Multilíngue

Todos os idiomas, a mesma precisão.

A qualidade do recall é idêntica, quer seus usuários escrevam em 日本語, 中文, Español ou inglês. Medimos como uma grade de 70 pares de idioma de armazenamento e idioma de consulta e publicamos o número: 95,2% de recall@5.

Um store com muitos idiomas é onde a recuperação se degrada sem ninguém perceber: a mesma pergunta recebe pontuações diferentes conforme o idioma em que a memória foi escrita. Tratamos isso como defeito e não como limitação, e medimos com uma grade completa de pares de idiomas.

Um store, três idiomas ao mesmo tempo

Você não escolhe um idioma por store - misture-os livremente. Abaixo, a memória de um único usuário contém japonês, inglês e espanhol ao mesmo tempo, e cada pergunta encontra a memória certa independentemente do idioma. Esta é uma interação real com a API em produção:

# one user, three languages stored together
mem.add("彼女はコーヒーより紅茶が好き", user_id="alice")                      # Japanese
mem.add("she works at a design studio in Brooklyn", user_id="alice")       # English
mem.add("A ella le encanta hacer senderismo los sábados", user_id="alice")  # Spanish
Resultados reais - cada pergunta cruza para um idioma diferente
"¿Qué bebe ella?"               -> 彼女はコーヒーより紅茶が好き
"what does she do on weekends?" -> A ella le encanta hacer senderismo los sábados
"彼女の仕事は?"                  -> she works at a design studio in Brooklyn

Sem etapa de tradução, sem detecção de idioma, sem configuração por idioma. Memórias e perguntas são posicionadas pelo significado, não pelo idioma - se o significado corresponde, o idioma não importa.

Três idiomas aqui é apenas o que cabe em uma página - não existe uma lista de idiomas suportados da qual fazer parte. O mesmo teste ao vivo também passa com memórias em 中文, Русский e العربية, todas verificadas contra a API de produção.

Por que nenhum idioma pode vencer outro

Uma regra está acima de qualquer outra decisão de ajuste: a qualidade do recall não pode depender do idioma em que uma memória foi escrita. Ela é medida sobre 70 pares de idiomas e cobrada na revisão de código, e nada que eleve um idioma às custas de outro entra em produção.

O LongMemEval é somente em inglês, então não mede recall multilíngue. A demonstração acima é como você pode verificar isso diretamente contra a API em produção.