Todos os idiomas, a mesma precisão.
A qualidade do recall é idêntica, quer seus usuários escrevam em 日本語, 中文, Español ou inglês. Medimos como uma grade de 70 pares de idioma de armazenamento e idioma de consulta e publicamos o número: 95,2% de recall@5.
Um store com muitos idiomas é onde a recuperação se degrada sem ninguém perceber: a mesma pergunta recebe pontuações diferentes conforme o idioma em que a memória foi escrita. Tratamos isso como defeito e não como limitação, e medimos com uma grade completa de pares de idiomas.
Um store, três idiomas ao mesmo tempo
Você não escolhe um idioma por store - misture-os livremente. Abaixo, a memória de um único usuário contém japonês, inglês e espanhol ao mesmo tempo, e cada pergunta encontra a memória certa independentemente do idioma. Esta é uma interação real com a API em produção:
# one user, three languages stored together mem.add("彼女はコーヒーより紅茶が好き", user_id="alice") # Japanese mem.add("she works at a design studio in Brooklyn", user_id="alice") # English mem.add("A ella le encanta hacer senderismo los sábados", user_id="alice") # Spanish
"¿Qué bebe ella?" -> 彼女はコーヒーより紅茶が好き "what does she do on weekends?" -> A ella le encanta hacer senderismo los sábados "彼女の仕事は?" -> she works at a design studio in Brooklyn
Sem etapa de tradução, sem detecção de idioma, sem configuração por idioma. Memórias e perguntas são posicionadas pelo significado, não pelo idioma - se o significado corresponde, o idioma não importa.
Por que nenhum idioma pode vencer outro
Uma regra está acima de qualquer outra decisão de ajuste: a qualidade do recall não pode depender do idioma em que uma memória foi escrita. Ela é medida sobre 70 pares de idiomas e cobrada na revisão de código, e nada que eleve um idioma às custas de outro entra em produção.