Multilingüe

Todos los idiomas, la misma precisión.

La calidad del recall es idéntica ya sea que tus usuarios escriban en 日本語, 中文, Español o inglés. La medimos como una cuadrícula de 70 pares de idioma de almacenamiento e idioma de consulta y publicamos la cifra: 95,2 % de recall@5.

Un store con muchos idiomas es donde la recuperación se degrada sin que nadie lo note: la misma pregunta obtiene una puntuación distinta según el idioma en que se escribió la memoria. Lo tratamos como un defecto y no como una limitación, y lo medimos con una cuadrícula completa de pares de idiomas.

Un store, tres idiomas a la vez

No eliges un idioma por store - mézclalos libremente. Abajo, la memoria de un usuario contiene japonés, inglés y español al mismo tiempo, y cada pregunta encuentra la memoria correcta sin importar el idioma. Este es un intercambio real contra la API en vivo:

# one user, three languages stored together
mem.add("彼女はコーヒーより紅茶が好き", user_id="alice")                      # Japanese
mem.add("she works at a design studio in Brooklyn", user_id="alice")       # English
mem.add("A ella le encanta hacer senderismo los sábados", user_id="alice")  # Spanish
Resultados reales - cada pregunta cruza a un idioma distinto
"¿Qué bebe ella?"               -> 彼女はコーヒーより紅茶が好き
"what does she do on weekends?" -> A ella le encanta hacer senderismo los sábados
"彼女の仕事は?"                  -> she works at a design studio in Brooklyn

Sin paso de traducción, sin detección de idioma, sin configuración por idioma. Las memorias y las preguntas se ubican por significado, no por idioma - si el significado coincide, el idioma no importa.

Tres idiomas aquí es solo lo que cabe en una página - no existe una lista de idiomas soportados a la que haya que pertenecer. La misma prueba en vivo también pasa con memorias en 中文, Русский y العربية, todas verificadas contra la API de producción.

Por qué ningún idioma debe ganarle a otro

Una regla está por encima de cualquier otra decisión de ajuste: la calidad del recall no debe depender del idioma en que se escribió una memoria. Se mide sobre 70 pares de idiomas y se exige en la revisión de código, y nada que eleve un idioma a costa de otro llega a producción.

LongMemEval es solo en inglés, por lo que no mide el recall multilingüe. La demo de arriba es la forma de verificarlo directamente contra la API en vivo.