Mehrsprachigkeit

Jede Sprache, dieselbe Genauigkeit.

Die Recall-Qualität ist identisch, ob Ihre Nutzer auf 日本語, 中文, Español oder Englisch schreiben. Wir messen sie als Raster aus 70 Kombinationen von Speicher- und Abfragesprache und veröffentlichen die Zahl: 95,2 % recall@5.

Ein Store mit vielen Sprachen ist die Stelle, an der Retrieval unbemerkt schlechter wird: Dieselbe Frage erzielt unterschiedliche Werte, je nachdem, in welcher Sprache die Erinnerung geschrieben wurde. Wir behandeln das als Defekt und nicht als Grenze und messen es als vollständiges Raster von Sprachpaaren.

Ein Store, drei Sprachen zugleich

Sie wählen keine Sprache pro Store - mischen Sie frei. Unten enthält das Gedächtnis eines Nutzers gleichzeitig Japanisch, Englisch und Spanisch, und jede Frage findet die richtige Erinnerung, unabhängig von der Sprache. Dies ist ein echter Austausch mit der Live-API:

# one user, three languages stored together
mem.add("彼女はコーヒーより紅茶が好き", user_id="alice")                      # Japanese
mem.add("she works at a design studio in Brooklyn", user_id="alice")       # English
mem.add("A ella le encanta hacer senderismo los sábados", user_id="alice")  # Spanish
Tatsächliche Ergebnisse - jede Frage wechselt in eine andere Sprache
"¿Qué bebe ella?"               -> 彼女はコーヒーより紅茶が好き
"what does she do on weekends?" -> A ella le encanta hacer senderismo los sábados
"彼女の仕事は?"                  -> she works at a design studio in Brooklyn

Kein Übersetzungsschritt, keine Spracherkennung, keine Konfiguration pro Sprache. Erinnerungen und Fragen werden nach Bedeutung eingeordnet, nicht nach Sprache - passt die Bedeutung, spielt die Sprache keine Rolle.

Drei Sprachen sind hier nur das, was auf eine Seite passt - es gibt keine Liste unterstützter Sprachen, auf der man stehen müsste. Derselbe Live-Test besteht auch mit Erinnerungen auf 中文, Русский und العربية, alle gegen die Produktions-API verifiziert.

Warum keine Sprache eine andere schlagen darf

Eine Regel steht hier über jeder anderen Tuning-Entscheidung: Die Recall-Qualität darf nicht davon abhängen, in welcher Sprache eine Erinnerung geschrieben wurde. Sie wird über 70 Sprachpaare gemessen und im Code-Review durchgesetzt, und was eine Sprache auf Kosten einer anderen anhebt, geht nicht in Produktion.

LongMemEval ist rein englischsprachig und misst daher keinen mehrsprachigen Recall. Die Demo oben zeigt, wie Sie ihn direkt gegen die Live-API verifizieren können.