Nachweis

67,5 %, gemessen und reproduzierbar.

67,5 % auf BEAM 1M, gemittelt über 5 unabhängige Läufe (σ 0,22 %, keiner handverlesen), bewertet von gpt-4.1-mini mit dem Judging-Prompt des Benchmarks selbst.

Auf demselben Benchmark schwanken die Ergebnisse stark mit dem Bewertungsprotokoll - dem Judge, dem Prompt und dem, was die Abrufschicht tun darf. Wir bewerten mit dem Judge, den das Repository der Autoren selbst mitliefert, verwenden ihren Judging-Prompt wie geschrieben, passen nichts an den Test an und veröffentlichen Harness, Bewertungscode und Reader-Prompt, sodass jeder die 67,5 % exakt reproduzieren kann.

Das Protokoll in einer Tabelle

PunktUnser Vorgehen
DatensatzBEAM 1M - 35 Gespräche, 74.630 Turns, 2,2 Millionen Erinnerungen, 700 Fragen
Judgegpt-4.1-mini bei temperature 0, mit BEAMs eigenem Judging-Prompt - der Standard im Repository der Autoren, kein von uns gewählter Judge
Läufe5 unabhängige Läufe, jeder Wert veröffentlicht, Mittelwert berichtet (σ 0,22 %)
ReaderFestes Reader-Modell und fester Prompt, wortwörtlich veröffentlicht

Was es ehrlich hält: ein Judge von dritter Seite, der unverändert veröffentlichte Reader-Prompt, die Veröffentlichung jedes Laufs - nicht nur des besten. Die Abruf-Engine ist deterministisch - führen Sie sie erneut aus, erhalten Sie dieselben Erinnerungen.

Wir erklimmen härtere Benchmarks

Wir testen auf dem härtesten Standard-Benchmark, den wir noch nicht bezwungen haben - und die Zahl ist die Bestmarke über alle WOS-Modelle hinweg, neu geschrieben, sobald ein besseres erscheint. Überschreiten wir klar 94%, steigen wir zu einem härteren Benchmark auf.

BEAM 1MIn Arbeit
Tablet67.5%
gpt-4.1-mini als Judge · Mittelwert aus fünf Durchläufen94% zum Aufstieg
Früherer Benchmark LongMemEval-S Bestanden
Tablet95.7%
Scroll92.3%
GPT-4o-Judge · Bestwert über alle WOS-Modelle94% zum Aufstieg
Vollständigen Bericht ansehen