67,5 %, gemessen und reproduzierbar.
67,5 % auf BEAM 1M, gemittelt über 5 unabhängige Läufe (σ 0,22 %, keiner handverlesen), bewertet von gpt-4.1-mini mit dem Judging-Prompt des Benchmarks selbst.
Auf demselben Benchmark schwanken die Ergebnisse stark mit dem Bewertungsprotokoll - dem Judge, dem Prompt und dem, was die Abrufschicht tun darf. Wir bewerten mit dem Judge, den das Repository der Autoren selbst mitliefert, verwenden ihren Judging-Prompt wie geschrieben, passen nichts an den Test an und veröffentlichen Harness, Bewertungscode und Reader-Prompt, sodass jeder die 67,5 % exakt reproduzieren kann.
Das Protokoll in einer Tabelle
| Punkt | Unser Vorgehen |
|---|---|
| Datensatz | BEAM 1M - 35 Gespräche, 74.630 Turns, 2,2 Millionen Erinnerungen, 700 Fragen |
| Judge | gpt-4.1-mini bei temperature 0, mit BEAMs eigenem Judging-Prompt - der Standard im Repository der Autoren, kein von uns gewählter Judge |
| Läufe | 5 unabhängige Läufe, jeder Wert veröffentlicht, Mittelwert berichtet (σ 0,22 %) |
| Reader | Festes Reader-Modell und fester Prompt, wortwörtlich veröffentlicht |
Was es ehrlich hält: ein Judge von dritter Seite, der unverändert veröffentlichte Reader-Prompt, die Veröffentlichung jedes Laufs - nicht nur des besten. Die Abruf-Engine ist deterministisch - führen Sie sie erneut aus, erhalten Sie dieselben Erinnerungen.
Wir erklimmen härtere Benchmarks
Wir testen auf dem härtesten Standard-Benchmark, den wir noch nicht bezwungen haben - und die Zahl ist die Bestmarke über alle WOS-Modelle hinweg, neu geschrieben, sobald ein besseres erscheint. Überschreiten wir klar 94%, steigen wir zu einem härteren Benchmark auf.