Preuve

67,5 %, mesuré et reproductible.

67,5 % sur BEAM 1M, en moyenne sur 5 runs indépendants (σ 0,22 %, aucun trié sur le volet), noté par gpt-4.1-mini avec le prompt de jugement du benchmark lui-même.

Sur le même benchmark, les scores varient beaucoup selon le protocole de notation : le juge, le prompt et ce que la couche de récupération a le droit de faire. Nous notons avec le juge que le dépôt des auteurs fournit lui-même, utilisons leur prompt de jugement tel quel, ne changeons rien pour coller au test, et publions le harness, le code de notation et le prompt du lecteur afin que chacun puisse reproduire exactement les 67,5 %.

Le protocole, en un tableau

ÉlémentCe que nous faisons
Jeu de donnéesBEAM 1M - 35 conversations, 74 630 tours, 2,2 millions de souvenirs, 700 questions
Jugegpt-4.1-mini à temperature 0, avec le prompt de jugement propre à BEAM - la valeur par défaut du dépôt des auteurs, pas un juge que nous avons choisi
Runs5 runs indépendants, chaque score publié, moyenne rapportée (σ 0,22 %)
LecteurModèle lecteur et prompt fixes, publiés verbatim

Ce qui garantit l'honnêteté : un juge tiers, le prompt du lecteur publié tel quel, et chaque run rapporté - pas seulement le meilleur. Le moteur de récupération est déterministe - relancez-le et vous obtenez les mêmes souvenirs.

Nous gravissons des benchmarks plus difficiles

Nous testons sur le benchmark standard le plus difficile que nous n'avons pas encore conquis - et le chiffre affiché est le record parmi tous les modèles WOS, réécrit chaque fois qu'un meilleur modèle sort. Passé 94%, nous passons à un benchmark plus difficile.

BEAM 1MEn cours
Tablet67.5%
juge gpt-4.1-mini · moyenne sur cinq runs94% pour passer au suivant
Benchmark antérieur LongMemEval-S Franchi
Tablet95.7%
Scroll92.3%
Juge GPT-4o · meilleur score parmi tous les modèles WOS94% pour passer au suivant
Voir le rapport complet