67,5 %, mesuré et reproductible.
67,5 % sur BEAM 1M, en moyenne sur 5 runs indépendants (σ 0,22 %, aucun trié sur le volet), noté par gpt-4.1-mini avec le prompt de jugement du benchmark lui-même.
Sur le même benchmark, les scores varient beaucoup selon le protocole de notation : le juge, le prompt et ce que la couche de récupération a le droit de faire. Nous notons avec le juge que le dépôt des auteurs fournit lui-même, utilisons leur prompt de jugement tel quel, ne changeons rien pour coller au test, et publions le harness, le code de notation et le prompt du lecteur afin que chacun puisse reproduire exactement les 67,5 %.
Le protocole, en un tableau
| Élément | Ce que nous faisons |
|---|---|
| Jeu de données | BEAM 1M - 35 conversations, 74 630 tours, 2,2 millions de souvenirs, 700 questions |
| Juge | gpt-4.1-mini à temperature 0, avec le prompt de jugement propre à BEAM - la valeur par défaut du dépôt des auteurs, pas un juge que nous avons choisi |
| Runs | 5 runs indépendants, chaque score publié, moyenne rapportée (σ 0,22 %) |
| Lecteur | Modèle lecteur et prompt fixes, publiés verbatim |
Ce qui garantit l'honnêteté : un juge tiers, le prompt du lecteur publié tel quel, et chaque run rapporté - pas seulement le meilleur. Le moteur de récupération est déterministe - relancez-le et vous obtenez les mêmes souvenirs.
Nous gravissons des benchmarks plus difficiles
Nous testons sur le benchmark standard le plus difficile que nous n'avons pas encore conquis - et le chiffre affiché est le record parmi tous les modèles WOS, réécrit chaque fois qu'un meilleur modèle sort. Passé 94%, nous passons à un benchmark plus difficile.