67,5 %, medido y reproducible.
67,5 % en BEAM 1M, promediado sobre 5 ejecuciones independientes (σ 0,22 %, ninguna seleccionada a conveniencia), calificado por gpt-4.1-mini con el prompt de evaluación del propio benchmark.
En el mismo benchmark, las puntuaciones varían mucho según el protocolo de evaluación: el juez, el prompt y lo que se le permite hacer a la capa de recuperación. Calificamos con el juez que trae el propio repositorio de los autores, usamos su prompt de evaluación tal cual, no cambiamos nada para ajustarnos a la prueba y publicamos el harness, el código de puntuación y el prompt del lector para que cualquiera pueda reproducir exactamente el 67,5 %.
El protocolo, en una tabla
| Elemento | Qué hacemos |
|---|---|
| Dataset | BEAM 1M - 35 conversaciones, 74.630 turnos, 2,2 millones de memorias, 700 preguntas |
| Juez | gpt-4.1-mini con temperature 0, ejecutando el prompt de evaluación del propio BEAM: el valor por defecto en el repositorio de los autores, no un juez elegido por nosotros |
| Ejecuciones | 5 ejecuciones independientes, todos los puntajes publicados, se reporta la media (σ 0,22 %) |
| Lector | Modelo lector y prompt fijos, publicados textualmente |
Lo que lo mantiene honesto: un juez de terceros, el prompt del lector publicado sin cambios, y cada ejecución reportada - no solo la mejor. El motor de recuperación es determinista - ejecútalo de nuevo y obtienes las mismas memorias.
Escalamos benchmarks más difíciles
Probamos en el benchmark estándar más difícil que aún no hemos conquistado - y la cifra es la marca máxima entre todos los modelos de WOS, reescrita cada vez que sale uno mejor. Al superar el 94%, nos graduamos a un benchmark más difícil.