Prueba

67,5 %, medido y reproducible.

67,5 % en BEAM 1M, promediado sobre 5 ejecuciones independientes (σ 0,22 %, ninguna seleccionada a conveniencia), calificado por gpt-4.1-mini con el prompt de evaluación del propio benchmark.

En el mismo benchmark, las puntuaciones varían mucho según el protocolo de evaluación: el juez, el prompt y lo que se le permite hacer a la capa de recuperación. Calificamos con el juez que trae el propio repositorio de los autores, usamos su prompt de evaluación tal cual, no cambiamos nada para ajustarnos a la prueba y publicamos el harness, el código de puntuación y el prompt del lector para que cualquiera pueda reproducir exactamente el 67,5 %.

El protocolo, en una tabla

ElementoQué hacemos
DatasetBEAM 1M - 35 conversaciones, 74.630 turnos, 2,2 millones de memorias, 700 preguntas
Juezgpt-4.1-mini con temperature 0, ejecutando el prompt de evaluación del propio BEAM: el valor por defecto en el repositorio de los autores, no un juez elegido por nosotros
Ejecuciones5 ejecuciones independientes, todos los puntajes publicados, se reporta la media (σ 0,22 %)
LectorModelo lector y prompt fijos, publicados textualmente

Lo que lo mantiene honesto: un juez de terceros, el prompt del lector publicado sin cambios, y cada ejecución reportada - no solo la mejor. El motor de recuperación es determinista - ejecútalo de nuevo y obtienes las mismas memorias.

Escalamos benchmarks más difíciles

Probamos en el benchmark estándar más difícil que aún no hemos conquistado - y la cifra es la marca máxima entre todos los modelos de WOS, reescrita cada vez que sale uno mejor. Al superar el 94%, nos graduamos a un benchmark más difícil.

BEAM 1MEn curso
Tablet67.5%
juez gpt-4.1-mini · media de cinco ejecuciones94% para graduarse
Benchmark anterior LongMemEval-S Superado
Tablet95.7%
Scroll92.3%
Juez GPT-4o · el mejor entre todos los modelos de WOS94% para graduarse
Ver el informe completo