Prova

67,5 %, medido e reproduzível.

67,5 % no BEAM 1M, média de 5 execuções independentes (σ 0,22 %, nenhuma escolhida a dedo), avaliado por gpt-4.1-mini com o prompt de julgamento do próprio benchmark.

No mesmo benchmark, as pontuações variam muito conforme o protocolo de avaliação: o juiz, o prompt e o que a camada de recuperação pode fazer. Avaliamos com o juiz que o próprio repositório dos autores traz, usamos o prompt de julgamento deles como está, não mudamos nada para caber no teste e publicamos o harness, o código de pontuação e o prompt do leitor, para que qualquer um reproduza exatamente os 67,5 %.

O protocolo, em uma única tabela

ItemO que fazemos
Conjunto de dadosBEAM 1M - 35 conversas, 74.630 turnos, 2,2 milhões de memórias, 700 perguntas
Juizgpt-4.1-mini com temperature 0, rodando o prompt de julgamento do próprio BEAM - o padrão no repositório dos autores, não um juiz escolhido por nós
Execuções5 execuções independentes, todas as pontuações publicadas, média reportada (σ 0,22 %)
LeitorModelo leitor e prompt fixos, publicados na íntegra

O que mantém a honestidade: um juiz terceiro, o prompt do leitor publicado sem alterações, todas as execuções reportadas - não apenas a melhor. O motor de recuperação é determinístico - execute de novo e você obtém as mesmas memórias.

Escalamos benchmarks mais difíceis

Testamos no benchmark padrão mais difícil que ainda não conquistamos - e o número é a marca máxima entre todos os modelos WOS, reescrita sempre que um modelo melhor é lançado. Ao superar 94%, avançamos para um benchmark mais difícil.

BEAM 1MEm andamento
Tablet67.5%
juiz gpt-4.1-mini · média de cinco execuções94% para avançar
Benchmark anterior LongMemEval-S Superado
Tablet95.7%
Scroll92.3%
Juiz GPT-4o · melhor entre todos os modelos WOS94% para avançar
Veja o relatório completo