67,5 %, medido e reproduzível.
67,5 % no BEAM 1M, média de 5 execuções independentes (σ 0,22 %, nenhuma escolhida a dedo), avaliado por gpt-4.1-mini com o prompt de julgamento do próprio benchmark.
No mesmo benchmark, as pontuações variam muito conforme o protocolo de avaliação: o juiz, o prompt e o que a camada de recuperação pode fazer. Avaliamos com o juiz que o próprio repositório dos autores traz, usamos o prompt de julgamento deles como está, não mudamos nada para caber no teste e publicamos o harness, o código de pontuação e o prompt do leitor, para que qualquer um reproduza exatamente os 67,5 %.
O protocolo, em uma única tabela
| Item | O que fazemos |
|---|---|
| Conjunto de dados | BEAM 1M - 35 conversas, 74.630 turnos, 2,2 milhões de memórias, 700 perguntas |
| Juiz | gpt-4.1-mini com temperature 0, rodando o prompt de julgamento do próprio BEAM - o padrão no repositório dos autores, não um juiz escolhido por nós |
| Execuções | 5 execuções independentes, todas as pontuações publicadas, média reportada (σ 0,22 %) |
| Leitor | Modelo leitor e prompt fixos, publicados na íntegra |
O que mantém a honestidade: um juiz terceiro, o prompt do leitor publicado sem alterações, todas as execuções reportadas - não apenas a melhor. O motor de recuperação é determinístico - execute de novo e você obtém as mesmas memórias.
Escalamos benchmarks mais difíceis
Testamos no benchmark padrão mais difícil que ainda não conquistamos - e o número é a marca máxima entre todos os modelos WOS, reescrita sempre que um modelo melhor é lançado. Ao superar 94%, avançamos para um benchmark mais difícil.