근거

67.5%, 재어서 나온 숫자입니다.

BEAM 1M 에서 67.5%입니다. 5회 독립 실행 평균이고(σ 0.22%, 고른 회차 없음), gpt-4.1-mini 가 벤치마크 자체의 판정 프롬프트로 채점했습니다.

같은 벤치마크라도 채점 방식에 따라 점수가 크게 갈립니다. 평가자, 프롬프트, 그리고 검색 계층에 무엇까지 허용하느냐입니다. 저희는 저자 저장소에 실려 있는 평가자로 채점하고, 저자의 판정 프롬프트를 적힌 그대로 쓰며, 시험에 맞추려고 무엇도 바꾸지 않습니다. 하네스와 채점 코드, 리더 프롬프트를 공개하므로 누구든 67.5%를 그대로 재현할 수 있습니다.

측정 프로토콜 한눈에

항목우리 방식
데이터셋BEAM 1M - 대화 35개, 74,630턴, 기억 220만 건, 700문항
채점자gpt-4.1-mini, temperature 0. BEAM 자체의 판정 프롬프트를 그대로 돌립니다. 저자 저장소의 기본값이며 저희가 고른 평가자가 아닙니다
실행5회 독립 실행, 모든 점수 공개, 평균 보고 (σ 0.22%)
리더리더 모델·프롬프트 고정, 원문 그대로 공개

정직하게 유지하는 것: 제3자 채점자, 변경 없이 공개한 리더 프롬프트, 그리고 최고 회차가 아니라 전 회차 보고. 검색 엔진은 결정론적이라 다시 돌려도 같은 기억이 나옵니다.

더 어려운 벤치로 올라갑니다

우리는 아직 정복하지 못한 가장 어려운 표준 벤치마크 위에서 겨룹니다 - 적힌 점수는 모든 WOS 모델이 세운 최고 기록이고, 더 나은 모델이 나올 때마다 새로 쓰입니다. 94%를 넘기는 순간, 더 어려운 벤치마크로 졸업합니다.

BEAM 1M진행 중
Tablet67.5%
gpt-4.1-mini 평가 · 5회 평균졸업까지 94%
이전 벤치마크 LongMemEval-S 통과
Tablet95.7%
Scroll92.3%
GPT-4o 채점 · 모든 WOS 모델 중 최고졸업까지 94%
전체 리포트 보기