実証

67.5%。実測で、再現可能。

BEAM 1M で 67.5%。独立した 5 回の実行の平均(σ 0.22%、選り好みなし)で、gpt-4.1-mini がベンチマーク自身の判定プロンプトで採点しています。

同じベンチマークでも、点数は採点手順で大きく変わります。判定者、プロンプト、そして検索層に何を許すかです。私たちは著者のリポジトリが同梱する判定者で採点し、その判定プロンプトを書かれたまま使い、試験に合わせて何も変えません。ハーネス、採点コード、リーダープロンプトを公開しているので、誰でも 67.5% をそのまま再現できます。

プロトコルを 1 つの表で

項目私たちのやり方
データセットBEAM 1M - 会話 35 件、74,630 ターン、記憶 220 万件、700 問
ジャッジgpt-4.1-mini、temperature 0。BEAM 自身の判定プロンプトをそのまま実行します。著者リポジトリの既定値であり、私たちが選んだ判定者ではありません
実行回数独立した 5 回の実行。全スコアを公開し、平均を報告(σ 0.22%)
リーダーリーダーモデルとプロンプトを固定し、原文のまま公開

誠実さを支えるもの:サードパーティのジャッジ、無修正で公開されたリーダープロンプト、そしてベストだけでなく全実行の報告。検索エンジンは決定的で、もう一度実行しても同じ記憶が返ります。

より難しいベンチマークへ登り続けます

私たちは、まだ制覇していない最も難しい標準ベンチマークでテストします - 数字はすべての WOS モデルを通じた最高記録で、より良いモデルが出るたびに更新されます。94% を超えたら、さらに難しいベンチマークへ進みます。

BEAM 1M挑戦中
Tablet67.5%
gpt-4.1-mini 判定 · 5 回実行の平均卒業ラインは 94%
以前のベンチマーク LongMemEval-S クリア済み
Tablet95.7%
Scroll92.3%
GPT-4o ジャッジ · 全 WOS モデル中のベスト卒業ラインは 94%
完全なレポートを見る