证明

67.5%,实测且可复现。

在 BEAM 1M 上取得 67.5%,为 5 次独立运行的平均值(σ 0.22%,无任何挑选),由 gpt-4.1-mini 使用该基准自带的评判提示词打分。

即使是同一个基准,分数也会随打分方式大幅变化:评判模型、提示词,以及允许检索层做什么。我们使用作者仓库自带的评判模型打分,原样使用他们的评判提示词,不为迎合测试改动任何东西,并公开测试框架、打分代码与阅读端提示词,任何人都能原样复现 67.5%。

评测协议,一表看全

项目我们的做法
数据集BEAM 1M - 35 段对话、74,630 轮、220 万条记忆、700 道题
评判gpt-4.1-mini,temperature 0,运行 BEAM 自带的评判提示词 - 作者仓库中的默认设置,而非我们挑选的评判模型
运行次数5 次独立运行,公布每一次的分数,报告均值(σ 0.22%)
阅读器固定的阅读模型与提示词,原文公开

诚实的保障:第三方评判、原样公开的阅读器提示词、以及公布每一次运行的结果 - 而不是只报最好的一次。检索引擎是确定性的 - 再跑一次,返回的记忆完全相同。

我们攀登更难的基准

我们只在尚未攻克的最难的标准基准上测试 - 这个数字是所有 WOS 模型的最高水位线,每当更强的模型发布就会刷新。突破 94%,我们就毕业,转向更难的基准。

BEAM 1M进行中
Tablet67.5%
gpt-4.1-mini 评判 · 五次运行均值达到 94% 即毕业
早期基准测试 LongMemEval-S 已达标
Tablet95.7%
Scroll92.3%
GPT-4o 评判 · 所有 WOS 模型中的最佳成绩达到 94% 即毕业
查看完整报告