67.5%,实测且可复现。
在 BEAM 1M 上取得 67.5%,为 5 次独立运行的平均值(σ 0.22%,无任何挑选),由 gpt-4.1-mini 使用该基准自带的评判提示词打分。
即使是同一个基准,分数也会随打分方式大幅变化:评判模型、提示词,以及允许检索层做什么。我们使用作者仓库自带的评判模型打分,原样使用他们的评判提示词,不为迎合测试改动任何东西,并公开测试框架、打分代码与阅读端提示词,任何人都能原样复现 67.5%。
评测协议,一表看全
| 项目 | 我们的做法 |
|---|---|
| 数据集 | BEAM 1M - 35 段对话、74,630 轮、220 万条记忆、700 道题 |
| 评判 | gpt-4.1-mini,temperature 0,运行 BEAM 自带的评判提示词 - 作者仓库中的默认设置,而非我们挑选的评判模型 |
| 运行次数 | 5 次独立运行,公布每一次的分数,报告均值(σ 0.22%) |
| 阅读器 | 固定的阅读模型与提示词,原文公开 |
诚实的保障:第三方评判、原样公开的阅读器提示词、以及公布每一次运行的结果 - 而不是只报最好的一次。检索引擎是确定性的 - 再跑一次,返回的记忆完全相同。
我们攀登更难的基准
我们只在尚未攻克的最难的标准基准上测试 - 这个数字是所有 WOS 模型的最高水位线,每当更强的模型发布就会刷新。突破 94%,我们就毕业,转向更难的基准。
BEAM 1M进行中
Tablet67.5%
gpt-4.1-mini 评判 · 五次运行均值达到 94% 即毕业
早期基准测试 LongMemEval-S 已达标
Tablet95.7%
Scroll92.3%
GPT-4o 评判 · 所有 WOS 模型中的最佳成绩达到 94% 即毕业