Agent 研习舱
工具调用 MCP Skills2026-05-11

二元基准饱和

定义

SWE-bench 这类只看最终通过/失败的二元基准存在两个连带病:

  1. 轨迹细节被一个数字吞掉——部分正确、走偏后回正、过早放弃这些信号全部看不到。
  2. 饱和速度远快于建造速度——花数月建一套基准,几周内就被新模型刷爆,原因有真能力提升、训练数据污染、reward hacking 三种。

要点

  • 解法之一:用 LLM-as-judge 打分每一步轨迹,再聚合,与最终结果做相关性分析
  • SWE-bench 与其他领域分数高度相关 → "为什么要跑两万个基准,三个就抓住了信号"
  • 下一个前沿是真实生产环境使用,但这模糊了"科学基准 vs 实验室 demo"的边界
  • Alec 的经济学类比:evals 可能要变成解释性学科——看过大量数据的人做出受教育的判断

示例

团队跑 SWE-bench 看到模型 A 比 B 高 3 分就替换。后来发现 A 的解题轨迹平均 18 步、走偏后强行硬怼,B 是 6 步直击。生产里 A 的 token 成本是 B 的 4 倍,根本不能用。如果当初看了 trajectory 评分,结论会反过来。

相关概念

参考资料

  • Akash Bajwa: Evals with Alec Barber, OpenAI(2026-04-27)

来自本站知识库 · 全部概念