工具调用 MCP Skills2026-05-11
二元基准饱和
定义
SWE-bench 这类只看最终通过/失败的二元基准存在两个连带病:
- 轨迹细节被一个数字吞掉——部分正确、走偏后回正、过早放弃这些信号全部看不到。
- 饱和速度远快于建造速度——花数月建一套基准,几周内就被新模型刷爆,原因有真能力提升、训练数据污染、reward hacking 三种。
要点
- 解法之一:用 LLM-as-judge 打分每一步轨迹,再聚合,与最终结果做相关性分析
- SWE-bench 与其他领域分数高度相关 → "为什么要跑两万个基准,三个就抓住了信号"
- 下一个前沿是真实生产环境使用,但这模糊了"科学基准 vs 实验室 demo"的边界
- Alec 的经济学类比:evals 可能要变成解释性学科——看过大量数据的人做出受教育的判断
示例
团队跑 SWE-bench 看到模型 A 比 B 高 3 分就替换。后来发现 A 的解题轨迹平均 18 步、走偏后强行硬怼,B 是 6 步直击。生产里 A 的 token 成本是 B 的 4 倍,根本不能用。如果当初看了 trajectory 评分,结论会反过来。
相关概念
参考资料
- Akash Bajwa: Evals with Alec Barber, OpenAI(2026-04-27)
来自本站知识库 · 全部概念