工具调用 MCP Skills2026-05-11
自建评估 Harness
定义
不采用通用 evals 平台,而是用 Codex / Claude Code 让 Agent 为你的 Agent Harness 量身定制一套 eval Harness。Eval 与 AI Harness 的耦合度太高,无法外包给"通用基础原语"。
要点
- 原始单元问题(Primitives Problem):所有 evals 平台都败在"测试用例"这个原始抽象——单轮、多 Agent、决策树架构无法共用同一 schema。Alec Barber 自己创业时押 single-turn schema,用户立刻要 multi-agent,扩不出去。
- 该用平台的地方:可观测性(Langfuse、Grafana)继续用现成的;垂直领域(如 coding-agent 专用)的窄平台有意义,因为问题边界封闭。
- 第一性原则:Harness 必须从第一天就为可测设计——可分解、可检视、可单元测试。先 scrappy 再 retrofit evals = 必败。
- 施工方式:把好 eval 写作 skill(如 Hamel Husain 系列)喂给 Agent,让它给你建专属 Harness。
示例
保险定价系统:文档进入 → 20 个复杂调用 → 各步 regex → 确定性与 AI 组件混合 → 输出定价判断。整个系统都是 Harness,推理步骤只是其中一个实现细节。这种系统的 eval 必须知道每一步形状,通用平台覆盖不了。
相关概念
参考资料
- Akash Bajwa: Evals with Alec Barber, OpenAI(2026-04-27)
被这些概念引用
来自本站知识库 · 全部概念