工具调用 MCP Skills2026-05-11
跨模态评估(Cross-Modal Eval)
定义
在没有 ground truth 的开放生成任务上,让多个不同模型互相评分对方的输出,每个模型负责一种它擅长的失败模式,把多视角分数喂回 Skill 优化循环。
要点
- 单模型 self-eval 容易陷入自我同构盲区
- Garry Tan 的分工示例:
- Opus 4.7 1M 抓精度错误(事实错位、引用断链)
- GPT-5.5 抓缺失 context(该提没提到的关键背景)
- DeepSeek V4-Pro 抓"读起来像 generic"的段落(套话化)
- 评出的失败模式直接固化进 Skill 的 fact-check / fact-cite / 反套话步骤,跑一次复利到所有未来调用
- 与 自建评估Harness 互补:自建 Harness 是结构,cross-modal 是内容评判
示例
Book Mirror v1 把 Garry 父母搞成离婚状态、出生地搞错。加 cross-modal eval 强制每条人生映射先经 Opus fact-check,自此再没出过精度错误,且所有右栏条目都引用具体的 brain page。
相关概念
参考资料
- Garry Tan: Meta-Meta-Prompting(2026-05-09)
来自本站知识库 · 全部概念