Agent 研习舱
工具调用 MCP Skills2026-05-11

跨模态评估(Cross-Modal Eval)

定义

在没有 ground truth 的开放生成任务上,让多个不同模型互相评分对方的输出,每个模型负责一种它擅长的失败模式,把多视角分数喂回 Skill 优化循环。

要点

  • 单模型 self-eval 容易陷入自我同构盲区
  • Garry Tan 的分工示例:
    • Opus 4.7 1M 抓精度错误(事实错位、引用断链)
    • GPT-5.5 抓缺失 context(该提没提到的关键背景)
    • DeepSeek V4-Pro 抓"读起来像 generic"的段落(套话化)
  • 评出的失败模式直接固化进 Skill 的 fact-check / fact-cite / 反套话步骤,跑一次复利到所有未来调用
  • 自建评估Harness 互补:自建 Harness 是结构,cross-modal 是内容评判

示例

Book Mirror v1 把 Garry 父母搞成离婚状态、出生地搞错。加 cross-modal eval 强制每条人生映射先经 Opus fact-check,自此再没出过精度错误,且所有右栏条目都引用具体的 brain page。

相关概念

参考资料

  • Garry Tan: Meta-Meta-Prompting(2026-05-09)

来自本站知识库 · 全部概念