Agent 研习舱
Harness 与运行时2026-05-15

双环进化

定义

一种 self-improving agent 的工程范式:运行时内环让 agent 一边干活一边改写 skill / memory,离线外环周期性跑进化算法(典型为 GEPA〔待补〕)+ 自动闸门 + 提 PR 给人审。两环显式做"速度/风险分工"——内环秒-分钟级、个性化、零验证;外环小时级、社区级、强闸门。代表实现是 Hermes Agent 的 v0.8.0 起的工程化设计。

要点

  • 内环 = 快但脏:触发条件如"完成 ≥5 tool call 任务"、"用户纠错"、"错误恢复",由 agent 自己决定改什么、直接落盘到 ~/.hermes/skills/,无 Pareto、无对比、无验证
  • 外环 = 慢但严:从 trace / synthetic / golden 三类数据源构建评估集,跑 GEPA → 五层闸门(测试 100% / 字符上限 / 缓存兼容 / 语义保真 / 强制 PR)→ benchmark 分级 gate → 人审合入
  • PR review 替代缺失的硬验证:在弱反馈环境下(个人 agent、多平台消息),LLM judge 不足以兜底,工程上选择把"人"放回 loop 的最后一道
  • benchmark 作为 gate 而非 fitness:知道 GEPA 容易朝 metric 过拟合,把 benchmark 摆在 fitness 计算之外做兜底
  • OOS 红线清单:凭证 / 用户数据 / 工具函数签名 / 会话中途 prompt 变更 / 直接 commit main,禁止自动进化
  • 已知工程债:内环无 forget/retire 循环(错误经验会固化);外环若像 hermes-agent-self-evolution Phase 1 那样把 skill body 当 runtime input 而非 Signature.instructions,GEPA 实际只能 mutate wrapper,碰不到正文(Issue #38)

示例

Hermes 双环(参考 Hermes自进化机制〔待补〕):

维度内环(runtime)外环(offline)
决策者agent + skill_manageGEPA + reflection LLM + Pareto
评估LLM-as-judge rubric
持久化~/.hermes/skills/<name>/SKILL.mdgit branch + PR
人闸强制 PR review
频率秒-分钟小时级,~$2-10/run

光谱里其他范式都没同时摆出这三件套:Self-Refine / Reflexion 只有内环;STaR / ADAS / Darwin Gödel Machine / Karpathy AutoResearch 只有外环且无人值守;Voyager 只有外环但跑在 Minecraft 强反馈沙盒里。

相关概念

  • Hermes自进化机制〔待补〕 - 双环进化最完整的工程化案例与质疑
  • GEPA〔待补〕 - 外环常用的进化优化算法
  • Self-Improving Agent - 双环是它的工程实现形态之一
  • Skill四层级进化 - 双环对应 L3(内环)+ L4 半成品(外环)
  • Skillify循环 - explicit by user vs 双环隐式 by trace
  • hermes-agent架构与对比分析〔待补〕
  • Hermes Agent
  • Autoresearch - 单环 hill-climbing 的近邻范式
  • Agent 循环 - 内外双环都是 Agent 循环的组合

参考资料

来自本站知识库 · 全部概念