Agent 研习舱

concept index

全部概念(109

按六大领域分组;也可以在图谱中按关联关系探索。

Harness 与运行时38

地图与疆域

Agentic Coding 语境下对"the map is not the territory"这一老命题的重述:地图是你交给 Agent 的东西——提示词、Skills、上下文;疆域是工作真正发生的地方——代码库、真实世界及其实际约束。地图与疆域之间的差值,就是 未知。

二阶 Harness 论

二阶 Harness 论(Second-Order Harness Theory)主张:Meta-Harness 不是 Norbert Wiener 一阶反馈系统的变体,而是 Heinz von Foerster 意义上的"二阶控制论"——平台层在监管下层不断变形的具体 harness 实现。它对应 Stafford

接口折旧速度

接口折旧速度(Interface Depreciation Rate)指 Agent 平台中预定义接口形状的有效期 vs 模型能力增长速度的相对竞速。它是判断 Meta-Harness 押注成败的核心变量:模型增长快于接口半衰期,接口被击穿、协同进化派胜利;模型增长慢于接口半衰期,接口跨代稳定、控制论拓扑成立。

可恢复流

可恢复流(Resumable Stream)是生产级 Agent 流式输出的关键能力:客户端断线后能从断点继续接收事件。它建立在"流式输出不是 token 打字机,而是任务事件流"这一认知之上——把状态变化、消息增量、工具进展、Artifact 增量和错误统一编码成事件流。

盲点扫描

Blindspot Pass:一种实现前技法——显式请 Agent 帮你找出并向你解释你的 Unknown Unknowns(未知的未知),从而让你能更好地给它提示。适用于进入陌生代码库、或做自己不熟悉的工作(如设计迭代、视频调色)时。

双环进化

一种 self-improving agent 的工程范式:运行时内环让 agent 一边干活一边改写 skill / memory,离线外环周期性跑进化算法(典型为 GEPA〔待补〕)+ 自动闸门 + 提 PR 给人审。两环显式做"速度/风险分工"——内环秒-分钟级、个性化、零验证;外环小时级、社区级、强闸门。代表实

停止条件(Stop Condition)

Agent 循环 何时结束的判据。它是循环设计里最关键的旋钮之一:定义得好,Agent 既不会过早收工、也不会无止境空转。不同 循环类型 把停止的判断权分配给不同主体。

未知四象限

将"面对一个问题时的认知状态"拆成四类的框架(借自 Rumsfeld 的 known/unknown 矩阵,被 Thariq 用于 Agentic Coding)。识别自己处在哪一象限,决定了该用哪种技法去缩小 地图与疆域 之差。

循环四类型学

Claude Code 团队对 Agent 循环 的分类:按"触发方式 × 停止方式 × 所用原语 × 适用任务"划出四种循环。核心记法是"你把哪一块交给系统"。

语义层作为工具接口

语义层作为工具接口是一种 Agent 架构设计范式:在 Agent 和底层系统之间插入一个语义中间层,Agent 通过这个语义层(而非直接 API 调用)来发现工具、获取上下文和执行操作。语义层将技术细节(数据库表、API endpoint)翻译为业务概念(订单、客户、审批),同时附带权限、验证和审计能力。

执行模型两层

分析 Agent 执行模型时最容易犯的错误,是把不同层级的东西放在一起比较。更清晰的做法是拆成两层:Loop 承载方式(主循环放在哪种运行时容器里)与编排协议模式(主循环内部哪些语义对象被显式建模、哪些 Action 副作用会进入 Runtime 状态机)。

中断即状态

"中断是状态,不是异常"是 Agent Runtime Protocol 的核心设计原则之一:`INPUT_REQUIRED`、`AUTH_REQUIRED` 这类暂停应进入协议状态机,成为一等状态,而非被当作异常处理。它是 Human-in-the-Loop 的真正基础设施。

自主迭代模式

一种 Agent 设计模式,核心公式:约束 + 可量化指标 + 自主迭代 = 复合增益。

Agent 循环(Agentic Loop)

Claude Code 团队的定义:Agent 重复工作循环,直到满足停止条件。最基本的形态是"收集上下文→行动→检查自己的工作→按需重复→回应"。近来"设计循环而非提示 agent"成为热议,其本质就是把这一重复过程的触发方式、停止条件、所用原语与适用任务显式设计出来。

Agent Harness

Agent Harness 是围绕 AI 模型构建的编排框架,用于管理多轮交互、上下文、工具调用和状态传递。它决定了 Agent 如何分解任务、何时重置上下文、如何评估输出质量。

Agent Runtime Protocol

Agent Runtime Protocol 是 Agent Runtime 暴露给外部世界的契约——一组稳定对象、生命周期操作和状态迁移。它不是某个具体标准(不等于 A2A、AG-UI 或 LangChain Agent Protocol),而是跨框架反复出现的稳定边界:外部世界如何启动任务、携带上下文、观察进展、中

Agent Traces

Agent Trace(代理执行轨迹)是一次 Agent 运行的完整结构化记录:它串起所有用户请求、模型输入输出、工具调用、中间状态变化与最终结果。Trace 不是"日志"的美化版——它是让 Agent 系统可以被评估、被调试、被用来改进自身的核心数据资产。

Agent-first 基础设施

Karpathy 提出的范式:把世界拆成 Agent 能读懂的输入,以及 Agent 能安全调用的动作接口——而不是让 Agent 模拟人去点网页、读图文文档、按菜单操作。

Agentic 思维

Agentic 思维是一种优化目标:模型能否在与环境持续交互中有效行动,而非仅在内部独白中产出正确答案。核心从"思考得更久"转向"为了行动而思考"。

Agentic Engineering

Karpathy 在 2026 年 Sequoia 访谈里提出的概念,与 Vibe Coding〔待补〕 形成对照:

Artifact

Artifact 是 Agent 产出的正式结果,作为一等协议对象存在,回答"结果在哪里、由哪次执行产生"。长任务的结果不应只塞进最终文本,而要成为可引用、可追溯、可版本化的产物——文件、报告、代码 diff 等。

Autoresearch

Andrej Karpathy 于 2026 年 3 月开源的自主 AI 研究框架。核心思想:让 AI Agent 在固定时间预算内自主修改代码、运行实验、评估结果,保留有效改进、丢弃无效尝试,然后无限循环。

Brain-Hands 解耦

Brain-Hands 解耦是 Claude Managed Agents 的核心架构原则:把 Agent 系统拆成三个可独立失败、可独立替换的部分——"大脑"(Claude + harness,负责推理与决策)、"双手"(sandbox 与工具,负责执行)、"会话"(append-only 事件日志,负责状态持久化)

Checkpoint

Checkpoint 是 Agent 执行到某一步之后的完整可恢复状态快照,回答"失败或中断后从哪里继续"。它是生产级 Agent 区别于玩具的关键基础设施——没有 Checkpoint,中断恢复、错误回滚、时间旅行调试和状态分叉都无从谈起。

Claude Managed Agents

Claude Managed Agents 是 Anthropic 于 2026-04-08 在 Claude Platform 上推出的托管 Agent 基础设施,以可组合 API 的形式让开发者在云端构建、部署、运行长程 Agent,而无需自行建设沙箱、会话持久化、凭证管理、权限与追踪等底层设施。

Coding Harness

Coding Harness(编码框架)是 Agent Harness 的一个特化形态——专门围绕"写代码/改代码"任务设计的软件脚手架。它在 LLM 之上封装仓库上下文、工具定义、权限闸门、上下文压缩和会话记忆,让模型能够在真实代码仓库里循环地观察→分析→选择→执行。

Error-as-Data

Error-as-Data(错误即数据)是 Agent Runtime 的一种错误处理哲学:把可理解的工具错误作为合法的工具结果返回给模型,由 LLM 自主决定重试、换工具还是告知用户,而不是默认抛异常打断执行。与之相对的是 Error-as-Exception(传统编程模式)。

Harness 嵌合体性

Harness 嵌合体性(Chimeric Nature of Harness)指出:Agent Harness 不是一个性质统一的系统,而是不同性质接口的集合。同一个 Harness 在不同接口层呈现不同的系统拓扑——薄接口处呈现控制论的 controller/plant 拓扑,厚接口处呈现自创生(autopoies

Harness 协同进化

模型与其训练时所用的特定 Agent Harness 已经形成深度耦合:模型在 Harness 循环中被后训练,因此改变 Harness 的工具与流程实现可能反而降低性能。模型与 Harness 不再是可独立替换的两块,而是共同进化的一体。

Hermes Agent

Hermes Agent 是 Nous Research 于 2026 年初以 MIT 协议开源的自进化 AI Agent 框架,定位为"住在你服务器上、越用越懂你的常驻私人 Agent"。它与 OpenClaw〔待补〕 同赛道,但把"自动 skill 提炼 + 离线 GEPA 优化"作为默认行为,并在战略上代表"开放

Meta-Harness

Meta-Harness 是一种 Agent 平台设计范式:平台本身不规定具体的 harness 实现,而是定义一组稳定的、对"未曾设想的 Agent 程序"足够通用的接口(session、harness、sandbox),允许底下的具体实现随模型演进自由替换。它是操作系统"虚拟化硬件为进程/文件"思路在 Agent

Ontology-backed Agent

Ontology-backed Agent 是一种 Agent 架构模式:Agent 的工具发现、上下文获取和操作执行全部通过一个统一的语义层(Ontology)完成,而非直接调用异构 API。Ontology 同时充当 Agent 的"世界模型"(提供结构化上下文)和"操作边界"(限定可执行操作),实现了"从语义到行

Palantir Ontology

Palantir Ontology 是一个位于数字资产之上的运营层,将数据集、模型和虚拟表映射为真实世界对应物(工厂、订单、交易),同时定义这些对象可以被如何操作。它不是传统意义上的"只读"知识图谱,而是一个包含语义元素(Object Types、Properties、Link Types、Interfaces)和动力

Prompt Prefix Caching

Prompt Prefix Caching(提示前缀缓存)是 Agent Harness 的一项核心优化:把每轮几乎不变的 prompt 部分(系统指令、工具描述、工作区摘要)固化为"稳定前缀",让模型运行时只重新处理变化的尾部(最新用户请求、短期记忆、近期对话)。

Ralph Loop

Anthropic 提出的两阶段 Agent 模式,用于跨越多个上下文窗口的长任务。文件系统在上下文窗口之间提供连续性,让 Agent 可以"睡眠—醒来—接着做"。

Runtime Loop

Runtime Loop 是 Agent 框架内部那个隐藏的主循环:反复"加载上下文 → 调用 LLM → 若有工具调用则执行并回写 → 若需切换 Agent 则 handoff → 若需人类则中断 → 否则返回结果"。判断一个框架是不是 Runtime,不看它能否调模型,而看它是否拥有这个循环。

Self-Improving Agent

一种 Agent 自我改进机制,通过自动记录用户纠正、执行错误和新需求,持续积累经验并升级到人格/记忆系统,实现跨会话的能力进化。

Vertical Harness

针对垂直领域把行业 know-how 做到极致的 Agent Harness。模型公司做不完所有 Skills,通用 Harness 无法覆盖的深度,是垂直公司切入上一代企业做不深工作流的杠杆。

工具调用 MCP Skills47

程序化工具调用

Anthropic Claude API 的客户端能力:让 Agent 在代码执行沙箱里处理工具结果,而不是把原始结果直接喂回模型。Agent 在沙箱内循环、过滤、聚合多次调用,只有最终输出进入上下文。

垂直 AI 三层架构

把垂直领域 AI 产品收敛到三层:确定性工具层(Deterministic Tool)+ 知识检索层(Domain RAG)+ 推理 LLM 层(Reasoning),再叠加 Persona 记忆 实现个性化。通用大模型直接 Prompt 在专业领域稳定性差(排盘错误、解读教条),而把"能算清"的部分外包给确定性工具、

代理式分析三失败模式

Anthropic 数据团队总结的、造成绝大多数分析 Agent 错误回答的三个属性,以及一套分层各个击破的"代理式分析栈"。

代码编排型 MCP

针对表面极大(数百到数千端点)的服务,MCP 服务器只暴露极薄的工具壳:Agent 写一段短脚本,服务器在沙箱里执行该脚本对接底层 API,只把结果返回。

二元基准饱和

SWE-bench 这类只看最终通过/失败的二元基准存在两个连带病:

工具注册表(Tool Registry)

Agent 系统的核心组件之一:集中管理各团队构建的业务工具、把 Agent 的通用能力与组织的具体业务逻辑连接起来的注册表。本质是一个 Resolver(解析器)——告诉 Agent"我能做什么",Agent 接到任务后先查 Resolver 决定调用哪个工具,再去执行。

回归集与迭代集

Eval 数据集的最小卫生切分:回归集(Regression Set)稳定、广覆盖,所有变更必须跑;迭代集(Iteration Set)小、聚焦于当前在 debug 的失败模式。修复后从迭代集迁入回归集。

会话续接决策

在使用 Claude Code 等 AI Agent 时,判断是否应该开启新会话还是继续当前会话的决策框架。核心依据是提示缓存(Prompt Prefix Caching)的热/冷状态与任务连续性,而非直觉上的「做完一步就清空」。

即时软件(Just-in-Time Software)

Agent 在需要某个特定视图或能力时当场生成一个针对当前需求的、用完即弃的单页应用(如一个 JavaScript app),生成它的技能文件可随时再调用。软件不再是预先写好的固定资产,而是按需即时生成、动态可改的产物。

渐进式披露

允许 Agent 通过探索逐步发现相关上下文的设计模式,而非一次性将所有信息预加载到上下文中。技能文件可以引用其他文件,Agent 可以递归读取,按需发现所需层级的信息。

接力棒模式

Skill 设计模式之一。把"上次做到哪"写在外部文件(接力棒,next-prompt.md)里,让多个 session 之间通过文件传递状态。LLM 不需要记住,每次 session 启动读接力棒、执行任务、写下一个接力棒。

禁止配替代模式

写 AGENTS 最稳定的规律之一:每一条"别做"都要配一条"做这个"。Augment AuggieBench 测试中,只有禁止项的文档表现系统性地差于禁止+替代方案配对的文档。

决策表(Agent 文档)

在 AGENTS 中用于解决架构歧义的工具:当代码库里有几种都说得通的方案时,决策表让 Agent 在写第一行代码前就做出选择,不用边写边猜。是 AuggieBench 评测中提升效果最显著的模式之一。

跨模态评估(Cross-Modal Eval)

在没有 ground truth 的开放生成任务上,让多个不同模型互相评分对方的输出,每个模型负责一种它擅长的失败模式,把多视角分数喂回 Skill 优化循环。

领域专家 UX

为提取领域专家(律师、医生、保险核保员、航空工程师等)的tacit judgment〔待补〕而专门定制的评估界面:让 UI 看起来像专家平时已经在用的工具,让他们在熟悉的语境里高亮、批注、标记对错,系统在背后把这些操作转换成 eval pipeline 的标签。

路径作用域规则

路径作用域规则(Path-scoped Rules)是 Claude Code `.claude/rules/` 下、带有 `paths:` frontmatter 字段的规则文件:规则只在 Claude 触碰匹配该路径模式的文件时才加载进上下文,而非 session 启动即载。它是"按需加载约束"的机制,用来对抗无作

配对 Skill(Pairwise Skills)

Anthropic 数据团队的 Skill 设计模式:用一对协作的 Skill 分别承载声明性知识与程序性知识——若真相源是 Agent 的声明性知识(一个指标"是什么"),那么 Skill 就是其程序性知识(按什么顺序查哪些源、如何在歧义数据里导航、一份完成的分析长什么样)。

熵值诊断

评测"评估本身"质量的方法:同一测试用例对同一模型与 grader 跑 10 次。10/10 通过或 10/10 失败 = 低熵 = 信号干净;5/5 分裂 = 高熵 = grader 或用例本身有歧义。

生成式UI

由 AI 智能体根据用户需求和上下文动态生成并组合的用户界面,而非由开发者预先硬编码。区别于传统 UI(静态、预定义),生成式 UI 的输出生命周期可以超越对话本身(持久视图)。

书籍镜像(Book Mirror)

把整本书章节化提取,每章派一个子 Agent 同时做两件事——总结作者的观点 + 把每条观点映射到读者的真实人生——产出双栏脑图(左:作者说什么;右:在我现在生活里对应什么)。映射来自系统对读者的全部 context(家族史、职业、近期会议、读书史、治疗师笔记)。

输出风格

输出风格(Output Styles)是 Claude Code `.claude/output-styles/` 下的文件,其指令被 注入系统提示。因身处系统提示层,它携带所有指令机制中 最高的权威性,从不被 压缩,每个 session 启动时加载,首次请求后缓存(故为中等上下文成本)。

数据不是软件

Anthropic 数据团队用来区分"分析 Agent"与"编码 Agent"的核心命题:分析的准确性是上下文与验证问题,不是代码生成问题。把 Claude 指向数据仓库直接执行会制造一种"虚假的精确感"。

消融设计空结果

Anthropic 数据团队的 evals 方法论原则:为空结果(null result)而设计。每个关于 Skill 的结构性决策(暴露哪些源、某个子 Agent 是否值得它的延迟、是否合并两个 Skill)都通过固定离线 eval 集、只改变一个组件、比较通过率来回答——方法论比任何单个结果更重要。

意图分组工具

设计 Agent 工具集时按用户意图组合,而非按 API 端点一对一映射。工具数量更少、描述更丰富,让 Agent 在两三次调用内完成任务,而不是把多个原语拼起来。

知识编译与检索

知识编译与检索(compile-not-append)是一种知识库迭代哲学:新内容入库时优先尝试 merge 进现有概念,而不是追加新页面。配套机制是 manifest 增量追踪——记录每个源文件的上次同步状态,只处理 delta 部分。它直接对抗"碎片化笔记"问题,是 知识编译〔待补〕 在工程层面的具体迭代纪律。与之

指令权威性梯度

指令权威性梯度是评估"向 Agent 下达指令的不同机制"的统一框架:任何一种机制都可沿四个维度刻画——何时加载进上下文 × 是否经受压缩 × 上下文成本 × 携带多少权威性。它解释了为什么同一句话放在不同位置,效果与代价天差地别,并导出"确定性的事用确定性机制,指令只用于需要模型判断的部分"这一核心原则。

智能体界面四阶段

Rabi Shanker Guha 提出的智能体驱动产品界面演进模型,描述从纯文本到完全自适应 UI 的四个阶段。解释了为何「聊天框既是对的方向,又是错的体验」——能力到了,容器没跟上。

自建评估 Harness

不采用通用 evals 平台,而是用 Codex / Claude Code 让 Agent 为你的 Agent Harness 量身定制一套 eval Harness。Eval 与 AI Harness 的耦合度太高,无法外包给"通用基础原语"。

Agent 包裹确定性工具

Pete Koomen 提出的 AI 软件正确形态:Agent 包裹确定性工具(agent wrapping deterministic tools),而非"确定性软件包裹一小块 AI"。后者是他批评的"Horseless Carriages(无马马车)"反模式——像汽车发明初期模仿马车外形、只把马换成发动机,没有按新

Agent Skill 包

Agent Skill 包是一种跨 agent 通用的纯 markdown 指令书——一个目录下放一个 `SKILL.md`(必要时配 reference / scripts / data),不绑定任何运行时,让任意支持 skill 发现的 agent(Claude Code、Cursor、Codex、Gemini、H

Agent-CLI 设计

专为 AI Agent 优化的命令行界面设计范式。区别于传统面向人类的 CLI 设计,Agent-CLI 针对 LLM 的认知特点(概率选择、树搜索、幻觉倾向)进行交互优化。

AGENTS.md

放置在仓库根目录或模块目录的项目级 Agent 指令文件——告诉编码 Agent 这个仓库/模块的导航地图、工作流、决策规则、复用模式。是 Claude Code(CLAUDE.md)、OpenAI Codex、Augment 等多家工具共享的事实标准格式。

AI 原生 CLI

专为 AI 代理设计的命令行工具,从设计之初就假设调用者可能是 AI,而非仅服务于人类开发者。与传统 CLI 的根本区别在于:无交互式菜单、结构化输出、自带说明书(Skills)、支持预览和自查。

CIMD(Client ID Metadata Documents)

MCP 2025-11-25 spec 引入的OAuth 客户端注册机制。客户端通过一份元数据文档表明身份,跳过传统 OAuth 的预注册流程,让用户首次接入更快、复授权提示更少。

Elicitation

MCP 协议中允许服务器在工具调用过程中暂停、向用户索取输入的机制。让 Agent 不必把用户踢到设置页面,就能完成参数补全、二次确认或敏感凭据采集。

Fat Skills, Fat Code, Thin Harness

个人 / 小团队构建复利型 AI 系统的核心架构原则:Harness 薄 + Skills 厚 + Data 厚 + Code 厚。Harness 只做路由分发,Skill 是自包含的能力单元,Data 与 Code 才是复利沉淀的地方。

Hooks 系统

在 AI 代理生命周期的特定节点自动执行预设逻辑的机制。类似 Git 的 pre-commit hook,但作用于代理的整个运行周期。是 Claude Code 作为"代理平台"(而非编程助手)的关键设计。

MCP Apps

MCP 的第一个官方协议扩展。允许工具返回一个可交互界面(图表、表单、仪表盘等),由客户端在聊天界面内联渲染,而不是只回纯文本。

MCP(Model Context Protocol)

将 Agent 与外部系统连接的协议层〔待补〕。客户端(Agent)连接到服务器(系统能力暴露方),认证、发现、富语义都被标准化。一台远程服务器可被任何兼容客户端(Claude、ChatGPT、Cursor、VS Code 等)在任何部署环境下使用。

Noun-Verb 命令结构

CLI 命令组织模式:先名词(资源类型)后动词(操作)。如 `docker container ls`、`gh pr create`。与 verb-noun(如 `create-pr`)相对。

Skill 借口反驳表

预判 LLM 在执行 Skill 时可能产生的自我合理化路径,逐条列出并提供反驳。堵死所有逃避路径,让模型即使想走捷径也找不到台阶。

Skill 四层级进化

Skill 能力成熟度的四级模型,从静态指令到可自主进化的能力体,每一级代表更深的经验沉淀和更强的护城河。

Skill 五种设计模式

从 7 个顶级 Skill 中提炼的五种核心写作模式 + 一种特殊模式。根据"Skill 需要做什么"选模式,是 Skills系统 工程化的入门框架。

Skill可迁移幻觉

误以为用强模型写出的 Skill 可以无缝迁移给弱模型使用的认知偏差。实际上,Skill 是自然语言指令,对模型能力存在隐性依赖;更换模型后行为可能完全不同。

Skillify 循环

"做完一次 → 用元 Skill 把它压成新 Skill"的复利闭环。Skillify 本身是一个创造 Skill 的元 Skill——遇到要重复的工作流就说"skillify this",它会回看刚发生的过程、抽出可复用模式、写出带触发器和边界条件的 Skill 文件、注册到 resolver。

Skills 系统

Skills 是 AI Agent(如 Claude Code)的扩展机制——文件夹而非纯文本,可包含 Markdown 指令、脚本、资源数据等。Agent 在运行时根据 description 匹配和加载相关 Skill。

Tool Search

Anthropic Claude API 的客户端能力:不把所有工具定义一次性塞进上下文,而是让 Agent 在运行时检索工具目录、按需调入相关工具的 schema。

上下文 记忆 学习9

工作记忆与完整会话

一个合理的 Coding Agent 会把"会话状态"至少分成两层:Working Memory(工作记忆)——小而精的显式状态,由 harness 主动维护和压缩;Full Transcript(完整会话)——忠实记录每一次用户请求、模型回复和工具输出的完整流水,用于断点续跑。两者任务不同、压缩节奏不同,不应混为一谈

过程记忆

Agent 从成功完成复杂任务的执行路径中自动提炼出的可复用工作方法,以 Skill 的形式持久存储。区别于陈述性记忆(事实和偏好),过程记忆记录的是「怎么做某类具体任务」。Hermes Agent 中的核心设计。

三层持续学习

三层持续学习(Three-Layer Continual Learning)是 Harrison Chase 提出的 Agent 进化框架:Agent 系统可以在三个不同层面学习,而不仅仅是"更新模型权重"。三层分别是 Model(模型)、Harness(框架)、Context(上下文)——学习发生在哪一层,决定了工具

上下文污染

Agent 处理某一子任务时积累的上下文信息与后续子任务无关,却仍占据上下文窗口,从而稀释注意力、降低推理质量的现象。是多智能体架构设计中最核心的问题之一。

上下文压缩

上下文压缩(Context Compaction)是 Coding Agent 对抗"上下文膨胀"的运行时机制:通过剪裁、去重、摘要等手段,把会话历史、工具输出、文件读取压缩成模型在下一轮真正需要看到的内容,而不是把一切原封不动塞回 prompt。

上下文中心分解

多智能体任务分解的核心原则:按上下文边界而非工作类型拆分任务。组合在一起的工作不应因职能不同而拆分,而应因上下文是否可以真正隔离来决定。

Context Anxiety

Context Anxiety(上下文焦虑)是 LLM 在长任务中的一种行为模式:当模型感知自己接近上下文窗口极限时,提前收工——开始草率地结束任务,质量下降。

Context Rot

上下文腐烂/过度探索陷阱:Agent 因被 prompt/AGENTS.md 引发的探索行为吸引,打开过多无关文档把上下文塞满,最终输出反而变差。本质是 上下文污染 的一种特定子类——由文档结构本身触发,而不是子任务残留。

Session as Context Object

Session as Context Object 是一种上下文管理范式:把长程任务的上下文作为一个持久化的、可按位置询问的对象存在模型窗口之外,而不是在窗口内做不可逆的压缩与丢弃。Claude 通过 `getEvents()` 这样的接口去切片、回溯、重读事件流,把"存什么"与"用什么"彻底解耦。

多 Agent 协作6

Agent 基础设施5

Agent 安全 身份 支付4