Harness 与运行时2026-04-08
Prompt Prefix Caching
定义
Prompt Prefix Caching(提示前缀缓存)是 Agent Harness 的一项核心优化:把每轮几乎不变的 prompt 部分(系统指令、工具描述、工作区摘要)固化为"稳定前缀",让模型运行时只重新处理变化的尾部(最新用户请求、短期记忆、近期对话)。
要点
- 为什么重要:编码会话是高度重复的——指令、工具列表、仓库事实几乎不变,每轮重建全部 prompt 既慢又贵
- 什么进稳定前缀:系统提示、agent 规则、工具 schema、工作区摘要("stable facts")
- 什么进变动部分:短期记忆、压缩后的对话流、最新用户请求
- 配合 KV cache:"智能"运行时依赖底层推理服务的 prefix caching 能力来真正省算力
- 这是 Coding Harness 六大组件之二,直接影响延迟和成本
示例
- Raschka Mini Coding Agent 的
build_prefix / memory_text / prompt三段式结构 - Claude / OpenAI API 都提供 prompt caching 功能,让 harness 显式标记稳定片段
相关概念
- Coding Harness
- Agent Harness
- Context Anxiety - 前缀太大也会挤压上下文
- 上下文压缩
- 会话续接决策 - 缓存热身状态决定是否开新会话的实践框架
参考资料
- Sebastian Raschka, Components of A Coding Agent (2026-04-04)
被这些概念引用
来自本站知识库 · 全部概念