Agent-first 基础设施
定义
Karpathy 提出的范式:把世界拆成 Agent 能读懂的输入,以及 Agent 能安全调用的动作接口——而不是让 Agent 模拟人去点网页、读图文文档、按菜单操作。
"为什么还有人在告诉我该做什么?我什么都不想做。'给我复制粘贴给 Agent 的东西是什么?'"——Karpathy
要点
今天的工具是"为人设计 + Agent 模拟人"
文档说"去某个 URL,点击某个设置,复制某个 key,打开某个菜单,配置某个 DNS"——这是给人看的指令。Agent 要么去人工 UI 上模拟点击(脆弱、慢),要么靠人类反复给它喂上下文。
Agent-first 重构清单
文档、API、权限、日志、部署、配置、账单、回滚——每一项都要变得更适合 Agent 使用:
- 不让 Agent 模拟人去点网页
- 让 Agent 直接理解状态、调用动作、收到反馈
MenuGen 部署痛点是基准案例
Karpathy 说 MenuGen 最麻烦的部分不是写代码,而是部署:在 Vercel 上配 DNS、连服务、进各种设置页面、把东西串起来。
理想标准:给 LLM 一句 Build MenuGen,它不仅能写代码,还能完成部署、上线到互联网、配好依赖服务,整个过程不需要人去一个个菜单里操作。
它是 智能体原生(Agent Native)〔待补〕 的基础设施侧
智能体原生(Agent Native)〔待补〕 是产品架构的范式(假设操作者可能是 AI)。Agent-first 基础设施是它的支撑层:让"操作者是 AI"在工程上真的可执行。
MCP 是这条路上的协议候选
MCP 把 Agent 接入外部系统的方式从"模拟人 UI"换成"协议层调用",是 Agent-first 基础设施的协议侧实现。Machine Payments Protocol 是支付侧的同类尝试。
进一步的图景:Agent 之间互相协调
Karpathy 设想每个人、每个组织都有自己的 Agent representation。安排会议、处理细节、协调事项变成"我的 Agent 和你的 Agent 去谈"。届时基础设施要承载的不只是人-Agent 调用,还有 Agent-Agent 协议。
示例
- 反例:Agent 通过浏览器自动化模拟人填表 → 脆弱、慢、UI 改一次就崩
- 正例:MCP 服务器暴露
create_dns_record等结构化动作 → 状态可读、错误可处理、回滚可执行 - 反例:账单系统让人去 dashboard 看图 → Agent 拍屏识别(极脆)
- 正例:账单系统返回 JSON usage 数据 → Agent 直接读
相关概念
- 智能体原生(Agent Native)〔待补〕
- Agentic Engineering
- MCP
- Agent Identity
- Agent Payment
- Machine Payments Protocol
- To Human 与 To Agent〔待补〕
参考资料
- Karpathy × Sequoia AI Ascent 访谈(2026-04)
来自本站知识库 · 全部概念