约 9 分钟
2026 年给 agent 写提示词:Anthropic 与 OpenAI 官方指南的共同转向
并排读 Anthropic 与 OpenAI 2025–2026 年的官方 agent 提示词指南,两家走向了同一个方向:删提示而不是加提示,从催模型到拦模型,从步骤清单到目标契约。本文整理其中最重要的共识与最可操作的规则。
- 提示词
- agent
- 方法论
2025 到 2026 年,Anthropic 和 OpenAI 各自发布了一批「如何为 AI agent 写提示词」的官方材料:工程博客、platform 文档、cookbook 和指南 PDF。把两家的材料并排读,会发现它们在 2026 年走向了同一个方向。本文整理其中最重要的共识与最可操作的规则,所有要点均出自官方原文,来源编号见文末。
七个共同转向
- 少即是多成为官方立场。 两家都要求删提示而不是加提示。OpenAI GPT-5.6 指南给出实测数据:精简系统提示后 eval 分数提升约 10–15%,token 减少 41–66% [O8];GPT-5.5 指南要求迁移时从新的最小基线重建,不要把旧 prompt 整个搬过来,过程性 step-by-step 指令被明确定性为噪声 [O7]。Anthropic 对 Claude Fable 5 的指导同调:为旧模型写的提示往往过度规定,会拖低新模型的输出质量;过去用来防偷懒的激进措辞(「CRITICAL: You MUST」)现在会导致过度触发,应回调为平实措辞 [A1][A2]。
- 方向反转:从「催」到「拦」。 2025 年上半年的经典模式是催模型别偷懒;2026 年的新模型指令遵循强、行动倾向高,官方样例段大量变成防过度:防未请求的动作、防过度验证、防过度规划、防过度调用工具 [A1][A2][O6][O8]。
- 从步骤指令到目标契约。 OpenAI 的推荐模板从
Reasoning Steps演化为Goal / Success criteria / Constraints / Stop rules:不写过程,写什么算完成、如何验证 [O7]。Anthropic 的表述是「right altitude」:足够具体以指导行为,但给启发式而非编排每一步 [A3]。 - 官方直接发可复制的「契约块」。 Anthropic 的
<default_to_action>、防伪进度报告段、checkpoint 段 [A1][A2];OpenAI 的<tool_persistence_rules>、<completeness_contract>、<verification_loop>、<instruction_priority>[O6]。 - 工具上下文平台化。 工具清单瘦身从提示技巧变成平台特性:两家都上了按需加载的 tool search(Anthropic
defer_loading[A15],OpenAI GPT-5.4 起原生 [O6])和「模型写代码编排工具调用」(Anthropic Programmatic Tool Calling [A15],OpenAI PTC [O8])。 - 评估文化制度化。 「eval → 读 transcript → 定向修提示」是提示迭代的唯一正规路径。Anthropic:没人细看 transcript 之前不接受任何 eval 分数 [A13];OpenAI 给出 metaprompting 两步法 [O3]。
- 模型升级是删脚手架的时机。 Anthropic 在 Opus 4.6 消除「上下文焦虑」后,自己删掉了 sprint 拆分 harness [A11]。为旧模型写的护栏,对新模型常常是负资产。
系统提示怎么写
分节加语义化标签是两家共识。Anthropic 用 XML 标签或 Markdown 标题切区块,标签名跨提示一致、可嵌套 [A1][A3]。OpenAI 首选 Markdown 标题,XML 表现也好,JSON 包裹长上下文表现特别差 [O1]。
给理由,不只给命令。 Anthropic 建议把模型当「聪明但刚入职的新员工」:「NEVER use ellipses」不如解释「输出会被 TTS 朗读」,模型会从理由中泛化 [A1]。
指令冲突是最高优先级 bug。 GPT-5 以外科手术般的精确性遵循指令,矛盾指令会让模型烧推理 token 试图调和,而不是随机选边 [O2]。GPT-5.4 给出显式 <instruction_priority> 块:用户指令覆盖风格默认,安全与隐私不让步,新指令覆盖旧指令 [O6]。
绝对词降级。 ALWAYS/NEVER 只留给真正的不变量(安全规则、必填字段),不要用来控制判断型决策 [O6];Anthropic 同向 [A1]。
人格写成行为规则。 不要写「友好」,写「直接陈述答案;用户报告问题先确认具体问题再给下一步」[O8]。人格描述要短,不能替代目标、成功标准和工具规则 [O7]。
什么时候直接做,什么时候先问
两家 2026 年都把这一条写成了标准段落,而且划界逻辑一致:按副作用的可逆性划界,不按任务类型。
- Anthropic:可逆的本地操作放手做,难逆、共享、破坏性的操作先确认,样例枚举了 rm -rf、force push、对外发消息;遇到障碍不得用破坏性操作抄近道 [A1]。Fable 5 的 checkpoint 段:只在真正需要用户时暂停,即破坏性或不可逆动作、真实的范围变化、只有用户能提供的输入 [A2]。另一条边界:用户在描述问题、提问或思考时,交付物是你的评估,报告发现即止,不动手修 [A2]。
- OpenAI:GPT-5.6 按请求类型划授权。回答、解释、审查类请求:检查后报告,不实施变更;变更、构建类请求:本地变更与非破坏性验证直接做,不询问;外部写入和破坏性操作需要确认 [O8]。
长程自主运行的专属段落
Anthropic 的 Fable 5 指南 [A2] 是这个主题最系统的官方材料:
- 防伪进度报告:汇报进度前,把每条声明对照本会话内的工具结果审计;只报告有证据可指的工作;测试失败就带输出说失败,跳过的步骤就说跳过。官方称这段在测试中几乎消除了虚构进度报告。
- 防早停:结束回合前检查最后一段,若是计划、问题或承诺,就现在用工具调用把它做掉。
- 防上下文焦虑:尽量不给模型看剩余 token 倒计时;必须显示时加一句「你有充足的剩余上下文,不要因上下文限制提前收尾」。
OpenAI 的对应物是进度播报的量化规范:GPT-5.1 要求「每几次工具调用 1–2 句更新,至少每 6 步一次」[O3],GPT-5.2 收紧为「只在新阶段或计划改变时播报,不要旁白常规工具调用」[O4]。一个值得注意的反例:对 gpt-5.x-codex 要删除所有要求 upfront plan 和 preamble 的提示,否则模型会中途突停,因为模型已经内置该行为 [O5]。
工具描述是最高杠杆
- 描述即提示工程。 Anthropic:写工具描述如同给新同事写文档,包括用法示例、边界情况、输入格式、与其他工具的边界 [A4]。OpenAI 的「实习生测试」:只凭给模型的信息,实习生能否正确使用该函数 [O9]。
- 职责切分。 工具定义写「是什么、参数格式」,system prompt 写「何时用、何时不用」[O9][O1]。2026 年 OpenAI 进一步把使用时机、副作用、重试安全性、错误模式都下放到 description [O7]。
- 防错设计。 改参数结构让错误用法不可能发生:相对路径参数改为强制绝对路径 [A6];
toggle_light(on: bool, off: bool)改为枚举 [O9]。 - 错误信息可操作。 不要裸错误码,要「Invalid format. Expected: user_id (integer)」式的修正指引 [A4]。查询为空时先尝试 1–2 个后备策略再报告未找到 [O6]。
- 工具数量看相似度,不只看数量。 15+ 个清晰工具没问题,不到 10 个重叠工具就崩 [O9][O12]。
平台层面的对应能力:
| 机制 | Anthropic | OpenAI |
|---|---|---|
| 工具按需加载 | Tool Search Tool,58 工具场景前置消耗 77K→8.7K tokens,工具选择准确率 79.5%→88.1% [A15] | GPT-5.4 起原生 tool search;allowed_tools 限定当前可用子集 [O6][O9] |
| 模型写代码编排工具 | Programmatic Tool Calling,中间结果不进上下文,token 减少 37% [A15] | PTC,官方强调克制:单次调用足够、中间输出小时优先直接调用 [O8] |
| schema 之外的用法知识 | 工具定义内加 1–5 个 input_examples,复杂参数准确率 72%→90% [A15] | 用法示例放 prompt 的 Examples 节 [O1] |
多智能体:先把单 agent 做好
两家 2026 年的立场都很克制。Anthropic 警示多智能体消耗单 agent 3–10 倍 token,先改进单 agent 提示,有证据才加复杂度 [A14];OpenAI 同样要求先最大化单 agent 能力 [O12]。
两家一致认定的最成功模式是验证子代理:主 agent 干活,一个干净上下文的独立 agent 做验证,不受实现方推理的污染 [A14][A9][A2]。要注意的失败模式是验证 agent 跑 1–2 个测试就宣告通过,对策是把「必须运行完整测试套件」写死 [A14]。切分按上下文边界,不按工种:做功能的 agent 也应该做它的测试 [A14]。
评估与迭代
- 起步只需 20–50 个来自真实失败的任务,越晚越难建;任务要能让两个领域专家独立给出相同的 pass/fail [A13]。
- 问题集要平衡:既测「何时该做」也测「何时不该做」[A13]。
- Grader 不要过度规定步骤,否则 agent 找到有效替代路径反而被判失败 [A13]。
- OpenAI 的 metaprompting 两步法:先诊断,给模型当前 prompt 和失败日志,要求识别失败模式并引用最可能导致它的 prompt 行;再修补,做小而显式的编辑,不重构,保持结构和长度大体不变 [O3]。
- 消融法:逐次移除一组指令、示例或工具后重新 eval,这正是「少即是多」数据的来源 [O8]。
对做数字员工的人意味着什么
对任何在生产环境里运行 agent 的团队,这些指南的共同含义可以压成几句话:审计现有系统提示,删掉为弱模型写的 anti-laziness 措辞和过度规定的步骤清单;工具描述写清何时用、何时不用,错误信息给修正指引;自主任务的系统提醒里加入防伪进度报告和防早停段落;多智能体优先采用干净上下文的验证子代理;从真实失败案例攒 20–50 个 eval 任务,越早越好。
来源
Anthropic
- [A1] Prompting best practices
- [A2] Prompting Claude Fable 5(2026-06)
- [A3] Effective context engineering for AI agents(2025-09)
- [A4] Writing effective tools for agents(2025-09)
- [A5] How we built our multi-agent research system(2025-06)
- [A6] Building effective agents(2024-12)
- [A7] Skill authoring best practices
- [A8] Equipping agents for the real world with Agent Skills(2025-10)
- [A9] Claude Code best practices
- [A10] Effective harnesses for long-running agents(2025-11)
- [A11] Harness design for long-running application development(2026-03)
- [A12] Building a C compiler with a team of parallel Claudes(2026-02)
- [A13] Demystifying evals for AI agents(2026-01)
- [A14] When to use multi-agent systems(2026-01)
- [A15] Introducing advanced tool use(2025-11)
- [A16] Code execution with MCP(2025-11)
- [A17] Agent SDK: Modifying system prompts
- [A18] System prompts release notes
- [A19] Prompt engineering best practices for 2026(2025-11)
- [A20] claude-cookbooks
OpenAI
- [O1] GPT-4.1 Prompting Guide(2025-04)
- [O2] GPT-5 Prompting Guide(2025-08)
- [O3] GPT-5.1 Prompting Guide(2025-11)
- [O4] GPT-5.2 Prompting Guide(2025-12)
- [O5] Codex Prompting Guide(gpt-5.3-codex)
- [O6] Model guidance: GPT-5.4(2026-03)
- [O7] Model guidance: GPT-5.5(2026-04)
- [O8] Model guidance: GPT-5.6(2026-07-09)
- [O9] Function calling guide
- [O10] Reasoning best practices
- [O11] Prompt caching
- [O12] A Practical Guide to Building Agents(PDF,2025-04)
- [O13] Agents SDK handoff prompt
- [O14] Agents SDK agents/instructions
- [O15] AGENTS.md 开放标准
- [O16] Codex: Custom instructions with AGENTS.md
- [O17] OpenAI Academy 课程公告(2026-06)
cookbook 与 platform 页面多不标显式日期,以上日期按随附模型发布日、GitHub 提交记录与第三方引用交叉确认。