Anthropic 删掉 80% 系统提示词,真正被淘汰的,是“用文字控制 AI”的旧范式

0 评论 288 浏览 0 收藏 10 分钟

Anthropic 在 Claude Opus 5 中删减超 80% 系统提示词,引发行业热议。本文结合最新研究,揭示上下文工程的新范式:从“规则堆砌”转向“短内核+按需调页+证据治理”。深入剖析提示词精简背后的注意力预算、渐进式披露与治理逻辑,为 AI 产品设计提供全新视角。

7 月 24 日,Anthropic 在发布 Claude Opus 5 的同时披露:Claude Code 面向新一代模型删掉了超过 80% 的系统提示词,内部编码评测没有可测量的下降。

很多人把它理解成“提示词不重要了”或“越短越好”。但把 Anthropic 的实践与近一年的研究放在一起看,结论其实更深:

删掉的不是上下文,而是对所有任务永久生效的静态上下文;迁移出去的,是控制权。

过去,我们试图在任务开始前,用一堵文字规则墙预防所有错误。现在,控制正在被拆到 skills、工具接口、权限、记忆、测试、rubric 和 verifier 里:模型负责判断“怎么做”,系统负责约束“不能做什么”,证据负责证明“是否做成”。

洞见一:上下文窗口是容量,不是有效注意力。能装下,不等于能用好

一项入选 EMNLP 2025 Findings 的研究,在数学、问答和代码任务上测试 5 个模型:即使模型已经完美拿到全部相关证据,输入越长,表现仍会下降 13.9%—85%;把无关内容换成空白、甚至屏蔽掉,下降依然存在。

Chroma 对 18 个模型的受控实验也发现:上下文越长,模型表现越不稳定;一个干扰项就能拉低结果,四个干扰项会继续放大损失。2026 年 8 月更新的一项长程搜索研究还发现一种更隐蔽的失败:premature termination——模型远未耗尽窗口,就提前放弃搜索,给出带犹豫的错误答案。

这说明每多写一条规则,消耗的不只是 token,还有三种更稀缺的预算:注意力预算、冲突消解预算和继续探索的信心预算。

洞见二:无关规则不是“没有帮助”,而可能是负资产

ICLR 2026 的 AGENTS.md 研究很值得警惕。研究者在多种 coding agent 和模型上比较了“无上下文文件”“模型生成的上下文文件”和“开发者编写的上下文文件”。结果是:任务成功率没有稳定提升,但推理成本普遍增加 20% 以上;agent 会更广泛地遍历文件、执行更多测试、走更多步骤。

最反直觉的地方在于:强模型之所以会被冗余规则拖累,恰恰因为它更认真地执行了这些规则。 一条看似保险的要求,会变成新的子目标;十条彼此重叠的要求,会变成一组需要同时满足的约束;当系统提示词、项目规范和用户请求冲突时,模型必须先解决“听谁的”,再解决任务本身。

所以,“规则越多越安全”只在规则彼此独立时成立;现实里,规则会组合、冲突并产生执行税。

洞见三:渐进式披露解决的是路由问题,不是“多做几层目录”

2026 年 7 月首个渐进式披露受控实验给出了一个重要修正:面对单本书时,强 agent 自己就会完成“定位—读取”,披露结构几乎不增加智力;面对 20 本书的资料库时,扁平索引才开始显著生效。在英文开放问答中,扁平披露把准确率从约 0.257 提升到 0.462,同时把每题 token 使用量从 6830 万降到 3250 万。

但更深的分层没有继续变好,反而在一些设置里把准确率从 0.9126 拉低到 0.6398。原因很简单:每多一层路由,都要常驻更多描述;层级本身也会重新制造上下文压力。

论文的原话很精准:“Progressive disclosure buys context, not intelligence.” 渐进式披露买到的是更干净的工作台,不是更聪明的模型。好的设计不是把知识藏得更深,而是用最轻的索引,让模型以最少的中间步骤找到正确证据。

洞见四:“删提示词”与“让上下文持续进化”并不矛盾

斯坦福、SambaNova 与 UC Berkeley 的 ACE 研究,反而让 agent 的 playbook 持续增长,并在 agent benchmark 上平均提升 10.6%,在金融任务上提升 8.6%。关键区别是:它不反复重写整份上下文,而是把经验拆成带结构的条目,通过 Generator—Reflector—Curator 进行局部、增量更新。

研究观察到,整份重写会产生“context collapse”:一份 18,282 token、准确率 66.7 的上下文,在下一轮被压成 122 token,准确率跌到 57.1,甚至低于未适配基线。问题不是上下文太长,而是知识在反复总结中被抹平。

所以真正的新架构不是“极简提示词”,而是:

短内核 + 大外存 + 按需调页 + 增量写回。

永远驻留的系统提示词要短;可检索的知识库可以很大;当前任务只加载必要工作集;新经验不能靠整篇重写,而要带来源、版本和适用条件做局部更新。Claude 5 的变化,更像是把上下文做成了操作系统的虚拟内存,而不是简单删文案。

洞见五:AI 系统的治理,正在从“事前指令治理”迁移到“事后证据治理”

这才是 80% 事件最重要的含义。模型越强,越不需要我们规定每一步“怎么走”;但模型行动范围越大,系统越需要明确权限、状态、回滚、验证和审计。

LangChain 在保持 GPT-5.2-Codex 不变的情况下,只改提示词、middleware、自验证和循环检测,就把 Terminal-Bench 2.0 从 52.8% 提升到 66.5%。Harness-Bench 的 5,194 条执行轨迹也显示:强模型确实更能容忍不同 harness,但在数据分析、工具调用、状态维护和工作区修改这类任务里,执行框架的差异仍然最明显。

因此,未来高质量 agent 的原则不是“完全放手”,而是:

在方法上给自由,在边界上做硬约束,在结果上要求可验证。

对于我们自己的 SOP、培训手册和 AI 工作流,这意味着五个具体动作:

  1. 把常驻规则压成最小内核:只保留目标、不可逆边界、升级条件和真正无法从环境推断的 gotcha。
  2. 把场景知识拆成按需模块:什么任务触发什么 skill,而不是让所有人、所有任务先读完一本百科全书。
  3. 把“必须正确”改造成可执行约束:权限、schema、测试、lint、校验器能机器执行,就不要只写成一句“请务必注意”。
  4. 把 SOP 的中心从步骤改成 Evidence Contract:交付物是什么、证据在哪里、通过标准是什么、失败如何回滚。让 agent 自己选择路径,但必须拿证据过 Gate。
  5. 给每条规则做消融实验:删掉它,评测是否下降?如果没有,就删除;如果只在特定场景有用,就移到 skill;如果属于安全底线,就下沉到权限或 verifier。

所以,真正被淘汰的不是 prompt engineering,而是一个旧假设:只要把组织里所有经验、担忧和例外都写进提示词,AI 就会更可靠。

下一代上下文工程的核心,不是“还能补哪条规则”,而是判断:

这条要求究竟应该留在提示词里,做成按需知识,变成工具接口,落成权限边界,还是写进一个能验证的gate?

从“写更多规则”到“设计更好的反馈回路”,这才是 Claude 5 带来的真正范式转移。

本文由 @NEXERA AI 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 目前还没评论,等你发挥!