Claude Code 默认开启 Auto Mode,Agent 的安全不能靠用户一直点“允许”
Anthropic 将 Claude Code 的 Auto Mode 设为默认,引发了对 Agent 权限设计的重新思考。当人工审批退化为条件反射,系统自动判断能否真正保障安全?本文从产品经理视角,探讨权限分级、风险控制与人工介入的平衡,为 Agent 产品设计提供新思路。

最近,Anthropic 宣布了一项变化:
从 8 月 14 日开始,Claude Code 的 Pro、Max 和 Team 计划,新会话默认启用 Auto Mode。
简单说,以后 Claude Code 不会在每一次工具调用前都弹出确认框,而是先通过分类器判断这个操作有没有破坏性、不可逆,或者是否试图访问当前环境之外的资源。
很多人看到这个消息,第一反应可能是:Agent 终于可以少打扰用户了。
我的第一反应是:以后谁来替我判断它该不该执行?
作为曾经的max用户,狠狠不能忘记被封号的惨痛,虽然现在也不怎么能用上了。
但是
这个问题很重要。因为 Agent 真正影响效率的地方,往往不是它能不能写代码,而是它什么时候停下来问你,什么时候直接往下做。
我使用过 Claude Code、Codex,也使用过国产的 Workbuddy。我的感受是,这几个工具真正拉开体验差距的,不只是模型能力,而是权限设计。
权限太松,用户会担心它失控。
权限太紧,用户又会觉得自己只是雇了一个不断提问的实习生。
Anthropic 这次把 Auto Mode 设为默认,实际上是在回答一个产品问题:
Agent 到底应该把多少决定权交给系统,多少决定权留给人?
一、人工审批看起来安全,但可能只是让人不断点击
Agent 产品早期普遍采用一种比较保守的设计:
每当 Agent 准备执行命令,就弹出提示,让用户确认。
这个逻辑很容易理解。系统把最终决定权交给用户,用户也能知道 Agent 准备做什么。
但问题是,确认次数一多,用户未必真的还在认真判断。就比较容易出现。

框框一顿允许操作过后

Anthropic 在官方公告中提到,Claude Code 用户会批准约 97% 的权限提示。这是 Anthropic 对自身产品使用情况的分析,不代表所有用户都会如此,但它说明了一个很现实的问题:
如果每天出现几十次甚至上百次确认,人工审批很可能会退化成条件反射。用户看到弹窗,第一反应不是分析命令会影响什么,而是赶紧点“允许”,让任务继续跑下去。
Anthropic 还公布了一项由 1053 名付费测试者参加的受控实验。在这个实验环境里,人工审批捕获了 13.6% 的危险命令,Auto Mode 捕获了 89%。
这个结果不能简单理解成“机器比人类更安全”。实验环境、参与者状态和危险命令的设计,都会影响结果。
但这个结果至少提醒产品经理重新思考一件事:
让用户每次点击确认,不等于用户每次都真正参与了安全判断。
这就像很多网站的隐私弹窗。第一次出现时,用户可能会认真阅读。看到几十次之后,绝大多数人只想赶紧关掉。
Agent 的权限弹窗也一样。
如果产品把所有安全责任都推给用户,最后可能出现一种很尴尬的结果:系统看起来保留了人工控制,实际上用户只是成了一个不断点击“同意”的按钮。
二、Auto Mode 解决了打扰,但没有解决所有安全问题
Auto Mode 的思路,是把“每一步都问人”改成“系统先判断,必要时再问人”。
按照 Anthropic 的介绍,Auto Mode 会让工具调用先经过分类器,重点拦截不可逆、破坏性,或者指向用户环境之外的操作。
如果系统连续三次拦截,或者一段会话里累计拦截二十次,Claude Code 会退回人工审批模式。
这个设计比单纯取消弹窗要成熟一些,因为它至少保留了几个环节:
- 系统先做风险判断;
- 高风险操作先被阻止;
- Agent 可以尝试更安全的替代方案;
- 多次无法判断时,再把问题交给用户。
但我不认为 Auto Mode 可以被理解为“安全问题已经解决”。
分类器也会误判。
它可能拦截一个本来安全的命令,也可能放过一个单独看起来没问题,但组合起来风险很高的动作。
比如,读取一个网页看起来没有问题,写入一个临时文件也没有问题,访问一个外部服务也可能没有问题。但这几个动作连续起来,结果可能就完全不同。
这也是 Agent 和普通软件功能最大的区别之一:
很多风险不在单个动作里,而在一连串动作之间。
Boris Cherny 在 X 上表示,结合模型训练、输入探针和意图分类器,多层防护可以把未见过的间接提示注入攻击成功率降到接近 0。
这是 Anthropic 员工的一手观点,应该按照他引用的测试条件理解,不能直接扩展成“提示注入已经被彻底解决”。
产品经理真正要关心的,不是某个分类器的数字有多漂亮,而是:
如果分类器判断错了,系统会造成多大损失?
三、我使用这些 Agent 后,最明显的感受不是模型变强,而是权限越来越重要
我使用 Claude Code、Codex 和 Workbuddy 的时候,感受到一个变化:
早期大家更在意模型能不能写出代码、能不能理解需求、能不能处理复杂任务。
现在大家越来越在意另外一个问题:
它能不能在正确的边界里工作?
因为 Agent 一旦可以调用工具,产品问题就不再只是“回答质量”。
它可能修改文件、运行命令、提交代码、访问网页、调用接口。模型能力越强,能完成的事情越多,权限设计的重要性也越高。
我现在的判断是,低风险任务可以自动化,高风险任务必须分级授权,并保留人工介入。
比如下面这些任务,我认为可以更多交给 Agent:
- 查询资料;
- 总结文档;
- 生成方案;
- 修改本地文件;
- 运行测试;
- 整理代码结构;
- 生成一个可以随时撤销的提交。
但下面这些任务,至少在目前阶段,不能只依靠自动模式:
- 修改生产数据库;
- 删除重要数据;
- 创建外部账号;
- 发送客户邮件;
- 修改线上权限;
- 处理资金和合同;
- 将代码直接发布到生产环境。
这里的判断标准,不是模型聪不聪明,而是这个动作出了问题以后,能不能恢复。
一个错误的本地文件修改,通常可以撤销。
一次错误的生产数据删除,可能就不是重新运行一次命令那么简单了。
四、产品经理不要只设计“允许”或“禁止”
很多产品的权限设计只有两个选项:
允许,或者禁止。
但 Agent 的实际工作不适合这么粗糙。
更合理的做法,是按照风险把操作分成几档。
第一档,低风险任务,默认自动执行。
比如查询、总结、生成草稿。这类任务通常是只读的,影响范围有限,也容易重新生成。
第二档,可撤销任务,自动执行但保留记录。
比如修改本地代码、生成测试文件、整理目录。这类任务可以让 Agent 直接完成,但必须保留操作日志,让用户知道它改了什么。
第三档,影响外部系统的任务,需要二次确认。
比如提交代码、发送消息、修改共享文档。这些任务已经超出本地环境,最好让用户在执行前看到影响范围。
第四档,不可逆或高影响任务,默认禁止自动执行。
比如删除生产数据、创建账号、修改权限、处理资金。这些动作不能只靠一个分类器判断,也不能只靠用户习惯性点击。
PM 启示:权限不是越开放越好,也不是越严格越好。权限设计的目标,是让低风险工作尽量顺畅,让高风险工作必须留下足够的判断和责任链。
五、未来模型可能比人类更适合判断风险吗?
我的答案是:有可能。
甚至我觉得,未来某些场景下,模型的安全判断可能真的会比普通人处理得更好。
原因并不复杂。
人类会疲劳,会分心,也会因为赶时间而忽略提示。一个经过长期训练的模型,可以持续检查大量操作,记住完整上下文,并且按照同一套规则判断风险。
如果模型能够理解任务目标、当前环境、操作对象、历史行为和潜在后果,那么它当然可能比用户随手点击“允许”更稳定。
但这里有一个区别:
模型可以比人类更擅长判断风险,不代表它就应该拥有全部权限。
安全判断和最终授权不是一回事。
模型可以说:“这个动作风险很高。”
但企业是否允许它执行,还涉及客户责任、业务损失、法律后果和组织规则。这些事情不能只看模型的准确率。
所以我认为,未来人工不会完全退出,但人工的角色会变。
现在的人可能是每一步都点确认。
以后的人,更可能负责三件事:
- 制定 Agent 可以做什么;
- 规定什么情况必须升级;
- 在系统异常时停止和恢复。
也就是说,人工不再盯着每一条命令,但仍然需要对权限边界负责。
六、Agent 产品最后拼的不是“能做什么”,而是“出错后怎么办”
如果团队准备使用 Agent,我建议不要一开始就给它最高权限。
可以先从只读任务开始,再进入隔离的测试环境,最后才考虑有限度地接入生产系统。
每增加一种权限,都要先回答三个问题:
- 这个动作最坏会造成什么后果?
- 出错之后能不能快速恢复?
- 谁能看到异常,并在第一时间停止它?
如果这三个问题都没有答案,就不应该急着让 Agent 自动执行。
OpenAI 最近将 Astra 列为首个“关键”网络安全能力模型,也说明模型能力和安全控制已经越来越难分开讨论。
模型变强以后,产品经理不能只问:
“这个 Agent 能不能完成任务?”
还要继续问:
“它凭什么权限完成任务?”
“它能不能通过其他路径绕过限制?”
“出了问题以后,谁来负责?”
我目前仍然坚持一个比较保守的判断:
低风险任务可以自动化,高风险任务必须分级授权和保留人工介入。
但我也不排除另一种可能。
当模型能力真正达到一定程度后,它在很多具体的风险判断上,可能会比我们人类处理得更好。
到那个时候,人工审批不会消失,但它不应该再是产品安全的第一道防线。真正的第一道防线,应该是清晰的权限规则、可靠的运行时判断,以及出错之后能迅速停止和恢复的机制。
资料与说明:本文参考了 Anthropic 关于 Claude Code Auto Mode 的官方公告、Boris Cherny 的 X 帖子,以及 OpenAI 关于 Astra 网络安全能力的官方公告。文中 Anthropic 公布的测试数据按厂商口径表述;关于分级授权和未来 Agent 能力的判断,属于作者个人观点。
来源:
Anthropic:Auto mode is now the default in Claude Code
Boris Cherny X 原帖
OpenAI:Responding to the next frontier of critical cyber capabilities
OpenAI:Hugging Face security incident
本文由 @十二 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自Unsplash,基于CC0协议

起点课堂会员权益




自动判断能减少打扰是好事,但有些操作单独看确实安全,组合起来风险就变了。分类器理解不了任务全貌时,退回人工审批反而是更保守的兜底。