Claude Code 默认开启 Auto Mode,Agent 的安全不能靠用户一直点“允许”

0 评论 297 浏览 1 收藏 15 分钟

Anthropic 将 Claude Code 的 Auto Mode 设为默认,引发了对 Agent 权限设计的重新思考。当人工审批退化为条件反射,系统自动判断能否真正保障安全?本文从产品经理视角,探讨权限分级、风险控制与人工介入的平衡,为 Agent 产品设计提供新思路。

最近,Anthropic 宣布了一项变化:

从 8 月 14 日开始,Claude Code 的 Pro、Max 和 Team 计划,新会话默认启用 Auto Mode。

简单说,以后 Claude Code 不会在每一次工具调用前都弹出确认框,而是先通过分类器判断这个操作有没有破坏性、不可逆,或者是否试图访问当前环境之外的资源。

很多人看到这个消息,第一反应可能是:Agent 终于可以少打扰用户了。

我的第一反应是:以后谁来替我判断它该不该执行?

作为曾经的max用户,狠狠不能忘记被封号的惨痛,虽然现在也不怎么能用上了。

但是

这个问题很重要。因为 Agent 真正影响效率的地方,往往不是它能不能写代码,而是它什么时候停下来问你,什么时候直接往下做。

我使用过 Claude Code、Codex,也使用过国产的 Workbuddy。我的感受是,这几个工具真正拉开体验差距的,不只是模型能力,而是权限设计。

权限太松,用户会担心它失控。

权限太紧,用户又会觉得自己只是雇了一个不断提问的实习生。

Anthropic 这次把 Auto Mode 设为默认,实际上是在回答一个产品问题:

Agent 到底应该把多少决定权交给系统,多少决定权留给人?

一、人工审批看起来安全,但可能只是让人不断点击

Agent 产品早期普遍采用一种比较保守的设计:

每当 Agent 准备执行命令,就弹出提示,让用户确认。

这个逻辑很容易理解。系统把最终决定权交给用户,用户也能知道 Agent 准备做什么。

但问题是,确认次数一多,用户未必真的还在认真判断。就比较容易出现。

框框一顿允许操作过后

Anthropic 在官方公告中提到,Claude Code 用户会批准约 97% 的权限提示。这是 Anthropic 对自身产品使用情况的分析,不代表所有用户都会如此,但它说明了一个很现实的问题:

如果每天出现几十次甚至上百次确认,人工审批很可能会退化成条件反射。用户看到弹窗,第一反应不是分析命令会影响什么,而是赶紧点“允许”,让任务继续跑下去。

Anthropic 还公布了一项由 1053 名付费测试者参加的受控实验。在这个实验环境里,人工审批捕获了 13.6% 的危险命令,Auto Mode 捕获了 89%。

这个结果不能简单理解成“机器比人类更安全”。实验环境、参与者状态和危险命令的设计,都会影响结果。

但这个结果至少提醒产品经理重新思考一件事:

让用户每次点击确认,不等于用户每次都真正参与了安全判断。

这就像很多网站的隐私弹窗。第一次出现时,用户可能会认真阅读。看到几十次之后,绝大多数人只想赶紧关掉。

Agent 的权限弹窗也一样。

如果产品把所有安全责任都推给用户,最后可能出现一种很尴尬的结果:系统看起来保留了人工控制,实际上用户只是成了一个不断点击“同意”的按钮。

二、Auto Mode 解决了打扰,但没有解决所有安全问题

Auto Mode 的思路,是把“每一步都问人”改成“系统先判断,必要时再问人”。

按照 Anthropic 的介绍,Auto Mode 会让工具调用先经过分类器,重点拦截不可逆、破坏性,或者指向用户环境之外的操作。

如果系统连续三次拦截,或者一段会话里累计拦截二十次,Claude Code 会退回人工审批模式。

这个设计比单纯取消弹窗要成熟一些,因为它至少保留了几个环节:

  • 系统先做风险判断;
  • 高风险操作先被阻止;
  • Agent 可以尝试更安全的替代方案;
  • 多次无法判断时,再把问题交给用户。

但我不认为 Auto Mode 可以被理解为“安全问题已经解决”。

分类器也会误判。

它可能拦截一个本来安全的命令,也可能放过一个单独看起来没问题,但组合起来风险很高的动作。

比如,读取一个网页看起来没有问题,写入一个临时文件也没有问题,访问一个外部服务也可能没有问题。但这几个动作连续起来,结果可能就完全不同。

这也是 Agent 和普通软件功能最大的区别之一:

很多风险不在单个动作里,而在一连串动作之间。

Boris Cherny 在 X 上表示,结合模型训练、输入探针和意图分类器,多层防护可以把未见过的间接提示注入攻击成功率降到接近 0。

这是 Anthropic 员工的一手观点,应该按照他引用的测试条件理解,不能直接扩展成“提示注入已经被彻底解决”。

产品经理真正要关心的,不是某个分类器的数字有多漂亮,而是:

如果分类器判断错了,系统会造成多大损失?

三、我使用这些 Agent 后,最明显的感受不是模型变强,而是权限越来越重要

我使用 Claude Code、Codex 和 Workbuddy 的时候,感受到一个变化:

早期大家更在意模型能不能写出代码、能不能理解需求、能不能处理复杂任务。

现在大家越来越在意另外一个问题:

它能不能在正确的边界里工作?

因为 Agent 一旦可以调用工具,产品问题就不再只是“回答质量”。

它可能修改文件、运行命令、提交代码、访问网页、调用接口。模型能力越强,能完成的事情越多,权限设计的重要性也越高。

我现在的判断是,低风险任务可以自动化,高风险任务必须分级授权,并保留人工介入。

比如下面这些任务,我认为可以更多交给 Agent:

  • 查询资料;
  • 总结文档;
  • 生成方案;
  • 修改本地文件;
  • 运行测试;
  • 整理代码结构;
  • 生成一个可以随时撤销的提交。

但下面这些任务,至少在目前阶段,不能只依靠自动模式:

  • 修改生产数据库;
  • 删除重要数据;
  • 创建外部账号;
  • 发送客户邮件;
  • 修改线上权限;
  • 处理资金和合同;
  • 将代码直接发布到生产环境。

这里的判断标准,不是模型聪不聪明,而是这个动作出了问题以后,能不能恢复。

一个错误的本地文件修改,通常可以撤销。

一次错误的生产数据删除,可能就不是重新运行一次命令那么简单了。

四、产品经理不要只设计“允许”或“禁止”

很多产品的权限设计只有两个选项:

允许,或者禁止。

但 Agent 的实际工作不适合这么粗糙。

更合理的做法,是按照风险把操作分成几档。

第一档,低风险任务,默认自动执行。

比如查询、总结、生成草稿。这类任务通常是只读的,影响范围有限,也容易重新生成。

第二档,可撤销任务,自动执行但保留记录。

比如修改本地代码、生成测试文件、整理目录。这类任务可以让 Agent 直接完成,但必须保留操作日志,让用户知道它改了什么。

第三档,影响外部系统的任务,需要二次确认。

比如提交代码、发送消息、修改共享文档。这些任务已经超出本地环境,最好让用户在执行前看到影响范围。

第四档,不可逆或高影响任务,默认禁止自动执行。

比如删除生产数据、创建账号、修改权限、处理资金。这些动作不能只靠一个分类器判断,也不能只靠用户习惯性点击。

PM 启示:权限不是越开放越好,也不是越严格越好。权限设计的目标,是让低风险工作尽量顺畅,让高风险工作必须留下足够的判断和责任链。

五、未来模型可能比人类更适合判断风险吗?

我的答案是:有可能。

甚至我觉得,未来某些场景下,模型的安全判断可能真的会比普通人处理得更好。

原因并不复杂。

人类会疲劳,会分心,也会因为赶时间而忽略提示。一个经过长期训练的模型,可以持续检查大量操作,记住完整上下文,并且按照同一套规则判断风险。

如果模型能够理解任务目标、当前环境、操作对象、历史行为和潜在后果,那么它当然可能比用户随手点击“允许”更稳定。

但这里有一个区别:

模型可以比人类更擅长判断风险,不代表它就应该拥有全部权限。

安全判断和最终授权不是一回事。

模型可以说:“这个动作风险很高。”

但企业是否允许它执行,还涉及客户责任、业务损失、法律后果和组织规则。这些事情不能只看模型的准确率。

所以我认为,未来人工不会完全退出,但人工的角色会变。

现在的人可能是每一步都点确认。

以后的人,更可能负责三件事:

  • 制定 Agent 可以做什么;
  • 规定什么情况必须升级;
  • 在系统异常时停止和恢复。

也就是说,人工不再盯着每一条命令,但仍然需要对权限边界负责。

六、Agent 产品最后拼的不是“能做什么”,而是“出错后怎么办”

如果团队准备使用 Agent,我建议不要一开始就给它最高权限。

可以先从只读任务开始,再进入隔离的测试环境,最后才考虑有限度地接入生产系统。

每增加一种权限,都要先回答三个问题:

  1. 这个动作最坏会造成什么后果?
  2. 出错之后能不能快速恢复?
  3. 谁能看到异常,并在第一时间停止它?

如果这三个问题都没有答案,就不应该急着让 Agent 自动执行。

OpenAI 最近将 Astra 列为首个“关键”网络安全能力模型,也说明模型能力和安全控制已经越来越难分开讨论。

模型变强以后,产品经理不能只问:

“这个 Agent 能不能完成任务?”

还要继续问:

“它凭什么权限完成任务?”

“它能不能通过其他路径绕过限制?”

“出了问题以后,谁来负责?”

我目前仍然坚持一个比较保守的判断:

低风险任务可以自动化,高风险任务必须分级授权和保留人工介入。

但我也不排除另一种可能。

当模型能力真正达到一定程度后,它在很多具体的风险判断上,可能会比我们人类处理得更好。

到那个时候,人工审批不会消失,但它不应该再是产品安全的第一道防线。真正的第一道防线,应该是清晰的权限规则、可靠的运行时判断,以及出错之后能迅速停止和恢复的机制。

资料与说明:本文参考了 Anthropic 关于 Claude Code Auto Mode 的官方公告、Boris Cherny 的 X 帖子,以及 OpenAI 关于 Astra 网络安全能力的官方公告。文中 Anthropic 公布的测试数据按厂商口径表述;关于分级授权和未来 Agent 能力的判断,属于作者个人观点。

来源:

Anthropic:Auto mode is now the default in Claude Code

Boris Cherny X 原帖

OpenAI:Responding to the next frontier of critical cyber capabilities

OpenAI:Hugging Face security incident

本文由 @十二 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 自动判断能减少打扰是好事,但有些操作单独看确实安全,组合起来风险就变了。分类器理解不了任务全貌时,退回人工审批反而是更保守的兜底。

    来自广东 回复