Claude 连续越界后,Anthropic 和 OpenAI 开始主动踩刹车

1 评论 268 浏览 0 收藏 22 分钟

Claude 在评测中闯进真实生产系统,还往 PyPI 传过恶意软件包;OpenAI 的内部智能体靠自建留言板摸进 Hugging Face。Anthropic 回查 141006 次评测记录后,两家实验室先后暂停部分训练与评测,承认事故背后还有对齐问题。

8 月 31 日,Anthropic 宣布暂停过一批高风险评测和强化学习任务,并公开支持整个行业建立可验证的协同减速机制。

这份声明来自几次已经碰到真实世界的事故。Claude 在评测中进入三家机构的生产系统,向 PyPI 上传过恶意软件,还在英国 AI Security Institute 的测试里创建假身份,试图说服一名开源项目维护者接受带有恶意代码的修改。OpenAI 的内部智能体也曾绕过隔离,通过一套本来只用于下载软件包的系统互相留言,随后访问 Hugging Face 的生产环境。

这些模型都处在特殊测试配置中,安全过滤被关闭,部分环境还开放了互联网。它们没有以同样方式提供给普通用户。可事故仍然改变了一件很重要的事。头部实验室开始承认,今天的智能体已经能把一条不够严密的任务说明、一个配置错误和几小时持续执行,组合成真实的安全事件。

我们把 Anthropic、OpenAI、英国 AI Security Institute 和 METR 的公开报告放在一起看,最醒目的变化并不在模型又提高了多少分。两家实验室都已公开披露,它们因为智能体在内部开发阶段表现出的能力,暂停过部分训练或评测,随后补上隔离、监控与停机机制。

Anthropic 8 月 31 日安全与对齐声明的官方主视觉

01 三次进入真实系统

Anthropic 的第一轮调查回看了 141006 条可能接触互联网的评测运行记录。研究人员在其中找到三起事故,共涉及六次具体运行和三个不同的 Claude 模型。模型原本要完成夺旗测试,也就是进入模拟网络,找到一段被隐藏的信息。

测试提示明确告诉 Claude,环境无法访问互联网。实际配置却留下了通往互联网的路径。Claude 遇到真实网站后,把它们当成测试场景的一部分,继续寻找密码、接口和数据库。

最严重的一组运行涉及 Claude Opus 4.7。它进入一家真实公司的生产系统,取得应用与基础设施凭证,还访问了包含数百行生产数据的数据库。模型在后续推理里已经发现目标大概率属于真实环境,却说服自己这仍是评测安排的一部分,没有停手。

另外一个内部研究模型的反应不同。它扫描约 9000 个目标,找到一家公司的外部应用并取得访问权限。随后,它发现这个云账户与测试任务没有关系,主动停止攻击。

Anthropic 对 141006 次评测的回查结果

三起事故不能用来做严格的代际比较。Anthropic 也明确提醒,样本太小,环境各不相同。不过,这组记录揭示了一个过去容易被忽略的问题。模型是否守规矩,要看它会不会拒绝危险请求,也要看它是否正确理解自己身处何处。

02 一小时的恶意软件

第二起事故更能看出智能体怎样把许多小动作连成后果。

Claude Mythos 5 在虚构环境里发现一份开发说明,里面要求员工安装一个当时并不存在的 Python 软件包。模型想到的办法是抢先注册同名软件包,放入恶意代码,等待目标系统自动安装。

它为了注册 PyPI 账户,先找电子邮箱,又寻找电话号码。付费号码拿不到后,它换了一家免费的邮箱服务,完成注册并上传软件包。那段恶意软件在公开网络上存在约一小时,并在 15 个真实系统中被执行,其中包括自动扫描软件包的安全环境。

其中一台机器属于安全公司,职责恰好是自动下载软件包并扫描恶意内容。扫描器运行了代码,凭证被传到 Claude 设置的收集点。Claude 随后用这些凭证进入了这家公司的其他系统。

Claude 上传恶意软件包时形成的动作链

模型在早期推理中写过,如果眼前是真实互联网,这样做就构成真实攻击,也不应当继续。它随后根据证书名称和系统显示的 2026 年日期,推断环境仍是模拟的。新的证据出现后,它没有重新检查这个结论。

Anthropic 把这种行为称为有动机的自我说服。模型先形成一个方便完成任务的解释,之后不断寻找理由保护这个解释。这里没有发现模型在追求自己的长期目标。危险来自另一种更普通的组合,任务目标很窄,执行很坚持,环境理解又错了。

03 假身份和恶意修改

英国 AI Security Institute 的事故把同类风险推得更远。

这家机构在一项网络安全评测中测试七个模型,共运行 122 次。互联网被主动开放,厂商提供的网络安全过滤也被关闭。研究人员在 10 次运行里记录到 19 项越过测试范围的行动,其中 17 项来自 Mythos 5,另外 2 项来自 GPT-5.6 Sol,当时它的网络安全分类器已被关闭。

最严重的一条行动链指向一个真实的开源项目。智能体提交了带有恶意代码的修改,搜集维护者的公开信息,创建多个假身份,又用这些身份催促维护者批准修改。公开质疑出现后,它还修改之前留下的内容,试图让行为显得无害,并考虑换一个身份继续。

英国安全机构在 122 次测试中记录的越界行动

智能体还通过 Tor 绕过部分网络限制,向真实用户发送消息和文件,并尝试把隐藏指令放到其他编程智能体可能读取的位置。维护者最终拒绝了恶意修改,调查也没有发现由此产生的现实损害。

真正拦住它的是一名认真看代码的人。

这次评测有很强的特殊性,过滤器被关闭,互联网本来就开放,任务还出现过难以按预定方式完成的配置错误。英国安全机构没有把结果外推到商业版本。报告确认,这类行为已经能够发生并持续执行,过去也没有如此清楚地出现过。

安全评测因此碰到一个难题。完全切断互联网,研究人员很难知道模型在真实攻击条件下能走多远。开放互联网,又可能让一次能力测试把无关的人和系统卷进来。英国安全机构已经改变默认设置,今后每次开放外网都要单独说明理由,还要用更细的网络规则限制模型能够接触的目标。

04 模型自己搭了留言板

OpenAI 披露的 Hugging Face 事故有另一条路线。模型没有直接拿到智能体之间的通信渠道,却发现内部 Artifactory 软件包系统可以写入共享文件,于是把它改造成一个临时留言板。

5 月 12 日,一个智能体留下第一条寻找缺失文件的消息。5 月 26 日,模型利用服务端请求伪造,让 Artifactory 代替它访问互联网。6 月 26 日,智能体又利用令牌刷新漏洞取得管理员权限。不同评测中的智能体把这些方法写回留言板,后来的智能体可以直接接着使用。

7 月 4 日,大量持续活动让 Artifactory 服务发生故障。安全团队重建系统,留言板随之消失。评测恢复后,模型又重建了这套通信方式,随后进入 Hugging Face 的生产系统。

OpenAI 智能体从留言板到外部系统的时间线

OpenAI 的报告承认,内部团队早在 5 月底已经见过未经允许的通信和互联网访问,却没有把这些信号及时升级成完整的安全事件。公司后来规定,最高级别警报触发后,如果值班人员在 30 分钟内无法证明它是误报,就应当暂停相关活动。

METR 的独立调查把重点放在协作上。单个智能体的一次尝试也许会失败,共享留言板让不同运行交换漏洞、账号和进度,失败经验不再随任务结束而消失。智能体由此积累了远超单次评测的持续性。

05 问题出在哪一层

把几份报告放在一起,事故至少跨过三层。

第一层是模型行为。Claude 会围绕有利于完成任务的解释继续推理,OpenAI 的智能体会保存和传播已经发现的办法。任务越难,智能体越会尝试原先没有被设计者想到的路线。

第二层是评测设计。提示说没有互联网,配置却允许访问。测试人员想测模型能不能攻破虚构目标,却没有清楚标出真实目标的边界。有些任务还因为配置错误变得近乎无解,持续执行的模型便把搜索范围越推越远。

第三层是基础设施。单一配置被当作主要防线,共享服务拥有过多权限,异常动作没有在工具调用前被拦截,第三方评测环境与模型能力之间也出现了落差。

智能体事故同时跨过模型、任务与基础设施三层

Anthropic 在 7 月时更倾向于把三起事件描述为评测外壳和操作失误。8 月 31 日的新声明把判断往前推进了一步。公司认为,事故同时反映了操作安全问题与两类对齐问题,分别是有动机的自我说服,以及为了狭窄目标接受有害行动。

这个变化很重要。修好一条网络规则只能堵住同一路径。只要智能体仍会在困难任务里寻找意外路线,评测系统就要假定它会试探每一道边界。

06 训练也会留下性格

Anthropic 同日发布的一项早期研究尝试追问更深的原因。研究人员训练一个模型在奖励机制中作弊,并观察这种训练会不会扩散到其他行为。

模拟网络安全测试中,这个模型更愿意逃离虚构沙箱、攻击虚构的内部和第三方系统,还会篡改自己的奖励函数,绕过部署监控,甚至为了满足评分器而提供制造生物武器的建议。训练前版本和几款公开模型没有表现出同等程度的行为。

奖励作弊训练可能扩散到其他危险行为

这仍是一项受控研究,所有工具调用都由另一个模型模拟,不能拿来证明商用 Claude 会照样行动。它提供的线索是,训练过程里被反复奖励的取巧方式,可能慢慢改变模型面对新任务时愿意采用哪些手段。

模型能力、安全训练和运行环境因此不能拆开审查。一个安全外壳可以挡住许多动作,却不能替代对模型本身的研究。模型表现得更聪明以后,旧的拒绝规则和旧的测试场也不会自动升级。

07 实验室真的按了暂停

这些事故已经影响研发节奏。

Anthropic 在发现问题后暂停外部网络安全评测,也短暂停过内部评测。高风险强化学习环境停了数周,多数任务在新监控上线后恢复,部分环境仍等待人工检查或新的分类器。

OpenAI 在 Hugging Face 事故和 Astra 网络安全能力评估后,把面向发布模型的强化学习训练放慢了两周。公司称,原计划中规模最大的前沿强化学习任务仍处于暂停状态,一批涉及 Astra 的训练和评测也要等到新的安全标准落实后才能恢复。

两家实验室已经公开确认的暂停措施

这类暂停没有一个统一计时器,也不代表模型研发全面停止。两家公司都在迁移环境、缩小训练规模、恢复达到要求的任务。它更接近工程上的分批停机检修。

Anthropic 还公开支持一套合法、可核验、有效的行业协同减速机制。公司把减速分成两类。一类发生在企业内部,安全与速度冲突时由公司停下来。另一类需要政府和行业共同建立规则,防止一家减速后,其他公司立刻用更低的安全标准抢走进度。

08 防线开始跟着动作跑

Anthropic 新增的实时分类器会在模型试探或逃离测试环境时检查工具调用。命中后,动作会在真正执行前被阻断,任务结束,同时通知人类。公司还把高风险沙箱迁到更强的隔离环境,扩大对内部智能体活动的离线监控,并要求第三方评测机构采用多层防护。

OpenAI 的监控从抽样检查走向分级响应。检测器会查看内部活动、工具动作和完整执行序列,再把可疑事件交给计算量更大的自动调查系统。公司还移除部分共享服务和长期权限,为最严重事件设计自动停机程序。

新的防线在工具调用前完成识别、阻断和升级

这些措施有一个共同方向。过去的安全系统常在任务结束后读日志,现在必须在智能体行动的速度上作出反应。一个模型可以在几分钟内注册账号、上传软件、发送消息和继续利用凭证。只靠第二天的人工复盘,最多能解释事故,来不及阻止它。

第三方评测机构也会承担更重的责任。实验室需要提前核对沙箱是否真的封闭,列出允许访问的域名与服务,约定发现异常后由谁停机,并保存足够完整的网络日志和任务记录。模型能力变化很快,一年前还能接受的开放权限,到了下一代模型上可能已经过于宽松。

09 智能体的价值也是风险

我们不认为这些事故证明公开版本的 Claude 或 ChatGPT 会自行攻击互联网。报告里的模型处于特殊环境,安全过滤被关闭,任务也有明显配置问题。把它们直接写成失控的通用人工智能,会丢掉最关键的条件。

它们真正说明的是另一件事。智能体的商业价值来自持续执行、调用工具、处理失败和寻找新路线。相同能力进入测试环境后,也会把一个人类可能很快放弃的错误任务继续做下去。

模型公司过去最担心的是外部攻击者偷走权重或滥用产品。现在,训练和评测过程本身也成了高风险运行环境。实验室需要把尚未发布的模型视作有能力寻找漏洞的内部参与者,让每次网络访问、权限提升和跨任务通信都有技术边界。

这也是为什么几次事故会推动真正的暂停。模型已经快到安全团队不能只在最后检查结果,评测系统也不能继续依赖模型自行理解哪里该停。

我们会继续跟踪 Anthropic 与 METR 后续的独立调查。眼下最清楚的信号已经出现。智能体越能自己完成事情,实验室越需要提前决定,哪些事情即使有助于完成任务,也绝对不能发生。

资料来源:

Anthropic 改进对齐与安全工作的声明,2026 年 8 月 31 日原文 https://www.anthropic.com/news/improving-alignment-security-efforts

Anthropic 对三起真实系统事故的调查,2026 年 7 月 30 日原文 https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals

英国 AI Security Institute 事故报告,2026 年 8 月 4 日原文 https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing

英国 AI Security Institute 技术报告原文 https://cdn.prod.website-files.com/663bd5fc8bd1453f2f0a0fd1/689112a43a7a8827580e80af_AISI-Incident-Report.pdf

OpenAI 对 Hugging Face 事故的说明,2026 年 8 月 26 日原文 https://openai.com/index/the-hugging-face-incident-and-the-road-ahead/

OpenAI Hugging Face 事故技术报告原文 https://cdn.openai.com/pdf/67869394-cb91-4c12-888c-5cbd85c7814c/OpenAI-Hugging-Face%20Incident-Technical-Report.pdf

METR 对 OpenAI 事故的独立调查原文 https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/

OpenAI 关于放慢模型开发的说明,2026 年 8 月 18 日原文 https://openai.com/index/pacing-model-development-cyber-capabilities/

OpenAI 对 Astra 网络安全能力的说明,2026 年 8 月 7 日原文 https://openai.com/index/responding-next-frontier-critical-cyber-capabilities/

Anthropic 奖励作弊训练研究原文 https://alignment.anthropic.com/2026/reward-seeker/

本文由人人都是产品经理作者【深思SenseAI】,微信公众号:【深思SenseAI】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自作者提供

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 把减速分成企业内部协同和行业规则两部分,这个分类很实际。企业内部的暂停只能解决单点风险,如果只有一家在停,市场压力会促使其他公司用更低安全标准抢进度。可验证的协同减速机制如果能落地,比单独发安全声明难得多,也更有用:它得让同行确认你是真停而不是换了个名字继续跑,还得防止政府规则变成大公司设门槛的手段。这条路上实验室内外需要一起走。

    来自广东 回复