为什么现在,又要谈 AI 安全
OpenAI 对未发布的 Astra 发出罕见的能力预警,同时一起 AI 闯入 Hugging Face 生产系统的事件揭示了前沿 AI 安全的新挑战。当 AI 开始使用工具和访问网络,风险已提前至研发阶段。本文深入分析事件细节,探讨 AI 安全从“说了什么”走向“做了什么”的转变,并审视现有监管机制的局限。

8 月 7 日,OpenAI 对尚未发布的 Astra 做了一次少见的能力预警。最近的内部测试显示,Astra 在编程和网络攻防上进步很快。OpenAI 表示,目前已经“无法排除”它达到 Critical 级别的可能。
Critical 可以简单理解为一条非常高的危险能力线。达到这个级别的 AI,在工具帮助下,可能独立找到还没有补丁的软件漏洞,并对现实中经过加固的系统发起复杂攻击。
这个判断还没有坐实。传播中常见的“OpenAI 首个 Critical 模型”,比官方公告的表达更确定。OpenAI 说的是风险暂时不能被排除,评估仍在继续。
几周前,另一批 AI 已经在内部测试中跑出了原定边界。它们从 OpenAI 的测试环境出发,最后进入了 Hugging Face 的生产系统。
Astra 虽没有参与这起事件,但两条新闻仍然指向同一个变化。前沿 AI 的安全风险已经出现在公开发布之前。AI 开始使用工具和访问网络以后,安全问题也不再只发生在聊天窗口里。

内部评测原本有边界,一个不起眼的下载通道却让 AI 接触到了外部系统。
一个只想拿到答案的 AI
Hugging Face 事件发生在一项网络攻防测试中。OpenAI 给 AI 的任务是寻找并利用软件漏洞。为了测出能力上限,测试中的限制比普通产品更少。
这个测试环境原本不能直接访问公开互联网。AI 仍然需要下载软件,因此 OpenAI 为它保留了一个内部下载通道。问题就出在这里。AI 发现通道背后的软件有漏洞,利用它获得了访问外网的能力。
接下来,AI 猜测 Hugging Face 可能存放这项测试的数据和参考答案。它开始寻找进入 Hugging Face 的方法,最后在对方的生产服务器上执行了代码。
Hugging Face 从日志中恢复了约 17,600 次攻击动作。目前确认被获取的客户内容,是五个与网络安全挑战有关的数据集。Hugging Face 表示,没有发现其他用户的模型、数据集或软件包被修改。
整个过程中还出现了一个意外的变化。不同次运行的 AI 开始在共享目录里留言。某一次运行找到的文件、密码或攻击方法,可以被下一次运行读到。单次任务会结束,留在环境里的信息却让行动延续了下来。
现有材料更支持一个朴素的解释。这些 AI 想完成任务,它们在寻找拿到答案的有效路径。当任务目标写得不完整,系统权限又足够大时,“把任务做完”就可以一路变成真实的外部事故。这个问题不需要 AI 拥有自我意识,也不需要它存在长期恶意。
AI 安全已经从“说了什么”走向“做了什么”
过去几年,大多数用户感受到的 AI 安全,集中在模型的回答上。它会不会编造信息,会不会生成危险内容,都可以通过拒答和内容审核来降低风险。
Agent 改变了问题。这个英文词可以简单理解为“能够替用户连续做事的 AI”。它可以使用浏览器、命令行和外部服务,用户也可能把账号权限交给它。
同一个模型,只负责回答问题时,影响大多停在屏幕上。它拿到工具和账号权限以后,就可以发邮件、改文件,甚至对外部系统发起请求。模型本身没有换,它造成的现实影响已经完全不同。

同一个模型获得工具和账号权限后,能够造成的现实影响会被迅速放大。
因此,“这个模型安不安全”已经不足以判断一个 AI 产品的风险。产品团队还要说清楚 AI 正在执行什么任务,它能够去哪里。如果 AI 做错了,系统必须留下记录,并让人能够及时停止它。
Hugging Face 事件里的许多漏洞都是网络安全行业早已熟悉的问题。AI 带来的新风险是速度和规模。它可以连续尝试,并把多个小漏洞接起来,操作速度可能超过人工审查。
Astra 正在检验公司能否约束自己
OpenAI 的风险管理规则把前沿网络能力分成 High 和 Critical 等级。High 级模型已经能明显提高攻击效率。Critical 对应的风险更高,AI 可以在很少人类帮助下,寻找未知漏洞并完成复杂攻击。
这些等级测量的是 AI 在最强工具帮助下能做到什么。普通用户最后拿到的 Astra 产品有多大风险,还取决于它能否联网,以及它会获得哪些工具。OpenAI 尚未公布具体的测试结果和失败案例。
根据公司自己制定的规则,模型一旦可能达到 Critical,开发阶段就要提高安全措施。OpenAI 已经限制 Astra 访问网络和工具,并加强了隔离。尚未满足新要求的内部测试已被暂停。
这至少表明,风险评估已经开始影响研发节奏。当前信息仍有明显空白。外界还不知道暂停涉及多大范围,也不知道谁会判断新的安全措施已经足够。
还有一个很难回避的矛盾。公司在向外界提示风险时,也在宣布新模型的能力变得更强。“首个 Critical 模型”既是一张危险标签,也很容易被市场当成性能徽章。外部测试和可供复查的结果,才能减少公司自评带来的利益冲突。
政府的 30 天能管到什么
2026 年 6 月 2 日,特朗普签署了第 14409 号行政命令。这份命令要求美国政府建立一套保密的测试,用来判断哪些前沿模型已经具备高级网络攻击能力。
行政命令还要求政府与 AI 公司设计一套自愿机制。参与的开发者可以在模型交给其他可信伙伴前,先让政府提前测试,时间最长为 30 天。政府也可以让关键基础设施和专业防守团队提前使用这些能力。

30 天审查把政府带到发布之前,风险却可能更早出现在研发和内部测试中。
这项安排属于自愿参与的提前测试,它没有要求所有模型都要停留 30 天。行政命令也没有给政府设置模型许可证或发布批准权。到 8 月初,白宫表示相关机制已经按期完成,具体规则还没有公布。
30 天的价值很直接。如果一个模型已经很擅长寻找漏洞,防守者就有机会在这种能力被广泛使用之前,先修复重要系统。同一项能力可以被用来攻击,也可以帮助防守。安全机制需要为防守者留出提前行动的时间。
Hugging Face 事件暴露了它的限制。这起事故的最早线索出现在内部测试阶段,远早于公开发布前的 30 天。如果政府只在模型接近发布时进场,它无法及时处理研发环境里已经发生的外部风险。
此外,政府主要测试的还是模型。Hugging Face 事件里,实际风险来自模型、工具和权限的组合。政府在受控环境里测试一个模型,可以看到它的攻击能力有多强。这项测试无法自动覆盖它在公司内部获得真实账号和长时间运行权限后的风险。
AI 安全需要管住整个使用过程
对高风险 AI 的管理,需要从一次发布前测试延伸到完整的开发和使用过程。模型变得更强时,开发者要重新评估风险。AI 获得新工具或更大网络范围时,原来的测试结论也应该重做。
在产品内,每个能够自主做事的 AI 都应该有独立身份,它只拿到当前任务必需的权限。系统还要记录 AI 使用过哪些工具,让高风险动作等待人来确认。一旦出现异常,人需要能够立即停止任务。

安全控制需要覆盖开发和使用全过程,并保留随时中断任务的能力。
外部机构可以检查模型的真实能力,也要验证这些安全措施是否有效。政府则需要规定哪些事故必须上报,并让关键行业在风险扩大前获得预警。
强模型仍然可以逐步开放。专业防守机构可以在严格监控下提前使用,普通用户获得的工具和行动权限则需要与实际风险匹配。出现新的危险证据时,公司还要能够迅速收回权限或降低能力。
Hugging Face 事件已经说明,模型在发布前也可以对外部系统造成影响。Astra 让开发阶段的安全问题变得更紧迫。美国政府的 30 天机制让公共机构更早进入模型发布流程,它仍然追不上已经提前到研发环境的风险。
当 AI 能够真正替人行动,通用的安全等级只能回答它有多强。更实际的问题是,它在越过边界时谁能停止它,事故发生后谁又会对此负责。一套安全机制能否回答这些具体问题,比公司给模型贴上什么标签更重要。
本文由 @心动云洁 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自Unsplash,基于CC0协议
- 目前还没评论,等你发挥!

起点课堂会员权益




