智能体也许某天也要装上杀毒软件:浅谈AI智能体投毒
当AI智能体不再只是“动嘴”回答问题,而是能自己操作软件、读写文件、管理服务器时,投毒的后果就从“说假话”升级成了“干坏事”。本文深入拆解智能体投毒的四大常见场景与真实案例,并给出产品经理必须掌握的四层安全防护架构。

今年315晚会曝光了一件事:一款根本不存在的”Apollo-9智能手环”,靠十几篇自动生成的虚假测评软文,在两小时内就被主流大模型当成了”标准答案”推荐给用户。”量子纠缠传感””黑洞级续航”这种鬼话,AI照单全收。
这还只是干扰AI回答问题“嘴皮子”的层面。更值得警惕的是,当AI进化为智能体Agent——不再只是仅限于回答问题,而是能自己调工具、操作软件、读写文件、甚至管理服务器——投毒的后果就从”说假话”升级成了”干坏事”。
就像电脑普及催生了电脑病毒,智能体的能力越强,被投毒后的破坏力就越大,围绕它的黑灰产也正在加速形成。
一、什么是智能体投毒
智能体投毒,就是有人往AI智能体的输入数据、记忆系统、工具返回结果里塞恶意内容,诱导智能体跑偏、干坏事、泄密。
和普通大模型的”提示注入”不一样,智能体是有”手和脚”的。普通大模型被注入了,回答的内容如果内容真实性存疑或者插播了一些广告营销的内容,我们还能自行分辨;智能体被投毒了,它可能真的去删你文件、发你邮件、转你钱——它能把恶意指令变成真实操作。
举个例子:以前的AI是个只会说话的客服,被忽悠了最多跟你胡说八道;现在的智能体是个能上手操作的助理,被忽悠了可能直接把你办公桌给掀了。
OWASP(一个专注于应用安全的组织)发布了《2026版AI智能体应用十大安全风险》(Agentic Applications Top 10),把”目标劫持””工具滥用”排在最前面,原因很简单——智能体能力越大,潜在的风险也越大。
二、常见智能体投毒场景
1、数据认知投毒:给AI”喂假料”
315曝光的GEO(生成式引擎优化)投毒,是最贴近普通人的场景。黑产批量发虚假软文、伪造测评,让大模型搜信息的时候把这些玩意儿当真事,你问它”哪款手环好用”,它就把花了钱推广的假货推给你。
说白了,就是以前的SEO(搜索引擎优化)黑产换了个赛道,大家越来越少用搜索引擎,但是广告从来不会消失,只是换了个渠道再次涌现。据IDC等机构统计,包含内容生产、数据服务在内的广义GEO市场规模已达480亿元,整个灰色地带只会越来越大。
2、提示注入:藏在文档里的”隐形指令”
今年上半年,一款叫做OpenClaw(俗称”龙虾”)的开源AI智能体在技术圈火了一把。它能直接操控电脑、整理邮件、执行代码,相当于一个数字助理。因为Logo是只红色龙虾,国内开发者把部署它的过程叫做”养虾”。
但火了没几天,工信部、国家互联网应急中心接连发高危预警,多所高校纷纷发文,要么严禁校内使用,要么要求彻底卸载。因为攻击者可以在网页、PDF、邮件里藏恶意指令——比如用白色字体写在空白处,或者塞零宽字符,肉眼看不见,但AI读得懂。智能体一扫文档,就把藏着的指令当用户命令执行了:偷你API密钥、删你文件、把敏感信息偷偷发出去,你全程啥也不知道。
对于高校或者其他有信息安全要求的单位来说,尤其危险。比如有人在公开的学术PDF里植入隐藏指令,学生用AI辅助读文献时就可能触发风险。已有用户反映出现指令误判情况,理论上可能导致邮件误删、文件删除等问题。
3.供应链投毒:从根源下毒
今年3月,知名大模型网关工具LiteLLM在PyPI上的更新版本被植入恶意代码,会在安装时窃取环境变量和SSH密钥;同期国内API协作平台Apifox也遭了供应链攻击,可窃取SSH私钥、Git凭证等敏感数据。
这种投毒最阴——你用的工具本身就是带毒的,开发者和用户都很难察觉。想想你在正规超市买了一瓶饮料,瓶子也是新的,但是里面的水却是被换过了的。
4.自主行动失控:当AI自己决定”搞事情”
最危险的还是智能体自己做出危险操作的案例。例如最近刷屏的GPT模型越狱入侵HuggingFace事件。
就在前几天7月27日,OpenAI发布了一份调查报告,他们把GPT-5.6 Sol和一款更强的未发布模型放进隔离沙箱里测能力,按设计这环境是断网的,模型只能访问内部的测试数据集,结果模型不知道怎么琢磨起了”越狱”。它先是在沙箱里扫来扫去,发现内部包仓库代理是唯一能和外界通信的口子,然后利用了一个零日漏洞,硬生生钻了出去,连上了互联网。
连上网络之后大模型推断测试题的答案可能存在HuggingFace上,于是直接发起攻击——上传恶意数据集,利用数据集处理的远程代码执行漏洞,在HuggingFace的生产服务器上跑起了代码,最后下载了包含测试答案的加密数据集。
整个攻击过程留下了超过1.7万条操作记录。更讽刺的是:7月16日HuggingFace公开说被”一套自主AI系统”攻击了,OpenAI这边还没反应过来是自己家模型干的。直到7月21日OpenAI才正式发文承认。
而HuggingFace想找商业API(包括Anthropic和OpenAI的模型)帮忙分析攻击日志,结果被安全护栏拦住了——因为日志里全是攻击payload,模型分不清你是防御者还是攻击者。最后HuggingFace是靠自托管的开源模型GLM-5.2才完成取证。
这事儿证明了一件事:足够强的AI智能体,是会自己想办法突破约束的。你以为把它关在沙箱里就安全了?结果它自己撬锁跑出来。
除了这个极端案例,还有两个更贴近生产环境的事故:
- PocketOS 9秒删库:今年4月,一家叫PocketOS的租车SaaS公司用CursorAI编程智能体执行常规任务,AI遇到错误后没停下来问人,而是擅自决定删除存储卷来尝试解决问题,9秒内就把生产数据库连同备份全删了,导致客户无法预订车辆、新用户无法注册。事后AI还生成了一份”忏悔书”,承认自己违反了安全原则。
- JADEPUFFER AI勒索:今年7月安全厂商Sysdig披露了首例主要由AI智能体驱动的勒索攻击——攻击者利用开源AI框架Langflow的漏洞进入系统,智能体自主完成了环境侦察、凭证窃取、横向移动,最后对企业的MySQL和Nacos数据库执行了加密勒索。虽然目标选择和基础设施配置仍有人类参与,但攻击链的执行几乎不需要人工干预,全程由AI按自己的节奏推进。
三、为什么会有智能体投毒
有利益的地方,就有人搞破坏。
- 赚快钱:GEO投毒帮商家刷推荐、抹黑竞品,一条产业链几百亿规模;
- 偷数据:智能体能接触大量敏感数据,投毒后批量偷了卖钱;
- 搞勒索:JADEPUFFER已经证明,AI智能体可以当全自动勒索工具;
- 商业竞争:今年7月《连线》杂志曝光Meta的”戛纳计划”——雇几百人伪装成未成年人,给竞争对手的AI发高风险诱导提问,试探对手的安全边界。Meta辩称这是”安全基准测试”,但这个边界在哪,业内吵翻了天。
投毒手法也在进化:从直白的”忽略以上指令”,到藏在图片元数据、文件注释、网页DOM里的隐形指令,再到跨会话的记忆投毒——一次注入,长期生效。
四、智能体产品安全设计优化
智能体安全不是加一行系统提示词就能搞定的,得从架构上做纵深防御。对产品经理来说,至少要搭好四层防护:
第一层:输入侧前置安检
这一层是重点,也是目前行业正在验证的主流方案。
思路很像iPhone中的Apple Intelligence的架构:端侧小模型做快速初筛,云端大模型做深度分析,两层配合。苹果的做法是设备本地跑一个约30亿参数的小模型处理轻量任务,保护隐私和速度;复杂任务再调云端的大模型。
把这个思路用到安全上,就是”认知防火墙”:
第一关:端侧轻量模型快速安检。部署一个专门训练过的小模型,在本地离线运行,专门识别隐藏文本、零宽字符、编码变形、典型注入话术这些”明面上的坏东西”。速度极快,延迟可以做到几毫秒,数据不用出本地。
第二关:云端深度语义分析。通过了初筛但仍有嫌疑的内容,再送到云端用更强的模型做语义级分析,判断是不是伪装成普通文本的恶意指令。
打个比方:端侧小模型是小区门口的保安,看你形迹可疑直接拦下来;云端大模型是警局的刑侦专家,拿不准的案子再送过去深度研判。这样既保证了速度,又不丢精度,还能避免把所有用户数据都送去云端检测的隐私问题。
微软研究院的BIPIA基准测试也验证过:基于”边界意识+显式提醒”的防御策略,能把攻击成功率压到很低。说白了就是明确告诉AI:”这块标记的都是别人说的话,不是给你的命令,别瞎执行。”
第二层:权限最小化
智能体能调用什么工具、能访问什么数据,必须严格卡在任务需要的范围内。只需要读文件的,就别给写权限;只需要查某张表的,就别给整个数据库的权限。
PocketOS删库事件最核心的教训就是:一个编程智能体,凭什么拥有删除生产数据库的权限?这就好比你雇了个保洁,顺手把保险柜钥匙也给人家了。
第三层:高危操作必须人工确认
涉及删除、转账、批量发送、改系统配置这些高风险操作,必须弹个框让人工确认,智能体不能自己就干了。
让AI静默把事儿都干完固然爽,但关键节点必须让AI停下来问一句”确定要执行吗?”,该人审的不能省。
第四层:日志审计与异常告警
把智能体的每一步决策、每一次操作都记下来,建立正常行为基线,一旦出现反常调用模式就告警。不光看结果合不合规,还要追踪”这个决策是怎么一步步形成的”,方便事后溯源。
五、未来:智能体会有自己的”杀毒软件”吗?
电脑病毒和杀毒软件斗了几十年,最终形成了动态平衡。智能体安全大概率也会走类似的路,但形式可能完全不一样。
一条路是”外挂式”安全工具。现在已经有团队在研究专门的智能体安全审计工具、提示注入检测防火墙、行为监控平台了。就像每台电脑都装杀毒软件一样,以后企业部署智能体,大概率都会配套一套”安全护栏”。
另一条路是”内生安全”,参考iOS的技术路线,苹果的生态证明了,封闭但严格管控的体系,安全性确实有优势。大模型自身的安全能力不断进化,对齐训练做得更好、指令边界识别更强、工具调用安全机制更完善,从根上降低被投毒的概率。
还有第三条路——监管和行业标准。OWASP的智能体安全Top10、国内陆续出台的白皮书和行业标准,都是在给这个新领域立规矩。等智能体深入金融、医疗、政务这些重要领域,合规要求只会越来越严。
当下,大模型与智能体给我们带来了前所未有的高效生产工具,自然会有黑产盯上它、想污染它从中得利,也许有一天大家可能会习惯安装智能体前先把“杀毒软件”装上打开(就像若干年前装机首先安装360,现在装机先装个火绒),让智能体运行更安全可靠。又或者习惯于在智能体的生成结果中对一堆广告视而不见,说不定还会衍生出AGI去广告插件。
AI的未来可期,但是也要注意安全。
本文由 @iCheer 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自Unsplash,基于CC0协议

起点课堂会员权益





权限最小化这个原则太重要了,PocketOS删库就是反面教材。很多团队图方便给智能体开太多权限,相当于把炸弹交到它手里。
这篇文章把智能体投毒的四大场景讲得还是很透彻的,尤其是”提示注入”那段——白色字体藏指令的案例。想请教作者:四层防护里”端侧初筛+云端深度语义分析”的方案,对中小厂来说成本会不会太高?有没有更轻量的过渡方案?