多数资本都押错了注:2026年,仍不是Agent之年

0 评论 135 浏览 0 收藏 7 分钟

每年都有人说今年是 Agent 之年,但一份访问了 95 位生产环境 Agent 工程负责人的调查结论相当冷静。MIT 调查 1837 家企业,只有 95 家真正跑在生产环境,其余 95% 卡在实验和试点;落地的 5% 里,受监管行业 70% 每三个月就要重建技术栈。

每年都有人说“今年是Agent之年”,2025年喊过,2026年接着喊。

可一份2025年8月完成的调查,访问了95位已经在生产环境跑AI Agent的工程负责人,结论相当冷静:就算在这批“跑通了”的人里,Agent也远没有成熟。

今年,大概率仍不是Agent之年。

01 95%的项目没落地,落地的5%也不轻松

MIT调查了1837家企业,只有95家让AI Agent真正跑在生产环境,其余95%都卡在实验和试点。

落地的这5%也没好到哪去:受监管行业70%的企业每3个月就要重建一次技术栈,只有5%把“准确调用工具”列为头号技术难题,63%承认连Agent干得好不好都看不清。

结论:大多数公司还没走到“能用”这一步。

02 AI技术栈像流沙,昨天能用的今天就得重写

受监管行业里,70%的企业每季度换一次技术栈,不受监管的也有41%这么干。有受访者两个月内从一套框架换到另一套,刚换完又开始琢磨要不要换回去。

模型、框架、编排层迭代太快,试点能跑的东西一到生产就过时。内部自建AI工具失败率是外部合作的两倍,根源就是技术栈换得太快,自建团队追不上。

结论:不是大家不想稳定,是底座一直在晃。

03 生产里的agent,大多在干”打杂”

落地最多的场景:文档处理76%、文档分析74%、回答FAQ和技术文档70%、数据提取66%、数据分析64%,还有一半在给人工客服打下手。

这些活的共同点:重复、量大、回报好算。只有5%的工程负责人把“工具调用准确”当头号难题,恰恰说明多数Agent还在拼表面回复,没到拼深度推理和精准控制的阶段。

结论:Agent还处在“能干活”,远没到“能扛事”。

04 评估靠自建,可观测性是最弱一环

技术栈各环节里,满意度最低的是可观测性和评估,不到三分之一的团队满意,近一半在找替代方案。79%的公司用内部自建的办法评估Agent准不准,只有21%用第三方工具。

内部方法可控,但覆盖不全、难以规模化,Agent一面向更多用户,盲区就露出来。构建方式上,22%纯自建、10%纯外部,剩下68%都是混合路线。

结论:看不见Agent在干什么,就谈不上信任它。

05 规模一大,问题全变

交互量小的Agent,头号挑战是成本,占37%到40%;交互量超过1万次的Agent,延迟立刻顶上来,占比35%,可靠性也成了主角。

小规模跑得好,不代表放量后还跑得动。所以未来一年,62%的团队把头号投资放在可观测性和评估上,57%打算微调定制模型,56%要压幻觉。

结论:Agent越深入业务,地基越拖后腿。

06 出路不在更强的模型,在人

调查给出的方向很朴素:让Agent变好,跟带人是一个道理,靠反馈、纠错和问责,而不是每几个月推翻重训。

受监管行业42%的企业计划给Agent加审批、复核、审查行为这类管理功能,不受监管的只有16%。

当Agent开始扛更多责任,把人的审批嵌进流程不是退步,是它安全长大的前提。

结论:人和流程,才是Agent能不能成事的答案。

07 变化速度

有人会说,这是2025年8月的调查,2026年AI变化这么快,结论还成立吗?

一句话:变化越快,底座越晃——技术栈每季度重建、评估靠自建、可观测性缺失,这些结构性问题一年时间改变不了,只会随迭代加速更突出,Agent离成熟只会更远。

08 国内的情况怎样?

虽然调查数据都来自海外,但国内情况只能说更不乐观。因为压根还没想到这些评价标准,就不要提改进了。

轰轰烈烈的agent demo,只能说明与事实完全相反。

写在最后

押注今年就是Agent元年,大概率押错了。明年、后年是不是,现在也看不出来。

2026年不会以“Agent之年”被记住。95%的项目还在试错,落地的5%还在频繁换底座、补可观测性、建审批流程。

判断Agent成没成年,不看谁喊得响,看它能不能在真实业务里稳定、可控、透明地跑起来。

这一年,是打地基的一年,不是狂欢的一年。

作者 | ToBeSaaS

本文由人人都是产品经理作者【ToBeSaaS】,微信公众号:【ToBeSaaS】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。

题图来自Pixabay,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!