通用Agent横评,到底谁更强?
IDC 发布中国企业级通用 Agent 产品技术评估,没有沿用模型跑分,而是用近百道非公开任务测各家在真实办公环境里能否把事做完。TeleAgent 综合排名第三,任务表现满分、成本效率最高,靠的是自研 ModelRouter 按任务强度动态调度。

最近,我看到IDC发布了《中国企业级通用Agent产品技术评估》,没有沿用大家熟悉的模型跑分,而是拿近百道自建非公开任务,测试各家Agent在真实办公环境里能不能把事情做完。这份榜单里,有一个名字拿到了综合第三。

它就是TeleAgent。TA各项全面高于行业平均,任务表现拿到满分5分,成本效率拿到本次测评最高的4分,安全性4分位居前列。

我对这类榜单的态度一向是:看两眼然后自己上手。因为“任务表现满分”和“成本效率最高”放在一起,其实是一个很少见的组合:做得好通常意味着调最贵的模型、烧最多的Token。TeleAgent凭什么两头都占?
我花了几天时间,把TA的调度机制翻了一遍,又用三份真实工作考了TA。结论先放在这里:TA不是一个更会聊的对话框,而是一个把办公任务做完、做对、还做得便宜的执行者。下面按顺序说。
不用纠结选哪个模型,ModelRouter替你调度
先说成本效率这件事,因为它是我最好奇的。
光子星球最近有一篇《办公Agent之战,才刚刚找到战场》,把办公Agent的模型路由分成了两代。1.0是“分销模型能力的渠道”:把任务粗分成简单和复杂两层,接一堆模型进来让用户挑。这种做法只能给交付成本兜个下限,保证不了交付质量的上限,做到头也就是一个模型分销商,没有护城河。
TA走的是文中说的2.0:自研ModelRouter智能模型调度。用户不需要再费心纠结到底选哪个模型,而是由ModelRouter帮你调度。这套调度由模型API服务端提供,根据实时请求量动态分配流量,同时按任务强度分配不同级别的模型:简单任务用轻量模型,复杂任务用高级模型,优化模型使用量和积分消耗。

光子星球把这套调度拆成了供给侧和用户侧两面。供给侧解决“既不经济也不稳定”的问题:把不同服务商放进一个能力池,按当前压力调度,服务商之间自动无缝切换。用户侧则把任务分成三档,翻译、总结、格式化这类走轻量档,文件操作、PPT和文档生成走均衡档,代码调试、深度推理、研究报告走旗舰档。
对用户来说,体感就是输入框右下角那个模型档位可以不用管。我后面三组测试全程没有手动切换过模型,该省的地方TA自己省,该用旗舰的地方TA自己上。
调度机制说清了,接下来看TA到底能不能把事做完。我选了三份日常工作里最常见的活,难度递增。
第一份:20条用户反馈,要一份报告和一张行动清单
第一个任务我给了TA一份CSV,20条用户反馈,字段有角色、终端、满意度、问题类型和影响程度。要求做定量和定性分析,交付一份DOCX洞察报告和一份XLSX行动清单。
实测指令读取case-01-ux-feedback.csv,分析其中20条反馈。先给出执行计划,再输出《用户反馈洞察报告.docx》和《问题优先级与行动清单.xlsx》。所有数字必须来自附件,不要补造数据。

TA读附件、统计分布、归类问题,然后生成两种格式的文件。核对结果与原始CSV一致:5类角色共20人,电脑客户端10条、手机客户端5条、小程序3条、一体机2条,满意度均值3.1,高、中、低影响分别为6、9、5条
导出的行动清单21行、11列,20条反馈全部保留并按P0到P3排序:P0有6条、P1有7条、P2有2条、P3有5条。颜色标记、责任角色和建议动作都写进了同一张表。

真实使用里出了一个很有价值的细节:首版DOCX把F014的“通知合并”错写成了另一条设计系统类问题。我用一句自然语言指出错误,限定“只改这一处”,TA重新导出,复核后错误消失,其余统计保持不变。

对做用户研究的人来说,这一步省掉的不是写报告的时间,而是从原始反馈到“能拿去排期的表”之间那段反复搬运和对账的时间。而且TA接受基于事实的追改,错了一处就改一处,不会把整份文件重做一遍。
第二份:一份会议纪要,同时要执行计划和8页评审PPT
第二个任务换成一份项目会议纪要,里面有0.9版本目标、4个模块进度、3项关键决策、3项风险、5项待办和下次会议日期。要求输出一份项目执行计划DOCX,加一份不超过8页的评审PPTX。
TA没有直接开写,而是先把工作拆成四段:抽取并核对事实、生成执行计划、生成评审汇报、逐项检查日期与结论。这个顺序很关键,因为文档和PPT面向不同读者,但必须共用同一份事实源。

最终执行计划包含目标范围、6个里程碑、5项可直接映射的RACI工作、3项风险、依赖关系和下次会议检查项;PPT严格控制在8页,结论先行。实际渲染的第2页把8月28日前灰度上线、4个模块、试点范围、权限风险和3项决策压进一页,没有文字重叠或裁切。

对经常在会后补材料的产品经理来说,价值不是省一次写作,而是事实抽取、内容组织、格式转换和文件交付被串成了一条链路,多人协作里反复复制、版本漂移和漏项的机会少了很多。
第三份:224行经营数据,要一个能直接汇报的增长驾驶舱
第三个任务刻意换了赛道:8周、4个渠道、224行经营数据,只要求交付一个可视化增长诊断驾驶舱。
TA先校验数据结构,报出五项总量:总访问量181,930、总下单数8,038、总广告花费627,844元、总成交金额2,519,818元、退款订单340,与我独立汇总的结果完全一致。然后TA才开始设计工作表、公式和图表。
最终文件包含仪表盘、数据明细、核心指标、渠道对比、周趋势5个工作表,3张原生图表和88个公式单元格,缓存公式错误为0。

同一组数据TA还补了一份精美的网页演示版。四个渠道按ROAS形成清晰的效率梯度,“扩量、加投、稳投、收紧”与转化率、退款率证据放在同一屏。


更重要的是TA没停在“画图”:私域ROAS 16.39、转化率7.4%,规模最小但效率最高;社媒内容ROAS 7.27、转化率5.0%,适合继续放大;信息流访问量最高,但ROAS仅2.22、转化率3.1%、退款率6.4%,是最需要收紧定向和压降退款的渠道,这些分析对经营者非常有价值。
对运营人员来说,这相当于把“算数、看趋势、找问题、给建议”四个动作压进同一份可复核的文件里,而且TA主动多做了一份拿去汇报效果更好的视觉版本。人不再从零搭表,但仍然握着事实判断和最终放行权。
三个任务靠的是三件底层功夫
三份活跑下来,我更关心的是TA为什么能稳定跑完,而不是运气好。答案有三件事。
第一件是上下文管理。上下文工程是“智能体系统运行的血液”,长程任务最大的问题就是上下文长度和记忆的连贯性。TA用harness工程对上下文长度做预算分配和控制,根据所选模型自动计算上下文长度,优先对超长工具结果做剪枝,设定阈值减少剪枝对缓存命中率的破坏,并在合适时机做整体压缩。
多级处理的顺序是:先轻量剪枝旧的工具输出,不够了再由专职压缩模型对整段对话深度压缩;实时检测上下文溢出,触发窗口上限后自动压缩并继续执行,不中断。当前版本上下文窗口已经突破400K。
第二件是autoDream长期记忆。它每2小时自动总结近期对话生成当日日志,每24小时把对话记录与既有记忆合并、更新个人记忆档案,记忆跨会话生效,能记住项目背景、习惯和偏好,不用每次重复交代。记忆保存在本地,用户可以自行开启、关闭和清除。

第三件是TA对办公场景的专门打磨。业内领先的Coding Agent拥有千锤百炼的系统提示词,但思维模式天然围绕代码工程展开。
TA没有直接借鉴这套体系,而是针对中文白领办公场景做了大量针对性修改,彻底避免Agent用“写代码的思维”去解决写周报、做PPT、处理表格这类问题。办公任务被当作办公任务理解和执行,而不是被代码逻辑强行翻译。
这也解释了前面第二个任务里TA为什么会先拆事实源再分头生成,第三个任务里为什么会先校验总量再画图。目前,超95%用户给出4到5分评价,总体满意度4.8分。技能方面采用“核心技能+技能广场+自主创建”模式,已有超过5万个技能支持下载调用。
从个人搭子到组织资产
把三组实测放在一起看,个人层面的变化其实很一致:我不再纠结选哪个模型,不再守着步骤,不再担心长任务跑到一半失忆,也不用每次重新交代项目背景。我的角色从操作者变成了出题、设检查点、验收的人,结果对不对,依然由我掌控。
放到团队里,这个变化会被放大。同一类任务做十次、换十个人还能稳定交付,才叫组织生产力。
TA已经推出企业SaaS版和政企私有化版,旨在更好服务政企用户。
安全这条线是组织敢用的前提。TA支持个人文件和工作资料本地存储,围绕感知、推理、执行、记忆构建四层安全防护体系,通过信通院安全测试的智能体软件,并通过多家头部厂商安全核验。
再往上看一层。IDC调研显示,中国企业级Agent市场现在以办公自动化和流程自动化为主,通用Agent已经进入企业试点与选型阶段。IDC这次不考模型跑分而考真实任务、把成本效率和安全可控单列为维度,本身就说明竞争的标尺换了:不再是“谁的模型更会回答”,而是“谁能把任务稳定跑完、跑得省、跑得可管”。
ModelRouter把模型选择从用户手里收回到调度层,上下文治理和长期记忆把一次性的对话变成可累积的工作资产,这两件事叠在一起,才是通用Agent从个人搭子长成组织数字助理的路径。
如果你想试,从哪一份活开始
最适合先上手的人,是每周都要把原始材料变成交付文件的人:做用户研究的设计师、会后要补材料的产品经理、每周复盘渠道数据的运营。IDC给出的那三个分数,值得你用自己的一份真活去验一验。
本文由人人都是产品经理作者【AI高手杜小虎】,微信公众号:【AI高手杜小虎】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载
题图来自Unsplash,基于 CC0 协议
- 目前还没评论,等你发挥!

起点课堂会员权益



