你的Agent耗费词元大,并不是因为模型单价贵

0 评论 266 浏览 0 收藏 10 分钟

Agent账单居高不下,换便宜模型却只省四分之一?单价差15倍,账单却只降4.5倍。问题不在模型价格,而在任务结构:重复计费、冗长上下文、重试成本才是大头。本文拆解八步任务成本算法,教你从任务设计入手,真正省钱。

最近我把一个Agent的模型换掉了。

原来是当时第一梯队模型,输入15元、输出60元每百万token。更换后的便宜许多,输入1元,输出4元。

单价差15倍。

因此希望账单会掉一个数量级。下个月对出来,只降到原来的四分之一多一点。

差掉的那十几倍去了哪?经过对比,这几天我有了暴论。

单价只决定基数,任务结构是核心倍数。要省钱,只能动任务设计,大头不在模型价格。

下面把一个八步的Agent任务价格算法,参数都列出来,可以自行带入计算。

怎么看Agent花销分布?

Agent的账单不是单价X用量,中间隔着一个任务结构。

而这三件事在放大我们平时用Agent的成本。

1. 被忽略的输入单价

输出的单价比输入贵,通常是三到五倍。输出要逐token生成,开销远高于输入编码。

所以比价的时候,大家都盯着输出价看。

但Agent任务里,输入的token量往往是输出的十几倍。系统提示、工具定义、检索来的资料、前面所有轮的对话,全在输入侧。

单价高的那项用量小,用量大的那项单价低。谁占大头,需要按照任务结构计算。

2. 冗长的上下文窗口

十轮对话不是十次独立计费。第二轮要把第一轮的内容重新交一遍钱,第三轮要把前两轮重新交一遍,往后每一轮都在替前面所有轮重复付费。

所以轮数翻倍,账单不是翻倍,是翻好几倍。

如果某一步调了检索工具,捞回两万token的资料,这两万在后面每一轮都要重新交一次钱。

3. 重试是全价重算的

能力弱的模型不是做得差一点,是做不对要重来。重来一次,上面两项原样再付一遍。

Artificial Analysis有组数据能说明这件事的分量。

比较跑完同一套评测集要花多少钱时,DeepSeek V4-Flash约0.03,Kimi K3是0.86,GPT-5.6 Sol是1.86,Claude Fable 5是3.15。

他们证明一件事:单价便宜的模型,如果要多走几步才做对,账单未必低。

同一份榜单上,V4-Flash的智能指数是50,Claude和GPT高出至少9分。这9分在单轮问答里感觉不到,在十几步的长任务里会变成重试率的差距。

这三项支出,全都由任务结构决定。

举例看Agent账单

场景是一个协作SaaS功能,叫《需求文档助手》。客户公司的产品经理丢进一句话背景,Agent生成一份PRD初稿。

它会先读客户自己空间里的历史文档,学到这家公司的章节顺序、惯用词和必填项,产出的稿子像这家公司撰写的,文档通常分为八步:解析需求列澄清问题,确认范围,调检索工具捞历史PRD,拆功能点,写主流程,写异常流程,对照必填项自检,按模板成文。

每轮输出分别是400、300、1500、1200、2000、1800、800、1600token,合计9600。

每轮都带的固定部分:系统提示和模板2000,需求背景500。

第3步的检索时,返回约20000token历史文档,从第4轮起每轮都带这份文档,累计逐轮叠加。

这样算下来,八轮的输入分别是2500、2900、3200、24700、25900、27900、29700、30500,总输入147300。

输入按15元每百万算,2.21元。输出9600按60元算,0.58元。合计2.79元。重试率按10%计,单次3.07元。

看这个拆解。

输入2.21元,输出0.58元,输入占了79%。

输出的单价是输入的四倍,最后只占两成。

再往里看一层。那20000token的历史文档,第4到第8轮带了五次,光这一项就是100000token,占总输入的68%。

你盯着比的是输出单价,掏钱的是输入用量,而且大头是同一批内容被反复计费。

换成便宜模型呢。

它走不完八步。上线后被迫加了六步:澄清质量差要追问一轮,功能点拆得太粗要细化,主流程漏了要补,异常流程一轮写不完拆成两轮,自检跑一遍不够跑两遍。十四步。

总输入约359000,总输出约16000。输入0.36元,输出0.06元,合计0.42元。重试率60%,单次0.68元。

3.07元:0.68元,单价差15倍,账单只差4.5倍。

摊到生意上更直观。日调用500次,一个月贵模型烧4.6万,便宜模型1.02万。这个功能月收入10万,毛利从90%掉到54%。

对一个SaaS来说,54%的毛利是无法正常运转的。

不换模型,怎么省钱

第一件回报最大:把重复的部分做成稳定前缀,让缓存接住。

上面那100000token的重复计费是纯浪费。同一批文档,一个字没变,交了五次钱。

缓存命中是单独计价的,降幅很大。

按输入价的一成保守算,这部分从1.5元降到0.15元,省下1.35元。单次成本从2.79掉到1.44,含重试1.58元。月成本2.37万,毛利回到76%。

没换模型,效果一点没降,毛利从54%回到76%。

前提是前缀要稳。检索结果的顺序、拼接方式、时间戳,任何一处每次都变,缓存就命不中。这是纯设计问题,不花一分钱。

第二件,砍步数。

判断标准是这一步的输出有没有被后面真正用到。自检类的步骤最容易冗余,跑两遍的收益通常小于它带来的那两轮全量上下文。 而这一步,考察的不是产品经理对Agent本身概念的了解,是对业务把握准确性,什么是必要性痛点,什么是可有可无的地方。

第三件,分级派活。

不是整个任务配一个模型。澄清、格式整理、模板填充这类配便宜的,拆功能点和写主流程这种配好的。标准是这一步的错误会不会往下传导,会传导的不要省。

第四件,给重试设上限。

同一个方案重试第三次还不成,继续重试的期望收益已经低于换方案。超了就升级到更好的模型跑一次,这笔账通常更划算。

计量方式的改变

这一趟下来,我改的其实不是成本,是记账方式。

成本的计量单位要从token换成任务。

按token记账,你只看得到单价,做出来的决策就是换模型。按任务记账,你看到的是步数、重试率、重复计费,这些才是能动的东西。

它会往前传导两步。

需求文档里要写单任务成本预算,跟定价一起定,别等上线后看账单。

埋点要埋在任务粒度上,记每个任务走了几步、重试几次、上下文峰值多少,而不是只统计调用次数。

这里有五个问题锦囊,可以用在任何Agent上评估效能

Agent单任务成本是多少?没人算过,就是没人负责。

输入和输出各占多少?输入超过七成的,可以去查查重复计费。

有没有内容在多轮里被重复带入?缓存命中率是多少?

重试率是多少?(这些数据必须准确记录)超过30%的,换模型比优化prompt快。

定价单位和成本单位对得上吗?

这些问题,让你的业务有迹可循。

数据来源与说明:

Artificial Analysis的cost-per-task对照与智能指数;

本文由 @兔主任观测员 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Pixabay,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 目前还没评论,等你发挥!