Token 便宜了 99.7%,为什么你的 AI 账单还在涨

0 评论 121 浏览 0 收藏 12 分钟

模型单价暴跌99.7%,企业AI账单却翻了三倍。Uber四个月烧光全年预算,米哈游13小时产生200万token账单。本文拆解降价背后的结构性不均与席位模式塌陷,指出AI成本正从固定项变为可爆炸的变量项,并给出产品经理可落地的预算护栏与定价策略。

管过 AI 功能预算的人最近大概都碰上过这种事:模型的单价一路在降,账单一路在涨。

这不是个别公司的问题,账也没算错。它就是这一轮 token 价格战的常态,而且我觉得它比降价这个消息本身更值得做产品的人琢磨。

一、一组对不上的账

降价这一侧的数字很好看。2026 年上半年,中国各大实验室六次下调 API 价格,其中三次直接宣布为永久性降价,腾讯云对 DeepSeek-V4 系列的降幅最高做到 97.5%。海外节奏也没慢,GPT-5.6 系列上线仅三周,OpenAI 就把 Luna 降价 80%、Terra 降价 20%,只有旗舰 Sol 的价格没动。

把时间轴拉长更夸张。从 2023 年 3 月到 2025 年 4 月,同等智力水平的模型,每百万 token 推理成本从 30 美元跌到 0.1 至 0.15 美元,跌幅超过 99.7%。跌到这个程度,其实已经不太能用降价来描述了。

另一侧是:同一段时间里,企业的 AI 云支出不但没降,反而翻了三倍。

总量上涨还能解释成用的人变多了。但有两个已经公开的案例,说明事情比用得多要复杂。Uber 给 5000 名工程师开放 AI 编程工具后,四个月烧光了 2026 全年预算。

米哈游技术团队负责人郑银河今年 5 月在阿里云峰会上讲过另一件事:一位工程师测试多 Agent 协作时没设熔断,几十个 Agent 进了循环调用,13 个小时产生 200 万元的 token 账单。

一个是全公司层面的预算失控,一个是单点事故,放在跌了 99.7% 的背景下怎么看都有点荒谬。

二、单价与次数的剪刀差

单价确实在跌,但调用次数涨得比跌的更快。

过去用大模型大多是一问一答,一次输入触发一次调用,成本很好估。现在真正在付费的场景是 Agent 协作、长上下文记忆、多步推理、代码生成、多模态处理,一次用户输入触发的可能是几十次甚至几百次调用。单价降十倍、调用涨一百倍,总账当然是涨的。

黄仁勋在今年 GTC 上说过去两年 AI 计算需求增长了 100 万倍、推理正在成为主工作负载,这话现在听起来更像写实,不像发布会效果。

不过总量涨了还只是表面,更麻烦的是成本的性质变了。

过去 SaaS 的成本是一个可预测的固定项,边际成本接近零;现在它是一个可以爆炸的变量项。

米哈游那 200 万是结构问题,不是价格问题。一个没有熔断的循环调用可以在半天内把预算打穿,这跟单价是 30 美元还是 0.1 美元关系不大。要说的话,单价越低反而越容易失控,因为便宜会让人放松警惕。

三、降价的结构性不均

我们下意识会把 token 降价理解成一条整体往下走的曲线。可供给侧其实一直是紧的。Anthropic 反复发 capacity-limited 的说明,OpenAI 多次对 API 限速,国内推理算力批文紧张,这些都是真实的供需信号。

所以更接近事实的描述是:所谓“趋近边际成本”,主要在通用场景、低保障档位、非高峰时段成立。高峰时段、长上下文档位、reasoning 档位、前沿模型档位这几块,价格不会继续无脑下降,反而会通过服务分层来收溢价。

再叠加另一条趋势。通用文本生成的 token 正在走向零毛利,最终会趋近电力成本加一点微薄毛利,模型厂商的出路就剩两条:要么规模最大成本最低,要么做出别人做不到的能力来收溢价。

两条合起来,便宜的会越来越便宜,贵的还是贵,被抽空的是中间那一层。

推论也就明确了:如果你的产品价值主要建立在帮客户用上了模型这件事上,你正好站在被抽空的那一层。

四、席位模式的塌陷

前面说的都还在成本侧。收入侧的变化我认为更结构性,逻辑也很直白:如果你的 AI 就是用来替代坐在那些席位上的人,那你的产品越好用,客户能砍掉的席位就越多,你的收入就越少。

这已经在发生了。今年 1 月,Monday.com 的 CEO 公开宣布用 AI Agent 替换了整个 100 人的 SDR 团队,响应时间从 24 小时降到 3 分钟,转化率还上去了。同年,Atlassian 报告了历史上第一次企业席位数下降,主因就是 AI Agent 接管了原本需要专人操作的任务。让 SaaS 会议室紧张的其实不是 AI 有多强,是它对定价意味着什么:Monday.com 的竞品全都按席位收费,等于被递了一个取消九成授权的理由。

市场已经在迁移。Zendesk 的 AI Agent 按“自动解决”计费,承诺量下约 1.5 美元一次,按需付费约 2 美元一次,只有在无需人工介入就解决问题时客户才付钱。HubSpot 在 4 月把 Breeze Customer Agent 从每次处理的对话 1 美元改成每次成功解决的对话 0.5 美元,注意它改的其实是计价对象,从“做了”变成了“做成了”。GitHub Copilot 从 6 月 1 日起全面转向按量计费。

买方偏好也在动。Futurum 今年上半年针对企业软件决策者的调研显示,43% 的买家倾向消费型定价,27% 倾向结果型定价。还坚持只做席位定价的厂商,面临的是直接出局。

五、能落地的几件事

先说一个视角上的调整。我不太建议把 token 降价当利好来理解,它更像一次定价权的重新分配:降的是你的进货价,可它同时降了所有竞争对手的进货价,还顺手抬高了客户对你的价格预期。三件事一起发生,净效应未必是好的。

第一件事,把单位经济账做成产品文档的一部分。每一个 AI 功能,你要能算出单次执行的成本区间、最坏情况的成本上限,以及它对应的客户价值。这里面有个杠杆很多人没意识到:缓存策略是产品决策,不该只当工程细节。缓存命中价的差异能大到夸张,Kimi K2.6 是每百万 0.07 美元,DeepSeek V4-Pro 是 0.003625 美元,差了近二十倍。对任何有稳定系统提示词的 Agent,该拿去做基准测试的是缓存命中价,不是未命中的列表价。再往下推一层,系统提示词写多长、上下文怎么组织、要不要把长任务拆成多轮,这些以前算工程实现的东西现在直接决定毛利,而它们恰恰都是产品经理有话语权的地方。

第二件是把预算护栏当成产品需求写进 PRD。熔断机制、单任务 token 上限、循环调用检测、成本告警、用量可见性,这些以前会被归到运维,没人觉得是产品的事。但米哈游那个案例说明它们属于功能安全的一部分。一个 Agent 产品如果没有这些,等于把一个可能失控的开关直接交给了用户。这条是最容易立刻落地的,也最容易体现产品经理的价值,因为工程侧通常不会主动把它当需求提出来。

最后一件是训练定价能力,尤其是结果定价那部分。按结果收费听起来很美,难点却不在收费,在定义和归因:什么算“成功解决”?部分成功怎么算?客户不认怎么办?信号怎么采集才不会被钻空子?这些没有标准答案,只能一个业务一个业务地磨。所以现实里大多数公司是朝结果定价慢慢演进,很少一上来就用,比较成熟的落点通常是混合模式,一个订阅底价加上用量部分,Stripe 的数据显示这种模式的中位增长比纯订阅或纯用量都高 21%。我更愿意把结果定价当成方向:先把“什么算成功”定义清楚、把信号采集做扎实,定价形式反而是最后一步的事。

六、最后

把这些串起来,我觉得行业里正在长出一个新的岗位缝隙。它介于产品、财务和基础设施之间,要回答的是:这个 AI 功能到底赚不赚钱、它会不会炸预算、它该怎么卖。这个位置还没有统一叫法,有人叫 AI FinOps,有人叫定价产品经理,也有人干脆没给名字,就压在某个产品负责人身上。正因为还没定型,现在去占的成本最低。

另外还有一句可能不太受欢迎的判断。“token 越来越便宜,所以可以放开做”,我觉得这个推论是反的。成本低到人人都能做的时候,你产品的差异化就必须完全来自别处:对工作流的理解、结果的可靠性、出错时的兜底能力。

便宜现在很难在ai时代当护城河。

本文由 @观澜AI 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 目前还没评论,等你发挥!