3分钱一个任务,B端该怎么选

0 评论 159 浏览 0 收藏 18 分钟

DeepSeek V4 Flash以3美分的任务成本,将全球90%的模型甩在身后,海外平台争相补贴,开发者疯狂调用。本文从B端视角拆解这一现象,揭示成本结构剧变如何重塑企业AI选型逻辑,并给出三层成本优化框架,助你重算AI账本。

昨天试了一下DeepSeek V4 Flash,速度确实快。

但这篇文章的重点不是聊体验,而是聊一组让我重新算了一遍账的数字。

7月31日,DeepSeek发布V4 Flash正式版。8月4日,英国路透社专门发了一篇报道,标题大意是:深度求索新模型运行成本优势明显。能让路透社专门写一篇成本分析,这在AI行业里还是头一次。

紧接着,海外平台开始疯狂给V4 Flash叠加补贴——Nous Portal直接打了一折,Cline因为成本比预期低太多,把免费额度翻了三倍。

一个国产模型,便宜到海外平台抢着倒贴。这件事本身,就值得写一篇B端视角的分析。

一、3美分意味着什么:一次被重新定义的”性价比”

先看数字。

权威模型评测机构Artificial Analysis用多组主流模型跑同一套基准测试,比的是”跑完一整套任务平均花多少钱”。注意,不是比token单价,是比干完一件事到底花多少钱

结果:

$0.03DeepSeek V4 Flash 平均任务成本(约3美分,人民币2毛)

$1.86OpenAI GPT-5.6 Sol 平均任务成本

$3.15Anthropic Claude Fable 5 平均任务成本

3美分 vs 3.15美元——差了100倍。

而且不只是便宜。Artificial Analysis实测,V4 Flash(Max Effort模式)的输出速度约113 tokens/秒,而Claude Opus 5约74 tokens/秒,速度快了1.5倍。也就是说,当DeepSeek跑完所有测试任务的时候,Claude才刚跑完一半。

代价呢?智能指数方面,V4 Flash得分50分,和Google Gemini 3.6 Flash持平,比旗舰模型(Claude Opus 5的61分、Fable 5的60分)低大约10分。

翻译成大白话:你用旗舰模型八成的能力,花了百分之一的钱。

但这不是最让我震惊的部分。

真正重要的不是token单价,是”任务成本”

过去几年,大模型行业的定价方式很简单粗暴:按跑了多少token算钱。输入每百万token多少钱,输出每百万token多少钱。

但这个算法有个问题——它比的是”原材料价格”,不是”成品价格”。

就像去饭店吃饭,菜单上写着”大米5块钱一斤”,但我只在乎”一碗米饭多少钱”。token相当于是大米,任务就是那碗米饭。大米就算再便宜,蒸成米饭的工艺依然会影响最终价格。

一个模型如果需要生成更多的token才能完成同样的任务,那便宜的token单价可能换来一张昂贵的账单。

Artificial Analysis做的事情,就是把这层”翻译”给做了。他们比较的是”跑完同一套基准测试要花多少钱”——把token用量、推理深度、缓存命中率、思考时间这些变量全部揉在一起,直接给出一个终极答案:

干完一件事,到底要花多少钱?

这才是企业真正应该关心的指标。

二、海外平台为什么抢着倒贴一个国产模型

V4 Flash的官方定价本身已经够低了:

这个价格已经是行业最低梯队。但更魔幻的事情发生了:海外的”中间商”们居然还在疯狂叠加补贴。

Nous Portal:限时一折

Nous Portal是一个AI模型聚合平台,直接给V4 Flash打了个一折,限时7天。按这个折扣算,比Claude Fable 5便宜了一千多倍

Cline:免费额度翻三倍

Cline是一个开源的VS Code编程Agent,上周六宣布用V4 Flash为用户提供免费额度。结果烧了几天一看账单——哈,这么便宜?——直接把免费额度翻了三倍。用他们自己的话说:”没想到还真能一直这么烧下去。”

OpenCode:单日8T Token

光是8月1号一天,DeepSeek Flash在OpenCode平台上就跑了8万亿tokens。什么概念?这已经超过了OpenRouter全平台的日均总量。

一个国产模型,让海外平台争着补贴、开发者抢着用。这在半年前是不可想象的。

为什么海外平台愿意倒贴?逻辑很简单:

  • 流量入口争夺:V4 Flash的出现正在改变开发者主力模型的选择。谁先绑定这个模型的用户,谁就能在AI工具链里占住位置。
  • 成本实在低到可以”烧得起”。:按一折算,跑一个任务的成本可能不到0.3美分。这种成本水平下,补贴不会亏到心疼。
  • 生态卡位。:DeepSeek是开源的,但大多数开发者不会自己部署。平台通过补贴把开发者吸引过来,本质上是在抢AI时代的”应用商店”入口。

这让我想起当年网约车大战——平台补贴不是因为钱多,是因为不补贴就没用户。V4 Flash正在AI领域制造类似的效应。

三、B端的启示:你的AI账本要重算了

说了这么多行业现象,回到B端。这件事对我们做企业信息化、做AI选型的人来说,到底意味着什么?

第一,”斩杀线”被大幅抬高了。

Artificial Analysis做了一张图,把所有主流模型放在一个坐标系里——横轴是每次任务的成本(对数坐标),纵轴是智能指数得分。图中有一条虚线,代表DeepSeek V4 Flash的”性价比斩杀线”。

结果:全球将近70%的模型都处于被斩杀区域。

也就是说,在V4 Flash能处理的任务复杂度范围内,没有任何模型的性价比能超过它。华泰证券的研报更直接:包括低推理强度的Fable 5和GPT-5.6在内,全球90%的模型都被DeepSeek斩杀了

对企业来说,这意味着什么?意味着你之前的AI成本预算,可能是按”行业平均”来做的。现在行业平均被一个3美分的模型重新定义了。

第二,从”选能力”到”选性价比”。

过去做AI选型,核心问题是”哪个模型最聪明”。现在多了一个更实际的问题:”在够用的前提下,哪个模型最便宜?”

这不是降级,这是成熟。就像企业买服务器,不会每个场景都买顶配,而是根据负载选配置。AI模型也应该分层使用。

举个实际例子:一个任务,直接用Claude要3美元。用DeepSeek先试,3美分,成功了就赚了;失败了,再用Claude,总共3.03美元,只比直接用Claude多花1%。

只要成功率不是0,这个买卖就划算。

第三,成本结构的变化,可能改变AI Agent的ROI计算。

之前我写过AI智能体ROI量化的文章,里面提到AI Agent的部署成本中,大模型API调用通常占30%-50%。现在这个比例可能要进一步压缩。

根据IDC《2026全球AI软件与应用支出指南》,企业部署AI Agent的成本由四部分构成:软件授权与算力、开发与集成(最大成本项)、知识库与数据治理、持续运维。

模型调用成本的暴降,意味着:

  • AI Agent的经济可行性门槛大幅降低——原来算不过来账的场景,现在可能算得过来了
  • 企业可以将节省的模型成本重新分配到数据治理和持续运维上——这两块恰恰是决定AI Agent长期效果的关键
  • 中小企业的AI落地门槛降低——不用一开始就烧大钱验证可行性

️ 四、信息化人的应对框架:三层成本优化

数字看完了,说说实操。基于V4 Flash这个案例,我梳理了一套企业AI成本优化的三层框架。

企业AI成本优化三层框架

1分层模型调度:不是所有任务都需要旗舰

简单意图识别、工具参数提取、常规问答——调用低成本模型(如V4 Flash、7B/14B开源模型)。复杂业务规划、合同审核、高价值决策——仅最后环节调用旗舰模型。知识库检索、数据过滤完全脱离大模型,用向量库/规则引擎处理。核心原则:让便宜的模型干便宜的活,贵的模型只在刀刃上发力。

2缓存与节流:98%命中率不是梦

V4 Flash能这么便宜,一个重要原因是98%的缓存命中折扣——高频重复请求直接返回缓存结果,命中后输入价从1元降到0.02元,降幅50倍。企业可以借鉴这个策略:重复业务指令、通用查询结果本地缓存;固定工具描述、系统提示词抽离公共模板;设置日调用额度和并发上限。核心原则:同样的活,尽量不要重复算。

3场景分级与TCO思维:从token账单到任务成本

不要只看token单价,要看”完成一个业务任务的总成本”。建立场景分级清单:高频标准化场景(单据录入、常规咨询)用低成本模型全自动执行;中风险场景(数据修改、内容生成)AI出初稿+人工确认;高风险场景(资金审批、对外发文)强制人工终审。核心原则:用TCO(总拥有成本)取代软件报价对比,算清3年的全周期账。

一个实操建议:先跑一组对比测试

如果你的企业正在用Claude或GPT系列做AI Agent,我建议你做一个简单的实验:

  1. 挑出10个你们最常用的业务场景
  2. 用V4 Flash分别跑一遍,记录成功率和任务成本
  3. 对比原来用旗舰模型的成本
  4. 计算”V4 Flash先试 + 失败后降级旗舰”的混合成本

根据Artificial Analysis的数据,混合策略的成本增幅通常不超过1%-5%,但能省下95%以上的开支。

这个实验花不了多少时间,但可能彻底改变你的AI预算规划。

五、我的判断:成本断层之后,真正的战场在哪

最后说说我自己的思考。

第一,DeepSeek正在重新定义行业的”成本基准线”。

过去几年,GPT-4o、Claude Sonnet、Gemini Pro是行业性价比的参照物。比它们贵的,得证明自己更强;比它们弱的,得证明自己更便宜。

现在,V4 Flash把这条斩杀线抬到了一个非常高的地方。全球90%的模型都被它斩杀了,剩下的10%要么在能力上有明显优势,要么在特定场景上有不可替代的价值。

对企业来说,这意味着”选模型”这件事的复杂度降低了——大部分常规场景,V4 Flash或者同级别的低成本模型就够用了。真正需要操心的,是那些旗舰模型才能搞定的复杂任务。

第二,成本断层之后,真正的战场是”场景适配”。

当模型成本不再是瓶颈,企业AI的竞争焦点会从”谁的模型更便宜”转向”谁的场景适配做得更好”。

什么是场景适配?就是你的AI Agent能不能真正理解你的业务流程、对接你的系统、处理你的数据。这不是模型能力的问题,是工程化的问题——数据治理、知识库维护、系统集成的质量,决定了AI Agent的实际效果。

这也呼应了我前面说的:模型调用成本暴降之后,企业应该把省下来的钱投到数据治理和持续运维上。因为那才是决定AI Agent长期效果的关键。

第三,海外平台抢着补贴国产模型,说明AI的竞争维度变了。

以前比的是谁的能力更强,现在多了一个维度:谁的生态更广。

DeepSeek是开源的,理论上任何人都可以部署。但大多数开发者不会自己搞,他们会用平台。平台通过补贴把开发者吸引过来,本质上是在抢AI时代的”应用商店”入口。

这跟当年安卓和iOS的竞争逻辑类似——系统本身免费甚至倒贴,靠生态里的应用和服务赚钱。

对企业来说,选择AI供应商时,不只要看模型能力,还要看生态健康度:有多少平台在用它、开发者社区活不活跃、上下游工具链完不完善。

第四,不要被”便宜”冲昏头。

最后泼一点冷水。V4 Flash确实便宜,但它也有明确的短板——智能指数比旗舰模型低10分左右。在需要深度推理、复杂决策、长篇写作的场景下,这个差距是真实存在的。

所以我的建议是:分层使用,不要一刀切。

常规场景用V4 Flash或者同级别的低成本模型,把成本压下来;关键场景用旗舰模型,把质量保上去。两者的混合策略,才是当下最务实的选择。

写在最后:

3美分一个任务,这个数字会成为中国AI行业的一个标志性节点。

它意味着AI的成本门槛,从”企业级”降到了”个人级”。一杯奶茶钱,就能处理8亿个token。

但成本低不等于效果好,便宜不等于适合。做信息化这么多年,我最大的体会是:技术选型永远不是选最便宜的,而是选最匹配的。

现在”最匹配”的定义里,成本权重大幅提升了。但场景适配、生态健康、长期可维护性,这些维度的重要性并没有降低。

DeepSeek V4 Flash给B端带来的,不只是一个便宜的选择,更是一次重新算账的机会。

好好算。

本文由个人原创,仅代表个人观点,欢迎交流讨论。

数据来源:Artificial Analysis评测、DeepSeek官方定价、Reuters报道、华泰证券研报、量子位、36氪、IDC等公开资料。

本文由 @数智产研笔记 原创发布于人人都是产品经理。未经许可,禁止转载。

题图来自Unsplash,基于 CC0 协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 目前还没评论,等你发挥!