3美分打3美元,DeepSeek V4 Flash 杀穿的不是模型,是定价

0 评论 279 浏览 1 收藏 13 分钟

DeepSeek V4-Flash 正式版悄然上线,以 3 美分完成标准化测试,与 Claude 的 3.15 美元形成 100 倍价差,直接击穿行业定价逻辑。本文拆解其成本优势背后的架构与战略,并探讨模型迭代加速下,产品经理如何构建真正的护城河。

7月31号下午,DeepSeek 在 API 文档更新日志里挂了一条通知,V4-Flash 正式版上线公测。没有发布会,没有预告片,就那么悄悄挂上去了。按说这种更新,行业里一周能出好几个,没啥稀奇。但两天之后,一家叫 Artificial Analysis 的评测机构放出一组数据,直接把整个圈子干沉默了。

同一个标准化测试,DeepSeek V4 Flash 跑完,平均花 3 美分。

Claude Fable 5 跑完,花 3.15 美元。

100 倍的价差。

我看到这张图的时候,第一反应是去数零。3 cents 和 3.15 dollars,单位都不一样,这怎么比?再一看,数据是这么算的,同一个基准测试套件,按各家的 token 消耗和官方 API 价格折算,DeepSeek 完成一轮测试只要 0.03 美元,Kimi K3 要 86 美分,GPT-5.6 Sol 要 1.86 美元,Claude Fable 5 要 3.15 美元。而且这还不是最夸张的,V4 Flash 跑完整个智能指数评测只要 72 美元,Claude Opus 4.8 要 3836 美元。

你敢信???

把这次更新是什么讲清楚。V4-Flash 正式版,官方代号 V4-Flash-0731。和预览版相比,模型各项数据都未变动,只重新做了一遍后训练。把 Agent 能力给拉上去了。终端操作测试 TerminalBench 2.1 拿到 82.7,网络安全攻防 Cybergym 76.7,工具调用 Toolathlon Verified 70.3。几个代码智能体基准,直接超过 V4-Pro-Preview

并且这次更新原生支持 Responses API 格式,还专门适配了 Codex。你品品,一个国产开源模型,把 OpenAI 家的接口格式和 OpenAI 家的编程工具都伺候好了。只需要在终端运行一道命令,10秒钟,你就能用最具性价比的大模型适配当今第一梯队的IDE,吓哭了。

而且当天晚上,权重就开源了,MIT 协议,挂上了 Hugging Face。商业使用、二次修改、闭源再分发,全都不限制。完整权重包 167GB,混合 FP4/FP8 精度。像 RTX PRO 6000 这种 96G 显存的卡,本地就能跑。

昨晚你叫我梁子,,那今天该叫什么?

好,现在说回价格。

同一个太空射击游戏需求,Claude Opus 5 和 DeepSeek V4 Flash 0731 前后脚发布,网友把它俩摆一块跑。两个都完整实现了战机移动、射击、击碎陨石、道具拾取,可玩性没有明显差距。账单呢,DeepSeek 这边 1 美分级别,那边 1 美元级别。

更离谱的是宝可梦 3D 模型的对照。一模一样的指令,GPT-5.6 Luna 输出 230 万 token,DeepSeek V4 Flash 只输出 47.7 万,成品效果一时分不出好坏,成本差接近 14 倍。

拿 V4 Flash 直出第一人称 3D 射击游戏,能跑能跳能打枪,地图掩体物理碰撞全部到位,UI 右下角还实时显示弹匣余量。一看账单,0.07 美元。五毛钱。

五毛钱,做出一个能玩的 3D 射击游戏。

这个画面放三年前,你敢想吗。

真正有意思的地方,在下面。

看这张图。Artificial Analysis 的智能指数,V4 Flash 拿到 50 分。

什么概念?和 Google Gemini 3.6 Flash 打平。但 Kimi K3 是 57 分,OpenAI 和 Anthropic 的高端模型只比他高9分。

在纯能力排行榜上,它排不进第一梯队。它的位置是性价比之王。50 分的水平,卖出了不到顶尖模型 1% 的价格。

所以杀穿的不是模型,是定价。它不是把 GPT 和 Claude 摁在地上打,它干的是另一件事,把按能力定价这套商业逻辑给掀了。

你想想看,过去两年大家默认的规矩是什么。能力越强越贵,旗舰模型就该卖出旗舰价,就像买手机,Pro Max 和标准版,价格差一倍用户也认。OpenAI 的 GPT-5.6 分 Sol、Terra、Luna 三档,7 月 30 号 Luna 刚降了 80%。Claude Opus 4.8 卖得贵不贵?贵。但贵得有道理吗?如果只贵 2 倍,那是品牌溢价。贵 50 多倍,就是智商税。开发者不是傻子,同样的任务,跑一次省 3700 多美元,用脚趾头都知道怎么选。

说到这我得承认,最初看到 3 美分这个数,我下意识以为是营销号在夸大其词,毕竟AI圈天天都是核爆,日日都是颠覆。后来我把 Artificial Analysis 的原始数据翻了一遍,又把量子位的实测账单对了一遍,才敢信。

回到 DeepSeek 这边。它是怎么做到这么便宜的?

做模型我从不在乎钱,没钱了我自会去股市取。(不出自某梁姓男子)

左手无限昇腾卡,右手无限国网电,中间A股无限钱,你拿什么和我梁叔叔打?

开个玩笑,其实是三件事。第一是 MoE 架构,2840 亿参数只有 130 亿被激活,好比一个公司几千号人,但每单业务只派 13 个人上场,人力成本自然低。第二是注意力机制上的压缩,100 万 token 的上下文不用每次都把全部历史翻一遍,先压缩再筛选,KV 缓存省了,显存省了,每步推理的算力也省了。第三是它压根没打算靠 API 挣钱,把推理成本打下来,让开发者把 DeepSeek 当成水电煤一样的基础设施,这才是它的算盘。

便宜不是目的,便宜是手段。

说真的,这次更新对产品经理的影响很大。因为模型正在变成自来水。想想看,两个月里 OpenAI 发 GPT-5.6,月之暗面发 Kimi K3,DeepSeek 发 V4 Flash,7 月底 OpenAI 还在给 Luna 降价。2026 年上半年全球发布的前沿及开源模型超过 50 款,平均每个月接近 10 个。过去我们说一代模型隔一年,现在隔一个季度。OpenRouter 今年中期的判断,开源和闭源的差距只剩 3 到 6 个月,Epoch AI 保守一点,说 3 到 12 个月。取哪个数不重要,方向是一样的,代际差正在消失。

这个速度下,产品经理过去引以为傲的能力正在失效。你精心选的模型,三个月后就被新模型超越。你打磨的 prompt 技巧,模型一升级就作废。你比别的产品强的那 5%,很可能只是你比对手早两周接上了新模型。

那护城河在哪?我自己的感受是,不在模型层,而在三层东西上。

第一,自建评测集。别信厂商的发布会,也别全信第三方榜单,把你产品最核心的 20 个场景做成测试集,每次模型更新先跑一遍你自己的题,用脚投票。第二,工作流理解。模型只是发动机,你的产品对用户任务的理解、对上下文的组织、对结果的校验,才是驾驶系统。第三,数据闭环。用户在你的产品里产生的真实反馈,才是别人抄不走的资产。

别把宝押在某个模型身上,把宝押在你对业务的理解上。模型随便换,业务跑不跑得通,是你说了算。

说到评测,顺便给你一个我的办法。看模型别只看跑分,要看三个数。一是能力分,比如 Artificial Analysis 的智能指数,看它在哪一档。二是成本,看完成标准化测试的实际花费,这才是拉平各家口径的统一标尺。三是上下文和输出上限,这决定了你能拿它做什么。三个数放在一起,你大概就知道它适合干什么活,不适合干什么活,还要考虑真实场景下的延迟、输出效率

比如 V4 Flash 这个 50 分,放在任务上是什么感觉?写代码、改 bug、批量处理文档、跑测试,这些容错率高、量又大的活,它香得不行。但如果你是做金融风控,错了要出人命的场景,还是老老实实找能力分更高的模型,或者加一层人工兜底。便宜不能当万能药。

哦对了,还有一个重要的反转。

就在 8 月 5 号,DeepSeek 自己发了个预告,说要上调 API 价格。

所以你要是产品经理,趁窗口期做两件事。第一,把核心场景接上 V4 Flash 跑一轮真实测试,把评测数据沉淀下来,以后它涨价了、或者出了 V5,你都有基线可以对比。第二,别把架构焊死在单一模型上,接口层做抽象,模型做成可插拔的。等哪天真有更便宜更好的模型出来,你换起来成本最低。

一百多年前电灯刚普及的时候,因为价格,人们还在纠结要不要把自家发电机换成中央电网的电。后来电价一路降,再也没有人自己发电了。今天的大模型,正在走同一条路。能力商品化的终点,是它变成水电煤一样的基础设施,人人都用得起,没有人再为发电本身付费,大家比拼的是谁更会用这些电。

但便宜的电来了,也别把家搬进发电厂。模型可以随便换,你的产品、你的数据、你对用户的理解,才是那个家。

本文由 @赛博中登 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 目前还没评论,等你发挥!