这是V4Pro还是V5Pro?DeepSeek“斩杀线”划了一条又一条
DeepSeek V4 Pro正式版悄然上线,性能飙升近5倍,但评测分数与跑分表不符,引发质疑。本文深度解析V4 Pro的真实能力、斩杀线效应及DeepSeek Harness的潜在影响,探讨AI模型价格战的底层逻辑与未来走向。

8月12日深夜,DeepSeek官网的API文档页面悄然完成了一次更新。Pro模型的版本号更换成了DeepSeek-V4-Pro-0813。

与此同时,根据第一财经报道DeepSeek官方群,放出了一组评分数据,表格中显示DeepSeek V4 Pro的性能远远超过了预览版,甚至在Terminal Bench 2.1这个Agent领域影响极大的测试集上,性能比肩当下最强的模型Claude Fable 5。

另一方面,在DeepSWE测试集上,预览版仅得12.8分,基本属于“不会做”的水平;正式版直接飙到62.7分,涨幅接近5倍。
这个测试集是衡量代码Agent能力的核心基准。同样翻倍的还有DSBench-Hard,从31.1冲到67.2;DSBench-FullStack从41.8提升到71.1。
如此这般的性能提升,将其称之为DeepSeek V5 Pro都不为过。
硬件规格上,V4 Pro延续了MoE架构设计,总参数规模1.6万亿,每次推理激活约490亿参数。接口侧提供100万 token上下文和最高38.4万 Token 输出,这两个数字对普通聊天可能意义不大,但对长任务Agent却是硬刚需。
尤其是大型代码库、长时间运行的日志以及连续工具调用,都会快速吃掉上下文。窗口不够大,Agent就只能不断压缩记忆,压着压着,前面做过什么也忘了。
调用方式保持不变,模型名仍然是deepseek-v4-pro,老用户的代码一行不用改,后端就自动切换到了新版本。
价格方面,0813版每百万token缓存未命中输入3元、输出6元,和预览版时期一致,并没有随模型转正而同步上调。
而就在不久前,DeepSeek官方曾表示价格将要上涨。
01 DeepSeek V4引发全球降价
自DeepSeek V4发布以后行业内有个怪现象,几乎所有大厂都在降价。但大背景却是只要跟AI相关的,一定都在涨价。最开始是GPU、内存,现在连硬盘、电,甚至陶瓷都涨了。
就好像西红柿涨价、鸡蛋涨价、糖涨价,结果西红柿炒鸡蛋反而比以前更便宜了。
2025年的时候,DeepSeek R1虽然引发了DeepSeek时刻,可当时由于行业重点在于输出内容的质量,所以OpenAI、Anthropic还能用“我们更聪明”来维持溢价。
但是现在今年7月31日V4 Flash正式版上线以后,行业叙事改成了“每任务/单位智能的价格”,DeepSeek V4 Flash正式版凭借“能力够用+价格便宜两个数量级”形成了一道独有的斩杀线。
根据Artificial Analysis的测试,在完成相同水平任务的前提下,DeepSeek V4 Flash的价格低于市面上70%的模型,而那些处于这70%分水岭内的模型,称之为被DeepSeek“斩杀”。
落在斩杀线上的竞品,只剩两条出路,要不然主动大幅下调定价,或者干脆放弃普惠开发者市场,收缩到预算充足的高端企业客户。
于是各家厂商的处境变得很微妙。短期内没办法提高智能水平,又舍不得开发者市场,降价就成了唯一能立刻执行的防御手段。
OpenAI是最典型的例子。GPT-5.6 Luna 7月9日才上线,7月30日就宣布降价80%,输入价从每百万token 1美元砍到0.2美元,输出价从6美元砍到1.2美元。一款刚发布的新旗舰,上市不到一个月就打两折,这也是无可奈何的事情。
OpenAI在降价当天同步发了一篇技术博客,称GPT-5.6 Sol自己重写并优化了部分生产推理内核,把端到端模型服务成本压低了约20%,token生成效率提升了15%以上。
这就使得它能把省下来的钱,直接变成给用户的降价补贴。换句话说,OpenAI这波降价,是被自己模型写代码省下的成本托起来的。
不过成本降低20%和提升15%生成效率这两个数字,似乎跟降价80%匹配不上。
根据OpenAI的投资人披露,该企业单季营收57亿美元,同比增长约3倍;经营性亏损93亿美元,当期现金消耗(实际烧掉的现金)37亿美元,相当于每赚1美元收入就要烧掉约0.65美元现金。当季研发支出高达86亿美元,整体毛利率仅39%。
并且市场预测,OpenAI在2026年的全年经营性亏损约为140亿美元。
因此,无论如何OpenAI发布的技术报告内容如何,如果没这条斩杀线,这笔效率红利大概率会先进利润表,而不是变成用户账单上的折扣。
Anthropic也有相似的反应。Claude Opus 5发布后,其定价改为了5美元/25美元,正好是Fable 5的半价。Sonnet 5首发优惠价2美元/10美元,比标准定价低了三分之一,优惠期一路延到8月31日。
随着DeepSeek斩杀线的发酵,Anthropic在8月10日宣布,将Sonnet 5的优惠价格变为永久价格,再也不会恢复成为原价格。
谷歌7月21日一口气发三款 Gemini Flash 轻量模型,主力款3.6 Flash当天宣布输出价永久下调17%。
国内更是放血式促销,8月11日,智谱把GLM Coding Plan全员额度重置回满,再叠1.5倍限时加成;火山引擎给 GLM-5.2开出四倍折扣系数,49元的套餐能换到五千多万token;OpenRouter上GLM-5.2的三家供应商互相压价,从60%打到80%,再到95%。
02 反直觉,斩杀线其实会越来越低
逃避斩杀线的路有两条:一条往下走,一条往上走。
往下走是防御,是承认自己在这个区间和DeepSeek没有本质区别,只能拼价格。往上走是进攻,是只要能力足够强、DeepSeek够不到,就根本不在斩杀线的杀伤范围内。
在DeepSeek的斩杀线之上可以继续收溢价,因此,诸如GPT-5.6 Sol、Kimi K3、Claude Fable 5,这些真正站在金字塔尖的旗舰模型,一个都没降价。
以Kimi K3为例,于2026年7月16日正式上线,本身就发布在DeepSeek V4 Flash之后,其 API 定价为:国际版输入3美元/百万token、输出15美元/百万token;国内版输入20元/百万token、输出100元/百万token。
对比上一代旗舰K2.6,K3国内版的输入价格上涨了208%,输出价格上涨270%
但是有个事得提前说明白,如今已经2026年过半了。DeepSeek V4 Flash的总参数量为284B,这在当下其实是一个非常轻量的模型,它的定位是“高效率地完成大多数任务”。
Artificial Analysis的智能指数里,V4 Flash只得了50分,明显低于 Kimi K3、GPT-5.6和Claude Fable 5。
这就使得在复杂推理、长链路任务、多步规划、需要深度领域知识的判断,这些超级硬核的任务上,DeepSeek V4 Flash的完成率和可靠性,远不如头部模型。
斩杀线扫过的是“够用就好”的那片海,在“必须万无一失”的那片土地上,DeepSeek暂时还过不去。
不过这个斩杀线其实也维持不了多久,因为“推测解码”越来越成为了主流。这也是为什么,所有大厂都要研发旗舰模型的同时,开发一款极其便宜的小模型。
所谓推测解码,是指2022年时,谷歌Research团队的亚尼夫·利维坦(Yaniv Leviathan)、马坦·卡尔曼(Matan Kalman)和约西·马蒂亚斯(Yossi Matias)曾在论文《通过推测解码实现Transformer的快速推理》(Fast Inference from Transformers via Speculative Decoding)中提出,用一个小模型快速出草稿,大模型只负责并行验证和修正,草稿命中率一旦稳定在80%以上,旗舰模型的有效推理成本就能降到原来的1/3到1/5。
但以前这项技术不太能降低成本,原因在于以前给旗舰模型配草稿,用的是7B、13B的通用超小模型,命中率上不去,所以价格就打不下来。
可推测解码仍然是业内公认最可行的方向,这才使得大家都备有一款小模型。
现在来看,推测解码逐渐走向成熟。2026年6月DeepSeek发布了DSpark推测解码模块,并部署到V4 Flash和V4 Pro的线上流量,在相同吞吐下单用户生成速度提升了60%到85%,这也直接造成了DeepSeek的大幅降价。
随着DSpark的成功,势必会有越来越多的厂商部署推测解码,以实现更快更便宜的效果。
除了推测解码外,还有一个技术也可能会降低模型成本,那就是静态知识剥离。
这个技术其实起源更早,它是Meta AI的帕特里克·刘易斯(Patrick Lewis)等人在2020年论文《面向知识密集型NLP任务的检索增强生成》(Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks)中提出的。
简单来讲,它就是让模型在思考的过程中,把事实性知识从参数中拆出去,只靠外部检索补充。这样整个思考过程就会更快,成本因此更低,并且由于外部引入知识,还能让输出结果幻觉更少。
不过真正把这个技术发扬光大的依然是DeepSeek。2026年1月,DeepSeek联合北大发表论文《通过可扩展查找实现条件记忆》(Conditional Memory via Scalable Lookup)。
论文的观点是,语言建模本质上包含两类完全不同的任务,一类是需要深度动态计算的组合推理,另一类是检索静态知识,但Transformer把这两件事混在一起做了。
于是论文就依照静态知识剥离的逻辑提出了一个叫做Engram的技术。
打个比方,在考试的时候,让大模型背下所有公式、历史年份、名人身份、地理常识。然而这就导致大模型只能用一部分的脑容量来解题。背得越多,能用来思考的脑容量就越少。
Engram干的事就是把闭卷考试改成开卷考试。它在模型中间插了一本“速查手册”,遇到 “戴安娜王妃是谁”、“张仲景是什么朝代的”这种事实性问题,不用现场一层层推导,直接翻手册,一秒查到。
这样,模型的脑容量就可以全部用来做真正需要动脑筋的事,比如解数学题、写代码、做逻辑推理。
Engram一旦成熟,也将大幅减少模型成本。
03 DeepSeek V4 Pro真的发布了吗?
随着DeepSeek V4 Pro的更新,网上最大的声音便是质疑。因为这次更新和DeepSeek V4 Flash正式版的更新方式截然不同,V4 Flash正式版有完整的官方更新日志,明确标题“DeepSeek-V4-Flash更新”,列出了9项基准测试的具体分数。最关键的是,DeepSeek会注明“模型结构、尺寸和Preview保持一致,仅重新进行了后训练”这些细节。
可截止发稿,DeepSeek V4 Pro正式版相关的发布痕迹也只有三处:官网的“模型 &; 价格”页面、官网首页出现一句简短的滚动公告、一张跑分表。
甚至就连官方的更新日志,也停留在DeepSeek V4 Flash正式版上。

除了这些迹象外,权威评测机构Artificial Analysis上线了V4 Pro 0813(最大推理强度)的独立评测页,综合智能指数为53 分。相比预览版的45分确有提升,和GLM-5.2齐平。
但问题在于,53分这个档位和Fable 5差了很远,无法匹配跑分表中的“接近甚至超过Fable 5”。
作为参照,同一天发布的Grok 4.6还拿到了61分。

不只是Artificial Analysis,在比较模型数学能力的Proof Bench上,作为靠数学能力而声名鹊起的DeepSeek,其V4 Pro正式版甚至连前10都没有挤进去。

更有一些个人评测者对V4 Pro正式版进行了深度的测试,均表示实测效果皆不尽人意。
AI博主牙医就发文表示“刚发的DeepSeek-V4-Pro-0813好像的确有问题。reasoning_effort=max的时候模型在长程 AgenticCoding 任务下更倾向于早停。”
他进一步表示,“我这个测试总计50轮, 让模型不断优化代码, 结果他在3次测试中, 2次都在42-43轮左右的情况下停止了. 并未用完全部机会. 而且目前成绩来看, 甚至没打过 GLM-5.1 (仅我这一个case, 我不对其它case负责).”

以最常见的“鹈鹕测试”为例,提示词为“Generate an animated looping SVG of a pelican riding a bicycle. Wheels spin, pedals move, pelican’s legs pedal correctly, smooth infinite loop, no javascript, use native SVG animateTransform only.”(生成一个循环动画SVG:鹈鹕骑自行车。轮子旋转、踏板转动、鹈鹕的腿正确踩踏板,平滑无限循环,不要JS,只用SVG原生animateTransform动画。)
我将相同的提示词分别发给DeepSeek V4 Pro正式版和Flash正式版,结果发现,反而Flash做的效果远远超过了V4 Pro,无论是鹈鹕的动作还是背景中的云彩,V4 Flash正式版均比Pro正式版更好。
0813这个版本号本身可能只是一个“占位符”。
换句话说,DeepSeek可能并没有直接上线新模型,或者是有意去压制新模型的能力,先把坑占上了,等后续做好准备再上线,这样就不用担心一瞬间超高并发挤爆服务器了。
此前,DeepSeek Harness负责人崔添翼曾透露,DeepSeek V4 Pro的正式版将和DeepSeek Harness同时上线。而8月13日这天,是DeepSeek Harness的最后一次测试。
在DeepSeek Harness内测群中就有这样一条消息,0813版本计划发布DeepSeek Harness的公测版。

目前看来该Harness产品还未发布,并且DeepSeek V4 Flash之前的测试中,就有很多成绩是DeepSeek Harness上跑出来的。那么结合官方群里的跑分表,尤其是在Terminal Bench这样的测试集上,使用的可能就是传说中的DeepSeek Harness。
模型的斩杀线会下降,但DeepSeek Harness可能会带来新的斩杀线。
2026年5月,DeepSeek Harness内部立项,独立组建专项核心团队,由崔添翼负责。8月2日,崔添翼面向全球公开征集Harness内测用户,优先筛选具备Agent Harness开源项目经验的开发者。8月11日,“DeepSeek Harness团队”微信公众号完成注册,认证主体是深度求索北京分公司。
在V4 Flash正式版的API文档中有这么一段内容,对于公开基准测试中的Code Agent任务,正式版用的是DeepSeek Harness极简模式作为框架进行测试。
也就是说,V4 Flash能拿下Terminal Bench 2.1的82.7分,严格来说是“DeepSeek模型+DeepSeek Harness测试框架”的组合成绩,不是纯模型裸分。
V4 Flash预览版在Terminal Bench 2.1上是61.8分,同期V4 Pro预览版是72.1分。显然,DeepSeek Harness在Agent任务上,给DeepSeek模型带来了质的飞跃。
82.7分其实是一个非常高的分数。Terminal Bench 2.1目前的SOTA是GPT-5.6 Sol的88.8分,Kimi K3是88.3分,Claude Opus 5是84.3分,所有参评模型的平均分是77.3分。
正如前文提到的,V4 Flash是一个轻量模型,和Fable 5、GPT-5.6 Sol对比的应该是旗舰模型V4 Pro。那么可想而知,一旦DeepSeek Harness和V4 Pro正式版上线,势必会迎来一个新的斩杀档位。
更值得注意的是,国内玩家已经全部挤进了这条赛道。
除了DeepSeek外,智谱的ZCode也是一款Coding Harness,只不过它针对的是智谱自家的GLM,8月11日一口气上线了Goal、Subagents、Remote Control、闲时任务四大功能。
在智谱自研的Code Bench中,在复杂跨文件任务上,GLM-5.2配合ZCode,要比GLM-5.2配合Claude Code,整体通过率高出2.39 %,缓存命中率超过98%,有效 token 量提升约30%。
西红柿在涨价、鸡蛋在涨价、糖在涨价,结果西红柿炒鸡蛋反而便宜了。可是我们都清楚,这个逻辑是有问题的,至于它会持续多久,没人说得明白。
作者:苗正 编辑:王靖
本文由人人都是产品经理作者【字母榜】,微信公众号:【字母AI】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。
题图来自 Unsplash,基于 CC0 协议。
- 目前还没评论,等你发挥!

起点课堂会员权益




