DeepSeek V4 Pro 遇上 Grok 4.6,新一轮模型竞争开始 比什么?

0 评论 297 浏览 0 收藏 23 分钟

DeepSeek V4 Pro 与 Grok 4.6 同期亮相,引发新一轮大模型竞赛讨论。本文基于公开材料,深入解析两款模型的技术升级、能力边界与产品策略,揭示大模型从对话走向任务执行的关键转折,为产品经理提供决策参考。

这两天,DeepSeek V4 Pro 和 Grok 4.6 同时进入讨论中心。有人忙着转发跑分,有人已经开始问哪个模型更强,也有人把它们理解成中美大模型竞争的新一轮正面对决。

我把两家公司的官网、模型文档、更新记录和公开报道重新对了一遍,先发现了一个容易让文章出错的地方。

DeepSeek V4 系列在 2026 年 4 月 24 日已经发布预览版,其中包括 V4 Pro 和 V4 Flash。7 月 31 日,DeepSeek 正式更新 V4 Flash,同时说明 V4 Pro 正式版随后推出。截至本文核对时间,DeepSeek 官网尚未把 8 月 11 日列为 V4 Pro 的全新首发日期。

Grok 4.6 的情况更特殊。多家海外财经媒体在 8 月 12 日报道了它的发布,称其面向长时间运行的智能体和复杂任务。SpaceXAI 官网的新闻页、模型文档和开发者更新记录目前仍以 Grok 4.5 为最新正式条目,Grok 4.6 的完整模型卡、价格页和测试方法尚未同步。

这意味着,眼下能做的是一份基于公开材料的综合分析。DeepSeek V4 Pro 有模型卡、技术报告和官方测试数据,可以评估得更具体。Grok 4.6 需要以媒体报道为线索,再用已正式开放的 Grok 4.5 作为能力与价格基线。任何把二者写成完整亲测,并给出精确胜负的文章,此时都跑在证据前面。

不过,这并不妨碍我们回答一个更值得产品经理关心的问题。为什么两家公司都在这个阶段继续推出更强模型,它们真正争夺的又是什么。

我的判断是,大模型正在从对话产品进入任务执行阶段。模型厂商需要同时解决能力、速度和成本之间的矛盾,还要争夺开发者入口。DeepSeek V4 Pro 与 Grok 4.6 选择了不同路径,却都在为同一件事服务,让模型承担更长、更复杂、能够产生业务结果的工作。

Part.01 DeepSeek V4 Pro 到底更新了什么

DeepSeek V4 Pro 是一个混合专家模型。官方模型卡显示,它有 1.6 万亿总参数,每处理一个 Token 激活约 490 亿参数,支持 100 万 Token 上下文。它保留了 DeepSeek V3 使用的混合专家框架与多 Token 预测方法,又增加了混合注意力、受约束的超连接和新的优化器。

参数听起来很大,产品价值要落到用户能做什么。

100 万 Token 上下文意味着模型可以在一次任务里读取更大的代码仓库、更长的合同集合或更多研究材料。长上下文过去经常遇到两个问题。内容放得越多,显存占用越高;模型虽然读进去了,却未必能准确找到散落在前后位置的关键信息。

DeepSeek 给出的方案是混合注意力。它结合两种压缩方式,减少模型处理长序列时需要保留的信息量。按照官方技术说明,在 100 万 Token 条件下,V4 Pro 单 Token 推理所需计算量约为 V3.2 的 27%,KV Cache 约为后者的 10%。KV Cache 可以理解为模型阅读长内容时保留的临时记忆。它占用越少,同样的硬件就越有机会服务更多请求。

这项变化直接影响产品。企业过去想让模型分析整个代码库,往往要先切块、检索,再反复拼接上下文。百万上下文不能取消检索,也不能保证模型记住每个细节,但它能让团队减少一部分切分工作,并把更完整的任务状态留在一次会话中。

V4 Pro 还把推理分成三个档位。Non Think 面向日常低风险任务,Think High 用于复杂规划,Think Max 允许模型投入更多计算完成高难度任务。产品可以根据任务风险选择计算预算。改一句标题无需让模型长时间思考,检查大型代码仓库则可以提高推理档位。

这种设计比单纯追求最高跑分更接近真实软件。用户需要的是不同任务对应不同成本。模型永远以最高强度运行,响应会慢,账单也会迅速增加。

Part.02 DeepSeek V4 Pro 的公开表现怎样

DeepSeek 在模型卡中给出了多组官方测试结果。V4 Pro Max 在 LiveCodeBench 上得到 93.5,在 SWE Bench Verified 上解决 80.6% 的任务,在 Terminal Bench 2.0 上得到 67.9。它在 GPQA Diamond 上达到 90.1,在百万上下文测试 MRCR 中达到 83.5。

这些数字表明,V4 Pro 的强项集中在代码、数学、长上下文和工具任务。它已经进入顶级闭源模型所在的能力区间。在更困难的 SWE Bench Pro 中,V4 Pro 得到 55.4,说明面对真实代码仓库中更复杂的修改任务,能力仍有明显上升空间。

知识准确性也存在边界。V4 Pro Max 在 SimpleQA Verified 上得到 57.9,DeepSeek 同一张对比表中的 Gemini 3.1 Pro 为 75.6。模型会写复杂代码,不等于它能稳定回答所有事实问题。用它做报告、咨询或行业研究,联网检索和来源核对仍然必要。

官方跑分还需要谨慎阅读。不同公司会使用不同提示词、推理预算和智能体框架。同一个模型换一套工具或增加重试次数,成绩可能明显变化。DeepSeek 已公布测试设置,这提高了材料的可读性,但第三方复测仍是判断稳定性的必要一步。

如果从产品角度给 V4 Pro 下一个阶段性评价,我会把它概括为四点。

这里最容易被忽略的是最后一项。DeepSeek V4 Pro 的参数规模和长上下文很醒目,它依然是文本模型。通用助手正在向语音、图像和屏幕操作发展,V4 Pro 在这部分需要依靠外部模型或应用层组合。

Part.03 Grok 4.6 现在能确认什么

截至本文完成时,Grok 4.6 的官方材料还不完整。媒体报道将它描述为面向长期运行智能体和复杂任务的升级,并称其能力较 Grok 4.5 有所提高。由于 SpaceXAI 尚未公开完整模型卡,这些信息应当保留来源归属,不能直接当成已经复核的产品参数。

能够确认的基线来自 7 月发布的 Grok 4.5。SpaceXAI 将它定位为编程、智能体任务与知识工作模型,支持文本和图片输入,拥有 50 万 Token 上下文。官方给出的 API 价格为每百万输入 Token 2 美元、输出 Token 6 美元,输出速度约为每秒 80 Token。

Grok 4.5 的重点不只在模型本身。它已进入 Grok Build、Cursor 和 SpaceXAI 开发者平台,还能与 Word、PowerPoint 和 Excel 等办公工具结合。模型生成答案之后,产品继续让它改代码、做表格或制作演示文稿。

SpaceXAI 官方介绍显示,Grok 4.5 的强化学习训练覆盖大量多步骤软件工程任务,智能体可以运行较长时间。公司同时强调 Token 效率。以其公布的 SWE Bench Pro 测试为例,Grok 4.5 平均输出 Token 数少于部分对手。这个指标对开发者很重要,模型完成同一任务所走的步骤越少,响应时间和调用费用就越容易控制。

如果媒体对 Grok 4.6 的描述最终被官方材料确认,它的升级重点大概率会沿着这条路线继续。模型需要在较长时间里保持目标,调用工具后能根据结果修正计划,并减少无效步骤。这里的“大概率”是一项推断,最终仍要等待模型卡、API 入口和可复现评测。

Part.04 两个模型该怎样比较

在现有材料下,给两者排出一个总分没有意义。它们的开放状态不同,能够验证的数据量也不同。更合理的办法是看产品路线。

DeepSeek 的优势在开放、长上下文和部署选择。开发团队可以下载模型权重,研究它的架构,也可以通过 API 接入。企业对数据和部署有更高控制要求时,这条路线更有吸引力。

Grok 的优势来自分发和工具环境。它能进入 X 的实时信息场景,又通过 Grok Build、Cursor 和办公软件接近开发者的工作。模型能力只要达到前沿区间,产品入口就可以放大使用频率。

两家公司也有各自的压力。DeepSeek V4 Pro 规模很大,开放权重不等于普通企业能够低成本私有部署。企业还要准备硬件、推理框架和运维团队。Grok 的闭源路线降低了接入难度,却让客户更依赖供应商的价格、额度和安全政策。Grok 过去在内容安全与回答稳定性上出现过争议,新版本仍需要观察这些问题有没有改善。

Part.05 这场测评暂时不能得出什么

现阶段最容易出现的误判,是把不同公司公布的跑分直接放在一张排行榜上。DeepSeek 公布的 LiveCodeBench 和 SWE Bench Verified 结果来自它的测试设置,SpaceXAI 对 Grok 4.5 的编程评测也使用了自己的工具、推理预算和运行环境。模型名称相同,只要工具权限、重试次数或时间上限改变,结果就可能不同。

评估长上下文时,一百万 Token 也只是容量指标。真实体验还取决于信息召回、指令遵循和输出稳定性。模型可以读入一整套项目文档,却可能遗漏中间的一项限制条件。用户最后需要手动核对多少内容,会直接影响这项能力的价值。

价格也不能只比每百万 Token 的标价。一个便宜模型若需要多次重试,单次任务总成本依然可能很高。一个单价较高的模型若能减少人工确认和错误修复,整体费用反而可能更低。产品经理应把模型费用、工具调用、服务器时间和人工复核放在同一项任务中计算。

因此,本文只给出阶段性结论。DeepSeek V4 Pro 的技术信息更完整,可以确认它对长上下文、代码和推理成本做了系统更新。Grok 4.6 的产品方向已经出现,具体能力和边界需等官方材料与独立测试确认。读者可以先把它看作一项待验证的新选项,不必急着替换已经稳定运行的模型。

Part.06 为什么偏偏在这个阶段发布

讨论发布时间,不能只看公司想抢热搜。模型行业正在发生几项可以观察到的变化,它们共同推动新版本加速出现。

对话能力已经很难单独形成差异

两年前,能自然对话、写文案和总结资料就足以让用户惊讶。现在,ChatGPT、Claude、Gemini、豆包、千问、Kimi 和腾讯元宝都能覆盖这些基础任务。普通用户很难仅凭一次聊天判断模型之间的差距。

竞争因此进入更复杂的任务。模型要读取完整项目,使用搜索和代码工具,执行多轮操作,最后交付可以继续使用的文件。DeepSeek 把百万上下文与智能体测试写进 V4 的核心叙事,SpaceXAI 把 Grok 放进编程工具和办公软件,两者都在回应同一变化。

推理成本开始约束产品增长

智能体比聊天更贵。一次普通问答可能只调用模型一轮,一个编程智能体会读文件、修改代码、运行测试,再根据报错继续修改。任务持续时间越长,Token、工具和服务器消耗越多。

产品团队已经不能只问模型够不够聪明,还要计算一次成功任务花多少钱。DeepSeek 用混合专家架构和压缩注意力降低长上下文成本,Grok 4.5 则强调速度与 Token 效率。两条技术路线最终都要反映在一项经营指标上,每完成一次用户任务需要支付多少推理费用。

这也是模型频繁推出 Pro、Flash、High、Max 等档位的原因。企业可以把简单任务交给便宜模型,困难任务再切到高推理档位。路由设计逐渐成为 AI 产品的一部分。

开发者入口正在快速集中

模型公司需要更多开发者在自己的 API 上构建产品。开发者一旦完成接入、评测和数据迁移,更换模型会产生工程成本。谁能先进入代码工具、办公软件和企业系统,谁就更容易留下持续调用量。

DeepSeek 同时兼容 OpenAI 与 Anthropic 的接口形式,降低迁移难度。SpaceXAI 让 Grok 进入 Cursor、Grok Build 和云平台。发布新模型可以吸引开发者重新测试,也能推动原有客户升级默认模型。

中美公司面对的资源条件不同

DeepSeek 需要在算力限制和国内部署需求下证明,高水平模型能够用更高效的架构运行。开放权重还能扩大研究和产业使用范围。V4 Pro 的价值因此不仅来自跑分,还来自百万上下文、稀疏激活与更低缓存占用能否在真实部署中成立。

SpaceXAI 拥有大规模 GPU 集群,又有 X、Grok 和开发工具作为分发入口。它需要证明投入的大量算力能转化成高频任务与持续收入。Grok 4.6 若强化长时间智能体能力,就能进一步连接编程、办公和企业自动化场景。

Part.07 它们与上一代模型有什么不同

DeepSeek 的变化比较清楚。V3.2 已经支持思考模式和智能体能力,V4 把上下文扩展到 100 万 Token,并通过新的注意力结构控制成本。Pro 与 Flash 形成两档模型,前者承担知识和复杂任务,后者覆盖高频调用。推理模式也从一个开关变成多档预算。

这使 DeepSeek 的产品形态更像一组可调度的计算资源。团队可以先用 Flash 处理分类、改写和简单工具调用,遇到仓库级代码或复杂研究任务再切换 Pro。模型选择开始由任务价值和失败风险决定。

Grok 4.5 相比早期 Grok,已经从强调实时信息与表达风格,转向软件工程和任务执行。它拥有更长上下文、图片输入、工具调用和可调推理强度。若 Grok 4.6 最终确认强化长期智能体,它与上一代的差距应当体现在连续工作的稳定性,而非聊天时偶尔给出更漂亮的回答。

判断这种升级,可以看四个结果。任务中途偏离目标的比例有没有下降,调用工具失败后能否恢复,完成任务所需 Token 是否减少,用户介入次数有没有降低。这些指标比一张总榜更接近真实产品体验。

Part.08 产品经理应该怎样测这两个模型

目前最不建议的测法,是让两个模型写一首诗、回答一道脑筋急转弯,再凭语气决定胜负。这样的测试重复性很差,也无法对应产品需求。

一套可执行的评测可以从真实任务开始。比如让模型阅读一个中型代码仓库,定位一项缺陷并提交修改;或者提供若干份公开报告,要求它形成带来源的结论。每类任务至少准备成功案例和容易失败的边界案例,并固定提示词、工具权限与时间上限。

产品团队可以记录下面这些指标。

DeepSeek V4 Pro 还应单独测试百万上下文的有效利用。把同一组关键信息放在文档前部、中部和末尾,观察模型能否稳定找回。随后增加无关材料,查看答案是否受到干扰。能够输入 100 万 Token 只说明容量,能够准确使用这些信息才说明产品价值。

Grok 4.6 在官方开放后,应重点测试长时间任务。让智能体连续运行一到数小时,记录它是否重复调用工具、是否忘记初始目标,以及失败以后会不会扩大错误。SpaceXAI 如果公布更高的智能体跑分,这些测试能验证提升是否进入普通开发者的使用环境。

Part.09 谁更适合什么产品

需要开放权重、中文任务、长文档分析和可控部署的团队,可以优先评估 DeepSeek V4 Pro。它尤其适合代码平台、知识管理和研究工具。团队要接受一个现实,超大模型的私有部署费用并不低,很多公司最终仍会选择 API 或经过压缩的小版本。

已经使用 Cursor、X 数据或 SpaceXAI 工具的团队,可以关注 Grok 4.6 的正式开放。它的潜在优势集中在编程智能体、实时信息和工具执行。如果产品涉及高风险内容、企业数据或公开发布,还要增加安全测试,不能只看开发效率。

普通用户无需急着在两个模型之间二选一。DeepSeek 的网页与应用版本是否切换到 V4 Pro,要以官方更新为准。Grok 4.6 是否进入免费版、SuperGrok 或 API,也要等待正式方案。模型发布和用户真正获得能力之间,经常隔着灰度开放、额度限制与产品适配。

Part.10 这轮发布真正改变了什么

DeepSeek V4 Pro 最值得关注的地方,是它尝试让百万上下文、前沿代码能力和开放权重同时成立。Grok 4.6 若按媒体报道强化长期智能体,则代表 SpaceXAI 继续把模型推向能够持续工作的软件角色。

两条路线最后会在同一个用户任务上相遇。用户给出目标,模型读取大量上下文,调用外部工具,经过多轮执行后交付结果。模型公司要让这套过程足够稳定,也要把成本压到用户愿意持续支付的范围。

未来三到六个月,我会观察三件具体的事。DeepSeek V4 Pro 正式版何时开放以及应用端是否切换,Grok 4.6 的官方模型卡与 API 何时出现,第三方长任务评测能否复现两家公司宣称的提升。如果这些指标成立,新一轮竞争会继续推动 AI 从辅助回答进入任务交付。

对产品经理来说,眼下最值得做的动作很简单。选一个团队每周都会遇到的复杂任务,保存当前模型的成功率、耗时和成本。新模型正式开放以后,用同一套数据重新测试。版本名称可以制造关注,稳定多完成一个真实任务,才值得改默认模型。

本文由 @广赢 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自作者提供

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
评论
评论请登录
  1. 目前还没评论,等你发挥!