腾讯猛踩油门,混元追赶的127天

0 评论 176 浏览 0 收藏 16 分钟

腾讯混元Hy4 preview发布,总参数达770B,代码与推理能力跃升,逼近头部模型。其加速秘诀在于“实战闭环”:以preview机制收集真实反馈,借Co-Design整合专家知识,并通过WorkBuddy等多产品矩阵构建训练场,让每一次发布都成为能力进化的催化剂。

8 月 28 日,腾讯混元发布并开源 Hy4 preview。

从今年 2 月重建预训练与强化学习基建算起,混元把大版本的迭代周期,压缩到两个月左右。

这已经接近 Anthropic、OpenAI、智谱等头部模型厂商的更新频率。

差别在于,腾讯是在重建地基的同时跑出了这个速度。

版本间隔在缩短,混元能力跃升的幅度也在持续变大。

Hy4 preview 总参数达到 770B,是 Hy3 的 2.6 倍;激活参数从 21B 提升到 49B,上下文从 256K 扩展到 1M。

图注:Hy4 preview在各项benchmark的评分表现

7 月初,Hy3 在软件工程实战基准 DeepSWE 上拿到 28.0 分,同期 Claude Opus 4.8 是 58.0。

不到两个月,Hy4 preview 在同一项测试上拿到 64.3,超过 DeepSeek V4 Pro 的 62.7。

同一天公布的Terminal-Bench 2.1 上,Hy4 preview 拿到 85.4 分,与 Claude Opus 5 持平。

如果把 Hy3 preview 以来的三个版本放在一起看,混元在多项主流 benchmark 上都画出了一条显著上升的曲线。

总的来说,混元整体仍在追赶阶段。但在更接近真实生产力的任务上,混元实打实追赶上来了,尤其是长上下文任务、代码库重构、专业科学推理等方面。

那么,猛踩油门的腾讯混元,它的“加速度”究竟从何而来?

1、每一次发布,都是实战

Hy4 preview 发布当天,WorkBuddy 和 CodeBuddy 同步开启两周免费体验。

混元团队在说明中提到:“如同 Hy3 preview,我们希望通过 Hy4 preview 的尽快发布获得广泛的真实反馈,从而显著提升 Hy4 正式版。”

同一套流程,混元已经走过一遍。

4 月 23 日,Hy3 preview 开源上线,同时接入元宝、WorkBuddy、CodeBuddy、ima 和 QQ 等多个业务产品。

三个月后,Hy3 正式版发布。团队表示,Hy3 preview 已在 50 多个业务中获得广泛反馈,修复了大量体验问题;正式版在此基础上,进一步提升后训练数据的质量与多样性,并扩大了强化学习的算力规模。

变化体现在核心指标上。

对比preview版,Hy3 正式版的幻觉率从 12.5% 降到 5.4%,常识错误率从 25.4% 降到 12.7%,多轮对话问题率从 17.4% 降到 7.9%。

这不是单靠增加参数就能解决的。

模型在真实任务里会犯一些非常具体的错误。比如忘记用户几轮前提出的限制,工具调用失败后盲目重试,任务已经完成却不知道什么时候该停等等。

只有把模型放进产品,让它持续面对真实用户,再把失败过程拆开,找到问题发生在哪一步,补充正确的任务轨迹和判断标准,错误才可能被一条条纠正。

Preview 不是一个版本标签,而是将真实使用纳入模型研发的行业机制。

早在 2022 年,OpenAI 就把 ChatGPT 作为 research preview 推向公众,希望借此收集用户反馈,了解模型在真实世界中的优势与局限。后来的 o1-preview、GPT-4.5,也延续了相似的发布方式。

OpenAI 将其称为“迭代式部署”:不是等系统在实验室里变得完美再推出,而是让一个仍有不足的版本受控地进入真实世界,再根据实际使用不断修正。

如今,分阶段开放、早期测试和 preview-first,已经成为前沿模型常见的研发机制。

每一次 preview 都不只是一次产品公测,也是一次大规模实战。

正如混元团队所说,Hy3 preview 是混元从读万卷书到行万里路的开端。

2、实战反馈,如何变成模型能力

发布大模型只是第一步。

它能不能真的进步,取决于收回来的是什么,以及这些东西能不能变成有效的训练材料。

Hy4 preview 的官方说明里,有一句容易被略过的话:模型能力的提升,来自与腾讯内部软件工程、游戏、金融、安全等领域专家的高质量数据共建。

Hy3 时期,重点是与 CodeBuddy、WorkBuddy 等产品深度协同,把真实任务中的用户反馈和失败案例送回训练环节。

到了 Hy4 阶段,在产品反馈之外,来自各个专业领域的专家共建被放到了更靠前的位置。

这是两个不同层次的反馈。

用户告诉模型“哪里不好用”,专家告诉模型“什么才算真正做好”。

一个金融分析任务,普通用户可能只能判断最后的报告能不能用;专业人士则可以进一步判断统计口径是否一致、证据链是否完整、风险提示是否充分。

一个软件工程任务,测试通过不等于代码可以合入,工程师还会看架构、可维护性、性能和潜在回归。

让产品反馈和专家判断组织起来,参与模型训练的方法,腾讯内部叫 Co-Design。

什么信息该给模型,什么时候给,以什么结构给;模型可以调用哪些工具,怎样判断任务完成,失败后又该如何恢复——这些都不是模型团队关在实验室里能独立想明白的。

Co-Design 做的,是让多方一起定义问题,而不是等模型训练完成,再由产品接上一个 API。

混元内部还建立了 50 多套评测,用真实考题、人工评测和产品众测进行验收,不再把外部排名作为唯一标准。

姚顺雨的判断是,真正有价值的进步来自产品侧回流的真实 Prompt 分布:模糊提问、多轮追问、省略表达、隐含意图、前后矛盾,以及用户自己都没有完全说清楚的需求。

用户提供问题分布,专家提供质量标准,产品提供任务环境,模型团队再把三者变成后训练和评测体系。

这才是反馈真正转化成模型能力,实现Co-Design loop的全过程。

3、腾讯的Agent产品矩阵,混元的训练场

WorkBuddy 的界面上,摆着多个厂商的十余款模型。

混元、DeepSeek、GLM、Kimi、MiniMax,用户点一下就能切换,没有唯一选项。

这给混元设置了一个比内部评测更直接的考场。

每一次切换都是一次投票。每一次重复使用也是一次投票。

结果是 Hy3 留住了用户。

今年 7 月 8 日,Hy3 正式版在 WorkBuddy 上线后,调用量一度把算力打满。当天下午排队率超过 50%,团队紧急扩容。原定两周的免费体验,也因为需求过大延长到了 8 月底。

自上线 WorkBuddy 以来,主动选择 Hy3 preview 的用户数量增长了 6 倍。接入 Hy3 正式版后,WorkBuddy 内部测评的任务成功率从 72% 提升到 90%,平均耗时缩短 34%。

这些数字至少证明了一件事:

模型在内部评测中获得的提升,有一部分转化成了用户能够直接感知的体验。

用户选择只是结果。

对模型研发更重要的是,用户为什么选择它,又为什么放弃它。

在多模型共存的产品里,混元获得的不只是一句“好用”或者“不好用”,而是一组带有对照关系的反馈:

同一个任务,不同模型用了多长时间,采取了什么路径,调用了哪些工具,在哪一步失败,用户最终接受了哪一个结果。

这让 WorkBuddy 不只是混元的考场,也成了它的训练场。

WorkBuddy 只是其中一个入口。

混元已经接入腾讯内部百余个业务场景。腾讯也在推动企业微信、腾讯文档、ima、腾讯会议和 iwiki 与 WorkBuddy 进一步打通。

入口越多,模型面对的任务类型越丰富;工具越多,模型能完成的任务链条越长;任务链条越长,暴露出来的问题也越接近真实生产。

对拥有产品矩阵的公司来说,优势不只是用户多,而是环境多。

元宝提供搜索和对话,CodeBuddy 提供代码库和开发工具,WorkBuddy 提供本地文件与办公流程,ima 提供知识库,腾讯会议和企业微信则提供协作上下文。

这些产品提供的环境不同,但模型在其中习得的能力可以迁移。

搜索中练出来的信源判断,可以用于研报分析;编程中练出来的规划、调试和验证,可以迁移到办公任务;长文理解中练出来的上下文管理,又可以帮助模型完成跨文件协作。

单个产品只能提供一种反馈。产品矩阵提供的是一整套能力进化的环境。

4、把实战闭环搬进模型内部

到这里,混元的加速逻辑已经形成了一条外部闭环:

模型进入产品,用户和专家提供反馈,反馈被加工成训练与评测材料,再进入下一个版本。

Hy4 preview 往前又走了一步。

它开始把同样的循环搬进模型研发内部。

产品侧的循环是“发布—使用—反馈—改进”;模型内部的循环则是“提出方案—运行实验—读取结果—继续修改”。

前者由模型、产品和专家共同完成,后者开始由模型参与执行。

用 AI 优化 AI,并不是 Hy4 独有的方向。

随着编程 Agent 的长程执行能力增强,越来越多模型开始参与训练框架、GPU 算子、编译器和芯片设计等研发任务。行业正在从 AI for Coding,走向 AI for AI。

Hy4 preview 的不同之处在于,它开始参与一条与自身研发直接相关的链条:训练方法、数据策略、评估体系和底层算子的自动优化。

这虽然远不是严格意义上的“自己训练自己”,但模型与研发对象之间的距离,已经缩短了一步。

一个直接结果是,Hy4 preview 首次给自己的推理系统做了一次优化。

模型先分析系统瓶颈,再围绕算子融合、通信优化等方向提出方案,运行实验,根据日志继续调整。最终,端到端吞吐相对基线提升了 31.8%,而且在不同上下文长度和并发度下都获得了稳定收益。

简单说,同样一套算力,现在可以承接更多请求。

模型不只是被部署到基础设施上,也开始参与改造承载自己的基础设施。

在一个小模型后训练任务中,Hy4 preview 作为 researcher 协调多个 Codex Session,并行优化多个评测目标,8 项评测全部优于 Codex 独立探索。

过去,这些工作主要由研究员完成:提出假设、修改代码、启动实验、阅读日志、比较结果,再决定下一轮怎么做。

现在,模型自身也开始进入这个闭环。

5、实战驱动的加速度

回过头看,这也解释了混元这半年的加速度。

它不是只靠一次更大规模的预训练,把模型憋到足够强再发布。

它把发布变成获取反馈的入口,把产品变成任务环境,把用户和专家的判断变成训练弹药,又开始让模型参与下一轮研发。

这条链条可以概括成四步:发布,实战,反馈,再训练。

到了 Hy4 preview,这条链又向内延伸了一步:模型开始参与改进承载自己的系统。

对腾讯而言,这款模型的意义,不只是混元又追上了一段距离,而是腾讯开始把模型、Agent产品、真实任务、数据反馈,以及推理基建组织成一个持续运转的系统。

过去,大模型竞争主要看算力、参数和文本数据。

现在,竞争正在转向另一组能力:

谁能找到真正有价值的问题,谁能构造足够真实的环境,谁能把用户、专家、产品和模型组织进同一条反馈链,以及谁能让这条链转得更快。

模型仍然重要。

决定下一次迭代速度的,还有围绕模型运转的整个系统。

文 / 吴绛枫

本文由 @深流研究所 原创发布于人人都是产品经理。未经作者许可,禁止转载

题图来自Unsplash,基于CC0协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!