小米迈向 RSI,MiMo-V2.6 正式上线,347 万美元完成一轮大规模 RL

0 评论 179 浏览 0 收藏 13 分钟

小米正式发布并开源MiMo-V2.6系列,含Pro与Flash两款原生全模态模型,并推出UltraSpeed版本,最高提供20倍输出速度。这轮训练把重心放在大规模强化学习上,团队称它可能是开源模型团队迄今规模最大的单次RL训练之一。

9 月 22 日,小米正式发布并开源 MiMo-V2.6 系列,包括 MiMo-V2.6-Pro 和 MiMo-V2.6-Flash 两款原生全模态模型。

其中,Pro 是目前 MiMo 能力最强的模型,Flash 更强调能力、效率与成本之间的平衡。小米还同步推出 MiMo-V2.6-Pro-UltraSpeed,在模型质量保持一致的情况下,最高提供 20 倍输出速度。

同时,小米还公布了 MiMo-V2.6-Pro 和 Flash 的一组 Benchmark 数据,覆盖 Coding、General、Visual 和 Cyber 四类任务,并与 GPT-6 Astra、Claude Opus 5、DeepSeek V4.1 Flash 等模型进行对比。

这次发布,小米第一次把 MiMo-V2.6 更明确地放到了 RSI 这条线上。按照小米给出的定义,MiMo-V2.6 是其探索 RSI 路径的一个关键节点:以可验证的复杂任务为基础,继续扩大强化学习算力,让模型在真实环境中反复探索、获得反馈并更新策略,逐步形成模型自我改进的闭环。

模型上线后,小米 MiMo 团队负责人罗福莉也在 X 上进一步解释了这条路线。她称,如果按照计算量衡量,MiMo-V2.6 很可能是开源模型团队迄今规模最大的单次 RL 训练之一。过去半年,小米投入数十人的团队持续研究一个问题:强化学习到底还能扩展到什么程度。

罗福莉此前已经明确表达过 MiMo 对这条路线的判断:RL 是通往模型自我改进最具扩展性、效率最高的路径之一。

MiMo-V2.6 的训练也围绕这件事展开。模型能力首先在 Mid-training 阶段建立,再通过大规模 RL 继续释放。罗福莉还提到,在她看来,这轮训练涉及的研究创新和工程挑战已经超过 DeepSeek R1,她本人此前曾参与 R1 的部分工作。

具体到训练方法,MiMo 同时使用 MixRL 和 MOPD,但两者承担的任务不同。

代码及其他具备稳定验证信号、难度适中的 Agent 任务,会被放入同一轮 MixRL 中共同训练。罗福莉称,这类混合训练表现出了较好的跨任务泛化。

游戏、3D、主观评价任务,以及难度过高或链路非常长的任务,则会拆开训练。如果直接加入同一轮 RL,可能明显降低 Rollout 效率,也会增加 Rollout Staleness。不同领域分别训练完成后,再通过 MOPD 将这些能力合并回同一个模型。

这套训练方式最终对应的仍然是同一个目标:扩大可以由模型自己探索、自己获得反馈、再继续更新的任务范围。

此前在 9 月 17 日,小米曾提前把这轮训练过程直接放到了网上。MiMo-V2.6-Pro 和 Flash 的训练 Step、Token 消耗、任务通过率、评测成绩、基础设施故障和累计费用都可以实时查看。直播早期按照页面设定的速率,两轮训练合计每小时约消耗 3.08 万美元。

到 9 月 22 日模型正式发布,两款模型分别完成 30 个 RL Step。训练汇总显示,两轮 RL 累计训练 150.5 万个样本、1564 亿 Token,总成本约 347 万美元,其中 Flash 约 85 万美元,Pro 约 262 万美元。

训练规模也比直播开始时进一步扩大。每次模型更新包含 1568 个样本,最高支持 100 万 Token 上下文,单个 Step 的训练量达到 35 亿至 37 亿 Token。训练任务覆盖代码、通用 Agent、视觉和网络安全,并混合多种 Harness;另一部分算力投入 Grader,通过 Group 内相对比较给 Long-Horizon RL 提供更细的奖励信号,同时引导模型用更短路径、更少 Token 完成任务。

两款模型拉开能力与成本档位

从最终模型看,MiMo-V2.6-Pro 和 Flash 对应了两个不同的使用档位。Pro-UltraSpeed 则进一步把输出速度拉高到普通 Pro 的最高 20 倍。

在 Artificial Analysis Intelligence Index v4.3 中,MiMo-V2.6-Pro 得分为 46.32,高于同期的 Kimi K3 和 Qwen3.8 Max。


API 价格延续 V2.5。按每百万 Token 计算,MiMo-V2.6-Flash 缓存命中输入 0.0028 美元、非缓存输入 0.14 美元、输出 0.28 美元;MiMo-V2.6-Pro 分别为 0.0036 美元、0.435 美元和 0.87 美元。Pro-UltraSpeed 对应三个价格分别为 0.036 美元、4.35 美元和 8.7 美元。

两款模型目前已经进入 MiMo Desktop、MiMo Code、AI Studio、MiMo API 和 OpenRouter。MiMo Desktop 也结束 Early Access,发布首个正式版本。

代码能力继续扩到三维世界

MiMo-V2.6 这次一个比较明显的变化,是代码能力开始继续向视觉和三维环境延伸。小米把其中一部分能力称为 Vibe World。

用户可以输入一张图片、一段视频或者文字需求,MiMo-V2.6 再把任务拆给多个 Agent,分别处理 3D 场景搭建、交互逻辑和视觉验证。完成初始版本后,模型还会根据实际渲染结果继续修改,最后生成可以运行的交互世界。

官网展示了多组对应视频,这部分也是 MiMo-V2.6 页面中视觉占比最高的内容之一。在 3D 建模任务里,模型可以直接操作 Blender,根据文字描述或者参考图片生成物体和场景,最终资产可以继续用于动画、3D 打印和游戏开发。

具身部分则直接接入机器人仿真环境。MiMo-V2.6 可以读取多个摄像头画面,持续进行视觉理解和动作决策,再根据视觉反馈闭环控制 Franka Panda 机械臂,完成物体抓取、颜色匹配和精准放置等操作。

这里不再只是给模型一段代码再判断对错,输入开始包含实时视觉信息,输出也进一步延伸到了环境中的连续操作。

视觉创作进入完整工作流

另一组集中展示的能力来自视觉设计。MiMo-V2.6 可以从一句需求开始生成完整前端页面,包括页面结构、组件、交互和动画;也可以直接完成一份完整演示文稿,而不是只提供文字大纲。

模型同时可以使用 Figma 以及图片、视频生成工具。在任务执行过程中,字体、颜色、图片和文本布局都可以继续调整。

小米在页面里展示了三套由一句 Brief 生成的演示文稿,分别涉及 LLM 工作原理培训、关键矿产研究以及公司年报设计方案。

视频生成也被接进这一套工作流。面对产品宣传或创意视频,MiMo-V2.6 可以继续处理视觉设计、镜头和动效安排、音乐生成以及卡点剪辑;面对知识类视频,则可以把傅里叶分解等抽象概念转换成动画,并调用 MiMo-V2.5-TTS 生成与画面对齐的旁白。

音乐是这次另外增加的一类展示。在一个案例中,MiMo-V2.6-Pro 被要求为约十种乐器创作一首管弦乐。模型先完成乐谱,再自行转换成 MIDI。页面还放出了两首不同速度的 A 小调钢琴曲,用来展示模型对力度、织体和编曲结构的处理。

科研任务开始进入真实流程

MiMo-V2.6 还展示了两组科研案例。

第一组来自材料研究。小米材料团队让 MiMo-V2.6-Pro 寻找能够吸附 PFAS 的新型金属有机框架材料。模型先进行网络检索,阅读相关论文和专利,提出候选设计并检查新颖性,随后调用开源计算工具配置模拟环境,计算不同 MOF 与 PFAS 的结合强度,再筛选后续可以进入湿实验阶段的候选材料。

官网同时给出了三组经过模型设计和计算筛选的 UiO-67 型 Zr₆ 框架,可以直接旋转查看其三维结构。

另一组任务是形式化数学证明。MiMo-V2.6-Pro 参与完成了 Li 和 Yorke 经典论文《周期三蕴含混沌》主定理的 Lean 4 形式化。模型通过多个 Subagent 协作推进定理陈述和证明,研究人员继续修改和整合后,整个项目超过 6000 行 Lean 代码,最终由 Lean Kernel 完成验证,没有遗留未完成的证明占位符。MiMo-V2.6 此前没有接受针对 Lean 的专项后训练。

模型权重与训练资源同步开放

这次发布的内容也不只有 Pro 和 Flash 两款模型。小米同步开放了 MiMo-V2.6-Pro、Flash 的模型权重和技术报告,同时发布 MiMo-V2.6-Distill-Qwen-9B。后者使用 MiMo 的 RL 轨迹蒸馏得到,主要用于给后续强化学习提供一个新的起点。

一起开放的还有超过 7000 个 RL 任务环境,覆盖软件工程、漏洞复现、知识型工作和网页设计开发等 Agent 任务。

训练部分则提供完整 RL Framework,覆盖环境交互、轨迹采集、奖励评估和策略优化,并基于 verl、uni-agent 和 mini-swe-agent 等组件搭建。

MiMo 还提供了一套轻量级 mini-harnesses,把 System Prompt、工具以及上下文管理拆开,研究者可以重新组合不同 Harness,再观察模型面对训练阶段没有使用过的 Agent 框架时的泛化情况。模型、技术报告、训练环境和 RL 代码目前均已经随 MiMo-V2.6 一起开放。

本文由人人都是产品经理作者【有新Newin】,微信公众号:【有新Newin】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载

题图来自Unsplash,基于 CC0 协议

更多精彩内容,请关注人人都是产品经理微信公众号或下载App
海报
评论
评论请登录
  1. 目前还没评论,等你发挥!