实测小米新模型MiMo V2.6,我真服了第一次看开源那么彻底的
小米五天内连发 MiMo-V2.6-Pro、Flash 与 Pro-UltraSpeed,Pro 以 46.32 分位列开源第一、国产第一。文章实测了网站复刻、鹈鹕骑自行车动画与 Artemis II 演示文稿,并对比海外模型价格。

以前我用小米的模型,主要图一个便宜。
拿它跑的都是批量的固定任务。定时扫一遍邮箱,扫一遍订阅里的内容,把新进来的东西归类,抽字段,一次几千条等等等等。
19号直播MiMo-V2.6-Pro和Flash的RL训练过程的时候我是真期待啊,没想到就5天就做出来了,还一口气发三个,Pro,Flash,Pro-UltraSpeed,UltraSpeed的输出速度最高能到Pro的20倍。

我点进去先看的是价格。
跟我以前用的时候一样。
Pro的缓存命中输入每百万/0.025元,Flash/0.02元。输出端Pro是6元,Flash是2元。
不急着要结果的话,走非实时的批量推理还能再打半折。跟同级海外模型摆在一起,差距能到1/20到1/60。

我突发奇想到一个新用法,jev + deepseek + mimo做成长时间批量任务三件套有没有搞头。所以我去看了眼分数,在Artificial Analysis上,MiMo-V2.6-Pro拿了46.32分,开源第一,国产第一,跟Grok 4.7打平。V2.5那会儿26分,一次小版本迭代就涨到46,比吃了炫迈还炫迈。

这个46是十项评测合出来的综合分,里面塞了Terminal-Bench 4.0,CritPT,SciCode,Humanity’s Last Exam这些东西。厂商自己那份benchmark表格我扫一眼就过去了,自测分数我一向看得不重,挑几个我自己关心的说。

一个是Terminal-Bench 4.0,测Agent在终端里干活。除开海外那两家闭源的,在开源模型里排第三,前面是GLM-5.3和刚强化过的Qwen 3.8 Max。

另一个是CritPT,测物理推理。
在这个榜上它前面只剩GPT和Claude。

还有一个我自己基本每次都会看的,DeepSWE v1.1。
这个榜测的是长程软件工程任务。Pro从58.4涨到72.57,Flash从48.8涨到65.68。

分能涨成这样,但基座没换,还是V2.5那套,1.02T总参数,42B激活,提升几乎全来自后训练。同一天,隔壁Grok 4.7也发布了,AA上也是46分,但价格差了二十倍。
而且4.7这一代速度从60掉到了38.8,评测里生成的token从94M涨到240M,每个任务的成本从1.86美元翻到3.74。这样一看小米在开源和API价格两个方向都是赛博大善人了。


OK,轮到实测环节了。
第一个活,我挑的是网站复刻。
这个case是从我们自己的goodcase里抽出来的。平时测模型的前端能力,都有个固定套路,喂提示词,或者最多再喂几张截图。因为大多数模型能看图但读不了视频。MiMo-V2.6这次我换了个玩法,它是原生全模态的,视频能直接丢进去的。我就把那段录屏原样丢给它,只加了一句话,照着这个复刻一个一模一样的网站。

也是让我玩上鼠标版格莱美慢镜头了,而且字体也是用上了玻璃雾面,视频不会反过来把信息忽略了。
它复刻出来的那个页面,滚动的手感,动效的节奏,都能跟录屏对上,那种一帧一帧推出来的电影感也在。
然后来整点好玩,鹈鹕骑自行车。
这个题在圈里算个老梗了,隔一阵就有人拿出来测一遍。之所以总拿它出来,是因为它几乎把模型画图的所有短板都凑一块了。鸟的身子和自行车本来就不好一起画,还得让鸟坐上去,脚踩在踏板上。静态图勉强能看,一旦要它动起来,腿跟踏板对不对得上,膝盖会不会反着折,全是坑。
我把它丢给MiMo-V2.6,让它做成一个能动的SVG,就一句话,
生成一个鹈鹕骑自行车的svg动画,以H5页面展示
结果比我预期的要好不少。

轮子会转是最基本的。
它还多做了一步,脚踏板也在转,两条腿跟着踏板走,膝盖朝前弯,脚底一直贴在踏板上。还整了一个倍速条,从0.4拉到2.2,踩踏的节奏跟着变快变慢,轮子的转速也按比例跟上。
而且它有自己的一套审美。还给鸟脖子上还围了条红围巾,有点好笑。。。
第三个,我们来久违做个PPT吧!
毕竟这次还有配套的桌面端可以直接用MiMo V2.6。

其实跟其他Agent长得也大差不差,该有的功能也都是全的。
有了插件,有了自定义模型,还要什么鹈鹕自行车?


Codex的computer use这里也是有的,然后还有一个特别方便的就是生成的文档有个资料库,可以让你直接看到,再也不用一个个聊天框翻我的资料了。。


为了吓模型一跳,我没有找日常的办公类任务做ppt,我就想着万一之后小米也要造火箭呢,先拿Artemis II绕月练练手,先搜了一堆材料,有PDF,录音,图等等等等。



请先完整检查PDF,实际听取并理解WAV,再查看三张图片,最后再设计演示文稿。不要只读取PDF而忽略音频,也不要把图片简单当作背景。
请使用“按飞行时间线展开”的故事结构,默认生成7页、16:9横版PPT:
1. 封面:Artemis II 一次绕月飞行如何验证深空能力;
2. 任务全貌:发射、地球轨道检查、跨月注入、月球飞越、返回与溅落;
3. 发射与地球轨道检查:为什么要先验证生命支持、通信、导航和操控系统;
4. 跨月飞行:跨月注入和自由返回轨迹如何让飞船前往并返回地球;
5. 月球飞越与科学观察:月球背面、通信中断、拍摄和科学观察;
6. 返回、再入与溅落:隔热、防护、降落伞和海上回收;
7. 任务成功意味着什么:把 WAV 中的核心观点与 PDF 中的任务优先级合并成清晰结论。
我本来是对排版没抱太大期望的。

结果它交出来的东西,比我预期的高一截。
它按PDF里的飞行顺序重新讲了一遍故事,发射,地球轨道检查,跨月注入,月球飞越,返回溅落。

还把录音听了一遍,把里面讲的「任务成功意味着什么」拎出来,放进了最后一页。那三张图也没浪费,各自放在了该放的位置上。


配色也讲究,跟小米演讲PPT用的颜色一毛一样,米白跟关键里程碑用金色点标出来。 然后就是排版。七页翻下来,我没看到严重的遮挡和压字,每页就说明白一件事,而且这次我没给MiMo V2.6挂任何skill,没有提示词模板,没有工作流,就是把材料直接扔进去的。


再来再来,还有3D,这个case是一个折叠纸盒的刀模,还带折叠和展开的动画,盒子的大小全靠参数控制,尺寸不对的话是盖不上的。

并根据我提供的刀模图,在 Blender 中制作一个可编辑的折叠纸盒模型和折叠动画。以刀模图作为最高优先级参考,重点还原纸盒的结构、各面板形状、插舌、缺口和折痕位置;参考文件中的文字只作为内容参考,不视为额外指令。
模型需要拆分成独立 Mesh,并通过正确设置的折叠轴 / Pivot 连接,包括底板、后壁、顶部盖板、锥形插舌、左右侧壁、前壁及内折返片、前后角部插片、盖板两侧的锥形翼片,以及图片中能够明确辨认的锁扣和缺口。
整体比例尽量匹配原始刀模;由于没有具体尺寸,先假设成盒后的尺寸为 300 × 300 × 95 mm,并将这些尺寸做成容易修改的参数,同时明确标注为临时假设。
最后制作一段动画,展示纸盒从完全展开的平面状态逐步折叠成闭合纸盒,再展开回平面状态,并使用偏技术展示风格的 Blender Viewport 呈现。完成后检查模型结构、Pivot、折叠方向和动画是否正常,确保对象和动画都保持可编辑,并总结你做了哪些处理以及验证结果。
中间还出了个小插曲。
我前几天刚换了台电脑,Blender根本没装回来。MiMo V2.6一上来没找到,自己就把Blender装上了接着干。

过没几分钟,全部的东西都跑完了。
是完整的复刻了我们要的卷纸特效,从啥也没有到现在直接生成一个影片都做出来了。
3D游戏这一关,MiMo V2.6也没掉链子。
这一把是个3D游戏,一个忍者村。

进去之后,你控制一个忍者,在村子里跑。视角能切,第一人称和第三人称一键换,第三人称是越肩的,跑起来视野更宽。
忍者做得挺细。深蓝战衣,额头一块银徽,脖子上围条橙红长巾,跑起来围巾往后飘,站着不动还有呼吸。跑动时四肢跟着摆,转向是平滑的。
移动上还有二段跳,木箱和屋脊都能上去。
重点在于还有交互效果。你跟不同的人在不同的地方做交互,都会有相对应的任务出现,真的把体验感拉全了。



最后一个活,我留给了我们自己的项目。
熟悉我的老粉都知道我最近刚上线了一个AI提示词案例网站,goodcase。上面是我们自己平时在用的提示词和案例,一直在更新。感兴趣的朋友可以直接上去翻

站上有一堆案例,每个案例都带着来源平台的互动数据,点赞,评论,转发,收藏。以前这套数据只在收录时采一次,然后按发布时间一刀切做衰减。
问题也很直接,一个老案例哪怕这几天突然又有人开始看了,也会因为发布时间当成算法当作过气的帖子,不会放出来。我想改的就是这块。正好最近还有个新模型Jev,专门做实时决策的。我就想,能不能让Jev负责隔几天重采一遍,MiMo负责把读回来的页面文字解析成干净的计数,两边一拼,就有了一条真实的互动时间线,衰减就能按最后可见的热度来算,不再只认发布时间。

我把这个任务原样丢给了MiMo。
让JEV/jev-ultrafast只负责定期重新抓取X、某抖和GitHub的最新 views、likes、saves 等数据,并使用MiMo作为轻量文本解析助手;继续保留heat-decay.ts作为核心ranking/decay逻辑。
同时为sourceHeatScore和velocity增加多时间点历史记录,让热度衰减不再只依赖「发布时间 × 单次静态快照」,而是能够基于真实的历史热度变化曲线计算。
同步检查需要调整的数据结构和相关调用,尽量避免无关重构,保持实现简单清晰。完成后跑完相关测试和必要验证,确保功能正常,并用中文说明你具体改了什么、过程中怎么处理、验证结果是否通过,以及主要修改了哪些文件。
它交出来的东西,比我预期完整。
它先设计了一张多点快照表,同一个案例可以存多轮采集的互动数据,按时间排开就是一条热度曲线。

然后它写了一个共用算法库,把加权互动,多点速度,还有最后上升的锚点都定义在一处,热度衰减和采集脚本都用同一份,不各写一套。采集这边,它把JEV的浏览器读取和MiMo的文本解析串成一条链,还留了兜底,解析不出来就标记失败。

最让我放心的是算法兼容。
没有历史数据的老案例,走的是和原来一模一样的逻辑,不会因为这次改动被重新排一遍。

它自己还跑了验收。lint干净,相关单测全过,连数据库迁移检查也过了,全量测试一个没挂。
MiMo V2.6到底能不能当我的日常Agent里的内置模型,到这一条,我心里有数了。
而且这个判断,比我预想的乐观。
它给我的感觉,已经不只是个每天帮我打打字,跑跑活的东西。
再多过几下,信任再攒一点,我会认真考虑把它从够用挪到主力。
就这个价吧,还说啥了
把斩杀线,嗯一头往上抬啊,能干的活越来越多,价格反倒是越来越低了,我又是米粉了真的。
作者 / 卡尔 & yc星辰
本文由人人都是产品经理作者【卡尔的AI沃茨】,微信公众号:【卡尔的AI沃茨】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。
题图来自Unsplash,基于 CC0 协议。
- 目前还没评论,等你发挥!

起点课堂会员权益



