分享一个在长视频推理上超过Gemini 2.5 Pro的新模型
拿一段飞机起落架的3D演示去验新模型,本来只想找茬,结果VLX-VR把传动、啮合、液压作动和过死点自锁整条链路推演了一遍,还判断这段演示没有机械错误。文章借这次对照讨论长视频推理为什么难:多数模型只是在单帧上答题,视频一拉长就撞上时间墙。

这两天我一直在用GPT6做3D建模,然后我翻到一段塞斯纳337起落架收放的3D演示。做得挺细,传动怎么走,齿轮怎么啮合,锁扣怎么咬合,都有讲究。现在这种AI做的机械演示越来越多,画面一个比一个唬人,但是这些传动都是真的吗?我是有点拿不准。所以我当时的想法很简单,找个能做视频识别的模型来验一验。
还真让我在X上找到个新模型,VLX-VR,OmAI联汇新出的视频深度推理模型。
在最难的视频推理基准MINERVA上,准确率居然快达到80%,78.8%,直接公开第一。把这段我好奇的视频丢进去,然后问了一句,「检查这段视频,在机械运转和物理规律上有没有毛病。」
我本来还以为,会有十几个地方出问题的。
结果VLX-VR给我回了一份视频分析报告。传动是怎么走的,齿轮齿条往哪个方向啮合,液压作动筒缩回去起落架就收起,伸出去就放下锁定,一根贯穿轴怎么带动两侧摇臂做对称收放,连over-center过死点自锁都讲到了。最后它给出结论,这段演示准确还原了真实飞机的工程结构,没发现机械或物理层面的错误。


如果我用的是一个只会看图说话的模型,这时候大概率会顺着我的话头硬凑两个错误出来才叫正常,反正我也未必看得出来。结果没有。。它是作用在整个视频时间轴的,不是随机截图就得到结论,对着整台起落架,把机理从头到尾讲一遍,再给一个没问题的判断。
那我继续顺着时间线追问了一个假设。
「如果第2分钟那个过死点自锁没有到位,或者作动筒少缩回5厘米,后续高速平飞时会发生什么?」它停了几秒,在思考草稿纸里顺着时间线做了推演。


也就是说,这个模型不但能看懂视频,还能根据模型的时间顺序往后推,能做这种因果推演,说明它也是真把整套机械运转的前后因果全想明白了,看得懂动作之间的连锁反应。
再再然后,就算是一些人像视频,一些搞怪的分析,它也有办法理解和做成。

到这里我就有点好奇是哪家横空做出来这样一个模型了。
VLX-VR是OmAI联汇VLX模型家族中的一款视频深度推理模型。过去大模型在纯文本和看图问答上突飞猛进,但只要丢一段长视频进去,大部分模型的能力就会出现断崖式下跌。
因为视频和图片完全是两个维度的东西。平时大家用的视频总结工具,大多只是提取视频里的人声做语音转文字,本质还是在读文稿。一旦遇到全片没人说话、全靠画面运转的工程视频,或者画面里的动作跟说话内容毫无关系,这些工具就立刻抓瞎了。而且视频一旦拉长到十几分钟以上,主流大模型普遍会撞上所谓的时间墙。看前头忘了后头,越到后面越开始胡说八道。
所以MINERVA基准,包含一千多道长视频推理大题,而且专门防模型蒙答案,要求把整套推导轨迹也交出来供人工核对。VLX-VR是真的名副其实的第一。。。

作为对比,OpenAI的推理模型o1在这套题库里只拿到了43.48分,GPT-4o拿到了45.54分。Gemini 2.5 Pro在面对15分钟以上的长视频时,得分也只有57.97%。
更重要的是两组反常的数据。

一个是推理逻辑一致性是在答对的题目上,达到了96.2%。人工拿着标准步骤去对它的推导过程,几乎每一步都有据可查,思考草稿纸跟人类专家的思路高度吻合。
然后是它的跨时长表现。在5分钟以下,5到15分钟,15分钟以上三个区间,准确率不降反升,76.70%,78.73%和80.92%,真就是跟着推理把内容推出来了。
当然,如果对照人类92.54分的满级基准,它现在还是有些肉眼可见的差距的。在实测里我也发现,如果视频里涉及密集微小零件的数量清点,或者画面里快速发生极其微弱的局部形变,它偶尔还是会犯迷糊。


在微观状态和空间几何感知上,它还有很长一段路要走,但这也真很近了。。
搞清楚它的技术参数之后,我决定再拿一个更接地气的场景去考考它。
开始来点工程强度,找了一段AI辅助工业建模的屏幕录制。把四五分钟的原视频加速了整整9倍,压成了一段只有30秒的极速内容。画面里窗口乱飞,从记事本切到ChatGPT,又切到专业的NX工业建模软件。
这种视频人眼盯着看两遍都觉得眼花,连代码都看不清。
这段直接给VLX,让它按时间顺序还原操作流程,并分析是手动建模还是脚本生成。
三分钟左右就都看完了,并把时间线细分成了十几个节点。
最让我惊讶的是它对代码报错的捕捉能力。
第11秒左右,它精准捕捉到了屏幕上闪过的一行代码错误,指出脚本在调用CreateBlock1时触发了AttributeError。然后15秒,18秒,都有解决的过程。
它不仅确认了全过程是通过Python Journal脚本自动化拉伸生成,甚至把最终生成的零件细节都数了出来,包括22个独立实体构成的外轮廓近似模型,底座尺寸精确到了624毫米乘355毫米乘1949毫米,并在收尾阶段将分段倒圆升级为了R121标准圆弧。

能在这种9倍速快进,窗口频繁切换的画面里,精准咬住每一次报错和代码修改的因果,这种视觉抓取能力已经超出了普通视频看图的范畴。
既然懂了机械,又懂了工业软件,那让它去看真实的物理实验呢?
我又找了一段真实的机械臂物理学习实验视频。画面被切成了四宫格,四个窗口同时在跑四种不同的机械臂操作。

我让它分别告诉我这四个窗口在干什么,有什么本质区别和细节差异。


它不仅把左上角烤面包机取放餐盘,右下角下角开阀门倒橙汁区分得明明白白,还指出了右上角与左下角的关键对照。

更细致的是,它还看出了人工示教和机械臂实操的动态区别。人工示教是双手自然配合,动作连贯无间隙。机械臂在双臂协作交接时,动作之间大概1秒的等待停顿都给指出来了。。。
最后的最后,就是看课程的能力了。
感觉每次刷到很多AI教程,我都满心期待地想看,但时间要不允许,要不然说白就是懒了。
但现在既然AI也能自动分析,那我这不就直接丢给他来总结了吗?
这还是一个10分钟的长影片。之前AI已经开始能稳定生成的那一两分钟的视频了,但还是读不懂。那现在长影片,他们已经看得懂了,那离生成还会远吗?
也是没两三分钟,结果就完成出来了。大纲拿到了,核心也帮我总结完了。平时看影片,到处去抓总结工具,有的限制长度有的限制文件大小,现在一个网站全做了,方便起飞。

总结完影片后,VLX还给我们一些延伸的想法。

真的,把我能想到的功能都已经放进去了已经,对于影片的疑问,也都帮我解决了。
认出画面里有什么,和看懂一段视频里正在发生什么,本来就是两码事。
认出,是看到画面里有一架飞机,看到屏幕上有个报错弹窗,看到一个机械臂在动。
看懂,是讲得清作动筒少缩回5厘米会导致空中意外展开,讲得清第11秒的报错怎么在第18秒被修复,讲得清机械臂分盘与合盘的策略区别。
轮到落地这块,他们推出的视频创作Agent,OttoBox小欧视频创作助理是基于这个VLX-VR模型能力做了升级。
简单来说,给它一句人话,它就能在几百个G的海量素材里把你要的那一幕准确定位出来,能看懂画面里的人在做什么动作,还能读懂角色的情绪起伏,自动拼成一版粗剪。

过去人工粗剪要磨8到10个小时的活,它30分钟就能出稿,而且全在本地端侧跑,素材不用传上云端。我们就也玩了下,给他一个我们刚发完的影片,让他分析复盘,甚至再帮我们看有没有什么能做些进阶延伸。

从分镜头分析,再到完成剪辑,来来回回就说了两句话,就都跑通了。
真的有装上眼睛的AI就是不一样,更何况这还是能够看影片的 AI。
老实说,最开始把视频丢进去的时候,我纯粹是抱着找茬的心态去的。
现在AI剪辑现在有太多花哨的演示,看起来很能剪口播,实际上就只能剪口播了。
做AI这几年,我们见惯了模型在屏幕里写文章,敲代码,生成酷炫的短片。
但很多时候,那些所谓的逼真画面,只是模型在概率里猜像素。
吃汉堡的时候汉堡没有变少,走路的时候多出一条腿,在纯数字的屏幕里,这些荒诞或许只是有点无所谓的穿帮。
可真实的物理世界不行,在屏幕之外,容错率其实低得可怕。
这也是为什么看到它把整条链条推演出来的时候,我心里会有一种踏实感。
也正是这种不投机取巧的较真,在把物理AI一点点拉得离我更近,离我们更近。
作者 / 卡尔 & yc星辰
本文由人人都是产品经理作者【卡尔的AI沃茨】,微信公众号:【卡尔的AI沃茨】,原创/授权 发布于人人都是产品经理,未经许可,禁止转载。
题图来自Pixabay,基于 CC0 协议。
- 目前还没评论,等你发挥!

起点课堂会员权益



