李飞飞发布Atlas:世界模型,到底是个啥?
李飞飞联合创办的World Labs发布了新一代世界模型Atlas。它能用少量图片重建3D空间,按照精确的相机轨迹生成视频,还把能力延伸到了机器人仿真。但对产品经理来说,真正需要判断的不是演示视频够不够惊艳,而是模型能不能持续维护环境状态、模拟行动结果,并转化为一个可控、可验证、可交付的产品。本文借Atlas讲清世界模型与大语言模型、多模态模型、视频模型的区别,并给出一套产品经理评估世界模型的五问框架。

现在每天都会习惯性地查一遍AI资讯。
一方面是工作需要,另一方面也是怕几天不看,AI圈又悄悄长出几个完全看不懂的新概念。
这两天看到了一条消息,李飞飞联合创办的World Labs发布了新一代世界模型Atlas。官方给出的定位很猛,全球首个多模态世界模型,能生成图像和视频、重建3D空间,还能用于机器人仿真。
世界模型这个词,我其实不是第一次听到了。
之前看具身智能、自动驾驶和机器人相关内容时,经常有人提到它。大语言模型已经能写文章、写代码了,多模态模型也能看懂图片和视频,视频模型生成的画面甚至越来越接近真实世界。
那为什么还需要一个世界模型?
它是一种新的模型架构,还是AI圈给视频生成换了个更大的名字?
作为产品经理,我更关心的是另一层问题:如果世界模型真的成为下一类基础模型,它会把AI产品的核心对象变成什么?我们又该用什么标准,判断一段演示是在生成画面,还是在模拟一个可以持续运行的世界?
一、Atlas发布了什么?
9月1日,World Labs正式发布新一代世界模型Atlas。
按照官方介绍,Atlas是一个从零开始预训练的全模态模型。它采用多模态自回归扩散Transformer架构,可以原生处理文字、图片、视频、相机位姿、深度信息和3D数据。
这句话看起来有点技术,但它表达的重点其实是:
Atlas处理的不只是画面,还包括画面在真实空间中的位置。
比如给Atlas几张从不同角度拍摄的房间照片,它可以把这些图片放进同一个空间上下文,再生成相机从其他位置看到的画面。
World Labs还展示过一个案例。团队提供7张参考图片,手动设计一条相机轨迹,Atlas沿着这条轨迹生成了一段时长1分钟、分辨率1440p的视频。

如果只看最终视频,Atlas确实很像一个更强的视频生成模型。
但普通视频模型里的镜头运动,通常还是通过文字描述控制的。你可以告诉模型镜头向左移动、缓慢推进,但最后的空间和运动细节,很大程度上仍然由模型自己决定。
Atlas接收的是相机在3D空间中的位置和运动轨迹。
说白了,普通视频模型更像是根据要求拍一段画面,Atlas则试图先搭出画面背后的整个片场。即便相机转向另一个方向,房间、桌椅和墙壁之间的空间关系也不能跟着乱掉。
Atlas还可以从一张或多张图片中重建3D空间,输出深度图、点云和3D Gaussian Splat。这些结果不只是给人看的,还可以进入3D制作和机器人仿真工作流。

在World Labs展示的机器人场景中,用户可以先用普通相机拍摄一个真实环境,再由Atlas重建空间,生成机器人沿不同路线移动时可能获得的RGB画面和深度信息。
以前搭建这样的机器人仿真环境,往往需要专业扫描设备和人工建模。World Labs想做的,是降低Real-to-Sim的成本,让机器人先在虚拟空间中训练和犯错。
这里先记住一个产品判断:Atlas想交付的不是一段视频,而是一个可以被反复观察、重建和调用的空间。
二、世界模型到底是个啥?
世界模型不是这两年才出现的新概念。
早在强化学习和机器人研究中,研究人员就在尝试让AI建立一个关于外部环境的内部模型。2018年,David Ha和Jürgen Schmidhuber发表《World Models》,又把这个概念带进了更多人的视野。
它的核心并不复杂:
世界模型是AI在内部建立的环境表示。它不仅要知道当前发生了什么,还要预测采取某个行动后,世界会变成什么样。
一个杯子放在桌边。人看到以后,会自然知道几件事:转过头,杯子不会凭空消失;从另一侧观察,它还是同一个杯子;继续往外推,杯子会掉到地上;杯子掉下去以后,再回头看,它不会重新出现在桌面上。
这些对人来说都是常识,对AI却不是。
AI不仅要识别出这是一个杯子,还要知道杯子在哪里、周围有什么、过去发生了什么,以及某个动作会带来什么结果。
如果把视频生成模型比作摄影师,它可以根据提示词,拍出一段看起来很真实的画面。镜头之外是什么,刚才被移动的物体现在在哪里,它不一定真的知道。下一帧只要看起来合理,任务就算完成了。
世界模型更接近一个可以运行的游戏。
我们在游戏里推开一扇门,绕一圈再回来,门应该仍然开着。玩家撞到墙,不能直接穿过去。画面只是我们看到的结果,背后的系统还在维护地图、物体位置、角色状态和环境规则。
所以世界模型真正关心的不是这一帧画得像不像,而是三个问题:
- 现在的世界是什么状态?
- 如果执行一个动作,会发生什么?
- 变化之后,新的世界状态是什么?

世界模型也不是某一种固定的模型架构。
有些世界模型在隐藏空间里学习环境状态,不一定生成图片;有些通过预测视频帧来学习世界变化;有些直接处理3D空间、传感器信息和机器人动作。
世界模型更像一个能力目标,而不是一个固定的技术配方。
这也导致现在能力完全不同的产品,都在使用世界模型这个名字。能生成可交互视频,叫世界模型;能重建3D场景,叫世界模型;能预测机器人动作结果,也叫世界模型。
只看名字,已经分不清它们到底做到了哪一步。
三、它和大语言模型、多模态模型有什么区别?
第一次听到世界模型时,我最容易混淆的就是这几个概念。
大语言模型已经学习了海量知识,多模态模型也能识别图片里的物体。既然它们知道这么多,为什么还不能直接理解和模拟世界?
问题在于,它们解决的不是同一类任务。
大语言模型处理的是语言里的关系。
你问它把杯子推到桌边会发生什么,它大概率能回答杯子会掉下来。但这个答案来自人类已经写进文本里的知识。让它控制一台真实机器人,它还需要知道杯子的具体位置、桌面的高度、机械臂当前的角度,以及动作执行后环境发生了什么变化。
多模态解决的是模型能接收什么。
多模态模型可以同时处理文字、图片、音频和视频。它相当于在语言能力之外,又获得了眼睛和耳朵。但能看见,不代表它会长期保存环境状态,也不代表它能预测行动结果。
视频模型学习的是画面如何变化。
它可以生成一段视觉上非常合理的视频。但视觉合理不等于空间和物理上正确。人物换个角度以后衣服细节变了,镜头绕到物体背面时结构对不上,前几秒出现的东西在后面突然消失,这些都是视频模型常见的问题。
世界模型学习的是状态如何变化。
它要记录环境里有哪些对象、对象之间是什么关系、当前处于什么状态,以及一个行动会怎样改变这些状态。

这里有一句特别值得产品经理记住:
多模态回答模型能读什么,世界模型回答模型能不能维护并推演一个环境。它们不在同一个分类维度上。
一个世界模型可以同时是多模态模型,Atlas就是如此;一个多模态模型却不一定拥有稳定的世界模型。
四、Atlas究竟走到了哪一步?
World Labs此前发布过一套世界模型的功能分类,把相关系统分成三个层级:渲染器、模拟器和规划器。
渲染器负责生成观察结果。
用户向前走,它生成向前移动的画面;用户向右转,它继续生成右侧的场景。它看起来可以被探索,但模型未必维护了完整的环境状态。
模拟器需要维护世界状态。
一个物体被移动、损坏或遮挡以后,这些变化需要被保存下来。角色采取不同动作,环境也要给出相对符合规则的反馈。
规划器还要围绕目标选择行动。
比如用户让机器人把桌面收拾干净,机器人需要决定先拿什么、如何绕开障碍,以及某一步失败后怎样调整。

用这个框架看Atlas,结论会清楚很多。
Atlas已经不只是普通渲染器。它把相机位姿、深度和3D空间信息放进模型的原生输入和输出中,可以生成新视角,也可以输出明确的3D结果。
但它距离完整模拟器还有几个问题没有回答。
首先,World Labs这次重点展示的是镜头控制和3D重建。模型能否稳定模拟碰撞、摩擦、重量、液体、布料和复杂物体交互,公开资料里还没有足够证据。
其次,现有评测主要来自World Labs自己。官方称Atlas在相机控制和3D重建任务上超过多个专业模型,但Atlas可以直接接收相机轨迹,部分对比模型接收的则是文字形式的镜头描述。
这个测试证明了Atlas原生空间控制的优势,不能直接说明它在所有能力上都超过了其他模型。
最后,Atlas目前只向部分合作伙伴开放早期访问。截至发布时,World Labs没有同步公开完整论文、模型权重、训练数据、价格和面向普通开发者的正式API。外部团队还很难复现官方演示,或者验证它在复杂环境中的稳定性。
所以,我更愿意把Atlas放在强空间渲染与重建模型,正在走向模拟器的位置。
它已经证明AI可以更稳定地组织空间,没有证明AI已经掌握完整的物理世界。
五、产品真正变的,不是模型,而是产品对象
现在的大部分AI产品,都围绕一个输入框设计。
用户输入文字、图片或文件,模型生成回答、代码、图片和视频。产品主要管理的是输入、生成过程和最终结果。
世界模型带来的产品形态不太一样。
用户面对的不再只是一次生成结果,而是一个持续存在的环境。环境里有空间、对象、状态和规则。用户与Agent的每一次操作,都会改变这个环境。

这个变化会直接改写产品经理的工作。
过去设计AIGC产品,我们重点考虑提示词怎么输入、结果怎么选择、生成失败怎么重试。
设计世界模型产品,还要回答这些问题:
- 用户如何创建或导入一个环境?
- 模型如何展示自己已经识别的空间和对象?
- 用户怎样修正错误的位置、属性和状态?
- 哪些规则由模型学习,哪些规则允许人工设置?
- 一个动作执行以后,用户如何查看状态变化?
- 模拟结果如何进入3D软件、机器人或企业系统?
这里面的核心产品能力,不再只是生成,而是状态管理、可控编辑、过程验证和系统连接。
比如机器人训练平台不能只给用户看一段成功抓取的视频。用户还需要调整桌面高度、杯子材质、机械臂参数和光照环境,批量运行测试,再查看不同条件下的成功率。
影视创作产品也不能只有一个生成按钮。用户需要控制相机位置、空间结构和镜头衔接,还要保证修改一个地方时,不会把整个场景重新生成一遍。
从生成内容到运行环境,产品经理管理的对象变了。
六、世界模型最先会落在哪些产品里?
从落地难度看,我觉得至少有三层机会。
第一层:内容创作
这是距离普通用户最近的一层。
影视制作人员可以用少量参考图片重建场景,再设计不同的相机运动;游戏团队可以快速生成可探索的3D环境;设计师可以把一个空间概念变成能够继续编辑的资产。
这类产品首先解决制作效率和创作成本。对应的产品指标也很明确:画面质量、空间一致性、镜头可控性、局部编辑能力和3D资产可用性。
第二层:空间数字化
当模型可以从普通照片和视频中重建空间,它就可以用于房屋、商场、仓库和工厂的数字化。
用户拿手机绕场地拍一圈,系统完成空间重建和物体识别,再交给用户继续修正。这里真正的门槛不在看起来像,而在尺寸、位置、对象属性和版本变化能否被准确管理。
第三层:机器人训练
这是想象空间最大,也最难的一层。
现实世界的数据很贵。机器人学习拿杯子,需要真的执行动作;抓取失败以后,杯子的位置会改变,还需要有人把环境恢复原状。
在模拟环境里,失败可以被复制一万次。
世界模型如果能够批量生成环境、改变物体和任务条件,再给出足够可信的反馈,机器人就能在进入现实之前跑完大量测试。
但机器人不在乎画面有没有电影感。它更在乎模拟环境里的判断,换到现实以后是否仍然成立。
内容创作、空间数字化和机器人训练都需要世界模型,但它们的产品指标完全不同。把它们放在同一张模型排行榜里比较,意义不大。
七、产品经理判断世界模型,我建议先问五个问题
世界模型这个词还会继续变热。
接下来会有更多视频工具、3D工具和机器人公司,给自己的产品贴上世界模型标签。只看宣传片,很难分辨它究竟做到了哪一步。
我给自己整理了五个问题。
1. 它能不能保持世界状态?
同一个房间从不同角度看,空间结构是否一致?一个物体被移动以后,模型能不能记住新的位置?
如果每次观察都在重新生成,它更接近一个渲染器。
2. 行动能不能带来合理结果?
用户移动物体、打开门或让机器人执行动作以后,模型能否给出符合空间和物理规则的反馈?
这是从渲染器走向模拟器的关键。
3. 用户能不能控制和修正?
能不能指定相机路径、对象位置和环境条件?模型重建错误以后,能否局部调整,还是只能推倒重来?
演示效果和产品能力的差别,经常就藏在这里。
4. 输出能不能进入下游系统?
一段漂亮的视频当然有价值。但如果目标是数字孪生或机器人训练,模型还需要输出深度、空间坐标、传感器数据或者可继续处理的3D资产。
机器能不能使用这些结果,决定了它是一款内容工具,还是生产基础设施。
5. 在真实业务中跑不跑得起?
生成一个场景要多久?成本是多少?能不能批量运行?结果是否稳定?失败后是否可回滚?
一个模型即使满足世界模型的技术定义,也不等于已经成为可交付的产品。

用这五个问题回头看Atlas,它目前在状态保持、空间控制和下游3D输出上给出了比较强的信号;行动结果、复杂物理和规模化成本,还需要等待真实用户验证。
这比简单争论Atlas算不算世界模型更有意义。
最后
以前看到世界模型,我很容易把它理解成更高级的视频生成。
查完Atlas以后,我觉得两者最关键的区别,不是画面精度,也不是能不能生成3D。
视频模型主要回答接下来会看到什么,世界模型还要回答做了这件事以后,世界会变成什么。
这个区别决定了产品最终交付的是一段内容,还是一个可以持续观察、修改和行动的环境。
真正的测试也不是视频好不好看。
相机转过去再转回来,杯子还在不在原来的位置;机器人碰了它以后,模型知不知道接下来发生了什么。
Atlas现在证明了前半句,后半句还要再等等。
参考资料:
- World Labs:Atlas,A World Model for Spatial Intelligence
- World Labs:A Functional Taxonomy of World Models
- David Ha、Jürgen Schmidhuber:World Models
- 李飞飞:From Words to Worlds,Spatial Intelligence is AI’s Next Frontier
本文由 @楊yang 原创发布于人人都是产品经理。未经作者许可,禁止转载
题图来自作者提供
- 目前还没评论,等你发挥!

起点课堂会员权益




