李飞飞World Labs发布全球首个多模态世界模型Atlas
摘要:多模态世界模型Atlas可以根据少量照片补全并重建三维空间,再按照设定好的镜头路线生成新视角和最长1分钟的1440p视频,还能帮助把真实环境转化为机器人训练和测试所需的仿真场景。
产联社编辑 | 黄钰慧

【产联社】AI正在尝试从生成一张图、一段视频,进一步走向把画面背后的空间也“搭”出来。当地时间9月1日,李飞飞创办的World Labs发布新一代世界模型Atlas,并称其为全球首个多模态世界模型。按照World Labs的定义,Atlas是一款面向空间智能的“omni world model”。模型从零开始预训练,可以处理文本、图像、视频和3D数据,并在同一个模型中完成世界生成、空间重建和时空模拟等任务。
Atlas最直观的变化,是它开始处理画面背后的空间关系。给它一张或几张照片,模型可以根据已有信息生成新的观察角度,也可以随着输入照片增加,逐步还原更加完整的真实场景。用户还可以直接设定相机的位置、角度和移动路线,让模型沿着指定路径生成视频。World Labs展示的案例中,Atlas可以根据1至6张参考图片生成视频,最长达到1分钟,分辨率最高为1440p。
目前Atlas尚未全面开放,而是进入面向部分合作伙伴的早期访问阶段。World Labs表示,这款模型未来将成为Marble以及公司其他产品的底层模型。
从生成画面到重建空间
过去给AI一张照片,得到的通常还是另一张图片或者一段视频。Atlas则试图进一步处理照片背后的空间关系,并从没有被拍到的角度继续生成画面。
比如一张照片只拍到了机器人的正面,Atlas可以换一个角度继续生成机器人的背面。照片只拍到了泳池的一部分,当镜头继续移向原图没有覆盖的区域时,模型还会补出草坪等周边环境。
不过,这些没有被拍到的内容并不是对现实世界的精确还原。Atlas需要根据已经看到的画面和模型学到的世界知识进行推测,World Labs把这一过程称为“想象”。随着不同角度的真实照片增加,模型掌握的场景信息越来越多,需要自行补充的区域也会相应减少。
World Labs还展示了斯坦福大学Main Quad的重建案例。团队向Atlas输入2至25张从地面拍摄的照片,模型随后可以生成从校园上空观察这一场景的镜头。除了新的观看角度,Atlas还能输出点云、3D Gaussian Splatting等3D结果,可用于机器人、游戏、设计和视觉特效等后续流程。
这也让Atlas与单纯生成一段视频有了明显区别。它不仅要继续生成画面,还要利用不同图片在三维空间中的位置关系,让用户能够从新的角度观察同一个场景。
镜头开始在虚拟空间里移动
当模型能够处理场景里的空间关系,改变的不只是生成什么画面,镜头怎么移动也变得更加可控。
相比依靠“镜头左移”“环绕人物”等文字描述来控制运镜,Atlas可以直接把相机在三维空间中的位置和方向作为输入。用户可以提前设计镜头从哪里开始、经过哪里、最后停在哪里,再让模型沿着这条路线生成画面。
World Labs还展示了类似电影“子弹时间”的效果。团队使用3至5台普通手机或运动相机拍摄场景,再由Atlas重新生成其他观察角度。即使新的观察位置原本没有摆放相机,模型也可以根据已有画面重新生成这一角度下的内容。
这种能力的意义不只在于做出更特别的镜头。对于影视、游戏和设计等需要反复调整观察位置的场景,一个已经生成或者重建的空间可以继续更换机位和镜头路线,而不用每次都从头生成一段彼此独立的视频。World Labs也将视觉特效、游戏和设计列为Atlas 3D能力可以进入的工作流。
这也和World Labs此前的产品路线接上了。2025年11月,公司将世界生成产品Marble向所有用户开放。Marble可以根据文字、图片、视频和简单3D布局生成可探索的3D世界,并允许用户继续编辑、扩展和组合这些场景。今年1月,公司又推出World API,让开发者能够通过接口调用Marble的世界生成能力。
Atlas发布后,World Labs已经明确表示,这款模型将用于未来版本的Marble以及公司的其他产品。相比此前主要通过Marble生成和编辑3D世界,Atlas进一步把世界生成、空间重建和模拟能力放进了同一个模型。
Real-to-Sim拓展机器人仿真
如果说影视、游戏和设计是Atlas比较直观的应用,机器人则是World Labs正在重点拓展的另一个方向。今年以来,公司已经连续推进机器人仿真和Real-to-Sim相关布局。
机器人进入真实环境工作之前,需要经过大量训练和测试。World Labs指出,每增加一个任务或环境,都可能需要大量人工准备,真实硬件上的失败也往往需要重新恢复场景和设备,因此反复依赖实机测试成本较高。
把更多训练搬进虚拟环境可以减少真机试错,但大规模准备仿真场景本身同样需要成本。World Labs此前在机器人案例中也提到,传统方式手工构建大量高质量训练环境速度慢、成本高,而且不同场景之间的一致性也难以保证。
Atlas此次展示的是一种Real-to-Sim路径。开发人员可以先用手机或相机拍下真实环境,再利用Atlas重建空间,并把这些结果用于机器人的仿真训练和测试。
World Labs展示的机器人导航案例中,团队用手机视频拍摄两个大型环境,分别选取24帧画面用于重建。随后,不同类型的虚拟机器人可以在这些场景中沿不同路线移动,Atlas则根据机器人所在的位置,生成其机载相机此时应该看到的RGB画面和深度信息。
在机械臂等操作任务中,Atlas还可以根据几段真实录像辅助建立包含物体运动和交互的仿真环境。开发人员随后可以改变物体、位置、机器人动作、光照和背景等条件,从同一个现实任务进一步产生不同的训练数据和测试环境。
这条路线并不是Atlas发布后才出现。今年7月21日,World Labs宣布收购机器人公司SceniX。7月28日,公司进一步公布Real-to-Sim-to-Real技术进展,希望把真实机器人、环境和任务重建成可以反复使用的仿真环境,在其中训练和测试机器人策略,再回到现实中验证。
从World Labs目前公开的产品路线看,Atlas让这些能力进一步向统一模型靠拢。真实照片和视频可以用于重建空间,Atlas还可以生成机器人在其中移动时对应的视觉和深度信息,并辅助建立机器人操作仿真。
不过,Atlas目前展示的仍是Real-to-Sim进一步扩展的能力。机器人仿真不仅要解决画面是否逼真,还涉及现实中的物体运动和交互能否在虚拟环境中得到可靠反映。其能够在多大程度上减少真实环境的数据采集和测试,仍需要后续实际应用验证。
多种空间能力向统一模型集中
Atlas并不是World Labs突然推出的一款独立产品,而是这家公司过去两年围绕空间智能逐步推进的最新一步。
World Labs由李飞飞与Justin Johnson、Ben Mildenhall、Christoph Lassner共同创办。公司2024年公开亮相后,同年12月展示了从单张图片生成可持续探索3D世界的早期成果,此后不断扩展相关模型和产品。
2025年11月,Marble正式向所有用户开放。今年1月,World API上线,让开发者可以通过程序调用世界生成能力。到了7月,World Labs又收购SceniX,并公布Real-to-Sim-to-Real技术进展,进一步加强机器人仿真方向。
今年2月,World Labs还宣布获得10亿美元新融资,投资方包括AMD、Autodesk、Emerson Collective、Fidelity、英伟达和Sea等。公司表示,这笔资金将用于继续推进空间智能和世界模型,应用方向覆盖内容创作、机器人和科学发现等。
现在推出的Atlas,则开始把过去分布在世界生成、空间重建和模拟中的多种能力放进同一个模型。World Labs称,Atlas能够在统一架构中完成生成、重建和模拟等任务,并将成为未来版本Marble等产品的底层模型。
从产业端看,Atlas体现出的变化,是生成式AI开始进一步处理图片和视频背后的三维空间。一个场景不仅可以被生成,还可以从新的角度观察、重建,并进一步进入影视、游戏、设计和机器人等工作流。
目前,这条路线仍处于早期阶段。Atlas尚未全面向公众开放,而是首先面向部分合作伙伴提供早期访问。
从Marble生成可探索的3D世界,到World API把能力开放给开发者,再到收购SceniX加强机器人仿真布局,World Labs正在逐步把世界生成、空间重建和模拟连接起来。Atlas的最新尝试不再只是让AI生成眼前的画面,而是进一步让模型处理和构建画面背后的三维世界。
商务合作/报料请联系侯经理 18801065284(微信同号)
特别声明:产联社摘录或转载的属于第三方的信息,目的在于传递更多信息而非盈利,同时并不代表赞成其观点或证实其描述,内容仅供参考。转载信息版权归原媒体及作者所有,若有侵权,请联系我们删除。如其他媒体、网站或个人擅自转载使用,请自负版权等法律责任。




