李飞飞创办World Labs发布Atlas世界模型,可生成最长1分钟1440p视频

https://assets.wanlianyida.com/industry-uniapp/web/static/image-default.BtYt8t8Z.png
产联社海外
·阅读量:3,906

摘要:Atlas原生支持文本、图像、相机位姿和3D深度信息,可进行相机控制生成、空间重建及时空模拟;目前已向部分合作伙伴开放Early Access。

产联社编译

feBv35k4m.jpeg

9月2日,World Labs在社交媒体发布消息,由李飞飞创办的人工智能公司World Labs发布新一代世界模型Atlas。该模型从零开始预训练,采用多模态自回归扩散Transformer架构,可在统一模型中处理文本、图像、相机位姿和3D深度信息,并用于世界生成、空间重建和时空模拟。Atlas未来将成为World Labs旗下Marble及其它产品的底层模型。

在相机控制生成方面,Atlas将精确的相机几何信息作为原生输入,可根据指定的相机位置、角度和运动轨迹生成新视角。World Labs表示,模型可基于1至6张参考图像生成视频,最高支持1440p分辨率和1分钟时长。对于输入图像未覆盖的区域,Atlas会依据模型掌握的世界知识补全场景。

Atlas同时具备空间重建能力,可通过少量不同视角图像恢复真实场景。World Labs称,Atlas通常仅使用2至3张图像即可获得较为忠实的重建结果,同时也能够处理超过100张输入图像。模型可直接输出点云和3D Gaussian Splatting等三维表示,并与Marble平台衔接,用于机器人、游戏、设计和视觉特效等场景。

在机器人领域,Atlas重点支持Real-to-Sim应用。World Labs展示的案例中,仅从手机拍摄视频中提取24帧画面,即可重建大型真实环境;在模拟机器人移动过程中,Atlas还可生成机载传感器对应的RGB图像和深度数据,并辅助构建包含刚性物体、关节物体及可变形物体交互的仿真环境,为机器人训练和测试提供数据。

此外,Atlas可以利用3至5台普通手机或运动相机拍摄的多视角视频重建场景,实现类似“子弹时间”的自由视角视频重构,并支持根据文本或图像生成360度全景图。World Labs表示,Atlas目前已进入Early Access阶段,首先向部分合作伙伴开放。

商务合作/报料请联系侯经理 18801065284(微信同号)

特别声明:产联社摘录或转载的属于第三方的信息,目的在于传递更多信息而非盈利,同时并不代表赞成其观点或证实其描述,内容仅供参考。转载信息版权归原媒体及作者所有,若有侵权,请联系我们删除。如其他媒体、网站或个人擅自转载使用,请自负版权等法律责任。

77
27
分享
上一篇 下一篇