李飞飞创办的World Labs发布了一款名为Atlas的多模态世界模型,官方称其为全球首个。Atlas从零开始预训练,属于面向空间智能的omni world model,能原生处理文本、图像、视频、相机位姿与3D深度信息,并在同一模型中实现世界生成、空间重建和时空模拟。

在相机控制生成方面,输入1至6张照片并设定运镜轨迹,Atlas即可生成最长1分钟、1440p分辨率的视频,并在镜头运动中保持几何与空间一致。模型也能根据单张照片补全未拍摄的区域,例如从机器人正面照片推测其背面,或在泳池边角照上补出草坪和远山。不过当视野进入原图没有覆盖的区域时,它主要依赖先验信息进行推断,跨度越大、路径越长,越可能出现局部几何漂移、物体形状变化和纹理闪烁。因此,它生成的更多是视觉上合理的三维世界,未必是真实场景的精确复刻。
这些能力的底层依赖空间上下文与多视角合成。Atlas给每张图像加上三维坐标和深度信息,使不同角度拍摄的图片、视频能在同一三维空间中定位。视角输入较少时,它更多依靠模型先验;视角增多后,则倾向做空间约束下的多视角融合,把零散素材连成可漫游的场景。
Atlas还支持空间重建。官方展示的斯坦福大学Main Quad案例中,只需提供2至25张游客视角的普通照片,Atlas即可还原草坪、拱廊和纪念教堂外墙,并能将视角升高做航拍式漫游。在DTU、ETH3D、ScanNet等数据集上,稀疏视角重建误差(AbsRel×10-3)得分为25.3,优于Pi3X的28.7、Depth Anything 3的39.3和MapAnything的47.7。输出可对接点云与3D Gaussian Splatting,用于World Labs的Marble平台高帧率渲染。
此外,Atlas还能利用一些普通手机和运动相机拍摄的素材,在虚拟空间中自由切换视角,实现类似“子弹时间”的效果。










