World Labs Atlas:一张图控镜头,还能给机器人做 Real-to-Sim
文字、图、视频、深度图进同一个「空间上下文」。你给相机路径,它生成连贯世界;几张手机照片也能重建场景。
2026 年 9 月 1 日,World Labs 推出 Atlas——下一代 omni world model。它从零预训练,原生吃文本、图像、视频和 3D,架构是 multimodal autoregressive diffusion transformer:输入先落到共享空间上下文,再按上下文生成下一步,并在 3D 上保持一致。
能做的几类事
- 镜头可控生成:一两张参考图加精确相机位姿,可出最长约 1 分钟、最高 1440p 的视频。相机是原生输入,不是靠文案猜「pan / crane」。
- 稀疏重建:一两张到上百张都行。输入少时会靠世界知识补洞;输入多时更忠于实景。可出点云或 3D Gaussian splat,方便进游戏、VFX、机器人。
- 时空模拟:几部手机拍的多机位,能做子弹时间式 reframing;也可从真实录像做 Real-to-Sim,给导航/操作机器人喂传感器视角。
- 图像 / 360°:文生图与 panorama,能跟复杂提示、渲染文字、换风格。
和 Marble 的关系
Atlas 会驱动未来版本的 Marble 以及 World Labs 其他产品。官方称在相机跟随和稀疏视角 3D 重建基准上,超过一批更专一的模型;并且随训练算力增大,能力阶梯式上涨。
怎么拿到
目前是早期访问:选定合作伙伴可申请,官方会联系。没有面向全网的公开 API 入口,想玩先填申请。
主要依据 World Labs Atlas: A World Model for Spatial Intelligence(2026-09-01)。