把相机位姿做成原生输入:世界模型第一次可以被「导演」,而不是拉一次老虎机拉杆。
从零预训练的「全模态」世界模型:文本、图像、视频、3D 深度图进同一个空间上下文。
在 Atlas 之前,「生成」和「重建」基本是两拨人。视频生成模型能编出好看的镜头,但你没法精确指定相机怎么动——只能在提示词里写「向左平移、然后升镜」,然后祈祷模型照办;三维重建模型能忠实还原一个真实空间,但通常需要密集拍摄几十上百张图,而且它只会还原,不会想象:没拍到的地方就是一个洞。中间那件真正有用的事——给我一个空间,我在里面任意走动,看到的既忠于我拍过的部分、又能合理补出我没拍到的部分——两边都做不完整。
Atlas 是一个从零预训练的多模态自回归扩散 Transformer,原生吃文本、图像、相机位姿和三维深度图,视频被表示成图像序列。四个词各管一件事:多模态负责统一输入类型,自回归负责一个元素一个元素地往下生成,扩散(具体是 rectified flow)负责把高维连续数据去噪生成,Transformer 负责在现代硬件上跑得动。
真正的分界点在于上下文的形状。像 LLM 一样,Atlas 先把输入编码成上下文、再条件于上下文生成;但它的每一张图像和深度图都被绑定在三维空间中的一个显式相机位姿上,于是这个上下文不是一维序列,而是一个有坐标的「空间上下文」。相机不再是提示词里的一句形容,而是一种可以逐帧指定的输入格式。
这个设计解锁的控制方式相当直接:你可以把两张毫不相关的参考图放进上下文里的不同三维位置,模型会生成一个在它们之间平滑过渡的世界——自己想象出门廊、走廊、拐角这些本来不存在的连接。官方把这件事描述成「你在布景,而不是在拉老虎机的拉杆」。
生成与重建在这套架构里是同一件事的两面,区别只在你给多少上下文:输入图越多,它想象得越少。官方称两三张图通常就能给出忠实重建,已经超过专门训练的重建模型;同时它也能吃进一百多张图做精确还原。输出可以是 2D 图像与视频,也可以是点云或 3D 高斯泼溅——和 Marble 用的是同一种表征,所以能直接接进 World Labs 已有的产品线。
机器人那部分值得单独看。重建只完成了一半工作:模拟的机器人在空间里移动时,Atlas 还要生成它机身相机沿路会看到的 RGB 与深度。世界,以及机器人对世界的观测,来自同一个模型。官方演示里两个大场景各自只用手机视频的 24 帧完成重建(官方口径)。
| 架构 | 多模态自回归扩散 Transformer;每张图像与深度图都绑定一个显式相机位姿,输入被组织成「空间上下文」而不是一维序列 | 官方口径(World Labs 博客 2026-09-01) |
| 生成能力 | 由 1–6 张参考图加手工设计的相机路径,生成最长 1 分钟、1440p 的视频 | 官方口径(World Labs 博客) |
| 相机可控性 | 第三方人类评委在「谁更贴合指定的相机路径」上选择 Atlas 的比例:对 MiniMax H3 75%、Gemini Omni Flash 81%、Happy Horse 1.1 86%、FLUX 3 93%、Seedance 2.5 94% | 官方口径(World Labs 博客,人类偏好评测) |
| 稀疏视图三维重建 | 七个基准平均 AbsRel 误差 25.3×10⁻³,低于专门训练的重建模型 Pi3X(posed)28.7、π³ 34.7、VGGT-Ω 1B 36.4、Depth Anything 3 39.3、MapAnything 47.7;全部基线由 World Labs 自行复现 | 官方口径(World Labs 博客) |
| 开放状态 | 2026-09-01 起对选定合作伙伴开放早期访问,需提交申请;官方称它将驱动未来版本的 Marble | 官方口径 |
先说那组最醒目的数字。第三方人类评委在「谁更贴合指定的相机路径」上选择 Atlas 的比例是 75% 到 94%(对手依次为 MiniMax H3、Gemini Omni Flash、Happy Horse 1.1、FLUX 3、Seedance 2.5)。问题在口径:这些对手模型不接受相机位姿作为原生输入,只能把镜头运动用标准影视术语写进文本提示。World Labs 自己在博客里承认了这一点,并说更精细的提示工程或创造性的多模态提示可能改善对手表现。所以这组胜率严格说证明的是「有原生相机接口比用文本描述镜头更可控」——这接近于定义,而不是「Atlas 的世界建模能力强于这些模型」。相比之下,三维重建那组数字的可比性要扎实得多:七个基准、全部基线由 World Labs 在统一协议下自行复现,平均 AbsRel 误差 25.3×10⁻³ 对 28.7 到 47.7。
更要紧的空白是物理。整篇发布里没有任何物理准确度的评测——碰撞、重力、物体恒存,一个数字都没有。Atlas 能生成一个几何上自洽的空间,不等于这个空间会按物理规律演化。这恰恰是空间智能这条路线的长期分界线,也是 World Labs 自己立的那把尺子最锋利的地方:李飞飞 2026 年 6 月的《功能性分类》把世界模型分成渲染器、模拟器、规划器三类,批评行业里大量产品「只是渲染器却当三合一来卖」。按这把尺子量,Atlas 在渲染器与重建这一侧做得相当扎实,模拟器那一侧——尤其是动力学——仍然只有演示,没有度量。支持的一方会说,Real-to-Sim 的机器人演示里已经出现了刚体、铰接体与可形变物体的交互,方向是对的;但方向对与数字在不在,是两件事。
最后是开放性。Atlas 目前只对选定合作伙伴开放早期访问,需要提交申请,没有权重、没有公开 API、也没有第三方能在统一条件下复现的评测通道。这意味着上面所有数字——包括那组扎实的重建误差——目前都只能标「官方口径」。