World Labs 把相机位姿做成了世界模型的原生输入;同一个月,GPT-6 Astra 的 ARC-AGI-3 有两个都被官方承认的分数,差了 37 个百分点。
9 月 1 日,World Labs 发布 Atlas。它值得放在这一栏,不是因为又多了一个世界模型,而是因为它把过去两年分属两拨人的两件事合成了一件。视频生成模型能编出好看的镜头,但你没法精确指定相机怎么动——只能在提示词里写「向左平移、然后升镜」,然后祈祷模型照办;三维重建模型能忠实还原真实空间,但通常需要密集拍摄,而且只会还原、不会想象,没拍到的地方就是一个洞。中间那件真正有用的事——给我一个空间,我在里面任意走动,看到的既忠于我拍过的部分、又能合理补出我没拍到的部分——两边都做不完整。
Atlas 的做法是把上下文的形状换掉。它是一个从零预训练的多模态自回归扩散 Transformer,像 LLM 一样先把输入编码成上下文、再条件于上下文生成;但它的每一张输入图像和深度图都绑定在三维空间中的一个显式相机位姿上,于是这个上下文不是一维序列,而是一个有坐标的「空间上下文」。相机由此从提示词里的一句形容,变成了可以逐帧指定的输入格式。生成与重建在这套架构里成了同一件事的两面,区别只在你给了多少上下文:输入图越多,它想象得越少。官方称两三张图通常就能给出忠实重建,同时它也能吃进一百多张图做精确还原(官方口径)。
可核对的数字有两组。生成侧:由 1 到 6 张参考图加手工设计的相机路径,生成最长 1 分钟、1440p 的视频。重建侧:稀疏视图三维重建在七个基准上的平均 AbsRel 误差是 25.3×10⁻³,低于五个专门为重建训练的模型(28.7、34.7、36.4、39.3、47.7),全部基线由 World Labs 在统一协议下自行复现。输出可以是 2D 图像与视频,也可以是点云或 3D 高斯泼溅——和 Marble 用的是同一种表征。
对机器人那部分值得单说。重建只完成一半工作:模拟的机器人在空间里移动时,Atlas 还要生成它机身相机沿路会看到的 RGB 与深度——世界,以及机器人对世界的观测,来自同一个模型。官方演示里两个大场景各自只用手机视频的 24 帧完成重建。这是 Real-to-Sim 这条线上很实的一步。
但有两件事按本站的规矩必须说清楚。第一,那组最醒目的相机可控性胜率——第三方人类评委选择 Atlas 的比例在 75% 到 94% 之间——口径有问题:对手模型不接受相机位姿作为原生输入,只能把镜头运动用影视术语写进文本提示,而 Atlas 用的是原生相机格式。World Labs 自己在博客里承认了这一点。所以这组数字严格说证明的是「有原生相机接口比用文本描述镜头更可控」,这接近于定义,而不是世界建模能力的比较。相比之下那组重建误差的可比性要扎实得多。
第二,也是更要紧的:整篇发布里没有任何物理准确度的评测。碰撞、重力、物体恒存,一个数字都没有。Atlas 能生成一个几何上自洽的空间,不等于这个空间会按物理规律演化。这恰恰是李飞飞自己 2026 年 6 月那把尺子最锋利的地方——渲染器、模拟器、规划器三分法,批评行业里大量产品「只是渲染器却当三合一来卖」。按这把尺子量 Atlas:渲染与重建这一侧被做得更扎实了,模拟器那一侧仍然只有演示、没有度量。它目前也只对选定合作伙伴开放早期访问,没有权重、没有公开 API、没有第三方能在统一条件下复现的通道,所以上面所有数字——包括那组扎实的重建误差——目前都只能标「官方口径」。
本月对照组这边动静不小,而且指向同一个方向。9 月 1 日 Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1(同一个模型、两档防护),定价不变,但缓存读取降到每百万 token 0.25 美元、比 Fable 5 低 75%,官方估计典型工作负载省约 25%、高度智能体化的负载最多省约 45%(官方口径)。9 月 2 日 Google 发布 Gemini 3.8 Flash,模型卡上的定位是「通用生产级智能体的低成本规模化」。9 月初 OpenAI 发布 GPT-6 Astra。三件事的共同点很清楚:让智能体跑得更久、更便宜。
本月对照组新收两条:GPT-6 Astra 与 Gemini 3.8 Flash。后者顺带补上了对照组里一直缺的 Google 一席——此前这一栏里没有任何一个 Gemini。
Astra 是对照组里目前离「行动闭环」最近的一个,值得认真对待。OSWorld 2.0 的延迟模拟中它得分 72.6%、每项任务约 40 分钟,上一代 GPT-5.6 Sol 是 65.7%、约 75 分钟(官方口径)——不只是分数涨了,是同样的活少花了约 47% 的时间。Gemini 3.8 Flash 在 OSWorld-2.0 上是 59.0%(官方模型卡),但两家的测试条件未必一致,不宜直接相减。另外 Astra 在越界行为上的改善也确实显著:在基于 Hugging Face 事故构建的评测里,无生产防护时 Sol 有 48% 的案例超出授权目标,Astra 为 0%(官方口径)。
那么它变成世界模型了吗?没有。计算机操作变强这件事,改变的是「在数字环境里把事做完」的能力,而闭环方式仍然是动一步、看一眼屏幕、再动一步。整份发布页里没有任何一项评测涉及「给定当前状态和一个动作,预测环境接下来会怎样」,也没有任何物理世界或真机迁移的结果。各条对照组模型的 gap 描述,本月依然成立。
有一处确实值得单独记一笔,因为它正好落在能力矩阵的一个维度上:OpenAI 同时换掉了 Codex 的上下文管理方式——不再靠压缩生成一段摘要,而是跨上下文窗口保留笔记,且旧的上下文窗口仍可检索(官方口径)。这是对照组在补「长程记忆」。但补的是自己会话历史的记忆,不是环境状态的记忆。为什么这两件事不能划等号,写在本期交叉地带里。
本月新增两条,都跟同一件事有关:分数是在什么条件下拿到的。
第一条是评测口径。GPT-6 Astra 的发布页宣称 ARC-AGI-3 得分 99.9%;ARC Prize 基金会公布的复测把它拆成了两个数字:中立的 Standard harness 62.7%(花费 26,098 美元),厂商自家的 Provider Adapter harness 99.9%(花费 18,817 美元,按累计耗时约快 3.66 倍、总 token 少 49%)。ARC Prize 没有判定哪个是「真」的,而是说两者回答的是不同问题,今后两种条件都报告、分别标注。
这件事对世界模型的意义不在 ARC-AGI-3 本身——那是数字推理与交互任务,离视频世界模型远得很。意义在于:一个中立第三方第一次把「同一基准、多种条件、分别标注」制度化了。而世界模型这边,连这个问题都还没被正经提出来。翻一遍本站的能力矩阵,来源那一栏大面积写着「官方口径」:厂商自选评测环境、自选对手、自选提示方式。本月的 Atlas 胜率就是现成的例子。如果这套做法哪天扩散过来,矩阵里的「🟢 有公开数据」还得再分一层:是在中立条件下拿到的,还是在厂商自己的壳里拿到的。
第二条是那套持久上下文机制,强度只给到「有论证,无实验」。理由写在条目里:Codex 记的是自己写过的会话历史,离散、可以逐字检索;世界模型要记的是环境本身的状态,连续、高维,而且大部分从来没被显式写下来过。「那堵墙在哪里」不是模型说过的一句话,是它生成第 400 帧时必须重新算出来的东西。检索一段自己写过的笔记,和重建一个自己没写过的世界,是两个问题。不过支持方有一条反驳指向更具体的路径:Atlas 的「空间上下文」和 LLM 的上下文本来就是同一个思路的两种实现,World Labs 也明说它因此能复用 KV 缓存、分离式服务这些为 LLM 做的工程优化。所以真正在传导的可能不是「记忆机制」,而是「为长上下文做的系统工程」——这条更窄,也更容易验证。
一句提醒:这两条都还没有任何一家世界模型机构照做。放进来是因为它们具体到可以逐月核对,不是因为它们已经发生。