MONTHLY · 2026-08
创刊号:世界模型志改版,从此按月更新
把「前沿模型」让位给「世界模型」,把一次性快照改成每月增量。这一期说明改了什么、以后怎么更。
这一期出自「世界模型志」时期:那时本站以世界模型为唯一主线、通用大模型为对照组。正文原样保留,是历史记录;文中的「对照组」即现在的「SOTA 模型」,「交叉地带」即现在的「传导」。
本月最重要的一件事
先说改版本身:这个站原来叫「前沿模型学习」,是一份一次性写完就不再更新的快照。这一版把主角换成了世界模型——「前沿基础模型 → 智能体 → 世界模型 → 行动系统」这条叙事线里,世界模型是最容易被忽略、也最考验耐心的一段,六条技术路线(MBRL、JEPA、视频模拟器、具身/VLA、空间智能,加一条起源线)横跨 1990 到 2026 年,很难用一次性快照讲清楚。从这一期开始,站点按月发增量:新模型、新证据、新术语放进对应的内容文件,月报只负责把这个月的变化说清楚——包括「这个月其实没什么好写」这种情况。
落到本月的世界模型进展本身,8 月没有出现类似 DreamerV3、Genie 3 那种改变格局的单点突破。相对有分量的一件事,是做视频生成起家的 LTX(从 Lightricks 拆分出来的公司)在 8 月 11 日发布了 LTX-2.5:一个 220 亿参数、双流架构(视频+音频联合建模)的开放权重模型(官方口径),官方直接把它称为「world model」,支持 720p 到原生 4K、6 到 20 秒的视频片段(官方口径),在两块 NVIDIA GB200 芯片上能把一张图变成 10 秒 720p 视频、耗时约 6.8 秒,快于实时播放速度(VentureBeat 2026-08-11 报道,测试由 LTX 自己在 720p、稳态条件下完成)。它还带了一个面向物理 AI/机器人的预训练检查点,机器人公司 Markov Robotics 联合创始人公开表示正用它来做「让机器人对物理环境建模、跨场景泛化」的工作(roboticsandautomationnews.com 2026-08-13 报道)。
但这条新闻本身就是本站长期强调的那个争议的又一次重演:它究竟是不是「世界模型」?LTX 自己的 Hugging Face 模型卡上写的是「an open world model with open weights」,同时也承认「applicability to emerging domains such as robotics and physical AI is developing」——也就是说,机器人/物理 AI 方向目前更接近「正在发展中」而不是已经成熟可用的能力,这与部分二手报道里「已经带了成熟的物理 AI 检查点」的说法并不完全一致,读者应该以官方模型卡这句更谨慎的表述为准。归根结底,LTX-2.5 首先是一个视频+音频生成模型,「世界模型」这个标签目前主要来自厂商自己的定位,与 Sora、Genie 3 当年面对的质疑是同一个问题:生成得像,不等于理解得对。
对照组观察:通用大模型自己变成世界模型了吗
本月七个对照组模型都有动态,但没有一个把重心移向「预测物理世界如何演变」这件事。GPT-5.6 Sol(OpenAI,2026-07-09 发布)在 8 月的更新集中在网络安全和成本上:8 月 10 日推出的 GPT-5.6-Cyber 变体在自家安全评测里号称解决了 95% 的题目(官方口径),8 月 21 日起 API 与额度定价又下调了两成以上(官方口径,OpenAI 2026-08-21 公告)——都是数字任务范畴内的优化,没有涉及物理环境建模或机器人部署的新证据。
Claude Fable 5 与 Claude Opus 5(Anthropic)8 月的更新主要是安全侧的调整:官方更新了生物安全防护措施,将生物相关请求的误拦截率降低了约 85%(官方口径),涉及双重用途的生物类请求仍会退回给 Opus 5 处理。两个模型的核心定位——长程自主工作、Computer Use、知识任务——没有变化,仍然是通过观察屏幕反馈来行动,而不是维护一个可供反事实推演的环境状态。
Kimi K3(Moonshot,2.8T 参数,官方口径)在 7 月底完成完整权重发布;GLM-5.3(智谱,2026-08-14 发布,官方口径 z.ai/blog/glm-5.3)则在同一套基座上做了强化学习后训练,重点提升编程、Agent 环境和网络安全能力(在自家 CyberGym 基准上刷到新高,官方口径)——GLM-5.3 目前已可通过 API 正式访问,但权重截至 2026-08-26 仍未公开,官方称因安全能力具双重用途、需完成额外安全评估后再开放(官方口径;Hugging Face zai-org 组织下最新仍为 GLM-5.2)。检索范围内没有找到这两个模型在物理理解、具身能力上的专门更新。
本月对照组新收两条,都来自开放阵营,也都在 8 月发布。深度求索的 DeepSeek-V4-Pro-0813 是 1.7 万亿参数、MIT 协议的开放权重模型,官方称其「广泛可比于最强的专有模型」,自报 Terminal Bench 2.1 得分 87.9(官方口径,Hugging Face 模型卡,无第三方复现)——MIT 是目前开放阵营里最宽松的许可,这一点比分数更值得记。阿里的 Qwen3.8-2.4T-A95B 则是 Qwen 首次把 Max 级模型直接开放:2.4 万亿总参数、950 亿激活,原生 262,144 token 上下文可扩展到 1,010,000(官方口径,Hugging Face 模型卡),但它用的是自定义的 qwen3.8-max 协议,而非 Qwen3/Qwen3.5 主线的 Apache 2.0。
把这两条与 GLM-5.3 权重迟迟不放、万相 Wan 自 2.2 之后不再开源放在一起看,本月开放阵营呈现的是一条分叉而不是一条趋势:有人把最强的模型用最宽松的协议放出来,有人一边发布一边收紧。「开源」正在从一种立场退化成一种逐次决策。
汇总下来:本月七个对照组模型的动态清一色落在成本、速度、安全护栏和数字任务能力这几件事上,没有一个模型给出新的、可核对的证据表明自己在往「维护显式物理环境状态」这个方向移动——各自的 gap 描述在本月依然成立。
交叉地带:前沿侧这个月递了什么过来
从这一期起,月报多一个固定栏目。原因是上面那一栏问的「通用大模型离世界模型更近了吗」,答案长期是「没有」——逐月复核 gap 是必要的,但只写这一问,一年十二期都是同一句话。真正每月有料的是对称的另一问:前沿侧发生的事,有没有传导到世界模型这边。这些东西挂不到模型库上,它们是协议、方法和议题,所以单开了一页「交叉地带」,本月首发两条。
第一条是递归自我改进(RSI)。它和世界模型的关联方向与直觉相反:不是 RSI 顺带产生世界模型,而是世界模型很可能是 RSI 走出数字域的前置条件。RSI 之所以先在代码和数学上发生,是因为那两个领域有便宜可靠的验证器——一篇梳理了 1250 篇论文的综述把评估器排成强弱序列,最强是形式化验证器,最弱是模型的内省式自评(arXiv:2607.07663)。物理世界没有便宜的验证器,而这正是世界模型被期待去填的位置。这条关联本月拿到了实测数字:《World Action Verifier》把状态预测拆成「状态是否合理」与「动作是否可达」两个更容易的验证任务,世界模型学习的样本效率提高约 2 倍、下游策略表现提升约 18%,并同时拿下 ICLR 2026 World Models 工作坊的 Outstanding Paper 与 RSI 工作坊的 Spotlight。
第二条是 Anthropic 于 8 月 27 日发布研究预览的 Model Hardware Standard(MHS),可以理解成「物理版的 MCP」:用 read/write 这样一组极简原语加上标准化的设备发现格式,让智能体直接操作显微镜、液体处理器、机械臂,官方称硬件集成工作可从数周压缩到数小时(官方口径)。必须说清楚的是它的层级——MHS 是接口,不是能力,它不预测任何东西。但它冲着的正是能力矩阵里最空的那一列「真实世界」:那一列之所以空,是因为填它需要真机数据,而真机数据贵在机器人本身和把模型接到机器人上的定制集成。它现在只是研究预览、尚未开源,强度只能给到「有论证,无实验」——它是否在年底前真的开源、有多少设备厂商实际实现,是可以逐月核对的事实,会跟。
一句话速览
- Genie 3 于 2026-01-29 起以 Project Genie 形式向美国 Google AI Ultra 订阅用户开放,单次生成上限 60 秒,至今未发表技术论文。官方口径(Google DeepMind 博客 blog.google/.../project-genie/)
- LTX 于 2026-08-11 发布开放权重视频/世界模型 LTX-2.5(220 亿参数),并提供面向机器人与物理 AI 的预训练检查点。官方口径(huggingface.co/Lightricks/LTX-2.5);VentureBeat 2026-08-11 报道
- GLM-5.3 于 2026-08-14 发布,在同一基座上做强化学习后训练,重点提升编程、Agent 环境与网络安全能力,未见世界模型/物理理解方向的专门更新。官方口径(z.ai/blog/glm-5.3)
- GPT-5.6-Cyber(Daybreak Blue/Red)于 2026-08-10 发布,官方称在自家网络安全评测中解决了 95% 的题目。官方口径(OpenAI)
- Anthropic 于 2026 年 8 月更新生物安全防护措施,官方称误拦截率降低约 85%,双重用途生物类请求仍退回 Opus 5 处理。官方口径(Anthropic)
- 阿里万相 Wan3.0 于 2026-08-06 开启公测,单次可生成 30 秒视频并支持 doc/ppt/pdf 等文档输入,但未开源——Hugging Face 的 Wan-AI 组织下最新仍是 2025 年 7 月以 Apache 2.0 开源的 Wan2.2。官方口径(通义实验室发布公告);开源状态为本站 2026-08-28 直接查证 huggingface.co/Wan-AI
- DeepSeek-V4-Pro-0813(1.7T 参数,MIT 协议)与 Qwen3.8-2.4T-A95B(2.4T 总参 / 95B 激活)先后于 8 月以开放权重发布,两者均已收入对照组。官方口径(Hugging Face 模型卡 deepseek-ai/DeepSeek-V4-Pro-0813、Qwen/Qwen3.8-2.4T-A95B)
- 字节 Seedance 2.0 论文题为《Advancing Video Generation for World Complexity》,但摘要通篇未涉及物理模拟、因果或世界建模——「world」在标题里,证据不在论文里。arXiv:2604.14148(本站通读摘要核对)
本月数据增量 · 自动聚合
新增模型 · 47
可微 RNN 世界模型好奇心机制World ModelsPlaNetDreamerV1DreamerV2DreamerV3DIAMONDI-JEPAV-JEPAV-JEPA 2SoraGenie 1GameNGenOasisGenie 3Hunyuan-GameCraftKling 可灵万相 Wan2.2万相 Wan3.0Seedance 2.0LingBot-WorldLingBot-World 2RT-1RT-2OpenVLAπ0π0.5CosmosGR00T N11X World ModelGAIA-1GAIA-2GR-3LingBot-VALingBot-VLA 2NeRF3DGSMarbleHunyuanWorldGPT-5.6 SolClaude Fable 5Claude Opus 5Kimi K3GLM-5.3DeepSeek-V4-ProQwen3.8-2.4T-A95B 能力矩阵变动 · 25
- World Models · 时序一致性 → 🟢 有公开数据arXiv:1803.10122
- World Models · 动作可控性 → 🟡 有演示无数据arXiv:1803.10122
- World Models · 规划与反事实 → 🟢 有公开数据arXiv:1803.10122
- DreamerV3 · 时序一致性 → 🟢 有公开数据arXiv:2301.04104
- DreamerV3 · 动作可控性 → 🟡 有演示无数据arXiv:2301.04104
- DreamerV3 · 规划与反事实 → 🟢 有公开数据arXiv:2301.04104
- V-JEPA 2 · 时序一致性 → 🟢 有公开数据arXiv:2506.09985
- V-JEPA 2 · 动作可控性 → 🟢 有公开数据arXiv:2506.09985
- V-JEPA 2 · 规划与反事实 → 🟢 有公开数据arXiv:2506.09985
- V-JEPA 2 · 真机迁移 → 🟢 有公开数据arXiv:2506.09985
- Sora · 时序一致性 → 🟡 有演示无数据官方口径
- Sora · 物理合理性 → 🟡 有演示无数据官方口径
- Genie 3 · 时序一致性 → 🟡 有演示无数据官方口径(Google DeepMind 博客)
- Genie 3 · 动作可控性 → 🟡 有演示无数据官方口径(Google DeepMind 博客)
- Genie 3 · 长程记忆 → 🟡 有演示无数据官方口径(Google DeepMind 博客)
- LingBot-World 2 · 时序一致性 → 🟡 有演示无数据arXiv:2607.07534
- LingBot-World 2 · 动作可控性 → 🟡 有演示无数据arXiv:2607.07534
- LingBot-World 2 · 物理合理性 → 🟡 有演示无数据第三方实测(爱范儿 ifanr.com/1671406)
- LingBot-World 2 · 长程记忆 → 🟡 有演示无数据arXiv:2607.07534;第三方实测(爱范儿 ifanr.com/1671406)
- π0.5 · 时序一致性 → 🟢 有公开数据arXiv:2504.16054
- π0.5 · 动作可控性 → 🟢 有公开数据arXiv:2504.16054
- π0.5 · 规划与反事实 → 🟡 有演示无数据官方口径(Physical Intelligence 官网博客 pi05)
- π0.5 · 真机迁移 → 🟢 有公开数据arXiv:2504.16054
- Marble · 物理合理性 → 🟡 有演示无数据官方口径(World Labs 博客)
- Marble · 长程记忆 → 🟡 有演示无数据官方口径(World Labs 博客)
新增时间线节点 · 19
- 1990《Making the world differentiable》
- 1991好奇心与内在动机
- 2018Ha & Schmidhuber《World Models》
- 2017–22Transformer → 指令模型 → ChatGPT
- 2019–25PlaNet → Dreamer V1/V2/V3 → V4
- 2020/23NeRF 与 3D Gaussian Splatting
- 2022LeCun 蓝图与 JEPA 登场
- 2024 · 2月Sora 与 Genie 1 同月发布
- 2024 · 8月GameNGen:神经网络跑 DOOM
- 2024 · 9–12月World Labs 成立 · Oasis · Genie 2
- 2025 · 1月NVIDIA Cosmos 发布(CES)
- 2025 · 6–8月V-JEPA 2 · Genie 3
- 2025 · 11月Marble 发布 · LeCun 离开 Meta
- 2026 · 6–8月Fable 5 · GPT-5.6 · Opus 5
- 2026 · 7–8月Kimi K3 开放 · GLM-5.3 发布
- 2026 · 1月/7月LingBot 开源周
- 2026 · 3月AMI Labs 10.3 亿美元种子轮
- 2026 · 8月开放阵营分叉:DeepSeek-V4-Pro / Qwen3.8 开放,Wan3.0 收紧
- 2026 · 6月李飞飞《A Functional Taxonomy of World Models》