ABOUT · 口径、节奏与红线

这个站怎么做的

这个站的几乎全部价值来自方法,而不是来自某一条结论:什么算证据、什么只算主张、谁说的、在什么条件下说的。 所以方法得摊开写,否则「科研会比物理世界先被 AI 接手」这种判断就只是一句断言。这一页就是那份说明书。

§1 追踪什么:两个引擎,两条前沿

大模型最先落地的是编程与办公——辅助甚至替代大量白领工作,这一级已经比较成熟。下一站是科研(AI4S,辅助或替代研究员与科学家), 更远处是物理世界(世界模型,辅助或替代和物理世界打交道的工作)。这两条是本站跟踪的前沿。

推着它们往前走的有两个引擎。一个是 SOTA 模型本身——重点看 GPT、Claude、Gemini 与国产开源模型; 另一个是递归自我改进(RSI)——AI 参与改进 AI 自己,让研发本身加速。两者都会同时作用在两条前沿上: 「AI 科学家」用在 AI 身上就是 RSI,用在生物和材料上就是 AI4S。

引擎 · 通用大模型本身
SOTA 模型
引擎 · 让模型研发自己加速
RSI
前沿 · 辅助或替代科学家
AI4S
前沿 · 理解并操控物理世界
世界模型
每月第一问
引擎走到哪了?
RSI 本月推进到第几阶段、有什么新证据;SOTA 模型又往前走了多少。RSI 的判断写在 RSI 页,四个阶段各有证据撑着,目前 11 条。
每月第二问
SOTA 递了什么?
协议、方法、产品形态、评测口径——挂不到某个模型上,却真的在传导。它们收在传导页,目前 5 条。这一问在「世界模型志」时期叫「交叉地带」,那时只看一个方向。
每月第三问
两条前沿各自走到哪了?
AI4S 与世界模型不依赖通用大模型的独立进展:新的药物进了几期临床、新的世界模型在哪个能力维度上有了数字。
§2 主轴判断:谁先成熟,取决于验证有多便宜

这是本站最核心的一条判断,也是把四条线串成一个逻辑、而不是四块拼盘的那根线:一个领域多快被 AI 接手,取决于「验证一个结果对不对」要花多少时间和钱。 编程最先成熟,是因为改完代码跑一遍测试就知道对错;自我改进(RSI)最先发生在代码上,也是同一个原因。

1 级 · 已成熟
白领
编程与办公
测试与编译器:秒级、几乎免费
2 级 · 约两年内成熟
科学家
AI4S:生命科学、材料
模拟与湿实验:几天到几个月
3 级 · 行业早期
蓝领
世界模型:物理世界
只有真机:慢、贵、不可重复

这条判断的边界要说清楚:「科研约两年内成熟」「物理世界还在早期」是本站的判断,不是预言,每月都会拿新证据复核。 它最容易被推翻的地方有两处:一是自动实验室把湿实验的验证成本大幅压低,AI4S 会比预想的快;二是世界模型真的成为物理世界的「廉价验证器」,蓝领这一级会被提前。 反过来,如果开放式问题上的研究判断迟迟上不去(见 RSI 页的反方证据),科研这一级也可能比预想的慢。

§3 每月怎么更新

固定信源、固定动作。SOTA 模型:OpenAI、Anthropic、Google DeepMind 的官方发布与系统卡,国产开源模型的 Hugging Face 模型卡。 RSI:arXiv 的 cs.AI / cs.LG、METR 与 Epoch AI 的测量、各实验室关于自动化研究的披露。AI4S:《自然》《科学》及子刊、bioRxiv、 Isomorphic、英矽智能、FutureHouse、Arc 研究所等官方发布,药物进展以 clinicaltrials.gov 为准。世界模型:arXiv 的 cs.RO、 Hugging Face Daily Papers、六家世界模型机构的官方博客。中文科技媒体只作线索,任何数字都要回到一手来源核对后才会写进来。

每条新增内容都带一个「收录月份」,月报页因此可以自动聚合出当月的全站增量——新模型、新机构、新术语、新时间线节点、 新的证据格子。这意味着短文是可选的,数据不是:忙碌的月份可以只更数据、不写短文, 月报页会只渲染增量,站点照常更新。设计上不存在「停更」这个状态。

已更新 2
2026 年 9 月 · 2026 年 8 月
每一期都写了短文。
§4 证据怎么分级

世界模型那条线的能力矩阵记录的是证据的强度,不是能力的强弱。 一个格子是黄的,只表示目前没有可核对的数字,不表示这个模型做得差。六个维度分别是:

时序一致性画面/状态在时间上是否连贯,长序列会不会崩坏。
动作可控性能否按外部动作指令改变后续演化,而不只是被动生成。
物理合理性碰撞、重力、物体恒存等物理约束是否被遵守。
长程记忆离开视野的东西再回来时,是否还是原样。
规划与反事实能否用于推演「如果换个动作会怎样」并据此做决策。
真机迁移有没有在真实机器人或真实环境上跑通的公开证据。
矩阵的三档
🟢有公开数据有公开、可核对的量化结果;来源会标明是论文实测还是官方口径。
🟡有演示无数据有可看的演示或案例,但没有任何量化结果。
未涉及这个模型没有主张过这项能力,或没有任何公开材料涉及它。

传导用的是另一套四档,刻意比矩阵多出两档。 原因是「引擎那一侧的某件事影响了某条前沿」这类命题,绝大多数目前只停在论证层面——有清晰的因果推理、有人认真写过, 但没有任何人跑过验证实验。把它塞进「有演示」是撒谎,塞进「未涉及」是抹掉,所以单列出来:

🟢有实测数据有公开的量化结果直接支持这条关联。
🟡有演示有可看的演示或案例,但没有量化结果。
🔵有论证,无实验有清晰的因果论证或严肃文献支持,但还没有人跑过验证实验。
仅有主张目前只是有人这样主张,缺乏论证与证据。

一条守则:绝大多数传导目前只到「有论证,无实验」,不会为了好看往上抬。

RSI 的证据沿用同一套四档,并额外标出「支持」还是「反方」。四个阶段的状态分「已规模化 / 进行中 / 早期迹象 / 未发生」, 只描述有没有公开证据表明它在发生,不预测什么时候完成:

阶段 1经验自进化同一个模型只靠自己积累的经验(而不是人写的新提示词),在同一类任务上可测地变好。
阶段 2Harness 自进化智能体改写自己的脚手架代码,改写后的版本在留出的基准上稳定优于人工设计的版本。
阶段 3AI 加速 AI 研究有公开数字表明 AI 系统的产出直接缩短了下一代模型的研发周期或训练成本。
阶段 4AI 端到端训练下一代 AI有实验室公开承认,某个已部署的模型主要是由上一代模型自主研发并训练出来的。

AI4S 不用能力矩阵,而用一把四级阶梯衡量「AI 在科研闭环里走到了哪一环」,目前收录 18 个条目。 等级是本站判断,依据写在每个条目的「事实与来源」里:

L1 预测给出结构、性质或响应的预测;实验仍由人决定做什么。
L2 设计生成新的分子、序列或材料,并至少有一例被实验合成或表达出来。
L3 闭环AI 提出假设、设计实验、分析结果并迭代——实验可以由机器人或人按 AI 的设计执行。
L4 外部验证发现经过独立验证:进入临床试验,或被 AI 以外的第三方复现。
§5 内容红线
01厂商宣称一律标「官方口径」
论文实测标 arXiv 号,厂商自己发布的数字标「官方口径」,二手报道标出处与日期。一个数字是谁测的、在什么条件下测的,比数字本身更重要。
02视频先核验再上线
路线页里嵌的每一段视频,都要先确认真实存在、且确实是它声称的那个东西,才会进内容文件。没核验的宁可不放。
03争议呈现双方论点
Sora 到底算不算世界模型、LeCun 与生成派之争、RSI 会不会很快到来、自动实验室的「新材料」算不算新——这类问题这里不给结论,两边的理由都写出来,把判断留给读者。
04不做总排行榜
SOTA 模型、AI4S 条目、世界模型用的不是同一套坐标,六条技术路线之间、五个科研方向之间也不是。强行排成一张榜只会失真,所以这里只有按维度的证据与阶梯,没有名次。
05药物只按临床阶段记
「AI 设计的药」是 AI4S 里宣传最多、验证最慢的一块。这里只按一个硬指标记:分子走到了临床几期、数据是否公开发表。融资额与合作公告不算进展。
§6 已知的局限

一、「官方口径」之间并不可比。矩阵里大面积的来源写着「官方口径」,意味着厂商自选评测环境、自选对手、自选提示方式。 2026 年 9 月 ARC Prize 对同一个模型给出 62.7% 与 99.9% 两个都算数的分数,把这个问题第一次摆上了台面—— 而世界模型这边连这个问题都还没被正经提出来。详见传导页的《同一个基准,两个都算数的分数》

二、矩阵是稀疏的。世界模型的能力矩阵里,只有重点模型逐格填满了六个维度,其余多数仍是空白(全站共 52 个模型)。 AI4S 与 RSI 目前也只有种子内容,按月往里补。 补格子是每月的常规动作,不是一次性工程。空白表示「还没查」,不表示「没有」。

三、检索层本身会出错。编纂过程中出现过搜索结果给出具体数字、并归给某篇论文,回查该论文却根本没有这个数字的情况。 所以写进正文的关键数字都要回到一手来源核对;如果你发现某条仍然错了,那是这一步没做到位。

四、分类本身是一种判断。把世界模型切成 6 条路线,以及把某个模型归到某条路线上,都是编者的判断而非客观事实。 路线之间存在竞争、互补与融合关系,路线页里专门画了这张关系图,就是为了不让分类假装成定论。

§7 站点本身

纯静态站点,没有后端、没有登录、不调用任何大模型:你看到的每一句话都是人写进内容文件的,页面只是把它们渲染出来。 目前收录 SOTA 模型 10 个、世界模型 42 个、AI4S 条目 18 个、RSI 证据 11 条。 本站 2026 年 8 月以「世界模型志」之名上线,2026 年 9 月改为现在的定位;那个时期的两期月报原样保留。

读最新一期月报 →去资料库
模型与RSI · 方法、口径与红线都写在这一页。关于与方法 →术语表 →最后更新 2026-09