这个站的几乎全部价值来自方法,而不是来自某一条结论:什么算证据、什么只算主张、谁说的、在什么条件下说的。 所以方法得摊开写,否则「科研会比物理世界先被 AI 接手」这种判断就只是一句断言。这一页就是那份说明书。
大模型最先落地的是编程与办公——辅助甚至替代大量白领工作,这一级已经比较成熟。下一站是科研(AI4S,辅助或替代研究员与科学家), 更远处是物理世界(世界模型,辅助或替代和物理世界打交道的工作)。这两条是本站跟踪的前沿。
推着它们往前走的有两个引擎。一个是 SOTA 模型本身——重点看 GPT、Claude、Gemini 与国产开源模型; 另一个是递归自我改进(RSI)——AI 参与改进 AI 自己,让研发本身加速。两者都会同时作用在两条前沿上: 「AI 科学家」用在 AI 身上就是 RSI,用在生物和材料上就是 AI4S。
这是本站最核心的一条判断,也是把四条线串成一个逻辑、而不是四块拼盘的那根线:一个领域多快被 AI 接手,取决于「验证一个结果对不对」要花多少时间和钱。 编程最先成熟,是因为改完代码跑一遍测试就知道对错;自我改进(RSI)最先发生在代码上,也是同一个原因。
这条判断的边界要说清楚:「科研约两年内成熟」「物理世界还在早期」是本站的判断,不是预言,每月都会拿新证据复核。 它最容易被推翻的地方有两处:一是自动实验室把湿实验的验证成本大幅压低,AI4S 会比预想的快;二是世界模型真的成为物理世界的「廉价验证器」,蓝领这一级会被提前。 反过来,如果开放式问题上的研究判断迟迟上不去(见 RSI 页的反方证据),科研这一级也可能比预想的慢。
固定信源、固定动作。SOTA 模型:OpenAI、Anthropic、Google DeepMind 的官方发布与系统卡,国产开源模型的 Hugging Face 模型卡。 RSI:arXiv 的 cs.AI / cs.LG、METR 与 Epoch AI 的测量、各实验室关于自动化研究的披露。AI4S:《自然》《科学》及子刊、bioRxiv、 Isomorphic、英矽智能、FutureHouse、Arc 研究所等官方发布,药物进展以 clinicaltrials.gov 为准。世界模型:arXiv 的 cs.RO、 Hugging Face Daily Papers、六家世界模型机构的官方博客。中文科技媒体只作线索,任何数字都要回到一手来源核对后才会写进来。
每条新增内容都带一个「收录月份」,月报页因此可以自动聚合出当月的全站增量——新模型、新机构、新术语、新时间线节点、 新的证据格子。这意味着短文是可选的,数据不是:忙碌的月份可以只更数据、不写短文, 月报页会只渲染增量,站点照常更新。设计上不存在「停更」这个状态。
世界模型那条线的能力矩阵记录的是证据的强度,不是能力的强弱。 一个格子是黄的,只表示目前没有可核对的数字,不表示这个模型做得差。六个维度分别是:
传导用的是另一套四档,刻意比矩阵多出两档。 原因是「引擎那一侧的某件事影响了某条前沿」这类命题,绝大多数目前只停在论证层面——有清晰的因果推理、有人认真写过, 但没有任何人跑过验证实验。把它塞进「有演示」是撒谎,塞进「未涉及」是抹掉,所以单列出来:
一条守则:绝大多数传导目前只到「有论证,无实验」,不会为了好看往上抬。
RSI 的证据沿用同一套四档,并额外标出「支持」还是「反方」。四个阶段的状态分「已规模化 / 进行中 / 早期迹象 / 未发生」, 只描述有没有公开证据表明它在发生,不预测什么时候完成:
AI4S 不用能力矩阵,而用一把四级阶梯衡量「AI 在科研闭环里走到了哪一环」,目前收录 18 个条目。 等级是本站判断,依据写在每个条目的「事实与来源」里:
一、「官方口径」之间并不可比。矩阵里大面积的来源写着「官方口径」,意味着厂商自选评测环境、自选对手、自选提示方式。 2026 年 9 月 ARC Prize 对同一个模型给出 62.7% 与 99.9% 两个都算数的分数,把这个问题第一次摆上了台面—— 而世界模型这边连这个问题都还没被正经提出来。详见传导页的《同一个基准,两个都算数的分数》。
二、矩阵是稀疏的。世界模型的能力矩阵里,只有重点模型逐格填满了六个维度,其余多数仍是空白(全站共 52 个模型)。 AI4S 与 RSI 目前也只有种子内容,按月往里补。 补格子是每月的常规动作,不是一次性工程。空白表示「还没查」,不表示「没有」。
三、检索层本身会出错。编纂过程中出现过搜索结果给出具体数字、并归给某篇论文,回查该论文却根本没有这个数字的情况。 所以写进正文的关键数字都要回到一手来源核对;如果你发现某条仍然错了,那是这一步没做到位。
四、分类本身是一种判断。把世界模型切成 6 条路线,以及把某个模型归到某条路线上,都是编者的判断而非客观事实。 路线之间存在竞争、互补与融合关系,路线页里专门画了这张关系图,就是为了不让分类假装成定论。
纯静态站点,没有后端、没有登录、不调用任何大模型:你看到的每一句话都是人写进内容文件的,页面只是把它们渲染出来。 目前收录 SOTA 模型 10 个、世界模型 42 个、AI4S 条目 18 个、RSI 证据 11 条。 本站 2026 年 8 月以「世界模型志」之名上线,2026 年 9 月改为现在的定位;那个时期的两期月报原样保留。