模型与RSIMODELS · RSI · 月更
两个引擎 · 两条前沿 · 每月更新

AI 学会了写代码,
下一步是科研与物理世界

大模型已经能辅助甚至替代大量白领工作;下一站是科研(AI4S),更远处是和物理世界打交道的工作(世界模型)。 推着它们往前走的有两个引擎:SOTA 模型本身,以及让 AI 研发自己加速的递归自我改进(RSI)。这个站每月记一次,四条线各自走到了哪。

先看本月 →这个站怎么判断
最新一期 · 2026 年 9 月
Atlas 落地,与两个都算数的分数
World Labs 把相机位姿做成了世界模型的原生输入;同一个月,GPT-6 Astra 的 ARC-AGI-3 有两个都被官方承认的分数,差了 37 个百分点。
读本期月报 →
每月三问
1. 引擎走到哪了?
RSI 本月推进到第几阶段,SOTA 模型又往前走了多少。
2. SOTA 递了什么?
GPT、Claude、Gemini 与国产开源模型,本月给科研和物理世界带来了什么。
3. 两条前沿各自走到哪了?
AI4S 与世界模型不依赖通用大模型的独立进展。
THE THESIS · 本站主轴

谁先成熟,取决于验证一个结果有多便宜

1 级 · 已成熟
白领
编程 · 办公
验证器 · 测试与编译器:秒级、几乎免费
本站不单独跟踪,只在 SOTA 模型页标定起点
2 级 · 约两年内成熟(本站判断)
科学家
AI4S · 生命科学 · 材料
验证器 · 模拟与湿实验:几天到几个月,昂贵
主线之一
3 级 · 行业早期
蓝领
世界模型 · 理解并操控物理世界
验证器 · 只有真机:慢、贵、不可重复
主线之一
引擎SOTA 模型推着每一级往上走引擎RSI让推的速度本身变快

这也解释了 RSI 为什么先发生在代码上:改完一版代码,测试立刻告诉你有没有变好。验证越贵,「自己改进自己」的环越难闭上。成熟时间是本站的判断,逐月复核,不是预言。

FOUR LINES · 两个引擎 + 两条前沿

四条线现在在哪

引擎 · 通用大模型本身
SOTA 模型
10个模型
OpenAI · Anthropic · Google · 国产开源
2026 年 9 月 新增 6
引擎 · 让模型研发自己加速
RSI
3/4阶段
走得最远:AI 加速 AI 研究(进行中)
2026 年 9 月 新增 13
前沿 · 辅助或替代科学家
AI4S
13个条目
5 个方向,最高到 L4
2026 年 9 月 新增 14
前沿 · 理解并操控物理世界
世界模型
6条路线
42 个世界模型
2026 年 9 月 新增 9
RSI 四阶段1 经验自进化 · 已规模化2 Harness 自进化 · 进行中3 AI 加速 AI 研究 · 进行中4 AI 端到端训练下一代 AI · 未发生· 11 条证据
MONTHLY · 按月更新

最近更新

看全部月报
2026-09模型Cosmos 32026-09机构OpenAI2026-09时间线World Labs 发布 Atlas2026-09术语评测外壳2026-09传导同一个基准,两个都算数的分数2026-09RSIACE:让上下文自己演化2026-09AI4SAlphaFold 32026-09模型Atlas2026-09机构World Labs2026-09时间线GPT-6 Astra,与 ARC-AGI-3 的两个分数
TRANSMISSION · 引擎 → 前沿

引擎递了什么过来

看全部传导
SOTA 模型AI4S🟡 有演示通用大模型进入科研工作台
三家都在 2026 年把通用模型推进了科研流程;目前加速的是文献、分析、写作与实验设计,验证环节——湿实验与临床——一步也没有变快。
SOTA 模型世界模型 · RSI🔵 有论证,无实验从压缩摘要到可检索的持久上下文
对照组这个月在补「长程记忆」,但补的是自己会话历史的记忆,不是环境状态的记忆——两件事只共享一个名字。
SOTA 模型世界模型 · RSI🟢 有实测数据同一个基准,两个都算数的分数
同一个模型、同一套题,换一层评测外壳分数从 62.7% 跳到 99.9%——世界模型的官方数字经不起同样这一问。
LIBRARY · 资料层

查具体的东西

去资料库
52
条模型
模型库
35
家机构
机构
21
个节点
时间线
39
条术语
术语表
模型库里世界模型 42 个、SOTA 模型 10 个;AI4S 条目与 RSI 证据在各自的线上
模型与RSI · 两个引擎、两条前沿,每月更新。关于与方法 →术语表 →最后更新 2026-09