MODEL LIBRARY · 专用模型,分层而不混排

模型库

这里收的是两条前沿上的专用模型:世界模型回答「系统如何预测环境与行动后果」,AI4S 科学模型回答「分子、蛋白、材料长什么样、怎么设计」。两类模型的评价坐标不同,所以分层而不混排,也不做总排行榜。通用大模型是引擎,单独放在「模型」页

LIBRARY A · WORLD MODELS
世界模型 · 42 个 ↓
MBRL、JEPA、视频模拟器、具身/VLA、空间智能
LIBRARY B · SCIENCE MODELS
AI4S 科学模型 · 12 个 ↓
蛋白质与分子设计、药物发现、虚拟细胞、材料
LIBRARY A · 世界模型

世界模型

路线
42 个世界模型
可微 RNN 世界模型
1990
慕尼黑工大 / IDSIA · 路线0 起源
「世界模型」术语进入机器学习:RNN 预测未来感官输入。
M+C 范式FKI-126-90
好奇心机制
1991
慕尼黑工大 / IDSIA · 路线0 起源
预测误差即内在奖励,智能体主动探索。
内在动机开山IJCNN 1991
World Models
2018-03
Google Brain · 路线1 MBRL
VAE + MDN-RNN + 梦境训练,让「世界模型」重回聚光灯。
CarRacing 906 分arXiv:1803.10122开源详情 →
PlaNet
2018-11
Google DeepMind · 路线1 MBRL
RSSM 循环状态空间模型,纯隐空间规划。
RSSM 开山arXiv:1811.04551开源
DreamerV1
2019-12
Google DeepMind · 路线1 MBRL
《Dream to Control》:把梦境训练做成通用配方。
梦境策略学习arXiv:1912.01603开源
DreamerV2
2020-10
Google DeepMind · 路线1 MBRL
离散隐变量,首个 Atari 达人类水平的世界模型内智能体。
Atari 人类水平arXiv:2010.02193开源
DreamerV3
2023-01
Google DeepMind · 路线1 MBRL
单套超参跨 150+ 任务,Nature 2025,从零采到钻石。
150+ 任务单套超参arXiv:2301.04104开源详情 →
DIAMOND
2024-05
日内瓦大学 / 爱丁堡大学 · 路线1 MBRL
用扩散模型做世界建模的 RL 智能体。
Atari 100k SOTAarXiv:2405.12399开源
I-JEPA
2023-01
Meta AI(FAIR) · 路线2 JEPA
图像隐空间预测的第一个 JEPA 实例。
隐空间预测arXiv:2301.08243开源
V-JEPA
2024-04
Meta AI(FAIR) · 路线2 JEPA
JEPA 扩展到视频:时序遮挡学运动表征。
视频表征arXiv:2404.08471开源
V-JEPA 2
2025-06
Meta AI(FAIR) · 路线2 JEPA
2-AC 版用 62 小时机器人视频后训练,零样本控制。
62 小时视频后训练arXiv:2506.09985开源详情 →
Sora
2024-02
OpenAI · 路线3 视频模拟器
「世界模拟器」争议起点,分钟级视频生成。
最长 1 分钟视频官方口径详情 →
Genie 1
2024-02
Google DeepMind · 路线3 视频模拟器
从无标注视频无监督学出潜在动作与可玩 2D 世界。
潜在动作模型arXiv:2402.15391
GameNGen
2024-08
Google DeepMind · 路线3 视频模拟器
扩散模型 20fps 实时跑 DOOM。
20fps DOOMarXiv:2408.14837
Oasis
2024-10
Decart / Etched · 路线3 视频模拟器
首个公开可玩的 AI 生成游戏(Minecraft 风)。
公开可玩官方口径开源
Genie 3
2025-08
Google DeepMind · 路线3 视频模拟器
无标注视频学出可交互世界,文本事件注入。
720p / 24fps 实时官方口径详情 →
Hunyuan-GameCraft
2025-06
腾讯混元 · 路线3 视频模拟器
面向游戏场景的可交互视频生成。
游戏场景arXiv:2506.17201开源
Kling 可灵
2024
快手可灵 · 路线3 视频模拟器
国内视频生成代表,向世界模型方向演进。
视频生成官方口径
万相 Wan2.2
2025-07
阿里通义 · 路线3 视频模拟器
首个 MoE 架构的开源视频生成模型,也是 LingBot-World 的底座。
首个 MoE 开源视频模型官方口径开源
万相 Wan3.0
2026-08
阿里通义 · 路线3 视频模拟器
单次 30 秒生成、支持文档输入;能力上去了,权重不再开放。
单次 30 秒官方口径
Seedance 2.0
2026-02
字节跳动 Seed · 路线3 视频模拟器
论文标题写着「面向世界复杂性」,摘要里没有一句世界建模。
480p/720p · 4–15 秒arXiv:2604.14148
LingBot-World
2026-01
蚂蚁灵波 · 路线3 视频模拟器
基于 Wan2.2 的开源世界模拟器:16fps、<1s 延迟、近 10 分钟稳定生成。
16fps 实时arXiv:2601.20540开源
LingBot-World 2
2026-07
蚂蚁灵波 · 路线3 视频模拟器
因果预训练 + MoBA,开源对标 Genie 3,主打帧率与时长。
720p / 60fps 实时流arXiv:2607.07534开源详情 →
RT-1
2022-12
Google DeepMind · 路线4 具身/VLA
离散动作 Transformer 策略,真机大规模数据先行者。
13 万轨迹arXiv:2212.06817
RT-2
2023-07
Google DeepMind · 路线4 具身/VLA
VLM 权重直出机器人动作,VLA 概念确立。
VLA 开山arXiv:2307.15818
OpenVLA
2024-06
斯坦福大学 · 路线4 具身/VLA
7B 开源 VLA,社区微调生态起点。
7B 开源arXiv:2406.09246开源
π0
2024-10
Physical Intelligence · 路线4 具身/VLA
流匹配动作专家,50Hz 连续控制。
50Hz 控制arXiv:2410.24164开源
π0.5
2025-04
Physical Intelligence · 路线4 具身/VLA
开放世界泛化:陌生厨房里收拾台面。
新环境成功率 94%官方口径开源详情 →
Cosmos
2025-01
NVIDIA · 路线4 具身/VLA
世界基础模型平台:预训练 + 后训练管线。
WFM 平台arXiv:2501.03575开源
Cosmos 3
2026-05
NVIDIA · 路线4 具身/VLA
把视觉推理、世界生成与动作预测放进同一个模型的全模态物理 AI 基座。
全模态物理 AI 基座官方口径开源NEW · 2026 年 9 月
GR00T N1
2025-03
NVIDIA · 路线4 具身/VLA
人形机器人推理与技能基础模型。
人形基座arXiv:2503.14734开源
1X World Model
2024
1X Technologies · 路线4 具身/VLA
为全身人形预测接触密集未来:评估比特而非原子。
策略评估官方口径
GAIA-1
2023-09
Wayve · 路线4 具身/VLA
9B 自动驾驶生成式世界模型:视频+文本+动作。
9B 驾驶场景arXiv:2309.17080
GAIA-2
2025-03
Wayve · 路线4 具身/VLA
多视角潜在扩散,结构化条件控制。
多相机一致arXiv:2503.20523
GR-3
2025-07
字节跳动 Seed · 路线4 具身/VLA
字节自研 VLA,配双臂移动机器人 ByteMini,论文称在多项任务上超过 π0。
多任务超过 π0arXiv:2507.15493
LingBot-VA
2026-01
蚂蚁灵波 · 路线4 具身/VLA
视频预测 + 逆动力学出动作(RSS 2026)。
150Hz(官方)arXiv:2601.21998开源
LingBot-VLA 2
2026-07
蚂蚁灵波 · 路线4 具身/VLA
6 万小时预训练、20 种构型:「一脑多机」。
<130ms 延迟(官方)官方口径开源
NeRF
2020-03
加州大学伯克利分校 · 路线5 空间智能
神经辐射场:3D 表征革命的起点。
3D 表征革命arXiv:2003.08934开源
3DGS
2023-08
Inria 等 · 路线5 空间智能
高斯泼溅:实时渲染的显式 3D 表征。
实时渲染arXiv:2308.04079开源
Marble
2025-11
World Labs · 路线5 空间智能
文本/图像生成可探索持久 3D 世界,双表征输出。
高斯泼溅 + 碰撞网格官方口径详情 →
Atlas
2026-09-01
World Labs · 路线5 空间智能
从零预训练的「全模态」世界模型:文本、图像、视频、3D 深度图进同一个空间上下文。
自回归扩散 Transformer官方口径详情 →NEW · 2026 年 9 月
HunyuanWorld
2025-07
腾讯混元 · 路线5 空间智能
视频渲染 + 3D 模拟融合的世界生成。
双表征arXiv:2507.21809开源
LIBRARY B · AI4S 科学模型

AI4S 科学模型

只收「模型」本身;药物、自动实验室与 AI 科学家系统在 AI4S 各方向页。每个模型标出它在闭环成熟度阶梯上的位置(L1 预测 → L4 外部验证),点开看来源与判断。

蛋白质与分子设计 · 5
AlphaFold 2
2021-07
Google DeepMind · 蛋白质与分子设计
从氨基酸序列直接预测单个蛋白质的三维结构,把一个五十年的难题变成了查表。
L1 预测开源NEW · 2026 年 9 月
AlphaFold 3
2024-05
Google DeepMind · 蛋白质与分子设计
把结构预测从单个蛋白扩展到蛋白质与 DNA、RNA、小分子配体等组成的复合物。
L1 预测开源NEW · 2026 年 9 月
RFdiffusion
2023-07
华盛顿大学蛋白质设计研究所 · 蛋白质与分子设计
用扩散模型从噪声中「生长」出蛋白质骨架,按需设计结合蛋白、对称组装体与酶活性位点。
L2 设计开源NEW · 2026 年 9 月
ESM3
2024-06
EvolutionaryScale · 蛋白质与分子设计
同时理解蛋白质序列、结构与功能的生成式语言模型,可以按提示「写」出新蛋白。
L2 设计开源NEW · 2026 年 9 月
AlphaProteo
2024-09
Google DeepMind · 蛋白质与分子设计
给定一个靶点蛋白,直接设计出能与之高亲和力结合的新蛋白(结合剂)。
L2 设计NEW · 2026 年 9 月
药物发现 · 1
Boltz-2
2025-06
MIT Jameel Clinic · 药物发现
同时预测蛋白-小分子复合物结构与结合亲和力的开源模型,由 MIT 与 Recursion 联合发布。
L1 预测开源NEW · 2026 年 9 月
虚拟细胞与生物基础模型 · 2
Evo 2
2025-02
Arc 研究所 · 虚拟细胞与生物基础模型
在横跨生命三域、超过 10 万个物种的基因组上训练的 DNA 基础模型,能读也能写基因序列。
L2 设计开源NEW · 2026 年 9 月
xTrimoSCPerturb
2025-12
百图生科 · 虚拟细胞与生物基础模型
百图生科在单细胞基础模型 scFoundation 上改进的扰动响应预测模型。
L1 预测NEW · 2026 年 9 月
材料研发 · 4
GNoME
2023-11
Google DeepMind · 材料研发
用图神经网络预测晶体是否稳定,把已知稳定无机晶体的数量扩大了一个数量级。
L1 预测开源NEW · 2026 年 9 月
MatterGen
2025-01
微软研究院 · 材料研发
按目标性质直接生成无机晶体结构的扩散模型,与微软的模拟器 MatterSim 配套。
L2 设计开源NEW · 2026 年 9 月
MatterSim
2024-05
微软研究院 · 材料研发
覆盖整个周期表的机器学习原子间势,用来代替昂贵的第一性原理计算做材料模拟。
L1 预测开源NEW · 2026 年 9 月
UMA
2025-06
Meta AI(FAIR) · 材料研发
Meta FAIR 的通用原子模型家族,一个模型同时覆盖分子、材料与催化剂。
L1 预测开源NEW · 2026 年 9 月
指标来源性质:论文实测标 arXiv 号或期刊卷期;厂商宣称标「官方口径」。关于与方法 →术语表 →最后更新 2026-09