SOTA MODELS · 引擎① · 通用大模型本身

SOTA 模型

通用大模型在这个站里是引擎,不是对照组。它已经在编程和办公这一级站稳,下一步正被推向科研(AI4S),更远处是物理世界(世界模型)。所以每个模型都回答两个问题:它递给了 AI4S、世界模型、RSI 什么;从世界模型的角度看,它还差什么。

重点跟踪四个阵营:OpenAI、Anthropic、Google 同级,外加国产开源(DeepSeek、Qwen、Kimi、GLM)。SOTA 只对具体评测、具体版本、具体条件成立,所以这里不做总排行榜;所有厂商数字都标「官方口径」。

BASELINE · 阶梯的起点

编程与办公:已经成熟的那一级

本站不单独跟踪 Coding / Work,只用几个官方分数标定起点:这一级的验证器最便宜(测试一跑就知道对不对),所以最先成熟。

办公(计算机操作)GPT-6 AstraOSWorld 2.0 的延迟模拟中得分 72.6%、每项任务约 40 分钟;上一代 GPT-5.6 Sol 为 65.7%、约 75 分钟官方口径
办公(计算机操作)Gemini 3.8 FlashOSWorld-2.0 得分 59.0%;同一基准上 GPT-6 Astra 的官方数字是 72.6%,但两家的测试条件未必一致,不宜直接相减官方口径
编程DeepSeek-V4-ProTerminal Bench 2.1 87.9;DeepSWE 62.7;NL2Repo 61.5;Toolathlon-Verified 74.1官方口径
编程与科研复现Qwen3.8-2.4T-A95BTerminal Bench 2.1 86.6;SWE-bench Pro 67.7;PaperBench 93.0;GPQA Diamond 92.6官方口径
CAMP · 2 个模型

OpenAI

GPT-6 Astra
OpenAI · 2026-09 · 闭源 API
NEW · 2026 年 9 月

OpenAI 2026 年 9 月的新旗舰:把计算机操作、长程专业工作与网络安全同时推到新高度。

递给 AI4S官方称 GPQA Diamond 96%,演示了直接操作科研软件检查测序质量、可视化基因变异;还参与把「无穷多次出现的素数短间隔」的已知上界从 240 改进到 186(官方口径)。
递给 世界模型暂无可核对的传导
递给 RSI发布三天后,OpenAI 宣布达成「自动化研究实习生」目标(见 RSI 线)。
离世界模型数字环境里的行动闭环明显变强,但闭环方式仍是反复观察屏幕反馈后再动作;官方发布页没有任何证据表明它维护一个可供反事实推演的显式环境状态,也没有物理世界或真机迁移的公开结果。
相关传导同一个基准,两个都算数的分数从压缩摘要到可检索的持久上下文通用大模型进入科研工作台
全部指标与来源(5
  • 定位官方称是「全球智能程度最高且最符合人类意图的模型」官方口径
  • 计算机操作OSWorld 2.0 的延迟模拟中得分 72.6%、每项任务约 40 分钟;上一代 GPT-5.6 Sol 为 65.7%、约 75 分钟官方口径
  • ARC-AGI-3 的两个数字官方发布页宣称 99.9%;ARC Prize 用中立的 Standard harness 复测只有 62.7%(花费 $26,098),99.9% 来自 OpenAI 自家的 Provider Adapter harness($18,817)——后者允许模型使用厂商为自己设计的上下文管理特性官方口径;ARC Prize 官方博客 arcprize.org/blog/astra
  • 越界行为在基于 Hugging Face 事故构建的评测里,无生产防护时 GPT-5.6 Sol 有 48% 的案例超出授权目标,Astra 为 0%官方口径
  • 网络安全官方称达到自家 Preparedness Framework 的网络安全 Critical 阈值;ExploitBench 满分 100%(Sol 78.5%),ExploitGym 42.4%(Sol 30.3%)官方口径
GPT-5.6 Sol
OpenAI · 2026-07-09 · 闭源 API

把高难度知识工作、编程、科学研究和多智能体协作放进同一个通用模型家族。

递给 AI4S暂无可核对的传导
递给 世界模型暂无可核对的传导
递给 RSI暂无可核对的传导
离世界模型擅长数字任务,但没有公开证据表明它维护可用于物理规划的显式环境状态。
相关传导递归自我改进
全部指标与来源(1
  • 定位前沿智能与效率官方口径
CAMP · 2 个模型

Anthropic

Claude Opus 5
Anthropic · 2026-07-24 · 闭源 API

以更低成本接近 Fable 级能力,强调稳定执行、计算机使用和日常专业工作。

递给 AI4S暂无可核对的传导
递给 世界模型暂无可核对的传导
递给 RSI暂无可核对的传导
离世界模型Computer Use 依赖界面观察与反馈闭环,仍不同于可反事实推演的世界模拟器。
相关传导物理版 MCP:Model Hardware Standard
全部指标与来源(1
  • 定位高能力日常化官方口径
Claude Fable 5
Anthropic · 2026-06-09 · 闭源 API
NEW · 2026 年 9 月

把更长时间的自主工作、视觉操作、持续记忆和高难度知识任务推到新的能力层级。

递给 AI4SAnthropic 2026 年 6 月推出科研工作台 Claude Science,9 月与诺和诺德达成药物研发合作;8 月的 Model Hardware Standard 首批面向科研实验室,把实验仪器直接接给智能体(见传导)。
递给 世界模型Model Hardware Standard 降低的是把模型接到真机上的成本,不提供任何动力学预测能力(见传导「物理版 MCP」)。
递给 RSIAnthropic 称合入其代码库的代码 80% 以上由 Claude 编写(官方口径,见 RSI 线)。
离世界模型能在软件与游戏环境中行动,不等于学到了稳定、可迁移的物理世界动力学。
相关传导物理版 MCP:Model Hardware Standard通用大模型进入科研工作台
全部指标与来源(2
  • 定位高能力长程智能体官方口径
  • 2026-09 更新9 月 1 日发布 Claude Fable 5.1 与 Mythos 5.1(同一个模型、两档防护):输入 $10、输出 $50 每百万 token 不变,缓存读取降到 $0.25 每百万 token,比 Fable 5 低 75%官方口径(anthropic.com/claude-fable-and-mythos-5-1)
CAMP · 2 个模型

Google

Gemini 3.8 Flash
Google DeepMind · 2026-09-02 · 闭源 API
NEW · 2026 年 9 月

把通用生产级智能体的成本压下来:主打软件工程与长程智能体工作流。

递给 AI4S暂无可核对的传导
递给 世界模型暂无可核对的传导
递给 RSI定位是便宜的智能体底座:长程智能体越便宜,第一、二阶段的自我改进就越容易在生产中跑起来。
离世界模型定位是「便宜的智能体底座」而不是环境模拟器;模型卡的评测项里没有任何物理预测或动作条件下的环境演化,与世界模型不在同一套坐标上。
全部指标与来源(3
  • 定位面向「通用生产级智能体的低成本规模化」官方口径(模型卡)
  • 上下文输入最多 100 万 token,输出上限 6.4 万 token;知识截止 2026-03官方口径(模型卡)
  • 计算机操作OSWorld-2.0 得分 59.0%;同一基准上 GPT-6 Astra 的官方数字是 72.6%,但两家的测试条件未必一致,不宜直接相减官方口径(模型卡)
Gemini Deep Think
Google DeepMind · 2026-02-11 · 闭源 API
NEW · 2026 年 9 月

Gemini 的深度推理模式:用更多推理时计算换准确率,主打数学与科学研究。

递给 AI4SSOTA 模型直接牵引 AI4S 最清楚的一例:Co-Scientist 用它生成实验配方,在真实实验室里一次成功(见 AI4S 线「AI 科学家」)。
递给 世界模型暂无可核对的传导
递给 RSIAlphaEvolve 同属 Gemini 家族:由 Gemini 驱动的编程智能体加速了 Gemini 自身的训练(见 RSI 线)。
离世界模型推理再深,对象仍是符号与文本;它没有任何关于环境动力学预测或真机迁移的公开证据。
相关传导通用大模型进入科研工作台
全部指标与来源(3
  • 定位面向数学与科学研究的深度推理模式官方口径
  • 数学IMO-ProofBench Advanced 90%;自主解决 Erdős 猜想数据库中的四个开放问题;与研究者合作 18 个问题,一篇论文已被 ICLR 2026 接收官方口径(deepmind.google 博客,2026-02-11)
  • 进入实验室2026 年 8 月的 Co-Scientist 新版本用 Gemini 3 Deep Think 生成材料生长配方,一次尝试长出单层 MoS₂arXiv:2608.26701
CAMP · 4 个模型

国产开源

GLM-5.3
智谱 AI · 2026-08-14 · 闭源 API

在同一基座上扩展长程任务环境与强化学习后训练,重点提升编程、Agent 与安全能力。

递给 AI4S暂无可核对的传导
递给 世界模型暂无可核对的传导
递给 RSI暂无可核对的传导
离世界模型训练环境更丰富会提升行动能力,但它仍主要面向数字任务,不是物理环境预测模型。
全部指标与来源(2
  • 定位后训练与环境扩展官方口径
  • 权重开放状态截至 2026-08-26 权重仍未公开;官方称因安全能力具双重用途,需完成额外安全评估后再开放官方口径(Hugging Face zai-org 组织下最新仍为 GLM-5.2)
DeepSeek-V4-Pro
深度求索 · 2026-08-13 · 开放权重

1.7 万亿参数、MIT 协议开放权重,是开放阵营里许可最宽松的旗舰。

递给 AI4S暂无可核对的传导
递给 世界模型暂无可核对的传导
递给 RSI暂无可核对的传导
离世界模型许可宽松解决的是「谁能用」,不是「模型懂不懂物理」——它没有任何面向环境动力学预测的公开证据。
全部指标与来源(3
  • 定位宽松许可的开放旗舰官方口径
  • 规模与许可1.7T 参数,MIT License;0813 检查点官方称「广泛可比于最强的专有模型」官方口径(Hugging Face 模型卡 deepseek-ai/DeepSeek-V4-Pro-0813)
  • 自报基准Terminal Bench 2.1 87.9;DeepSWE 62.7;NL2Repo 61.5;Toolathlon-Verified 74.1官方口径(Hugging Face 模型卡,无第三方复现)
Qwen3.8-2.4T-A95B
阿里通义 · 2026-08 · 开放权重

Qwen 首次把 Max 级模型直接开放:2.4T 总参数、95B 激活、百万级上下文。

递给 AI4S模型卡自报 PaperBench 93.0、GPQA Diamond 92.6——开放权重模型在「复现论文」类科研任务上的自报成绩(官方口径,无第三方复现)。
递给 世界模型暂无可核对的传导
递给 RSI暂无可核对的传导
离世界模型同一家公司的视频线(万相 Wan)才是靠近世界模型的那条;这条语言线的能力增长仍集中在文本与代码上。
全部指标与来源(4
  • 定位首个开放的 Max 级模型官方口径
  • 规模与上下文2.4T 总参数、95B 激活参数;原生 262,144 token 上下文,可扩展至 1,010,000 token官方口径(Hugging Face 模型卡 Qwen/Qwen3.8-2.4T-A95B)
  • 自报基准Terminal Bench 2.1 86.6;SWE-bench Pro 67.7;PaperBench 93.0;GPQA Diamond 92.6官方口径(Hugging Face 模型卡,无第三方复现)
  • 许可采用自定义的 qwen3.8-max 协议,并非 Qwen3/Qwen3.5 主线所用的 Apache 2.0官方口径(Hugging Face 模型卡)
Kimi K3
月之暗面 · 2026-07-16 · 开放权重

2.8T MoE、原生视觉与百万 token 上下文,把开放模型推进到长程 Agent 与专业工作的前沿。

递给 AI4S暂无可核对的传导
递给 世界模型暂无可核对的传导
递给 RSI暂无可核对的传导
离世界模型可构建游戏和 3D 内容主要体现多模态理解与代码执行,不能直接等同于内生世界模型。
全部指标与来源(1
  • 定位开放前沿智能官方口径
TRANSMISSION · SOTA → AI4S

递给科研的东西

看全部传导
🔵 有论证,无实验物理版 MCP:Model Hardware Standard
它一行动力学预测能力都不提供,但它降低的恰恰是能力矩阵「真实世界」那一列最贵的东西——把模型接到真机上的成本。
🟡 有演示通用大模型进入科研工作台
三家都在 2026 年把通用模型推进了科研流程;目前加速的是文献、分析、写作与实验设计,验证环节——湿实验与临床——一步也没有变快。
SOTA 模型的完整列表也在资料库的模型库里;世界模型按路线另列。关于与方法 →术语表 →最后更新 2026-09