通用大模型在这个站里是引擎,不是对照组。它已经在编程和办公这一级站稳,下一步正被推向科研(AI4S),更远处是物理世界(世界模型)。所以每个模型都回答两个问题:它递给了 AI4S、世界模型、RSI 什么;从世界模型的角度看,它还差什么。
重点跟踪四个阵营:OpenAI、Anthropic、Google 同级,外加国产开源(DeepSeek、Qwen、Kimi、GLM)。SOTA 只对具体评测、具体版本、具体条件成立,所以这里不做总排行榜;所有厂商数字都标「官方口径」。
本站不单独跟踪 Coding / Work,只用几个官方分数标定起点:这一级的验证器最便宜(测试一跑就知道对不对),所以最先成熟。
OpenAI 2026 年 9 月的新旗舰:把计算机操作、长程专业工作与网络安全同时推到新高度。
把高难度知识工作、编程、科学研究和多智能体协作放进同一个通用模型家族。
以更低成本接近 Fable 级能力,强调稳定执行、计算机使用和日常专业工作。
把更长时间的自主工作、视觉操作、持续记忆和高难度知识任务推到新的能力层级。
把通用生产级智能体的成本压下来:主打软件工程与长程智能体工作流。
Gemini 的深度推理模式:用更多推理时计算换准确率,主打数学与科学研究。
在同一基座上扩展长程任务环境与强化学习后训练,重点提升编程、Agent 与安全能力。
1.7 万亿参数、MIT 协议开放权重,是开放阵营里许可最宽松的旗舰。
Qwen 首次把 Max 级模型直接开放:2.4T 总参数、95B 激活、百万级上下文。
2.8T MoE、原生视觉与百万 token 上下文,把开放模型推进到长程 Agent 与专业工作的前沿。