RSI(Recursive Self-Improvement)指 AI 参与改进 AI 自己。本站把它分成四个阶段,刻度是「人从环里退出去多少」:从只改记忆和上下文,到连训练下一代模型都不需要人。它是加速其他一切的引擎——AI4S 里的「AI 科学家」与这里的第三阶段用的是同一套机器。
一篇 2026 年的综述梳理了 1250 篇相关论文,把自我改进用到的评估器排成一个强弱序列:最强的是形式化验证器,最弱的是模型给自己打分(arXiv:2607.07663)。这句话解释了 RSI 为什么先在代码和数学上发生:改完一版代码,测试立刻告诉你有没有变好;改完一步证明,检查器立刻判定对错。「判断有没有变好」几乎不要钱,自我改进的环才闭得上。
这也是本站把 RSI、AI4S、世界模型放在同一把尺子上的原因:科研有模拟和湿实验,验证要几天到几个月;物理世界只有真机,验证又慢又贵还不可重复。验证器越贵,自我改进的环越难闭上,那个领域就越晚成熟。
同一个模型只靠自己积累的经验(而不是人写的新提示词),在同一类任务上可测地变好。
已经从论文走进产品。ACE 这类「不断改写上下文」的方法在智能体基准上有两位数的提升;各家前沿产品都在把跨会话记忆做成默认能力。门槛已经不是「能不能」,而是经验会不会越积越乱。
对世界模型的外溢有限:它记住的是自己的会话历史,不是环境状态(见传导「持久上下文」)。对 AI4S 更直接——科研智能体跨项目积累实验记录,是 AI 科学家从一次性演示走向持续工作的前提。
不动权重,只让模型根据执行反馈不断改写自己的「操作手册」,智能体基准提升 10.6%。
ACE 把上下文当成一本不断增补、修订的操作手册:模型执行任务后,把成功与失败的经验整理成条目写回手册,下一次任务直接带着更新后的手册上场。它刻意避免「每次都把手册压缩成一段摘要」——作者认为那会把细节磨平,越压越空。
结果是在智能体任务上提升 10.6%,金融领域任务提升 8.6%;在 AppWorld 排行榜上,总平均分追平了排名第一的生产级智能体,在更难的挑战集上超过了它(arXiv:2510.04618)。
这是第一阶段的典型样子:没有任何一个权重被改动,变强的全部来源是模型自己积累的经验。
2023 年的早期样本:在 Minecraft 里把学会的技能写成代码存进技能库,后续任务直接调用。
Voyager 是经验自进化最早被广泛引用的例子之一。它在 Minecraft 里探索时,把每个学会的技能写成一段可执行代码存进技能库,下次遇到类似任务先查库、再组合,不必从头摸索。
论文报告它比此前方法多获得约 3.3 倍的独特物品,解锁科技树关键节点最快快 15.3 倍(arXiv:2305.16291)。它也是本站世界模型线与 RSI 线的一个交汇点:它学的是一个游戏世界里的技能,但它并没有学这个世界的动力学模型。
智能体改写自己的脚手架代码,改写后的版本在留出的基准上稳定优于人工设计的版本。
有扎实的实验数字,但大多停在基准上。达尔文-哥德尔机让智能体改写自己的代码,SWE-bench 从 20% 升到 50%;Meta-Harness 找到的脚手架超过了最好的人工设计。前沿实验室内部是否已在生产中常态化使用,外界看不到。
这是 AI4S 最先吃到的一层:同一个科研模型,换一套更好的实验编排与自我审稿流程,结果就不一样(DeepMind 的 Co-Scientist 专门加了一个模块,把稿件里每个数字和原始实验日志逐条核对,见 AI4S 线)。
智能体反复改写自己的脚手架代码并保留一个不断变大的变体档案库,SWE-bench 从 20% 升到 50%。
达尔文-哥德尔机(DGM)让一个编程智能体修改自己的源码——工具怎么调、上下文怎么管、失败了怎么重试——再用编程基准检验改动是否有效。它不只保留当前最好的一版,而是维护一个不断扩大的变体档案库,从中挑选分支继续演化,避免困在局部最优。
结果:SWE-bench 从 20.0% 升到 50.0%,Polyglot 从 14.2% 升到 30.7%(arXiv:2505.22954)。能成立的前提是编程任务有现成的验证器——跑一遍测试就知道改动是好是坏。
自动搜索出的脚手架在 TerminalBench-2 上超过最好的人工设计,而且能迁移到没见过的模型上。
Meta-Harness 把「包在模型外面的整套系统」当作优化对象,端到端地搜索更好的版本。三组结果:在线文本分类上比最好的上下文管理系统高 7.7 分且用的 token 更少;检索增强的数学推理上,一个自动找到的脚手架让 200 道 IMO 级题目的准确率在五个留出模型上平均提高 4.7 分;智能体编程上,找到的脚手架超过了 TerminalBench-2 上最好的人工设计(arXiv:2603.28052)。
「在留出模型上也有效」这一点很关键:它说明改进的是脚手架本身,而不是碰巧适配了某一个模型。
一篇系统梳理:从提示词优化到「优化器代码自己演化」的五级阶梯,主张近期 RSI 主要经由 Harness 发生。
翁荔 2026 年 7 月的长文把 harness 定义为「包在基础模型外面、决定它怎么思考与规划、怎么调用工具、怎么管理上下文、怎么存放产物、怎么评估结果的那套系统」,并把自我改进排成一个由浅到深的序列:指令优化 → 结构化上下文管理 → 工作流设计 → Harness 代码优化 → 优化器代码自身的演化。
文章的核心判断是:近期的递归自我改进主要通过 harness 工程发生,而不是模型直接改写自己的权重。本站的第一、二阶段划分与这个判断一致。这是一篇综述性论证,不是新实验,所以标为「有论证」。
有公开数字表明 AI 系统的产出直接缩短了下一代模型的研发周期或训练成本。
2026 年最有料的一段。两家头部实验室都公开了自测数字:Anthropic 称合入代码库的代码 80% 以上由 Claude 编写;OpenAI 称研究团队每投入一个人工工作日,对应约 3.1 个智能体工作日,并宣布达成「自动化研究实习生」目标。但这些都是自测、自评,没有第三方复核;普林斯顿的独立实验则发现,智能体在开放式研究的创造性判断上仍明显不行。判断:工程层已大面积自动化,研究判断层没有。
这是 RSI 与 AI4S 共用同一套机器的地方:「AI 科学家」用在 AI 上就是这一阶段,用在生物和材料上就是 AI4S。两边的瓶颈也一样——开放式问题没有便宜的验证器。
Gemini 驱动的进化式编程智能体,找到的优化反过来加速了训练 Gemini 本身——阶段 3 最早的硬证据之一。
AlphaEvolve 用 Gemini 生成程序变体、用自动评估器打分、保留好的继续演化。它交出的成果横跨数学与工程:为数据中心找到更高效的调度算法,为硬件加速器的电路设计找到等价简化,把 4×4 复数矩阵乘法降到 48 次标量乘法——在这个设定下是 56 年来第一次改进 Strassen 算法(arXiv:2506.13131)。
与 RSI 直接相关的是另一句:它加速了支撑 AlphaEvolve 自身的那个大模型的训练。一个模型参与优化训练它自己的流程,这就是第三阶段的定义。需要注意的是,每一项成果都依赖一个能自动打分的评估器——它擅长的是「目标清楚、能自动验证」的问题。
OpenAI 称研究团队每个人工工作日对应约 3.1 个智能体工作日;数字全部自测自评。
2026 年 9 月 6 日,OpenAI 发文宣布达成去年秋天定下的目标:到 2026 年 9 月拥有一个「自动化研究实习生」,定义是「能在人的指导下完成边界清楚的研究任务,包括熟练研究员需要花几天的任务」。
三组数字(均为官方口径):截至 2026 年 8 月中旬,按全研究部门编程智能体的总运行时长折算,每投入一个人工工作日对应约 3.1 个智能体工作日;研究员日均推理花费的中位数超过 600 美元(按 API 价格),第 90 百分位超过 7,000 美元;过去六个月,成功完成的 4–8 小时任务中超过一半需要一次以上人工干预。下一个目标是 2028 年 3 月的「自动化 AI 研究员」。
按本站规矩要说清楚:这是自测、自评。OpenAI 自己在附录里承认,这些指标「容易收集,但难以解释」,与研究进展的关系并不确定。「智能体工作日」衡量的是投入,不是产出。
合入代码库的代码 80% 以上由 Claude 编写;代码优化任务上的提速从约 3 倍升到约 52 倍。均为官方口径。
Anthropic 2026 年年中发布的这份报告,是目前前沿实验室对「AI 加速 AI 研发」披露得最细的一份。几组数字(官方口径):合入 Anthropic 代码库的代码 80% 以上由 Claude 编写;工程师人均每季度交付的代码量是 2021–2025 年的 8 倍;在代码优化类任务上,AI 带来的提速从 2025 年 5 月的约 3 倍升到 2026 年 4 月的约 52 倍;在研究中「下一步该做什么」的判断上,Claude 被评为优于人类的比例从 2025 年 11 月的 51% 升到 2026 年 4 月的 64%。
报告同样写明了还没发生的事:Claude 在「选择研究目标」上仍有明显差距;在自主研究的演示里,问题和打分标准仍由人来定。它把「智能体构建并训练模型」画在时间线末端,时间写作「20XX?」。报告还提出,世界应当拥有在可验证的多方协调下放缓或暂停前沿开发的选项。
Sakana 的系统从想法到写论文全自动完成,一篇通过了顶会工作坊首轮评审——但只是工作坊,接收率约 70%。
Sakana AI 与不列颠哥伦比亚大学、Vector 研究所、牛津大学合作的 AI Scientist,能把科研全流程串起来:提出想法、写代码、跑实验、画图分析、写完整论文,再自己审稿。改进后的 v2 版本生成的一篇论文通过了一个顶级机器学习会议工作坊的首轮同行评审,这是第一篇完全由 AI 生成并通过人类同行评审的论文。相关工作 2026 年发表于《自然》(Nature 651, 914–919)。
要把分量放准:那是工作坊而不是主会,接收率约 70%;研究题目限定在机器学习,恰好是实验便宜、结果可自动检验的领域。它同时是 AI4S「AI 科学家」方向的样本——同一套机器,研究对象换成 AI 自己,就是 RSI 第三阶段。
普林斯顿团队让智能体复做两篇未发表的 NeurIPS 2026 论文:工程执行很强,研究判断很弱。
普林斯顿的 Peter Kirgis 与 Sayash Kapoor 等人用 Claude Opus 4.8 尝试完成两篇尚未发表的 NeurIPS 2026 论文的研究工作。结论是:智能体擅长工程任务,但在研究本身上「明确不行」——在极小的数据集上跑出奇怪的实验,凭不充分的证据否掉有希望的假设,对失败的路线只能做小修小补,无法推倒重来(据《麻省理工科技评论》2026-08-18 报道)。
Anthropic 联合创始人 Jack Clark 在同一篇报道中说,公司在尝试自动化 AI 安全研究时看到了类似的局限,并称缺乏创造性是对「短 RSI 时间线」的一个看空信号。Kapoor 给出的解释与本站的验证器主张一致:能用自动指标做强化学习的任务,模型进步很快;任务本身开放时,连训练环境都难以构造。
有实验室公开承认,某个已部署的模型主要是由上一代模型自主研发并训练出来的。
没有任何公开证据表明它已经发生。Anthropic 把它画在自家时间线的末端,时间写的是「20XX?」;OpenAI 把「自动化 AI 研究员」的目标定在 2028 年 3 月。这一格目前只有主张。
如果发生,它对 AI4S 和世界模型的影响是间接的——研发速度整体变快;但物理世界那一侧的瓶颈(真机实验、湿实验)不会因此变快,这正是本站判断「物理世界最后成熟」的理由。
OpenAI 把「自动化 AI 研究员」定在 2028 年 3 月;Anthropic 的时间线上这一格写的是「20XX?」。
目前没有任何公开证据表明,某个已部署的模型主要是由上一代模型自主研发和训练出来的。这一格能写的只有目标:OpenAI 公开的下一个里程碑是 2028 年 3 月实现「自动化 AI 研究员」;Anthropic 在《当 AI 开始构建自己》里把「智能体构建并训练模型」列为最后一步,没有给出时间。
本站会在出现以下任一情况时上调这一格:实验室公开承认某个已部署模型的主要研发工作由 AI 自主完成;或者有第三方能复核的、AI 自主完成一次完整预训练加后训练并超过起点的实验。