自我改进的对象决定了问题
同一个模型回答得更好,可能有四种完全不同的原因:多试了几次;换了一套工具和工作流程;通过训练改变了权重;改写了负责提出下一次修改的程序。四者都可能有用,但它们给“递归自我改进”提供的证据不同。
本文把 RSI(Recursive Self-Improvement)理解为一个需要逐项检查的研究问题:系统产生的改变,是否进入下一轮运行,并提高未来改进的能力? 这是一条分析主线,不是对所有论文强加的统一定义。
本次检索截止 2026-10-03。与“Google 最新 RSI”最直接相关的是 Google Cloud AI Research 等机构的 RRSI:首发 9 月 21 日,核对版本为 9 月 23 日 v2。它主要改 Agent 的 harness,即围绕固定模型的提示、工具、控制流、记忆和上下文管理。Google DeepMind 的 AlphaEvolve 则提供另一条基础路线:用执行结果筛选程序。RRSI 原文、AlphaEvolve 原文
图为本文绘制的分析框架。实线表示一次修改成为系统新版本,虚线表示进一步修改“产生修改的方法”。不是每篇论文都包含虚线部分。
三种进步需要不同证据
第一种是找到一个更好的产物。例如程序搜索发现了更快的内核。评价对象是内核的正确性与性能,生成器本身可以完全不变。重复搜索一万次后的最佳结果很强,也不能单独证明搜索器越来越强。
第二种是得到一个更好的工作系统。例如模型权重固定,但 Agent 学会用局部补丁编辑文件、为长任务保存状态,后续题目都能复用。这里改进被持久保留,评价对象从单个答案变成一套行为。SICA、DGM、RRSI 都能帮助研究这类问题。SICA、DGM
第三种是得到一个更好的改进器。假设原改进器只会提出“增加重试”,新改进器能分析失败类别、提出有区分力的实验,再决定是否增加重试。如果在新任务上,它用同等预算更容易产生有效修改,就比原任务曲线上升更接近我们要验证的递归能力。Hyperagents 把 task agent 与 meta agent 一起纳入可编辑程序,直接触及这个问题。Hyperagents
这三个问题没有天然的单向排名。严格验证的程序发现可以比一个泛化不明的自修改循环更有实践价值。“递归程度更高”本身并不等于更可靠或更经济。
一张固定维度的论文地图
| 路线 | 留下的改变 | 谁给出反馈 | 仍然固定的关键部分 | 本系列位置 |
|---|---|---|---|---|
| RRSI | Agent harness | 任务执行、评分、token 成本 | 基础模型、演化任务与准入框架 | 第 2 篇 |
| AlphaEvolve | 程序、求解器或优化程序 | 可执行评价器 | 外层搜索组织、问题定义 | 第 3 篇 |
| Magellan | 编译器策略及阈值 | 编译与基准测量 | LLVM 环境、工作负载 | 第 3 篇 |
| SICA / DGM | 工具与 Agent 代码 | 代码任务测试 | 基础模型及部分外层机制 | 第 4 篇 |
| Hyperagents | 任务程序与改进程序 | 任务验证和跨域改进实验 | 外层实验协议、任务分布 | 第 4 篇 |
| SEAL | 生成学习材料的策略、适应后的权重 | 更新后的下游表现 | 内层训练程序、参考评价 | 第 5 篇 |
| Absolute Zero | 课程与模型权重 | 程序执行结果 | 任务形式、执行环境、预训练起点 | 第 5 篇 |
这张表比较“改变的对象”,不比较榜单高低。每行的实验任务、模型、预算和计分方式不同,不能把其中的百分数直接放在一根排名轴上。对应论文及版本见下文时间索引。
一个贯穿系列的具体问题
设想一个编码 Agent 总在修改大文件时超时。以下是教学构造,不是任何论文中的实验记录。
最直接的改法是把超时从 5 分钟延长至 20 分钟。这可能提高完成率,却同时改变了资源条件。第二种改法是提供精确定位的补丁工具,减少全文读写。如果它在未见仓库中同样有效,就有了更好的迁移证据。
第三种改法是改变“找改法”的过程:先统计时间花在哪里,再把错误分成定位失败、补丁失败、测试失败,分别生成候选。评价新改进器时,需要让它面对新的故障类型,检查它是否更快找到有效修改。只在大文件题目上继续涨分,还不够。
SEAL 和 Absolute Zero 又走向另一侧:前者问能否把新材料转成更有效的训练内容,后者问能否自动生成有学习价值的问题。它们改变权重,不能仅用“加一个工具”的实现模型理解。SEAL、Absolute Zero
近期工作与受到关注的基础论文
“近期”分成近期首发和近期仍在讨论的基础工作。下表记录本次使用的版本,避免把修订时间当成首次发现的时间。
| 工作 | 首次公开 | 本次核对版本 | 选择原因 |
|---|---|---|---|
| RRSI | 2026-09-21 | v2,2026-09-23 | Google 最新、直接研究 harness RSI 的泛化 |
| 矩阵乘法指数与 AlphaEvolve | 2026-08-17 | v1 | 改进优化程序并给出可验证数学结果 |
| 开放 AI 研究评估 | 2026-07-29 | v2,2026-08-07 | 检查 Agent 能否完成真实研究过程 |
| Hyperagents | 2026-03-19 | v1 | 将改进器本身纳入修改范围 |
| Magellan | 2026-01-28 | v1 | 真实编译器策略搜索与成本边界 |
| AlphaEvolve | 2025-05 官方发布;06-16 论文 | v1 | 程序进化的机制基础 |
| SEAL | 2025-06-12 | v2,2025-09-18 | 学习“怎样更新自己” |
| DGM | 2025-05-29 | v3,2026-03-12 | 自修改与开放分支搜索 |
| Absolute Zero | 2025-05-06 | v3,2025-10-16 | 可执行反馈下的自动课程 |
| SICA | 2025-04-21 | v2,2025-05-16 | 持久修改 Agent 代码的清楚起点 |
公开关注度只用作选题线索。DGM 有 Sakana 官方介绍,SEAL 有 MIT 报道,Absolute Zero 和 Hyperagents 有活跃的 HF 论文讨论页、HF 论文讨论页;开放研究评估也引发了 MachineLearning 讨论。这些是传播证据,既不构成全面热度排行,也不提高论文结论的可信度。SICA 主要因机制清楚入选,不声称它是当下最热门的一篇。
更早的 STOP(2023) 和 ADAS / Meta Agent Search(2024) 是历史入口。2026 年 9 月的 The Last AI Built by Humans 可作框架延伸阅读,其中的未来示意不能当成运行实验。
怎样读完后真正形成判断
先读第 2 篇:RRSI 给出了最现实的矛盾——同一个开发集可以同时驱动改进和驱动过拟合。第 3 篇用可执行评价解释为什么某些自动发现特别有效,以及人的问题建模仍然在哪里起作用。
第 4 篇从持久修改走向改进器迁移;第 5 篇把视角移到权重与数据;第 6 篇把所有路线重新放回测量问题,附上合成实验代码和原始结果。
对于任何新论文,可以先问五个问题:到底改了什么?下一轮继承了什么?评分者看到什么?测试是否参与过选择?完整改进成本是多少? 如果其中任何一项没有答案,最合理的结论是证据还不完整,而不是立刻接受或否定 RSI。
本系列属于公开论文与部分源码的研究分析;论文结果没有在这里重新运行。第 6 篇单独标识已执行的本地合成实验。
更新于 2026-10-03 · 研究方法