研究专题 / RSI

递归自我改进

一个系统如何改进自己,以及我们怎样知道它真的变好了。

“自我改进”覆盖了很不相同的过程:搜索更好的程序、改写 Agent 的运行框架、生成训练数据,甚至修改负责改进的过程。这个系列用同一组问题把它们放在一起,逐步走向更强的递归闭环。

检索截止 2026-10-03。论文结果均注明来源;最后一篇包含可复现的合成实验,独立于论文基准。

从问题进入

十分钟建立地图
先读第 1 篇的定义、比较表和证据标准,再看第 2 篇的主要结论。
理解 Google 的最新工作
第 2 篇细读 RRSI,第 3 篇追溯 AlphaEvolve:两者改进的对象不同。
设计自己的改进循环
第 4 篇看自修改架构,第 6 篇看隔离评估、成本核算和选择偏差。

系列保留研究假设与证据不足处,不把排行榜分数视为开放环境中的通用能力。