持久修改怎样变成下一轮的能力
假设 Agent 发现自己的编辑工具经常破坏缩进。它可以在当前对话中更加小心,也可以修改工具,让未来所有任务都受益。后者把一次经验变成持久系统状态,是 SICA、DGM 和 Hyperagents 的共同起点。
它们的差别在于:谁决定下一步改哪里,历史上不够好的分支是否仍被保留,以及负责改进的代码能否一起变化。把这三个问题拆开,才不会把“能改自己的文件”直接等同于完整 RSI。
SICA:系统能力包含时间与工具
SICA 让当前较好的 Agent 利用历史实现、日志与分数修改自己的 Python 代码;基础模型保持固定。它的目标结合质量、成本和速度,权重分别为 0.5、0.25、0.25,每题预算上限为 10 美元和 300 秒。SICA v2
论文报告固定随机 50 道 SWE-bench Verified 题目上的结果由 17% 升至 53%。这是指定子集和限时条件下的结果,不能直接与完整 SWE-bench 榜单相比。早期提升很大程度来自文件编辑效率和成本控制,起始系统在五分钟时限下受到了明显限制。原文结果与局限
这不是要贬低工程改进。产品真正交付的是整个系统,而不是孤立模型。相同模型把 200 秒浪费在重复读取文件,与用 20 秒完成精确补丁,其可完成的任务确实不同。只是因果解释应是“工作流程改善”,不能悄悄改成“模型学到了新的编程知识”。
DGM:为什么不总从最高分父代出发
DGM 建立 Agent 版本档案,从中选择父代,进行自修改,执行代码任务评估,再将版本纳入历史。开放分支搜索允许暂时较弱的节点继续作为后续起点。DGM v3
想象三个版本:A 的测试分数最高;B 引入更结构化的文件索引,但接口尚不成熟,因此暂时较低;C 在 B 上修复接口后超过 A。只保留 A 的贪心策略会提前抹掉 C 的路径。这个例子是对探索作用的解释,不是论文运行轨迹。
档案也有代价:保存更多分支需要更多评估,低分节点并非都值得继续。父代选择必须在利用已有高分和探索新结构之间分配预算。开放搜索增加机会,并不保证每条分支都向上,也不保证未来没有停滞。
DGM 报告约 80 次迭代后,SWE-bench Verified 的分阶段子集评估由 20%到 50%;较完整阶段最多使用 200 道题。Polyglot 全量结果为 14.2%到 30.7%,与搜索子集的 14%到 38%不是同一数字。消融中,移除自改或开放搜索会降低最终成绩。原文实验与附录
这些证据支持两个设计部件在相应设置中的价值,尚不能把分数上升唯一归因于“改进能力递归增强”:历史积累、更多候选和固定外层机制也在同时工作。
任务能力与改进能力之间存在缺口
编码任务有一个特殊优势:写出好代码和修改 Agent 代码使用相似技能。改进编码能力,可能同时改善自修改能力。但在论文评审或机器人奖励设计中,完成领域任务与设计下一代 Agent 并不天然一致。
一个评审器变得更会识别方法缺陷,未必更会设计 A/B 实验;一个奖励函数更能驱动机器人前进,也不意味着负责生成奖励函数的流程更会搜索。因此,“任务分数持续上升”只能直接回答任务系统的表现,不能替代对改进器的评价。
这也是理解 Hyperagents 的入口:将 task agent 和 meta agent 合并为可编辑程序,让产生未来修改的机制也能改变,而不是把外层诊断与改进指令永久固定。Hyperagents 方法
Hyperagents 怎样检验改进器
最有价值的思路是迁移后冻结。先在一些领域演化得到 meta agent,再放到未见领域,冻结它的改进机制,只允许它生成并改进 task agent。这样能问:它已经学到的改进方式,是否能帮助新的任务?
论文从审核与机器人领域迁移到奥赛解答评分,使用验证分数选择生成的后代,再报告测试表现。50 次生成后的 imp@50 为 0.630,95% 区间为 0.540–0.630;初始测试分数为 0。这个特定指标衡量固定预算下产生更好 Agent 的能力,不能理解为“通用智力提高 63%”。原文 §5.2
独立于该迁移实验,论文还报告审核和机器人任务上的改进。初始零分包含输出格式失效的影响,因此需要分解哪些收益来自格式修复,哪些来自判断本身。这一点会影响读者对“从不会到会”的理解。原文结果与限制
迁移实验比原任务曲线更强,却仍然留下固定项:外层选择规则、生成次数、测试任务和评价协议没有无限开放。它提供局部可测的元改进证据,不等于验证无上限增长。
如何设计更有区分力的对照
下面是基于这些论文提出的实验建议,不是已经运行的结果。
| 对照 | 固定什么 | 改变什么 | 能回答什么 |
|---|---|---|---|
| 新旧 task agent | 模型、题目、预算 | 任务执行程序 | 最终系统是否更好 |
| 新旧 meta agent | 初始 task agent、候选数、任务集 | 改进器 | 是否更容易产生有效修改 |
| 跨领域迁移 | 测试协议、生成预算 | 元改进经验来源 | 改进方法是否可迁移 |
| 等总成本搜索 | 总 token、执行时间 | 搜索组织 | 增益是否来自额外计算 |
| 历史消融 | 同一搜索规则与起点 | 可见历史 | 历史是否改善决策 |
评价 meta agent 时,不能让新版本从更好的 task agent 起步,再把最终差异都归给改进方法。否则起点优势会与改进效率混在一起。也不能用新版本自行选择的评价题证明它比旧版本更强。
一种更严谨的最小实验是:同一组起始系统、同一批开发任务、多个随机种子、相同候选预算,两种改进器各自产生候选,再用锁定测试集评价。除了最好成绩,还报告成功修改比例、达到阈值所需资源和失败分布。
三篇论文共同揭示的工程结构
SICA 让我们看到基础工具和时间限制的重要性;DGM 说明历史分支可能保存未来有价值的结构;Hyperagents 则将诊断和改进方法本身变为可变对象。
可以把改进器的输入想成一份实验记录,而非一句“继续优化”:候选的改动、假设、失败类别、成本、测量波动,以及哪些证据会推翻假设。记录越完整,后续系统越可能避免重复试错。但记录完整不等于推理正确,仍需独立评价。
本篇引用的是论文报告与方法分析,没有执行这些需要模型调用和基准环境的搜索。下一篇转向另一种持久状态:模型权重。那时“保存一个修改”会变成内层训练,成本和反馈要求也会随之改变。
更新于 2026-10-03 · 研究方法