当改变进入权重,循环多了一层

前面的 harness 方法保持基础模型权重固定。SEAL 和 Absolute Zero 则把学习过程纳入循环:一个系统可以生成训练材料、生成问题,或者选择自己的更新方式,然后通过训练改变模型。

这里有两个不同问题。SEAL 问怎样把已有材料变成有效更新;Absolute Zero 问怎样生成值得学习的练习。 一个更接近学习策略,一个更接近课程生成。两者都不能仅凭“数据由自己生成”就摆脱外部评价。SEAL v2、Absolute Zero v3

SEAL 的 self-edit 是什么

self-edit 不是模型直接手工改某个权重数值,而是模型生成用于更新自身的内容或配置。内层执行 SFT、LoRA 等适应过程,外层根据适应后的下游效果,学习什么样的 self-edit 更有效。SEAL 方法

可以用下面的概念式描述两层过程;它是解释性记法,而非原文全部训练细节:

e = 生成策略(context)                # 合成训练内容 / 更新配置
θ′ = Update(θ, e)                    # 内层适应
r = Score(θ′, downstream_questions)  # 适应后效果
用 r 改善未来生成 e 的策略             # 外层学习

关键是奖励经过一次真实更新才能得到。某份合成笔记看起来结构漂亮,并不说明它对训练有效;真正要测的是模型更新后的回答。这样把“什么材料值得学习”从人工直觉变成一个可优化的决策。

一个教学例子:给模型一段包含新术语的材料,self-edit 可以直接复述,也可以拆成定义、对比和多个问答。第二种形式可能让相同事实更容易被学习,但若它编造了材料里没有的内容,也会把错误一同写入权重。外层分数是否能识别这个问题,取决于测试问答是否覆盖关键事实。

知识吸收和推理适应需要分开读

SEAL 单篇知识吸收实验使用无原文上下文的问答。论文报告冻结模型 32.7%,直接用原文训练 33.5%,未经过外层 RL 的 self-edit 39.7%,GPT-4.1 合成数据 46.3%,SEAL 47.0%。这里比较的是特定知识注入流程,不是模型总体知识或所有推理能力。原文知识实验

版本很重要。v2 的多篇材料实验中,200 篇设置下 SEAL 为 58.2%,GPT-4.1 数据为 59.4%;不能再照搬早期版本的 43.8%,也不能说 SEAL 在所有条件都超越更强模型生成的数据。算法是否有效与是否每项第一,是两个问题。v2 全文

另一组 ARC 结果中的 72.5%,来自预先筛选的 8 个评估任务、每题 5 个 self-edit,共 40 次适应尝试。筛选要求理想的 test-time training 配置可以解决该题;因此它测的是这组可适应任务上的成功比例,不能改写成完整 ARC 通过率。原文抽象推理实验

这个限制不只是数字脚注。先挑“可通过适应解决”的题目,有助于隔离 self-edit 选择能力,却同时减少了对完全陌生问题的覆盖。设计合理与适用范围有限可以同时成立。

Absolute Zero 怎样产生课程

Absolute Zero 从预训练模型出发,由模型承担 proposer 与 solver,通过程序执行产生可检验反馈。它研究三类代码推理任务:给程序和输入求输出;给程序和输出找输入;从输入输出例子推断程序。模型权重通过强化学习更新。Absolute Zero 方法

出题者若总出 solver 已经会的题,没有多少学习压力;若总出完全不会的题,也可能只有失败信号。论文使用的难度代理大致为:平均求解成功率为零时奖励零,否则奖励为一减成功率。它偏好“有少量成功、但尚未熟练”的区域。

需要分清难度代理和实测学习增益。成功率为 20%的题不一定比成功率为 60%的题更能训练出可迁移能力;它可能包含歧义、过长计算或对当前模型不合适的结构。代理奖励帮助组织搜索,但不自动解决课程质量问题。

执行器给出的是一个外部约束。对代码输出可以运行验证,避免让语言模型只凭主观评价同时出题、答题并给自己打分。然而程序是否终止、资源是否有限、任务是否退化成简单模板,仍要由环境与任务设计约束。

“Zero”不等于没有起点

Absolute Zero 的“无数据”指相应训练阶段不使用人工题目数据。基础模型已经经过预训练,任务类型、Python 执行环境、奖励和训练程序也由人设计。省去了一个数据来源,不等于系统从没有知识的状态创造全部知识。

论文报告 Qwen2.5-Coder-7B 设置下,代码领域均分 56.6→61.6,数学领域均分 23.9→39.1,总分 40.2→50.4。总分是两个领域平均分再取平均,不能写成所有基准逐题混合后的准确率。原文表格与图 6

对 RSI 的启发是反馈设计:当任务可由执行器验证,系统有机会构造持续训练信号。边界也来自同一处:这种结构能否延伸到研究问题的新颖性、法律解释或长期规划,不能只用代码执行上的成功推导。

两条路线的共同瓶颈

维度 SEAL Absolute Zero
系统主动生成 学习内容与更新配置 练习问题及解答尝试
反馈经过什么 内层训练后的下游测量 程序执行、求解表现
保留下来的状态 更新策略与适应后权重 proposer / solver 的权重
关键固定条件 训练程序、参考问答 任务结构、执行器、奖励
主要成本 每个候选 edit 的训练与评估 生成、执行、采样与 RL
需要额外检查 遗忘、知识错误、跨材料迁移 课程退化、代理偏差、跨领域迁移

两条路线都可能放大反馈偏差。若下游评价只奖励一个狭窄能力,更新过程可能牺牲其他能力;若自动课程只在可验证的小世界中循环,分数提高也可能主要是适应该世界。

因此,一个完整实验需要同时看新能力、原有能力保留和预算。只报告更新后的最好结果,会隐藏失败的内层训练、被丢弃的数据和已经付出的搜索成本。

对系统设计的选择

如果失败来自工具错误、上下文丢失或不合理控制流,先修改 harness 往往更容易归因和回滚。如果问题是知识无法被保留或已有表示不足,权重更新才可能触及瓶颈。这是工程判断,需要通过对照实验验证,不能从论文名称直接选择方案。

同样,“让系统自己找训练数据”应建立在能够判断数据是否有效的基础上。评价器越弱,自动化的数据循环越可能高效重复自己的偏差。最后一篇将用一个没有真实学习的极简实验,展示为什么即使评分本身无偏,搜索与选择也会制造漂亮曲线。

更新于 2026-10-03 · 研究方法