执行反馈让程序搜索形成闭环
AlphaEvolve 的关键组合是代码生成、程序档案和自动评价。模型提出的修改可以被真正运行,评价结果再决定哪些程序进入后续搜索。它并不要求生成模型通过训练立即变强;被积累的是更好的程序与搜索历史。AlphaEvolve 技术报告
Google DeepMind 于 2025 年 5 月介绍系统,6 月公开论文。2026 年 8 月的矩阵乘法指数工作把它用于改进优化算法;1 月的 Magellan 则将类似闭环用于编译器策略。三者放在一起,可以区分“更好的结果”“更好的求解器”与“更好的求解器搜索过程”。
一个候选如何进入下一代
可以把基本过程写成下面的教学伪代码。它压缩了实现细节,并非逐行复刻原系统。
archive = 初始程序及执行记录
while 预算未耗尽:
parent, references = 从档案选择父程序和参考程序
candidate = 模型根据代码、反馈、限制提出修改
if 便宜的检查失败: 记录失败并继续
score = 执行较昂贵的完整评价
archive = 按质量和多样性纳入候选
return 经过完整验证的程序
档案为什么重要?假设两个程序分数相近,一个省内存,一个速度快。若只保存当前最快者,内存路线可能消失;未来加入新的变换后,它却可能成为更好的起点。质量与多样性的组织,使历史承担探索记忆。报告讨论了 MAP-Elites 与岛屿种群等组织思路。原文方法
级联评价处理另一种限制:验证一次可能非常昂贵。语法、基本正确性和小规模用例可以先筛掉明显错误,剩余候选才进入完整测量。但筛选器也是有偏的:如果某条有潜力的路线在小规模上暂时落后,过早筛除就会阻止发现。设计评价级联本身仍需要领域判断。
为什么评价器比提示词更决定上限
考虑一个内核优化任务。目标函数可以写成“通过正确性检查后,最小化指定硬件和输入分布上的延迟”。这句话隐藏了四个必须固定的条件:正确性容差、硬件版本、输入分布、计时边界。
若候选只对已知矩阵尺寸特化,它可能是有用的专用内核,但不能被称为通用加速。若计时漏掉数据转换,结果可能只把工作移到了边界之外。若不同候选使用不同数值精度,速度与正确性条件也已改变。
因此,自动发现可以降低提出修改的人力,却不会自动消除测量设计的责任。一个极强的生成器也只能优化评价器实际测到的东西。这个结论是对程序搜索的工程分析,不是某个基准分数。
不同结果不能共享一个分母
官方材料报告,AlphaEvolve 在全球计算调度、内核和数学构造等任务上取得结果。其中 Borg 相关改进对应平均回收约 0.7% 的计算资源;某个 Gemini 内核平均加速 23%,对应整体训练时间下降约 1%。这些是不同层级的指标。DeepMind 官方发布
为何内核快 23%,总训练只减少约 1%?用 Amdahl 定律理解:若被改进部分原来只占总时间的一小部分,整体加速必然受到其余部分限制。设占比为 f,该部分加速为 s,则总时间比例近似为 (1−f)+f/s。这里是原理解释,不是用公开数字反推出 Google 内部 profiling。
数学结果也要保留问题域。报告中的 4×4 复数域矩阵乘法把标量乘法次数从 49 次降至 48 次。这不是直接声称任意实数矩阵都能用同样办法在 GPU 上更快,实际运行还涉及加法、内存、数值稳定性与规模。技术报告
2026 年的矩阵乘法指数:两层优化
矩阵乘法指数 ω 描述渐近算术复杂度。2026 年 8 月的论文将已知上界从 2.371339 改进到 2.371177。它结合人类提出的问题重写、现代数值优化,以及 AlphaEvolve 对优化程序的改进,最后用有理数运算验证结果。原论文
内层固定一段优化代码,调整数学参数以寻找更好的界。外层改变这段代码:参数化、优化策略或计算组织一旦变好,内层会更有效。这是“改进求解器”与“让同一求解器跑得更久”的区别。
人的贡献不能从图中消失。论文先将问题写成适合 JAX 张量计算与梯度优化的形式,变量规模从约 2.5 万扩大至约 700 万。AlphaEvolve 的单个候选评估约为单 GPU 五小时,还会继承父代找到的解。搜索收益因此同时涉及代码、起点和计算预算,不能全部归给模型的一次灵感。原文优化与实验章节
对“递归”的谨慎解释是:被搜索对象已经包含优化过程。但外层选父代、评价规则和数学框架依然由人设定。它是研究自我改进的一块重要机制,不是无边界递归的实验。
渐近指数的小数点变化也不能直接换成今天的 GPU 性能提升。算法可能具有巨大常数,理论构造与实用尺寸之间还隔着实现条件。它的意义是可验证的复杂度上界进展。
Magellan:把结构搜索与参数搜索分开
Magellan 针对编译器策略:LLM 提出 C++ 规则结构,数值阈值交给 Vizier 调参,然后真实编译并测基准。这里把两种不同搜索分开:模型比较适合提出“根据什么特征决策”,数值优化器比较适合搜索“阈值到底取多少”。Magellan
用内联策略作教学例子:把函数展开到调用点看似会膨胀代码,但若只有一次调用,原函数体可能被删除;展开后还可能触发常量折叠,最终反而缩小。决定是否内联需要组合上下文,单独调一个全局阈值未必足够。
论文在二进制体积任务上报告,固定 38 个特征的策略搜索降低 4.27%,开放 LLVM API 的策略降低 5.23%;分离调参后,10 轮、每轮 10 个配置的搜索约五小时超过 5% 改善。无效候选率也从超过 65%降至 13%。这些是特定工具链与工作负载下的来源结果,本文未复现。原文结果
更有解释力的是失败:性能优化的两次从零搜索未超过基线,接续已有策略后才得到 0.61% 改善。它提醒我们,二进制大小和运行速度虽都可测量,搜索地形却不同;“评价器存在”并不保证可持续进步。
从算法发现走向改进能力
AlphaEvolve 这条路线在问题可形式化、反馈可靠、候选能较快执行时特别有力。数学证书还能把“模型觉得正确”变成独立可检查的结果。但开放研究往往还要选择问题、判断新颖性、处理负面实验,这些环节没有同样干净的奖励。
把此类系统用于新的领域时,应先问:评价器是否比提出候选便宜?能否防止只针对样例优化?最佳程序能否在新规模、新输入或新硬件上保持收益?是否记录了整个搜索成本?
下一篇把改变对象从程序扩展到 Agent 与改进器本身。届时最重要的评价也会变化:除了“最后一个产物好不好”,还要问“产生未来产物的方法有没有变好”。
更新于 2026-10-03 · 研究方法