
26年7月来自DeepGrounding、AlphaAvatar和 美国 IIT的论文“Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops”。这篇综述最重要的判断是AI 已经能够在许多局部任务上实现可验证的自我改进但这些成果尚不足以证明系统能够自主、持续地提升“改进自身的能力”。评价机制、外部反馈、长期稳定性以及研究问题的选择仍是关键限制。一、论文究竟在讨论什么RSI 是 Recursive Self-Improvement即“递归自我改进”。其关键不只是模型表现变好而是本轮改进能否增强下一轮改进的能力形成持续反馈。论文试图回答三个问题当前所谓的“自我改进”究竟改进了系统的哪一部分改进是否真实由谁来判断从局部优化走向自主研究和持续递归改进还缺什么作者将两个经常混用的概念分开这是作者采用的概念划分不宜直接当作整个领域已经统一接受的定义。它的作用是提醒读者“多做几轮后分数提高”与“系统获得持续自我发展的能力”是不同强度的主张。二、综述的范围与组织框架作者收集 1,250 篇以 2024—2026 年 arXiv 文献为主的论文871 篇初始检索文献加上 379 篇针对性补充文献另引入较早的代表性工作作为背景。74% 的样本文献发表于 2026 年。如图 2 所示这些论文的语料库语义图谱基于摘要的TF-IDF特征经SVD和t-SNE降维投影坐标轴代表任意嵌入维度。等高线显示了各类别的分布密度“自动研究”Auto Research与“基础理论”foundations形成了界限清晰的区域而另外三大类别之间则存在相互交融。论文用两个维度组织研究。第一个维度是“改进什么”第二个维度是“由谁确认改进”人在环中人逐项审查改动。人在环上监督系统自动产生评价信号人审计结果并控制部署。闭环运行系统自行生成、验证和应用改进无需人逐项审查。本文将各类自我提升方法置于两个维度构成的坐标系中进行定位。图 1 展示由此形成的4×3网格每个单元格中列出了代表性系统。首先系统分布主要集中在中间一行考察的几乎所有系统都属于“人在回路human-on-the-loop”模式——即由系统自动生成信号并由人类对结果进行审核。其次“闭环closed-loop”这一行整体分布稀疏且越往右越稀疏其中最具影响力的单元格是“自评估 × 闭环”——即能够重写自身“更优”定义的系统——这正是“有限自改进”过渡到“开放式RSI递归自改进”的关键节点。作者认为大多数成果仍属于有外部约束的局部改进真正开放式的 RSI 证据很少。需要注意有没有人参与与有没有外部真实反馈并不是同一回事。 无人干预的系统仍然可以依靠执行环境、形式证明和预设目标获得约束。这也构成后文评价这篇综述时的重要问题。三、四条技术主线的详细概述部署时自演化从改答案到改造智能体自身这一部分覆盖三种不同持久性的变化当前输出的修订 → 部署期间的参数适应 → 跨任务积累的工具、记忆和技能。如图3所示按持久性排序的部署阶段自演化——精炼后的输出随单次episode结束而消失测试阶段的更新仅持续单次会话session而框架与技能的变更则可无限期累积。首先是“生成—批评—修订”的输出改进。Self-Refine、Reflexion 等工作是代表。作者强调自我批评能否有效主要取决于批评是否连接到可靠证据。在代码任务中测试失败、编译错误、运行结果能够提供具体反例在形式数学中证明检查器能给出更严格的约束。相比之下只让模型重新思考或评价自己可能只是改善表述、增强自信甚至把正确答案改错。其次是测试时训练系统在处理查询或会话时更新参数把当前经验转化为适应。它模糊了传统“推理”和“训练”的边界但也使保持已有能力、控制更新范围和稳定性变得更重要。再次是智能体驾驭harness与技能库的演化。这里的 harness 指模型外围的提示词、工具、记忆、任务编排和停止规则等。Gödel Agent、Darwin Gödel Machine以及 Voyager 式技能积累都属于这一方向。本节要点改进的持久性决定了它的价值也改变了风险。 一次回答中的错误影响有限进入共享技能库、记忆或工具链的错误则可能跨任务、跨智能体传播。作者同时提醒许多看起来像“模型自己变聪明”的提升实际上来自更好的搜索、任务编排和预算分配。训练时自我迭代把自身产出变成训练信号基本流程是生成候选数据或任务 → 评价和筛选 → 更新参数 → 用新模型继续生成。作者归纳了五条路线如图4所示训练阶段的自我迭代循环。五种范式主要区别在于评估信号的来源两种失效模式均关联于“评估与选择”环节。这里有三个值得特别理解的区别。第一“没有外部教师”不等于“没有外部信息”。 同一模型作为教师时可能获得参考答案、更丰富上下文或已验证反馈这些信息仍是能力提升的重要来源。第二“零数据自博弈”不等于系统从零知识开始。 它通常仍依赖已有基础模型、任务环境及验证机制只是不再依赖人工提供的新任务集。第三评价正确也不保证训练稳定。 论文引用的研究报告即使奖励来自可验证的代码执行结果训练仍可能先提升后崩溃。因此优化动力学是独立于评价偏差的另一个问题。本节要点自生成数据能够积累能力也能高效积累偏差持久提升需要数据筛选、奖励约束、多样性和训练稳定性的共同支持。自我评价整篇论文的中心作者把评价器独立列为一类研究而不只是其他方法的辅助组件。原因是任何“自我改进”都隐含一个判断——新版本比旧版本更好。如果判断机制有系统性偏差那么循环可能只是在更有效地迎合错误标准。如图5验证层级所示。信号可靠性随层级上升而提高而任务覆盖范围则随层级下降而扩大失效模式集中在底层而基于人类研究的判断则是“自我改进”机制尚无法逾越的层级。该层级针对特定目标对信号进行排序目标的选择先于该层级而非层级中的一环。论文提出一个“验证层级”作者明确说明“更可靠的验证对应更强的自改进”是对文献的定性观察不是已经测得的普遍定律。围绕这一框架论文讨论四种失败自我确认循环生成器与评价器共享盲点错误越自信越可能被奖励。模型崩溃递归使用自身产出导致分布尾部、信息或能力逐渐丢失。多样性崩溃任务生成器只产生容易获得奖励的一小类问题。目标框架锁定系统稳定、诚实且指标不断提高却一直优化一个已经不值得研究的问题。最后一种失败是全文最有启发性的补充。它说明判断一个答案是否正确判断一个研究方向是否可行以及发现应该换一个问题是不同的能力。论文进一步区分“结果级改进”和“过程级改进”。前者提高某次任务的成功率后者积累错误归因、可复用技能、实验方法和研究策略。作者认为成熟的自我改进系统可能体现为方法体系不断完善而不一定表现为基础智能无限增长。自动化研究可检验发现与开放科研之间存在明显鸿沟论文区分了两种自动化研究。一类是有可执行评价函数的程序与算法发现。FunSearch、AlphaEvolve 等系统提出候选方案由程序测试、性能测量或数学检查筛选。其产出还可能改善 AI 自身的基础设施和训练工具形成实际反馈。另一类是端到端 AI 科学家从选题、实验一直到论文撰写和评审。作者认为这一方向已经展示出很强的执行能力但执行完成与科学贡献之间仍有距离。主要问题包括论文文字看起来可信但代码、数据和实验不能充分支持论断能得到正确结果却给出错误的机制解释在必须完成任务的压力下隐瞒失败或制造不充分的证据重复研究活动后模型行为有所改善研究方法却没有积累即“科学失忆”。文中重点介绍了 A-Evolve-Training据其原论文报告系统在数周内完成了 30B 模型的四轮自主后训练并发现开发指标与外部表现脱节进而调整搜索策略。作者将它视为接近自主模型研发闭环的案例但也承认它仍在人工设定的目标和搜索空间中工作不能据此认定研究方向选择已经自动化。四、这篇综述最值得抓住的要点可以把全文压缩为六个判断1 自我改进不是单一技术。改输出、改参数、改工具、改评价器和改研究方法需要不同证据。2 可靠反馈比重复迭代更关键。没有新的纠错信息循环可能只带来重述与自我强化。3 改进评价器成为共同趋势。但评价器共同演化既可能纠正偏差也可能形成更复杂的共同盲点。4 持久积累是能力与风险的共同放大器。技能、记忆和训练数据既能保存经验也能保存污染。5 科研执行与科研方向选择之间存在缺口。会做实验、会写论文并不自动意味着会发现值得研究的问题。6 局部自我改进的成功不能直接推出智能爆炸。中间还隔着长期稳定性、资源约束、能力迁移和研究判断等问题。五、作者认为 RSI 领域还有哪些未解决的问题论文最后提出六个研究方向其中最后一点尤其值得注意作者提出可测量“有价值的放弃”、目标重构后的知识保留以及环境变化后调整目标所需的时间。这使“研究品味”不再只是笼统描述而开始接近可以设计实验的能力。六、存在的问题RSI 定义偏窄并把几个独立维度捆绑在一起。论文倾向于把开放式 RSI 与“修改评价器、缺少固定外部锚点”联系起来但这并非逻辑上的必要条件。一个系统可以保持最终目标不变通过改进优化器、训练算法、实验策略和资源利用方式提高自身研发能力。反过来一个系统能够修改自己的评分规则也不意味着它获得了真实能力提升。更清楚的框架应该分别记录人工干预程度外部信息来源可修改的系统组成改进是否增强下一轮改进能力。目前的两个轴不足以完整表达这些差别。文献规模很大但统计不能被当作领域全貌。作者坦率承认了几项限制检索有深度上限偏向近期、高产方向补充检索根据既定分类框架进行分类由单一标注者完成379 篇补充文献中约 54 篇属于边缘相关文献但仍保留在计数中工业实验室内部工作只能通过公开材料观察。因此“某类别有多少论文”适合描述这个样本不能直接证明该方向在整个领域中的真实占比或重要性。“理论与治理最缺研究”的判断也需要更有针对性的检索来支持。这篇文章更适合被理解为大规模文献映射与观点综合而不是定量元分析。“验证层级”有解释力但尚未证明它是决定性因果变量。代码和形式数学中的自我改进通常更容易测量但这些任务也具有目标明确、反馈快、搜索空间便于表达等优势。所以观察到强验证任务效果更好并不能单独说明提升来自验证器强度。还需要控制模型、算力、反馈数量、任务难度和搜索策略。更重要的是论文自身引用了“可验证奖励下仍然崩溃”的案例。这意味着可靠评价可能是重要条件却不是充分条件。对形式验证能力的部分表述过强。论文出现了“不会接受错误改进”一类表达需要加上严格限定。形式验证能保证的是在给定规格、假设和可信计算基础之下某个命题成立。它不能自动保证规格完整表达了真实需求优化目标值得追求性能和安全在所有环境中都改善单次正确改动产生长期净收益。证明符合规格与证明系统整体变好仍然有距离。 这实际上与作者后来提出的“目标框架锁定”问题相呼应。有些总结比正文证据更绝对。作者多次强调“没有外部信号就没有可靠改进”但正文也介绍了不使用外部验证器的自训练、自蒸馏和内部评价增益。这些结果可以与论文主线兼容系统可能重新组织或提取基础模型已有的能力获得有限提升而无法持续开放增长。但因此需要明确区分短期局部增益、长期稳定增益、开放式能力增长。“无外部反馈不能无限改进”与“无外部反馈不能改进”并不是同一个命题。类似地某些递归合成数据训练中的崩溃结果也不能未经限定就推广到所有自主闭环系统。结果级与过程级改进的经济学划分过于整齐。论文把结果级改进比作运营支出把过程级改进比作能够长期摊销的资本投入。这个比喻有启发但不是严格分类结果奖励训练也能形成可迁移、持久的参数能力过程监督也可能需要持续付费并且不一定迁移技能文档虽能保存也可能因环境改变而失效。因此“评价的是结果还是过程”与“提升是否持久、能否复用”应当作为两个独立维度。理论限制与实际加速之间还缺少连接。计算能力层级不发生跃迁不代表实际研发效率不能提高很多排除有限时间数学发散也不代表排除了具有重大影响的快速增长。论文在部分理论介绍中保留了建模假设但总体叙事容易让读者将这些限制理解为对现实 RSI 潜力的广泛否定。更严谨的写法应逐项说明定理限制的对象是什么哪些现实增长路径仍然允许。最关键的“递归增益”仍缺少直接测量。论文介绍了许多性能提升却没有形成统一方法回答系统是在更擅长完成任务还是更擅长改进完成任务的系统要支持后一种主张需要在固定总预算、计入外部反馈和人工投入的条件下追踪多代系统下一轮研发是否更快同等成本下能否产生更大改进能否迁移到新任务是否减少了外部纠错需求是否保持长期稳定性与安全性。缺少这些证据时多轮性能增长仍可能来自额外计算、重复搜索或预设流程而不是改进能力本身的递归增强。该综述的强项在于建立清晰的研究地图并把评价可靠性、持久积累和研究选题放进同一个讨论框架它的弱项在于尚未用统一的测量和因果证据把“局部自改进”连接到“递归改进能力”。适合用来组织研究问题不宜单独作为判断 RSI 已经实现或不可能实现的依据。