🧬 递归自我改进(RSI):从红皇后、哥德尔机到 AI 研发自动化的真实历史脉络

🧭
研究结论(截至 2026-08-24):今天公开可验证的 RSI 不是“模型在无人监管下随意重写自己并迅速变成超级智能”,而是 AI 开始进入下一代 AI 的数据、代码、实验、评测、训练和基础设施链条。真正发生的是研发反馈回路逐步闭合;尚未发生的是目标选择、价值判断和安全验证全面脱离人类。

一、先把概念说准:什么才算 RSI

“递归自我改进”(Recursive Self-Improvement, RSI)至少有三种强度:

  1. 局部自修正:模型在一次推理或任务中反思、重试、修补代码。它改善的是当前输出,不一定改变下一代系统。
  2. 可持续的系统改进:AI 修改提示词、上下文、工具、工作流、评测器或 Harness,使后续任务表现变好。今天大量研究位于这一层。
  3. AI4AI 的代际闭环:当前系统参与设计数据、训练配方、模型代码和实验,产出更强的继任模型;继任模型再重复这一过程。只有当“改进能力本身”也随每代增强,才接近强意义的 RSI。

因此,DeepSeek-R1-Zero 的反思行为、普通自我纠错、固定模型上的程序搜索,都与 RSI 有关,但不能直接等同于完整 RSI。判断一个系统时应追问:改了什么、由谁提出改动、谁验证、改进是否跨代保留、改进器本身是否变强、目标和裁判是否固定。

二、AI 之前:RSI 继承了哪些更古老的思想

1. 反馈控制:系统通过误差改变下一步

蒸汽机调速器、控制论和自动控制建立了最基础的闭环:设定目标—测量状态—计算误差—采取行动—再次测量。1948 年诺伯特·维纳以《Cybernetics》系统化了“控制与通信”的反馈观。它不是 RSI,但给出了所有自我改进系统的骨架。

2. 生物进化:变异、选择、遗传

自然选择提供了另一种无需中央设计者的改进机制:产生候选、按环境选择、保留优势。20 世纪 1950—1970 年代,进化策略、进化规划、遗传算法逐渐把这个框架搬进计算机;1990 年代遗传编程进一步让“程序本身”成为变异和组合对象。这里的关键遗产是:搜索不必只沿一条路线爬坡,可以维护种群和多样性。

3. 红皇后:环境和对手也在变化

Leigh Van Valen 于 1973 年发表 A New Evolutionary Law,提出红皇后假说。名称来自 Lewis Carroll 的 Through the Looking-Glass:“Now, here, you see, it takes all the running you can do, to keep in the same place.” 其原始问题是物种在共演化生态中的持续适应,不是 AI 评测。

原文:

https://www.mn.uio.no/cees/english/services/van-valen/evolutionary-theory/volume-1/vol-1-no-1-pages-1-30-l-van-valen-a-new-evolutionary-law.pdf

RQGM 对它的继承很明确:如果 Agent 变强而评测器不变,固定评测就会饱和、被钻空子或失去区分度;因此“环境/裁判”也要演化。

4. 自指、程序自举与可修改系统

递归、自指和编译器自举说明:一个系统可以把自身描述或自身工具作为输入。编译器可以编译自己的后续版本,操作系统和软件工程也长期使用测试—构建—部署循环。但“能改自己”不等于“能保证自己变好”;RSI 最难的从来不是写入权限,而是可靠评价与保留真正改进

5. I. J. Good:从工具循环到“智能爆炸”

I. J. Good 的 Speculations Concerning the First Ultraintelligent Machine 通常引用为 1965 年,载于 Advances in Computers, Vol. 6, pp. 31–88(部分出版页标作 1966,写作时应注明版本差异)。Good 的经典推理是:机器设计也是智力活动;若一台机器超过人类并能设计更好的机器,就可能形成“智能爆炸”。

论文记录与 DOI:

https://philpapers.org/rec/GOOSCT

https://doi.org/10.1016/S0065-2458(08)60418-0

Good 提供的是宏观逻辑,不是可运行架构。

6. Gödel Machine:给自我修改加上证明门槛

Jürgen Schmidhuber 于 2003-09-25 提交 Gödel Machine 初稿,2006 年修订。它把系统自身代码、效用函数和证明搜索器都纳入形式系统;只有证明某次改写能提高预期效用,才执行自我修改。

论文:

https://arxiv.org/abs/cs/0309048

项目页:

https://people.idsia.ch/~juergen/goedelmachine.html

它的重要性在于第一次给出严格的“自指—证明—改写”框架;局限也同样明显:现实大模型、复杂环境和长期科研价值很难被完整公理化,更难高效证明。因此今天的 Gödel Machine 后继者普遍把“形式证明”放宽为“实验评测”。

三、进入 AI:从自我博弈到可执行研发循环

1992—2018:自我博弈证明“对手可自动生成课程”

TD-Gammon 在 1992—1994 年通过自我对弈达到高水平;AlphaGo Zero(2017)和 AlphaZero(论文发表于 2018)把自我博弈扩展到围棋、国际象棋和将棋。自我博弈的深层贡献不是“模型会和自己玩”,而是让训练分布随能力上升自动变难。它与红皇后路线相似,但游戏规则和胜负函数仍然固定。

TD-Gammon:

https://aaai.org/papers/0003-fs93-02-003-td-gammon-a-self-teaching-backgammon-program-achieves-master-level-play/

AlphaZero:

https://www.science.org/doi/10.1126/science.aar6404

2023—2024:提示词、评测器和代码开始自我改进
2025:程序进化和 Agent 自我改写成为可运行系统

Google DeepMind 于 2025-05-14 发布 AlphaEvolve;白皮书后于 2025-06-16 提交 arXiv。系统以 Gemini Flash/Pro 生成程序,用自动评测器验证,再通过进化数据库选择后续候选。

官方发布:

https://deepmind.google/blog/alphaevolve-a-gemini-powered-coding-agent-for-designing-advanced-algorithms/

论文:

https://arxiv.org/abs/2506.13131

已公开事实包括:

  • Borg 调度启发式平均回收 Google 全球约 0.7% 计算资源;
  • 改写 Gemini 内核,相关矩阵乘法内核提速 23%,整体训练时间降低约 1%;
  • FlashAttention 实现最高提速 32.5%;
  • 4×4 复数矩阵乘法从已知 49 次标量乘法降至 48 次;
  • 50 多个数学问题中约 75% 重现当时最优结果,约 20% 改善已知结果(均为 DeepMind 自报)。

它确实“优化了训练 AlphaEvolve 所依赖的 AI 基础设施”,形成反馈关系;但 Gemini 权重不是在该循环内自动改写。因此更准确的定位是RSI 邻近的算法与基础设施进化器

Sakana AI/UBC 团队于 2025-05-30 发布 DGM。它放弃 Gödel Machine 的形式证明要求,改用代码基准实证验证;维护多个 Agent 版本的开放档案,通过选择、改写、评测不断产生新 Agent。基础 LLM 固定,变化的是 Agent 的代码和 Harness。

项目:

https://sakana.ai/dgm/

论文:

https://arxiv.org/abs/2505.22954

公开实验中,SWE-bench Verified 从 20% 提升至 50%,Polyglot 从 14.2% 提升至 30.7%。DGM 是 RQGM 的直接学术前驱:RQGM 论文参考文献第 2 条即 DGM。

四、2026 年:三条路线同时成形

路线 A:AI 进入 AI 研发——Anthropic 与 OpenAI

原文:

https://www.anthropic.com/institute/recursive-self-improvement

这篇文章首次系统公开 Anthropic 的内部 AI4AI 进度,并明确说“我们还没有到完整 RSI,RSI 也并非必然”。其数据是公司自报、未独立审计,但有一手来源:

  • 截至 2026-05,Anthropic 合并代码中超过 80% 由 Claude 编写;
  • 2026 年第二季度,典型工程师每天合并代码量约为 2024 年的 8 倍,但 Anthropic 自己提醒代码行数高估真实生产率;
  • 开放式任务成功率在 2026-05 达到 76%,半年提高 50 个百分点,成功与否由 Claude judge 判定;
  • 固定目标的训练代码加速任务中,Claude Opus 4(2025-05)约 3×,Mythos Preview(2026-04)约 52×;
  • 自动弱到强监督研究中,两位人类研究员约恢复 23% 的基准差距;Agent 恢复 97%,消耗约 800 累计小时与 18,000 美元算力。人类仍负责选题和评分标准,结果未顺利迁移到生产规模模型。

这些数据支持“AI 已显著加速 AI 研发”,但也揭示最后瓶颈:研究品味、方向选择和对结果是否可信的判断。

Jack Clark 关于 2028 年 60% 概率的说法来自 2026-06-07 的《经济学人》采访/报道,是个人预测,不是 RQGM 项目事实:

https://www.economist.com/science-and-technology/2026/06/07/how-artificial-intelligence-got-better-at-building-itself

Andrej Karpathy 于 2026-05-19 宣布加入 Anthropic 的 pre-training 团队。可信报道指向“用 Claude 加速预训练研究”,但“Auto-Research 智能体集群”不是已证实的官方项目名:

https://techcrunch.com/2026/05/19/openai-co-founder-andrej-karpathy-joins-anthropics-pre-training-team

OpenAI 的 GPT-5.6 官方页公开了一个内部评测套件的汇总结果,称为 RSI Index,任务包括调试研究系统、优化内核和训练配方、运行机器学习实验及改进另一个模型。GPT-5.6 Sol 的汇总分数比 GPT-5.5 高 16.2 点。正确表述应是“OpenAI 对外披露内部评测结果”,而不是“公开发布可复现基准”;任务集、数据和完整协议并未像 RE-Bench 那样开放。

官方来源:

https://openai.com/index/gpt-5-6

Lilian Weng 于 2026-07-04 发布 Harness Engineering for Self-Improvement

https://lilianweng.github.io/posts/2026-07-04-harness/

她把 Harness 定义为基础模型外层、负责规划、工具调用、行动、上下文、持久化和评估的运行系统,并总结三类常见设计:工作流自动化、文件系统持久记忆、子 Agent/后台任务。她的核心判断是:近期 RSI 不大可能始于模型直接重写权重,而更可能先优化上下文、工作流、Harness 代码乃至优化器代码。

时间关系必须讲清:

  • DGM、AlphaEvolve、RE-Bench、Meta-Harness 等研究早于 Weng 博客;
  • Weng 的文章是 2026-07 的综述和工程框架化,明确引用 DGM、AlphaEvolve、RE-Bench 等工作,不是这些项目的思想源头;
  • RQGM 初稿提交于 2026-06-24,也早于 Weng 博客;目前不能说 RQGM 受该博客启发;
  • Weng 于 2026-07-29 离开 Thinking Machines Lab 并回归 OpenAI,媒体称其将领导加速内部研究、支持跨方向 RSI 的高层团队。这是博客之后的职业事件。

报道:

https://techcrunch.com/2026/07/29/thinking-machines-co-founder-lilian-weng-left-the-company-citing-health-reasons-then-joined-openai

路线 B:裁判与选手共同进化——RQGM

RQGM 论文初稿提交于 2026-06-24,6 月 29 日修订;剑桥新闻稿发表于 2026-07-21。因此“2026 年 7 月论文”不准确,论文时间应记为 6 月,新闻传播在 7 月。

论文:

https://arxiv.org/abs/2606.26294

剑桥新闻:

https://www.cst.cam.ac.uk/news/red-queen-hypothesis-new-way-forward-self-improving-ai

项目介绍:

https://mlsys.cst.cam.ac.uk/2026/07/19/who-evaluates-the-evaluator.html

RQGM 把搜索分成多个 epoch:epoch 内评测标准固定,以保留局部改进保证;epoch 边界允许 utility/评测器更新。公开结果包括:

  • 在可验证代码任务中加入 Agent-as-a-judge 代码审查信号,优于此前方法并少用 1.35×—1.72× token;
  • 科学论文写作的共同演化版本在多样化 judge panel 下,接受率达到基线的 1.78×—1.86×;
  • 共同演化的数学证明评分器,真实标签准确率提高 9%;
  • 发现最强基线评审器对 AI 论文的过度接收率最高为人类论文的 1.91×,并通过对抗目标纠正偏差。

团队确有 NVIDIA 参与:论文作者 Daniel Burkhardt 与 Niccolò Alberto Elia Venanzi 标注 NVIDIA,致谢也列有 NVIDIA 支持。因此“英伟达参与”可以保留,但必须和 Jack Clark 的第三方评论分开。

RQGM 的思想谱系是可追踪的:Van Valen(1973)提供共演化隐喻;Schmidhuber(2003)提供自我修改机器框架;DGM(2025)把证明放宽为实证搜索;RQGM 再把固定效用推进到受控的动态效用。它不是 Weng 博客的应用,而是与 Harness 路线同期汇合于“如何可靠闭合研发反馈回路”。

路线 C:数据、模型与开源基础设施——DeepSeek、OpenRSI、RSIBench 与 Hugging Face

DeepSeek-R1 / R1-Zero(2025-01)

https://arxiv.org/abs/2501.12948

R1-Zero 用纯 RL 启动,出现反思和自校验等行为。它说明固定奖励下可以涌现有用推理策略,但评测、训练流程和目标仍由人定义,故应标为“RSI 所需的模型侧能力”,不是 RSI 闭环。

Engram(2026-01-12)

https://arxiv.org/abs/2601.07372

https://github.com/deepseek-ai/Engram

Engram 是可扩展查表式 conditional memory,与 MoE 的 conditional computation 互补。它可降低静态知识检索的计算成本,但论文没有证明它就是 RSI 技术,也不能直接说“V4 采用 Engram”。

DeepSeek-V4 Preview(2026-04-24)

https://api-docs.deepseek.com/news/news260424

官方可证实:V4-Pro/Flash 开源、1M 上下文、DeepSeek Sparse Attention、强化 Agentic Coding,并用于 DeepSeek 内部 Agent 编码。官方 V4 页面没有把 Engram 列为 V4 组件,也没有在该页给出“RSI 系统”声明;因此“Engram=V4 底层”“SWE-Bench 80.6%”“国产算力适配”需要分别引用技术报告,不能打包推断。

Cordis(2026-08)

https://github.com/cordiverse/paper

https://github.com/cordiverse/cordis

Cordis 是可动态组合和卸载组件的 TypeScript 元框架,其核心是可回滚 effect、响应式 coeffect、组件加载和热更新。媒体把它称为“黑鲸/DeepSeek Harness 底座”,但论文仓库本身展示的是 Cordiverse 项目,不足以单独证明它是 DeepSeek 官方 RSI 项目。它与 Harness 工程在技术形态上相关,归属和用途必须按官方仓库/技术报告谨慎表述。

DSuE-RSI:本次未找到足够的一手论文、官方仓库或 DeepSeek 联合发布证据,应保留在 C 级“未证实”,不进入基本事实主线。

Frontis 于 2026-07-31 发布首版 OpenRSI:

https://github.com/FrontisAI/OpenRSI

论文:

https://arxiv.org/abs/2607.28568

它明确声明从 bounded、executable 的机器学习工程领域开始,不声称解决通用 RSI。OpenMLE 提供 Gym、SFT/RL 和长程进化搜索;Frontis-MA1 训练 Draft、Improve、Debug、Crossover 四类算子。公开结果需标为 model–harness 联合结果,而非单次模型分数;项目称一张 RTX 4090、12GB 限额和 12 小时任务预算可运行其 MLE-Bench Lite 配置。

论文于 2026-07-28 提交:

https://arxiv.org/abs/2607.25886

代码:

https://github.com/evolvent-ai/RSIBench-Data

它固定基础模型、训练/服务/评测栈,只让研究 Agent 改训练数据策略。四个前沿 Agent、六个任务中,58.33% 的设置能改进第一次有效尝试;但在已经达到峰值后仍继续搜索的运行中,78.26% 最终以更低分结束,其余只回到峰值。核心事实是:当前 Agent 能发现改进,但不能可靠保留和继续改进。

论文使用 Tinker、Harbor 和 E2B;这些是实验栈组件,不是 Hugging Face 官方产品。

Hugging Face 在这里主要是开放发布和协作基础设施:托管模型权重、数据集、论文页面和 Demo,而不是上述系统的统一研发者。

可验证项目:

因此不能写“Hugging Face 提供 E2B/Harbor”,也不能把在 HF 托管的项目成果算作 HF 自研 RSI。

五、字节跳动·豆包:公开证据支持到什么程度

最强的一手来源是 Seed 团队 2026-06-23 的 Seed2.1 官方发布:

https://seed.bytedance.com/en/blog/seed2-1-officially-released-advancing-ai-productivity

产品页:

https://seed.bytedance.com/en/seed2_1

官方明确提出 Seed for Seed:Seed2.1 进入评测系统开发、能力诊断、SFT 数据合成、RL 训练框架优化、研究论文方法复现和基础设施研发;复杂任务可由执行、评测、诊断、优化等多 Agent 协作,任务跨度从数小时到数十天。未来方向也明确写有:改善 Harness—模型协同,把模型更深地接入训练流程并推动 autonomous research。

这已经是公开可验证的 AI4AI / Harness 路线贡献。它比“只有普通 Agent 产品”更进一步,但仍未公开:

  • 像 RQGM 那样评测器与 Agent 同步演化的论文;
  • 一个可复现、可审计、连续产出更强继任模型的端到端 RSI 系统;
  • 足以核实“Seed-Evolving 每月 2—4 次”“256K”“Trae 自动视觉修复”均属于同一 RSI 项目的统一一手证据。

Seed2.1 产品页确实展示 RTL Design Agent 实践,因此“用于 RTL 场景”可保留;但“完整自主芯片设计”应避免扩大表述。最准确的结论是:字节已公开确认 AI 参与自家模型研发链,并把它命名为 Seed for Seed;目前属于 AI4AI 工程实践和自治研发方向,不是已证明的强 RSI。

六、各家到底有没有“互相参考”

能从论文引用确认的继承
  • RQGM 明确引用 Van Valen(1973)和 DGM(2025),其名称和方法就是在这两条线的交点上产生。
  • DGM 明确继承 Gödel Machine,并将“证明后修改”改为“实验验证后保留”;也处在 STOP 等递归代码改进工作的后续脉络中。
  • Weng 博客明确引用 Good、DGM、AlphaEvolve、RE-Bench、Meta-Harness 等,是一篇把已有工作组织成 Harness Engineering 路线的综述。
  • AlphaEvolve 官方说明其前身包括 DeepMind 2023 年的 FunSearch;其独立技术线是 LLM + 自动评测 + 进化程序搜索。
只能说“同期收敛”,不能说抄袭或直接启发
  • Anthropic 的内部 AI4AI 实践、OpenAI 的 RSI Index、ByteDance 的 Seed for Seed 都说明前沿实验室在 2025—2026 年独立收敛到“让模型参与模型研发”。公开证据不足以建立谁复制谁。
  • RQGM 论文早于 Weng 2026-07-04 博客,因此不能说剑桥从该博客得到灵感;反过来,博客作为 7 月综述可能吸收了 6 月已经公开的研究,但应以正文引用为准。
  • DeepSeek 的 Engram、V4 和 Cordis 与 RSI 的关系主要是“降低长程 Agent/研发循环成本、增强 Harness 可组合性”;除非官方论文明确建立闭环,否则不能把基础设施相似性写成思想继承。

七、真实历史主线

  1. 1940s—1970s:反馈与共演化——控制论给闭环,进化论给变异选择,红皇后给动态环境。
  2. 1965:Good 提出智能爆炸逻辑——一代机器设计下一代机器。
  3. 2003:Gödel Machine 形式化自我改写——改动前要求证明效用提升。
  4. 1992—2018:自我博弈成功——系统自动生成越来越强的训练对手,但规则与裁判固定。
  5. 2023—2024:可执行的局部递归——模型开始改提示词、程序、评测器和工作流;AI Scientist 与 RE-Bench 分别搭建科研闭环和测量仪表。
  6. 2025:经验主义 Gödel 机与程序进化——DGM 改自身 Harness;AlphaEvolve 在可验证程序空间进化,并反哺 AI 基础设施。
  7. 2026:AI4AI 进入实验室生产流程——Anthropic、OpenAI、ByteDance 披露 AI 已参与研发;OpenRSI 和 RSIBench 把流程开放、可测。
  8. 2026-06:RQGM 更新裁判——第一次把非平稳效用和评测器共同演化明确放进 Gödel Machine 后继框架。

这条历史不是从一篇博客突然开始,也不是各家公司同时“发明 RSI”。它是四股长期思想在 2025—2026 年汇合:反馈控制、自我博弈/进化搜索、自指程序、自动化科研。 大模型和代码 Agent 让过去只能讨论的循环第一次具备可执行接口。

八、今天的能力边界与最大风险

  • 固定裁判会失效:Goodhart 定律、奖励劫持、测试过拟合和 judge 偏见会把“分数进步”伪装成“能力进步”。
  • 评测器共同进化也不是万能药:如果 Agent 和 evaluator 共谋、共享盲区或一起漂移,双方都变复杂并不代表更接近真实目标。必须保留外部锚点、隐藏测试、异质 judge 和人类审计。
  • 改进不单调:RSIBench-Data 直接显示后续迭代常倒退。系统需要档案、回滚、最佳 checkpoint 保存和停止规则。
  • 验证成为瓶颈:代码、数学和芯片等可自动验证领域推进最快;研究品味、社会价值、长期维护性仍缺少快速可靠的奖励。
  • 算力会替代部分人力,但不会自动产生目标:Anthropic 的 97% 实验耗费约 800 Agent 小时和 18,000 美元,说明自治研发首先把瓶颈从人时转向计算、评测和治理。
  • “自己审自己”必须拆成多层:生成者、执行者、评审者、隐藏测试和最终授权不应由同一上下文、同一权重和同一目标完全控制。

九、事实分级清单

A 级:有一手论文或官方来源
  • RQGM 论文、提交时间、作者单位、NVIDIA 参与和实验结果。
  • Anthropic 80%、8×、97%/23%、约 18,000 美元等自报数据(需注明未独立审计)。
  • OpenAI 官方对外披露 RSI Index 的汇总结果。
  • AlphaEvolve 的官方技术结果。
  • DeepSeek R1、Engram 和 V4 的各自官方资料。
  • OpenRSI、Frontis-MA1、RSIBench-Data。
  • ByteDance Seed for Seed 官方说明。
B 级:事实存在,但 RSI 归类含解释
  • R1-Zero 的反思行为是 RSI 构件,而非 RSI 系统。
  • AlphaEvolve 反哺训练基础设施,属于 RSI 邻域而非权重自改。
  • Cordis 可支撑可修改 Harness,但本身不是 RSI 证据。
  • Hugging Face 是托管和开放生态节点,不是所有项目的研发主体。
C 级:暂不进入正文事实主线
  • DSuE-RSI 与 DeepSeek/UESOFT 的联合归属。
  • “Karpathy 负责 Auto-Research 智能体集群”这一具体项目名。
  • 未提供一手链接的 AREX、创业公司路线图及能力宣传。
  • 将 Jack Clark 的概率判断写成 RQGM 项目结论。

十、结语:真正的分水岭不是“AI 会不会反思”

RSI 的历史并不是一条从 Good 直线通往超级智能的预言史,而是一段评价机制逐渐被纳入自动化回路的工程史。过去的系统会生成答案;今天的系统开始生成代码、实验、数据和下一轮候选;下一道门槛是生成并维护可信的改进标准

AlphaEvolve 证明固定模型可以大规模搜索程序;DGM 证明 Agent Harness 可以自我改写;Anthropic、OpenAI 和 ByteDance 证明 AI 已进入真实 AI 研发流水线;OpenRSI 和 RSIBench 让这种能力变得开放且可测;RQGM 则指出所有路线迟早都会遇到同一个问题:谁来评价评价者?

因此,2026 年最准确的判断不是“RSI 已经实现”,而是:RSI 的必要零件已经从理论概念变成真实工程模块,若干局部闭环已经运转;但能否把这些模块组成长期、单调、可审计、目标不漂移的代际改进系统,仍是尚未解决的核心科学问题。