一、先把概念说准:什么才算 RSI
“递归自我改进”(Recursive Self-Improvement, RSI)至少有三种强度:
- 局部自修正:模型在一次推理或任务中反思、重试、修补代码。它改善的是当前输出,不一定改变下一代系统。
- 可持续的系统改进:AI 修改提示词、上下文、工具、工作流、评测器或 Harness,使后续任务表现变好。今天大量研究位于这一层。
- AI4AI 的代际闭环:当前系统参与设计数据、训练配方、模型代码和实验,产出更强的继任模型;继任模型再重复这一过程。只有当“改进能力本身”也随每代增强,才接近强意义的 RSI。
因此,DeepSeek-R1-Zero 的反思行为、普通自我纠错、固定模型上的程序搜索,都与 RSI 有关,但不能直接等同于完整 RSI。判断一个系统时应追问:改了什么、由谁提出改动、谁验证、改进是否跨代保留、改进器本身是否变强、目标和裁判是否固定。
二、AI 之前:RSI 继承了哪些更古老的思想
1. 反馈控制:系统通过误差改变下一步
蒸汽机调速器、控制论和自动控制建立了最基础的闭环:设定目标—测量状态—计算误差—采取行动—再次测量。1948 年诺伯特·维纳以《Cybernetics》系统化了“控制与通信”的反馈观。它不是 RSI,但给出了所有自我改进系统的骨架。
2. 生物进化:变异、选择、遗传
自然选择提供了另一种无需中央设计者的改进机制:产生候选、按环境选择、保留优势。20 世纪 1950—1970 年代,进化策略、进化规划、遗传算法逐渐把这个框架搬进计算机;1990 年代遗传编程进一步让“程序本身”成为变异和组合对象。这里的关键遗产是:搜索不必只沿一条路线爬坡,可以维护种群和多样性。
3. 红皇后:环境和对手也在变化
Leigh Van Valen 于 1973 年发表 A New Evolutionary Law,提出红皇后假说。名称来自 Lewis Carroll 的 Through the Looking-Glass:“Now, here, you see, it takes all the running you can do, to keep in the same place.” 其原始问题是物种在共演化生态中的持续适应,不是 AI 评测。
原文:
RQGM 对它的继承很明确:如果 Agent 变强而评测器不变,固定评测就会饱和、被钻空子或失去区分度;因此“环境/裁判”也要演化。
4. 自指、程序自举与可修改系统
递归、自指和编译器自举说明:一个系统可以把自身描述或自身工具作为输入。编译器可以编译自己的后续版本,操作系统和软件工程也长期使用测试—构建—部署循环。但“能改自己”不等于“能保证自己变好”;RSI 最难的从来不是写入权限,而是可靠评价与保留真正改进。
5. I. J. Good:从工具循环到“智能爆炸”
I. J. Good 的 Speculations Concerning the First Ultraintelligent Machine 通常引用为 1965 年,载于 Advances in Computers, Vol. 6, pp. 31–88(部分出版页标作 1966,写作时应注明版本差异)。Good 的经典推理是:机器设计也是智力活动;若一台机器超过人类并能设计更好的机器,就可能形成“智能爆炸”。
论文记录与 DOI:
https://philpapers.org/rec/GOOSCT
https://doi.org/10.1016/S0065-2458(08)60418-0
Good 提供的是宏观逻辑,不是可运行架构。
6. Gödel Machine:给自我修改加上证明门槛
Jürgen Schmidhuber 于 2003-09-25 提交 Gödel Machine 初稿,2006 年修订。它把系统自身代码、效用函数和证明搜索器都纳入形式系统;只有证明某次改写能提高预期效用,才执行自我修改。
论文:
https://arxiv.org/abs/cs/0309048
项目页:
https://people.idsia.ch/~juergen/goedelmachine.html
它的重要性在于第一次给出严格的“自指—证明—改写”框架;局限也同样明显:现实大模型、复杂环境和长期科研价值很难被完整公理化,更难高效证明。因此今天的 Gödel Machine 后继者普遍把“形式证明”放宽为“实验评测”。
三、进入 AI:从自我博弈到可执行研发循环
1992—2018:自我博弈证明“对手可自动生成课程”
TD-Gammon 在 1992—1994 年通过自我对弈达到高水平;AlphaGo Zero(2017)和 AlphaZero(论文发表于 2018)把自我博弈扩展到围棋、国际象棋和将棋。自我博弈的深层贡献不是“模型会和自己玩”,而是让训练分布随能力上升自动变难。它与红皇后路线相似,但游戏规则和胜负函数仍然固定。
TD-Gammon:
AlphaZero:
https://www.science.org/doi/10.1126/science.aar6404
2023—2024:提示词、评测器和代码开始自我改进
- Self-Refine(2023):同一模型生成反馈并迭代答案,是“输出层自修正”,不是代际 RSI。
- Promptbreeder(2023):用进化方法改提示词,并让改变提示词的方法也参与演化,出现自指式提示优化。
- STOP(2023 预印本,COLM 2024):让代码生成器改写“改进代码的程序”,是 DGM 的重要直接前史。
- Self-Taught Evaluators(Meta,2024-08):用模型生成的对比数据迭代训练评测器,说明“裁判也能学习”,但它不是 RQGM 那种 Agent—Evaluator 联合共演化。
- Gödel Agent(2024-10 预印本,ACL 2025):允许 Agent 修改自身逻辑与行为,以高层目标和实证效用推进递归改进。
- AI Scientist(Sakana AI,2024):把提出想法、写代码、跑实验、写论文、自动评审串成科研工作流,证明 AI 可以覆盖科研链多个环节,但“生成论文”不自动等于可靠发现。
- RE-Bench(METR,2024-11 预印本;ICML 2025):用 7 个开放式机器学习研发环境,将 AI Agent 与 61 位专家的 71 次八小时尝试直接比较。它测的是 AI 研发能力,是判断 RSI 是否接近的基础仪表,而不是 RSI 系统本身。
https://arxiv.org/abs/2411.15114
https://metr.org/blog/2024-11-22-evaluating-r-d-capabilities-of-llms/
2025:程序进化和 Agent 自我改写成为可运行系统
Google DeepMind 于 2025-05-14 发布 AlphaEvolve;白皮书后于 2025-06-16 提交 arXiv。系统以 Gemini Flash/Pro 生成程序,用自动评测器验证,再通过进化数据库选择后续候选。
官方发布:
论文:
https://arxiv.org/abs/2506.13131
已公开事实包括:
- Borg 调度启发式平均回收 Google 全球约 0.7% 计算资源;
- 改写 Gemini 内核,相关矩阵乘法内核提速 23%,整体训练时间降低约 1%;
- FlashAttention 实现最高提速 32.5%;
- 4×4 复数矩阵乘法从已知 49 次标量乘法降至 48 次;
- 50 多个数学问题中约 75% 重现当时最优结果,约 20% 改善已知结果(均为 DeepMind 自报)。
它确实“优化了训练 AlphaEvolve 所依赖的 AI 基础设施”,形成反馈关系;但 Gemini 权重不是在该循环内自动改写。因此更准确的定位是RSI 邻近的算法与基础设施进化器。
Sakana AI/UBC 团队于 2025-05-30 发布 DGM。它放弃 Gödel Machine 的形式证明要求,改用代码基准实证验证;维护多个 Agent 版本的开放档案,通过选择、改写、评测不断产生新 Agent。基础 LLM 固定,变化的是 Agent 的代码和 Harness。
项目:
论文:
https://arxiv.org/abs/2505.22954
公开实验中,SWE-bench Verified 从 20% 提升至 50%,Polyglot 从 14.2% 提升至 30.7%。DGM 是 RQGM 的直接学术前驱:RQGM 论文参考文献第 2 条即 DGM。
四、2026 年:三条路线同时成形
路线 A:AI 进入 AI 研发——Anthropic 与 OpenAI
原文:
https://www.anthropic.com/institute/recursive-self-improvement
这篇文章首次系统公开 Anthropic 的内部 AI4AI 进度,并明确说“我们还没有到完整 RSI,RSI 也并非必然”。其数据是公司自报、未独立审计,但有一手来源:
- 截至 2026-05,Anthropic 合并代码中超过 80% 由 Claude 编写;
- 2026 年第二季度,典型工程师每天合并代码量约为 2024 年的 8 倍,但 Anthropic 自己提醒代码行数高估真实生产率;
- 开放式任务成功率在 2026-05 达到 76%,半年提高 50 个百分点,成功与否由 Claude judge 判定;
- 固定目标的训练代码加速任务中,Claude Opus 4(2025-05)约 3×,Mythos Preview(2026-04)约 52×;
- 自动弱到强监督研究中,两位人类研究员约恢复 23% 的基准差距;Agent 恢复 97%,消耗约 800 累计小时与 18,000 美元算力。人类仍负责选题和评分标准,结果未顺利迁移到生产规模模型。
这些数据支持“AI 已显著加速 AI 研发”,但也揭示最后瓶颈:研究品味、方向选择和对结果是否可信的判断。
Jack Clark 关于 2028 年 60% 概率的说法来自 2026-06-07 的《经济学人》采访/报道,是个人预测,不是 RQGM 项目事实:
Andrej Karpathy 于 2026-05-19 宣布加入 Anthropic 的 pre-training 团队。可信报道指向“用 Claude 加速预训练研究”,但“Auto-Research 智能体集群”不是已证实的官方项目名:
OpenAI 的 GPT-5.6 官方页公开了一个内部评测套件的汇总结果,称为 RSI Index,任务包括调试研究系统、优化内核和训练配方、运行机器学习实验及改进另一个模型。GPT-5.6 Sol 的汇总分数比 GPT-5.5 高 16.2 点。正确表述应是“OpenAI 对外披露内部评测结果”,而不是“公开发布可复现基准”;任务集、数据和完整协议并未像 RE-Bench 那样开放。
官方来源:
https://openai.com/index/gpt-5-6
Lilian Weng 于 2026-07-04 发布 Harness Engineering for Self-Improvement:
https://lilianweng.github.io/posts/2026-07-04-harness/
她把 Harness 定义为基础模型外层、负责规划、工具调用、行动、上下文、持久化和评估的运行系统,并总结三类常见设计:工作流自动化、文件系统持久记忆、子 Agent/后台任务。她的核心判断是:近期 RSI 不大可能始于模型直接重写权重,而更可能先优化上下文、工作流、Harness 代码乃至优化器代码。
时间关系必须讲清:
- DGM、AlphaEvolve、RE-Bench、Meta-Harness 等研究早于 Weng 博客;
- Weng 的文章是 2026-07 的综述和工程框架化,明确引用 DGM、AlphaEvolve、RE-Bench 等工作,不是这些项目的思想源头;
- RQGM 初稿提交于 2026-06-24,也早于 Weng 博客;目前不能说 RQGM 受该博客启发;
- Weng 于 2026-07-29 离开 Thinking Machines Lab 并回归 OpenAI,媒体称其将领导加速内部研究、支持跨方向 RSI 的高层团队。这是博客之后的职业事件。
报道:
路线 B:裁判与选手共同进化——RQGM
RQGM 论文初稿提交于 2026-06-24,6 月 29 日修订;剑桥新闻稿发表于 2026-07-21。因此“2026 年 7 月论文”不准确,论文时间应记为 6 月,新闻传播在 7 月。
论文:
https://arxiv.org/abs/2606.26294
剑桥新闻:
https://www.cst.cam.ac.uk/news/red-queen-hypothesis-new-way-forward-self-improving-ai
项目介绍:
https://mlsys.cst.cam.ac.uk/2026/07/19/who-evaluates-the-evaluator.html
RQGM 把搜索分成多个 epoch:epoch 内评测标准固定,以保留局部改进保证;epoch 边界允许 utility/评测器更新。公开结果包括:
- 在可验证代码任务中加入 Agent-as-a-judge 代码审查信号,优于此前方法并少用 1.35×—1.72× token;
- 科学论文写作的共同演化版本在多样化 judge panel 下,接受率达到基线的 1.78×—1.86×;
- 共同演化的数学证明评分器,真实标签准确率提高 9%;
- 发现最强基线评审器对 AI 论文的过度接收率最高为人类论文的 1.91×,并通过对抗目标纠正偏差。
团队确有 NVIDIA 参与:论文作者 Daniel Burkhardt 与 Niccolò Alberto Elia Venanzi 标注 NVIDIA,致谢也列有 NVIDIA 支持。因此“英伟达参与”可以保留,但必须和 Jack Clark 的第三方评论分开。
RQGM 的思想谱系是可追踪的:Van Valen(1973)提供共演化隐喻;Schmidhuber(2003)提供自我修改机器框架;DGM(2025)把证明放宽为实证搜索;RQGM 再把固定效用推进到受控的动态效用。它不是 Weng 博客的应用,而是与 Harness 路线同期汇合于“如何可靠闭合研发反馈回路”。
路线 C:数据、模型与开源基础设施——DeepSeek、OpenRSI、RSIBench 与 Hugging Face
DeepSeek-R1 / R1-Zero(2025-01)
https://arxiv.org/abs/2501.12948
R1-Zero 用纯 RL 启动,出现反思和自校验等行为。它说明固定奖励下可以涌现有用推理策略,但评测、训练流程和目标仍由人定义,故应标为“RSI 所需的模型侧能力”,不是 RSI 闭环。
Engram(2026-01-12)
https://arxiv.org/abs/2601.07372
https://github.com/deepseek-ai/Engram
Engram 是可扩展查表式 conditional memory,与 MoE 的 conditional computation 互补。它可降低静态知识检索的计算成本,但论文没有证明它就是 RSI 技术,也不能直接说“V4 采用 Engram”。
DeepSeek-V4 Preview(2026-04-24)
https://api-docs.deepseek.com/news/news260424
官方可证实:V4-Pro/Flash 开源、1M 上下文、DeepSeek Sparse Attention、强化 Agentic Coding,并用于 DeepSeek 内部 Agent 编码。官方 V4 页面没有把 Engram 列为 V4 组件,也没有在该页给出“RSI 系统”声明;因此“Engram=V4 底层”“SWE-Bench 80.6%”“国产算力适配”需要分别引用技术报告,不能打包推断。
Cordis(2026-08)
https://github.com/cordiverse/paper
https://github.com/cordiverse/cordis
Cordis 是可动态组合和卸载组件的 TypeScript 元框架,其核心是可回滚 effect、响应式 coeffect、组件加载和热更新。媒体把它称为“黑鲸/DeepSeek Harness 底座”,但论文仓库本身展示的是 Cordiverse 项目,不足以单独证明它是 DeepSeek 官方 RSI 项目。它与 Harness 工程在技术形态上相关,归属和用途必须按官方仓库/技术报告谨慎表述。
DSuE-RSI:本次未找到足够的一手论文、官方仓库或 DeepSeek 联合发布证据,应保留在 C 级“未证实”,不进入基本事实主线。
Frontis 于 2026-07-31 发布首版 OpenRSI:
https://github.com/FrontisAI/OpenRSI
论文:
https://arxiv.org/abs/2607.28568
它明确声明从 bounded、executable 的机器学习工程领域开始,不声称解决通用 RSI。OpenMLE 提供 Gym、SFT/RL 和长程进化搜索;Frontis-MA1 训练 Draft、Improve、Debug、Crossover 四类算子。公开结果需标为 model–harness 联合结果,而非单次模型分数;项目称一张 RTX 4090、12GB 限额和 12 小时任务预算可运行其 MLE-Bench Lite 配置。
论文于 2026-07-28 提交:
https://arxiv.org/abs/2607.25886
代码:
https://github.com/evolvent-ai/RSIBench-Data
它固定基础模型、训练/服务/评测栈,只让研究 Agent 改训练数据策略。四个前沿 Agent、六个任务中,58.33% 的设置能改进第一次有效尝试;但在已经达到峰值后仍继续搜索的运行中,78.26% 最终以更低分结束,其余只回到峰值。核心事实是:当前 Agent 能发现改进,但不能可靠保留和继续改进。
论文使用 Tinker、Harbor 和 E2B;这些是实验栈组件,不是 Hugging Face 官方产品。
Hugging Face 在这里主要是开放发布和协作基础设施:托管模型权重、数据集、论文页面和 Demo,而不是上述系统的统一研发者。
可验证项目:
- BigBang-V1:
- OpenRSI / Frontis-MA1:
- Open-R1(复现和开放 DeepSeek-R1 训练研究):
因此不能写“Hugging Face 提供 E2B/Harbor”,也不能把在 HF 托管的项目成果算作 HF 自研 RSI。
五、字节跳动·豆包:公开证据支持到什么程度
最强的一手来源是 Seed 团队 2026-06-23 的 Seed2.1 官方发布:
https://seed.bytedance.com/en/blog/seed2-1-officially-released-advancing-ai-productivity
产品页:
https://seed.bytedance.com/en/seed2_1
官方明确提出 Seed for Seed:Seed2.1 进入评测系统开发、能力诊断、SFT 数据合成、RL 训练框架优化、研究论文方法复现和基础设施研发;复杂任务可由执行、评测、诊断、优化等多 Agent 协作,任务跨度从数小时到数十天。未来方向也明确写有:改善 Harness—模型协同,把模型更深地接入训练流程并推动 autonomous research。
这已经是公开可验证的 AI4AI / Harness 路线贡献。它比“只有普通 Agent 产品”更进一步,但仍未公开:
- 像 RQGM 那样评测器与 Agent 同步演化的论文;
- 一个可复现、可审计、连续产出更强继任模型的端到端 RSI 系统;
- 足以核实“Seed-Evolving 每月 2—4 次”“256K”“Trae 自动视觉修复”均属于同一 RSI 项目的统一一手证据。
Seed2.1 产品页确实展示 RTL Design Agent 实践,因此“用于 RTL 场景”可保留;但“完整自主芯片设计”应避免扩大表述。最准确的结论是:字节已公开确认 AI 参与自家模型研发链,并把它命名为 Seed for Seed;目前属于 AI4AI 工程实践和自治研发方向,不是已证明的强 RSI。
六、各家到底有没有“互相参考”
能从论文引用确认的继承
- RQGM 明确引用 Van Valen(1973)和 DGM(2025),其名称和方法就是在这两条线的交点上产生。
- DGM 明确继承 Gödel Machine,并将“证明后修改”改为“实验验证后保留”;也处在 STOP 等递归代码改进工作的后续脉络中。
- Weng 博客明确引用 Good、DGM、AlphaEvolve、RE-Bench、Meta-Harness 等,是一篇把已有工作组织成 Harness Engineering 路线的综述。
- AlphaEvolve 官方说明其前身包括 DeepMind 2023 年的 FunSearch;其独立技术线是 LLM + 自动评测 + 进化程序搜索。
只能说“同期收敛”,不能说抄袭或直接启发
- Anthropic 的内部 AI4AI 实践、OpenAI 的 RSI Index、ByteDance 的 Seed for Seed 都说明前沿实验室在 2025—2026 年独立收敛到“让模型参与模型研发”。公开证据不足以建立谁复制谁。
- RQGM 论文早于 Weng 2026-07-04 博客,因此不能说剑桥从该博客得到灵感;反过来,博客作为 7 月综述可能吸收了 6 月已经公开的研究,但应以正文引用为准。
- DeepSeek 的 Engram、V4 和 Cordis 与 RSI 的关系主要是“降低长程 Agent/研发循环成本、增强 Harness 可组合性”;除非官方论文明确建立闭环,否则不能把基础设施相似性写成思想继承。
七、真实历史主线
- 1940s—1970s:反馈与共演化——控制论给闭环,进化论给变异选择,红皇后给动态环境。
- 1965:Good 提出智能爆炸逻辑——一代机器设计下一代机器。
- 2003:Gödel Machine 形式化自我改写——改动前要求证明效用提升。
- 1992—2018:自我博弈成功——系统自动生成越来越强的训练对手,但规则与裁判固定。
- 2023—2024:可执行的局部递归——模型开始改提示词、程序、评测器和工作流;AI Scientist 与 RE-Bench 分别搭建科研闭环和测量仪表。
- 2025:经验主义 Gödel 机与程序进化——DGM 改自身 Harness;AlphaEvolve 在可验证程序空间进化,并反哺 AI 基础设施。
- 2026:AI4AI 进入实验室生产流程——Anthropic、OpenAI、ByteDance 披露 AI 已参与研发;OpenRSI 和 RSIBench 把流程开放、可测。
- 2026-06:RQGM 更新裁判——第一次把非平稳效用和评测器共同演化明确放进 Gödel Machine 后继框架。
这条历史不是从一篇博客突然开始,也不是各家公司同时“发明 RSI”。它是四股长期思想在 2025—2026 年汇合:反馈控制、自我博弈/进化搜索、自指程序、自动化科研。 大模型和代码 Agent 让过去只能讨论的循环第一次具备可执行接口。
八、今天的能力边界与最大风险
- 固定裁判会失效:Goodhart 定律、奖励劫持、测试过拟合和 judge 偏见会把“分数进步”伪装成“能力进步”。
- 评测器共同进化也不是万能药:如果 Agent 和 evaluator 共谋、共享盲区或一起漂移,双方都变复杂并不代表更接近真实目标。必须保留外部锚点、隐藏测试、异质 judge 和人类审计。
- 改进不单调:RSIBench-Data 直接显示后续迭代常倒退。系统需要档案、回滚、最佳 checkpoint 保存和停止规则。
- 验证成为瓶颈:代码、数学和芯片等可自动验证领域推进最快;研究品味、社会价值、长期维护性仍缺少快速可靠的奖励。
- 算力会替代部分人力,但不会自动产生目标:Anthropic 的 97% 实验耗费约 800 Agent 小时和 18,000 美元,说明自治研发首先把瓶颈从人时转向计算、评测和治理。
- “自己审自己”必须拆成多层:生成者、执行者、评审者、隐藏测试和最终授权不应由同一上下文、同一权重和同一目标完全控制。
九、事实分级清单
A 级:有一手论文或官方来源
- RQGM 论文、提交时间、作者单位、NVIDIA 参与和实验结果。
- Anthropic 80%、8×、97%/23%、约 18,000 美元等自报数据(需注明未独立审计)。
- OpenAI 官方对外披露 RSI Index 的汇总结果。
- AlphaEvolve 的官方技术结果。
- DeepSeek R1、Engram 和 V4 的各自官方资料。
- OpenRSI、Frontis-MA1、RSIBench-Data。
- ByteDance Seed for Seed 官方说明。
B 级:事实存在,但 RSI 归类含解释
- R1-Zero 的反思行为是 RSI 构件,而非 RSI 系统。
- AlphaEvolve 反哺训练基础设施,属于 RSI 邻域而非权重自改。
- Cordis 可支撑可修改 Harness,但本身不是 RSI 证据。
- Hugging Face 是托管和开放生态节点,不是所有项目的研发主体。
C 级:暂不进入正文事实主线
- DSuE-RSI 与 DeepSeek/UESOFT 的联合归属。
- “Karpathy 负责 Auto-Research 智能体集群”这一具体项目名。
- 未提供一手链接的 AREX、创业公司路线图及能力宣传。
- 将 Jack Clark 的概率判断写成 RQGM 项目结论。
十、结语:真正的分水岭不是“AI 会不会反思”
RSI 的历史并不是一条从 Good 直线通往超级智能的预言史,而是一段评价机制逐渐被纳入自动化回路的工程史。过去的系统会生成答案;今天的系统开始生成代码、实验、数据和下一轮候选;下一道门槛是生成并维护可信的改进标准。
AlphaEvolve 证明固定模型可以大规模搜索程序;DGM 证明 Agent Harness 可以自我改写;Anthropic、OpenAI 和 ByteDance 证明 AI 已进入真实 AI 研发流水线;OpenRSI 和 RSIBench 让这种能力变得开放且可测;RQGM 则指出所有路线迟早都会遇到同一个问题:谁来评价评价者?
因此,2026 年最准确的判断不是“RSI 已经实现”,而是:RSI 的必要零件已经从理论概念变成真实工程模块,若干局部闭环已经运转;但能否把这些模块组成长期、单调、可审计、目标不漂移的代际改进系统,仍是尚未解决的核心科学问题。