RSI:递归自我进化(Recursive Self-Improvement)
本专题收录 递归自我进化 / 递归自我改进(Recursive Self-Improvement, RSI) 相关的研究与实践:让 AI 系统参与甚至主导自身(或后代 AI 系统)的改进闭环, 包括自动化研究、自我训练、改进模型的改进流程等。
定位与边界
- 核心特征:存在一个闭环——AI 产出改进(算法、代码、数据、训练方案), 改进又被用于提升 AI 自身,循环往复且每一轮的改进能力可能增强。
- 与相关概念的区别:
- Self-play / 自我博弈:固定算法框架内的自我对抗训练,不算 RSI;
- Self-improvement(单轮):如 self-refine、self-consistency,只有一轮或固定轮次, 不具备"改进能力本身随循环增强"的递归性;
- AutoML / NAS:自动化搜索超参/架构,是人设定目标下的单层优化;
- RSI:强调改进管道本身可被改进,循环产物作用于循环机制。
核心脉络
- 改进对象:算法/代码(如进化搜索发现新算法)、数据(自生成训练数据)、 奖励与评估器、基础设施;
- 闭环组成:提出改进 → 验证/评测 → 筛选 → 部署进循环 → 能力增强 → 更强改进;
- 关键瓶颈:验证器(verifier)的可靠性与覆盖度、评测污染、 循环中的分布漂移与目标退化(reward hacking)、安全约束。
收录条目
子专题
- 端侧训练(On-Device Training) — 模型在用户设备上训练自己的硬件路线(CPU / GPU / NPU)与学习信号。
- RSI 数据集版图 — RSI 闭环的数据底座: 人类示范、真实设备失败轨迹、失败诊断、verifier、机器人失败、个人输入。
- VLM 自我改进:Reasoning Internalization — 把显式 reasoning 经验训练回模型权重的文献线(自蒸馏、过程监督、 自造课程、推理摊销)。
(待补充:AI Scientist 类自动化研究系统、AlphaEvolve 类进化式程序搜索、 self-taught optimizer(STOP)、递归奖励建模、RL 自我改进循环、 RSI 的安全性讨论等。)
相关:
- 端侧训练 — 端侧 LoRA 训练系统; 其 Online-SDFT(hindsight 自蒸馏闭环) 是 RSI 闭环的设备端微型版。
- RSI 数据集版图 — RSI 数据底座:示范轨迹、 真实设备失败轨迹、失败诊断、verifier 与个人数据。
- VLM 自我改进 — Reasoning Internalization 文献线:把显式推理经验烧回模型权重的五阶段演化轴。
- Attention 机制 — RSI 产出的新架构常涉及注意力变体。
- 写作规范 — 新增条目前请先阅读。
© 2026 Yang Huan · yanghuan9812@qq.com