RSI:递归自我进化(Recursive Self-Improvement)

本专题收录 递归自我进化 / 递归自我改进(Recursive Self-Improvement, RSI) 相关的研究与实践:让 AI 系统参与甚至主导自身(或后代 AI 系统)的改进闭环, 包括自动化研究、自我训练、改进模型的改进流程等。

定位与边界

  • 核心特征:存在一个闭环——AI 产出改进(算法、代码、数据、训练方案), 改进又被用于提升 AI 自身,循环往复且每一轮的改进能力可能增强。
  • 与相关概念的区别
    • Self-play / 自我博弈:固定算法框架内的自我对抗训练,不算 RSI;
    • Self-improvement(单轮):如 self-refine、self-consistency,只有一轮或固定轮次, 不具备"改进能力本身随循环增强"的递归性;
    • AutoML / NAS:自动化搜索超参/架构,是人设定目标下的单层优化;
    • RSI:强调改进管道本身可被改进,循环产物作用于循环机制。

核心脉络

  • 改进对象:算法/代码(如进化搜索发现新算法)、数据(自生成训练数据)、 奖励与评估器、基础设施;
  • 闭环组成:提出改进 → 验证/评测 → 筛选 → 部署进循环 → 能力增强 → 更强改进;
  • 关键瓶颈:验证器(verifier)的可靠性与覆盖度、评测污染、 循环中的分布漂移与目标退化(reward hacking)、安全约束。

收录条目

子专题

(待补充:AI Scientist 类自动化研究系统、AlphaEvolve 类进化式程序搜索、 self-taught optimizer(STOP)、递归奖励建模、RL 自我改进循环、 RSI 的安全性讨论等。)

相关:

  • 端侧训练 — 端侧 LoRA 训练系统; 其 Online-SDFT(hindsight 自蒸馏闭环) 是 RSI 闭环的设备端微型版。
  • RSI 数据集版图 — RSI 数据底座:示范轨迹、 真实设备失败轨迹、失败诊断、verifier 与个人数据。
  • VLM 自我改进 — Reasoning Internalization 文献线:把显式推理经验烧回模型权重的五阶段演化轴。
  • Attention 机制 — RSI 产出的新架构常涉及注意力变体。
  • 写作规范 — 新增条目前请先阅读。

© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""