OpenVLThinker:SFT-RL 迭代产生下一代训练数据
本页是 VLM 自我改进 演化轴第④阶段的代表: OpenVLThinker [1](NeurIPS 2025)——不只是 distillation, 而是模型自己产生下一代训练数据的迭代循环。
1. 迭代闭环
即:
每一轮 RL-improved 模型生成更高质量的 SFT 数据,供下一轮 self-improvement——比一次性 CoT distillation 更接近
2. 差距
这里的 experience 仍是 benchmark reasoning, 不是用户设备真实执行;迭代由 GPU 集群离线完成。 但它给出了 RSI 闭环的骨架——把 的数据源 换成设备自己的执行轨迹(RealMobile 型), 把训练换成端侧 LoRA(端侧训练), 结构上就是一个设备级 RSI 循环。
参考文献
[1] DENG Y H, BANSAL H, YIN F, et al. OpenVLThinker: complex vision-language reasoning via iterative SFT-RL cycles[C]//Advances in Neural Information Processing Systems 38 (NeurIPS). 2025. https://proceedings.neurips.cc/paper_files/paper/2025/hash/b33286edd8602ead8cb966358b01d115-Abstract-Conference.html
© 2026 Yang Huan · yanghuan9812@qq.com