OpenVLThinker:SFT-RL 迭代产生下一代训练数据

本页是 VLM 自我改进 演化轴第④阶段的代表: OpenVLThinker [1](NeurIPS 2025)——不只是 distillation, 而是模型自己产生下一代训练数据的迭代循环。

1. 迭代闭环

SFT0RL0M1M1D1SFT1RL1M2 \text{SFT}_0 \rightarrow \text{RL}_0 \rightarrow M_1 \;\rightarrow\; M_1 \rightarrow D_1 \rightarrow \text{SFT}_1 \rightarrow \text{RL}_1 \rightarrow M_2 \rightarrow \cdots

即:

Mtbetter reasoning dataMt+1 \underline{ M_t \rightarrow \text{better reasoning data} \rightarrow M_{t+1} }

每一轮 RL-improved 模型生成更高质量的 SFT 数据,供下一轮 self-improvement——比一次性 CoT distillation 更接近

experiencemodel improvementbetter future experience. \text{experience} \rightarrow \text{model improvement} \rightarrow \text{better future experience}.

2. 差距

这里的 experience 仍是 benchmark reasoning, 不是用户设备真实执行;迭代由 GPU 集群离线完成。 但它给出了 RSI 闭环的骨架——把 MtDtM_t \rightarrow D_t 的数据源 换成设备自己的执行轨迹(RealMobile 型), 把训练换成端侧 LoRA(端侧训练), 结构上就是一个设备级 RSI 循环。

参考文献

[1] DENG Y H, BANSAL H, YIN F, et al. OpenVLThinker: complex vision-language reasoning via iterative SFT-RL cycles[C]//Advances in Neural Information Processing Systems 38 (NeurIPS). 2025. https://proceedings.neurips.cc/paper_files/paper/2025/hash/b33286edd8602ead8cb966358b01d115-Abstract-Conference.html


© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""