ProcessThinker:从中间步 rollout 估计过程奖励
本页是 VLM 自我改进 演化轴第③阶段的关键方法: ProcessThinker [1](ICLR 2026)——不需要人工标注, 用从中间步重新 rollout 的统计成功率给 reasoning 步打分, 直接对接"失败 → recovery turning point → 成功"的轨迹结构。
1. 方法
对中间 reasoning step ,从这里重新 rollout 次:
用最终成功率当这一步的价值:
从而区分"暂时看起来合理"与"实际更容易走向成功", 再用过程奖励做 GRPO。在 Video-MMMU、MMVU、VideoMathQA、 LongVideoBench 等视频 reasoning 基准上验证。
2. 对本方向的对接
ProcessThinker 的 给出了自动估计 recovery point 价值的机制: 从候选恢复点重新 rollout,谁的成功率高谁就是该固化的转折步。 端侧场景里 次 rollout 太贵,但离线在 AndroidWorld 上做 (见 数据版图研究路径)完全可行—— 这是把 PRM 思路搬进 RSI 闭环的最现实通道。
参考文献
[1] WU J P, HAN X D, SHEN W X, et al. ProcessThinker: enhancing multi-modal large language models reasoning via rollout-based process reward[C]//International Conference on Learning Representations (ICLR). 2026. https://arxiv.org/abs/2606.11209
© 2026 Yang Huan · yanghuan9812@qq.com