ProcessThinker:从中间步 rollout 估计过程奖励

本页是 VLM 自我改进 演化轴第③阶段的关键方法: ProcessThinker [1](ICLR 2026)——不需要人工标注, 用从中间步重新 rollout 的统计成功率给 reasoning 步打分, 直接对接"失败 → recovery turning point → 成功"的轨迹结构。

1. 方法

对中间 reasoning step sis_i,从这里重新 rollout KK 次:

siτ(1),τ(2),,τ(K) s_i \rightarrow \tau^{(1)}, \tau^{(2)}, \ldots, \tau^{(K)}

用最终成功率当这一步的价值:

V(si)=#successK V(s_i) = \frac{\#\text{success}}{K}

从而区分"暂时看起来合理"与"实际更容易走向成功", 再用过程奖励做 GRPO。在 Video-MMMU、MMVU、VideoMathQA、 LongVideoBench 等视频 reasoning 基准上验证。

2. 对本方向的对接

recovery turning point \text{失败} \rightarrow \underline{\text{recovery turning point}} \rightarrow \text{成功}

ProcessThinker 的 V(si)V(s_i) 给出了自动估计 recovery point 价值的机制: 从候选恢复点重新 rollout,谁的成功率高谁就是该固化的转折步。 端侧场景里 KK 次 rollout 太贵,但离线在 AndroidWorld 上做 (见 数据版图研究路径)完全可行—— 这是把 PRM 思路搬进 RSI 闭环的最现实通道。

参考文献

[1] WU J P, HAN X D, SHEN W X, et al. ProcessThinker: enhancing multi-modal large language models reasoning via rollout-based process reward[C]//International Conference on Learning Representations (ICLR). 2026. https://arxiv.org/abs/2606.11209


© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""