VisualPRM:40 万条多模态过程监督

本页是 VLM 自我改进 演化轴第③阶段的过程奖励起点: VisualPRM [1](ICLR 2026,论文题为 VisualPRM400K)—— 给 reasoning trajectory 的每一步估计价值,回答 "哪一步值得学"这个 trajectory consolidation 的前置问题。

1. 数据与模型

组件 内容
训练集 VisualPRM400K:约 40 万条多模态 process supervision 数据
模型 VisualPRM-8B process reward model
评测 VisualProcessBench:2,866 个样本、26,950 条人工 step correctness 标注

2. 核心问题

对 reasoning 轨迹的中间步 s1,s2,,sns_1, s_2, \ldots, s_n 估计:

V(si) V(s_i)

which reasoning step is good/bad? \underline{\text{which reasoning step is good/bad?}}

这正是不能把整条 trajectory 直接 SFT的原因—— 前段探索错误必须被识别、剔除或降权(对照 数据版图 §4.1 的 recovery point 定位)。

3. 对本方向的定位

VisualPRM 的价值标注来自人工标注的 multimodal process supervision;端侧场景没有人工, 替代信号要么是环境可验证结果(AndroidWorld 型),要么是 ProcessThinker 的 rollout 统计。

参考文献

[1] WANG W Y, GAO Z W, CHEN L J, et al. VisualPRM400K: an effective dataset for training multimodal process reward models[C]//International Conference on Learning Representations (ICLR). 2026. https://proceedings.iclr.cc/paper_files/paper/2026/hash/d68b4e80fd0dd8ac72092b3acd418f75-Abstract-Conference.html


© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""