VisualPRM:40 万条多模态过程监督
本页是 VLM 自我改进 演化轴第③阶段的过程奖励起点: VisualPRM [1](ICLR 2026,论文题为 VisualPRM400K)—— 给 reasoning trajectory 的每一步估计价值,回答 "哪一步值得学"这个 trajectory consolidation 的前置问题。
1. 数据与模型
| 组件 | 内容 |
|---|---|
| 训练集 | VisualPRM400K:约 40 万条多模态 process supervision 数据 |
| 模型 | VisualPRM-8B process reward model |
| 评测 | VisualProcessBench:2,866 个样本、26,950 条人工 step correctness 标注 |
2. 核心问题
对 reasoning 轨迹的中间步 估计:
这正是不能把整条 trajectory 直接 SFT的原因—— 前段探索错误必须被识别、剔除或降权(对照 数据版图 §4.1 的 recovery point 定位)。
3. 对本方向的定位
VisualPRM 的价值标注来自人工标注的 multimodal process supervision;端侧场景没有人工, 替代信号要么是环境可验证结果(AndroidWorld 型),要么是 ProcessThinker 的 rollout 统计。
参考文献
[1] WANG W Y, GAO Z W, CHEN L J, et al. VisualPRM400K: an effective dataset for training multimodal process reward models[C]//International Conference on Learning Representations (ICLR). 2026. https://proceedings.iclr.cc/paper_files/paper/2026/hash/d68b4e80fd0dd8ac72092b3acd418f75-Abstract-Conference.html
© 2026 Yang Huan · yanghuan9812@qq.com