Vision-SR1:推理分解产生 self-reward
本页是 VLM 自我改进 演化轴第④阶段的一篇: Vision-SR1(Self-Rewarding Vision-Language Model via Reasoning Decomposition)[1](ICLR 2026)——连 reward 都让模型自己产生。
1. 动机
普通 VLM RL 很容易靠语言 shortcut 答对而不真正看图。 对策是把推理拆成两段:
模型先根据图片生成一个 self-contained visual description, 然后同一个模型只看这个 description、看不到原图,再回答问题。
2. Self-reward 的产生
- 第二段还能答对 → 说明 确实包含足够信息 → 视觉描述质量高 → 给正奖励;
- 第二段答错 → 描述漏了关键视觉信息 → 负奖励。
模型由此给自己产生训练奖励,再用它 RL 更新自身:
3. 对本方向的启发
这个"自产经验 + 自产评估 → 权重"的闭环与 RSI 同构, 但它评估的粒度是视觉描述是否完整; RSI 闭环里对应的角色是 verifier(见 Are We Done Yet?)—— 两者可以互补:self-reward 管"看清楚了没", 环境验证管"做成了没"。
参考文献
[1] LI Z X, YU W H, HUANG C S, et al. Self-rewarding vision-language model via reasoning decomposition[J/OL]. arXiv preprint arXiv:2508.19652, 2025. https://arxiv.org/abs/2508.19652
© 2026 Yang Huan · yanghuan9812@qq.com