Vision-SR1:推理分解产生 self-reward

本页是 VLM 自我改进 演化轴第④阶段的一篇: Vision-SR1(Self-Rewarding Vision-Language Model via Reasoning Decomposition)[1](ICLR 2026)——连 reward 都让模型自己产生

1. 动机

普通 VLM RL 很容易靠语言 shortcut 答对而不真正看图。 对策是把推理拆成两段:

Visual PerceptionLanguage Reasoning \underline{ \text{Visual Perception} \rightarrow \text{Language Reasoning} }

模型先根据图片生成一个 self-contained visual description, 然后同一个模型只看这个 description、看不到原图,再回答问题。

2. Self-reward 的产生

  • 第二段还能答对 → 说明 perceptiontperception_t 确实包含足够信息 → 视觉描述质量高 → 给正奖励;
  • 第二段答错 → 描述漏了关键视觉信息 → 负奖励。

模型由此给自己产生训练奖励,再用它 RL 更新自身:

model-generated experience+model-generated evaluationweights \underline{ \text{model-generated experience} + \text{model-generated evaluation} \rightarrow \text{weights} }

3. 对本方向的启发

这个"自产经验 + 自产评估 → 权重"的闭环与 RSI 同构, 但它评估的粒度是视觉描述是否完整; RSI 闭环里对应的角色是 verifier(见 Are We Done Yet?)—— 两者可以互补:self-reward 管"看清楚了没", 环境验证管"做成了没"。

参考文献

[1] LI Z X, YU W H, HUANG C S, et al. Self-rewarding vision-language model via reasoning decomposition[J/OL]. arXiv preprint arXiv:2508.19652, 2025. https://arxiv.org/abs/2508.19652


© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""