VisPlay:出题-解题自我博弈的 VLM

本页是 VLM 自我改进 演化轴第④阶段的一篇: VisPlay(Self-Evolving Vision-Language Models)[1](CVPR 2026)—— 不需要任何人工 QA:只有大量无标注图像, VLM 自己给自己造课程。

1. 方法

同一个 VLM 分成两个 role 自我博弈:

QuestionerReasoner \text{Questioner} \;\leftrightarrow\; \text{Reasoner}

  • Questioner:针对图像生成"越来越难、但可回答"的问题;
  • Reasoner:解决这些问题;
  • 双方通过 GRPO 联合训练:

(MtQ,MtR)(Mt+1Q,Mt+1R) (M^Q_t, M^R_t) \rightarrow (M^Q_{t+1}, M^R_{t+1})

2. 结果

在视觉 reasoning、组合泛化、hallucination 减少上均有提升—— 典型的 VLM creates its own learning curriculum

3. 对本方向的定位

它自造的是人工训练环境(问题-答案课程), 不是"失败执行 experience"。但它的启示在于: 课程不必人工设计——对端侧 agent 而言, 用户每天使用设备产生的任务流本身就是现成的 curriculum (对照 RSI 数据集版图 的 personal 线), 连"发明游戏"这一步都可以省掉。

参考文献

[1] HE Y C, HUANG C S, LI Z X, et al. VisPlay: self-evolving vision-language models[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2026. https://openaccess.thecvf.com/content/CVPR2026/html/He_VisPlay_Self-Evolving_Vision-Language_Models_CVPR_2026_paper.html


© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""