VisPlay:出题-解题自我博弈的 VLM
本页是 VLM 自我改进 演化轴第④阶段的一篇: VisPlay(Self-Evolving Vision-Language Models)[1](CVPR 2026)—— 不需要任何人工 QA:只有大量无标注图像, VLM 自己给自己造课程。
1. 方法
同一个 VLM 分成两个 role 自我博弈:
- Questioner:针对图像生成"越来越难、但可回答"的问题;
- Reasoner:解决这些问题;
- 双方通过 GRPO 联合训练:
2. 结果
在视觉 reasoning、组合泛化、hallucination 减少上均有提升—— 典型的 VLM creates its own learning curriculum。
3. 对本方向的定位
它自造的是人工训练环境(问题-答案课程), 不是"失败执行 experience"。但它的启示在于: 课程不必人工设计——对端侧 agent 而言, 用户每天使用设备产生的任务流本身就是现成的 curriculum (对照 RSI 数据集版图 的 personal 线), 连"发明游戏"这一步都可以省掉。
参考文献
[1] HE Y C, HUANG C S, LI Z X, et al. VisPlay: self-evolving vision-language models[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2026. https://openaccess.thecvf.com/content/CVPR2026/html/He_VisPlay_Self-Evolving_Vision-Language_Models_CVPR_2026_paper.html
© 2026 Yang Huan · yanghuan9812@qq.com