VisionArena:23 万条真实用户-VLM 对话
本页是 RSI 数据集版图 中"真实用户与长期个人输入"一列的起点: VisionArena [1](UC Berkeley 等,CVPR 2025)——目前最大的 众包真实用户-VLM 对话数据集,230K 对话、73K 独立用户、 138 种语言、45 个 VLM。
1. 数据概况
| 部分 | 规模 | 内容 |
|---|---|---|
| VisionArena-Chat | 200k | 用户与单个 VLM 的单轮/多轮真实对话 |
| VisionArena-Battle | 30k | 用户与 2 个匿名 VLM 对话后投偏好票 |
| VisionArena-Bench | 500 | 多样化用户 prompt 的自动评测小集,可低成本近似模型排名 |
用户上传的是真实图像 + 真实 prompt——问题分布、语言、 任务类型都是自然发生的,不是 benchmark 作者构造的。
2. 主要发现
- 开放式问题(captioning、幽默)的偏好强烈受风格影响, 风格调优的模型在这类问题上的胜率显著更高;
- 用 VisionArena 做 SFT 对齐人类偏好:同一底座, 相比 Llava-Instruct-158K,MMMU 提升 17 分、 WildVision 人类偏好提升 46 分;
- 数据中包含大量用户认为两个模型都表现差的双输案例—— 真实失败分布的直接来源。
3. 对 RSI 的定位:一半拼图
它提供的是:
但没有 tool / action 执行轨迹——用户提问、模型回答,仅此而已。 "真实用户输入"(VisionArena)与"执行轨迹 / 失败" (RealMobile、CUADebug、 ViFailback)目前是两条没有合流的数据线; 长期个人生活的部分则见 TeleEgo 与 EgoMonth。
参考文献
[1] CHOU C, DUNLAP L, MASHITA K, et al. VisionArena: 230k real world user-VLM conversations with preference labels[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2025: 3877-3887. https://arxiv.org/abs/2412.08687
© 2026 Yang Huan · yanghuan9812@qq.com