VisionArena:23 万条真实用户-VLM 对话

本页是 RSI 数据集版图 中"真实用户与长期个人输入"一列的起点: VisionArena [1](UC Berkeley 等,CVPR 2025)——目前最大的 众包真实用户-VLM 对话数据集,230K 对话、73K 独立用户、 138 种语言、45 个 VLM。

1. 数据概况

部分 规模 内容
VisionArena-Chat 200k 用户与单个 VLM 的单轮/多轮真实对话
VisionArena-Battle 30k 用户与 2 个匿名 VLM 对话后投偏好票
VisionArena-Bench 500 多样化用户 prompt 的自动评测小集,可低成本近似模型排名

用户上传的是真实图像 + 真实 prompt——问题分布、语言、 任务类型都是自然发生的,不是 benchmark 作者构造的。

2. 主要发现

  • 开放式问题(captioning、幽默)的偏好强烈受风格影响, 风格调优的模型在这类问题上的胜率显著更高;
  • 用 VisionArena 做 SFT 对齐人类偏好:同一底座, 相比 Llava-Instruct-158K,MMMU 提升 17 分、 WildVision 人类偏好提升 46 分;
  • 数据中包含大量用户认为两个模型都表现差的双输案例—— 真实失败分布的直接来源。

3. 对 RSI 的定位:一半拼图

它提供的是:

real user multimodal input \underline{\text{real user multimodal input}}

没有 tool / action 执行轨迹——用户提问、模型回答,仅此而已。 "真实用户输入"(VisionArena)与"执行轨迹 / 失败" (RealMobileCUADebugViFailback)目前是两条没有合流的数据线; 长期个人生活的部分则见 TeleEgoEgoMonth

参考文献

[1] CHOU C, DUNLAP L, MASHITA K, et al. VisionArena: 230k real world user-VLM conversations with preference labels[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2025: 3877-3887. https://arxiv.org/abs/2412.08687


© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""