RSI 数据集版图
本页是 RSI:递归自我进化 专题下的数据集子专题: 整理 VLM / VLA Agent 走向"从自己的执行经验中持续固化能力" (trajectory → skill → 下次更省)所需的数据底座——谁在提供人类示范、 谁在提供真实设备上的模型轨迹、谁能标出失败的位置、谁能验证成功、 以及真实用户与长期个人输入目前覆盖到哪里。 本页负责纵览与综合,每个数据集独立成页(见 §6 收录条目)。
"失败轨迹"已经不缺——2025–2026 年集中出现了一整批: CUADebug [8]、GUI-360° [9]、ViFailback [13]、RealMobile [6]…… 真正缺的是纵向数据:同一个能力上"第一次失败 → 固化 → 之后再次遇到 相似任务"的配对记录。现有 benchmark 回答的是 Can you recover?,还没有人系统回答 After recovering once, do you still need to recover the same way again?
1. Road Tree:数据集纵览
每张卡片带三类标准 tag:平台(手机 / 桌面 / 机器人 / 第一视角 / 对话)、 失败轨迹(含失败 / 无失败 / 全失败)、 正确校正(人工标注或程序标签的纠正信息 / 正确示范——人工、标签数据都算)。
六条 lane 正好对应 RSI 闭环要拼的六块数据拼图:示范与语料告诉模型正确做法, 真实设备轨迹暴露真实失败,失败诊断把失败变成可训练信号, verifier 保证"成功"可信,机器人线证明这套范式在 VLA 上同样成立, 个人输入线提供"只有这台设备 / 这个用户才需要"的定制信号—— 但目前没有任何一条 lane 同时覆盖 Personal 与 Failed。
2. 视觉形态:单步截图 / 截图序列 / 连续视频流
能直接拿来训练 VLM 本身(而不只是外部 controller)的视觉执行数据 已经很多,但要区分三种形态——它们适合训练的能力不同:
即:单步截图 / 截图序列(事件驱动的稀疏视频)/ 连续视频流。
GUI 场景里截图序列本质上就是稀疏的事件驱动视频: 有意义的状态变化只发生在 action 之后,30 秒 30fps 的 900 帧往往 15 张截图就能覆盖——对端侧 LoRA 训练反而是优势。 下表用「持续视频」一列区分第三档。
3. 数据版图矩阵
「获取」列的来源图标: = HuggingFace 数据集, = ModelScope 数据集, = GitHub 官方仓库, / 📄 = 论文(数据未单独公开时)。
| 数据集 | 获取 | 持续视频 | 真实个人输入 | 人类轨迹 | 模型轨迹 | 失败轨迹 | 失败定位/纠正 | 真实物理执行 |
|---|---|---|---|---|---|---|---|---|
| AITW [1] | GitHub | ❌ 截图序列 | 部分 | ✅✅ | ❌ | ❌ | ❌ | 真机采集 |
| AndroidControl [2] | GitHub | ❌ 截图序列 | 部分 | ✅ | ❌ | ❌ | ❌ | 真机采集 |
| GUIOdyssey [3] | HF · MS | ❌ 截图序列 | ❌ | ✅ | ❌ | ❌ | ❌ | 模拟器 |
| GUI-Libra [4] | HF·SFT · HF·RL | ❌ 截图序列 | ❌ | ❌ | ✅(蒸馏语料) | 已滤除 | CoT + 可执行动作 | AndroidWorld 评测 |
| GUI-CEval [5] | 📄 CVF 论文 | ❌ 截图序列 | ❌ | 部分 | ✅ | ✅ | 部分 | ✅ 真机 |
| RealMobile [6] | HF(注明不用于训练) | ❌ 截图序列 | ❌ | ❌ | ✅✅ | ✅ | reasoning + 评分 | ✅✅ 真机 |
| Xiaomi-GUI-0 [7] | arXiv(飞轮数据未公开) | ❌ 截图序列 | ❌ | ❌ | ✅ | ✅ | 反思 + 恢复示范 | ✅ 真机(内部) |
| CUADebug [8] | HF | ❌ 截图序列 | ❌ | ❌ | ✅ | ✅✅ | root-cause + 纠正 | 桌面 |
| GUI-360° [9] | HF · GitHub | ❌ 截图序列 | ❌ | ❌ | ✅ | ✅✅ | reasoning | 桌面 |
| Are We Done Yet? [10] | arXiv | ❌ 截图序列 | ❌ | ❌ | ✅ | ✅ | success 标签 | macOS |
| AgentHorizon [11] | HF | ❌ 截图序列 | ❌ | ❌ | ✅ | ✅ | 成败 + 错误类型 | 桌面 |
| AndroidWorld [12] | GitHub | ❌ 截图序列 | ❌ | ❌ | ✅(可产生) | 可产生 | programmatic 验证 | 模拟器/真机 |
| ViFailback [13] | HF | ✅ 连续视频 | ❌ | 遥操作/策略 | ✅ | ✅✅ | 诊断 + 纠正 VQA | ✅✅ 真实机器人 |
| RoboFAC [14] | HF | ❌ 关键帧/VQA | ❌ | ❌ | ✅ | ✅✅ | 分析 + 纠正 | sim + real |
| VisionArena [15] | HF·Chat · MS | ❌ 单图对话 | ✅✅ | 用户对话 | VLM 回答 | 回答失败 | preference | 用户环境 |
| TeleEgo [16] | HF · GitHub | ✅ 连续视频 | ✅✅ | 真人生活 | ❌ | ❌ | ❌ | ✅✅ 真实世界 |
| EgoMonth [17] | HF | ✅ 连续视频 | ✅✅ | 真人生活 | ❌ | ❌ | ❌ | ✅✅ 真实世界 |
矩阵里看不到的那个格子,就是缺口本身:
4. 核心缺口:纵向数据集
"真实用户私人数据"与"失败执行轨迹"目前是两条分离的数据线: VisionArena [15] 有真实用户但没有动作轨迹;RealMobile [6] / CUADebug [8] / ViFailback [13] 有执行与失败但与具体用户的长期生活无关; TeleEgo [16] / EgoMonth [17] 有长期个人生活但没有 agent 行动。 没有公开数据集同时包含:
更关键的是时间维度。现有数据大多在 或 处就结束了;研究"经验固化"实际需要:
并比较前后两次的成本与成功情况:
否则只能证明"模型从 failure data 学到了东西",证明不了 "模型把过去昂贵的 reasoning 变成了未来廉价的能力"—— 而后者正是 RSI 这个方向最有辨识度的命题。
4.1 从失败轨迹到 LoRA 训练样本:必须先定位 recovery point
还有一条工程要点:不要把完整长轨迹直接当 LoRA target。 一条 30 步的轨迹,前 20 步可能全是错误探索——直接 SFT 会把 失败行为一起学进去。正确做法是先用 CUADebug 式的根因定位找出关键恢复点, 再构造 before-recovery 状态到更优行为的配对:
这才是适合 consolidation 的训练样本。
4.2 如果自采,最小数据结构
第一版不需要几十万条;轨迹的纵向结构比规模重要。 让同一用户在同一台设备上连续多天执行"重复但有变化"的任务 (Day 1 的 、Day 5 的 属于同一个 latent skill),每次记录:
{
instruction,
screenshots[1..T], reasonings[1..T], actions[1..T],
environment_feedback, success,
resource_trace, # tokens / 延迟 / 能耗
failure_point, # 最早哪一步走错
recovery_point, # 从哪里改回来的
reusable_lesson # 提炼成下次直接复用的 skill
}
其中后三个字段是现有任何公开数据集都不提供的:
Task: 在 App 中把下载的 PDF 发给 Alice
Failure: agent 在文件选择器中错误进入 Pictures
Recovery: 返回后识别 Downloads,通过文件名搜索找到 PDF
Lesson: 在 Android document picker 中,若目标是下载文件,
先确认当前 storage root,而不是根据最近图片缩略图行动
并且必须采第二次:consolidation 之后,让相似任务再次出现, 否则整个闭环的收益无从度量。
5. 推荐研究路径
算法开发阶段完全没有必要从零采数据,三段式推进:
AITW / GUIOdyssey / GUI-Libra"] --> B["阶段 1b:失败定位 + lesson 提取
CUADebug / GUI-360°"] B --> C["阶段 2:可执行闭环
执行 → 验证 → 更新 → 重执行
AndroidWorld"] C --> D["阶段 3:真实性
RealMobile / 少量自采真实用户数据"] C -.偏机器人.-> E["换成 ViFailback"]
- 阶段 1a(基础能力):用 AITW / GUIOdyssey / GUI-Libra 训练 screenshot + history → reasoning + action 的基础策略;
- 阶段 1b(失败理解):用 CUADebug 人工标注的 root-error-step 训练/评测 ; 数据量不够时 GUI-360° 补足规模;
- 阶段 2(闭环):在 AndroidWorld 上跑通 "执行 → verifier → 更新 → 重新执行",度量第二次执行是否更省;
- 阶段 3(真实设备):用 RealMobile 的真机轨迹做 error analysis 与 re-scoring,再补少量自采纵向数据支撑 personal + repeated 的主张;
- 机器人方向:把第一阶段换成 ViFailback——它已经把 "视觉轨迹 → 检测失败 → 诊断原因 → 提出纠正"走通,缺的正是把 recovery 经验固化进模型这一步,与 RSI 的目标严丝合缝。
6. 收录条目
人类示范与训练语料
- AITW:715k 条 Android 真人示范
- AndroidControl:高低双层指令的人类示范
- GUIOdyssey:跨应用长轨迹与逐步语义推理标注
- GUI-Libra:把开源 VLM 训练成原生 GUI Agent 的 81K 语料
真实设备模型轨迹
失败诊断与纠正
成功判定 / Verifier
机器人操作失败
真实用户与长期个人输入
参考文献
[1] RAWLES C, LI A, RODRIGUEZ D, et al. Android in the wild: a large-scale dataset for Android device control[C]//Advances in Neural Information Processing Systems 36 (NeurIPS Datasets and Benchmarks Track). 2023. https://arxiv.org/abs/2307.10088
[2] LI W, BISHOP W, LI A, et al. On the effects of data scale on UI control agents[C]//Advances in Neural Information Processing Systems 37 (NeurIPS). 2024. https://arxiv.org/abs/2406.03679
[3] LU Q, SHAO W, LIU Z, et al. GUIOdyssey: a comprehensive dataset for cross-app GUI navigation on mobile devices[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). 2025: 22404-22414. https://arxiv.org/abs/2406.08451
[4] YANG R, WU Q H, WANG Z Y, et al. GUI-Libra: training native GUI agents to reason and act with action-aware supervision and partially verifiable RL[J/OL]. arXiv preprint arXiv:2602.22190, 2026. https://arxiv.org/abs/2602.22190
[5] LI Y, LIU Y, LU H, et al. GUI-CEval: a hierarchical and comprehensive Chinese benchmark for mobile GUI agents[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2026: 20303-20312. https://arxiv.org/abs/2603.15039
[6] SEERRAY-LAB. RealMobile: model trajectories on the RealMobile benchmark[EB/OL]. Hugging Face Datasets, 2026. https://huggingface.co/datasets/SeerRay-Lab/RealMobile
[7] CAO W X, DUAN C Z, FU P, et al. Xiaomi-GUI-0 technical report[J/OL]. arXiv preprint arXiv:2606.31410, 2026. https://arxiv.org/abs/2606.31410
[8] ZHANG W J, ZHU K L, LIU Z Y, et al. CUADebug: diagnosing and repairing computer-use agent failures[J/OL]. arXiv preprint arXiv:2608.02643, 2026. https://arxiv.org/abs/2608.02643
[9] MU J, ZHANG C Y, NI C M, et al. GUI-360°: a comprehensive dataset and benchmark for computer-using agents[J/OL]. arXiv preprint arXiv:2511.04307, 2025. https://arxiv.org/abs/2511.04307
[10] SUMYK M, KOSOVAN O. "Are We Done Yet?": a vision-based judge for autonomous task completion of computer use agents[C]//AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent). 2026. https://arxiv.org/abs/2511.20067
[11] SERVICENOW. AgentHorizon: a benchmark for evaluating LLM judges of computer-use agents[EB/OL]. Hugging Face Datasets, 2026. https://huggingface.co/datasets/ServiceNow/AgentHorizon
[12] RAWLES C, CLINCKEMAILLIE S, CHANG Y, et al. AndroidWorld: a dynamic benchmarking environment for autonomous agents[J/OL]. arXiv preprint arXiv:2405.14573, 2024. https://arxiv.org/abs/2405.14573
[13] ZENG X C, ZHOU X Y, LI Y C, et al. Diagnose, correct, and learn from manipulation failures via visual symbols[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2026: 42386-42395. https://arxiv.org/abs/2512.02787
[14] YE Z W, LU W F, YE M H, et al. RoboFAC: a comprehensive framework for robotic failure analysis and correction[J/OL]. arXiv preprint arXiv:2505.12224, 2025. https://arxiv.org/abs/2505.12224
[15] CHOU C, DUNLAP L, MASHITA K, et al. VisionArena: 230k real world user-VLM conversations with preference labels[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2025: 3877-3887. https://arxiv.org/abs/2412.08687
[16] YAN J Q, REN R L, LIU J R, et al. TeleEgo: benchmarking egocentric AI assistants in the wild[J/OL]. arXiv preprint arXiv:2510.23981, 2025. https://arxiv.org/abs/2510.23981
[17] CHEN W T, HU J X, XIE T Y, et al. EgoMonth: a month-level egocentric video benchmark for long-term spatiotemporal memory[J/OL]. arXiv preprint arXiv:2608.13113, 2026. https://arxiv.org/abs/2608.13113
© 2026 Yang Huan · yanghuan9812@qq.com