RSI 数据集版图

本页是 RSI:递归自我进化 专题下的数据集子专题: 整理 VLM / VLA Agent 走向"从自己的执行经验中持续固化能力" (trajectory → skill → 下次更省)所需的数据底座——谁在提供人类示范、 谁在提供真实设备上的模型轨迹、谁能标出失败的位置、谁能验证成功、 以及真实用户与长期个人输入目前覆盖到哪里。 本页负责纵览与综合,每个数据集独立成页(见 §6 收录条目)。

💭 总判断(截至 2026 年 9)

"失败轨迹"已经不缺——2025–2026 年集中出现了一整批: CUADebug [8]、GUI-360° [9]、ViFailback [13]、RealMobile [6]…… 真正缺的是纵向数据:同一个能力上"第一次失败 → 固化 → 之后再次遇到 相似任务"的配对记录。现有 benchmark 回答的是 Can you recover?,还没有人系统回答 After recovering once, do you still need to recover the same way again?

1. Road Tree:数据集纵览

每张卡片带三类标准 tag:平台(手机 / 桌面 / 机器人 / 第一视角 / 对话)、 失败轨迹(含失败 / 无失败 / 全失败)、 正确校正(人工标注或程序标签的纠正信息 / 正确示范——人工、标签数据都算)。

RSI 数据集版图2023 → 2026 · 六类数据 × 代表数据集
人类示范与训练语料正确的 teacher · 截图序列 · 可直接 SFT
AITW [1]2023 · NeurIPS D&B ↗
手机·真机无失败正确示范715k episodes
30k 指令、Android 10–13、8 种设备;按新任务/新应用/新版本分块,专供鲁棒性分析
AndroidControl [2]2024 · NeurIPS ↗
手机·真机无失败正确示范高低双层指令
15,283 条示范 / 833 apps;in-domain 随数据可扩展,out-of-domain 高层任务提升明显变慢
GUIOdyssey [3]2025 · ICCV ↗
手机·模拟器无失败正确示范reasoning 标注
8,334 episodes × 平均 15.3 步、212 apps、1,357 组合;每步带语义推理标注
GUI-Libra [4]2026 · arXiv ↗
手机·截图失败已滤CoT+动作校正81K 步
已用于 VLM post-training 的 screenshot→think→act 语料;4B/8B 在 AndroidWorld 追平 GPT-4o 级
真实设备模型轨迹真机 rollout · 失败可观测
GUI-CEval [5]2026 · CVPR ↗
手机·真机含失败中文 App五维评估
201 个主流 App、4 类设备;强模型执行任务并特意保留 failure cases(4,028 agent 任务)
RealMobile [6]2026 · HuggingFace ↗
手机·真机含失败评分规则校正reasoning 记录
14 个模型在物理手机上执行真实 App,逐步记录 screenshot / XML / action / thought
Xiaomi-GUI-0 [7]2026 · arXiv ↗
手机·真机含失败反思+恢复示范error flywheel
失败轨迹 → 纠正动作 + 反思解释 + 恢复示范;RealMobile 72.0% / AndroidWorld 78.9%
失败诊断与纠正离线开发首选 · root-cause 标注
CUADebug [8]2026 · arXiv ↗
桌面全失败人工根因校正5 类 30 子类
204 条 OSWorld 失败轨迹人工标出最早出错步 + 证据 + 纠正建议;做失败定位原型先用它
GUI-360° [9]2025 · arXiv ↗
桌面·Windows含失败reasoning 标注1.2M 步
全分辨率截图 + accessibility 元数据 + 中间 reasoning;grounding / 解析 / 动作预测三任务
成功判定 / Verifier不能只信模型自己说成了
Are We Done Yet? [10]2025 · arXiv ↗
桌面·macOS含失败success 标签VLM judge
42 个 macOS 应用、1,260 个人工标注任务;截图判 done / not done,反馈回灌 +27%
AgentHorizon [11]2026 · HuggingFace ↗
桌面含失败错误类型标签对抗负样本
100–300+ 步轨迹 + 真值成败;负样本用兄弟指令错配构造,专骗只查表面一致性的 judge
AndroidWorld [12]2024 · arXiv ↗
手机·模拟器可产生失败programmatic 验证
116 个任务动态实例化,init / 成功检查 / teardown 全自动——闭环训练的标准沙盘
机器人操作失败VLA · 失败数据比 GUI 更成熟
ViFailback [13]2026 · CVPR ↗
机器人·真实4,545 失败诊断+纠正 VQA视觉符号
5,202 条真实轨迹 + 58,128 VQA;已训练 ViFailback-8B 辅助 VLA 恢复
RoboFAC [14]2025 · arXiv ↗
机器人·sim+real全失败分析+纠正 QA78,623 QA
9,440 条错误轨迹;理解→分析→纠正三段式;VLA 外挂 supervisor 相对提升 29.1%
真实用户与长期个人输入个性化信号源 · 无执行轨迹
VisionArena [15]2025 · CVPR ↗
对话回答失败preference 标签230K 对话
73K 用户、138 语言、45 VLM;真实输入分布,但只有问答对话、没有动作轨迹
TeleEgo [16]2025 · arXiv ↗
第一视角无失败QA 标注3 天连续
5 人 × 3 天 × ~14.4h;记忆 / 理解 / 跨记忆三维度 QA,典型可穿戴助理场景
EgoMonth [17]2026 · arXiv ↗
第一视角无失败QA 标注月级 300+ 小时
20 人、20–120 天连续记录;最强模型仍落后人类 22.4 个百分点

六条 lane 正好对应 RSI 闭环要拼的六块数据拼图:示范与语料告诉模型正确做法, 真实设备轨迹暴露真实失败,失败诊断把失败变成可训练信号, verifier 保证"成功"可信,机器人线证明这套范式在 VLA 上同样成立, 个人输入线提供"只有这台设备 / 这个用户才需要"的定制信号—— 但目前没有任何一条 lane 同时覆盖 Personal 与 Failed

2. 视觉形态:单步截图 / 截图序列 / 连续视频流

能直接拿来训练 VLM 本身(而不只是外部 controller)的视觉执行数据 已经很多,但要区分三种形态——它们适合训练的能力不同:

single frame/screenshot sequence/continuous video \text{single frame} \quad / \quad \text{screenshot sequence} \quad / \quad \text{continuous video}

即:单步截图 / 截图序列(事件驱动的稀疏视频)/ 连续视频流。

GUI 场景里截图序列本质上就是稀疏的事件驱动视频: 有意义的状态变化只发生在 action 之后,30 秒 30fps 的 900 帧往往 15 张截图就能覆盖——对端侧 LoRA 训练反而是优势。 下表用「持续视频」一列区分第三档。

3. 数据版图矩阵

「获取」列的来源图标: = HuggingFace 数据集, = ModelScope 数据集, = GitHub 官方仓库, / 📄 = 论文(数据未单独公开时)。

数据集 获取 持续视频 真实个人输入 人类轨迹 模型轨迹 失败轨迹 失败定位/纠正 真实物理执行
AITW [1] GitHub ❌ 截图序列 部分 ✅✅ 真机采集
AndroidControl [2] GitHub ❌ 截图序列 部分 真机采集
GUIOdyssey [3] HF · MS ❌ 截图序列 模拟器
GUI-Libra [4] HF·SFT · HF·RL ❌ 截图序列 ✅(蒸馏语料) 已滤除 CoT + 可执行动作 AndroidWorld 评测
GUI-CEval [5] 📄 CVF 论文 ❌ 截图序列 部分 部分 ✅ 真机
RealMobile [6] HF(注明不用于训练) ❌ 截图序列 ✅✅ reasoning + 评分 ✅✅ 真机
Xiaomi-GUI-0 [7] arXiv(飞轮数据未公开) ❌ 截图序列 反思 + 恢复示范 ✅ 真机(内部)
CUADebug [8] HF ❌ 截图序列 ✅✅ root-cause + 纠正 桌面
GUI-360° [9] HF · GitHub ❌ 截图序列 ✅✅ reasoning 桌面
Are We Done Yet? [10] arXiv ❌ 截图序列 success 标签 macOS
AgentHorizon [11] HF ❌ 截图序列 成败 + 错误类型 桌面
AndroidWorld [12] GitHub ❌ 截图序列 ✅(可产生) 可产生 programmatic 验证 模拟器/真机
ViFailback [13] HF ✅ 连续视频 遥操作/策略 ✅✅ 诊断 + 纠正 VQA ✅✅ 真实机器人
RoboFAC [14] HF ❌ 关键帧/VQA ✅✅ 分析 + 纠正 sim + real
VisionArena [15] HF·Chat · MS ❌ 单图对话 ✅✅ 用户对话 VLM 回答 回答失败 preference 用户环境
TeleEgo [16] HF · GitHub ✅ 连续视频 ✅✅ 真人生活 ✅✅ 真实世界
EgoMonth [17] HF ✅ 连续视频 ✅✅ 真人生活 ✅✅ 真实世界

矩阵里看不到的那个格子,就是缺口本身:

Personal+Executable+Failed+Recovered+Repeated \underline{ \text{Personal} + \text{Executable} + \text{Failed} + \text{Recovered} + \text{Repeated} }

4. 核心缺口:纵向数据集

"真实用户私人数据"与"失败执行轨迹"目前是两条分离的数据线: VisionArena [15] 有真实用户但没有动作轨迹;RealMobile [6] / CUADebug [8] / ViFailback [13] 有执行与失败但与具体用户的长期生活无关; TeleEgo [16] / EgoMonth [17] 有长期个人生活但没有 agent 行动。 没有公开数据集同时包含:

++VLM/VLA ++ \text{同一真实用户} + \text{长期私人多模态输入} + \text{VLM/VLA 执行轨迹} + \text{失败} \rightarrow \text{反思} \rightarrow \text{成功} + \text{之后再次遇到相似任务}

更关键的是时间维度。现有数据大多在 τfail\tau_{\text{fail}}τsuccess\tau_{\text{success}} 处就结束了;研究"经验固化"实际需要:

τtconsolidationτt+1similar task \tau_t \;\rightarrow\; \text{consolidation} \;\rightarrow\; \tau_{t+1}^{\text{similar task}}

并比较前后两次的成本与成功情况:

Successt+1,Tokenst+1,Actionst+1,Energyt+1 \text{Success}_{t+1} \uparrow, \qquad \text{Tokens}_{t+1} \downarrow, \qquad \text{Actions}_{t+1} \downarrow, \qquad \text{Energy}_{t+1} \downarrow

否则只能证明"模型从 failure data 学到了东西",证明不了 "模型把过去昂贵的 reasoning 变成了未来廉价的能力"—— 而后者正是 RSI 这个方向最有辨识度的命题。

4.1 从失败轨迹到 LoRA 训练样本:必须先定位 recovery point

还有一条工程要点:不要把完整长轨迹直接当 LoRA target。 一条 30 步的轨迹,前 20 步可能全是错误探索——直接 SFT 会把 失败行为一起学进去。正确做法是先用 CUADebug 式的根因定位找出关键恢复点, 再构造 before-recovery 状态到更优行为的配对:

(Ik,q,h<k)(rshort,a) (I_k, q, h_{<k}) \rightarrow (r^{*}_{\text{short}}, a^{*})

这才是适合 consolidation 的训练样本。

4.2 如果自采,最小数据结构

第一版不需要几十万条;轨迹的纵向结构比规模重要。 让同一用户在同一台设备上连续多天执行"重复但有变化"的任务 (Day 1 的 task1a\text{task}_{1a}、Day 5 的 task1b\text{task}_{1b} 属于同一个 latent skill),每次记录:

{
  instruction,
  screenshots[1..T], reasonings[1..T], actions[1..T],
  environment_feedback, success,
  resource_trace,               # tokens / 延迟 / 能耗
  failure_point,                # 最早哪一步走错
  recovery_point,               # 从哪里改回来的
  reusable_lesson               # 提炼成下次直接复用的 skill
}

其中后三个字段是现有任何公开数据集都不提供的:

Task:      在 App 中把下载的 PDF 发给 Alice
Failure:   agent 在文件选择器中错误进入 Pictures
Recovery:  返回后识别 Downloads,通过文件名搜索找到 PDF
Lesson:    在 Android document picker 中,若目标是下载文件,
           先确认当前 storage root,而不是根据最近图片缩略图行动

并且必须采第二次:consolidation 之后,让相似任务再次出现, 否则整个闭环的收益无从度量。

5. 推荐研究路径

算法开发阶段完全没有必要从零采数据,三段式推进:

flowchart LR A["阶段 1a:基础能力

AITW / GUIOdyssey / GUI-Libra"] --> B["阶段 1b:失败定位 + lesson 提取

CUADebug / GUI-360°"] B --> C["阶段 2:可执行闭环

执行 → 验证 → 更新 → 重执行

AndroidWorld"] C --> D["阶段 3:真实性

RealMobile / 少量自采真实用户数据"] C -.偏机器人.-> E["换成 ViFailback"]
  • 阶段 1a(基础能力):用 AITW / GUIOdyssey / GUI-Libra 训练 screenshot + history → reasoning + action 的基础策略;
  • 阶段 1b(失败理解):用 CUADebug 人工标注的 root-error-step 训练/评测 D(τ)failure point+type+correctionD(\tau) \rightarrow \text{failure point} + \text{type} + \text{correction}; 数据量不够时 GUI-360° 补足规模;
  • 阶段 2(闭环):在 AndroidWorld 上跑通 "执行 → verifier → 更新 → 重新执行",度量第二次执行是否更省;
  • 阶段 3(真实设备):用 RealMobile 的真机轨迹做 error analysis 与 re-scoring,再补少量自采纵向数据支撑 personal + repeated 的主张;
  • 机器人方向:把第一阶段换成 ViFailback——它已经把 "视觉轨迹 → 检测失败 → 诊断原因 → 提出纠正"走通,缺的正是把 recovery 经验固化进模型这一步,与 RSI 的目标严丝合缝。

6. 收录条目

人类示范与训练语料

真实设备模型轨迹

失败诊断与纠正

成功判定 / Verifier

机器人操作失败

真实用户与长期个人输入

参考文献

[1] RAWLES C, LI A, RODRIGUEZ D, et al. Android in the wild: a large-scale dataset for Android device control[C]//Advances in Neural Information Processing Systems 36 (NeurIPS Datasets and Benchmarks Track). 2023. https://arxiv.org/abs/2307.10088

[2] LI W, BISHOP W, LI A, et al. On the effects of data scale on UI control agents[C]//Advances in Neural Information Processing Systems 37 (NeurIPS). 2024. https://arxiv.org/abs/2406.03679

[3] LU Q, SHAO W, LIU Z, et al. GUIOdyssey: a comprehensive dataset for cross-app GUI navigation on mobile devices[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). 2025: 22404-22414. https://arxiv.org/abs/2406.08451

[4] YANG R, WU Q H, WANG Z Y, et al. GUI-Libra: training native GUI agents to reason and act with action-aware supervision and partially verifiable RL[J/OL]. arXiv preprint arXiv:2602.22190, 2026. https://arxiv.org/abs/2602.22190

[5] LI Y, LIU Y, LU H, et al. GUI-CEval: a hierarchical and comprehensive Chinese benchmark for mobile GUI agents[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2026: 20303-20312. https://arxiv.org/abs/2603.15039

[6] SEERRAY-LAB. RealMobile: model trajectories on the RealMobile benchmark[EB/OL]. Hugging Face Datasets, 2026. https://huggingface.co/datasets/SeerRay-Lab/RealMobile

[7] CAO W X, DUAN C Z, FU P, et al. Xiaomi-GUI-0 technical report[J/OL]. arXiv preprint arXiv:2606.31410, 2026. https://arxiv.org/abs/2606.31410

[8] ZHANG W J, ZHU K L, LIU Z Y, et al. CUADebug: diagnosing and repairing computer-use agent failures[J/OL]. arXiv preprint arXiv:2608.02643, 2026. https://arxiv.org/abs/2608.02643

[9] MU J, ZHANG C Y, NI C M, et al. GUI-360°: a comprehensive dataset and benchmark for computer-using agents[J/OL]. arXiv preprint arXiv:2511.04307, 2025. https://arxiv.org/abs/2511.04307

[10] SUMYK M, KOSOVAN O. "Are We Done Yet?": a vision-based judge for autonomous task completion of computer use agents[C]//AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent). 2026. https://arxiv.org/abs/2511.20067

[11] SERVICENOW. AgentHorizon: a benchmark for evaluating LLM judges of computer-use agents[EB/OL]. Hugging Face Datasets, 2026. https://huggingface.co/datasets/ServiceNow/AgentHorizon

[12] RAWLES C, CLINCKEMAILLIE S, CHANG Y, et al. AndroidWorld: a dynamic benchmarking environment for autonomous agents[J/OL]. arXiv preprint arXiv:2405.14573, 2024. https://arxiv.org/abs/2405.14573

[13] ZENG X C, ZHOU X Y, LI Y C, et al. Diagnose, correct, and learn from manipulation failures via visual symbols[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2026: 42386-42395. https://arxiv.org/abs/2512.02787

[14] YE Z W, LU W F, YE M H, et al. RoboFAC: a comprehensive framework for robotic failure analysis and correction[J/OL]. arXiv preprint arXiv:2505.12224, 2025. https://arxiv.org/abs/2505.12224

[15] CHOU C, DUNLAP L, MASHITA K, et al. VisionArena: 230k real world user-VLM conversations with preference labels[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2025: 3877-3887. https://arxiv.org/abs/2412.08687

[16] YAN J Q, REN R L, LIU J R, et al. TeleEgo: benchmarking egocentric AI assistants in the wild[J/OL]. arXiv preprint arXiv:2510.23981, 2025. https://arxiv.org/abs/2510.23981

[17] CHEN W T, HU J X, XIE T Y, et al. EgoMonth: a month-level egocentric video benchmark for long-term spatiotemporal memory[J/OL]. arXiv preprint arXiv:2608.13113, 2026. https://arxiv.org/abs/2608.13113


© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""