AITW:715k 条 Android 真人操作示范
本页是 RSI 数据集版图 中"人类示范轨迹"一列的起点: Android in the Wild(AITW) [1](Google,NeurIPS 2023 Datasets and Benchmarks Track)是目前规模最大的 Android 设备控制数据集—— 715k 条人类示范 episode、30k 条唯一指令。
1. 数据概况
| 维度 | 内容 |
|---|---|
| 规模 | 715k episodes,30k unique instructions |
| 设备 | 真实 Android 真机:8 种 Pixel(Pixel 2 XL → Pixel 6),屏幕分辨率不一 |
| 系统 | Android 10–13 共四个版本 |
| 动作 | 人类实际执行的 touch / swipe / type 等精确手势(含轮播组件的横向滑动) |
| 轨迹 | instruction + screenshot + human action,逐步成对记录 |
| 获取 | google-research/android_in_the_wild |
每条 episode 就是完整的一步一步操作流:
instruction → screenshot_1 → human action_1 → … → screenshot_T → human action_T
数据集特意按新任务描述 / 新应用 / 新系统版本分块组织, 用于系统性分析 device-control 系统的鲁棒性——模型在没见过的 instruction 写法、没见过的 App、没见过的 OS 版本上表现如何。
2. 它适合做什么
- 正确行为的 teacher:人类示范即"这个任务怎么做对", 适合作为 imitation target、skill 蒸馏源或 reward shaping 参考;
- 鲁棒性分析:现成的泛化分块,可直接复用为评测协议;
- 动作空间设计参考:不是简单的 UI 元素点击,而是视觉外观驱动的 精确手势——更贴近真实部署。
3. 它不能提供什么(对 RSI 闭环)
⚠️ 基本是 human demonstration,不是 model failure trajectory
你看不到"模型先按错 → 想了很久 → 自己恢复 → 最终成功"的过程: 没有失败点标注、没有恢复轨迹、更没有同一用户跨天的重复任务。 它回答"该怎么做",回答不了"哪里会错、错了怎么改、 改完之后下次是否不再错"。
- 失败轨迹与 root-cause 标注 → CUADebug、GUI-360°;
- 真实设备上的模型执行轨迹 → RealMobile;
- 后续数据规模实验见 AndroidControl。
参考文献
[1] RAWLES C, LI A, RODRIGUEZ D, et al. Android in the wild: a large-scale dataset for Android device control[C]//Advances in Neural Information Processing Systems 36 (NeurIPS Datasets and Benchmarks Track). 2023. https://arxiv.org/abs/2307.10088
© 2026 Yang Huan · yanghuan9812@qq.com