AndroidControl:高低双层指令的 15k 人类示范
本页是 RSI 数据集版图 中"人类示范轨迹"一列的第二个节点: AndroidControl [1](Google,NeurIPS 2024,论文题为 On the Effects of Data Scale on UI Control Agents)—— 15,283 条 Android 真人示范,每条任务同时带 high-level 与 low-level 两层人类撰写的指令,是研究"数据规模 × 任务复杂度"最系统的数据集。
1. 数据概况
| 维度 | 内容 |
|---|---|
| 规模 | 15,283 条人类示范 demonstrations |
| 任务 | 14,548 个 unique tasks(几乎一任务一示范) |
| 应用 | 833 个 Android apps——迄今多样性最高的计算机控制数据集 |
| 指令 | 双层:high-level(任务意图)+ low-level(单步动作描述) |
| 轨迹 | 真机人类示范,格式与 AITW 同族 |
| 获取 | google-research/android_control |
2. 核心实验结论:离线示范 ≠ 部署鲁棒
论文用这份数据系统回答"继续收数据到底能不能解决问题":
- in-domain:随示范数量增多,微调后的模型性能稳定提升, 零样本/少样本基线被明显甩开——看起来"堆数据"可行;
- out-of-domain:性能随数据规模增长显著变慢, 尤其 high-level 任务——仅靠更多离线示范,很可能永远到不了 可靠的 out-of-domain 表现。
offline demonstrations ⊬ deployment robustness。 无论离线示范堆多大,真实部署后仍会持续产生新的失败经验—— 这些"部署后的失败"必须由模型自己在使用中消化, 这正是 RSI 闭环 存在的理由, 也是本专题数据版图的核心出发点。
双层指令还有独立的训练价值:high-level 指令考察任务级规划, low-level 指令考察单步 grounding,同一轨迹可同时监督两种能力。
3. 局限
与 AITW 同样的问题:全部是人类示范—— 没有模型失败轨迹、没有失败点标注、没有恢复过程、没有纵向重复。 适合当 teacher 数据,不适合当 failure diagnosis 数据。
参考文献
[1] LI W, BISHOP W, LI A, et al. On the effects of data scale on UI control agents[C]//Advances in Neural Information Processing Systems 37 (NeurIPS). 2024. https://arxiv.org/abs/2406.03679
[2] RAWLES C, LI A, RODRIGUEZ D, et al. Android in the wild: a large-scale dataset for Android device control[C]//Advances in Neural Information Processing Systems 36 (NeurIPS Datasets and Benchmarks Track). 2023. https://arxiv.org/abs/2307.10088
© 2026 Yang Huan · yanghuan9812@qq.com