AndroidWorld:可编程验证的 Android 闭环环境
本页是 RSI 数据集版图 中"成功判定 / Verifier"一列的执行底座: AndroidWorld [1](Google,2024)——116 个可编程验证任务的 Android 动态基准环境,是跑 RSI 闭环的标准沙盘。
1. 数据概况
| 维度 | 内容 |
|---|---|
| 任务 | 116 个 programmatic tasks,跨 20 个真实 Android 应用 |
| 动态性 | 任务参数化、以自然语言无限实例化(非静态测试集) |
| 验证 | 每个任务带专属 initialization / success-checking / teardown 逻辑,直接读写系统状态 |
| 基线 | 论文最优 agent 当时 30.6%;后续 Xiaomi-GUI-0 [2] 达 78.9% |
| 获取 | google-research/android_world |
2. 为什么 RSI 闭环需要它
闭环的每一环都依赖可编程验证:
执行 → V(s_T) ∈ {0,1} 验证 → 生成训练信号 → 更新 → 重新执行
- 成功检查写进代码:不靠模型自评,杜绝"自己说自己成功了" (对照 Are We Done Yet?、AgentHorizon);
- teardown 保证可重复:每轮实验从干净状态出发, 纵向对比"第 1 次执行 vs 固化后的第 2 次执行"才有意义;
- 任务动态实例化:同一 latent skill 可以生成 、 、——正是研究 "经验固化是否让相似任务变便宜"需要的配对结构。
3. 鲁棒性警示
论文的鲁棒性分析显示:任务表述的微小变化会显著影响 agent 表现—— 不控制这类变量,agent 性能数字可能严重失真。 做闭环实验时要把"任务表述扰动"当成一级实验变量。
参考文献
[1] RAWLES C, CLINCKEMAILLIE S, CHANG Y, et al. AndroidWorld: a dynamic benchmarking environment for autonomous agents[J/OL]. arXiv preprint arXiv:2405.14573, 2024. https://arxiv.org/abs/2405.14573
[2] CAO W X, DUAN C Z, FU P, et al. Xiaomi-GUI-0 technical report[J/OL]. arXiv preprint arXiv:2606.31410, 2026. https://arxiv.org/abs/2606.31410
© 2026 Yang Huan · yanghuan9812@qq.com