AndroidWorld:可编程验证的 Android 闭环环境

本页是 RSI 数据集版图 中"成功判定 / Verifier"一列的执行底座: AndroidWorld [1](Google,2024)——116 个可编程验证任务的 Android 动态基准环境,是跑 RSI 闭环的标准沙盘。

1. 数据概况

维度 内容
任务 116 个 programmatic tasks,跨 20 个真实 Android 应用
动态性 任务参数化、以自然语言无限实例化(非静态测试集)
验证 每个任务带专属 initialization / success-checking / teardown 逻辑,直接读写系统状态
基线 论文最优 agent 当时 30.6%;后续 Xiaomi-GUI-0 [2] 达 78.9%
获取 google-research/android_world

2. 为什么 RSI 闭环需要它

闭环的每一环都依赖可编程验证:

执行 → V(s_T) ∈ {0,1} 验证 → 生成训练信号 → 更新 → 重新执行
  • 成功检查写进代码:不靠模型自评,杜绝"自己说自己成功了" (对照 Are We Done Yet?AgentHorizon);
  • teardown 保证可重复:每轮实验从干净状态出发, 纵向对比"第 1 次执行 vs 固化后的第 2 次执行"才有意义;
  • 任务动态实例化:同一 latent skill 可以生成 task1a\text{task}_{1a}task1b\text{task}_{1b}task1c\text{task}_{1c}——正是研究 "经验固化是否让相似任务变便宜"需要的配对结构。

3. 鲁棒性警示

论文的鲁棒性分析显示:任务表述的微小变化会显著影响 agent 表现—— 不控制这类变量,agent 性能数字可能严重失真。 做闭环实验时要把"任务表述扰动"当成一级实验变量。

参考文献

[1] RAWLES C, CLINCKEMAILLIE S, CHANG Y, et al. AndroidWorld: a dynamic benchmarking environment for autonomous agents[J/OL]. arXiv preprint arXiv:2405.14573, 2024. https://arxiv.org/abs/2405.14573

[2] CAO W X, DUAN C Z, FU P, et al. Xiaomi-GUI-0 technical report[J/OL]. arXiv preprint arXiv:2606.31410, 2026. https://arxiv.org/abs/2606.31410


© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""