Xiaomi-GUI-0:真机闭环与 error-driven data flywheel

本页是 RSI 数据集版图 中"真实设备模型轨迹"一列的工业参照点: Xiaomi-GUI-0 [1](2026 技术报告)——在真实物理手机闭环里训练 原生多模态 GUI Agent,并用 error-driven data flywheel 把失败轨迹系统性转化为训练数据。

1. 为什么强调"真机"

真实手机里账户状态、permission dialog、支付认证、风控弹窗 会不断改变 agent 遇到的状态分布——离线轨迹、模拟器与标准 benchmark 都无法忠实刻画这种执行不稳定性。Xiaomi-GUI-0 的对策是 real-device-dominant hybrid 基础设施:物理设备是主执行环境, 沙箱只做辅助,使数据采集、训练、rollout、评测共享接近真实部署的 执行分布。

2. Error-driven data flywheel

核心数据机制,正好对应 RSI 关心的"失败怎么变成训练信号": 一条失败轨迹被转化为三类数据(纠正后的动作、反思解释、恢复示范), 再进入训练:

failure trajectory{corrected actionreflective rationalerecovery demonstrationtraining \text{failure trajectory} \;\rightarrow\; \begin{cases} \text{corrected action}\\ \text{reflective rationale}\\ \text{recovery demonstration} \end{cases} \;\rightarrow\; \text{training}

训练数据分三类:高频头部任务数据、长尾意图的高泛化数据、 reflection 与 memory 的能力增强数据;训练走三阶段管线: SFT → step-level RL → agentic RL。

3. 结果

基准 成功率
RealMobile(自建真机基准) 72.0%
AndroidWorld 78.9%

(AndroidWorld 见 AndroidWorld。)

4. 与 RSI 的关系:它停在哪一步

Xiaomi-GUI-0:centralized flywheelvsRSI:on-device skill update \text{Xiaomi-GUI-0} \;\; : \;\; \text{centralized flywheel} \qquad vs \qquad \text{RSI} \;\; : \;\; \text{on-device skill update}

它的飞轮把全机队的失败集中起来训练模型,更新发生在云端训练管线—— 即"集中式 flywheel";而 RSI 想要的是这台设备自己的 failure → 这台设备自己的 skill update——更新发生在设备端 (参见 Online-SDFT 的设备端微型闭环)。 它公开的 RealMobile 轨迹数据是研究前者最好的原料, 后一步"设备端固化"仍是空位。

参考文献

[1] CAO W X, DUAN C Z, FU P, et al. Xiaomi-GUI-0 technical report[J/OL]. arXiv preprint arXiv:2606.31410, 2026. https://arxiv.org/abs/2606.31410

[2] SEERRAY-LAB. RealMobile: model trajectories on the RealMobile benchmark[EB/OL]. Hugging Face Datasets, 2026. https://huggingface.co/datasets/SeerRay-Lab/RealMobile


© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""