RealMobile:物理手机上的模型执行轨迹

本页是 RSI 数据集版图 中"真实设备模型轨迹"一列的核心数据: RealMobile [1](SeerRay-Lab,Hugging Face,CC-BY-4.0)—— 14 个模型在物理 Android 手机上执行真实中文 App 任务的逐步执行轨迹, 是 Xiaomi-GUI-0 [2] 技术报告的配套公开数据。

1. 数据概况

维度 内容
内容 每条轨迹 = 一个模型在物理手机上尝试一个真实 App 任务
应用 Bilibili、抖音、小红书、微博、淘宝、QQ音乐、携程、高德、盒马等真实应用
设备 物理真机(如 Redmi 12 5G,Android 13,1080×2460)
模型 claude-opus-4-x、gemini-3.1-pro/flash、seed-2.0/1.8、GUI-Owl-1.5、UI-TARS-1.5、UI-Venus-1.5、mai-ui、step-gui 等 14 个
体量 90.7 GB(含全分辨率截图)
许可 CC-BY-4.0
获取 SeerRay-Lab/RealMobile

2. 轨迹格式:四件套逐步成对

每条轨迹一个文件夹,逐步记录 screenshot / UI 层级 / 动作 / 推理:

<model>/<episode_id>/
├── task.json          # 任务元数据 + 每步完整记录
├── 1.png / 1.jpg      # 第 1 步截图(全分辨率 PNG + 压缩 JPG)
├── 1.xml              # 第 1 步 Android UI 层级(uiautomator dump)
├── 1.json             # 第 1 步动作元数据
└── 2.png / 2.jpg / 2.xml / 2.json …

task.json 中每步的核心字段:

step           步序
action         实际执行的动作
thought        模型推理([Observation] … [Plan] … [Decision] …)
screenshot     该步截图
xml            该步 UI 层级树
exec_success   动作是否执行成功
infer_time     推理耗时

即:

screenshot+UI XML+action+model reasoning \underline{\text{screenshot} + \text{UI XML} + \text{action} + \text{model reasoning}}

四件套齐备,且带 exec_successinfer_time 两个字段—— 后者对"经验固化是否降低单步成本"这类 RSI 度量直接有用。

3. 评分方式

按任务细分子目标(sub-goal)给部分得分,评分规则基于 UI 层级 XML 上的 XPath 与代码规则,逐任务一个规则文件, 评分脚本与任务 rubric 见 benchmark 仓库

4. 定位与限制

⚠️ 官方定位是 qualitative inspection / error analysis / reproducible

re-scoring,不是训练集

  • 公开的是执行轨迹,不含 Xiaomi-GUI-0 内部训练飞-wheel 的 纠正动作、反思解释与恢复示范(那些数据未公开);
  • 没有同一用户的跨天重复任务——纵向维度仍需自采。

因此它的角色是:sim/emulator 结论 → 真实设备结论的桥梁, 以及真机 error analysis 的原料库。失败根因的结构化标注 仍要用 CUADebug

参考文献

[1] SEERRAY-LAB. RealMobile: model trajectories on the RealMobile benchmark[EB/OL]. Hugging Face Datasets, 2026. https://huggingface.co/datasets/SeerRay-Lab/RealMobile

[2] CAO W X, DUAN C Z, FU P, et al. Xiaomi-GUI-0 technical report[J/OL]. arXiv preprint arXiv:2606.31410, 2026. https://arxiv.org/abs/2606.31410


© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""