GUIOdyssey:跨应用长轨迹与逐步语义推理标注
本页是 RSI 数据集版图 中"人类示范轨迹"一列的第三个节点: GUIOdyssey [1](ICCV 2025)——专注跨应用(cross-app)长 horizon 导航的数据集,8,334 条 episode、平均 15.3 步, 每一步都带语义推理标注。
1. 数据概况
| 维度 | 内容 |
|---|---|
| 规模 | 8,334 episodes,平均每条 15.3 步 |
| 应用 | 212 个 apps,1,357 种 app 组合 |
| 任务 | 跨应用长 horizon:App A → App B → App C 式的工作流 |
| 设备 | 6 种移动设备(Android 模拟器采集的人类示范) |
| 标注 | 每步附 semantic reasoning annotation |
| 获取 | jiahuigeng/GUI-Odyssey |
2. 数据结构:天然带 reasoning 的轨迹
每一步的标注形如"在当前界面下,为了完成子目标,下一步为什么这么点", 即数据结构近似:
这正是长轨迹推理训练需要的形态:模型不光学"点了哪里", 还学"为什么此时点这里"。配套的 OdysseyAgent 用 history resampler 高效压缩历史截图 token,在性能与推理速度间取平衡。
3. 对 RSI 闭环的定位
适合:
- 训练 trajectory encoder / skill distiller 的输入分布—— 跨应用长工作流正是最容易反复出现的用户 routine;
- 教模型在长 horizon 中维护子目标状态(它每步都标了推理)。
不适合:
- 数据来自模拟器上的人类示范,不是模型自己的失败执行;
- 回答不了"failure turning point 在哪里"—— 那需要 CUADebug 的 root-error-step 标注 或 RealMobile 的真机模型轨迹。
同类语料的工业级版本见 GUI-Libra: 它把这类"逐步带推理"的数据直接做成了 VLM post-training 语料。
参考文献
[1] LU Q, SHAO W, LIU Z, et al. GUIOdyssey: a comprehensive dataset for cross-app GUI navigation on mobile devices[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). 2025: 22404-22414. https://arxiv.org/abs/2406.08451
© 2026 Yang Huan · yanghuan9812@qq.com