GUI-360°:百万步桌面 CUA 轨迹(成功与失败都有)
本页是 RSI 数据集版图 中"失败诊断与纠正"一列的规模担当: GUI-360° [1](Microsoft,2025)——120 万+ 执行动作步的 Windows 办公应用 CUA 数据集与基准,成功与失败轨迹都包含。
1. 数据概况
| 维度 | 内容 |
|---|---|
| 规模 | 1.2M+ executed action steps,数千条轨迹 |
| 环境 | Windows 办公应用(desktop),LLM 增强的自动化管线采集 |
| 每步 | 全分辨率截图 + accessibility 元数据(可得时)+ 实例化目标 + 中间 reasoning |
| 轨迹 | 成功与失败轨迹并存 |
| 任务 | 三大任务:GUI grounding / screen parsing / action prediction |
| 动作空间 | GUI 动作 + API 调用的混合空间(贴近现代 agent 设计) |
| 获取 | 论文页(arXiv:2511.04307),数据集已完全公开 |
采集管线:query sourcing → 环境模板构建 → 任务实例化 → 批量执行 → LLM 质量过滤,全程高度自动化——这也是它能到百万步量级的原因。
2. 基准发现
对 SOTA VLM 的基准测试显示:
- 开箱即用的模型在 grounding 与 action prediction 上有明显短板;
- supervised fine-tuning 与 reinforcement learning 都能显著涨点, 但仍到不了人类级可靠性——剩余差距就是"执行经验"的价值空间。
3. 对 RSI 的定位
虽然平台是 Windows 桌面而非手机,它是第一阶段验证
最省事的数据——不必先自采大量失败。 每步带中间 reasoning,失败的轨迹可以直接喂给 lesson 提取器(对照 CUADebug 的人工根因标注)。
参考文献
[1] MU J, ZHANG C Y, NI C M, et al. GUI-360°: a comprehensive dataset and benchmark for computer-using agents[J/OL]. arXiv preprint arXiv:2511.04307, 2025. https://arxiv.org/abs/2511.04307
© 2026 Yang Huan · yanghuan9812@qq.com