GUI-CEval:中文真机 GUI 基准,特意保留失败案例
本页是 RSI 数据集版图 中"真实设备模型轨迹"一列的第一个节点: GUI-CEval [1](CVPR 2026)——首个构建在物理设备上的 中文移动 GUI Agent 综合基准,覆盖 201 个主流 App, 并特意保留强模型的失败案例以反映真实错误分布。
1. 数据概况
| 维度 | 内容 |
|---|---|
| 规模 | 4,028 个 GUI-agent 应用任务 + 4,194 个多模态 QA |
| 环境 | 物理真机(非模拟器),201 个中文主流 App,4 类设备 |
| 结构 | 两层:原子能力(atomic)+ 应用级综合任务(application-level) |
| 维度 | 五维:感知 perception / 规划 planning / 反思 reflection / 执行 execution / 评估 evaluation |
| 采集 | 多阶段人工采集与校验;轨迹记录 screenshot + UI XML + touch 动作 |
| 获取 | 论文开放获取(CVPR 2026) |
2. 失败轨迹的来源
GUI-CEval 的 agent 任务轨迹由强模型在真机上执行预定义任务产生 (如 UI-TARS、Qwen2.5-VL),且作者特意保留 failure cases, 使基准能反映真实的错误分布而非幸存者偏差—— 这让它同时具备"评测基准"与"失败轨迹语料"双重身份。
3. 评测发现:反思与自我评估是普遍短板
对 20 个代表性 MLLM 与多智能体系统的评测显示:
- 感知与 grounding 相对不差(单步原子能力可以做到 80% 上下);
- 反思式决策(reflection)与动作后自我评估(post-action self-evaluation)是普遍短板,导致真实交互可靠性受限;
- 真机在线执行的成功率远低于静态指标——最好的模型在线任务 成功率也只有约三分之一。
💡 与 RSI 的关系
"反思与动作后自我评估"恰恰是 RSI 闭环 要训练的核心能力: 失败 诊断 与成功 验证 都依赖它。GUI-CEval 把这个短板定量钉死了——这本身就是 RSI 方向 最直接的问题动机。
中文 App 生态(超级 App、复杂弹窗、强运营界面)也让它的状态分布 比英文基准更接近国内真实部署。
参考文献
[1] LI Y, LIU Y, LU H, et al. GUI-CEval: a hierarchical and comprehensive Chinese benchmark for mobile GUI agents[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2026: 20303-20312. https://arxiv.org/abs/2603.15039
© 2026 Yang Huan · yanghuan9812@qq.com