GUI-CEval:中文真机 GUI 基准,特意保留失败案例

本页是 RSI 数据集版图 中"真实设备模型轨迹"一列的第一个节点: GUI-CEval [1](CVPR 2026)——首个构建在物理设备上的 中文移动 GUI Agent 综合基准,覆盖 201 个主流 App, 并特意保留强模型的失败案例以反映真实错误分布。

1. 数据概况

维度 内容
规模 4,028 个 GUI-agent 应用任务 + 4,194 个多模态 QA
环境 物理真机(非模拟器),201 个中文主流 App,4 类设备
结构 两层:原子能力(atomic)+ 应用级综合任务(application-level)
维度 五维:感知 perception / 规划 planning / 反思 reflection / 执行 execution / 评估 evaluation
采集 多阶段人工采集与校验;轨迹记录 screenshot + UI XML + touch 动作
获取 论文开放获取(CVPR 2026

2. 失败轨迹的来源

GUI-CEval 的 agent 任务轨迹由强模型在真机上执行预定义任务产生 (如 UI-TARS、Qwen2.5-VL),且作者特意保留 failure cases, 使基准能反映真实的错误分布而非幸存者偏差—— 这让它同时具备"评测基准"与"失败轨迹语料"双重身份。

3. 评测发现:反思与自我评估是普遍短板

对 20 个代表性 MLLM 与多智能体系统的评测显示:

  • 感知与 grounding 相对不差(单步原子能力可以做到 80% 上下);
  • 反思式决策(reflection)与动作后自我评估(post-action self-evaluation)是普遍短板,导致真实交互可靠性受限;
  • 真机在线执行的成功率远低于静态指标——最好的模型在线任务 成功率也只有约三分之一。
💡 与 RSI 的关系

"反思与动作后自我评估"恰恰是 RSI 闭环 要训练的核心能力: 失败 诊断 与成功 验证 都依赖它。GUI-CEval 把这个短板定量钉死了——这本身就是 RSI 方向 最直接的问题动机。

中文 App 生态(超级 App、复杂弹窗、强运营界面)也让它的状态分布 比英文基准更接近国内真实部署。

参考文献

[1] LI Y, LIU Y, LU H, et al. GUI-CEval: a hierarchical and comprehensive Chinese benchmark for mobile GUI agents[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 2026: 20303-20312. https://arxiv.org/abs/2603.15039


© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""