CUADebug:Computer-Use Agent 失败的根因定位
本页是 RSI 数据集版图 中"失败诊断与纠正"一列的首选数据: CUADebug [1](2026)——如果现在就要做 "模型怎么知道自己的轨迹哪里失败了"的 prototype,先用它。
1. 数据概况
| 维度 | 内容 |
|---|---|
| 数据 | CUAErrorBench:204 条 OSWorld 失败轨迹,人工根因标注 |
| 观测 | screenshot-only observation + agent 低层鼠标/键盘动作 |
| 分类 | 5 大类、30 子类失败 taxonomy |
| 字段 | root error step、taxonomy label、written evidence、suggested correction |
| 规模 | 数千步(单条轨迹 1–100 步),10 个应用、3 个模型 |
| 获取 | CyT1ng/cua_debugger_traj [2](Apache-2.0) |
2. 关键字段:不是只有 label=failure
每条失败轨迹的核心价值在于标注了最早的因果步:
| 字段 | 含义 |
|---|---|
root_error_step |
最早哪一步导致最终失败(1–100) |
taxonomy_family / taxonomy_tag |
5 大类 / 30 子类失败类型 |
evidence |
判定依据的书面证据(引用具体步骤与截图) |
correction |
建议的纠正方式 |
confidence |
标注置信度(high/mid/low) |
result |
最终任务得分 |
五大类中 Task Reasoning & Control 最大(110/204)—— 即多数失败不是"点错了地方"(grounding),而是"想错了"。 其余四类:Grounding & Interaction、Perception、Infeasible Task、 External/System(含 benchmark 自身缺陷导致的误判)。
3. 配套方法与结果
论文同时提出 CUADebugger:ReAct 式根因分析 agent,迭代选取轨迹步、 对照前后截图与动作痕迹,输出结构化诊断(因果步 + 类型 + 证据 + 纠正):
- 根因定位:Tag+Step Exact 从 11.1% 提升到 19.4%(Gemini 2.5 Pro);
- 依据诊断修复后重执行:单次重执行使失败恢复率从 13.89% 提到 29.86%(整体成功率 61.77% → 68.14%)。
4. 对 RSI 的定位
可直接训练失败诊断函数:
它止步于"诊断 + 重执行"——诊断出来的 lesson 没有被固化, 下次遇到相似任务仍要从零推理。把 的输出接进 RSI 闭环 的 consolidation 阶段,正是可以往前推的一步。 需要更大规模(但无人工根因标注)时用 GUI-360°。
参考文献
[1] ZHANG W J, ZHU K L, LIU Z Y, et al. CUADebug: diagnosing and repairing computer-use agent failures[J/OL]. arXiv preprint arXiv:2608.02643, 2026. https://arxiv.org/abs/2608.02643
[2] CYT1NG. cua_debugger_traj: human-annotated failed OSWorld trajectories[EB/OL]. Hugging Face Datasets, 2026. https://huggingface.co/datasets/CyT1ng/cua_debugger_traj
© 2026 Yang Huan · yanghuan9812@qq.com