CUADebug:Computer-Use Agent 失败的根因定位

本页是 RSI 数据集版图 中"失败诊断与纠正"一列的首选数据: CUADebug [1](2026)——如果现在就要做 "模型怎么知道自己的轨迹哪里失败了"的 prototype,先用它。

1. 数据概况

维度 内容
数据 CUAErrorBench:204 条 OSWorld 失败轨迹,人工根因标注
观测 screenshot-only observation + agent 低层鼠标/键盘动作
分类 5 大类、30 子类失败 taxonomy
字段 root error step、taxonomy label、written evidence、suggested correction
规模 数千步(单条轨迹 1–100 步),10 个应用、3 个模型
获取 CyT1ng/cua_debugger_traj [2](Apache-2.0)

2. 关键字段:不是只有 label=failure

每条失败轨迹的核心价值在于标注了最早的因果步

字段 含义
root_error_step 最早哪一步导致最终失败(1–100)
taxonomy_family / taxonomy_tag 5 大类 / 30 子类失败类型
evidence 判定依据的书面证据(引用具体步骤与截图)
correction 建议的纠正方式
confidence 标注置信度(high/mid/low)
result 最终任务得分

五大类中 Task Reasoning & Control 最大(110/204)—— 即多数失败不是"点错了地方"(grounding),而是"想错了"。 其余四类:Grounding & Interaction、Perception、Infeasible Task、 External/System(含 benchmark 自身缺陷导致的误判)。

3. 配套方法与结果

论文同时提出 CUADebugger:ReAct 式根因分析 agent,迭代选取轨迹步、 对照前后截图与动作痕迹,输出结构化诊断(因果步 + 类型 + 证据 + 纠正):

  • 根因定位:Tag+Step Exact 从 11.1% 提升到 19.4%(Gemini 2.5 Pro);
  • 依据诊断修复后重执行:单次重执行使失败恢复率从 13.89% 提到 29.86%(整体成功率 61.77% → 68.14%)。

4. 对 RSI 的定位

可直接训练失败诊断函数:

D(τ)failure point+failure type+correction D(\tau) \rightarrow \text{failure point} + \text{failure type} + \text{correction}

它止步于"诊断 + 重执行"——诊断出来的 lesson 没有被固化, 下次遇到相似任务仍要从零推理。把 DD 的输出接进 RSI 闭环 的 consolidation 阶段,正是可以往前推的一步。 需要更大规模(但无人工根因标注)时用 GUI-360°

参考文献

[1] ZHANG W J, ZHU K L, LIU Z Y, et al. CUADebug: diagnosing and repairing computer-use agent failures[J/OL]. arXiv preprint arXiv:2608.02643, 2026. https://arxiv.org/abs/2608.02643

[2] CYT1NG. cua_debugger_traj: human-annotated failed OSWorld trajectories[EB/OL]. Hugging Face Datasets, 2026. https://huggingface.co/datasets/CyT1ng/cua_debugger_traj


© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""