Are We Done Yet?:截图判任务完成与否的 judge
本页是 RSI 数据集版图 中"成功判定 / Verifier"一列的第一块拼图: Are We Done Yet? [1](AAAI 2026 TrustAgent Workshop)—— 训练"模型判断自己到底成功了没有"的数据。
1. 数据概况
| 维度 | 内容 |
|---|---|
| 规模 | 1,260 个人工标注任务,42 个 macOS 内置应用 |
| 来源 | 三个 Computer Use Agent 被实际运行,记录完整执行轨迹 |
| 标注 | 人工检查轨迹终态,标 done / not done |
| 字段 | screenshot、low-level actions、agent reasoning |
| 方法 | VLM 直接从截图 + 任务描述判完成度 |
2. 结果
- 判定框架的任务成功检测准确率最高 73%;
- 把判定器的反馈回灌给 CUA,整体任务成功率平均相对提升 27%。
3. 对 RSI 的定位
RSI 闭环里最怕的就是"模型自己说我成功了"—— 自我报告的 success 会把错误经验固化进参数。 这个数据集直接支持训练一个外部验证器:
反馈回灌 +27% 这个数字还顺带验证了 verifier 在闭环中的价值: 验证信号本身就是训练信号。配套的对抗视角见 AgentHorizon(专测会骗人的 judge), 可执行环境里的 programmatic 验证见 AndroidWorld。
参考文献
[1] SUMYK M, KOSOVAN O. "Are We Done Yet?": a vision-based judge for autonomous task completion of computer use agents[C]//AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent). 2026. https://arxiv.org/abs/2511.20067
© 2026 Yang Huan · yanghuan9812@qq.com