Are We Done Yet?:截图判任务完成与否的 judge

本页是 RSI 数据集版图 中"成功判定 / Verifier"一列的第一块拼图: Are We Done Yet? [1](AAAI 2026 TrustAgent Workshop)—— 训练"模型判断自己到底成功了没有"的数据。

1. 数据概况

维度 内容
规模 1,260 个人工标注任务,42 个 macOS 内置应用
来源 三个 Computer Use Agent 被实际运行,记录完整执行轨迹
标注 人工检查轨迹终态,标 done / not done
字段 screenshot、low-level actions、agent reasoning
方法 VLM 直接从截图 + 任务描述判完成度

2. 结果

  • 判定框架的任务成功检测准确率最高 73%
  • 把判定器的反馈回灌给 CUA,整体任务成功率平均相对提升 27%

3. 对 RSI 的定位

RSI 闭环里最怕的就是"模型自己说我成功了"—— 自我报告的 success 会把错误经验固化进参数。 这个数据集直接支持训练一个外部验证器:

V(task,τ)P(success) V(\text{task}, \tau) \rightarrow P(\text{success})

反馈回灌 +27% 这个数字还顺带验证了 verifier 在闭环中的价值: 验证信号本身就是训练信号。配套的对抗视角见 AgentHorizon(专测会骗人的 judge), 可执行环境里的 programmatic 验证见 AndroidWorld

参考文献

[1] SUMYK M, KOSOVAN O. "Are We Done Yet?": a vision-based judge for autonomous task completion of computer use agents[C]//AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent). 2026. https://arxiv.org/abs/2511.20067


© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""