AgentHorizon:长轨迹成败判定的对抗基准
本页是 RSI 数据集版图 中"成功判定 / Verifier"一列的对抗担当: AgentHorizon [1](ServiceNow,Hugging Face)——评测 "LLM judge 能否读完一条长执行轨迹、判断任务真的完成了吗"的基准。
1. 数据概况
| 维度 | 内容 |
|---|---|
| 形态 | 每条样本 = 一条 GUI agent 长轨迹 + 真值成败标签 |
| 轨迹长度 | 常见 100–300+ 步 |
| 难度分两档 | 主 split 605 条(287 正 / 318 负);Simple split 768 条(236 正 / 532 负) |
| 体量 | 43 GB(markdown + 结构化 JSON + 截图 + judge prompt 框架) |
| 获取 | ServiceNow/AgentHorizon |
即:
2. 负样本是对抗性构造的
普通 judge 基准的负样本"轨迹里总有点明显错误";AgentHorizon 的 负样本专门针对只查表面一致性的 judge:
- 任务成对出现(parent / child,指令只差一个细节);
- 负样本 = 把兄弟任务的轨迹配给当前任务的指令—— 轨迹本身是流畅、成功的执行,只是执行的是另一条指令;
- 失败藏在"指令 ↔ 轨迹"的对齐关系里,而非任何可见的执行错误。
配三种失败类型标签:Critical Mistake(核心目标未达成,不可逆)、 Bad Side Effect(目标达成但留下必须善后的副作用)、 Misunderstanding of the Instructions(动作合理但读错细节)。
3. 对 RSI 的定位
RSI 闭环的成功信号必须经得起这类对抗:一个把"看起来做完了" 当成"做完了"的 verifier,会把错误经验固化进参数。 这个数据集适合研究:
VLM 能否检查自己的长执行历史、并判断是否真的成功?
配套:图像判完成度的 Are We Done Yet?、 programmatic 验证的 AndroidWorld。
参考文献
[1] SERVICENOW. AgentHorizon: a benchmark for evaluating LLM judges of computer-use agents[EB/OL]. Hugging Face Datasets, 2026. https://huggingface.co/datasets/ServiceNow/AgentHorizon
© 2026 Yang Huan · yanghuan9812@qq.com