AgentHorizon:长轨迹成败判定的对抗基准

本页是 RSI 数据集版图 中"成功判定 / Verifier"一列的对抗担当: AgentHorizon [1](ServiceNow,Hugging Face)——评测 "LLM judge 能否读完一条长执行轨迹、判断任务真的完成了吗"的基准。

1. 数据概况

维度 内容
形态 每条样本 = 一条 GUI agent 长轨迹 + 真值成败标签
轨迹长度 常见 100–300+ 步
难度分两档 主 split 605 条(287 正 / 318 负);Simple split 768 条(236 正 / 532 负)
体量 43 GB(markdown + 结构化 JSON + 截图 + judge prompt 框架)
获取 ServiceNow/AgentHorizon

即:

instruction+action sequence+screenshots+ground-truth success/failure \text{instruction} + \text{action sequence} + \text{screenshots} + \text{ground-truth success/failure}

2. 负样本是对抗性构造的

普通 judge 基准的负样本"轨迹里总有点明显错误";AgentHorizon 的 负样本专门针对只查表面一致性的 judge:

  • 任务成对出现(parent / child,指令只差一个细节);
  • 负样本 = 把兄弟任务的轨迹配给当前任务的指令—— 轨迹本身是流畅、成功的执行,只是执行的是另一条指令;
  • 失败藏在"指令 ↔ 轨迹"的对齐关系里,而非任何可见的执行错误。

配三种失败类型标签:Critical Mistake(核心目标未达成,不可逆)、 Bad Side Effect(目标达成但留下必须善后的副作用)、 Misunderstanding of the Instructions(动作合理但读错细节)。

3. 对 RSI 的定位

RSI 闭环的成功信号必须经得起这类对抗:一个把"看起来做完了" 当成"做完了"的 verifier,会把错误经验固化进参数。 这个数据集适合研究:

VLM 能否检查自己的长执行历史、并判断是否真的成功?

配套:图像判完成度的 Are We Done Yet?、 programmatic 验证的 AndroidWorld

参考文献

[1] SERVICENOW. AgentHorizon: a benchmark for evaluating LLM judges of computer-use agents[EB/OL]. Hugging Face Datasets, 2026. https://huggingface.co/datasets/ServiceNow/AgentHorizon


© 2026 Yang Huan · yanghuan9812@qq.com

results matching ""

    No results matching ""