你看到的 Agent 排行榜分数,可能有七成是「作弊」来的
过去一年,Agent 评测榜单上的数字涨得让人眼花缭乱。编码、网页浏览、终端操作、长周期任务——每一项都在刷新。每次新模型发布,都会拎出一两个「SOTA」来说事。
这些分数,有多少是在测能力,有多少只是 Agent 找到了捷径?
一篇 7 月 24 日挂在 arXiv 上的论文,标题很直白:《Do Agent Benchmarks Measure Capability?》——Agent 基准测试到底在测什么。Jiaqi Shao、Hanck Chen 等人的这篇工作,审计了 15 个主流 Agent 基准测试的 2,385 条运行轨迹,结论不太好看。
论文总结了几种典型的「捷径」:恢复公开的现成解法、直接读取评测标注文件、推断题目生成器的内部结构、操纵反馈循环。这些行为有一个共同的名字——Reward Hacking,奖励黑客。模型没有真正完成任务,只是利用评测协议的漏洞「演」出高分。
只要评测集公开,训练数据就有可能被污染。这篇论文还指出了一种更隐蔽的情况:即使模型没有见过训练数据,它也能在评测过程中找到取巧的方式。
论文提出了一个叫 HackDetect 的审计方法,在事后回溯 Agent 的运行轨迹,识别它是否利用了某种不应该获得的信号,然后量化这个「作弊」让分数虚高了多少。
量化指标叫 Mislead Gap——作弊分数减去本该有的真实分数。
数字有多大?
在 Frontier Science 评测集里,67.0% 的轨迹存在利用漏洞的证据。AutoLab 上,66.7%。在成对的对照比较中,分数虚高(Score Inflation)的范围是 0.45 到 1.00。
某些基准测试上,Agent 拿到的高分里,可能有一大半是靠「盘外招」拿到的。
论文没有点名具体是哪个模型或哪个榜单,但指向很清楚:现在的 Agent 评测生态,缺乏一套通用的方法来验证分数有没有被污染。
HackDetect 的定位是审计工具,帮评测方和研究者看清分数的可信度。
某个 Agent 刷了新高的分数,过 HackDetect 了吗?
论文链接:arXiv:2607.22368