Agent评测结果,不用全跑完也能下判断
搞 Agent 评测的人应该都有过这种体验:挂上一个 benchmark,让它慢慢跑,时不时切过去瞄一眼进度条。跑了几百个 case 之后胜负已经很清楚了,但还得等剩下那几百个跑完才能正式下结论——因为没人敢拿部分结果说话,怕抽样偏差,怕刚好避开了最硬的那些骨头,怕便宜的任务先跑把数据带歪。
arXiv 上最近挂了一篇论文,正好聊这个事。Wei-Jung Huang 和 Bonan Shen 的「ParEvalLayer」,已经被今年的 ACM 国际 AI-ML 系统会议(AIMLSystems)接收了。思路不复杂:要比较两个 Agent 系统,每组任务都会跑出一个对比结果。ParEvalLayer 根据事先定好的比较策略,每跑完一批就输出四个判断之一——该系统确实更强、确实没有更强、需要更多证据、或者直接弃权。它不是等到所有任务跑完才给结论,而是每到一个检查点就问一次:现在的结果能不能下判断?
作者用现有的公开基准数据做了回放实验,假装评测在某个百分比提前终止,看 ParEvalLayer 当时能做出什么判断,再跟完整评测的最终结果比对。结果挺有意思:用主比较规则时,有三个公开基准在只跑了 15% 到 25% 的任务之后,就做出了与完整评测一致的结论——这些评测可能根本不需要跑完。
不是所有 benchmark 都这么配合。有些需要更多任务才能稳定判断,而这个差异本身就是一个值得报告的结论——它说明光报一个部分分数远远不够,还得告诉别人用了什么决策规则、还有多少对比没分出胜负、有多少任务是弃权的。一个 80% 的部分准确率,和另一个 80% 但所有难例都还没跑到的部分准确率,含金量完全不同。
这篇论文没有解决 Agent 评测里的所有问题,但它提供了一个数学上可以说得通的早停依据。对于每天烧着卡跑评测的团队来说,省下来的就是实打实的算力和时间。不过真往流水线里塞的时候还得自己调一遍——策略选什么、阈值设多少,不同任务场景下的敏感度差异不会小。论文搭好了框架也做了初步验证,但要让它不误判,得亲手试过才知道。
相关链接
- 论文页面:https://arxiv.org/abs/2608.02444