95 万条记录、714 个 Agent,Messier 把 Agent 评估的「混战」局面标准化了

搞 Agent 的人大概都经历过这个场景:同一个模型,在 A benchmark 上表现惊艳,在 B benchmark 上直接拉胯,分不清是模型的问题、框架的问题、评分规则的问题,还是 benchmark 本身已经饱和了。碎片化的评估生态让 Agent 能力对比几乎成了一场各说各话的游戏。

上周 arXiv 上的一篇论文想终结这种混乱。由 Stefan Krsteski 等人提交的 Messier,是一个大规模的跨 benchmark Agent 评估标准化语料库——957,253 条记录,覆盖 30 个 benchmark、714 个 Agent、11,891 个任务和 74,205 个验证器。数字很唬人,但真正值得在意的不是规模,而是它做的事:把所有公开 benchmark 的分数统一成一套 schema,然后在六个 underrepresented 的专业和科学领域(包括一个最近的法律 benchmark)补跑了五次 Agent 运行,把模型、框架、环境、任务、验证器和聚合规则全部标准化对齐。

Messier 就是在给 Agent 评估做「度量衡统一」。之前各家 benchmark 各玩各的,评分标准、通过条件、任务难度全不一样,没法把两个 benchmark 的结果拉到一张表里比。Messier 做了这个脏活——每条记录都按一套固定字段标准化,还加上了 SOC/NAICS 职业和行业分类,让评估结果能跟具体岗位和行业挂钩。

三个有意思的发现

基于这个语料库,论文给出了几个趋势判断,比单纯发数据集更有价值。

Function calling 已经饱和了。 这跟一线开发者的体感一致——现在模型调工具、传参数这件事,基本上已经拉不开差距了,再拿这个维度做评测意义不大。

Programming 是进步最快的方向。 代码生成和编程相关任务上的提升曲线最陡,这也不意外,vibe coding 时代连框架都开始主动补代码了。

Enterprise workflows 仍然是最难的。 企业级工作流的 benchmark 分数普遍偏低,说明 Agent 在复杂、多步骤、多系统的真实业务场景里还远没到「好用」的程度。这也是目前最值钱也最难啃的方向。

一个方法论上的提醒

论文做了一个反事实重评分实验:在多验证器任务中,如果采用严格的全通过(all-pass)聚合,即所有子验证器全都通过才算过,那很多模型的进步就被抹平了,甚至 Agent 的排名也会被人工地改变。

这是一个很实操的提醒。在评测报告里看到的「通过率」,高度依赖于聚合策略的选择。一个宽松的聚合策略可能让模型看起来一直在进步,而严格的策略可能掩盖真正的突破。Messier 把这个因素显式地记录到每条数据里,意味着未来做评估对比时,可以主动控制这个变量,而不是被隐藏的评分策略牵着走。

一张可以定制的能力标尺

Messier 还从标准化记录中推导出了能力量表(capability scales),与 Epoch 的 Evaluation Capability Index 排名做相关性检验,Spearman ρ = 0.81,对齐度很高。而且这套量表可以按领域、职业、行动空间或验证器类型做细分切片。想知道某个模型在「法律行业的多步骤 Agent 任务」上到底行不行,Messier 可以拉出一张专门的标尺来比,而不是拿一个笼统的「全能分数」说事。

论文在 arXiv 上,CC BY 4.0 许可,数据可以拿来复用。对于那些认真做 Agent 评估、或者想搞清楚自己选的模型在哪个维度上真正能打的人来说,Messier 是一个可以直接上手的底座——它没有发明新的 benchmark,而是让已有的 benchmark 变得可比较、可审计、可复用。

当然,这只是一个语料库和标准化框架,不是评估本身的终结方案。它能暴露 benchmark 设计上的盲区,但消除不了 benchmark 与现实之间的差距。论文也承认,严格的全通过策略可能掩盖进步——这意味着在解读所有 Agent 评测结果时,应该多问一句:这个分数背后用了什么聚合规则?