让一群 LLM 给 LLM 打分:这篇 ACL 论文用 Elo 评分做评估,路子对了

做 AI 应用的人总会撞上同一个问题:你怎么知道模型吐出来的东西是好的?

跑榜有用,但榜测的都是通用能力。拿自己的场景、自己的数据去测,人工评估太慢太贵,自动指标又经常和体感对不上。BLEU、ROUGE 这些老指标在生成式任务上基本失灵,用单个 LLM 做裁判又有偏好——换一个模型打分,结果可能完全不一样。

昨天挂在 arXiv 上的一篇论文直接冲着这个问题来的。Bertil Braun 和 Martin Forell 在 ACL 2025 的 GEM2 Workshop 上发表的工作,标题带着一个诚实的「Towards」——他们没说自己彻底解决了,但方向是实的。

核心思路不复杂:别让一个模型当裁判,让多个模型一起上,做两两比较,然后用 Elo 评分系统排出稳定排名。可以调一致性阈值——从全员同意到多数投票——来控制评估的置信度和覆盖率。

细看就知道为什么这比单模型打分靠谱。

两两比较是基础。让模型直接给打分(比如 1-5)的问题在于,不同模型的打分习惯不一样,同一个模型今天和明天也可能不一样。但「A 和 B 哪个更好」这个判断相对稳定,模型干这个比直接给分数自然得多。Pairwise comparison 不新鲜,但把它作为评估 LLM 输出的核心机制,这篇论文给了一个系统化的实现。

评委团负责抵消偏好。单模型评估跑多了就能发现,GPT-4 觉得好的 Claude 可能觉得一般,反过来也一样。用多个 LLM 组评委团相当于做了一次内部交叉验证。论文没有点名用了哪些模型当评委,但这个思路本身是成立的——甚至可以用不同尺寸、不同家族的模型来组。

有了两两比较和评委团,再用 Elo 评分系统做排序。Elo 从国际象棋借来,核心好处是能处理不完全的对战矩阵——不是每对输出都被比过,但它能逐渐收敛到稳定排名。在大规模评估场景里,这意味着不用跑完所有两两组合就能得到有意义的排序,计算量可控。

再加上可调阈值做兜底。全员一致时结果可信但覆盖率低;多数投票覆盖率高但可能有噪声。根据场景调这个参数,比固定打分公式灵活得多。

论文拿科学摘要里的能力轮廓(competency profiles)做了验证。自动排序和专家判断的相关性不错,论文表示「显著减少了人工干预的需求」。具体数字没有大张旗鼓地列,但 17 页的篇幅给出了足够复现的细节。

这套框架不是那种让人拍大腿的颠覆性突破。它更像一个工程上合理的组合方案——把几个在各自领域被验证过的技术拼在一起,解决了一个具体且普遍的问题。这也是为什么它值得关注:AI 评估这个环节越来越像整个链条的瓶颈,模型出活快,但验证出活慢。能把这个瓶颈松一松的工具,每一点改进都有实际价值。

当然,「Towards」不是白放的。框架本身依赖作为评委的 LLM 的质量——如果评委模型在某些领域表现拉胯,那团评的结果也不会好。另外,论文的验证场景还比较窄(科学摘要),放到开放式对话、代码生成、创意写作里是不是还稳,需要更多实验。

对于正在搭建评估管线、或者被人工审核搞得焦头烂额的人来说,这篇论文提供了一个可以直接抄作业的方向:别迷信单个 Judge LLM,上评委团,做两两比,打 Elo 分,调阈值控置信度。论文没有附带公开仓库,但描述已经足够清晰,实现门槛不高。

AI 评估更务实的方向,是设计一套流程——让一群不那么完美的裁判共同做出可靠判断。

相关链接
- 论文页面:https://arxiv.org/abs/2607.28282
- PDF:https://arxiv.org/pdf/2607.28282