CalibratedRubric:131 条评分标准砍到 49 条,LLM 评估反而更准了

刷 arXiv 时看到一篇「CalibratedRubric」,副标题 Task-Adaptive Rubric Banks for Open-Ended LLM Evaluation。评估方向的论文多得读不过来,本来没太在意,但读进去发现它打了一个我这两年一直没绕过去的点:评价大模型的开放输出时,到底哪些评分标准是真能用的。

做摘要生成、客服回复、报告起草或者决策支持的人,大概都被评估卡过。写了十几条测评标准,找两三个人标了一两百条,算完 kappa——0.4 不到。觉得是标准不够细,开始加 rubric,从 20 条加到 80 条,标注员开始崩溃,成本翻倍,一致性没怎么涨。

这种困局是个方法论问题。很多评分标准其实没法被可靠测量——看起来合理,但不同人打出来的分几乎随机,放进去只会稀释整体信噪比。

这套方法的核心是:针对不同任务类型设计不同的打分方式(type-specific scoring),然后用 Beta-Bernoulli 共轭模型为每条评分标准估算一个「可测量后验概率」——回答的就是:这条标准到底能不能区分好的输出和差的输出。最后用 IRT(项目反应理论)加 submodular information-coverage 目标函数,从几百条标准里选出信息量最大且不冗余的最小子集。

论文在金融、医疗、通用和法律四个领域的 benchmark 上做了验证。一组最直观的结果:在 JudgmentBench 上,measurability filtering 把 human-gold agreement 从 κ=0.604 拉到了 0.743,涨了近 0.14。在 FinResearchBench 的决策支持任务上,IRT 挑选只需要 49 条 rubric 就达到了目标相关性,随机选需要 131 条——少了差不多六成,排序 fidelity 反而更高。所有六个被评估的 response block 上,IRT 选出来的 rubric 组合在排序准确度上都优于随机选。

论文也写了边界:这套 calibration 的效果取决于 sufficient judge redundancy——评估管线至少得有好几个 judge 同时打分,不然贝叶斯后验算不出来。只用一两个 judge 的场景暂时用不上。另外,task-label perturbations 会降低 system separation,任务描述稍微变一下,挑出来的 rubric 集合可能就得重来。

对一个做 AI 产品的人来说,CalibratedRubric 目前还只是论文,不是可以直接装来用的工具。但方法本身不重——Beta-Bernoulli 加 submodular selection,几十行 Python 能搭个雏形。如果手头已经有评估数据,花半天跑一轮 measurability filter,很可能会改变对「什么才算好评分标准」的判断。

别盲目堆 rubric 了。先搞清楚哪些标准是真能打的。剩下的,该删就删。