LLM 的概率判断自带「乐观滤镜」,这篇论文给出了测量方法

上周审一个 Agent 项目时遇到件怪事。我让模型评估某个技术方案的成功概率,它回了「成功可能性 70%」,我又问失败概率,它说「15%」。两数加起来只有 85%,剩下的 15 个点哪去了?我当时以为是模型随口发挥,没细究。直到看到这篇刚挂在 arXiv 上的论文,才发现那不是偶然——大量语言模型的概率判断存在系统性的方向偏差,而且绝大多数是偏乐观的。

论文叫 OptimismBench,来自 Seonglae Cho 和 Adriano Koshiyama。它解决的是一个校准指标一直不擅长的问题:传统校准评估的是误差大小(预测 70% 实际 60%,差 10 个点),但不管这个误差是偏大还是偏小,不区分方向。OptimismBench 用了一个很干净的思路——对同一个场景问一对反向问题:P(成功) 和 P(失败)。如果模型真的「理解」概率逻辑,两数应该自然相加到 100%;不对称的部分,就是没有真实标签也能算出来的方向偏差。

结果相当一致。16 个模型、来自 8 家厂商,其中 14 个是偏乐观的。唯一出现悲观倾向的,是 Anthropic 的 frontier 层级模型。论文还特意做了 11 组 base 模型和 chat 模型(同一系列,训练前后)的对比,结论很明确:post-training(对齐、微调、RLHF 那套流程)决定了偏差的方向,而且不同模型家族里这个方向甚至相反——有的家族对齐后变乐观了,有的变悲观了。

作者还做了不少消融实验,试图找到「修掉」这种偏差的办法。换 prompt、调温度、改视角(第一人称 vs 第三人称)、甚至让模型自我纠偏——全都没什么效果。这些干预没能明显改变偏差的方向或幅度。

作者还发现,模型身份对偏差的影响远超语言。论文在 6 种语言上测了 17 个模型,模型间的方差是语言间方差的 4.7 倍。用什么语言问影响不大,关键在用的是哪个模型。

论文附带发布了 3,870 条测试数据,覆盖 10 种语言,按 CC BY 4.0 许可开放。对于基于 LLM 概率输出的工作流——风险评分、项目评估、自动化决策——这个数据集可以直接用来做偏差审计。

说回到那条加起来只有 85% 的概率。这 15 个点的「失踪概率」不单是数学问题。拿 LLM 的概率判断去喂下游 pipeline 时——比如自动筛选项目、输出决策建议——这份乐观滤镜会一路透传下去,相当于模型在替用户「希望事情顺利」。如果恰好用了那个唯一偏悲观的模型家族,pipeline 又会持续倾向保守。

论文没有给出简单的修法,只是把问题摊开了。但能看清偏差的方向和规模,已经比「校准了但不知道偏哪边」进了一大步。模型给的概率加起来不到 100%,往往不是无心之失,而是反映了模型本身的倾向。