LLM 当政治信息中介:分数漂亮,一碰模糊信息就露馅

越来越多人把政治话题直接丢给 ChatGPT、Claude 这类模型——问它某个政策怎么看、某个候选人什么立场、某条新闻有没有水分。LLM 已经是很多人获取信息的默认入口了。但一个模型在回答「Python 怎么排序」和回答「这个 election promise 可信吗」之间,承担的是完全不同的责任。

一篇 7 月 28 日上传到 arXiv 的论文正好戳了这个点。题叫 Polistemics,作者 Baran Peters,给「LLM 作为政治信息中介」这件事建了一套评估基准。论文基于一个叫 Epistemic Modesty(认知谦逊)的规范标准:模型在面对政治信息时,不能超出自己知道的范畴瞎发挥,尤其不能替用户做价值判断。

分数不低,但分数是骗人的。

Polistemics 拿 2025 年德国和荷兰的选举信息做测试场景,控制了信息的清晰度、噪声和一致性这三个变量,测了三家当时最先进的 LLM。在高分榜上,结果都不错——模型在信息清晰、证据扎实的情况下表现可靠。但论文指出一个核心问题:高分平均值掩盖了系统性失败。

一旦信息变得模糊、缺失、矛盾,模型就开始乱来。不是精度下降,而是行为模式本身变了——模型开始用语言本身的倾向去填空,不是基于事实去推理。所有被测试的模型都表现出一个共性:它们会 flatten 政治语言的强度——把激进的说法磨平,把尖锐的分歧软化。表面上看是「中立」了,但论文认为,这种无差别的平滑本身就是一种失真,因为它抹掉了政治信息中最关键的部分:立场和强度。

问题在 party priors。

论文给出的诊断是,模型的失效大概率由 party priors 驱动——也就是模型对政党标签的先验偏好,以及输出语言本身附带的倾向性。一个模型在训练数据里读到的关于某个政党的语料分布是不均匀的,它记住了这种不均匀,并在信息不明确时用这种记忆去补缺。这不能叫「有立场」——更像是模型的统计惯性在政治语境下变成了隐性偏见。

论文最扎心的一句话在结尾附近:Reliable mediation appears achievable, but no model delivers it consistently。意思是,让人放心的政治信息中介不是做不出来,但目前没有一个模型能稳定做到。

为什么开发者应该在意这个。

如果只是用 LLM 写代码、做翻译、写摘要,这篇论文看着有点远。但如果是面向公众的产品,或者 Agent 工具需要从网上抓取信息再做归纳,Polistemics 的发现就直接相关:任何涉及模糊、矛盾、不全信息的场景,模型会以预期不到的方式失效。而且这种失效不是崩了、胡言乱语了,而是用非常自信、非常「靠谱」的语气给出了一个有偏的结论——这才是最难 debug 的那类错误。

论文目前还在 arXiv 上,带 CC BY 4.0 许可,可以直接翻。任何跟新闻摘要、政策解读、选举信息搭边的产品,这篇值得花半小时细读一下它的实验设计——那个控制信息清晰度和一致性的测试框架,本身就可以拿来对自己的场景做一次类似的压力测试。