多元对齐研究被自己人掀了桌子:前沿大模型没有一个真在做

翻 arXiv 的时候刷到一篇狠起来连自己都打的论文。标题叫《A Roadmap to Impactful Pluralistic Alignment Research》,一群多元对齐(pluralistic alignment)领域的研究者写的,包括 Jacob Andreas 和 Michiel Bakker 这些名字。按说应该是给自家领域画地图、指方向的东西,结果开篇就来了一句大实话:这个方向已经搞了好几年了,但没有任何公开证据表明它真正影响了人们在用的 AI 系统的训练或评估。

他们真的去查了。审计了前沿 labs 的公开行为文档和评估报告,发现没有一个把「多元主义」列为对齐目标。截至写论文时,也没有明确的迹象表明任何一个生产模型被明确地训练或测试过这个东西。这个圈子讨论了好几年、发了无数论文、构建了各种理论框架的领域,在产品层面的落地是零。

论文自己总结了三个原因,一个比一个扎心。

第一,到目前为止支持多元对齐的主要论据,要么是规范性的,要么是推测性的。大家更多在谈"应该"——AI 应该尊重多元价值观、应该服务于不同人群——但缺少实证研究证明这样做到底给用户或社会带来了什么可测量的好处。没有数据,产品团队怎么说服自己为这个目标花钱花算力?

第二,这个圈子没有在「什么时候该有多元行为」以及「理想的多元对齐到底长什么样」上达成共识。尊重不同价值观,面对一个具体问题,到底是给多个答案、折中、还是让用户选?不同场景答案很可能不一样。开发者没法把一个模糊的哲学目标做成产品需求文档。

第三,现有的多元对齐方法跟 LLM 的其他性能指标之间存在 trade-off,而且很大程度上没被量化过。加了多元约束,可能就牺牲了准确性、一致性、安全性。现有的指标又不能拿来当优化目标去爬山。这直接决定了它进不了 production 的 loss function。

论文不是来骂街的,它给出了三个对应的研究方向:需要实证 foundation,需要具体的理想行为描述,需要 trade-off 感知的评估和方法。翻译成工程语言就是——这东西到底值不值得做、什么时候该做、做了怎么知道没搞砸。

这篇论文最有价值的地方在它的姿态。多元对齐一直是个"政治正确"的研究方向,很少有人愿意公开说"我们还没准备好"。这群作者等于是自己站出来,对圈子喊了一嗓子:别光写论文了,先去证明这东西在真实系统里管用。

学术界提出来的框架跟工程落地之间的鸿沟,这篇论文等于画了一张现场地图。这更像一份内部复盘:承认问题、找根因、排优先级。

多元对齐这件事本身我判断不了该不该做,但论文里有一句我是认的——研究要产生影响,就得从规范论证转向实证基础、从模糊愿景转向可操作的目标、从实验室方法转向能放进生产管线的工具。这其实不只是对齐研究的问题,很多 AI 子方向都卡在同样的坎上。

论文今天刚挂 arXiv,编号 2607.22305。做模型对齐、产品安全、RLHF 相关工作的人都值得读一下。不是因为给了答案,而是因为它把问题摊得比谁都清楚。