LLM 后训练的「对齐税」有解了?PRISM 的思路是:别混奖励,混策略

做 LLM 后训练的人,大概都撞过一堵墙——手里有好几个对齐目标,比如让模型聪明又安全、会用工具又不乱调用,但一放进同一个 RL 流程里优化,它们就开始打架。模型变乖了,推理能力掉一截;数学上去了,工具调用又飘了。这个现象有个名字叫「对齐税」——多目标优化时不同 reward 互相拉扯,最后哪个都没做到位。

今天 arXiv 上挂出来的一篇新论文,干脆把这个问题的底层假设翻了个面。标题就很直白:「Don't Mix Rewards, Mix Policies」。来自中科院自动化所等机构的工作,提出了一个叫 PRISM 的框架——核心思路是,把几个 reward 捏成一个信号去训一个策略,不如把策略本身拆开。

传统多奖励 RL 把多个 reward 加权求和成一个标量,然后用这个标量去优化单一策略。听起来合理,但实际操作中不同 reward 之间的梯度方向经常不一致,优化过程左右摇摆,最终策略为了兼顾所有目标而变得「平庸」——对齐税就是这么来的。PRISM 换了个方案:为每个正向 reward 单独训练一个独立的「正策略」,同时训练一个全局的「负策略」来抑制不良行为。训练时各个策略各管各的,互不干扰。推理阶段再通过灵活的策略组合来合成最终行为。

换个角度理解:不用再逼一个模型同时当数学家和安全审查员。分别训一个数学好的策略、一个工具调用稳的策略、一个回答礼貌的策略,再训一个通用的「别乱来」策略。上线时根据场景需求动态调配它们各自的权重——今天要跑科学推理,就把数学策略拉满;明天要做客服,把礼貌权重调高。这个过程不需要重新训练模型,推理时实时组合就行。

论文在科学推理、工具使用推理和 helpfulness-safety 对齐三个场景上做了实验,结论是 PRISM 一致超过现有的多奖励 RL 基线,而且多了推理时的偏好控制能力。后者在实际部署里的价值在于——同一个基座模型,给不同用户群体提供不同行为倾向,而不需要为每个群体重新做一次 RL。

当然,这篇工作目前是学术论文阶段的成果,实验主要基于开源模型和特定 benchmark,离大规模产品级部署还有距离。但它的思路——用策略分解代替奖励混合——确实指向了一个很多从业者已经隐隐感觉到的问题:我们可能一直在用错工具解决多目标对齐。

多 reward 后训练的「对齐税」会不会因为 PRISM 这种思路而大幅降低,现在下结论还太早。但这个方向至少让人看到一条不需要在各个 reward 之间痛苦调权的路。接下来如果有团队把它搬到更大的模型和更复杂的 reward 结构上试一遍,结果会很有意思。我打算盯着这个 repo,等代码放出来先跑一把。对做后训练的人来说,少调一个 reward 权重,就是少熬一次夜。