奖励模型终于不用「二选一」了:LatentRM 用隐变量把推理和打分焊在了一起

做 RLHF 的人大概见过这种场景:scalar reward model 在简单对话数据上跑得好好的,一换到复杂推理任务上就翻车——给了一堆高分,但仔细看都是靠表面套路蒙混过关。换成 generative RM,让模型写一段评价再打分,效果确实稳一些,但那个自然语言分数又软又难调,不能当概率用,也不好跟 policy gradient 对接。

这就卡住了:要么选效率,要么选深度,很难两全。

最近 arXiv 上挂出来一篇论文,来自 Sanwoo Lee 和几位合作者,标题叫《Learning Latent Reasoning Traces for Scalar Reward Models End-to-End》,提出了一个叫 LatentRM 的框架。它切中的是这个领域一个很实际也很隐蔽的缺口——不是要不要让 reward model 做推理,而是怎么让推理的结果真正帮到那个最终分数。

现在主流的奖励模型分两派。一派是 scalar RM,直接给一个数字分数,效率高、概率意义清晰,但容易被表面特征骗,泛化能力堪忧,遇上 out-of-distribution 任务基本靠猜。另一派是 generative RM,先用自然语言推理一段再给分,鲁棒性好不少,但那个分数是从文本生成的,数值灵活性和概率可解释性都不行——没法真的把它当 reward signal 用。也有混合方案试图两边讨好,但它们的 reasoning trace 和 scalar score 之间是松耦合的,并行训练,推理过程未必在真正帮打分。

LatentRM 的做法是把 reasoning trace 当作离散隐变量,整个框架用 on-policy 方式端到端优化,目标直接是最大化下游 scalar reward 的似然。模型先想一段不可见的推理步骤,再基于这段推理去打分,而且这个推理过程是专门为了打准分而训练的,不是附带的。

论文的验证显示,LatentRM 在分布内和分布外数据集、以及完整的 RLHF 流程上都跑赢了 scalar RM、generative RM 和混合 RM,覆盖的任务从开放式对话到复杂推理都有。论文本身没有给出所有实验细节(摘要篇幅所限),但方向很明确:把推理藏到 latent space 里,让深度和精度同时成立。

这篇目前是 preprint,2026 年 7 月 31 日刚挂上 arXiv。代码和模型权重还没有放出来。LatentRM 的实际训练成本、推理开销、以及离散隐变量的设计如何扩展到更大模型,这些还要等后续材料。但它指了一条路:奖励模型的关键是推理步骤有没有真正在帮打分,简单或能写都不是评判标准。

搞 RLHF、调 reward model、或者被 policy collapse 折磨过的人,这篇值得盯着。等代码放出来,估计不少人会第一时间拉下来跑跑看。


相关链接