LEMUR 发 paper 了|当 RL 学会跟人学偏好,还不用你手写 Reward 函数

干 RL 的人大概都遇过这个坑:花了两周写 reward 函数,跑了一周训练,发现 agent 找到了一条完全没想到的捷径——score 刷上去了,但想要的东西它根本没学会。这算不上 bug,更像是单标量 reward 的先天缺陷:没法用一个数字精确表达你到底想要什么。

而且真实场景里几乎没有单目标这回事。机器人既要跑得快又要省电还要不撞墙,推荐系统既要高点击又要多样性还要时效性。目标一多,手写 reward 组合的难度指数级上升——调过 weights 的都懂,那基本是玄学。

所以看到这篇 LEMUR 的时候,第一反应是:这条路早该有人走了。

LEMUR(Learning to Align with Multi-Objective Reinforcement Learning from Preference Feedback),刚挂上 arXiv(编号 2607.29559),作者来自曼彻斯特大学的研究团队。它干的事说起来不复杂:把 Multi-Objective RL 和 Preference-based RL 拧到了一起。

Multi-Objective RL(MORL)处理的是多目标问题——把 reward 做成向量而不是标量,理论上可以学习帕累托最优的多种折中策略。但它的前提是每个目标都得能写一个 reward 函数。这就回到了一开始的坑——照样得手写 reward,只不过从一个变成一个数组。

Preference-based RL(PbRL)走的是另一条路:不写 reward 了,让人类看两个行为片段,挑出更符合意图的那个,算法从偏好中反推 reward 模型。这个方法这几年在 alignment 领域很火,但大部分工作都局限在单目标场景里。

LEMUR 的做法是把两者结合:从多个人类的偏好反馈中,同时学习策略和多个目标专属的 reward 模型。换句话说,不需要事先定义任何 reward 函数,只需要让人类(或者同一组人在不同维度上)给偏好判断,agent 就能自己学会怎么在多个目标之间做 trade-off。

论文在 benchmark 多目标任务上做了评估,结果优于基线方法。具体提高多少、在哪些任务上效果最明显,PDF 里有细节,这里不展开跑分——但方向本身比具体数字更有意思。

这个框架对做机器人、做 alignment、做任何部署阶段没法精确写 reward 的团队,都有实际价值。想想实际在调的那些场景:模型输出既要有用又要安全,Agent 既要完成任务又要控制成本,机器人既要高效又要鲁棒。每一条都得靠写 prompt、调阈值、做规则来硬约束——如果换成偏好反馈,只需要表态就行了,剩下的让算法去对齐。

当然,现在还早。LEMUR 是个框架性的工作,从论文到可复用的开源工具还有距离。而且它依赖的「多个人类偏好」在实际工程中怎么规模化收集、标注一致性怎么保证,都是接下来要碰的硬骨头。另一个问题是 compute——同时学多个 reward 模型再加策略优化,训练开销不会小。但方向是对的:RL 这些年最大的瓶颈之一就是 reward 设计,Preference-based 方法已经被 RLHF 证明了在大模型场景的有效性。把它搬到多目标、多人类的一般决策场景里,是顺理成章的一步。

接下来要看的是这个框架能不能跑通真实的机器人任务,以及作者会不会开源代码和训练的 reward 模型权重。如果能把偏好收集的成本降下来,LEMUR 这条线会比很多刷榜的算法更有工程生命力。

相关链接:
- arXiv 论文页
- PDF 全文