LAPO:一种无需外部奖励模型的多轮搜索过程监督方法

LAPO:让 AI 学会"自我反思"的多轮搜索强化学习新范式

2026年7月15日,Qiang Zhu 与 Jiajun Wu 在 arXiv 上提交了一篇名为 LAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoning 的论文。这项研究提出了一种创新的过程奖励方法,为多轮搜索推理中的强化学习训练带来了新的可能性。

传统方法的痛点

在多轮搜索推理的强化学习中,研究人员长期依赖一种简单粗暴的方式——终端结果奖励。简单来说,就是等智能体完成所有搜索步骤、得出最终答案后,才给予奖励或惩罚。

这种方法存在一个根本缺陷:系统无法区分哪些中间交互是真正有用的,哪些是冗余的,甚至哪些是有害的。

想象一下,一个 AI 助手通过 10 轮搜索最终回答了用户的问题。当它得到正确答案时,我们并不知道是哪一轮搜索真正贡献了关键信息,也不知道其中是否混入了误导性的搜索步骤。这种"黑盒式"的反馈机制,严重限制了策略优化的效率。

LAPO 的核心思路:留一归因

LAPO 的解决方案优雅而直接。它的核心思想可以概括为一句话:"如果去掉这一步,AI 还能答对吗?"

具体而言,LAPO 采用了一种基于回溯留一归因的过程监督方法,工作流程如下:

第一步:留一归因(Leave-One-Turn Attribution)

对于每一次搜索轮次,LAPO 将该轮次及其检索到的观测结果替换为一个固定的 [DELETE] 占位符,然后测量当前策略对黄金答案的平均对数似然值的变化。

第二步:答案似然增益(Answer-Likelihood Gain)

上述变化量即为"答案似然增益",它衡量了该轮次搜索对最终答案的贡献程度。这种方法的关键优势在于保留了所有下游交互,使得早期证据能够在完整的推理上下文中进行评估。

第三步:符号一致性门控(Sign-Consistency Gating)

LAPO 进一步应用符号一致性门控机制,仅保留那些方向与其原始归因分数一致的归一化过程优势值,从而过滤掉噪声信号。

技术亮点:零额外成本

与传统方法相比,LAPO 具有以下几个显著特点:

特点 说明
无需额外组件 不需要额外的奖励模型、教师模型、验证器或 LLM-as-a-Judge
自我生成 过程奖励完全由策略自身推导得出
回溯式归因 基于反向传播的归因方式评估每步贡献
上下文保持 保留下游交互以维持完整推理链

这意味着,部署 LAPO 不需要额外的计算资源,也不需要训练独立的奖励模型,大大降低了应用门槛。

实验结果:显著提升

研究者在七个知识密集型问答数据集上进行了全面评估,所有实验均使用本地检索(local retrieval)设置。

  • LAPO 的平均精确匹配分数(exact-match score)达到 0.326
  • 相比最强的步骤奖励基线 IGPO,高出 0.053

消融实验进一步表明,回溯归因和符号一致性门控各自带来了互补的收益,证明了策略衍生的回溯归因可以为多轮搜索代理提供有效的过程监督。

行业意义

对于 AI 从业者和开发者而言,LAPO 提供了一种零额外成本的过程监督方案。在多轮搜索代理(如 RAG 增强、自主搜索 Agent)的训练中,过程奖励的质量直接影响策略优化的效率。

LAPO 的优势在于三个方面:

  1. 降低部署门槛:无需训练或部署独立的奖励模型,节省计算资源和运维成本。
  2. 提升训练信号质量:从单一的终端反馈细化到每轮搜索的细粒度评估。
  3. 适用于知识密集型任务:在七个不同数据集上的验证表明方法具有一定的泛化能力。

对于创业者和从业者而言,这一方向暗示了在搜索增强型 Agent 基础设施中,过程监督可能成为差异化竞争的一个技术支点。随着多轮搜索 Agent 在各个领域的广泛应用,如何高效地训练和优化这些 Agent,将成为决定产品竞争力的关键因素之一。


论文信息

  • 标题: LAPO: Leave-One-Turn Attribution for Self-Generated Process Rewards in Multi-Turn Search Reasoning
  • 作者: Qiang Zhu, Jiajun Wu
  • arXiv ID: 2607.13501
  • 链接: https://arxiv.org/abs/2607.13501