arXiv:2607.18979 Fishing Out Free Riders: Shapley-Based Reward Attribution for Parallel Reasoning via Reinforcement Learning

解决并行推理中的“搭便车”问题:基于Shapley值的奖励分配框架Parallel Shapley

在大型语言模型(LLMs)的多步推理中,生成多个推理路径(Parallel Reasoning)已成为提升性能的主流范式。然而,arXiv:2607.18979 指出,当前的并行推理方法往往无法有效区分各个推理路径的独立贡献,导致训练信号模糊和训练不稳定。

为此,Wentao Zhang、Haoyu Zhang 等10位作者提出了一种名为 Parallel Shapley 的强化学习框架。该框架利用合作博弈论中的 Shapley 值,为每个推理路径进行细粒度的奖励分配,从而有效识别并剔除冗余或有害的路径。

核心痛点:结果级奖励的局限性

在现有的并行推理范式中,模型通常会生成多条推理路径来探索问题的不同解法。然而,传统方法通常采用结果级奖励(outcome-level rewards)机制:

  • 奖励分配不均:只要最终答案正确,所有参与推理的路径都会获得相同的奖励。
  • 掩盖低效路径:许多路径可能是冗余的、误导性的,甚至是有害的,但在结果级奖励下,这些“搭便车(free riders)”的行为无法被有效惩罚。
  • 训练不稳定:由于缺乏对单个路径贡献的精确度量,强化学习过程中的信号变得模糊,导致模型训练难以收敛。

解决方案:Parallel Shapley 框架

Parallel Shapley 将多路径推理视为一个合作博弈(cooperative game),其中每条推理路径被视为博弈中的一个“玩家”。其核心技术特点包括:

  1. 细粒度贡献分配:通过计算 Shapley 值,量化每条路径对最终结果的边际贡献(marginal contributions)。
  2. 生成式奖励模型:使用生成式奖励模型(generative reward model)来评估路径效用,而非仅仅依赖最终答案的对错。
  3. 蒙特卡洛采样:为了高效近似计算 Shapley 值,框架引入了蒙特卡洛采样技术,以平衡计算成本与精度。

实验结果与意义

该研究团队在数学推理基准测试(mathematical reasoning benchmarks)上进行了实验。结果表明:

  • 性能超越基线:Parallel Shapley 的表现优于现有的基线方法。
  • 训练更稳定:通过按比例分配奖励,模型的训练过程更加平稳,解释性更强。
  • “钓出”搭便车者:该框架能够有效识别出那些对最终结果贡献微小甚至为负的路径,并相应地降低其奖励,从而促使模型专注于高质量的推理路径。

论文信息

  • 标题:Fishing Out Free Riders: Shapley-Based Reward Attribution for Parallel Reasoning via Reinforcement Learning
  • 作者:Wentao Zhang, Haoyu Zhang, Xinke Jiang, Yuxuan Cheng, Yuhan Pan, Miao Li, Zhipeng Qiao, Tao Feng, Zhen Tao, Dengji Zhao
  • 提交日期:2026年7月21日 (Tue, 21 Jul 2026)
  • 页数/图表:19 pages, 4 figures, 8 Tables
  • 领域:人工智能 (cs.AI)
  • 链接

这篇论文为优化大语言模型的并行推理能力提供了新的理论视角和技术手段,特别是在强化学习奖励设计的精细化方面具有重要的参考价值。