长上下文推理中“复制陷阱”的破解:GEAR 奖励塑形方法

拒绝做“复读机”:GEAR 方法如何破解大模型长上下文推理的“复制陷阱”

在人工智能飞速发展的今天,大语言模型(LLM)的能力边界正在不断拓展。随着模型能够处理越来越长的上下文窗口,研究人员发现了一个令人担忧的现象:模型似乎陷入了一种“重复复制”的思维惰性。

2026 年 7 月 21 日,Lizhe Fang、Weizhou Shen、Tianyi Tang 和 Yisen Wang 等学者提交了一篇题为 《Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning》 的论文 [1]。他们不仅精准诊断了这一顽疾,更提出了一套名为 GEAR (Grounding Evidence-Aware Reward) 的创新奖励塑形机制,为大模型的长上下文推理能力带来了显著突破。

一、 被忽视的“复读机”现象

在长上下文场景中,我们期望模型能够像人类阅读长篇报告一样,筛选关键信息,忽略无关干扰,最终给出精准的答案。然而,现实却往往不尽如人意。

研究人员指出,前沿的长上下文 LLM 普遍存在一种失败模式——重复复制(Repetitive Copying)。简单来说,就是模型倾向于机械地复制输入文本中的片段到推理过程中,而不是真正去理解并解决问题。更糟糕的是,这种病态行为会随着上下文长度的增加而加剧。

为什么会出现这种情况?

论文深入剖析了根源:接地不足(Insufficient Grounding)

所谓“接地”,是指模型将语言符号与真实世界或文档中的具体证据联系起来的能力。当模型无法有效区分哪些是关键证据,哪些是无关干扰信息时,它就会陷入迷茫。这种迷茫导致它不敢越雷池一步,只能选择最安全的策略——照搬原文。结果便是,回答错误的概率大幅上升。

2. GEAR:给模型装上“证据雷达”

为了解决这一难题,研究团队提出了 GEAR(Grounding Evidence-Aware Reward) 方法。

传统的强化学习(RL)通常只关注答案的最终准确率:答对了给奖励,答错了给惩罚。但 GEAR 认为,仅靠结果反馈是不够的,模型在推理过程中对证据的利用方式同样重要。

因此,GEAR 在标准 RL 奖励之外,引入了基于“证据接地”的额外奖励信号:

  1. 关键证据重叠奖励:如果模型的输出与其应该依据的关键证据高度重叠,它将获得额外的奖励。这鼓励模型去关注和引用真正有用的信息。
  2. 无关干扰惩罚:如果模型的输出包含了大量与问题无关的上下文信息,它将受到惩罚。这迫使模型学会“做减法”,聚焦核心。

为了让 GEAR 能够在自然语言数据上发挥作用,研究团队还开发了一套自动化数据构建流水线。这套流水线能够从任意文档中自动提取并标注关键证据,为训练提供了坚实的数据基础。

三、 显著成效:更准、更快、更聪明

研究者在多个模型规模和数据集上对 GEAR 进行了广泛验证,结果令人振奋:

  • 准确率大幅提升:相比标准的基于准确率的 RL,采用 GEAR 的模型平均得分提升了 +4.6 分
  • 长上下文优势明显:在上下文更长、更复杂的任务中,GEAR 带来的性能增益更加显著,直接缓解了“复制陷阱”。
  • 推理效率优化:GEAR 不仅提高了准确性,还意外地缩短了模型的思考长度(Thinking Length)。这意味着模型不再需要冗长的、充满冗余信息的推理轨迹,就能得出正确答案,变得更加高效。

四、 启示:回归“接地”的本质

这项研究给我们带来了深刻的启示。随着长上下文评估从简单的信息检索转向复杂的逻辑推理,对关键证据的准确接地能力依然是不可或缺的基石。

对于 AI 从业者和开发者而言,仅仅依赖最终的准确率奖励可能已经触及瓶颈。关注模型在推理过程中的“接地”能力,引导其学会区分主次、聚焦核心,或许是突破长上下文推理困境的关键钥匙。

Lizhe Fang 等人的工作再次证明,让模型“少复制,多 grounding”,才能真正迈向更智能、更可靠的推理未来。


参考文献:

[1] Fang, L., Shen, W., Tang, T., & Wang, Y. (2026). Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning. arXiv:2607.19345. Retrieved from https://arxiv.org/abs/2607.19345