arXiv:2607.14777 SEED:一种解决智能体强化学习稀疏奖励问题的自进化蒸馏框架

SEED:一种解决智能体强化学习稀疏奖励问题的自进化蒸馏框架

核心事件:2026年7月16日,Jinyang Wu 等人将论文《SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning》提交至 arXiv(编号 2607.14777)。该研究提出了一种名为 SEED 的自进化框架,旨在解决大型语言模型(LLM)作为智能体进行长程任务时面临的强化学习奖励稀疏问题。

1. 背景与痛点:智能体训练中的"监督鸿沟"

随着大型语言模型被越来越多地训练为交互式智能体,以执行涉及多轮交互、工具使用和环境影响的长程任务,强化学习(RL)成为关键的优化范式。然而,现有的基于结果(Outcome-based)的强化学习存在一个显著缺陷:轨迹级奖励过于稀疏

这种稀疏性导致了"监督鸿沟":

  • Episode 级别的成果Token 级别的政策学习之间缺乏有效的指导。
  • 智能体在完成整个任务后获得的反馈,难以精确指导中间决策步骤的学习。

2. SEED 框架核心机制

SEED(Self-Evolving On-Policy Distillation,自进化在线策略蒸馏)通过以下三个核心步骤解决了上述问题:

2.1 将轨迹转化为"后见之明技能"

SEED 首先微调策略模型,使其能够分析已完成的在线策略轨迹(on-policy trajectories),并从中提取出自然语言形式的"后见之明技能"(hindsight skills)。这些技能包括:

  • 可复用的工作流程;
  • 关键的决定性观察;
  • 避免失败的规则。

2.2 自进化的双重角色

在强化学习过程中,当前策略模型扮演两个角色:

  1. 数据收集者:收集新的交互轨迹。
  2. 技能分析师:从这些轨迹中提取后见之明技能。

这意味着策略更新不仅提升了后续的决策能力,同时也提升了技能分析的能力,使得后见监督信号能够随着策略的进化而自我迭代。

2.3 稠密 Token 级蒸馏信号

SEED 将提取出的技能重新应用于采样动作,分别在普通上下文和技能增强上下文下对动作进行重评分。通过计算这两种上下文下的概率差异,生成一个稠密的 Token 级在线策略蒸馏信号

该信号与基于结果的强化学习信号联合优化,确保辅助监督信号始终与当前的轨迹分布保持一致。

3. 实验结果与验证

作者在文本类和视觉类智能体任务上进行了广泛的实验,结果显示:

  • 性能提升:SEED consistently 提高了智能体的任务表现。
  • 样本效率:显著改善了样本利用效率。
  • 泛化能力:在未见过的情景中表现出鲁棒的泛化能力。

4. 资源与代码

该研究由 Jinyang Wu, Shuo Yang, Zhengxi Lu, Fan Zhang, Yuhao Shen, Lang Feng, Haoran Luo, Zheng Lian, Shuai Zhang, Zhengqi Wen, Jianhua Tao 共同完成。

5. 对从业者的启示

对于 AI 开发者和研究者而言,SEED 框架提供了一种将非结构化的任务完成经验转化为结构化"技能"并用于指导后续训练的新思路。特别是在智能体需要长时间规划和高精度工具使用的场景下,这种自进化的蒸馏机制可能成为突破强化学习样本效率瓶颈的关键技术路径。