Agent 长程规划能力到底从哪来?这篇论文拆了一遍预训练到后训练的全链路
多轮长程规划——让 Agent 连续决策好几步——是目前基础模型 Agent 最卡脖子的能力。给一个目标,第一步还行,第二步开始绕,第三步直接忘了自己在干嘛。这个问题太普遍,不少团队已经默认这是模型的先天短板,只能靠 prompt 技巧或外部编排来补。
规划能力到底是怎么进入模型的,没人搞得清楚。预训练数据来自混杂的互联网文本,没法控制模型从里面学到了什么,也没法追溯某个能力是在哪一步长出来的。后训练阶段各家都在试 GRPO、DPO 这些对齐方法,但哪个对规划能力真正有效、哪个只是看起来有效,同样缺少系统判断框架。
最近 arXiv 上出现了一篇硬核论文——「多轮长程规划的物理学」(The Physics of Multi-Turn Long-Horizon Planning),作者是 Tianyi Men、Zhuoran Jin、Kang Liu、Jun Zhao。他们搭了一个可控的多轮交互环境,系统拆解了规划能力从预训练到后训练的全过程。
预训练:轨迹质量比数据量更致命
核心实验是让模型在可控环境里做多步推理。显式让模型通过 CoT 构建世界模型(建模状态转移),比单纯堆原子技能更能带来长程泛化。原子技能本身不够,必须掺入一些长程规划数据才能组合出泛化能力。
次优轨迹的影响在长程任务里会被严重放大——错误随步数累积,一步偏了后面全偏。这大概是为什么直接从互联网数据学规划很难:网上大量轨迹本身就不是最优的,模型学到的反而是错误模式。
后训练:OPD 在低质量和长程场景下比 GRPO 更稳
论文用互信息把规划能力拆成两部分:通用的规划模式(跨任务通用的推理结构)和任务特定的规划知识(具体领域的操作步骤)。他们识别了后训练的三种应用区间——不必要的、有效的、无法支持的。在低质量和长程规划场景下,OPD(On-Policy Distillation)比 GRPO 的有效区间更宽,原因是 OPD 能提供更一致的更新方向。
多教师蒸馏:能力能否融合,看规划模式是否兼容
多个教师的能力能否成功融合,取决于它们的规划模式是否兼容。兼容的模式可以跨环境泛化,部分共享的可以持续学习,完全冲突的则会导致严重干扰。不是所有能力都能无痛叠加的。
这篇论文没有给出简单答案,但把「规划能力」从黑箱里往外拽了一步,给出了一个分析框架,说明什么条件下什么方法对规划有效、什么情况下反而有害。这些发现值得在训 Agent 或做多步推理时落到实验设计里,尤其是预训练数据的轨迹质量控制和后训练方法的选择。
当然,这是在受控环境里做的研究,结论的迁移性还需要在更真实的任务上验证。但它至少给出了一个更清晰的坐标系来讨论 Agent 的规划问题。
相关链接
- 论文:https://arxiv.org/abs/2607.24720