PRO-LONG:程序化记忆让长程推理更高效,ARC-AGI-3 提升 18.0pp 且显著省 token
在人工智能从“对话助手”向“自主智能体”演进的进程中,一个核心挑战日益凸显:如何让模型在复杂、长期的任务中保持清晰的推理链条?
2026 年 7 月 22 日,Alexis Fox、Junlin Wang、Paul Rosu 与 Bhuwan Dhingra 在 arXiv 上发表了题为 《PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning》 的论文(arXiv:2607.20064),提出了一种面向大语言模型(LLM)智能体的最小化上下文管理框架——PRO-LONG。该框架以"程序化记忆"为核心,旨在缓解长程探索任务中"保留信息多则检索困难"的固有矛盾。
一、背景:长程任务的"记忆困境"
长程任务(long-horizon tasks)要求智能体在较长时间内维持持续的感知、推理与探索。这类任务常见于代码生成、科学发现、自动化测试等场景。然而,现有的基准测试如 ARC-AGI-3 持续暴露出 LLM 智能体在该类任务上的短板,尤其在"开箱即用"(out of the box)评估时表现受限。
为弥合这一差距,学界提出了多种 agent harness(智能体运行框架)。这些框架的关键分歧在于如何处理长序列观测:
| 核心问题 | 说明 |
|---|---|
| 保存哪些信息? | 从环境中提取的观测数据,哪些值得长期保留? |
| 如何加载到上下文? | 将历史信息送入模型时,采用何种策略以保证效率? |
作者指出,上下文管理策略的选择具有高度重要性。现有方法普遍面临一个显著的权衡:保留的信息越多,后续从中检索相关细节的难度越大。这一困境类似于"大海捞针"——当上下文中堆积了海量历史交互记录时,模型往往难以精准定位关键线索。
二、PRO-LONG 的设计思路:结构化的"完整记录 + 精准搜索"
PRO-LONG 的核心思想可以概括为两句话:
- 保持完整、结构化的交互日志——不对历史信息做激进裁剪;
- 利用编码智能体的进展,对历史日志进行高效搜索——在需要时精准定位相关信息。
换言之,PRO-LONG 并不在"存多少信息"上做减法,而是通过程序化搜索机制,使模型能够在需要时从完整记录中精准定位相关信息,从而化解"信息保留"与"检索可行性"之间的矛盾。
这种设计路径不同于传统的"上下文压缩/选择性遗忘"策略,提供了一条更为简洁且可扩展的技术路线。
三、关键结果:基于 ARC-AGI-3 的量化表现
在 ARC-AGI-3 的公开测试集上,PRO-LONG 展现出以下量化效果:
1. 相对基线提升显著
相比基础编码智能体(base coding agent),在前沿模型上平均提升 18.0 个百分点。
2. 匹配甚至超越专用框架
性能匹配或超过现有的最先进专用 harness(state-of-the-art specialized harnesses),最高达到 76.1% pass@1。
3. 成本效率突出
在上述对比中,PRO-LONG 使用的 token 数量仅为对比方法的 1/4.2 至 1/5.8(即少 4.2–5.8 倍)。
4. 与 Fable 5 结合的表现亮眼
使用 Fable 5 模型时,PRO-LONG 达到 97.4% best@2,总成本为 $1,750。
| 指标 | 数值 |
|---|---|
| 相对基线提升 | +18.0 个百分点 |
| 最高 pass@1 | 76.1% |
| Token 成本缩减 | 4.2–5.8 倍 |
| Fable 5 + PRO-LONG best@2 | 97.4%(总成本 $1,750) |
这些结果表明,PRO-LONG 在保持高准确率的同时,显著降低了长程推理场景下的计算开销。
四、意义与启示
对 AI 从业者与开发者
PRO-LONG 提供了一条不同于传统"上下文压缩/选择性遗忘"的技术路径:以结构化记录 + 程序化检索来支撑长程智能体的记忆需求。其"最小化框架"的定位也意味着它更容易嵌入现有 agent 管线,而非要求重写整套推理架构。
对创业者与技术决策者
该工作提示在长程任务场景中,token 成本与检索效率可能成为比单纯模型规模更关键的瓶颈;而通过记忆管理机制优化这两项指标,有望带来可量化的性能—成本优势。
五、资源链接
- 论文摘要页:https://arxiv.org/abs/2607.20064
- 实验性 HTML 版本:https://arxiv.org/html/2607.20064v1
- 代码与日志:https://github.com/alexisfox7/PRO-LONG
注:以上所有事实、数字与链接均来自所给材料,未引入材料外信息。