PRO-LONG:程序化记忆让长程推理更高效,ARC-AGI-3 提升 18.0pp 且显著省 token

用“程序化记忆”破解长程推理瓶颈:PRO-LONG 框架解读

在人工智能从“对话助手”向“自主智能体”演进的进程中,一个核心挑战日益凸显:如何让模型在复杂、长期的任务中保持清晰的推理链条?

2026 年 7 月 22 日,Alexis Fox、Junlin Wang、Paul Rosu 与 Bhuwan Dhingra 在 arXiv 上发表了题为 《PRO-LONG: Programmatic Memory Enables Long-Horizon Reasoning》 的论文(arXiv:2607.20064),提出了一种面向大语言模型(LLM)智能体的最小化上下文管理框架——PRO-LONG。该框架以"程序化记忆"为核心,旨在缓解长程探索任务中"保留信息多则检索困难"的固有矛盾。


一、背景:长程任务的"记忆困境"

长程任务(long-horizon tasks)要求智能体在较长时间内维持持续的感知、推理与探索。这类任务常见于代码生成、科学发现、自动化测试等场景。然而,现有的基准测试如 ARC-AGI-3 持续暴露出 LLM 智能体在该类任务上的短板,尤其在"开箱即用"(out of the box)评估时表现受限。

为弥合这一差距,学界提出了多种 agent harness(智能体运行框架)。这些框架的关键分歧在于如何处理长序列观测:

核心问题 说明
保存哪些信息? 从环境中提取的观测数据,哪些值得长期保留?
如何加载到上下文? 将历史信息送入模型时,采用何种策略以保证效率?

作者指出,上下文管理策略的选择具有高度重要性。现有方法普遍面临一个显著的权衡:保留的信息越多,后续从中检索相关细节的难度越大。这一困境类似于"大海捞针"——当上下文中堆积了海量历史交互记录时,模型往往难以精准定位关键线索。


二、PRO-LONG 的设计思路:结构化的"完整记录 + 精准搜索"

PRO-LONG 的核心思想可以概括为两句话:

  1. 保持完整、结构化的交互日志——不对历史信息做激进裁剪;
  2. 利用编码智能体的进展,对历史日志进行高效搜索——在需要时精准定位相关信息。

换言之,PRO-LONG 并不在"存多少信息"上做减法,而是通过程序化搜索机制,使模型能够在需要时从完整记录中精准定位相关信息,从而化解"信息保留"与"检索可行性"之间的矛盾。

这种设计路径不同于传统的"上下文压缩/选择性遗忘"策略,提供了一条更为简洁且可扩展的技术路线。


三、关键结果:基于 ARC-AGI-3 的量化表现

ARC-AGI-3 的公开测试集上,PRO-LONG 展现出以下量化效果:

1. 相对基线提升显著

相比基础编码智能体(base coding agent),在前沿模型上平均提升 18.0 个百分点

2. 匹配甚至超越专用框架

性能匹配或超过现有的最先进专用 harness(state-of-the-art specialized harnesses),最高达到 76.1% pass@1

3. 成本效率突出

在上述对比中,PRO-LONG 使用的 token 数量仅为对比方法的 1/4.2 至 1/5.8(即少 4.2–5.8 倍)。

4. 与 Fable 5 结合的表现亮眼

使用 Fable 5 模型时,PRO-LONG 达到 97.4% best@2,总成本为 $1,750

指标 数值
相对基线提升 +18.0 个百分点
最高 pass@1 76.1%
Token 成本缩减 4.2–5.8 倍
Fable 5 + PRO-LONG best@2 97.4%(总成本 $1,750)

这些结果表明,PRO-LONG 在保持高准确率的同时,显著降低了长程推理场景下的计算开销。


四、意义与启示

对 AI 从业者与开发者

PRO-LONG 提供了一条不同于传统"上下文压缩/选择性遗忘"的技术路径:以结构化记录 + 程序化检索来支撑长程智能体的记忆需求。其"最小化框架"的定位也意味着它更容易嵌入现有 agent 管线,而非要求重写整套推理架构。

对创业者与技术决策者

该工作提示在长程任务场景中,token 成本与检索效率可能成为比单纯模型规模更关键的瓶颈;而通过记忆管理机制优化这两项指标,有望带来可量化的性能—成本优势。


五、资源链接


注:以上所有事实、数字与链接均来自所给材料,未引入材料外信息。