AREX:实现递归自我改进的深度研究智能体
核心事件:2026年7月23日,Shuqi Lu 等24位作者向 arXiv 提交了题为《AREX: Towards a Recursively Self-Improving Agent for Deep Research》的论文(arXiv: 2607.21461),提出了一种名为 AREX 的深度研究智能体架构。
1. 研究背景:发现与验证的非对称性
深度研究任务通常要求智能体寻找同时满足多个约束条件的答案。论文指出,这类任务存在一个显著特征:发现满足多重约束的答案成本高昂,而验证候选答案往往可以分解为可处理的逐项检查。
这种“发现-验证非对称性”表明,单纯延长搜索时间并非最优解。研究团队认为,深度研究智能体应当超越简单的搜索扩展,转而通过验证中间结果来递归地改进当前答案,并利用部分验证状态指导后续的精细化操作。
2. 核心架构:双重循环机制
AREX(Recursively Self-Improving agent)是一类基于递归自我改进(RSI)理念构建的深度研究智能体家族。其核心创新在于交替运行两个循环:
- 内部研究循环(Inner Research Loop):负责收集证据并构建临时答案。
- 外部自我改进循环(Outer Self-Improvement Loop):按约束条件审计答案,识别未解决的声明(unresolved claims),并启动有针对性的后续研究。
为了在长周期内维持这种递归自我改进能力,AREX 学习了一种自主的上下文更新工具(context-update tool)。该工具能够将不断增长的交互历史压缩为一个紧凑的“改进状态”,其中保留了已验证的证据和未解决的约束条件,且不依赖外部模型。
3. 训练策略:缓解稀疏奖励
AREX 在经过验证的合成任务和高质量轨迹上进行了训练,采用了以下两种关键技术:
- Agentic Mid-training:智能体中途微调。
- 长周期强化学习(Long-horizon Reinforcement Learning):针对长周期学习中最终奖励稀疏的问题,训练过程强调了关键步骤,即在获取决定性证据或纠正错误研究方向时的节点。
4. 模型实例与性能表现
研究团队实例化了两个版本的 AREX 模型:
* 一个密集的 4B 参数模型。
* 一个 122B-A10B 参数的混合专家(MoE)模型。
基准测试结果:
在多个权威 benchmarks 上,AREX 均表现出显著优势:
* BrowseComp
* WideSearch
* DeepSearchQA
* Humanity's Last Exam (HLE)
* 其他推理和工具使用基准测试
结果显示,AREX 不仅在同等规模的基线模型中大幅领先,而且在与其他激活参数量大得多的模型竞争时仍保持竞争力。
5. 论文信息
- 标题:AREX: Towards a Recursively Self-Improving Agent for Deep Research
- 作者:Shuqi Lu, Chaofan Li, Kun Luo, Zhang Zhang, Hui Wang, Hongwang Xiao, Zheng Liu, Lei Xiong, Jiahao Wang, Sen Wang, Xiyan Jiang, Wanli Li, Yuyang Hu, Hongjin Qian, Bingyu Yan, Ziyi Xia, Yingxia Shao, Kang Liu, Zhicheng Dou, Di He, Chaozhuo Li, Qiwei Ye, Zhongyuan Wang, Zheng Liu
- 提交日期:2026年7月23日 (Thu, 23 Jul 2026)
- 来源:arXiv: 2607.21461 [cs.AI]
- 链接:
- arXiv 页面:https://arxiv.org/abs/2607.21461
- DOI:https://doi.org/10.48550/arXiv-2607.21461
- PDF 阅读:https://arxiv.org/pdf/2607.21461
- HTML 预览:https://arxiv.org/html/2607.21461v1
6. 开发者观点
这篇论文标志着深度研究智能体从"广度搜索"向"递归验证与自我修正"范式的转变。通过引入内部研究与外部审计的双循环机制,AREX 展示了如何在长周期的复杂推理任务中保持高效和准确。对于 AI 从业者和开发者而言,理解这种利用"发现-验证非对称性"的架构设计,以及通过强化学习优化关键步骤的策略,对于构建下一代具备自主改进能力的智能体具有重要的参考价值。