Agent 优化器的增益会累积吗?持续学习视角下的 Terminal-Bench 2.0 评估

Agent 优化器的增益会累积吗?持续学习视角下的 Terminal-Bench 2.0 评估

摘要: 本文基于 arXiv:2607.14004 论文,对三种智能体(Agent)优化方法在持续学习场景下的表现进行横向辨析。研究发现:优化增益能否累积,取决于是否在优化循环内置入了回归控制。


一、核心问题:优化增益能否"复利式"累积?

大多数报道的智能体优化方法增益来自"一次性测试"(one-shot):一个智能体针对固定基准进行测试和优化,随后将结果报告为该方法的稳定属性。

这种评估方式没有触及部署环境中真正重要的场景——优化是递归应用的:随着新失败和新任务的持续出现,优化会反复执行。

由此提出的核心问题是:

经过一次优化后,智能体能否在新任务上再次被优化,而不侵蚀第一轮优化产生的增益?

换言之,优化驱动的增益是否会累积(compound)?


二、实验设计:两阶段持续学习评估

2.1 评估框架

该研究构建了一个两阶段持续学习评估(two-phase continual-learning evaluation),基于 Terminal-Bench 2.0 中的高难度任务。

2.2 对比方法

在相同的优化预算下,比较了三种智能体优化方法:

方法 全称/描述
GEPA Agent Harness Optimization 方法之一
Meta Harness Agent Harness Optimization 方法之二
RELAI-VCL Verifiable Continual Learning(可验证持续学习)

2.3 基线

所有方法均与未优化的基线智能体(baseline agent)进行对比。


三、结果分析

3.1 静态单阶段设置下的表现

在传统的、静态的、单阶段设置中,三种方法均优于基线智能体。

3.2 引入新任务后的分化

一旦新任务被引入,三种方法的表现出现显著分化:

GEPA

  • 优化后的智能体在迁移到未见过的新任务时,表现低于未优化的基线
  • 这意味着 GEPA 的优化增益不仅未能累积,反而出现了负迁移(negative transfer)。

Meta Harness

  • 能够良好地迁移到新任务。
  • 但在获得第二次优化预算后,无法进一步提升
  • 优化增益在此方法中停滞

RELAI-VCL

  • 是唯一一种同时满足以下两个条件的方法:
    1. 正向迁移到未见过的任务
    2. 在这些任务被纳入优化目标后,能够继续改进
  • 在每一个评估阶段都达到了最高通过率
  • 终身平均通过率(lifelong average pass rate)达到 76.4%

3.3 量化对比

方法 终身平均通过率
RELAI-VCL 76.4%
GEPA 66.0%
Meta Harness 64.6%
基线(Baseline) 58.7%

四、关键观察:什么让优化增益得以累积?

该研究的核心发现是:

优化增益仅在回归控制(regression control)被内置到优化循环中时才会累积。

回归控制为优化过程提供了一种归纳偏置(inductive bias),用于对抗那些无法泛化的捷径解决方案(shortcut solutions)。

这一观察对智能体系统的长期优化具有重要的实践意义:

  • 如果优化循环中没有防止退化的机制,单次优化的增益可能会在新任务上完全丧失。
  • 可验证的持续学习框架是实现优化增益累积的关键基础设施。

五、对 AI 从业者的启示

5.1 评估范式的转变

从"一次性优化"转向"持续学习评估",是更贴近真实部署环境的必要步骤。

5.2 方法选择建议

在需要长期迭代优化的场景中,应优先选择具备回归控制能力的优化框架。

5.3 研究来源


本文仅基于 arXiv:2607.14004 论文中可核对的事实、数字和时间进行客观辨析,未引入材料外信息。