让 Agent 学会「如何演化」:清华、华为提出层次化技能元演化框架 HiSME

大模型 Agent 的“进化论”:清华提出 HiSME,让技能演化算法自我迭代

在人工智能迈向自主智能体的浪潮中,一个核心痛点始终存在:如何让大模型在部署后,不更新参数却能将经验转化为能力?

清华大学计算机科学与技术系李旭浚、郑克寒等人联合华为基础模型部,提出了 HiSME(Hierarchical Skill Meta-Evolving) 框架。这项发表于 arXiv 的研究不仅解决了 Agent 在工具调用和长程任务中的适应性问题,更颠覆了一个传统认知:负责产生技能的算法本身,也可以在学习过程中不断进化。

从“静态技能”到“动态演化”的范式转移

目前的 Agent 系统普遍采用“技能演化”范式:在执行任务后,系统从轨迹中提取可复用的技能(如 API 调用流程),并在后续相似任务中检索使用。这属于测试时学习(Test-time Learning)的一种应用。

然而,现有方法面临两大瓶颈:
1. 适配性差:单一策略难以兼顾强调状态追踪的工具调用和依赖失败恢复的开放世界任务。
2. 维护成本高:若演化算法本身存在偏差,系统会反复生成低质量技能,导致大量人工修复成本。

HiSME 的核心洞察在于:既然技能可以从经验中演化,那么生成技能的元算法(Meta-algorithm)为何不能也从经验中演化?

HiSME 技术架构:三层驱动的自我进化系统

HiSME 不触碰底层 LLM 的参数,而是在文本空间中同时优化两类对象:面向任务执行的“技能”面向技能生成与维护的“元技能”。其结构分为三个层次:

1. 轨迹层(Trajectory):数据的源头

这是 Agent 执行任务的原始记录。无论成功与否,只要系统能评价其效用(成功率、正确性等),就能从中抽取“该怎么做”或“不该怎么做”的经验。

2. 技能演化层(Skill Evolution):经验的提炼工厂

这一层通过一套完整的组件闭环来维护技能库:
* Extractor & Refactorer:分别从单条轨迹中发现候选技能,并从多条轨迹中抽象共享结构。
* Bundle Tester & Credit Assigner:检查技能契约并分配后验信用,确保技能既有效又具复用性。
* Refiner & Filter:修订缺陷技能并过滤噪声,防止技能库污染。

3. 元技能演化层(Meta-Skill Evolution):进化的进化

这是 HiSME 最具创新的部分。系统不仅评价“技能好不好”,还评价“产生技能的算法好不好”。
* 当某个技能被验证有效或无效时,反馈会被写回对应的算法角色(如 Extractor 或 Refiner)。
* 通过 Meta Refiner,这些反馈沉淀为 Meta Skill——即面向算法角色的方法论规则。

举个例子:
* Extractor 学到的元技能:“不要仅凭表层情绪词抽取工作流,除非它对应可验证的状态或 API 前置条件。”
* Refiner 学到的元技能:“当技能误触发时,优先收窄触发条件。”

这些元技能以轻量级的文本规则形式注入 Prompt,直接指导后续的演化算法,使其越用越聪明。

实验验证:在复杂环境中展现显著优势

论文在 BFCL-v3 multi-turn base(多轮工具调用)和 MineDojo(Minecraft 开放世界长程交互)两大基准上进行了验证。

  • 性能稳定领先:相比无技能基线、静态技能演化方法(SkillX)及其他 Test-time Learning 基线,HiSME 均表现出稳定优势。
  • Token 开销大幅降低:在 MineDojo 等长程任务中,高质量技能减少了无效探索和重复重试,让 Agent 更快找到执行路径。
  • 元技能具备迁移性:研究进行了 "meta-test",将学到的元技能冻结并用于初始化新的静态演化系统。结果显示,“带元技能初始化”的系统显著优于从零开始,并接近完整 HiSME 的性能。这证明元技能本身具有极高的质量和通用价值。

意义与展望:从 Skill 到 Harness 的重新定义

HiSME 的价值远超 Benchmark 分数的提升,它提出了一种全新的 Agent 系统优化范式

传统观点认为测试时学习仅发生在模型参数或经验库中。而 HiSME 表明,围绕模型运行的外部 Harness(包括提示词、工具路由、记忆策略、评测器及技能维护逻辑)都可以成为可演化的对象。

未来,这一方向可能引出两个重要趋势:
1. Learning to Evolve:结合文本化元技能与轻量参数学习,让系统同时掌握“经验内容”和“演化能力”。
2. Automatic Harness Engineering:针对不同任务和模型,自动调整外部驾驭系统,使 Agent 在部署后形成最适合自身的工作方式。

对于日益复杂的 Agent 系统而言,真正的挑战已不再是“让模型做对一次任务”,而是让它在真实反馈中判断:哪些经验值得保留,哪些规则应该收窄,甚至哪些失败模式说明演化算法本身需要改变?

HiSME 给出的答案是:让 Agent 活不止一次,也让它的学习方式本身有机会被学习。


论文来源:arXiv: 2605.28390
研究机构:清华大学计算机科学与技术系、华为基础模型部