腾讯SkillHone:让Agent在持续进化中记住“为什么改”
在构建具备自主优化能力的 Agent 时,开发者往往面临一个令人头疼的悖论:一个 Skill 本周能正常工作,并不代表下周依然有效。
搜索接口会被限流,API 会改版,网页结构也会突变。当开发者修复了某个 Bug 并将文件交给下一轮 Agent 时,新接手的 Agent 拿到的只是冷冰冰的“最终结果”,而不知道前几轮踩过的坑、试过的失败方案,以及为什么最终保留了某些修改。这种“优化历史丢失”,导致 Agent 无法利用过去的经验,极易重复探索已失败的方向,陷入原地打转的死循环。
针对这一痛点,腾讯微信团队在最新论文 SkillHone 中提出了一种面向持续 Skill 进化的开发框架。其核心创新在于:不仅优化 Skill 本身,更对 Skill 的优化过程进行建模,将诊断、候选修改、评估证据和最终决定组织成一份持久决策历史。
📄 论文标题:SkillHone: A Harness for Continual Agent Skill Evolution Through Persistent Decision History
🔗 论文链接:https://arxiv.org/abs/2606.08671
💻 代码链接:https://github.com/Tencent/SkillHone
从“改文档”到“建历史”:SkillHone 的底层逻辑
现有的 Agent 自进化方法大致分为两类:一是 Skill-Creator,根据任务描述直接生成新的 Skill;二是 Hermes-SE,通过不断修改已有 Skill 的候选版本并择优录取。这类方法在单轮优化中能提升效果,但运行结束后,留下的往往只有最终版本的文件。虽然 diff 可以展示“改了什么”,却无法回答“为什么这样改”。
SkillHone 的创新之处在于引入了持久决策历史(Persistent Decision History)机制。它将每次优化的步骤记录为一条完整的历史,包括问题诊断、候选修订、清洗后的评估证据及最终结果。通过累积这些多轮记录,后续 Agent 可以理解某次修改针对的具体问题、依据,甚至是被撤销的原因,从而实现优化经验的持续传递。
简而言之,以前的优化是“改完即忘”,而 SkillHone 是“边改边记,以史为鉴”。
架构解析:Repo 级别的优化与角色隔离
SkillHone 在架构设计上实现了两个关键突破:Repo 级别的更新与角色隔离的调度机制。
1. 突破 SKILL.md 的局限
以往的优化(如 SkillOpt 和 Hermes-SE)主要以 SKILL.md 为单元,本质上是在迭代自然语言描述。SkillHone 则将优化对象扩展为完整的 Skill 仓库(Repo),其中不仅包含 SKILL.md,还涵盖执行脚本、参考资料和模板等。这意味着系统不仅可以修改指令描述,还能直接更新底层的脚本逻辑,使优化更加全面和深入。
2. 双仓库与子 Agent 协作
系统设置了两个相互关联的仓库:
* Skill 仓库:存放技能本体。
* Skill-Eval 仓库:存放练习探针、验证器和回归测试。
为了保证优化的公正性和安全性,SkillHone 采用了严格的角色隔离:
* 优化侧 Agent:负责修改 Skill,但看不到未脱敏的答案。
* 评估侧 Agent:负责运行验证、查看轨迹,但不能写入 Skill 仓库。
运行时调度器会根据需要动态生成诊断、开发、审核、执行和报告等子 Agent。这种设计不依赖固定的多智能体框架,只需运行环境支持自动创建子智能体即可接入 Claude Code、Codex 和 Hermes 等主流 Agent Runtime,具有极高的灵活性。
实验数据:精准回退带来的性能跃升
论文通过对深度研究 Skill 的五轮优化验证,展示了 SkillHone 处理性能回退的强大能力。
- 起步阶段:加入 DuckDuckGo 回退和错误处理后,探针准确率从 30% 提高到 60%。
- 遭遇瓶颈:下一轮加入过早作答和严格预算限制后,准确率反而降低了 10 个百分点。
- 历史优势:Hermes-SE 基于标量分数接受或放弃完整候选,五轮后停在 40%。而 SkillHone 通过查询历史记录,发现是预算策略导致退化,因此只撤销有问题的部分,保留有效的搜索改进,第三轮准确率升至 65%,最终达到 70%。
在 GAIA 和 WebWalkerQA-EN 两个深度研究基准上的主实验显示,使用 Qwen3.6-35B-A3B 作为执行模型时:
* SkillHone 在 GAIA 上达到 64.6%。
* 在 WebWalkerQA-EN 上达到 66.4%。
相比使用商业检索服务的 deep-research Agent,这两个结果分别高出 15.8 和 3.2 个百分点;相比 Hermes-SE,分别高出 14.2 和 13.4 个百分点。
更值得注意的是其迁移能力:同一个 Skill 包在没有重新优化的情况下,直接迁移到 Claude Sonnet 4.6 后,GAIA 成绩继续升至 72.4%。
结语
SkillHone 通过持久化的决策历史和 Repo 级别的更新,解决了 Agent 技能优化中“知其然不知其所以然”的难题。对于 AI 从业者和开发者而言,这不仅是一个提升 Agent 性能的框架,更是一种将技能工程从“单次交付”推向“持续进化”的实践范式。
© THE END
转载请联系本公众号获得授权
投稿或寻求报道:liyazhou@jiqizhixin.com