从闭源到开源:一篇新论文用「协议蒸馏」解决 Agent 能力迁移的老毛病

想拿开源小模型复现 GPT-4 那种能自己查资料、多步推理的 agentic search 能力,已经折磨了不少人大半年。最常规的路径是蒸馏——让大模型当老师,小模型跟着学。但实操过的人都清楚,这条路有两个死结:一是闭源模型不给你 logits,传统 logit-level 蒸馏根本没法做;二是让小模型直接模仿大模型的回答文字,学来的多半是废话连篇的话术,推理结构却没学到。

最近 arXiv 上挂出来一篇论文,标题很直白——《From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search》。几位作者来自学术界,提出了一个叫 MAPD(Multi-Agent Protocol Distillation)的框架,专门解决上面那个「学不会」的问题。我看完觉得这个思路值得开发者关注。

Agentic Search 的问题出在哪

所谓的 agentic search,简单说就是让 LLM 不只靠内部知识回答问题,而是让它自己能决定什么时候去查资料、查什么、查完怎么整合,中间可能还要根据结果修正搜索策略。这是一个多步推理加检索的联合决策问题。

用 RL 做优化是标准思路,但 reward 是稀疏的——模型做对了一长串动作,最后只在终点拿到一个信号,中间每一步对不对只能猜。知识蒸馏理论上可以给更密集的指导,前提是你得找到一个能「拆开讲」的老师。

Logits 拿不到,模仿学皮毛

问题来了:GPT-4、Claude 这些闭源模型,API 不暴露 logits,而且 tokenizer 不一样,传统 logit-level 蒸馏直接废掉。那就退而求其次,让小模型直接模仿大模型输出的自然语言推理链条。

做过这个的人都知道结果什么样——学生模型学会了老师的语气和废话率,但遇到没见过的搜索路径,该断的时候不断,该查的时候不查。论文把这个叫「style drift and verbosity degeneration」,翻译成人话就是:学了一嘴官腔,能力没到手。

MAPD:不学话术,学协议

MAPD 的核心想法是把「老师怎么推理」这件事从自然语言里抽出来,编码成一个结构化的中间协议。

具体做法是构建一个离线多智能体系统(multi-agent system),对于每一个 query,这个系统会做:拆解任务类型、制定推理计划、检索支持证据、修复失败的搜索——然后把整个探索过程转成一个 JSON 协议。这个协议里包含任务类型、推理步骤和带原文定位的事实依据。

训练的时候,这个 JSON 协议只喂给学生模型的一个 privileged branch(可以理解成一个只在训练时存在的辅助分支),让这个分支产生的 token 分布提供一个 dense 的蒸馏信号,和稀疏的 RL 目标一起联合优化。推理时 privileged branch 被拿掉,不增加部署成本。

效果和数据

论文在 7 个 QA benchmark 上做了评估。MAPD 在两个开源基座上都有提升:Qwen3-1.7B 平均成功率 39.4%,Qwen3-4B 平均成功率 44.4%,持续优于对比的蒸馏和 RL 方法。论文还声称这个框架对不同闭源老师模型(即使用不同的 proprietary model 做 teacher)都能稳定泛化,同时有效抑制了学生模型的风格漂移和冗长退化。

我的看法

这篇论文的选题非常具体,打的是工程师每天都在碰但论文很少正面解决的痛点——闭源模型的 API 不给你 logits,你还想把它能力抽出来。MAPD 用协议作为中间表示,等于给蒸馏加了一层「翻译层」,把学推理结构和学口头禅分开了。

当然也有值得怀疑的地方。多智能体系统离线构造 JSON 协议这一步本身有设计成本和开销,协议的质量决定了蒸馏的上限。论文目前的评估集中在 QA benchmark 上,距离真实生产环境中开放域 agentic search 还有距离。而且「privileged branch」这个设计虽然在推理时无成本,但训练时的框架复杂度不低,能否在社区里被广泛复现还要看代码开源情况。

截至发稿,论文已经挂在 arXiv 上,PDF 和 HTML 版本都可以直接看。如果你也在折腾小模型 agent 能力迁移,这篇值得花半小时读一下原论文。