腾讯元宝搜索Agent的训练框架公开了,核心是解决那个「对齐税」问题

搜了一圈昨天的arXiv,让我停住的是这篇——腾讯元宝搜索Agent背后的训练框架正式公开了。论文标题《Cross-Domain Hybrid OPD for Generalizable Search Agents》,8月3号挂出来的,通讯作者里有Jeff Chen这些熟悉的名字。不过更值得看的是它正面处理了一个模型落地团队都会遇到的问题:对齐税。

所谓对齐税,就是让模型专门干一件事——比如搜索——它确实变能干了,但干别的就变傻了。搜索规划能力上去了,闲聊、写作、逻辑推理全面倒退。这是实实在在的损失。很多团队的选择是妥协——要么不做深度搜索专项,要么做了就认能力降级。

元宝这个方案有意思的地方在于,它不认。框架基于Hun yuan3架构,核心是两个东西叠在一起跑:Agentic RL负责让模型学会自主搜索,包括多步规划、动态检索这些搜索Agent的能力;然后在此基础上加一道跨领域专家On-Policy Distillation(OPD)——用多个保持通用能力的专家模型,在线蒸馏回搜索专用模型里。不是先做完搜索再补课,而是搜索训练和通用能力保持同时发生。

用论文的话说,hybrid training jointly optimizes both。它把专用化和通用化从竞争关系改成了联合优化。这听起来像一个trick,但做过RL加蒸馏的话,on-policy蒸馏的时机、专家的领域覆盖度、学生模型的容量分配,每步都是坑。能把流程跑通并出结果,工程投入不小。

实验结果部分,搜索能力达到competitive水平,通用能力还有持续提升。这大概是这篇报告最有价值的信号:做好搜索Agent不需要牺牲通用能力,关键在于训练框架怎么设计。如果正被对齐税折磨——用RL做强了代码弱了对话,或者做强了搜索弱了理解——这个框架的思路值得直接参考。

这是个tech report,不是完整论文,很多实现细节比如蒸馏的具体损失函数、专家模型大小、RL的reward设计都没有展开。它更像一个能力宣示:路是通的。但做过工程的都清楚,从路是通的到跑通自己那条路,中间还有无数实验在等着。

如果正在做Agent产品,或者在对齐税里反复折腾,可以下载这篇PDF看看。至少它给出了一个已经验证过的方向。

Paper链接:https://arxiv.org/abs/2608.02101