把多个 LLM 当成接力赛:这篇论文用 1/7 的成本跑出 GPT-5.2 的水平
WILC:多模型接力逼近大模型,成本七分之一
同一个模型,写代码逻辑不错但输出格式总漏东西,换了另一个整洁了但深层推理又差点意思。不是没有好模型,是每个模型都有自己那堵墙。市面上大部分方案要么堆一个更大的模型硬解,要么搞静态集成——几个模型各答一遍再投票,成本翻倍但效果提升有限。
前两天 arxiv 上挂出来一篇论文,正好在讨论这个问题。标题叫《Harnessing the Wisdom of LLM Crowds through Complementarity-Driven Iterative Collaboration》,7 月 31 日刚提交,作者是 Yanbin Fang、Xuan Wei、Wei Chen。核心思路是让多个模型像接力赛一样,每棒交给最适合当前瓶颈的那个选手。
它提了一个框架叫 WILC(Wisdom Integration of LLM Crowds),即「LLM 群众智慧集成」。两个设计原则。第一是迭代反思-精炼:后一个模型能看到前一个模型的完整输出状态,在此基础上诊断问题、接力改进。第二是互补性驱动的模型选择:用了一个双门控机制——PCF(预期互补性匹配)先选出最适合当前瓶颈的工人模型,PCG(后验互补性增益)再评估这次切换到底有没有让答案变好,两道门都过了才换人。
这跟现在流行的 MoE(混合专家)或者简单路由不太一样。MoE 在 token 级别切给不同专家,用户基本不感知。WILC 是在完整输出层面做接力,每个模型面对的是上一个模型留下的「半成品」和诊断结论,更像一个真正的协作流程。论文的说法是,这是把群体智慧理论从静态聚合扩展到了顺序式的 AI 互补协作。
实验结果放在四个 benchmark 上,WILC 超过了单模型自我精炼、静态集成方案和查询路由方案。论文还给了一个让人无法忽视的对比:在标准定价假设下,WILC 跑出了 GPT-5.2 的平均 benchmark 水平,但估算每次查询的成本大约只有 GPT-5.2 的七分之一。 而且这个框架可以用自托管方式部署,数据主权在自己手里。
七分之一什么概念?假设一个团队每天跑几十万次推理,单次成本从 1 块变 1 毛 4,一年下来差出六位数。更不用说对那些数据不能出 VPC 的金融、医疗场景,自托管加多模型接力是一个现实得多的选择。
论文也有没展开的地方。接力式协作引入了额外的编排逻辑和推理延迟——选模型、传状态、过双门控,这些步骤加起来会不会让首 Token 时间变长?极端场景下多模型来回接力会不会反而拉低下限?论文没有给工程侧的压测数据。另外四个 benchmark 具体是哪四个、覆盖了哪些任务类型,摘要里也没展开,需要读全文才知道 WILC 的强项边界在哪。
过去两年,小模型蒸馏、量化、speculative decoding、Prompt 压缩这些方法都在做同一件事——在推理阶段抠成本,不用 GPT-5 那个价也能接近那个效果。WILC 提供了另一个角度:用多个中号模型的互补性来逼近大模型的能力,同时把成本和安全都控制住。
如果工作流里已经跑着不止一个模型,或者正在搭 Agent 链路但总感觉单模型不够稳,这篇论文值得花半小时读一下 PDF。也许下一个版本的工具链里,加一个「接力编排层」就会成为标配。