不训练的分类器,反而更扛攻击——COLM 2026 论文把 LLM 意图路由的 trade-off 算清楚了
搭正经 LLM 应用的人大概率已经碰到这个选择:用户发来的 prompt,到底该交给哪个模型处理?
数学题路由给数学专用模型,代码段走 coding 优化过的模型,日常闲聊留给通用对话——这个决策叫 intent classification,意图分类。做对了,精度和成本都能优化;做错了,一段 Java 代码被扔给通用对话模型,结果就是一顿胡扯。
这个意图分类器,要不要单独训练?
刚被 COLM 2026 接收的一篇论文把这笔账掰开算了。作者对比了两类方法:一类是 training-free,直接从 LLM 的内部表示里捞统计特征来分类,不跑梯度、不更新权重;另一类是 training-based,在 LLM 的表示层上接一个 MLP 或 linear probe 做微调。
粗粒度分类上,两类方法基本拉不开差距。「这是数学题、代码段还是日常对话」,谁都能做到接近饱和。拿现成的 embedding 或者写几条规则就够用了,没必要专门维护一个训练流程。
一旦分类变细,差距就出来了。比如要区分「这段代码是 Java 还是 Python」——类间差异小、决策边界模糊——MLP 和 linear probe 的精细拟合能力明显更强。这个结论不意外,但论文给出了实验层面的量化支撑。
最值得关注的是鲁棒性。训练-free 方法在面对 mixed-intent(一句话里揉了多种意图)和 adversarial prompt(刻意改写文本试图绕过分类)时,表现反而更稳。推测起来也合理:训练过的分类器为了做精细区分,容易在特定特征分布上过拟合,遇到分布外的输入时更容易偏;而没经过额外训练的表示保留了模型更原始的多样性,边缘情况反而不容易翻车。
这对路由选型意味着什么?
如果用户群体稳定、prompt 类型相对干净、而且业务上确实需要细粒度分类——比如要区分不同的编程语言或不同的产品领域——那训练一个轻量分类器性价比很高。MLP 或 linear probe 的训练成本极低,收益可量化。
如果面向的是开放域,用户会各种混搭意图,甚至可能有 prompt 注入的尝试——那 training-free 方案反而更安全。单条精度可能低一两个点,但在 dirty 场景下表现更稳,线上翻车的概率更低。
论文里提到的 training-free 方法基于内部表示的统计特征,拿 LLM 中间层的 hidden state 做轻量聚合,不做梯度更新。这对工程落地也友好:不需要维护额外的训练 pipeline,推理时只增加一次特征提取的开销。
这篇论文也留下了一些没完全回答的问题。比如训练-free 方法在哪些具体的表示层上做统计效果最好?不同规模的 LLM 会不会改变 trade-off 的平衡点?以及——如果用户意图本身就模糊,人都不一定能分清楚,那分类器做到什么程度才算「够用」?
这些问题大概只能等下一批论文,或者在自己的线上系统里慢慢磨了。至少这篇工作把账算清楚了:免费的不一定最准,但可能是最扛打的。选哪个,取决于用户到底有多「脏」。
相关链接
- 论文地址:https://arxiv.org/abs/2608.02415
- COLM 2026:https://colmweb.org