Fine-Tuning 后的 LLM 安全漏洞,终于有人用「蒸馏 + 路由」堵上了

Fine-tune 供应链攻击:一篇论文点出的雷

先讲一个让人不舒服的场景。

你搞到一个开源基座模型,自己攒了一批领域数据做 fine-tune。模型在你任务上的表现确实上去了——代码写得溜,逻辑推理顺,领域知识也没丢。但你不知道的是,你用的这批数据里,有人悄悄塞了「触发器」:某些特定 prompt 组合下,模型会乖乖输出有害内容,而且表面看不出来。等你发现的时候,模型已经既保留了专业能力,又学会了「看人下菜碟」。

这不是阴谋论。这篇 7 月 29 号挂在 arXiv 上的论文——「On-Policy Distillation for LLM Safety: A Routing Approach to Template-Robust Realignment」——把问题摊开了:Fine-tune 是目前做垂直模型的主流手段,也成了最大的攻击面。恶意数据提供者可以在下游数据里嵌入有害行为,让模型「平时正常,触发时作恶」。

现有安全重对齐方法有三个硬伤:重对齐之后模型忘了刚学会的专业技能;防御方不知道攻击者用的 prompt 模板,防御效果直接崩塌;就算模型被重新对齐了,攻击者换一句系统 prompt 也能把它打回原形。

这篇论文的方法叫 ROPD(Routing-based On-Policy Distillation)。过去的安全对齐是「猜模板」——防御方假设攻击者会用什么模板,然后针对这些模板做对齐,攻击者一换模板就失效。ROPD 不再死磕模板,而是建模「安全模型」和「被注毒模型」在输出概率分布上的差异,用 on-policy distillation 把这个差异蒸馏到一个路由模块里,推理时路由实时判断该走安全分支还是被注毒分支。

实验对比了 4 个 SOTA baseline、3 个数据集、3 个基础模型,覆盖不同对齐强度。Baseline 一遇到模板不匹配,下游任务能力就崩,防御效果也跟着垮。ROPD 在模板偏移的情况下,防御效果和能力保留都更稳定。论文也承认 ROPD 不是绝对免疫模板迁移,但这个代价跟现有方法比基本可以忽略。

这篇工作的价值不在于提出了完美方案,而在于指出了一个很现实的漏洞类别——fine-tune 供应链攻击。做垂直模型的人,数据集从开源社区扒、外包标、甚至直接从竞争对手仓库拉,里面有没有夹带私货,没人知道。ROPD 这类方法至少提供了一条不需要知道攻击者模板就能做防御的工程路径。

还有一个细节:论文的 license 是 CC BY 4.0,作者有意让这个方案能被直接复用。从工程角度看,路由式架构对推理延时的增加非常有限,比再跑一轮全参数对齐实际得多。

这套方法目前还只在受限的实验设置里验证过,真实环境下的攻击面肯定比论文里复杂。但方向是对的——不再跟攻击者玩猜谜游戏,而是从分布层面做防御。

正在做模型 fine-tune 的人,或者管着开源数据集合规流程的人,值得花半小时读完这篇论文。它没解决所有问题,但点了一个很多人假装不存在的雷。