LLM 指纹注入新思路:不靠乱码,靠「语言混搭」绕过困惑度检测

开源大模型谁都能下,但怎么证明它是你的?

行业里一直在用「指纹注入」做所有权验证——在模型行为里埋一组 trigger-target 对,暗号只有模型主人知道。等模型被人扒走重新分发或者偷偷商用,拿暗号一测,ownership 就坐实了。

但这个方案有两个长期无解的矛盾。用自然语言做 trigger,日常对话很容易意外触发,水印信号还没派上用场就先废了。换成乱码倒是不会被误触了,但 perplexity 滤波器一眼就能筛出来——越狱检测、内容安全过滤看到 perplexity 异常直接标记掉。ownership 还没验证,信号先被拦截了。

过去的指纹方案把「构造 trigger」和「注入 trigger」当成了两个独立阶段。构造的人不管注入时的语言结构,注入的人也不管 trigger 怎么被人察觉。两边脱节,优化各干各的。

arXiv 上 7 月 28 号挂出来的这篇论文(2607.25633),核心主张是构造应该驱动注入,两个阶段必须联合优化。作者提出了 LCF(Linguistically-grounded Code-mixing Fingerprint)框架——用低资源语言做「语言混搭」来构造 trigger,再配合一种「构造感知」的方式把指纹写进模型参数。

具体分两层。构造端用语义密度替换规则和语法偏置混合策略,把几种低资源语言揉在一起生成 trigger。这样产出的文本,perplexity 远低于乱码 baseline,也不会像纯自然语言那样容易被意外激活——在「太容易被发现」和「太容易被误触」之间找到了一条窄路。

注入端叫 LCFEdit。先从一个高资源多语言表征空间导出零空间投影(null-space projection),用这个投影做权重更新,保证注入指纹时不破坏已有知识。再加一步跨语言对齐,把权重更新往 trigger 语言所在的表征子空间里拉。因为构造阶段已经锁定了语言结构,注入知道该往哪个方向用力,不再需要盲目地往参数里硬塞乱码。

论文在不可感知性、可检测性和无害性三个维度上做了评估,ownership 验证信号持久,对模型能力几乎没有影响。当然,这是一篇论文,不是产品。评估在有限场景下完成,对抗攻击还没被充分检验——如果有人专门训练一个去指纹模型,这套混搭语言还能扛多久,现在没人知道。但把语言学和注入优化绑在一起,所有权信号才能真正藏住。

操心模型分发安全或做 LLM 服务的团队,这篇值得跟进后续的实验复现。如果这套方法真能在更多模型和语言对上站稳,那「偷模型不认账」的扯皮空间会小很多。

论文:https://arxiv.org/abs/2607.25633