只关掉40个神经元,偏见就变了——一篇论文拆了LLM的「偏见回路」
训过模型、调过对齐、跟偏见数据打过架的人都知道,改模型行为有多重。RLHF得攒偏好数据、重新跑训练,直接微调也得上万步,改完还不一定知道到底改了哪根筋。
所以当看到这篇论文时,我愣了一下。
三个研究者提了一个叫 Fairness Pruning 的方法,核心动作极其简单:找到模型里对「性别」「种族」这类人口统计属性特别敏感的神经元,然后把它们的输出置零。不需要重新训练,也不需要加分类头——就是关掉,而且最多只关 40 个。在 Llama-3.2-1B 上,这不到总 MLP 宽度的 0.031%。
结果呢?模型对性别、种族相关提示的响应确实变了。模型的推理和通用知识能力平均保留了 99.49%,几乎没掉。
怎么找到那 40 个神经元
他们的做法大致是:构造两组提示,只改一个词——比如「程序员很聪明」和「护士很聪明」——然后跑推理,盯着 GLU-MLP 层的 down_proj 输入位置看哪些神经元的激活值差异最大。那些差异大的,就是对「性别」这个属性敏感的节点。
这属于因果定位的思路——通过最小对比直接触发差异信号。论文中称为「推理时激活捕获」,配合最小对比提示对,定位到具体神经元。
方法本身不复杂,胜在干净。它只针对 GLU 架构——现在大部分主流开源模型都是 GLU 变体,像 Llama、Qwen、Mistral 都吃这套。
关掉之后发生了什么
论文的用词值得细读。他们说干预导致的是「双向偏差失稳」(bidirectional bias destabilization),而非单向的偏差消除。原因在于 BiasScore 是无符号的,定位出来的候选神经元里,有些是推波助澜的,有些反而是对抗刻板印象的。全部置零之后,净效果取决于哪一边占主导。
这个方法目前擅长的是找到偏见在哪,然后打乱它,但还不能精准地只消除「坏」方向。
这也是论文自己划的边界:它是一套方法论基础,目标是未来从「盲目清零」过渡到「定向行为调制」。现在能证明的是:偏见处理和模型能力确实是可分离的神经回路。
这意味着什么
对做模型对齐和审计的人来说,这篇提供了一个极轻量的检查工具。不需要搭训练流程、不需要攒对比数据,几对 prompt 跑一次推理,就能定位到具体神经元。要确认某个版本的模型是否对某些人口统计属性有敏感节点,代码和数据都已经公开了。
但它不是投产级的偏见消除方案。3B 参数以内的模型验证、定性生成实验+标准基准评测,这是论文的实验范围。0.031% 的神经元占比虽然漂亮,但双向失稳意味着生产环境里不太敢直接这么用——关掉后实际输出往哪个方向偏,事先并不确定。
不过这个方向很有意思。如果能从「找到偏见回路」进化到「定向扭转特定方向」,那对齐工作的粒度会从整个模型压缩到几十个神经元的级别。以后发模型更新补丁可能不再是「新权重.ckpt」,而是一张几十个索引的关停列表。
论文、代码和数据集均已公开。