论文解读:Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations
核心事件
研究人员 Hiskias Dingeto 提出了一种名为 RECAP (Readable Encodings via Co-trained Auxiliary Predictors) 的新方法,用于解决大模型内部激活(Activation)解释的“可验证性”问题。该方法通过辅助预测器保持特定内容解码的可读性,显著提升了模型内部状态解释的准确性与抗欺骗能力。
背景与动机
在 AI 可解释性研究中,自然语言自编码器(Natural-language autoencoders)常被用来评估隐藏激活的解释质量。其核心逻辑是:如果一段解释能够成功重构出原始激活状态,则该解释被认为是“忠实”的。然而,这种基于重构的测试存在结构性缺陷,无法有效识别个别虚假声明。
现有方法的问题
研究揭示了当前基于重构的评估测试存在的两个主要问题:
1. 对具体事实不敏感:如果修改某个声明不会改变重构结果,该声明将不会受到惩罚。
2. 仅追踪大意而非具体事实:在 Qwen-2.5-7B 的释放 verbalizer 上,解释的重构效果虽远高于随机水平,但仅有约 2% 的具体声明对重构有依赖性。
3. 共适应私有代码(Co-adapted private codes):在标准训练配方下,5/5 的实验中会出现这种情况,即模型发展出虚假措辞来依赖重构,而修复后的版本未能改善目标模型的状态。
RECAP 方法与实验结果
RECAP 通过在训练目标模型的同时训练线性头(Linear heads),确保指定内容的可解码性。实验结果如下:
沙盒模型表现
- 真实性提升:新 verbalizer 能够真实陈述指定内容,且相关代码消失。
- 成本极低:仅带来 +0.001-nat 的微小成本。
预训练模型表现 (Pythia-160M)
- 探针解码可靠性:指定内容变得可被可靠探针解码。
- 部分传输限制:新 verbalizer 只能部分传达内容(Truth 0.44-0.46 vs 接近零的控制组)。
安全意义与对抗测试
在 AI 安全领域,RECAP 使得指定的内部内容可以独立于 prose(散文/文本)进行探针检查,防止模型通过文本“作弊”。
对抗性测试场景
针对编辑解释以最大化重构得分并撒谎的 adversaries:
- 谎言抑制率:对手成功抑制了约 87% 的谎言惩罚。
- RECAP 表现:探针仍能标记谎言(AUC 0.95)。
- 对照组表现:控制组的探针表现降至随机水平(AUC 0.51)。
- 常规探针对比:RECAP 训练的探针在区分真实与虚假声明时表现优异(AUC 0.96),而未使用 RECAP 的探针表现较差(AUC 0.82)。
结论
高重构得分并不能证明单个声明的真实性。RECAP 提供了一种独立验证机制,使得内部内容可以被探针独立检查,从而提高了模型解释的透明度和安全性。
参考文献
- 论文标题: Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations
- 作者: Hiskias Dingeto
- arXiv ID: 2607.20379
- 提交日期: 22 Jul 2026
- 链接: https://arxiv.org/abs/2607.20379