“无知”即智慧:当大模型学会“遗忘”,反而更可靠了
摘要: 2026年7月14日,Roi Cohen等人向arXiv提交了一项颠覆性研究——通过让语言模型在预训练阶段"遗忘"实体知识,反而显著提升了其在检索增强场景下的可靠性与准确性。这一名为"知识less语言模型"(KLLM)的范式,为破解大模型幻觉问题提供了全新思路。
核心事件:让模型"不知道",是为了让它"说得更准"
2026年7月14日,由Roi Cohen、Yvan Carré、Nick Lechtenbörger、Hendrik Droste、Lucas Kerschke、Russa Biswas、Gerard de Melo和Jan Buys等8位研究者共同撰写的论文《Knowledgeless Language Models: Suppressing Parametric Recall for Evidence-Grounded Language Modeling》(知识less语言模型:抑制参数化回忆以实现基于证据的语言建模)正式提交至arXiv平台(编号:2607.12831)。
该研究提出了一种全新的预训练范式——"知识less语言模型"(Knowledgeless Language Models, 简称KLLM)。其核心理念是:通过在预训练语料中对命名实体进行匿名化处理,系统性地抑制模型对参数化知识的依赖,从而迫使模型转向基于上下文证据的推理模式。
这一做法与传统大模型"尽可能多地学习知识"的理念背道而驰,但实验结果却表明:适度的"无知",反而带来了更高的可靠性。
方法解析:如何制造一个"知识less"模型?
命名实体匿名化
在标准的大模型训练中,模型通过海量文本学习事实性知识(如"巴黎是法国首都""埃隆·马斯克是特斯拉CEO")。这些知识被编码在模型的参数中,形成所谓的"参数化记忆"。
KLLM的做法是:在预训练语料中,将所有命名实体替换为占位符。例如:
原文:
巴黎是法国的首都。
处理后:[ENTITY_A]是[BOUNTRY_B]的首都。
这种做法切断了模型将特定实体与事实属性直接关联的通道,从而削弱了其闭卷回答事实问题的能力。
训练目标不变,只是输入变了
研究者并未改变模型的架构或损失函数,而是仅修改了预训练数据的构成。模型仍然学习预测下一个词,但输入中不再包含可供直接记忆的实体-事实对。
预期效果
- 闭卷问答能力下降:模型无法再自信地编造事实。
- 开卷/上下文依赖能力上升:当相关证据作为输入提供时,模型更倾向于基于上下文推理,而非依赖内部记忆。
实验结果:KLLM在哪些任务上表现更好?
根据论文摘要披露的数据,KLLM在多个基准测试中展现出优势:
| 评估维度 | 关键发现 |
|---|---|
| 上下文问答 | 在提供相关信息的任务中,KLLM consistently(一致地)优于匹配基线模型 |
| 事实验证 | 在需要判断陈述是否正确的任务中表现更佳 |
| 幻觉检测 | 在识别模型自身生成内容中的幻觉方面表现更好 |
| 检索增强场景 | 在使用不完美的检索证据时,KLLM相比标准语言模型实现了20%-25%的相对提升 |
| 校准度 | ECE(期望校准误差)、Brier Score和AUROC指标均有所改善 |
| 拒答行为 | 表现出更可靠的"我不知道"式拒答能力 |
值得注意的是,这些结果跨越多模型规模(multiple model scales)均成立,说明该效应并非特定于某一参数量级的模型。
行业启示:对AI从业者的三个信号
信号一:预训练策略可以成为控制模型行为的杠杆
当前业界对幻觉问题的应对主要集中在推理阶段(如引入RAG、思维链、自我反思等后处理机制)。KLLM研究表明,在预训练阶段对知识获取进行干预,同样可以有效塑造模型的认知行为。这为模型设计提供了一个新的调控维度。
信号二:"少即是多"在知识学习中可能成立
传统观点认为,模型学到的知识越多,性能越好。但KLLM的结果暗示:过多的参数化知识可能在某些场景下成为负担——当外部证据与内部记忆冲突时,模型可能优先信任错误的内部记忆。抑制这种倾向,反而能提升整体可靠性。
信号三:KLLM不是替代RAG,而是增强RAG
论文明确指出,KLLM的价值在于为检索增强系统提供一个更敏感于证据的基础模型。换句话说,KLLM与RAG是互补关系,而非竞争关系。一个经过KLLM训练的模型,在使用RAG时会更谨慎地对待检索到的证据,更少地用自己的"记忆"去覆盖它。
局限与开放问题
尽管结果令人鼓舞,但该研究也存在若干值得关注的局限性:
- 闭卷能力确实下降了:KLLM在不需要外部证据的场景下表现不如标准模型。这意味着它不适合完全依赖内部知识的任务。
- 匿名化策略的细节未充分披露:论文摘要未说明匿名化的具体粒度(是全量匿名还是部分匿名)、是否保留实体类型信息等。
- 下游任务的适配成本:企业级应用需要重新评估其模型选择策略,从"追求知识广度"转向"追求证据敏感性"。
结语:重新思考"智能"的定义
KLLM研究挑战了一个根深蒂固的假设:智能等同于知识积累。它提醒我们,在信息过载的时代,筛选、验证和基于证据推理的能力,可能比单纯的知识储备更重要。
对于AI从业者而言,这篇论文提出了一个值得深思的问题:
我们是在构建一个"知道一切但不可靠"的模型,还是一个"知道得少但值得信赖"的模型?
答案或许取决于应用场景。但在那些对准确性要求极高的领域——医疗诊断、法律咨询、金融分析——"可靠的无知"可能远比"自信的幻觉"更有价值。
参考文献:
- Cohen, R., Carré, Y., Lechtenbörger, N., Droste, H., Kerschke, L., Biswas, R., de Melo, G., & Buys, J. (2026). Knowledgeless Language Models: Suppressing Parametric Recall for Evidence-Grounded Language Modeling. arXiv:2607.12831. Retrieved from https://arxiv.org/abs/2607.12831