新研究:神经语言模型内部表征中语法正确性的线性编码证据
新研究:神经语言模型内部表征中语法正确性的线性编码证据
发布日期:2026年7月16日
来源:arXiv: 2607.15175
作者:Jane Li, Najoung Kim
核心摘要
在计算语言学领域,神经语言模型(NLMs)是否真正具备区分句子语法正确性的能力一直存在争议。最新发表于 arXiv 的研究论文《Linear representations of grammaticality in neural language models》指出,传统的基于概率的评估方法存在局限性,因为语法正确性往往与词汇频率、合理性及世界知识等因素纠缠在一起。
本研究通过"质量均值探测"(mass-mean probing)技术,深入分析了预训练 NLM 的内部表征空间。结果显示,语法正确性在多种预训练模型的句子表征中得到了稳健的编码,形成了独立的线性表示维度,且该编码能够跨越不同的语法现象及部分语言进行泛化。这一发现为评估模型的语法能力提供了不依赖字符串概率的新框架。
背景:传统评估方法的局限
既往关于 NLM 语法知识的证据主要依赖于概率测量。即测试模型是否给语法正确的句子分配比语法错误句子更高的概率。然而,这种评估方式受到了批评,主要原因在于:
- 因素纠缠:语法正确性与可能性(likelihood)在本质上被认为是纠缠在一起的。
- 干扰变量:模型分配的概率是多种句子属性的函数,包括词汇频率(lexical frequency)、合理性(plausibility)和世界知识(world knowledge)。
因此,仅凭概率高低难以断定模型是真正理解了语法规则,还是仅仅利用了其他表面特征。
研究方法:超越概率的内部表征分析
为了突破上述局限,研究人员采取了一种新的评估路径:
- 聚焦内部表征:不再仅关注输出概率,而是调查语法正确性是否被编码在 NLM 的内部表征中。
- 质量均值探测(Mass-mean probing):通过该技术测试语法正确和错误的句子在表征空间中是否被系统性地分离。
- 独立性检验:进一步检查这些表征在多大程度上独立于与语法正确性相关的那些句子属性。
- 泛化能力测试:考察这种编码在不同语法现象和不同语言之间的泛化情况。
关键发现
研究结果提供了以下关键证据:
- 稳健的编码存在:语法正确性在一系列广泛的预训练 NLM 的句子表征中被稳健地编码。
- 清晰的分离维度:在语法正确性这一维度上,表征空间中存在清晰的分离,且这种分离不能完全由其他句子级别的替代因素来解释。
- 广泛的泛化能力:这种编码不仅适用于广泛的语法现象,还在一定程度上跨越了不同的语言。
- 连贯的表征维度:结果表明,语法正确性构成了当代 NLM 中一个连贯的表征维度。
行业意义
这项研究对 AI 从业者和开发者具有以下几点启示:
- 评估框架的补充:提供了一套互补的框架来评估语法能力,不再单纯依赖字符串概率。这对于更精确地诊断模型的语言理解能力至关重要。
- 语法知识的本质:为新关于语言模型中句法知识性质的辩论提供了新证据,支持了 NLM 内部确实存在抽象语法结构的观点。
- 跨语言与跨现象的鲁棒性:发现的泛化能力表明,预训练模型可能学到了更通用的语法结构,而非仅仅是特定语言或特定类型的规则记忆。
文献信息
- 标题:Linear representations of grammaticality in neural language models
- 作者:Jane Li, Najoung Kim
- 提交日期:2026年7月16日
- arXiv ID:2607.15175
- 链接:https://arxiv.org/abs/2607.15175