频率高的词不用学语法?这篇论文讲透了语言组合性的演化条件

上周刷 arXiv 的时候看到一篇 preprint,标题平平无奇——《Evolving language compositionality in a frequency-structured meaning space》。点进去读完,觉得这东西跟搞 AI 的人关系比想象中大。

论文本身做的是语言演化模拟,用的是迭代学习模型(iterated learning model)。这个模型在认知科学里不算新:一群人(其实是智能体)把语言一代一代往下传,每代只能看到有限样本,传着传着语言就自己长出组合性(compositionality)来了——也就是能用规则组装意思,而不是死记硬背每个表达。这个结论十几年前就有了,经典。

但这篇加了新变量:频率结构。意思是,并不是所有含义在交流中出现的次数都一样。有些含义天天说,有些半年才用一次。作者想看的,就是这种频率差异会不会改变语言演化的方向。

第一个发现是,高频含义会「逃逸」语法压力。在标准迭代学习模型里,组合语法之所以能站稳,是因为每代学习者都面临传输瓶颈——样本太少,死记硬背记不全,只能靠归纳规则来覆盖没见过的情况。但如果某个含义出现频率特别高,它就被直接记住了,不需要走规则那条路。这跟自然语言里的现象对得上——英语里 go 的过去式是 went,不遵守加 -ed 的规则,因为太常用了,直接整块存储。高频词不规则化,不是例外,是规律。

第二个发现才让我停下来想了一下。研究者把频率结构换了一种布置方式:不是让「整个含义」有的高频有的低频,而是让含义的「组成部分」出现频率不同。这听起来像是更细粒度的设计,结果却出问题了——语言系统没能稳定传下去。虽然那些高频部件学得很牢,但整个系统就是组装不起来,跨代之后直接崩了。

原文的说法是:频率只有定义在「可以被整体习得的含义单元」上时,才能塑造涌现的语言结构。一旦分布到更小的单元上,就支撑不起组合泛化所需的关联结构了。

这个结果对搞 LLM 的人来说有点扎心。现在的语言模型,本质上是在一个频率极度倾斜的数据分布上训练的——高频词、高频 n-gram、高频指令模板,全都在训练语料里反复出现。而 tokenizer 把句子拆成子词单元(subword units),模型学的是这些单元的共现统计,而不是天然的含义单元。换句话说,我们刚好在干论文里说的「把频率分布在更小单元上」这件事。

论文没直接讨论神经网络,但它的结论指向一个值得认真对待的假设:如果频率结构被切碎在子词层面上,而模型又没能在这个层面上自发重建出组合性的含义结构,那它的泛化行为就会不稳定——能记住高频搭配,但面对没见过的组合就容易失控。这跟我们观察到的 LLM 行为是一致的:高频模式学得极好,组合泛化时好时坏。

当然,迭代学习模型跟 Transformer 训练是两套机制。前者是文化传播,后者是损失函数驱动。但它们在「从有限数据中归纳出组合结构」这个核心问题上,面对的是同样的约束:频率分布、单元粒度、传输瓶颈。

这篇 preprint 已经提交给 Wivace 2026,目前挂的是 CC BY-SA 4.0 许可,17 页正文加附录。我建议手头在做 tokenizer 设计、数据配比或者少样本泛化相关工作的朋友花半小时读一下。论文不一定对,但它给的启发方向,比不少「我们提了一个新注意力机制」的文章有用。