那个被群嘲的「delve」,其实是AI圈的一场语言意识形态战争

经常刷社交媒体上AI讨论的人,大概都见过这种场景:有人贴了一段AI生成的回复,评论区有人指着某个词说「AI味儿太重」。「delve」是高频挨批的词之一。

但问题在于——对第一语言不是美式英语的人来说,delve 可能是正常在用的词。它又不是AI发明的,在东南亚、非洲、南亚英语里一直活着。只是硅谷的模型训练数据把这些地区的用法标记成了「少数派」,于是当这些地区的用户正常使用自己的英语变体时,却被其他用户嘲讽为「像AI写的」。

这不是一个段子。这是一篇正经论文的切入点。

Kingsley Ugwuanyi 刚挂在 arXiv 上的论文(2607.28528),标题很长,核心意思是:AI 系统正在再生产「标准语言意识形态」——谁说了算、谁的英语算正宗、谁的需要被边缘化,这些老问题被 LLM 重新激活了。

论文的分析路径大致是:训练数据以英语内圈(英国、美国、澳洲等)为主,设计协议和评估基准跟着这些数据走,用户反馈机制又强化了这种偏向。Global South 用户正常输出的英语,在审核和排序环节被系统性地降权,甚至被人类用户标记为「AI 生成」。# 非主导英语变体正被与AI腔混为一谈。

Ugwuanyi 借用了 Christian Mair 的一个概念来解释这个局面——「标准化悖论」:AI 一边通过偏好标准形式来 homogenize 英语,一边又因为训练语料的广泛性和 Global South 标注员的参与,在客观上 pluralize 英语。同一个系统在做两件相反的事。

这对做 AI 产品的人来说不是学术问题。一个面向全球用户的对话产品,reward model 对「delve」这类词的打分方式,直接决定了印度用户、尼日利亚用户、菲律宾用户得到的回复质量。如果评估集是清一色的美式英语写成的,根本测不出模型对其他英语变体的表现。

论文是 13 页的分析,没有提出具体的解法,但把问题说清楚了。它把「AI 生成的语言」这个技术问题放回到了世界英语和社会语言学几十年的争论里——标准化、合法性、谁拥有英语,这些争论现在正在训练脚本、评估榜单和社交媒体评论区里重演。

我不觉得一篇论文能立刻改变模型训练和评估的惯性。但它点出了一件事:我们每天在做的动作——写 prompt、跑评估、看反馈——背后藏着一个语言权力结构。下次有人在你面前嘲讽某个回复「太 AI 了」,多问一句:那是真的 AI 腔,还是另一个英语社区的正常表达?

文章作者信息的 arXiv 页面写的是 CC BY 4.0 许可。13 页,0 张图。全文 PDF 可以直接下载。论文链接