当44个AI模型被要求"选一个词",它们几乎都选了同一个答案

当44个AI模型被要求"选一个词",它们几乎都选了同一个答案

一项名为"One-Word Census"的新研究揭示了语言模型惊人的一致性

核心事件:2026年7月14日,Tapan Parikh 在 arXiv 上发表了题为 《The One-Word Census: Answer-Choice Conformity Across 44 Language Models》(arXiv:2607.12796)的研究论文,通过对44个语言模型的测试,发现它们在开放选择任务中表现出高度趋同的答案分布。


实验设计:极简却有力的测量工具

该研究的核心贡献是构建了一个极简的测量工具——One-Word Census(一词普查)。具体方法如下:

  • 31个单轮提示词,每个提示词定义一个具有大量合法单字答案的类别(例如:"Name a tree." / "说一种树")。
  • 每个提示词向每个模型提问4次
  • 不使用系统提示词(no system prompt)。
  • 分析采用归一化标记的精确匹配(exact-match on normalized tokens),不使用嵌入向量,也不使用评判模型。
  • 每个模型的测试成本约为1美元

这种设计的精妙之处在于剥离了复杂的评估框架,用一个最基础的"自由选择一个词"任务来探测模型之间的答案收敛性。


关键发现:惊人的趋同

1. "serendipity"成为跨模型的共同选择

当被要求"pick a word -- any word"(选一个词——任何词都行)时,44个模型中有41%的概率选择了"serendipity"(机缘巧合)这个词。这一结果直观地展示了不同模型在开放性任务中的高度一致性。

2. 极端收敛与结构化差异并存

  • 31个类别中,有7个类别的一个答案占据了超过80%的所有回答,收敛程度极高。
  • 然而,模型间的从众程度存在四倍以上的差异(conformity varies more than fourfold across models),且这种差异并非随机,而是呈现结构性模式(structured variation)。

3. 模型类型决定发散程度

  • Persona-和community-tuned模型(人格化和社区微调模型)是最具发散性的,即它们的回答与其他模型差异最大。
  • 最新的旗舰主线模型(mainline flagships)则是最从众的,它们产生的答案几乎不会与其他模型的回答不同。

4. 代际演进中的"趋同-反转"现象

在四个主要模型系列(Claude、GPT、Qwen、Grok)内部,从众程度随着每一代新模型的发布而上升。但值得注意的是,最新一代的Claude和GPT旗舰模型出现了反转——从众度下降。作者指出,这可能是顶级模型重新定位(repositioning)的早期信号。

5. 排名稳健性

通过留一法(leave-one-family-out)验证,模型排名的稳健性系数为 rho = 0.985,表明结论不受具体模型阵容组成的影响。

6. 与人类表现的对比

在与人类的类别生成规范进行对比时,模型群体在20个共享类别中有18个比人类更加集中(more concentrated than people),说明AI模型在开放性任务中的多样性低于人类。


评分方法:答案选择惊讶度(Answer-Choice Surprisal)

该研究提出了一种量化模型从众程度的评分方式:答案选择惊讶度。其计算方式为:

对一个模型的每个答案,计算其在其余所有模型 pooled(合并)答案分布下的平均 -log₂ 概率,采用留一法(leave-one-out)排除自身。

简而言之,如果一个模型的答案在其他模型中很少出现,它的惊讶度就高(更不从众);反之则低。


对从业者的启示

这项研究虽然形式简单,但其揭示的现象对AI从业者具有重要参考价值:

  1. 模型趋同是一个可测量的现象:One-Word Census 提供了一个低成本(约1美元/模型)、高精度的测量工具,可用于持续追踪模型生态的多样性变化。
  2. 旗舰模型的"同质化风险":最新主线旗舰模型的极端从众倾向可能意味着创新多样性的丧失,这对依赖差异化能力的场景构成潜在风险。
  3. 微调模型的价值:人格化和社区微调模型在答案发散性上的优势,表明定制化训练在保留模型独特性方面仍有不可替代的作用。
  4. "反转信号"值得关注:Claude和GPT最新旗舰模型从众度的下降,可能预示着顶级模型正在经历策略调整——这一趋势值得持续观察。

资源链接


本文仅基于材料中可核对的事实撰写,未引入任何外部信息或推测。