LLM 当不了人类被试:六个模型模拟信念更新,全翻车了

去年开始,我注意到越来越多人用 LLM 替代人类被试做实验。发问卷太慢,招人太贵,Prolific 上一个人好几美元,而 API 调用一次几分钱。逻辑看起来也自洽:LLM 读了那么多人类文本,总该知道人会怎么想吧?一篇刚挂上 arXiv 的论文给了直接回答——不知道。

这篇由 Sebastian Pohl 等七位作者完成的实验,设计得很干净。他们拿了 391 位英国被试在 Prolific 上产生的真实数据——每个人就三个话题读了 Reddit 评论后更新了自己的立场——然后让六个 LLM 一对一地模拟这 391 个个体。每个 LLM 会拿到一个根据该被试人口统计学和人格特征数据生成的 persona,再被要求做出一样的信念更新。

结果六个模型全倒了。

如果直接把被试的真实初始立场喂给 LLM,Qwen3-32B 和 GPT-5-Mini 这两个模型——注意,只有这两个——能比较准确地匹配人类读完评论之后最终立场的整体分布。这算一条及格线:给定起点,模型能大致走到跟人类一样的终点区域。

但问题在于,一旦要求模型自己生成初始立场——也就是从 persona 推测这个人一开始会怎么想——六个模型无一例外全部失败。从自生成的初始立场出发做信念更新,结果完全不忠实——没法让 LLM 先猜一个人怎么想,再猜他怎么被说服。

论文挖出了三个系统性的偏差,贯穿所有测试模型。

第一,模型过度给出中立立场。比起真人,LLM 更倾向于选择折中答案——要么是中间选项,要么表态更温和。这跟其他很多性格模拟研究里观察到的"中庸偏向"一致,但在信念更新场景里它尤为致命,因为人恰恰是在被说服后剧烈移动的那些点最有研究价值,而模型恰好把这些点磨平了。

第二,模型比人类更频繁地改变立场,但每次改变的幅度更小。人类可能读完一条评论就从中立跳到强烈支持,也可能从头到尾不改。模型不是这样,它频繁微调,但几乎不做大幅跳跃。很多 Agent 应用里也有这个问题:LLM 做决策时容易震荡,不会像人一样在某个点真正"想通"。

第三,模型无法按说服力给评论排序。给它五条评论,它分不出哪条最能让人改变想法。这太关键了——信念更新不只是"收到信息",而是"被某条信息真正击中"。LLM 分辨不出什么是击中人心的那一下。

还有一个发现值得单独拎出来:人口统计学和人格特征构建的 persona,对于提升模拟保真度没有一致效果。告诉模型"这个用户是男性、大五人格开放性高"之类,基本不影响它模拟得准不准。

文章结论说得很克制:LLM 对信念动态的模拟,只有在基于现实的初始条件时才可靠,而这恰恰是目前多轮社交媒体模拟几乎不提供的东西。翻译过来——论文里看到的"用 LLM 模拟人类对舆论变化反应"的做法,大概率不可信。

这不是说 LLM 完全没用。如果已经有了每个被试的真实前测数据,拿 GPT-5-Mini 或 Qwen3-32B 去模拟后续分布,还能凑合。但最流行的做法——给 LLM 一个角色设定就让它当人类发言——基本是空中楼阁。

过去一年里我遇到过两次具体场景,跟这篇论文说的一模一样。一次是帮一个朋友搭舆情模拟,他想让 LLM 扮演不同立场的用户在社交媒体上互动,我试了几轮就觉得输出像一群客气人在开会,谁也不真急眼,原来这不是 prompt 问题,是模型本性。另一次是审一个学术稿,作者用 GPT-4 模拟被试做了五个实验,没有提供任何初始条件,直接让模型"从一个了解 X 的人的角度回答"。我当时觉得怪,但说不出哪儿不对。现在有答案了。

唯一还没搞清楚的,是这些偏差到底来自预训练语料里人类表达本身的偏斜,还是 RLHF 阶段对中立和安全倾向的强化。如果是后者,那可能换一个对齐策略就能缓解不少——但这就是下一篇论文的事了。