LLM 当模拟受访者,别只看它选了什么,要看它怎么想的

现在有不少团队在用 LLM 做「社会模拟器」——拿模型当合成受访者填问卷、做概念测试。省钱、快、样本量大,看起来很美。但这两天 arXiv 上有一篇论文,点名说了一个很多人选择性忽视的问题:LLM 模拟出来的答案,对是对,但推理过程可能完全是废的。

这篇论文叫《Reason-Mediated Behavioral Models for Auditing LLM Social Simulators》,作者是 Atharva Pandey 和 Gautam Jajoo。他们没有停在「批评」层面,而是做了一个 94 人防晒霜概念测试,把每个受访者对三个产品概念的评价和开放式 rationale 全部收上来,然后比较人与 LLM 的推理差异。结果不算意外,但足够让人不舒服。

LLM 模拟的「逻辑」很脆

这 94 个人不光是选「买不买」,还要写一段为什么这么选。研究者把这些 rationale 映射成带符号的理由状态 Z——正号表示支持购买的理由,负号表示阻止购买的理由。然后他们固定住受访者描述 D、品类背景 K 和概念处理 X,看人类 rationale 和 LLM 模拟的 rationale 到底差在哪。

结果分得很开:人类写的 rationale 对预测购买意图有实质性提升——这些理由构成了真实的决策路径;但 LLM 模拟出来的理由往往听起来像那么回事,实际只是在复读概念板上的话术,没有真正还原受访者的接受或拒绝路径。

LLM 可以给出跟人类一样的最终答案——买或不买——但抵达答案的方式是错的。单次模拟里可能察觉不到,批量跑几千条时,「合成样本」就变成了表面分布对、内部结构歪的东西。

论文给的,是一个审计框架

这篇论文的价值不在又一个 benchmark,它给的是一个审计框架。reason state Z 本身不能单独识别因果效应(论文也承认这一点),但它提供了一个可解释的测试:让 LLM 模拟一个人做决策后,看它的 rationale 跟真实人类写的 rationale 是否对齐。

这个测试在现实中很有用。比如一家消费品公司想用 LLM 模拟消费者对新配方的反馈,传统做法是看模型选「愿意买」的比例跟历史数据是否一致。但 Pandey 和 Gajoo 的实验表明,一致不代表没问题——模型可能完全绕过了真实的决策理由,只是靠着概念描述里的关键词蒙对了标签。

这对做 AI 产品调研、用户模拟、合成数据生成的人来说是一个明确的提醒:目前的模拟验证还不够。光对答案不行,要拆答案。

这个实验规模不大——94 人,防晒霜,三个概念。reason state 的映射本身也依赖人工编码,很难直接规模化。论文自己也承认,reason state 不是天然的因果推断工具。但它指出了一个真实的风险:LLM 被广泛用作社会模拟器时,我们正在用一个「答案正确但理由跑偏」的模型去替代理性决策。

已经在用 LLM 做合成受访者的团队,或者正在搭建 Agent 替人类做判断的人,这篇论文值得翻一下。答案对只是及格线,把路走对才是真干活。