新论文证实:大模型对中国34个省份存在系统性地域偏见

LLM 对中国省级行政区的系统性地域偏见,论文摆出了证据

上周 arXiv 上线了一篇论文,来自 Jiayuan Di 等人。标题很长,结论倒不复杂:主流的 LLM 对中国 34 个省级行政区存在系统性的地域偏见,而且这些偏见会从抽象的刻板印象渗透到具体的社会决策里——教育选择、职业推荐、日常社交互动,都能测出来。

论文的核心贡献是一个叫 S2D(Stereotypes-to-Decisions)的评估框架。做法很直接:让模型先对每个地区的人做 Warmth(友好度、可信度)和 Competence(能力、智力)两个维度的评分,再在教育、职业、社交互动三类场景里做配对选择。一共测了 6 个大模型,覆盖全部 34 个省级行政区。

结果不太好看。

不同区域的得分差距相当大,而且 6 个模型呈现出的偏好模式高度一致——不是某一个模型的训练数据有问题,而是多个模型表现出类似的偏见。论文还发现,模型给出的地域评分与该地区的经济发展水平、数字化程度存在统计关联:经济更发达的地区,Competence 维度得分更高。

如果只是抽象评分有差异,或许还能说问题不大。但 S2D 最有价值的部分在配对选择任务。模型被问到"两个候选人来自不同省份,谁更适合这个岗位"这类问题时,偏好模式依然稳定出现。偏见不只是在口头标签上——它会直接影响模型输出的判断。

论文还揭示了一个更微妙的模式:混合型刻板印象,和人类很像。有些地区被评价为高 Warmth 低 Competence,即"人挺好的,但能力不行";另一些地区相反。这种双维度分化,比单纯说"模型歧视某某地区"更难对付。

论文专门做了中英文 prompt 对比测试,偏见模式基本稳定——换语言也治不了。

对正在把 LLM 塞进工作流的开发者来说,这意味着:如果你的产品涉及简历初筛、面试反馈、候选人评估,或者任何跟地域信息相关的推荐,模型内置的这个偏见会直接传导到业务逻辑里。而且它不太容易被 prompt 层面的简单修补解决,因为偏见是系统性的,不是某条训练语料的偶发问题。

论文把问题摆得很清楚了。解决方案那一块还比较薄——怎么去偏、怎么评估去偏效果、去偏会不会破坏其他维度的表现,这些还得等人继续填坑。至少现在大家知道坑在哪了。