Grokipedia vs Wikipedia:LLM 政治中立性审计研究解析
核心事件:2026 年 7 月 16 日,Filippos Vlahos、Guillaume Bied 和 Tijl De Bie 在 arXiv 上发表论文《Grokipedia vs Wikipedia: An LLM-Based Audit of Political Neutrality along Ideologies》(arXiv:2607.15146),对由 LLM Grok 完全撰写的百科全书 Grokipedia 与维基百科的政治中立性进行了大规模对比审计。
一、研究背景
在线百科全书塑造政治舆论,进而影响民主话语。2025 年底,Grokipedia 发布,这是一个完全由大型语言模型 Grok 撰写的百科全书项目。该项目的动机之一是提供维基百科的无偏见替代方案——后者曾面临"左翼"和"自由派"偏见的指控。
然而,一个核心问题尚未得到回答:由 LLM 撰写的百科全书是否真的能带来更大的中立性?还是仅仅嵌入了另一种意识形态?
二、方法论
研究团队设计了一项大规模政治偏见研究,具体方法如下:
- 样本规模:分析 1,394 对文章对,描述政府成员的政治中立性
- 评估维度:采用 9 个专家编码的意识形态维度
- 评估工具:使用 4 个 LLM 裁判进行评判,分别是:
- Grok
- Claude
- Mistral
- DeepSeek
研究团队同时意识到 LLM 本身可能存在偏见,因此还调查了这些裁判的判断模式。
三、核心发现
3.1 所有 LLM 裁判一致判定 Grokipedia 不如 Wikipedia 中立
无论使用哪个 LLM 作为裁判(包括 Grok 自身),Grokipedia 的中立性评分均低于 Wikipedia。
3.2 两者都有利偏向,但方向不同
两本百科全书都被评价为总体上对政治家持有利态度,但偏向的意识形态群体不同:
| 百科全书 | 偏向群体 | 不利群体 |
|---|---|---|
| Grokipedia | 经济右翼政治家 | 社会自由主义者 |
| Wikipedia | 社会自由主义者 | 经济右翼政治家 |
四、对 AI 从业者的启示
4.1 "中立"是一个复杂的多维概念
本研究采用 9 个专家编码的意识形态维度进行评估,说明政治中立性并非单一指标,而是涉及经济、社会等多个层面的复合概念。
4.2 LLM 裁判本身可能存在偏见
研究团队使用 4 个不同的 LLM 作为裁判,并发现即使 Grok 自身也判定 Grokipedia 不够中立。这提示我们:
- LLM 作为评估工具时,需要警惕其自身的偏见
- 多模型交叉验证可能有助于识别系统性偏差
4.3 训练数据决定输出倾向
Grokipedia 由 Grok 撰写却表现出特定的意识形态偏向,这表明:
- 即使是"AI 生成"的内容,也可能继承训练数据中的偏见
- "AI 中立性"不能仅通过更换内容来源实现,需要从数据层面解决偏见问题
4.4 评估框架的重要性
本研究采用了专家编码的维度体系,而非主观判断。对于 AI 内容的评估,建立标准化、可量化的评估框架至关重要。
五、参考资料
- 论文标题:Grokipedia vs Wikipedia: An LLM-Based Audit of Political Neutrality along Ideologies
- arXiv ID:2607.15146
- 作者:Filippos Vlahos, Guillaume Bied, Tijl De Bie
- 提交日期:2026 年 7 月 16 日
- 论文链接:https://arxiv.org/abs/2607.15146
- DOI:https://doi.org/10.48550/arXiv.2607.15146
本文仅基于 arXiv:2607.15146 公开材料编写,所有事实、数字和数据均来自该论文摘要及元信息。