ICML 2026 | 从“事实错误”到“世界模型失配”:大模型幻觉的统一定义与 HalluWorld 基准
核心事件:CMU、斯坦福等研究者提出大模型幻觉统一定义,并发布配套评测基准 HalluWorld。
在 AI 领域,"幻觉"(Hallucination)早已成为高频词汇,但直到最近,学界对于"什么是幻觉"仍未达成共识。在第一篇被 ICML 2026 Position Track 接收的论文中,来自 CMU、斯坦福等机构的研究者指出,幻觉研究的分裂源于不同任务背后隐含了不同的"真值锚点"。
团队提出了一个基于 参考世界模型(Reference World Model) 的统一定义框架,并发布了首个操作化该定义的基准测试 HalluWorld。
1. 核心冲突:同一个回答,两种判定
幻觉研究长期存在结构性困境:同一段模型输出,在不同任务假设下可能得出截然相反的结论。
论文以一道"福尔摩斯问题"开场:
上下文:明确写着 "Sherlock Holmes 住在伦敦贝克街 221B 号"。
模型回答:"福尔摩斯是虚构人物,没有现实地址。"
- 摘要/翻译视角:模型公然违背源文档,构成幻觉(Source Faithfulness)。
- 开放域问答视角:该陈述在现实事实层面成立,甚至被视为更谨慎的回答(Factuality)。
这种分歧导致"我们将幻觉降低了 40%"这类声明缺乏可比性——若未指明相对于哪个参考世界、证据冲突时谁优先,不同 Benchmark 的分数便无法进入同一场学术对话。
2. 统一定义框架:显式化"被省略的前提"
为了解决概念裂缝,论文将幻觉定义为:模型输出中可被用户观察到的、相对于指定参考世界的不准确世界建模。
形式化定义
研究引入了 参考世界模型 $W$ 的形式化定义:
$$ W = (S, H, R) $$
- $S$:可能的世界状态。
- $H$:交互历史。
- $R$:状态与历史必须满足的规则。
$W$ 并非对神经网络内部表征的推测,而是用于判定"什么为真"的指定参照结构(如源文档、知识库、DOM 树或模拟器)。
可复现评测的三个关键组件
论文指出,一项可复现的幻觉评测必须显式回答三个长期被隐含处理的问题:
- V(视图函数 View):模型在当前输入下能观察到参考世界的哪一部分?
- P(冲突策略 Priority):当多个信息源(如检索文档与参数记忆)矛盾时,谁优先?
- T(真值函数 Truth):给定 $W$ 和 $P$,原子命题应被判为 true、false 还是 unknown?
统一定义公式:
如果模型输出中存在一个用户可观察的原子命题 $c$,并且它在给定参考世界与冲突策略下为 false,则构成幻觉:
$$ \exists c \in C(y) : T_{(W,P)}(x, c) = \text{false} $$
3. 辨析:不是所有错误都叫幻觉
该框架的一个重要贡献是将 "幻觉" 与更宽泛的 "模型错误" 区分开来:
- Planning Error(规划错误):Agent 准确看到按钮却选择低效动作。这是"做错了",而非幻觉。
- Instruction-Following Error(指令遵循错误):模型理解环境但未遵循用户目标。
- Hallucination(幻觉):模型坚称页面上存在 DOM 中不存在的元素,或对环境状态形成错误信念。这是"假定了一个不存在的世界"。
这一区分明确了缓解策略的作用位置:检索增强改变 V(看得更多),外部验证器明确 P/T(判定更可靠),而训练干预才直接优化 W(世界建模更准确)。
4. HalluWorld 基准:从定义到实验
为了验证该定义的操作性,团队推出了 HalluWorld 基准。该基准通过国际象棋等结构化场景,展示了如何由环境本身"按构造给出"幻觉标签,无需调用 LLM-as-a-judge。
基准构成
HalluWorld 覆盖三类环境,共包含 1,718 个探针:
| 环境类型 | 关卡/任务数 | 探针数量 | 特点 |
|---|---|---|---|
| Grid Worlds | 33 个关卡 | 839 个 | 完全合成,可定制复杂度与动态机制 |
| Chess | 7 个关卡 | 350 个 | 规则明确,自动验证,测试强先验下的忠实度 |
| Terminal Tasks | 110 个任务 | 529 个 | 真实 Linux 终端轨迹,模拟长时程 Agent |
关键实验发现
实验结果并未给出简单的"谁最好",而是揭示了不同类别幻觉的能力曲线差异:
1. 看得见,不等于跟得上
前沿模型对当前观测信息的读取已接近饱和,但在要求跨多步维护状态或模拟动作后果的任务中,幻觉率明显上升。模型可能看清了当前场景,却未持续维护一致的世界状态。
2. 想得更久,不一定更忠实
在 Grid Worlds 的因果探针上,增加推理预算并未带来稳定收益。
- 数据:Claude Sonnet 4.6 的因果幻觉率从 无 thinking 时的 19.7%,上升到 thinking 最大预算 下的 27.1%。
- 解释:开放式前向模拟给了模型生成"看似合理、却未受环境状态约束"中间步骤的机会。
3. 最难说出口的仍是"无法确定"
在真实终端轨迹中,即使表现最好的模型,当正确答案应为"无法判断"时,仍有约 23.1% 的回答作出了过度确定的断言。
- 风险:模型常把"我没有找到证据"写成"已有证据证明不存在",这在 Agent 系统中可能成为后续行动的错误前提。
5. 作者与背景
- 论文标题:
- Position Paper: We Need A Unified Definition of Hallucination (It's The World Model, Stupid!)
- Benchmark Paper: HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models
- 链接:
- 作者团队:
- 第一作者:Emmy Liu (CMU LTI 博士生)
- 通讯作者:Varun Gangal (Patronus AI 研究员 / CMU), Steven Y. Feng (Stanford AI 博士生 / Anthropic Research Fellow)
- 所属机构:主要来自 Stanford、CMU 等高校,独立科研小队 DegenAI Labs(成立于 2025 年秋)。
结语
这篇 ICML 2026 论文的贡献不在于提供消除幻觉的微调技巧,而在于为"幻觉"提供了一套可操作、可比较、可测量的形式化语言。
随着大模型从一次性问答走向长时程 Agent,静态的"事实正确率"已不足以刻画风险。未来的研究重点将从"模型是否全知"转向"模型是否认识自己的证据边界"——即在不完全观察和证据冲突中,能否保留 unknown 状态,而非编造一个看似完整的世界。
这或许是未来幻觉研究真正应该出发的地方。