ICML 2026 | 从“事实错误”到“世界模型失配”:大模型幻觉的统一定义与 HalluWorld 基准

ICML 2026 | 从"事实错误"到"世界模型失配":大模型幻觉的统一定义与 HalluWorld 基准

核心事件:CMU、斯坦福等研究者提出大模型幻觉统一定义,并发布配套评测基准 HalluWorld。

在 AI 领域,"幻觉"(Hallucination)早已成为高频词汇,但直到最近,学界对于"什么是幻觉"仍未达成共识。在第一篇被 ICML 2026 Position Track 接收的论文中,来自 CMU、斯坦福等机构的研究者指出,幻觉研究的分裂源于不同任务背后隐含了不同的"真值锚点"。

团队提出了一个基于 参考世界模型(Reference World Model) 的统一定义框架,并发布了首个操作化该定义的基准测试 HalluWorld


1. 核心冲突:同一个回答,两种判定

幻觉研究长期存在结构性困境:同一段模型输出,在不同任务假设下可能得出截然相反的结论。

论文以一道"福尔摩斯问题"开场:

上下文:明确写着 "Sherlock Holmes 住在伦敦贝克街 221B 号"。
模型回答:"福尔摩斯是虚构人物,没有现实地址。"

  • 摘要/翻译视角:模型公然违背源文档,构成幻觉(Source Faithfulness)。
  • 开放域问答视角:该陈述在现实事实层面成立,甚至被视为更谨慎的回答(Factuality)。

这种分歧导致"我们将幻觉降低了 40%"这类声明缺乏可比性——若未指明相对于哪个参考世界、证据冲突时谁优先,不同 Benchmark 的分数便无法进入同一场学术对话。


2. 统一定义框架:显式化"被省略的前提"

为了解决概念裂缝,论文将幻觉定义为:模型输出中可被用户观察到的、相对于指定参考世界的不准确世界建模。

形式化定义

研究引入了 参考世界模型 $W$ 的形式化定义:
$$ W = (S, H, R) $$
- $S$:可能的世界状态。
- $H$:交互历史。
- $R$:状态与历史必须满足的规则。

$W$ 并非对神经网络内部表征的推测,而是用于判定"什么为真"的指定参照结构(如源文档、知识库、DOM 树或模拟器)。

可复现评测的三个关键组件

论文指出,一项可复现的幻觉评测必须显式回答三个长期被隐含处理的问题:

  1. V(视图函数 View):模型在当前输入下能观察到参考世界的哪一部分?
  2. P(冲突策略 Priority):当多个信息源(如检索文档与参数记忆)矛盾时,谁优先?
  3. T(真值函数 Truth):给定 $W$ 和 $P$,原子命题应被判为 true、false 还是 unknown?

统一定义公式
如果模型输出中存在一个用户可观察的原子命题 $c$,并且它在给定参考世界与冲突策略下为 false,则构成幻觉:
$$ \exists c \in C(y) : T_{(W,P)}(x, c) = \text{false} $$


3. 辨析:不是所有错误都叫幻觉

该框架的一个重要贡献是将 "幻觉" 与更宽泛的 "模型错误" 区分开来:

  • Planning Error(规划错误):Agent 准确看到按钮却选择低效动作。这是"做错了",而非幻觉。
  • Instruction-Following Error(指令遵循错误):模型理解环境但未遵循用户目标。
  • Hallucination(幻觉):模型坚称页面上存在 DOM 中不存在的元素,或对环境状态形成错误信念。这是"假定了一个不存在的世界"。

这一区分明确了缓解策略的作用位置:检索增强改变 V(看得更多),外部验证器明确 P/T(判定更可靠),而训练干预才直接优化 W(世界建模更准确)。


4. HalluWorld 基准:从定义到实验

为了验证该定义的操作性,团队推出了 HalluWorld 基准。该基准通过国际象棋等结构化场景,展示了如何由环境本身"按构造给出"幻觉标签,无需调用 LLM-as-a-judge。

基准构成

HalluWorld 覆盖三类环境,共包含 1,718 个探针:

环境类型 关卡/任务数 探针数量 特点
Grid Worlds 33 个关卡 839 个 完全合成,可定制复杂度与动态机制
Chess 7 个关卡 350 个 规则明确,自动验证,测试强先验下的忠实度
Terminal Tasks 110 个任务 529 个 真实 Linux 终端轨迹,模拟长时程 Agent

关键实验发现

实验结果并未给出简单的"谁最好",而是揭示了不同类别幻觉的能力曲线差异:

1. 看得见,不等于跟得上
前沿模型对当前观测信息的读取已接近饱和,但在要求跨多步维护状态或模拟动作后果的任务中,幻觉率明显上升。模型可能看清了当前场景,却未持续维护一致的世界状态。

2. 想得更久,不一定更忠实
在 Grid Worlds 的因果探针上,增加推理预算并未带来稳定收益。
- 数据:Claude Sonnet 4.6 的因果幻觉率从 无 thinking 时的 19.7%,上升到 thinking 最大预算 下的 27.1%
- 解释:开放式前向模拟给了模型生成"看似合理、却未受环境状态约束"中间步骤的机会。

3. 最难说出口的仍是"无法确定"
在真实终端轨迹中,即使表现最好的模型,当正确答案应为"无法判断"时,仍有约 23.1% 的回答作出了过度确定的断言。
- 风险:模型常把"我没有找到证据"写成"已有证据证明不存在",这在 Agent 系统中可能成为后续行动的错误前提。


5. 作者与背景

  • 论文标题
    • Position Paper: We Need A Unified Definition of Hallucination (It's The World Model, Stupid!)
    • Benchmark Paper: HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models
  • 链接
  • 作者团队
    • 第一作者:Emmy Liu (CMU LTI 博士生)
    • 通讯作者:Varun Gangal (Patronus AI 研究员 / CMU), Steven Y. Feng (Stanford AI 博士生 / Anthropic Research Fellow)
    • 所属机构:主要来自 Stanford、CMU 等高校,独立科研小队 DegenAI Labs(成立于 2025 年秋)。

结语

这篇 ICML 2026 论文的贡献不在于提供消除幻觉的微调技巧,而在于为"幻觉"提供了一套可操作、可比较、可测量的形式化语言。

随着大模型从一次性问答走向长时程 Agent,静态的"事实正确率"已不足以刻画风险。未来的研究重点将从"模型是否全知"转向"模型是否认识自己的证据边界"——即在不完全观察和证据冲突中,能否保留 unknown 状态,而非编造一个看似完整的世界。

这或许是未来幻觉研究真正应该出发的地方。