世界模型只懂物理不懂人心?这篇论文把「信念」写进了状态机
最近扫 arXiv 看到一篇让我停下来想了想实际场景的论文。Hao Fei 和 Yiran Zhao 发的「Mental World Modeling」,题目不新,但切入点很准——现在的世界模型能回答「这个物体在哪、会怎么运动」,但完全搞不懂「这个人下一步会干什么」。
拿 LLM 模拟一个用户操作流程来说,模型能把界面画对、元素位置说对,但一到用户决策就翻车。因为它看到的只是画面——画面里的人在想什么、相信什么、打算什么,这些信息在训练数据里隐着,但模型从来没被要求显式建模。
这篇论文把这个短板直接命题了。它提了一个叫 MWM(Mental World Modeling)的理论框架,核心就一句话:把心智状态(一个人相信什么、想要什么、意图是什么、感觉到什么、认为社会允许什么)变成世界模型的内置变量,而不是事后的解释补丁。
他们实现了一个叫 MENTIS 的基线系统,不训练、全可审计,整个流程拆成五步——状态解析 → 目标视角生成 → 动作分解 → 物理-心理联合演化 → 分支级价值评估。每一步都能打开看中间结果,不是端到端的黑箱。
实验也实在。他们自建了一个质量控制过的数据集,覆盖文本、图像和有声视频三种叙事场景,拿了 8 个现代 LLM 做世界模型来比。显式建模心理状态的版本,在预测人类决策上明显更准。
但真正有价值的不只是这个结论——这篇论文把瓶颈拆开了。它不只说「心理状态很重要」,还给出了一个可操作的分层结构:世界状态 = 物理状态 × 每个人的心理状态,每次动作更新既要改变物理,也要改变每个人的知识、信念和意图。这套形式化,哪怕不跑代码,光是读一遍就比自己模糊地想「模型应该懂人」清晰得多。
项目页挂在 https://mental-world.github.io/,论文 CC BY-NC-ND 4.0,arXiv ID 2607.27201,感兴趣的可以自己翻实验细节。
我自己的判断是:世界模型这个方向过去两年被炒得厉害,但绝大多数落地方案仍然在跟物理场景较劲——渲染、预测、规划。Mental World Modeling 最直接的冲击是提醒了一件事:如果一个模型能完美预测球的轨迹却猜不对人下一步的动作,那它本质上还是缺了一层。这层不是加一个 personality prompt 能补的,需要从状态表示层面动手。
目前 MENTIS 还是个无训练基线,效率和多轮耦合的复杂度还没展开讲。但这篇至少划了一条线:下一阶段的世界模型,可能不只是模拟物理场景,而是模拟在场景里行动的那颗大脑。