LLM 能打赢一场 D&D 战斗,但打不完一整天
arXiv 上最近挂了一篇关于 LLM 战术推理边界的论文:DungeonBench: A Benchmark for Rules-Rich Tactical Reasoning in Dungeons & Dragons Combat。三位作者基于 D&D 2014 版 SRD 规则构建了一套基准,专门测试模型在规则密集、需要多步资源管理的战术局面中的表现。乍看像玩票,但这个 benchmark 挖到了一些挺真实的东西。
它测的是什么
DungeonBench 基于 D&D 2014 版 SRD 规则,覆盖了大部分战斗相关的法术、动作、反应、资源管理。它不给模型写故事或扮演角色的机会,而是直接丢一个战术局面:战场地图、敌我位置、剩余血量、可用法术位、动作选项,要求模型从一系列合法动作里选出最优解。
这里面有几个层次。第一层是单场战斗(Encounter 模式),模型只需要打好眼前这一架。第二层是把多场战斗串成一个冒险日(Day 模式),血量不重置、法术位用掉就是用了、消耗品得省着花。模型得在第一场战斗里就考虑后面还有几场硬仗要打——法术是现在丢还是留着保命,短休时机怎么卡,这些决策直接决定后面能不能活着打完。
论文跑了几种主流的前沿语言模型。单场战斗里,这些模型打得不错,能赢。但进入持续一整天的多场战斗后,暴露的问题就很典型——资源预算不会做、休息时机判断失误、规则意识不够稳定。LLM 能当一个合格的战棋玩家走完一步两步,但让它像一个有经验的 D&D 玩家一样管理一整天的资源,它很快就崩了。
为什么这个 benchmark 比很多纯文本推理测试更刁钻
现在主流的推理 benchmark 大多是数学题、代码题、逻辑谜题。DungeonBench 不一样的地方在于,它把以下几个维度拧在一起:
- 行动经济(Action Economy):每个角色每回合只能做一个动作、一个附赠动作、一个反应,怎么分配是核心问题。
- 几何与站位:法术有范围、有覆盖、有豁免,队友不能炸,敌人要尽量罩住。
- 资源跨场景继承:这可能是对 LLM 最不友好的设计。大多数 bench 是一题一题独立做的,但 DungeonBench 的 Day 模式让模型必须带着上一场的伤和消耗进下一场。
- 规则密度:D&D 的战斗规则不是一两页纸能写完的。各种状态、抗性、豁免、法术交互,模型得真的理解规则文本才能做出合法选择,不是靠常识猜就能混过去。
论文用的是引擎生成决策流,不是让模型自己跑游戏。每一步都给模型完整的战术观测数据、待定决策、以及一组可执行选项的索引列表。这样可以用统一的接口去测不同的策略——启发式控制器、LM policy、学习到的排序器、masked-action RL agent,都走同一套数据。
暴露的问题不止是「模型不够聪明」
单场能赢、多场崩盘,这个现象指向一个更深层的短板:LLM 擅长短视的、局部的优化,但在跨步长、跨场景的资源分配上,它们没有稳定的内部价值函数。
人类玩家打 D&D 的时候,脑子里大概有一个模糊的「电池余量」感——这一场打到了第几回合、剩几个法术位、后面推测还有几场战斗、现在这个火球术值不值得交。模型似乎很难建立这种持续的内部状态跟踪。它可能在第三场战斗里把一个六级法术位用来打一个已经没有威胁的小怪,然后在第四场面对 Boss 时发现自己只剩戏法了。
还有一个问题是「规则意识」。即便模型在训练数据里见过无数 D&D 规则文本,真正做决策时它还是会犯一些低级错误——比如选了需要专注的法术却已经保持着一个专注法术,或者忘了自己还有反应动作可用。很多错误出现在推理时的规则约束执行环节,而不是知识层面。
对做 AI 产品和 Agent 的人有什么启发
这个工作的价值不止于 D&D。它的设计思路对任何做复杂 Agent 的人都有参考意义。
让一个 Agent 处理一个孤立任务,它表现不错。但放进一个需要持续运行、跨 session 继承状态、资源有限的生产环境里,它很快出现类似的症状:这步走得挺好,但整体节奏不对;当前决策看起来合理,放在更长的时间轴上就亏了。
DungeonBench 的 Day 模式相当于给 Agent 上了一道「运营压力测试」——它在连续的操作链中考验 Agent 能否始终保持状态健康。
论文的 PDF 和实验性 HTML 版本已经挂在 arXiv 上(2607.29577),代码和数据暂时没看到完整放出,但作者说引擎生成的决策流支持多种策略接入,后续如果有开源动作,值得拉下来跑一跑自己的模型。
一条保留意见
DungeonBench 目前覆盖的是 2014 SRD 规则下的战斗部分,不完全代表整个 D&D 推理复杂度。而且语言模型作为 policy 的表现是单次推理,没有 fine-tune 也没有用搜索树——如果加上 MCTS 或者 self-play 训练,结果可能会有很大不同。论文自己也说了,full tactical observations 还没有让 benchmark 饱和,说明往上还有空间。
但能把 LLM 在「持久资源管理」上的短板用这么具体的方式暴露出来,这已经是一个好的 benchmark 该做的事。下一波模型能不能在 Day 模式上刷高一点,可能比很多数学 benchmark 的提高更能说明推理能力的真实进步。
相关链接
- 论文页面:https://arxiv.org/abs/2607.29577
- PDF:https://arxiv.org/pdf/2607.29577
- HTML(实验性):https://arxiv.org/html/2607.29577v1