LLM 逻辑推理总翻车?一篇新论文说问题出在「意义没摆好」,不是推理本身

做 AI 应用的人大概都遇到过这种场景:让大模型处理一个带点逻辑链条的任务——比如审核合同条款的一致性,或者判断几条业务规则之间有没有冲突——结果它一本正经地给出了一个错的结论。回看它的推理过程,每一步看起来都合理,但最终答案就是不对。

以前习惯把这类问题归到「推理能力不行」,然后开始上各种方案:思维链、符号翻译、外接求解器、自我验证。这些方法确实管用,但总有种头疼医头脚疼医脚的感觉。最近 arXiv 上有一篇新论文,矛头指向了一个更底层的问题——大模型做逻辑推理出了问题,根子往往不在推理这一步,而在推理之前的那一步就没走对。

这篇论文叫《Semiotic logical hexagon theory for LLM logical reasoning》,作者来自国内高校(张云瑶、张兴朗、陈泽良、余俊清、宋子楷),7 月 24 日刚挂出来。

文章的核心判断:自然语言里的句子,在人开始做任何形式推理之前,就已经携带了大量隐含的语义关系。这些关系如果没有被完整地组织起来,模型后续的推理过程再漂亮,结论也可能是错的。作者把这种现象称为「不完整的语义表征」,并且指出大模型逻辑推理翻车的主要原因,是前置的语义组织没做到位,而非演绎推理本身。

模型没搞清楚那几句话之间到底是什么意思上的关系——哪些互斥、哪些包含、哪些矛盾、哪些可以同时成立。这些关系没理顺,推理路径再标准也没用。

论文提出了一个框架叫 HexLogicAgent,思路是先对自然语言陈述做语义结构的组织,再在这个结构化的语义基础上做引导式的逻辑推理验证。理论基础是符号学里的「逻辑六边形」理论(logical hexagon)——对亚里士多德逻辑方阵的扩展,用六边形结构覆盖了所有可能的命题对立关系(矛盾、反对、下反对、蕴含等),比传统逻辑方阵更完整。

作者做了实验,在挑战性较强的逻辑推理基准上跑了几组对比,有两个观察值得提。实验证实了前面的判断:不完整的语义表征是推理失败的主要来源,而非推理过程本身。显式地建模完整的语义对立结构,能够「显著推迟」推理性能随逻辑复杂度增加而下降的趋势。问题越绕、逻辑链条越长,把语义关系先理清楚带来的收益越明显。

这个结果跟不少人的直觉对得上。做过复杂 Prompt 设计的人多半有这种体会:想让模型别在多步推理中掉坑里,最有效的办法往往不是给更多推理示例,而是先把关键概念之间的边界说清楚。这篇论文相当于从理论层面给这个经验找到了一个形式化的依据——「说清楚边界」就是在语义层面构造一个完整的对立结构。

Paper 本身只是一个初步探索,实验规模不算大,HexLogicAgent 的工程化程度也有限。但它指出的方向值得掂量:当大家都在卷更多的推理 Token、更长的思维链、更复杂的外部工具调用时,回归到一个更基础的问题——模型到底有没有在语义层面把要它搞的事情搞明白——反而是一条更值得投入的路。

至少下次被大模型的逻辑坑了之后,可以少骂一句「推理能力不行」,多想想是不是「语义没对齐」。