DAIS:依赖感知中间问答监督,提升复杂推理能力

DAIS:依赖感知中间问答监督,提升复杂推理能力

在人工智能领域,如何让大模型像人类一样进行严谨的多步逻辑推理,一直是个核心难题。近期,Yu Wang、Ming Fan 等人向 arXiv 提交了一篇题为《DAIS: Dependency-Aware Intermediate QA Supervision for Complex Reasoning》的论文(arXiv:2607.19088)。该研究提出了一种名为 DAIS(依赖感知中间问答监督) 的训练框架,旨在通过优化思维链(CoT)中的中间推理步骤,显著提升大型语言模型在复杂推理任务中的表现。

核心突破:从“扁平化”到“结构化”

研究团队提出的 DAIS 框架,核心创新在于将过滤后的教师推理过程转化为阶段级的问答记录

与传统的扁平化思维链监督不同,DAIS 强调中间结论对后续决策的支持作用。通过在训练过程中引入依赖感知的中间问答监督信号,该框架显著提升了模型在政策合规、医学问答及形式逻辑等领域的最终答案准确率。

痛点分析:为什么传统思维链不够好?

思维链(Chain-of-thought, CoT)监督通过暴露中间推理过程,帮助模型学习如何解决复杂问题。然而,现有的方法通常使用“扁平化的推理目标”(flat rationale targets),主要存在两个局限:

  1. 单一序列优化:通常只优化单一的推理序列,未能充分建模推理步骤之间的逻辑依赖关系。
  2. 局部监督不足:缺乏对“局部结论如何支持后续决策”这一过程的明确监督,导致模型虽然能生成推理过程,但在多步依赖复杂的任务中容易出错。

简而言之,传统方法教会了模型“每一步该说什么”,却没教会它“这一步为什么需要上一步的结果”。

解决方案:DAIS 框架的工作机制

DAIS 框架的核心思想是将教师的推理过程转化为结构化的阶段级问答(QA)记录。其关键机制如下:

  • 中间状态 Conditioning:每个中间记录不仅预测一个局部答案,还基于解决该决策所需的“先前状态”进行条件预测。这意味着模型在学习时,不仅要关注当前步骤的输出,还要关注如何利用之前的推理结果。
  • 最终答案保留:最终的问答记录保持原始任务的格式,确保评估标准与标准基准一致。
  • 轻量级辅助监督:DAIS 作为一种训练时的辅助监督信号,不改变推理时的输入格式(仅使用原始输入和可选上下文),因此推理成本增加有限。

这种设计使得模型在训练阶段就能深刻理解推理步骤间的因果链条,而在实际部署时又能保持高效。

实验结果:政策合规领域增益显著

研究者在多个基准数据集上评估了 DAIS 的效果,包括 GDPR(通用数据保护条例合规)、AIACT(人工智能法案合规)、MedQA(医学问答)和 FOLIO(形式逻辑推理)。实验使用了多个 Qwen 系列模型作为骨干网络。

主要发现如下:

  • 整体准确率提升:相较于仅输出答案(answer-only)、扁平思维链(flat chain-of-thought)以及独立问答(independent-QA)基线,DAIS 提高了平均最终答案准确率。
  • 政策合规领域显著增益:在政策合规基准测试中,DAIS 相比最强的非 DAIS 基线,实现了 5.6% 的最大增益和 4.2% 的平均增益。
  • 依赖条件的作用:受控消融实验表明,有效的“先前状态条件”带来的性能提升,超过了单纯增加目标文本长度或增加中间文本数量的效果。这支持了依赖感知的中间问答作为一种轻量级且高效的辅助监督信号的有效性。

意义与展望

DAIS 的研究表明,在复杂推理任务中,仅仅生成正确的推理步骤是不够的,模型还需要学习步骤之间的依赖关系。通过将推理过程结构化为一组具有依赖条件的中间问答,可以在不增加推理负担的前提下,显著提升模型在需要多步逻辑推导的任务上的表现。

对于 AI 从业者和开发者而言,DAIS 为优化思维链训练提供了一种新的思路:关注推理步骤间的逻辑依赖,而非仅仅关注步骤本身的正确性。


参考文献:
* Yu Wang, Ming Fan, Xicheng Zhang, Zhiyong Li, Zhihu Wang, Caiyue Xu, Dahai Hu, Ting Liu. "DAIS: Dependency-Aware Intermediate QA Supervision for Complex Reasoning." arXiv preprint arXiv:2607.19088, 2026. Link