DualG-MRAG 论文速读|多模态 RAG 的多跳推理顽疾,被一张双图架构解了

做多模态 RAG 多跳推理的人,大概率都卡过同一个问题:图建细了,视觉特征一加进来,节点爆炸,检索直接变成噪声扫射;图建粗了,局部关键证据又丢了,召回率惨不忍睹。两头都不讨好。

这本质上是多模态图增强检索的一个结构性矛盾——单一图结构没法同时承担「全局拓扑路由」(决定去哪找)和「局部精确匹配」(确认是不是它)两个任务。非要塞进同一张图里,结果就是互相干扰。

刚被 ACM MM 2026 接收的这篇 DualG-MRAG,给的解法非常直接:拆。

DualG-MRAG 构建了一个双层级框架,包含两张图:

  • Macro Graph,负责宏观推理层面的全局拓扑路由。它不关心具体的像素级匹配,只管沿着图结构把查询导向可能包含答案的区域。
  • Micro Graph,负责微观匹配层面的局部精准验证。在这一层做细粒度跨模态对齐,确认检索到的证据到底能不能支撑答案。

两张图各管各的,从架构上就把结构推理和细粒度匹配的噪声隔离开了。

检索方式也做了针对性设计。文章用一个 GNN Retriever 把检索过程建模成查询驱动的消息传递——从查询节点出发,沿着两张图的拓扑结构做信息传播,而不是像常规 RAG 那样把文档切成独立片段一把丢给模型。他们还设计了一个动态规划解码机制,直接从 GNN 的前向传播过程中提取显式的推理路径,替代原先喂给生成模型的孤立文档块。这意味着生成器拿到的不是一堆碎片,而是一条完整的推理链条。多跳场景下这个设计尤其关键——LLM 不再需要自己从碎片里拼线索了。

实验结果是 DualG-MRAG 在证据召回和复杂 QA 准确率上都超过了基线方法。

这个思路在架构层面不算花哨,甚至可以说很朴素——发现矛盾,解耦,分别优化。但「拆」这个动作本身切得很准。当前多模态 RAG 的核心瓶颈之一,就是单一图结构的信息容量撑不住多模态多跳推理的信息密度。强行塞一起只会两败俱伤,分开管反而都做好了。

当然,这篇目前还只是标准 benchmark 验证。实际落地要考虑的事情不少:两张图的构建和维护成本、GNN 推理的实时性能、跨图一致性怎么保证。论文本身 12 页,CC BY 4.0 许可,arXiv 上可以拿到全文。

对于正在做多模态知识库、跨模态问答这类方向的团队,这个双图解耦的方向值得跟一跟。

相关链接:
- 论文页面:https://arxiv.org/abs/2607.28580
- PDF:https://arxiv.org/pdf/2607.28580