GLM-RAG:三类知识图谱检索器硬碰硬,跨域泛化才是真差距
知识库从纯文本换成知识图谱之后,常规的向量检索就不太够用了。单跳问题还好——问「iPhone 16 的芯片是什么」,向量匹配上就完事。但问题一旦变成「iPhone 16 的芯片供应商和哪家汽车公司有合作」,检索器就得沿着图结构做多跳推理。向量检索只看语义相似度,不看边,到这个环节就开始露怯。
GLM-RAG 这篇论文瞄准的正是这个问题。全称「Graph Language Models for Graph-Based Retrieval-Augmented Generation」,7 月 30 日挂上 arXiv,10 页正文,19 张图,CC BY-NC-SA 4.0 许可。作者用 Graph Language Model(GLM)做知识图谱 RAG 的检索器,然后跟 GNN 检索器和传统向量检索做了系统的横向对比。
在跨领域泛化这条线上,微调过的 GLM 检索器明显更强,在两个多跳 benchmark 上拿了 SOTA。在域内多跳 QA 上跟此前方法持平,而且随着参数规模和子图覆盖的增长,效果还在涨。GNN 这边的优势是训练效率高、图覆盖更完整。向量检索则是在单跳数据集上表现最好——不意外,它本来就不处理结构信息。
GLM 的思路是把图结构推理和语言模型的语义能力糅到一起。传统做法要么用 GNN 建模拓扑再做检索,要么直接用向量把节点嵌入后召回。GLM 相当于让语言模型直接「读图」——既能理解节点上的文本语义,又能感知节点之间的连接关系。论文把这三种方案放在同样的实验条件下做对比,比单纯堆 benchmark 更有参考价值。
这个方向的实用价值在于:现实场景里的知识图谱经常跨领域,一个在金融 KG 上训好的检索器,换到医疗 KG 上还能不能打?GLM 在这组实验里表现出的跨域泛化能力,是它最值得关注的点。
论文没有喊「XX 方案全面胜出」。三类检索器各有适用区间:多跳、跨域的场景 GLM 占优;对图覆盖和训练效率有要求的,GNN 更稳;单跳、简单检索,向量搜索又快又不折腾。选哪个取决于知识图谱长什么样、问题有多绕。
对于正在搭知识图谱 RAG 的团队来说,这篇论文提供了一个比较扎实的横向对比。下次跟同事争「到底上 GNN 还是让 LLM 直接读图」的时候,至少有了实验数据可以参照。三类方案各有取舍,没有银弹——但至少知道在什么场景下该押哪一边。