本体匹配不再只找等价关系,AgentMap 用多 Agent 把父子关系也挖了
做过数据对齐或知识图谱集成的人,大概率被本体匹配折磨过。两个 Ontology 摆在面前,一个概念在 A 里叫「Customer」,在 B 里叫「Client」——以为是等价,跑一遍 equivalence matching 找到了。但下一个 A 叫「Enterprise Customer」,B 没有等价类,只有「Organization」,范围更大。这是包含关系(subsumption),得换另一套工具、另一条管线再跑一次。传统 OM 系统只认一类映射:等价或者包含,得分开做,最后手动拼结果。
这个拆开做的状态持续了很久,原因是等价匹配和包含匹配在技术上走的是不同路子,没有系统把两者当一个问题统一处理。最近 arXiv 上的一篇新论文把这个缺口明确挖了出来——提出 Hybrid Ontology Matching (HOM),把等价和包含发现合并成一个任务,然后丢了一个基于多 LLM Agent 的框架 AgentMap 过来接。
论文由 Yiping Song、Jiaoyan Chen 等人提交,7 月 29 日上线,21 页。核心改动很直接:给定源本体里的一个概念,AgentMap 同时在目标本体里找它的等价概念,或者如果等价不存在,就找最细粒度的上位概念。以前两条流程,现在一条管线出两种映射关系。
具体实现拆了三步:语义检索先定位目标本体里的候选区域,层次化搜索在层级结构里上下探索,最后多个 LLM Agent 做协同推理——商量出这个映射到底该标等价还是包含。整个过程不是一次 Prompt 搞定,而是多个 Agent 依次决策、互相引用结果。
论文还扩了 4 个已有的 OM 数据集,搭了一个 HOM 评测基准。在 hybrid 设置下 AgentMap 表现不错,在纯等价和纯包含任务上也分别超过了各自领域的基线方法。
对做知识图谱、数据集成的开发者来说,最直接的收益是不需要维护两套匹配管线了。一套 AgentMap 同时产出 owl:equivalentClass 和 rdfs:subClassOf 两种映射,省了工程开销和人工拼合。用 LLM 做决策意味着可以用自然语言描述匹配逻辑,边界模糊时,Agent 自己判断是等价还是父子关系,不用反复调相似度阈值。
不过论文目前还是 preprint,benchmark 的完整指标和 baseline 配置还没铺开,Agent 每轮跑的 token 开销、推理延迟和幻觉率也没有披露。多 Agent 协作意味着多次 LLM 调用,到了大规模 Ontology 上成本会不会炸,还是未知数。
本体匹配在知识工程里出了名的脏和累——规则写到吐、阈值调到手软,漏一对映射后面能串错一整片。把 LLM Agent 拉进来做这件事,方向切得挺准。至于 AgentMap 在真实规模上到底跑不跑得动、压不压得住幻觉,等实验细节和代码放出来再下判断。