模型没答错,只是没看表:AAAI这篇时序问答方法让AI学会“穿越时间”找答案

让AI拥有“时间感”:北航复旦浙大联合提出QC-MHM时序知识图谱问答框架

作者单位:北京航空航天大学、复旦大学、浙江大学
发表会议:AAAI(CCF-A类顶会),Pages 19332–19340
论文链接:https://arxiv.org/abs/2402.13188
代码仓库:https://github.com/zhouyan0614-sys/QC-MHM-TKGQA


核心问题:AI为何记不住“过去”?

向ChatGPT提问:“Lasha Talakhadze之前的奥运举重纪录是多少?”
模型能识别出这位举重冠军及其金牌成就,却给出了他当前的纪录,而非历史数据。类似地,“第25届奥运会期间布达佩斯的市长是谁?”这类带时间约束的问题,Google和ChatGPT均出现错误回答。

这并非单一模型的缺陷,而是基于知识图谱(Knowledge Graph, KG)的问答系统共有的结构性问题:传统系统能识别实体,却无法感知时间。

针对这一痛点,北航、复旦、浙大联合团队在AAAI 2024上提出了QC-MHM(Question Calibration and Multi-Hop Modeling)框架。该方案通过“问题校准+时序嵌入+多跳图推理”三件套,使模型能够真正理解并处理时间约束下的复杂查询。


背景与痛点

时序知识图谱问答(Temporal KGQA)的任务

给定一个包含时间约束的自然语言问题,从知识图谱中找出落在正确时间窗口内的答案。

看似只是在普通KGQA上加了时间字段,实则差距巨大。例如,在KG中:
- (布达佩斯, 市长, 某人, 1992)
- (布达佩斯, 市长, 另一人, 2024)

这是两条独立的事实。传统模型容易混淆二者,当询问“1992年谁当市长”时,可能错误输出2024年的答案。

现有方法的两大硬伤

尽管学界已有CronKGQA、TMA、TSQA等时序KGQA模型,但该论文指出其存在两个根本性缺陷:

  1. PLM对时间“视而不见”
    BERT等预训练语言模型在编码问题时,注意力机制天然聚焦于实体名词(人名、地名),对“之前/之后/期间”等时间词汇缺乏敏感性。导致模型实际处理的是“不带时间约束”的问题。

  2. 图结构信息被浪费
    多数方法仅将知识图谱作为答案查询的索引,未充分利用其中蕴含的多跳关系结构。面对需要“两步以上跳转”的复杂问题,模型容易失效,且推理过程呈黑箱状态。


技术方案:QC-MHM三件套

QC-MHM构建了一个端到端框架,串联三个核心模块:

  1. 时序感知嵌入:使KG中的时间戳具备“先后顺序”意识。
  2. 问题校准:让问题向量主动从KG中检索时间线索,更新自身表示。
  3. 多跳GNN推理:单层GNN一次性访问任意跳邻居,同时输出可解释的推理路径。

模块一:让时间戳“懂顺序”的KG嵌入

KG中的每条事实由四元组(主体, 关系, 客体, 时间)构成。QC-MHM以TComplEx为基座嵌入方法,但其评分函数本身无法体现时间戳间的先后关系。

为此,作者借鉴Transformer的sinusoidal编码,为每个时间戳叠加位置编码,并构造辅助任务——判断时间m是否早于时间n

$$ L_{aux} = \sum_{(m,n) \in D} -\log \sigma(f(m,n)) $$

总训练损失结合主任务与辅助任务。这一设计相当于给模型进行“时间排序”专项训练,使嵌入空间中1992的向量自然排在2024之前。

模块二:问题校准——让问题主动“找时间”

这是QC-MHM最具创新性的设计。常规流程为:问题 → PLM编码 → 直接查询答案。QC-MHM在中间插入一步:让问题先去KG中检索与时序相关的SPO(主体-关系-客体三元组),再回来修正自身表示。

具体步骤如下:

  1. 候选SPO召回
    将问题和KG中所有SPO分别输入SentenceBERT,计算余弦相似度并排名,保留Top-10候选。

  2. 三注意力多视角匹配
    使用三种注意力机制同时比较“问题词×SPO候选”:
    - Concat:查看两个向量组合的合理性
    - Dot:检查关键维度上的对齐情况
    - Minus:分析向量间的差异

  3. 门控自适应融合
    让模型自主决定“原始问题语义”与“从KG检索到的时序信息”的权重比例。

经过校准后的问题向量(如从“XXX是谁?”变为“XXX在1992年是谁?”)从而具备了明确的“时间感”。

模块三:多跳GNN推理——一层看穿整条路径

传统GNN的局限在于:一层仅能看1跳邻居,若要查看2跳需堆叠2层,以此类推,效率和可解释性均不佳。

QC-MHM的策略是:先裁剪子图,再进行一次性多跳注意力聚合。

  1. 子图裁剪
    以问题中的实体为起点,抽取k跳范围内的子图,收窄搜索空间。

  2. 路径打分与一次性聚合
    通过公式D,利用加权和将1跳、2跳、…、ℓ跳的注意力矩阵一次性合并。这使得单层GNN即可访问任意跳邻居,经验设置$\ell=2$已能取得理想效果。

最终图向量生成后,注意力权重可直接可视化,展示模型的“思考轨迹”——哪些边被高权重激活,推理路径一目了然。

模块四:双通道答案预测

将语义向量(问题校准后的表示)和图向量(GNN聚合后的表示)拼接,通过一层Transformer融合。随后分别投影到实体空间时间戳空间,使用TComplEx评分进行双通道预测:

两个通道的分数拼接后经Softmax处理,采用交叉熵优化。这意味着同一模型可同时回答“是谁”和“什么时候”两类问题。


实验结果

CronQuestions数据集:逼近性能天花板

  • 复杂多跳问题Hits@1绝对提升5.1%,Hits@10提升1.2%
  • 在实体型答案与时间型答案两条赛道均取得优势
  • 整体Hits@1达到0.971,表明性能已接近上限

TimeQuestions数据集:跨数据集泛化验证

迁移至第二个基准同样实现SOTA(State-of-the-Art),证明该方法具有可迁移性,非针对特定数据集的特化方案。

细粒度问题类型拆解

Before-After(前后对比)这种典型时间排序题上,QC-MHM的优势最为显著。这正是“问题校准”模块的主场:只有显式建模时间约束,模型才能准确理解“之前”的含义。

消融实验:三件套缺一不可

实验显示,三个模块互相成就,并非简单拼盘。移除任一模块均会导致特定类型问题大幅退化。

可视化:“白盒”推理路径

可视化结果显示,模型能在图中逐跳推进,清晰展示高权重激活的边。图中高亮的92%、95%等数值,证明问题对最相关时序SPO的高度关注,表明门控机制成功捕捉了关键信息。梯度分析也印证了问题校准模块确实将关键时序事实反映到了问题向量中。


项目价值

学术贡献

  1. 首创“问题校准”机制:通过多视角注意力+门控融合,使PLM编码的问题向量主动从KG中提取时序知识,根治“时间盲区”。
  2. 单层多跳聚合:利用加权组合方式,使单层GNN访问任意跳邻居,同时输出可解释推理路径。
  3. 顺序感知的嵌入辅助任务:以“判断时间先后”作为额外监督信号,隐式编码时间序于嵌入空间。

落地场景

  • 搜索引擎:精准应答带时间限定词(如“之前”“期间”“最早”)的复杂查询。
  • 金融合规:跨时间维度查询股权变更、监管事件、诉讼时序。
  • 医疗药学:追踪疾病演进、用药史、临床试验时间线。
  • 档案管理:跨年代事件因果与关联推理。
  • 企业BI:基于时间链路的趋势与因果分析。

在LLM普遍强调“事实可追溯”的当下,QC-MHM所代表的“PLM×时序KG×多跳GNN”思路,是构建可信时序推理系统的关键拼图。