AI 提取的威胁情报到底能不能信?这篇论文给出了审计方案

TRACE-CTI:可审计的 AI 映射

威胁情报报告越堆越多,光靠人读根本翻不完。于是大家开始用 LLM 自动映射到 MITRE ATT&CK 框架——哪个攻击手法对应哪个 TTP(战术、技术、过程),由 AI 自动标注。

但问题来了。AI 标完了,敢直接用吗?

同一个报告,GPT-4 说是「凭据访问」,Claude 说是「持久化」,该信谁的?更麻烦的是,半年后有人质疑一条映射有问题,能不能翻得出当初是谁、用什么模型、基于哪段原文做出的判断?大部分安全运营中心(SOC)手里的数据,根本经不住这种追问。

arXiv 上刚挂出来的一篇论文「TRACE-CTI」就是在解决这个问题。作者来自意大利,他们把知识图谱塞进了 AI 威胁情报提取的后处理流程,让每一条 TTP 映射都有完整的来源、版本和验证记录,可审计、可追溯、可撤回。

从标到存

现在多数工具的流程是:扔一段报告给 LLM → 拿到 TTP 映射 → 写入数据库。映射对了固然好,错了呢?谁改的?改之前是什么?这些信息基本丢光了。

TRACE-CTI 的核心差异在于它留存了三个层级的信息。最底层是「运行级预测」(run-level Predictions),即每次模型跑出来的原始结果。往上一层,系统把这些预测按配置来源聚合为「图谱断言」(GraphAssertions),同一个证据来源的预测归拢在一起。再往上,如果多个独立配置来源指向同一个 TTP,就形成「共识断言」(ConsensusAssertions)。

这一套结构的好处是:每条结论都能随时查到,到底是几个模型的共识,还是某一个模型的孤证。

共识门槛拉满,精度从 25% 跳到 90%

论文在两组公开威胁情报语料上做了实验,包含 65 份报告、5303 个句子。他们用了一个 2×3 的检索器-生成器矩阵,涵盖不同的检索器和生成模型家族,并且按 6 个图谱版本增量摄入。

不设共识门槛、只要任意一个模型产出了就算数时,精确率只有 25.3%,召回率 88.2%。大部分映射都是错的,只是 AI 几乎能覆盖所有可能的点。当把门槛拉到六个模型全部一致时才采纳,精确率飙升到 90.6%,但召回率掉到了 16.3%。

这两个数字说明了一个做 AI 安全应用时都会遇到的困境:单个模型输出不可靠,多模型投票虽好但会漏掉大量信号。TRACE-CTI 的做法是把原始投票过程、配置来源、版本历史全保留下来,由使用者根据场景自行决定信任门槛。

七个追问

论文还做了一个更落地的对比:拿一套标准的安全分析师问题去问 TRACE-CTI 图谱和传统的扁平输出。这七个问题包括:溯源(这条结论是谁产的)、可信度(是否有足够验证)、版本追踪(这条结论是不是最新的)、依赖关系、分析师分歧、以及还有哪些待审项目。

传统扁平输出在面对这七个问题时,要么答不出来,要么需要额外加工或重新跑模型。而 TRACE-CTI 的图谱原生就能回答全部七个问题,因为信息从设计上就是按这些维度组织的。

对 SOC 分析师来说,这意味着一个场景可以直接落地:早上打开工单系统,看到一条 AI 建议的 TTP 映射,分析师不用再对着一个光秃秃的结论发愁。每条映射都标注了来自哪几个模型、各模型的置信度、对应的原文段落、以及有没有其他团队成员的复核意见。

一些没说的事

论文也写得比较老实。作者明确指出他们描述的是共识轨迹的观测结果,并没有建立统计独立性验证或因果模型家族效应。不同模型家族之间确实产生了更多样的输出,但这不代表跨家族投票就是万能方案。多模型方案的稳定性、计算成本、以及最优投票策略,都还需要更多工程实践来检验。

另外这套框架当前还是纯治理层,不涉及模型本身的改进。一个坏模型产出的坏结论,经过 TRACE-CTI 治理之后,至少知道它坏得有多具体、谁该负责,但坏还是坏。

值得思考的问题

做安全领域的 AI 应用,或者任何需要让 AI 输出可审计的场景,TRACE-CTI 的设计提供了一个参考方向:把模型输出当原材料,在此基础上设计一套分层聚合、版本追溯、来源透明的治理层,业务方才敢用、敢复盘、敢上生产。

反正我读完的感受是,现在每用一个 AI 产出的安全结论,都应该追问一句:这条结论的证据链在哪?

如果没有,那就跟论文里那个 25% 精确率的跑分一样——大部分时候信的,可能都是错的。

相关链接

  • 论文地址:https://arxiv.org/abs/2607.24563
  • 论文 PDF:https://arxiv.org/pdf/2607.24563