根因分析在真实遥测数据上的能力边界:基于 OpenRCA 基准的实证研究

根因分析在真实遥测数据上的能力边界:基于 OpenRCA 基准的实证研究

来源arXiv:2607.13548
作者:Athira Gopal, Ashwanth Krishnan
提交时间:2026年7月15日


核心发现

本研究对当前微服务故障根因分析(Root Cause Analysis, RCA)方法进行了系统性基准测试,发现无论是经典因果发现算法还是现有大语言模型(LLM)驱动的多智能体系统,在 OpenRCA 这一大规模多模态数据集上均表现不佳。研究提出了一种结构化多智能体 RCA 管道,并揭示了一个关键洞察:多数失败并非由于数据缺失,而是推理能力不足


问题背景

在生产环境中识别微服务故障的根因,需要基于指标(metrics)、日志(logs)和链路追踪(traces)等多模态遥测数据进行复杂推理。这一问题长期以来对传统方法和基于 LLM 的方法都构成了挑战。

OpenRCA 数据集作为该领域的基准,具有以下特征:
- 大规模多模态
- 缺乏详细的领域知识
- 所有现有方法在该数据集上均产生持续偏低的准确率


方法评估与发现

1. 基线方法的局限性

研究测试了两类主流方法:
- 经典因果发现方法
- 现有的 LLM 驱动多智能体系统

结果表明,这两类方法均无法在该基准上可靠地识别根因。

2. 提出的解决方案:结构化多智能体 RCA 管道

作者提出了一种新的 Structured Multi-Agent RCA pipeline,其特点包括:
- 在性能上显著优于现有的 LLM 基线和经典基线
- 支持两种运行模式:有领域知识无领域知识

3. 故障诊断机制:逆向推理智能体

为定位失败根源,研究引入了一个 逆向推理智能体(reverse reasoning agent),其工作流程为:
1. 给定正确答案
2. 识别提取到的异常中哪些信号支持该答案
3. 判断第一阶段(Stage 1)是否访问到了这些信号

据此,每种失败被分类为:
- 推理差距(Reasoning Gap):证据存在但未被使用
- 数据歧义(Data Ambiguity):证据确实缺失

4. 关键结论

逆向推理分析揭示了一个反直觉的发现:

所需证据在绝大多数失败案例中是存在的。瓶颈不在于数据获取,而在于智能体正确推理的能力。

5. 自动化规则挖掘管道

研究进一步引入了一条 自动化规则挖掘管道(automated rule mining pipeline),能够从逆向推理报告中系统地提取判别规则,从而减少对手动知识工程(manual knowledge curation)的依赖。


对 AI 从业者的启示

约束因素

在所有配置下,研究确定了两个主要约束:
1. 模型推理能力
2. 领域知识

更强的模型能够嵌入更多领域专业知识,而显式的知识注入可以在一定程度上弥补这一差距。

性能天花板

一个重要的限制是:

即使证据提取达到完美,推理性能仍存在实际上限。仅靠脚手架工程(scaffold engineering)和数据管道的改进无法缩小这一差距;进步需要在模型层面实现。

这意味着,对于依赖 LLM 进行复杂推理的系统而言,底层模型的推理能力是决定性因素,而非外围的数据处理或提示工程优化。


技术总结

维度 发现
现有方法表现 经典方法与 LLM 多智能体均不可靠
新方案 结构化多智能体管道显著提升性能
失败主因 推理差距 > 数据歧义
核心瓶颈 模型推理能力与领域知识
改进方向 需从模型层面突破,而非仅优化数据管道

本文所有事实、数据和结论均来自 arXiv:2607.13548 论文摘要及元数据,未引入材料外信息。