下水道里的可解释AI:一篇新论文把管道缺陷检测从黑箱变成了可追溯推理
下水道、模糊规则、神经符号,这三个词同时出现在一篇论文标题里,看起来确实容易让人滑走。但如果关注 neuro-symbolic 的实际落地,或者正在想怎么让模型输出不再只是黑箱猜测、而是能回溯的推理结果,那这篇 arXiv:2607.28481 值得多看两眼。
现在的下水管道缺陷检测,主流做法是用图像分类模型直接对 CCTV 影像打分——输入一张照片,输出一个严重等级。问题是整个流程是个黑箱:模型说「这条管道很严重」,它看到了什么缺陷、哪个缺陷贡献了多少权重,没人知道。
这篇论文把流程拆了两步。感知那一步,用 Swin Transformer 从图像里预测 14 种标准检查 CODE 的等级——先搞清楚管道里到底有什么毛病,裂缝、变形、堵塞,每种有多严重。推理那一步,把这 14 个 CODE 输入一套由决策树转化而来的 IF-THEN 模糊规则系统,总共 19 条规则,每条有置信度权重,通过模糊逻辑(t-norm / s-norm 算子组合)算出最终严重等级。
这套框架有两个地方比较有意思。
研究人员用 LLM 来生成训练数据的标准答案。他们把原始检查员的笔记扔给 5 个独立的大语言模型,让它们分别判读,取共识作为 ground truth 标签。这比人工标注快得多,5 个模型一起投票,也比单个检查员的主观判断更稳定。用 AI 给 AI 打标,再用打好的标训练决策树——路子野,但逻辑上说得通。
另一处是那 19 条 IF-THEN 规则可读性很强。拿到一个预测结果,可以往回追溯:Swin Transformer 看到了哪些 CODE 缺陷,哪几条规则被激活,每条规则的置信度贡献了多少,最后怎么加权求和得出「严重」或「不严重」。对于下水道这类基础设施维护决策来说,可解释不是锦上添花。预算审批、维修排期,都需要一个能说清楚的理由。
结果方面,他们在 3,244 张图像、5 个严重等级(高度不平衡)的数据集上做了验证,对比纯图像分类,准确率提升 17.9%,平衡准确率提升 12.2%,Macro F1 提升 23.0%,MCC 提升 17.3%。作者测试了 Product、Łukasiewicz 和 Hamacher 三组模糊算子对,框架整体在类别平衡性能上表现不错。
这套方法当然也有代价。需要额外标注流程(LLM 共识 + 决策树训练),推理阶段也比单模型分类多了一步规则计算。但如果是做一个需要向 stakeholders 解释「为什么是这个结论」的 AI 系统,这篇论文的思路值得参考——把感知和推理拆开,用模糊规则做中间层,既保留了端到端的性能,又让决策过程可追溯。
项目目前还没有公开代码(arXiv 页面上暂未看到链接),但架构描述足够清晰,可以照着 paper 复现。