EF 预测对了,但心室容积坍缩到了 0.1 mL:概念瓶颈模型的一个数学命门

聊这篇之前我犹豫过——内容够硬,揭示的问题会让不少做可解释 AI 的人坐不住。

概念瓶颈模型最近几年在医疗 AI 里挺受欢迎。模型先预测一组可解释的中间变量(比如心室容积),再通过公式算出最终结果(比如射血分数 EF),不走直接从图像到结论的路线。可以在中间层停下来检查——模型是依据正确的临床变量在做判断,还是走了什么捷径。

Han 和 Kim 这篇 2026 年 7 月的 arXiv 论文做的事不复杂:用公开的超声心动图数据集训练了一个视频 transformer,中间层输出收缩末期容积(ESV)和舒张末期容积(EDV),然后严格通过公式计算 EF——没有残差通路,也没有分支让模型绕过概念层直接把图像连到输出。

表面结果还不错:加上概念瓶颈之后,EF 的预测误差(MAE 6.89)甚至比直接回归(7.13)还低一点。概念预测准确率也说得过去。只盯这两个指标的话,大概率会觉得概念层确实在工作,模型理解了容积。

真正让人警觉的是一个数字。

在没有容积直接监督的训练条件下,模型预测的容积数值分布几乎完全坍缩:散度只有 0.1 mL。测试集里真实的参考容积散度是 35.7 mL(ESV)和 45.7 mL(EDV)。不管病人是谁,模型预测的收缩末和舒张末容积几乎都是同一个值——但两个值之间的比例关系大致维持了,于是算出来的 EF 居然还能维持不错的排序相关性。

这篇论文的核心洞察是:损失函数的不变性决定了概念层能学到什么——也决定了它可能漏掉什么。

EF 是个比值:ESV 和 EDV 同时乘以任意常数,比值不变。只用 EF 作为目标训练时,损失函数对两个容积的绝对尺度没有约束力。模型找到了一条"捷径":在容积空间里找一个没有物理单位的坐标,只要两个容积的相对比例大致正确,EF 就对了。结果是——概念层输出的值看起来有相关性,但携带的物理信息几乎为零,它在一个完全没被注意到的对称方向上瞎猜。

加上容积的直接监督后(以 mL 为单位),容积误差从 89.8 mL 降到 25.8 mL,代价是 EF 误差增加了 0.4 个点。

这个 trade-off 本身不让人意外。让人意外的是前面那个状态——不加容积监督的时候,从概念层的预测准确率上完全看不出任何异常。概念瓶颈层"准了",但准的是排名不是物理量。把这个模型拿去临床部署,它输出的 EF 数字大概率是对的,但中间给出的心室容积数字是假的。而在临床上,心室容积本身——心室大小、重构趋势——就是重要的诊断信息,不是中间过程的副产品。

对于做可解释 AI、概念瓶颈、以及任何依赖中间变量做可信度评估的人来说,这篇论文提出的问题非常具体:评估一个概念瓶颈模型时,验证的是概念层的"预测准确率",还是它真的携带了正确的物理或语义信息?如果训练目标对某些变换保持对称性(比值对缩放,分类概率对温度,等等),概念层就可能在这个对称方向上学到完全没有意义的内容,而评估指标完全看不出来。

这不是理论风险。0.1 mL 对 35.7 mL 的差距已经超出近似范围——模型在彻底放弃物理尺度。

解决思路论文里也提到了:检查训练目标的对称性和不变性结构,以及用真实物理单位直接监督概念层。但问题在于,很多场景下拿不到那些真实的"物理单位"。NLP 里的概念瓶颈、或者用概念层做推理链验证的场景,这个盲区同样存在。

这篇论文不做预言,也不贩卖焦虑。只做了一个干净的实验,然后给出一个数学层面的诊断。这个诊断值得每一个做落地的人认真看一遍——尤其是那些正准备拿概念瓶颈层的准确率去说服临床医生或监管方的人。