指标越漂亮,盲区越隐蔽——这篇论文让 LLM 当「模型医生」,专翻失败病例
如果一个 12 导联 ECG 分类器在测试集上跑了 90% 准确率,你会放心用它筛病人吗?对着这个数字点头很容易,但在生产环境里,aggregate metrics 往往最骗人。模型可能对典型病例很准,但对那几个边缘案例——波形轻微变异、基线漂移、合并症干扰——它说错就错,而且没人知道为什么。
最近 arXiv 上挂出来一篇论文,直接对着这个痛点下手。标题就叫「Failures Reveal What Metrics Miss」,来自 Jinliang Deng 和五位合作者。他们提了一个叫 RecursiveECG 的框架,核心思路是:别只盯着平均分,让 LLM 当一回模型设计师,去翻失败病例、读波形、查测量值,然后自己动手改分类器。
不是让 LLM 写代码,是让 LLM 当 reviewer
这个领域目前的做法是:训练一个 ECG 分类器→看 aggregate metrics→调结构或者调 loss→再训。整个过程依赖人类专家凭经验判断「哪里出了问题」。RecursiveECG 的做法是把 LLM 放进离线设计循环里——它不参与推理,只负责分析失败原因并提出修改方案。
设计了两层「证据接地」。
第一层叫 Criteria-to-Measurement Compilation。把心电图的临床判读标准(比如 ST 段抬高多少毫米、QRS 宽度阈值)转成确定的、可复现的计算函数。每个病例进来,先算出这批客观测量值,再连同原始波形一起交给模型。这些值有据可查,不是黑盒特征。
第二层叫 Evidence-Grounded Failure Review。LLM 拿到一个失败病例之后,同时看三样东西:原始波形、客观测量值、模型输出。再加上几个对比病例(正确分类的相似案例),让 LLM 在对比中定位分类器的真实盲区——是特征提取没抓到某个形态?还是决策边界把某个子类划错了?
改完就冻结,推理时没有 LLM 开销
这个设计有一个务实的选择:所有修改都是在离线完成的,改完之后最终的分类器是冻结的,部署推理的时候不需要跑 LLM。没有推理延迟爆炸,没有 API 账单。每次修改都有一条审计链——哪个失败触发的、基于什么证据改的、改了什么——对医疗 AI 来说,这条 audit trail 本身就是合规刚需。
他们在三个公开数据集上做了验证:PTB-XL、Georgia 和 CPSC2018。RecursiveECG 相比强基线平均相对提升 10.0%。消融和迁移实验也说明,去掉「证据接地」这一步,性能下降明显。
几个值得细想的地方
10% 的相对提升不算惊艳,但方向有意思。过去用 LLM 自动设计模型,大多是用自然语言描述架构、生成代码、看 loss 反馈。RecursiveECG 的区别在于引入了领域特定的确定性测量函数,让 LLM 的诊断能落到具体测量值上——比如「这一帧的 ST 段确实偏离了阈值 0.15mV」,而不是「我觉得这里可能有问题」。
这套方法有几处局限:依赖事先定义好的判读标准清单,覆盖不了所有罕见异常;确定性函数本身需要领域专家来写;三个数据集虽然来源不同,但规模都不算大。论文也没有提到这套流程跑一轮要多少 token、多少时间——如果每个失败病例都要 LLM 翻波形和测量值,离线迭代的成本未必低。
但作为一条技术路线,它给了一个提示:用 LLM 做证据梳理,人来做最终决定。LLM 能把「为什么错、哪里错了」这一步从凭经验猜,变成有测量值支撑的诊断——这在医疗 AI 这种容错率极低的场景里,可能比多刷两个点准确率更值钱。
论文地址:https://arxiv.org/abs/2607.24419
目前没有看到开源代码的链接,感兴趣的可以盯一下作者主页后续更新。