测完 15 个多模态模型看病,结论是:方向感有了,推理还不行

AI 看病这事,之前的评测方式一直有个结构性缺口:要么给一张片子让模型直接说结论,要么给一段文本做单选题。但真在医院里,诊断不是这样走的。真实的临床流程是分步的、多轮的——先看主诉,再查体征,再开检查,影像出来之后结合前面的信息重新判断,诊断假设在过程中不断被修正。而目前绝大多数多模态大模型评测,覆盖不到这部分。

最近 arXiv 上有一篇来自多家机构的论文,发布了 ClinMM-Bench——目前规模最大的多轮多模态临床诊断评测基准。数据量很实在:1,089 个真实临床病例,3,760 张医学影像,覆盖 8 个专科。跟过去那些「一锤子买卖」的评测不同,ClinMM-Bench 模拟了信息逐步披露的过程,模型需要在多轮交互中持续更新诊断判断,而不是一次性给出答案。

研究者设计了一套两层评估框架:第一层看诊断准确性,第二层看诊断推理质量。他们测了 15 个有代表性的多模态大模型,闭源和开源都包括在内。

闭源模型的整体诊断准确率最高,但所有模型在「完全正确诊断」这个指标上占比都很有限。模型们能猜到大致方向、能列出看着合理的鉴别诊断,但真要把整个推理路径走对、把关键体征和影像发现准确扣在一起,大部分还做不到。

论文归纳了五个代表性失败模式:

第一个是信息整合失败——模型在多轮对话里接了新信息之后,没法把它和前面轮次的信息有效整合,诊断思路前后脱节。第二个是知识映射错误,记住了知识点但用错了场景。第三个是感知错误,对影像上的关键征象识别不准。第四个是过早结论——信息还不充分就直接敲定诊断,这在真实临床里是典型的翻车行为。第五个是视觉幻觉,模型「看到」了影像上实际不存在的异常。

这五个错误里,有些是纯模型能力问题(感知、幻觉),有些是评测方式本身暴露出来的——比如过早结论和信息整合失败,在单轮评测里根本测不出来。这正是 ClinMM-Bench 的价值——它把问题从「模型能不能识别肺炎」换成了更贴近临床场景的提问:模型能不能像医生一样,在信息逐步披露的过程中做推理、修正判断。

对于正在把多模态模型推入医疗场景的团队来说,这篇论文提供了一个很实际的检查清单。模型在单轮评测上分数不错,不代表它在分步推理上同样可靠。ClinMM-Bench 这种多轮、多模态、分步披露的评测方式,可能比任何静态 benchmark 都更能提前卡住那些部署后才暴露的问题。

1,089 个病例对于医疗场景的复杂性来说还不算大,8 个专科覆盖得不够宽,推理质量的评估维度也还有讨论空间。但方向是对的——临床 AI 评测从「会不会答题」往「会不会看病」挪了一步。

论文已在 arXiv 公开,可全文查看。