28 万份肠镜报告「训」出一个接近专家水平的 AI,关键不在模型结构
每天早上,AI 圈都会消化几篇新论文,大多数是基线往上挪了零点几个点。但偶尔会出现一篇,读完第一反应不是「又涨了」,而是「之前怎么没人这么干」。刚挂上 arXiv 的这篇 EndoCLIP 就属于后者。
一个团队从 280,476 份常规肠镜检查报告中,恢复出了 125,756 对「病灶级别的图像-文本对」,然后用这些数据训练了一个视觉-语言基础模型 EndoCLIP。在病灶级别检索、结构化报告生成、六个多中心临床分类任务上,它都超过了通用和生物医学领域的视觉-语言编码器,零样本和线性探测两种设置都做了。但真正让我觉得有意思的,是那些报告被「废物利用」的方式。
肠镜检查的日常流程大致如此:医生做检查、过程中截图,检查结束后写一份报告,总结发现了什么病灶、大小多少、位置在哪、性质如何。报告是「对整个过程的总结」,不是对单张图片的逐帧描述。图像和文字之间存在一个对应关系模糊的 gap,直接拿整份报告和整组图像去训,模型收到的学习信号非常嘈杂。EndoCLIP 的核心贡献,就是把这个 gap 补上了——设计了一套方法,从常规报告中恢复出「这段文字对应的是这张图」的对应关系。医院里积累多年但一直没法直接用的文档,被转化成了可训练的燃料。
这个思路比模型结构本身的创新更值得关注。在医疗 AI 领域,标注成本一直是天花板。一个精准的病灶标注需要专业医师花时间来做,而全世界有海量的检查报告——只要找到办法把报告和图像对齐,就等于免费拿到了一大笔训练数据。
论文让 EndoCLIP 的线性探测头去做良性-恶性分类,然后在盲法设置下和 12 位内镜医师做了对比,结果是接近专家读者的水平。论文措辞是「接近」——写得克制,没有用力过猛。但这就够了。一个用常规报告训练出来的模型,在分类能力上能和实际做检查的医生处于同一量级,说明数据路线是走得通的。
当然,也有它的边界。良性-恶性分类是一个相对明确的任务,模型可以在有限的类别上做得很好。但肠镜检查中还有更复杂的判断——比如病变的边界、深度浸润的识别、不同病理类型的区分——目前论文没有覆盖。另外,训练数据如果全部来自单一机构,泛化性还需要更多外部验证。
EndoCLIP 真正值得记住的,是一个更底层的事实:医院每天产生的常规文档,不是一堆没法用的废数据。它们看起来「非结构化」,只是缺少数据对齐这一步。把这个步骤跑通,几十万份报告就可以变成几十万个带监督信号的训练样本。这件事的后续发展,会比模型本身更值得持续看。
相关链接:
- 论文:arXiv:2607.28466 | PDF