测试了 3 个开源模型 960 次,发现 LLM 离进医院只差一个闭环

试过让 LLM 输出一段符合 ICD-10 标准的诊断编码的,大概见过这种场面:问它「高血压用什么编码」,回的是「HTN」或者「I10—hypertension」。前者是临床随手写的缩写,后者画蛇添足加了说明。格式不对,医疗信息系统不认。这个问题其实卡住了不少做医疗 AI 落地的团队。

最近一篇被 IEEE SMC 2026 接收的论文,把这个痛点好好量化了一把。研究者本地部署了 Qwen2.5 7B、Llama 3.1 8B 和 Gemma2 9B 三个开源模型,用 320 个临床场景、覆盖 10 个医学专科,做了 960 次测试。基线合规率在 85.9% 到 91.6% 之间,三个模型的数据非常接近。这说明什么?不是某一个模型特别笨,是训练语料里就缺少医疗 IT 标准格式的覆盖。96% 的检测失败不是模型答错了医学问题,而是它用了临床习惯写法——缩写、非标准前缀、格式不对——医院后端接不了。

论文的方案简单但实用:在模型输出后面接一个验证-修复循环。第一步照常生成;第二步用一个格式验证器去卡 ICD-10、CPT、HL7 FHIR 三种标准的合规性;不通过就把具体的格式错误塞回提示里让模型自己改。大部分错误一次迭代就修好,最多两次。整体合规率拉到 99.0%,单模型最低 98.4%、最高 99.4%,统计显著性确认(Exact McNemar p < 0.001)。

这个结果的价值在于,它把格式合规问题从「模型能力问题」挪到了「工程架构问题」。不需要重新训模型,不需要做 RLHF,不需要换更大的参数量——加一个轻量验证循环就能从 85% 提到 99%。这对做医疗 AI 工程落地的人来说是很实际的消息。

但也要看清楚边界。论文验证的是「格式合规」,不是「临床正确」。模型输出了一个格式完美的 ICD-10 编码,不等于它给的诊断是对的。验证器检查的是壳,不是核。而且论文只测了 7B 到 9B 的模型,更大规模的模型在格式合规上会不会有更好的基线表现,没有涉及。

说句实在的:LLM 进医院的路上,临床推理能力可能已经不是最短那块木板了。医疗 IT 标准那套格式要求,看起来琐碎,但确实是拦路虎。这篇论文给了一个很实在的结论——这块拦路虎,一个工程闭环就能解决一大半。剩下那一小半,以及格式底下的临床判断,才是真正需要较真的地方。