ClinPRISM 发布 | 4B 参数、16 Token、0.15 秒推理,临床时序问答来了个轻量专业方案
临床时间序列数据是出了名的难搞——稀疏、不规则、不同指标采样不同步。把 ICU 监护数据、血糖监测或者心电图直接塞给 GPT-4 这类通用多模态模型,大概率得到一堆模棱两可的回应,或者干脆就是错的。这不是模型不够聪明,是它根本没见过这种数据形态。
最近 arXiv 上挂出来一篇论文,ClinPRISM,专门搞这个场景。作者 Frank Nie、Ethan B Liu、Yuan Zhu、Wei Fan、Jindong Han 设计了一个 4B 参数的多模态 LLM 框架,配上专门针对不规则时序的编码和蒸馏策略,在临床时序问答上跑到了 SOTA。
ClinPRISM 的核心设计有三块。
不规则感知多尺度编码器。临床数据在不同时间尺度上有不同含义——心率看秒级,血压看分钟级,体温看小时级。固定窗口的编码器抓不住这个差异,多尺度编码让模型同时感知短窗口突变和长窗口趋势。
时间证据蒸馏器。多尺度编码会产出不少特征,不可能全塞进 LLM。蒸馏器把它们压缩成 16 个 token。这个数字挺关键——token 越少推理越快越便宜,直接影响能不能嵌进临床实时工作流。
渐进对齐策略。文本空间和时序空间的 embedding 不是一回事,一步对齐容易丢信息。ClinPRISM 分阶段把时序表征往文本空间靠,尽可能保留细节。
数据方面,他们构建了 30,000 条临床时间序列配上多尺度描述,外加 41,000 条指令微调样本,覆盖 11 类任务。
结果部分最有看头。4B 参数的 LLM backbone,在保留测试集上达到 SOTA,每次推理只吃 16 个时序 token,平均延迟 0.15 秒。临床场景里,医生问个问题等十几秒是不现实的。0.15 秒意味着这东西能直接嵌进工作流,而不是提交查询然后等结果。
用 4B 模型做到这个程度,比很多拿 70B、上百 B 参数用通用架构硬怼的方案要聪明。专门设计的小模型加有针对性的数据,在垂直场景里比大模型泛读然后猜答案可靠得多。
目前只是 arXiv 预印本,代码和数据还没公开。训练数据是构建的而非真实临床记录,从 benchmark 到实际部署还有距离。但方向很清楚——临床 AI 不一定需要什么都会的通用天才,更需要的是在具体任务上快、准、便宜的专业选手。