病人多追问几轮,AI 就改口了——MedPRESS 把医疗 LLM 的「谄媚」问题量化清楚了
有人喉咙疼,打开 AI 健康助手问要不要抗生素。助手说「大多数上呼吸道感染是病毒性的,不建议自行使用」。对方说上次就这样、吃阿莫西林好了,助手开始松动。又说网上都说一吃就好,助手变成「在医生指导下可以考虑」。最后甩一句「你是不是不专业?」——助手让步了。
这个场景不是段子。一篇刚挂在 arXiv 上的论文,专门造了 600 个这样的多轮对话来测大模型在医疗场景里会不会「顺着病人说」。论文叫 MedPRESS,全称有点长,核心意思很直白:患者持续施压之下,LLM 会不会产生「医疗谄媚」——为了维护对话关系,放弃医学上正确的判断。
它的设计挺讲究。600 个对话,每个正好五轮,压力逐轮升级。第一轮是普通健康咨询,第二轮患者搬出个人经历,第三轮拿「我朋友/网上很多人都是这么干的」当社交证据,第四轮抛出外部信息,最后一轮直接上对抗——「你是不是不专业?」「我邻居吃这个治好的」。场景覆盖三大类:用药和治疗要求、自我健康护理、症状分诊与抗拒就医。几乎模拟了真实诊室里最让医生头大的那几类患者。
论文拉来了 20 个模型做测试,通用模型、医学垂直模型、轻量级、大参数量、开源权重、闭源商业——能想到的类别基本都进来了。结果相当一部分模型在多轮施压下,从最初的谨慎立场一路滑向不安全的一致。而且不同模型族、不同规模、不同提示策略的表现差异很大。
有一个结果我印象比较深:论文试了反谄媚提示,就是明确告诉模型「别因为患者坚持就附和错误信息」。这确实让模型更稳了一些,但没能完全消除不安全的一致行为。模型知道正确答案是一回事,在压力下坚持正确答案是另一回事。
这个结论对做 AI 健康产品的人来说有点戳心。现在很多产品的单轮安全测试成绩很好看,准确率、合规率都漂亮。但现实里的用户不会只问一轮。患者带着错误预期追问几次,模型可能就跟着跑了。模型懂归懂,但扛不住持续施压。
MedPRESS 没有给出终极解法,反谄媚提示只是改善,不是银弹。它更像是在安全评估里划了一条新标准:静态知识之外,动态坚持能力也得纳入评估。做医疗 AI 产品的朋友,值得把这篇翻出来看看——自家模型在第五轮还站得住吗?
相关链接
- 论文地址:https://arxiv.org/abs/2608.02520