LLM 当心理督导师:2100 场模拟治疗跑完,大部分模型打分太松
arXiv 上刚挂出来一篇论文,叫 MyMentorLLM,讲的是用多模态 GenAI 搭建心理治疗模拟环境,让学员跟 AI 病人做 CBT(认知行为疗法),然后 AI 督导师给反馈。听起来像又一个角色扮演套壳项目,但作者直接生成了 2100 场完整治疗会话,病人按 DSM-5-TR 诊断标准配置,覆盖重度抑郁、广泛性焦虑和边缘性人格障碍三种类型,督导师则来自多个不同的 LLM。
我读完的第一反应不是「AI 能当心理医生了吗」,而是这个设计其实是一次很有规模的 LLM 评估实验——只是考场换成了心理咨询室。
一个会话里同时有三个角色:AI 病人(带诊断特征的情绪和对话模式)、学员治疗师(真人或模拟都可以)、AI 督导师(看完会话记录后给出能力评分和反馈)。2100 场跑下来,几个结果挺值得看。
病人模拟得还不错。论文分析了情绪轨迹,AI 病人确实表现出跟各自诊断一致的 emotional profile,学员治疗师也会像真实咨询一样产生情绪镜像。这算是对模拟 fidelity 的初步验证。
但督导师这边的问题更突出。大部分 LLM 在评估学员能力时普遍偏松,给分比人类督导师高出一截。模型不太愿意给出「你做得不行」这种判断。这在 AI 评估场景里是个老问题——模型在 judgement task 上容易倾向温和或者回避负面评价。心理治疗需要精准反馈,打分偏松直接削弱了训练价值。
论文里有一个对比值得注意:text-based 模型和 speech-to-speech 模型在评估上的差异。语音模型(端到端语音输入输出)给出的评分最接近人类督导师,纯文本模型普遍偏乐观。
语音模态不只是一个交互形式的变化,它可能天然携带更多评估信号。语气、停顿、语速这些在文本里被过滤掉的信息,在判断一个人「到底做得好不好」时恰恰是关键。
另外两个数据点对做 AI 产品的人有直接参考价值。
AI 督导师给出的反馈确实能改善学员后续的诊断准确率,7 个模型里有 5 个表现出正向效果。LLM 生成的 supervisory feedback 不是空话,是真能帮人提高的。很多 AI 辅助工具到了「给建议」这一步就变成了套话生成器,但这篇的结果至少说明在结构化的 CBT 框架下,LLM 的建议是 work 的。
症状识别的准确率跟模型规模正相关。大模型确实更擅长从对话里抓诊断线索,这个结论不意外,但它又一次提醒了一个实际部署中的尴尬:要效果好就得堆参数,堆参数就意味着推理成本不低。真要拿这套东西做规模化培训,账单会是第一个拦路虎。
作者自己也承认,当前 simulation 的 patient fidelity 还需要更多验证——病人演得像不像,不能只看情绪 profile,还得看临床专家的人工判断。督导师的 calibration 问题也没有被完全解决,模型打分手松是一个系统性的偏差,不是换一个 prompt 就能修好的。还有一条容易被忽略的:harmful feedback。如果 AI 督导师给了不恰当甚至有害的反馈,谁来兜底?论文里提到了这一点,但暂时没有展开解决方案。
2100 场模拟、多模态对话、跨模型对比,这篇的工作量在学术论文里算实打实的。但从工程落地的角度看,从实验室模拟到真正放进临床培训 pipeline,中间还隔着打分校准、安全护栏和成本这三道坎。对我这种每天跟模型输出打交道的人来说,那个「大部分 LLM 打分偏松」的结论比任何 benchmark 数字都更值得记住——它在提醒我们,模型在评价人的时候,目前还没有学会严肃。而这恰恰是让它真正进入高 stakes 场景之前,必须补上的课。