Cognivia 发布|专治 LLM「过度讨好」,这篇论文造了一个真能开药的 CBT Copilot

用 LLM 做过心理疏导的人大概碰到过这种情况:说了半天焦虑,它回一句「你已经做得很好了,要相信自己」。话没错,但没用。通用模型在心理健康场景下有两个硬伤:一是过度讨好,怎么说用户都没错;二是缺乏领域 specificity,分不清「合理反思」和「认知扭曲」的区别。

前天(7 月 28 日)arXiv 上的一篇新论文,就是冲这两个问题去的。标题是 Cognivia: A Cognitive Behavioral Therapy Copilot for Evidence-Based Mental Healthcare,作者来自 SNOWTEAM2023,代码已开源。

概括一下:他们做了一个 AI CBT(认知行为疗法)Copilot,能自动识别认知扭曲并生成理性回应,不玩虚的。

CBT 是治疗认知扭曲的金标准,但专业治疗师严重短缺,规模化卡在这里。LLM 替代品的尝试一直有,但就像上面说的,模型要么乱夸人,要么胡说。论文用了一个挺实在的词——"overly flattering responses",「过度奉承」。这在心理健康场景下尤其致命:不是在帮用户纠正扭曲认知,而是在强化它,等于治病反把病养重了。

Cognivia 的做法分几层。训练数据不靠通用语料,基于权威 CBT 教科书和标准参考文献,再加精神健康问答数据增强。不只是微调,用了 multi-stage prompting 和结构化生成策略,整个过程有行为科学专家监督。最终微调的是轻量级 LLM——不是 70B、几百 B 的大模型,是能跑得动的规模。

Cognivia 能识别认知扭曲(比如灾难化思维、非黑即白),然后生成理性的替代回应。

论文还有一个贡献:提出了第一个面向 CBT 理性回应的分层质量评估框架。AI 研究员和行为科学专家一起设计,用了词汇指标、LLM-based Judge(两套互补标准),再加 10 名行为科学专家的真人评估。不光造了药,还造了验药的方法——这在 AI 心理健康领域里是个缺口。

对开发者来说,这个项目的信号:代码已开源(CC BY-NC-ND 4.0);轻量级模型意味着可能落地到实际部署,不依赖闭源 API;structured generation 和 multi-stage prompting 的做法对任何做 domain-specific LLM 应用的团队都有参考价值。

这篇论文是研究性质,不是产品发布。10 位专家的评估规模不算大,基准对比限定在学术范围内。Cognivia 目前还是实验室阶段,离成为手机里的治疗师还有距离。但方向是对的——它冲着 LLM 在心理健康场景下的真实缺陷去,跟只会说「你很棒」的聊天机器人是两码事。

GitHub 链接在论文里:https://github.com/SNOWTEAM2023/Cognivia。有兴趣的可以拉下来跑跑看,顺便治一治模型「过度讨好」的毛病。