用户给 ChatGPT 打了 4.19 分,但 23% 的任务其实没干成

昨天刷到一篇刚被 AIES 2026 接收的论文,题目叫 MonitrLLM,读完之后让我对着屏幕发了好一会儿呆。

不是因为有什么惊天动地的技术突破,而是它用一个特别朴素的实验,点明了一件 AI 圈里大家心照不宣但很少明说的事:我们根本不知道模型到底有没有帮上用户的忙。

论文作者来自 Penn 和 Brown,做的事情很简单——他们搭了一套开源基础设施,让用户在用 ChatGPT 的时候,能同时记录三样东西:完整的对话文本、用户本来想干嘛(task intent)、最后到底干成没有(outcome assessment)。以往的研究里这三样东西是被拆开处理的:benchmark 只管答没答对,大规模对话语料只管说了什么话,界面里的点赞点踩只管用户爽不爽。没有一套东西把它们串起来看。

于是作者找了 26 个大学生,让他们正常用 ChatGPT 干了两周的活,拿到 206 份带完整对话记录的任务报告。

结果挺打脸的。

用户自己报告的平均满意度是 4.19 分(满分 5),看起来大家用得挺开心对吧?但同一批人、同一批任务,有 23.1% 的任务目标实际上没达成。 每五次跟 ChatGPT 对话,至少有一次其实没搞定——只是当时可能还没发现,或者懒得追究了。

另一个发现是多轮对话。直觉上,回合越多,似乎意味着模型在与用户深度互动、帮用户拆解问题。但 MonitrLLM 的数据显示:多轮对话的失败率是单轮对话的 2.5 倍。不断追问、纠正、重说,往往意味着模型第一次就没搞懂意图,第二次也没搞懂,第三次还在猜。

这其实很符合我自己的使用体感。很多时候我跟一个模型来回拉扯七八轮,最后发现它从一开始就理解偏了,而我浪费了十分钟才意识到。以前我把这种过程归结为「prompt 没写清楚」,怪自己。但这篇论文提供了一种更结构化的解释:我们缺少一个把「用户到底想干什么」当作一等公民的评估体系。

现在的模型评估,不管是学术 benchmark 还是产品的 A/B 测试,核心都在看模型输出好不好,很少追到用户侧的目标完成率。MonitrLLM 的尝试是把 conversation transcript + user intent + outcome 绑在一起,作为 main signal,而不是 optional metadata。这听起来不酷,但在工程和产品层面,要落地其实很难——得让用户愿意在对话前说清楚目标、对话后评价结果,而且不能太打扰体验。

论文里没有吹自己解决了所有问题,26 人的 pilot 也确实只是可行性验证。但这个方向我觉得是对的。尤其对于正在做 AI 产品的团队,关注吞吐量和用户 retention 曲线之外,更值得想想怎么在自己的产品里搭一套类似的闭环——用户到底带着什么问题来,走的时候问题解决没有。

如果多轮对话的失败率真的比单轮高 2.5 倍,那很多产品经理就要重新思考一件事了:那些引以为傲的「高对话轮数」,到底是 engagement 还是 frustration,就需要打个问号了。

论文已经挂在 arXiv 上,代码和基础设施也说会开源。我会持续关注后续的更大规模实验。毕竟,如果 26 个人就已经暴露了 23% 的隐性失败,那放到千万用户级别的产品里,这个数字意味着什么,值得仔细想想。