GPT-5.5 在长对话里只拿 41 分——新 Benchmark 把大模型的「多轮健忘症」量化了
跟 AI 助手聊到二三十轮之后,很多人都会遇到这种事:模型忘了开头交代的约束,把前几轮提到的东西张冠李戴,或者还没等用户说「好」就自己把事情办了。不是偶然翻车,这是当前大模型在长程多轮对话里一类系统性的薄弱环节。
7 月 31 日挂上 arXiv 的 Hy-MultiTurn,就是专门针对这类「翻车」做的一次系统性量化。它不是又一套单轮问答或多选题,而是专门测深度多轮对话理解的六维中文 Benchmark。团队(Eileen Ye 等 10 人)先分析了真实聊天机器人的失败案例,从中提炼出六种反复出现的故障机制,再把这些机制转成测试维度,构建了 209 个控制任务,每段对话从 12 轮到 76 轮不等。
六个维度翻译成人话分别对应:
- 约束记忆:设的规则模型还记不记得。
- 精确执行:能不能按指定方式做指定的事。
- 约束综合:同时满足多个条件时会不会打架。
- 对象定位:在漫长的对话历史里找到正确对象。
- 动作抑制:条件没满足时能不能憋住不动。
- 指代消解:「那个」「它」「这家」到底指谁。
跟模型聊崩的大多数场景,基本都能装进这六个筐里。
论文测了 22 个前沿模型配置,综合最强的 GPT-5.5,在所有维度上同时满足要求的比例只有 41.1%。一段典型的深度多轮对话里,它有将近六成的概率至少在某个关键维度上出错。而且没有哪个模型在全部六个维度上都表现最好——擅长记约束的,可能在指代消解上栽了;动作抑制做得好的,约束综合又垮了。
这组数据对两种人有直接价值。
一种是重度 AI 用户。体感上觉得「聊得越久越蠢」,Hy-MultiTurn 告诉你这不是错觉。它在任务里加入了无关话题干扰和口语化表达,模拟的就是真实聊天场景的噪声。助手在第三轮记住了一个偏好,到了第三十轮,可能早就丢了,或者被中途插的闲话带偏了。
另一种是正在搭 Agent、客服系统或任何长流程对话产品的开发者。这六个维度就是一份缺陷排查清单。如果 Agent 在复杂任务里执行不到位,别急着只怪 Prompt 写太短——问题很可能出在模型自身的长程指代或约束综合能力上。Hy-MultiTurn 可以拿来当一套诊断框架,按它的维度拆自己的场景,看哪个维度才是真正的瓶颈。
这是目前少见的专注中文深度多轮对话的 Benchmark。英文类似测试集有一些,但中文在口语化表达、缺省主语和长程指代上的翻车模式不一样。Hy-MultiTurn 正好补了缺口。
论文没有给出解决方案——它本质是一份诊断报告。但诊断本身是值钱的:它把原来只停留在体感层面的「聊久了就傻」,锚定成了六个可测量、可追踪的维度。下一步不是等模型自己进化,而是开发者可以拿着这六面镜子去照自己的流程——Prompt 该拆多细、记忆模块怎么设计、什么时候该人工兜底。
多轮对话是 Agent 产品最核心的交互形态。Hy-MultiTurn 提醒了一件事:这条路还远没走完。