腾讯 E-GRM:58% 的输入不需要深度推理,延迟直降 62%

杀鸡何必用牛刀:腾讯混元提出 E-GRM,让大模型学会「有把握时闭嘴」

用过几天大模型的人大概都有这个记忆:问个「1+1=?」,模型先来一句「Let's think step by step」,然后编一段没必要的废话再给答案。这事在数学推理、代码生成场景里尤其普遍——不管问题多简单,模型都先走一遍完整推理链,好像不「think」一下就不专业。

腾讯混元团队这次发在 ACL 2026 的工作,就是冲这个浪费来的。

核心洞察:用「确定性波动」判断要不要想

赌注很简单:模型在处理不同难度的问题时,内部的确定性波动是不一样的。如果能捕捉这种波动,用它来判断「这个问题值不值得深想」,就能避免那种杀鸡用牛刀的计算开销。

E-GRM 的具体做法非常直观:对同一个输入跑 5 次快速采样,使用不同的温度参数(T 从 0 到 1.0),然后看 5 个答案是否一致。

  • 高度一致:比如 5 次都选了同一个答案,说明模型对这个输入有把握,直接返回结果就行,不走 CoT。
  • 答案五花八门:说明模型自己也拿不准,这时候再触发深度推理,配合一个轻量评分器选出最优推理路径。

一致性计算也很简单:出现最多的答案出现次数除以总采样次数,范围在 0.2 到 1.0 之间。阈值设在了 0.8,也就是说 5 次里至少 4 次选同一个答案,才算「拿得准」。

结果:延迟降低 62%,准确率反而微升

结果相当实在。在 RM-Bench、RMB、RewardBench 三个基准上:

  • 大约 58% 的样本被路由到「直答」模式
  • 延迟降低了 62%
  • 准确率不但没掉,反而有小幅上升

这 58% 的「直答」样本平均延迟只有 CoT 模式的约五分之一。

一个有趣的细节:过度推理反而有害

实验里有个值得注意的现象:τ=0.9 时准确率反而低于 τ=0.8。这说明有些输入走了 CoT 效果更差——过度推理不仅浪费算力,还引入了推理噪声。杀鸡用了牛刀,牛刀还把鸡砍坏了。

技术实现:两阶段训练 + 混合损失评分器

整个技术实现分两个阶段:

  1. SFT 混合训练:数据里同时包含短答和长 CoT 两种风格,让模型学会两种回答模式。
  2. GRPO 偏好优化:进一步精调对推理路径的选择质量。

评分器部分采用了混合损失设计:
- Huber 回归:保分数绝对准确
- Hinge 排序:保排名相对正确

两者合在一起比传统投票制细粒度得多——投票只看最终答案对错,分不清「逻辑正确但蒙对」和「逻辑正确真会做」的区别。

工程价值:无外部依赖,即插即用

整件事最吸引工程团队的地方是「无外部依赖」

  • ✅ 不需要额外训练一个分类器来判断输入复杂度
  • ✅ 不需要单独的 reward model
  • ✅ 不需要手工规则
  • ✅ 一切信号来自模型自身的输出分布

这意味着这套方法不需要改造现有推理管线太多,可以直接嵌入。

背景:同一团队的持续思考

团队来自腾讯混元新南威尔士大学,共 14 位作者。同期同一团队还有一篇 ACL 2026 主会的工作,讲的是 SFT 训练中 15.3% 的样本「假学会」的问题——两篇放一起看,他们对「模型什么时候真会、什么时候只是在表演」这件事确实下了功夫。

论文和代码都已公开。

一句话总结

对大部分做应用的人来说,核心判断记住一个就够了:

不是所有问题都需要「think step by step」,有把握的事直接说,拿不准的再深想。

这不仅是效率优化,某种程度上也是在逼近更接近人类直觉的推理方式——知道什么时候该闭嘴,也是一种能力。


相关链接

  • 论文(arXiv):https://arxiv.org/abs/2604.10072
  • 论文(ACL Anthology):https://aclanthology.org/2026.findings-acl.1167/
  • 代码(GitHub):https://github.com/xccc-8071/reason-only-when-needed