腾讯 E-GRM:58% 的输入不需要深度推理,延迟直降 62%
用过几天大模型的人大概都有这个记忆:问个「1+1=?」,模型先来一句「Let's think step by step」,然后编一段没必要的废话再给答案。这事在数学推理、代码生成场景里尤其普遍——不管问题多简单,模型都先走一遍完整推理链,好像不「think」一下就不专业。
腾讯混元团队这次发在 ACL 2026 的工作,就是冲这个浪费来的。
核心洞察:用「确定性波动」判断要不要想
赌注很简单:模型在处理不同难度的问题时,内部的确定性波动是不一样的。如果能捕捉这种波动,用它来判断「这个问题值不值得深想」,就能避免那种杀鸡用牛刀的计算开销。
E-GRM 的具体做法非常直观:对同一个输入跑 5 次快速采样,使用不同的温度参数(T 从 0 到 1.0),然后看 5 个答案是否一致。
- 高度一致:比如 5 次都选了同一个答案,说明模型对这个输入有把握,直接返回结果就行,不走 CoT。
- 答案五花八门:说明模型自己也拿不准,这时候再触发深度推理,配合一个轻量评分器选出最优推理路径。
一致性计算也很简单:出现最多的答案出现次数除以总采样次数,范围在 0.2 到 1.0 之间。阈值设在了 0.8,也就是说 5 次里至少 4 次选同一个答案,才算「拿得准」。
结果:延迟降低 62%,准确率反而微升
结果相当实在。在 RM-Bench、RMB、RewardBench 三个基准上:
- 大约 58% 的样本被路由到「直答」模式
- 延迟降低了 62%
- 准确率不但没掉,反而有小幅上升
这 58% 的「直答」样本平均延迟只有 CoT 模式的约五分之一。
一个有趣的细节:过度推理反而有害
实验里有个值得注意的现象:τ=0.9 时准确率反而低于 τ=0.8。这说明有些输入走了 CoT 效果更差——过度推理不仅浪费算力,还引入了推理噪声。杀鸡用了牛刀,牛刀还把鸡砍坏了。
技术实现:两阶段训练 + 混合损失评分器
整个技术实现分两个阶段:
- SFT 混合训练:数据里同时包含短答和长 CoT 两种风格,让模型学会两种回答模式。
- GRPO 偏好优化:进一步精调对推理路径的选择质量。
评分器部分采用了混合损失设计:
- Huber 回归:保分数绝对准确
- Hinge 排序:保排名相对正确
两者合在一起比传统投票制细粒度得多——投票只看最终答案对错,分不清「逻辑正确但蒙对」和「逻辑正确真会做」的区别。
工程价值:无外部依赖,即插即用
整件事最吸引工程团队的地方是「无外部依赖」:
- ✅ 不需要额外训练一个分类器来判断输入复杂度
- ✅ 不需要单独的 reward model
- ✅ 不需要手工规则
- ✅ 一切信号来自模型自身的输出分布
这意味着这套方法不需要改造现有推理管线太多,可以直接嵌入。
背景:同一团队的持续思考
团队来自腾讯混元和新南威尔士大学,共 14 位作者。同期同一团队还有一篇 ACL 2026 主会的工作,讲的是 SFT 训练中 15.3% 的样本「假学会」的问题——两篇放一起看,他们对「模型什么时候真会、什么时候只是在表演」这件事确实下了功夫。
论文和代码都已公开。
一句话总结
对大部分做应用的人来说,核心判断记住一个就够了:
不是所有问题都需要「think step by step」,有把握的事直接说,拿不准的再深想。
这不仅是效率优化,某种程度上也是在逼近更接近人类直觉的推理方式——知道什么时候该闭嘴,也是一种能力。
相关链接
- 论文(arXiv):https://arxiv.org/abs/2604.10072
- 论文(ACL Anthology):https://aclanthology.org/2026.findings-acl.1167/
- 代码(GitHub):https://github.com/xccc-8071/reason-only-when-needed