推理越深,噪音越大:REDE 给长思考链路做了一次「注意力降噪」

留意过推理模型工作过程的人大概都有这种印象:模型在最终答案前会输出一段很长的 reasoning trace——像是把自己的思考过程摊开写了份日志。粗看每一步都有道理,细看经常绕来绕去,有时候还会自己编个理由把自己带沟里。这是长推理的固有现象,不是模型在偷懒。

几位作者在 arXiv 上发了一篇论文,专门讨论这个矛盾——推理模型想得越久、想得越细,它的思维轨迹里混入的噪音反而越多。多余步骤、重复步骤,把真正能用来判断它有没有胡说八道的信息淹没了。他们管这类问题叫 reasoning noises,并且明确分了两种:irrelevant steps 和 repetitive steps。

以前的办法为什么不行。之前有人试过从推理轨迹里揪幻觉,主要手段是算置信度分数或者用 embedding 做简单过滤。但这篇论文指出,长轨迹、迂回思维一上来,这些方法就扛不住了——分数会波动,embedding 会被噪音步带偏。问题不在检测方法本身,而是推理数据太脏。

REDE 的做法。他们提出的框架(全称 Reasoning Denoiser)不依赖人工标注,也不调用外部工具,而是拿模型自己对最终答案的注意力作为监督信号。这个信号用来重新组织每一步的表征空间——哪一步真正对最终决定有贡献,哪一步是绕路、是重复,都会在表征空间里拉开距离。然后把噪音步切掉,只留下干净的子序列给检测器用。REDE 是一个预处理模块——已有的 detector 可以直接接上去,由它把噪音步滤干净再交进去,不需要替换现有检测器。论文在多个 reasoning benchmark 上做了实验,结论是 consistently improves detection performance。

一个暂时没解决的自指问题。REDE 依赖 final-answer attention 作为监督信号,这个前提本身就假设模型输出了一个可靠的最终答案。但如果最终答案本身就是有幻觉的呢?注意力信号还能不能信任?论文目前没有正面讨论这个循环。REDE 更适合答案大致正确、需要确认过程有没有问题的场景,而不是答案完全未知、需要从零检测的场景。

但这个方向值得放进周报。推理模型正在成为 API 调用的默认选项,开发者把越来越多决策流程交给长思考链路去完成,却很难审计模型到底怎么绕到结论上去的。REDE 的思路是用模型自己的注意力信号做一轮清洗,不需要人工干预,也不需要外部工具。在搭 Agent、做 eval pipeline、或者被 o1 级别的长思考输出折腾过的人,这篇论文值得一读。

相关链接:
- arXiv:2607.22098
- PDF 全文