T²MLR:用中层循环突破Transformer推理瓶颈

T²MLR:用中层循环突破Transformer推理瓶颈

核心事件

2026年7月16日,Ziyang Cai、Xingyu Zhu、Yihe Dong、Yinghui He 和 Sanjeev Arora 等五位研究者向 arXiv 提交了论文 T^2MLR: Transformer with Temporal Middle-Layer Recurrence(arXiv:2607.15178),提出了一种名为 T²MLR(带时间中层循环的 Transformer)的新型推理架构。


问题背景:Transformer 推理的"信息衰减"困境

Transformer 的推理过程依赖于自回归解码(autoregressive decoding),即逐个 token 生成输出。在这个过程中,模型需要在每一步将丰富的隐藏层计算结果压缩到当前 token 的表示中。

论文指出,这种机制存在一个根本性缺陷:中间推理状态难以跨时间持久化。换句话说,Transformer 在推理过程中产生的复杂计算和推理痕迹,会在 token 空间的反复压缩中丢失,导致模型在处理需要多步推理的任务时表现受限。


T²MLR 的核心思路

T²MLR 是一种基于 Transformer 的潜在推理架构(latent reasoning architecture)。其核心创新在于:

  • 前一个 token 的计算中缓存中层表示(middle layer representation)
  • 将该缓存表示直接融合当前 token 位置的更早层中
  • 通过这种方式,使抽象的中间计算能够在解码步骤之间持久化

简而言之,T²MLR 让 Transformer 在推理过程中"记住"之前步骤的中间计算结果,而不是每步都从零开始。


关键实验发现

1. 性能优势

在自然语言预训练和多跳推理微调任务中,T²MLR 一致性地超越了数据量和参数量匹配的 Transformer 基线模型

2. "局部循环"优于"全层循环"

论文发现了一个反直觉的结果:

仅对局部中层块应用循环(低至网络规模的 20%)往往优于对整个网络应用全层循环。

这意味着有效的推理持久化不需要在所有层中引入循环机制,而是可以从模型的中层区域获得更强的收益。

3. 无需从头预训练

T²MLR 的一个重要实用价值是不需要从零开始预训练

  • 研究团队将一个循环路径逆向工程改造(retrofitting)到一个已有的 1.7B 参数 Transformer 模型中
  • 仅需进行简要微调,即可显著提升数学推理能力

这一特性大幅降低了将该架构投入实际应用的门槛。


学术意义与行业启示

理论层面

论文结果表明,Transformer 中的有效潜在推理不需要像以往工作那样在所有层中循环,而是可以通过针对性的中层循环机制更强地涌现出来。这为理解 Transformer 的推理能力提供了新的视角。

实践层面

对于 AI 从业者和开发者而言,T²MLR 的价值在于:

  1. 推理效率:在几乎没有增加推理开销的情况下提升了模型的推理持久化能力
  2. 迁移成本低:可直接改造现有预训练模型,无需昂贵的从头训练
  3. 架构简洁:仅需修改部分中层结构,工程实现复杂度可控

论文信息

项目 详情
标题 T^2MLR: Transformer with Temporal Middle-Layer Recurrence
arXiv ID 2607.15178
提交日期 2026年7月16日
作者 Ziyang Cai, Xingyu Zhu, Yihe Dong, Yinghui He, Sanjeev Arora
学科分类 Computation and Language (cs.CL); Artificial Intelligence (cs.AI)
实验 HTML 版本 https://arxiv.org/html/2607.15178v1
许可证 CC BY 4.0

本文所有事实和数据均来源于上述 arXiv 论文页面,未引入任何材料外信息。