Penelope 提出「局部潜变量循环」,推理不再依赖长 CoT 吐 token
跑推理模型时有一个让人烦躁的时刻:模型在 CoT 里写了一大堆「让我想想……第一步……第二步……检查一下……」,最终答案也许是对的,但延迟和账单一起飞涨。Chain-of-Thought 让模型学会了思考,但它把思考过程全部序列化成可见 token,推理越长,生成成本越线性往上走。
最近 arXiv 上出现了一篇论文,试图从根源上解决这个问题。Penelope 的思路很直接:既然长 CoT 的瓶颈在于把推理计算暴露成了 token 生成,那把推理藏进模型的 latent 空间不就好了?但藏进 latent 空间还有个老问题——很多 latent 推理方案需要在整个 decoder 上反复跑循环,计算量一样不小。
Penelope 做了一件更精细的事:它把循环计算局部化到了 decoder 的某一个区间里,而不是每次迭代都跑完整模型。具体来说,下层的 decoder prefix 只计算一次,用来构建一个「问题条件化的边界记忆」,然后在这个记忆之上,用一个时间调制的 GRU 动力学和循环读取状态做迭代优化,直到 Ready 了再生成答案。整个推理链条中,真正在做循环的只是一个窄的 decoder 区间,其他部分只跑一遍。
这相当于把原来写在屏幕上的「让我想想……第一步……第二步……」压缩进了模型内部的一段潜变量路径,而且这段路径不需要每次都过整个 transformer。
论文里还设计了一个渐进式的训练策略——Progressive CoT-to-Latent Curriculum。先让模型用正常的 CoT 学习推理,然后逐步把可见推理「移交」到内部的 latent 循环路径上。这种课程设计是务实的:直接从零训 latent 推理很难收敛,从 CoT 起步再把推理内化,更容易让模型学到有效的结构化推理。
实验部分他们用开源的结构化推理 benchmark 做评估,在验证集选定的 latent budget 下,Penelope 达到了和已有 latent reasoning 模型相当的精度,同时 inference latency 更低。他们没说自己全面超越 SOTA,说的是 competitive accuracy + lower latency,这是一个诚实的定位:用小幅度的精度让步换取明显的速度提升。
对于做推理部署的人来说,这种取舍是有实际意义的。很多场景下,延迟比那 1-2 个点的精度更重要,尤其是面向终端用户的实时推理场景。Penelope 的方案如果能落地到开源模型上,意味着同样的硬件能塞进更多推理请求,或者同样请求的响应时间能明显缩短。
论文也留下了一些边界问题。latent budget 目前是在验证集上选的,不是端到端自适应学习的;实验主要落在 structured reasoning benchmarks 上,在更开放的语言任务上表现如何还不好说。以及,progressive curriculum 本身需要两阶段训练,这个流程在当前主流训练范式下能不能顺利集成,取决于社区后续的复现和适配。
Penelope 不是那种让人看完惊呼「范式革命」的论文,但它指向了一条更务实的路:在不推翻现有 decoder-only 架构的前提下,把推理计算挤进 latent 空间并限定在局部区间里跑。对一线做模型推理优化的人来说,这种 direction 比喊口号有用得多。