大模型终于学会「攒经验」了:SPEE 框架把推理和训练之间的那层窗户纸捅破了

模型自进化,缺个记错本

我最近看论文有个越来越强烈的感受:模型自进化这事儿,一直卡在一个不上不下的位置。

一个典型场景是——模型在某个数学推理问题上给出了漂亮的逐步推导,换个同类题型,又回到老路子上去了。测试时可以做 Chain-of-Thought 扩展,可以多次采样选最优,但推理完也就完了,经验攒不下来。训练时用 RL 硬调,能改权重,但缺少一个把「这次 trial 里学到的东西」抽象出来、迁移到下一轮去的机制。两个范式各管一段,中间是断的。

模型缺一个「记错本」。

这周 arXiv 上有一篇论文,正好在捅这层窗户纸。作者 Meng Li 等人提出的 SPEE 框架,全称 Self-Progressive Experience Evolution,核心就一件事:在测试时推理和训练时优化之间,显式地加一个「经验蒸馏」阶段。论文链接是 arxiv.org/abs/2608.02139,代码也开源了,在 github.com/rrrsj/SPEE。

名字很学术,意思其实挺直白。SPEE 先把模型扔到多个交互里跑一遍,从成功和失败的轨迹里提取、验证、渐进演化出可迁移的经验,攒成一个全局经验池。然后通过一个叫 On-Policy Self-Distillation(OPSD)的机制,把这些经验蒸馏进模型参数里。最后,带着这些内化了的先验知识去做 RL 探索,找新的解法。

这套设计的巧妙之处,不在某一个单一模块,在它把流程补全了。

之前很多工作只做了半截。有的只做 test-time 推理扩展,经验留在 prompt 或者思维链里,对话一关就没了;有的只做 training-time 强化学习,模型调完了确实能解某类题,但说不清自己怎么学会的,也很难把学到的套路单独拆出来复用。SPEE 中间插的这一层「经验池 + 蒸馏」,恰好让两个半截连上了。

它也没有只拿成功的轨迹说事。经验池同时吸收失败轨迹里的信息,然后主动过滤低质量的 experience。模型自己在推理时产生的「伪反思」太多了,很多事后合理化(post-hoc rationalization)看着漂亮,实际没什么用。有一个显式的筛选和渐进演化机制,至少能压一压这种自我欺骗。

论文在五个数学推理 benchmark 上做了实验,三种模型规模都跑了一遍,结果 consistently 优于纯 test-time 或纯 training-time 的自进化基线。当然,这是 arXiv 论文,还没走 peer review,也不是哪个大厂发了产品。但我觉得这类方向比又刷一个 benchmark 点更值得跟进——它在解决一个真实问题:怎么让模型在持续使用中真正变强,而不是每次从头开始。

我准备把代码拉下来跑一跑,看看那个经验池在实际推理任务里长什么样。如果它真能做到「模型自己攒错题本、自己复习、自己考更好」,后训练方向今年最值得跟的线恐怕就是它了。