梁文锋看重的持续学习,一支国产团队悄悄做出来了!

大模型部署后如何“持续进化”?Macaron-V1 用强化学习让经验写回参数

大语言模型在部署上线后,其能力往往被“定格”。每天处理海量真实请求的模型,难以将新获得的经验重新学进去。同一个用户纠正过多次的偏好,下一次还得重新解释;智能体在相同流程里反复失败,这些失败也不会自然转化为它的新能力。

想让模型变强,最直接的办法是拿新数据再训练一遍。但对于千亿、万亿参数的模型而言,全量重训的成本高到无法常态化执行。

针对这一现实短板,Mindverse 旗下研究实验室 Mind Lab 开源了 Macaron-V1。该方案通过冻结庞大的基座模型,仅训练一个很小的附加模块,并利用强化学习将新经验持续写回参数,使大模型在部署之后仍能低成本地进行持续学习。

从 FireAct 到 Macaron-V1:同一条技术路线的演进

Macaron-V1 的研发团队 Mind Lab 在智能体领域并非初出茅庐。早在 2023 年,团队成员 Andrew 就与现任腾讯集团首席 AI 科学家姚顺雨、普林斯顿大学 Karthik Narasimhan 合作发表了 FireAct 论文。FireAct 利用监督微调(SFT)将智能体的行为轨迹一次性写进模型参数,被视为“把经验写进参数”的早期尝试之一。

从 FireAct 到 Macaron-V1,团队沿着同一条技术路径持续推进:当年使用监督微调一次性写入经验,如今则转换为利用强化学习持续写回经验。Mind Lab 将这条路线推向了万亿参数规模。

据公开报道,目前全球能在万亿参数规模上跑通 LoRA 强化学习的团队屈指可数,Mind Lab 是其中之一,另一家为前 OpenAI CTO Mira Murati 创立的 Thinking Machines Lab。

产品版本一览

Macaron-V1 是一款面向个人智能体场景的开源模型,目前提供两个版本:

  • 旗舰版 Venti:7480 亿参数,由一个 744B 参数的 GLM-5.2 基座和四个 10 亿参数的 LoRA 专家组成,原生支持 200 万 token 上下文。
  • 轻量版 Tall:350 亿参数,基于通义千问 3.6,面向本地部署。

此外,该模型此前还发布过一个预览版 Macaron-V1-Preview(749B 参数、五个专家)。正式版 Venti 从五个专家缩减为四个,并非缩水,而是将 Preview 中与特定场景相关的 LoRA 并入了通用的 Agent 专家中。

核心思路:用 LoRA 承载“持久状态”,以强化学习持续写回经验

让模型实现持续学习主要有两条路径:

  1. 不动参数,将经验放入上下文(如提示词工程、记忆机制、检索增强等)。优点是灵活,缺点是经验存储在模型外部,每次调用需重新读取,成本随积累递增,且“放进上下文”不等于模型真正内化了知识。
  2. 将经验写进参数。Macaron-V1 选择了后者,旨在让模型直接内化经验,在面对相似任务时不必每次都重读全部历史。

由于全量更新模型代价高昂,Macaron-V1 采用了低秩适配(LoRA)技术:在冻结的基座旁挂载一个参数量极小(不足基座的百分之一)的可训练模块,训练时仅更新该模块。在此架构下,LoRA 的角色发生了改变——从过去被视为省显存、能力打折的廉价妥协,转变为承载“个性”的持久状态,即一个会随交互不断演化的记忆。基座负责提供通用能力,而小模块则承载特定场景下的偏好、技能和工具使用习惯。

在将经验转化为训练信号这一步,团队采用了强化学习:模型执行任务并获取结果,随后根据结果的好坏来调整小模块的参数。这延续了 FireAct 的思路,但将其升级为强化学习,使模型在部署后能持续从自身经验中学习。

Mixture-of-LoRA 架构

Macaron-V1 的架构具体落地为“Mixture-of-LoRA”。在冻结的 GLM-5.2 基座上,团队挂载了四个各 10 亿参数的 LoRA 专家,分别管理不同环节:

  • L0 Chat:负责对话与指令遵循;
  • L1 Agent:负责长程、动态、复杂的智能体任务;
  • L2 Coding:负责代码理解、软件工程与终端使用;
  • L3 UI:负责界面渲染与界面驱动的操作。

这种设计使得新能力能以插件式 LoRA 的形式加入,既不动摇已有知识,又允许不同专家在同一个基座上组合。

在实际测试中,使用 Macaron-V1-Venti 在 Claude Code 环境下执行 3D 世界生成任务,仅凭一句包含 Three.js、程序化生成及复杂逻辑要求的提示词,模型在十余分钟内生成了一个包含巧克力河、摩天轮等元素的完整 3D 网页应用。

算力成本:万亿参数上的强化学习仅需约十分之一算力

LoRA 能否胜任比监督微调更复杂的强化学习训练,此前学界尚无定论。这一科学前提由 Thinking Machines Lab 在 2025 年的研究确立:只要 LoRA 覆盖到包含前馈层和专家层在内的所有层,且不超过其容量,它在监督微调和强化学习上均能追平全参数微调,且强化学习对秩的要求较低。

Mind Lab 在此基础上进行了规模化验证。团队在总参数量约 1.04 万亿、单次激活约 326 亿的稀疏专家模型 Kimi K2 上,端到端跑通了 LoRA 强化学习。结果显示:

  • 其算力开销约为全参数强化学习的 十分之一
  • 训练曲线平稳上升,未出现灾难性发散。

团队还发现,即使将可训练模块压至极低的秩,配合专门的初始化方法也能实现稳定训练。此外,相关训练框架的补丁已并入几个主流开源训练项目的上游,配套基础设施也以 verl-mint 的名字开源,提供了外部可核对的工程证据。

群体智能:一个基座长出协作的模块化网络

极低的更新成本打开了另一种可能性:同一个基座上可以挂载多个小模块,让它们分别学习不同内容并通过协作提升整体能力。

Mind Lab 进行了一组对照实验来验证这一规律。他们从同一个约 300 亿参数的开源模型(Qwen3-30B)出发,仅修改数据顺序和训练细节,训练出接近两百个小模块,并在数学基准 AIME24 上进行多数投票测试。结果显示:

  • 单个模块准确率为 36.4%;
  • 198 个模块共同投票后准确率升至 48.7%
  • 该结果明显高于对同一模块反复采样的上限(约 43.3%),也高于基线的 37.3%。

这组受控实验数据验证了“多个模块协作确实能更强”的规律。

支撑这种大规模模块化体系的是 MinT 基础设施。MinT 将海量小模块的训练、评估、部署和回滚统一管理,设计目标是可以管理百万量级的模块目录。有了这套工程底座,模块规模的扩大才得以有序进行。

结语:持续学习是下一代模型的关键

对于从业者而言,Macaron-V1 的路线提供了几点值得借鉴的经验:

  1. 将适配模块视为可训练的持久状态,而不仅仅是节省显存的技巧;
  2. 与其无限扩大单一模型,不如让多个专门的小模块分工协作;
  3. 将模块的版本控制、评估和回滚纳入基础设施建设。

近期,DeepSeek 创始人梁文锋指出,当前 AI 不缺品味和直觉,缺的是持续学习的能力,只有能让模型持续学习才算得上下一代模型。这与 Mind Lab 的判断一致。在他们看来,下一代智能的决定性因素在于两件事:一是通过递归自我改进做后训练,让模型持续从经验中学习;二是多智能体协作,让专业化模型在共享基础设施上组合。

Macaron-V1 正是迈向这一方向的一个里程碑,为“让大模型部署后还能持续学习”提供了一条完整且低成本的实现路径。