Macaron-V1 开源:从“规模竞赛”到“经验智能”的架构跃迁

超越规模:Macaron-V1 如何用“经验智能”重新定义 AI 未来

在人工智能的演进史上,模型规模的扩张曾被视为衡量能力最直观的标尺。然而,随着基础底座能力的日益饱和,行业共识正在发生一场深刻的转移。2026 年 6 月,智谱开源了大规模 MoE 模型 GLM-5.2 [1]。这一基座模型的优异表现甚至引发了 Next.js 作者、Vercel 创始人 Guillermo Rauch 的关注 [2]。但在 GLM-5.2 的规划中,训练结束并非终点,攻克记忆、持续学习和自我评判才是下一步的关键 [3]。

就在这一行业背景下,心洲科技(Xinzhou Technology)旗下的前沿实验室 Mind Lab 开源了其最新成果 Macaron-V1 [4]。该模型没有选择重复造轮子,而是站在巨人的肩膀上,将基座升级至 GLM-5.2(另提供基于 Qwen3.6 的小版本),并在此基础上实现了行业前瞻:让模型在部署后具备持续学习能力,并通过多模型协作实现群体智能 [5]。

核心事件:押注“经验智能”与“群体智能”

Macaron-V1 的核心创新在于提出了“经验智能机器”(Experiential Intelligence Machine)的概念。Mind Lab 认为,下一代 AI 的决定性因素不再是单体模型的规模扩大,而是两种相辅相成的能力:通过递归自我改进(RSI)进行后训练,以及多智能体协作 [6]。

这一理念并非空穴来风。Richard Sutton 与 David Silver 在 2025 年的著名博文中已将下一阶段命名为“经验时代” [7]。近期,梁文锋在投资者交流会中也预测,“持续学习之后,可能我们就会来到一个奇点” [8]。与此同时,Thinking Machines Lab 等创业公司也在工程侧验证了使用 LoRA 进行高效后训练的可行性 [9]。Macaron-V1 的意义在于,它在一个千亿参数级的开源模型上,同时跑通了理念与工程两条路径。

技术架构:MoL 让 LoRA 从“替代品”变为“持久状态”

传统大模型面临的一个共同天花板是:参数在训练结束后被冻结,无法吸收部署后涌现的经验(如用户偏好、特定代码库架构等) [10]。虽然提示词工程和 RAG 等技术可以将经验保存在模型之外,但随着经验增加,读取和理解成本会越来越高 [11]。

Macaron-V1 选择了参数空间迭代的路径,并采用了一种名为 Mixture-of-LoRA (MoL) 的创新架构 [12]。其核心逻辑是将技能和思维模式相近的任务归入同一个 LoRA,使其相互强化;而差异大的任务则分到不同 LoRA,互不干扰。

以旗舰版 Venti 为例,其总参数量为 748B,由 744B 的 GLM-5.2 基座和四个 1B 的 LoRA 专家组成:

  • L0 Chat:负责对话与指令遵循的主干;
  • L1 Agent:负责重度工具使用与长程复杂任务;
  • L2 Coding:负责代码理解与终端使用;
  • L3 GenUI:负责生成式 UI 渲染与 UI 驱动操作 [13]。

这种设计让 LoRA 超越了静态补丁的角色,成为可写入并随交互演化的“持久本地状态” [14]。Mind Lab 的研究表明,在万亿参数稀疏 MoE 模型 Kimi K2 上跑通 LoRA 强化学习,算力与通信开销仅为全参数 RL 的约 10% [15]。此外,实验数据显示,在大先验底座上使用小规模 LoRA 更新(如 32B 模型使用 r=8 的 LoRA),其强化学习增益(20.61%)甚至超越了全参数微调在小模型上的表现 [16]。

群体智能:从投票到路由的进化

既然 LoRA 是可插拔且可持续新增的,如何让多个 LoRA 协作?Mind Lab 给出的答案是“群体智能”。

实验证据显示,当从相同的基础模型出发,仅改变数据顺序和 masking 时,不同学习轨迹会导致模型分化。在 AIME24 基准测试中,单个 adapter 的准确率为 36.44%,而将 198 个不同 adapter 进行多数投票,准确率提升至 48.67%,显著高于从同一 adapter 进行重复采样的结果(43.78%) [17]。这证明了多样性是自我迭代的自然结果,也是智能的新来源。

Macaron-V1 进一步实现了从“结果投票”到“技能路由”的跨越。通过动态选择和组合 specialist LoRA,模型可以在处理复杂任务时,根据需求在规划、编程、检索和 UI 生成等不同阶段切换能力 [18]。

基础设施:让强化学习在大规模基座上落地

要在大规模基座上实现上述愿景,必须解决强化学习中“训推不一致”导致的精度漂移问题 [19]。为此,Mind Lab 构建了配套的基础设施:

  1. MinT 平台:作为底层后训练平台,MinT 支持 Actor 与 Learner 之间只传递 Adapter,免去搬运完整模型权重的开销。它支持百万规模的 Adapter 目录托管,并能端到端支持最高万亿参数规模的模型 [20]。
  2. MindForge 框架:面向智能体强化学习的上层框架,引入了 Harness Context Protocol (HCP)。HCP 确保模型在训练 rollout 中看到的信息与生产环境一致,从而形成 RSI 闭环 [21]。
  3. LongStraw 系统:解决了长上下文强化学习的难题。传统 GRPO 后训练通常停留在 256K 以下,而 LongStraw 通过无梯度处理共享提示词并串行重放回复分支,在 32×H20 上实现了 GLM-5.2 在 2,097,152 positions 上的确定性执行与反向传播 [22]。

实测体验与开源价值

Macaron-V1 的能力不仅体现在基准测试上,也获得了实测验证。在 UI4A 基准(考验前端设计能力)上,Macaron-V1 以 87.7 的成绩大幅领先 Claude Opus 4.8 [23]。

在实测中,配置了 Macaron-V1 的 Claude Code 在 22 分钟内生成了一个 67 KB 的 HTML 文件,模拟出具有计算器、照片、天气、浏览器甚至翻译功能的 macOS 界面 [24]。此外,该模型还能生成带有物理学家特征 SVG 头像的聊天群动态截图,展现了其在生成式 UI 方面的潜力 [25]。值得注意的是,这些超越基座的能力仅来自挂载的几个小型 LoRA [26]。

结语

Mind Lab 已将 Macaron-V1-Venti、Macaron-V1-Coding-Venti 以及基于 Qwen 3.6 的 Macaron-V1-Tall 三个变体的开放权重发布在 Hugging Face [27]。官方托管 API 也已同步上线,为开发者提供了快速验证的路径 [28]。

尽管反馈延迟、自我反思归因错误以及学习效率等问题仍是“经验智能机器”面临的长期挑战 [29],但 Macaron-V1 已经证明了:在一个强大的开源基座上,用可插拔的 LoRA 承载持续学习,用协作实现群体智能,是一条可行且具有巨大潜力的技术路线。


参考链接:
* Macaron-V1 模型集合:https://huggingface.co/collections/mindlab-research/macaron-v1
* Macaron Artifacts 插件:https://github.com/MindLab-Research/macaron-artifacts
* 海外 API 地址:https://mint.macaron.im
* 中国大陆 API 地址:https://mintcn.macaron.xin
* 《On the Scaling of PEFT》论文:arXiv:2606.02437
* 《MinT: Managed Infrastructure for Training and Serving Millions of LLMs》论文:arXiv:2605.13779
* 《LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget》论文:arXiv:2607.14952