一张 RTX 4090、35B 参数,Frontis-MA1 在 MLE-Bench 上超过了 GPT-5.5

一张 RTX 4090,12 GB 显存,12 小时跑完一个任务——这是 Frontis-MA1(35B)在「MLE-Bench Lite」上的运行配置。同一份榜单上,它的 Medal Average 是 71.21%,超过了 GPT-5.5 搭配 Codex 的水平,逼近 2.8T 参数的 Kimi K3 和 GPT-5.6 Sol。一个 35B 的开源模型,在单张消费级显卡上跑出这个成绩。

这篇新挂 arXiv 的论文核心是做递归自我改进(Recursive Self-Improvement,RSI):训练一个 AI 让它自己改进自己做 AI 的能力。这个概念圈里讨论了几年,但大多数时候停留在理论或 toy demo 层面。Frontis-MA1 是少见的、把 RSI 放到工程任务里完整跑了一轮、并且把全部代码和权重都开源了的尝试。

它的核心不只是一个模型,而是一整套叫 OpenMLE 的开源系统,包含三个层面。OpenMLE-Gym 是可验证的任务环境,带执行反馈,能判断模型改的代码到底跑没跑对、效果有没有提升。OpenMLE-RL 是操作学习层,用强化学习训练模型执行具体的编程操作。OpenMLE-Evo 是长 horizon 搜索层,让模型在更长时间尺度上探索更优方案。

Frontis-MA1 本身是在基础模型上 post-train 得到的 35B 模型,专门扮演 ML 工程领域的元进化 agent,被训练去执行四个原子操作:Draft(起草代码)、Improve(改进代码)、Debug(调试)、Crossover(交叉组合)。这四个操作先通过执行反馈驱动的 SFT 和 RL 训练,然后组合成长期搜索——学习和进化被放进同一个循环里。

这个设计的效果是:它不需要人为拆解任务步骤。自己 Draft 一段代码,Run 一下看结果,接着 Improve 或 Debug,再 Run,再进化。

结果在 MLE-Bench Lite 上很直接。基础模型的 Medal Average 是 39.39%,加上 OpenMLE-Evo 之后升到 60.61%,再叠上 OpenMLE-Evo-Max(引入 benchmark 无关的经验先验和异步搜索)就到了 71.21%。超过 GPT-5.5 + Codex,接近 GPT-5.6 Sol 和 2.8T 的 Kimi K3——后面几个都是千亿甚至万亿参数级别的闭源模型。

泛化能力也值得注意。论文放了一个留出测试集叫 NatureBench Lite。框架固定、只把模型换成训练后的版本,Match-SOTA 从 50% 涨到 70%;模型固定、只换成 OpenMLE-Evo 搜索策略,这个指标从 20% 涨到 50%。两个组件各自都有迁移效果,不局限于训练集分布。

边界要说清楚。MLE-Bench 是特定 benchmark,考察的是完成 ML 工程任务的能力,不是通用 coding 或 reasoning。12 小时跑一个任务也不算快,很多场景等不了那么久。OpenMLE-Evo-Max 用了 benchmark-independent 的经验先验,部分提升来自工程积累,不是纯模型涌现。但这些边界恰恰说明这个方向值得跟踪——它不是靠堆参数上来的,而是靠系统设计,把学习、搜索、执行反馈焊成一个闭环。每多跑一轮,模型都能看到自己代码的实际运行结果并据此调整,这种 grounded 反馈比纯文本 next token prediction 要扎实得多。

代码和权重都开源了,项目叫 OpenRSI,在 GitHub 上。24 个作者,来自 FrontisAI。这条线做的是 AI4AI——用 AI 改进 AI 研发流程。以前这种自己写代码、自己跑、自己改、自己迭代的能力更多是 research prototype,离真正接进开发者工作流还有距离。Frontis-MA1 让人看到的是:35B、单张 4090、12 小时,可以在一个标准工程榜单上追平甚至超过 10 倍参数量的闭源模型。

手里有一张 4090 的话,论文和代码都在 arXiv 和 GitHub 上,可以去拉下来跑跑,看看递归自我改进离接入实际工作流还有多远。

相关链接

  • 论文:https://arxiv.org/abs/2607.28568
  • GitHub:https://github.com/FrontisAI/OpenRSI