Muse Glimmer-30B:跑在消费级硬件上的30B Agent模型

Meta 在 Hugging Face 上发布了一款名为 Muse Glimmer-30B 的新开源模型。它不是另一个纯对话模型,而是明确冲着本地 Agent 去的——30B 参数,内置感知编码器,能从一张截图、一个图表、一段多轮对话里持续推理,并且在消费级硬件上跑起来。

背景

来自 Meta Superintelligence Lab,从更大的 Muse Spark 蒸馏而来,2026 年 8 月发布,Apache 2.0 协议。可以商用,也可以随便改,但别指望它能跑满 64GB 显存的高端显卡——它的设计目标就是一台 24GB 甚至 32GB 的本地机器。

30B,本地跑,不靠云

Muse Glimmer 的架构是一个 Dense Causal Transformer,52 层,隐藏维度 6656,上下文长度 13 万+。视觉部分是一个大约 1.8B 参数的 ViT-G/14,跟语言模型绑在一起。训练数据来自公开数据、第三方提供的内容,以及 Meta 产品内部的信息,知识截止 2026 年 1 月 4 日。

量化方面给了两个档:K-Quant-Dynamic 是 0.2% 的精度损失,跑在 32GB 显存上;K-Quant-17GB 是 1.0% 的精度损失,能塞进 24GB。测试基准覆盖了 15 个常见 benchmark,整体影响微乎其微。

速度方面,它自带了一个 DFlash drafter 模型做投机解码,一次能预测 16 个 token。在 MacBook M5-Max 上,推理速度从 26.6 tok/s 提升到 50.2 tok/s;RTX 5090 上从 74.9 提升到 233.4。这个速度意味着本地跑 Agent 不再是看 PPT 的速度,而是可以真正用来做实时交互的。

Agent 能力:不只是推理,是闭环

Muse Glimmer 的目标场景很明确:多步推理、可靠工具调用、失败恢复、多模态理解,全部在一个模型里完成。

Benchmarks 上,它在 SWE-Bench Pro 拿到 51.2(同档位最高之一),SWE-Bench Verified 是 76.0,MCP-Atlas 是 75.5,DeepSearch QA 是 74.6。这些数字跟 Gemma4-31B 和 Qwen3.6-27B 相比,整体持平或小幅领先。它的 AIME 2026 得分是 94.7,GAIA2 是 43.3,Charxiv Reasoning 是 78.8。

它支持 OpenClaw、Hermes Agent 等编排模式,也支持 controllable reasoning——系统提示里写 Reasoning strength: <value>,可以选 low、medium、high 或 xhigh。复杂任务建议用 high 或 xhigh。

安全层面,它被定为"中等风险"

Meta 明确说,Muse Glimmer 不属于其 Advanced AI Scaling Framework 里定义的"前沿 AI",因为它的整体能力低于 Muse Spark。但在化学/生物、网络安全、失控风险三个维度,评估结论是"中等或更低风险"。安全方面的训练包括了 SFT 和 RL 两个阶段,针对工具调用边界、提示注入抵抗、权限处理做了专门的数据处理。

需要注意的是,模型本身不建议 18 岁以下使用,部署时建议加 human-in-the-loop 确认 irreversible action。

开源了什么

模型以 Apache 2.0 协议开放,内容包括 BF16 全精度权重、两种 4-bit 量化版本、DFlash drafter 头、以及冻结的 ViT-G/14 感知编码器。目前已经有人在 Hugging Face 上发布了 10 个 finetune 和 36 个量化版本,说明社区已经在行动。

开源地址在这里:https://huggingface.co/meta-models/Muse-Glimmer-30B

方法学报告:https://research.meta.ai/static/muse-glimmer-methodology

几点判断

这个模型最大的看点不是参数规模,而是"30B + 本地 + Agent"这个组合。过去两年开源圈一直在谈"本地能不能跑 Agent",但真正能在 24GB 显存上跑、速度不拉胯、工具调用还算稳的模型,并不多见。Muse Glimmer 至少证明了这条路线是可行的。

它在 Coding Agent 上的表现相对突出,SWE-Bench Pro 51.2 是个有参考价值的数字。如果你手头有需要长期跑的本地代码 Agent 场景,这个模型值得试一试。

量化后的精度损失很小,但边界场景下仍然可能出现异常。Meta 自己的 model card 里也写了"可能输出不准确、有偏见的回答",部署时加一层安全护栏是必要的,不是可选的。

这个模型是蒸馏自更大的 Muse Spark,而 Muse Spark 本身的能力水平我们目前没有公开的详细数据。这意味着 Muse Glimmer 的上限已经被定义了,它不是从零训练的模型,而是"把大模型的 Agent 能力压缩到一个更小、更快的形式"。