MiniMax Music 3 发布:开源、长音频、分层架构的音乐生成模型
MiniMax 在 Hugging Face 上线了 Music 3,能生成最长 5 分钟的完整歌曲,而且完全开源。这不是又一个只跑十几秒 sample 的 demo,而是可以直接本地部署、跑完整曲子的方案。
架构:一层管结构,一层管细节
Music 3 的架构把任务拆成了两层。一个 8B 的 Global LLM(基于 Qwen3-8B 初始化)负责长程的音乐结构和语义推进,一个 0.6B 的 Local LLM 负责每帧内的声学细节。两层模型的隐藏状态在合成阶段融合,再经过 Flow Matching(2.4B)和 Flow-VAE Decoder(123M)输出 32 kHz 立体声 WAV。
这种分层设计在音频生成里不算新鲜,但在音乐场景下做得比较完整。Global 层让歌曲的主题、节奏、人声特征在长序列里保持一致;Local 层补全高频细节。输出采样率 32 kHz、16-bit,比很多同级别模型常见的 24 kHz 稍高。
控制方式:歌词加结构化描述
模型接受两个输入:歌词和音乐描述。歌词里可以嵌 section tag,比如 [Verse]、[Chorus]、[Bridge]、[Outro] 等。音乐描述建议用 Structured Caption 的三段式:Global Metadata(风格、BPM、调性、情绪曲线)、Vocal Details(人声性别、音色、表现方式)、Arrangement(乐器编排、段落演变)。
官方还提供了一个 music-caption-rewriter 工具,能把简短的自然语言描述扩展成结构化格式。
部署门槛:8GB 显存能跑
这是 Music 3 比较务实的地方。完整精度需要 24GB+ VRAM,通过自动 CPU offloading 可以降到 22GB,再配合流式加载 LLM 的层级,8GB 显存的卡也能跑,只是速度会慢一些。
支持的推理框架有三个:SGLang-Omni、diffusers 和 ComfyUI。SGLang-Omni 的部署命令比较直接:
sgl-omni serve --model-path MiniMaxAI/MiniMax-Music3 --port 8000
diffusers 的 pipeline 已集成,社区 PR 还在 review 中(huggingface/diffusers#14456),目前需要直接从 PR commit 安装。
限制
模型有不少硬限制,部署前需要心里有数:
- 需要 CUDA,不支持其他加速后端
- 只支持非流式生成,无法边生成边听
- 文本 token 上限 5,000,音频帧上限 9,000(约 5 分钟)
- section tag 和音乐描述是生成性控制,不是符号保证,生成的调性、BPM、配器不一定完全匹配请求
这些限制在长音频生成领域比较常见,但官方明确列出来,比那种「理论上能生成 5 分钟实际经常崩」的产品要诚实。
社区现状
Hugging Face 页面显示下载量 25,不算高。模型发布才不久,而且音乐生成类模型的下载动机和用户群体比较分散——有人下载本地跑,有人直接调 API,有人只是看看架构。
目前社区有 3 个 finetune 版本、4 个量化版本,5 个 Spaces 在用这个模型。生态正在建立中。
结语
MiniMax Music 3 的核心价值是开源、支持长音频、显存适配灵活。对于想在自己机器上跑音乐生成,或者基于开源模型做二次开发的人,这是一个可以直接用的方案。它目前不支持流式输出,文本和音频长度都有硬限制,是否影响你的使用场景需要自己评估。
相关链接
- Hugging Face 模型页
- GitHub 仓库
- Demo 页面
- SGLang-Omni 安装指南
- diffusers 集成文档