MiniMax H3 开源:33B 多模态视频生成模型来了,但两个关键模块没给
MiniMax 把 H3 开源了。
Hugging Face 上,35,295 次下载,45 个微调版本,65 个 Space。模型本体是开放的,真正想用的那两样东西不在里面。
三件套,给了一件
H3 由三个模块构成:H3-Context-IR(多模态上下文理解与编排)、H3-Base(视频音频生成本体)、H3-Regenerate-2K(768p 超到 2K 的重生成)。
开源的只有 H3-Base。
H3-Context-IR 是一个多阶段工作流的预处理系统,负责解析文本、图像、音频、参考视频之间的关系,生成模型能直接消费的 Context Intermediate Representation。官方文档写得很直白:"H3-Context-IR 对最终输出质量至关重要,我们强烈建议将其纳入你的生成流程。"但没开源,给了 API。
H3-Regenerate-2K 用的是 in-context 重生成思路——把 768p 结果连同原始上下文一起喂回模型重新生成 2K,而不是用传统超分模块。"这种方式能最大程度复用 H3 Base 的生成能力",但同样没开源,也给了 API。
本地跑 H3-Base 只能出 768p、24 FPS、4-15 秒的视频,带 32kHz 立体声。要 2K,要完整的多模态参考理解,得走官方 API。
模型本身:务实的组合
H3-Base 是一个 33B 参数 dense single-stream Transformer,BF16 精度,需要 4 张 GPU 才能正常跑(SGLang 部署示例用的是 --num-gpus 4 --ulysses-degree 4)。
架构上是几个现成组件拼起来的:
- 文本编码器直接用 Qwen3-VL-32B 的完整预训练权重,取第 50 层的 hidden states
- 视觉 VAE(H3-VisualVAE)是自研的,空间压缩 16×、时间压缩 4×、24 latent channels,解码端加了一个 ViT-based decoder 降本提效
- 音频 VAE(H3-AudioVAE)也是自研,32kHz 压到 40Hz 的 latent tokens,左右声道独立处理再合并输出立体声
注意力机制支持 MM-RoPE(三维多模态旋转位置编码),稀疏注意力训练已经做完了,但稀疏推理的实现在未来版本才发布,首发只有 full attention。
模型分两个 checkpoint:FL2VA(首尾帧模式,支持 0/1/2 张输入图)和 Ref2VA(多模态参考模式,最多 9 张图、3 个视频 clip、3 个音频 clip,混合输入不超过 12 个文件)。
部署现实
官方推荐了四个推理框架:SGLang、vLLM、diffusers、ComfyUI。每个都有对应文档和示例。
ComfyUI 用户可以直接下载模板,SGLang 和 vLLM 用户按仓库里的部署脚本跑就行。diffusers 用户更简单,ModularPipeline.from_pretrained("MiniMaxAI/MiniMax-H3") 就能自动拉取所需组件。
模型仓库同时提供原始 checkpoint 和 diffusers 格式,按需下载,不需要整个拉下来。用 hf download 可以只拉需要的部分。
768p 的三个复现用例(T2VA、FL2VA、Ref2VA)都附了完整脚本和参考输出视频,可以直接对照。
许可和边界
H3 用的是 MiniMax H3 Community License。美国、欧盟、英国、韩国用户需要单独提交申请表。其他地区的开发者直接在 Hugging Face 下载即可。
API 方面,全球节点是 platform.minimax.io,国内是 platform.minimaxi.com。Context-IR 和 Regenerate-2K 的 API 端点文档也都在上面,支持通过 API 走完整 2K 流程。
开源的底座,完整的产品
开源一个 33B 的多模态视频生成模型,本身是有分量的动作。但开源的是底座,不是完整产品。
Context-IR 决定了模型能理解多复杂的多模态输入,Regenerate-2K 决定了输出能达到什么分辨率。这两个模块没开放,意味着本地部署的 H3 是一个能力受限但可自由修改的版本。能做微调、能改架构、能接自己的上下文处理系统,但要做到和官方 API 同等的效果,还是得走那两条 API。
开发者能拿到 33B 多模态 Transformer 的完整权重,能看到他们怎么用 Qwen3-VL、怎么设计视觉和音频 VAE、怎么处理多模态 token 的 packing 和位置编码。这些对研究多模态生成的人来说是有价值的参考。
本地跑一套对标不了 Hailuo 上直接生成的 2K 视频。那个体验需要官方那两件套的配合。