NVIDIA 开源全双工语音模型:11B 参数,450ms 响应,支持工具调用
NVIDIA 在 Hugging Face 上放了一个新模型——NemotronLabs VoiceChat 11B。这是一个端到端全双工语音模型,参数 11B,8 月 3 日发布,开源许可 OpenMDW License 1.1,也是开源全双工语音模型里第一个支持工具调用的。
目前做语音 Agent 的主流方案还是级联的:ASR 把语音转文字,喂给 LLM,LLM 的输出再交给 TTS 转成语音。这套方案的问题 everybody knows——延迟叠加、交互不自然、用户打断的时候系统反应迟钝。端到端模型试图用单一架构同时完成语音理解和语音生成,把这几段 pipeline 压缩成一个模型,理论上能把延迟压下来。
VoiceChat 11B 走的就是这条路。它用一个 Fast Conformer 编码器处理音频信号,把音频 token 送入 Nemotron Nano V2 9B 的 LLM 主干预测文本 token,再接 TTS decoder 生成语音。工具调用走单独的输出通道,和语音生成并行处理。
在 VoiceBench 的开源全双工模型中它排第 2,在 Full-Duplex-Bench 1.0 中也排第 2。响应延迟约 450ms,用户打断平均延迟 480ms。AU Harness BFCL-v3 平均分 56.1%,Full-Duplex-Bench v3 的 Tool Selection 达到 82.5%。
训练数据规模约 55 万小时音频,混合真实录音和合成语音,包括 LibriVox、LibriTTS、HiFi-TTS 等公开数据集,也有内部数据。
模型基于 vLLM,支持 NVIDIA A100、H100、H200、B100、B200 和 RTX-6000,操作系统为 Linux。代码仓库在 GitHub 的 NVIDIA-NeMo/Speech 项目下,分支名为 nemotron-labs-voicechat。
模型标注「仅供研究用途」,没有明确说可以用于商业产品。系统提示和 API 工具响应必须是纯 ASCII,避免 Unicode 标点符号——这对非英语场景可能需要额外处理。离线推理不支持实时工具调用,交互式调用需要部署 NVIDIA 的推理容器。
开源全双工语音模型的竞争在加速。VoiceChat 11B 把工具调用这个关键能力拉进了开源阵营,下一步看社区能不能基于它跑出真正可用的语音 Agent 产品。
相关链接:
- Hugging Face 模型页:https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B
- GitHub 代码仓库:https://github.com/NVIDIA-NeMo/Speech/tree/nemotron-labs-voicechat
- OpenMDW License:https://github.com/OpenMDW/OpenMDW/blob/main/1.1/LICENSE.OpenMDW-1.1