NVIDIA NemotronLabs VoiceChat 11B:具备实时工具调用的开放全双工语音AI
NVIDIA发布了NemotronLabs VoiceChat 11B,这是一款端到端的实时语音到语音模型,专为自然全双工语音对话而设计。与常见的流水线方法不同,

NVIDIA NemotronLabs VoiceChat 11B 为开放语音 AI 带来全双工语音和实时工具调用
简介
NVIDIA 发布了 NemotronLabs VoiceChat 11B,一款端到端实时语音到语音模型,专为自然的全双工语音对话而设计。
与将自动语音识别、大语言模型和文本转语音串联起来的常见流水线不同,VoiceChat 在统一的架构内处理流式语音理解和语音生成。其目标是减少通常会增加延迟、使语音助手感觉不够自然的交接环节。
该模型可以在对话进行时聆听,在用户打断时让出话语权,并在用户说完后自然恢复。NVIDIA 报告在 Full-Duplex-Bench 1.0 上的平滑轮流说话延迟为 448 毫秒,打断延迟约为 480 毫秒。
VoiceChat 还引入了对生产级语音代理尤为相关的功能:在语音对话保持活跃的同时进行实时工具调用。一个单独的输出通道可以发出工具调用指令,而预定义的确认消息帮助代理在外部 API 请求期间避免尴尬的静默停顿。
此次发布意义重大,但仍处于早期阶段。NVIDIA 将该模型标注为仅限研究用途,建议部署时需要大量 GPU 内存,并记录了在长对话、嘈杂环境、推理、多工具使用和失控语音方面的若干限制。
统一的语音到语音架构
传统的实时语音助手通常如下所示:
用户语音
↓
ASR(自动语音识别)
↓
文本
↓
LLM(大语言模型)
↓
文本回复
↓
TTS(文本转语音)
↓
代理语音
VoiceChat 将这些能力整合到一个更加紧密集成的模型中。
NVIDIA 将这款 11B 系统描述为混合 Mamba/Transformer 架构,由以下部分组成:
- Fast Conformer 语音编码器
- Nemotron Nano v2 9B 语言模型主干
- NVIDIA TTS 解码器和音频编解码器
- 用于工具调用脚本的独立通道
用户以 16 kHz 提供语音。输出包括代理文本、代理语音和用户转录文本,其中代理音频以 22.05 kHz 生成。
全双工意味着对话可以重叠
半双工助手实际上像对讲机一样处理对话:一方说完,另一方再回应。
全双工系统可以持续建模对话的双方。这使得打断处理、停顿、来回交流以及更自然的轮流说话成为可能。
NVIDIA 发布的 Full-Duplex-Bench 1.0 结果包括:
| 指标 | VoiceChat 11B 结果 |
|---|---|
| 平滑轮流说话 TOR(轮流占用率) | 0.82 |
| 平滑轮流说话延迟 | 448 毫秒 |
| 用户打断 TOR | 1.0 |
| 用户打断延迟 | 480 毫秒 |
| 用户打断 GPT-4o 评分 | 4.33 |
原始新闻文章中提到的 448 毫秒数据来自平滑轮流说话基准测试。NVIDIA 将模型概括为提供约 450 毫秒的响应延迟。
VoiceChat 设计为在用户打断时让出话语权
打断处理是语音演示与可用对话代理之间最大的区别之一。
VoiceChat
该模型直接针对对话式轮流发言进行了训练。当用户在模型回复中途开始说话时,系统可以停止其语音轮次并倾听。
NVIDIA 的已知限制文档也指出,该行为并非在所有情况下都完美。模型仍可能在用户句中停顿处打断用户、在应停止后继续说话、在没有新输入的情况下发起新轮次、陷入循环,或错误处理反馈信号。
实时工具调用是最有趣的工程特性
VoiceChat 11B 是 NVIDIA 首款支持工具调用的开源全双工模型,其设计旨在使用工具时保持自然的语音交互。
语音代理经常需要模型内部不包含的信息。例如:
我订单的当前状态是什么?
模型可能需要先调用订单管理 API,然后才能回答。
VoiceChat 支持工具的确认消息。开发人员可以定义诸如以下的简短短语:
好的,让我为您查一下。
当模型决定调用工具时,系统可以在处理外部请求期间说出其中一条短语。
简化的流程如下所示:
用户说话
↓
VoiceChat 回应
↓
模型确定需要工具
↓
工具调用事件发送至客户端
↓
客户端执行外部功能
↓
工具结果返回给 VoiceChat
↓
VoiceChat 恢复语音回答
重要的工具调用限制
NVIDIA 建议每次会话最多约五个工具,因为可用工具更多时性能可能会下降。
该模型目前还无法可靠地同时调用多个工具。
其他限制包括工具选择错误、跳过工具调用、虚构参数、错误口述工具结果,以及在应使用工具时却依靠内部知识作答。
一个特别重要的细节:尽管 VoiceChat 支持在正常对话中由用户打断,但目前用户无法在工具执行期间打断代理。
工具调用基准测试结果
报告的 AU Harness 结果为:
| 工具调用类别 | 得分 |
|---|---|
| 简单 | 58.5% |
| 多个 | 62.5% |
| 并行 | 42.5% |
| 并行多个 | 27.5% |
| 无关性 | 89.6% |
| 平均 | 56.1% |
在 Full-Duplex-Bench v3 上,NVIDIA 报告:
| 指标 | 得分 |
|---|---|
| 工具选择 | 82.5% |
| 参数准确性 | 44.2% |
| Pass@1 | 33% |
这些数字表明,生产环境中的工具调用仍应由应用程序逻辑和参数验证加以保护。
VoiceChat 在开源全双工模型中排名靠前
NVIDIA 报告称,VoiceChat 在 VoiceBench 和 Full-Duplex-Bench 1.0 上均位列开源全双工模型第二。
该模型针对通用智能与自然实时对话之间的权衡进行了优化。NVIDIA 明确警告,在知识、指令遵循、安全性和推理任务上,其表现可能不如底层的 Nemotron Nano v2 语言模型。
该模型基于约 55 万小时的音频进行训练
NVIDIA 的模型卡列出了约55 万小时的音频训练数据。
该混合数据
包括真实语音和合成语音,以及用于语言模型组件的文本数据。命名的数据源包括Fisher、LibriVox、LibriTTS、HiFi-TTS、VCTK、PromptTTS、UltraChat、NVIDIA内部语音数据、合成语音、Nemotron函数调用数据和PersonaPlex训练数据。
VoiceChat使用固定语音
当前的VoiceChat检查点不支持语音克隆。
NVIDIA的仓库说明发布的检查点使用一个固定语音。此次发布的目的更加聚焦:低延迟、全双工会话行为和工具感知的语音交互。
硬件要求相当高
NVIDIA当前的实时部署前提条件明确要求:
至少80 GB显存的NVIDIA GPU
文档中记录的容器支持的GPU包括NVIDIA A100、H100、RTX 6000 Pro和B200。更广泛的模型卡还列出了H200和B100兼容性。
对于优化的实时容器,NVIDIA目前要求x86_64、Linux、Docker、NVIDIA容器工具包和兼容的NVIDIA驱动程序。
故障排除指南指出,模型本身使用约66 GB的GPU内存。
尚无成熟的托管推理API
截至8月11日,Hugging Face模型页面未列出该检查点的活跃推理提供商。
相反,NVIDIA提供两条主要路径:
- 离线推理,从Hugging Face检查点进行
- 交互式流式传输,通过优化的NVIDIA容器进行
实时容器打包了CUDA、Triton、vLLM和完整的VoiceChat推理栈,并暴露了双向WebSocket服务。
如何运行离线推理
克隆NVIDIA的实验性VoiceChat分支:
git clone https://github.com/NVIDIA-NeMo/Speech.git
cd Speech
git switch nemotron-labs-voicechat
export NEMO_DIR="$(pwd)"
创建环境:
conda create -y -n voicechat python=3.12
conda activate voicechat
pip install torch==2.10.0 torchvision==0.25.0 torchaudio==2.10.0
pip install -e ".[all]"
pip uninstall -y nvidia-resiliency-ext
pip install transformers==4.56.0 tokenizers==0.22.0 lhotse==1.32.2 huggingface-hub==0.34.4 hf-xet==1.1.9 torchcodec==0.10.0 torch_audiomentations jinja2
pip install ninja packaging wheel einops
pip install --no-build-isolation --no-deps causal-conv1d==1.6.2.post1 mamba-ssm==2.3.2.post1
下载检查点:
hf download nvidia/NVIDIA-NemotronLabs-VoiceChat-11B --local-dir /path/to/checkpoint
运行示例:
conda activate voicechat
export NEMO_DIR=/path/to/Speech
python "$NEMO_DIR/examples/speechlm2/offline_voicechat_infer.py" --checkpoint /path/to/checkpoint --wav "$NEMO_DIR/examples/speechlm2/sample_audio/sample_general.wav" --output-dir /path/to/output
NVIDIA建议在自定义输入音频末尾添加足够的静音,以便模型有时间响应。
如何部署实时容器
下载模型仓库:
ngc registry model download-version nim/nvidia/nemotron-labs-voicechat:1.0.0
chmod -R 777 nemotron-labs-voicechat_v1.0.0
启动服务:
docker run -it --rm
--name=nemotron-labs-voicechat --runtime=nvidia --gpus '"device=0"' --shm-size=8GB -e NIM_HTTP_API_PORT=9000 -p 9000:9000 -v $(pwd)/nemotron-labs-voicechat_v1.0.0:/data/models --entrypoint /s2s/run_s2s_server.sh nvcr.io/nim/nvidia/nemotron-labs-voicechat:latest
检查就绪状态:
curl 'http://localhost:9000/v1/realtime/health'
随后服务器会在以下地址暴露一个双向 WebSocket 端点:
ws://localhost:9000/v1/realtime
一个简单的工具定义
简化的工具定义示例如下:
[
{
"name": "get_weather",
"description": "获取某个城市的当前天气",
"ack_messages": [
"好的,让我为您查一下。"
],
"parameters": {
"type": "object",
"properties": {
"city": {
"type": "string"
}
},
"required": ["city"]
}
}
]
ack_messages 字段为系统在工具执行期间提供了自然的回应内容。
仅供研究使用,生产团队需谨慎
NVIDIA 明确将 VoiceChat 11B 标记为仅供研究使用。
该模型训练时的音频上下文窗口不超过约两分钟,因此较长的对话上下文可能无法被可靠保留。
已知问题包括推理错误、幻觉、多轮对话后语音质量下降、重复、乱码文本、语音截断、失控式续说、自我对话、澄清循环、转录中缺失词语、语言切换不可靠,以及在嘈杂或高混响环境中表现不佳。
VoiceChat 11B 的潜在应用场景
潜在的研究和原型场景包括:
联络中心
智能体可以自然地聆听、处理插话、调用客服工具,并在等待 API 返回时使用确认消息。
车载助手
驾驶员无需等待完整的语音回复结束即可打断助手。当前对背景噪音的敏感度意味着车载部署需要额外的优化工作。
零售和餐饮点单
语音智能体可以收集订单、响应更正,并调用商品或库存系统。
无障碍辅助
更自然的对话轮换有助于免提界面和语音优先应用,但无障碍部署需要仔细的用户测试。
企业语音智能体
组织可以在内部工具和自托管语音交互方面进行试验,同时将模型保留在自己基础设施之内。
开放模型,但有两种不同许可证
“开源”这一说法需要更精确地理解。
VoiceChat 使用的 NeMo Speech 代码 采用 Apache License 2.0 许可证。
VoiceChat 模型材料 使用 OpenMDW 1.1 许可证。
因此,将 VoiceChat 11B 描述为开放模型或开放权重模型更为稳妥,而非假设模型许可证与其周围采用 Apache 许可的软件完全相同。
计划进行再分发或商业使用的团队应直接审阅 OpenMDW 许可证。
生产前开发者应测试的内容
一份有用的评估计划应涵盖:
对话轮换和用户插话处理
句中停顿和回馈信号
嘈杂、回声和多说话人音频
错误或缺失的工具参数
工具超时和API调用失败
长对话
失控的语音
幻觉和推理质量问题
敏感操作需审批
日志记录、速率限制和人工升级
能够调用工具的语音代理需要与其他自主代理相同的权限控制。
常见问题
什么是NVIDIA NemotronLabs VoiceChat 11B?
NemotronLabs VoiceChat 11B是NVIDIA推出的端到端实时语音到语音模型,用于全双工对话式AI。它结合了流式语音理解、Nemotron语言模型骨干、语音生成以及独立的工具调用通道。
VoiceChat 11B的速度有多快?
NVIDIA报告其在Full-Duplex-Bench 1.0上实现了448毫秒的平滑轮流对话延迟和约480毫秒的打断延迟。
用户可以在VoiceChat说话时打断它吗?
可以,正常对话支持插入和打断处理。然而,NVIDIA表示在工具执行期间用户目前无法打断代理。
VoiceChat 11B支持函数调用吗?
支持。该模型可以通过独立的输出通道发出工具调用,开发者可以定义在外部工具运行期间播报的确认消息。
VoiceChat 11B需要多少GPU内存?
NVIDIA的实时容器需要至少80 GB显存的GPU。故障排除文档指出加载后的模型大约使用66 GB。
是否有托管的VoiceChat 11B API?
NVIDIA目前提供自托管离线推理和优化的实时容器文档。Hugging Face模型页面目前未列出托管推理提供商。
VoiceChat可以克隆声音吗?
不可以。发布的检查点使用固定声音,不支持声音克隆。
VoiceChat 11B可以用于生产环境吗?
NVIDIA将该模型标记为仅限研究使用。开发者应在生产部署前评估其在上下文长度、推理、工具使用、嘈杂音频、重复、转录和失控语音方面的局限性。
相关工具
- NVIDIA NemotronLabs VoiceChat 11B:官方模型卡片、权重、基准、架构、许可证和推理说明。
- NVIDIA NeMo Speech:包含VoiceChat实现和部署分支的官方语音仓库。
- NVIDIA VoiceChat实时容器指南:官方Docker、WebSocket和函数调用部署说明。
- NVIDIA容器工具包:使Docker容器能够访问NVIDIA GPU。
- vLLM:NVIDIA VoiceChat模型卡片中列出的推理引擎。
- VoiceBench:用于评估基于LLM的语音助手的开放基准。
相关链接
主要来源涵盖发布日期、基准测试、训练数据、架构及仅供研究用途的状态说明。
- VoiceChat GitHub 分支:官方源代码、安装说明、硬件要求、局限性与模型说明。
- 实时部署前置条件:硬件、Linux、Docker、驱动程序及容器工具包要求。
- 实时部署指南:NVIDIA 的容器启动、健康检查、WebSocket、客户端及工具调用文档。
- OpenMDW 1.1 许可证:管辖 VoiceChat 模型材料的许可证。
- Full-Duplex-Bench:用于评估停顿处理、轮流说话及打断行为的基准测试。
- Full-Duplex-Bench v3:专注于带工具调用的全双工口语交互的基准测试。
摘要
NVIDIA NemotronLabs VoiceChat 11B 在统一的全双工架构中融合了语音理解、语言建模、语音生成、打断处理及工具调用能力。NVIDIA 报告其轮换说话延迟仅为 448 毫秒,并将该模型定位在当前开放全双工语音基准测试的领先位置。
最值得关注的工程特性是工具调用。独立的输出通道可触发外部功能,同时确认消息可避免对话在 API 调用期间陷入沉默。
该版本尚非可直接投入生产的完整服务。实时部署至少需要 80 GB 的 GPU 显存,当前检查点使用固定语音,托管推理尚未广泛提供,且 NVIDIA 明确记录了在较长会话、推理、嘈杂音频及工具执行方面的显著局限。
VoiceChat 11B 更适合被视为用于构建和研究低延迟语音智能体的开放研究平台,而非用于替代生产环境中的客服中心或消费级语音 API 的成熟方案。