NVIDIA NemotronLabs VoiceChat 11B: IA de voz full-duplex aberta com chamada de ferramentas em tempo real
A NVIDIA lançou o NemotronLabs VoiceChat 11B, um modelo de voz para voz em tempo real, ponta a ponta, projetado para conversas naturais full-duplex. Diferente das abordagens de pipeline comuns,

NVIDIA NemotronLabs VoiceChat 11B traz conversa full-duplex e chamada de ferramentas em tempo real para a IA de voz aberta
Introdução
A NVIDIA lançou o NemotronLabs VoiceChat 11B, um modelo de voz para voz em tempo real e de ponta a ponta, projetado para conversas de voz full-duplex naturais.
Ao contrário dos pipelines comuns que encadeiam reconhecimento automático de fala, grandes modelos de linguagem e conversão de texto em fala, o VoiceChat processa compreensão e geração de fala em streaming dentro de uma arquitetura unificada. O objetivo é reduzir as trocas de etapa que normalmente adicionam latência e fazem os assistentes de voz parecerem menos naturais.
O modelo pode ouvir enquanto a conversa prossegue, ceder a palavra quando o usuário interrompe e retomar naturalmente após o usuário terminar. A NVIDIA relata uma latência de troca de turno suave de 448 milissegundos no Full-Duplex-Bench 1.0, e uma latência de interrupção de cerca de 480 milissegundos.
O VoiceChat também introduz um recurso especialmente relevante para agentes de voz em produção: a chamada de ferramentas em tempo real enquanto a conversa por voz permanece ativa. Um canal de saída separado pode emitir instruções de chamada de ferramenta, e mensagens de confirmação predefinidas ajudam o agente a evitar pausas silenciosas desconfortáveis durante solicitações de API externas.
O lançamento é significativo, mas ainda está em estágio inicial. A NVIDIA classifica o modelo como apenas para pesquisa, recomenda que a implantação exija grande quantidade de memória GPU e documenta várias limitações em conversas longas, ambientes ruidosos, raciocínio, uso de múltiplas ferramentas e fala descontrolada.
Arquitetura unificada de voz para voz
Os assistentes de voz em tempo real tradicionais geralmente seguem este formato:
Fala do usuário
↓
ASR (Reconhecimento Automático de Fala)
↓
Texto
↓
LLM (Grande Modelo de Linguagem)
↓
Resposta em texto
↓
TTS (Texto para Fala)
↓
Fala do agente
O VoiceChat integra essas capacidades em um modelo muito mais unificado.
A NVIDIA descreve esse sistema de 11B como uma arquitetura híbrida Mamba/Transformer, composta por:
- Codificador de fala Fast Conformer
- Tronco de modelo de linguagem Nemotron Nano v2 9B
- Decodificador TTS da NVIDIA e codec de áudio
- Canal separado para scripts de chamada de ferramentas
O usuário fornece fala a 16 kHz. As saídas incluem o texto do agente, a fala do agente e a transcrição do usuário, com o áudio do agente gerado a 22,05 kHz.
Full-duplex significa que as conversas podem se sobrepor
Assistentes half-duplex essencialmente tratam a conversa como um rádio comunicador: uma pessoa fala e a outra responde em seguida.
Sistemas full-duplex podem modelar continuamente ambos os lados da conversa. Isso permite tratamento de interrupções, pausas, trocas rápidas e turnos de fala mais naturais.
Os resultados divulgados da Full-Duplex-Bench 1.0 incluem:
| Métrica | Resultado do VoiceChat 11B |
|---|---|
| TOR de troca de turno suave (Ocupação de Turno) | 0,82 |
| Latência de troca de turno suave | 448 ms |
| TOR de interrupção do usuário | 1,0 |
| Latência de interrupção do usuário | 480 ms |
| Pontuação GPT-4o de interrupção do usuário | 4,33 |
O valor de 448 ms mencionado no artigo original vem do benchmark de troca de turno suave. A NVIDIA resume o modelo como proporcionando cerca de 450 ms de latência de resposta.
O VoiceChat é projetado para ceder a palavra quando o usuário interrompe
O tratamento de interrupções é uma das maiores diferenças entre demonstrações de voz e agentes de conversa utilizáveis.
VoiceChat
O modelo foi treinado diretamente para a alternância de turnos em diálogo. Quando o usuário começa a falar no meio da resposta do modelo, o sistema pode interromper seu turno de fala e ouvir.
O documento de limitações conhecidas da NVIDIA também observa que esse comportamento não é perfeito em todos os casos. O modelo ainda pode interromper o usuário em pausas dentro da frase, continuar falando após dever parar, iniciar novos turnos sem nova entrada, entrar em loops ou lidar incorretamente com sinais de feedback.
Chamada de ferramentas em tempo real é o recurso de engenharia mais interessante
O VoiceChat 11B é o primeiro modelo full-duplex de código aberto da NVIDIA com suporte a chamada de ferramentas, projetado para manter interações de voz naturais ao usar ferramentas.
Agentes de voz frequentemente precisam de informações que não estão dentro do modelo. Por exemplo:
Qual é o status atual do meu pedido?
O modelo pode precisar chamar uma API de gerenciamento de pedidos antes de responder.
O VoiceChat suporta mensagens de confirmação para ferramentas. Os desenvolvedores podem definir frases curtas como:
Certo, deixe-me verificar isso para você.
Quando o modelo decide chamar uma ferramenta, o sistema pode dizer uma dessas frases enquanto processa a solicitação externa.
O fluxo simplificado é o seguinte:
Usuário fala
↓
VoiceChat responde
↓
Modelo determina que precisa de ferramenta
↓
Evento de chamada de ferramenta enviado ao cliente
↓
Cliente executa função externa
↓
Resultado da ferramenta retorna ao VoiceChat
↓
VoiceChat retoma resposta por voz
Limitações importantes da chamada de ferramentas
A NVIDIA recomenda no máximo cerca de cinco ferramentas por sessão, pois o desempenho pode cair com mais ferramentas disponíveis.
O modelo atualmente não consegue chamar várias ferramentas simultaneamente de forma confiável.
Outras limitações incluem erros de seleção de ferramentas, pulo de chamadas de ferramenta, parâmetros inventados, erro ao narrar resultados de ferramentas e uso de conhecimento interno quando deveria usar uma ferramenta.
Um detalhe particularmente importante: embora o VoiceChat suporte interrupções do usuário em conversas normais, atualmente o usuário não pode interromper o agente durante a execução de uma ferramenta.
Resultados de benchmark de chamada de ferramentas
Os resultados reportados no AU Harness:
| Categoria de chamada de ferramenta | Pontuação |
|---|---|
| Simples | 58,5% |
| Múltiplas | 62,5% |
| Paralelas | 42,5% |
| Paralelas múltiplas | 27,5% |
| Irrelevância | 89,6% |
| Média | 56,1% |
No Full-Duplex-Bench v3, a NVIDIA reporta:
| Métrica | Pontuação |
|---|---|
| Seleção de ferramenta | 82,5% |
| Precisão de parâmetros | 44,2% |
| Pass@1 | 33% |
Esses números indicam que a chamada de ferramentas em produção ainda deve ser protegida por lógica de aplicação e validação de parâmetros.
O VoiceChat fica entre os melhores modelos full-duplex de código aberto
A NVIDIA afirma que o VoiceChat ficou em segundo lugar entre os modelos full-duplex de código aberto no VoiceBench e no Full-Duplex-Bench 1.0.
O modelo foi otimizado para o equilíbrio entre inteligência geral e conversa natural em tempo real. A NVIDIA alerta explicitamente que, em tarefas de conhecimento, seguimento de instruções, segurança e raciocínio, o desempenho pode ser inferior ao do modelo de linguagem subjacente Nemotron Nano v2.
O modelo foi treinado com cerca de 550 mil horas de áudio
A ficha do modelo da NVIDIA lista cerca de 550 mil horas de dados de treinamento em áudio.
Os dados mistos
incluem fala real e sintética, além de dados de texto para os componentes do modelo de linguagem. Fontes nomeadas incluem Fisher, LibriVox, LibriTTS, HiFi-TTS, VCTK, PromptTTS, UltraChat, dados de fala internos da NVIDIA, fala sintética, dados de chamada de funções Nemotron e dados de treinamento PersonaPlex.
O VoiceChat usa uma voz fixa
O checkpoint atual do VoiceChat não suporta clonagem de voz.
O repositório da NVIDIA indica que o checkpoint publicado usa uma voz fixa. O foco do lançamento é mais específico: comportamento de conversa full-duplex de baixa latência e interação de voz com reconhecimento de ferramentas.
Requisitos de hardware são bastante altos
Os pré-requisitos atuais de implantação em tempo real da NVIDIA exigem explicitamente:
GPU NVIDIA com pelo menos 80 GB de memória
As GPUs suportadas documentadas para o contêiner incluem NVIDIA A100, H100, RTX 6000 Pro e B200. A ficha mais ampla do modelo também lista compatibilidade com H200 e B100.
Para o contêiner otimizado em tempo real, a NVIDIA atualmente exige x86_64, Linux, Docker, NVIDIA Container Toolkit e drivers NVIDIA compatíveis.
O guia de solução de problemas indica que o modelo em si usa cerca de 66 GB de memória GPU.
Ainda não há APIs de inferência maduras
Até 11 de agosto, a página do modelo no Hugging Face não listava provedores de inferência ativos para este checkpoint.
Em vez disso, a NVIDIA oferece dois caminhos principais:
- Inferência offline, a partir do checkpoint do Hugging Face
- Transmissão interativa, por meio de contêineres NVIDIA otimizados
O contêiner em tempo real empacota CUDA, Triton, vLLM e a pilha completa de inferência do VoiceChat, expondo um serviço WebSocket bidirecional.
Como executar inferência offline
Clone o branch experimental do VoiceChat da NVIDIA:
git clone https://github.com/NVIDIA-NeMo/Speech.git
cd Speech
git switch nemotron-labs-voicechat
export NEMO_DIR="$(pwd)"
Crie o ambiente:
conda create -y -n voicechat python=3.12
conda activate voicechat
pip install torch==2.10.0 torchvision==0.25.0 torchaudio==2.10.0
pip install -e ".[all]"
pip uninstall -y nvidia-resiliency-ext
pip install transformers==4.56.0 tokenizers==0.22.0 lhotse==1.32.2 huggingface-hub==0.34.4 hf-xet==1.1.9 torchcodec==0.10.0 torch_audiomentations jinja2
pip install ninja packaging wheel einops
pip install --no-build-isolation --no-deps causal-conv1d==1.6.2.post1 mamba-ssm==2.3.2.post1
Baixe o checkpoint:
hf download nvidia/NVIDIA-NemotronLabs-VoiceChat-11B --local-dir /caminho/para/checkpoint
Execute o exemplo:
conda activate voicechat
export NEMO_DIR=/caminho/para/Speech
python "$NEMO_DIR/examples/speechlm2/offline_voicechat_infer.py" --checkpoint /caminho/para/checkpoint --wav "$NEMO_DIR/examples/speechlm2/sample_audio/sample_general.wav" --output-dir /caminho/para/saida
A NVIDIA recomenda adicionar silêncio suficiente ao final do áudio de entrada personalizado para que o modelo tenha tempo de responder.
Como implantar o contêiner em tempo real
Baixe o repositório do modelo:
ngc registry model download-version nim/nvidia/nemotron-labs-voicechat:1.0.0
chmod -R 777 nemotron-labs-voicechat_v1.0.0
Inicie o serviço:
docker run -it --rm
--name=nemotron-labs-voicechat --runtime=nvidia --gpus '"device=0"' --shm-size=8GB -e NIM_HTTP_API_PORT=9000 -p 9000:9000 -v $(pwd)/nemotron-labs-voicechat_v1.0.0:/data/models --entrypoint /s2s/run_s2s_server.sh nvcr.io/nim/nvidia/nemotron-labs-voicechat:latest
Verifique o status de prontidão:
curl 'http://localhost:9000/v1/realtime/health'
Em seguida, o servidor expõe um endpoint WebSocket bidirecional no seguinte endereço:
ws://localhost:9000/v1/realtime
Uma definição simples de ferramenta
Um exemplo simplificado de definição de ferramenta:
[
{
"name": "get_weather",
"description": "Obtém o clima atual de uma cidade",
"ack_messages": [
"Certo, deixe-me verificar para você."
],
"parameters": {
"type": "object",
"properties": {
"city": {
"type": "string"
}
},
"required": ["city"]
}
}
]
O campo ack_messages fornece ao sistema conteúdo de resposta natural durante a execução da ferramenta.
Somente para pesquisa; equipes de produção devem ter cautela
A NVIDIA marca explicitamente o VoiceChat 11B como somente para pesquisa.
O modelo foi treinado com uma janela de contexto de áudio de no máximo cerca de dois minutos, portanto, contextos de conversa mais longos podem não ser preservados de forma confiável.
Problemas conhecidos incluem erros de inferência, alucinações, degradação da qualidade de voz após múltiplas rodadas de conversa, repetições, texto ilegível, truncamento de fala, continuação descontrolada, autoconversa, loops de esclarecimento, palavras ausentes na transcrição, troca de idioma não confiável e desempenho ruim em ambientes ruidosos ou com alta reverberação.
Casos de uso potenciais do VoiceChat 11B
Cenários potenciais de pesquisa e prototipagem incluem:
Centrais de atendimento
O agente pode ouvir naturalmente, lidar com interrupções, chamar ferramentas de atendimento ao cliente e usar mensagens de confirmação enquanto aguarda o retorno da API.
Assistentes veiculares
O motorista pode interromper o assistente sem esperar o fim de uma resposta de voz completa. A sensibilidade atual a ruídos de fundo significa que implantações veiculares exigem trabalho adicional de otimização.
Pedidos no varejo e restaurantes
Agentes de voz podem coletar pedidos, responder a correções e acionar sistemas de produtos ou estoque.
Acessibilidade
Alternâncias de conversa mais naturais ajudam em interfaces sem uso das mãos e aplicativos com prioridade de voz, mas implantações de acessibilidade exigem testes cuidadosos com usuários.
Agentes de voz empresariais
Organizações podem experimentar com ferramentas internas e interações de voz auto-hospedadas, mantendo o modelo dentro da própria infraestrutura.
Modelo aberto, mas com duas licenças diferentes
O termo "código aberto" precisa ser entendido com mais precisão.
O código do NeMo Speech usado pelo VoiceChat é licenciado sob Apache License 2.0.
Os materiais do modelo VoiceChat usam a licença OpenMDW 1.1.
Portanto, é mais seguro descrever o VoiceChat 11B como um modelo aberto ou modelo de pesos abertos, em vez de assumir que a licença do modelo é idêntica à do software ao redor, licenciado sob Apache.
Equipes que planejam redistribuição ou uso comercial devem revisar diretamente a licença OpenMDW.
O que os desenvolvedores devem testar antes da produção
Um plano de avaliação útil deve cobrir:
Alternância de conversa e tratamento de interrupções do usuário
Pausas no meio da frase e sinais de retorno
Áudio ruidoso, com eco e com múltiplos falantes
Parâmetros de ferramenta incorretos ou ausentes
Tempo limite de ferramentas e falhas de chamada de API
- Conversas longas
- Fala fora de controle
- Alucinações e problemas de qualidade de raciocínio
- Operações sensíveis exigem aprovação
- Registro em log, limitação de taxa e escalonamento humano
Agentes de voz que podem chamar ferramentas precisam dos mesmos controles de permissão que outros agentes autônomos.
Perguntas Frequentes
O que é o NVIDIA NemotronLabs VoiceChat 11B?
O NemotronLabs VoiceChat 11B é um modelo de voz para voz em tempo real, de ponta a ponta, desenvolvido pela NVIDIA para IA conversacional full-duplex. Ele combina compreensão de fala em streaming, backbone de modelo de linguagem Nemotron, geração de voz e um canal separado de chamada de ferramentas.
Qual é a velocidade do VoiceChat 11B?
A NVIDIA relata uma latência de alternância de fala suave de 448 milissegundos e uma latência de interrupção de aproximadamente 480 milissegundos no Full-Duplex-Bench 1.0.
Os usuários podem interromper o VoiceChat enquanto ele fala?
Sim, a conversa normal suporta interjeições e tratamento de interrupções. No entanto, a NVIDIA afirma que os usuários atualmente não podem interromper o agente durante a execução de ferramentas.
O VoiceChat 11B suporta chamada de funções?
Sim. O modelo pode emitir chamadas de ferramentas por meio de um canal de saída separado, e os desenvolvedores podem definir mensagens de confirmação que são anunciadas durante a execução de ferramentas externas.
Quanta memória GPU o VoiceChat 11B precisa?
O contêiner em tempo real da NVIDIA requer uma GPU com pelo menos 80 GB de memória de vídeo. A documentação de solução de problemas indica que o modelo carregado usa aproximadamente 66 GB.
Existe uma API hospedada para o VoiceChat 11B?
A NVIDIA atualmente oferece inferência offline auto-hospedada e documentação otimizada de contêiner em tempo real. A página do modelo no Hugging Face atualmente não lista provedores de inferência hospedada.
O VoiceChat pode clonar vozes?
Não. O checkpoint publicado usa vozes fixas e não suporta clonagem de voz.
O VoiceChat 11B pode ser usado em produção?
A NVIDIA marca este modelo como apenas para pesquisa. Os desenvolvedores devem avaliar suas limitações em comprimento de contexto, raciocínio, uso de ferramentas, áudio ruidoso, repetição, transcrição e fala fora de controle antes da implantação em produção.
Ferramentas Relacionadas
- NVIDIA NemotronLabs VoiceChat 11B: Ficha oficial do modelo, pesos, benchmarks, arquitetura, licença e instruções de inferência.
- NVIDIA NeMo Speech: Repositório oficial de fala contendo a implementação do VoiceChat e ramificações de implantação.
- Guia de contêiner em tempo real do NVIDIA VoiceChat: Documentação oficial de implantação com Docker, WebSocket e chamada de funções.
- NVIDIA Container Toolkit: Permite que contêineres Docker acessem GPUs NVIDIA.
- vLLM: Motor de inferência listado na ficha do modelo NVIDIA VoiceChat.
- VoiceBench: Benchmark aberto para avaliação de assistentes de voz baseados em LLM.
Links Relacionados
Fonte principal cobrindo data de lançamento, benchmarks, dados de treinamento, arquitetura e status de uso apenas para pesquisa.
- Ramificação GitHub do VoiceChat: Código-fonte oficial, instruções de instalação, requisitos de hardware, limitações e descrição do modelo.
- Pré-requisitos de implantação em tempo real: Requisitos de hardware, Linux, Docker, drivers e container toolkit.
- Guia de implantação em tempo real: Documentação da NVIDIA sobre inicialização do contêiner, health checks, WebSocket, clientes e chamada de ferramentas.
- Licença OpenMDW 1.1: Licença que rege os materiais do modelo VoiceChat.
- Full-Duplex-Bench: Benchmark para avaliar tratamento de pausas, alternância de fala e comportamento de interrupção.
- Full-Duplex-Bench v3: Benchmark focado em interações de fala full-duplex com chamada de ferramentas.
Resumo
O NVIDIA NemotronLabs VoiceChat 11B combina compreensão de fala, modelagem de linguagem, geração de voz, tratamento de interrupções e capacidade de chamada de ferramentas em uma arquitetura full-duplex unificada. A NVIDIA relata uma latência de alternância de fala de apenas 448 milissegundos e posiciona o modelo na liderança dos benchmarks abertos atuais de fala full-duplex.
A característica de engenharia mais notável é a chamada de ferramentas. Um canal de saída separado pode acionar funções externas enquanto mensagens de confirmação evitam silêncio durante chamadas de API.
Esta versão ainda não é um serviço completo pronto para produção. A implantação em tempo real exige pelo menos 80 GB de memória GPU, o checkpoint atual utiliza vozes fixas, inferência hospedada ainda não está amplamente disponível, e a NVIDIA documenta explicitamente limitações significativas em sessões mais longas, raciocínio, áudio ruidoso e execução de ferramentas.
O VoiceChat 11B é mais adequadamente visto como uma plataforma de pesquisa aberta para construir e estudar agentes de voz de baixa latência, e não como uma solução madura para substituir centrais de atendimento ou APIs de voz de consumo em ambientes de produção.