NVIDIA NemotronLabs VoiceChat 11B: IA de voz full-duplex abierta con invocación de herramientas en tiempo real

NVIDIA ha lanzado NemotronLabs VoiceChat 11B, un modelo de voz a voz en tiempo real de extremo a extremo, diseñado para conversaciones de voz full-duplex naturales. A diferencia de los métodos de pipeline comunes,

发布于 2026年8月11日generalGEO 评分: 016 次阅读
NVIDIA NemotronLabs VoiceChat 11B: IA de voz full-duplex abierta con invocación de herramientas en tiempo real

NVIDIA NemotronLabs VoiceChat 11B aporta voz dúplex completa y llamadas a herramientas en tiempo real a la IA de voz abierta

Introducción

NVIDIA ha lanzado NemotronLabs VoiceChat 11B, un modelo de voz a voz en tiempo real de extremo a extremo, diseñado para conversaciones de voz naturales en dúplex completo.

A diferencia de los flujos comunes que encadenan reconocimiento automático del habla, modelos de lenguaje grandes y conversión de texto a voz, VoiceChat procesa la comprensión y generación de voz dentro de una arquitectura unificada. Su objetivo es reducir los traspasos que suelen aumentar la latencia y hacer que los asistentes de voz se sientan menos naturales.

El modelo puede escuchar mientras la conversación continúa, ceder el turno cuando el usuario interrumpe y retomar con naturalidad cuando el usuario termina de hablar. NVIDIA reporta una latencia de turnos fluidos de 448 milisegundos en Full-Duplex-Bench 1.0 y una latencia de interrupción de aproximadamente 480 milisegundos.

VoiceChat también incorpora una función especialmente relevante para agentes de voz de nivel de producción: la llamada a herramientas en tiempo real mientras la conversación de voz sigue activa. Un canal de salida separado puede emitir instrucciones de llamada a herramientas, y mensajes de confirmación predefinidos ayudan al agente a evitar silencios incómodos durante solicitudes externas a APIs.

Este lanzamiento es significativo, pero aún se encuentra en una etapa temprana. NVIDIA etiqueta el modelo como de uso exclusivo para investigación, recomienda que su despliegue requiere mucha memoria de GPU y documenta varias limitaciones en diálogos largos, entornos ruidosos, razonamiento, uso de múltiples herramientas y habla descontrolada.

Arquitectura unificada de voz a voz

Los asistentes de voz en tiempo real tradicionales suelen verse así:

Voz del usuario
   ↓
ASR (Reconocimiento automático del habla)
   ↓
Texto
   ↓
LLM (Modelo de lenguaje grande)
   ↓
Respuesta de texto
   ↓
TTS (Conversión de texto a voz)
   ↓
Voz del agente

VoiceChat integra estas capacidades en un modelo mucho más estrechamente integrado.

NVIDIA describe este sistema de 11B como una arquitectura híbrida Mamba/Transformer compuesta por:

  • Codificador de voz Fast Conformer
  • Columna vertebral de modelo de lenguaje Nemotron Nano v2 de 9B
  • Decodificador TTS y códec de audio de NVIDIA
  • Canal separado para scripts de llamada a herramientas

El usuario proporciona voz a 16 kHz. Las salidas incluyen el texto del agente, la voz del agente y la transcripción del usuario, mientras que el audio del agente se genera a 22.05 kHz.

El dúplex completo implica que las conversaciones pueden superponerse

Los asistentes en semidúplex manejan la conversación básicamente como un walkie-talkie: una parte termina y luego la otra responde.

Los sistemas en dúplex completo pueden modelar continuamente a ambas partes de la conversación. Esto permite el manejo de interrupciones, pausas, intercambios y turnos de habla más naturales.

Los resultados publicados por NVIDIA de Full-Duplex-Bench 1.0 incluyen:

Métrica Resultado VoiceChat 11B
Turnos fluidos TOR (Tasa de ocupación del turno) 0.82
Latencia de turnos fluidos 448 ms
Interrupción de usuario TOR 1.0
Latencia de interrupción de usuario 480 ms
Puntuación GPT-4o de interrupción de usuario 4.33

El dato de 448 milisegundos mencionado en el artículo original proviene de la evaluación de turnos fluidos. NVIDIA resume que el modelo ofrece una latencia de respuesta de aproximadamente 450 ms.

VoiceChat está diseñado para ceder el turno cuando el usuario interrumpe

El manejo de interrupciones es una de las mayores diferencias entre una demostración de voz y un agente conversacional utilizable.

VoiceChat se entrenó directamente para el intercambio conversacional de turnos. Cuando el usuario comienza a hablar a mitad de la respuesta del modelo, el sistema puede detener su turno de voz y escuchar.

La documentación de limitaciones conocidas de NVIDIA también señala que este comportamiento no es perfecto en todos los casos. El modelo aún puede interrumpir al usuario en las pausas de sus frases, seguir hablando después de que debería detenerse, iniciar nuevos turnos sin entrada nueva, caer en bucles o manejar incorrectamente las señales de retroalimentación.

La llamada a herramientas en tiempo real es la característica de ingeniería más interesante

VoiceChat 11B es el primer modelo de dúplex completo de código abierto de NVIDIA compatible con llamadas a herramientas, y su diseño busca mantener una interacción de voz natural mientras se utilizan herramientas.

Los agentes de voz a menudo necesitan información que no está dentro del modelo. Por ejemplo:

¿Cuál es el estado actual de mi pedido?

El modelo puede necesitar llamar primero a una API de gestión de pedidos antes de poder responder.

VoiceChat admite mensajes de confirmación para herramientas. Los desarrolladores pueden definir frases cortas como:

Claro, déjame verificar eso por ti.

Cuando el modelo decide llamar a una herramienta, el sistema puede pronunciar una de esas frases mientras procesa la solicitud externa.

El flujo simplificado se ve así:

El usuario habla
   ↓
VoiceChat responde
   ↓
El modelo determina que necesita una herramienta
   ↓
El evento de llamada a herramienta se envía al cliente
   ↓
El cliente ejecuta la función externa
   ↓
El resultado de la herramienta regresa a VoiceChat
   ↓
VoiceChat retoma la respuesta por voz

Limitaciones importantes de las llamadas a herramientas

NVIDIA recomienda un máximo de aproximadamente cinco herramientas por sesión, ya que con más herramientas disponibles el rendimiento puede degradarse.

Actualmente, el modelo tampoco puede llamar de manera fiable a múltiples herramientas al mismo tiempo.

Otras limitaciones incluyen errores de selección de herramientas, omisión de llamadas, parámetros inventados, errores al dictar los resultados de las herramientas y el uso de conocimiento interno cuando debería usarse una herramienta.

Un detalle especialmente importante: aunque VoiceChat admite la interrupción por parte del usuario en conversaciones normales, actualmente el usuario no puede interrumpir al agente durante la ejecución de una herramienta.

Resultados de las evaluaciones de llamadas a herramientas

Los resultados reportados con el harness AU son:

Categoría de llamada a herramienta Puntuación
Simple 58.5%
Múltiple 62.5%
Paralela 42.5%
Paralela múltiple 27.5%
Irrelevancia 89.6%
Promedio 56.1%

En Full-Duplex-Bench v3, NVIDIA reporta:

Métrica Puntuación
Selección de herramienta 82.5%
Precisión de parámetros 44.2%
Pass@1 33%

Estas cifras indican que las llamadas a herramientas en entornos de producción aún deben protegerse con lógica de aplicación y validación de parámetros.

VoiceChat se posiciona alto entre los modelos de dúplex completo de código abierto

NVIDIA reporta que VoiceChat ocupa el segundo lugar entre los modelos de dúplex completo de código abierto tanto en VoiceBench como en Full-Duplex-Bench 1.0.

El modelo está optimizado para el equilibrio entre inteligencia general y conversación natural en tiempo real. NVIDIA advierte explícitamente que su rendimiento en conocimiento, seguimiento de instrucciones, seguridad y tareas de razonamiento puede ser inferior al del modelo de lenguaje subyacente Nemotron Nano v2.

El modelo se entrenó con alrededor de 550.000 horas de audio

La ficha técnica del modelo de NVIDIA enumera aproximadamente 550.000 horas de datos de audio de entrenamiento.

Estos datos mixtos

incluyen voz real y sintética, así como datos de texto para los componentes del modelo de lenguaje. Las fuentes de datos mencionadas incluyen Fisher, LibriVox, LibriTTS, HiFi-TTS, VCTK, PromptTTS, UltraChat, datos de voz internos de NVIDIA, voz sintética, datos de llamadas a funciones de Nemotron y datos de entrenamiento de PersonaPlex.

VoiceChat usa una voz fija

Los puntos de control actuales de VoiceChat no admiten clonación de voz.

Las notas del repositorio de NVIDIA indican que el punto de control publicado utiliza una voz fija. El propósito de este lanzamiento es más enfocado: interacción de voz de baja latencia, comportamiento de dúplex completo y llamadas a herramientas.

Los requisitos de hardware son bastante elevados

Los requisitos previos actuales de despliegue en tiempo real de NVIDIA especifican claramente:

GPU NVIDIA con al menos 80 GB de memoria de video

Las GPU compatibles documentadas para el contenedor incluyen NVIDIA A100, H100, RTX 6000 Pro y B200. La ficha técnica más amplia también lista compatibilidad con H200 y B100.

Para el contenedor optimizado en tiempo real, NVIDIA actualmente requiere x86_64, Linux, Docker, NVIDIA Container Toolkit y controladores NVIDIA compatibles.

La guía de solución de problemas señala que el modelo en sí utiliza aproximadamente 66 GB de memoria de GPU.

Aún no hay una API de inferencia gestionada madura

Hasta el 11 de agosto, la página del modelo en Hugging Face no lista proveedores de inferencia activos para este checkpoint.

En su lugar, NVIDIA ofrece dos vías principales:

  1. Inferencia offline, a partir del checkpoint de Hugging Face
  2. Transmisión interactiva, mediante contenedores NVIDIA optimizados

El contenedor en tiempo real incluye CUDA, Triton, vLLM y la pila completa de inferencia de VoiceChat, y expone un servicio WebSocket bidireccional.

Cómo ejecutar la inferencia offline

Clona la rama experimental VoiceChat de NVIDIA:

git clone https://github.com/NVIDIA-NeMo/Speech.git
cd Speech
git switch nemotron-labs-voicechat
export NEMO_DIR="$(pwd)"

Crea el entorno:

conda create -y -n voicechat python=3.12
conda activate voicechat
pip install torch==2.10.0 torchvision==0.25.0 torchaudio==2.10.0
pip install -e ".[all]"
pip uninstall -y nvidia-resiliency-ext
pip install transformers==4.56.0 tokenizers==0.22.0 lhotse==1.32.2             huggingface-hub==0.34.4 hf-xet==1.1.9 torchcodec==0.10.0             torch_audiomentations jinja2
pip install ninja packaging wheel einops
pip install --no-build-isolation --no-deps             causal-conv1d==1.6.2.post1 mamba-ssm==2.3.2.post1

Descarga el checkpoint:

hf download nvidia/NVIDIA-NemotronLabs-VoiceChat-11B   --local-dir /ruta/al/checkpoint

Ejecuta el ejemplo:

conda activate voicechat
export NEMO_DIR=/ruta/al/Speech
python "$NEMO_DIR/examples/speechlm2/offline_voicechat_infer.py"   --checkpoint /ruta/al/checkpoint   --wav "$NEMO_DIR/examples/speechlm2/sample_audio/sample_general.wav"   --output-dir /ruta/a/salida

NVIDIA recomienda añadir suficiente silencio al final del audio de entrada personalizado para que el modelo tenga tiempo de responder.

Cómo implementar el contenedor en tiempo real

Descarga el repositorio del modelo:

ngc registry model download-version nim/nvidia/nemotron-labs-voicechat:1.0.0
chmod -R 777 nemotron-labs-voicechat_v1.0.0

Inicia el servicio:

docker run -it --rm
--name=nemotron-labs-voicechat   --runtime=nvidia   --gpus '"device=0"'   --shm-size=8GB   -e NIM_HTTP_API_PORT=9000   -p 9000:9000   -v $(pwd)/nemotron-labs-voicechat_v1.0.0:/data/models   --entrypoint /s2s/run_s2s_server.sh   nvcr.io/nim/nvidia/nemotron-labs-voicechat:latest

Comprueba el estado de preparación:

curl 'http://localhost:9000/v1/realtime/health'

A continuación, el servidor expone un endpoint WebSocket bidireccional en la siguiente dirección:

ws://localhost:9000/v1/realtime

Una definición de herramienta sencilla

Un ejemplo simplificado de definición de herramienta es el siguiente:

[
  {
    "name": "get_weather",
    "description": "Obtiene el clima actual de una ciudad",
    "ack_messages": [
      "De acuerdo, déjeme consultarlo."
    ],
    "parameters": {
      "type": "object",
      "properties": {
        "city": {
          "type": "string"
        }
      },
      "required": ["city"]
    }
  }
]

El campo ack_messages proporciona al sistema respuestas naturales durante la ejecución de la herramienta.

Solo para investigación; los equipos de producción deben actuar con cautela

NVIDIA marca explícitamente VoiceChat 11B como solo para investigación.

La ventana de contexto de audio utilizada durante el entrenamiento del modelo no supera los dos minutos aproximadamente, por lo que los contextos de conversación más largos podrían no conservarse de forma fiable.

Los problemas conocidos incluyen errores de inferencia, alucinaciones, degradación de la calidad de voz tras múltiples turnos de conversación, repeticiones, texto ilegible, truncamiento de voz, continuaciones descontroladas, autodiálogos, bucles de aclaración, palabras faltantes en las transcripciones, cambio de idioma poco fiable y un rendimiento deficiente en entornos ruidosos o con mucha reverberación.

Casos de uso potenciales de VoiceChat 11B

Los escenarios potenciales de investigación y creación de prototipos incluyen:

Centros de contacto

Los agentes pueden escuchar de forma natural, gestionar interrupciones, invocar herramientas de atención al cliente y utilizar mensajes de confirmación mientras esperan la respuesta de la API.

Asistentes en el vehículo

Los conductores pueden interrumpir al asistente sin esperar a que termine una respuesta de voz completa. La sensibilidad actual al ruido de fondo implica que su implementación en vehículos requiere un trabajo de optimización adicional.

Pedidos en comercios y restaurantes

El agente de voz puede recopilar pedidos, responder a correcciones e invocar sistemas de productos o inventario.

Accesibilidad

Una rotación de turnos más natural favorece las interfaces sin manos y las aplicaciones con prioridad de voz, pero su implementación en el ámbito de la accesibilidad requiere pruebas cuidadosas con usuarios.

Agentes de voz empresariales

Las organizaciones pueden experimentar con herramientas internas e interacciones de voz autoalojadas, manteniendo el modelo dentro de su propia infraestructura.

Modelo abierto, pero con dos licencias diferentes

La afirmación de que es "código abierto" debe entenderse con mayor precisión.

El código de NeMo Speech utilizado por VoiceChat tiene la licencia Apache License 2.0.

Los materiales del modelo VoiceChat utilizan la licencia OpenMDW 1.1.

Por lo tanto, es más seguro describir VoiceChat 11B como un modelo abierto o un modelo de pesos abiertos, en lugar de asumir que la licencia del modelo es idéntica a la del software circundante con licencia Apache.

Los equipos que planeen redistribuirlo o utilizarlo comercialmente deben revisar directamente la licencia OpenMDW.

Qué deberían probar los desarrolladores antes de producción

Un plan de evaluación útil debería cubrir:

  • Rotación de turnos y manejo de interrupciones del usuario

  • Pausas en mitad de frase y señales de retroalimentación

  • Audio ruidoso, con eco y de múltiples hablantes

  • Parámetros de herramienta erróneos o faltantes

Tiempos de espera de herramientas y fallos de llamadas a API

  • Conversaciones largas
  • Voz descontrolada
  • Alucinaciones y problemas de calidad de razonamiento
  • Operaciones sensibles que requieren aprobación
  • Registro de logs, límites de velocidad y escalamiento humano

Los agentes de voz con capacidad de llamar a herramientas necesitan los mismos controles de permisos que otros agentes autónomos.

Preguntas frecuentes

¿Qué es NVIDIA NemotronLabs VoiceChat 11B?

NemotronLabs VoiceChat 11B es un modelo de voz a voz en tiempo real de extremo a extremo desarrollado por NVIDIA para IA conversacional full-duplex. Combina comprensión de voz en streaming, el backbone del modelo de lenguaje Nemotron, generación de voz y un canal independiente para llamadas a herramientas.

¿Qué tan rápido es VoiceChat 11B?

NVIDIA reporta una latencia de turnos conversacionales fluidos de 448 milisegundos y una latencia de interrupción de aproximadamente 480 milisegundos en Full-Duplex-Bench 1.0.

¿Puede el usuario interrumpir a VoiceChat mientras habla?

Sí, la conversación normal admite interrupciones y superposiciones. Sin embargo, NVIDIA indica que durante la ejecución de herramientas el usuario actualmente no puede interrumpir al agente.

¿VoiceChat 11B admite llamadas a funciones?

Sí. El modelo puede emitir llamadas a herramientas a través de un canal de salida independiente, y los desarrolladores pueden definir mensajes de confirmación que se reproducen mientras las herramientas externas están en ejecución.

¿Cuánta memoria de GPU requiere VoiceChat 11B?

El contenedor en tiempo real de NVIDIA requiere una GPU con al menos 80 GB de memoria. La documentación de resolución de problemas indica que el modelo cargado utiliza aproximadamente 66 GB.

¿Existe una API alojada para VoiceChat 11B?

NVIDIA actualmente ofrece inferencia offline autoalojada y documentación optimizada para contenedores en tiempo real. La página del modelo en Hugging Face no lista actualmente proveedores de inferencia alojada.

¿VoiceChat puede clonar voces?

No. El checkpoint publicado utiliza una voz fija y no admite clonación de voz.

¿Se puede usar VoiceChat 11B en entornos de producción?

NVIDIA marca el modelo como de uso exclusivo para investigación. Los desarrolladores deben evaluar sus limitaciones en cuanto a longitud de contexto, razonamiento, uso de herramientas, audio ruidoso, repeticiones, transcripción y voz descontrolada antes de un despliegue en producción.

Herramientas relacionadas

Enlaces relacionados

Resumen

NVIDIA NemotronLabs VoiceChat 11B integra comprensión de voz, modelado de lenguaje, generación de voz, manejo de interrupciones y llamadas a herramientas en una arquitectura full-duplex unificada. NVIDIA reporta una latencia de turnos de habla de solo 448 milisegundos y posiciona al modelo en la vanguardia de los benchmarks actuales de voz full-duplex abiertos.

La característica de ingeniería más destacable es la llamada a herramientas. Un canal de salida independiente puede activar funciones externas mientras que los mensajes de confirmación evitan que la conversación caiga en silencio durante las llamadas a API.

Esta versión aún no es un servicio completamente listo para producción. El despliegue en tiempo real requiere al menos 80 GB de memoria de GPU, el checkpoint actual utiliza una voz fija, la inferencia alojada no está ampliamente disponible, y NVIDIA documenta explícitamente limitaciones significativas en sesiones largas, razonamiento, audio ruidoso y ejecución de herramientas.

VoiceChat 11B debe considerarse más como una plataforma de investigación abierta para construir y estudiar agentes de voz de baja latencia, que como una solución madura para reemplazar centros de atención al cliente o APIs de voz para consumidores en entornos de producción.