NVIDIA NemotronLabs VoiceChat 11B: AI vocale full-duplex aperto con chiamate di strumenti in tempo reale
NVIDIA ha rilasciato NemotronLabs VoiceChat 11B, un modello end-to-end da voce a voce in tempo reale, progettato per conversazioni vocali full-duplex naturali. A differenza dei comuni approcci a pipeline,

NVIDIA NemotronLabs VoiceChat 11B porta la voce full-duplex e le chiamate di strumenti in tempo reale all'IA vocale aperta
Introduzione
NVIDIA ha rilasciato NemotronLabs VoiceChat 11B, un modello da voce a voce in tempo reale end-to-end, progettato per conversazioni vocali full-duplex naturali.
A differenza delle pipeline comuni che concatenano riconoscimento vocale automatico, modelli linguistici di grandi dimensioni e sintesi vocale, VoiceChat gestisce la comprensione e la generazione vocale in streaming all'interno di un'architettura unificata. L'obiettivo è ridurre i passaggi intermedi che tipicamente aumentano la latenza e rendono gli assistenti vocali meno naturali.
Il modello può ascoltare mentre la conversazione è in corso, cedere la parola quando l'utente interrompe e riprendere naturalmente quando l'utente ha finito di parlare. NVIDIA riporta una latenza di turno fluido di 448 millisecondi su Full-Duplex-Bench 1.0 e una latenza di interruzione di circa 480 millisecondi.
VoiceChat introduce anche una funzionalità particolarmente rilevante per gli agenti vocali di livello produttivo: la chiamata di strumenti in tempo reale mentre la conversazione vocale rimane attiva. Un canale di output separato può emettere istruzioni di chiamata di strumenti, mentre messaggi di conferma predefiniti aiutano l'agente a evitare silenzi imbarazzanti durante le richieste API esterne.
Questo rilascio è significativo, ma è ancora in una fase iniziale. NVIDIA etichetta il modello come solo per scopi di ricerca, raccomanda una quantità considerevole di memoria GPU per la distribuzione e documenta diverse limitazioni in conversazioni lunghe, ambienti rumorosi, ragionamento, uso multiplo di strumenti e generazione vocale incontrollata.
Architettura vocale-voce unificata
Gli assistenti vocali in tempo reale tradizionali si presentano tipicamente così:
Voce utente
↓
ASR (Riconoscimento vocale automatico)
↓
Testo
↓
LLM (Modello linguistico di grandi dimensioni)
↓
Risposta testuale
↓
TTS (Sintesi vocale)
↓
Voce dell'agente
VoiceChat integra queste capacità in un modello molto più coeso.
NVIDIA descrive questo sistema da 11B come un'architettura ibrida Mamba/Transformer composta da:
- Encoder vocale Fast Conformer
- Tronco principale del modello linguistico Nemotron Nano v2 da 9B
- Decoder TTS NVIDIA e codec audio
- Canale separato per script di chiamata di strumenti
L'utente fornisce l'audio a 16 kHz. L'output include il testo dell'agente, la voce dell'agente e la trascrizione dell'utente, con l'audio dell'agente generato a 22.05 kHz.
Il full-duplex significa che le conversazioni possono sovrapporsi
Gli assistenti half-duplex gestiscono la conversazione essenzialmente come walkie-talkie: una parte parla, poi l'altra risponde.
Un sistema full-duplex può modellare continuamente entrambi i lati della conversazione. Questo consente la gestione delle interruzioni, le pause, gli scambi avanti e indietro e turni di parola più naturali.
I risultati pubblicati da NVIDIA su Full-Duplex-Bench 1.0 includono:
| Metrica | Risultato VoiceChat 11B |
|---|---|
| TOR (Occupazione turni) di turno fluido | 0,82 |
| Latenza di turno fluido | 448 ms |
| TOR di interruzione utente | 1,0 |
| Latenza di interruzione utente | 480 ms |
| Punteggio GPT-4o per interruzione utente | 4,33 |
Il dato di 448 millisecondi menzionato nell'articolo di notizie originale proviene dal benchmark del turno di parola fluido. NVIDIA riassume il modello come in grado di fornire una latenza di risposta di circa 450 ms.
VoiceChat è progettato per cedere la parola quando l'utente interrompe
La gestione delle interruzioni è una delle maggiori differenze tra una demo vocale e un agente conversazionale utilizzabile.
VoiceChat
Il modello è stato addestrato direttamente per il turno di parola conversazionale. Quando l'utente inizia a parlare a metà della risposta del modello, il sistema può interrompere il proprio turno vocale e ascoltare.
La documentazione delle limitazioni note di NVIDIA indica anche che questo comportamento non è perfetto in tutte le situazioni. Il modello può ancora interrompere l'utente nelle pause all'interno delle frasi, continuare a parlare dopo che avrebbe dovuto fermarsi, iniziare nuovi turni senza input aggiuntivo, cadere in loop o gestire erroneamente i segnali di feedback.
La chiamata di strumenti in tempo reale è la caratteristica ingegneristica più interessante
VoiceChat 11B è il primo modello full-duplex open-source di NVIDIA a supportare la chiamata di strumenti, progettato per mantenere un'interazione vocale naturale durante l'uso degli strumenti.
Gli agenti vocali spesso necessitano di informazioni non contenute nel modello. Per esempio:
Qual è lo stato attuale del mio ordine?
Il modello potrebbe dover chiamare un'API di gestione ordini prima di poter rispondere.
VoiceChat supporta i messaggi di conferma per gli strumenti. Gli sviluppatori possono definire brevi frasi come:
Va bene, me lo controllo per lei.
Quando il modello decide di chiamare uno strumento, il sistema può pronunciare una di queste frasi durante l'elaborazione della richiesta esterna.
Il flusso semplificato è il seguente:
L'utente parla
↓
VoiceChat risponde
↓
Il modello determina che è necessario uno strumento
↓
L'evento di chiamata strumento viene inviato al client
↓
Il client esegue la funzione esterna
↓
Il risultato dello strumento viene restituito a VoiceChat
↓
VoiceChat riprende la risposta vocale
Limiti importanti della chiamata di strumenti
NVIDIA consiglia un massimo di circa cinque strumenti per sessione, poiché le prestazioni possono degradarsi con più strumenti disponibili.
Il modello attualmente non è in grado di chiamare più strumenti contemporaneamente in modo affidabile.
Altre limitazioni includono errori di selezione degli strumenti, chiamate di strumenti saltate, parametri inventati, risultati di strumenti riportati in modo errato e l'uso di conoscenze interne quando sarebbe stato necessario uno strumento.
Un dettaglio particolarmente importante: sebbene VoiceChat supporti l'interruzione da parte dell'utente nelle conversazioni normali, attualmente l'utente non può interrompere l'agente durante l'esecuzione di uno strumento.
Risultati del benchmark per la chiamata di strumenti
I risultati riportati dell'AU Harness sono:
| Categoria di chiamata strumento | Punteggio |
|---|---|
| Semplice | 58,5% |
| Multiplo | 62,5% |
| Parallelo | 42,5% |
| Parallelo multiplo | 27,5% |
| Non pertinenza | 89,6% |
| Media | 56,1% |
Su Full-Duplex-Bench v3, NVIDIA riporta:
| Metrica | Punteggio |
|---|---|
| Selezione strumento | 82,5% |
| Accuratezza parametri | 44,2% |
| Pass@1 | 33% |
Questi numeri indicano che la chiamata di strumenti in ambienti di produzione dovrebbe ancora essere protetta dalla logica applicativa e dalla validazione dei parametri.
VoiceChat si posiziona in alto tra i modelli full-duplex open-source
NVIDIA riporta che VoiceChat si classifica al secondo posto tra i modelli full-duplex open-source sia su VoiceBench che su Full-Duplex-Bench 1.0.
Il modello è ottimizzato per il compromesso tra intelligenza generale e conversazione naturale in tempo reale. NVIDIA avverte esplicitamente che le sue prestazioni in termini di conoscenza, aderenza alle istruzioni, sicurezza e compiti di ragionamento potrebbero essere inferiori a quelle del modello linguistico sottostante Nemotron Nano v2.
Il modello è stato addestrato su circa 550.000 ore di audio
La scheda del modello NVIDIA elenca circa 550.000 ore di dati di addestramento audio.
I dati misti
includono voce reale e sintetica, oltre a dati testuali per i componenti del modello linguistico. Le fonti di dati nominate includono Fisher, LibriVox, LibriTTS, HiFi-TTS, VCTK, PromptTTS, UltraChat, dati vocali interni NVIDIA, voce sintetica, dati di chiamata di funzioni Nemotron e dati di addestramento PersonaPlex.
VoiceChat utilizza una voce fissa
I checkpoint attuali di VoiceChat non supportano la clonazione vocale.
Il repository NVIDIA indica che i checkpoint rilasciati utilizzano una voce fissa. Lo scopo di questo rilascio è più mirato: interazione vocale a bassa latenza, comportamento full-duplex conversazionale e consapevolezza degli strumenti.
I requisiti hardware sono piuttosto elevati
I prerequisiti attuali di NVIDIA per la distribuzione in tempo reale richiedono esplicitamente:
GPU NVIDIA con almeno 80 GB di memoria video
Le GPU supportate dai contenitori documentati includono NVIDIA A100, H100, RTX 6000 Pro e B200. La scheda del modello più ampia elenca anche la compatibilità con H200 e B100.
Per il contenitore real-time ottimizzato, NVIDIA attualmente richiede x86_64, Linux, Docker, NVIDIA Container Toolkit e driver NVIDIA compatibili.
La guida alla risoluzione dei problemi indica che il modello stesso utilizza circa 66 GB di memoria GPU.
Nessuna API di inferenza gestita matura disponibile
Al 11 agosto, la pagina del modello Hugging Face non elenca provider di inferenza attivi per questo checkpoint.
NVIDIA offre invece due percorsi principali:
- Inferenza offline, a partire dal checkpoint Hugging Face
- Streaming interattivo, tramite container NVIDIA ottimizzati
Il container in tempo reale include CUDA, Triton, vLLM e l'intero stack di inferenza VoiceChat, esponendo un servizio WebSocket bidirezionale.
Come eseguire l'inferenza offline
Clona il ramo sperimentale VoiceChat di NVIDIA:
git clone https://github.com/NVIDIA-NeMo/Speech.git
cd Speech
git switch nemotron-labs-voicechat
export NEMO_DIR="$(pwd)"
Crea l'ambiente:
conda create -y -n voicechat python=3.12
conda activate voicechat
pip install torch==2.10.0 torchvision==0.25.0 torchaudio==2.10.0
pip install -e ".[all]"
pip uninstall -y nvidia-resiliency-ext
pip install transformers==4.56.0 tokenizers==0.22.0 lhotse==1.32.2 huggingface-hub==0.34.4 hf-xet==1.1.9 torchcodec==0.10.0 torch_audiomentations jinja2
pip install ninja packaging wheel einops
pip install --no-build-isolation --no-deps causal-conv1d==1.6.2.post1 mamba-ssm==2.3.2.post1
Scarica il checkpoint:
hf download nvidia/NVIDIA-NemotronLabs-VoiceChat-11B --local-dir /path/to/checkpoint
Esegui l'esempio:
conda activate voicechat
export NEMO_DIR=/path/to/Speech
python "$NEMO_DIR/examples/speechlm2/offline_voicechat_infer.py" --checkpoint /path/to/checkpoint --wav "$NEMO_DIR/examples/speechlm2/sample_audio/sample_general.wav" --output-dir /path/to/output
NVIDIA consiglia di aggiungere silenzio sufficiente alla fine dell'audio di input personalizzato, per dare al modello il tempo di rispondere.
Come distribuire il container in tempo reale
Scarica il repository del modello:
ngc registry model download-version nim/nvidia/nemotron-labs-voicechat:1.0.0
chmod -R 777 nemotron-labs-voicechat_v1.0.0
Avvia il servizio:
docker run -it --rm
--name=nemotron-labs-voicechat --runtime=nvidia --gpus '"device=0"' --shm-size=8GB -e NIM_HTTP_API_PORT=9000 -p 9000:9000 -v $(pwd)/nemotron-labs-voicechat_v1.0.0:/data/models --entrypoint /s2s/run_s2s_server.sh nvcr.io/nim/nvidia/nemotron-labs-voicechat:latest
Verifica lo stato di prontezza:
curl 'http://localhost:9000/v1/realtime/health'
Successivamente, il server espone un endpoint WebSocket bidirezionale all'indirizzo:
ws://localhost:9000/v1/realtime
Una semplice definizione di strumento
Un esempio semplificato di definizione di strumento è il seguente:
[
{
"name": "get_weather",
"description": "Ottieni il meteo attuale per una città",
"ack_messages": [
"Va bene, glielo controllo."
],
"parameters": {
"type": "object",
"properties": {
"city": {
"type": "string"
}
},
"required": ["city"]
}
}
]
Il campo ack_messages fornisce al sistema contenuti di risposta naturali durante l'esecuzione dello strumento.
Solo per uso di ricerca, cautela per i team di produzione
NVIDIA contrassegna esplicitamente VoiceChat 11B come solo per uso di ricerca.
Il modello è stato addestrato con una finestra di contesto audio non superiore a circa due minuti, quindi contesti conversazionali più lunghi potrebbero non essere mantenuti in modo affidabile.
I problemi noti includono errori di inferenza, allucinazioni, degrado della qualità vocale dopo più turni di conversazione, ripetizioni, testo illeggibile, troncamento vocale, continuazione incontrollata, auto-conversazione, cicli di chiarimento, parole mancanti nella trascrizione, cambio di lingua inaffidabile e scarse prestazioni in ambienti rumorosi o con forte riverbero.
Potenziali casi d'uso per VoiceChat 11B
I potenziali scenari di ricerca e prototipazione includono:
Contact center
L'agente può ascoltare naturalmente, gestire le interruzioni, chiamare strumenti di assistenza clienti e utilizzare messaggi di conferma mentre attende il ritorno dell'API.
Assistente in auto
Il conducente può interrompere l'assistente senza attendere la fine completa della risposta vocale. L'attuale sensibilità al rumore di fondo implica che le implementazioni in auto richiedano ulteriori ottimizzazioni.
Ordini nel retail e nella ristorazione
L'agente vocale può raccogliere ordini, rispondere a correzioni e chiamare sistemi di prodotti o inventario.
Assistenza all'accessibilità
Turni conversazionali più naturali aiutano le interfacce a mani libere e le applicazioni voice-first, ma le implementazioni per l'accessibilità richiedono test utente accurati.
Agenti vocali aziendali
Le organizzazioni possono sperimentare con strumenti interni e interazioni vocali self-hosted, mantenendo il modello all'interno della propria infrastruttura.
Modello aperto, ma con due licenze diverse
L'espressione "open source" va intesa con maggiore precisione.
Il codice NeMo Speech utilizzato da VoiceChat è concesso in licenza Apache License 2.0.
I materiali del modello VoiceChat utilizzano la licenza OpenMDW 1.1.
Pertanto, è più prudente descrivere VoiceChat 11B come un modello aperto o un modello a pesi aperti, piuttosto che assumere che la licenza del modello sia identica a quella del software circostante con licenza Apache.
I team che pianificano ridistribuzione o uso commerciale dovrebbero rivedere direttamente la licenza OpenMDW.
Cosa dovrebbero testare gli sviluppatori prima della produzione
Un piano di valutazione utile dovrebbe includere:
Turni conversazionali e gestione delle interruzioni da parte dell'utente
Pause a metà frase e segnali di feedback
Audio rumoroso, con eco e multi-parlante
Parametri degli strumenti errati o mancanti
Timeout degli strumenti e fallimenti delle chiamate API
- Conversazioni lunghe
- Voce fuori controllo
- Allucinazioni e problemi di qualità del ragionamento
- Operazioni sensibili che richiedono approvazione
- Registrazione dei log, limiti di velocità e escalation manuale
Gli agenti vocali in grado di chiamare strumenti necessitano degli stessi controlli di autorizzazione degli altri agenti autonomi.
Domande frequenti
Cos'è NVIDIA NemotronLabs VoiceChat 11B?
NemotronLabs VoiceChat 11B è un modello vocale end-to-end in tempo reale da voce a voce sviluppato da NVIDIA per l'IA conversazionale full-duplex. Combina comprensione vocale in streaming, backbone del modello linguistico Nemotron, generazione vocale e un canale di chiamata strumenti separato.
Quanto è veloce VoiceChat 11B?
NVIDIA riporta una latenza di turnazione fluida di 448 millisecondi e una latenza di interruzione di circa 480 millisecondi su Full-Duplex-Bench 1.0.
Gli utenti possono interrompere VoiceChat mentre sta parlando?
Sì, la conversazione normale supporta inserimenti e gestione delle interruzioni. Tuttavia, NVIDIA dichiara che gli utenti attualmente non possono interrompere l'agente durante l'esecuzione degli strumenti.
VoiceChat 11B supporta le chiamate di funzione?
Sì. Il modello può emettere chiamate agli strumenti tramite un canale di output separato, e gli sviluppatori possono definire messaggi di conferma da annunciare durante l'esecuzione degli strumenti esterni.
Di quanta memoria GPU ha bisogno VoiceChat 11B?
Il container in tempo reale di NVIDIA richiede almeno 80 GB di memoria GPU. La documentazione per la risoluzione dei problemi indica che il modello caricato utilizza circa 66 GB.
Esiste un'API hosted per VoiceChat 11B?
NVIDIA attualmente fornisce inferenza offline self-hosted e documentazione ottimizzata per container in tempo reale. La pagina del modello su Hugging Face attualmente non elenca fornitori di inferenza hosted.
VoiceChat può clonare le voci?
No. I checkpoint rilasciati utilizzano voci fisse e non supportano la clonazione vocale.
VoiceChat 11B può essere utilizzato in produzione?
NVIDIA contrassegna il modello come destinato esclusivamente alla ricerca. Gli sviluppatori dovrebbero valutarne i limiti in termini di lunghezza del contesto, ragionamento, utilizzo degli strumenti, audio disturbato, ripetizioni, trascrizioni e voce fuori controllo prima della distribuzione in produzione.
Strumenti correlati
- NVIDIA NemotronLabs VoiceChat 11B: Scheda ufficiale del modello, pesi, benchmark, architettura, licenza e istruzioni di inferenza.
- NVIDIA NeMo Speech: Repository vocale ufficiale contenente l'implementazione di VoiceChat e i rami di distribuzione.
- Guida ai container in tempo reale di NVIDIA VoiceChat: Documentazione ufficiale per Docker, WebSocket e distribuzione delle chiamate di funzione.
- NVIDIA Container Toolkit: Consente ai container Docker di accedere alle GPU NVIDIA.
- vLLM: Motore di inferenza elencato nella scheda del modello NVIDIA VoiceChat.
- VoiceBench: Benchmark aperto per la valutazione degli assistenti vocali basati su LLM.
Link correlati
La fonte principale copre data di rilascio, benchmark, dati di addestramento, architettura e stato di utilizzo esclusivamente per ricerca.
- Ramo GitHub di VoiceChat: Codice sorgente ufficiale, istruzioni di installazione, requisiti hardware, limitazioni e descrizione del modello.
- Prerequisiti per la distribuzione in tempo reale: Requisiti di hardware, Linux, Docker, driver e container toolkit.
- Guida alla distribuzione in tempo reale: Documentazione di NVIDIA per l'avvio del container, health check, WebSocket, client e chiamate degli strumenti.
- Licenza OpenMDW 1.1: Licenza che regola i materiali del modello VoiceChat.
- Full-Duplex-Bench: Benchmark per la valutazione della gestione delle pause, dell'alternanza dei turni e del comportamento di interruzione.
- Full-Duplex-Bench v3: Benchmark focalizzato sulle interazioni vocali full-duplex con chiamate agli strumenti.
Riepilogo
NVIDIA NemotronLabs VoiceChat 11B integra comprensione vocale, modellazione linguistica, generazione vocale, gestione delle interruzioni e capacità di chiamata degli strumenti in un'architettura full-duplex unificata. NVIDIA riporta una latenza di alternanza dei turni di soli 448 millisecondi e posiziona il modello ai vertici degli attuali benchmark aperti full-duplex.
La caratteristica ingegneristica più rilevante è la chiamata agli strumenti. Un canale di output separato può attivare funzioni esterne, mentre i messaggi di conferma evitano che la conversazione cada nel silenzio durante le chiamate API.
Questa versione non è ancora un servizio completo pronto per la produzione. La distribuzione in tempo reale richiede almeno 80 GB di memoria GPU, i checkpoint attuali utilizzano voci fisse, l'inferenza hosted non è ancora ampiamente disponibile e NVIDIA documenta chiaramente limitazioni significative nelle sessioni più lunghe, nel ragionamento, nell'audio disturbato e nell'esecuzione degli strumenti.
VoiceChat 11B è più adatto a essere considerato una piattaforma di ricerca aperta per la creazione e lo studio di agenti vocali a bassa latenza, piuttosto che una soluzione matura per sostituire i contact center o le API vocali consumer in produzione.