NVIDIA NemotronLabs VoiceChat 11B: AI vocale full-duplex aperto con chiamate di strumenti in tempo reale

NVIDIA ha rilasciato NemotronLabs VoiceChat 11B, un modello end-to-end da voce a voce in tempo reale, progettato per conversazioni vocali full-duplex naturali. A differenza dei comuni approcci a pipeline,

发布于 2026年8月11日generalGEO 评分: 01 次阅读
NVIDIA NemotronLabs VoiceChat 11B: AI vocale full-duplex aperto con chiamate di strumenti in tempo reale

NVIDIA NemotronLabs VoiceChat 11B porta la voce full-duplex e le chiamate di strumenti in tempo reale all'IA vocale aperta

Introduzione

NVIDIA ha rilasciato NemotronLabs VoiceChat 11B, un modello da voce a voce in tempo reale end-to-end, progettato per conversazioni vocali full-duplex naturali.

A differenza delle pipeline comuni che concatenano riconoscimento vocale automatico, modelli linguistici di grandi dimensioni e sintesi vocale, VoiceChat gestisce la comprensione e la generazione vocale in streaming all'interno di un'architettura unificata. L'obiettivo è ridurre i passaggi intermedi che tipicamente aumentano la latenza e rendono gli assistenti vocali meno naturali.

Il modello può ascoltare mentre la conversazione è in corso, cedere la parola quando l'utente interrompe e riprendere naturalmente quando l'utente ha finito di parlare. NVIDIA riporta una latenza di turno fluido di 448 millisecondi su Full-Duplex-Bench 1.0 e una latenza di interruzione di circa 480 millisecondi.

VoiceChat introduce anche una funzionalità particolarmente rilevante per gli agenti vocali di livello produttivo: la chiamata di strumenti in tempo reale mentre la conversazione vocale rimane attiva. Un canale di output separato può emettere istruzioni di chiamata di strumenti, mentre messaggi di conferma predefiniti aiutano l'agente a evitare silenzi imbarazzanti durante le richieste API esterne.

Questo rilascio è significativo, ma è ancora in una fase iniziale. NVIDIA etichetta il modello come solo per scopi di ricerca, raccomanda una quantità considerevole di memoria GPU per la distribuzione e documenta diverse limitazioni in conversazioni lunghe, ambienti rumorosi, ragionamento, uso multiplo di strumenti e generazione vocale incontrollata.

Architettura vocale-voce unificata

Gli assistenti vocali in tempo reale tradizionali si presentano tipicamente così:

Voce utente
   ↓
ASR (Riconoscimento vocale automatico)
   ↓
Testo
   ↓
LLM (Modello linguistico di grandi dimensioni)
   ↓
Risposta testuale
   ↓
TTS (Sintesi vocale)
   ↓
Voce dell'agente

VoiceChat integra queste capacità in un modello molto più coeso.

NVIDIA descrive questo sistema da 11B come un'architettura ibrida Mamba/Transformer composta da:

  • Encoder vocale Fast Conformer
  • Tronco principale del modello linguistico Nemotron Nano v2 da 9B
  • Decoder TTS NVIDIA e codec audio
  • Canale separato per script di chiamata di strumenti

L'utente fornisce l'audio a 16 kHz. L'output include il testo dell'agente, la voce dell'agente e la trascrizione dell'utente, con l'audio dell'agente generato a 22.05 kHz.

Il full-duplex significa che le conversazioni possono sovrapporsi

Gli assistenti half-duplex gestiscono la conversazione essenzialmente come walkie-talkie: una parte parla, poi l'altra risponde.

Un sistema full-duplex può modellare continuamente entrambi i lati della conversazione. Questo consente la gestione delle interruzioni, le pause, gli scambi avanti e indietro e turni di parola più naturali.

I risultati pubblicati da NVIDIA su Full-Duplex-Bench 1.0 includono:

Metrica Risultato VoiceChat 11B
TOR (Occupazione turni) di turno fluido 0,82
Latenza di turno fluido 448 ms
TOR di interruzione utente 1,0
Latenza di interruzione utente 480 ms
Punteggio GPT-4o per interruzione utente 4,33

Il dato di 448 millisecondi menzionato nell'articolo di notizie originale proviene dal benchmark del turno di parola fluido. NVIDIA riassume il modello come in grado di fornire una latenza di risposta di circa 450 ms.

VoiceChat è progettato per cedere la parola quando l'utente interrompe

La gestione delle interruzioni è una delle maggiori differenze tra una demo vocale e un agente conversazionale utilizzabile.

VoiceChat

Il modello è stato addestrato direttamente per il turno di parola conversazionale. Quando l'utente inizia a parlare a metà della risposta del modello, il sistema può interrompere il proprio turno vocale e ascoltare.

La documentazione delle limitazioni note di NVIDIA indica anche che questo comportamento non è perfetto in tutte le situazioni. Il modello può ancora interrompere l'utente nelle pause all'interno delle frasi, continuare a parlare dopo che avrebbe dovuto fermarsi, iniziare nuovi turni senza input aggiuntivo, cadere in loop o gestire erroneamente i segnali di feedback.

La chiamata di strumenti in tempo reale è la caratteristica ingegneristica più interessante

VoiceChat 11B è il primo modello full-duplex open-source di NVIDIA a supportare la chiamata di strumenti, progettato per mantenere un'interazione vocale naturale durante l'uso degli strumenti.

Gli agenti vocali spesso necessitano di informazioni non contenute nel modello. Per esempio:

Qual è lo stato attuale del mio ordine?

Il modello potrebbe dover chiamare un'API di gestione ordini prima di poter rispondere.

VoiceChat supporta i messaggi di conferma per gli strumenti. Gli sviluppatori possono definire brevi frasi come:

Va bene, me lo controllo per lei.

Quando il modello decide di chiamare uno strumento, il sistema può pronunciare una di queste frasi durante l'elaborazione della richiesta esterna.

Il flusso semplificato è il seguente:

L'utente parla
   ↓
VoiceChat risponde
   ↓
Il modello determina che è necessario uno strumento
   ↓
L'evento di chiamata strumento viene inviato al client
   ↓
Il client esegue la funzione esterna
   ↓
Il risultato dello strumento viene restituito a VoiceChat
   ↓
VoiceChat riprende la risposta vocale

Limiti importanti della chiamata di strumenti

NVIDIA consiglia un massimo di circa cinque strumenti per sessione, poiché le prestazioni possono degradarsi con più strumenti disponibili.

Il modello attualmente non è in grado di chiamare più strumenti contemporaneamente in modo affidabile.

Altre limitazioni includono errori di selezione degli strumenti, chiamate di strumenti saltate, parametri inventati, risultati di strumenti riportati in modo errato e l'uso di conoscenze interne quando sarebbe stato necessario uno strumento.

Un dettaglio particolarmente importante: sebbene VoiceChat supporti l'interruzione da parte dell'utente nelle conversazioni normali, attualmente l'utente non può interrompere l'agente durante l'esecuzione di uno strumento.

Risultati del benchmark per la chiamata di strumenti

I risultati riportati dell'AU Harness sono:

Categoria di chiamata strumento Punteggio
Semplice 58,5%
Multiplo 62,5%
Parallelo 42,5%
Parallelo multiplo 27,5%
Non pertinenza 89,6%
Media 56,1%

Su Full-Duplex-Bench v3, NVIDIA riporta:

Metrica Punteggio
Selezione strumento 82,5%
Accuratezza parametri 44,2%
Pass@1 33%

Questi numeri indicano che la chiamata di strumenti in ambienti di produzione dovrebbe ancora essere protetta dalla logica applicativa e dalla validazione dei parametri.

VoiceChat si posiziona in alto tra i modelli full-duplex open-source

NVIDIA riporta che VoiceChat si classifica al secondo posto tra i modelli full-duplex open-source sia su VoiceBench che su Full-Duplex-Bench 1.0.

Il modello è ottimizzato per il compromesso tra intelligenza generale e conversazione naturale in tempo reale. NVIDIA avverte esplicitamente che le sue prestazioni in termini di conoscenza, aderenza alle istruzioni, sicurezza e compiti di ragionamento potrebbero essere inferiori a quelle del modello linguistico sottostante Nemotron Nano v2.

Il modello è stato addestrato su circa 550.000 ore di audio

La scheda del modello NVIDIA elenca circa 550.000 ore di dati di addestramento audio.

I dati misti

includono voce reale e sintetica, oltre a dati testuali per i componenti del modello linguistico. Le fonti di dati nominate includono Fisher, LibriVox, LibriTTS, HiFi-TTS, VCTK, PromptTTS, UltraChat, dati vocali interni NVIDIA, voce sintetica, dati di chiamata di funzioni Nemotron e dati di addestramento PersonaPlex.

VoiceChat utilizza una voce fissa

I checkpoint attuali di VoiceChat non supportano la clonazione vocale.

Il repository NVIDIA indica che i checkpoint rilasciati utilizzano una voce fissa. Lo scopo di questo rilascio è più mirato: interazione vocale a bassa latenza, comportamento full-duplex conversazionale e consapevolezza degli strumenti.

I requisiti hardware sono piuttosto elevati

I prerequisiti attuali di NVIDIA per la distribuzione in tempo reale richiedono esplicitamente:

GPU NVIDIA con almeno 80 GB di memoria video

Le GPU supportate dai contenitori documentati includono NVIDIA A100, H100, RTX 6000 Pro e B200. La scheda del modello più ampia elenca anche la compatibilità con H200 e B100.

Per il contenitore real-time ottimizzato, NVIDIA attualmente richiede x86_64, Linux, Docker, NVIDIA Container Toolkit e driver NVIDIA compatibili.

La guida alla risoluzione dei problemi indica che il modello stesso utilizza circa 66 GB di memoria GPU.

Nessuna API di inferenza gestita matura disponibile

Al 11 agosto, la pagina del modello Hugging Face non elenca provider di inferenza attivi per questo checkpoint.

NVIDIA offre invece due percorsi principali:

  1. Inferenza offline, a partire dal checkpoint Hugging Face
  2. Streaming interattivo, tramite container NVIDIA ottimizzati

Il container in tempo reale include CUDA, Triton, vLLM e l'intero stack di inferenza VoiceChat, esponendo un servizio WebSocket bidirezionale.

Come eseguire l'inferenza offline

Clona il ramo sperimentale VoiceChat di NVIDIA:

git clone https://github.com/NVIDIA-NeMo/Speech.git
cd Speech
git switch nemotron-labs-voicechat
export NEMO_DIR="$(pwd)"

Crea l'ambiente:

conda create -y -n voicechat python=3.12
conda activate voicechat
pip install torch==2.10.0 torchvision==0.25.0 torchaudio==2.10.0
pip install -e ".[all]"
pip uninstall -y nvidia-resiliency-ext
pip install transformers==4.56.0 tokenizers==0.22.0 lhotse==1.32.2             huggingface-hub==0.34.4 hf-xet==1.1.9 torchcodec==0.10.0             torch_audiomentations jinja2
pip install ninja packaging wheel einops
pip install --no-build-isolation --no-deps             causal-conv1d==1.6.2.post1 mamba-ssm==2.3.2.post1

Scarica il checkpoint:

hf download nvidia/NVIDIA-NemotronLabs-VoiceChat-11B   --local-dir /path/to/checkpoint

Esegui l'esempio:

conda activate voicechat
export NEMO_DIR=/path/to/Speech
python "$NEMO_DIR/examples/speechlm2/offline_voicechat_infer.py"   --checkpoint /path/to/checkpoint   --wav "$NEMO_DIR/examples/speechlm2/sample_audio/sample_general.wav"   --output-dir /path/to/output

NVIDIA consiglia di aggiungere silenzio sufficiente alla fine dell'audio di input personalizzato, per dare al modello il tempo di rispondere.

Come distribuire il container in tempo reale

Scarica il repository del modello:

ngc registry model download-version nim/nvidia/nemotron-labs-voicechat:1.0.0
chmod -R 777 nemotron-labs-voicechat_v1.0.0

Avvia il servizio:

docker run -it --rm
--name=nemotron-labs-voicechat   --runtime=nvidia   --gpus '"device=0"'   --shm-size=8GB   -e NIM_HTTP_API_PORT=9000   -p 9000:9000   -v $(pwd)/nemotron-labs-voicechat_v1.0.0:/data/models   --entrypoint /s2s/run_s2s_server.sh   nvcr.io/nim/nvidia/nemotron-labs-voicechat:latest

Verifica lo stato di prontezza:

curl 'http://localhost:9000/v1/realtime/health'

Successivamente, il server espone un endpoint WebSocket bidirezionale all'indirizzo:

ws://localhost:9000/v1/realtime

Una semplice definizione di strumento

Un esempio semplificato di definizione di strumento è il seguente:

[
  {
    "name": "get_weather",
    "description": "Ottieni il meteo attuale per una città",
    "ack_messages": [
      "Va bene, glielo controllo."
    ],
    "parameters": {
      "type": "object",
      "properties": {
        "city": {
          "type": "string"
        }
      },
      "required": ["city"]
    }
  }
]

Il campo ack_messages fornisce al sistema contenuti di risposta naturali durante l'esecuzione dello strumento.

Solo per uso di ricerca, cautela per i team di produzione

NVIDIA contrassegna esplicitamente VoiceChat 11B come solo per uso di ricerca.

Il modello è stato addestrato con una finestra di contesto audio non superiore a circa due minuti, quindi contesti conversazionali più lunghi potrebbero non essere mantenuti in modo affidabile.

I problemi noti includono errori di inferenza, allucinazioni, degrado della qualità vocale dopo più turni di conversazione, ripetizioni, testo illeggibile, troncamento vocale, continuazione incontrollata, auto-conversazione, cicli di chiarimento, parole mancanti nella trascrizione, cambio di lingua inaffidabile e scarse prestazioni in ambienti rumorosi o con forte riverbero.

Potenziali casi d'uso per VoiceChat 11B

I potenziali scenari di ricerca e prototipazione includono:

Contact center

L'agente può ascoltare naturalmente, gestire le interruzioni, chiamare strumenti di assistenza clienti e utilizzare messaggi di conferma mentre attende il ritorno dell'API.

Assistente in auto

Il conducente può interrompere l'assistente senza attendere la fine completa della risposta vocale. L'attuale sensibilità al rumore di fondo implica che le implementazioni in auto richiedano ulteriori ottimizzazioni.

Ordini nel retail e nella ristorazione

L'agente vocale può raccogliere ordini, rispondere a correzioni e chiamare sistemi di prodotti o inventario.

Assistenza all'accessibilità

Turni conversazionali più naturali aiutano le interfacce a mani libere e le applicazioni voice-first, ma le implementazioni per l'accessibilità richiedono test utente accurati.

Agenti vocali aziendali

Le organizzazioni possono sperimentare con strumenti interni e interazioni vocali self-hosted, mantenendo il modello all'interno della propria infrastruttura.

Modello aperto, ma con due licenze diverse

L'espressione "open source" va intesa con maggiore precisione.

Il codice NeMo Speech utilizzato da VoiceChat è concesso in licenza Apache License 2.0.

I materiali del modello VoiceChat utilizzano la licenza OpenMDW 1.1.

Pertanto, è più prudente descrivere VoiceChat 11B come un modello aperto o un modello a pesi aperti, piuttosto che assumere che la licenza del modello sia identica a quella del software circostante con licenza Apache.

I team che pianificano ridistribuzione o uso commerciale dovrebbero rivedere direttamente la licenza OpenMDW.

Cosa dovrebbero testare gli sviluppatori prima della produzione

Un piano di valutazione utile dovrebbe includere:

  • Turni conversazionali e gestione delle interruzioni da parte dell'utente

  • Pause a metà frase e segnali di feedback

  • Audio rumoroso, con eco e multi-parlante

  • Parametri degli strumenti errati o mancanti

Timeout degli strumenti e fallimenti delle chiamate API

  • Conversazioni lunghe
  • Voce fuori controllo
  • Allucinazioni e problemi di qualità del ragionamento
  • Operazioni sensibili che richiedono approvazione
  • Registrazione dei log, limiti di velocità e escalation manuale

Gli agenti vocali in grado di chiamare strumenti necessitano degli stessi controlli di autorizzazione degli altri agenti autonomi.

Domande frequenti

Cos'è NVIDIA NemotronLabs VoiceChat 11B?

NemotronLabs VoiceChat 11B è un modello vocale end-to-end in tempo reale da voce a voce sviluppato da NVIDIA per l'IA conversazionale full-duplex. Combina comprensione vocale in streaming, backbone del modello linguistico Nemotron, generazione vocale e un canale di chiamata strumenti separato.

Quanto è veloce VoiceChat 11B?

NVIDIA riporta una latenza di turnazione fluida di 448 millisecondi e una latenza di interruzione di circa 480 millisecondi su Full-Duplex-Bench 1.0.

Gli utenti possono interrompere VoiceChat mentre sta parlando?

Sì, la conversazione normale supporta inserimenti e gestione delle interruzioni. Tuttavia, NVIDIA dichiara che gli utenti attualmente non possono interrompere l'agente durante l'esecuzione degli strumenti.

VoiceChat 11B supporta le chiamate di funzione?

Sì. Il modello può emettere chiamate agli strumenti tramite un canale di output separato, e gli sviluppatori possono definire messaggi di conferma da annunciare durante l'esecuzione degli strumenti esterni.

Di quanta memoria GPU ha bisogno VoiceChat 11B?

Il container in tempo reale di NVIDIA richiede almeno 80 GB di memoria GPU. La documentazione per la risoluzione dei problemi indica che il modello caricato utilizza circa 66 GB.

Esiste un'API hosted per VoiceChat 11B?

NVIDIA attualmente fornisce inferenza offline self-hosted e documentazione ottimizzata per container in tempo reale. La pagina del modello su Hugging Face attualmente non elenca fornitori di inferenza hosted.

VoiceChat può clonare le voci?

No. I checkpoint rilasciati utilizzano voci fisse e non supportano la clonazione vocale.

VoiceChat 11B può essere utilizzato in produzione?

NVIDIA contrassegna il modello come destinato esclusivamente alla ricerca. Gli sviluppatori dovrebbero valutarne i limiti in termini di lunghezza del contesto, ragionamento, utilizzo degli strumenti, audio disturbato, ripetizioni, trascrizioni e voce fuori controllo prima della distribuzione in produzione.

Strumenti correlati

Link correlati

La fonte principale copre data di rilascio, benchmark, dati di addestramento, architettura e stato di utilizzo esclusivamente per ricerca.

Riepilogo

NVIDIA NemotronLabs VoiceChat 11B integra comprensione vocale, modellazione linguistica, generazione vocale, gestione delle interruzioni e capacità di chiamata degli strumenti in un'architettura full-duplex unificata. NVIDIA riporta una latenza di alternanza dei turni di soli 448 millisecondi e posiziona il modello ai vertici degli attuali benchmark aperti full-duplex.

La caratteristica ingegneristica più rilevante è la chiamata agli strumenti. Un canale di output separato può attivare funzioni esterne, mentre i messaggi di conferma evitano che la conversazione cada nel silenzio durante le chiamate API.

Questa versione non è ancora un servizio completo pronto per la produzione. La distribuzione in tempo reale richiede almeno 80 GB di memoria GPU, i checkpoint attuali utilizzano voci fisse, l'inferenza hosted non è ancora ampiamente disponibile e NVIDIA documenta chiaramente limitazioni significative nelle sessioni più lunghe, nel ragionamento, nell'audio disturbato e nell'esecuzione degli strumenti.

VoiceChat 11B è più adatto a essere considerato una piattaforma di ricerca aperta per la creazione e lo studio di agenti vocali a bassa latenza, piuttosto che una soluzione matura per sostituire i contact center o le API vocali consumer in produzione.