NVIDIA NemotronLabs VoiceChat 11B: Offene Vollduplex-Sprach-KI mit Echtzeit-Tool-Aufrufen
NVIDIA hat NemotronLabs VoiceChat 11B veröffentlicht, ein end-to-end Echtzeit-Sprach-zu-Sprach-Modell, das für natürliche Vollduplex-Sprachdialoge entwickelt wurde. Anders als bei gängigen Pipeline-Methoden,

NVIDIA NemotronLabs VoiceChat 11B bringt Voll-Duplex-Sprache und Echtzeit-Tool-Aufrufe für offene Sprach-KI
Einführung
NVIDIA hat NemotronLabs VoiceChat 11B veröffentlicht, ein End-to-End-Echtzeit-Sprache-zu-Sprache-Modell, das für natürliche Voll-Duplex-Sprachdialoge entwickelt wurde.
Im Gegensatz zu gängigen Pipelines, die automatische Spracherkennung, große Sprachmodelle und Text-zu-Sprache in Reihe schalten, verarbeitet VoiceChat Streaming-Sprachverständnis und Sprachgenerierung innerhalb einer einheitlichen Architektur. Ziel ist es, Übergabepunkte zu reduzieren, die typischerweise Latenz erhöhen und Sprachassistenten weniger natürlich wirken lassen.
Das Modell kann zuhören, während das Gespräch läuft, das Wort abgeben, wenn Nutzer unterbrechen, und nach dem Sprechen des Nutzers natürlich wieder aufnehmen. NVIDIA berichtet eine flüssige Turn-Taking-Latenz von 448 Millisekunden sowie eine Unterbrechungslatenz von etwa 480 Millisekunden auf Full-Duplex-Bench 1.0.
VoiceChat führt außerdem Funktionen ein, die für produktionsreife Sprachagenten besonders relevant sind: Echtzeit-Tool-Aufrufe bei gleichzeitig aktivem Sprachdialog. Ein separater Ausgabekanal kann Tool-Aufrufbefehle ausgeben, während vordefinierte Bestätigungsnachrichten dem Agenten helfen, peinliche Stillephasen während externer API-Anfragen zu vermeiden.
Diese Veröffentlichung ist bedeutsam, befindet sich jedoch noch in einem frühen Stadium. NVIDIA kennzeichnet das Modell als nur für Forschungszwecke, empfiehlt hohen GPU-Speicherbedarf für den Einsatz und dokumentiert mehrere Einschränkungen bei langen Gesprächen, lauten Umgebungen, Schlussfolgerungen, mehrfacher Tool-Nutzung und außer Kontrolle geratener Sprache.
Einheitliche Sprache-zu-Sprache-Architektur
Traditionelle Echtzeit-Sprachassistenten sehen typischerweise wie folgt aus:
Nutzerstimme
↓
ASR (Automatische Spracherkennung)
↓
Text
↓
LLM (Großes Sprachmodell)
↓
Textantwort
↓
TTS (Text-zu-Sprache)
↓
Agentenstimme
VoiceChat integriert diese Fähigkeiten in ein enger gekoppeltes Modell.
NVIDIA beschreibt dieses 11B-System als Hybrid-Mamba/Transformer-Architektur, bestehend aus:
- Fast-Conformer-Sprachcodierer
- Nemotron-Nano-v2-9B-Sprachmodell-Backbone
- NVIDIA-TTS-Dekodierer und Audio-Codec
- Separatem Kanal für Tool-Aufruf-Skripte
Nutzer liefern Sprache mit 16 kHz. Die Ausgabe umfasst Agententext, Agentensprache und Nutzertranskript; Agenten-Audio wird mit 22,05 kHz erzeugt.
Voll-Duplex bedeutet, dass sich Gespräche überlappen können
Halb-Duplex-Assistenten behandeln Konversationen faktisch wie Gegensprechanlagen: Eine Seite spricht, danach antwortet die andere.
Voll-Duplex-Systeme können beide Gesprächsseiten kontinuierlich modellieren. Dies ermöglicht Unterbrechungsbehandlung, Pausen, Hin-und-her-Kommunikation und natürlicheres Turn-Taking.
Die von NVIDIA veröffentlichten Full-Duplex-Bench-1.0-Ergebnisse umfassen:
| Metrik | VoiceChat-11B-Ergebnis |
|---|---|
| Flüssiges Turn-Taking TOR (Turn-Occupancy-Rate) | 0,82 |
| Flüssige Turn-Taking-Latenz | 448 ms |
| Nutzerunterbrechung TOR | 1,0 |
| Nutzerunterbrechungslatenz | 480 ms |
| Nutzerunterbrechung GPT-4o-Bewertung | 4,33 |
Die in den ursprünglichen Pressemitteilungen erwähnten 448 Millisekunden stammen aus dem Flüssig-Turn-Taking-Benchmark. NVIDIA fasst das Modell mit einer Antwortlatenz von etwa 450 ms zusammen.
VoiceChat ist darauf ausgelegt, bei Unterbrechungen durch den Nutzer das Wort abzugeben
Unterbrechungsbehandlung ist einer der größten Unterschiede zwischen Sprachdemos und brauchbaren Konversationsagenten.
VoiceChat
Das Modell wurde direkt auf konversationelles Turn-Taking trainiert. Wenn der Nutzer mitten in einer Modellantwort zu sprechen beginnt, kann das System seine Sprachrunde stoppen und zuhören.
Der bekannte Einschränkungsdokument von NVIDIA weist auch darauf hin, dass dieses Verhalten nicht in allen Fällen perfekt ist. Das Modell kann den Nutzer an Pausenstellen unterbrechen, nach dem Soll-Stopp weiterreden, ohne neue Eingabe neue Runden starten, in Schleifen geraten oder Feedback-Signale falsch verarbeiten.
Echtzeit-Tool-Aufrufe sind die interessanteste technische Funktion
VoiceChat 11B ist das erste Open-Source-Voll-Duplex-Modell von NVIDIA mit Tool-Aufruf-Unterstützung, das darauf ausgelegt ist, natürliche Sprachinteraktion bei Tool-Nutzung aufrechtzuerhalten.
Sprachagenten benötigen häufig Informationen, die nicht im Modell enthalten sind. Zum Beispiel:
Wie ist der aktuelle Status meiner Bestellung?
Das Modell muss möglicherweise zuerst eine Bestellverwaltungs-API aufrufen, bevor es antworten kann.
VoiceChat unterstützt Bestätigungsnachrichten für Tools. Entwickler können kurze Phrasen wie die folgende definieren:
Okay, lassen Sie mich das für Sie überprüfen.
Wenn das Modell entscheidet, ein Tool aufzurufen, kann das System während der Verarbeitung der externen Anfrage eine dieser Phrasen aussprechen.
Der vereinfachte Ablauf sieht wie folgt aus:
Nutzer spricht
↓
VoiceChat antwortet
↓
Modell stellt fest, dass ein Tool benötigt wird
↓
Tool-Aufrufereignis wird an den Client gesendet
↓
Client führt externe Funktion aus
↓
Tool-Ergebnis wird an VoiceChat zurückgegeben
↓
VoiceChat nimmt die Sprachantwort wieder auf
Wichtige Einschränkungen bei Tool-Aufrufen
NVIDIA empfiehlt höchstens etwa fünf Tools pro Sitzung, da die Leistung bei mehr verfügbaren Tools abnehmen kann.
Das Modell kann derzeit auch nicht zuverlässig mehrere Tools gleichzeitig aufrufen.
Weitere Einschränkungen umfassen falsche Tool-Auswahl, übersprungene Tool-Aufrufe, erfundene Parameter, fehlerhaft wiedergegebene Tool-Ergebnisse sowie die Nutzung internen Wissens, obwohl ein Tool verwendet werden sollte.
Ein besonders wichtiges Detail: Obwohl VoiceChat Unterbrechungen durch den Nutzer in normalen Gesprächen unterstützt, kann der Nutzer den Agenten während der Tool-Ausführung derzeit nicht unterbrechen.
Ergebnisse der Tool-Aufruf-Benchmarks
Die berichteten AU-Harness-Ergebnisse lauten:
| Tool-Aufruf-Kategorie | Punktzahl |
|---|---|
| Einfach | 58,5 % |
| Mehrere | 62,5 % |
| Parallel | 42,5 % |
| Parallel mehrere | 27,5 % |
| Irrelevanz | 89,6 % |
| Durchschnitt | 56,1 % |
Auf Full-Duplex-Bench v3 berichtet NVIDIA:
| Metrik | Punktzahl |
|---|---|
| Tool-Auswahl | 82,5 % |
| Parameter-Genauigkeit | 44,2 % |
| Pass@1 | 33 % |
Diese Zahlen deuten darauf hin, dass Tool-Aufrufe in der Produktion weiterhin durch Anwendungslogik und Parameterprüfungen abgesichert werden sollten.
VoiceChat rangiert unter den Open-Source-Voll-Duplex-Modellen weit oben
NVIDIA berichtet, dass VoiceChat auf VoiceBench und Full-Duplex-Bench 1.0 auf Platz zwei unter den Open-Source-Voll-Duplex-Modellen liegt.
Das Modell ist auf den Kompromiss zwischen allgemeiner Intelligenz und natürlicher Echtzeit-Konversation optimiert. NVIDIA warnt ausdrücklich davor, dass es bei Wissen, Befehlsbefolgung, Sicherheit und Schlussfolgerungsaufgaben möglicherweise schlechter abschneidet als das zugrunde liegende Nemotron-Nano-v2-Sprachmodell.
Das Modell wurde mit etwa 550.000 Stunden Audio trainiert
Das Modellkarten-Dokument von NVIDIA listet etwa 550.000 Stunden Audiotrainingsdaten auf.
Diese gemischten Daten
umfassen sowohl echte als auch synthetische Sprache sowie Textdaten für die Sprachmodellkomponenten. Genannte Datenquellen sind unter anderem Fisher, LibriVox, LibriTTS, HiFi-TTS, VCTK, PromptTTS, UltraChat, NVIDIA-interne Sprachdaten, synthetische Sprache, Nemotron-Funktionsaufrufdaten und PersonaPlex-Trainingsdaten.
VoiceChat verwendet eine feste Stimme
Die aktuellen VoiceChat-Checkpoints unterstützen keine Stimmklonierung.
Das NVIDIA-Repository gibt an, dass die veröffentlichten Checkpoints eine feste Stimme verwenden. Der Fokus dieser Veröffentlichung liegt enger: geringe Latenz, Voll-Duplex-Konversationsverhalten und Tool-bewusste Sprachinteraktion.
Hardware-Anforderungen sind relativ hoch
Die aktuellen Voraussetzungen für Echtzeit-Bereitstellung von NVIDIA lauten explizit:
NVIDIA-GPU mit mindestens 80 GB Grafikkartenspeicher
Die dokumentierten, vom Container unterstützten GPUs umfassen NVIDIA A100, H100, RTX 6000 Pro und B200. Die breitere Modellkarte listet zusätzlich H200- und B100-Kompatibilität auf.
Für optimierte Echtzeit-Container verlangt NVIDIA derzeit x86_64, Linux, Docker, das NVIDIA-Container-Toolkit und kompatible NVIDIA-Treiber.
Der Fehlerbehebungsleitfaden weist darauf hin, dass das Modell selbst etwa 66 GB GPU-Speicher belegt.
Noch keine ausgereifte gehostete Inferenz-API
Stand 11. August sind auf der Hugging-Face-Modellseite keine aktiven Inferenz-Anbieter für diesen Checkpoint aufgeführt.
Stattdessen bietet NVIDIA zwei Hauptpfade an:
- Offline-Inferenz basierend auf dem Hugging-Face-Checkpoint
- Interaktives Streaming über optimierte NVIDIA-Container
Der Echtzeit-Container bündelt CUDA, Triton, vLLM und den vollständigen VoiceChat-Inferenz-Stack und stellt einen bidirektionalen WebSocket-Dienst bereit.
So führen Sie Offline-Inferenz aus
Klonen Sie den experimentellen VoiceChat-Zweig von NVIDIA:
git clone https://github.com/NVIDIA-NeMo/Speech.git
cd Speech
git switch nemotron-labs-voicechat
export NEMO_DIR="$(pwd)"
Umgebung erstellen:
conda create -y -n voicechat python=3.12
conda activate voicechat
pip install torch==2.10.0 torchvision==0.25.0 torchaudio==2.10.0
pip install -e ".[all]"
pip uninstall -y nvidia-resiliency-ext
pip install transformers==4.56.0 tokenizers==0.22.0 lhotse==1.32.2 huggingface-hub==0.34.4 hf-xet==1.1.9 torchcodec==0.10.0 torch_audiomentations jinja2
pip install ninja packaging wheel einops
pip install --no-build-isolation --no-deps causal-conv1d==1.6.2.post1 mamba-ssm==2.3.2.post1
Checkpoint herunterladen:
hf download nvidia/NVIDIA-NemotronLabs-VoiceChat-11B --local-dir /path/to/checkpoint
Beispiel ausführen:
conda activate voicechat
export NEMO_DIR=/path/to/Speech
python "$NEMO_DIR/examples/speechlm2/offline_voicechat_infer.py" --checkpoint /path/to/checkpoint --wav "$NEMO_DIR/examples/speechlm2/sample_audio/sample_general.wav" --output-dir /path/to/output
NVIDIA empfiehlt, am Ende des benutzerdefinierten Eingabe-Audios ausreichend Stille hinzuzufügen, damit das Modell Zeit zum Antworten hat.
So stellen Sie den Echtzeit-Container bereit
Modell-Repository herunterladen:
ngc registry model download-version nim/nvidia/nemotron-labs-voicechat:1.0.0
chmod -R 777 nemotron-labs-voicechat_v1.0.0
Dienst starten:
docker run -it --rm
--name=nemotron-labs-voicechat --runtime=nvidia --gpus '"device=0"' --shm-size=8GB -e NIM_HTTP_API_PORT=9000 -p 9000:9000 -v $(pwd)/nemotron-labs-voicechat_v1.0.0:/data/models --entrypoint /s2s/run_s2s_server.sh nvcr.io/nim/nvidia/nemotron-labs-voicechat:latest
Bereitschaft prüfen:
curl 'http://localhost:9000/v1/realtime/health'
Anschließend stellt der Server einen bidirektionalen WebSocket-Endpunkt unter folgender Adresse bereit:
ws://localhost:9000/v1/realtime
Eine einfache Tool-Definition
Ein vereinfachtes Beispiel für eine Tool-Definition:
[
{
"name": "get_weather",
"description": "Ruft das aktuelle Wetter für eine Stadt ab",
"ack_messages": [
"Gut, ich schaue das für Sie nach."
],
"parameters": {
"type": "object",
"properties": {
"city": {
"type": "string"
}
},
"required": ["city"]
}
}
]
Das Feld ack_messages liefert dem System während der Tool-Ausführung natürliche Antwortinhalte.
Nur für Forschungszwecke – Produktionsteams sollten vorsichtig sein
NVIDIA kennzeichnet VoiceChat 11B ausdrücklich als nur für Forschungszwecke.
Das Modell wurde mit einem Audio-Kontextfenster von höchstens etwa zwei Minuten trainiert; längere Gesprächskontexte können daher möglicherweise nicht zuverlässig beibehalten werden.
Bekannte Probleme umfassen Inferenzfehler, Halluzinationen, nachlassende Sprachqualität nach mehreren Gesprächsrunden, Wiederholungen, verstümmelten Text, abgebrochene Sprache, unkontrolliertes Weitersprechen, Selbstgespräche, Klärungsschleifen, fehlende Wörter in Transkriptionen, unzuverlässigen Sprachwechsel sowie schlechte Leistung in lauten oder stark hallenden Umgebungen.
Mögliche Anwendungsszenarien für VoiceChat 11B
Mögliche Forschungs- und Prototypenszenarien umfassen:
Contact Center
Agenten können natürlich zuhören, Unterbrechungen verarbeiten, Kundenservice-Tools aufrufen und während der API-Antwort Bestätigungsmeldungen verwenden.
Fahrzeugassistenten
Fahrer können den Assistenten unterbrechen, ohne das Ende einer vollständigen Sprachantwort abzuwarten. Die aktuelle Empfindlichkeit gegenüber Hintergrundgeräuschen bedeutet, dass ein Fahrzeugeinsatz zusätzliche Optimierungsarbeit erfordert.
Einzelhandel und Restaurantbestellungen
Sprachagenten können Bestellungen aufnehmen, auf Korrekturen reagieren und Waren- oder Inventarsysteme aufrufen.
Barrierefreiheit
Natürlichere Gesprächswechsel unterstützen freihändige Schnittstellen und sprachgesteuerte Anwendungen, doch Barrierefreiheitsbereitstellungen erfordern sorgfältige Benutzertests.
Unternehmenssprachagenten
Organisationen können mit internen Tools und selbst gehosteten Sprachinteraktionen experimentieren, während das Modell innerhalb der eigenen Infrastruktur bleibt.
Offenes Modell, aber mit zwei verschiedenen Lizenzen
Der Begriff „Open Source“ muss präziser verstanden werden.
Der von VoiceChat verwendete NeMo-Speech-Code ist unter der Apache-Lizenz 2.0 lizenziert.
Die Modellmaterialien von VoiceChat sind unter der OpenMDW 1.1-Lizenz lizenziert.
Daher ist es zutreffender, VoiceChat 11B als offenes Modell oder Modell mit offenen Gewichten zu beschreiben, anstatt anzunehmen, dass die Modelllizenz identisch mit der Apache-lizenzierten umgebenden Software ist.
Teams, die eine Weiterverbreitung oder kommerzielle Nutzung planen, sollten die OpenMDW-Lizenz direkt prüfen.
Was Entwickler vor der Produktion testen sollten
Ein sinnvoller Evaluierungsplan sollte abdecken:
Gesprächswechsel und Verarbeitung von Benutzerunterbrechungen
Satzmittige Pausen und Bestätigungssignale
Laute, hallende und Mehrsprachler-Audio
Fehlende oder fehlerhafte Tool-Parameter
Tool-Timeout und API-Aufruffehler
- Lange Unterhaltungen
- Unkontrollierte Sprachausgabe
- Halluzinationen und Probleme mit der Denkqualität
- Genehmigungspflicht für sensible Aktionen
- Protokollierung, Ratenbegrenzung und Eskalation an menschliche Bearbeiter
Sprachagenten, die Tools aufrufen können, benötigen dieselben Berechtigungskontrollen wie andere autonome Agenten.
Häufige Fragen
Was ist NVIDIA NemotronLabs VoiceChat 11B?
NemotronLabs VoiceChat 11B ist ein von NVIDIA entwickeltes Echtzeit-Sprach-zu-Sprach-Modell (End-to-End) für duplexe Konversations-KI. Es kombiniert Streaming-Sprachanalyse, das Nemotron-Sprachmodell als Rückgrat, Sprachsynthese sowie einen separaten Kanal für Tool-Aufrufe.
Wie schnell ist VoiceChat 11B?
NVIDIA gibt für das Modell eine Serverlatenz von 448 ms bei flüssiger Turn-Taking-Konversation und etwa 480 ms Unterbrechungslatenz an, gemessen auf dem Full-Duplex-Bench 1.0.
Kann der Benutzer VoiceChat während des Sprechens unterbrechen?
Ja, während normaler Unterhaltungen werden Interjektionen und Unterbrechungen unterstützt. Allerdings gibt NVIDIA an, dass Benutzer den Agenten während der Ausführung von Tools derzeit nicht unterbrechen können.
Unterstützt VoiceChat 11B Funktionsaufrufe?
Ja. Das Modell kann über einen separaten Ausgabekanal Tool-Aufrufe ausgeben. Entwickler können Bestätigungsnachrichten definieren, die während der Ausführung externer Tools gesprochen werden.
Wie viel GPU-Speicher benötigt VoiceChat 11B?
Der Echtzeit-Container von NVIDIA erfordert eine GPU mit mindestens 80 GB Videospeicher. Die Fehlerbehebungsdokumentation gibt an, dass das geladene Modell etwa 66 GB belegt.
Gibt es eine gehostete API für VoiceChat 11B?
NVIDIA bietet derzeit Dokumentation für selbst-gehostete Offline-Inferenz und optimierte Echtzeit-Container an. Die Hugging-Face-Modellseite listet derzeit keine gehosteten Inferenzanbieter auf.
Kann VoiceChat Stimmen klonen?
Nein. Die veröffentlichten Checkpoints verwenden eine feste Stimme und unterstützen kein Stimmklonen.
Kann VoiceChat 11B in der Produktion eingesetzt werden?
NVIDIA kennzeichnet das Modell als forschungsnutzung. Entwickler sollten vor dem Produktionseinsatz seine Einschränkungen bei Kontextlänge, Reasoning, Tool-Nutzung, verrauschtem Audio, Wiederholungen, Transkription und unkontrollierter Sprache bewerten.
Zugehörige Tools
- NVIDIA NemotronLabs VoiceChat 11B: Offizielle Modellkarte, Gewichte, Benchmarks, Architektur, Lizenz und Inferenzanweisungen.
- NVIDIA NeMo Speech: Offizielles Sprachrepositorium mit VoiceChat-Implementierung und Bereitstellungszweig.
- NVIDIA VoiceChat Echtzeitcontainer-Leitfaden: Offizielle Bereitstellungsanweisungen für Docker, WebSocket und Funktionsaufrufe.
- NVIDIA Container Toolkit: Ermöglicht Docker-Containern den Zugriff auf NVIDIA-GPUs.
- vLLM: Inferenz-Engine, die auf der NVIDIA-VoiceChat-Modellkarte aufgeführt ist.
- VoiceBench: Offener Benchmark zur Bewertung LLM-basierter Sprachassistenten.
Zugehörige Links
Primärquelle, die Veröffentlichungsdatum, Benchmarks, Trainingsdaten, Architektur und den Status „nur für Forschung" abdeckt.
- VoiceChat GitHub-Zweig: Offizieller Quellcode, Installationsanweisungen, Hardwareanforderungen, Einschränkungen und Modellbeschreibung.
- Voraussetzungen für die Echtzeitbereitstellung: Hardware-, Linux-, Docker-, Treiber- und Container-Toolkit-Anforderungen.
- Leitfaden für die Echtzeitbereitstellung: NVIDIA-Dokumentation zu Containerstart, Health-Checks, WebSocket, Clients und Tool-Aufrufen.
- OpenMDW 1.1-Lizenz: Lizenz, die das VoiceChat-Modellmaterial regelt.
- Full-Duplex-Bench: Benchmark zur Bewertung von Pausenverarbeitung, Turn-Taking und Unterbrechungsverhalten.
- Full-Duplex-Bench v3: Benchmark, der sich auf vollduplexe Sprachinteraktionen mit Tool-Aufrufen konzentriert.
Zusammenfassung
NVIDIA NemotronLabs VoiceChat 11B vereint Sprachanalyse, Sprachmodellierung, Sprachsynthese, Unterbrechungsverarbeitung und Tool-Aufruffähigkeiten in einer einheitlichen vollduplexen Architektur. NVIDIA gibt eine Serverlatenz von nur 448 ms an und positioniert das Modell an der Spitze der derzeit offenen vollduplexen Sprachbenchmarks.
Das bemerkenswerteste technische Merkmal ist die Tool-Aufruffunktion. Ein separater Ausgabekanal kann externe Funktionen auslösen, während Bestätigungsnachrichten verhindern, dass die Unterhaltung während API-Aufrufen verstummt.
Diese Version ist noch kein vollständiger, produktionsreifer Dienst. Die Echtzeitbereitstellung erfordert mindestens 80 GB GPU-Videospeicher, aktuelle Checkpoints verwenden feste Stimmen, gehostete Inferenz ist noch nicht weit verbreitet verfügbar, und NVIDIA dokumentiert ausdrücklich erhebliche Einschränkungen bei längeren Sitzungen, Reasoning, verrauschtem Audio und der Tool-Ausführung.
VoiceChat 11B ist daher besser als offene Forschungsplattform für den Aufbau und die Untersuchung von Echtzeit-Sprachagenten mit niedriger Latenz zu betrachten, denn als ausgereifte Lösung, die in der Produktion Callcenter oder kommerzielle Sprach-APIs ersetzt.