NVIDIA NemotronLabs VoiceChat 11B: Offene Vollduplex-Sprach-KI mit Echtzeit-Tool-Aufrufen

NVIDIA hat NemotronLabs VoiceChat 11B veröffentlicht, ein end-to-end Echtzeit-Sprach-zu-Sprach-Modell, das für natürliche Vollduplex-Sprachdialoge entwickelt wurde. Anders als bei gängigen Pipeline-Methoden,

发布于 2026年8月11日generalGEO 评分: 015 次阅读
NVIDIA NemotronLabs VoiceChat 11B: Offene Vollduplex-Sprach-KI mit Echtzeit-Tool-Aufrufen

NVIDIA NemotronLabs VoiceChat 11B bringt Voll-Duplex-Sprache und Echtzeit-Tool-Aufrufe für offene Sprach-KI

Einführung

NVIDIA hat NemotronLabs VoiceChat 11B veröffentlicht, ein End-to-End-Echtzeit-Sprache-zu-Sprache-Modell, das für natürliche Voll-Duplex-Sprachdialoge entwickelt wurde.

Im Gegensatz zu gängigen Pipelines, die automatische Spracherkennung, große Sprachmodelle und Text-zu-Sprache in Reihe schalten, verarbeitet VoiceChat Streaming-Sprachverständnis und Sprachgenerierung innerhalb einer einheitlichen Architektur. Ziel ist es, Übergabepunkte zu reduzieren, die typischerweise Latenz erhöhen und Sprachassistenten weniger natürlich wirken lassen.

Das Modell kann zuhören, während das Gespräch läuft, das Wort abgeben, wenn Nutzer unterbrechen, und nach dem Sprechen des Nutzers natürlich wieder aufnehmen. NVIDIA berichtet eine flüssige Turn-Taking-Latenz von 448 Millisekunden sowie eine Unterbrechungslatenz von etwa 480 Millisekunden auf Full-Duplex-Bench 1.0.

VoiceChat führt außerdem Funktionen ein, die für produktionsreife Sprachagenten besonders relevant sind: Echtzeit-Tool-Aufrufe bei gleichzeitig aktivem Sprachdialog. Ein separater Ausgabekanal kann Tool-Aufrufbefehle ausgeben, während vordefinierte Bestätigungsnachrichten dem Agenten helfen, peinliche Stillephasen während externer API-Anfragen zu vermeiden.

Diese Veröffentlichung ist bedeutsam, befindet sich jedoch noch in einem frühen Stadium. NVIDIA kennzeichnet das Modell als nur für Forschungszwecke, empfiehlt hohen GPU-Speicherbedarf für den Einsatz und dokumentiert mehrere Einschränkungen bei langen Gesprächen, lauten Umgebungen, Schlussfolgerungen, mehrfacher Tool-Nutzung und außer Kontrolle geratener Sprache.

Einheitliche Sprache-zu-Sprache-Architektur

Traditionelle Echtzeit-Sprachassistenten sehen typischerweise wie folgt aus:

Nutzerstimme
   ↓
ASR (Automatische Spracherkennung)
   ↓
Text
   ↓
LLM (Großes Sprachmodell)
   ↓
Textantwort
   ↓
TTS (Text-zu-Sprache)
   ↓
Agentenstimme

VoiceChat integriert diese Fähigkeiten in ein enger gekoppeltes Modell.

NVIDIA beschreibt dieses 11B-System als Hybrid-Mamba/Transformer-Architektur, bestehend aus:

  • Fast-Conformer-Sprachcodierer
  • Nemotron-Nano-v2-9B-Sprachmodell-Backbone
  • NVIDIA-TTS-Dekodierer und Audio-Codec
  • Separatem Kanal für Tool-Aufruf-Skripte

Nutzer liefern Sprache mit 16 kHz. Die Ausgabe umfasst Agententext, Agentensprache und Nutzertranskript; Agenten-Audio wird mit 22,05 kHz erzeugt.

Voll-Duplex bedeutet, dass sich Gespräche überlappen können

Halb-Duplex-Assistenten behandeln Konversationen faktisch wie Gegensprechanlagen: Eine Seite spricht, danach antwortet die andere.

Voll-Duplex-Systeme können beide Gesprächsseiten kontinuierlich modellieren. Dies ermöglicht Unterbrechungsbehandlung, Pausen, Hin-und-her-Kommunikation und natürlicheres Turn-Taking.

Die von NVIDIA veröffentlichten Full-Duplex-Bench-1.0-Ergebnisse umfassen:

Metrik VoiceChat-11B-Ergebnis
Flüssiges Turn-Taking TOR (Turn-Occupancy-Rate) 0,82
Flüssige Turn-Taking-Latenz 448 ms
Nutzerunterbrechung TOR 1,0
Nutzerunterbrechungslatenz 480 ms
Nutzerunterbrechung GPT-4o-Bewertung 4,33

Die in den ursprünglichen Pressemitteilungen erwähnten 448 Millisekunden stammen aus dem Flüssig-Turn-Taking-Benchmark. NVIDIA fasst das Modell mit einer Antwortlatenz von etwa 450 ms zusammen.

VoiceChat ist darauf ausgelegt, bei Unterbrechungen durch den Nutzer das Wort abzugeben

Unterbrechungsbehandlung ist einer der größten Unterschiede zwischen Sprachdemos und brauchbaren Konversationsagenten.

VoiceChat

Das Modell wurde direkt auf konversationelles Turn-Taking trainiert. Wenn der Nutzer mitten in einer Modellantwort zu sprechen beginnt, kann das System seine Sprachrunde stoppen und zuhören.

Der bekannte Einschränkungsdokument von NVIDIA weist auch darauf hin, dass dieses Verhalten nicht in allen Fällen perfekt ist. Das Modell kann den Nutzer an Pausenstellen unterbrechen, nach dem Soll-Stopp weiterreden, ohne neue Eingabe neue Runden starten, in Schleifen geraten oder Feedback-Signale falsch verarbeiten.

Echtzeit-Tool-Aufrufe sind die interessanteste technische Funktion

VoiceChat 11B ist das erste Open-Source-Voll-Duplex-Modell von NVIDIA mit Tool-Aufruf-Unterstützung, das darauf ausgelegt ist, natürliche Sprachinteraktion bei Tool-Nutzung aufrechtzuerhalten.

Sprachagenten benötigen häufig Informationen, die nicht im Modell enthalten sind. Zum Beispiel:

Wie ist der aktuelle Status meiner Bestellung?

Das Modell muss möglicherweise zuerst eine Bestellverwaltungs-API aufrufen, bevor es antworten kann.

VoiceChat unterstützt Bestätigungsnachrichten für Tools. Entwickler können kurze Phrasen wie die folgende definieren:

Okay, lassen Sie mich das für Sie überprüfen.

Wenn das Modell entscheidet, ein Tool aufzurufen, kann das System während der Verarbeitung der externen Anfrage eine dieser Phrasen aussprechen.

Der vereinfachte Ablauf sieht wie folgt aus:

Nutzer spricht
   ↓
VoiceChat antwortet
   ↓
Modell stellt fest, dass ein Tool benötigt wird
   ↓
Tool-Aufrufereignis wird an den Client gesendet
   ↓
Client führt externe Funktion aus
   ↓
Tool-Ergebnis wird an VoiceChat zurückgegeben
   ↓
VoiceChat nimmt die Sprachantwort wieder auf

Wichtige Einschränkungen bei Tool-Aufrufen

NVIDIA empfiehlt höchstens etwa fünf Tools pro Sitzung, da die Leistung bei mehr verfügbaren Tools abnehmen kann.

Das Modell kann derzeit auch nicht zuverlässig mehrere Tools gleichzeitig aufrufen.

Weitere Einschränkungen umfassen falsche Tool-Auswahl, übersprungene Tool-Aufrufe, erfundene Parameter, fehlerhaft wiedergegebene Tool-Ergebnisse sowie die Nutzung internen Wissens, obwohl ein Tool verwendet werden sollte.

Ein besonders wichtiges Detail: Obwohl VoiceChat Unterbrechungen durch den Nutzer in normalen Gesprächen unterstützt, kann der Nutzer den Agenten während der Tool-Ausführung derzeit nicht unterbrechen.

Ergebnisse der Tool-Aufruf-Benchmarks

Die berichteten AU-Harness-Ergebnisse lauten:

Tool-Aufruf-Kategorie Punktzahl
Einfach 58,5 %
Mehrere 62,5 %
Parallel 42,5 %
Parallel mehrere 27,5 %
Irrelevanz 89,6 %
Durchschnitt 56,1 %

Auf Full-Duplex-Bench v3 berichtet NVIDIA:

Metrik Punktzahl
Tool-Auswahl 82,5 %
Parameter-Genauigkeit 44,2 %
Pass@1 33 %

Diese Zahlen deuten darauf hin, dass Tool-Aufrufe in der Produktion weiterhin durch Anwendungslogik und Parameterprüfungen abgesichert werden sollten.

VoiceChat rangiert unter den Open-Source-Voll-Duplex-Modellen weit oben

NVIDIA berichtet, dass VoiceChat auf VoiceBench und Full-Duplex-Bench 1.0 auf Platz zwei unter den Open-Source-Voll-Duplex-Modellen liegt.

Das Modell ist auf den Kompromiss zwischen allgemeiner Intelligenz und natürlicher Echtzeit-Konversation optimiert. NVIDIA warnt ausdrücklich davor, dass es bei Wissen, Befehlsbefolgung, Sicherheit und Schlussfolgerungsaufgaben möglicherweise schlechter abschneidet als das zugrunde liegende Nemotron-Nano-v2-Sprachmodell.

Das Modell wurde mit etwa 550.000 Stunden Audio trainiert

Das Modellkarten-Dokument von NVIDIA listet etwa 550.000 Stunden Audiotrainingsdaten auf.

Diese gemischten Daten

umfassen sowohl echte als auch synthetische Sprache sowie Textdaten für die Sprachmodellkomponenten. Genannte Datenquellen sind unter anderem Fisher, LibriVox, LibriTTS, HiFi-TTS, VCTK, PromptTTS, UltraChat, NVIDIA-interne Sprachdaten, synthetische Sprache, Nemotron-Funktionsaufrufdaten und PersonaPlex-Trainingsdaten.

VoiceChat verwendet eine feste Stimme

Die aktuellen VoiceChat-Checkpoints unterstützen keine Stimmklonierung.

Das NVIDIA-Repository gibt an, dass die veröffentlichten Checkpoints eine feste Stimme verwenden. Der Fokus dieser Veröffentlichung liegt enger: geringe Latenz, Voll-Duplex-Konversationsverhalten und Tool-bewusste Sprachinteraktion.

Hardware-Anforderungen sind relativ hoch

Die aktuellen Voraussetzungen für Echtzeit-Bereitstellung von NVIDIA lauten explizit:

NVIDIA-GPU mit mindestens 80 GB Grafikkartenspeicher

Die dokumentierten, vom Container unterstützten GPUs umfassen NVIDIA A100, H100, RTX 6000 Pro und B200. Die breitere Modellkarte listet zusätzlich H200- und B100-Kompatibilität auf.

Für optimierte Echtzeit-Container verlangt NVIDIA derzeit x86_64, Linux, Docker, das NVIDIA-Container-Toolkit und kompatible NVIDIA-Treiber.

Der Fehlerbehebungsleitfaden weist darauf hin, dass das Modell selbst etwa 66 GB GPU-Speicher belegt.

Noch keine ausgereifte gehostete Inferenz-API

Stand 11. August sind auf der Hugging-Face-Modellseite keine aktiven Inferenz-Anbieter für diesen Checkpoint aufgeführt.

Stattdessen bietet NVIDIA zwei Hauptpfade an:

  1. Offline-Inferenz basierend auf dem Hugging-Face-Checkpoint
  2. Interaktives Streaming über optimierte NVIDIA-Container

Der Echtzeit-Container bündelt CUDA, Triton, vLLM und den vollständigen VoiceChat-Inferenz-Stack und stellt einen bidirektionalen WebSocket-Dienst bereit.

So führen Sie Offline-Inferenz aus

Klonen Sie den experimentellen VoiceChat-Zweig von NVIDIA:

git clone https://github.com/NVIDIA-NeMo/Speech.git
cd Speech
git switch nemotron-labs-voicechat
export NEMO_DIR="$(pwd)"

Umgebung erstellen:

conda create -y -n voicechat python=3.12
conda activate voicechat
pip install torch==2.10.0 torchvision==0.25.0 torchaudio==2.10.0
pip install -e ".[all]"
pip uninstall -y nvidia-resiliency-ext
pip install transformers==4.56.0 tokenizers==0.22.0 lhotse==1.32.2             huggingface-hub==0.34.4 hf-xet==1.1.9 torchcodec==0.10.0             torch_audiomentations jinja2
pip install ninja packaging wheel einops
pip install --no-build-isolation --no-deps             causal-conv1d==1.6.2.post1 mamba-ssm==2.3.2.post1

Checkpoint herunterladen:

hf download nvidia/NVIDIA-NemotronLabs-VoiceChat-11B   --local-dir /path/to/checkpoint

Beispiel ausführen:

conda activate voicechat
export NEMO_DIR=/path/to/Speech
python "$NEMO_DIR/examples/speechlm2/offline_voicechat_infer.py"   --checkpoint /path/to/checkpoint   --wav "$NEMO_DIR/examples/speechlm2/sample_audio/sample_general.wav"   --output-dir /path/to/output

NVIDIA empfiehlt, am Ende des benutzerdefinierten Eingabe-Audios ausreichend Stille hinzuzufügen, damit das Modell Zeit zum Antworten hat.

So stellen Sie den Echtzeit-Container bereit

Modell-Repository herunterladen:

ngc registry model download-version nim/nvidia/nemotron-labs-voicechat:1.0.0
chmod -R 777 nemotron-labs-voicechat_v1.0.0

Dienst starten:

docker run -it --rm
--name=nemotron-labs-voicechat   --runtime=nvidia   --gpus '"device=0"'   --shm-size=8GB   -e NIM_HTTP_API_PORT=9000   -p 9000:9000   -v $(pwd)/nemotron-labs-voicechat_v1.0.0:/data/models   --entrypoint /s2s/run_s2s_server.sh   nvcr.io/nim/nvidia/nemotron-labs-voicechat:latest

Bereitschaft prüfen:

curl 'http://localhost:9000/v1/realtime/health'

Anschließend stellt der Server einen bidirektionalen WebSocket-Endpunkt unter folgender Adresse bereit:

ws://localhost:9000/v1/realtime

Eine einfache Tool-Definition

Ein vereinfachtes Beispiel für eine Tool-Definition:

[
  {
    "name": "get_weather",
    "description": "Ruft das aktuelle Wetter für eine Stadt ab",
    "ack_messages": [
      "Gut, ich schaue das für Sie nach."
    ],
    "parameters": {
      "type": "object",
      "properties": {
        "city": {
          "type": "string"
        }
      },
      "required": ["city"]
    }
  }
]

Das Feld ack_messages liefert dem System während der Tool-Ausführung natürliche Antwortinhalte.

Nur für Forschungszwecke – Produktionsteams sollten vorsichtig sein

NVIDIA kennzeichnet VoiceChat 11B ausdrücklich als nur für Forschungszwecke.

Das Modell wurde mit einem Audio-Kontextfenster von höchstens etwa zwei Minuten trainiert; längere Gesprächskontexte können daher möglicherweise nicht zuverlässig beibehalten werden.

Bekannte Probleme umfassen Inferenzfehler, Halluzinationen, nachlassende Sprachqualität nach mehreren Gesprächsrunden, Wiederholungen, verstümmelten Text, abgebrochene Sprache, unkontrolliertes Weitersprechen, Selbstgespräche, Klärungsschleifen, fehlende Wörter in Transkriptionen, unzuverlässigen Sprachwechsel sowie schlechte Leistung in lauten oder stark hallenden Umgebungen.

Mögliche Anwendungsszenarien für VoiceChat 11B

Mögliche Forschungs- und Prototypenszenarien umfassen:

Contact Center

Agenten können natürlich zuhören, Unterbrechungen verarbeiten, Kundenservice-Tools aufrufen und während der API-Antwort Bestätigungsmeldungen verwenden.

Fahrzeugassistenten

Fahrer können den Assistenten unterbrechen, ohne das Ende einer vollständigen Sprachantwort abzuwarten. Die aktuelle Empfindlichkeit gegenüber Hintergrundgeräuschen bedeutet, dass ein Fahrzeugeinsatz zusätzliche Optimierungsarbeit erfordert.

Einzelhandel und Restaurantbestellungen

Sprachagenten können Bestellungen aufnehmen, auf Korrekturen reagieren und Waren- oder Inventarsysteme aufrufen.

Barrierefreiheit

Natürlichere Gesprächswechsel unterstützen freihändige Schnittstellen und sprachgesteuerte Anwendungen, doch Barrierefreiheitsbereitstellungen erfordern sorgfältige Benutzertests.

Unternehmenssprachagenten

Organisationen können mit internen Tools und selbst gehosteten Sprachinteraktionen experimentieren, während das Modell innerhalb der eigenen Infrastruktur bleibt.

Offenes Modell, aber mit zwei verschiedenen Lizenzen

Der Begriff „Open Source“ muss präziser verstanden werden.

Der von VoiceChat verwendete NeMo-Speech-Code ist unter der Apache-Lizenz 2.0 lizenziert.

Die Modellmaterialien von VoiceChat sind unter der OpenMDW 1.1-Lizenz lizenziert.

Daher ist es zutreffender, VoiceChat 11B als offenes Modell oder Modell mit offenen Gewichten zu beschreiben, anstatt anzunehmen, dass die Modelllizenz identisch mit der Apache-lizenzierten umgebenden Software ist.

Teams, die eine Weiterverbreitung oder kommerzielle Nutzung planen, sollten die OpenMDW-Lizenz direkt prüfen.

Was Entwickler vor der Produktion testen sollten

Ein sinnvoller Evaluierungsplan sollte abdecken:

  • Gesprächswechsel und Verarbeitung von Benutzerunterbrechungen

  • Satzmittige Pausen und Bestätigungssignale

  • Laute, hallende und Mehrsprachler-Audio

  • Fehlende oder fehlerhafte Tool-Parameter

Tool-Timeout und API-Aufruffehler

  • Lange Unterhaltungen
  • Unkontrollierte Sprachausgabe
  • Halluzinationen und Probleme mit der Denkqualität
  • Genehmigungspflicht für sensible Aktionen
  • Protokollierung, Ratenbegrenzung und Eskalation an menschliche Bearbeiter

Sprachagenten, die Tools aufrufen können, benötigen dieselben Berechtigungskontrollen wie andere autonome Agenten.

Häufige Fragen

Was ist NVIDIA NemotronLabs VoiceChat 11B?

NemotronLabs VoiceChat 11B ist ein von NVIDIA entwickeltes Echtzeit-Sprach-zu-Sprach-Modell (End-to-End) für duplexe Konversations-KI. Es kombiniert Streaming-Sprachanalyse, das Nemotron-Sprachmodell als Rückgrat, Sprachsynthese sowie einen separaten Kanal für Tool-Aufrufe.

Wie schnell ist VoiceChat 11B?

NVIDIA gibt für das Modell eine Serverlatenz von 448 ms bei flüssiger Turn-Taking-Konversation und etwa 480 ms Unterbrechungslatenz an, gemessen auf dem Full-Duplex-Bench 1.0.

Kann der Benutzer VoiceChat während des Sprechens unterbrechen?

Ja, während normaler Unterhaltungen werden Interjektionen und Unterbrechungen unterstützt. Allerdings gibt NVIDIA an, dass Benutzer den Agenten während der Ausführung von Tools derzeit nicht unterbrechen können.

Unterstützt VoiceChat 11B Funktionsaufrufe?

Ja. Das Modell kann über einen separaten Ausgabekanal Tool-Aufrufe ausgeben. Entwickler können Bestätigungsnachrichten definieren, die während der Ausführung externer Tools gesprochen werden.

Wie viel GPU-Speicher benötigt VoiceChat 11B?

Der Echtzeit-Container von NVIDIA erfordert eine GPU mit mindestens 80 GB Videospeicher. Die Fehlerbehebungsdokumentation gibt an, dass das geladene Modell etwa 66 GB belegt.

Gibt es eine gehostete API für VoiceChat 11B?

NVIDIA bietet derzeit Dokumentation für selbst-gehostete Offline-Inferenz und optimierte Echtzeit-Container an. Die Hugging-Face-Modellseite listet derzeit keine gehosteten Inferenzanbieter auf.

Kann VoiceChat Stimmen klonen?

Nein. Die veröffentlichten Checkpoints verwenden eine feste Stimme und unterstützen kein Stimmklonen.

Kann VoiceChat 11B in der Produktion eingesetzt werden?

NVIDIA kennzeichnet das Modell als forschungsnutzung. Entwickler sollten vor dem Produktionseinsatz seine Einschränkungen bei Kontextlänge, Reasoning, Tool-Nutzung, verrauschtem Audio, Wiederholungen, Transkription und unkontrollierter Sprache bewerten.

Zugehörige Tools

Zugehörige Links

Primärquelle, die Veröffentlichungsdatum, Benchmarks, Trainingsdaten, Architektur und den Status „nur für Forschung" abdeckt.

Zusammenfassung

NVIDIA NemotronLabs VoiceChat 11B vereint Sprachanalyse, Sprachmodellierung, Sprachsynthese, Unterbrechungsverarbeitung und Tool-Aufruffähigkeiten in einer einheitlichen vollduplexen Architektur. NVIDIA gibt eine Serverlatenz von nur 448 ms an und positioniert das Modell an der Spitze der derzeit offenen vollduplexen Sprachbenchmarks.

Das bemerkenswerteste technische Merkmal ist die Tool-Aufruffunktion. Ein separater Ausgabekanal kann externe Funktionen auslösen, während Bestätigungsnachrichten verhindern, dass die Unterhaltung während API-Aufrufen verstummt.

Diese Version ist noch kein vollständiger, produktionsreifer Dienst. Die Echtzeitbereitstellung erfordert mindestens 80 GB GPU-Videospeicher, aktuelle Checkpoints verwenden feste Stimmen, gehostete Inferenz ist noch nicht weit verbreitet verfügbar, und NVIDIA dokumentiert ausdrücklich erhebliche Einschränkungen bei längeren Sitzungen, Reasoning, verrauschtem Audio und der Tool-Ausführung.

VoiceChat 11B ist daher besser als offene Forschungsplattform für den Aufbau und die Untersuchung von Echtzeit-Sprachagenten mit niedriger Latenz zu betrachten, denn als ausgereifte Lösung, die in der Produktion Callcenter oder kommerzielle Sprach-APIs ersetzt.