Grok Voice Think Fast 2.0: xAIs schnelleres und genaueres Sprach-Agenten-Modell
Grok Voice Think Fast 2.0: xAIs schnelleres und genaueres Sprach-Agenten-Modell. Leitfaden zu Grok Voice Think Fast 2.0: Benchmarks, Preise, Genauigkeit und Migration. xAIs Grok Voice Think Fast 2.0 verbessert Sprachverarbeitung, Transkriptionsgenauigkeit, Agentenleistung und Latenz. Sehen Sie sich Benchmarks, Preise, Starlink-Ergebnisse und die Migration am 5. August an. Grok Voice Think Fast 2.0, xAI Sprach-Agent, Grok Voice API, Sprache-zu-Sprache KI, Sprach-Agent-Modell, Grok Voice Preise, KI-Sprachbenchmarks, Transkription

Grok Voice Think Fast 2.0: xAIs schnelleres und präziseres Sprach-Agenten-Modell
Einleitung
xAI hat Grok Voice Think Fast 2.0 veröffentlicht, das nächste Sprach-zu-Sprache-Modell für die Entwicklung von Echtzeit-Sprachagenten.
Die neue Version konzentriert sich auf die vier wichtigsten Aspekte produktionsreifer Sprachsysteme: Intelligenzniveau, Transkriptionsgenauigkeit, Dialogverhalten und zuverlässige Tool-Nutzung. xAI gibt an, dass bestehende Anwendungen in den meisten Fällen ohne Umschreiben der Prompts auf das neue Modell migrieren können.
Think Fast 2.0 kostet 0,08 US-Dollar pro Minute Audio. Entwickler können den versionierten Modellnamen grok-voice-think-fast-2.0 verwenden, während der Alias grok-voice-latest voraussichtlich am 5. August 2026 von Version 1.0 auf Version 2.0 umgestellt wird.
Das Modell ist für reale Sprachagenten-Workloads konzipiert, wie z. B. Kundensupport, Vertrieb, Telefonautomatisierung und mehrstufige Geschäftsabläufe – in Szenarien, in denen der Agent Sprache verstehen, logisch schlussfolgern, Tools einsetzen und schnell reagieren muss, um einen natürlichen Gesprächsfluss zu gewährleisten.
Grok Voice Think Fast 2.0 verbessert sich bei allen wichtigen Sprach-Benchmarks
xAI hat Benchmark-Ergebnisse von Artificial Analysis veröffentlicht, die Think Fast 2.0 mit seinem Vorgänger, OpenAIs GPT-Realtime-2.1 und Googles Gemini 3.1 Flash vergleichen.

Die gemeldeten Ergebnisse sind wie folgt:
| Benchmark | Grok Voice Think Fast 2.0 | Think Fast 1.0 | GPT-Realtime-2.1 High | Gemini 3.1 Flash High |
|---|---|---|---|---|
| AA Sprache-zu-Sprache Qualitätsindex | 82,9% | 75,7% | 79,1% | 69,5% |
| Big Bench Audio | 97,2% | 97,1% | 96,0% | 96,6% |
| Vollduplex-Test | 95,1% | 77,8% | 95,7% | 74,3% |
| τ-Sprachtest | 56,5% | 52,1% | 45,7% | 37,7% |
| Erste Audio-Antwortzeit | 0,70 Sek. | 1,25 Sek. | — | 2,98 Sek. |
Im Vergleich zu Think Fast 1.0 stieg der gesamte KI-Sprache-zu-Sprache-Qualitätsindex von 75,7 % auf 82,9 %.
Die deutlichsten praktischen Veränderungen zeigen sich in der Dialogdynamik, der Agentenleistung und der Reaktionslatenz.
Sprachlogik
Im Big Bench Audio Test erreichte Think Fast 2.0 97,2 % , nur knapp über den 97,1 % des Vorgängermodells.
Dies deutet darauf hin, dass diese Veröffentlichung nicht primär auf einen großen Sprung in der rohen Sprachlogik abzielt. Stattdessen liegen die meisten Verbesserungen im Verhalten des Modells in Echtzeitgesprächen.
Dialogdynamik
Think Fast 2.0 erreichte im Vollduplex-Test 95,1 % , verglichen mit 77,8 % bei Think Fast 1.0.
Der Vollduplex-Test bewertet Verhaltensweisen wie: Timing beim Sprechen, Umgang mit Pausen, Reaktion auf Unterbrechungen, Erkennen von Rückmeldungen und Aufrechterhalten eines natürlichen Sprecherwechsels.
GPT-Realtime-2.1 High erzielte in diesem Einzeltest mit 95,7 % eine etwas höhere Punktzahl, sodass das xAI-Modell nicht in allen Kategorien führend ist.
Agentenleistung
Im τ-Sprachtest, der stärker darauf abzielt, ob ein Sprachagent praktische Aufgaben erfüllen kann, erreichte Think Fast 2.0 56,5 % .
Dieser Wert liegt über den 52,1 % von Think Fast 1.0, den 45,7 % von GPT-Realtime-2.1 High und den 37,7 % von Gemini 3.1 Flash High.
Diese Kennzahl ist besonders wichtig für Kundendienst- und Vertriebsagenten, da ein gut klingendes Gespräch allein nicht ausreicht. Das System muss Anweisungen korrekt befolgen, Tools verwenden, Informationen sammeln und Arbeitsabläufe abschließen.
Schnellere erste Audio-Antwort
xAI gibt eine erste Audio-Antwortzeit von 0,70 Sekunden an, gegenüber 1,25 Sekunden bei Think Fast 1.0.
Eine geringere Latenz reduziert die unangenehme Stille zwischen dem Ende des Sprechens eines Benutzers und dem Beginn der KI-Antwort.
Artificial Analysis führt Think Fast 2.0 derzeit als eines der schnelleren gemessenen Sprache-zu-Sprache-Systeme, jedoch nicht als das schnellste Modell in der gesamten Rangliste.
Verbesserte Transkriptionsgenauigkeit in 24 Sprachen
xAI testete Think Fast 2.0 auch mit Tausenden von kurzen Sprachproben in 24 Sprachen.
Laut Unternehmen ist die Transkriptionsgenauigkeit des neuen Modells in seinen Evaluierungen etwa 1,5- bis 2,0-mal höher als die von Deepgram Nova 3 und ElevenLabs Scribe v2 und etwa 1,4-mal höher als die von Grok Voice Think Fast 1.0.
xAI
Zudem wird angegeben, dass der Unterschied in bestimmten lauten und telefonkomprimierten Umgebungen auf etwa das 10-Fache anwachsen kann.
Diese Daten stammen aus xAIs eigenen Transkriptionsauswertungen und nicht aus Benchmarktabellen für KI-Analysen. Diese Unterscheidung ist wichtig, da Benchmark-Vergleiche und Transkriptionsexperimente unterschiedliche Metriken messen und auf unterschiedlichen Bewertungseinstellungen basieren.
Die Betonung von verrauschtem Audio ist für Sprachagenten in der Produktion von großer Bedeutung. Echte Telefonate enthalten oft Mobilfunknetzkompression, minderwertige Mikrofone, Straßen- oder Bürolärm, Akzente, schnelles Sprechen, Unterbrechungen, unvollständige Sätze, Namen, Adressen und Kontodetails.
Das Modell denkt während des Sprechens
Eine eher ungewöhnliche Designentscheidung bei Grok Voice Think Fast ist das parallele Denken.
xAI
Das Modell kann während des Sprechens weiterdenken, anstatt das gesamte Denken vor der Generierung des Audios abzuschließen. Dieses Design zielt darauf ab, den Zielkonflikt zwischen Intelligenz und Latenz zu verringern.
Think Fast 2.0 verwendet zudem weniger Denk-Token als sein Vorgänger. xAI berichtet über den folgenden relativen Medianverbrauch an Denk-Token:
| Modell | Relative Denk-Token pro Antwort |
|---|---|
| Grok Voice Think Fast 2.0 | 0,4× |
| Grok Voice Think Fast 1.0 | 1,0× |
Das Unternehmen gibt an, dass dies die Geschwindigkeit von Tool-Aufrufen erhöht und es typischerweise ermöglicht, dass Tools bereits ausgeführt werden, bevor der intelligente Assistent seinen ersten Satz beendet hat.
Ein Kundendienst-Assistent könnte beispielsweise gerade sagen: „Ich sehe mir das für Sie an ...“ und gleichzeitig im Hintergrund ein Kontoabfrage-Tool aufrufen. Wenn die verbale Einleitung endet, könnten die Tool-Ergebnisse bereits für den nächsten Teil der Antwort bereitstehen.
Verstärkungslernen macht Dialoge prägnanter
xAI gibt an, dass Think Fast 2.0 durch umfangreiches Verstärkungslernen trainiert wurde, um sich in echten Gesprächen更像一个实用的真人客服。
Das Modell wird dazu ermutigt, kürzere Sätze zu verwenden, jeweils nur eine Frage zu stellen, unnötige Füllwörter zu vermeiden, den Dialog fokussiert zu halten und beim Führen des Benutzers durch komplexe Abläufe keine unnötige Komplexität preiszugeben.
Das mag sich nach kleinen Änderungen anhören, aber Sprachschnittstellen tolerieren lange Antworten weit weniger als Text-Chats. Lange Antworten mögen auf dem Bildschirm akzeptabel sein, sind jedoch beim Zuhören in einem Telefonat frustrierend.
Tool-Nutzung ist ein Kernbestandteil der Sprach-API
Die aktuelle Speech-to-Speech-API von xAI unterstützt direkt mehrere Tool-Typen in Sprachsitzungen:
file_searchweb_searchx_search- Remote-MCP-Tools
- Benutzerdefinierte Funktionen
Dies ermöglicht es intelligenten Sprachassistenten, über einfache Frage-Antwort-Dialoge hinauszugehen.
Abhängig von den von der Anwendung gewährten Berechtigungen kann der Assistent die Anfragen des Anrufers verstehen, genehmigte Dokumente durchsuchen, Kontoinformationen abfragen, Geschäfts-APIs aufrufen, erlaubte Aktionen ausführen und die Ergebnisse per Sprache erläutern.
Für Produktionsumgebungen müssen Anwendungen weiterhin strenge Berechtigungsgrenzen setzen. Auch wenn das Modell die Fähigkeit besitzt, sensible Tools aufzurufen, sollte ihm der Zugriff nicht direkt gewährt werden.
Starlink testet Think Fast 2.0 im A/B-Test
Grok Voice wird bereits in den telefonbasierten Vertriebs- und Kundendienst-Workflows von Starlink eingesetzt.
xAI gibt an, dass Think Fast 2.0 auf der Starlink-Telefonleitung unter +1 888 GO STARLINK einem A/B-Test unterzogen wurde.
Das Unternehmen berichtet von signifikanten Verbesserungen bei der Verkaufskonversionsrate und der Lösungsrate von Kundendienstanfragen.
xAI hat in der Ankündigung keine konkreten prozentualen Verbesserungen des A/B-Tests für Think Fast 2.0 bekannt gegeben.
Dies sollte nicht mit früheren öffentlichen Daten zum ursprünglichen Think Fast 1.0- Deployment verwechselt werden. xAI berichtete damals von einer Verkaufskonversionsrate von 20 % und einer autonomen Kundendienstlösungsrate von 70 %. Die Ankündigung für Version 2.0 besagte lediglich, dass die neue Version die bestehenden Ergebnisse von Starlink verbessert.
Preisgestaltung: 0,08 USD pro Minute
Die offizielle Preisübersichtsseite von xAI listet:
| Sprachmodell | Audiopreis |
|---|---|
grok-voice-think-fast-1.0 |
0,05 USD/Minute |
grok-voice-think-fast-2.0 |
0,08 USD/Minute |
Daher betragen die Audiokosten für Think Fast 2.0 4,80 USD pro Stunde,
die veröffentlichten API-Tarife.
Der Texteingang der Speech-to-Speech-API wird separat mit 0,004 USD abgerechnet.
Zusätzliche serverseitige Tools können ebenfalls unabhängige Kosten verursachen. Beispielsweise bepreist xAI derzeit Websuche, X-Suche und Codeausführung mit 5 USD pro 1000 Tool-Aufrufen.
Entwickler sollten daher die Gesamtkosten auf Basis des vollständigen Workflows berechnen, anstatt einfach die Audiotarife zu multiplizieren.
grok-voice-latest wechselt am 5. August 2026 auf Version 2.0
Entwickler, die die Grok Voice API bereits nutzen, sollten den Modell-Alias beachten.
Die aktuelle Dokumentation gibt an:
grok-voice-latest
verweist auf:
grok-voice-think-fast-1.0
bis zum 5. August 2026.
Am 5. August 2026 wird dieser Alias automatisch umgestellt auf:
grok-voice-think-fast-2.0
Anwendungen, die grok-voice-latest verwenden, benötigen für das Upgrade keine Änderungen.
Teams, die ein stabileres Verhalten benötigen, sollten jedoch die Version explizit festlegen.
Um bei Version 1.0 zu bleiben:
grok-voice-think-fast-1.0
Um das neue Modell sofort zu übernehmen:
grok-voice-think-fast-2.0
Die Versionierung ist besonders wichtig für Produktionssysteme mit regulierten Workflows, festgelegten Evaluierungs-Benchmarks oder Anforderungen an das Änderungsmanagement.
Vorhandene Prompts müssen in der Regel nicht geändert werden
xAI gibt an, dass Think Fast 2.0 darauf ausgelegt ist, die meisten bestehenden Anwendungen ohne Prompt-Änderungen zu verbessern.
Dies macht die Migration relativ einfach, dennoch sollten Produktionsteams Regressionstests durchführen.
Ein Sprachmodell-Upgrade kann die Antwortlänge, das Timing, die Redewechselfolge, die Häufigkeit von Tool-Aufrufen, Nachfragen, Eskalationsmechanismen, Transkription, Aussprache und strukturierte Datenerfassung beeinflussen.
Ein sinnvoller Migrationsablauf ist:
- Das bestehende 1.0-Modell festlegen.
- Dieselben Testdialoge mit 2.0 ausführen.
- Die Erfolgsraten bei Aufgaben und die Tool-Nutzung vergleichen.
- Audio mit Rauschen und Telefonqualität testen.
- Die Unterbrechungsverarbeitung prüfen.
- Die Latenz überprüfen.
- Die Kosten pro abgeschlossener Aufgabe messen.
- Den Produktionsdatenverkehr schrittweise migrieren.
Minimale Grok Voice-Verbindung
Der ursprüngliche AIBase-Bericht enthielt keinen Code, aber die offizielle xAI-Dokumentation bietet ein einfaches WebSocket-Beispiel für die Verbindung zur Speech-to-Speech-API.
Auswahl des Modells über die WebSocket-URL:
MODEL = "grok-voice-think-fast-2.0"
url = f"wss://api.x.ai/v1/realtime?model={MODEL}"
Anschließend kann die Sitzung Stimme, Anweisungen und Redewechselerkennung definieren:
session_config = {
"type": "session.update",
"session": {
"voice": "eve",
"instructions": "Sie sind ein präziser Kundendienstmitarbeiter.",
"turn_detection": {
"type": "server_vad"
}
}
}
Für Browser- oder mobile Clients empfiehlt xAI die Verwendung temporärer Tokens, anstatt langlebige API-Schlüssel gegenüber dem Client offenzulegen. Server-seitige Anwendungen können sich über einen API-Schlüssel im Authorization-Header authentifizieren.
Unterstützte Audioformate
Die Speech-to-Speech-API unterstützt derzeit:
| Format | Typische Verwendung |
|---|---|
| PCM | Allgemeines hochwertiges Audio |
G.711 μ-law / audio/pcmu |
Telefon-Audio |
G.711 A-law / audio/pcma |
Telefonsysteme |
| Opus | Komprimiertes Echtzeit-Audio |
PCM-Unterstützung ab 8
Mehrere Abtastraten von kHz bis 48 kHz.
Für allgemeine Sprachdienste empfiehlt die offizielle Dokumentation standardmäßig PCM mit 24 kHz. Native G.711-Unterstützung ist für Telefonsysteme nützlich, da sie zusätzliche Transkodierung in manchen Telefonsystemen reduziert.
Die besten Anwendungsszenarien für Think Fast 2.0
Diese Veröffentlichung zielt hauptsächlich auf Echtzeit-Agenten-Workflows ab, nicht auf einfache Offline-Transkription.
Kunden-Support
Das Modell kann Kundenfragen anhören, genehmigte Informationen durchsuchen, Kontotools verwenden und mehrstufige Fehlerbehebungen durchführen.
Telefonverkauf
Sprachagenten können Fragen beantworten, potenzielle Kunden identifizieren, Verkaufstools verwenden und Anrufer durch den Kaufprozess führen.
Termin- und Buchungsagenten
Das System kann Kalenderdaten, Uhrzeiten, Namen und Präferenzen sammeln, während es gleichzeitig Buchungs-APIs aufruft.
Interne Unternehmensassistenten
Mitarbeiter können per Sprache mit Unternehmenssystemen interagieren, während das Modell interne Tools oder genehmigte Wissensdatenbanken durchsucht.
Mehrsprachige Sprachdienste
Die Grok-Voice-Plattform von xAI unterstützt über 25 Sprachen und macht das Modell für globale Supportdienste geeignet.
Was Entwickler selbst testen müssen
Benchmark-Daten sind nützlich, können aber nicht beurteilen, ob das Modell für eine bestimmte Anwendung geeignet ist.
Testen Sie vor der Produktionsbereitstellung die Akzente tatsächlicher Anrufer, Telefon-Codecs, Hintergrundgeräusche, Produktnamen, Kundennamen, Adressen, lange Kontonummern, Unterbrechungen, Stille, Meinungsänderungen von Benutzern, Tool-Fehler, falsche Tool-Ergebnisse, Bedingungen für menschliche Weiterleitung sowie Sicherheits- oder Compliance-Regeln.
Nur wenn die Antwort korrekt ist, ist eine First-Audio-Time von 0,70 Sekunden wertvoll. Ebenso garantiert eine hohe Benchmark-Punktzahl nicht, dass der Agent unternehmensspezifische Rückgaberichtlinien befolgt oder ungewöhnliche Kundennamen korrekt eingibt.
Häufig gestellte Fragen
Was ist Grok Voice Think Fast 2.0?
Grok Voice Think Fast 2.0 ist das neue Sprach-zu-Sprach-Modell von xAI, das für Echtzeit-Sprachagenten entwickelt wurde. Es vereint native Audio-Interaktion, Reasoning, Gesprächswechsel, Transkription und Tool-Nutzung.
Wie viel kostet Grok Voice Think Fast 2.0?
xAI hat dieses Modell auf 0,08 USD pro Audiominute bepreist, was 4,80 USD pro Stunde entspricht. Tool-Aufrufe und einige andere API-Funktionen können zusätzliche Kosten verursachen.
Ist Think Fast 2.0 schneller als Think Fast 1.0?
Ja. xAI und Artificial Analysis berichten, dass die First-Audio-Time von 1,25 Sekunden auf 0,70 Sekunden gesunken ist.
Ist es besser als GPT-Realtime-2.1?
Im Artificial Analysis Speech-to-Speech Quality Index und im τ-Voice-Agent-Benchmark erzielt Think Fast 2.0 in den veröffentlichten Vergleichen höhere Werte. GPT-Realtime-2.1 High hat im Full-Duplex-Benchmark noch einen leichten Vorteil, daher liegt Think Fast 2.0 nicht in allen Einzelkategorien vorn.
Muss ich meine Prompts für Version 2.0 umschreiben?
xAI gibt an, dass die meisten Anwendungen ohne Prompt-Änderungen eine Leistungssteigerung erfahren. Produktionsteams sollten dennoch Regressionstests durchführen, da Timing, Tool-Nutzung, Wechselverhalten und Antwortstil je nach Modellversion variieren können.
Wann wechselt grok-voice-latest zu Think Fast 2.0?
xAI gibt an, dass dieser Alias am 5. August 2026 automatisch umgestellt wird.
Entwickler, die weiterhin Version 1.0 verwenden möchten, sollten grok-voice-think-fast-1.0 fixieren.
Kann Grok Voice Think Fast 2.0 Tools aufrufen?
Ja. Die aktuelle Speech-to-Speech-API unterstützt benutzerdefinierte Funktionen, Dateisuche, Websuche, X-Suche sowie Remote-MCP-Tools.
Ist Think Fast 2.0 nur für den Kundensupport?
Nein. Kundensupport und Vertrieb sind typische Anwendungsszenarien, aber das Modell kann auch für andere Echtzeit-Sprachagenten-Workflows genutzt werden, z. B. Buchungsdienste, Unternehmensassistenten und interaktive Anwendungen.
Verwandte Tools
- Grok Voice Think Fast 2.0: Offizielle Ankündigung von xAI zum neuen Flaggschiff-Sprachmodell.
- Grok Voice API: Offizielle Speech-to-Speech-API-Dokumentation zu Modellauswahl, Audioformaten, Tools und Sitzungseinstellungen.
- Grok Voice Agent Builder: Codefreie Umgebung von xAI zum Erstellen von Produktions-Sprachagenten.
- Artificial Analysis Speech-to-Speech Leaderboard: Unabhängiger Benchmark-Vergleich zu Sprach-Reasoning, Gesprächsdynamik, Agentenleistung, Geschwindigkeit und Preisen.
- Deepgram Nova: Spracherkennungsplattform, die im xAI-Transkriptionsvergleich referenziert wird.
- ElevenLabs: Sprach-KI-Plattform, deren Scribe-Modell in xAIs Transkriptionsbewertung enthalten ist.
Verwandte Links
- Introducing Grok Voice Think Fast 2.0: Offizielle Veröffentlichungsankündigung mit Benchmarks, Transkriptionsergebnissen, Reasoning-Effizienz, Starlink-Tests, Migration und Preisen.
- Speech-to-Speech API-Dokumentation: Offizielle Implementierungsanleitung für Echtzeit-Grok-Voice-Anwendungen.
- xAI API-Preise: Aktuelle Preise für Sprache, Speech-to-Text, Text-to-Speech und Tools.
- Artificial Analysis Speech-to-Speech-Modelle: Unabhängige Benchmark-Daten, die im xAI-Veröffentlichungsvergleich verwendet werden.
- Grok Voice Think Fast 1.0: Vorherige Modellgeneration mit Starlink-Produktionsergebnissen.
- Grok Voice Agent Builder: Offizielle Informationen zu Telefonie, Tools, Schutzmaßnahmen, Beobachtbarkeit, SIP-Unterstützung und Agentenkonfiguration.
- Grok Speech-to-Text- und Text-to-Speech-APIs: Offizielle Details zu den eigenständigen Audio-APIs von xAI.
Zusammenfassung
Grok Voice Think Fast 2.0 verbessert den Echtzeit-Sprach-Stack von xAI in den für Produktionsagenten kritischsten Bereichen: Aufgabenerfüllung, Gesprächsdynamik, Transkriptionsgenauigkeit und Latenz.
Das Modell erreicht im Artificial Analysis Speech-to-Speech-Qualitätsindex 82,9 %, eine τ-Voice-Punktzahl von 56,5 % und eine erste Audioantwortzeit von 0,70 Sekunden. xAI berichtet zudem von besserer Transkription in 24 Sprachen und höherer Reasoning-Effizienz, die eine frühere Ausführung von Tool-Aufrufen in Sprachantworten ermöglicht.
Entwickler können das Modell ab sofort zum Preis von 0,08 USD pro Audiominute nutzen. Bestehende Benutzer sollten beachten, dass grok-voice-latest am 5. August 2026 automatisch von Think Fast 1.0 auf Think Fast 2.0 umgestellt wird.
Dieses Upgrade ist nicht nur ein intelligenteres Sprachmodell, sondern ein produktionsorientierterer Agent, der mit geringerer Latenz hören, denken, sprechen und Tools aufrufen kann.