Grok Voice Think Fast 2.0: il modello di agente vocale più veloce e accurato di xAI

Grok Voice Think Fast 2.0: il modello di agente vocale più veloce e accurato di xAI Guida a Grok Voice Think Fast 2.0: benchmark, prezzi, precisione e migrazione Grok Voice Think Fast 2.0 di xAI migliora il ragionamento vocale, la precisione della trascrizione, le prestazioni dell'agente e la latenza. Consulta benchmark, prezzi, risultati Starlink e dettagli sulla migrazione del 5 agosto. Grok Voice Think Fast 2.0, agente vocale xAI, API Grok Voice, AI voce-a-voce, modello agente vocale, prezzi Grok Voice, benchmark vocale AI, trascrizione

发布于 2026年7月30日generalGEO 评分: 02 次阅读
Grok Voice Think Fast 2.0: il modello di agente vocale più veloce e accurato di xAI

Grok Voice Think Fast 2.0: il modello di agente vocale più veloce e preciso di xAI

Introduzione

xAI ha rilasciato Grok Voice Think Fast 2.0, il suo modello voce-a-voce di nuova generazione per sviluppare agenti vocali in tempo reale.

La nuova versione si concentra sui quattro aspetti più importanti per i sistemi vocali di livello produttivo: livello di intelligenza, precisione della trascrizione, comportamento dialogico e chiamate affidabili agli strumenti. xAI afferma che, nella maggior parte dei casi, le applicazioni esistenti possono migrare al nuovo modello senza riscrivere i prompt.

Think Fast 2.0 ha un prezzo di 0,08 dollari al minuto di audio. Gli sviluppatori possono utilizzare il nome del modello con versione grok-voice-think-fast-2.0, mentre l'alias grok-voice-latest passerà dalla versione 1.0 alla 2.0 il 5 agosto 2026.

Il modello è progettato per carichi di lavoro reali di agenti vocali, come assistenza clienti, vendite, automazione telefonica e flussi di lavoro aziendali multi-fase, dove l'agente deve comprendere il parlato, ragionare, chiamare strumenti e rispondere rapidamente per mantenere un dialogo naturale.

Grok Voice Think Fast 2.0 migliora in tutti i principali benchmark vocali

xAI ha pubblicato i risultati dei benchmark di Artificial Analysis, confrontando Think Fast 2.0 con il suo predecessore, GPT-Realtime-2.1 di OpenAI e Gemini 3.1 Flash di Google.

Immagine di uno screenshot di un tweet di SpaceX AI su Grok Voice Think Fast 2.0. Mostra che il modello è un modello vocale di nuova generazione con intelligenza, precisione di trascrizione e capacità dialogiche migliorate. La tabella confronta Grok Voice Think Fast 2.0, Think Fast 1.0, GPT-Realtime-2.1 (High) e Gemini 3.1 Flash (High) su diversi aspetti come indice di qualità vocale AA, ragionamento vocale, dinamiche dialogiche, prestazioni dell'agente e velocità. Grok Voice Think Fast 2.0 si distingue in molte metriche, con un indice di qualità vocale AA dell'82,9% e una velocità di 0,70 secondi. L'immagine corrisponde al confronto delle prestazioni di Grok Voice Think Fast 2.0 descritto nel documento.

I risultati riportati sono i seguenti:

Benchmark Grok Voice Think Fast 2.0 Think Fast 1.0 GPT-Realtime-2.1 High Gemini 3.1 Flash High
Indice qualità voce-a-voce AA 82,9% 75,7% 79,1% 69,5%
Big Bench Audio 97,2% 97,1% 96,0% 96,6%
Test Full-Duplex 95,1% 77,8% 95,7% 74,3%
Test τ-Voce 56,5% 52,1% 45,7% 37,7%
Tempo primo audio risposta 0,70 sec 1,25 sec 2,98 sec

Rispetto a Think Fast 1.0, l'indice complessivo di qualità voce-a-voce di Artificial Analysis è passato dal 75,7% all'82,9%.

I cambiamenti pratici più significativi riguardano le dinamiche dialogiche, le prestazioni dell'agente e la latenza di risposta.

Ragionamento vocale

Nel test Big Bench Audio, Think Fast 2.0 ha ottenuto 97,2%, leggermente superiore al 97,1% del modello precedente.

Ciò indica che questo rilascio non mira principalmente a un balzo in avanti nelle capacità brute di ragionamento vocale. Piuttosto, la maggior parte dei miglioramenti riguarda il comportamento del modello nelle conversazioni in tempo reale.

Dinamiche dialogiche

Think Fast 2.0 ha raggiunto 95,1% nel test Full-Duplex, contro il 77,8% di Think Fast 1.0.

Il test Full-Duplex valuta comportamenti come: tempismo nel prendere la parola, gestione delle pause, gestione delle interruzioni, riconoscimento dei segnali di feedback e mantenimento del naturale turno di parola.

GPT-Realtime-2.1 High ha ottenuto un punteggio leggermente superiore in questo singolo test, con il 95,7%, quindi il modello xAI non è leader in tutte le categorie.

Prestazioni dell'agente

Nel test τ-Voce, che valuta maggiormente la capacità dell'agente vocale di completare compiti reali, Think Fast 2.0 ha ottenuto 56,5%.

Questo risultato è superiore al 52,1% di Think Fast 1.0, al 45,7% di GPT-Realtime-2.1 High e al 37,7% di Gemini 3.1 Flash High.

Questa metrica è particolarmente importante per gli agenti di assistenza clienti e vendite, perché un buon audio dialogico da solo non basta. Il sistema deve anche seguire correttamente le istruzioni, utilizzare strumenti, raccogliere informazioni e completare i flussi di lavoro.

Tempo di risposta del primo audio più veloce

xAI riporta un tempo di risposta del primo audio di 0,70 secondi, inferiore a 1,25 secondi di Think Fast 1.0.

Una latenza più bassa riduce il silenzio imbarazzante tra il momento in cui l'utente finisce di parlare e l'inizio della risposta dell'IA.

Artificial Analysis attualmente elenca Think Fast 2.0 come uno dei sistemi voce-a-voce più rapidi tra quelli misurati, anche se non è il più veloce in assoluto nella classifica generale.

Miglioramento della precisione di trascrizione in 24 lingue

xAI ha anche testato Think Fast 2.0 utilizzando migliaia di brevi campioni vocali in 24 lingue.

Secondo l'azienda, nella sua valutazione, la precisione di trascrizione del nuovo modello è circa 1,5-2,0 volte superiore a quella di Deepgram Nova 3 e ElevenLabs Scribe v2, e circa 1,4 volte superiore a quella di Grok Voice Think Fast 1.0.

xAI

Indica inoltre che, in ambienti rumorosi e con compressione telefonica, il divario può ampliarsi fino a circa 10 volte.

Questi dati provengono dalle valutazioni di trascrizione di xAI, non da tabelle di benchmark per l'analisi dell'intelligenza artificiale. Questa distinzione è importante perché i benchmark e gli esperimenti di trascrizione misurano parametri diversi e provengono da impostazioni di valutazione differenti.

L'enfasi sull'audio disturbato è significativa per gli agenti vocali in produzione. Le chiamate reali spesso includono compressione della rete mobile, microfoni di scarsa qualità, rumori stradali o d'ufficio, accenti, parlato veloce, interruzioni, frasi incomplete, nomi, indirizzi e dettagli dell'account.

Modello che ragiona mentre parla

Una scelta progettuale piuttosto unica in Grok Voice Think Fast è il ragionamento parallelo.

xAI

Il modello può continuare a ragionare mentre parla, invece di completare tutto il ragionamento prima di generare l'audio. Questo design mira a ridurre il compromesso tra intelligenza e latenza.

Think Fast 2.0 utilizza anche meno token di ragionamento rispetto al predecessore. xAI riporta il seguente utilizzo relativo mediano di token di ragionamento:

Modello Token di ragionamento relativi per risposta
Grok Voice Think Fast 2.0 0,4×
Grok Voice Think Fast 1.0 1,0×

L'azienda afferma che questo velocizza le chiamate agli strumenti, consentendo tipicamente l'esecuzione dello strumento prima che l'assistente intelligente abbia finito di pronunciare la prima frase.

Ad esempio, un assistente di assistenza clienti potrebbe dire "Sto controllando per lei..." mentre contemporaneamente richiama in background lo strumento di interrogazione dell'account. Quando la presentazione vocale termina, il risultato dello strumento potrebbe già essere pronto per la parte successiva della risposta.

Apprendimento per rinforzo per dialoghi più concisi

xAI afferma che Think Fast 2.0, attraverso un vasto addestramento con apprendimento per rinforzo, lo rende più simile a un agente umano pratico nelle conversazioni reali.

Il modello è incoraggiato a usare frasi più brevi, fare una domanda alla volta, evitare riempitivi non necessari, mantenere il dialogo focalizzato e non esporre complessità inutili quando guida l'utente attraverso flussi complicati.

Potrebbe sembrare un piccolo cambiamento, ma le interfacce vocali tollerano molto meno le risposte lunghe rispetto alla chat testuale. Le risposte lunghe possono essere accettabili su schermo, ma ascoltarle durante una chiamata è frustrante.

L'uso degli strumenti è parte centrale dell'API vocale

L'attuale API voce-a-voce di xAI supporta direttamente diversi tipi di strumenti nelle sessioni vocali:

  • file_search
  • web_search
  • x_search
  • Strumenti MCP remoti
  • Funzioni personalizzate

Ciò consente agli assistenti vocali intelligenti di andare oltre le semplici domande e risposte.

In base alle autorizzazioni fornite dall'applicazione, l'assistente intelligente può comprendere la richiesta del chiamante, cercare documenti approvati, interrogare informazioni sull'account, chiamare API aziendali, eseguire operazioni consentite e spiegare i risultati vocalmente.

Per gli ambienti di produzione, le applicazioni devono ancora impostare limiti di autorizzazione rigorosi. Anche se il modello ha la capacità di chiamare strumenti sensibili, non dovrebbe ricevere direttamente l'accesso.

Starlink sta testando A/B Think Fast 2.0

Grok Voice è già utilizzato nei flussi di lavoro di vendita e assistenza clienti basati su telefono di Starlink.

xAI afferma di aver condotto test A/B di Think Fast 2.0 sulla linea telefonica Starlink al +1 888 GO STARLINK.

L'azienda riporta miglioramenti significativi nei tassi di conversione delle vendite e nella risoluzione dei problemi di assistenza clienti.

xAI non ha divulgato le percentuali di miglioramento specifiche del test A/B di Think Fast 2.0 nell'annuncio.

Ciò non va confuso con i dati pubblici precedenti relativi alla distribuzione originale di Think Fast 1.0. xAI all'epoca riportò un tasso di conversione delle vendite del 20% e un tasso di risoluzione autonoma dei problemi di assistenza del 70%. L'annuncio della versione 2.0 afferma solo che la nuova versione ha migliorato i risultati esistenti di Starlink.

Prezzi: 0,08 USD al minuto

La pagina dei prezzi ufficiale di xAI elenca:

Modello vocale Prezzo audio
grok-voice-think-fast-1.0 0,05 USD/minuto
grok-voice-think-fast-2.0 0,08 USD/minuto

Pertanto, il costo audio di Think Fast 2.0 è di 4,80 USD all'ora,

le tariffe API pubblicate.

L'input di testo per l'API voce-a-voce viene fatturato separatamente a 0,004 USD ciascuno.

Ulteriori strumenti lato server possono generare costi indipendenti. Ad esempio, xAI attualmente prezza la ricerca web, la ricerca X e l'esecuzione di codice a 5 USD ogni 1000 chiamate di strumento.

Pertanto, gli sviluppatori dovrebbero calcolare il costo totale basato sul flusso di lavoro completo, non solo moltiplicando la tariffa audio.

grok-voice-latest passerà alla versione 2.0 il 5 agosto 2026

Gli sviluppatori che già utilizzano l'API vocale Grok devono prestare attenzione agli alias dei modelli.

La documentazione corrente indica:

grok-voice-latest

punta a:

grok-voice-think-fast-1.0

fino al 5 agosto 2026.

Il 5 agosto 2026, questo alias passerà automaticamente a:

grok-voice-think-fast-2.0

Le applicazioni che utilizzano grok-voice-latest riceveranno l'aggiornamento senza alcuna modifica.

Tuttavia, i team che necessitano di un comportamento stabile dovrebbero fissare esplicitamente la versione.

Per rimanere sulla versione 1.0:

grok-voice-think-fast-1.0

Per adottare immediatamente il nuovo modello:

grok-voice-think-fast-2.0

Il fissaggio della versione è particolarmente importante per i sistemi di produzione con flussi di lavoro regolamentati, baseline di valutazione fisse o esigenze di gestione delle modifiche.

I prompt esistenti di solito non necessitano modifiche

xAI afferma che Think Fast 2.0 è progettato per migliorare la maggior parte delle applicazioni esistenti senza richiedere modifiche ai prompt.

Ciò rende la migrazione relativamente semplice, ma i team di produzione devono comunque eseguire test di regressione.

L'aggiornamento del modello vocale può influenzare la lunghezza delle risposte, i tempi, il cambio di turno, la frequenza delle chiamate agli strumenti, le domande di chiarimento, i meccanismi di escalation, la trascrizione, la pronuncia e la raccolta di dati strutturati.

Un flusso di migrazione ragionevole è:

  1. Fissare il modello 1.0 esistente.
  2. Eseguire gli stessi dialoghi di test sulla versione 2.0.
  3. Confrontare il tasso di successo delle attività e l'uso degli strumenti.
  4. Testare audio rumoroso e di qualità telefonica.
  5. Verificare la gestione delle interruzioni.
  6. Esaminare la latenza.
  7. Misurare il costo per attività completata.
  8. Migrare gradualmente il traffico di produzione.

Connessione vocale Grok minimale

Il rapporto originale di AIBase non includeva codice, ma la documentazione ufficiale di xAI fornisce un semplice esempio WebSocket per connettersi all'API voce-a-voce.

Selezionare il modello tramite URL WebSocket:

MODEL = "grok-voice-think-fast-2.0"
url = f"wss://api.x.ai/v1/realtime?model={MODEL}"

Successivamente, la sessione può definire voce, istruzioni e rilevamento del cambio di turno:

session_config = {
    "type": "session.update",
    "session": {
        "voice": "eve",
        "instructions": "Sei un assistente di supporto clienti conciso.",
        "turn_detection": {
            "type": "server_vad"
        }
    }
}

Per client browser o mobili, xAI consiglia di utilizzare token temporanei, invece di esporre chiavi API a lungo termine al client. Le applicazioni lato server possono autenticarsi tramite chiave API nell'intestazione di autorizzazione.

Formati audio supportati

L'API voce-a-voce attualmente supporta:

Formato Utilizzo tipico
PCM Audio generico di alta qualità
G.711 μ-law / audio/pcmu Audio telefonico
G.711 A-law / audio/pcma Sistemi telefonici
Opus Audio in tempo reale compresso

PCM supporta da 8

Diverse frequenze di campionamento, da kHz a 48 kHz.

Per le applicazioni vocali generiche, la documentazione ufficiale consiglia per impostazione predefinita l'uso del PCM a 24 kHz. Il supporto nativo del G.711 è utile per i sistemi telefonici, poiché riduce la necessità di transcodifica aggiuntiva in alcuni di essi.

Casi d'uso ideali per Think Fast 2.0

Questo rilascio è principalmente rivolto ai flussi di lavoro degli agenti in tempo reale, non alla semplice trascrizione offline.

Assistenza clienti

Il modello può ascoltare le domande dei clienti, cercare informazioni approvate, utilizzare strumenti di account e completare procedure di risoluzione dei problemi in più fasi.

Telemarketing

Gli agenti vocali possono rispondere a domande, identificare potenziali clienti, utilizzare strumenti di vendita e guidare i chiamanti attraverso il processo di acquisto.

Agenti per prenotazioni e appuntamenti

Il sistema può raccogliere informazioni su date, orari, nomi e preferenze mentre chiama le API di pianificazione.

Assistente aziendale interno

I dipendenti possono interagire con i sistemi aziendali tramite voce, mentre il modello richiama strumenti interni o cerca nella knowledge base approvata.

Servizio vocale multilingue

La piattaforma Grok Voice di xAI supporta oltre 25 lingue, rendendo il modello adatto per operazioni di supporto globali.

Cosa devono ancora testare gli sviluppatori

I dati di benchmark sono utili, ma non determinano se un modello è adatto a un'applicazione specifica.

Prima di implementare in produzione, testate: accenti dei chiamanti reali, codec telefonici, rumore di fondo, nomi di prodotti, nomi di clienti, indirizzi, numeri di conto lunghi, interruzioni, silenzi, cambi di idea dell'utente, malfunzionamenti degli strumenti, risultati errati degli strumenti, condizioni di trasferimento a un operatore umano e regole di sicurezza o conformità.

Il tempo di primo audio di 0,70 secondi ha valore solo se la risposta è corretta. Allo stesso modo, un punteggio elevato nei benchmark non garantisce che l'agente segua le politiche di rimborso specifiche dell'azienda o inserisca correttamente nomi di clienti insoliti.

Domande frequenti

Cos'è Grok Voice Think Fast 2.0?

Grok Voice Think Fast 2.0 è il nuovo modello voce-voce di xAI, progettato per agenti vocali in tempo reale. Integra interazione audio nativa, ragionamento, turnazione della conversazione, trascrizione e uso di strumenti.

Quanto costa Grok Voice Think Fast 2.0?

xAI ha fissato il prezzo di questo modello a 0,08 dollari al minuto audio, equivalenti a 4,80 dollari all'ora. Le chiamate agli strumenti e altre funzionalità API possono comportare costi aggiuntivi.

Think Fast 2.0 è più veloce di Think Fast 1.0?

Sì. Secondo i report di xAI e Artificial Analysis, il tempo di primo audio è sceso da 1,25 secondi a 0,70 secondi.

È superiore a GPT-Realtime-2.1?

Nell'indice di qualità complessiva voce-voce e nel benchmark τ-voice agent di Artificial Analysis, Think Fast 2.0 ha ottenuto punteggi più alti nei confronti pubblicati. GPT-Realtime-2.1 High mantiene ancora un leggero vantaggio nel benchmark full-duplex, quindi Think Fast 2.0 non è leader in tutti gli indicatori individuali.

Devo riscrivere i prompt per la versione 2.0?

xAI afferma che la maggior parte delle applicazioni otterrà miglioramenti delle prestazioni senza modificare i prompt. I team di produzione dovrebbero comunque eseguire test di regressione, poiché tempistiche, uso degli strumenti, modalità di turnazione e stile di risposta possono variare a seconda della versione del modello.

Quando grok-voice-latest passerà a Think Fast 2.0?

xAI ha dichiarato che questo alias passerà automaticamente il 5 agosto 2026.

Gli sviluppatori che devono continuare a utilizzare la versione 1.0 dovrebbero impostare manualmente grok-voice-think-fast-1.0.

Grok Voice Think Fast 2.0 può chiamare strumenti?

Sì. L'attuale API voce-voce supporta funzioni personalizzate, ricerca file, ricerca web, ricerca X e strumenti MCP remoti.

Think Fast 2.0 è solo per l'assistenza clienti?

No. Assistenza clienti e vendite sono scenari tipici, ma il modello può essere utilizzato anche per altri flussi di lavoro di agenti vocali in tempo reale, come servizi di prenotazione, assistenti aziendali e applicazioni interattive.

Strumenti correlati

  • Grok Voice Think Fast 2.0: Annuncio ufficiale di xAI per il nuovo modello vocale di punta.
  • Grok Voice API: Documentazione ufficiale dell'API voce-voce, che copre selezione del modello, formati audio, strumenti e impostazioni della sessione.
  • Grok Voice Agent Builder: Ambiente no-code di xAI per creare agenti vocali di livello produttivo.
  • Classifica voce-voce di Artificial Analysis: Confronto indipendente di benchmark che copre ragionamento vocale, dinamiche conversazionali, prestazioni dell'agente, velocità e prezzi.
  • Deepgram Nova: Piattaforma di riconoscimento vocale di riferimento nei confronti di trascrizione di xAI.
  • ElevenLabs: Piattaforma di intelligenza artificiale vocale, il cui modello Scribe è incluso nelle valutazioni di trascrizione di xAI.

Link correlati

Riepilogo

Grok Voice Think Fast 2.0 migliora lo stack tecnologico vocale in tempo reale di xAI negli aspetti più critici per gli agenti di livello produttivo: completamento dei compiti dell'agente, dinamiche conversazionali, accuratezza della trascrizione e latenza.

Il modello raggiunge un punteggio dell'82,9% nell'indice di qualità voce-voce di Artificial Analysis, un punteggio τ-voice del 56,5% e un tempo di prima risposta audio di 0,70 secondi. xAI riporta inoltre una migliore trascrizione in 24 lingue e una maggiore efficienza del ragionamento, consentendo l'esecuzione più precoce delle chiamate agli strumenti all'interno delle risposte vocali.

Gli sviluppatori possono ora utilizzare il modello al prezzo di 0,08 dollari al minuto audio. Gli utenti

esistenti devono inoltre notare che grok-voice-latest passerà automaticamente da Think Fast 1.0 a Think Fast 2.0 il 5 agosto 2026.

Questo aggiornamento non è semplicemente un modello vocale più intelligente, ma un agente più orientato alla produzione, in grado di ascoltare, ragionare, conversare e chiamare strumenti con una latenza inferiore.