Grok 4.6 pubblicato: prestazioni da agente pari a GPT-5.6 Sol, a costo inferiore

SpaceXAI ha rilasciato Grok 4.6 il 12 agosto 2026, posizionandolo come un modello all'avanguardia per la programmazione, attività agente di lunga durata e lavoro conoscitivo. Il modello è costruito direttamente su Grok 4.5, b

发布于 2026年8月13日generalGEO 评分: 02 次阅读
Questa immagine è un materiale promozionale relativo a Grok 4.6, il cui contenuto principale mostra il confronto tra Grok 4.6 e GPT-5.6 Sol, con l'indicazione in basso delle dimensioni del confronto, inclusi benchmark, prezzi, API e prestazioni da agente. Lo sfondo è nero profondo, con un anello barrato leggermente visibile a sinistra e un simbolo a spirale leggermente visibile a destra, nel complesso in linea con lo stile tecnologico minimalista legato agli sviluppatori di IA menzionato nel documento, progettato per presentare visivamente il tema del confronto tra i due grandi modelli.

Grok 4.6 Rilasciato: Prestazioni da Agente alla Pari con GPT-5.6 Sol, a Costo Inferiore

Introduzione

SpaceXAI ha rilasciato Grok 4.6 il 12 agosto 2026, posizionandolo come modello all'avanguardia per programmazione, attività da agente a lungo termine e lavoro knowledge.

Il modello si basa direttamente su Grok 4.5, ma con un focus più mirato e pragmatico: mantenere l'efficienza in sessioni di lavoro continuative più lunghe, utilizzare strumenti in più passaggi e generare prime bozze più solide per applicazioni interattive e visive.

Secondo SpaceXAI e Cursor, Grok 4.6 ora eguaglia GPT-5.6 Sol sull'indice di intelligenza Artificial Analysis, mostrando risultati particolarmente brillanti in valutazioni da agente nel mondo reale come GDPval-AA v2 e AA-Briefcase.

L'articolo originale di AIBase evidenzia inoltre il prezzo e la velocità di servizio di Grok 4.6. Il vantaggio di prezzo è ampiamente supportato dalla documentazione ufficiale. I dati sulla velocità richiedono invece un'interpretazione più attenta: AIBase riporta 80 TPS, mentre Artificial Analysis attualmente misura circa 68 token di output al secondo per l'API di prima parte di Grok 4.6. La velocità di runtime varia in base all'infrastruttura, alla lunghezza del prompt, all'intensità di ragionamento e al carico del fornitore.

Grok 4.6 Si Basa su Grok 4.5

Grok 4.6 rappresenta una generazione incrementale del modello, non un rilascio di una nuova architettura.

SpaceXAI afferma che il nuovo modello ha ricevuto un addestramento supplementare più esteso rispetto a Grok 4.5. La composizione del training include:

  • Dati di ragionamento generati dal modello, selezionati con cura
  • Concetti tecnici avanzati
  • Dati ingegneristici di alta qualità
  • Ottimizzatore e ricetta di addestramento migliorati
  • Fine-tuning supervisionato che copre diverse intensità di ragionamento e framework da agente
  • Apprendimento per rinforzo da agente orientato a programmazione, lavoro knowledge e ambienti tecnici specializzati

L'azienda dichiara inoltre che Grok 4.5 è stato utilizzato per rigenerare le tracce di fine-tuning supervisionato per attività STEM, ingegneria del software e lavoro knowledge, con filtri basati su modelli per rimuovere tracce problematiche.

Le Fondamenta di Grok 4.5

Grok 4.5 aveva già completato l'addestramento su scala estremamente ampia.

SpaceXAI ha dichiarato ufficialmente che l'addestramento di Grok 4.5 ha utilizzato decine di migliaia di GPU NVIDIA GB300. I suoi dati di addestramento coprono programmazione, scienza, ingegneria e matematica, mentre l'apprendimento per rinforzo si è concentrato principalmente su attività di ingegneria del software multi-step e altri lavori tecnici a lungo termine.

Grok 4.6 è un'estensione di questa base, non una sostituzione.

Il cambiamento più importante riguarda l'enfasi sul comportamento da agente continuativo: il modello non dovrebbe limitarsi a risolvere problemi di programmazione isolati, ma mantenere coerenza durante la ricerca, la modifica di file, l'uso di strumenti, il test del proprio lavoro e i cicli di feedback iterativi.

Focus dell'Addestramento: Attività da Agente a Lungo Termine

SpaceXAI afferma che Grok 4.6 è stato addestrato su un'ampia gamma di compiti da agente con apprendimento per rinforzo.

Questi ambienti includono:

  • Lavoro knowledge
  • Programmazione generale
  • Ottimizzazione del kernel
  • Sviluppo web
  • Progettazione assistita da computer
  • Altre attività tecniche specifiche di dominio

Questo aiuta a spiegare perché il modello eccelle particolarmente nelle valutazioni che coinvolgono lavoro esteso piuttosto che ragionamento a risposta breve.

Bozze Iniziali Migliori per Progetti Visivi e Interattivi

SpaceXAI e Cursor sottolineano inoltre

la capacità del modello di trasformare idee di prodotto ampie in bozze iniziali utilizzabili.

Nei test interni, Grok 4.6 è in grado di:

  1. Ricercare domini non familiari.
  2. Strutturare l'architettura dell'applicazione.
  3. Implementare le interazioni principali.
  4. Stabilire la direzione visiva.
  5. Testare alcune parti del proprio output.
  6. Affinare continuamente i risultati attraverso molteplici iterazioni.

Questo non significa che ogni applicazione generata in un'unica passata sia pronta per la produzione. Significa semplicemente che l'azienda ha riscontrato una qualità dell'output iniziale superiore rispetto a Grok 4.5, soprattutto quando l'attività richiede una combinazione di codice, design, interazione e uso iterativo degli strumenti.

Grok 4.6 Eguaglia GPT-5.6 Sol sull'Indice di Intelligenza Artificial Analysis

Artificial Analysis attualmente assegna a Grok 4.6 (versione alta) un punteggio di 61 sull'indice di intelligenza.

Questo corrisponde al punteggio totale di GPT-5.6 Sol (versione massima) nel confronto pubblicato da SpaceXAI.

L'indice è un risultato composito di nove benchmark, non un singolo test, quindi è più appropriato considerarlo come un segnale di confronto ampio piuttosto che come prova che i due modelli si comportino esattamente allo stesso modo su tutti i carichi di lavoro.

L'immagine mostra una tabella comparativa delle prestazioni di Grok 4.6 versione alta, Grok 4.5 versione alta, GPT-5.6 Sol Max e Fable 5 Max su diversi benchmark. Include voci come AA Intelligence Index, GDPVal-AA v2, CursorBench v3.2, DeepSWE v1.1, FrontierCode v1.1 Extended, APEX-Agents, Terminal-Bench v3.0, APEX-SWE, AA-Briefcase, Harvey LAB (Vals), con punteggi o percentuali per ciascuna versione. La tabella riflette i risultati dei benchmark menzionati nel testo, mostrando visivamente le prestazioni delle diverse versioni.

La tabella dei benchmark inclusa al momento del rilascio riporta i seguenti risultati:

Benchmark Grok 4.6 Versione Alta Grok 4.5 Versione Alta GPT-5.6 Sol Max Fable 5 Max
Indice di Intelligenza AA 61 56 61 62
GDPval-AA v2 1753 1526 1728 1741
CursorBench v3.2 69,9% 66,7% 67,2% 70,5%
DeepSWE v1.1 65,9% 54,0% 73,0% 70,0%
FrontierCode v1.1 Esteso 61,3% 56,6% 60,6% 63,6%
APEX-Agents 57,5% 47,1% 56,7% 59,2%
Terminal-Bench v3.0 26,0% 15,7% 34,6% 34,1%
APEX-SWE 56,4% 53,6% 58,8%
AA-Briefcase 1577 1313 1502 1574
Harvey LAB (Vals) 15,8% 12,9% 2,5% 11,3%

Le classifiche dei benchmark cambiano con gli aggiornamenti di modelli, framework di test e versioni di valutazione. La tabella sopra riflette i risultati al momento del rilascio e non costituisce una classifica permanente.

GDPval-AA v2: Solida Capacità di Lavoro Knowledge nel Mondo Reale

Su GDPval-AA v2, Grok 4.6 ha ottenuto un punteggio di 1753 Elo.

Artificial Analysis descrive GDPval-AA v2 come una valutazione del lavoro knowledge da agente nel mondo reale che copre diverse professioni specializzate.

Al momento dell'analisi del rilascio di Grok 4.6, Artificial Analysis ha dichiarato che questo punteggio è secondo solo alla serie Claude Opus 5, con intervalli di confidenza che si sovrappongono a quelli di altri modelli leader come Claude Fable 5 e Qwen3.8 Max.

Questo è più rigoroso rispetto ad affermare direttamente che Grok 4.6 sia chiaramente al secondo posto.

Le valutazioni basate su Elo comportano incertezza e punteggi ravvicinati possono sovrapporsi statisticamente.

AA-Briefcase: Lavoro da Agente a Ciclo Lungo

Grok 4.6 ha inoltre ottenuto 1577 Elo su AA-Briefcase.

del punteggio. Si tratta di un benchmark privato istituito da Artificial Analysis per il lavoro conoscitivo agenziale a ciclo lungo.

Ciò porta il suo punteggio a—

Nello snapshot pubblicato, le prestazioni di Grok 4.6 sono all'incirca equivalenti al livello di Fable 5, collocandosi dietro alla serie Claude Opus 5.

Anche la sua efficienza merita attenzione.

Artificial Analysis riferisce che Grok 4.6, nel completare i suoi task AA-Briefcase, ha utilizzato approssimativamente:

  • una media di 53 turni di conversazione
  • una media di 500 milioni di token in input

Al confronto, si riporta che Claude Opus 5 (versione massima) abbia utilizzato circa:

  • 103 turni di conversazione
  • 2 miliardi di token in input

Ciò non significa che Grok 4.6 sia più efficiente di Claude Opus 5 in ogni circostanza. È semplicemente un'osservazione relativa a uno specifico benchmark. Ciononostante, per agenti intelligenti a lunga esecuzione, un minor numero di turni e una minore quantità cumulativa di contesto possono ridurre significativamente i costi delle attività.

Prezzi di Grok 4.6: a partire da 2$ per l'input e 6$ per l'output

La tariffazione standard dell'API pubblica rimane uno dei punti di forza competitivi più importanti di Grok 4.6.

Per i prompt che restano al di sotto della soglia di prezzo per contesto lungo, la documentazione SpaceXAI indica quanto segue:

Tipo di token Prezzo per milione di token
Input 2,00 $
Input cache 0,50 $
Output 6,00 $

Artificial Analysis osserva che, nonostante il punteggio dell'indice di intelligenza sia salito da 56 a 61, questa tariffazione pubblica resta invariata rispetto a Grok 4.5.

Al confronto, al momento della stesura di questo articolo:

  • GPT-5.6 Sol ha una tariffazione API standard di 5$ per milione di token in input / 30$ in output.
  • Le tariffe pubbliche per token di Claude Opus 5 sono superiori a quelle di Grok 4.6.

Ciò rende Grok 4.6 particolarmente interessante per cicli agenziali ad alta produttività, poiché in questi scenari i token di output e il contesto ripetuto tendono a costituire la maggior parte dei costi complessivi.

Costi più elevati per i prompt lunghi

Le note di rilascio ufficiali SpaceXAI aggiungono un dettaglio importante che il breve articolo di AIBase non menziona.

Per i prompt che superano i 200.000 token, Grok 4.6 applica un livello di prezzo più alto:

Tipo di token Prezzo per milione di token per prompt oltre 200.000
Input 4,00 $
Input cache 1,00 $
Output 12,00 $

Pertanto, "2$ per l'input / 6$ per l'output" è un prezzo di partenza, non una tariffa universale applicabile a tutte le richieste.

Variante veloce

Cursor indica che la variante veloce ha un prezzo pari a due volte il prezzo standard.

Questo è separato dalle regole tariffarie per i prompt lunghi sopra menzionate. A seconda della piattaforma e del carico di lavoro, gli utenti dovrebbero verificare il livello di velocità e il livello di contesto applicabili prima di stimare i costi di produzione.

Che dire dei riportati 80 TPS di velocità?

L'articolo di AIBase afferma che Grok 4.6 può funzionare a 80 token al secondo.

Questa cifra va presa con cautela.

L'annuncio ufficiale di Grok 4.6 di SpaceXAI non pubblica una garanzia fissa di servizio a 80 TPS. Attualmente, Artificial Analysis misura, sui propri carichi di lavoro di benchmark, una velocità di output di circa 67,6 token di output al secondo per Grok 4.6 (alto) sull'API di prima parte.

Al confronto, la pagina di lancio ufficiale di Grok 4.5 di SpaceXAI afferma esplicitamente che Grok 4.5 viene servito a 80 TPS.

Pertanto, l'articolo di origine sintetico potrebbe aver ripreso la vecchia cifra di 80 TPS, oppure aver fatto riferimento a un diverso livello di servizio.

Il punto pratico è più semplice:

Grok 4.6 ha una velocità piuttosto buona per un modello di ragionamento all'avanguardia, ma non esiste un singolo numero TPS fisso applicabile a tutti i prompt, provider, livelli di ragionamento o livelli di velocità.

Contesto di 500.000 token sull'API SpaceXAI

La documentazione API SpaceXAI elenca la finestra di contesto di grok-4.6 come 500.000 token.

Il modello supporta:

  • Input testuali
  • Input

immagini

  • Output testuali
  • Intensità di ragionamento bassa, media, alta ed estremamente alta
  • Chiamate di funzione
  • Ricerca web
  • Ricerca X
  • Esecuzione di codice

La pagina ufficiale del modello elenca anche la data di scadenza delle conoscenze al 1° febbraio 2026.

Cursor utilizza un limite di contesto diverso

La documentazione del modello Grok 4.6 di Cursor elenca attualmente una finestra di contesto di 256.000 token all'interno di Cursor.

Ciò non contraddice le specifiche del modello di base. Significa che l'integrazione della piattaforma può esporre un limite di contesto inferiore rispetto all'API SpaceXAI di prima parte.

Quando si confrontano i limiti dei modelli, verificate sempre il provider e l'integrazione esatti in uso.

Come utilizzare Grok 4.6 tramite API

L'ID ufficiale del modello SpaceXAI è:

grok-4.6

Una richiesta minima all'API Responses si presenta così:

curl https://api.x.ai/v1/responses \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -d '{
    "model": "grok-4.6",
    "input": "Trova e correggi il bug, poi spiegamelo: function median(a){a.sort();return a[a.length/2]}"
  }'

Lo stesso modello è disponibile anche tramite gli SDK ufficiali xAI e i client API compatibili con OpenAI.

Esempio in Python

import os
from xai_sdk import Client
from xai_sdk.chat import user

client = Client(api_key=os.getenv("XAI_API_KEY"))

chat = client.chat.create(model="grok-4.6")
chat.append(
    user(
        "Trova e correggi il bug, poi spiegamelo: "
        "function median(a){a.sort();return a[a.length/2]}"
    )
)

response = chat.sample()
print(response.content)

Per i cicli agenziali a lunga esecuzione, SpaceXAI consiglia di utilizzare la cache dei prompt e la compressione del contesto, ove appropriato, per ridurre i costi legati al contesto ripetuto.

Grok 4.6 disponibile in Cursor e Grok Build

Al momento del lancio, Grok 4.6 è disponibile sulle seguenti piattaforme:

  • Cursor
  • Grok Build
  • API SpaceXAI
  • OpenRouter
  • Vercel
  • Cloudflare

SpaceXAI e Cursor offrono inoltre 2 volte l'utilizzo incluso per la prima settimana in Cursor e Grok Build.

Questa promozione di lancio è a tempo limitato e non deve essere considerata una tariffazione permanente.

Grok 4.6 in Cursor

Cursor presenta Grok 4.6 con quattro livelli di intensità di ragionamento:

  • xhigh
  • high
  • medium
  • low

high è l'intensità di ragionamento predefinita.

Nei piani Cursor idonei è disponibile anche il livello di velocità rapida.

All'interno di Cursor, il modello può utilizzare gli strumenti agenziali della piattaforma per:

  • Cercare file e cartelle
  • Leggere file
  • Modificare file
  • Eseguire comandi shell
  • Navigare sul web
  • Test di applicazioni basate su browser
  • Generazione di immagini
  • Acquisire le regole del progetto

Questo è uno dei motivi per cui il lancio di Grok 4.6 ha posto così tanta enfasi sui benchmark agenziali: il suo utilizzo previsto non si limita al completamento di chat isolate.

Grok 4.6 dà il meglio di sé quando le attività richiedono un lavoro continuativo

I modelli di benchmark indicano che il miglioramento più grande di Grok 4.6 non risiede solo nel ragionamento statico.

I suoi progressi sono più evidenti quando i compiti coinvolgono:

  1. Passaggi multipli
  2. Utilizzo di strumenti
  3. Ricerca
  4. Manipolazione di codice o documenti
  5. Auto-verifica
  6. Contesti lunghi
  7. Ottimizzazione iterativa

Questo lo rende particolarmente adatto per:

  • Agenti di codifica
  • Lavoro software a livello di repository
  • Agenti di ricerca
  • Flussi di lavoro con fogli di calcolo e documenti
  • Analisi tecnica
  • Prototipazione di applicazioni web

Compiti di lavoro basati sulla conoscenza di lunga durata.

Per prompt brevi e semplici, questo vantaggio potrebbe non essere evidente.

Cosa i benchmark possono e non possono dimostrare

I dati pubblicati supportano diverse conclusioni chiare:

  • In numerosi benchmark per agenti, Grok 4.6 è chiaramente più forte di Grok 4.5.
  • Nell'attuale confronto dell'Artificial Analysis Intelligence Index, è alla pari con GPT-5.6 Sol.
  • Ottiene risultati particolarmente buoni su GDPval-AA v2 e AA-Briefcase.
  • Il suo prezzo API standard pubblicizzato è notevolmente inferiore a quello di GPT-5.6 Sol.

Ma i dati non possono dimostrare che Grok 4.6 sia universalmente superiore a GPT-5.6 Sol o Claude in ogni singolo compito.

Ad esempio, la stessa tabella di lancio mostra GPT-5.6 Sol in vantaggio su DeepSWE v1.1 e Terminal-Bench v3.0, mentre Claude Fable 5 è in testa in molte altre valutazioni di programmazione e agenti.

Pertanto, la scelta del modello dovrebbe dipendere dal carico di lavoro effettivo, non da un unico punteggio composito.

Domande frequenti

Cos'è Grok 4.6?

Grok 4.6 è il modello all'avanguardia di SpaceXAI per la programmazione, i compiti degli agenti e il lavoro basato sulla conoscenza. Si basa su Grok 4.5 con addestramento aggiuntivo, focalizzato sul potenziamento degli agenti a lunga durata, una maggiore capacità di costruzione di app al primo tentativo e un lavoro multi-fase più persistente.

Grok 4.6 è migliore di GPT-5.6 Sol?

Dipende dal compito specifico. Nel confronto di lancio, Grok 4.6 è alla pari con GPT-5.6 Sol sull'Artificial Analysis Intelligence Index e guida in alcune valutazioni degli agenti, mentre GPT-5.6 Sol rimane più forte in alcuni benchmark di programmazione. I due modelli differiscono anche notevolmente per prezzo e lunghezza del contesto.

Quanto costa l'API di Grok 4.6?

Il prezzo standard è di $2 per milione di token di input, $0,50 per milione di token di input nella cache e $6 per milione di token di output. Per prompt superiori a 200.000 token, la documentazione di SpaceXAI prevede fasce di prezzo più elevate, rispettivamente $4/$1/$12 per milione per input, input nella cache e output.

Qual è la finestra di contesto di Grok 4.6?

L'API di prima parte di SpaceXAI supporta una finestra di contesto di 500.000 token. Cursor attualmente offre una finestra di contesto di 256.000 token per la propria integrazione di Grok 4.6, quindi il limite effettivo dipende dalla piattaforma.

Grok 4.6 supporta le immagini?

Sì. SpaceXAI elenca Grok 4.6 come supporto per input di testo e immagini e output di testo. Il modello supporta anche strumenti come chiamate di funzione, ricerca web, ricerca X ed esecuzione di codice, disponibili tramite l'API xAI.

Posso usare Grok 4.6 in Cursor?

Sì. Grok 4.6 è disponibile in Cursor e supporta livelli di ragionamento xhigh, high, medium e low. Cursor fornisce anche l'accesso al suo set di strumenti per agenti per operazioni sui file, comandi Shell, navigazione e altri flussi di lavoro di programmazione.

Grok 4.6 è open source?

No. Grok 4.6 è un modello proprietario; SpaceXAI non ha divulgato i suoi pesi del modello o il numero di parametri.

Quanto è veloce Grok 4.6?

AIBase segnala 80 token al secondo, ma le misurazioni attuali di Artificial Analysis mostrano che l'API di prima parte di Grok 4.6 è di circa 68 token di output al secondo sotto i loro carichi di lavoro di benchmark. La velocità varia in base all'intensità del ragionamento, alla dimensione del prompt, al carico dell'infrastruttura e al livello della piattaforma.

Strumenti correlati

  • Grok 4.6: Pagina di lancio ufficiale di SpaceXAI che copre addestramento, benchmark, sicurezza e disponibilità.
  • Console API SpaceXAI: Console ufficiale per creare chiavi API

e accedere ai modelli Grok.

  • Grok Build: L'ambiente di lavoro e codifica degli agenti di SpaceXAI, alimentato dai modelli Grok.
  • Cursor: Ambiente di codifica IA, che ha lanciato Grok 4.6 in concomitanza con SpaceXAI e rende disponibile il modello tramite i suoi flussi di lavoro per agenti.
  • Artificial Analysis: Benchmark indipendenti dei modelli per intelligenza, costi, velocità, contesto e prestazioni degli agenti.

Link correlati

Riepilogo

Grok 4.6 è un aggiornamento mirato di Grok 4.5, concentrato su agenti a lunga durata, codifica, lavoro basato sulla conoscenza e qualità di prima esecuzione su progetti interattivi. I suoi risultati di lancio lo collocano all'avanguardia delle attuali valutazioni dei modelli, raggiungendo un punteggio di 61 sull'Artificial Analysis Intelligence Index, alla pari con GPT-5.6 Sol nel confronto di lancio.

Il punto di forza principale di questo rilascio è la combinazione di prestazioni degli agenti e prezzo. Grok 4.6 parte da $2 per milione di token di input e $6 per milione di token di output, ottenendo allo stesso tempo punteggi elevati su GDPval-AA v2 e AA-Briefcase. Prompt lunghi e livelli rapidi possono comportare costi più elevati, quindi le stime per la produzione dovrebbero utilizzare la configurazione esatta del fornitore di servizi.

Il dato pubblicizzato di 80 TPS va considerato con cautela: le misurazioni indipendenti attuali si avvicinano a circa 68 token di output al secondo, e la velocità del servizio può variare nel tempo.

Grok 4.6

Il suo principale vantaggio non sta nell'aver vinto tutti i benchmark, ma nel fatto che ora offre prestazioni di agente di livello all'avanguardia a un prezzo estremamente competitivo.