DeepSeek V4 Pro contro Grok 4.6: il primo test nel mondo reale porta entrambi i modelli ai vertici
Il rilascio quasi simultaneo dei due modelli di intelligenza artificiale ha portato DeepSeek V4 Pro e Grok 4.6 direttamente sotto i riflettori. DeepSeek V4 Pro si distingue per le capacità di agente e

DeepSeek V4 Pro contro Grok 4.6: il primo test nel mondo reale porta entrambi i modelli ai vertici
Introduzione
Due modelli di intelligenza artificiale di alto profilo sono stati rilasciati quasi contemporaneamente, portando DeepSeek V4 Pro e Grok 4.6 direttamente sotto i riflettori.
DeepSeek V4 Pro compie un balzo in avanti significativo nelle prestazioni per agenti e ingegneria del software, mentre Grok 4.6 si dimostra forte nella programmazione, nel lavoro cognitivo e nelle capacità generali. L'articolo originale descrive questi due rilasci come una sfida diretta ai modelli di frontiera attuali di OpenAI e Anthropic.
Ciò che rende questo confronto particolarmente interessante è che entrambi i modelli non sono stati valutati soltanto sulle classifiche dei benchmark. I primi test nel mondo reale hanno richiesto loro di creare siti web, realizzare giochi, riprodurre design visivi e generare esperienze 3D utilizzando gli stessi prompt.
Il risultato non è tanto una semplice gara a vincitore unico, quanto piuttosto una sfida alla pari, in cui ciascun modello ha eccelso in ambiti specifici.
DeepSeek V4 Pro entra in scena, insieme a Grok 4.6
L'articolo originale evidenzia diversi risultati benchmark di DeepSeek V4 Pro.
Nella valutazione CyberGym per agenti di cybersicurezza, DeepSeek V4 Pro ha ottenuto un punteggio di 83,3, superando di poco Fable 5 con 83,1 e Opus 4.8 con 78,3.
Su AutomationBench, raggiunge 31,8, davanti a Fable 5 con 29,1 e Opus 4.8 con 27,2.
Il risultato più competitivo è su Terminal-Bench 2.1. DeepSeek V4 Pro ottiene 87,9, mentre Opus 4.8 registra 85,0 e Fable 5 arriva a 88,0.
L'articolo riporta inoltre un punteggio di 60,0 nell'impostazione di Humanity's Last Exam con strumenti abilitati, rispetto a 57,9 di Opus 4.8 e 63,0 di Fable 5.
DeepSWE rappresenta un altro miglioramento significativo menzionato nel rapporto. DeepSeek V4 Pro raggiunge 62,7, un balzo notevole rispetto al 12,8 della versione di anteprima, superiore agli 58,0 riportati da Opus 4.8, ma ancora al di sotto del 70,0 di Fable 5.
Grok 4.6 è stato invece testato in diversi ambiti a confronto con GPT-5.6 e Fable 5.
L'articolo riporta un punteggio dell'indice di intelligenza generale pari a 61, un punto dietro ai 62 di Fable 5.
Su CursorBench, Grok 4.6 avrebbe ottenuto 69,9%, davanti al 67,2% di GPT-5.6 e vicino al 70,5% di Fable 5.
Su FrontierCode, raggiunge 61,3%, superando leggermente anche qui il 60,6% di GPT-5.6, ma restando dietro al 63,6% di Fable 5.
L'articolo mostra risultati ancora più solidi per il lavoro cognitivo. Grok 4.6 risulta primo in tutte e tre le valutazioni chiave: 1.753 Elo su GDPval-AA v2, 1.577 Elo su AA-Briefcase e 15,8% sul benchmark legale specialistico Harvey LAB.
La conclusione principale che l'articolo trae da questi dati è chiara: entrambi i modelli sono ormai entrati nella conversazione dei sistemi di frontiera, competendo alla pari.
Anche la differenza di prezzo fa parte della storia
Le prestazioni sono solo metà del confronto.
L'articolo evidenzia anche i costi di inferenza. Riporta i prezzi per milione di token di output al momento del lancio:
| Modello | Prezzo per milione di token di output (dichiarato) |
|---|---|
| DeepSeek V4 Pro | $0,87 |
| Grok 4.6 | $6 |
| GPT-5.6 Sol | $30 |
| Claude Opus 5 | $25 |
| Fable 5 | $50 |
Nella visualizzazione prezzi in dollari, il costo per milione di token di input è di 0,435 dollari in caso di cache miss e di 0,003625 dollari in caso di cache hit.
La documentazione di DeepSeek indica inoltre che il modello V4 supporta una finestra di contesto di 1 milione di token, il tool calling e l'accesso API sia in formato OpenAI che in formato Anthropic.
I prezzi specifici degli altri modelli variano nel tempo, pertanto i confronti tra modelli presenti nell'articolo originale vanno considerati come una fotografia della data di rilascio, non come una tariffa valida a lungo termine.
Primo test reale: DeepSeek V4 Pro crea una Terra 3D
Il primo test pratico descritto nell'articolo pone a DeepSeek V4 Pro una richiesta piuttosto ambiziosa.
Con un solo prompt, il modello ha generato un'esperienza completa di Terra 3D interattiva all'interno del browser.
Secondo quanto riportato, il risultato supporta interazioni di base come trascinamento, rotazione e zoom, e include anche flussi di dati globali, rotte dinamiche e segnaposto geografici in tutto il mondo.
I dettagli visivi vanno ancora oltre. Dispersione atmosferica, nuvole, illuminazione giorno-notte e interfaccia circostante fanno parte dell'esperienza generata.
L'aspetto centrale di questo test non è solo che il modello ha generato una pagina web, ma che dimostra quanto possa spingersi un modello di programmazione AI quando gli viene chiesto di coordinare design visivo, rendering 3D, interazione e struttura applicativa in un unico compito.
DeepSeek V4 Pro contro Grok 4.6 in tre attività applicative
Successivamente, l'articolo originale confronta i due modelli utilizzando prompt identici o molto simili.
Il creatore AI Xiangyang Qiaomu ha eseguito prima tre piccoli task con DeepSeek V4 Pro, poi ha affidato due degli stessi prompt a Grok 4.6.
Costruire e distribuire un sito web con tre competenze
Il primo task richiedeva al modello di sviluppare e distribuire un sito web utilizzando tre competenze.
Secondo quanto riportato, DeepSeek V4 Pro ha completato con successo l'intero flusso di lavoro. L'articolo afferma che il design della pagina e la completezza complessiva si sono rivelati solidi.
Test di questo tipo sono particolarmente rilevanti per la programmazione agentica, poiché il modello deve coordinare più strumenti o capacità, non limitarsi a generare un blocco di codice.
Riprodurre 60 stili di design in card Bento
Il secondo task richiedeva al modello di riprodurre 60 diversi stili di design presentandoli come una serie di card Bento.
Secondo quanto riportato, DeepSeek V4 Pro ha distinto tipografia, palette di colori e layout tra i diversi design.
Quando lo stesso prompt è stato affidato a Grok 4.6, quest'ultimo ha preso il sopravvento. L'articolo afferma che alcune pagine di Grok risultavano più mature in termini di layout, colori e gerarchia visiva, con un risultato finale più rifinito.
Creare un gioco 3D Breakout
Il terzo task consisteva nel creare da zero un gioco 3D Breakout.
DeepSeek V4 Pro ha generato un gioco giocabile con ambiente 3D, musica di sottofondo, effetti sonori dinamici e feedback interattivo.
Grok 4.6 ha offerto una prestazione comparabile in questa tornata. L'articolo descrive i risultati come quasi alla pari in termini di qualità visiva, completezza della scena e giocabilità.
Il test Flappy Bird rivela un altro tipo di compromesso
Un test più sfumato arriva dallo sviluppatore Jun Song, che ha fornito a DeepSeek V4 Pro e Grok 4.6 lo stesso identico prompt, chiedendo di costruire da zero un gioco stile Flappy Bird.
I due modelli hanno adottato approcci radicalmente diversi.
DeepSeek V4 Pro ha utilizzato oltre 20.000 token, ma secondo quanto riportato il costo API è stato di 0 dollari, poiché la tariffazione API del modello (durante l'offerta a tempo limitato di DeepSeek) rendeva completamente gratuiti sia i token di input che quelli di output.
Grok 4.6 ha utilizzato circa 5.000 token, con un costo dichiarato di 0,03 dollari.
In questa particolare esecuzione, Grok è stato quindi più efficiente in termini di token, ma secondo l'articolo originale DeepSeek ha prodotto un risultato finale migliore.
La versione di DeepSeek includeva uno sfondo a montagne stratificate, nuvole, gradienti e tubi con effetto tridimensionale, oltre all'animazione di "+1" che fluttuava quando il personaggio passava attraverso i tubi.
La conclusione dell'articolo è preziosa: un consumo inferiore di token non significa automaticamente risultati applicativi migliori, così come un consumo maggiore non implica necessariamente costi più elevati.
Un altro test front-end premia anch'esso DeepSeek
Lo sviluppatore Hamza ha eseguito un altro test di generazione front-end, e l'articolo originale riporta che DeepSeek V4 Pro ha vinto nuovamente.
La pagina generata è stata descritta come superiore in termini di completezza complessiva e qualità visiva
Risultati di Grok 4.6.
Ciò ha rafforzato i modelli osservati in precedenza nei compiti: i due modelli sono molto vicini, ma i loro punti di forza variano a seconda dell'applicazione specifica e del prompt.
V4 Pro ha ancora punti deboli
DeepSeek V4 Pro non vince in ogni test di generazione visiva.
In un confronto che coinvolgeva un pellicano, la versione V4 Pro è risultata apparentemente più forte della versione Flash nella completezza visiva complessiva e ha generato un'illustrazione di elefante più accattivante, ma la direzione del movimento del pellicano era errata.
Questo è un piccolo esempio, ma evidenzia un limite comune dei sistemi di codifica generativa e visiva: i risultati possono sembrare raffinati ma contenere ancora errori semantici o di movimento di base.
Albero di ciliegio Three.js: il divario è più evidente
L'articolo originale ha poi alzato la difficoltà, chiedendo a DeepSeek V4 Pro, GPT-5.6 Sol e Claude Opus 5 di generare lo stesso albero di ciliegio usando Three.js.
Questa volta, le differenze sono state più marcate.
L'articolo ha riportato che DeepSeek V4 Pro era indietro rispetto agli altri due modelli nei dettagli di tronco e rami, fogliame, illuminazione, profondità di campo e atmosfera complessiva.
Questo risultato è importante perché impedisce che il confronto diventi una semplice narrazione di vittoria. DeepSeek V4 Pro può essere molto potente nei compiti di codifica end-to-end, ma esistono ancora scenari di generazione visiva specializzati in cui altri modelli all'avanguardia producono risultati più raffinati.
Nel complesso: DeepSeek V4 Pro e Grok 4.6 sono a livelli simili
Dopo diversi round di test, il giudizio complessivo dell'articolo originale è che DeepSeek V4 Pro e Grok 4.6 hanno raggiunto livelli competitivi simili.
Nessuno dei due modelli può vincere ogni compito.
DeepSeek V4 Pro sembra particolarmente forte in alcuni compiti di codifica end-to-end e costruzione di applicazioni, mentre Grok 4.6 potrebbe essere più efficiente in termini di token e mostrare vantaggi in alcuni confronti di progettazione visiva e lavoro di conoscenza.
Ciò rende questo confronto più utile di un semplice punteggio in classifica. Per gli sviluppatori, il modello migliore potrebbe dipendere dal fatto che la priorità sia la qualità della codifica, l'affidabilità dell'agente, la raffinatezza visiva, l'efficienza dei token o il costo API.
I due modelli AI stanno riducendo il divario con la frontiera
L'articolo originale descrive la pubblicazione simultanea di DeepSeek V4 Pro e Grok 4.6 come un momento insolito nel mercato dell'AI.
La reazione di Rick De Oliveira, citata nell'articolo,
Il punto centrale dell'articolo originale è che entrambi i modelli sono sia potenti che convenienti.
È questa combinazione che rende le loro uscite così rilevanti.
La documentazione ufficiale di DeepSeek conferma che V4 Pro è progettato per il tool calling, carichi di lavoro a contesto lungo e modalità di pensiero e non-pensiero.
I materiali ufficiali Grok di xAI posizionano allo stesso modo la loro ultima generazione Grok nella codifica, compiti agente e lavoro di conoscenza. Ad esempio, l'annuncio ufficiale di Grok 4.5 descrive il modello come costruito specificamente per codifica, compiti agente e lavoro di conoscenza, riportando risultati di valutazioni ingegneristiche reali.
Anche se i singoli dati dei benchmark possono variare, la tendenza più ampia è chiara: l'AI di livello frontiera sta diventando sempre più accessibile agli sviluppatori, e il rapporto qualità-prezzo sta diventando una parte sempre più importante della competizione tra modelli.
Cosa succederà dopo?
L'articolo originale conclude indicando la direzione del prossimo round di competizione.
Menziona che xAI ha già anticipato Grok 4.7, e ci si aspetta che OpenAI e Anthropic continueranno a rispondere con i rispettivi aggiornamenti dei modelli.
Ciò significa che i leader di oggi nei benchmark potrebbero non mantenere a lungo la loro posizione.
Per gli sviluppatori, la lezione più duratura è: valutare i modelli in base ai compiti che influenzano realmente il proprio flusso di lavoro. Un modello che ottiene punteggi alti nei benchmark ma che non funziona bene con il tuo codebase, il tuo processo di deployment, i tuoi requisiti UI o la tua toolchain, potrebbe comunque non essere la scelta giusta.
FAQ
Cos'è DeepSeek V4 Pro?
DeepSeek V4 Pro è il modello di punta della serie V4 di DeepSeek, progettato per ragionamento, codifica, uso di strumenti e carichi di lavoro a contesto lungo. La documentazione ufficiale di DeepSeek elenca una finestra di contesto di 1 milione di token con supporto al tool calling, offrendo accesso API sia in formato OpenAI che in formato Anthropic.
Come si confronta DeepSeek V4 Pro con Grok 4.6?
L'articolo originale riporta che i due modelli hanno performance simili in diversi test di agenti e codifica, con vittorie alternate. DeepSeek V4 Pro eccelle in particolare in diversi test di costruzione di applicazioni end-to-end, mentre Grok 4.6 mostra risultati forti in codifica, lavoro di conoscenza e alcune attività di progettazione visiva.
DeepSeek V4 Pro è più economico di Grok?
Secondo il confronto del 14 agosto 2026 nell'articolo originale, DeepSeek V4 Pro riporta un prezzo di output di 0,87 USD per milione di token, mentre Grok 4.6 costa 6 USD. La pagina di pricing ufficiale di DeepSeek attualmente conferma V4 Pro a 0,87 USD per milione di token di output, anche se i prezzi API possono variare.
DeepSeek V4 Pro può creare siti web e giochi?
L'articolo originale riporta test riusciti in cui DeepSeek V4 Pro ha generato un'esperienza 3D della Terra, siti web, una collezione di design in stile Bento, un gioco 3D di Breakout e un gioco in stile Flappy Bird. Questi sono risultati di test reali riportati, non una garanzia che ogni prompt produrrà qualità equivalente.
DeepSeek V4 Pro è adatto per agenti di codifica AI?
È progettato per il tool calling e i carichi di lavoro agente, e l'articolo originale riporta prestazioni forti in diverse valutazioni di agenti e ingegneria del software. Anche la documentazione ufficiale di DeepSeek elenca il supporto al tool calling per V4 Pro.
DeepSeek V4 Pro batte sempre altri modelli all'avanguardia?
No. L'articolo originale include test in cui GPT-5.6 Sol e Claude Opus 5 hanno ottenuto risultati migliori, in particolare nel confronto della generazione dell'albero di ciliegio Three.js. I risultati variano notevolmente a seconda del compito.
Oltre ai punteggi dei benchmark, cosa dovrebbero confrontare gli sviluppatori?
Gli sviluppatori dovrebbero anche confrontare costi API, latenza, lunghezza del contesto, tool calling, affidabilità della codifica, qualità dell'output e quanto bene il modello si adatta al flusso di lavoro agente esistente. Per i sistemi in produzione, coerenza e costo totale possono essere più importanti di piccole differenze nei benchmark.
Strumenti correlati
- DeepSeek API: endpoint API ufficiale per l'accesso ai modelli DeepSeek.
- Documentazione API DeepSeek: documentazione ufficiale su modelli, prezzi, tool calling e integrazione API.
- xAI API: risorse ufficiali per sviluppatori per creare con i modelli Grok.
- Grok: servizio Grok orientato all'utente di xAI per interagire con i loro modelli.
- Three.js: libreria JavaScript 3D correlata ai test di generazione Three.js descritti nell'articolo.
Link correlati
- Modelli e prezzi DeepSeek: specifiche ufficiali dei modelli API DeepSeek e prezzi correnti per token.
- Documentazione DeepSeek V4: documentazione API ufficiale DeepSeek e guida all'integrazione.
- Annuncio xAI Grok 4.5: annuncio ufficiale xAI che copre le capacità di codifica e agente dell'attuale generazione Grok.
- Documentazione API xAI: documentazione ufficiale per l'uso di Grok tramite la piattaforma sviluppatori xAI.
- Three.js: sito web ufficiale del progetto Three.js e documentazione.
- [DeepSeek API
GitHub: l'organizzazione GitHub ufficiale di DeepSeek.
Sintesi
DeepSeek V4 Pro e Grok 4.6 stanno spingendo contemporaneamente l'IA all'avanguardia da due direzioni: agenti del mondo reale più potenti e prestazioni di codifica, oltre a un rapporto prezzo-prestazioni più aggressivo.
I test preliminari non hanno prodotto un vincitore assoluto. DeepSeek V4 Pro ha mostrato prestazioni solide in diverse attività di costruzione di applicazioni end-to-end, mentre Grok 4.6 ha dimostrato capacità competitive in codifica, lavoro basato sulla conoscenza e progettazione visiva.
Il cambiamento più grande è che gli sviluppatori ora hanno a disposizione più modelli con capacità superiori, senza dover pagare automaticamente prezzi da livello all'avanguardia.