DeepSeek V4 Pro si classifica seconda nel benchmark di programmazione terminale SuperCLUE, con costi pari a una frazione di quelli di Kimi K3
DeepSeek-V4-Pro-0813 si è classificata seconda nell'ultimo benchmark SuperCLUE-Terminal di programmazione per terminali intelligenti in cinese, con un punteggio di 51,52 punti, seconda solo a Kimi K3.

DeepSeek V4 Pro conquista il secondo posto nel benchmark di programmazione terminale SuperCLUE con una frazione del costo di Kimi K3
Introduzione
DeepSeek-V4-Pro-0813 ha conquistato il secondo posto nel più recente benchmark SuperCLUE-Terminal per agenti intelligenti di programmazione terminale in cinese, con un punteggio di 51,52 punti. Si posiziona solo dietro a Kimi K3, che guida la classifica con 60,61 punti.
Ciò che rende questo risultato particolarmente degno di nota è il suo vantaggio in termini di costi. Nell'esecuzione del benchmark, DeepSeek-V4-Pro-0813 è costato in media circa 1,42 RMB per attività, dimostrando un forte rapporto qualità-prezzo tra i modelli ad alte prestazioni.
SuperCLUE-Terminal è progettato attorno a compiti di programmazione reali per sviluppatori cinesi. I modelli vengono valutati tramite un framework agente generico basato su Claude Code, consentendo al benchmark di confrontare le prestazioni dei modelli nella comprensione di requisiti in cinese, pianificazione di attività multi-step, uso di strumenti, debugging e modifica del codice attraverso flussi di lavoro end-to-end.

DeepSeek V4 Pro si classifica secondo nella più recente valutazione di programmazione
Il benchmark è progettato per riflettere il lavoro di sviluppo reale, non brevi problemi di programmazione isolati. Secondo i risultati pubblicati, una singola attività può richiedere circa da 50 a 110 turni di interazione, mentre un'esecuzione completa di un'attività può richiedere circa da 30 a 90 minuti.
Nella classifica attuale, Kimi K3 mantiene il primo posto con 60,61 punti. DeepSeek-V4-Pro-0813 segue al secondo posto con 51,52 punti, davanti a GLM-5.2 con 48,48 punti e alla versione precedente DeepSeek-V4-Flash-0731 con 46,46 punti.
| Modello | Punteggio SuperCLUE-Terminal | Costo medio per attività riportato |
|---|---|---|
| Kimi K3 (max) | 60,61 | 19,63 RMB |
| DeepSeek-V4-Pro-0813 (max) | 51,52 | 1,42 RMB |
| GLM-5.2 (max) | 48,48 | 23,30 RMB |
| DeepSeek-V4-Flash-0731 (max) | 46,46 | 0,64 RMB |
I dati sopra riportati provengono dall'ambiente di benchmark SuperCLUE-Terminal e devono essere intesi come costi di esecuzione del benchmark, non come prezzi fissi per singola attività stabiliti dai fornitori di modelli.
DeepSeek ha inoltre confermato separatamente che il modello API di produzione deepseek-v4-pro ora punta a DeepSeek-V4-Pro-0813. Il modello è disponibile tramite l'app web DeepSeek, l'app mobile e l'API.
Solo 1,42 RMB per attività: un vantaggio di costo eccezionale
La parte più sorprendente del risultato è il costo riportato per DeepSeek-V4-Pro-0813.
Nel benchmark, il suo costo medio è di circa 1,42 RMB/attività, pari a circa un quattordicesimo di quello di Kimi K3 (19,63 RMB) e circa un sedicesimo di quello di GLM-5.2 (23,30 RMB) nello stesso confronto SuperCLUE.
Questa differenza è importante perché il divario di punteggio tra modelli di programmazione ad alte prestazioni può essere relativamente piccolo, mentre i costi di esecuzione di attività agente di lunga durata possono variare notevolmente. Per piccole aziende, sviluppatori indipendenti e team che necessitano di esecuzioni ripetute di agenti di programmazione, il costo di esecuzione può essere importante quanto il punteggio principale del benchmark.
La valutazione copre scenari di sviluppo reali, tra cui pagine front-end, giochi 3D e modifiche a script di ingegneria. Nei test riportati, DeepSeek-V4-Pro-0813 è stato in grado di completare logiche di sviluppo di giochi che coinvolgono gestione delle collisioni, punteggi e stati di fine partita.
Comportamento prestazionale, mentre lo stile dell'interfaccia prodotta e il feedback interattivo superano anche gli effetti di template di base.
Alcuni compiti di disegno creativo presentano ancora lievi problemi strutturali, ma la qualità complessiva del completamento rimane allo stesso livello del gruppo di testa.
Per i team di sviluppo attenti al budget, questo risultato offre a DeepSeek-V4-Pro-0813 un posizionamento chiaro: prestazioni vicine a quelle degli agenti di programmazione all'avanguardia, con costi di esecuzione del benchmark molto inferiori rispetto a diversi concorrenti con prezzi più elevati.
Domande frequenti
Cos'è DeepSeek-V4-Pro-0813?
DeepSeek-V4-Pro-0813 è la versione di produzione attuale dietro il nome del modello API deepseek-v4-pro. DeepSeek ha rilasciato ufficialmente la versione GA il 13 agosto 2026, con capacità agente potenziate e supporto per la sua app web, app mobile e API.
Cos'è SuperCLUE-Terminal?
SuperCLUE-Terminal è un benchmark per attività terminali di agenti intelligenti, focalizzato su flussi di lavoro di programmazione e ingegneria in cinese in scenari reali. Valuta le prestazioni end-to-end come comprensione dei requisiti, pianificazione, esecuzione di comandi, modifica di file, debugging e completamento finale delle attività.
Perché il benchmark utilizza Claude Code?
Il benchmark utilizza un framework agente generico per consentire ai modelli partecipanti di essere testati in un ambiente di esecuzione più comparabile. Claude Code fornisce un ambiente agente di tipo terminale per l'esecuzione delle attività, mentre il modello sottostante viene sostituito in ogni valutazione.
1,42 RMB è il prezzo ufficiale per singola attività di DeepSeek V4 Pro?
No. 1,42 RMB è il costo medio per attività osservato nell'esecuzione di questo benchmark SuperCLUE-Terminal, calcolato in base al consumo di token e alla metodologia di pricing del benchmark. Il costo API effettivo dipende da token di input, token di output, utilizzo della cache, impostazioni di reasoning e dai prezzi correnti del fornitore di servizi.
Come si comporta DeepSeek V4 Pro rispetto a Kimi K3 in questo benchmark?
Kimi K3 ottiene un punteggio più alto, 60,61 punti, rispetto ai 51,52 di DeepSeek-V4-Pro-0813. Tuttavia, il benchmark riporta un costo medio per attività di 19,63 RMB per Kimi K3, mentre DeepSeek-V4-Pro-0813 costa solo 1,42 RMB, conferendo a DeepSeek un significativo vantaggio in termini di costi in questa specifica valutazione.
DeepSeek V4 Pro supporta contesti lunghi e flussi di lavoro agente?
Sì. La documentazione API ufficiale di DeepSeek elenca per DeepSeek V4 Pro una lunghezza del contesto di 1 milione di token, con supporto per tool calling, API Responses, API compatibile con Anthropic e varie impostazioni di intensità di reasoning. DeepSeek posiziona esplicitamente la versione GA come un aggiornamento per carichi di lavoro agente.
DeepSeek V4 Pro è sempre superiore a GLM-5.2 nella programmazione?
Non necessariamente. In questi risultati SuperCLUE-Terminal, DeepSeek-V4-Pro-0813 ha ottenuto 51,52 punti contro i 48,48 di GLM-5.2, ma un singolo benchmark non determina le prestazioni in tutti i carichi di lavoro di programmazione. Dimensioni del repository, linguaggio, ambiente degli strumenti, comportamento con contesti lunghi, latenza e costi influenzano tutti la scelta del modello.
Strumenti correlati
- DeepSeek API: piattaforma API ufficiale per accedere ai modelli DeepSeek, incluso
deepseek-v4-pro. - SuperCLUE-Terminal: il
I benchmark citati in questo articolo sono quelli utilizzati per il confronto della programmazione dell'agente terminale.
- Claude Code: lo strumento di codifica dell'agente di Anthropic, utilizzato nel benchmark come framework di esecuzione generale.
- Kimi API: la piattaforma ufficiale per sviluppatori di Moonshot AI per Kimi K3 e altri modelli Kimi.
- Z.AI GLM-5.2: la panoramica ufficiale di GLM-5.2, un modello che ha ottenuto punteggi elevati anche nel benchmark.
Collegamenti correlati
- Rilascio della versione ufficiale di DeepSeek-V4-Pro: l'annuncio ufficiale di DeepSeek sulla versione V4 Pro di livello produzione.
- Modelli e prezzi DeepSeek: versioni ufficiali dei modelli, limiti di contesto, funzionalità e prezzi API attuali.
- Guida rapida all'API DeepSeek: istruzioni ufficiali per l'accesso a
deepseek-v4-protramite API. - Benchmark SuperCLUE-Terminal: la pagina ufficiale del benchmark con classifiche e confronto dei costi.
- Documentazione API Kimi K3: documentazione ufficiale Kimi che copre il modello K3 e l'uso dell'API.
- Documentazione Claude Code: documentazione ufficiale del framework dell'agente di codifica utilizzato nel benchmark.
- Panoramica ufficiale GLM-5.2: presentazione ufficiale di Z.AI su GLM-5.2 e le sue capacità di codifica a lungo raggio.
Riepilogo
DeepSeek-V4-Pro-0813 ha ottenuto un punteggio di 51,52 in SuperCLUE-Terminal, classificandosi al secondo posto in questo benchmark, dietro a Kimi K3 e davanti a GLM-5.2 e DeepSeek-V4-Flash-0731.
Il suo principale vantaggio risiede nei costi: il costo medio riportato da SuperCLUE è di circa 1,42 RMB per attività, molto inferiore ai costi registrati da Kimi K3 e GLM-5.2 nella stessa valutazione.
Questo risultato non implica che DeepSeek V4 Pro sia universalmente il miglior modello di codifica, ma indica che, per attività di programmazione lunghe e ad alta intensità di strumenti, il modello offre un buon equilibrio tra prestazioni di codifica dell'agente e costi di esecuzione.
Per i team che prestano attenzione sia alle capacità dell'agente di codifica sia ai costi operativi, DeepSeek-V4-Pro-0813 è una delle opzioni più competitive in questo confronto SuperCLUE-Terminal.