DeepSeek V4 Flash 0731: La demo di gioco da $0.07, prezzi API, architettura e benchmark di codifica
DeepSeek V4 Flash 0731 ha suscitato un'insolita combinazione di reazioni. Gli sviluppatori sono impressionati dai suoi punteggi negli agenti di codifica. I team delle infrastrutture sono interessati al suo milione di token di contesto e al suo prezzo competitivo, mentre il suo approccio architetturale ibrido MoE attira l'attenzione dei ricercatori.

DeepSeek V4 Flash 0731: Come un Modello Ri-Post-Addestrato ha Innescato una Guerra Globale dei Prezzi
Introduzione
DeepSeek V4 Flash 0731 ha generato una combinazione insolita di reazioni.
Gli sviluppatori sono colpiti dai suoi punteggi sugli agenti di codifica.
I team di infrastruttura sono interessati al suo contesto da 1 milione di token e al basso numero di parametri attivi.
Le piattaforme AI offrono uso gratuito e sconti aggressivi.
E i social media si riempiono di screenshot di prototipi le cui fatture di inferenza riportate sono misurate in centesimi piuttosto che in dollari.
Gli esempi più ampiamente condivisi nell'articolo originale includevano:
- Un piccolo prototipo di sparatutto 3D presumibilmente generato per circa 0,07 RMB.
- Un prototipo in stile Counter-Strike presumibilmente prodotto per circa 0,50 RMB.
- Una dashboard di utilizzo personale che mostra 87 milioni di token per 31,57 RMB.
- OpenCode che riporta 8 trilioni di token DeepSeek Flash il 1° agosto.
- Cline che aumenta la propria quota gratuita dopo aver scoperto che il modello era più economico da sovvenzionare del previsto.
- Nous Portal che sconta temporaneamente V4 Flash 0731 del 90%.
Questi esempi catturano l'entusiasmo, ma possono anche confondere diverse cose distinte:
- Il prezzo ufficiale dell'API di DeepSeek.
- I prezzi con e senza cache-hit.
- L'accesso gratuito o sovvenzionato di terze parti.
- Il numero di chiamate agli strumenti che un agente esegue.
- La quantità di output e di ragionamento nascosto generato.
- Il costo del solo modello rispetto al costo del prodotto completo.
Il modello è genuinamente economico.
Ciò non significa che ogni applicazione costerà sette centesimi.
La domanda utile non è se un singolo demo virale sia riproducibile esattamente. È come DeepSeek abbia ottenuto un salto di capacità così grande senza cambiare l'architettura di base—e cosa significhino le nuove dinamiche economiche per gli sviluppatori.
Il Ciclo Globale degli Sconti
Il prezzo ufficiale dell'API era già basso prima dell'applicazione delle promozioni di terze parti.
DeepSeek attualmente elenca i seguenti prezzi per milione di token:
| Tipo di utilizzo | Prezzo DeepSeek V4 Flash |
|---|---|
| Input, cache hit | $0,0028 |
| Input, cache miss | $0,14 |
| Output | $0,28 |
L'API supporta:
- Una finestra di contesto da 1 milione di token.
- Fino a 384K token di output.
- Modalità di pensiero e non-pensiero.
- Tre livelli di sforzo di ragionamento nella scheda del modello 0731:
low,highemax. - Chiamate agli strumenti.
- Output JSON.
- Completamento del prefisso chat in beta.
- Completamento FIM in modalità non-pensiero.
- Chat Completions compatibili con OpenAI.
- L'API Responses.
- Un'interfaccia compatibile con Anthropic.
- Un limite di concorrenza pubblicato di 2.500 per account per V4 Flash.
Questi prezzi ufficiali sono la base.
Le piattaforme possono quindi scegliere di:
- Applicare il prezzo così com'è.
- Aggiungere un margine.
- Sovvenzionare l'utilizzo.
- Offrire un modello gratuito limitato.
- Includere il modello in un abbonamento.
- Applicare crediti promozionali.
- Instradare il traffico attraverso un altro provider di inferenza.
Questo è il motivo per cui uno sviluppatore può pagare il prezzo di listino di DeepSeek mentre un altro non paga nulla per un periodo limitato.
OpenCode Riporta Otto Trilioni di Token in un Solo Giorno
OpenCode ha dichiarato pubblicamente che DeepSeek Flash ha elaborato 8 trilioni di token il 1° agosto attraverso la sua piattaforma.
Il post suddivide la cifra come segue:
5T token di utilizzo gratuito
+
3T token attraverso OpenCode Go

La documentazione Zen attuale di OpenCode elenca un'opzione DeepSeek V4 Flash Free disponibile per un periodo limitato.
Questa è una distinzione importante.
La cifra di otto trilioni di token descrive il traffico attraverso OpenCode, non l'utilizzo diretto riportato da DeepSeek su tutte le piattaforme.
Resta comunque un segnale forte che i modelli a basso costo possono generare una domanda enorme quando vengono inseriti in un flusso di lavoro di agenti di codifica popolare.
Nous Portal Riduce Temporaneamente il Prezzo del 90%
Nous Research ha annunciato una promozione di sette giorni che offre DeepSeek V4 Flash 0731 con uno sconto del 90% tramite Nous Portal in collaborazione con Novita Labs.

Il post promozionale ha confrontato il costo scontato con Claude Fable 5, affermando una differenza di prezzo superiore a 1.000 volte su compiti paragonabili.
Tale confronto dipende da diverse scelte:
- Quale prezzo del fornitore viene utilizzato.
- Se prevalgono i token di input o di output.
- Se la memorizzazione nella cache è disponibile.
- Quale impostazione di ragionamento viene selezionata.
- Quanti token ciascun modello necessita per completare l'attività.
- Quale benchmark o flusso di lavoro definisce "comparabile".
Un confronto del prezzo per token è utile, ma la metrica più significativa è:
Costo totale per attività accettata
Un modello che utilizza meno token costosi può essere più economico di un modello a basso prezzo che prova ripetutamente.
Al contrario, quando un modello a basso prezzo è anche abbastanza capace da completare rapidamente l'attività, il vantaggio in termini di costo può diventare enorme.
Cline Triplica la Quota Gratuita
Cline ha inizialmente annunciato l'utilizzo gratuito di V4 Flash 0731 tramite il suo agente di codifica.
Un successivo post pubblico ha dichiarato che la quota gratuita era stata triplicata perché l'economicità sembrava sostenibile.

Il catalogo modelli attuale di Cline e i materiali ClinePass includono DeepSeek V4 Flash come opzione rapida e orientata al valore per attività di codifica mirate.
Le quote gratuite e la disponibilità dei modelli possono cambiare, quindi gli utenti dovrebbero verificare la pagina del fornitore in tempo reale piuttosto che affidarsi a uno screenshot obsoleto.
La lezione più ampia è più duratura.
Quando l'inferenza diventa abbastanza economica, una piattaforma di agenti può utilizzare l'accesso gratuito come acquisizione clienti senza assorbire
lo stesso costo che dovrebbe sostenere con un modello premium di frontiera.
Gli Screenshot dei Costi della Community Necessitano di Contesto
L'articolo originale include una dashboard che mostra:
- ¥31,57 di spesa.
- 2.282 richieste API.
- 87.027.995 token.

Lo screenshot è utile perché dimostra l'ordine di grandezza che gli sviluppatori potrebbero osservare in condizioni d'uso favorevoli.
Non rivela informazioni sufficienti per ricostruire esattamente la fattura.
Le variabili mancanti includono:
- Rapporto tra token di input e di output.
- Percentuale di cache-hit.
- Versione del modello utilizzata in ciascuna data.
- Sforzo di ragionamento.
- Numero di chiamate agli strumenti.
- Richieste fallite.
- Crediti promozionali.
- Sconti del fornitore.
- Se tutti i token fossero fatturabili alla stessa tariffa.
Un lungo prompt di sistema ripetuto può essere estremamente economico quando colpisce la cache.
Un lungo prompt unico inviato una sola volta viene fatturato al prezzo di input con cache-miss.
Anche l'output è molto più costoso dell'input in cache.
Per i sistemi agente, queste differenze dominano la fattura finale.
Flash Blitz: Cosa è Cambiato il 31 Luglio
DeepSeek V4 Preview è stato lanciato il 24 aprile 2026.
La famiglia comprendeva:
- DeepSeek V4 Pro.
- DeepSeek V4 Flash.
La versione Preview ha stabilito l'architettura principale:
- Mixture of Experts sparsa.
- Contesto da 1 milione di token.
- Attenzione efficiente per contesti lunghi.
- Basso numero di parametri attivi rispetto alla capacità totale.
- Modalità di pensiero e non-pensiero.
- Pesi aperti con licenza MIT.
V4 Flash Preview è stato posizionato come l'alternativa più piccola, veloce ed economica a V4 Pro.
L'aggiornamento del 31 luglio ha cambiato la sua posizione competitiva.
DeepSeek dichiara che V4 Flash 0731 utilizza la stessa architettura e dimensione del modello di V4 Flash Preview.
L'aggiornamento è stato prodotto eseguendo un nuovo processo di post-addestramento.
In forma semplificata:
Stessa architettura di base pre-addestrata
+
nuovo post-addestramento e ottimizzazione agente
=
comportamento agente di codifica molto più forte
Questo è importante perché mostra quanta capacità può rimanere latente in un modello pre-addestrato.
Architettura e numero di parametri non sono l'intero prodotto.
Il post-addestramento determina l'efficacia con cui il modello:
- Utilizza gli strumenti.
- Pianifica lavori multi-fase.
- Gestisce il feedback del terminale.
- Si riprende dagli errori.
- Scriva e modifichi file.
- Segua un protocollo agente.
- Allochi lo sforzo di ragionamento.
- Lavori all'interno di un harness.
Architettura di Base e Dettagli del Checkpoint
La scheda originale del modello V4 Flash descrive il modello di base come:
| Specifica | DeepSeek V4 Flash |
|---|---|
| Parametri MoE totali di base | 284B |
| Parametri attivati | 13B |
| Lunghezza del contesto | 1M |
| Licenza | MIT |
| Modalità principale | Testo |
| Precisione di base | FP8 / bassa precisione mista a seconda del checkpoint |
La scheda del modello 0731 afferma che la nuova versione ha la stessa struttura della variante DSpark e include un modulo di decodifica speculativa allegato.
Questo spiega perché alcuni metadati dei file del modello potrebbero mostrare
un conteggio totale di checkpoint più grande rispetto alla cifra di 284B del modello MoE di base.
La descrizione più chiara è:
Il modello MoE sottostante di V4 Flash rimane di circa 284B totali con 13B parametri attivi, mentre la release 0731 include il componente aggiuntivo di decodifica speculativa DSpark nel checkpoint pubblicato.
Decodifica Speculativa DSpark
La decodifica speculativa utilizza un processo di bozza veloce per proporre diversi token futuri.
Il modello principale verifica poi queste proposte.
Quando le previsioni vengono accettate, il sistema può produrre più token con meno lavoro sequenziale.
La scheda del modello DeepSeek 0731 fornisce supporto esplicito per DSpark con vLLM e SGLang.
Per vLLM, la configurazione rilevante è:
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
Per SGLang, la scheda del modello utilizza:
--speculative-algorithm DSPARK
DSpark non migliora di per sé il ragionamento del modello.
È un'ottimizzazione dell'inferenza volta a ridurre la latenza di decodifica o ad aumentare il throughput preservando la distribuzione di output del modello target nella configurazione supportata.
Il Salto nei Benchmark
DeepSeek pubblica il seguente confronto per V4 Flash 0731:
| Benchmark | V4 Flash 0731 | V4 Flash Preview | V4 Pro Preview |
|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 |
| NL2Repo | 54.2 | 39.4 | 38.5 |
| CyberGym | 76.7 | 38.7 | 52.7 |
| DeepSWE | 54.4 | 7.3 | 12.8 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 |
| Agents’ Last Exam | 25.2 | 15.8 | 16.5 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 |
L'incremento più drammatico è DeepSWE:
7.3 → 54.4
CyberGym quasi raddoppia:
38.7 → 76.7
Terminal Bench 2.1 sale di oltre venti punti:
61.8 → 82.7
Il nuovo modello Flash supera inoltre V4 Pro Preview in ogni benchmark nella tabella pubblicata da DeepSeek.
Questo è un cambiamento importante per un modello originariamente posizionato principalmente come opzione più economica e veloce.
La Metodologia dei Benchmark Conta
La tabella non dovrebbe essere letta come un puro confronto di checkpoint grezzi.
La scheda del modello DeepSeek include diverse note importanti.
Per i task pubblici di code-agent, l'azienda ha utilizzato:
DeepSeek Harness modalità minima
Sforzo di ragionamento: max
Temperatura: 1.0
Top-p: 0.95
DeepSeek Harness non era stato rilasciato pubblicamente al momento della verifica.
Ciò significa che i ricercatori esterni potrebbero non essere ancora in grado di riprodurre l'ambiente software esatto utilizzato per i risultati pubblicati dei code-agent.
Due test sono anche interni:
- DSBench-FullStack.
- DSBench-Hard.
I benchmark interni possono essere utili per lo sviluppo del prodotto, ma i team indipendenti non possono ispezionare i loro task nascosti o i controlli di contaminazione.
L'interpretazione corretta è:
DeepSeek riporta un grande miglioramento nel suo stack agente e nella configurazione di valutazione scelti. La riproducibilità pubblica migliorerà quando harness, prompt, log e configurazione completa di valutazione saranno disponibili.
La Qualità dell'Harness Può Cambiare il Punteggio
Un benchmark di codifica spesso misura un sistema completo:
Modello
+
prompt di sistema
+
strumenti di repository
+
terminale
esecuzione
+
gestione del contesto
+
politica di ripetizione
+
feedback sui test
+
logica di invio delle patch
Lo stesso modello può ottenere punteggi diversi quando cambia un singolo componente.
Un harness migliore può:
- Selezionare file più pertinenti.
- Conservare output di terminale utili.
- Prevenire l'overflow del contesto.
- Ripetere intelligentemente i comandi falliti.
- Fermare loop improduttivi.
- Applicare patch in modo più affidabile.
- Fornire al modello risultati di test più chiari.
Questo non rende il modello irrilevante.
Significa che il risultato del benchmark appartiene alla combinazione modello-e-harness.
I forti numeri del 0731 suggeriscono che DeepSeek ha migliorato sia il comportamento agentico del modello sia il processo di valutazione circostante.
## Artificial Analysis Lo Valuta 50
Artificial Analysis riporta un punteggio di Intelligence Index di circa **50** per DeepSeek V4 Flash 0731, circa dieci punti sopra la versione Flash precedente.
La società indipendente di analisi dei modelli descrive inoltre V4 Flash come eccezionalmente economica rispetto ad altri noti sistemi di frontiera.
Reuters ha riassunto i risultati di Artificial Analysis riportando un costo medio di test benchmark di circa tre centesimi di dollaro statunitense secondo la sua metodologia.
Questo confronto supporta l'argomento del valore.
Non significa che ogni attività di produzione costi tre centesimi.
Artificial Analysis riporta anche risultati più deboli su alcune misure di affidabilità della conoscenza.
Il suo articolo su V4 Flash 0731 nota:
- L'accuratezza dell'omniscienza è rimasta intorno al 37%.
- Il tasso di allucinazioni è diminuito ma è rimasto elevato, circa all'84% in quella valutazione.
Queste cifre sono un utile promemoria.
Un modello può essere:
- Molto forte negli agenti di codifica.
- Estremamente economico.
- Competitivo su un indice composito.
- Ancora inaffidabile su alcune domande fattuali del mondo aperto.
"Il miglior rapporto qualità-prezzo" non è la stessa cosa di "il migliore per ogni attività".
## Prezzi Ufficiali dell'API
Il prezzo diretto dell'API DeepSeek è:
| Categoria di fatturazione | Prezzo per 1M token |
|-|-|
| Input con cache attiva | \$0.0028 |
| Input senza cache | \$0.14 |
| Output | \$0.28 |
Il divario di prezzo tra un input con cache attiva e uno senza cache è enorme:
```Plaintext
$0.14 ÷ $0.0028 = 50
L'input con cache è cinquanta volte più economico di quello senza cache.
Per agenti a lunga esecuzione, la struttura del prompt diventa architettura dei costi.
Esempio di Calcolo dei Costi
Supponiamo che una richiesta utilizzi:
100.000 token di input senza cache
20.000 token di output
Il costo diretto del modello è:
Input:
100.000 / 1.000.000 × $0.14
= $0.014
Output:
20.000 / 1.000.000 × $0.28
= $0.0056
Totale:
$0.0196
Questo è meno di due centesimi di dollaro statunitense.
Ora supponiamo che lo stesso prefisso di 100.000 token sia memorizzato nella cache:
Input con cache:
100.000 / 1.000.000 × $0.0028
= $0.00028
Output:
20.000 / 1.000.000 × $0.28
= $0.0056
Totale:
$0.00588
L'output ora domina la fattura.
Questi esempi spiegano perché i prototipi di codifica a basso costo sono plausibili.
Non includono:
- Margini del fornitore.
- Addebiti delle API degli strumenti.
- Costi di browser o ricerca.
- Calcolo in sandbox.
- Archiviazione.
- Tentativi falliti ripetuti.
- Tempo di sviluppo umano.
Perché le Fatture degli Agenti Possono Ancora Crescere
La codifica agentica è raramente una singola richiesta.
Un flusso di lavoro tipico può includere:
- Leggere il repository.
- Cercare il codice pertinente.
- Pianificare la modifica.
- Modificare diversi file.
- Eseguire i test.
- Ispezionare il
fallimento.
7. Modifica di nuovo.
8. Esegui di nuovo i test.
9. Rivedi la diff.
10. Produci la risposta finale.
Ogni passaggio può comportare un’altra chiamata al modello.
Un compito apparentemente piccolo può diventare costoso quando:
- Il contesto del repository non viene memorizzato nella cache ripetutamente.
- Il modello genera lunghe sequenze di ragionamento.
- I test falliscono molte volte.
- L’agente legge file di grandi dimensioni inutilmente.
- Più agenti paralleli duplicano il lavoro.
- La compattazione del contesto causa il reinvio di informazioni importanti.
- Il modello non si ferma dopo aver raggiunto una buona soluzione.
V4 Flash riduce il prezzo di questi errori.
Non li elimina.
La Cache del Contesto È la Leva Principale dei Costi
DeepSeek utilizza la cache del contesto basata su disco.
Quando lo stesso prefisso viene riutilizzato, i token di input corrispondenti possono beneficiare del prezzo più basso per hit in cache.
Buoni candidati per un prefisso stabile includono:
- Istruzioni di sistema.
- Policy del repository.
- Definizioni degli strumenti.
- Documenti di riferimento lunghi.
- Uno snapshot invariato del progetto.
- Contesto aziendale ripetuto.
Un design semplificato del prompt è:
Prefisso stabile riutilizzabile
+
nuova richiesta utente
+
ultimo risultato dello strumento
Un design meno favorevole alla cache è:
Istruzioni riordinate
+
riepilogo del repository riscritto
+
timestamp variabili
+
metadati casuali della richiesta
+
nuova richiesta utente
Piccole modifiche al prefisso possono ridurre il riutilizzo della cache.
Gli sviluppatori dovrebbero ispezionare i campi di utilizzo dei token piuttosto che presumere che un prompt lungo sia stato memorizzato nella cache.
DeepSeek offre anche l’isolamento tramite user_id per privacy e pianificazione. Il riutilizzo della cache e l’isolamento degli utenti dovrebbero essere progettati insieme per evitare che il contesto di un cliente venga accidentalmente mescolato con quello di un altro.
Avvio Rapido dell’API
L’URL di base ufficiale rimane:
https://api.deepseek.com
L’ID del modello è:
deepseek-v4-flash
DeepSeek afferma che l’ID API stabile serve automaticamente l’ultima versione Flash ufficiale.
Questo è comodo, ma i team di produzione dovrebbero registrare il fingerprint del modello restituito e testare le modifiche, perché il comportamento dietro un ID stabile può essere aggiornato.
Esempio in Python
from openai import OpenAI
client = OpenAI(
api_key="YOUR_DEEPSEEK_API_KEY",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "user",
"content": "Review this function and propose a safe refactor.",
}
],
)
print(response.choices[0].message.content)
Esempio con cURL
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{
"role": "user",
"content": "Write a small Python CLI that validates JSON files."
}
]
}'
Gli sviluppatori dovrebbero consultare il riferimento API live per i campi esatti relativi a reasoning-effort e thinking-mode supportati dal proprio endpoint e dalla versione dell’SDK.
La Cronologia del Pensiero Deve Essere Preservata
La documentazione sulla modalità di pensiero di DeepSeek afferma che quando un turno include chiamate agli strumenti, il campo reasoning_content del messaggio dell’assistente deve essere ripassato nelle richieste successive.
Un agente multi-turno dovrebbe preservare:
content
reasoning_content
tool_calls
L'eliminazione dello stato di ragionamento può ridurre la continuità o causare problemi di validazione delle richieste.
Questo è particolarmente rilevante quando si integra tramite un client compatibile con OpenAI che normalmente ignora i campi di ragionamento specifici del provider.
Compatibilità con OpenAI, Anthropic e Responses API
DeepSeek offre più di un'interfaccia.
OpenAI Chat Completions
Utilizza l'URL di base standard di DeepSeek e l'ID del modello:
deepseek-v4-flash
API Compatibile con Anthropic
DeepSeek documenta anche un'interfaccia in formato Anthropic.
Questo può aiutare il software costruito attorno ai messaggi in stile Claude a connettersi a DeepSeek con meno modifiche all'applicazione.
La compatibilità non garantisce un comportamento identico.
I campi specifici del provider, la cronologia del ragionamento, gli schemi degli strumenti, il comportamento di sicurezza e la gestione degli errori richiedono comunque test.
Responses API
DeepSeek afferma che la versione 0731 supporta nativamente il formato Responses API ed è stata adattata per l'uso in stile Codex.
Questo è importante per i prodotti agenti di codifica che dipendono sempre più da oggetti di risposta stateful, chiamate agli strumenti e cicli agentici strutturati.
Pesi Aperti Sotto Licenza MIT
DeepSeek ha rilasciato i pesi di V4 Flash 0731 su Hugging Face sotto licenza MIT.
Ciò consente agli sviluppatori di ispezionare, modificare, distribuire e ridistribuire il modello secondo i termini della licenza.
Il rilascio dei pesi aperti offre maggiore controllo rispetto a un modello solo API.
I team possono:
- Eseguire il modello su infrastruttura privata.
- Studiarne l'architettura.
- Creare varianti quantizzate.
- Adattare i kernel di inferenza.
- Affinarlo o specializzarlo.
- Integrarlo in sistemi interni.
- Evitare di inviare codice sensibile a un'API di terze parti.
La barriera pratica è l'hardware.
"Pesi aperti" non significa "gira su un normale laptop".
Distribuzione con vLLM
La scheda ufficiale del modello 0731 fornisce un esempio vLLM per un singolo nodo 4×GB300:
vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
--trust-remote-code \
--kv-cache-dtype fp8 \
--block-size 256 \
--data-parallel-size 4 \
--enable-expert-parallel \
--moe-backend deep_gemm_mega_moe \
--attention-config '{"use_fp4_indexer_cache": true}' \
--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'
Questo esempio dimostra la classe di infrastruttura prevista per un servizio di qualità completa.
Non deve essere interpretato come l'unica configurazione supportata.
La ricetta vLLM potrebbe aggiungere supporto per altre topologie GPU nel tempo.
Distribuzione con SGLang
L'esempio ufficiale SGLang è:
sglang serve \
--trust-remote-code \
--model-path deepseek-ai/DeepSeek-V4-Flash-0731 \
--tp 4 \
--moe-runner-backend flashinfer_mxfp4 \
--speculative-algorithm DSPARK \
--mem-fraction-static 0.90 \
--chunked-prefill-size 4096 \
--swa-full-tokens-ratio 0.1
I pesi target e draft provengono dallo stesso checkpoint, quindi la documentazione indica di non impostare un percorso separato per il modello draft speculativo.
I motori di inferenza si evolvono rapidamente.
Utilizza la scheda del modello corrente e la ricetta del motore di servizio anziché copiare un vecchio comando di avvio dalla versione Preview.
La Distribuzione Locale è Ancora un Progetto di Infrastruttura
Anche se solo circa
13 miliardi di parametri sono attivi per un token, l'intero peso del modello deve rimanere disponibile in tutto il sistema di servizio.
La pianificazione del deployment deve considerare:
- Archiviazione totale del modello.
- Memoria GPU.
- Parallelismo degli esperti.
- Larghezza di banda dell'interconnessione.
- Cache KV per contesto lungo.
- Supporto alla quantizzazione.
- Kernel DSpark.
- Dimensione del batch.
- Concorrenza.
- Latenza di prefill.
- Throughput di decodifica.
Quantizzazioni più piccole possono rendere possibile la sperimentazione su hardware diverso, ma possono modificare qualità, velocità o lunghezza del contesto supportata.
Per la maggior parte degli sviluppatori individuali, l'API diretta o un provider ospitato sarà più facile ed economico rispetto all'auto-hosting.
API Ufficiale Versus Provider di Terze Parti
Ci sono tre modi comuni per utilizzare V4 Flash.
| Percorso | Vantaggio principale | Compromesso principale |
|---|---|---|
| API DeepSeek | Prezzi ufficiali e modello ufficiale attuale | I dati lasciano il tuo ambiente; l'ID stabile può essere aggiornato |
| Piattaforma di terze parti | Quote gratuite, agenti integrati, fatturazione più semplice | Promozioni e routing possono cambiare |
| Pesi auto-ospitati | Massimo controllo e privacy | Requisiti significativi di hardware e ingegneria |
Il percorso più economico dipende dal carico di lavoro.
Una quota gratuita di Cline o OpenCode può essere la migliore per la sperimentazione.
L'API diretta può essere la migliore per un uso su piccola scala prevedibile.
L'auto-hosting può diventare interessante solo a volumi sufficientemente elevati e sostenuti o quando i requisiti di privacy predominano.
La Migliore Era per il Prototipaggio
L'articolo originale confronta l'IA economica con la produzione di massa di automobili.
L'analogia è imperfetta ma utile.
Quando una tecnologia diventa drammaticamente più economica, il mercato non compra semplicemente la stessa quantità a meno prezzo.
Nuovi usi diventano possibili.
I modelli agente a basso costo possono supportare esperimenti che in precedenza sarebbero stati rifiutati prima dei test.
Esempi includono:
- Uno studente che costruisce un primo prototipo software.
- Un fondatore singolo che genera e testa diverse idee di landing page.
- Un piccolo team che esegue revisioni del codice su ogni pull request.
- Un progetto open-source che offre triage gratuito dei problemi.
- Un ricercatore che elabora una grande collezione di codice o documenti.
- Un'azienda che crea agenti interni per lavori ripetitivi.
- Uno sviluppatore di giochi che testa meccaniche e livelli generati.
Il valore non è che il modello sostituisca tutta l'ingegneria del software.
Riduce il costo di chiedersi:
Vale la pena sviluppare ulteriormente questa idea?
Un Prototipo Non È un Prodotto
La generazione economica può produrre una prima demo convincente.
Un prodotto in produzione ha ancora bisogno di:
- Progettazione del prodotto.
- Sicurezza.
- Testing.
- Accessibilità.
- Prestazioni.
- Monitoraggio.
- Deployment.
- Protezione dei dati.
- Revisione legale.
- Manutenzione.
- Supporto clienti.
Una fattura del modello di sette centesimi non significa un'attività da sette centesimi.
Significa che il primo esperimento computazionale può essere abbastanza economico da tentare.
Questo cambia chi può partecipare e quante idee possono essere testate.
Un Esempio di Workspace Costruito dalla Comunità
L'articolo originale include un workspace documentale leggero mostrato come esempio di ciò che gli sviluppatori stavano costruendo con agenti di codifica economici.

Uno screenshot non può stabilire quanta parte dell'applicazione sia stata prodotta dal modello, quanto editing umano sia stato necessario, o se il prodotto sia sicuro e manutenibile.
Mostra comunque il tipo di progetto che i modelli di codifica a basso costo rendono più facile prototipare.
Dove si colloca al meglio V4 Flash
V4 Flash 0731 è particolarmente interessante quando:
- L'attività è incentrata su codice o strumenti.
- Il costo è un fattore molto rilevante.
- Un contesto ampio è utile.
- È previsto un volume elevato di richieste.
- Il flusso di lavoro può convalidare gli output.
- Nuovi tentativi occasionali sono accettabili.
- È disponibile un modello fallback più grande per i casi difficili.
Potrebbe essere meno adatto quando:
- L'accuratezza fattuale nel mondo aperto è fondamentale.
- Una prima risposta raffinata conta più del costo.
- L'attività richiede la comprensione delle immagini.
- L'organizzazione non può convalidare il codice generato.
- È richiesta una garanzia di conformità gestita.
- Il flusso di lavoro dipende da un comportamento API stabile e con versione bloccata.
Un router di modelli può combinare Flash con un sistema più potente o più specializzato.
Per esempio:
Modifiche di routine al repository
→ V4 Flash
Decisioni ad alto rischio su architettura o sicurezza
→ modello più potente + revisione umana
I modelli economici cambiano l'architettura degli agenti
Quando le chiamate ai modelli sono costose, gli sviluppatori cercano di minimizzare ogni richiesta.
Quando le chiamate diventano economiche, un agente può permettersi di:
- Chiedere a un altro modello di rivedere la patch.
- Eseguire un passaggio separato di analisi dei test.
- Generare diverse soluzioni candidate.
- Confrontare implementazioni alternative.
- Usare un modello per la pianificazione e un altro per l'esecuzione.
- Ricontrollare il proprio lavoro prima dell'invio.
Questo può aumentare l'affidabilità.
Può anche sprecare token.
L'obiettivo giusto non è l'uso minimo di token.
È:
Il costo totale più basso che raggiunge la qualità richiesta
I principali rischi dietro la storia del prezzo
1. La beta pubblica può cambiare
DeepSeek descrive l'API Flash ufficiale come una beta pubblica.
Prezzi, comportamento, limiti e versioni del modello possono cambiare.
I team di produzione dovrebbero mantenere test di regressione.
2. I punteggi dei benchmark dipendono dall'harness di DeepSeek
I migliori risultati degli agenti di codice utilizzano una configurazione harness non rilasciata.
La riproduzione indipendente esatta non è ancora semplice.
3. Un input economico non garantisce un agente economico
Output, nuovi tentativi, strumenti e contesto non memorizzato nella cache possono dominare il costo finale.
4. Il contesto lungo non è gratuito
Una finestra da 1 milione di token è un limite di capacità, non una raccomandazione a inviare un milione di token in ogni richiesta.
I carichi di lavoro di prefill elevati aumentano latenza e costi.
5. L'affidabilità nel mondo aperto richiede ancora lavoro
La valutazione indipendente mostra che il valore e la forza nella codifica possono coesistere con un alto tasso di allucinazioni nei test fattuali.
I fatti critici dovrebbero essere verificati rispetto alle fonti.
6. Il codice generato richiede revisione
I modelli a basso costo possono generare più codice di quanto un team possa ispezionare in sicurezza.
Test automatizzati, analisi statica, scansione delle dipendenze e revisione umana rimangono necessari.
7. L'accesso promozionale è temporaneo
Modelli gratuiti di terze parti e sconti possono scomparire.
Non costruire un modello di business permanente basato su sussidi di sette giorni o promozioni a tempo limitato.
8. Gli ID API stabili possono nascondere aggiornamenti
L'ID del modello deepseek-v4-flash punta alla versione corrente.
Un aggiornamento dietro quell'ID può modificare gli output senza alcuna modifica al codice nella tua applicazione.
Checklist pratica per il controllo dei costi
1. Stabilizzare i prefissi riutilizzabili
Mantieni coerenti le istruzioni di sistema e le definizioni degli strumenti per migliorare il riutilizzo della cache.
2. Monitorare separatamente i token con cache attiva
Non affidarti solo al totale dei token di input.
3. Limitare gli output non necessari
Imposta un budget di output realistico per l'attività.
4. Utilizzare uno sforzo di ragionamento inferiore per le attività di routine
Riserva max per le attività che traggono beneficio da una deliberazione più lunga.
5. Limitare i passaggi dell'agente
Interrompi i loop che non stanno producendo progressi.
6. Eseguire validazioni economiche prima di un'altra chiamata al modello
Utilizza linter, test, validatori di schema e controlli deterministici.
7. Instradare i casi difficili
Escalation solo quando l'attività fallisce un test o supera una soglia di rischio.
8. Misurare il costo per risultato accettato
Includi i tentativi falliti e la revisione umana.
Un'altra cosa: DeepSeek Harness
L'articolo originale si conclude con un possibile passo successivo nell'ecosistema sviluppatori di DeepSeek.
Tianyi Cui, identificato nella fonte come la persona responsabile di DeepSeek Harness, ha pubblicato un messaggio di reclutamento per sviluppatori di progetti open-source di agent-harness.
Il messaggio invitava gli sviluppatori interessati a condividere un account GitHub e lavori open-source rappresentativi per partecipare ai test interni.

Anche il changelog del 31 luglio di DeepSeek afferma che la modalità minima di DeepSeek Harness utilizzata per la valutazione dei benchmark è "in arrivo a breve".
Al momento della verifica, non ho trovato:
- Un repository ufficiale pubblico di DeepSeek Harness.
- Una pagina prodotto stabile per "DeepSeek Code".
- Istruzioni di installazione pubbliche.
- Prezzi.
- Una data di rilascio.
- Una specifica completa delle funzionalità.
Le prove supportano questa conclusione più ristretta:
DeepSeek sta testando un agent harness e intende rilasciare almeno parte del framework, ma il nome finale del prodotto, l'ambito pubblico e i tempi di lancio rimangono non confermati.
Il modello, l'API e i pesi aperti sono disponibili ora.
L'harness è ancora un componente futuro dell'ecosistema.
Perché DeepSeek Harness potrebbe essere importante
Un harness di prima parte potrebbe aiutare DeepSeek a controllare l'intero stack dell'agente di codifica.
Potrebbe offrire:
- Gestione nativa della cronologia del ragionamento.
- Formati di prompt specifici per modello.
- Parsing delle chiamate agli strumenti.
- Gestione del contesto.
- Ricerca nel repository.
- Esecuzione nel terminale.
- Riproducibilità dei benchmark.
- Integrazione con l'API Responses.
- Flussi di lavoro compatibili con Codex.
- Controlli dei costi.
- Instradamento automatico tra Flash e Pro.
DeepSeek documenta già integrazioni con harness esterni e agenti di codifica.
Uno strumento di prima parte potrebbe trasformare le ottimizzazioni specifiche per benchmark in un prodotto che gli sviluppatori ordinari possono utilizzare.
Potrebbe anche rivelare quanto del balzo nei benchmark di V4 Flash 0731 derivi dal checkpoint e quanto dall'ambiente di esecuzione dell'agente.
Cosa Osservare in Seguito
Diversi sviluppi determineranno se il momento V4 Flash diventerà un cambiamento duraturo per l'ecosistema.
Rilascio Ufficiale di V4 Pro
DeepSeek afferma che il rilascio ufficiale di V4 Pro seguirà l'aggiornamento Flash.
Il divario in termini di prestazioni e prezzo tra Pro e Flash influenzerà le decisioni di instradamento.
Disponibilità di DeepSeek Harness
Un rilascio pubblico migliorerebbe la riproducibilità dei benchmark e fornirebbe agli sviluppatori un framework agente nativo del modello.
Stabilità dei Prezzi
Il prezzo diretto è già basso, ma le promozioni di terze parti potrebbero non rimanere.
Capacità del Provider
L'inferenza economica attira un traffico molto elevato.
Latenza, limiti di velocità e affidabilità saranno importanti man mano che l'utilizzo cresce.
Supporto per Inferenza Open-Source
vLLM, SGLang, i fornitori di hardware e i progetti di quantizzazione determineranno quanto sarà accessibile l'auto-hosting.
Valutazioni Indipendenti
Più valutazioni pubbliche dovrebbero testare:
- Codifica.
- Sicurezza.
- Affidabilità fattuale.
- Contesto lungo.
- Uso di strumenti.
- Costo per attività riuscita.
- Prestazioni con diversi harness.
Domande Frequenti
Cos'è DeepSeek V4 Flash 0731?
DeepSeek V4 Flash 0731 è la versione ufficiale del 31 luglio di V4 Flash, attualmente servita tramite l'API deepseek-v4-flash in beta pubblica. DeepSeek afferma che mantiene l'architettura di base e le dimensioni del modello Preview migliorando sostanzialmente le capacità dell'agente attraverso un nuovo post-training.
Quanto costa DeepSeek V4 Flash?
L'API ufficiale di DeepSeek elenca $0,14 per milione di token di input con cache miss, $0,0028 per milione di token di input con cache hit e $0,28 per milione di token di output. Le piattaforme di terze parti possono offrire prezzi diversi, quote gratuite o sconti temporanei.
Un gioco 3D costa davvero solo 0,07 RMB da generare?
L'articolo originale cita un esempio della community con quel costo di modello riportato. L'esempio non è accompagnato da prompt completi, log dei token, dati di cache, tentativi, costi degli strumenti o registri del lavoro umano, quindi dovrebbe essere trattato come un aneddoto piuttosto che come un budget garantito.
Quali sono i principali punteggi benchmark di V4 Flash 0731?
DeepSeek riporta 82,7 su Terminal Bench 2.1, 76,7 su CyberGym, 54,4 su DeepSWE, 70,3 su Toolathlon-Verified e 54,2 su NL2Repo. Le valutazioni pubbliche degli agenti di codice hanno utilizzato la modalità minima non rilasciata di DeepSeek Harness con il massimo sforzo di ragionamento.
DeepSeek V4 Flash 0731 è open source?
I pesi del modello e il repository sono rilasciati sotto la Licenza MIT, quindi "open-weight" e uso ampiamente permissivo sono descrizioni accurate. L'esecuzione del checkpoint completo richiede comunque un'infrastruttura multi-GPU sostanziale.
DeepSeek V4 Flash può essere eseguito localmente?
Sì, DeepSeek pubblica pesi e istruzioni di servizio per vLLM e SGLang. Gli esempi ufficiali su larga scala utilizzano hardware multi-GPU avanzato, quindi un normale laptop non è l'ambiente target per il modello completo.
Qual è la finestra di contesto?
L'API ufficiale e la scheda del modello specificano una finestra di contesto di 1 milione di token. L'API elenca anche una
lunghezza massima di output di 384K token, ma l'utilizzo del contesto o dell'output massimi può aumentare significativamente la latenza e l'uso delle risorse.
Sono stati rilasciati DeepSeek Code o DeepSeek Harness?
DeepSeek ha fatto riferimento pubblicamente a una modalità minima Harness e ha reclutato sviluppatori open-source di harness per test interni. Non è stato trovato un repository pubblico completo, una specifica finale del prodotto o una data di rilascio confermata durante la verifica.
Strumenti correlati
- API DeepSeek: La piattaforma ufficiale per chiavi API, fatturazione e accesso diretto ai modelli DeepSeek.
- DeepSeek V4 Flash 0731 su Hugging Face: Checkpoint ufficiale open-weight, scheda del modello, tabella dei benchmark, licenza e istruzioni di distribuzione.
- vLLM: Un motore di servizio open-source ad alta produttività con supporto per DeepSeek V4 e DSpark.
- SGLang: Un framework di servizio open-source con un percorso di distribuzione pubblicato per V4 Flash 0731.
- OpenCode: Un agente di codifica open-source il cui servizio Zen elenca attualmente un'opzione V4 Flash gratuita a tempo limitato.
- Cline: Un agente di codifica open-source e piattaforma di modelli che offre DeepSeek V4 Flash tramite il suo ecosistema di provider.
- Nous Portal: Una piattaforma di inferenza multi-modello che ha eseguito una promozione limitata di DeepSeek V4 Flash.
- Artificial Analysis: Una piattaforma indipendente di analisi dei modelli che copre intelligenza, velocità, prezzo e costo dei benchmark.
Link correlati
- Registro delle modifiche DeepSeek del 31 luglio: Stato di rilascio ufficiale, risultati dei benchmark, note metodologiche, ambito API e dichiarazione post-addestramento.
- Modelli e prezzi DeepSeek: Prezzi ufficiali attuali, lunghezza del contesto, limite di output, funzionalità e concorrenza.
- Scheda del modello DeepSeek V4 Flash 0731: Note sull'architettura, confronto dei benchmark, livelli di sforzo di ragionamento, configurazione DSpark e licenza MIT.
- Scheda tecnica del modello DeepSeek V4: Architettura V4 originale, conteggi dei parametri, rapporto tecnico e valutazione della famiglia di modelli.
- Guida alla modalità di pensiero DeepSeek: Guida ufficiale per l'output di ragionamento e la conservazione di
reasoning_contenttra le chiamate agli strumenti. - Integrazioni agente DeepSeek: Esempio ufficiale per collegare V4 Flash a un harness di codifica del terminale.
- Modelli OpenCode Zen: Catalogo modelli attuale e informazioni sui modelli gratuiti a tempo limitato.
- Valutazione Artificial Analysis V4 Flash 0731: Punteggio composito indipendente, prezzo, valutazione dell'agente e osservazioni sull'affidabilità.
Riepilogo
DeepSeek V4 Flash 0731 mantiene la base del modello Preview
architettura e dimensioni, ma utilizza un nuovo post-addestramento per produrre un notevole salto nelle prestazioni degli agenti di coding. DeepSeek riporta 82,7 su Terminal Bench 2.1, 76,7 su CyberGym e 54,4 su DeepSWE, sebbene i risultati pubblici più forti per gli agenti di codice dipendano da una configurazione DeepSeek Harness non rilasciata.
Il prezzo ufficiale dell’API è insolitamente basso: $0,14 per milione di token di input non memorizzati nella cache, $0,0028 per milione di token di input memorizzati nella cache e $0,28 per milione di token di output. Le quote gratuite e gli sconti di terze parti possono rendere l’accesso ancora più economico, ma queste promozioni sono temporanee e non vanno confuse con il prezzo di listino permanente.
La pubblicazione open-weight con licenza MIT, il contesto da 1 milione di token, le API compatibili con Responses e Anthropic, e il supporto in vLLM e SGLang rendono il modello accessibile sia tramite servizi ospitati sia tramite percorsi autogestiti. La distribuzione locale completa rimane comunque un progetto infrastrutturale serio con più GPU.
I prototipi virali da sette e cinquanta centesimi sono esempi plausibili di quanto possa diventare basso il costo marginale del modello, ma non sono studi completi sui costi del prodotto. Cicli degli agenti, lunghezza dell’output, cache miss, strumenti, test e lavoro umano contano ancora.
DeepSeek V4 Flash 0731 è importante non perché ogni applicazione ora costi pochi centesimi, ma perché il coding agentico capace è diventato abbastanza economico da permettere a molti più sviluppatori di sperimentare su scala significativa.