DeepSeek V4 Flash 0731: La demo di gioco da $0.07, prezzi API, architettura e benchmark di codifica

DeepSeek V4 Flash 0731 ha suscitato un'insolita combinazione di reazioni. Gli sviluppatori sono impressionati dai suoi punteggi negli agenti di codifica. I team delle infrastrutture sono interessati al suo milione di token di contesto e al suo prezzo competitivo, mentre il suo approccio architetturale ibrido MoE attira l'attenzione dei ricercatori.

发布于 2026年8月6日generalGEO 评分: 01 次阅读
Questa immagine è la copertina della guida di DeepSeek V4 Flash 0731, con uno stile tecnologico scuro, sfondo nero ed elementi luminosi blu di diverse tonalità. Il testo principale della copertina è "DeepSeek V4 Flash 0731 Guide". Sotto, sono indicati i contenuti principali: prezzi, benchmark, API e distribuzione locale. Nella parte inferiore sono presenti quattro icone tecnologiche rappresentative: un grafico statistico con il dollaro per i prezzi, un grafico a linee delle prestazioni per i benchmark, l'icona di un'interfaccia di codice per l'API e un'icona di server e chip per la distribuzione locale. Lo sfondo mostra inoltre un logo DeepSeek sfocato, in linea con il tema centrale dell'articolo che presenta DeepSeek V4 Flash 0731.

DeepSeek V4 Flash 0731: Come un Modello Ri-Post-Addestrato ha Innescato una Guerra Globale dei Prezzi

Introduzione

DeepSeek V4 Flash 0731 ha generato una combinazione insolita di reazioni.

Gli sviluppatori sono colpiti dai suoi punteggi sugli agenti di codifica.

I team di infrastruttura sono interessati al suo contesto da 1 milione di token e al basso numero di parametri attivi.

Le piattaforme AI offrono uso gratuito e sconti aggressivi.

E i social media si riempiono di screenshot di prototipi le cui fatture di inferenza riportate sono misurate in centesimi piuttosto che in dollari.

Gli esempi più ampiamente condivisi nell'articolo originale includevano:

  • Un piccolo prototipo di sparatutto 3D presumibilmente generato per circa 0,07 RMB.
  • Un prototipo in stile Counter-Strike presumibilmente prodotto per circa 0,50 RMB.
  • Una dashboard di utilizzo personale che mostra 87 milioni di token per 31,57 RMB.
  • OpenCode che riporta 8 trilioni di token DeepSeek Flash il 1° agosto.
  • Cline che aumenta la propria quota gratuita dopo aver scoperto che il modello era più economico da sovvenzionare del previsto.
  • Nous Portal che sconta temporaneamente V4 Flash 0731 del 90%.

Questi esempi catturano l'entusiasmo, ma possono anche confondere diverse cose distinte:

  1. Il prezzo ufficiale dell'API di DeepSeek.
  2. I prezzi con e senza cache-hit.
  3. L'accesso gratuito o sovvenzionato di terze parti.
  4. Il numero di chiamate agli strumenti che un agente esegue.
  5. La quantità di output e di ragionamento nascosto generato.
  6. Il costo del solo modello rispetto al costo del prodotto completo.

Il modello è genuinamente economico.

Ciò non significa che ogni applicazione costerà sette centesimi.

La domanda utile non è se un singolo demo virale sia riproducibile esattamente. È come DeepSeek abbia ottenuto un salto di capacità così grande senza cambiare l'architettura di base—e cosa significhino le nuove dinamiche economiche per gli sviluppatori.

Il Ciclo Globale degli Sconti

Il prezzo ufficiale dell'API era già basso prima dell'applicazione delle promozioni di terze parti.

DeepSeek attualmente elenca i seguenti prezzi per milione di token:

Tipo di utilizzo Prezzo DeepSeek V4 Flash
Input, cache hit $0,0028
Input, cache miss $0,14
Output $0,28

L'API supporta:

  • Una finestra di contesto da 1 milione di token.
  • Fino a 384K token di output.
  • Modalità di pensiero e non-pensiero.
  • Tre livelli di sforzo di ragionamento nella scheda del modello 0731: low, high e max.
  • Chiamate agli strumenti.
  • Output JSON.
  • Completamento del prefisso chat in beta.
  • Completamento FIM in modalità non-pensiero.
  • Chat Completions compatibili con OpenAI.
  • L'API Responses.
  • Un'interfaccia compatibile con Anthropic.
  • Un limite di concorrenza pubblicato di 2.500 per account per V4 Flash.

Questi prezzi ufficiali sono la base.

Le piattaforme possono quindi scegliere di:

  • Applicare il prezzo così com'è.
  • Aggiungere un margine.
  • Sovvenzionare l'utilizzo.
  • Offrire un modello gratuito limitato.
  • Includere il modello in un abbonamento.
  • Applicare crediti promozionali.
  • Instradare il traffico attraverso un altro provider di inferenza.

Questo è il motivo per cui uno sviluppatore può pagare il prezzo di listino di DeepSeek mentre un altro non paga nulla per un periodo limitato.

OpenCode Riporta Otto Trilioni di Token in un Solo Giorno

OpenCode ha dichiarato pubblicamente che DeepSeek Flash ha elaborato 8 trilioni di token il 1° agosto attraverso la sua piattaforma.

Il post suddivide la cifra come segue:

5T token di utilizzo gratuito
+
3T token attraverso OpenCode Go

L'immagine mostra un tweet di OpenCode datato 3 agosto, che afferma: "DeepSeek Flash ha elaborato 8 trilioni di token l'1 agosto, di cui 5 trilioni utilizzati gratuitamente e 3 trilioni su OpenCode Go". Questo tweet è correlato al contenuto in cui OpenCode dichiara pubblicamente che DeepSeek Flash ha elaborato 8 trilioni di token l'1 agosto, fungendo da spiegazione ufficiale di tali dati, e suddivide ulteriormente l'utilizzo gratuito e a pagamento, fornendo supporto dati alla discussione sul volume di token elaborati da DeepSeek Flash nel contesto.

La documentazione Zen attuale di OpenCode elenca un'opzione DeepSeek V4 Flash Free disponibile per un periodo limitato.

Questa è una distinzione importante.

La cifra di otto trilioni di token descrive il traffico attraverso OpenCode, non l'utilizzo diretto riportato da DeepSeek su tutte le piattaforme.

Resta comunque un segnale forte che i modelli a basso costo possono generare una domanda enorme quando vengono inseriti in un flusso di lavoro di agenti di codifica popolare.

Nous Portal Riduce Temporaneamente il Prezzo del 90%

Nous Research ha annunciato una promozione di sette giorni che offre DeepSeek V4 Flash 0731 con uno sconto del 90% tramite Nous Portal in collaborazione con Novita Labs.

L'immagine mostra un tweet di Nous Research riguardante la promozione di DeepSeek V4 Flash 0731. Il tweet afferma che durante il periodo promozionale su Nous Portal, il modello è disponibile con uno sconto del 90%, in collaborazione con Novita Labs, per i prossimi 7 giorni. Con il prezzo scontato, supera di oltre 1000 volte Fable 5 su compiti comparabili, mantenendo comunque la vittoria su Terminal-Bench 2.1. In fondo al tweet sono presenti i loghi di Jovita e Nous Research, insieme a un video di 13 secondi. L'immagine è strettamente correlata al contesto e presenta visivamente i dettagli promozionali di DeepSeek V4 Flash 0731 menzionati nel testo.

Il post promozionale ha confrontato il costo scontato con Claude Fable 5, affermando una differenza di prezzo superiore a 1.000 volte su compiti paragonabili.

Tale confronto dipende da diverse scelte:

  • Quale prezzo del fornitore viene utilizzato.
  • Se prevalgono i token di input o di output.
  • Se la memorizzazione nella cache è disponibile.
  • Quale impostazione di ragionamento viene selezionata.
  • Quanti token ciascun modello necessita per completare l'attività.
  • Quale benchmark o flusso di lavoro definisce "comparabile".

Un confronto del prezzo per token è utile, ma la metrica più significativa è:

Costo totale per attività accettata

Un modello che utilizza meno token costosi può essere più economico di un modello a basso prezzo che prova ripetutamente.

Al contrario, quando un modello a basso prezzo è anche abbastanza capace da completare rapidamente l'attività, il vantaggio in termini di costo può diventare enorme.

Cline Triplica la Quota Gratuita

Cline ha inizialmente annunciato l'utilizzo gratuito di V4 Flash 0731 tramite il suo agente di codifica.

Un successivo post pubblico ha dichiarato che la quota gratuita era stata triplicata perché l'economicità sembrava sostenibile.

Questo screenshot mostra due tweet correlati su una piattaforma social, riguardanti la spiegazione della quota gratuita di DeepSeek V4-Flash fornita da Cline. Il tweet in alto, pubblicato 22 ore fa, menziona che Cline ha ampliato la quota gratuita di deepseek v4-flash al triplo dell'originale, e che il servizio ha un'economia operativa sostenibile; il tweet in basso, pubblicato l'1 agosto, spiega che la piattaforma sta integrando il modello DeepSeek V4-Flash 0731 nel servizio, fornendo anche una guida in tre passaggi per installare e utilizzare il modello, oltre a mostrare l'interfaccia di prova di conversazione online del modello e i relativi dati di utilizzo.

Il catalogo modelli attuale di Cline e i materiali ClinePass includono DeepSeek V4 Flash come opzione rapida e orientata al valore per attività di codifica mirate.

Le quote gratuite e la disponibilità dei modelli possono cambiare, quindi gli utenti dovrebbero verificare la pagina del fornitore in tempo reale piuttosto che affidarsi a uno screenshot obsoleto.

La lezione più ampia è più duratura.

Quando l'inferenza diventa abbastanza economica, una piattaforma di agenti può utilizzare l'accesso gratuito come acquisizione clienti senza assorbire

lo stesso costo che dovrebbe sostenere con un modello premium di frontiera.

Gli Screenshot dei Costi della Community Necessitano di Contesto

L'articolo originale include una dashboard che mostra:

  • ¥31,57 di spesa.
  • 2.282 richieste API.
  • 87.027.995 token.

L'immagine mostra l'importo speso, il numero di richieste API e i token di Claude Code. L'importo speso è di ¥31,57 CNY, le richieste API sono 2.282 e i token sono 87.027.995. Il grafico sottostante presenta l'importo speso giornalmente dal 6 luglio al 4 agosto, con un picco evidente il 28 luglio. L'immagine è correlata alla sezione "Community Cost Screenshots Need Context" del documento e serve a illustrare l'ordine di grandezza che gli sviluppatori potrebbero osservare in condizioni d'uso favorevoli, ma non è sufficiente per ricostruire con precisione la fattura, poiché mancano numerose variabili.

Lo screenshot è utile perché dimostra l'ordine di grandezza che gli sviluppatori potrebbero osservare in condizioni d'uso favorevoli.

Non rivela informazioni sufficienti per ricostruire esattamente la fattura.

Le variabili mancanti includono:

  • Rapporto tra token di input e di output.
  • Percentuale di cache-hit.
  • Versione del modello utilizzata in ciascuna data.
  • Sforzo di ragionamento.
  • Numero di chiamate agli strumenti.
  • Richieste fallite.
  • Crediti promozionali.
  • Sconti del fornitore.
  • Se tutti i token fossero fatturabili alla stessa tariffa.

Un lungo prompt di sistema ripetuto può essere estremamente economico quando colpisce la cache.

Un lungo prompt unico inviato una sola volta viene fatturato al prezzo di input con cache-miss.

Anche l'output è molto più costoso dell'input in cache.

Per i sistemi agente, queste differenze dominano la fattura finale.

Flash Blitz: Cosa è Cambiato il 31 Luglio

DeepSeek V4 Preview è stato lanciato il 24 aprile 2026.

La famiglia comprendeva:

  • DeepSeek V4 Pro.
  • DeepSeek V4 Flash.

La versione Preview ha stabilito l'architettura principale:

  • Mixture of Experts sparsa.
  • Contesto da 1 milione di token.
  • Attenzione efficiente per contesti lunghi.
  • Basso numero di parametri attivi rispetto alla capacità totale.
  • Modalità di pensiero e non-pensiero.
  • Pesi aperti con licenza MIT.

V4 Flash Preview è stato posizionato come l'alternativa più piccola, veloce ed economica a V4 Pro.

L'aggiornamento del 31 luglio ha cambiato la sua posizione competitiva.

DeepSeek dichiara che V4 Flash 0731 utilizza la stessa architettura e dimensione del modello di V4 Flash Preview.

L'aggiornamento è stato prodotto eseguendo un nuovo processo di post-addestramento.

In forma semplificata:

Stessa architettura di base pre-addestrata
+
nuovo post-addestramento e ottimizzazione agente
=
comportamento agente di codifica molto più forte

Questo è importante perché mostra quanta capacità può rimanere latente in un modello pre-addestrato.

Architettura e numero di parametri non sono l'intero prodotto.

Il post-addestramento determina l'efficacia con cui il modello:

  • Utilizza gli strumenti.
  • Pianifica lavori multi-fase.
  • Gestisce il feedback del terminale.
  • Si riprende dagli errori.
  • Scriva e modifichi file.
  • Segua un protocollo agente.
  • Allochi lo sforzo di ragionamento.
  • Lavori all'interno di un harness.

Architettura di Base e Dettagli del Checkpoint

La scheda originale del modello V4 Flash descrive il modello di base come:

Specifica DeepSeek V4 Flash
Parametri MoE totali di base 284B
Parametri attivati 13B
Lunghezza del contesto 1M
Licenza MIT
Modalità principale Testo
Precisione di base FP8 / bassa precisione mista a seconda del checkpoint

La scheda del modello 0731 afferma che la nuova versione ha la stessa struttura della variante DSpark e include un modulo di decodifica speculativa allegato.

Questo spiega perché alcuni metadati dei file del modello potrebbero mostrare

un conteggio totale di checkpoint più grande rispetto alla cifra di 284B del modello MoE di base.

La descrizione più chiara è:

Il modello MoE sottostante di V4 Flash rimane di circa 284B totali con 13B parametri attivi, mentre la release 0731 include il componente aggiuntivo di decodifica speculativa DSpark nel checkpoint pubblicato.

Decodifica Speculativa DSpark

La decodifica speculativa utilizza un processo di bozza veloce per proporre diversi token futuri.

Il modello principale verifica poi queste proposte.

Quando le previsioni vengono accettate, il sistema può produrre più token con meno lavoro sequenziale.

La scheda del modello DeepSeek 0731 fornisce supporto esplicito per DSpark con vLLM e SGLang.

Per vLLM, la configurazione rilevante è:

--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

Per SGLang, la scheda del modello utilizza:

--speculative-algorithm DSPARK

DSpark non migliora di per sé il ragionamento del modello.

È un'ottimizzazione dell'inferenza volta a ridurre la latenza di decodifica o ad aumentare il throughput preservando la distribuzione di output del modello target nella configurazione supportata.

Il Salto nei Benchmark

DeepSeek pubblica il seguente confronto per V4 Flash 0731:

Benchmark V4 Flash 0731 V4 Flash Preview V4 Pro Preview
Terminal Bench 2.1 82.7 61.8 72.1
NL2Repo 54.2 39.4 38.5
CyberGym 76.7 38.7 52.7
DeepSWE 54.4 7.3 12.8
Toolathlon-Verified 70.3 49.7 55.9
Agents’ Last Exam 25.2 15.8 16.5
AutomationBench Public 25.1 10.8 12.8
DSBench-FullStack 68.7 37.0 41.8
DSBench-Hard 59.6 25.8 31.1

L'incremento più drammatico è DeepSWE:

7.3 → 54.4

CyberGym quasi raddoppia:

38.7 → 76.7

Terminal Bench 2.1 sale di oltre venti punti:

61.8 → 82.7

Il nuovo modello Flash supera inoltre V4 Pro Preview in ogni benchmark nella tabella pubblicata da DeepSeek.

Questo è un cambiamento importante per un modello originariamente posizionato principalmente come opzione più economica e veloce.

La Metodologia dei Benchmark Conta

La tabella non dovrebbe essere letta come un puro confronto di checkpoint grezzi.

La scheda del modello DeepSeek include diverse note importanti.

Per i task pubblici di code-agent, l'azienda ha utilizzato:

DeepSeek Harness modalità minima
Sforzo di ragionamento: max
Temperatura: 1.0
Top-p: 0.95

DeepSeek Harness non era stato rilasciato pubblicamente al momento della verifica.

Ciò significa che i ricercatori esterni potrebbero non essere ancora in grado di riprodurre l'ambiente software esatto utilizzato per i risultati pubblicati dei code-agent.

Due test sono anche interni:

  • DSBench-FullStack.
  • DSBench-Hard.

I benchmark interni possono essere utili per lo sviluppo del prodotto, ma i team indipendenti non possono ispezionare i loro task nascosti o i controlli di contaminazione.

L'interpretazione corretta è:

DeepSeek riporta un grande miglioramento nel suo stack agente e nella configurazione di valutazione scelti. La riproducibilità pubblica migliorerà quando harness, prompt, log e configurazione completa di valutazione saranno disponibili.

La Qualità dell'Harness Può Cambiare il Punteggio

Un benchmark di codifica spesso misura un sistema completo:

Modello
+
prompt di sistema
+
strumenti di repository
+
terminale

esecuzione
+
gestione del contesto
+
politica di ripetizione
+
feedback sui test
+
logica di invio delle patch


Lo stesso modello può ottenere punteggi diversi quando cambia un singolo componente.

Un harness migliore può:

- Selezionare file più pertinenti.
- Conservare output di terminale utili.
- Prevenire l'overflow del contesto.
- Ripetere intelligentemente i comandi falliti.
- Fermare loop improduttivi.
- Applicare patch in modo più affidabile.
- Fornire al modello risultati di test più chiari.

Questo non rende il modello irrilevante.

Significa che il risultato del benchmark appartiene alla combinazione modello-e-harness.

I forti numeri del 0731 suggeriscono che DeepSeek ha migliorato sia il comportamento agentico del modello sia il processo di valutazione circostante.

## Artificial Analysis Lo Valuta 50

Artificial Analysis riporta un punteggio di Intelligence Index di circa **50** per DeepSeek V4 Flash 0731, circa dieci punti sopra la versione Flash precedente.

La società indipendente di analisi dei modelli descrive inoltre V4 Flash come eccezionalmente economica rispetto ad altri noti sistemi di frontiera.

Reuters ha riassunto i risultati di Artificial Analysis riportando un costo medio di test benchmark di circa tre centesimi di dollaro statunitense secondo la sua metodologia.

Questo confronto supporta l'argomento del valore.

Non significa che ogni attività di produzione costi tre centesimi.

Artificial Analysis riporta anche risultati più deboli su alcune misure di affidabilità della conoscenza.

Il suo articolo su V4 Flash 0731 nota:

- L'accuratezza dell'omniscienza è rimasta intorno al 37%.
- Il tasso di allucinazioni è diminuito ma è rimasto elevato, circa all'84% in quella valutazione.

Queste cifre sono un utile promemoria.

Un modello può essere:

- Molto forte negli agenti di codifica.
- Estremamente economico.
- Competitivo su un indice composito.
- Ancora inaffidabile su alcune domande fattuali del mondo aperto.

"Il miglior rapporto qualità-prezzo" non è la stessa cosa di "il migliore per ogni attività".

## Prezzi Ufficiali dell'API

Il prezzo diretto dell'API DeepSeek è:

| Categoria di fatturazione | Prezzo per 1M token |
|-|-|
| Input con cache attiva | \$0.0028 |
| Input senza cache | \$0.14 |
| Output | \$0.28 |

Il divario di prezzo tra un input con cache attiva e uno senza cache è enorme:

```Plaintext
$0.14 ÷ $0.0028 = 50

L'input con cache è cinquanta volte più economico di quello senza cache.

Per agenti a lunga esecuzione, la struttura del prompt diventa architettura dei costi.

Esempio di Calcolo dei Costi

Supponiamo che una richiesta utilizzi:

100.000 token di input senza cache
20.000 token di output

Il costo diretto del modello è:

Input:
100.000 / 1.000.000 × $0.14
= $0.014

Output:
20.000 / 1.000.000 × $0.28
= $0.0056

Totale:
$0.0196

Questo è meno di due centesimi di dollaro statunitense.

Ora supponiamo che lo stesso prefisso di 100.000 token sia memorizzato nella cache:

Input con cache:
100.000 / 1.000.000 × $0.0028
= $0.00028

Output:
20.000 / 1.000.000 × $0.28
= $0.0056

Totale:
$0.00588

L'output ora domina la fattura.

Questi esempi spiegano perché i prototipi di codifica a basso costo sono plausibili.

Non includono:

  • Margini del fornitore.
  • Addebiti delle API degli strumenti.
  • Costi di browser o ricerca.
  • Calcolo in sandbox.
  • Archiviazione.
  • Tentativi falliti ripetuti.
  • Tempo di sviluppo umano.

Perché le Fatture degli Agenti Possono Ancora Crescere

La codifica agentica è raramente una singola richiesta.

Un flusso di lavoro tipico può includere:

  1. Leggere il repository.
  2. Cercare il codice pertinente.
  3. Pianificare la modifica.
  4. Modificare diversi file.
  5. Eseguire i test.
  6. Ispezionare il

fallimento.
7. Modifica di nuovo.
8. Esegui di nuovo i test.
9. Rivedi la diff.
10. Produci la risposta finale.

Ogni passaggio può comportare un’altra chiamata al modello.

Un compito apparentemente piccolo può diventare costoso quando:

  • Il contesto del repository non viene memorizzato nella cache ripetutamente.
  • Il modello genera lunghe sequenze di ragionamento.
  • I test falliscono molte volte.
  • L’agente legge file di grandi dimensioni inutilmente.
  • Più agenti paralleli duplicano il lavoro.
  • La compattazione del contesto causa il reinvio di informazioni importanti.
  • Il modello non si ferma dopo aver raggiunto una buona soluzione.

V4 Flash riduce il prezzo di questi errori.

Non li elimina.

La Cache del Contesto È la Leva Principale dei Costi

DeepSeek utilizza la cache del contesto basata su disco.

Quando lo stesso prefisso viene riutilizzato, i token di input corrispondenti possono beneficiare del prezzo più basso per hit in cache.

Buoni candidati per un prefisso stabile includono:

  • Istruzioni di sistema.
  • Policy del repository.
  • Definizioni degli strumenti.
  • Documenti di riferimento lunghi.
  • Uno snapshot invariato del progetto.
  • Contesto aziendale ripetuto.

Un design semplificato del prompt è:

Prefisso stabile riutilizzabile
+
nuova richiesta utente
+
ultimo risultato dello strumento

Un design meno favorevole alla cache è:

Istruzioni riordinate
+
riepilogo del repository riscritto
+
timestamp variabili
+
metadati casuali della richiesta
+
nuova richiesta utente

Piccole modifiche al prefisso possono ridurre il riutilizzo della cache.

Gli sviluppatori dovrebbero ispezionare i campi di utilizzo dei token piuttosto che presumere che un prompt lungo sia stato memorizzato nella cache.

DeepSeek offre anche l’isolamento tramite user_id per privacy e pianificazione. Il riutilizzo della cache e l’isolamento degli utenti dovrebbero essere progettati insieme per evitare che il contesto di un cliente venga accidentalmente mescolato con quello di un altro.

Avvio Rapido dell’API

L’URL di base ufficiale rimane:

https://api.deepseek.com

L’ID del modello è:

deepseek-v4-flash

DeepSeek afferma che l’ID API stabile serve automaticamente l’ultima versione Flash ufficiale.

Questo è comodo, ma i team di produzione dovrebbero registrare il fingerprint del modello restituito e testare le modifiche, perché il comportamento dietro un ID stabile può essere aggiornato.

Esempio in Python

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_DEEPSEEK_API_KEY",
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {
            "role": "user",
            "content": "Review this function and propose a safe refactor.",
        }
    ],
)

print(response.choices[0].message.content)

Esempio con cURL

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {
        "role": "user",
        "content": "Write a small Python CLI that validates JSON files."
      }
    ]
  }'

Gli sviluppatori dovrebbero consultare il riferimento API live per i campi esatti relativi a reasoning-effort e thinking-mode supportati dal proprio endpoint e dalla versione dell’SDK.

La Cronologia del Pensiero Deve Essere Preservata

La documentazione sulla modalità di pensiero di DeepSeek afferma che quando un turno include chiamate agli strumenti, il campo reasoning_content del messaggio dell’assistente deve essere ripassato nelle richieste successive.

Un agente multi-turno dovrebbe preservare:

  • content

reasoning_content

  • tool_calls

L'eliminazione dello stato di ragionamento può ridurre la continuità o causare problemi di validazione delle richieste.

Questo è particolarmente rilevante quando si integra tramite un client compatibile con OpenAI che normalmente ignora i campi di ragionamento specifici del provider.

Compatibilità con OpenAI, Anthropic e Responses API

DeepSeek offre più di un'interfaccia.

OpenAI Chat Completions

Utilizza l'URL di base standard di DeepSeek e l'ID del modello:

deepseek-v4-flash

API Compatibile con Anthropic

DeepSeek documenta anche un'interfaccia in formato Anthropic.

Questo può aiutare il software costruito attorno ai messaggi in stile Claude a connettersi a DeepSeek con meno modifiche all'applicazione.

La compatibilità non garantisce un comportamento identico.

I campi specifici del provider, la cronologia del ragionamento, gli schemi degli strumenti, il comportamento di sicurezza e la gestione degli errori richiedono comunque test.

Responses API

DeepSeek afferma che la versione 0731 supporta nativamente il formato Responses API ed è stata adattata per l'uso in stile Codex.

Questo è importante per i prodotti agenti di codifica che dipendono sempre più da oggetti di risposta stateful, chiamate agli strumenti e cicli agentici strutturati.

Pesi Aperti Sotto Licenza MIT

DeepSeek ha rilasciato i pesi di V4 Flash 0731 su Hugging Face sotto licenza MIT.

Ciò consente agli sviluppatori di ispezionare, modificare, distribuire e ridistribuire il modello secondo i termini della licenza.

Il rilascio dei pesi aperti offre maggiore controllo rispetto a un modello solo API.

I team possono:

  • Eseguire il modello su infrastruttura privata.
  • Studiarne l'architettura.
  • Creare varianti quantizzate.
  • Adattare i kernel di inferenza.
  • Affinarlo o specializzarlo.
  • Integrarlo in sistemi interni.
  • Evitare di inviare codice sensibile a un'API di terze parti.

La barriera pratica è l'hardware.

"Pesi aperti" non significa "gira su un normale laptop".

Distribuzione con vLLM

La scheda ufficiale del modello 0731 fornisce un esempio vLLM per un singolo nodo 4×GB300:

vllm serve deepseek-ai/DeepSeek-V4-Flash-0731 \
  --trust-remote-code \
  --kv-cache-dtype fp8 \
  --block-size 256 \
  --data-parallel-size 4 \
  --enable-expert-parallel \
  --moe-backend deep_gemm_mega_moe \
  --attention-config '{"use_fp4_indexer_cache": true}' \
  --speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

Questo esempio dimostra la classe di infrastruttura prevista per un servizio di qualità completa.

Non deve essere interpretato come l'unica configurazione supportata.

La ricetta vLLM potrebbe aggiungere supporto per altre topologie GPU nel tempo.

Distribuzione con SGLang

L'esempio ufficiale SGLang è:

sglang serve \
  --trust-remote-code \
  --model-path deepseek-ai/DeepSeek-V4-Flash-0731 \
  --tp 4 \
  --moe-runner-backend flashinfer_mxfp4 \
  --speculative-algorithm DSPARK \
  --mem-fraction-static 0.90 \
  --chunked-prefill-size 4096 \
  --swa-full-tokens-ratio 0.1

I pesi target e draft provengono dallo stesso checkpoint, quindi la documentazione indica di non impostare un percorso separato per il modello draft speculativo.

I motori di inferenza si evolvono rapidamente.

Utilizza la scheda del modello corrente e la ricetta del motore di servizio anziché copiare un vecchio comando di avvio dalla versione Preview.

La Distribuzione Locale è Ancora un Progetto di Infrastruttura

Anche se solo circa

13 miliardi di parametri sono attivi per un token, l'intero peso del modello deve rimanere disponibile in tutto il sistema di servizio.

La pianificazione del deployment deve considerare:

  • Archiviazione totale del modello.
  • Memoria GPU.
  • Parallelismo degli esperti.
  • Larghezza di banda dell'interconnessione.
  • Cache KV per contesto lungo.
  • Supporto alla quantizzazione.
  • Kernel DSpark.
  • Dimensione del batch.
  • Concorrenza.
  • Latenza di prefill.
  • Throughput di decodifica.

Quantizzazioni più piccole possono rendere possibile la sperimentazione su hardware diverso, ma possono modificare qualità, velocità o lunghezza del contesto supportata.

Per la maggior parte degli sviluppatori individuali, l'API diretta o un provider ospitato sarà più facile ed economico rispetto all'auto-hosting.

API Ufficiale Versus Provider di Terze Parti

Ci sono tre modi comuni per utilizzare V4 Flash.

Percorso Vantaggio principale Compromesso principale
API DeepSeek Prezzi ufficiali e modello ufficiale attuale I dati lasciano il tuo ambiente; l'ID stabile può essere aggiornato
Piattaforma di terze parti Quote gratuite, agenti integrati, fatturazione più semplice Promozioni e routing possono cambiare
Pesi auto-ospitati Massimo controllo e privacy Requisiti significativi di hardware e ingegneria

Il percorso più economico dipende dal carico di lavoro.

Una quota gratuita di Cline o OpenCode può essere la migliore per la sperimentazione.

L'API diretta può essere la migliore per un uso su piccola scala prevedibile.

L'auto-hosting può diventare interessante solo a volumi sufficientemente elevati e sostenuti o quando i requisiti di privacy predominano.

La Migliore Era per il Prototipaggio

L'articolo originale confronta l'IA economica con la produzione di massa di automobili.

L'analogia è imperfetta ma utile.

Quando una tecnologia diventa drammaticamente più economica, il mercato non compra semplicemente la stessa quantità a meno prezzo.

Nuovi usi diventano possibili.

I modelli agente a basso costo possono supportare esperimenti che in precedenza sarebbero stati rifiutati prima dei test.

Esempi includono:

  • Uno studente che costruisce un primo prototipo software.
  • Un fondatore singolo che genera e testa diverse idee di landing page.
  • Un piccolo team che esegue revisioni del codice su ogni pull request.
  • Un progetto open-source che offre triage gratuito dei problemi.
  • Un ricercatore che elabora una grande collezione di codice o documenti.
  • Un'azienda che crea agenti interni per lavori ripetitivi.
  • Uno sviluppatore di giochi che testa meccaniche e livelli generati.

Il valore non è che il modello sostituisca tutta l'ingegneria del software.

Riduce il costo di chiedersi:

Vale la pena sviluppare ulteriormente questa idea?

Un Prototipo Non È un Prodotto

La generazione economica può produrre una prima demo convincente.

Un prodotto in produzione ha ancora bisogno di:

  • Progettazione del prodotto.
  • Sicurezza.
  • Testing.
  • Accessibilità.
  • Prestazioni.
  • Monitoraggio.
  • Deployment.
  • Protezione dei dati.
  • Revisione legale.
  • Manutenzione.
  • Supporto clienti.

Una fattura del modello di sette centesimi non significa un'attività da sette centesimi.

Significa che il primo esperimento computazionale può essere abbastanza economico da tentare.

Questo cambia chi può partecipare e quante idee possono essere testate.

Un Esempio di Workspace Costruito dalla Comunità

L'articolo originale include un workspace documentale leggero mostrato come esempio di ciò che gli sviluppatori stavano costruendo con agenti di codifica economici.

![L'immagine mostra un'interfaccia di workbench documentale. A sinistra c'è una barra di navigazione con opzioni come "Tutti i documenti", "File", "Centro attività". In alto a destra mostra "Workbench di contesto", in basso ci sono sezioni come "Centro attività", "Elenco attività", "Dettagli attività". Nella parte centrale sono mostrati "Silicon Valley 101 - GPU", "RonnieChatterji - AI agentic", "RadiArk -

"Ottimizzazione dell'utilizzo della GPU" e altri titoli di documenti e parte del contenuto. In basso è presente l'opzione "Account file locale". L'immagine è correlata al contenuto della documentazione che introduce l'area di lavoro documentale, mostrando chiaramente il layout dell'interfaccia dell'area di lavoro e alcune informazioni sui documenti.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/08/ea723a10-dc29-41c2-9668-b104bd715b44-5355bdda-f7e2-4763-919d-43a90bf112fd.png)

Uno screenshot non può stabilire quanta parte dell'applicazione sia stata prodotta dal modello, quanto editing umano sia stato necessario, o se il prodotto sia sicuro e manutenibile.

Mostra comunque il tipo di progetto che i modelli di codifica a basso costo rendono più facile prototipare.

Dove si colloca al meglio V4 Flash

V4 Flash 0731 è particolarmente interessante quando:

  • L'attività è incentrata su codice o strumenti.
  • Il costo è un fattore molto rilevante.
  • Un contesto ampio è utile.
  • È previsto un volume elevato di richieste.
  • Il flusso di lavoro può convalidare gli output.
  • Nuovi tentativi occasionali sono accettabili.
  • È disponibile un modello fallback più grande per i casi difficili.

Potrebbe essere meno adatto quando:

  • L'accuratezza fattuale nel mondo aperto è fondamentale.
  • Una prima risposta raffinata conta più del costo.
  • L'attività richiede la comprensione delle immagini.
  • L'organizzazione non può convalidare il codice generato.
  • È richiesta una garanzia di conformità gestita.
  • Il flusso di lavoro dipende da un comportamento API stabile e con versione bloccata.

Un router di modelli può combinare Flash con un sistema più potente o più specializzato.

Per esempio:

Modifiche di routine al repository
→ V4 Flash

Decisioni ad alto rischio su architettura o sicurezza
→ modello più potente + revisione umana

I modelli economici cambiano l'architettura degli agenti

Quando le chiamate ai modelli sono costose, gli sviluppatori cercano di minimizzare ogni richiesta.

Quando le chiamate diventano economiche, un agente può permettersi di:

  • Chiedere a un altro modello di rivedere la patch.
  • Eseguire un passaggio separato di analisi dei test.
  • Generare diverse soluzioni candidate.
  • Confrontare implementazioni alternative.
  • Usare un modello per la pianificazione e un altro per l'esecuzione.
  • Ricontrollare il proprio lavoro prima dell'invio.

Questo può aumentare l'affidabilità.

Può anche sprecare token.

L'obiettivo giusto non è l'uso minimo di token.

È:

Il costo totale più basso che raggiunge la qualità richiesta

I principali rischi dietro la storia del prezzo

1. La beta pubblica può cambiare

DeepSeek descrive l'API Flash ufficiale come una beta pubblica.

Prezzi, comportamento, limiti e versioni del modello possono cambiare.

I team di produzione dovrebbero mantenere test di regressione.

2. I punteggi dei benchmark dipendono dall'harness di DeepSeek

I migliori risultati degli agenti di codice utilizzano una configurazione harness non rilasciata.

La riproduzione indipendente esatta non è ancora semplice.

3. Un input economico non garantisce un agente economico

Output, nuovi tentativi, strumenti e contesto non memorizzato nella cache possono dominare il costo finale.

4. Il contesto lungo non è gratuito

Una finestra da 1 milione di token è un limite di capacità, non una raccomandazione a inviare un milione di token in ogni richiesta.

I carichi di lavoro di prefill elevati aumentano latenza e costi.

5. L'affidabilità nel mondo aperto richiede ancora lavoro

La valutazione indipendente mostra che il valore e la forza nella codifica possono coesistere con un alto tasso di allucinazioni nei test fattuali.

I fatti critici dovrebbero essere verificati rispetto alle fonti.

6. Il codice generato richiede revisione

I modelli a basso costo possono generare più codice di quanto un team possa ispezionare in sicurezza.

Test automatizzati, analisi statica, scansione delle dipendenze e revisione umana rimangono necessari.

7. L'accesso promozionale è temporaneo

Modelli gratuiti di terze parti e sconti possono scomparire.

Non costruire un modello di business permanente basato su sussidi di sette giorni o promozioni a tempo limitato.

8. Gli ID API stabili possono nascondere aggiornamenti

L'ID del modello deepseek-v4-flash punta alla versione corrente.

Un aggiornamento dietro quell'ID può modificare gli output senza alcuna modifica al codice nella tua applicazione.

Checklist pratica per il controllo dei costi

1. Stabilizzare i prefissi riutilizzabili

Mantieni coerenti le istruzioni di sistema e le definizioni degli strumenti per migliorare il riutilizzo della cache.

2. Monitorare separatamente i token con cache attiva

Non affidarti solo al totale dei token di input.

3. Limitare gli output non necessari

Imposta un budget di output realistico per l'attività.

4. Utilizzare uno sforzo di ragionamento inferiore per le attività di routine

Riserva max per le attività che traggono beneficio da una deliberazione più lunga.

5. Limitare i passaggi dell'agente

Interrompi i loop che non stanno producendo progressi.

6. Eseguire validazioni economiche prima di un'altra chiamata al modello

Utilizza linter, test, validatori di schema e controlli deterministici.

7. Instradare i casi difficili

Escalation solo quando l'attività fallisce un test o supera una soglia di rischio.

8. Misurare il costo per risultato accettato

Includi i tentativi falliti e la revisione umana.

Un'altra cosa: DeepSeek Harness

L'articolo originale si conclude con un possibile passo successivo nell'ecosistema sviluppatori di DeepSeek.

Tianyi Cui, identificato nella fonte come la persona responsabile di DeepSeek Harness, ha pubblicato un messaggio di reclutamento per sviluppatori di progetti open-source di agent-harness.

Il messaggio invitava gli sviluppatori interessati a condividere un account GitHub e lavori open-source rappresentativi per partecipare ai test interni.

L'immagine è un tweet di Tianyi Cui, che invita gli sviluppatori interessati a progetti open-source legati ad Agent Harness a partecipare ai beta test interni di DeepSeek Harness, contattandolo via risposta o messaggio privato, allegando il proprio ID GitHub e i lavori open-source rappresentativi. Il tweet è stato modificato l'ultima volta il 1 agosto 2026 alle 19:46, con 1K commenti, 496 retweet, 2.9K mi piace, 1.8K salvataggi e 879.7K visualizzazioni. Questo tweet è correlato alle informazioni sull'invito ai beta test interni per sviluppatori di DeepSeek Harness nel documento, ed è il messaggio di reclutamento pubblicato da Tianyi Cui menzionato nel documento.

Anche il changelog del 31 luglio di DeepSeek afferma che la modalità minima di DeepSeek Harness utilizzata per la valutazione dei benchmark è "in arrivo a breve".

Al momento della verifica, non ho trovato:

  • Un repository ufficiale pubblico di DeepSeek Harness.
  • Una pagina prodotto stabile per "DeepSeek Code".
  • Istruzioni di installazione pubbliche.
  • Prezzi.
  • Una data di rilascio.
  • Una specifica completa delle funzionalità.

Le prove supportano questa conclusione più ristretta:

DeepSeek sta testando un agent harness e intende rilasciare almeno parte del framework, ma il nome finale del prodotto, l'ambito pubblico e i tempi di lancio rimangono non confermati.

Il modello, l'API e i pesi aperti sono disponibili ora.

L'harness è ancora un componente futuro dell'ecosistema.

Perché DeepSeek Harness potrebbe essere importante

Un harness di prima parte potrebbe aiutare DeepSeek a controllare l'intero stack dell'agente di codifica.

Potrebbe offrire:

  • Gestione nativa della cronologia del ragionamento.
  • Formati di prompt specifici per modello.
  • Parsing delle chiamate agli strumenti.
  • Gestione del contesto.
  • Ricerca nel repository.
  • Esecuzione nel terminale.
  • Riproducibilità dei benchmark.
  • Integrazione con l'API Responses.
  • Flussi di lavoro compatibili con Codex.
  • Controlli dei costi.
  • Instradamento automatico tra Flash e Pro.

DeepSeek documenta già integrazioni con harness esterni e agenti di codifica.

Uno strumento di prima parte potrebbe trasformare le ottimizzazioni specifiche per benchmark in un prodotto che gli sviluppatori ordinari possono utilizzare.

Potrebbe anche rivelare quanto del balzo nei benchmark di V4 Flash 0731 derivi dal checkpoint e quanto dall'ambiente di esecuzione dell'agente.

Cosa Osservare in Seguito

Diversi sviluppi determineranno se il momento V4 Flash diventerà un cambiamento duraturo per l'ecosistema.

Rilascio Ufficiale di V4 Pro

DeepSeek afferma che il rilascio ufficiale di V4 Pro seguirà l'aggiornamento Flash.

Il divario in termini di prestazioni e prezzo tra Pro e Flash influenzerà le decisioni di instradamento.

Disponibilità di DeepSeek Harness

Un rilascio pubblico migliorerebbe la riproducibilità dei benchmark e fornirebbe agli sviluppatori un framework agente nativo del modello.

Stabilità dei Prezzi

Il prezzo diretto è già basso, ma le promozioni di terze parti potrebbero non rimanere.

Capacità del Provider

L'inferenza economica attira un traffico molto elevato.

Latenza, limiti di velocità e affidabilità saranno importanti man mano che l'utilizzo cresce.

Supporto per Inferenza Open-Source

vLLM, SGLang, i fornitori di hardware e i progetti di quantizzazione determineranno quanto sarà accessibile l'auto-hosting.

Valutazioni Indipendenti

Più valutazioni pubbliche dovrebbero testare:

  • Codifica.
  • Sicurezza.
  • Affidabilità fattuale.
  • Contesto lungo.
  • Uso di strumenti.
  • Costo per attività riuscita.
  • Prestazioni con diversi harness.

Domande Frequenti

Cos'è DeepSeek V4 Flash 0731?

DeepSeek V4 Flash 0731 è la versione ufficiale del 31 luglio di V4 Flash, attualmente servita tramite l'API deepseek-v4-flash in beta pubblica. DeepSeek afferma che mantiene l'architettura di base e le dimensioni del modello Preview migliorando sostanzialmente le capacità dell'agente attraverso un nuovo post-training.

Quanto costa DeepSeek V4 Flash?

L'API ufficiale di DeepSeek elenca $0,14 per milione di token di input con cache miss, $0,0028 per milione di token di input con cache hit e $0,28 per milione di token di output. Le piattaforme di terze parti possono offrire prezzi diversi, quote gratuite o sconti temporanei.

Un gioco 3D costa davvero solo 0,07 RMB da generare?

L'articolo originale cita un esempio della community con quel costo di modello riportato. L'esempio non è accompagnato da prompt completi, log dei token, dati di cache, tentativi, costi degli strumenti o registri del lavoro umano, quindi dovrebbe essere trattato come un aneddoto piuttosto che come un budget garantito.

Quali sono i principali punteggi benchmark di V4 Flash 0731?

DeepSeek riporta 82,7 su Terminal Bench 2.1, 76,7 su CyberGym, 54,4 su DeepSWE, 70,3 su Toolathlon-Verified e 54,2 su NL2Repo. Le valutazioni pubbliche degli agenti di codice hanno utilizzato la modalità minima non rilasciata di DeepSeek Harness con il massimo sforzo di ragionamento.

DeepSeek V4 Flash 0731 è open source?

I pesi del modello e il repository sono rilasciati sotto la Licenza MIT, quindi "open-weight" e uso ampiamente permissivo sono descrizioni accurate. L'esecuzione del checkpoint completo richiede comunque un'infrastruttura multi-GPU sostanziale.

DeepSeek V4 Flash può essere eseguito localmente?

Sì, DeepSeek pubblica pesi e istruzioni di servizio per vLLM e SGLang. Gli esempi ufficiali su larga scala utilizzano hardware multi-GPU avanzato, quindi un normale laptop non è l'ambiente target per il modello completo.

Qual è la finestra di contesto?

L'API ufficiale e la scheda del modello specificano una finestra di contesto di 1 milione di token. L'API elenca anche una

lunghezza massima di output di 384K token, ma l'utilizzo del contesto o dell'output massimi può aumentare significativamente la latenza e l'uso delle risorse.

Sono stati rilasciati DeepSeek Code o DeepSeek Harness?

DeepSeek ha fatto riferimento pubblicamente a una modalità minima Harness e ha reclutato sviluppatori open-source di harness per test interni. Non è stato trovato un repository pubblico completo, una specifica finale del prodotto o una data di rilascio confermata durante la verifica.

Strumenti correlati

  • API DeepSeek: La piattaforma ufficiale per chiavi API, fatturazione e accesso diretto ai modelli DeepSeek.
  • DeepSeek V4 Flash 0731 su Hugging Face: Checkpoint ufficiale open-weight, scheda del modello, tabella dei benchmark, licenza e istruzioni di distribuzione.
  • vLLM: Un motore di servizio open-source ad alta produttività con supporto per DeepSeek V4 e DSpark.
  • SGLang: Un framework di servizio open-source con un percorso di distribuzione pubblicato per V4 Flash 0731.
  • OpenCode: Un agente di codifica open-source il cui servizio Zen elenca attualmente un'opzione V4 Flash gratuita a tempo limitato.
  • Cline: Un agente di codifica open-source e piattaforma di modelli che offre DeepSeek V4 Flash tramite il suo ecosistema di provider.
  • Nous Portal: Una piattaforma di inferenza multi-modello che ha eseguito una promozione limitata di DeepSeek V4 Flash.
  • Artificial Analysis: Una piattaforma indipendente di analisi dei modelli che copre intelligenza, velocità, prezzo e costo dei benchmark.

Link correlati

Riepilogo

DeepSeek V4 Flash 0731 mantiene la base del modello Preview

architettura e dimensioni, ma utilizza un nuovo post-addestramento per produrre un notevole salto nelle prestazioni degli agenti di coding. DeepSeek riporta 82,7 su Terminal Bench 2.1, 76,7 su CyberGym e 54,4 su DeepSWE, sebbene i risultati pubblici più forti per gli agenti di codice dipendano da una configurazione DeepSeek Harness non rilasciata.

Il prezzo ufficiale dell’API è insolitamente basso: $0,14 per milione di token di input non memorizzati nella cache, $0,0028 per milione di token di input memorizzati nella cache e $0,28 per milione di token di output. Le quote gratuite e gli sconti di terze parti possono rendere l’accesso ancora più economico, ma queste promozioni sono temporanee e non vanno confuse con il prezzo di listino permanente.

La pubblicazione open-weight con licenza MIT, il contesto da 1 milione di token, le API compatibili con Responses e Anthropic, e il supporto in vLLM e SGLang rendono il modello accessibile sia tramite servizi ospitati sia tramite percorsi autogestiti. La distribuzione locale completa rimane comunque un progetto infrastrutturale serio con più GPU.

I prototipi virali da sette e cinquanta centesimi sono esempi plausibili di quanto possa diventare basso il costo marginale del modello, ma non sono studi completi sui costi del prodotto. Cicli degli agenti, lunghezza dell’output, cache miss, strumenti, test e lavoro umano contano ancora.

DeepSeek V4 Flash 0731 è importante non perché ogni applicazione ora costi pochi centesimi, ma perché il coding agentico capace è diventato abbastanza economico da permettere a molti più sviluppatori di sperimentare su scala significativa.