DeepSeek V4 Flash crea un gioco sparatutto 3D con 0,07 dollari: ecco perché il modello è così economico

DeepSeek V4 Flash 0731 entra in versione beta pubblica e porta con sé una promessa familiare: capacità di coding e agentive più potenti a prezzi API estremamente bassi. Gli sviluppatori non hanno perso tempo a mettere alla prova questa affermazione.

发布于 2026年8月5日generalGEO 评分: 09 次阅读
Questa immagine è una visualizzazione relativa a DeepSeek V4 Flash 0731, con un'evidenziazione centrale del contenuto "$0.07 Game Demo". L'immagine menziona inoltre esplicitamente tre sezioni principali relative al prodotto: prezzi API, architettura e benchmark. Il design complessivo adotta uno stile tecnologico blu scuro, arricchito con elementi visivi come controller di gioco, grafici di dati e diagrammi strutturali, in linea con il posizionamento del prodotto per scenari di gioco. L'immagine presenta in modo diretto la struttura informativa di base del prodotto, in sintonia con il tema del documento che descrive i prezzi e i contenuti correlati di DeepSeek V4 Flash 0731.

DeepSeek V4 Flash ha creato un gioco sparatutto 3D per soli 0,07 dollari: perché questo modello è così economico

Introduzione

DeepSeek V4 Flash 0731 è entrato in versione beta pubblica, con una promessa familiare: capacità di coding e agente più elevate a prezzi API estremamente bassi.

Gli sviluppatori hanno rapidamente trasformato questa affermazione in esperimenti concreti.

Uno dei casi più diffusi proviene da un'esecuzione di Hermes Agent, in cui DeepSeek V4 Flash ha generato un gioco sparatutto 3D in prima persona giocabile con un solo prompt iniziale. Secondo quanto riportato, il progetto ha richiesto 32 minuti e il costo d'uso del modello è stato di soli 0,07 dollari.

Il risultato finale include:

  • Movimento in prima persona.
  • Salto.
  • Sparo.
  • Collisioni fisiche con l'ambiente.
  • Oggetti e bersagli per la copertura.
  • Contatore munizioni nell'interfaccia.

DeepSeek V4 Flash 0731 版本介绍图

CSA e HCA riducono i costi per contesti lunghi

DeepSeek V4 supporta una finestra di contesto di 1 milione di token.

I sistemi di attenzione tradizionali diventano estremamente costosi a questa scala, poiché ogni nuovo token potrebbe dover esaminare una grande quantità di contesto precedente e mantenere una cache KV di grandi dimensioni.

Il rapporto tecnico di DeepSeek descrive un design di attenzione ibrida che combina:

  • Attenzione sparsa compressa (CSA)
  • Attenzione a compressione elevata (HCA)

La strategia complessiva consiste nell'evitare un calcolo di attenzione completo e costoso sull'intera storia a ogni passaggio.

Il sistema comprime e filtra il contesto, consentendo al modello di concentrare il calcolo sulle informazioni più utili.

DeepSeek riporta che in un contesto di 1 milione di token, V4 Pro richiede:

Il 27% dei FLOPs di inferenza per singolo token di DeepSeek V3.2.

  • Il 10% della capacità della cache KV.

Queste percentuali esatte sono riportate nel paper tecnico per V4 Pro, non sono dati di audit separati per Flash.

V4 Flash utilizza la stessa famiglia architetturale, quindi beneficia degli stessi principi di progettazione per contesti lunghi.

Gli effetti concreti includono la riduzione di:

  • Memoria cache KV.
  • Pressione sulla memoria GPU.
  • Volume di dati trasferiti.
  • Calcolo per token.
  • Costi di servizio per contesti lunghi.

FP4 e FP8 riducono storage

e traffico di memoria

Il modello V4 Flash pubblicato utilizza pesi a precisione mista.

DeepSeek elenca:

Precisione mista FP4 + FP8

La precisione ridotta diminuisce la quantità di dati che devono essere memorizzati, caricati dalla memoria, trasferiti tra dispositivi e elaborati durante l'inferenza.

Questo è importante perché l'inferenza dei modelli linguistici moderni è spesso limitata dalla larghezza di banda della memoria, non solo dalla potenza di calcolo grezza.

Se l'hardware e i kernel sono progettati per eseguire efficientemente questo formato, rappresentazioni dati più piccole possono aumentare il throughput.

La bassa precisione non è gratuita per natura.

Una quantizzazione scadente degrada la qualità del modello.

La pubblicazione di DeepSeek è progettata e addestrata attorno allo schema di precisione scelto, non si affida solo a quantizzazioni comunitarie post-hoc.

Architettura invariata tra anteprima e 0731

DeepSeek afferma che la versione ufficiale 0731 mantiene la stessa architettura e scala del modello dell'anteprima V4 Flash.

L'azienda non ha eseguito un nuovo pre-addestramento completo per questo aggiornamento.

Ha invece rifatto il processo di post-addestramento.

L'articolo originale riassume i cambiamenti come:

  • Nuovo fine-tuning supervisionato.
  • Nuovo apprendimento per rinforzo GRPO.
  • Decodifica speculativa DSpark.
  • Miglior comportamento agente.
  • Maggiore throughput di servizio.

Il report tecnico di DeepSeek descrive il processo di post-addestramento V4 più ampio come:

  1. Sviluppo indipendente di moduli esperti di dominio.
  2. Fine-tuning supervisionato e apprendimento per rinforzo con GRPO.
  3. Distillazione di policy online.
  4. Integrazione delle capacità esperte in un singolo modello.

L'aggiornamento 0731 si concentra sul migliorare le prestazioni di queste capacità nei flussi di lavoro agente reali.

DSpark accelera la generazione di token

DeepSeek-V4-Flash-0731 include il modulo di decodifica speculativa DSpark.

La decodifica speculativa utilizza un percorso bozza più piccolo o più economico per proporre più token futuri.

Il modello principale valida queste proposte in batch.

Il processo semplificato è il seguente:

Il modulo bozza propone token
→ Il modello principale valida simultaneamente
→ I token accettati vengono emessi
→ I percorsi rifiutati vengono corretti

Quando le previsioni della bozza sono accurate, il sistema può generare più token accettati con meno passaggi di inferenza sequenziale costosi del modello principale.

DeepSeek offre supporto DSpark sia per vLLM che per SGLang.

Per vLLM, la scheda ufficiale del modello utilizza:

--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

Per SGLang, l'opzione corrispondente è:

--speculative-algorithm DSPARK

DeepSeek afferma che i pesi del modello target e del modello bozza sono memorizzati nello stesso checkpoint, quindi SGLang non richiede un percorso separato per il modello bozza.

La decodifica speculativa migliora principalmente la velocità di servizio e il throughput.

Non spiega da sola i miglioramenti nelle capacità di ragionamento del modello.

Questi miglioramenti derivano dal processo di post-addestramento aggiornato.

La pubblicazione ufficiale migliora i benchmark agente

DeepSeek riporta grandi miglioramenti in diversi test incentrati sugli agenti rispetto all'anteprima V4 Flash.

Benchmark V4 Flash 0731 V4 Flash anteprima V4 Pro anteprima
Terminal Bench 2.1 82.7 61.8 72.1
NL2Repo 54.2 39.4 38.5
CyberGym 76.7 38.7 52.7
DeepSWE 54.4 7.3

12.8 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 |
| Agents' Last Exam | 25.2 | 15.8 | 16.5 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 |
| DSBench-FullStack | 68.7 | 37.0 | 41.8 |
| DSBench-Hard | 59.6 | 25.8 | 31.1 |

L'immagine mostra le prestazioni di DeepSeek V4 Flash in diversi benchmark, confrontate con V4 Flash Preview e V4 Pro Preview. Terminal Bench 2.1 è 82.7, NL2Repo è 54.2, Cybergym è 76.7, DeepSWE è 54.4, Toolathlon verified è 70.3, Agent Last Exam è 25.2, Automation Bench (Public) è 25.1, DSBench-FullStack è 68.7, DSBench-Hard è 59.6. L'immagine corrisponde ai notevoli progressi di DeepSeek menzionati nel testo, mostrando visivamente il miglioramento delle prestazioni.

DeepSeek afferma che i benchmark pubblici per agenti di codice sono stati eseguiti con la seguente configurazione:

DeepSeek Harness modalità minima
reasoning_effort = max
top_p = 0.95
temperature = 1.0

Al momento dell'aggiornamento ufficiale, il framework di test non era stato ancora rilasciato pubblicamente.

DSBench-FullStack e DSBench-Hard sono benchmark interni di DeepSeek.

Ciò significa che i loro punteggi possono servire come prova riferita dall'azienda, ma non sono verificabili in modo indipendente come suite di benchmark completamente pubbliche.

Cosa misurano Terminal Bench e Toolathlon

Terminal Bench 2.1

Terminal Bench valuta la capacità di un agente di completare attività in un ambiente terminale.

Il modello può dover ispezionare file, eseguire comandi, installare dipendenze, diagnosticare guasti, modificare codice e verificare il completamento.

Un punteggio alto riflette la prestazione combinata di modello, framework agente, strategia degli strumenti, budget di ragionamento e ambiente di runtime.

Toolathlon-Verified

Toolathlon valuta attività a lungo ciclo che attraversano più applicazioni software e strumenti.

Il benchmark include scenari che coinvolgono calendari, filesystem, Notion, WooCommerce, Kubernetes e BigQuery.

Le attività richiedono multiple interazioni con gli strumenti e vengono verificate tramite valutatori basati sull'esecuzione.

Il punteggio di 70.3 riportato da DeepSeek è un grande miglioramento rispetto al modello di anteprima.

Ma non deve essere interpretato come una garanzia del 70.3% di successo per ogni automazione aziendale reale.

I miglioramenti nei benchmark non garantiscono il successo al primo tentativo per ogni gioco

L'esempio del gioco nella fonte rivela una differenza importante tra prestazioni nei benchmark e coding creativo.

V4 Flash è forte nelle valutazioni agente ufficiali, ma un confronto su un gioco ha comunque richiesto tre iterazioni.

I benchmark possono misurare i tassi di successo su insiemi di attività ben definiti e con regole di valutazione note.

I progetti creativi possono includere requisiti visivi ambigui, problemi di compatibilità del browser, errori del motore fisico, risorse mancanti, giudizi di qualità soggettivi e nessuna singola suite di test che definisca il successo.

In questo scenario, i modelli a basso costo sono particolarmente utili perché il flusso di lavoro può sopportare più iterazioni.

Il loro valore non risiede necessariamente nella perfezione alla prima generazione.

Potrebbe essere:

Qualità accettabile
×
Numerosi tentativi a costo contenuto

V4 Flash supporta più formati API

DeepSeek rende disponibile il modello attraverso:

  • Interfaccia Chat Completions compatibile con OpenAI.
  • API Responses compatibile con OpenAI.
  • API compatibile con Anthropic.
  • Output JSON.
  • Chiamate a strumenti.
  • Completamento prefissi in chat.
  • Completamento a riempimento intermedio in modalità non pensante.

L'URL Base compatibile con OpenAI è:

https://api.deepseek.com

L'URL base compatibile con Anthropic è:

https://api.deepseek.com/anthropic

DeepSeek dichiara che V4 Flash è attualmente l'unico modello API V4 a supportare la Responses API.

Il supporto per V4 Pro sarà pianificato separatamente.

La compatibilità con la Responses API consente inoltre al modello di essere utilizzato in Codex tramite la configurazione documentata da DeepSeek.

La modalità di pensiero è abilitata per impostazione predefinita

DeepSeek V4 Flash supporta la modalità di pensiero e quella non pensante.

La modalità di pensiero è quella predefinita.

Per l'inferenza locale, la scheda ufficiale del modello supporta tre livelli di sforzo di ragionamento:

low
high
max

DeepSeek consiglia:

temperature = 1.0
top_p = 0.95

per scenari agente.

Per i livelli di sforzo di ragionamento high e max, l'azienda consiglia di consentire una lunghezza massima di output fino a 384K token.

Impostazioni di ragionamento più elevate possono migliorare le prestazioni su compiti difficili, ma possono anche aumentare la latenza, il volume di output, i costi API e i tempi dei cicli agente.

I sistemi in produzione dovrebbero valutare il livello di sforzo più basso in grado di soddisfare in modo affidabile i requisiti del compito.

I pesi sono rilasciati con licenza MIT

DeepSeek ha pubblicato i pesi di V4 Flash 0731 su Hugging Face con licenza MIT.

Ciò rende il modello eccezionalmente permissivo rispetto a molte pubblicazioni commerciali di grandi dimensioni.

Gli sviluppatori possono utilizzare il repository ufficiale del modello con gli engine supportati, tra cui:

  • vLLM.
  • SGLang.
  • Transformers.
  • Docker Model Runner.
  • Versioni quantizzate compatibili con llama.cpp.
  • Build community compatibili con LM Studio.

Il modello è di grandi dimensioni.

Il modello principale ha 284B parametri e nel checkpoint 0731 è presente anche un componente DSpark.

Eseguirlo a velocità utilizzabile richiede notevoli risorse di memoria e hardware.

La possibilità di scaricare i pesi non implica che il modello completo possa funzionare fluidamente su un normale laptop consumer.

Le versioni quantizzate della community possono ridurre i requisiti di memoria, ma potrebbero alterare accuratezza, throughput, capacità di contesto, comportamento DSpark e affidabilità delle chiamate a strumenti.

V4 Flash è sempre la scelta più conveniente?

Le fonti riassumono che V4 Flash non produce sempre i migliori risultati in ogni confronto, ma è difficile da battere in termini di rapporto qualità-prezzo.

Questo è un riepilogo ragionevole degli esempi, con un'importante premessa:

Il rapporto qualità-prezzo dipende dall'intero flusso di lavoro.

V4 Flash è particolarmente interessante quando:

  • Il volume di richieste è elevato.
  • Gli errori sono facili da rilevare.
  • I compiti possono essere ritentati automaticamente.
  • La cache di contesto funziona bene.
  • I costi di revisione umana sono bassi.
  • Un codice compatto è accettabile.
  • L'applicazione può utilizzare modelli a pesi aperti.

Nei seguenti casi, i modelli frontier più costosi potrebbero comunque essere più economici in generale:

  • Un singolo risultato fallito comporta perdite significative.
  • L'affidabilità al primo tentativo è cruciale.
  • I compiti richiedono conoscenze più approfondite.
  • L'agente non può ritentare in sicurezza.
  • I costi di revisione umana sono elevati.
  • I modelli più piccoli producono output difficili da mantenere.

Il confronto corretto non è:

prezzo per token

ma:

costo per attività verificata completata con successo

Come valutare V4 Flash per progetti reali

Passo 1: Scegliere attività rappresentative

Non testare solo demo curate.

Utilizzare attività corrispondenti al carico di lavoro di produzione, inclusi scenari difficili e complessi.

Passo 2: Fissare l'ambiente agente

Mantenere coerenti prompt, strumenti, limiti di tempo, strategie di retry, framework, sandbox, suite di test e impostazioni di ragionamento tra i diversi modelli.

Passo 3: Registrare i costi completi

Tracciare input con cache miss, input con cache hit, token di output, chiamate a strumenti, numero di retry, tempi di esecuzione, revisione umana e tentativi falliti.

Passo 4: Misurare l'accettabilità, non solo la somiglianza visiva

Per il codice, eseguire test e verificare la manutenibilità.

Per i giochi, verificare controlli, collisioni, prestazioni e compatibilità del browser.

Passo 5: Testare il comportamento della cache

Quando un contesto stabile viene riutilizzato ripetutamente in più passaggi dell'agente, i modelli con prezzi di cache hit molto bassi diventano più preziosi.

Passo 6: Confrontare il primo tentativo e il successo finale

Un modello che riesce dopo tre tentativi economici può essere più conveniente di uno che riesce al primo colpo a prezzo elevato.

Quando i retry sono lenti o rischiosi, può valere anche il contrario.

Domande frequenti

Cos'è DeepSeek V4 Flash 0731?

DeepSeek V4 Flash 0731 è la versione post-addestramento ufficiale del modello V4 mistura di esperti su scala ridotta di DeepSeek. Sostituisce la versione di anteprima, aggiunge il modulo di decodifica speculativa DSpark e si concentra su attività agente di codifica e uso di strumenti.

Quanto costa l'API di DeepSeek V4 Flash?

DeepSeek ha attualmente annunciato i seguenti prezzi regolari: 0,0028 USD per milione di token di input con cache hit, 0,14 USD per milione di token di input con cache miss e 0,28 USD per milione di token di output. L'azienda ha annunciato che in futuro raddoppierà i prezzi nelle fasce orarie di punta specificate.

DeepSeek V4 Flash ha davvero creato un gioco 3D con 0,07 USD?

Uno sviluppatore ha riferito che una singola esecuzione di Hermes Agent ha generato un gioco sparatutto in prima persona giocabile in 32 minuti a un costo di 0,07 USD. Si tratta di un case study sui social media, non di un benchmark standardizzato, quindi i costi per altre attività potrebbero essere più alti o più bassi.

Quanti parametri ha DeepSeek V4 Flash?

Il report tecnico V4 elenca un totale di 284 miliardi di parametri per il modello Flash principale, con 13 miliardi di parametri attivati per token. Il repository completo della versione 0731 può mostrare circa 304 miliardi di parametri, poiché include il componente di decodifica speculativa DSpark allegato.

Perché DeepSeek V4 Flash è così economico?

Il suo basso costo deriva dall'attivazione sparsa della mistura di esperti, dall'attenzione a contesto lungo compresso, dalla precisione mista FP4/FP8, dalla cache dei prompt, dalla decodifica speculativa e dal servizio ad alta concorrenza. Ogni token attiva solo una piccola parte del totale degli esperti.

DeepSeek V4 Flash è migliore di Claude Opus 5 o GPT-5.6?

Agli attuali prezzi API, è molto più economico e ha mostrato prestazioni competitive in diverse demo della community. Opus 5 e GPT-5.6 possono ancora offrire una maggiore affidabilità o qualità al primo tentativo su alcune attività, e quei confronti virali non sono benchmark controllati.

DeepSeek V4 Flash può essere eseguito localmente?

Sì. DeepSeek ha rilasciato i pesi con licenza MIT e fornisce istruzioni per l'uso con vLLM e SGLang. Il modello completo è estremamente grande, quindi un'implementazione locale pratica richiede molta memoria accelerata o schemi di quantizzazione aggressivi della community.

V4 Flash supporta Codex e la Responses API?

Sì. DeepSeek afferma che la versione Flash ufficiale supporta nativamente la Responses API ed è stata adattata per l'uso con Codex. L'attuale API V4 Pro non supporta ancora la Responses API.

Strumenti correlati

  • DeepSeek API: endpoint ospitato ufficiale per DeepSeek V4 Flash e altri modelli supportati.
  • [DeepSeek V4 Flash

0731](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731): repository ufficiale del modello, con pesi, benchmark, licenza e guida alla distribuzione.

  • vLLM: un motore di inferenza ad alta produttività, con ricette ufficiali per V4 Flash e DSpark.
  • SGLang: un framework di servizio per LLM, con supporto documentato per V4 Flash e DSpark.
  • DeepSpec: repository di DeepSeek per la ricerca sulla decodifica speculativa e sui metodi DSpark.
  • Codex: un ambiente di codifica intelligente che può connettersi a V4 Flash tramite l'interfaccia compatibile con Responses API di DeepSeek.

Link correlati

Riepilogo

DeepSeek V4 Flash 0731 ha attirato molta attenzione perché gli sviluppatori hanno riferito di poter creare demo interattive complete con pochi centesimi. Secondo quanto riportato, un gioco sparatutto in prima persona è costato solo 0,07 dollari, mentre altri confronti sui social media mostrano costi delle attività decine di volte inferiori rispetto a Claude Opus 5 o GPT-5.6.

Questi esempi non sono benchmark controllati, ma i prezzi ufficiali dell'API supportano il punto centrale. V4 Flash costa 0,14 dollari per milione di token di input non memorizzati nella cache, 0,28 dollari per milione di token di output e solo 0,0028 dollari per i colpi in cache, un valore sorprendentemente basso.

La sua economicità deriva dall'intero sistema: un core MoE da 284B con 13B di parametri attivati per token, attenzione a contesto lungo compresso, pesi FP4/FP8, finestra di contesto di milioni di token, capacità di servizio efficienti e decodifica speculativa DSpark. L'aggiornamento 0731 mantiene l'architettura di anteprima e migliora il comportamento degli agenti tramite un nuovo addestramento posteriore.

La prova ufficiale più forte è il miglioramento dei benchmark. Terminal Bench 2.1 è salito da 61,8 a 82,7, Toolathlon-Verified da 49,7 a 70,3, mentre il modello mantiene il livello di prezzo Flash.

Il punto di forza di V4 Flash non è che vince in tutti i confronti, ma che il suo costo marginale estremamente basso rende

possibile, nella pratica, eseguire esperimenti agentici ripetutamente su una scala che molti modelli con prezzi premium difficilmente possono permettersi.