DeepSeek V4 Flash crée un jeu de tir 3D pour 0,07 $ — voici pourquoi ce modèle est si économique

DeepSeek V4 Flash 0731 entre en version bêta publique avec une promesse familière : des capacités de codage et d'agent plus puissantes à des prix API extrêmement bas. Les développeurs n'ont pas tardé à mettre cette affirmation à l'épreuve.

发布于 2026年8月5日generalGEO 评分: 06 次阅读
Cette image est une illustration de présentation de DeepSeek V4 Flash 0731, mettant en avant le contenu clé « Démo de jeu à 0,07 $ ». Elle mentionne également trois piliers principaux liés au produit : tarification API, architecture et benchmarks. La conception adopte un style technologique bleu foncé, intégrant des éléments visuels tels qu'une manette de jeu, des graphiques de données et des schémas structurels, en phase avec le positionnement du produit pour les scénarios de jeu. Elle présente clairement le cadre d'informations de base du produit et fait écho au thème de la documentation qui décrit les prix et les sections de contenu de DeepSeek V4 Flash 0731.

DeepSeek V4 Flash a créé un jeu de tir 3D pour seulement 0,07 $ — pourquoi ce modèle est-il si bon marché

Introduction

DeepSeek V4 Flash 0731 est entré en version bêta publique avec une promesse familière : offrir des capacités améliorées de codage et d'agent à des prix API extrêmement bas.

Les développeurs ont rapidement transformé cette affirmation en expériences concrètes.

L'un des exemples les plus partagés provient d'une exécution d'Hermes Agent, où DeepSeek V4 Flash a généré un jeu de tir 3D à la première personne jouable à partir d'une seule invite initiale. Le projet aurait pris 32 minutes, avec un coût d'utilisation du modèle de seulement 0,07 $.

Le résultat final comprend :

  • Des déplacements à la première personne.
  • Des sauts.
  • Des tirs.
  • Des collisions physiques avec l'environnement.
  • Des objets de couverture et des cibles.
  • Un compteur de munitions dans l'interface.

Il s'agit d'une capture d'écran de la démo du jeu de tir 3D généré par DeepSeek V4 Flash 0731, correspondant au cas mentionné dans le document d'un jeu de tir 3D jouable généré avec ce modèle dans Hermes Agent. La capture provient du contenu publié par le compte nommé Elshayib, qui mentionne que la génération de ce jeu n'a pris que 32 minutes pour un coût de 0,07 $, et indique également que le modèle est si peu coûteux que 2 $ de frais d'utilisation peuvent couvrir une journée entière d'expérimentation. L'écran de jeu présente la scène à la première personne de la démo, incluant les éléments d'interface de jeu correspondant aux fonctionnalités de déplacement et de tir, ainsi qu'un compteur de munitions, en écho à la liste des fonctionnalités du jeu mentionnée dans le document.

La conclusion virale est simple : à ce prix, deux dollars suffisent pour une journée entière d'expérimentation.

Cette affirmation ne doit pas être interprétée comme une garantie de coût quotidien universel. Les dépenses liées aux agents dépendent de la longueur des invites, du volume de sortie, du nombre de tentatives, des appels d'outils, du taux de succès du cache, des frais généraux du framework et de la complexité de la tâche.

Néanmoins, cette démonstration capture l'attrait principal de V4 Flash : le modèle est suffisamment bon marché pour que les développeurs puissent laisser leurs agents itérer en continu, plutôt que de considérer chaque tentative comme une dépense coûteuse.

La tarification officielle de l'API du modèle aide à expliquer pourquoi.

DeepSeek V4 Flash 0731 est désormais la version Flash officielle

DeepSeek a publié la version de production de V4 Flash dans la bêta publique de l'API le 31 juillet 2026.

Le nom du modèle API reste inchangé :

deepseek-v4-flash

Les requêtes utilisant ce modèle accèdent désormais à DeepSeek-V4-Flash-0731.

DeepSeek indique que la version 0731 remplace le modèle de préversion et améliore considérablement les capacités d'agent.

Cette mise à jour s'applique spécifiquement à :

  • L'API DeepSeek V4 Flash.
  • Les poids du modèle V4 Flash publics.
  • La compatibilité avec l'API Responses.
  • L'intégration pour Codex.

Elle ne remplace pas :

  • L'API DeepSeek V4 Pro.
  • Le modèle utilisé dans l'application web DeepSeek.
  • Le modèle utilisé dans l'application mobile DeepSeek.

DeepSeek a également précisé que la version officielle de V4 Pro sera publiée séparément.

Des prix API officiels extrêmement bas

Les prix API classiques actuellement affichés par DeepSeek sont, par million de tokens :

Élément facturé DeepSeek V4 Flash
Entrée avec cache atteint 0,0028 $
Entrée sans cache 0,14 $
Sortie 0,28 $
Longueur de contexte 1 million de tokens
Sortie maximale 384 000 tokens
Mode de raisonnement par défaut Thinking
Limite de concurrence 2 500

Le prix avec cache atteint est particulièrement avantageux.

À 0,0028 $ par million de tokens d'entrée en cache, un agent de longue durée peut réutiliser de manière répétée des préfixes stables — comme les instructions système, les schémas d'outils ou le contexte du dépôt — sans payer à chaque fois le prix complet sans cache.

DeepSeek a également annoncé une future tarification selon les périodes de pointe et creuses.

Politique de tarification.

Lorsque cette politique entrera en vigueur, tous les prix affichés seront doublés pendant les heures suivantes (heure de Pékin) :

09:00–12:00
14:00–18:00

Au moment où la page de tarification a été examinée pour cet article, DeepSeek n'avait pas encore précisé la date d'effet définitive.

Par conséquent, les applications devront consulter la page de tarification officielle avant de s'appuyer sur un prix fixe à long terme.

Un centime contre un dollar

L'article original compare DeepSeek V4 Flash à Claude Opus 5 à travers un petit projet de jeu de tir spatial.

D'après le rapport, les deux versions ont toutes deux réalisé :

  • Le déplacement du vaisseau.
  • La fonction de tir.
  • Des astéroïdes destructibles.
  • Des objets à collecter.
  • Une boucle de jeu jouable.

Les différences apparaissent dans le chemin d'exécution.

Selon la comparaison du développeur :

Détail DeepSeek V4 Flash Claude Opus 5
Nombre de tentatives avant d'atteindre un résultat acceptable 3 1
Volume approximatif de code 900 lignes près de 3 000 lignes
Coût du modèle rapporté $0,01 $1,00

Opus a réussi du premier coup, tandis que V4 Flash a nécessité des itérations supplémentaires.

Le projet final est décrit comme fonctionnellement suffisamment similaire pour que la différence de coût de 100 fois rapportée devienne le point central de la discussion.

Il ne s'agit pas d'un benchmark de modèles contrôlé.

La comparaison ne publie pas de pack de reproductibilité complet couvrant :

  • Le même framework d'agents.
  • Des invites et messages de suivi strictement identiques.
  • Les journaux d'appels d'outils.
  • Les limites de temps d'exécution.
  • Les règles de calcul des tokens.
  • Les paramètres de calcul du modèle.
  • Les interventions humaines.
  • La fourniture ou non de ressources ou de code modèle.

Ce résultat doit donc être considéré comme une anecdote de développeur intéressante, et non comme une preuve que V4 Flash est systématiquement 100 fois moins cher qu'Opus 5 pour un travail équivalent.

DeepSeek V4 Flash contre GPT-5.6 Sol

Une autre comparaison a demandé à DeepSeek V4 Flash et GPT-5.6 Sol de construire un petit jeu de navigation 3D dans une rivière.

D'après le rapport, les deux ont produit :

  • Un décor fluvial complet.
  • Des déplacements gauche/droite.
  • Des collisions avec les obstacles.
  • Un suivi du score.
  • Des arbres et un paysage lointain.
  • Des interactions principales similaires.

Les coûts rapportés sont :

Modèle Coût rapporté
DeepSeek V4 Flash $0,05
GPT-5.6 Sol $2,47

Cela représente une différence proche de 50 fois lors de cette exécution spécifique.

![L'image montre un tweet avec le contenu : « DeepSeek est ridiculement bon marché. GPT-5.6 → 2,47 $ DeepSeek → 0,05 $ La façon dont DeepSeek réussit cette tarification est incroyable. 50 fois moins cher que GPT 5.6 avec une sortie similaire. » Le tweet est publié par l'utilisateur Dipankar, dont l'avatar montre un homme portant des lunettes. L'image est étroitement liée au contexte et illustre la comparaison des coûts de développement de jeux entre DeepSeek V4 Flash et GPT-5.6 Sol, montrant que le prix de DeepSeek est bien inférieur à celui de GPT-5.6, en soulignant le caractère étonnant de sa stratégie de tarification.](https://we0-cms.oss-cn-beijing.aliyuncs.

com/cms-assets/image/2026/08/7e9939d1-1af3-498a-9747-03470f1e858d-44a7f7e1-4473-425a-97a8-4dcd163b4903.png)

Les effets visuels ont été décrits comme globalement similaires, bien que la version DeepSeek utilise un environnement à plus petite échelle.

De même, cette comparaison reste anecdotique.

GPT-5.6 Sol et DeepSeek V4 Flash présentent des comportements de raisonnement par défaut, des structures de prix, des systèmes de gestion de contexte, des frameworks d'agents et des règles de calcul de tokens différents.

Une comparaison équitable en environnement de production devrait mesurer :

Coût total des tâches
÷
Nombre de résultats acceptables et réussis

Cette

La requête individuelle la moins chère n'est pas toujours le projet complet le moins coûteux.

Un modèle qui nécessite de nombreuses tentatives, génère du code difficile à maintenir ou exige une révision humaine intensive peut perdre son avantage tarifaire initial.

L'impact du nombre de tokens sur le coût peut dépasser celui de la qualité visuelle

L'article décrit également un test où GPT-5.6 Luna et DeepSeek V4 Flash ont généré un modèle 3D de style Pokémon selon les mêmes exigences.

Les résultats visuels rapportés sont difficiles à départager clairement, mais le volume total de tokens de sortie diffère considérablement :

Modèle Volume de sortie rapporté
GPT-5.6 Luna Plus de 2,3 millions de tokens
DeepSeek V4 Flash Environ 477 000 tokens

La différence de coût total rapportée pour la tâche est proche de 14 fois.

La leçon clé n'est pas qu'un modèle utilise toujours exactement ce nombre de tokens.

Elle est que l'économie des agents dépend de bien plus que le prix affiché par million de tokens.

Le coût total est déterminé par :

  • La redondance de la sortie.
  • Les réécritures répétées de fichiers.
  • Les journaux d'appels d'outils.
  • Les tokens de raisonnement.
  • Les tentatives échouées.
  • La relecture du contexte.
  • La réutilisation du cache.
  • La quantité de code généré.
  • Le comportement du framework d'agents.

Le prix unitaire par token d'un modèle peut être relativement bas, mais s'il produit des sorties inutiles, il peut néanmoins devenir coûteux.

La proposition de valeur de V4 Flash combine un prix affiché plus bas et des performances relativement compactes dans plusieurs exemples rapportés.

Deux heures d'expérimentation pour seulement sept cents

Un autre développeur a indiqué avoir passé près de deux heures à expérimenter pour seulement sept cents.

L'image est un tweet publié par @Samking207 à la date du 1er août. Le contenu du tweet est « Yea was playing with it today for almost 2 hrs and I only spent 7 cents, I'm like wtf 😳😂 Ouais, j'ai joué avec aujourd'hui pendant presque 2 heures et je n'ai dépensé que 7 cents, je suis comme wtf 😳😂 ». Ce tweet est présenté de manière bilingue en anglais et en chinois, exprimant l'étonnement de l'auteur d'avoir joué près de 2 heures avec le modèle DeepSeek V4 Flash pour seulement 7 cents. Ce tweet est étroitement lié au contexte et illustre directement le cas mentionné dans le document de « presque deux heures d'expérimentation pour seulement 7 cents », démontrant par un exemple concret l'impact du faible coût marginal sur le comportement des développeurs.

Ce commentaire illustre comment un faible coût marginal modifie le comportement des utilisateurs.

Lorsqu'un appel de modèle semble coûteux, les développeurs ont tendance à :

  • Limiter le nombre d'itérations.
  • Raccourcir les invites.
  • Éviter les branches exploratoires.
  • S'arrêter dès que le résultat est « assez bon ».
  • Réserver les agents aux travaux à forte valeur ajoutée.

Lorsque le coût se mesure en cents, les développeurs peuvent se permettre davantage de :

  • Tâtonnements.
  • Pistes parallèles.
  • Tests automatisés.
  • Tentatives de correction.
  • Tâches de fond de longue durée.
  • Petites expériences qui auraient autrement été sautées.

Cela ne signifie pas que la puissance de calcul est gratuite.

À l'échelle de l'entreprise, des fractions de cent multipliées par des millions d'appels représentent toujours une dépense considérable.

Le changement le plus significatif est que le seuil d'expérimentation devient bien plus bas.

Pourquoi DeepSeek V4 Flash est-il si bon marché ?

L'article attribue le faible coût de V4 Flash à plusieurs choix architecturaux et systémiques.

Les principaux facteurs comprennent :

  1. Le calcul avec mélange d'experts (MoE) parcimonieux.
  2. Un mécanisme d'attention à contexte long compressé.
  3. Des poids de modèle en basse précision.
  4. Un décodage spéculatif via DSpark.
  5. Des améliorations post-entraînement sans nécessiter un pré-entraînement complet supplémentaire.
  6. Un service API à haute concurrence.

Chaque élément réduit une catégorie différente de coûts.

Un modèle à 284 milliards de paramètres n'activant que 13 milliards

Le cœur du DeepSeek V4

Flash repose sur une architecture de mélange d'experts (MoE).

Le rapport technique liste les informations suivantes :

Détail d'architecture DeepSeek V4 Flash
Paramètres du modèle principal 284 milliards
Paramètres activés par token 13 milliards
Longueur de contexte 1 million de tokens
Données d'entraînement Plus de 32 billions de tokens
Précision principale Précision mixte FP4 + FP8

Bien que le modèle stocke des centaines de milliards de paramètres, tous ne sont pas traversés pour chaque token.

Le mécanisme de routage sélectionne un petit sous-ensemble d'experts.

Cela réduit la quantité de calcul actif nécessaire par token, tout en conservant l'accès à un pool de paramètres plus vaste.

Une façon simplifiée de comparer :

Modèle dense :
Chaque token → La plupart ou la totalité des poids du modèle

Modèle MoE :
Chaque token → Uniquement les experts sélectionnés

C'est l'une des raisons pour lesquelles un grand modèle MoE coûte beaucoup moins cher à servir qu'un modèle dense de taille comparable.

Pourquoi certaines pages affichent 304B paramètres

Les métadonnées Hugging Face du dépôt complet DeepSeek-V4-Flash-0731 affichent actuellement environ 304B paramètres.

Cela ne contredit pas les 284B du modèle principal indiqués dans le rapport technique.

La version 0731 inclut un module de décodage spéculatif DSpark. Les métadonnées du dépôt peuvent compter le modèle cible ainsi que les composants de brouillon associés.

En ce qui concerne les discussions architecturales, le rapport technique de DeepSeek reste la source la plus claire :

  • Le modèle principal V4 Flash totalise 284B paramètres.
  • Les paramètres activés par token sont de 13B.
  • Les poids DSpark supplémentaires pour le décodage spéculatif dans la version 0731.

L'image est une présentation du contenu de DeepSeek V4 Flash 0731. Elle indique qu'il s'agit de la version officielle de DeepSeek V4 Flash, avec des capacités d'agent nettement renforcées par rapport à la version aperçu, une structure identique à DeepSeek V4 Flash - DSpark, accompagnée d'un module de décodage spéculatif. Bien que le nombre de paramètres activés soit bien inférieur à celui de DeepSeek V4 Pro (version aperçu), il obtient de meilleures performances sur les benchmarks et rivalise largement avec les modèles propriétaires les plus puissants existants. Cette image est étroitement liée au contexte et constitue un aperçu des caractéristiques principales et des avantages de performance de la version 0731.

CSA et HCA réduisent le coût des contextes longs

DeepSeek V4 prend en charge une fenêtre de contexte d'un million de tokens.

Les systèmes d'attention traditionnels deviennent extrêmement coûteux à cette échelle, car chaque nouveau token peut nécessiter d'examiner une grande partie du contexte précédent et de maintenir un cache KV volumineux.

Le rapport technique de DeepSeek décrit une conception d'attention hybride combinant :

  • Attention parcimonieuse compressée (CSA)
  • Attention fortement compressée (HCA)

La stratégie globale consiste à éviter un calcul d'attention complet et coûteux sur tout l'historique à chaque étape.

Le système compresse et filtre le contexte, permettant au modèle de concentrer le calcul sur les informations les plus utiles.

DeepSeek rapporte que, dans un contexte d'un million de tokens, V4 Pro nécessite :

27 % des FLOPs d'inférence par token de DeepSeek V3.2.

  • 10 % de la capacité du cache KV.

Ces pourcentages exacts proviennent des rapports techniques sur le V4 Pro, et non d'un audit distinct pour Flash.

V4 Flash utilise la même famille d'architecture et bénéficie donc des mêmes principes de conception pour les contextes longs.

Les effets concrets incluent une réduction :

  • de la mémoire du cache KV.
  • de la pression sur la mémoire GPU.
  • du volume de données déplacées.
  • du calcul par token.
  • des coûts de service pour les contextes longs.

FP4 et FP8 réduisent le stockage

ainsi que le trafic mémoire

Le modèle V4 Flash publié utilise des poids en précision mixte.

DeepSeek indique :

Précision mixte FP4 + FP8

Une précision réduite diminue la quantité de données à stocker, à charger depuis la mémoire, à transférer entre dispositifs et à traiter lors de l'inférence.

C'est important car l'inférence des modèles de langage modernes est souvent limitée par la bande passante mémoire, pas seulement par la puissance de calcul brute.

Si le matériel et les noyaux sont conçus pour exécuter efficacement ce format, une représentation plus petite des données peut améliorer le débit.

La faible précision n'est pas gratuite.

Une mauvaise quantification dégrade la qualité du modèle.

La publication de DeepSeek a été conçue et entraînée autour du schéma de précision choisi, et ne repose pas uniquement sur une quantification communautaire post-hoc.

Aucun changement d'architecture entre l'aperçu et la version 0731

DeepSeek indique que la version officielle 0731 conserve la même architecture et la même taille de modèle que l'aperçu V4 Flash.

L'entreprise n'a pas refait un pré-entraînement complet pour cette mise à jour.

Elle a plutôt refait le processus de post-entraînement.

L'article source résume les changements comme suit :

  • Nouveau fine-tuning supervisé.
  • Nouvel apprentissage par renforcement GRPO.
  • Déchiffrage spéculatif DSpark.
  • Meilleur comportement agentique.
  • Plus grand débit de service.

Le rapport technique de DeepSeek décrit le processus de post-entraînement plus large du V4 ainsi :

  1. Développement indépendant de modules experts spécialisés.
  2. Fine-tuning supervisé et apprentissage par renforcement avec GRPO.
  3. Distillation en ligne de politiques.
  4. Intégration des capacités expertes dans un modèle unique.

La mise à jour 0731 se concentre sur l'amélioration de ces capacités dans des flux de travail agentiques réels.

DSpark accélère la génération de tokens

DeepSeek-V4-Flash-0731 est fourni avec un module de déchiffrage spéculatif DSpark.

Le déchiffrage spéculatif utilise un chemin de brouillon plus petit ou moins coûteux pour proposer plusieurs tokens futurs.

Le modèle principal valide ces propositions par lots.

Le processus simplifié est le suivant :

Le module de brouillon propose des tokens
→ Le modèle principal valide simultanément
→ Les tokens acceptés sont générés
→ Les chemins rejetés sont corrigés

Lorsque les prédictions du brouillon sont précises, le système peut générer plusieurs tokens acceptés avec moins de raisonnement séquentiel coûteux du modèle principal.

DeepSeek propose le support DSpark à la fois pour vLLM et SGLang.

Pour vLLM, la fiche officielle du modèle utilise :

--speculative-config '{"method":"dspark","num_speculative_tokens":7,"draft_sample_method":"greedy"}'

Pour SGLang, l'option correspondante est :

--speculative-algorithm DSPARK

DeepSeek précise que les poids du modèle cible et du modèle de brouillon sont stockés dans le même point de contrôle, donc SGLang n'a pas besoin d'un chemin de modèle de brouillon séparé.

Le déchiffrage spéculatif améliore principalement la vitesse de service et le débit.

Il n'explique pas à lui seul l'amélioration des capacités de raisonnement du modèle.

Ces gains proviennent du processus de post-entraînement actualisé.

La publication officielle améliore les scores des benchmarks agentiques

DeepSeek rapporte des gains importants sur plusieurs tests orientés agents par rapport à l'aperçu V4 Flash.

Benchmark V4 Flash 0731 Aperçu V4 Flash Aperçu V4 Pro
Terminal Bench 2.1 82,7 61,8 72,1
NL2Repo 54,2 39,4 38,5
CyberGym 76,7 38,7 52,7
DeepSWE 54,4 7,3

12,8 |
| Toolathlon-Verified | 70,3 | 49,7 | 55,9 |
| Agents' Last Exam | 25,2 | 15,8 | 16,5 |
| AutomationBench Public | 25,1 | 10,8 | 12,8 |
| DSBench-FullStack | 68,7 | 37,0 | 41,8 |
| DSBench-Hard | 59,6 | 25,8 | 31,1 |

L'image montre les performances de DeepSeek V4 Flash sur plusieurs benchmarks, comparées à l'aperçu V4 Flash et à l'aperçu V4 Pro. Terminal Bench 2.1 à 82,7, NL2Repo à 54,2, Cybergym à 76,7, DeepSWE à 54,4, Toolathlon vérifié à 70,3, Agent Last Exam à 25,2, Automation Bench (Public) à 25,1, DSBench-FullStack à 68,7, DSBench-Hard à 59,6. Cette image illustre les progrès importants de DeepSeek mentionnés ci-dessus dans plusieurs tests et visualise directement l'amélioration de ses performances.

DeepSeek précise que les benchmarks agentiques publics ont été exécutés avec la configuration suivante :

Mode minimal de DeepSeek Harness
reasoning_effort = max
top_p = 0,95
temperature = 1,0

Au moment de la mise à jour officielle, ce cadre de test n'avait pas encore été rendu public.

DSBench-FullStack et DSBench-Hard sont des benchmarks internes à DeepSeek.

Leurs scores peuvent donc servir de preuve de référence selon les rapports de l'entreprise, mais ils ne peuvent pas être vérifiés indépendamment comme une suite de benchmarks entièrement publique.

Ce que mesurent Terminal Bench et Toolathlon

Terminal Bench 2.1

Terminal Bench évalue la capacité d'un agent à accomplir des tâches dans un environnement terminal.

Le modèle peut devoir inspecter des fichiers, exécuter des commandes, installer des dépendances, déboguer des pannes, modifier du code et vérifier l'achèvement.

Un score élevé reflète la performance combinée du modèle, du cadre agentique, de la stratégie d'outils, du budget de raisonnement et de l'environnement d'exécution.

Toolathlon-Verified

Toolathlon évalue des tâches de longue durée à travers plusieurs applications et outils logiciels.

Ce benchmark inclut des scénarios impliquant des calendriers, des systèmes de fichiers, Notion, WooCommerce, Kubernetes et BigQuery.

Les tâches nécessitent de nombreuses interactions avec les outils et sont validées par des évaluateurs basés sur l'exécution.

Le score de 70,3 rapporté par DeepSeek constitue une forte progression par rapport au modèle d'aperçu.

Mais cela ne doit pas être interprété comme une garantie de succès de 70,3 % pour chaque automatisation métier réelle.

Les progrès sur les benchmarks ne garantissent pas un succès en une seule tentative pour chaque jeu

L'exemple de jeu de la source révèle une différence importante entre les performances sur benchmark et la création de code créative.

V4 Flash obtient de bons résultats dans les évaluations agentiques officielles, mais une comparaison de jeu a tout de même nécessité trois itérations.

Les benchmarks peuvent mesurer le taux de succès sur des ensembles de tâches bien définis et des règles d'évaluation connues.

Les projets créatifs peuvent contenir des exigences visuelles vagues, des problèmes de compatibilité navigateur, des bugs de moteur physique, des ressources manquantes, des jugements de qualité subjectifs et aucun kit de test unique ne peut définir le succès.

Dans ce type de scénario, un modèle à faible coût est particulièrement utile car le flux de travail peut supporter plusieurs itérations.

Sa valeur ne réside pas nécessairement dans une génération parfaite dès la première tentative.

Cela peut être :

Qualité acceptable
×
Grand nombre de tentatives abordables

V4 Flash prend en charge plusieurs formats d'API

DeepSeek met ses modèles à disposition via les moyens suivants :

  • Interface Chat Completions compatible OpenAI.
  • API Responses compatible OpenAI.
  • API compatible Anthropic.
  • Sortie JSON.
  • Appels d'outils.
  • Complétion de préfixe de discussion.
  • Complétion de remplissage intermédiaire en mode non-pensée.

L'URL de base compatible OpenAI est :

https://api.deepseek.com

L'URL de base compatible Anthropic est :

https://api.deepseek.com/anthropic

DeepSeek indique que V4 Flash est actuellement le seul modèle API V4 prenant en charge l'API Responses.

La prise en charge de V4 Pro sera planifiée séparément.

La compatibilité avec l'API Responses permet également au modèle d'être utilisé dans Codex via la configuration documentée de DeepSeek.

Le mode réflexion est activé par défaut

DeepSeek V4 Flash prend en charge les modes réflexion et non-réflexion.

Le mode réflexion est le mode par défaut.

Pour l'inférence locale, la fiche officielle du modèle prend en charge trois niveaux d'effort de raisonnement :

low
high
max

DeepSeek recommande :

temperature = 1.0
top_p = 0.95

pour les scénarios d'agents.

Pour les niveaux d'effort de raisonnement high et max, l'entreprise recommande de permettre une longueur de sortie maximale allant jusqu'à 384 000 jetons.

Des réglages de raisonnement plus élevés peuvent améliorer les performances sur les tâches difficiles, mais peuvent également augmenter la latence, le volume de sortie, le coût API et la durée des boucles d'agents.

Les systèmes de production doivent évaluer le niveau d'effort le plus bas capable de répondre de manière fiable aux besoins des tâches.

Les poids sont publiés sous licence MIT

DeepSeek a publié les poids de V4 Flash 0731 sur Hugging Face sous licence MIT.

Cela rend le modèle exceptionnellement permissif en termes de licence par rapport à de nombreuses publications commerciales majeures.

Les développeurs peuvent utiliser le dépôt de modèles officiel avec les moteurs pris en charge, notamment :

  • vLLM.
  • SGLang.
  • Transformers.
  • Docker Model Runner.
  • Les versions quantifiées compatibles avec llama.cpp.
  • Les versions communautaires compatibles avec LM Studio.

Ce modèle est de grande taille.

Le modèle principal possède 284B paramètres, et le checkpoint 0731 contient également un composant DSpark.

Son exécution à une vitesse utilisable nécessite d'importantes ressources mémoire et matérielles.

Le fait que les poids soient téléchargeables ne signifie pas que le modèle complet puisse fonctionner de manière fluide sur un ordinateur portable grand public ordinaire.

Les versions quantifiées communautaires peuvent réduire les besoins en mémoire, mais peuvent modifier la précision, le débit, la capacité contextuelle, le comportement DSpark et la fiabilité des appels d'outils.

V4 Flash est-il toujours le meilleur rapport qualité-prix ?

Les sources concluent que V4 Flash ne produit pas les meilleurs résultats à chaque comparaison, mais qu'il est difficile à battre en termes de rapport qualité-prix.

C'est un résumé raisonnable des exemples, avec une réserve importante :

Le rapport qualité-prix dépend de l'ensemble du workflow.

V4 Flash est particulièrement attractif dans les cas suivants :

  • Volume de requêtes élevé.
  • Erreurs faciles à détecter.
  • Tâches pouvant être réessayées automatiquement.
  • Bon effet de mise en cache du contexte.
  • Coût de révision humaine faible.
  • Code compact acceptable.
  • Applications pouvant utiliser des modèles à poids ouverts.

En revanche, les modèles frontières plus chers peuvent globalement rester plus économiques dans les cas suivants :

  • Un résultat échoué entraîne une perte importante.
  • La fiabilité au premier passage est cruciale.
  • Les tâches nécessitent des connaissances plus approfondies.
  • Les agents ne peuvent pas réessayer en toute sécurité.
  • Le coût de révision humaine est élevé.
  • Les modèles plus petits produisent des sorties difficiles à maintenir.

La bonne comparaison n'est pas :

le prix par jeton

mais :

le coût par tâche réussie et validée

Comment évaluer V4 Flash pour des projets réels

Étape 1 : Choisir des tâches représentatives

Ne testez pas uniquement des démos soignées.

Utilisez des tâches correspondant à la charge de travail de production, y compris des scénarios difficiles et complexes.

Étape 2 : Fixer l'environnement d'agent

Maintenez la cohérence des invites, des outils, des limites de temps, des stratégies de réessai, des frameworks, des sandbox, des suites de tests et des réglages de raisonnement entre les différents modèles.

Étape 3 : Enregistrer les coûts complets

Suivez les entrées sans cache, les entrées avec cache, les jetons de sortie, les appels d'outils, les nombres de réessais, les temps d'exécution, les révisions humaines et les tentatives échouées.

Étape 4 : Mesurer l'acceptabilité, pas seulement la similarité visuelle

Pour le code, exécutez des tests et vérifiez la maintenabilité.

Pour les jeux, vérifiez les contrôles, les collisions, les performances et la compatibilité navigateur.

Étape 5 : Tester le comportement du cache

Lorsqu'un contexte stable est réutilisé à plusieurs reprises sur plusieurs étapes d'agent, un modèle au prix de cache très bas devient plus précieux.

Étape 6 : Comparer le premier passage et le succès final

Un modèle qui réussit après trois tentatives bon marché peut avoir un meilleur rapport qualité-prix qu'un modèle qui réussit du premier coup à un prix élevé.

Lorsque les réessais sont lents ou risqués, la situation peut aussi être inverse.

Questions fréquentes

Qu'est-ce que DeepSeek V4 Flash 0731 ?

DeepSeek V4 Flash 0731 est la version post-entraînée officielle du modèle V4 d'experts mixtes à plus petite échelle de DeepSeek. Elle remplace la version d'aperçu, ajoute le module de décodage spéculatif DSpark et se concentre principalement sur les tâches d'agents de codage et d'utilisation d'outils.

Quel est le coût de l'API DeepSeek V4 Flash ?

Les prix réguliers actuellement publiés par DeepSeek sont : 0,0028 $ par million de jetons d'entrée avec cache atteint, 0,14 $ par million de jetons d'entrée sans cache, et 0,28 $ par million de jetons de sortie. L'entreprise a annoncé que les politiques futures doubleront les prix pendant les heures de pointe désignées.

DeepSeek V4 Flash a-t-il vraiment créé un jeu 3D pour 0,07 $ ?

Un développeur a rapporté qu'une exécution de Hermes Agent a généré un jeu de tir à la première personne jouable en 32 minutes pour un coût de 0,07 $. Il s'agit d'une étude de cas sur les réseaux sociaux, et non d'un benchmark standardisé ; les coûts pour d'autres tâches peuvent donc être plus élevés ou plus faibles.

Combien de paramètres DeepSeek V4 Flash possède-t-il ?

Le rapport technique V4 liste un total de 284 milliards de paramètres pour le modèle Flash principal, avec 13 milliards de paramètres activés par jeton. Le dépôt complet de la version 0731 peut afficher environ 304 milliards de paramètres, car il inclut le composant de décodage spéculatif DSpark associé.

Pourquoi DeepSeek V4 Flash est-il si bon marché ?

Son faible coût provient de l'activation parcimonieuse des experts mixtes, de l'attention compressée sur les contextes longs, de la précision mixte FP4/FP8, de la mise en cache des invites, du décodage spéculatif et du service à haute concurrence. Seule une petite partie des experts totaux est activée par jeton.

DeepSeek V4 Flash est-il meilleur que Claude Opus 5 ou GPT-5.6 ?

Aux prix API actuels, il est beaucoup moins cher et s'est montré compétitif dans plusieurs démonstrations communautaires. Opus 5 et GPT-5.6 peuvent encore offrir une meilleure fiabilité ou qualité au premier passage sur certaines tâches, et ces comparaisons virales ne sont pas des benchmarks contrôlés.

DeepSeek V4 Flash peut-il être exécuté localement ?

Oui. DeepSeek a publié les poids sous licence MIT et fournit des instructions d'utilisation pour vLLM et SGLang. Le modèle complet est extrêmement volumineux ; un déploiement local pratique nécessite donc une grande quantité de mémoire accélérateur ou des solutions de quantification communautaires agressives.

V4 Flash prend-il en charge Codex et l'API Responses ?

Oui. DeepSeek indique que la version Flash officielle prend nativement en charge l'API Responses et a été adaptée pour une utilisation avec Codex. L'API V4 Pro actuelle ne prend pas encore en charge l'API Responses.

Outils associés

  • API DeepSeek : point de terminaison hébergé officiel pour DeepSeek V4 Flash et d'autres modèles pris en charge.
  • [DeepSeek V4 Flash

0731](https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731) : Dépôt officiel du modèle, contenant les poids, les benchmarks, la licence et les guides de déploiement.

  • vLLM : Un moteur d'inférence à haut débit offrant des recettes officielles pour V4 Flash et DSpark.
  • SGLang : Un framework de service LLM avec prise en charge documentée intégrée pour V4 Flash et DSpark.
  • DeepSpec : Dépôt de recherche de DeepSeek sur le décodage spéculatif et la méthode DSpark.
  • Codex : Un environnement de codage intelligent pouvant se connecter à V4 Flash via l'interface compatible API Responses de DeepSeek.

Liens connexes

Résumé

DeepSeek V4 Flash 0731 a suscité une grande attention car les développeurs rapportent avoir construit des démos interactives complètes pour quelques centimes seulement. Un jeu de tir à la première personne aurait coûté seulement 0,07 $, tandis que d'autres comparaisons sur les réseaux sociaux montrent des coûts de tâche des dizaines de fois inférieurs à ceux de Claude Opus 5 ou GPT-5.6.

Ces exemples ne sont pas des benchmarks contrôlés, mais la tarification officielle de l'API soutient leur idée centrale. V4 Flash facture 0,14 $ par million de jetons d'entrée non mis en cache, 0,28 $ par million de jetons de sortie, et seulement 0,0028 $ pour les entrées avec cache, un montant étonnamment bas.

Son économie provient de l'ensemble du système : un noyau MoE de 284B avec 13B de paramètres activés par jeton, une attention à contexte long compressé, des poids FP4/FP8, une fenêtre de contexte d'un million de jetons, des capacités de service efficaces, et le décodage spéculatif DSpark. La mise à jour 0731 conserve l'architecture d'aperçu et améliore le comportement de l'agent grâce à un nouveau post-entraînement.

La preuve officielle la plus solide réside dans l'amélioration des benchmarks. Terminal Bench 2.1 passe de 61,8 à 82,7, Toolathlon-Verified de 49,7 à 70,3, tandis que le modèle conserve son niveau de tarification Flash.

La force de V4 Flash ne réside pas dans le fait qu'il surpasse tout lors de toutes les comparaisons — mais dans son coût marginal extrêmement faible qui rend

possibles des expériences d'agent répétées, à une échelle que de nombreux modèles à tarification de pointe ne peuvent pas se permettre en pratique.