DeepSeek V4 Pro se classe deuxième au benchmark de programmation terminale SuperCLUE, avec un coût ne représentant qu'une fraction de celui de Kimi K3
DeepSeek-V4-Pro-0813 se classe deuxième au dernier benchmark SuperCLUE-Terminal de programmation pour terminaux intelligents en chinois, avec un score de 51,52 points, juste derrière Kimi K3.

DeepSeek V4 Pro se classe deuxième au benchmark de programmation terminal SuperCLUE avec une fraction du coût de Kimi K3
Introduction
DeepSeek-V4-Pro-0813 a décroché la deuxième place au dernier benchmark SuperCLUE-Terminal de programmation terminal pour agents intelligents en chinois, avec un score de 51,52 points. Il est devancé uniquement par Kimi K3, qui mène le classement avec 60,61 points.
Ce résultat est particulièrement remarquable en raison de son avantage en termes de coût. Lors de l'exécution du benchmark, DeepSeek-V4-Pro-0813 a coûté en moyenne environ 1,42 yuan renminbi par tâche, démontrant un excellent rapport performance-prix parmi les modèles à score élevé.
SuperCLUE-Terminal est conçu autour de tâches de programmation réelles pour les développeurs chinois. Les modèles sont évalués via un framework d'agents générique basé sur Claude Code, ce qui permet au benchmark de comparer les performances des modèles en matière de compréhension des exigences en chinois, de planification de travaux multi-étapes, d'utilisation d'outils, de débogage et de modification de code à travers des workflows de bout en bout.

DeepSeek V4 Pro se classe deuxième au dernier benchmark de programmation
Le benchmark est conçu pour refléter le travail de développement réel, plutôt que des problèmes de programmation courts et isolés. Selon les résultats publiés, une seule tâche peut nécessiter environ 50 à 110 tours d'interactions, et l'exécution complète d'une tâche peut prendre environ 30 à 90 minutes.
Dans le classement actuel, Kimi K3 conserve la première place avec 60,61 points. DeepSeek-V4-Pro-0813 suit avec 51,52 points, devant GLM-5.2 (48,48 points) et la version antérieure DeepSeek-V4-Flash-0731 (46,46 points).
| Modèle | Score SuperCLUE-Terminal | Coût moyen par tâche rapporté |
|---|---|---|
| Kimi K3 (max) | 60,61 | 19,63 yuans |
| DeepSeek-V4-Pro-0813 (max) | 51,52 | 1,42 yuan |
| GLM-5.2 (max) | 48,48 | 23,30 yuans |
| DeepSeek-V4-Flash-0731 (max) | 46,46 | 0,64 yuan |
Ces données proviennent de l'environnement de test SuperCLUE-Terminal et doivent être comprises comme des coûts d'exécution du benchmark, et non comme une tarification fixe par tâche du fournisseur de modèles.
DeepSeek a par ailleurs confirmé que le modèle API de production deepseek-v4-pro pointe désormais vers DeepSeek-V4-Pro-0813. Ce modèle est accessible via l'application web DeepSeek, l'application mobile et l'API.
Seulement 1,42 yuan par tâche : un avantage de coût remarquable
L'aspect le plus frappant de ce résultat réside dans le coût rapporté de DeepSeek-V4-Pro-0813.
Dans le benchmark, son coût moyen est d'environ 1,42 yuan/tâche, soit environ un quatorzième du coût de Kimi K3 (19,63 yuans) et environ un seizième de celui de GLM-5.2 (23,30 yuans), dans la même comparaison SuperCLUE.
Cette différence est importante car les écarts de score entre les modèles de programmation hautes performances peuvent être relativement faibles, tandis que le coût d'exécution de tâches d'agents de longue durée peut varier considérablement. Pour les petites entreprises, les développeurs indépendants et les équipes qui doivent exécuter des agents de programmation de manière répétée, le coût d'exécution peut être aussi important que le score principal du benchmark.
L'évaluation couvre des scénarios de développement réels, notamment des pages front-end, des jeux 3D et des modifications de scripts d'ingénierie. Dans les tests rapportés, DeepSeek-V4-Pro-0813 a été capable de réaliser une logique de développement de jeu impliquant la gestion des collisions, le score et les états de fin.
Le comportement affiché, ainsi que le style d'interface et le retour d'interaction produits, dépassent également les effets de modèles de base.
Certaines tâches de dessin créatif présentent encore des problèmes structurels mineurs, mais la qualité globale de réalisation reste au même niveau que celle du groupe de tête.
Pour les équipes de développement sensibles au budget, ce résultat donne à DeepSeek-V4-Pro-0813 un positionnement clair : des performances proches des agents de programmation de pointe, avec un coût d'exécution de benchmark bien inférieur à celui de plusieurs concurrents aux prix plus élevés.
FAQ
Qu'est-ce que DeepSeek-V4-Pro-0813 ?
DeepSeek-V4-Pro-0813 est la version de production actuelle derrière le nom du modèle API deepseek-v4-pro. DeepSeek a officiellement publié la version GA le 13 août 2026, avec des capacités d'agents renforcées, et la prend en charge sur son application web, son application mobile et son API.
Qu'est-ce que SuperCLUE-Terminal ?
SuperCLUE-Terminal est un benchmark destiné aux tâches terminales des agents, axé sur les workflows de programmation et d'ingénierie en chinois dans des scénarios réels. Il évalue les performances de bout en bout, telles que la compréhension des exigences, la planification, l'exécution de commandes, la modification de fichiers, le débogage et la finalisation des tâches.
Pourquoi le benchmark utilise-t-il Claude Code ?
Le benchmark utilise un framework d'agents générique afin que les modèles participants soient testés dans un environnement d'exécution plus comparable. Claude Code fournit un environnement d'agent de type terminal pour exécuter les tâches, tandis que le modèle sous-jacent est remplacé à chaque évaluation.
Le prix de 1,42 yuan est-il la tarification officielle de DeepSeek V4 Pro pour une tâche unique ?
Non. Le montant de 1,42 yuan est le coût moyen par tâche observé lors de l'exécution de ce benchmark SuperCLUE-Terminal, calculé sur la base de la consommation de tokens et de la méthode de tarification du benchmark. Le coût API réel dépend des tokens d'entrée, des tokens de sortie, de l'utilisation du cache, des paramètres de raisonnement et de la tarification actuelle du fournisseur.
Comment DeepSeek V4 Pro se compare-t-il à Kimi K3 dans ce benchmark ?
Kimi K3 obtient un score plus élevé, 60,61 points, contre 51,52 points pour DeepSeek-V4-Pro-0813. Cependant, le benchmark rapporte un coût moyen par tâche de 19,63 yuans pour Kimi K3, contre seulement 1,42 yuan pour DeepSeek-V4-Pro-0813, ce qui confère à DeepSeek un avantage de coût significatif dans cette évaluation particulière.
DeepSeek V4 Pro prend-il en charge les contextes longs et les workflows d'agents ?
Oui. La documentation officielle de l'API DeepSeek indique que DeepSeek V4 Pro a une longueur de contexte de 1 million de tokens, et prend en charge l'appel d'outils, l'API Responses, l'API compatible Anthropic et plusieurs niveaux d'intensité de raisonnement. DeepSeek positionne explicitement la version GA comme une mise à niveau destinée aux charges de travail d'agents.
DeepSeek V4 Pro est-il toujours supérieur à GLM-5.2 en programmation ?
Pas nécessairement. Dans ces résultats SuperCLUE-Terminal, DeepSeek-V4-Pro-0813 a obtenu 51,52 points contre 48,48 pour GLM-5.2, mais un seul benchmark ne peut pas déterminer les performances sur toutes les charges de travail de programmation. La taille du dépôt, le langage, l'environnement d'outillage, le comportement en contexte long, la latence et le coût influencent tous le choix du modèle.
Outils associés
- API DeepSeek : Plateforme API officielle pour accéder aux modèles DeepSeek, y compris
deepseek-v4-pro. - SuperCLUE-Terminal : Cette
Les benchmarks utilisés dans cet article pour la comparaison de la programmation terminale des agents intelligents.
- Claude Code : l'outil de codage agentique d'Anthropic, utilisé comme cadre d'exécution général dans les benchmarks.
- Kimi API : la plateforme officielle pour les développeurs de Moonshot AI, destinée à Kimi K3 et aux autres modèles Kimi.
- Z.AI GLM-5.2 : la présentation officielle du GLM-5.2, un modèle qui a également obtenu des scores élevés dans les benchmarks.
Liens connexes
- Publication officielle de DeepSeek-V4-Pro : l'annonce officielle de DeepSeek concernant la version de production V4 Pro.
- Modèles et tarifs DeepSeek : les versions officielles des modèles, les limites de contexte, les fonctionnalités et la tarification actuelle de l'API.
- Guide de démarrage rapide de l'API DeepSeek : les instructions officielles pour accéder à
deepseek-v4-provia l'API. - Benchmark SuperCLUE-Terminal : la page officielle du benchmark incluant les classements et les comparaisons de coûts.
- Documentation API Kimi K3 : la documentation officielle Kimi couvrant le modèle K3 et l'utilisation de l'API.
- Documentation Claude Code : la documentation officielle du cadre d'agent de codage utilisé dans les benchmarks.
- Présentation officielle de GLM-5.2 : la présentation officielle par Z.AI du GLM-5.2 et de ses capacités de codage de longue durée.
Résumé
DeepSeek-V4-Pro-0813 obtient un score de 51,52 dans SuperCLUE-Terminal, se classant deuxième dans ce benchmark, juste derrière Kimi K3, et devant GLM-5.2 et DeepSeek-V4-Flash-0731.
Son principal atout réside dans le coût : le coût moyen rapporté par SuperCLUE est d'environ 1,42 yuan par tâche, bien inférieur aux coûts enregistrés pour Kimi K3 et GLM-5.2 dans la même évaluation.
Ce résultat ne signifie pas que DeepSeek V4 Pro est le meilleur modèle de codage au sens général, mais il montre qu'il atteint un bon équilibre entre les performances de codage agentique et le coût d'exécution, en particulier pour les tâches de programmation longues et intensives en outils.
Pour les équipes qui accordent de l'importance à la fois aux capacités de codage des agents et aux coûts opérationnels, DeepSeek-V4-Pro-0813 est l'une des options les plus compétitives dans cette comparaison SuperCLUE-Terminal.