DeepSeek V4 Pro contre Grok 4.6 : le premier test en conditions réelles propulse les deux modèles au sommet

Les deux modèles d'IA étant publiés presque simultanément, DeepSeek V4 Pro et Grok 4.6 se retrouvent directement sous les projecteurs. DeepSeek V4 Pro se distingue dans les domaines de l'agentivité et de

发布于 2026年8月14日generalGEO 评分: 07 次阅读
DeepSeek V4 Pro contre Grok 4.6 : le premier test en conditions réelles propulse les deux modèles au sommet

DeepSeek V4 Pro contre Grok 4.6 : les premiers tests en conditions réelles propulsent les deux modèles au sommet

Introduction

Deux modèles d'IA de premier plan ont été publiés presque simultanément, plaçant directement DeepSeek V4 Pro et Grok 4.6 sous les projecteurs.

DeepSeek V4 Pro réalise un bond significatif en matière de performances pour les agents et le génie logiciel, tandis que Grok 4.6 déploie de solides capacités en codage, travail intellectuel et polyvalence générale. L'article source décrit ces deux lancements comme un défi direct lancé aux modèles de pointe actuels d'OpenAI et d'Anthropic.

Ce qui rend cette comparaison particulièrement intéressante, c'est que les deux modèles ne sont pas seulement évalués sur des tableaux de benchmarks. Les premiers tests en conditions réelles leur ont également demandé d'utiliser les mêmes invites pour créer des sites web, fabriquer des jeux, reproduire des conceptions visuelles et générer des expériences 3D.

Le résultat s'apparente moins à une simple compétition où le gagnant rafle tout qu'à un duel équilibré — chaque modèle excelle dans des domaines qui lui sont propres.

DeepSeek V4 Pro entre en scène, Grok 4.6 suit

L'article source met en avant plusieurs résultats de benchmarks pour DeepSeek V4 Pro.

Dans l'évaluation d'agents de cybersécurité CyberGym, DeepSeek V4 Pro aurait obtenu 83,3, devançant de justesse Fable 5 avec 83,1 et Opus 4.8 avec 78,3.

Sur AutomationBench, il atteint 31,8, devant Fable 5 (29,1) et Opus 4.8 (27,2).

Le résultat le plus serré provient de Terminal-Bench 2.1. DeepSeek V4 Pro obtient 87,9, tandis qu'Opus 4.8 atteint 85,0 et Fable 5, 88,0.

L'article source fait également état d'un score de 60,0 dans la configuration Humanity's Last Exam avec outils activés, contre 57,9 pour Opus 4.8 et 63,0 pour Fable 5.

DeepSWE constitue également une autre amélioration majeure rapportée. DeepSeek V4 Pro atteint 62,7, soit une progression considérable par rapport aux 12,8 de la version préliminaire, surpassant les 58,0 rapportés pour Opus 4.8, mais restant en deçà des 70,0 de Fable 5.

Grok 4.6 a quant à lui été testé dans plusieurs domaines face à GPT-5.6 et Fable 5.

L'article source rapporte un score d'indice d'intelligence générale de 61, à un point de Fable 5 (62).

Sur CursorBench, Grok 4.6 aurait obtenu 69,9 %, devançant les 67,2 % de GPT-5.6 et se rapprochant des 70,5 % de Fable 5.

Sur FrontierCode, il atteint 61,3 %, là encore légèrement devant GPT-5.6 (60,6 %) et derrière Fable 5 (63,6 %).

L'article source indique des performances plus solides en matière de travail intellectuel. Grok 4.6 se classerait en tête sur les trois évaluations clés : 1 753 Elo sur GDPval-AA v2, 1 577 Elo sur AA-Briefcase, et 15,8 % sur le benchmark juridique professionnel Harvey LAB.

La conclusion principale que l'article source tire de ces données est directe : les deux modèles sont désormais entrés dans la conversation aux côtés des systèmes de pointe les plus avancés.

Les écarts de prix font aussi partie de l'histoire

La performance ne représente que la moitié de cette comparaison.

L'article source met également en lumière les coûts d'inférence. Il rapporte les prix par million de jetons de sortie au moment de la publication :

Modèle Prix par million de jetons de sortie (selon les rapports)
DeepSeek V4 Pro $0,87
Grok 4.6 $6
GPT-5.6 Sol $30
Claude Opus 5 $25
Fable 5 $50

Dans sa vue tarifaire actuelle en dollars, le prix par million de jetons d'entrée est de 0,435 $ en cas d'absence de cache et de 0,003625 $ en cas de cache atteint.

La documentation de DeepSeek indique également

que ses modèles V4 prennent en charge une fenêtre contextuelle d'un million de jetons, l'appel d'outils, ainsi qu'un accès API au format OpenAI et au format Anthropic.

Les prix spécifiques des autres modèles évoluent au fil du temps ; les comparaisons de prix entre modèles de l'article original doivent donc être considérées comme un instantané à la date de publication, et non comme une grille tarifaire valable à long terme.

Premier test réel : DeepSeek V4 Pro construit une Terre en 3D

Le premier test pratique décrit dans l'article impose à DeepSeek V4 Pro une exigence assez élevée.

À partir d'une simple invite, le modèle a généré dans le navigateur une expérience complète et interactive de globe terrestre en 3D.

D'après les rapports, le résultat prend en charge les interactions de base telles que le glissement, la rotation et le zoom, et inclut également des flux de données mondiaux, des itinéraires dynamiques et des marqueurs géographiques répartis sur toute la planète.

Les détails visuels vont encore plus loin. La diffusion atmosphérique, les nuages, l'éclairage jour-nuit et l'interface environnante sont tous inclus dans l'expérience générée.

L'importance de ce test ne réside pas seulement dans la capacité du modèle à générer une page web, mais dans la démonstration de ce qu'un modèle de programmation IA peut accomplir lorsqu'on lui demande de coordonner conception visuelle, rendu 3D, interaction et structure applicative dans une seule tâche.

DeepSeek V4 Pro contre Grok 4.6 dans trois tâches applicatives

Ensuite, l'article original compare les deux modèles en utilisant des invites identiques ou très similaires.

Le créateur IA Xiangyang Qiaomu a d'abord exécuté trois petites tâches avec DeepSeek V4 Pro, puis confié deux des mêmes invites à Grok 4.6.

Créer et déployer un site web avec trois compétences

La première tâche demandait au modèle d'utiliser trois compétences pour développer et déployer un site web.

Selon les rapports, DeepSeek V4 Pro a mené à bien l'ensemble du flux de travail. L'article précise que la conception de la page et l'intégrité globale étaient stables.

Ce type de test est particulièrement important pour la programmation par agents, car le modèle doit coordonner plusieurs outils ou capacités, et pas seulement générer un morceau de code.

Reproduire 60 styles de conception dans des cartes Bento

La deuxième tâche demandait au modèle de reproduire 60 styles de conception différents et de les présenter sous forme d'un ensemble de cartes Bento.

Selon les rapports, DeepSeek V4 Pro a distingué la typographie, les combinaisons de couleurs et la disposition parmi les différents designs.

Lorsque la même invite a été confiée à Grok 4.6, ce dernier a pris l'avantage. L'article original indique que certaines pages de Grok étaient plus abouties en termes de mise en page, de couleurs et de hiérarchie visuelle, avec un rendu final plus soigné.

Construire un jeu de casse-briques en 3D

La troisième tâche consistait à créer un jeu de casse-briques en 3D à partir de zéro.

DeepSeek V4 Pro a généré un jeu jouable, comprenant un environnement 3D, une musique de fond, des effets sonores dynamiques et des retours interactifs.

Grok 4.6 a fourni une performance comparable dans cette manche. L'article original décrit les deux résultats comme quasi identiques en termes de qualité visuelle, d'intégrité de la scène et de jouabilité.

Le test Flappy Bird révèle un autre arbitrage

Un test plus nuancé provient du développeur Jun Song, qui a donné à DeepSeek V4 Pro et Grok 4.6 exactement la même invite : créer un jeu de style Flappy Bird à partir de zéro.

Les deux modèles ont adopté des approches radicalement différentes.

DeepSeek V4 Pro a utilisé plus de 20 000 jetons, mais le coût API rapporté était de 0 $ — car la tarification API du modèle (pendant la période promotionnelle limitée de DeepSeek) rendait les jetons d'entrée et de sortie entièrement gratuits.

Grok 4.6 a utilisé environ 5 000 jetons, pour un coût rapporté de 0,03 $.

Ainsi, lors de cette exécution particulière, Grok s'est montré plus efficace en termes de jetons, mais selon l'article source, DeepSeek a produit un résultat final plus abouti.

La version DeepSeek comprendrait des couches de montagnes en arrière-plan, des nuages, des dégradés et des tuyaux à l'apparence tridimensionnelle, ainsi qu'une animation « +1 » flottante lorsque le personnage traverse les tuyaux.

La conclusion de l'article source est précieuse : une consommation moindre de jetons n'implique pas automatiquement de meilleurs résultats applicatifs, et une consommation plus élevée ne signifie pas nécessairement un coût plus important.

Un autre test front-end penche également en faveur de DeepSeek

Le développeur Hamza a exécuté un autre test de génération front-end, et l'article source rapporte que DeepSeek V4 Pro l'a emporté une nouvelle fois.

La page générée est décrite comme supérieure en termes d'intégrité globale et de qualité visuelle par

Résultats de Grok 4.6.

Cela renforce le schéma observé lors des tâches précédentes : les deux modèles sont très proches, mais leurs points forts varient selon l'application et le prompt spécifiques.

V4 Pro conserve des points faibles

DeepSeek V4 Pro ne remporte pas tous les tests de génération visuelle.

Lors d'une comparaison impliquant un pélican, la version V4 Pro s'est révélée, selon les informations rapportées, supérieure à la version Flash en termes de finition visuelle globale et a généré une illustration d'éléphant plus attrayante, mais la direction du mouvement du pélican était erronée.

C'est un petit exemple, mais il met en évidence une limite courante des systèmes de codage génératif et de vision : les résultats peuvent sembler soignés tout en contenant encore des erreurs sémantiques ou de mouvement fondamentales.

Cerisier Three.js : l'écart se creuse

L'article source a ensuite augmenté la difficulté, demandant à DeepSeek V4 Pro, GPT-5.6 Sol et Claude Opus 5 de générer le même cerisier en fleurs avec Three.js.

Cette fois, les différences étaient plus marquées.

L'article rapporte que DeepSeek V4 Pro était en retrait par rapport aux deux autres modèles concernant les détails du tronc et des branches, le feuillage, l'éclairage, la profondeur de champ ainsi que l'atmosphère générale.

Ce résultat est important, car il empêche la comparaison de se transformer en un simple récit de victoire. DeepSeek V4 Pro peut être très puissant dans les tâches de codage de bout en bout, mais il existe encore certains scénarios spécialisés de génération visuelle où d'autres modèles de pointe produisent des résultats plus raffinés.

Globalement : DeepSeek V4 Pro et Grok 4.6 à armes égales

Après plusieurs séries de tests, le jugement global de l'article source est que DeepSeek V4 Pro et Grok 4.6 ont atteint un niveau de compétitivité similaire.

Aucun des deux modèles ne peut remporter toutes les tâches.

DeepSeek V4 Pro semble particulièrement fort dans certaines tâches de codage et de création d'applications de bout en bout, tandis que Grok 4.6 pourrait être plus économe en tokens et montrer des avantages dans certaines comparaisons de conception visuelle et de travail de connaissances.

Cela rend cette comparaison plus utile qu'un simple score de classement. Pour les développeurs, le meilleur modèle peut dépendre si la priorité est la qualité du codage, la fiabilité de l'agent, le raffinement visuel, l'efficacité des tokens ou le coût de l'API.

Deux modèles d'IA réduisent l'écart avec la pointe

L'article source décrit la sortie simultanée de DeepSeek V4 Pro et Grok 4.6 comme un moment inhabituel sur le marché de l'IA.

La réaction de Rick De Oliveira, citée dans l'article,

Le point central de l'article original est que ces deux modèles sont à la fois puissants et abordables.

C'est cette combinaison qui rend leurs sorties remarquables.

La documentation officielle de DeepSeek confirme que V4 Pro est conçu pour l'appel d'outils, les charges de travail à contexte long, ainsi que les modes de réflexion et de non-réflexion.

Les documents officiels de xAI sur Grok positionnent de la même manière sa dernière génération de Grok dans le codage, les tâches d'agent et le travail de connaissances. Par exemple, l'annonce officielle de Grok 4.5 décrit le modèle comme étant spécifiquement conçu pour le codage, les tâches d'agent et le travail de connaissances, et rapporte des résultats d'évaluation technique réels.

Même si les données des tests individuels varient, la tendance plus large est claire : l'IA de pointe devient de plus en plus accessible aux développeurs, et le rapport qualité-prix devient une part de plus en plus importante de la concurrence entre modèles.

Et ensuite ?

L'article source conclut en indiquant la direction de la prochaine série de concurrence.

Il mentionne que xAI a déjà teasé Grok 4.7, tandis qu'OpenAI et Anthropic devraient continuer à répondre via leurs propres mises à jour de modèles.

Cela signifie que les leaders actuels des benchmarks pourraient ne pas conserver leur avance longtemps.

Pour les développeurs, la leçon la plus durable est la suivante : évaluez les modèles sur les tâches qui affectent réellement votre flux de travail. Un modèle qui obtient un score élevé aux benchmarks, mais qui est peu performant sur votre base de code, votre processus de déploiement, vos exigences d'interface utilisateur ou votre chaîne d'outils, pourrait ne pas être le bon choix.

FAQ

Qu'est-ce que DeepSeek V4 Pro ?

DeepSeek V4 Pro est le modèle phare V4 de DeepSeek, conçu pour le raisonnement, le codage, l'utilisation d'outils et les charges de travail à contexte long. La documentation officielle de DeepSeek répertorie une fenêtre de contexte d'un million de tokens et prend en charge l'appel d'outils, tout en offrant un accès API aux formats OpenAI et Anthropic.

Comment DeepSeek V4 Pro se compare-t-il à Grok 4.6 ?

L'article source rapporte que ces deux modèles ont des performances proches dans plusieurs tests d'agents et de codage, avec des victoires partagées. DeepSeek V4 Pro excelle particulièrement dans plusieurs tests de création d'applications de bout en bout, tandis que Grok 4.6 montre des résultats solides en codage, en travail de connaissances et dans certaines tâches de conception visuelle.

DeepSeek V4 Pro est-il moins cher que Grok ?

Selon la comparaison de l'article source datée du 14 août 2026, DeepSeek V4 Pro affiche un prix de sortie de 0,87 $ par million de tokens, contre 6 $ pour Grok 4.6. La page de tarification officielle de DeepSeek confirme actuellement le prix de 0,87 $ par million de tokens de sortie pour V4 Pro, bien que les prix des API puissent varier.

DeepSeek V4 Pro peut-il créer des sites web et des jeux ?

L'article source rapporte des cas de test réussis où DeepSeek V4 Pro a généré une expérience de globe 3D, des sites web, des collections de designs de style Bento, un jeu de casse-briques 3D et un jeu de style Flappy Bird. Ce sont des résultats de test réels rapportés, et non une garantie que chaque prompt produira une qualité équivalente.

DeepSeek V4 Pro est-il adapté aux agents de codage IA ?

Il est conçu pour l'appel d'outils et les charges de travail d'agent, et l'article source rapporte ses performances solides dans plusieurs évaluations d'agents et de génie logiciel. La documentation officielle de DeepSeek répertorie également la prise en charge de l'appel d'outils pour V4 Pro.

DeepSeek V4 Pro bat-il toujours les autres modèles de pointe ?

Non. L'article source inclut des tests où GPT-5.6 Sol et Claude Opus 5 ont obtenu de meilleurs résultats dans ces tests, en particulier dans la comparaison de génération du cerisier en fleurs Three.js. Les résultats varient considérablement selon les tâches.

Outre les scores de benchmark, que devraient comparer les développeurs ?

Les développeurs devraient également comparer les coûts d'API, la latence, la longueur du contexte, l'appel d'outils, la fiabilité du codage, la qualité de sortie et la compatibilité du modèle avec leurs flux de travail d'agent existants. Pour les systèmes de production, la cohérence et le coût total peuvent être plus importants que des différences mineures dans les benchmarks.

Outils connexes

  • API DeepSeek : Point de terminaison API officiel pour accéder aux modèles DeepSeek.
  • Documentation de l'API DeepSeek : Documentation officielle sur les modèles, les tarifs, l'appel d'outils et l'intégration de l'API.
  • API xAI : Ressources officielles pour développeurs afin de créer avec les modèles Grok.
  • Grok : Le service Grok de xAI destiné aux utilisateurs finaux pour interagir avec ses modèles.
  • Three.js : Bibliothèque JavaScript 3D liée aux tests de génération Three.js décrits dans l'article.

Liens connexes

  • Modèles et tarifs DeepSeek : Spécifications officielles des modèles de l'API DeepSeek et tarification actuelle des tokens.
  • Documentation DeepSeek V4 : Documentation officielle de l'API DeepSeek et guides d'intégration.
  • Annonce xAI Grok 4.5 : Annonce officielle de xAI couvrant les capacités de codage et d'agent de l'actuelle génération Grok.
  • Documentation de l'API xAI : Documentation officielle pour utiliser Grok via la plateforme de développement xAI.
  • Three.js : Site web officiel du projet Three.js et documentation.
  • [API DeepSeek

GitHub](https://github.com/deepseek-ai) : l'organisation officielle DeepSeek sur GitHub.

Résumé

DeepSeek V4 Pro et Grok 4.6 repoussent simultanément les limites de l'IA de pointe dans deux directions : des agents du monde réel plus puissants et des performances de codage améliorées, accompagnées d'un rapport qualité-prix plus agressif.

Les premiers tests n'ont pas désigné un vainqueur absolu. DeepSeek V4 Pro a fait preuve de robustesse dans plusieurs tâches de création d'applications de bout en bout, tandis que Grok 4.6 a démontré des capacités compétitives en codage, en travail de connaissances et en conception visuelle.

Le changement majeur réside dans le fait que les développeurs disposent désormais d'un plus grand choix de modèles plus performants, sans avoir à payer automatiquement le prix fort des modèles de pointe.