ByteDance prévoit de lancer un modèle d'IA avec plus de 5 000 milliards de paramètres, certains rapports suggérant jusqu'à 10 000 milliards
La course aux modèles de pointe en Chine entre dans l'ère des milliers de milliards de paramètres. Le modèle Qwen3.8-Max d'Alibaba a déjà atteint 2 400 milliards de paramètres, tandis que le Kimi K3 de Moonshot AI a été poussé à

D'après les rapports, ByteDance prévoit d'entraîner un modèle d'IA à plus de 5 000 milliards de paramètres, les rapports ultérieurs évoquant jusqu'à 10 000 milliards
Introduction
La course aux modèles de pointe en Chine entre dans l'ère des milliers de milliards de paramètres.
Le Qwen3.8-Max d'Alibaba a atteint 2 400 milliards de paramètres, tandis que le Kimi K3 de Moonshot AI a porté l'échelle publiquement divulguée à 2 800 milliards de paramètres.
ByteDance pourrait se préparer pour le prochain saut.
AIBase, citant un rapport de LatePost, rapporte que ByteDance discute, en date du 7 août 2026, de l'entraînement d'un modèle fondamental à plus de 5 000 milliards de paramètres. Selon ce rapport, le projet en est encore à un stade précoce, et rien ne garantit que le modèle final sera publié.

Rien qu'en termes d'échelle, ce projet deviendrait l'un des plus grands projets de modèles d'IA jamais rapportés publiquement en Chine.
Cependant, une mise à jour importante est survenue le même jour.
Plus tard dans la journée du 7 août, Reuters, citant le Financial Times britannique et des sources proches du dossier, a rapporté que ByteDance entraîne un modèle allant jusqu'à 10 000 milliards de paramètres, et que ce modèle est déjà entré en phase de pré-entraînement. ByteDance n'avait pas encore répondu publiquement à ce rapport à ce moment-là.
Ces deux rapports ne sont pas nécessairement contradictoires. Un projet initialement discuté comme « dépassant 5 000 milliards » pourrait finalement viser une configuration plus grande. Mais comme ByteDance n'a pas encore officiellement divulgué l'architecture du modèle ni le nombre de paramètres, tous les chiffres de cet article doivent être considérés comme des plans rapportés, et non comme des spécifications confirmées du modèle.
D'après les rapports, ByteDance se dirige vers le seuil des 5 000 milliards de paramètres
Le rapport original de LatePost indique que ByteDance discute d'un modèle dépassant les 5 000 milliards de paramètres.
Cela le placerait bien au-delà des échelles actuellement divulguées par plusieurs modèles de pointe chinois.
| Modèle | Paramètres totaux rapportés publiquement | Statut |
|---|---|---|
| Qwen3.8-Max | 2 400 milliards | Publié par Alibaba |
| Kimi K3 | 2 800 milliards | Publié par Moonshot AI |
| Modèle ByteDance rapporté | Plus de 5 000 milliards | Plan rapporté |
| Données ultérieures FT/Reuters | Jusqu'à 10 000 milliards | Rapporté, non confirmé officiellement |
Moonshot AI décrit officiellement Kimi K3 comme un modèle de mélange d'experts à 2 800 milliards de paramètres, avec 104 milliards de paramètres activés par jeton.
Reuters a rapporté le 3 août que le Qwen3.8-Max d'Alibaba contient 2 400 milliards de paramètres totaux.
Si ByteDance parvient finalement à entraîner et déployer un modèle de 5 000 à 10 000 milliards de paramètres, cela représenterait une augmentation significative de l'échelle totale du modèle.
Mais cela ne signifie pas automatiquement que les capacités du modèle seront deux à trois fois supérieures.
Le nombre de paramètres n'égale pas le niveau d'intelligence
Les sources d'AIBase décrivent le modèle à 5 000 milliards de paramètres comme appartenant à la même catégorie d'ordre de grandeur que les principaux systèmes de pointe américains, tels que GPT-5.6 ou les derniers modèles haut de gamme d'Anthropic.
Cette comparaison nécessite une réserve importante.
OpenAI et Anthropic ne divulguent pas publiquement le nombre exact de paramètres de GPT-5.6, Claude Fable 5 ou Claude Mythos 5.
Reuters a également soulevé ce point dans son rapport du 7 août : la comparaison directe d'échelle avec les principaux systèmes américains est difficile, car ces laboratoires ne publient pas le nombre de paramètres de leurs modèles.
Le nombre de paramètres n'est qu'une dimension de la capacité d'un modèle.
La performance dépend également de :
- L'architecture du modèle
- Le nombre de paramètres activés par jeton
- La qualité des données d'entraînement
- Le nombre de jetons d'entraînement
- Le filtrage des données
- La conception de l'optimiseur
- L'apprentissage par renforcement
- Le post-entraînement
- L'utilisation d'outils
- Le calcul au moment du test
- L'architecture à contexte long
- L'efficacité d'inférence
C'est particulièrement important pour les modèles de mélange d'experts.
Un modèle MoE sparse peut contenir des milliers de milliards de paramètres totaux, mais n'activer qu'un très petit sous-ensemble de ceux-ci pour chaque jeton.
Kimi K3 en est un bon exemple.
Sa fiche technique officielle indique :
- 2 800 milliards de paramètres totaux
- 104 milliards de paramètres activés
- 896 experts routés
- 16 experts sélectionnés par jeton
Ainsi, le nombre total de poids n'est pas la même chose que la quantité de calcul utilisée à chaque étape d'inférence.
ByteDance n'a pas encore divulgué publiquement si le modèle rapporté utilise une architecture sparse similaire, ni combien de paramètres seront activés par jeton.
Un modèle à 5 000 milliards de paramètres nécessitera une puissance de calcul d'entraînement colossale
Le rapport original utilise les GPU NVIDIA H100 comme exemple pour illustrer l'échelle.
Son estimation indique que l'entraînement d'un modèle à 5 000 milliards de paramètres nécessiterait environ :
- 100 000 GPU de classe H100 fonctionnant pendant 347 jours, ou
- 1 000 000 de GPU fonctionnant pendant environ 35 jours
Le temps total d'accélérateur pour ces deux scénarios est du même ordre de grandeur :
| Scénario | Nombre de GPU | Durée | Environ en jours-GPU |
|---|---|---|---|
| Cluster à long terme | 100 000 | 347 jours | 34,7 millions |
| Cluster massif à court terme | 1 000 000 | 35 jours | 35 millions |
Ces chiffres doivent être compris comme des estimations approximatives de scénarios provenant de sources, et non comme une formule d'ingénierie universelle.
Les besoins réels d'entraînement dépendent en grande partie de :
- L'architecture
- L'activation sparse ou dense
- Le nombre de jetons
- La précision
- Le taux d'utilisation des FLOPs du modèle
- La sauvegarde des points de contrôle
- L'efficacité du réseau
- La génération du matériel
- La stabilité de l'entraînement
- Les performances du pipeline de données
- Les exécutions échouées et les redémarrages
Les spécifications officielles NVIDIA H100 indiquent que la version SXM peut atteindre une TDP allant jusqu'à 700 W, et prennent en charge l'entraînement de transformateurs à grande échelle grâce au Transformer Engine de Hopper et à l'infrastructure NVLink.
À l'échelle de centaines de milliers d'accélérateurs, le cluster GPU atteint à lui seul une ampleur où l'électricité, le réseau, le refroidissement et la capacité du centre de données deviennent des contraintes primordiales.
Pourquoi « 1 million de GPU » ne signifie pas que ByteDance s'entraînera ainsi
Les sources d'AIBase notent à juste titre que faire fonctionner simultanément 1 million d'accélérateurs de classe H100 serait une configuration d'infrastructure extrême.
Un projet plus réaliste répartirait probablement l'entraînement sur un cluster plus petit mais toujours colossal.
Les sources suggèrent une approche plus proche de :
- 200 000 à 300 000 accélérateurs
- Fonctionnant pendant environ trois à quatre mois
Cela resterait l'un des plus grands clusters d'entraînement jamais construits.
L'un des projets d'entraînement de modèles les plus ambitieux de l'histoire de l'humanité.
Et le pré-entraînement n'est qu'une étape.
Un modèle de pointe nécessite également du temps et de la puissance de calcul pour :
- La préparation des données
- L'expérimentation architecturale
- La recherche sur la montée en échelle
- Le pré-entraînement
- L'évaluation des points de contrôle
- Le post-entraînement supervisé
- L'apprentissage par renforcement
- Les tests de sécurité
- L'entraînement aux outils et aux agents
- L'optimisation du service
Par conséquent, l'article original d'AIBase estime que l'ensemble du processus prendra au moins six mois, et que le temps total pourrait approcher une année avant qu'un modèle mature ne voie le jour.
Le rapport ultérieur du Financial Times (résumé par Reuters) indique que le modèle est déjà entré en phase de pré-entraînement, et note que cette phase prend généralement environ trois à six mois, avant de passer aux étapes de fine-tuning et de publication.
Les deux descriptions aboutissent à la même conclusion pratique : un projet de cette envergure est un projet d'infrastructure à long terme, et non un modèle qui apparaît immédiatement une fois le premier cluster d'entraînement en ligne.
ByteDance a les moyens de tenter l'expérience
Un entraînement à cette échelle n'est pas seulement un problème de recherche.
C'est aussi un problème d'infrastructure et de capital.
ByteDance est l'une des rares entreprises technologiques chinoises à disposer de ressources financières suffisantes, de canaux de distribution grand public, d'infrastructure cloud, de capacité de centres de données et d'équipes d'ingénierie IA pour tenter sérieusement un projet d'une telle envergure.
L'organisation Seed officielle de cette entreprise couvre les domaines suivants :
- Pré-entraînement de modèles fondamentaux
- Post-entraînement
- Apprentissage par renforcement
- Inférence haute performance
- Entraînement distribué
- Compilation pour matériel hétérogène
- Modèles multimodaux
- Systèmes d'agents
L'équipe d'infrastructure de ByteDance décrit explicitement son travail comme couvrant l'entraînement distribué, les systèmes d'apprentissage par renforcement, l'inférence haute performance et les technologies de compilation destinées aux modèles fondamentaux.
Ses documents de recrutement mentionnent également explicitement les missions suivantes :
- Entraînement à très grande échelle
- Stabilité de l'entraînement
- Utilisation des FLOPs du modèle
- Conception conjointe logiciel-matériel
- Inférence multi-nœuds
- Parallélisation
- Optimisation de l'ordonnancement
Ce sont précisément les problèmes d'ingénierie système qui deviennent cruciaux lors de l'entraînement de modèles à l'échelle de plusieurs billions de paramètres.
Le nombre de GPU mentionné par la source n'est qu'une estimation, pas une donnée officiellement divulguée
AIBase a également cité des estimations tierces concernant la capacité de calcul IA disponible dans plusieurs laboratoires de pointe.
Les chiffres approximatifs mentionnés dans l'article sont les suivants :
- OpenAI : environ 2 millions de GPU
- Anthropic : environ 620 000 GPU
- DeepSeek : environ 60 000 GPU
Ces chiffres ne doivent pas être considérés comme des données d'inventaire auditées.
OpenAI et Anthropic ne publient pas en temps réel le nombre exact d'accélérateurs disponibles dans leurs installations propres, chez leurs partenaires cloud et dans leurs capacités réservées.
Le chiffre d'environ 60 000 accélérateurs pour DeepSeek provient à l'origine d'une estimation de SemiAnalysis, largement reprise ensuite dans divers reportages. Ces estimations incluent un mélange d'accélérateurs variés (A100, H100, H800 et H20), et non une flotte homogène.
Plus fiable que n'importe quel chiffre d'inventaire précis, le point clé d'ensemble est le suivant :
Le développement de modèles de pointe dépend de plus en plus de l'accès à une puissance de calcul à très grande échelle, et à mesure que la taille des modèles augmente, l'écart entre les entreprises disposant d'infrastructures à très grande échelle et les laboratoires plus petits pourrait devenir considérable.
La course vers des milliers de milliards de paramètres.
La comparaison en H100 n'est qu'une référence de base
Utiliser l'équivalent de puissance de calcul H100 facilite la compréhension des discussions techniques, mais ByteDance ne dépendra pas nécessairement d'un seul type d'accélérateur.
Les grandes entreprises d'IA peuvent combiner :
- H100
- H200
- Systèmes NVIDIA de génération Blackwell
- Puces NVIDIA version Chine
- Accélérateurs IA nationaux
- Matériel personnalisé
- Plusieurs régions cloud et centres de données
Des accélérateurs plus récents peuvent modifier le nombre physique de GPU nécessaire pour effectuer la même charge de calcul d'entraînement.
Les logiciels sont tout aussi importants.
Les améliorations en matière de :
- Efficacité des noyaux
- Parallélisme
- Routage des experts
- Gestion de la mémoire
- Communications
- Sauvegarde des points de contrôle
- Quantification
- Chargement des données
Peuvent modifier considérablement la relation entre la taille totale du modèle et les coûts d'entraînement.
Par conséquent, « le modèle X nécessite exactement Y GPU » doit toujours être considéré comme une hypothèse de scénario, et non comme une loi immuable.
Pourquoi ByteDance pourrait avoir besoin d'un modèle aussi volumineux
La source présente principalement ce projet comme une tentative de propulser le niveau d'intelligence de Doubao vers la frontière mondiale.
C'est probablement une partie seulement de la motivation.
Un modèle fondamental plus grand pourrait soutenir plusieurs composantes de l'écosystème IA de ByteDance.
Doubao
Doubao est l'un des principaux produits d'IA grand public de ByteDance sur le marché chinois.
Un modèle de base plus puissant pourrait améliorer :
- Le raisonnement général
- Le travail lié aux connaissances
- La programmation
- La recherche
- Les tâches à contexte long
- Les comportements d'agents
- Les interactions multimodales
Recherche Seed
Un modèle à très grande échelle fournirait également à l'équipe Seed une nouvelle plateforme de recherche pour explorer :
- Les lois de mise à l'échelle
- Les architectures creuses
- L'apprentissage par renforcement
- L'entraînement d'agents
- L'efficacité des modèles
- La mémoire
- Le raisonnement sur de longues périodes
Volcengine
ByteDance pourrait également monétiser les capacités des modèles via des services d'entreprise et le cloud.
Ainsi, un modèle de pointe a une valeur potentielle au-delà des chatbots grand public.
Un modèle plus grand doit également générer un retour économique
La dernière question de l'article d'AIBase est la plus cruciale.
Un modèle avec un coût d'entraînement extrêmement élevé peut-il générer un retour proportionnel ?
Les laboratoires de pointe ne financent pas seulement l'exécution d'entraînement finale.
Les dépenses totales peuvent inclure :
- GPU
- Centres de données
- Électricité
- Réseaux
- Stockage
- Salaires des chercheurs
- Préparation des données
- Expériences échouées
- Post-entraînement
- Inférence
- Travaux liés à la sécurité
- Intégration produit
Ensuite, le modèle doit créer de la valeur via une combinaison des éléments suivants :
- Abonnements grand public
- Publicité
- Commerce électronique
- API d'entreprise
- Services cloud
- Produits d'outils d'efficacité
- Outils de programmation
- Agents
- Améliorations d'efficacité internes
Le nombre de paramètres n'a de sens économique que s'il se traduit en capacités utiles à un coût d'inférence acceptable.
C'est pourquoi la génération actuelle de modèles de pointe met de plus en plus l'accent sur l'efficacité de la mise à l'échelle, et pas seulement sur le nombre total de paramètres.
Par exemple, Kimi K3 a un total de 2,8 billions de paramètres, mais n'active que 104 milliards de paramètres par jeton. Moonshot AI indique que son architecture a amélioré l'efficacité de mise à l'échelle par rapport à la génération précédente.
Par conséquent, la véritable compétition n'est pas :
Qui a le plus de paramètres ?
Mais plutôt :
Qui peut convertir le plus de capacités avec le moins de ressources ?
Pour produire l'intelligence la plus utile, à un coût durable d'entraînement et d'inférence ?
Ce qui est confirmé et ce qui relève encore du reportage
Confirmé
- D'après les informations de Moonshot AI, Kimi K3 comporte un total de 2,8 billions de paramètres.
- D'après les rapports d'Alibaba et de Reuters, Qwen3.8-Max comporte un total de 2,4 billions de paramètres.
- L'équipe Seed de ByteDance travaille sur le pré-entraînement à grande échelle, le post-entraînement, l'inférence et l'infrastructure des modèles.
- Doubao est le produit d'IA grand public de ByteDance.
- Le NVIDIA H100 est conçu pour l'entraînement de Transformers à grande échelle et des charges de travail IA à l'échelle du billion de paramètres.
Rapporté mais non confirmé officiellement par ByteDance
- ByteDance construit un modèle de plus de 5 billions de paramètres.
- L'objectif final pourrait atteindre 10 billions de paramètres.
- La taille exacte du cluster d'entraînement.
- Le total de la puissance de calcul équivalente H100 requise.
- La date de sortie finale.
- La question de savoir si le modèle sera finalement rendu public.
- L'architecture du modèle et le nombre de paramètres activés.
Impossible à vérifier à partir des spécifications publiques du modèle
- Un modèle de 5 billions de paramètres appartient automatiquement au « niveau GPT-5.6 ».
- Le simple nombre de paramètres peut prédire le niveau d'intelligence du modèle.
- Le nombre précis de paramètres des modèles de niveau GPT-5.6 ou Fable/Mythos d'Anthropic.
- Les stocks exacts actuels de GPU d'OpenAI ou d'Anthropic.
Questions fréquentes
ByteDance entraîne-t-il réellement un modèle de 5 billions de paramètres ?
AIBase cite LatePost, qui rapporte que ByteDance discute d'un modèle de plus de 5 billions de paramètres. Plus tard dans la journée, Reuters a cité le Financial Times, indiquant que ByteDance pré-entraîne déjà un modèle pouvant atteindre 10 billions de paramètres. ByteDance n'a pas officiellement confirmé les chiffres exacts.
Ce modèle alimentera-t-il Doubao ?
Les sources prévoient que le modèle renforcera l'écosystème Doubao de ByteDance, mais ByteDance n'a pas encore officiellement annoncé comment le modèle mentionné dans le reportage sera déployé. Un modèle de pointe pourrait également soutenir des API d'entreprise, des agents, la recherche et d'autres produits de ByteDance.
Un modèle de 5 billions de paramètres est-il nécessairement meilleur que Kimi K3 ou Qwen3.8-Max ?
Pas nécessairement. Le nombre total de paramètres ne détermine pas directement la qualité du modèle. L'architecture, les paramètres activés, les données d'entraînement, le post-entraînement, l'apprentissage par renforcement, la réflexion au moment de l'inférence et l'utilisation d'outils peuvent être tout aussi importants.
Combien de paramètres possède Kimi K3 ?
Moonshot AI a officiellement annoncé que Kimi K3 totalise 2,8 billions de paramètres, avec 104 milliards de paramètres activés. Il adopte une architecture de mélange d'experts (MoE) creuse.
Combien de paramètres possède Qwen3.8-Max ?
Selon Alibaba et Reuters, Qwen3.8-Max d'Alibaba totalise 2,4 billions de paramètres. Il repose également sur une conception de modèle creux, plutôt que d'activer tous les paramètres pour chaque jeton.
Combien de GPU H100 faut-il pour entraîner un modèle de 5 billions de paramètres ?
La source fournit un scénario approximatif équivalent à environ 35 millions de GPU H100·jours, par exemple 100 000 H100 pendant 347 jours, ou 1 million de H100 pendant environ 35 jours. Les besoins réels peuvent varier considérablement selon l'architecture, la précision, l'utilisation, le nombre de jetons, le matériel et l'efficacité de l'entraînement.
GPT-5.6 a-t-il 5 billions de paramètres ?
OpenAI n'a pas divulgué publiquement le nombre de paramètres de GPT-5.6. Toute affirmation concernant le nombre de paramètres de GPT-5.6
Une comparaison numérique directe avec un certain modèle
Selon certaines informations, un modèle de ByteDance reste pour l'instant hypothétique.
Quand ByteDance pourrait-il publier ce modèle ?
Aucune date de sortie officielle n'a encore été annoncée. Sur la base d'un reportage du Financial Times, Reuters indique que le modèle est actuellement en phase de pré-entraînement, une étape qui pourrait durer plusieurs mois avant de passer au réglage fin, à l'évaluation et au déploiement.
Outils associés
- ByteDance Seed : Centre officiel de recherche et de modèles de ByteDance, couvrant les modèles fondamentaux, les systèmes multimodaux et la recherche en IA.
- ByteDance Seed LLM : Présentation officielle par ByteDance de ses travaux en pré-entraînement, post-entraînement, inférence, mémoire, apprentissage et recherche sur les modèles fondamentaux.
- Doubao : Assistant IA grand public de ByteDance, également l'un des principaux produits susceptibles de bénéficier d'un modèle fondamental plus puissant.
- Kimi : Plateforme produit officielle de Moonshot AI et point d'accès à la gamme de modèles Kimi.
- Qwen : Portail officiel d'Alibaba pour les modèles Qwen et leurs produits.
- NVIDIA H100 : Spécifications officielles de l'accélérateur H100 et informations sur ses performances d'entraînement fournies par NVIDIA.
Liens associés
- Reuters : ByteDance vise un modèle d'IA géant : Reportage plus tard dans la journée indiquant que le modèle pourrait atteindre jusqu'à 10 000 milliards de paramètres.
- ByteDance Seed Models : Catalogue officiel des modèles et axes de recherche de l'équipe ByteDance Seed.
- ByteDance Seed Infrastructure : Présentation officielle des travaux de ByteDance sur l'infrastructure d'entraînement distribué, d'inférence et les systèmes d'IA.
- Blog technique Kimi K3 : Explication officielle par Moonshot AI de l'architecture 2,8T de Kimi K3 et de ses 104B de paramètres activés.
- Dépôt GitHub Kimi K3 : Dépôt officiel du modèle Kimi K3 et spécifications techniques.
- Site officiel de Qwen : Portail officiel des modèles et API d'Alibaba.
- GPU NVIDIA H100 : Spécifications officielles H100 et informations sur l'entraînement de grands modèles.
Résumé
Selon des informations, ByteDance préparerait un modèle fondamental à très grande échelle, dépassant en taille les modèles chinois actuellement divulgués publiquement. AIBase et LatePost ont initialement décrit le projet comme dépassant 5 000 milliards de paramètres, tandis qu'un reportage ultérieur de Reuters/Financial Times le même jour évoquait un modèle pouvant atteindre 10 000 milliards de paramètres, déjà en phase de pré-entraînement.
Un projet d'une telle ampleur nécessiterait des ressources de calcul considérables. Le calcul H100 cité par les sources équivaut à environ 35 millions de jours GPU, mais les besoins réels d'entraînement dépendent de l'architecture, des paramètres activés, de la génération du matériel, du taux d'utilisation et de l'efficacité de l'entraînement.
Le vrai problème n'est pas de savoir si ByteDance peut construire le plus grand modèle. Le nombre total de paramètres est une mesure incomplète de l'intelligence, en particulier pour les systèmes experts mixtes à activation éparse.
Le véritable défi réside dans
la capacité de ByteDance à transformer des calculs à l'échelle du billion en un modèle dont les performances sont nettement supérieures, dont l'efficacité est suffisante pour le service, et dont la valeur justifie l'infrastructure qui le sous-tend.