Kimi K3 désormais open-weight : plongée dans le modèle de pointe à 2,8 T paramètres de Moonshot AI

Moonshot AI a tenu sa promesse en publiant les poids complets de Kimi K3, son modèle le plus vaste et le plus ambitieux à ce jour. Le modèle est désormais disponible sur les pages officielles Hugging Face et GitHub de Moonshot AI, accompagné d’un rapport technique détaillé et de projets d’infrastructure associés. Kimi K3 est un modèle natif multimodal de type mixture of experts, avec 2,8 billions de paramètres au total, environ 104 milliards de paramètres activés par jeton, et une fenêtre contextuelle d’un million de tokens. Moonshot

发布于 2026年7月30日generalGEO 评分: 011 次阅读
Cette image est une visuelle promotionnelle de la publication du grand modèle Kimi K3 par Moonshot AI, avec un fond noir profond et un design technologique bleu-violet. Le texte blanc « Kimi K3 Is Now Open-Weight » est mis en avant au centre, avec le logo « Kimi » semi-transparent au-dessus et le nom de marque « moonshot AI » en dessous. Sur la droite, une icône de cadenas violet lumineux de style technologique, avec des motifs de connexion de nœuds géométriques en surface, flotte sur un plateau avec un halo, entouré de traînées lumineuses en pointillés. Sur la gauche, une carte de modèle avec des symboles de code met en évidence la caractéristique open-weight de ce modèle de pointe à 2,8 T paramètres.

Kimi K3 désormais disponible en poids ouverts : exploration du modèle frontal à 2,8 billions de paramètres de Moonshot AI

Introduction

Moonshot AI a tenu sa promesse en publiant officiellement les poids complets de son modèle le plus vaste et le plus ambitieux à ce jour — Kimi K3.

Le modèle est désormais téléchargeable via les pages officielles Hugging Face et GitHub de Moonshot AI, accompagné d’un rapport technique détaillé et d’un projet d’infrastructure complémentaire.

Kimi K3 est un modèle natif multimodal à mélange d’experts, avec 2,8 billions de paramètres totaux, environ 104 milliards de paramètres activés par jeton, et une fenêtre contextuelle d’un million de jetons.

Moonshot le positionne comme un modèle frontal à poids ouverts, conçu pour la programmation longue durée, la recherche, la compréhension multimodale, le travail de connaissance agentique et les tâches de raisonnement pouvant impliquer des centaines ou des milliers d’étapes.

L’importance de cette publication réside dans deux aspects.

Premièrement, le modèle lui-même repousse l’échelle des poids ouverts au niveau des 3 billions de paramètres.

Deuxièmement, Moonshot dévoile bien plus que de simples points de contrôle. Les documents publics décrivent en détail son architecture, ses stratégies de post-entraînement, son infrastructure d’apprentissage par renforcement pour longs contextes, son système d’entraînement parallèle pour experts, ses optimisations d’inférence, ses résultats de benchmarks et plusieurs études de cas d’ingénierie à long terme.

Cette image montre la page de projet GitHub de Moonshot AI pour la publication du modèle open source Kimi K3, avec la branche principale, 1 branche, 0 tags, et un dernier commit effectué il y a 7 minutes. La page affiche un dossier assets, un fichier LICENSE, un fichier README.md et un rapport technique nommé k3_tech_report.pdf, correspondant aux documents accompagnant Kimi K3 mentionnés dans le texte. Les utilisateurs peuvent consulter le code via le bouton "Code".

Les poids complets de Kimi K3 désormais disponibles

Moonshot avait précédemment annoncé le lancement de Kimi K3, promettant la publication des poids complets avant le 27 juillet 2026.

Cette publication est désormais effective.

Le modèle officiel est accessible via les canaux suivants :

Le dépôt GitHub contient un fichier README, la licence Kimi K3, le rapport technique complet, des ressources d’architecture et de benchmarks, un guide de déploiement et des instructions d’utilisation.

La fiche modèle Hugging Face fournit la configuration du modèle et l’accès aux poids publiés.

Cela signifie que le modèle est passé d’un système frontal hébergé, prévu pour une publication ouverte, à un modèle que les chercheurs et les équipes d’infrastructure qualifiées peuvent effectivement télécharger, inspecter, déployer, affiner et adapter selon les termes de la licence Kimi K3.

L’image présente des informations sur Kimi K3. Kimi K3 est disponible aujourd’hui sur Kimi.com, Kimi Work, Kimi Code et Kimi API. Au lancement, Kimi K3 utilisera par défaut un effort de réflexion maximal ; les futures mises à jour introduiront des modes d’effort faible-élevé. Une collaboration étroite est en cours avec les partenaires d’inférence et les mainteneurs open source pour garantir la cohérence technique et un déploiement fiable de l’écosystème. Les poids complets du modèle seront publiés le 27 juillet 2026, et les détails sur l’architecture, l’entraînement et l’évaluation accompagneront le rapport technique Kimi K3.

Ce que signifie "ouvert" pour Kimi K3

Kimi K3 est mieux décrit comme un modèle à poids ouverts avec code et documentation publics.

La licence accorde des droits étendus, permettant aux utilisateurs d’utiliser, copier, modifier, affiner, déployer, créer des œuvres dérivées, redistribuer, sous-licencier et vendre des copies, conformément aux termes de la licence.

Cependant,

la licence inclut des exigences commerciales supplémentaires.

Par exemple, une société exploitant un service de modèle en tant que service (Model-as-a-Service) avec un chiffre d’affaires total supérieur à 20 millions de dollars sur une période de 12 mois consécutifs doit conclure un accord séparé avec Moonshot AI avant d’utiliser Kimi K3 ou ses dérivés à des fins commerciales.

La licence impose également des exigences d’affichage pour certains très grands produits ou services commerciaux dépassant des seuils spécifiques d’utilisateurs ou de revenus.

L’utilisation interne ainsi que celle via les produits officiels de Moonshot ou les partenaires d’inférence certifiés sont traitées différemment.

Par conséquent, toute personne utilisant Kimi K3 à des fins commerciales devrait lire attentivement la licence réelle, plutôt que de supposer qu’elle est équivalente à Apache 2.0, MIT ou d’autres licences permissives standard.

Un modèle de 2,8 billions de paramètres avec 104B paramètres activés

La capacité totale de Kimi K3 est extrêmement vaste, mais sa conception à mélange d’experts (MoE) signifie que tous les 2,8 billions de paramètres ne sont pas activés pour chaque jeton.

La fiche modèle officielle indique ce qui suit :

Spécification Kimi K3
Architecture Mélange d’experts (MoE)
Paramètres totaux 2,8T
Paramètres activés 104B
Nombre de couches 93
Couches denses 1
Experts routés 896
Experts sélectionnés par jeton 16
Experts partagés 2
Taille du vocabulaire 160K
Longueur de contexte 1 048 576 jetons
Encodeur visuel MoonViT-V2
Paramètres de l’encodeur visuel 401M
Quantification MXFP4 poids / MXFP8 activations
Modalités Texte et image

Le rapport technique fournit une comparaison architecturale plus précise avec Kimi K2.

Le tableau compare les architectures de Kimi K2 et Kimi K3, montrant les différences en nombre de couches, paramètres totaux, paramètres activés, dimensions cachées, dimensions des experts, etc. Kimi K3 présente des améliorations : nombre de couches +52 %, paramètres totaux +167 %, paramètres activés +220 %, etc. Kimi K3 introduit également de nouveaux mécanismes d’attention et de résidu, avec des changements dans la longueur de contexte d’entraînement, l’attention et la fonction d’activation. Ce tableau est directement lié au texte, illustrant les améliorations architecturales de Kimi K3 par rapport à Kimi K2.

Par rapport à Kimi K2, K3 augmente la profondeur du modèle et la parcimonie des experts, tout en introduisant de nouveaux mécanismes d’attention et de résidu.

Moonshot indique que, grâce à des améliorations combinées de l’architecture et de la méthode d’entraînement sur la base de Kimi K2, l’efficacité globale de passage à l’échelle a été multipliée par environ 2,5.

Cette affirmation fait référence à l’efficacité avec laquelle la capacité de calcul supplémentaire est convertie en capacité du modèle, et non à une augmentation générale de 2,5 fois de la vitesse d’inférence.

Multimodalité native et fenêtre contextuelle d’un million de jetons

Kimi K3 est conçu comme un modèle natif multimodal, et non comme un modèle linguistique auquel un module visuel est ajouté en fin d’entraînement.

Son encodeur visuel MoonViT-V2 compte environ 401 millions de paramètres.

Le rapport technique indique que MoonViT-V2 est entraîné de zéro via l’objectif de prédiction du prochain jeton du modèle, et non initialisé à partir d’un modèle visuel pré-entraîné contrastif comme SigLIP.

Moonshot rapporte que cette méthode reste stable pendant l’entraînement et atteint des performances visuelles compétitives.

![L’image montre Moonshot

Dans les expériences d'ablation sur le pré-entraînement par IA, la variation de la norme du gradient de la tour visuelle de différents modèles en fonction du nombre d'étapes d'entraînement. La figure (a) montre la trajectoire complète de l'entraînement, et la figure (b) est un agrandissement des étapes 14k à 16k. La ligne bleue représente MoonViT-3D initialisé à partir de SigLIP, et la ligne rouge représente MoonViT-V2 entraîné à partir de zéro. Comparé au modèle initialisé avec SigLIP, MoonViT-V2 entraîné à partir de zéro maintient une norme de gradient plus faible et moins de fluctuations, indiquant une optimisation plus stable. Ce graphique est étroitement lié au contexte et présente visuellement la stabilité de MoonViT-V2 pendant l'entraînement.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/63b386e9-0be5-4813-a254-4665269d9469-a3cea91a-babc-4ab7-9d22-af510c0efa46.jpeg)

](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/b6691c45-6229-4970-8a27-4e5a6deb00e1-dc511091-a635-4fc2-a80b-ab2e008b1415.png)

La longueur de contexte prise en charge par ce modèle est :

1 048 576 tokens

Cette échelle est particulièrement importante pour les systèmes d'agents, car une tâche de codage ou de recherche de longue durée peut accumuler le contenu du dépôt, les sorties d'outils, les journaux, les captures d'écran, les documents de recherche, les plans intermédiaires, les échecs de test, les résultats de raisonnement antérieurs et les informations de correction multi-tours.

Un contexte de million de tokens ne supprime pas le besoin de gestion de contexte, mais il permet à K3 de conserver un historique de travail bien plus grand que les systèmes traditionnels à contexte court.

Trois changements architecturaux majeurs

Le rapport technique attribue l'échelle et la stabilité de K3 à plusieurs modifications architecturales.

Les trois plus notables sont :

  1. Mécanisme d'attention hybride KDA + Gated MLA.
  2. Résidu d'attention.
  3. Modèle de mélange d'experts latent stable.

L'image montre l'architecture de Kimi K3, divisée en trois parties. À gauche se trouvent les modules Stable Normalized LatentMoE et KDA, comprenant des composants tels que Shared Expert, Routed Expert, Router, Linear, Norm, etc. En haut à droite se trouve l'opération AttnRes, avec Output, Stable LatentMoE, Gated MLA, Stable LatentMoE, KDA, etc. À droite se trouve le tronc principal Block Attention Residuals, avec Block n-1, Block n-2, Block n-3, etc. Ce graphique est étroitement lié au contexte et présente visuellement la structure modulaire des trois principaux changements de l'architecture de Kimi K3.

1. Mécanisme d'attention hybride : KDA + Gated MLA

Kimi K3 adopte une conception d'attention hybride.

La fiche officielle du modèle indique :

69 couches KDA + 24 couches Gated MLA

Cette architecture suit un motif répétitif où plusieurs couches d'attention Kimi Delta sont combinées avec des couches périodiques d'attention latente multi-têtes avec portes.

Attention Kimi Delta

KDA est un mécanisme d'attention linéaire conçu pour réduire la charge mémoire et de calcul associée aux contextes extrêmement longs.

Au lieu de maintenir un cache KV qui croît avec chaque token comme dans l'attention standard complète, KDA conserve un état récurrent.

Cela le rend intéressant pour les séquences de millions de tokens.

Moonshot a précédemment introduit KDA via la série de recherche linéaire Kimi, et l'équipe rapporte que, dans ses conditions d'évaluation, KDA réduit les besoins en cache KV et améliore le débit de décodage pour les longs contextes.

Gated MLA

K3 ne remplace pas entièrement l'attention globale.

Les couches Gated MLA périodiques préservent la capacité du modèle à récupérer des informations globalement dans le contexte.

Ainsi, cette conception hybride tente d'équilibrer deux objectifs :

  • Traitement efficace des longues séquences.
  • Récupération globale puissante.

L'idée n'est pas que l'attention linéaire soit toujours meilleure que l'attention globale, mais que chaque mécanisme traite une partie différente du problème des longs contextes.

2. Résidu d'attention

Les réseaux neuronaux profonds doivent transmettre des informations à travers plusieurs niveaux tout en évitant la perte progressive de représentations utiles.

Kimi K3 introduit le résidu d'attention (AttnRes) pour modifier la façon dont l'information est transmise en profondeur.

Ce mécanisme ne repose pas sur un flux résiduel séquentiel uniforme, mais permet aux modules suivants de récupérer sélectivement les représentations produites par les modules précédents.

Conceptuellement, cela fournit un mécanisme d'apprentissage au réseau, lui permettant de décider quelles informations antérieures doivent rester directement accessibles.

L'objectif est d'améliorer le flux d'informations dans un modèle de 93 couches sans forcer chaque caractéristique à passer exactement par le même chemin résiduel.

3. LatentMoE stable

Kimi K3 améliore considérablement la rareté du MoE.

Le modèle contient :

896 experts routés

Mais chaque token n'active que :

16 experts routés

De plus, le modèle comprend deux experts partagés.

Cela donne un nombre total de paramètres très élevé, mais le calcul actif est bien inférieur au nombre total de paramètres.

À ce niveau de rareté, la stabilité de l'entraînement et l'équilibre des experts deviennent des problèmes épineux.

La conception du LatentMoE stable de Moonshot intègre plusieurs mécanismes visant à résoudre ces problèmes.

SiTU-GLU

Kimi K3 remplace SwiGLU par SiTU-GLU, une fonction d'activation conçue pour éviter une croissance non bornée en cas d'expansion extrême.

L'image montre les structures des branches Gate et Up de GLU, SwiGLU et SiTU-GLU, ainsi que leurs courbes de réponse scalaire. Toutes les branches reçoivent une entrée scalaire x, les courbes partagent le domaine x ∈ [−10, 100], et l'encadré en bas à droite agrandit la zone proche de l'origine. Avec β1 = 4, β2 = 25, SiTU-GLU a une courbe proche de SwiGLU près de l'origine, et pour les grandes valeurs positives de x, |f(x)| ≤ β1β2 = 100, alors que SwiGLU reste non borné. Ce graphique est lié au contenu du contexte introduisant le remplacement de SwiGLU par SiTU-GLU dans Kimi K3 pour éviter une croissance non bornée lors d'une expansion extrême.

Équilibrage par quantiles

Le système utilise également une méthode d'équilibrage de charge basée sur un biais de routage dynamique, plutôt que de se reposer entièrement sur les fonctions de perte auxiliaires d'équilibrage traditionnelles.

L'objectif est de répartir plus uniformément les tokens routés entre les experts sans introduire trop de perturbations dans l'entraînement.

Entraînement d'agents à un million de tokens

Le rapport technique de Kimi K3 met particulièrement l'accent sur le post-entraînement pour les agents de longue durée.

Le modèle a été entraîné dans trois domaines :

  • Raisonnement général.
  • Tâches d'agents générales.
  • Agents de programmation.

Il prend également en charge plusieurs niveaux de finesse de raisonnement :

  • Faible.
  • Élevé.
  • Maximum.

Le modèle final combine plusieurs stratégies spécialisées via le distillation multi-enseignante en ligne par politique (MOPD).

Au lieu d'entraîner des modèles permanents distincts pour chaque domaine et niveau de finesse, Moonshot entraîne des modèles enseignants spécialisés et intègre leur comportement dans une politique unifiée K3.

AgentENV : Entraînement en bac à sable de longue durée

Le rapport technique décrit AgentENV, une couche d'infrastructure construite pour le déploiement persistant d'agents.

Ce système utilise Firecracker

L'environnement de micro-machine virtuelle permet aux agents d'exécuter de longues séquences d'opérations dans un bac à sable reproductible.

Une tâche d'entraînement peut inclure :

  1. Lire un fichier.
  2. Écrire du code.
  3. Exécuter une commande.
  4. Ouvrir une application.
  5. Prendre une capture d'écran.
  6. Utiliser des outils de bureau simulés.
  7. Déboguer une erreur.
  8. Revenir après un long délai.
  9. Reprendre à partir d'un état environnemental précédent.

Cela diffère de l'apprentissage par renforcement basé sur de courts échanges de questions-réponses.

Un agent peut exécuter des centaines d'appels d'outils et maintenir un état dans l'environnement simulé pendant plusieurs jours virtuels.

L'article source décrit un environnement simulé impliquant des applications comme Slack, Notion et Gmail.

Le principal défi d'entraînement est la persistance : l'état à long contexte de l'environnement et du modèle doit rester disponible.

Au cours d'un déploiement prolongé.

Synthèse de tâches guidée par graphe de connaissances

L'entraînement sur de longues périodes nécessite également un grand nombre de tâches difficiles.

Moonshot décrit un pipeline de génération de tâches organisé autour d'un graphe de connaissances hiérarchique.

Ce graphe couvre plusieurs domaines : informatique, intelligence artificielle, programmation, mathématiques, physique, chimie, biomédecine et sciences humaines.

Les concepts connexes peuvent être échantillonnés ensemble, les documents publics pertinents sont récupérés, puis de nouvelles tâches d'évaluation ou d'entraînement sont synthétisées à partir de ces documents.

L'objectif du graphe est de créer des tâches nécessitant une utilisation réelle d'outils et un raisonnement en plusieurs étapes, et non pas simplement de mémoriser des réponses.

Infrastructure pour un modèle MoE de niveau 3T

Un modèle de 2,8T avec une fenêtre de contexte de million de jetons ne peut pas être entraîné et servi efficacement par la seule architecture du modèle.

Le rapport technique de Moonshot décrit des travaux système couvrant les noyaux KDA, le parallélisme de contexte, le parallélisme d'experts, la gestion de la mémoire, l'ordonnancement RL à long cycle, la mise en cache de préfixes, le décodage spéculatif et le contrôle d'admission de service.

Certaines parties sont déjà publiques.

MoonEP : Parallélisme d'experts équilibré

MoonEP est une bibliothèque de communication pour le parallélisme d'experts open-sourcée par Moonshot.

Dans l'entraînement MoE, le routage peut être fortement déséquilibré.

Comme le routeur préfère certains experts, un rang peut recevoir beaucoup plus de jetons qu'un autre. Lorsque cela se produit, l'appareil le plus rapide doit attendre le plus lent.

MoonEP utilise des experts redondants dynamiques pour résoudre ce problème.

Il peut créer des copies temporaires d'experts en fonction du schéma de routage actuel, afin d'équilibrer la charge de travail des jetons sur chaque rang.

Le projet décrit son objectif comme faisant en sorte que chaque rang reste exactement à la charge de jeton de routage prévue, tout en réduisant la surcharge de communication.

C'est crucial à l'échelle de K3, car répartir 896 experts dans un grand cluster pose d'énormes problèmes de synchronisation.

FlashKDA : Noyaux KDA haute performance

FlashKDA fournit des noyaux d'attention Kimi Delta haute performance basés sur CUTLASS.

Le dépôt public actuel liste les exigences suivantes :

SM90 ou version ultérieure
CUDA 12.9 ou version ultérieure
PyTorch 2.4 ou version ultérieure

Le dépôt contient des tests de correction et des données de référence pour le matériel pris en charge.

FlashKDA vise à accélérer le mécanisme d'attention qui rend pratique l'architecture à long contexte de K3.

Quantification MXFP4 native

Kimi K3 utilise un entraînement conscient de la quantification dès la phase de superviser fine.

La configuration officielle liste :

Poids MXFP4
Activations MXFP8

Cela diffère de l'entraînement d'un modèle entièrement haute précision, puis de la quantification après l'entraînement.

Le modèle est entraîné à fonctionner directement avec ces formats de précision inférieure dans le pipeline.

Cela aide à réduire la mémoire et la surcharge de communication.

exigence, mais cela ne transforme pas le modèle 2,8T en un modèle de bureau ordinaire.

Peut-on exécuter Kimi K3 localement ?

Les poids sont publics, mais « téléchargeable » ne signifie pas « facile à exécuter sur un ordinateur portable ».

Kimi K3 a un total de 2,8 billions de paramètres.

Même avec une activation sparse et des formats de faible précision, l'exécution du modèle complet nécessite une grande quantité de mémoire d'accélérateur agrégée, des interconnexions de dispositifs à haute bande passante, un parallélisme d'experts, un moteur d'inférence compatible, et une prise en charge efficace de KDA, MLA et MoE.

Le dépôt officiel de Moonshot recommande :

  • vLLM
  • SGLang
  • TokenSpeed via la solution de déploiement Moonshot

L'écosystème évolue encore rapidement. La prise en charge peut dépendre de solutions, noyaux, schémas de quantification et matériel spécifiques.

Avant de construire un environnement auto-hébergé, veuillez confirmer la documentation de déploiement la plus récente de Kimi K3, et ne supposez pas que les configurations de service Transformer standard fonctionneront.

Pour la plupart des individus et des petites équipes, l'API hébergée peut être beaucoup plus facile que d'exécuter le modèle complet.

API Kimi K3 et niveau d'effort de raisonnement

Moonshot propose également Kimi K3 via sa plateforme API officielle :

https://platform.kimi.ai/

L'identifiant du modèle est :

kimi-k3

Kimi K3 utilise le raisonnement et renvoie le champ reasoning_content.

La fiche modèle officielle décrit trois niveaux d'effort de raisonnement :

low
high
max

Un détail d'implémentation important est l'historique de réflexion conservé.

Pour les workflows d'agents multi-tours, Moonshot indique que les développeurs doivent renvoyer l'intégralité des messages d'assistant précédents (y compris reasoning_content, content et tool_calls) dans la requête suivante.

En supprimer une partie peut nuire à la continuité, car K3 est entraîné à conserver l'historique de raisonnement.

Performances des benchmarks

Le rapport technique de Moonshot évalue Kimi K3 sur le raisonnement et les connaissances, le codage, les workflows d'agents et la vision.

Sa propre suite d'évaluation classe K3 comme l'un des modèles disponibles les plus puissants, et en tête dans des tâches spécifiques par rapport à de nombreux systèmes à poids ouverts et propriétaires.

En même temps, le rapport précise clairement que le modèle reste globalement derrière les systèmes propriétaires les plus puissants, en particulier Claude Fable 5 et GPT-5.6 Sol.

Cette nuance est importante.

L'affirmation n'est pas que K3 remporte tous les benchmarks.

La conclusion la plus défendable est que Kimi K3 amène les poids ouverts dans un domaine de performance qui, jusqu'à récemment, était principalement associé aux systèmes propriétaires de pointe.

Image sous forme de tableau comparant les performances de Kimi K3 avec Claude Fable 5, GPT-5.6 Sol, GLM-5.2, etc., sur le raisonnement et les connaissances, le codage, les workflows d'agents et la vision. Les meilleurs résultats sont en gras, les seconds en souligné. Par exemple, dans le raisonnement et les connaissances, Kimi K3 se distingue sur GQA OpenWorld, Critiq, ACLRC, etc., surpassant parfois Claude Fable 5. Ce tableau est directement lié au contexte et présente visuellement les performances de Kimi K3 sur différentes tâches.

Plusieurs comparaisons de benchmarks reposent également sur différents outils d'agents, notamment Kimi Code, Claude Code, Codex et les outils officiels de benchmark.

Par conséquent, les scores des benchmarks d'agents ne doivent pas être interprétés comme une pure capacité du modèle.

Résultats de mesure. Les outils environnants, les prompts, la gestion du contexte, les mécanismes de repli et les évaluateurs ont tous un impact substantiel sur les résultats.

Étude de cas de codage sur longue période

Le rapport fournit plusieurs cas destinés à démontrer que K3 est capable d'effectuer un travail d'ingénierie complexe bien au-delà de la complétion de code courte.

Ces cas sont fournis par les développeurs du modèle et doivent être considérés comme des démonstrations, et non comme des garanties de performance générales.

MiniTriton : Construction d'un système de programmation GPU

Moonshot rapporte que Kimi K3 a développé MiniTriton, un système de programmation GPU compact de type Triton.

Ce projet inclut une représentation intermédiaire, un pipeline de compilation, la génération PTX, un langage frontal, des composants d'exécution, l'optimisation des noyaux GPU et des primitives d'entraînement distribué.

L'image illustre un cas de calcul GPU développé par Kimi K3 sur un GPU NVIDIA L20 à l'aide du compilateur MiniTriton. Elle contient des diagrammes de performance des threads pour les cœurs CUDA et les cœurs Tensor, ainsi que des courbes de convergence entre MiniTriton et torch eager, et entre les primitives distribuées MiniTriton (NCCL) et l'entraînement sur GPU unique. Le diagramme des cœurs CUDA compare les performances de différents compilateurs tels que train, gpt et torch eager ; le diagramme des cœurs Tensor compare les performances de compilateurs comme train et gpt ; les courbes de convergence montrent respectivement l'évolution de la perte d'entraînement entre MiniTriton et torch eager, ainsi qu'entre les primitives distribuées MiniTriton et l'entraînement sur GPU unique.

Moonshot indique que K3 optimise également les noyaux complexes liés à sa propre architecture et a obtenu des accélérations significatives sur certains noyaux sélectionnés.

Cela illustre le comportement attendu du modèle : examiner des bases de code complexes, effectuer des analyses de performance, écrire du code de bas niveau, comparer les résultats et itérer pour améliorer.

Mais cela ne signifie pas que chaque compilateur ou noyau généré par le modèle peut être entièrement fiable sans examen ni test humain.

Une expérience de conception de puce de 48 heures

Dans une autre étude de cas, Kimi K3 a été placé dans un environnement sandbox pendant 48 heures et invité à créer un prototype de puce d'inférence pour un petit modèle, dont la conception partage des similitudes avec l'architecture mentionnée ci-dessus.

Le modèle a utilisé des outils de conception électronique open source ainsi que la bibliothèque de cellules standard Nangate 45 nm.

Moonshot rapporte que la simulation finale a été réalisée dans un budget de surface d'analyse de 4 mm², avec une fermeture temporelle à une fréquence d'horloge de 100 MHz, comprenant environ 1,46 million de cellules standard, utilisant 0,277 Mio de SRAM, et atteignant un débit de décodage de plus de 8 700 tokens par seconde via la simulation RTL.

L'image présente une introduction au prototype de puce d'inférence conçu par Kimi K3. En tant que preuve de concept précoce, Kimi K3 suit la même architecture de conception, incluant des mécanismes d'attention hybrides KDA et NoPE-MLA, Block AttnRes, un routage MoE basé sur sigmoïde, etc. Dans un budget de surface d'analyse de 4 mm², la conception ferme la temporisation à une horloge de 100 MHz, comprend environ 1,46 million de cellules standard, 0,277 Mio de SRAM, un réseau MAC INT4 avec déquantification intégrée, et un débit de décodage de plus de 8 700 tokens/s en simulation RTL. Cette conception, réalisée en 48 heures de fonctionnement autonome, a été construite, optimisée et validée à l'aide de Kimi Code ; le code est disponible sur GitHub.

Il s'agit d'une preuve de concept basée sur la simulation, et non d'une puce destinée à la production.

Codage de recherche et astrophysique

K3 a également été évalué dans une tâche de reproduction en astrophysique computationnelle.

Moonshot indique que le modèle a lu et validé de manière croisée plus de 20 articles, implémenté un pipeline numérique complet, évalué plus de 300 équations d'état, identifié des incohérences dans des formules publiées, écrit plus de 3 000 lignes de code Python et généré un tableau de bord HTML interactif.

L'image montre les réalisations de Kimi K3 en codage de recherche. Pour reproduire la relation universelle I-Love-Q en astrophysique computationnelle, Kimi K3 a examiné plus de 20 articles, validé les résultats de manière croisée, implémenté un pipeline numérique complet, évalué plus de 300 équations d'état, découvert des incohérences dans des formules publiques, écrit plus de 3 000 lignes de code Python et généré un tableau de bord HTML interactif en environ 2 heures, alors qu'un chercheur expérimenté mettrait généralement 1 à 2 semaines. Cette image est étroitement liée au contexte et présente visuellement les résultats concrets de Kimi K3 dans les tâches de codage de recherche.

Selon le rapport, ce travail autonome a duré environ deux heures, alors qu'un chercheur expérimenté aurait besoin d'une à deux semaines.

Pour les travaux de recherche, la vérification indépendante reste cruciale. Le modèle peut générer un pipeline complet, mais peut encore commettre des erreurs subtiles dans les hypothèses, les unités, les méthodes numériques, les citations ou les interprétations.

Évaluation de la cybersécurité

Le rapport technique aborde également l'évaluation en cybersécurité.

Moonshot indique que Kimi K3 a découvert, lors de tests de sécurité contrôlés, des vulnérabilités jusqu'alors inconnues dans le noyau Linux, découvertes qui ont été examinées par des experts humains.

L'importance ne réside pas dans l'utilisation de K3 pour des opérations de sécurité offensive non supervisées.

Mais elle montre que les modèles de codage à long cycle sont de plus en plus capables de lire de grandes bases de code, de suivre des comportements de bas niveau, de formuler des hypothèses, de les valider, de corriger les méthodes et de continuer après des échecs.

Ces capacités peuvent soutenir l'audit défensif et la révision de code sécurisé, mais elles rendent également l'autorisation, l'isolation sandbox, le contrôle d'accès et la supervision humaine plus importants.

Coût et efficacité

La valeur d'un modèle ne se mesure pas uniquement par ses scores de benchmark.

Les systèmes d'agents à long cycle peuvent générer des millions de tokens pour une seule tâche.

Par conséquent, le coût dépend de la longueur d'entrée, de la longueur de sortie, de la complexité d'inférence, du taux de hit du cache, du nombre d'appels d'outils, du nombre de tentatives, de la gestion du contexte et du fournisseur d'inférence.

Le rapport technique de Moonshot inclut des comparaisons de scores et de coûts sur plusieurs benchmarks d'agents.

Ces graphiques montrent que K3 présente un rapport coût-efficacité relatif sur certaines charges de travail de test.

Il ne faut pas interpréter cela comme une conclusion générale selon laquelle K3 serait moins cher que toutes les alternatives dans tous les cas.

Dans la planification de production, il convient de mesurer le coût total de réussite d'une tâche, et non seulement le prix par million de tokens.

Signification de la publication des poids ouverts

La publication de Kimi K3 dépasse le simple classement d'un modèle.

Elle ouvre plusieurs domaines de recherche et d'ingénierie difficiles à étudier dans des systèmes uniquement accessibles par API.

Les chercheurs peuvent examiner ou modifier les poids du modèle, le comportement MoE, le mécanisme d'attention basé sur KDA, les mécanismes de contexte long, les composants visuels, le comportement de quantification, les systèmes de service et les stratégies de post-entraînement des agents.

Les équipes d'infrastructure peuvent tester différentes solutions de service.

Les entreprises peuvent évaluer un déploiement privé lorsque l'économie du matériel le justifie.

La communauté peut construire :

  • De nouvelles solutions d'inférence.

  • Des variantes quantifiées.

  • Des modèles dérivés affinés.

  • Des systèmes spécifiques à un domaine.

  • Des cadres d'évaluation

  • Des outils de routage de modèles

  • Des optimisations spécifiques au matériel

La capacité à construire un écosystème comparable à celui des premières publications importantes de modèles ouverts dépendra du coût d'inférence, du matériel accessible, des conditions de licence, des outils communautaires et de la qualité des petits modèles dérivés.

Liste de vérification pratique avant le déploiement de Kimi K3

1. Lire le contrat de licence

Confirmez que votre cas d'utilisation relève de : recherche interne, usage commercial, affinage, application embarquée, inférence publique ou modèle en tant que service.

2. Vérifier la compatibilité matérielle

Vérifiez l'architecture de l'accélérateur, la capacité HBM, l'interconnexion, la version CUDA, les besoins en noyaux, le support de quantification, le nombre de périphériques et la topologie de parallélisme des experts.

3. Choisir un moteur d'inférence pris en charge

Utilisez les solutions spécifiques à K3 actuellement disponibles pour vLLM, SGLang ou d'autres voies de service officiellement supportées.

4. Tester individuellement le contexte complet de 1 million de tokens

Mesurez la latence de préremplissage, la latence de décodage, le comportement du cache de préfixe, l'occupation mémoire, la capacité de concurrence, le débit et la reprise après panne.

5. Conserver l'historique d'inférence

Pour les workflows agent multi-tours, suivez les directives de Moonshot en renvoyant les messages complets de l'assistant (y compris l'état d'inférence et d'appel d'outils).

6. Valider sur des tâches réelles

Effectuez des benchmarks sur vos propres dépôts, workflows de recherche, documents, tâches visuelles, utilisation d'outils et scénarios d'agents.

7. Mesurer le coût par tâche accomplie

Se concentrer uniquement sur le prix des tokens peut être trompeur. Il faut calculer le nombre de tentatives, les appels d'outils, la longueur de sortie et le coût de l'intervention humaine.

Questions fréquentes

Kimi K3 est-il open source ?

Les poids complets, le code source, la documentation et le rapport technique de Kimi K3 sont publics. MoonShot le décrit comme un modèle à poids ouverts. Le modèle utilise une licence personnalisée Kimi K3, et non Apache 2.0.

et autres protocoles standard ; les utilisateurs professionnels doivent examiner attentivement les clauses spécifiques.

Où télécharger Kimi K3 ?

Les poids officiels sont disponibles sur Moonshot AI sur Hugging Face. Le dépôt source principal et le rapport technique sont consultables sur GitHub.

Combien de paramètres possède Kimi K3 ?

Kimi K3 compte environ 2,8 billions de paramètres au total. Grâce à son architecture de modèle à experts clairsemés, environ 104 milliards de paramètres sont activés par token.

Quelle est la fenêtre contextuelle de Kimi K3 ?

Le modèle officiel prend en charge un contexte allant jusqu'à 1 048 576 tokens. Le déploiement en contexte long nécessite encore beaucoup de mémoire et d'infrastructure d'inférence, en particulier dans les scénarios concurrents.

Kimi K3 peut-il fonctionner sur un GPU grand public ?

Le modèle complet de 2,8T ne peut pas fonctionner sur un GPU grand public classique. Même avec une activation clairsemée et une quantification basse précision, les poids complets et la pile de services nécessitent une infrastructure multi-accélérateurs de grande envergure.

Quels moteurs d'inférence prennent en charge Kimi K3 ?

Le dépôt officiel de Moonshot recommande d'utiliser vLLM, SGLang et TokenSpeed via le guide de déploiement dédié à K3. Étant donné que ce modèle utilise les optimisations KDA, MLA, MoE et MXFP4, il est nécessaire de vérifier les versions actuellement prises en charge avant le déploiement.

Que sont MoonEP et FlashKDA ?

MoonEP est une bibliothèque de communication parallèle pour experts open source de Moonshot, utilisée pour équilibrer la charge des tokens MoE entre les GPU. FlashKDA est un noyau d'attention Kimi Delta haute performance construit sur CUTLASS.

Kimi K3 est-il meilleur que GPT-5.6 Sol et Claude Fable 5 ?

Pas dans tous les domaines. Le rapport technique de Moonshot indique que Kimi K3 a atteint des performances de pointe et est en tête sur certaines tâches spécifiques, mais reste globalement en retard par rapport aux systèmes propriétaires les plus puissants. Les résultats des benchmarks dépendent également du cadre d'agent, des outils, des réglages d'inférence et des méthodes d'évaluation.

Outils associés

  • Kimi K3 sur Hugging Face : Fiche officielle du modèle et poids complets de Kimi K3.
  • Kimi K3 sur GitHub : Dépôt officiel contenant le README, la licence, les ressources et le rapport technique.
  • MoonEP : Bibliothèque de communication parallèle pour experts de Moonshot, pour équilibrer dynamiquement la charge de travail MoE.
  • FlashKDA : Noyau d'attention Kimi Delta haute performance construit sur CUTLASS.
  • vLLM : Moteur d'inférence et de service open source recommandé par le guide de déploiement de Kimi K3.
  • SGLang : Cadre de service LLM et multimodal open source listé par Moonshot pour le déploiement de K3.
  • Kimi API : Plateforme API hébergée par Moonshot AI, donnant accès au modèle kimi-k3.

Liens associés

  • Dépôt GitHub officiel de Kimi K3 : Dépôt principal pour les détails d'architecture, les instructions de déploiement, l'utilisation du modèle, la licence et les ressources techniques.
  • Fiche Hugging Face de Kimi K3 : Résumé officiel du modèle avec poids complets téléchargeables.
  • Rapport technique de Kimi K3 : Rapport de recherche complet couvrant l'architecture, l'entraînement, l'infrastructure, l'évaluation et les études de cas.
  • Licence de Kimi K3 : Licence officielle régissant les poids, le code, les œuvres dérivées, le déploiement et les utilisations commerciales spécifiques.
  • Dépôt MoonEP : Implémentation open source du système de parallélisme d'experts équilibré de Moonshot.
  • Dépôt FlashKDA : Ressources d'implémentation et de benchmark du noyau KDA open source.
  • Organisation Kimi K3 ModelScope : Modèles Moonshot AI distribués via ModelScope.

Résumé

Moonshot AI a désormais publié les poids complets de Kimi K3, transformant ce modèle de pointe de 2,8 billions de paramètres en un système que les chercheurs et les équipes d'infrastructure peuvent inspecter, déployer, affiner et étendre sous la licence Kimi K3.

Le modèle combine 104 milliards de paramètres activés, une fenêtre contextuelle de 1 million de tokens, une multimodalité native, un mécanisme d'attention hybride KDA/Gated-MLA, une attention résiduelle, un MoE latent stable, un entraînement conscient de la quantification et un post-entraînement d'agent à long horizon.

Tout aussi important, cette publication révèle une partie de l'ingénierie système derrière le modèle à travers des projets comme MoonEP et FlashKDA. K3 reste un modèle extrêmement exigeant en auto-hébergement, et ses meilleurs résultats doivent être interprétés dans le contexte du choix du cadre et de l'exécution par les développeurs.

Évaluation.
Le véritable jalon n’est pas simplement l’existence d’un modèle de 2,8T – c’est qu’un modèle de cette ampleur soit désormais disponible pour que la communauté au sens large puisse l’examiner, l’exécuter et construire à partir de lui.