Kimi K3 domine l'arène du code front-end, construit un compilateur GPU et conçoit une puce en 48 heures

Moonshot AI a lancé Kimi K3, un modèle natif multimodal conçu pour le codage de longue durée, le travail de connaissance, le raisonnement visuel et les workflows basés sur des agents. Ce modèle dispose de 2,8 billions de paramètres au total, d’une fenêtre contextuelle d’1 million de tokens et d’une architecture de mélange d’experts hautement clairsemée — pour chaque token, seuls 16 de ses 896 experts sont activés. Moonshot le décrit comme le premier modèle ouvert de la classe 3T, bien que l’annonce de la société précise que les poids complets du modèle devraient être publiés le 27 juillet 2026. Kimi K3 a immédiatement attiré l’attention pour ses résultats en développement front-end, en optimisation autonome de noyaux GPU, en création d’un petit compilateur GPU nommé MiniTriton, et en une expérience de conception de puce réalisée en 48 heures à l’aide d’outils open source de conception assistée par ordinateur. Moonshot reconnaît également que le K3 n’est pas en tête dans toutes les caté

发布于 2026年7月19日generalGEO 评分: 05 次阅读
L'image présente un fond noir profond, avec à gauche le texte flou « KIMI MOONSHOT AI » et à droite le grand titre « Kimi K3 », accompagné en dessous de la mention « Frontend Leader · GPU Compiler · 48-Hour AI Chip ». Au centre, une puce lumineuse arbore la lettre « K ». À droite, un organigramme montre les étapes allant de « IR » à « Optimize », « Lowering », « CodeGen », etc. À gauche, une interface de code est affichée. Cette image est liée au contenu du « résumé SEO de la couverture » dans le document ; il s'agit d'une illustration technique de Kimi K3 de Moonshot AI, conforme aux exigences de description de la couverture du document.

Kimi K3 domine l'arène du code front-end, construit un compilateur GPU et conçoit une puce en 48 heures

Introduction

Moonshot AI a lancé Kimi K3, un modèle natif multimodal conçu pour le codage de longue durée, le travail de connaissance, le raisonnement visuel et les workflows basés sur des agents.

Ce modèle dispose de 2,8 billions de paramètres au total, d’une fenêtre contextuelle d’1 million de tokens et d’une architecture de mélange d’experts hautement clairsemée — pour chaque token, seuls 16 de ses 896 experts sont activés. Moonshot le décrit comme le premier modèle ouvert de la classe 3T, bien que l’annonce de la société précise que les poids complets du modèle devraient être publiés le 27 juillet 2026.

Kimi K3 a immédiatement attiré l’attention pour ses résultats en développement front-end, en optimisation autonome de noyaux GPU, en création d’un petit compilateur GPU nommé MiniTriton, et en une expérience de conception de puce réalisée en 48 heures à l’aide d’outils open source de conception assistée par ordinateur.

Moonshot reconnaît également que le K3 n’est pas en tête dans toutes les catégories. Sa propre évaluation montre que le modèle est en retard sur Claude Fable 5 et GPT-5.6 Sol en performance globale, mais qu’il obtient de meilleurs résultats dans plusieurs tâches de codage et d’agents de longue durée.

L’image source provient de la comparaison intelligente Artificial Analysis partagée dans l’article, montrant la position de Kimi K3.

Un modèle Kimi plus coûteux

Kimi K3 place la tarification de l’API de Moonshot à un niveau supérieur à celui des premiers modèles de codage Kimi.

Le tableau des prix du rapport original indique les tarifs suivants pour l’API en Chine :

Modèle Entrée avec cache atteint Entrée sans cache Sortie
Kimi K3 ¥2 par million de tokens ¥20 par million de tokens ¥100 par million de tokens
Kimi K2.7 Code ¥1,30 par million de tokens ¥6,50 par million de tokens ¥27 par million de tokens

Comparaison des prix entre Kimi K3 et Kimi K2.7 Code dans l’article source.

Sur la plateforme API internationale de Moonshot, les prix de Kimi K3 sont les suivants :

  • $0,30 par million de tokens d’entrée avec cache atteint
  • $3,00 par million de tokens d’entrée sans cache
  • $15,00 par million de tokens de sortie

C’est nettement plus cher que Kimi K2.7 Code, mais toujours inférieur aux prix de Claude Fable 5 cités par Moonshot dans sa comparaison de lancement.

(Image du tableau de comparaison des prix montrant que la tarification de sortie de Kimi K3 ne représente que 30 % de celle de Claude Fable 5.)

Il convient d’être prudent lors de la lecture de la comparaison des prix. Les tarifs des API peuvent varier selon la région, le fournisseur, le comportement du cache et les mises à jour ultérieures des produits. Avant tout déploiement, la page officielle de l’API Kimi est le meilleur moyen de vérifier les barèmes de facturation en vigueur.

Kimi K3 classé premier dans l’arène du code front-end

Le résultat le plus remarquable concerne le développement front-end.

Au moment de la rédaction de cet article, Kimi K3 est en tête du classement préliminaire WebDev de l’Arena Frontend Code Arena. Le graphique source indique un taux de victoire de 76 %, devançant Claude Fable 5 et GPT-5.6 Sol.

(Image montrant le classement préliminaire WebDev de la Frontend Code Arena, avec Kimi-K3 en tête avec un taux de victoire de 76 %. En dessous figurent les taux de victoire d’autres modèles, tels que Claude Fable 5 à 63 %, GPT-5.6 Sol (xHigh) à 58 %, GLM-5.2 (Max) à 55 %, Grok-4.5 à 53 %, Claude Opus 4.8 (Thinking) et Muse Spark 1.1 à 50 % chacun, et Claude Opus 4.7 (Thinking) à 49 %. Ce graphique, étroitement lié au contexte, illustre visuellement la position dominante de Kimi-K3 dans l’arène du code front-end et la comparaison des taux de victoire avec d’autres modèles.)

Kimi K3 occupe la première place dans les résultats préliminaires de la Frontend Code Arena présentés dans le rapport.

Parmi les sept catégories front-end, le rapport original indique que le K3 est classé premier dans six d’entre elles :

  1. Sites Web de marque et de marketing
  2. Conception basée sur une image de référence
  3. Interfaces d’analyse de données
  4. Produits de consommation
  5. Simulation
  6. Outils de création de contenu

Il serait classé deuxième dans la catégorie des jeux.

Ces résultats sont particulièrement importants car le travail front-end n’est pas seulement un problème de génération de code. Un modèle performant doit être capable d’interpréter des besoins visuels, de créer des applications fonctionnelles, de les exécuter, d’en vérifier les résultats et de modifier l’implémentation lorsque l’interface ne correspond pas à la conception souhaitée.

Reconstruction d’une interface de style macOS dans un navigateur

Un exemple cité dans l’article original est la reproduction d’une interface de style macOS 27 à l’aide d’un cluster d’agents en environ six heures.

Le résultat n’est pas simplement une capture d’écran statique. Le rapport indique qu’à l’exception de quelques applications comme le navigateur et la fonction téléphonique, la plupart des applications et interactions de bureau fonctionnent correctement.

(Image montrant un exemple d’interface de style macOS 27 générée par Kimi K3. À gauche, un bureau simulé de style macOS 27 avec des options de menu comme « About This Mac » et un échiquier en dessous. À droite, l’interface Freeform présente des tâches telles que « macOS 27 Brainstorm », avec des notes autocollantes, des diagrammes de flux et d’autres éléments. Cette image, étroitement liée au contexte, illustre visuellement le résultat de Kimi K3 dans la Frontend Code Arena en reconstruisant l’interface de style macOS 27, démontrant ses capacités en génération de code et en conception d’interface.)

Une interface de navigateur générée par des agents imitant un système d’exploitation de bureau moderne.

D’autres démonstrations incluent un simulateur de main robotique et un jeu 3D entièrement programmatique, basé sur un navigateur, utilisant Three.js et WebGPU.

Ces exemples restent des démonstrations plutôt que des benchmarks standardisés, mais ils montrent le type de workflows que Moonshot souhaite que le K3 prenne en charge : une création logicielle longue, visuelle et itérative.

Le visuel dans la boucle

Moonshot décrit le workflow front-end du K3 comme le visuel dans la boucle.

Le modèle ne se contente pas de générer du code et de s’arrêter ; il est capable de :

  1. Écrire ou modifier le code de l’application.
  2. Exécuter le projet.
  3. Inspecter des captures d’écran en temps réel ou des résultats de rendu.
  4. Détecter des problèmes de mise en page, de couleur, de hiérarchie ou d’interaction.
  5. Modifier le code.
  6. Rerendre le résultat mis à jour et répéter le processus.

Ce workflow comble l’écart entre la génération de code et l’évaluation visuelle.

Un modèle peut générer du HTML, du CSS et du JavaScript syntaxiquement valides tout en produisant une interface médiocre. En observant la sortie rendue, le K3 peut identifier des problèmes difficiles à détecter à partir du seul code source.

Pour les grands référentiels front-end, la fenêtre contextuelle d’1 million de tokens est également cruciale. Elle peut contenir, dans un seul contexte de travail, de nombreux composants, définitions de types, règles de système de conception, documents de projet et dépendances entre fichiers.

L’article original mentionne également un compromis : certains utilisateurs rapportent que les tâches front-end complexes prennent entre 20 minutes et une heure. Ce ne sont que des observations individuelles, et non des mesures de latence contrôlées, mais elles indiquent que le K3

Peut-être préfère-t-il les itérations longues aux sorties immédiates.

Références de programmation et ingénierie de long cycle

La programmation est l’un des atouts majeurs de Kimi K3.

Le tableau de référence du rapport original présente les résultats suivants :

Benchmark Kimi K3 Claude Fable 5 GPT-5.6 Sol
DeepSWE 67,5 70,0 73,0
Program Bench 77,8 76,8 77,6
SWE Marathon 42,0 35,0 39,0

L’image montre les performances de Kimi K3 dans plusieurs évaluations de codage et de génie logiciel, notamment les scores DeepSWE, Terminal Bench 2.1, Program Bench, SWE Marathon, etc. Par exemple, Kimi K3 obtient 67,5, Claude Fable 5 70,0 et GPT-5.6 Sol 73,0 pour DeepSWE ; Kimi K3 88,3 et GPT-5.6 Sol 88,9 pour Terminal Bench 2.1. L’image, en lien étroit avec le contexte, présente visuellement les scores de Kimi K3 dans différentes évaluations, aidant le lecteur à comprendre ses performances en codage et en génie logiciel.

Résultats rapportés de Kimi K3 dans plusieurs évaluations de programmation et de génie logiciel.

Le blog officiel de Kimi K3 fournit des éclaircissements méthodologiques importants.

Pour DeepSWE, Moonshot rapporte dans sa comparaison principale les résultats du framework Kimi Code, tandis que le classement public du mini-SWE-agent affiche 67,3. Ainsi, de légères variations peuvent apparaître selon le framework et les réglages d’évaluation.

Pour SWE Marathon, Moonshot a utilisé la branche de calibration H20 des tâches officielles. La société indique également que Claude Fable 5 a présenté un comportement de repli dans certaines évaluations, ce qui a pu réduire son score mesuré.

Ces détails n’invalident pas les résultats, mais sont importants pour comparer les modèles. Le framework d’agent, les permissions des outils, le matériel, les réglages d’inférence, les comportements de repli et la calibration des tâches peuvent tous affecter le score final.

Optimisation autonome des noyaux GPU

Moonshot a testé la capacité de Kimi K3 à optimiser des noyaux GPU avec une supervision humaine minimale.

Chaque modèle a reçu le même environnement sandbox et pouvait, en 24 heures maximum, analyser, réécrire, benchmarker et optimiser les noyaux suivants :

  • Résidu d’attention
  • Attention Delta Kimi
  • une charge de travail MLA à 512 têtes
  • un GPU générique d’un autre fournisseur

Les tests NVIDIA ont été exécutés sur du matériel H200.

Optimisation AttnRes

Pour la charge de travail des résidus d’attention, le texte indique que K3 a conçu un nouvel algorithme de noyau en deux phases, réduisant

le temps combiné des exécutions forward et backward de 283,6 ms à 114,4 ms.

Cela représente une accélération d’environ 59,7 % par rapport à la ligne de base, rapprochant Kimi K3 des performances de Claude Fable 5 dans la configuration expérimentale de Moonshot.

L’image montre la trajectoire d’optimisation de Kimi K3 pour la tâche Attention Residuals (AttnRes). L’axe horizontal représente les heures d’activité, l’axe vertical le ratio d’accélération. Différentes couleurs de lignes présentent l’évolution de Kimi K3, Claude Fable 5, GPT 5.5+, GPT 5.6 Sol, etc. La ligne rouge de Kimi K3 indique une accélération passant progressivement de 0 % à 59,7 %, se rapprochant des 57,1 % de Claude Fable 5. Ce graphique, en lien étroit avec le contexte, illustre visuellement la tendance de l’effet d’optimisation de Kimi K3 dans la tâche AttnRes au fil du temps.

Graphique de l’amélioration rapportée de Kimi K3 dans la tâche de noyau AttnRes.

Le graphique montre également le progrès de l’agent au fil du temps. K3 a réalisé plusieurs avancées majeures dès le début de l’exécution, puis a continuellement optimisé le noyau lors des itérations suivantes.

Noyau MLA-512

Pour la tâche MLA-512 à partir de zéro, le noyau de Kimi K3 a atteint, sous charge combinée forward et backward, les 517,8 TFLOPS rapportés.

Le deuxième meilleur résultat présenté dans le rapport est d’environ 492,7 TFLOPS.

L’image montre les performances TFLOPS de Kimi K3 dans différentes tâches d’optimisation de modèles. L’axe horizontal représente les heures d’activité, l’axe vertical les TFLOPS. Différentes couleurs de lignes présentent l’évolution de quatre tâches : AttnRes, DSA, MLA, KDA - GP GPU. Kimi K3 se distingue particulièrement dans la tâche MLA avec 517,8 TFLOPS, dépassant largement les autres modèles. Le graphique indique également les valeurs TFLOPS de Claude Fable 5, Claude Opus, GPT 4.8, GPT 5.5, GPT 5.6, etc. Ce graphique, en lien étroit avec le contexte, illustre visuellement les performances de Kimi K3 dans les tâches d’optimisation lors des tests de Moonshot.

Kimi K3 a atteint les 517,8 TFLOPS rapportés dans la tâche d’optimisation MLA-512.

Moonshot indique que, dans les phases ultérieures du développement du modèle, les premières versions de K3 ont assumé la majeure partie du travail d’optimisation des noyaux de l’équipe. Il s’agit d’un flux de travail auto-rapporté par l’entreprise, qui n’a pas été vérifié de manière indépendante dans les documents liés à la source.

MiniTriton : un compilateur GPU construit à partir de zéro

L’expérience suivante dépasse l’optimisation d’un seul noyau.

Moonshot a exploré si Kimi K3 pouvait construire un petit système de programmation GPU à partir de zéro. Le résultat est MiniTriton, un compilateur compact, semblable à Triton, comprenant :

  • sa propre représentation intermédiaire au niveau des tuiles
  • une couche IR construite sur MLIR
  • des processus d’optimisation
  • une pipeline de génération de code PTX
  • un support d’exécution pour les noyaux générés

Moonshot rapporte que MiniTriton atteint ou dépasse les performances de Triton et de torch.compile dans les benchmarks de roofline supportés, y compris une supériorité sur Triton pour certaines charges de travail.

![L’image montre les performances roofline des cœurs CUDA de MiniTriton sur un GPU NVIDIA L20 (sm_89). L’axe horizontal représente l’intensité arithmétique (FLOP/octet), l’axe vertical les performances atteintes (GFLOPS). Des points de différentes couleurs et formes indiquent les données de performance de torch.eager, torch.compile, minitriton, etc. Par exemple, torch.compile atteint 37,2 TFLOPS à 10^1. Sont également annotés les points de performance pour différentes tailles de tuiles (BT) et nombres de tuiles (T), comme BT=16 atteignant 1024 GFLOPS à 10^1. Ce graphique, en lien étroit avec le contexte, illustre visuellement les performances de MiniTriton.](https://we0-cms.oss-cn-beijing.aliyuncs.

fr/cms-assets/image/2026/07/664fc2e9-1b2c-459d-b907-898ed77df1af-2b65c54f-ba91-475a-81e6-9a3472a15637.png)

Performances de toit en CUDA du MiniTriton rapportées sur un GPU NVIDIA L20.

Le compilateur prend également en charge l’entraînement de nanoGPT de bout en bout, avec une convergence stable. Selon Moonshot, sa courbe de perte reste proche de l’implémentation de référence, avec seulement des écarts mineurs.

Cela a plus de sens que des micro-benchmarks isolés. Cela montre que le système généré est capable de relier le langage front-end, la représentation intermédiaire, le pipeline d’optimisation, la génération PTX et l’exécution en un flux de travail cohérent.

Cependant, au moment de la rédaction de cet article, Moonshot n’a pas encore publié publiquement le code source de MiniTriton. Par conséquent, les affirmations de performance proviennent des documents de lancement de Kimi K3 et ne peuvent pas encore être reproduites à partir du code officiellement publié.

Une puce conçue en 48 heures d’exécution

Kimi K3 a également été testé dans la conception de puces.

En 48 heures d’exécution autonome, le modèle a construit, optimisé et validé une puce destinée à servir de petits modèles basés sur l’architecture K3, en utilisant des outils EDA open source et le kit de conception de procédé Nangate 45nm.

Moonshot a rapporté les résultats de conception simulée suivants :

  • Surface inférieure à 4 mm²
  • 1,46 million de cellules standard
  • 0,277 Mo de SRAM
  • Synchronisation temporelle à 100 MHz
  • Débit de décodage simulé supérieur à 8 700 tokens par seconde
  • Un réseau de multiplication-accumulation INT4 avec déquantification fusionnée

L’image montre les résultats simulés de la puce conçue par Kimi K3 lors d’une exécution autonome de 48 heures. La figure présente plusieurs modules, tels que « 10 LGWR read pipe », avec des identifiants numériques sur chaque module. Le coin supérieur droit affiche des informations comme « 8358 tps », indiquant un traitement de 8 358 tokens par seconde. Cette image est liée au contenu du document concernant la conception de la puce par Kimi K3 en 48 heures d’exécution autonome à l’aide d’outils EDA open source et du procédé Nangate 45nm, illustrant visuellement le résultat de la conception.

Cette étude de cas de conception de puce rapporte un débit de traitement supérieur à 8 700 tokens par seconde en simulation.

La distinction entre une conception numérique validée et une puce physique fabriquée est importante.

Les documents publics décrivent un exercice de conception, d’optimisation, de synchronisation temporelle et de simulation EDA. Ils n’indiquent pas que la puce a été finalisée pour la fabrication, encapsulée et testée sur silicium.

Même avec cette limitation, la réalisation d’un pipeline étendu de conception matérielle constitue un cas notable de codage à long terme. Elle exige que l’agent coordonne les décisions architecturales, la description matérielle, la synthèse, le placement et le routage, la vérification temporelle, la validation et les optimisations itératives.

Deux innovations majeures derrière l’échelle 2,8 T

Kimi K3 est construit sur deux technologies développées par Moonshot AI :

  1. Kimi Delta Attention
  2. Attention Residuals (Résidus d’attention)

Le modèle combine ces technologies avec une architecture de mélange d’experts à activation plus clairsemée.

L’image montre l’architecture de Kimi K3, divisée en trois parties. À gauche se trouvent les modules Stable LatentMoE et KDA, comprenant des experts partagés, un routeur, des couches linéaires, des couches de normalisation, etc. Au milieu se trouve l’opération AttnRes, avec des couches linéaires, des couches de normalisation, KDA, etc. À droite se trouve le tronc résiduel de l’attention par bloc, avec les modules Stable LatentMoE, Gated MLA, Stable LatentMoE, KDA, etc. Ce diagramme est étroitement lié au contexte, illustrant visuellement la structure des composants clés tels que Stable LatentMoE, KDA, AttnRes dans le modèle Kimi K3, aidant à comprendre leurs caractéristiques de traitement efficace des longues séquences, de transmission flexible de l’information et d’activation clairsemée.

Kimi K3 intègre KDA, les résidus d’attention, Gated MLA et Stable LatentMoE.

Kimi Delta Attention

Kimi Delta Attention, abrégé en KDA, vise à rendre le mécanisme d’attention plus efficace sur les longues séquences.

Au lieu de s’appuyer entièrement sur l’attention totale standard sur l’ensemble du contexte, KDA offre un mécanisme efficace pour traiter les entrées longues tout en préservant les informations nécessaires pour le codage, le raisonnement et les tâches agentiques.

C’est l’une des bases du contexte de niveau million de tokens du modèle K3.

Mécanisme de résidus d’attention

Les couches Transformer traditionnelles ajoutent de manière répétée la sortie de chaque nouvelle couche à l’état caché cumulé.

Le mécanisme de résidus d’attention (AttnRes) change ce modèle. Il permet aux couches suivantes de sélectionner de manière sélective des représentations à différentes profondeurs, plutôt que de simplement traiter toutes les couches précédentes comme faisant partie d’un flux de cumul uniforme.

Moonshot le décrit comme une manière plus flexible de transmettre l’information dans les modèles très profonds.

Architecture Stable LatentMoE

Kimi K3 possède 896 modules experts, mais chaque token n’active que 16 experts.

Cette extrême parcimonie réduit le calcul par token (par rapport à la taille globale du modèle), mais augmente la difficulté du routage et de l’équilibrage de charge. Le cadre Stable LatentMoE de Moonshot vise à maintenir la stabilité de l’entraînement dans cette configuration parcimonieuse.

Équilibrage par quantiles

Les modèles de mélange d’experts doivent répartir les tokens équitablement entre les experts pour éviter la surcharge de quelques-uns.

K3 utilise la technique d’équilibrage par quantiles, qui assigne les experts en fonction des quantiles des scores du routeur, plutôt que de s’appuyer sur des stratégies d’équilibrage par réglage manuel. Moonshot indique que cela élimine les hyperparamètres sensibles d’équilibrage de charge, rendant l’attribution des experts à grande échelle plus stable.

Optimiseur par tête

K3 étend l’optimiseur Muon pour réaliser une optimisation Muon par tête.

Cette approche décompose les paramètres d’attention en structures indépendantes, optimisant chaque tête d’attention séparément. L’objectif est de fournir un comportement d’optimisation plus adaptatif pour chaque tête d’attention lors de l’entraînement à grande échelle.

SiTU et Gated MLA

Deux composants supplémentaires soutiennent le contrôle de l’activation et de l’attention :

  • L’unité Sigmoid Tanh (SiTU) améliore le contrôle de l’activation
  • Gated MLA augmente la flexibilité de la sélection de l’attention

En combinant KDA, AttnRes, Stable LatentMoE, l’équilibrage par quantiles et l’optimisation Muon par tête, Moonshot affirme que ces améliorations offrent une efficacité d’expansion globale environ 2,5 fois supérieure à celle de Kimi K2.

Architecture d’entraînement et d’inférence consciente de la quantification

Kimi K3 adopte un entraînement conscient de la quantification dès la phase de réglage supervisé.

Le blog technique officiel liste :

  • Poids MXFP4
  • Activations MXFP8

L’objectif est d’améliorer la compatibilité entre différents accélérateurs matériels tout en maintenant la capacité d’entraînement et de déploiement d’un modèle de cette taille.

Moonshot recommande également un déploiement en super-nœud avec plus de 64 accélérateurs pour une inférence efficace. Cela indique clairement que des poids ouverts ne signifient pas un déploiement local facile — ce modèle de 2,8 billions de paramètres reste un système d’infrastructure lourde.

Mécanisme de cache de préfixe KDA

KDA apporte de nouveaux défis au cache de préfixe traditionnel.

Moonshot indique avoir développé une implémentation de cache de pré-remplissage correspondante et l’avoir contribuée à l’écosystème vLLM. Son API officielle a un taux de succès du cache supérieur à 90 % dans les charges de travail de type code.

Cette couche de cache explique la grande différence de prix entre les entrées mises en cache et non mises en cache. Cette implémentation sera open source en même temps que le modèle, et les développeurs peuvent consulter les annonces officielles de Kimi et de vLLM.

Les dépôts de code actuellement disponibles et leur état d’intégration.

Limitations connues

Moonshot liste trois limitations importantes de Kimi K3.

Sensibilité à l’historique de réflexion

Le mode d’entraînement de K3 conserve l’historique de réflexion précédent du modèle.

Si le cadre agentique ne renvoie pas l’intégralité de l’historique attendu, la qualité de génération peut devenir instable. Lorsqu’un utilisateur passe d’un autre modèle au milieu d’une session active,

En K3, le même problème peut également se produire.

Moonshot AI recommande d'utiliser des outils compatibles validés (comme Kimi Code) et d'éviter de changer de modèle en cours de session.

Proactivité excessive

K3 a été massivement entraîné sur des tâches longues et difficiles.

Par conséquent, il peut réagir de manière excessive à des problèmes mineurs ou à des instructions floues, prenant des décisions que l'utilisateur n'avait pas anticipées.

Les applications nécessitant des limites strictes doivent définir clairement ces limites dans le prompt système ou dans le fichier AGENTS.md.

Écart d'expérience utilisateur

Moonshot AI indique que K3 présente encore un écart d'expérience utilisateur notable par rapport à Claude Fable 5 et GPT-5.6 Sol.

Cette nuance est précieuse : les scores de benchmark et les démonstrations d'ingénierie autonome ne couvrent pas tous les aspects de l'expérience de production, notamment la cohérence des réponses, la latence, l'interprétation des instructions, la fiabilité des outils et la fluidité des dialogues.

Disponibilité et statut des poids ouverts

Kimi K3 est accessible via les canaux suivants :

Lors de son lancement, K3 utilise par défaut l'intensité de réflexion maximale. Moonshot AI indique que des options d'intensité de réflexion plus faible et plus élevée seront ajoutées dans les futures mises à jour.

L'entreprise a annoncé que les poids complets du modèle seront publiés d'ici le 27 juillet 2026. En attendant la publication de ces poids et du rapport technique, certaines parties de l'architecture, des configurations de benchmark, de l'implémentation MiniTriton et du flux de conception de puces reposent sur les descriptions déjà publiées par Moonshot AI.

L'image montre l'évolution du nombre de paramètres des modèles ouverts phares de diverses entreprises entre juillet 2025 et octobre 2026. L'axe horizontal représente la chronologie, l'axe vertical le nombre total de paramètres. Différentes entreprises sont identifiées par des lignes de couleurs différentes, comme Moonshot AI, Xiaomi, Alibaba, etc. Kimi K3 atteint 2,8 billions de paramètres en juillet 2026, soit le maximum actuel. Ce graphique est pertinent pour le contexte et illustre visuellement l'avantage de Kimi K3 en termes de nombre de paramètres, ainsi que la comparaison avec d'autres grands modèles.

Kimi K3 porte l'échelle des modèles ouverts rapportée par Moonshot AI à 2,8 billions de paramètres.

Questions fréquentes

Qu'est-ce que Kimi K3 ?

Kimi K3 est un modèle multimodal natif de 2,8 billions de paramètres développé par Moonshot AI, adapté au codage de longue durée, au travail de la connaissance, au raisonnement visuel et aux tâches agent. Il prend en charge une fenêtre de contexte d'1 million de jetons, activant 16 des 896 experts par jeton.

Kimi K3 est-il open source ?

Moonshot AI qualifie K3 de modèle ouvert de niveau 3T et a annoncé que les poids complets du modèle seront publiés d'ici le 27 juillet 2026. Au moment de la rédaction de cet article, la publication des poids complets et du rapport technique de K3 n'est pas encore terminée.

Quels sont les frais de l'API Kimi K3 ?

La tarification de l'API Kimi internationale est la suivante : 0,30 $ par million de jetons d'entrée en cache, 3,00 $ par million de jetons d'entrée non mis en cache, et 15,00 $ par million de jetons de sortie. Les prix sont sujets à changement.

Par conséquent, les utilisateurs en production doivent vérifier les tarifs actuels sur la plateforme API officielle.

Les capacités de codage frontal de Kimi K3 sont-elles vraiment classées premières ?

Lors de son lancement, Kimi K3 se classe temporairement en tête du classement Arena WebDev. Comme le classement évolue dynamiquement avec l'ajout de nouveaux votes et modèles, veuillez consulter la page Arena en temps réel pour le dernier classement.

Qu'est-ce que MiniTriton ?

MiniTriton est un compilateur GPU compact que Moonshot AI a déclaré avoir construit à partir de zéro pour Kimi K3. Il comprend une représentation intermédiaire de niveau tuile basée sur MLIR, des passes d'optimisation, un pipeline de génération de code PTX et prend en charge l'entraînement nanoGPT de bout en bout.

Kimi K3 fabrique-t-il des puces physiques ?

Aucune information officielle sur le tape-out physique n'a été publiée. Moonshot AI décrit une exécution d'automatisation de la conception électronique (EDA) autonome de 48 heures, qui a utilisé la bibliothèque Nangate 45nm pour réaliser la conception, l'optimisation, la vérification et la simulation de la puce.

Kimi K3 peut-il être exécuté localement ?

Le modèle est extrêmement volumineux. Moonshot AI suggère qu'une configuration d'inférence pour le déploiement nécessite au moins 64 accélérateurs pour une exécution efficace. Même après l'ouverture des poids, l'exécution locale nécessite encore beaucoup d'infrastructures spécialisées ou des solutions de déploiement considérablement modifiées.

Quelles sont les principales limites de Kimi K3 ?

Moonshot AI souligne sa sensibilité à l'historique des pensées retenues, sa tendance à être trop proactif dans les tâches ambiguës, ainsi qu'un écart d'expérience utilisateur par rapport à Claude Fable 5 et GPT-5.6 Sol. L'utilisation de contraintes agent explicites et de cadres d'adaptation compatibles est recommandée.

Outils associés

  • Kimi : L'espace de travail agent de Moonshot AI, permettant d'utiliser Kimi K3 dans les flux de codage, de recherche, de documentation, de diapositives et de visualisation.
  • Kimi Code : L'agent de codage en terminal open source de Moonshot AI, également le cadre d'adaptation compatible recommandé pour K3.
  • Plateforme API Kimi : Le service API officiel pour accéder à kimi-k3 et à d'autres modèles Kimi.
  • Classement Arena WebDev : Un classement communautaire en temps réel par vote pour les modèles front-end et de développement web.
  • Triton : Un langage et compilateur open source pour écrire des kernels GPU haute performance.
  • MLIR : L'infrastructure de compilateur réutilisable de LLVM pour construire des représentations intermédiaires et des pipelines d'optimisation.
  • vLLM : Un moteur d'inférence de grands modèles de langage open source prenant en charge l'inférence à haut débit et la mise en cache des préfixes.
  • OpenROAD : Une chaîne d'outils open source RTL-to-GDSII liée au flux de conception de puces automatisé.

Liens associés

  • Blog technique officiel de Kimi K3 : L'article de lancement de Moonshot AI, couvrant l'architecture, les cas de codage, la tarification, la disponibilité, l'évaluation et les limites.
  • Plateforme API Kimi K3 : La source officielle actuelle pour l'accès et la tarification de l'API K3.
  • Dépôt GitHub de Kimi Code : Le dépôt officiel de l'agent de codage et la documentation d'installation.
  • Classement Arena WebDev : Le classement actuel des modèles front-end et les données de vote.
  • Classement DeepSWE : Un benchmark public de génie logiciel cité dans le rapport d'évaluation de Moonshot AI.
  • Program Bench : Un benchmark de programmation utilisé dans les comparaisons de codage de K3.
  • SWE Marathon : Un benchmark de génie logiciel longue durée cité par Moonshot AI.

Aperçu

Kimi K3 est le plus grand modèle de Moonshot AI à ce jour, avec un total de 2,

8 billions de paramètres, support multimodal natif, fenêtre contextuelle d'un million de tokens, et activation éparse de 16 experts parmi 896.

Son résultat précoce le plus remarquable se manifeste dans le domaine de l'ingénierie à long cycle. K3 s'est classé premier dans le classement préliminaire de l'arène de code front-end, a optimisé les noyaux GPU, a construit le compilateur MiniTriton, et a réalisé un flux de travail de conception de puces analogiques de 48 heures à l'aide d'outils EDA open source.

L'architecture intègre le mécanisme d'attention Kimi Delta, les connexions résiduelles d'attention, le MoE latent stable, l'équilibrage quantile, l'optimiseur Muon par tête, SiTU et le MLA à porte. Moonshot AI rapporte que l'efficacité de l'extension a été multipliée par 2,5 par rapport à Kimi K2, tout en reconnaissant des limitations importantes en matière de compatibilité agentive, de proactivité et d'expérience utilisateur globale.

La déclaration la plus importante de Kimi K3 n'est pas qu'il remporte tous les benchmarks, mais qu'il maintient une production efficace dans des tâches d'ingénierie exceptionnellement longues, visuelles et dépendantes de chaînes d'outils.

Kimi K3 domine l'arène du code front-end, construit un compilateur GPU et conçoit une puce en 48 heures