Yangqing Jia lance Intent Lab : Fleet transforme des instructions en une ligne en systèmes de production

Un peu plus d'un an après l'intégration de Lepton AI à NVIDIA, Yangqing Jia repart de zéro. Sa nouvelle entreprise, Intent Lab, ne se lance pas avec un chatbot classique, ni un marché du cloud

发布于 2026年7月31日generalGEO 评分: 07 次阅读
L'image présente une illustration promotionnelle d'Intent Lab Fleet. Sur un fond sombre, on aperçoit le logo flou d'Intent Lab Fleet et des éléments tels qu'un compteur de vitesse. Le texte « Intent Lab Fleet » et « GLM-5.2 6.3× Faster » est mis en avant, avec la mention « One-Shot Database · Verified File System » en dessous. En bas à gauche figurent les logos de Z.ai et GLM-5.2, tandis qu'en bas à droite se trouve une icône de dossier avec un bouclier et une coche. Cette image est liée au contenu présentant Intent Lab Fleet dans le document et met en évidence ses atouts techniques.

Yangqing Jia lance Intent Lab : Fleet transforme des instructions en une ligne en systèmes de production

Introduction

Un peu plus d'un an après l'intégration de Lepton AI à NVIDIA, Yangqing Jia repart de zéro.

Sa nouvelle entreprise, Intent Lab, ne lance ni chatbot conventionnel, ni marketplace cloud, ni IDE pour développeurs. À la place, la société développe Fleet, qu'elle décrit comme une équipe d'ingénierie autonome capable de transformer une intention de haut niveau en logiciel de qualité production.

La première démonstration publique d'Intent Lab comprend trois systèmes très différents :

  1. Un moteur d'inférence GLM-5.2 optimisé au-delà du TensorRT-LLM standard.
  2. Une base de données compatible SQLite construite à partir d'une exigence en une ligne.
  3. Un système de fichiers distribué pour agents IA avec vérification formelle et tests de panne.

À première vue, ces projets ne ressemblent pas à une seule catégorie de produit.

C'est précisément le but.

Intent Lab affirme que le véritable produit est le système d'ingénierie qui les sous-tend. Fleet est conçu pour accomplir le travail entre une demande logicielle vague et un système pouvant être évalué, vérifié, exploité et fait évoluer en production.

L'image est un tweet publié par Yangqing Jia, présentant Intent Lab. Le tweet mentionne qu'Intent Lab construit une équipe autonome nommée « fleet » qui transforme les intentions en logiciels de production. Il partage aujourd'hui quelques premiers résultats : le moteur d'inférence GLM5.2 le plus rapide, la création de base de données en une seule fois, et un système de fichiers d'agents entièrement vérifié. Un lien est également joint ci-dessous, intitulé « Le premier convoi autonome au monde qui transforme les intentions en systèmes de production », avec la mention « Transformer les intentions en systèmes de production — Intent Lab ». Cette image est étroitement liée au contexte et constitue une présentation officielle d'Intent Lab et de ses réalisations.

Les premiers chiffres de performance présentés dans cet article proviennent des propres supports de lancement d'Intent Lab. Ce sont des démonstrations prometteuses, et non des certifications de référence indépendantes. L'entreprise n'a pas encore publié suffisamment de détails de reproductibilité pour que des équipes externes puissent confirmer chaque résultat dans des conditions identiques.

Yangqing Jia fonde une nouvelle entreprise d'infrastructure

La carrière de Yangqing Jia a toujours gravité autour de l'infrastructure.

Il est surtout connu pour avoir créé Caffe à l'UC Berkeley, puis pour avoir travaillé sur d'importants projets d'infrastructure IA, notamment PyTorch et ONNX.

Après avoir quitté Alibaba en 2023, Jia a cofondé Lepton AI, une entreprise axée sur la simplification de l'accès aux GPU et du déploiement de modèles pour les développeurs.

La proposition initiale de Lepton combinait une expérience développeur native Python avec une infrastructure capable d'exécuter des charges de travail IA sur plusieurs fournisseurs de GPU.

L'entreprise a été acquise par NVIDIA en 2025, une transaction publiquement évaluée à l'époque à plusieurs centaines de millions de dollars. Des rapports industriels ultérieurs ont estimé le montant à environ 700 millions de dollars, bien que NVIDIA n'ait jamais publié de prix d'acquisition final.

La technologie de Lepton est devenue partie intégrante de NVIDIA DGX Cloud Lepton.

![L'image présente l'architecture cloud de Lepton AI. En haut figurent trois sections : Serverless Cloud, Lepton API Services, Enterprise Deployment. La zone bleue centrale correspond à Lepton AI Cloud Architecture, comprenant Deployments (Inference, Training), Jobs (Training, Development), Pods (Development), Fast Runtimes (LLM, SD, etc.), Global Overlay Network, Infra Health Management, Lepton Optimized Kubernetes. En bas se trouvent Multi Cloud & BYOC Hardware Resources. Ce schéma est étroitement lié au contexte et illustre directement la stratégie technique de Lepton AI en matière d'architecture cloud.](https://we0-cms.oss-cn-beijing.aliyuncs.

com/cms-assets/image/2026/07/32165d25-ec8e-45a4-8ec2-4b9895592d90-c88a130e-0f9f-4f13-a721-065d3cf997fc.png)

NVIDIA décrit actuellement DGX Cloud Lepton comme une plateforme active qui unifie le calcul GPU à travers les fournisseurs de cloud et l'infrastructure appartenant aux clients pour le développement, l'entraînement et l'inférence.

Ce statut actuel mérite d'être clarifié, car les commentaires après le départ de Jia affirmaient que le produit original de style startup Lepton et ses ambitions open source n'avaient pas survécu inchangés à l'acquisition.

Les preuves publiques soutiennent une description plus prudente :

  • La société autonome Lepton a été absorbée par NVIDIA.
  • Sa marque et sa technologie font désormais partie de DGX Cloud Lepton.
  • NVIDIA exploite et documente toujours DGX Cloud Lepton aujourd'hui.
  • La bibliothèque Python publique et le CLI lep restent disponibles.
  • Certaines attentes antérieures concernant l'open source de composants plus profonds de la plateforme ne se sont jamais concrétisées sous la forme que les observateurs attendaient.

Jia a ensuite occupé le poste de vice-président du logiciel système chez NVIDIA avant de quitter l'entreprise en 2026.

Une brève étape chez Hyperbolic

En juillet 2026, Hyperbolic a annoncé que Jia avait rejoint l'entreprise d'infrastructure GPU en tant que conseiller.

Hyperbolic a décrit son parcours à travers Caffe, ONNX, PyTorch, Lepton AI, NVIDIA, Google, Facebook et Alibaba Cloud comme particulièrement pertinent pour son travail sur l'accès GPU et l'infrastructure.

Cette image présente du contenu lié à l'entreprise Hyperbolic, avec le logo Hyperbolic dans le coin supérieur gauche. Sur le côté gauche de l'image se trouve un portrait en noir et blanc de Yangqing Jia, et sur le côté droit une déclaration de sa part, indiquant qu'Hyperbolic s'efforce d'aider les développeurs et les entreprises à obtenir la puissance de calcul nécessaire à l'entraînement, au déploiement et à l'extension des systèmes d'IA. En tant que conseiller d'Hyperbolic, il exprime son soutien à l'équipe dans l'avancement de l'IA, avec sa légende : Conseiller chez Hyperbolic, cofondateur de Lepton AI, ce qui correspond au contexte mentionné dans le document concernant son arrivée chez Hyperbolic en tant que conseiller.

Ce rôle s'est avéré ne pas être sa principale prochaine étape.

Le 29 juillet, Jia a présenté publiquement Intent Lab.

Son cadrage était différent de celui de Lepton AI.

Lepton se concentrait sur l'accès plus facile des développeurs à la puissance de calcul.

Intent Lab se concentre sur la capacité à donner à un système d'ingénierie autonome la possibilité de créer et de maintenir les logiciels qui s'exécutent sur cette puissance de calcul.

Jia a résumé ce changement en disant que ses équipes avaient passé leur carrière à construire soigneusement de grands systèmes un par un. Ce qui les intéressait désormais, c'était un système capable de produire de nombreux systèmes de ce type.

Il s'agit d'une publication sur les réseaux sociaux du 29 juillet 2026, publiée par Yangqing Jia, sous le nom de compte @jiayq. Le contenu mentionne que son équipe a toujours construit de grands systèmes à la main, couvrant des projets d'open source, d'infrastructure cloud, etc. Le thème est l'architecture minutieuse de la construction d'un système à la fois, et ce qui l'intéresse actuellement est de créer la « source » capable de générer des milliers de systèmes de ce type. Ce contenu fait écho au contexte de la création d'Intent Lab par Jia décrit dans le document, correspondant à sa direction centrale, lors de la présentation d'Intent Lab, qui consiste à passer de la construction ponctuelle de grands systèmes à la création d'un système d'ingénierie autonome capable de produire en masse plusieurs systèmes.

Fleet est le produit derrière les trois démonstrations

Intent Lab appelle son système d'ingénierie autonome Fleet.

L'entreprise le décrit comme une équipe plutôt que comme un agent de codage unique.

La distinction est importante.

Un agent de codage typique peut modifier des fichiers, exécuter des commandes, corriger des tests, rechercher dans un dépôt et implémenter une fonctionnalité.

Fleet est présenté comme un système capable de coordonner un processus d'ingénierie plus long.

L'objectif déclaré d'Intent Lab est de couvrir le travail nécessaire pour passer d'une demande de haut niveau à un système de production mesurable.

comportement, vérification et une voie vers l'amélioration continue.

Les trois premières démonstrations ont été choisies pour tester cette affirmation dans des domaines d'ingénierie très différents.

Démo Une : Optimisation de GLM-5.2 au-delà du TensorRT-LLM standard

Le résultat de lancement le plus frappant sur le plan technique est un moteur d'inférence pour GLM-5.2.

L'instruction initiale était essentiellement un objectif d'ingénierie :

Réingénier TensorRT-LLM pour que GLM-5.2 fonctionne efficacement sur les nœuds Grace Blackwell,
identifier les opportunités d'optimisation, les mettre en œuvre et les vérifier de manière autonome.

TensorRT-LLM est déjà la pile d'inférence orientée production de NVIDIA pour les grands modèles de langage.

NVIDIA documente des fonctionnalités telles que le service multi-GPU et multi-nœuds, le traitement par lots en vol, la mise en cache KV paginée, la quantification, les noyaux optimisés et les runtimes Python et C++.

Améliorer les performances sur cette pile constitue donc une cible plus exigeante que l'optimisation d'une implémentation de référence non optimisée.

Intent Lab rapporte une augmentation de 6,3× de la vitesse de sortie

Intent Lab indique que Fleet a commencé avec TensorRT-LLM standard à environ :

102 tokens/s

Un runtime optimisé a atteint :

161 tokens/s

Après l'ajout du chemin de décodage spéculatif optimisé de l'entreprise, le système aurait atteint :

647 tokens/s

Cela représente environ 6,3× la vitesse de sortie d'origine.

L'image illustre les résultats d'optimisation de TensorRT-LLM par Intent Lab. L'objectif est d'exécuter GLM 5.2 sur les nœuds Grace Blackwell, en identifiant les catégories d'optimisation et en les mettant en œuvre et en les vérifiant de manière autonome, pour atteindre une amélioration de 6,3× de la vitesse de sortie. Les optimisations sont réparties en quatre catégories : noyaux, runtime, communication et décodage spéculatif, avec des gains respectifs de 24 %, 16 %, 18 % et 4,0×. L'image présente également une comparaison des vitesses de sortie à différentes étapes de l'optimisation, de 102 à 181 puis 647, ainsi qu'un graphique de décomposition des gains de performance, illustrant clairement l'effet de l'optimisation.

Intent Lab indique que le benchmark a utilisé deux nœuds Grace Blackwell.

L'entreprise divise le travail de performance en quatre catégories.

Optimisation des noyaux : +24 %

Fleet aurait appliqué la fusion de noyaux et généré des chemins PTX/SASS de bas niveau pour un contrôle au niveau des instructions.

Optimisation du runtime : +16 %

Intent Lab indique que le runtime a supprimé les copies répétées de métadonnées hôte-vers-périphérique du décodage en régime permanent grâce au traitement par lots H2D et aux techniques de copie zéro.

Optimisation de la communication : +18 %

Fleet aurait utilisé un chemin de réduction globale MNNVL fusionné qui intègre l'addition résiduelle et RMSNorm dans l'opération collective.

Décodage spéculatif : environ 4×

Le gain individuel le plus important provient du décodage spéculatif.

Intent Lab indique qu'un rédacteur DSpark optimisé propose plusieurs tokens et que le modèle principal les vérifie par lots, augmentant considérablement le débit de décodage.

L'entreprise rapporte le résultat complet de bout en bout comme une amélioration de 534 % par rapport à sa référence standard.

Ces chiffres sont les propres mesures d'Intent Lab. La configuration matérielle, les détails de la charge de travail, les paramètres de lot, la longueur de sortie, la précision, la concurrence et les révisions logicielles peuvent affecter considérablement les benchmarks d'inférence.

La boucle d'optimisation de Fleet ressemble davantage à une équipe qu'à un passage unique

Intent Lab indique que Fleet suit une boucle d'ingénierie répétée :

  1. Analyse roofline
  2. Identification des goulots d'étranglement
  3. Proposition
  4. Vérification
  5. Composition
  6. Retour au goulot d'étranglement suivant

Si une optimisation proposée

échoue à la validation, le système revient en arrière et réessaie.

L’étape « composée » est cruciale car l’optimisation des performances échoue souvent lorsque des optimisations réussies individuellement interfèrent entre elles.

Fleet est conçu pour ne conserver les modifications qu’après avoir vérifié que le système combiné fonctionne toujours.

Pourquoi GLM-5.2 est une cible exigeante

GLM-5.2 est le modèle phare de Z.ai pour les tâches à long horizon.

Sa fiche technique officielle met en avant une fenêtre de contexte d’un million de jetons, des charges de travail de codage et d’agents à long horizon, un effort de raisonnement flexible, une architecture d’attention sparse améliorée, et des poids ouverts sous licence MIT.

Les grands modèles avec contexte long et charges agentiques créent des problèmes de serveur difficiles.

L’implémentation la plus rapide dépend des interactions entre la conception des kernels, la bande passante mémoire, le comportement du cache KV, la bande passante d’interconnexion, la taille des lots, le décodage spéculatif, la quantification, l’ordonnancement hôte et les collectifs de communication.

Cela fait de l’optimisation de l’inférence un test de stress utile pour un système d’ingénierie autonome.

Démo deux : une base de données compatible SQLite à partir d’une seule exigence

Le deuxième projet public de Fleet s’éloigne entièrement des kernels GPU.

Intent Lab a demandé au système de construire un moteur de base de données SQL compatible avec SQLite.

Le matériel de lancement présente une exigence équivalente à :

Construire un moteur de base de données SQL compatible avec SQLite,
dans le sens où il doit réussir TOUS les cas de test sqllogictest,
et les performances doivent être comparables ou supérieures.

Intent Lab indique que Fleet n’est pas parti du code source ni de la documentation de SQLite.

Au lieu de cela, il a traité le comportement du système existant et le corpus de tests comme contrat d’acceptation.

L’image illustre l’intention et le processus de Fleet pour construire un moteur de base de données SQL compatible avec SQLite. L’intention est de partir uniquement du comportement et du corpus de tests, sans dépendre du code ou de la documentation existants, afin de construire un moteur de base de données SQL compatible avec SQLite. Le processus inclut conception et implémentation itératives, division du travail, indépendance du modèle et efficacité des coûts. Le diagramme de séquence opérationnelle montre également les activités des différents rôles dans le projet. Cette image est étroitement liée au contexte et illustre visuellement l’intention et le processus de construction du moteur de base de données décrits dans le texte.

L’entreprise rapporte que le système final a réussi environ six millions de tests de compatibilité SQLite.

Ce chiffre provient d’Intent Lab et n’a pas été reproduit indépendamment pour cet article.

Un seul Fleet, plusieurs rôles d’ingénierie

Intent Lab visualise la construction de la base de données comme plusieurs rôles travaillant tout au long du projet :

  • Prise de décision.
  • Architecture.
  • Codage.
  • Tests.
  • Revue.
  • Assurance qualité.

Les rôles ne fonctionnent pas simplement en un transfert linéaire.

L’architecture peut changer pendant que l’implémentation progresse. Les tests se poursuivent pendant que des fonctionnalités sont ajoutées. La revue et l’assurance qualité restent actives à mesure que la base de code grandit.

Le coût dépend fortement du modèle

Intent Lab a également publié une comparaison des coûts.

Pour la même construction de base de données, l’entreprise indique qu’une exécution avec Opus 4.8 a coûté environ 2 000 $, tandis qu’une exécution avec des modèles open source a coûté environ 350 $.

Ces chiffres proviennent de l’entreprise et dépendent des prix des modèles, de la consommation de jetons, de l’orchestration des agents et de l’infrastructure.

Ils illustrent néanmoins une question économique majeure pour l’ingénierie agentique : quel est le coût d’un projet réussi complet plutôt que le prix d’un seul appel de modèle ?

Démo trois : une preuve formelle

Système de fichiers vérifié pour les agents

La troisième démonstration est un système de fichiers distribué appelé AgentFS.

Intent Lab indique qu'il a été conçu spécifiquement pour les charges de travail d'agents dans les environnements cloud.

Les agents d'IA de codage et de recherche ont tendance à créer un modèle de stockage distinctif :

  • De nombreux environnements sandbox temporaires.
  • Un grand nombre de petits fichiers.
  • Une création et une suppression fréquentes.
  • Un stockage cloud partagé.
  • Un renouvellement élevé des métadonnées.
  • Des dépôts à courte durée de vie.

Intent Lab affirme avoir évalué des systèmes existants, notamment Amazon EFS et S3FS, constaté des limitations pour cette charge de travail, et construit un nouveau système de fichiers à la place.

L'entreprise revendique des accélérations significatives par rapport aux systèmes comparés pour les opérations intensives en métadonnées.

L'image présente les caractéristiques clés du système de fichiers distribué AgentFS. Le titre en haut indique « Système de fichiers distribué 10 fois plus rapide ». La partie centrale compare les performances d'AgentFS, d'EFS et de S3FS pour les opérations de dépôt Git, telles que git clone, git status, etc., AgentFS étant le plus performant. La partie inférieure décrit l'objectif de construction d'AgentFS, la validation continue, la détection et la réparation des pannes, ainsi que la vérification formelle, notamment par un model checking formel de 1,8 million d'états, garantissant un niveau de correction que les agents de codage ne peuvent pas atteindre par de simples tests.

Encore une fois, il s'agit des benchmarks de lancement d'Intent Lab, et non de résultats indépendants de tiers.

La vérification formelle a trouvé un bug que l'agent de codage avait manqué

La partie la plus importante de l'exemple du système de fichiers n'est pas le graphique de comparaison.

C'est la vérification.

Intent Lab affirme que Fleet a modélisé formellement les protocoles de base et exploré environ 1,9 million d'états.

Ce processus a mis en évidence un bug dans le code produit par un agent de codage.

Le bug pourrait conduire à un état corrompu transitoire lors du comportement distribué de création/suppression.

Intent Lab indique que Fleet a ensuite corrigé l'implémentation et relancé la vérification.

L'entreprise fait également état d'environ 300 tests d'intégration, ainsi que d'injection de pannes et de fuzzing avec des pannes et des réplicas injectés.

La vérification formelle est précieuse ici car les systèmes de fichiers sont particulièrement vulnérables aux entrelacements rares.

Les tests traditionnels peuvent montrer que le chemin courant fonctionne. Un model checker peut rechercher systématiquement des combinaisons d'états que les suites de tests ordinaires ne rencontreront peut-être jamais.

Ce principe est bien établi en dehors d'Intent Lab. Les chercheurs en systèmes de fichiers utilisent le model checking depuis des décennies pour exposer les bugs de cohérence en cas de panne et les problèmes de métadonnées dans des systèmes matures.

L'affirmation nouvelle ici est qu'un système d'ingénierie autonome peut intégrer ce style de vérification dans sa propre boucle de développement.

La couche manquante entre « le code qui s'exécute » et le logiciel de production

L'argument central de Jia est plus large que ces trois démonstrations.

Les modèles modernes peuvent écrire du code rapidement.

Cela ne signifie pas que le résultat est un logiciel qu'une entreprise devrait exploiter pendant des années.

Il soutient que l'écart restant n'est pas simplement un autre bond dans la capacité de codage des modèles.

C'est une couche d'ingénierie autour du modèle.

Il s'agit d'un tweet publié par Yangqing Jia, avec une mention vérifiée à côté du nom du compte, exprimant son point de vue central : les modèles actuels écrivent du code très rapidement, mais il existe un écart réel entre le code exécutable et les logiciels de qualité production qu'une entreprise doit exploiter pendant des années. Il estime que cet écart n'est pas une limite de capacité des modèles, mais une couche manquante. Ce tweet correspond précisément à l'argument central de Yangqing Jia mentionné précédemment, abordant la couche d'ingénierie manquante nécessaire après la génération de code par les modèles pour construire des systèmes de production.

Un système de production nécessite plus qu'une implémentation.

Il faut des exigences, une architecture, des interfaces,

compromis, coordination, tests, analyse de performance, travail de fiabilité, vérification, gestion des pannes, maintenance, et retour d’expérience de la production.

Un modèle de codage peut participer à toutes ces activités.

La thèse de Fleet est qu’elles doivent être organisées en un système autonome unique.

Fleet Décompose l’Ingénierie en Six Étapes

Intent Lab décrit son processus d’ingénierie en six étapes.

L’image illustre les six étapes du flux de travail de Fleet. L’étape Comprendre, où Fleet transforme une intention floue en résultats concrets, contraintes et critères d’acceptation ; l’étape Concevoir, où Fleet pèse les compromis, définit les interfaces, les composants et la structure système à long terme ; l’étape Coordonner, où le système divise un grand projet en tâches, gère les dépendances et maintient l’implémentation alignée sur la conception ; l’étape Construire, où l’implémentation évolue avec l’architecture et le code à mesure que de nouvelles informations apparaissent ; l’étape Vérifier, où Fleet valide le travail par des preuves formelles et d’autres moyens, les problèmes se révélant lors des modifications de code ; l’étape Évoluer, où le système montre son comportement réel en production, Fleet observe la performance, et réinjecte usage, fiabilité et coût dans la conception, avec une amélioration continue du logiciel.

1. Comprendre

Fleet est censé transformer une intention vague en résultat concret, contraintes, critères d’acceptation et définitions mesurables du succès.

2. Concevoir

Fleet pèse les compromis et définit les interfaces, les composants et la structure système à long terme.

3. Coordonner

Le système divise un grand projet en tâches, gère les dépendances et maintient l’implémentation alignée sur la conception globale.

4. Construire

L’implémentation et l’architecture évoluent ensemble à mesure que de nouvelles informations apparaissent pendant le développement.

5. Vérifier

La vérification peut inclure des tests unitaires, des tests d’intégration, des benchmarks, des preuves formelles, du model checking, de l’injection de fautes, du fuzzing et de la validation en environnement d’exécution.

6. Évoluer

Fleet est conçu pour observer la performance en production et réinjecter des informations sur l’usage, la fiabilité et le coût dans la conception.

C’est ici que l’ambition d’Intent Lab dépasse celle d’un agent de codage autonome.

L’objectif n’est pas seulement la génération de logiciels.

C’est la possession autonome de logiciels.

« Une Équipe d’Ingénierie Exemplaire » Est la Métaphore Produit

Intent Lab décrit Fleet comme fonctionnant à la manière d’une équipe d’ingénierie exemplaire.

C’est une métaphore utile car dans une organisation d’ingénierie solide, aucun membre n’est responsable de tous les aspects.

Un ingénieur peut optimiser des noyaux. Un autre peut concevoir un protocole de stockage. Quelqu’un d’autre maintient les benchmarks. Une autre personne examine la fiabilité.

Fleet tente de transformer ces responsabilités en rôles coordonnés d’agents.

La question difficile n’est donc pas seulement de savoir si un LLM peut écrire du code de haute qualité.

C’est de savoir si plusieurs processus autonomes peuvent maintenir une architecture système cohérente tout en construisant, testant, optimisant, vérifiant et révisant le même projet sur un long horizon.

L’Argument Économique : Le Logiciel Peut Devenir Plus Personnalisé

Jia présente également un argument économique.

Pendant des décennies, le développement logiciel a eu un coût fixe élevé.

La stratégie rationnelle était de créer un produit, de le vendre à de nombreux utilisateurs, et de demander aux utilisateurs ayant des besoins différents de s’adapter au même logiciel.

Si l’ingénierie autonome réduit le coût fixe de construction et de maintenance d’un système, cette équation change.

![L’image montre un tweet de Yangqing Jia sur Twitter. Le tweet dit : « Si cela fonctionne, l’économie de l’ingénierie informatique changera à jamais. Pendant 50 ans, la bonne approche était de construire un logiciel et d’en vendre le plus possible, malgré des besoins différents. Maintenant, cela peut changer. Le monde verra des logiciels bien plus personnalisés. » Le tweet a été publié il y a 8 heures, avec les options « Modifier » et « ... » en haut à droite. Cette image est liée à l’argument économique de Yangqing Jia dans le document et illustre directement sa réflexion sur l’évolution de l’économie de l’ingénierie informatique.](https://we0-cms.

oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/dce27f23-7161-488d-aa67-f2ccc932be13-bdea7efd-b790-4fe7-97f2-e828d77b2750.png)

Une entreprise pourrait justifier un logiciel pour un groupe restreint d’utilisateurs.

Une équipe interne pourrait construire un système pour un flux de travail qui resterait autrement en attente pendant des années.

Un groupe d’infrastructure pourrait créer un moteur spécialisé au lieu d’accepter les limites d’un produit générique.

Intent Lab indique qu’il prévoit de collaborer avec des organisations externes sur ce type de projet : des systèmes à forte valeur d’ingénierie que les entreprises ont reportés parce que le travail requis est trop important.

Ceci n’est pas la même chose que « une invite crée n’importe quelle application »

Les démonstrations de lancement peuvent facilement être réduites à un titre viral :

Une phrase a créé une base de données.

Ce cadrage omet l’essentiel du travail que Fleet prétend accomplir.

L’exemple de la base de données commence par une seule exigence, mais le système exécute ensuite un long processus d’ingénierie.

Il doit à plusieurs reprises prendre des décisions de conception, générer du code, exécuter des tests, diagnostiquer les échecs, réviser l’architecture, examiner le comportement et recommencer.

L’utilisateur fournit une intention brève.

La machine n’effectue pas nécessairement une tâche brève.

Une meilleure évaluation demande combien d’intervention humaine a été requise, combien de calcul l’exécution a consommé, combien de tentatives ont eu lieu, dans quelle mesure le résultat a été vérifié, si une autre équipe peut le reproduire, et si le système peut être maintenu après la démonstration.

Ce qui reste à prouver

Les premiers résultats d’Intent Lab sont ambitieux, mais le matériel public laisse des questions importantes ouvertes.

Reproduction indépendante

Le résultat d’inférence de 6,3×, le nombre de tests SQLite, les performances d’AgentFS et les chiffres de vérification formelle sont déclarés par l’entreprise.

Une reproduction indépendante renforcerait considérablement ces affirmations.

Architecture de Fleet

Intent Lab n’a pas documenté publiquement suffisamment de détails pour reconstruire Fleet lui-même.

On ne sait pas encore clairement quels modèles de base sont utilisés pour chaque rôle, comment les agents partagent l’état, comment les tâches sont planifiées, comment les conflits sont résolus, comment les spécifications sont stockées, ni combien de supervision humaine reste disponible.

Propriété de production

Construire un système de qualité de référence n’est pas identique à l’exploiter pendant des années.

L’étape « Evolve » pourrait être la partie la plus difficile de la thèse, car un propriétaire de production doit gérer les correctifs de sécurité, les changements de dépendances, les évolutions matérielles, les incidents, les variations de coûts, les demandes de fonctionnalités et la compatibilité ascendante.

Économie

L’ingénierie autonome peut être moins chère qu’une équipe humaine pour certaines tâches tout en consommant des quantités substantielles d’inférence et de calcul.

L’exemple de base de données d’Intent Lab lui-même montre que le choix du modèle peut modifier le coût total du projet de plusieurs fois.

Une façon plus précise de penser à Intent Lab

Intent Lab n’est pas simplement une autre startup d’agents de codage.

Sa thèse est plus proche de l’ingénierie de systèmes autonomes.

L’unité de travail cible n’est pas une complétion de code ni une demande d’extraction.

C’est un système de production.

C’est pourquoi les trois premiers exemples semblent sans rapport.

Un moteur d’inférence, une base de données et un système de fichiers partagent peu de choses au niveau du produit.

Ils partagent un modèle d’ingénierie :

Intention
→ spécification
→ architecture
→

Implémentation coordonnée
→ mesure
→ vérification
→ itération
→ évolution de la production

Fleet est conçu pour automatiser ce schéma.

La question de savoir s'il peut le faire de manière fiable dans de nombreuses entreprises réelles reste ouverte.

Mais l'ambition est claire.

## Questions fréquentes
### Qu'est-ce qu'Intent Lab ?

Intent Lab est une nouvelle entreprise d'infrastructure IA et d'ingénierie autonome cofondée par Yangqing Jia et d'autres ingénieurs systèmes expérimentés. Son premier produit, Fleet, est conçu pour transformer des intentions logicielles de haut niveau en systèmes de qualité production.

### Qu'est-ce que Fleet ?

Fleet est le système d'ingénierie autonome d'Intent Lab. L'entreprise le décrit comme une équipe d'agents coordonnés capables de comprendre les exigences, de concevoir l'architecture, de construire le code, de vérifier les résultats et de continuer à faire évoluer le logiciel après son déploiement.

### Fleet a-t-il vraiment rendu l'inférence de GLM-5.2 6,3 fois plus rapide ?

Intent Lab indique que son moteur optimisé GLM-5.2 a augmenté la vitesse de sortie de 102 jetons/s sur TensorRT-LLM standard à 647 jetons/s sur deux nœuds Grace Blackwell. Ce chiffre est un benchmark déclaré par l'entreprise et n'a pas encore été reproduit de manière indépendante dans les sources examinées ici.

### Fleet a-t-il construit une base de données à partir d'une seule invite ?

Intent Lab affirme que l'exigence initiale de la base de données était une seule invite demandant un moteur SQL compatible SQLite. Fleet a ensuite réalisé de manière autonome l'architecture, le codage, les tests, la revue et l'assurance qualité jusqu'à ce que, selon l'entreprise, le système réussisse environ six millions de tests de compatibilité.

### Qu'est-ce qu'AgentFS ?

AgentFS est un système de fichiers distribué créé lors de la troisième démonstration de lancement d'Intent Lab. Il est optimisé pour les charges de travail d'agents IA impliquant de nombreux environnements sandbox et de petits fichiers, et Intent Lab affirme que ses protocoles de base ont été vérifiés par vérification formelle de modèles.

### Quelle est la différence entre Fleet et un agent de codage normal ?

Un agent de codage normal travaille généralement sur des modifications de code au sein d'un projet existant. Fleet est conçu pour coordonner un cycle complet d'ingénierie système, incluant la définition des exigences, l'architecture, l'implémentation, l'optimisation des performances, la vérification formelle, les tests de pannes et l'évolution de la production.

### Fleet est-il open source ?

Intent Lab a partagé publiquement des démonstrations et sa thèse produit, mais les sources examinées pour cet article ne montrent pas de publication publique du système d'orchestration complet de Fleet. Consultez le site officiel d'Intent Lab pour la disponibilité la plus récente.

### NVIDIA DGX Cloud Lepton fonctionne-t-il toujours ?

Oui. NVIDIA maintient actuellement des pages produit et de documentation pour DGX Cloud Lepton, y compris les charges de travail, les groupes de nœuds, les points de terminaison, les Dev Pods, les tâches par lots et la fonctionnalité apportez-votre-propre calcul. Cela est distinct du débat sur la mesure dans laquelle le produit NVIDIA a préservé la feuille de route originale de la startup Lepton AI.

## Outils associés
- [Intent Lab](https://intentlab.ai/) : L'entreprise qui construit Fleet, un système d'ingénierie autonome pour transformer les intentions en logiciels de production.
- [NVIDIA TensorRT-LLM](https://docs.nvidia.com/tensorrt-llm/index.html) : Le framework d'inférence de production de NVIDIA pour optimiser et servir les grands modèles de langage sur les GPU NVIDIA.
- [TensorRT-LLM sur GitHub](https://github.com/NVIDIA/TensorRT-LLM) : Le dépôt open source de la pile d'inférence LLM de NVIDIA.

[GLM-5.2](https://huggingface.co/zai-org/GLM-5.2) : le modèle open-weight à horizon long de Z.ai, utilisé dans la démonstration du moteur d'inférence d'Intent Lab.
- [NVIDIA DGX Cloud Lepton](https://www.nvidia.com/en-us/data-center/dgx-cloud-lepton/) : la plateforme de NVIDIA pour créer et déployer des charges de travail d'IA à travers un réseau de fournisseurs de calcul GPU.
- [SQLite](https://www.sqlite.org/) : la base de données dont les tests de comportement et de compatibilité ont servi de cible pour la démonstration de base de données de Fleet.

## Liens connexes

- [Intent Lab : Transformez votre intention en systèmes de production](https://intentlab.ai/blog/turn-your-intent-into-production-systems) : l'article de lancement officiel d'Intent Lab et la source des démonstrations Fleet.
- [Annonce d'Intent Lab par Yangqing Jia](https://x.com/jiayq/status/2082135245776920681) : le post public de Jia présentant Intent Lab et sa thèse sur l'ingénierie autonome.
- [Documentation NVIDIA DGX Cloud Lepton](https://docs.nvidia.com/dgx-cloud/lepton/get-started/) : la documentation officielle actuelle de la plateforme issue de la technologie de Lepton AI.
- [Lancement de NVIDIA DGX Cloud Lepton](https://nvidianews.nvidia.com/news/nvidia-announces-dgx-cloud-lepton-to-connect-developers-to-nvidias-global-compute-ecosystem) : l'annonce 2025 de NVIDIA décrivant DGX Cloud Lepton et son marché mondial de GPU.
- [Fiche officielle du modèle GLM-5.2](https://huggingface.co/zai-org/GLM-5.2) : les spécifications officielles et la documentation du modèle de Z.ai.
- [Documentation NVIDIA TensorRT-LLM](https://docs.nvidia.com/tensorrt-llm/index.html) : la documentation officielle sur l'architecture, l'installation, l'optimisation, l'exécution et le déploiement.
- [USENIX : Utilisation de la vérification de modèles pour trouver de graves erreurs de systèmes de fichiers](https://www.usenix.org/legacy/event/osdi04/tech/yang.html) : un exemple classique démontrant pourquoi la vérification formelle de modèles est utile pour détecter les rares défaillances de correction des systèmes de fichiers.

## Résumé

La nouvelle entreprise de Yangqing Jia, Intent Lab, construit Fleet autour d'une unité de travail d'IA différente : non pas la génération de code, mais le cycle de vie complet des systèmes de production.

Ses premières démonstrations couvrent l'optimisation de l'inférence GLM-5.2, une base de données compatible SQLite et un système de fichiers distribué vérifié formellement. Intent Lab rapporte une accélération de l'inférence de 6,3×, environ six millions de tests de compatibilité de base de données et une vérification de modèles portant sur près de 1,9 million d'états de systèmes de fichiers.

L'idée commune est une boucle d'ingénierie en six étapes — Comprendre, Concevoir, Coordonner, Construire, Vérifier et Évoluer — qui tente de reproduire les responsabilités d'une organisation d'ingénierie solide avec des agents autonomes.

Les résultats sont encore préliminaires et largement autodéclarés ; la reproductibilité et l'exploitation en production à long terme restent donc les véritables tests.

**La revendication la plus importante de Fleet n'est pas que l'IA peut écrire du code à partir d'une seule phrase ; c'est qu'un système autonome peut assumer la responsabilité du travail d'ingénierie entre une phrase et un logiciel digne d'être exploité pendant des années.**