Yangqing Jia lance Intent Lab : Fleet transforme des instructions en une ligne en systèmes de production
Un peu plus d'un an après l'intégration de Lepton AI à NVIDIA, Yangqing Jia repart de zéro. Sa nouvelle entreprise, Intent Lab, ne se lance pas avec un chatbot classique, ni un marché du cloud

Yangqing Jia lance Intent Lab : Fleet transforme des instructions en une ligne en systèmes de production
Introduction
Un peu plus d'un an après l'intégration de Lepton AI à NVIDIA, Yangqing Jia repart de zéro.
Sa nouvelle entreprise, Intent Lab, ne lance ni chatbot conventionnel, ni marketplace cloud, ni IDE pour développeurs. À la place, la société développe Fleet, qu'elle décrit comme une équipe d'ingénierie autonome capable de transformer une intention de haut niveau en logiciel de qualité production.
La première démonstration publique d'Intent Lab comprend trois systèmes très différents :
- Un moteur d'inférence GLM-5.2 optimisé au-delà du TensorRT-LLM standard.
- Une base de données compatible SQLite construite à partir d'une exigence en une ligne.
- Un système de fichiers distribué pour agents IA avec vérification formelle et tests de panne.
À première vue, ces projets ne ressemblent pas à une seule catégorie de produit.
C'est précisément le but.
Intent Lab affirme que le véritable produit est le système d'ingénierie qui les sous-tend. Fleet est conçu pour accomplir le travail entre une demande logicielle vague et un système pouvant être évalué, vérifié, exploité et fait évoluer en production.

Les premiers chiffres de performance présentés dans cet article proviennent des propres supports de lancement d'Intent Lab. Ce sont des démonstrations prometteuses, et non des certifications de référence indépendantes. L'entreprise n'a pas encore publié suffisamment de détails de reproductibilité pour que des équipes externes puissent confirmer chaque résultat dans des conditions identiques.
Yangqing Jia fonde une nouvelle entreprise d'infrastructure
La carrière de Yangqing Jia a toujours gravité autour de l'infrastructure.
Il est surtout connu pour avoir créé Caffe à l'UC Berkeley, puis pour avoir travaillé sur d'importants projets d'infrastructure IA, notamment PyTorch et ONNX.
Après avoir quitté Alibaba en 2023, Jia a cofondé Lepton AI, une entreprise axée sur la simplification de l'accès aux GPU et du déploiement de modèles pour les développeurs.
La proposition initiale de Lepton combinait une expérience développeur native Python avec une infrastructure capable d'exécuter des charges de travail IA sur plusieurs fournisseurs de GPU.
L'entreprise a été acquise par NVIDIA en 2025, une transaction publiquement évaluée à l'époque à plusieurs centaines de millions de dollars. Des rapports industriels ultérieurs ont estimé le montant à environ 700 millions de dollars, bien que NVIDIA n'ait jamais publié de prix d'acquisition final.
La technologie de Lepton est devenue partie intégrante de NVIDIA DGX Cloud Lepton.

NVIDIA décrit actuellement DGX Cloud Lepton comme une plateforme active qui unifie le calcul GPU à travers les fournisseurs de cloud et l'infrastructure appartenant aux clients pour le développement, l'entraînement et l'inférence.
Ce statut actuel mérite d'être clarifié, car les commentaires après le départ de Jia affirmaient que le produit original de style startup Lepton et ses ambitions open source n'avaient pas survécu inchangés à l'acquisition.
Les preuves publiques soutiennent une description plus prudente :
- La société autonome Lepton a été absorbée par NVIDIA.
- Sa marque et sa technologie font désormais partie de DGX Cloud Lepton.
- NVIDIA exploite et documente toujours DGX Cloud Lepton aujourd'hui.
- La bibliothèque Python publique et le CLI
leprestent disponibles. - Certaines attentes antérieures concernant l'open source de composants plus profonds de la plateforme ne se sont jamais concrétisées sous la forme que les observateurs attendaient.
Jia a ensuite occupé le poste de vice-président du logiciel système chez NVIDIA avant de quitter l'entreprise en 2026.
Une brève étape chez Hyperbolic
En juillet 2026, Hyperbolic a annoncé que Jia avait rejoint l'entreprise d'infrastructure GPU en tant que conseiller.
Hyperbolic a décrit son parcours à travers Caffe, ONNX, PyTorch, Lepton AI, NVIDIA, Google, Facebook et Alibaba Cloud comme particulièrement pertinent pour son travail sur l'accès GPU et l'infrastructure.

Ce rôle s'est avéré ne pas être sa principale prochaine étape.
Le 29 juillet, Jia a présenté publiquement Intent Lab.
Son cadrage était différent de celui de Lepton AI.
Lepton se concentrait sur l'accès plus facile des développeurs à la puissance de calcul.
Intent Lab se concentre sur la capacité à donner à un système d'ingénierie autonome la possibilité de créer et de maintenir les logiciels qui s'exécutent sur cette puissance de calcul.
Jia a résumé ce changement en disant que ses équipes avaient passé leur carrière à construire soigneusement de grands systèmes un par un. Ce qui les intéressait désormais, c'était un système capable de produire de nombreux systèmes de ce type.

Fleet est le produit derrière les trois démonstrations
Intent Lab appelle son système d'ingénierie autonome Fleet.
L'entreprise le décrit comme une équipe plutôt que comme un agent de codage unique.
La distinction est importante.
Un agent de codage typique peut modifier des fichiers, exécuter des commandes, corriger des tests, rechercher dans un dépôt et implémenter une fonctionnalité.
Fleet est présenté comme un système capable de coordonner un processus d'ingénierie plus long.
L'objectif déclaré d'Intent Lab est de couvrir le travail nécessaire pour passer d'une demande de haut niveau à un système de production mesurable.
comportement, vérification et une voie vers l'amélioration continue.
Les trois premières démonstrations ont été choisies pour tester cette affirmation dans des domaines d'ingénierie très différents.
Démo Une : Optimisation de GLM-5.2 au-delà du TensorRT-LLM standard
Le résultat de lancement le plus frappant sur le plan technique est un moteur d'inférence pour GLM-5.2.
L'instruction initiale était essentiellement un objectif d'ingénierie :
Réingénier TensorRT-LLM pour que GLM-5.2 fonctionne efficacement sur les nœuds Grace Blackwell,
identifier les opportunités d'optimisation, les mettre en œuvre et les vérifier de manière autonome.
TensorRT-LLM est déjà la pile d'inférence orientée production de NVIDIA pour les grands modèles de langage.
NVIDIA documente des fonctionnalités telles que le service multi-GPU et multi-nœuds, le traitement par lots en vol, la mise en cache KV paginée, la quantification, les noyaux optimisés et les runtimes Python et C++.
Améliorer les performances sur cette pile constitue donc une cible plus exigeante que l'optimisation d'une implémentation de référence non optimisée.
Intent Lab rapporte une augmentation de 6,3× de la vitesse de sortie
Intent Lab indique que Fleet a commencé avec TensorRT-LLM standard à environ :
102 tokens/s
Un runtime optimisé a atteint :
161 tokens/s
Après l'ajout du chemin de décodage spéculatif optimisé de l'entreprise, le système aurait atteint :
647 tokens/s
Cela représente environ 6,3× la vitesse de sortie d'origine.

Intent Lab indique que le benchmark a utilisé deux nœuds Grace Blackwell.
L'entreprise divise le travail de performance en quatre catégories.
Optimisation des noyaux : +24 %
Fleet aurait appliqué la fusion de noyaux et généré des chemins PTX/SASS de bas niveau pour un contrôle au niveau des instructions.
Optimisation du runtime : +16 %
Intent Lab indique que le runtime a supprimé les copies répétées de métadonnées hôte-vers-périphérique du décodage en régime permanent grâce au traitement par lots H2D et aux techniques de copie zéro.
Optimisation de la communication : +18 %
Fleet aurait utilisé un chemin de réduction globale MNNVL fusionné qui intègre l'addition résiduelle et RMSNorm dans l'opération collective.
Décodage spéculatif : environ 4×
Le gain individuel le plus important provient du décodage spéculatif.
Intent Lab indique qu'un rédacteur DSpark optimisé propose plusieurs tokens et que le modèle principal les vérifie par lots, augmentant considérablement le débit de décodage.
L'entreprise rapporte le résultat complet de bout en bout comme une amélioration de 534 % par rapport à sa référence standard.
Ces chiffres sont les propres mesures d'Intent Lab. La configuration matérielle, les détails de la charge de travail, les paramètres de lot, la longueur de sortie, la précision, la concurrence et les révisions logicielles peuvent affecter considérablement les benchmarks d'inférence.
La boucle d'optimisation de Fleet ressemble davantage à une équipe qu'à un passage unique
Intent Lab indique que Fleet suit une boucle d'ingénierie répétée :
- Analyse roofline
- Identification des goulots d'étranglement
- Proposition
- Vérification
- Composition
- Retour au goulot d'étranglement suivant
Si une optimisation proposée
échoue à la validation, le système revient en arrière et réessaie.
L’étape « composée » est cruciale car l’optimisation des performances échoue souvent lorsque des optimisations réussies individuellement interfèrent entre elles.
Fleet est conçu pour ne conserver les modifications qu’après avoir vérifié que le système combiné fonctionne toujours.
Pourquoi GLM-5.2 est une cible exigeante
GLM-5.2 est le modèle phare de Z.ai pour les tâches à long horizon.
Sa fiche technique officielle met en avant une fenêtre de contexte d’un million de jetons, des charges de travail de codage et d’agents à long horizon, un effort de raisonnement flexible, une architecture d’attention sparse améliorée, et des poids ouverts sous licence MIT.
Les grands modèles avec contexte long et charges agentiques créent des problèmes de serveur difficiles.
L’implémentation la plus rapide dépend des interactions entre la conception des kernels, la bande passante mémoire, le comportement du cache KV, la bande passante d’interconnexion, la taille des lots, le décodage spéculatif, la quantification, l’ordonnancement hôte et les collectifs de communication.
Cela fait de l’optimisation de l’inférence un test de stress utile pour un système d’ingénierie autonome.
Démo deux : une base de données compatible SQLite à partir d’une seule exigence
Le deuxième projet public de Fleet s’éloigne entièrement des kernels GPU.
Intent Lab a demandé au système de construire un moteur de base de données SQL compatible avec SQLite.
Le matériel de lancement présente une exigence équivalente à :
Construire un moteur de base de données SQL compatible avec SQLite,
dans le sens où il doit réussir TOUS les cas de test sqllogictest,
et les performances doivent être comparables ou supérieures.
Intent Lab indique que Fleet n’est pas parti du code source ni de la documentation de SQLite.
Au lieu de cela, il a traité le comportement du système existant et le corpus de tests comme contrat d’acceptation.

L’entreprise rapporte que le système final a réussi environ six millions de tests de compatibilité SQLite.
Ce chiffre provient d’Intent Lab et n’a pas été reproduit indépendamment pour cet article.
Un seul Fleet, plusieurs rôles d’ingénierie
Intent Lab visualise la construction de la base de données comme plusieurs rôles travaillant tout au long du projet :
- Prise de décision.
- Architecture.
- Codage.
- Tests.
- Revue.
- Assurance qualité.
Les rôles ne fonctionnent pas simplement en un transfert linéaire.
L’architecture peut changer pendant que l’implémentation progresse. Les tests se poursuivent pendant que des fonctionnalités sont ajoutées. La revue et l’assurance qualité restent actives à mesure que la base de code grandit.
Le coût dépend fortement du modèle
Intent Lab a également publié une comparaison des coûts.
Pour la même construction de base de données, l’entreprise indique qu’une exécution avec Opus 4.8 a coûté environ 2 000 $, tandis qu’une exécution avec des modèles open source a coûté environ 350 $.
Ces chiffres proviennent de l’entreprise et dépendent des prix des modèles, de la consommation de jetons, de l’orchestration des agents et de l’infrastructure.
Ils illustrent néanmoins une question économique majeure pour l’ingénierie agentique : quel est le coût d’un projet réussi complet plutôt que le prix d’un seul appel de modèle ?
Démo trois : une preuve formelle
Système de fichiers vérifié pour les agents
La troisième démonstration est un système de fichiers distribué appelé AgentFS.
Intent Lab indique qu'il a été conçu spécifiquement pour les charges de travail d'agents dans les environnements cloud.
Les agents d'IA de codage et de recherche ont tendance à créer un modèle de stockage distinctif :
- De nombreux environnements sandbox temporaires.
- Un grand nombre de petits fichiers.
- Une création et une suppression fréquentes.
- Un stockage cloud partagé.
- Un renouvellement élevé des métadonnées.
- Des dépôts à courte durée de vie.
Intent Lab affirme avoir évalué des systèmes existants, notamment Amazon EFS et S3FS, constaté des limitations pour cette charge de travail, et construit un nouveau système de fichiers à la place.
L'entreprise revendique des accélérations significatives par rapport aux systèmes comparés pour les opérations intensives en métadonnées.

Encore une fois, il s'agit des benchmarks de lancement d'Intent Lab, et non de résultats indépendants de tiers.
La vérification formelle a trouvé un bug que l'agent de codage avait manqué
La partie la plus importante de l'exemple du système de fichiers n'est pas le graphique de comparaison.
C'est la vérification.
Intent Lab affirme que Fleet a modélisé formellement les protocoles de base et exploré environ 1,9 million d'états.
Ce processus a mis en évidence un bug dans le code produit par un agent de codage.
Le bug pourrait conduire à un état corrompu transitoire lors du comportement distribué de création/suppression.
Intent Lab indique que Fleet a ensuite corrigé l'implémentation et relancé la vérification.
L'entreprise fait également état d'environ 300 tests d'intégration, ainsi que d'injection de pannes et de fuzzing avec des pannes et des réplicas injectés.
La vérification formelle est précieuse ici car les systèmes de fichiers sont particulièrement vulnérables aux entrelacements rares.
Les tests traditionnels peuvent montrer que le chemin courant fonctionne. Un model checker peut rechercher systématiquement des combinaisons d'états que les suites de tests ordinaires ne rencontreront peut-être jamais.
Ce principe est bien établi en dehors d'Intent Lab. Les chercheurs en systèmes de fichiers utilisent le model checking depuis des décennies pour exposer les bugs de cohérence en cas de panne et les problèmes de métadonnées dans des systèmes matures.
L'affirmation nouvelle ici est qu'un système d'ingénierie autonome peut intégrer ce style de vérification dans sa propre boucle de développement.
La couche manquante entre « le code qui s'exécute » et le logiciel de production
L'argument central de Jia est plus large que ces trois démonstrations.
Les modèles modernes peuvent écrire du code rapidement.
Cela ne signifie pas que le résultat est un logiciel qu'une entreprise devrait exploiter pendant des années.
Il soutient que l'écart restant n'est pas simplement un autre bond dans la capacité de codage des modèles.
C'est une couche d'ingénierie autour du modèle.

Un système de production nécessite plus qu'une implémentation.
Il faut des exigences, une architecture, des interfaces,
compromis, coordination, tests, analyse de performance, travail de fiabilité, vérification, gestion des pannes, maintenance, et retour d’expérience de la production.
Un modèle de codage peut participer à toutes ces activités.
La thèse de Fleet est qu’elles doivent être organisées en un système autonome unique.
Fleet Décompose l’Ingénierie en Six Étapes
Intent Lab décrit son processus d’ingénierie en six étapes.

1. Comprendre
Fleet est censé transformer une intention vague en résultat concret, contraintes, critères d’acceptation et définitions mesurables du succès.
2. Concevoir
Fleet pèse les compromis et définit les interfaces, les composants et la structure système à long terme.
3. Coordonner
Le système divise un grand projet en tâches, gère les dépendances et maintient l’implémentation alignée sur la conception globale.
4. Construire
L’implémentation et l’architecture évoluent ensemble à mesure que de nouvelles informations apparaissent pendant le développement.
5. Vérifier
La vérification peut inclure des tests unitaires, des tests d’intégration, des benchmarks, des preuves formelles, du model checking, de l’injection de fautes, du fuzzing et de la validation en environnement d’exécution.
6. Évoluer
Fleet est conçu pour observer la performance en production et réinjecter des informations sur l’usage, la fiabilité et le coût dans la conception.
C’est ici que l’ambition d’Intent Lab dépasse celle d’un agent de codage autonome.
L’objectif n’est pas seulement la génération de logiciels.
C’est la possession autonome de logiciels.
« Une Équipe d’Ingénierie Exemplaire » Est la Métaphore Produit
Intent Lab décrit Fleet comme fonctionnant à la manière d’une équipe d’ingénierie exemplaire.
C’est une métaphore utile car dans une organisation d’ingénierie solide, aucun membre n’est responsable de tous les aspects.
Un ingénieur peut optimiser des noyaux. Un autre peut concevoir un protocole de stockage. Quelqu’un d’autre maintient les benchmarks. Une autre personne examine la fiabilité.
Fleet tente de transformer ces responsabilités en rôles coordonnés d’agents.
La question difficile n’est donc pas seulement de savoir si un LLM peut écrire du code de haute qualité.
C’est de savoir si plusieurs processus autonomes peuvent maintenir une architecture système cohérente tout en construisant, testant, optimisant, vérifiant et révisant le même projet sur un long horizon.
L’Argument Économique : Le Logiciel Peut Devenir Plus Personnalisé
Jia présente également un argument économique.
Pendant des décennies, le développement logiciel a eu un coût fixe élevé.
La stratégie rationnelle était de créer un produit, de le vendre à de nombreux utilisateurs, et de demander aux utilisateurs ayant des besoins différents de s’adapter au même logiciel.
Si l’ingénierie autonome réduit le coût fixe de construction et de maintenance d’un système, cette équation change.

Une entreprise pourrait justifier un logiciel pour un groupe restreint d’utilisateurs.
Une équipe interne pourrait construire un système pour un flux de travail qui resterait autrement en attente pendant des années.
Un groupe d’infrastructure pourrait créer un moteur spécialisé au lieu d’accepter les limites d’un produit générique.
Intent Lab indique qu’il prévoit de collaborer avec des organisations externes sur ce type de projet : des systèmes à forte valeur d’ingénierie que les entreprises ont reportés parce que le travail requis est trop important.
Ceci n’est pas la même chose que « une invite crée n’importe quelle application »
Les démonstrations de lancement peuvent facilement être réduites à un titre viral :
Une phrase a créé une base de données.
Ce cadrage omet l’essentiel du travail que Fleet prétend accomplir.
L’exemple de la base de données commence par une seule exigence, mais le système exécute ensuite un long processus d’ingénierie.
Il doit à plusieurs reprises prendre des décisions de conception, générer du code, exécuter des tests, diagnostiquer les échecs, réviser l’architecture, examiner le comportement et recommencer.
L’utilisateur fournit une intention brève.
La machine n’effectue pas nécessairement une tâche brève.
Une meilleure évaluation demande combien d’intervention humaine a été requise, combien de calcul l’exécution a consommé, combien de tentatives ont eu lieu, dans quelle mesure le résultat a été vérifié, si une autre équipe peut le reproduire, et si le système peut être maintenu après la démonstration.
Ce qui reste à prouver
Les premiers résultats d’Intent Lab sont ambitieux, mais le matériel public laisse des questions importantes ouvertes.
Reproduction indépendante
Le résultat d’inférence de 6,3×, le nombre de tests SQLite, les performances d’AgentFS et les chiffres de vérification formelle sont déclarés par l’entreprise.
Une reproduction indépendante renforcerait considérablement ces affirmations.
Architecture de Fleet
Intent Lab n’a pas documenté publiquement suffisamment de détails pour reconstruire Fleet lui-même.
On ne sait pas encore clairement quels modèles de base sont utilisés pour chaque rôle, comment les agents partagent l’état, comment les tâches sont planifiées, comment les conflits sont résolus, comment les spécifications sont stockées, ni combien de supervision humaine reste disponible.
Propriété de production
Construire un système de qualité de référence n’est pas identique à l’exploiter pendant des années.
L’étape « Evolve » pourrait être la partie la plus difficile de la thèse, car un propriétaire de production doit gérer les correctifs de sécurité, les changements de dépendances, les évolutions matérielles, les incidents, les variations de coûts, les demandes de fonctionnalités et la compatibilité ascendante.
Économie
L’ingénierie autonome peut être moins chère qu’une équipe humaine pour certaines tâches tout en consommant des quantités substantielles d’inférence et de calcul.
L’exemple de base de données d’Intent Lab lui-même montre que le choix du modèle peut modifier le coût total du projet de plusieurs fois.
Une façon plus précise de penser à Intent Lab
Intent Lab n’est pas simplement une autre startup d’agents de codage.
Sa thèse est plus proche de l’ingénierie de systèmes autonomes.
L’unité de travail cible n’est pas une complétion de code ni une demande d’extraction.
C’est un système de production.
C’est pourquoi les trois premiers exemples semblent sans rapport.
Un moteur d’inférence, une base de données et un système de fichiers partagent peu de choses au niveau du produit.
Ils partagent un modèle d’ingénierie :
Intention
→ spécification
→ architecture
→
Implémentation coordonnée
→ mesure
→ vérification
→ itération
→ évolution de la production
Fleet est conçu pour automatiser ce schéma.
La question de savoir s'il peut le faire de manière fiable dans de nombreuses entreprises réelles reste ouverte.
Mais l'ambition est claire.
## Questions fréquentes
### Qu'est-ce qu'Intent Lab ?
Intent Lab est une nouvelle entreprise d'infrastructure IA et d'ingénierie autonome cofondée par Yangqing Jia et d'autres ingénieurs systèmes expérimentés. Son premier produit, Fleet, est conçu pour transformer des intentions logicielles de haut niveau en systèmes de qualité production.
### Qu'est-ce que Fleet ?
Fleet est le système d'ingénierie autonome d'Intent Lab. L'entreprise le décrit comme une équipe d'agents coordonnés capables de comprendre les exigences, de concevoir l'architecture, de construire le code, de vérifier les résultats et de continuer à faire évoluer le logiciel après son déploiement.
### Fleet a-t-il vraiment rendu l'inférence de GLM-5.2 6,3 fois plus rapide ?
Intent Lab indique que son moteur optimisé GLM-5.2 a augmenté la vitesse de sortie de 102 jetons/s sur TensorRT-LLM standard à 647 jetons/s sur deux nœuds Grace Blackwell. Ce chiffre est un benchmark déclaré par l'entreprise et n'a pas encore été reproduit de manière indépendante dans les sources examinées ici.
### Fleet a-t-il construit une base de données à partir d'une seule invite ?
Intent Lab affirme que l'exigence initiale de la base de données était une seule invite demandant un moteur SQL compatible SQLite. Fleet a ensuite réalisé de manière autonome l'architecture, le codage, les tests, la revue et l'assurance qualité jusqu'à ce que, selon l'entreprise, le système réussisse environ six millions de tests de compatibilité.
### Qu'est-ce qu'AgentFS ?
AgentFS est un système de fichiers distribué créé lors de la troisième démonstration de lancement d'Intent Lab. Il est optimisé pour les charges de travail d'agents IA impliquant de nombreux environnements sandbox et de petits fichiers, et Intent Lab affirme que ses protocoles de base ont été vérifiés par vérification formelle de modèles.
### Quelle est la différence entre Fleet et un agent de codage normal ?
Un agent de codage normal travaille généralement sur des modifications de code au sein d'un projet existant. Fleet est conçu pour coordonner un cycle complet d'ingénierie système, incluant la définition des exigences, l'architecture, l'implémentation, l'optimisation des performances, la vérification formelle, les tests de pannes et l'évolution de la production.
### Fleet est-il open source ?
Intent Lab a partagé publiquement des démonstrations et sa thèse produit, mais les sources examinées pour cet article ne montrent pas de publication publique du système d'orchestration complet de Fleet. Consultez le site officiel d'Intent Lab pour la disponibilité la plus récente.
### NVIDIA DGX Cloud Lepton fonctionne-t-il toujours ?
Oui. NVIDIA maintient actuellement des pages produit et de documentation pour DGX Cloud Lepton, y compris les charges de travail, les groupes de nœuds, les points de terminaison, les Dev Pods, les tâches par lots et la fonctionnalité apportez-votre-propre calcul. Cela est distinct du débat sur la mesure dans laquelle le produit NVIDIA a préservé la feuille de route originale de la startup Lepton AI.
## Outils associés
- [Intent Lab](https://intentlab.ai/) : L'entreprise qui construit Fleet, un système d'ingénierie autonome pour transformer les intentions en logiciels de production.
- [NVIDIA TensorRT-LLM](https://docs.nvidia.com/tensorrt-llm/index.html) : Le framework d'inférence de production de NVIDIA pour optimiser et servir les grands modèles de langage sur les GPU NVIDIA.
- [TensorRT-LLM sur GitHub](https://github.com/NVIDIA/TensorRT-LLM) : Le dépôt open source de la pile d'inférence LLM de NVIDIA.
[GLM-5.2](https://huggingface.co/zai-org/GLM-5.2) : le modèle open-weight à horizon long de Z.ai, utilisé dans la démonstration du moteur d'inférence d'Intent Lab.
- [NVIDIA DGX Cloud Lepton](https://www.nvidia.com/en-us/data-center/dgx-cloud-lepton/) : la plateforme de NVIDIA pour créer et déployer des charges de travail d'IA à travers un réseau de fournisseurs de calcul GPU.
- [SQLite](https://www.sqlite.org/) : la base de données dont les tests de comportement et de compatibilité ont servi de cible pour la démonstration de base de données de Fleet.
## Liens connexes
- [Intent Lab : Transformez votre intention en systèmes de production](https://intentlab.ai/blog/turn-your-intent-into-production-systems) : l'article de lancement officiel d'Intent Lab et la source des démonstrations Fleet.
- [Annonce d'Intent Lab par Yangqing Jia](https://x.com/jiayq/status/2082135245776920681) : le post public de Jia présentant Intent Lab et sa thèse sur l'ingénierie autonome.
- [Documentation NVIDIA DGX Cloud Lepton](https://docs.nvidia.com/dgx-cloud/lepton/get-started/) : la documentation officielle actuelle de la plateforme issue de la technologie de Lepton AI.
- [Lancement de NVIDIA DGX Cloud Lepton](https://nvidianews.nvidia.com/news/nvidia-announces-dgx-cloud-lepton-to-connect-developers-to-nvidias-global-compute-ecosystem) : l'annonce 2025 de NVIDIA décrivant DGX Cloud Lepton et son marché mondial de GPU.
- [Fiche officielle du modèle GLM-5.2](https://huggingface.co/zai-org/GLM-5.2) : les spécifications officielles et la documentation du modèle de Z.ai.
- [Documentation NVIDIA TensorRT-LLM](https://docs.nvidia.com/tensorrt-llm/index.html) : la documentation officielle sur l'architecture, l'installation, l'optimisation, l'exécution et le déploiement.
- [USENIX : Utilisation de la vérification de modèles pour trouver de graves erreurs de systèmes de fichiers](https://www.usenix.org/legacy/event/osdi04/tech/yang.html) : un exemple classique démontrant pourquoi la vérification formelle de modèles est utile pour détecter les rares défaillances de correction des systèmes de fichiers.
## Résumé
La nouvelle entreprise de Yangqing Jia, Intent Lab, construit Fleet autour d'une unité de travail d'IA différente : non pas la génération de code, mais le cycle de vie complet des systèmes de production.
Ses premières démonstrations couvrent l'optimisation de l'inférence GLM-5.2, une base de données compatible SQLite et un système de fichiers distribué vérifié formellement. Intent Lab rapporte une accélération de l'inférence de 6,3×, environ six millions de tests de compatibilité de base de données et une vérification de modèles portant sur près de 1,9 million d'états de systèmes de fichiers.
L'idée commune est une boucle d'ingénierie en six étapes — Comprendre, Concevoir, Coordonner, Construire, Vérifier et Évoluer — qui tente de reproduire les responsabilités d'une organisation d'ingénierie solide avec des agents autonomes.
Les résultats sont encore préliminaires et largement autodéclarés ; la reproductibilité et l'exploitation en production à long terme restent donc les véritables tests.
**La revendication la plus importante de Fleet n'est pas que l'IA peut écrire du code à partir d'une seule phrase ; c'est qu'un système autonome peut assumer la responsabilité du travail d'ingénierie entre une phrase et un logiciel digne d'être exploité pendant des années.**