Qingcheng.ai construit une « super-grille » de tokens à la WAIC 2026, affirmant réduire de 75 % le coût de déploiement de DeepSeek
À la Conférence mondiale sur l'intelligence artificielle 2026, les entreprises de modèles remplissent les halls d'exposition avec le nombre de paramètres, tandis que les fournisseurs d'infrastructure présentent des clusters de calcul toujours plus grands. Cependant, au stand de Qingcheng.ai, l'attrait principal n'est ni un modèle unique ni un serveur, mais un diagramme complet montrant comment les tokens sont produits, routés, distribués, mesurés et gouvernés tout au long du cycle de vie des agents IA. Qingcheng.ai appelle ce modèle le **modèle « boutique en ligne et atelier en coulisses » des tokens**. Ce cadre comprend trois couches : 1.

Qingcheng.ai construit une « super-grille » de tokens à la WAIC 2026, affirmant réduire de 75 % le coût de déploiement de DeepSeek
Introduction
Au salon WAIC 2026, les entreprises de modèles remplissent les halls d'exposition avec le nombre de leurs paramètres, tandis que les fournisseurs d'infrastructures présentent des clusters de calcul toujours plus imposants. Pourtant, sur le stand de Qingcheng Intelligence, la vedette n'est ni un modèle ni un serveur.
C'est un schéma complet qui illustre comment les Tokens sont produits, routés, distribués, mesurés et gouvernés tout au long du cycle de vie d'un agent d'IA.
Qingcheng Intelligence appelle ce modèle le « magasin et usine » de Tokens. Ce cadre intègre trois niveaux :
- La couche de production de Tokens en aval
- La couche intermédiaire de routage et de service
- La couche d'application et de gouvernance des agents
L'entreprise décrit son architecture comme le système électrique de l'ère de l'intelligence artificielle. Le matériel de calcul et les logiciels d'inférence jouent le rôle de centrales électriques, AI Ping agit comme le réseau électrique, et les outils des agents sont les appareils qui consomment l'électricité.
Le stand de Qingcheng Intelligence présente un flux de travail complet de production, routage et gouvernance des Tokens.
Selon le rapport original, ce système vise à résoudre trois problèmes récurrents : l'instabilité des API de modèles, la faible utilisation des accélérateurs hétérogènes nationaux, et l'absence d'une comptabilité claire des Tokens dans les déploiements d'agents à grande échelle.
Le goulot d'étranglement des Tokens avant les applications d'agents à grande échelle
Alors que les agents d'IA passent de la phase de démonstration à la production, une seule requête utilisateur peut déclencher plusieurs appels de modèles.
Un agent peut avoir besoin de récupérer un fichier, interroger une base de données, appeler un outil, générer du code, évaluer un résultat, réviser un plan, puis appeler un autre agent. La réponse que voit l'utilisateur n'est que la dernière étape. En coulisses, le système peut consommer un grand nombre de Tokens à travers plusieurs services.
L'article original identifie trois problèmes d'infrastructure majeurs qui s'aggravent à mesure que les flux de travail s'étendent.
Offre de Tokens instable
La capacité des API de modèles peut fluctuer pendant les périodes de forte demande.
Une même requête peut recevoir une réponse rapide à un moment donné, puis devenir lente ou indisponible à un autre. Dans un contexte de conversation informelle, un léger retard peut être acceptable, mais dans un flux de travail multi-étapes où chaque action dépend de la réponse précédente, ce retard peut entraîner une interruption du processus.
Par conséquent, les systèmes d'entreprise ont besoin de plus que d'un simple accès à un modèle. Ils ont besoin d'une latence prévisible, d'un débit fiable, et d'une qualité de sortie constante.
Difficulté à utiliser efficacement les accélérateurs nationaux
De nombreuses organisations ont acquis un mélange de GPU, NPU et serveurs de calcul intelligents nationaux. Le matériel peut être en place, mais déployer efficacement de grands modèles sur ceux-ci reste difficile.
Les frameworks d'inférence populaires comme vLLM ont d'abord été optimisés pour l'écosystème NVIDIA et CUDA. Bien qu'ils prennent en charge de plus en plus d'appareils, adapter chaque fonctionnalité et optimisation à différentes architectures d'accélérateurs nécessite un travail d'ingénierie considérable.
Qingcheng Intelligence estime qu'un moteur d'inférence natif et une pile logicielle consciente du matériel peuvent extraire davantage de Tokens utilisables de ces clusters.
Difficulté à suivre les dépenses liées aux agents
Lorsqu'une entreprise exploite plusieurs agents, la facture mensuelle des modèles ne révèle pas toujours quel flux de travail a généré les coûts.
Un seul agent peut appeler plusieurs modèles, utiliser plusieurs fournisseurs, lancer des sous-agents et fonctionner en continu pendant des heures. Sans un suivi détaillé, l'organisation peut avoir du mal à répondre à des questions de base :
- Quel agent a consommé des Tokens ?
- Quel modèle et fournisseur a-t-il appelé ?
- Quel outil ou étape a entraîné le coût le plus élevé ?
- Un flux de travail a-t-il dépassé le budget prévu ?
- Cette requête pourrait-elle être routée vers un service moins cher ?
Qingcheng Intelligence positionne son architecture en trois couches comme une infrastructure intégrée reliant la production, la distribution, l'application et la facturation.

Le plan de l'exposition illustre le flux de travail, du calcul sous-jacent aux applications agent.
Architecture en trois couches « magasin et usine »
Cette architecture repose sur une analogie industrielle simple.
L'usine transforme le matériel de calcul en Tokens. Le magasin agrège et route les services de Tokens. Les nœuds d'application distribuent les agents et contrôlent la manière dont les Tokens sont consommés.
L'architecture de Qingcheng Intelligence connecte la production de Tokens, le routage des services et la gouvernance des agents.
Ces trois couches sont conçues pour fonctionner ensemble, et non comme des produits isolés.
L'usine : la couche de production de Tokens
L'usine transforme les ressources de calcul physiques en capacités d'inférence de modèle standardisées.
Ses principaux composants incluent :
- Partenaires matériels et de calcul
- Moteur d'inférence Chitu
- Pile logicielle intelligente Bagua Lu
Qingcheng Intelligence compare cette couche à une centrale électrique. Son objectif est de générer autant de Tokens stables et utilisables que possible à partir du matériel disponible, tout en réduisant la complexité du déploiement.
Chitu : un moteur d'inférence orienté production
Chitu est un framework d'inférence hautes performances open-source de Qingcheng Intelligence.
Le dépôt officiel le décrit comme un moteur orienté production, mettant l'accent sur l'efficacité, la flexibilité et la convivialité. Il prend en charge les déploiements allant du CPU et d'un seul accélérateur aux clusters à grande échelle, et est optimisé pour plusieurs plates-formes matérielles nationales.
Le projet prend également en charge des modèles comme DeepSeek, Qwen, GLM et Kimi, ainsi que les interfaces HTTP standard compatibles OpenAI.

Chitu améliore les capacités d'inférence des grands modèles sur des plates-formes de calcul hétérogènes.
Qingcheng Intelligence estime qu'adapter un framework conçu pour un écosystème matériel unique peut être comme utiliser le mauvais outil. L'analogie de l'entreprise est la suivante : un four conçu pour griller du pain peut être modifié pour cuire à la vapeur des brioches, mais un cuiseur vapeur dédié utiliserait plus efficacement la chaleur disponible.
Cette comparaison, bien que simplifiée, reflète des problèmes d'ingénierie bien réels. Les architectures d'accélérateurs diffèrent en termes de mémoire, de communication, d'opérateurs, de formats numériques, de compilation et de comportement d'ordonnancement.
Chitu inclut des optimisations spécifiques au matériel et la prise en charge de l'inférence en basse précision, y compris les configurations FP4 et FP8.
L'affirmation de réduction de 75 % des coûts pour DeepSeek
Le rapport original indique qu'un déploiement de DeepSeek utilisant FP4 a réduit le nombre de machines nécessaires de quatre à une.
Dans cette configuration spécifique, passer de quatre machines à une signifie une réduction de 75 % du nombre de machines nécessaires. L'article convertit cette réduction en une économie de 75 % des coûts.
Le rapport attribue la réduction du déploiement de DeepSeek de quatre machines à une à l'optimisation FP4.
Ce résultat ne doit pas être interprété comme une garantie de réduction universelle de 75 % des coûts pour chaque déploiement de DeepSeek.
Les économies réelles dépendent des facteurs suivants :
- Le modèle DeepSeek choisi et le schéma de quantification
- Le type d'accélérateur et la capacité mémoire
- La configuration du serveur
- La longueur du contexte
- La taille du lot et la concurrence
- Les objectifs de latence
- Les exigences de précision
- La version du logiciel
- Les coûts d'électricité et d'exploitation
Chitu, le moteur open-source de Qingcheng Intelligence, est au cœur de cette couche de production.
Le dépôt indique également que les résultats de performance peuvent varier en fonction du matériel, des logiciels et des charges de test.
Bagua Fourneau : Masquer la complexité de l’infrastructure
Bagua Fourneau est la pile logicielle utilisée par Qingcheng.ai pour l’entraînement, l’inférence, le déploiement, l’ordonnancement et l’exploitation des modèles.
L’entreprise le présente comme un moyen d’intégrer des tâches complexes d’infrastructure dans une plateforme d’entreprise plus facile à gérer.
Bagua Fourneau repose sur du matériel hétérogène et fournit des outils de déploiement et d’exploitation.
Bagua Fourneau vise à réduire le travail manuel nécessaire dans les domaines suivants :
- Gestion des ressources du cluster
- Déploiement des modèles et applications
- Entraînement distribué
- Optimisation de l’inférence
- Évaluation des performances
- Livraison des applications
- Surveillance et exploitation
Qingcheng.ai a également collaboré avec Inspur Information pour lancer le Yuan Nao Bagua Fourneau Tout-en-Un optimisé conjointement. Dans un test publié sur Qwen3-32B, les partenaires ont signalé une augmentation totale du débit d’inférence allant jusqu’à 14,45 fois après optimisation via Chitu, et une amélioration des performances de bout en bout d’environ 10 fois après optimisations complètes de la pile.
Ces données proviennent de l’environnement de test propre aux entreprises partenaires et ne sont pas équivalentes au cas DeepSeek FP4 décrit à la WAIC.
Optimisation des clusters hétérogènes
La couche usine back-end est conçue pour gérer plusieurs types d’accélérateurs.
L’une des stratégies mentionnées dans le rapport original consiste à séparer les charges de travail de préremplissage et de décodage.
Lors de la phase de préremplissage, le système traite les invites d’entrée et construit le cache interne du modèle. Lors de la phase de décodage, il génère progressivement les jetons de sortie. Ces deux phases diffèrent en termes de mémoire, de bande passante et de caractéristiques de calcul.
Les clusters hétérogènes peuvent affecter chaque phase au matériel le plus efficace pour la traiter. Cette pratique est parfois appelée « séparation préremplissage-décodage ».
L’objectif n’est pas de rendre tous les accélérateurs identiques, mais de permettre à différents matériels de traiter les parties de la charge de travail qui correspondent le mieux à leurs atouts.
Magasin : AI Ping comme hub de routage de jetons
Une fois les jetons générés, les applications ont encore besoin d’un moyen stable de les obtenir.
La couche intermédiaire est AI Ping, la plateforme d’évaluation des services de modèles et de routage API de Qingcheng Zhiyun.
AI Ping surveille en continu les services de modèles et fournit une interface unifiée au-dessus de plusieurs fournisseurs.

AI Ping évalue les API des modèles et route les requêtes entre les fournisseurs de services.
Le rapport original indique qu’AI Ping surveille les éléments suivants :
- Plus de 30 fournisseurs de services
- Plus de 600 interfaces de services de modèles
- Latence
- Débit
- Fiabilité
- Taux de succès du cache
- Qualité des jetons
- Tarification et disponibilité des services
La plateforme vise à réduire le besoin des développeurs de créer des comptes, de gérer différents formats d’API ou de comparer manuellement les fournisseurs de services.
Les utilisateurs peuvent prioriser certains objectifs, par exemple :
- Réduire les coûts
- Accélérer les temps de réponse
- Améliorer la fiabilité
- Améliorer la qualité des résultats
Si aucune préférence n’est spécifiée, AI Ping peut utiliser sa logique de routage pour sélectionner un service disponible.
Routage dynamique en cas de congestion des services
L’intégration statique envoie chaque requête au même fournisseur de services jusqu’à ce que le développeur modifie la configuration.
Le routage dynamique fonctionne différemment. Si un fournisseur devient lent ou indisponible, la couche de routage peut rediriger les requêtes suivantes vers d’autres services offrant de meilleures performances à ce moment-là.
Cela est utile pour les charges de travail d’agents, car une seule interruption peut entraîner l’échec d’une tâche longue.
La boucle de rétroaction prévue pour la plateforme est la suivante :
- AI Ping mesure en continu la qualité du service.
- Les décisions de routage utilisent les données de mesure les plus récentes.
- Le trafic utilisateur réel fournit des données de performance supplémentaires.
- Les nouvelles données améliorent les futures évaluations et le routage.
Qingcheng Zhiyun indique que l’API unifiée permet aux petites équipes d’accéder à des capacités de routage et de surveillance qui nécessiteraient normalement une équipe de plateforme interne.
L’entreprise a rapporté séparément des améliorations moyennes en termes de coût, de débit et de latence via AI Ping. Ces pourcentages sont des résultats publiés par la plateforme ; les résultats réels peuvent varier en fonction du modèle choisi, du fournisseur de services, des schémas de trafic et de la stratégie de routage.
Nœud d’application : Magasin d’agents et ATM
La couche finale se concentre sur la manière dont les agents...
La manière dont leurs jetons sont distribués et les règles de gouvernance applicables.
Ce système se compose de deux composants principaux :
- Magasin d’agents
- ATM (Gestionnaire de jetons d’agent)
Magasin d’agents
Le magasin d’agents est présenté comme une couche de distribution et de réutilisation pour les agents génériques et spécifiques à un secteur.
Sa valeur fondamentale réside dans la connexion entre les développeurs d’agents et les organisations ayant besoin de flux de travail déployables, tout en permettant à ces agents d’accéder à une infrastructure Token plus large.
Le rapport original le compare à un marché d’appareils électriques connectés à un réseau électrique partagé. Au moment de la rédaction de ce document, les informations publiques sur la stratégie de tarification du magasin d’agents, les critères de validation, les formats de déploiement et les conditions commerciales restent limitées.
ATM : Gestionnaire de jetons d’agent
ATM signifie Agent Token Manager (Gestionnaire de jetons d’agent).
Qingcheng Technology l’a présenté à la Conférence mondiale sur l’intelligence artificielle 2026 comme un outil de gestion et de gouvernance des jetons localisé pour les systèmes multi-agents.
Cet outil offre les fonctionnalités suivantes :
- Gestion unifiée des identifiants API
- Suivi de l’utilisation des jetons
- Calcul de la répartition des coûts
- Contrôle des limites de consommation
- Basculement entre fournisseurs et reprise après panne
- Isolation des ressources pour plusieurs agents
- Alertes en cas d’utilisation anormale
- Surveillance localisée ou sensible à la vie privée
Le document original indique que l’ATM peut observer l’activité des agents via des mécanismes tels que des crochets comportementaux, l’analyse de fichiers locaux et des passerelles de confidentialité.
En pratique, l’ATM agit comme un « compteur électrique » pour les charges de travail d’IA. Son objectif est de lier la facturation des jetons à l’agent, à l’opération, au modèle et à l’outil ayant généré cette consommation.
Cela est fortement lié au concept de gestion des coûts cloud (FinOps) — la discipline de mesure et de contrôle des dépenses cloud. Dans les systèmes d’agents, le défi est plus précis car un seul processus métier peut contenir plusieurs niveaux d’appels de modèles imbriqués.
Un enregistrement efficace des coûts des agents doit inclure :
- L’utilisateur ou le flux de travail initiateur
- Les agents et sous-agents impliqués
- Le modèle choisi
- Le nombre de jetons d’entrée et de sortie
- Les outils appelés dans la tâche
- La tarification du fournisseur
- Le nombre de tentatives et d’appels échoués
- Le coût total et le temps écoulé
Qingcheng Technology positionne l’ATM comme une couche FinOps orientée jetons pour ces nouveaux types de charges de travail.
Pourquoi Qingcheng Technology met l’accent sur la neutralité
L’article original indique que la neutralité est l’un des principaux atouts de Qingcheng Technology.
Les grandes entreprises de cloud computing et de matériel ont naturellement tendance à promouvoir leurs propres plateformes, partenaires ou investissements. Par conséquent, les organisations exploitant des clusters hybrides préfèrent choisir des fournisseurs de logiciels indépendants qui prennent en charge plusieurs accélérateurs et fournisseurs de services concurrents.
Qingcheng Technology affirme que sa plateforme n’est pas liée à un seul fabricant de puces.
Cette philosophie se reflète dans la capacité de Chitu à prendre en charge plusieurs environnements matériels et dans le modèle de routage multi-fournisseurs d’AI Ping.
La neutralité doit encore être validée dans la pratique. Les clients doivent examiner les éléments suivants :
- Les versions de matériel et de logiciel prises en charge
- Les règles de routage
- Les partenariats commerciaux
- La méthodologie des benchmarks
- Les politiques de conservation des données
- Les options de sélection des fournisseurs
- Les mécanismes de basculement et de repli
Le parcours technique de l’entreprise constitue un autre avantage de positionnement.
Qingcheng Technology a été fondée en décembre 2023, et l’équipe principale est issue de l’Institut de calcul haute performance du Département d’informatique de l’Université Tsinghua.
L’entreprise indique que cette équipe a déjà réalisé des évaluations de performance et des optimisations pour des centres de supercalcul et des centres de calcul intelligent.
Transformer la puissance de calcul nationale en services Token exportables
Qingcheng AI considère également les services Token comme une voie possible pour rendre la puissance de calcul nationale accessible aux utilisateurs internationaux.
La logique est la suivante : les développeurs n’ont pas besoin de savoir quel accélérateur a généré la réponse. Les développeurs achètent une API de modèle et reçoivent des jetons.
Si le matériel national peut soutenir de manière stable et efficace des modèles compétitifs, ses sorties peuvent alors être vendues via une API unifiée, sans que les clients étrangers aient besoin de déployer ou de comprendre l’architecture matérielle sous-jacente.
Qingcheng AI considère les services Token comme un moyen de distribuer la puissance de calcul nationale à l’échelle mondiale.
Le rapport original indique que le trafic de développement à l'étranger atteint son pic entre 22 h et 8 h, heure de Pékin.
Cela crée une opportunité potentielle d'utilisation : la puissance de calcul inutilisée pendant les heures creuses en Chine peut être employée pour servir les utilisateurs d'autres fuseaux horaires.
Le flux de travail décrit dans l’article est le suivant :
- L’accélérateur national génère des tokens via Chitu.
- AI Ping mesure la qualité de service et répartit les requêtes.
- Les partenaires distribuent le service aux développeurs étrangers.
- Les utilisateurs consomment les modèles via une API standard.
Cela ne supprime pas les exigences habituelles de la fourniture de services internationaux. Les fournisseurs doivent toujours gérer la latence, la conformité, la gouvernance des données, les licences de modèles, la facturation, le support technique et la disponibilité régionale.
Préparer le terrain pour l’économie des agents
Lors des salons de l’IA, les produits les plus visibles sont souvent les modèles et les applications.
L’infrastructure reçoit moins d’attention, car l’essentiel de son travail se déroule sous l’interface utilisateur. C’est elle qui détermine si un modèle peut fonctionner de manière stable, si un agent peut accomplir sa tâche et si le coût final reste clair et compréhensible.
Le concept « usine à l’arrière, boutique à l’avant » de Qingcheng AI relie trois questions :
- Comment produire efficacement des tokens ?
- Comment router les tokens de manière fiable ?
- Comment consommer et gérer les tokens dans les agents ?
« L’usine à l’arrière » combine matériel, Chitu et Bagualu. « La boutique à l’avant » utilise AI Ping pour évaluer et router les services de modèles. Le nœud applicatif utilise l’Agent Store et l’ATM pour distribuer les agents et gérer leur consommation de tokens.
L’analogie avec le réseau électrique n’est pas une norme technique, mais elle offre aux entreprises une perspective pratique pour comprendre une architecture complète.
Cette architecture ne considère pas chaque API de modèle, cluster d’accélérateur et agent comme un produit isolé, mais comme des composants interconnectés dans la chaîne d’approvisionnement de tokens.
Questions fréquentes
Qu’est-ce que l’architecture token « usine à l’arrière, boutique à l’avant » de Qingcheng AI ?
C’est un modèle d’infrastructure IA à trois niveaux couvrant la production de tokens, le routage d’API et les applications agents. La couche « usine à l’arrière » utilise du matériel de calcul, Chitu et Bagualu ; la couche intermédiaire emploie AI Ping ; et la couche applicative comprend l’Agent Store et l’ATM.
Qu’est-ce que le moteur d’inférence Chitu ?
Chitu est un framework d’inférence open-source conçu pour la production, destiné aux grands modèles. Il prend en charge plusieurs plateformes d’accélérateurs nationales et internationales, plusieurs échelles de déploiement, l’inférence de faible précision et des interfaces HTTP compatibles avec OpenAI.
Chitu a-t-il réduit de 75 % le coût de déploiement de DeepSeek ?
Aucune promesse générale de réduction de 75 % n’a été publiée. Ce chiffre provient d’un scénario spécifique de déploiement FP4 où le nombre de serveurs est passé de quatre à un, soit une réduction de 75 % du nombre de machines.
Chitu peut-il être déployé via Docker ?
Oui. Le dépôt officiel de Chitu fournit des Dockerfiles adaptés au matériel Ascend, Hygon, MetaX, etc., ainsi qu’une documentation d’installation et de déploiement générale.
À quoi sert AI Ping ?
AI Ping permet de surveiller et de comparer les services d’API de modèles, et de router les requêtes en fonction d’objectifs de coût, de vitesse, de fiabilité ou de qualité. Il fournit une API unifiée au-dessus de plusieurs fournisseurs.
Qu’est-ce que l’Agent Token Manager ?
L’Agent Token Manager (ATM) est un outil de gouvernance de tokens conçu par Qingcheng AI pour les systèmes d’agents. Il permet de suivre l’utilisation, de répartir les coûts, de gérer les identifiants, de définir des limites, d’isoler les charges de travail et d’alerter les équipes en cas de consommation anormale.
Bagualu est-il un moteur d’inférence ?
Bagualu est une pile logicielle plus large, qui ne se limite pas à l’inférence. Elle couvre l’entraînement, le déploiement d’inférence, l’ordonnancement, la supervision, la livraison d’applications et l’exploitation de clusters, tandis que Chitu assure la couche d’inférence des modèles proprement dite.
Le résultat de « réduction des coûts de 75 % » a-t-il été vérifié de manière indépendante ?
Ce résultat provient de Qingcheng AI et du rapport original. Les détails de déploiement nécessaires à une reproduction indépendante n’ont pas été entièrement divulgués. Il est conseillé aux lecteurs de tester eux-mêmes sur leurs propres modèles, matériels et charges de travail.
Outils associés
- Chitu : Framework d’inférence open-source pour grands modèles de langage et matériels hétérogènes.
- AI Ping : Plateforme d’évaluation de services de modèles et de routage intelligent d’API exploitée par Qingcheng AI.
- Bagualu : Pile logicielle de Qingcheng AI pour l’entraînement, l’inférence, le déploiement et l’exploitation de clusters.
- vLLM : Moteur open-source largement utilisé pour le service à haut débit de grands modèles.
- SGLang : Framework de service open-source pour modèles de langage et multimodaux.
- DeepSeek : Plateforme officielle de la série DeepSeek discutée dans le cas de déploiement.
- Spécification de l’API OpenAI : Format API utilisé par la plupart des moteurs de service de modèles pour la compatibilité applicative.
Liens associés
- Site officiel de Qingcheng AI : Informations officielles sur les produits et la société concernant Chitu, Bagualu et AI Ping.
- Dépôt GitHub de Chitu : Code source, Dockerfiles, modèles pris en charge, versions, benchmarks et documentation de déploiement.
- Page produit Chitu : Présentation du matériel, des modèles, des interfaces et des performances déclarées par Qingcheng AI.
- Page produit Bagualu : Informations officielles sur l’entraînement et l’infrastructure.
- AI Ping : Plateforme officielle d’évaluation de modèles et de routage unifié d’API.
- Article de Science and Technology Daily : Reportage indépendant couvrant la solution complète de tokens de Qingcheng AI et les indicateurs d’AI Ping.
- Serveur Bagualu Inspur Yuanbrain : Détails des tests d’un serveur entreprise optimisé conjointement pour Chitu et Bagualu.
Résumé
Lors de la Conférence mondiale sur l’intelligence artificielle 2026, Qingcheng AI a présenté une infrastructure token à trois niveaux visant à relier l’inférence de modèles, le routage d’API, la distribution d’agents et la gouvernance des coûts.
La couche usine à l’arrière utilise Chitu et Bagualu pour optimiser le déploiement de modèles sur du matériel de calcul hétérogène. Selon le rapport de l’entreprise, dans la configuration FP4 DeepSeek, le nombre de machines nécessaires est passé de quatre à une, réalisant une réduction de coût de 75 %.
AI Ping constitue la couche de routage intermédiaire, tandis que l’Agent Store et l’ATM couvrent la distribution des agents et la gestion financière des tokens. Chaque produit contribue à rendre l’approvisionnement en tokens plus stable, mesurable, et indépendant d’un fournisseur unique de matériel ou d’API.
L’idée centrale est simple : les agents d’IA ont besoin de plus que de modèles — ils ont besoin d’une couche d’infrastructure capable de générer, router, mesurer et contrôler chaque token qu’ils consomment.