T-Head ouvre son logiciel SAIL : la pile logicielle IA qui soutient les 560 000 puces « Zhenwu »
Un accélérateur IA ne se résume pas à ses seules spécifications matérielles. Les développeurs travaillent avec des frameworks tels que PyTorch, TensorFlow, vLLM et SGLang, leurs modèles devant être compilés, ordonnancés, exécutés, profilés, débogués et distribués entre les dispositifs. Entre l'application et la puce, il existe une couche d'infrastructure colossale qui détermine si les performances théoriques se traduisent en puissance de calcul réellement utilisable. Lors de la conférence WAIC 2026, l'entreprise de semi-conducteurs T-Head, filiale d'Alibaba, a ouvert en open source le logiciel **T

T-Head ouvre son logiciel SAIL : la pile logicielle IA qui soutient les 560 000 puces « Zhenwu »
Introduction
Les accélérateurs IA ne deviennent pas pratiques simplement parce qu'ils possèdent des spécifications matérielles puissantes.
Les développeurs travaillent via des frameworks tels que PyTorch, TensorFlow, vLLM et SGLang. Leurs modèles doivent être compilés, planifiés, exécutés, profilés, débogués et déployés de manière distribuée entre les appareils. Entre l'application et la puce, il existe une vaste couche d'infrastructure qui détermine si les performances théoriques peuvent être transformées en puissance de calcul utilisable.
Lors de la Conférence Mondiale sur l'Intelligence Artificielle 2026, T-Head, la société de semi-conducteurs du groupe Alibaba, a open sourcé T-Head SAIL, sa pile logicielle IA pour la série d'accélérateurs XuanTie.
SAIL signifie Seed of AI Library (Graine de Bibliothèque IA).
T-Head décrit ce projet comme un chemin complet, couvrant le support du système d'exploitation, les composants SDK, les interfaces de programmation, les bibliothèques optimisées, les compilateurs, les logiciels d'exécution et les outils pour développeurs. Son objectif explicite est de rendre le matériel XuanTie plus facile à adopter, sans forcer les développeurs à abandonner leurs langages, frameworks, codes ou flux de travail familiers.
Alibaba indique qu'en avril 2026, les expéditions cumulées de puces IA XuanTie ont atteint 560 000 unités, servant plus de 400 clients dans plus de 20 secteurs. Avant sa divulgation publique, ce matériel et cette pile logicielle étaient déjà utilisés dans les environnements de production d'Alibaba Cloud et externes.
Par conséquent, T-Head ne présente pas SAIL comme un petit prototype de recherche. Il ouvre sourcé une base logicielle déjà éprouvée par des charges de travail à grande échelle et les exigences des services de production.
Pourquoi la pile logicielle est cruciale
Un accélérateur nouvellement fabriqué ne peut pas exécuter directement le code Python utilisé pour définir les réseaux de neurones.
La pile logicielle doit transformer les programmes de haut niveau en opérations que le matériel peut exécuter efficacement. Ce processus comprend :
- Permettre au système d'exploitation d'identifier et de gérer l'appareil.
- Exposer les capacités matérielles via des pilotes en espace utilisateur et noyau.
- Gérer la mémoire, les files d'attente de commandes, les contextes d'exécution et la synchronisation.
- Compiler les graphes de calcul et les kernels du modèle en instructions exécutables.
- Fournir des bibliothèques mathématiques, de réseaux de neurones, multimédia et de communication optimisées.
- Connecter l'accélérateur aux frameworks IA existants.
- Offrir aux développeurs des outils de profilage, débogage, surveillance et opérations de cluster.
Une faiblesse à n'importe quel niveau peut dégrader les performances ou rendre le déploiement difficile.
L'absence d'un opérateur peut entraîner un repli lent. Un logiciel de communication médiocre peut limiter la capacité d'extension multi-appareils. Un compilateur opaque rend l'optimisation difficile. Des outils de profilage faibles transforment le travail de performance en conjectures aveugles.
C'est pourquoi la position concurrentielle de Nvidia n'est pas seulement soutenue par le matériel GPU, mais aussi par CUDA, ses bibliothèques, sa chaîne d'outils de compilation, sa documentation et l'expérience des développeurs accumulée sur le long terme.
La décision de T-Head d'open sourcer SAIL vise précisément à concurrencer au niveau de l'écosystème.
Vers une plateforme plus inspectable depuis la boîte noire
Les logiciels des accélérateurs IA étaient souvent distribués sous forme de binaires précompilés. Les développeurs pouvaient appeler des API documentées, mais la visibilité sur la manière dont les modèles sont transformés et exécutés était souvent limitée.
Les problèmes courants incluent :
- Quelle implémentation d'opérateur est sélectionnée ?
- Pourquoi une partie du graphe est-elle peu performante ?
- Comment la mémoire est-elle allouée ?
- Quel chemin de communication est utilisé ?
- Où commencent les problèmes de compatibilité ?
- Peut-on optimiser la charge de travail pour un environnement de déploiement spécifique ?
L'ouverture du code source, de la documentation, des pilotes et des outils offre aux développeurs plus d'options pour inspecter, diagnostiquer, ajuster et optimiser la plateforme.
L'open source ne crée pas automatiquement un écosystème mature. Les composants associés doivent toujours être documentés, maintenus, testés, sous licence claire et supportés dans des charges de travail réelles. La gouvernance communautaire et la stabilité des versions sont tout aussi importantes que la première publication de code.
Ce qui est actuellement disponible
Le principal portail d'accès officiel est la "Communauté des Développeurs T-Head" :
https://developer.t-head.cn/home
L'annonce officielle indique que ce portail fournit :
- Documentation technique complète
- Paquets SDK
- Pilotes noyau
- Outils de profilage
- Outils de débogage
- Ressources de développement pour la puce IA Zhenyue
La première ouverture ne doit pas être considérée comme l'achèvement de l'ensemble de la feuille de route open source.
| Phase | Plan publié |
|---|---|
| Première ouverture | Documentation, paquets SDK, pilotes noyau, outils de performance et ressources de débogage |
| Deuxième phase | Logiciel de bibliothèque de communication supplémentaire, sources Docker et PIP version 2.2, et forum développeurs |
| Troisième phase | Bibliothèque d'accélération de calcul, logiciel de moteur d'inférence, et sources Docker et PIP version 2.3 |
| Développement ultérieur | Plus de mises à jour, d'outils, d'activités communautaires et d'extension de l'écosystème |
Comme les versions sont continuellement publiées, la disponibilité des paquets, les licences, les exigences matérielles et les instructions de construction doivent être confirmées via le portail en temps réel.
La pile technologique SAIL à cinq couches de T-Head
T-Head décrit SAIL comme une pile de développement technologique à cinq couches, allant du contrôle des appareils aux outils de production.
| Couche | Composants principaux | Utilisation |
|---|---|---|
| Pilote et Runtime | Pilote PPU, KMD, UMD, Runtime PPU | Accès aux appareils, gestion de la mémoire, soumission de commandes et contexte d'exécution |
| Langage de programmation | C, C++, Python | Interfaces familières pour le développement d'applications et de systèmes |
| Compilateur | Compilateur, Débogueur | Transformation, optimisation, inspection et débogage de graphes et de code |
| Bibliothèques haute performance | acBLAS, acDNN, acFFT, acRAND, acSOLVER, acSPARSE, bibliothèques multimédia et de communication | Implémentations optimisées pour les charges de travail IA et numériques courantes |
| Outils développeurs | Asight Compute, Asight Systems, PPU-SMI, PPU-DCGM | Profilage, débogage, surveillance et gestion de cluster |
Pilote et Runtime
La couche la plus basse connecte le système d'exploitation à l'accélérateur.
Pilote PPU
T-Head divise le pilote en :
- KMD : Pilote en mode noyau.
- UMD : Pilote en mode utilisateur.
Le composant en mode noyau gère les interactions privilégiées avec le système d'exploitation et l'appareil. Le composant en mode utilisateur expose les capacités de l'appareil aux logiciels d'exécution et d'application de niveau supérieur.
Runtime PPU
Le runtime PPU gère les ressources, notamment :
- Mémoire de l'appareil
- Files d'attente de commandes
- Contextes de calcul
- Opérations de l'application à l'appareil
- Exécution
Couche de coordination. Elle détermine si le matériel peut être découvert, alloué et utilisé de manière prévisible par les applications.
Interfaces C, C++ et Python
SAIL prend en charge les langages C, C++ et Python. Cela réduit le besoin pour les développeurs d'apprendre un langage spécifique au fournisseur avant d'essayer le matériel. Python reste le langage principal pour la définition et l'expérimentation des modèles, tandis que C et C++ sont toujours essentiels pour les bibliothèques de performance, les runtimes, les extensions de framework et l'intégration système. La prise en charge de ces langages dominants aide les équipes à réutiliser le code existant, les bibliothèques internes, les pratiques de débogage, les systèmes de construction et l'expérience en ingénierie. La compatibilité linguistique ne garantit pas que toutes les applications fonctionneront de manière transparente. Les extensions CUDA personnalisées, les opérateurs non supportés, les hypothèses spécifiques au matériel ou les dépendances particulières peuvent encore nécessiter un travail de portage.
Compilateur et Débogueur
Le compilateur transforme les graphes de modèle et les opérations au niveau du code source en code exécutable sur le matériel Zhenwu. Les travaux typiques d'un compilateur IA comprennent :
- Optimisation du graphe
- Fusion d'opérateurs
- Transformations de disposition
- Planification mémoire
- Sélection de kernels
- Optimisation de l'ordonnancement
- Conversion de précision
- Pliage de constantes
- Planification d'exécution parallèle
T-Head liste également un débogueur au niveau du compilateur. C'est extrêmement important – les développeurs ont besoin de comprendre pourquoi un graphe compilé se comporte anormalement ou pourquoi une section de code est moins performante que prévu. L'annonce officielle décrit le compilateur et le débogueur comme formant une boucle de développement complète. Les capacités spécifiques d'inspection et de débogage doivent être vérifiées dans la documentation de la version actuelle.
Bibliothèques haute performance
Les bibliothèques optimisées sont parmi les composants les plus précieux d'un écosystème d'accélérateur. La plupart des systèmes IA utilisent de manière répétée les mêmes catégories de tâches de calcul. Les bibliothèques optimisées permettent aux frameworks d'appeler des implémentations efficaces, plutôt que de forcer chaque développeur à écrire des kernels spécifiques à l'appareil.
Bibliothèques de calcul principales
| Nom de la bibliothèque | Rôle principal |
|---|---|
acBLAS |
Opérations d'algèbre linéaire de base |
acDNN |
Calculs de réseaux de neurones profonds |
acFFT |
Transformée de Fourier rapide |
acRAND |
Génération de nombres aléatoires |
acSOLVER |
Solveurs numériques |
acSPARSE |
Opérations sur matrices creuses |
Leur valeur réelle dépend de la couverture des opérateurs, des types de données, de la stabilité numérique, de la documentation technique, de la qualité des kernels et du degré d'intégration avec les frameworks supportés.
Bibliothèques multimédia et de prétraitement
| Nom de la bibliothèque | Rôle principal |
|---|---|
HGDEC |
Décodage vidéo |
HGENC |
Encodage vidéo |
HGJPEG |
JPEG Traitement d'images |
| HGPP | Prétraitement des données |
Le traitement multimédia devient de plus en plus important pour les modèles multimodaux. Le codage/décodage d'images/vidéos, la mise à l'échelle, la conversion de format et le prétraitement peuvent devenir les principaux goulots d'étranglement du pipeline.
Communication collective
Pingtouge liste :
PCCLsailSHMEM
Les bibliothèques de communication collective prennent en charge les opérations nécessaires à l'entraînement multi-appareils et multi-nœuds, notamment All-Reduce, All-Gather, Reduce-scatter, Broadcast et Synchronisation. La performance de la communication détermine souvent l'efficacité de l'extension des grands clusters. La feuille de route officielle indique que davantage de logiciels de communication seront ouverts dans les phases ultérieures.
Les développeurs doivent vérifier l'état actuel du code source de chaque composant.
Composants supplémentaires
La pile technologique liste également les composants suivants :
acextHGML
Ces composants étendent l'ensemble de bibliothèques de base et prennent en charge des fonctionnalités supplémentaires d'apprentissage automatique. Il est recommandé de consulter la documentation en temps réel des packages logiciels pour obtenir les dernières informations sur les API.
Outils de développement et d'exploitation
Asight Compute
Asight Compute est un outil d'analyse des performances au niveau des opérateurs, conçu pour aider les développeurs à examiner l'exécution des noyaux, l'utilisation, le comportement mémoire et les goulots d'étranglement de performance bas niveau.
Asight Systems
Asight Systems offre une vue au niveau système de l'exécution inter-cadres, des activités d'exécution, des noyaux, des transferts mémoire, des communications, du travail hôte et des cycles d'inactivité.
PPU-SMI
PPU-SMI prend en charge la surveillance et la gestion en temps réel des appareils. Consultez la documentation actuelle pour les métriques et commandes spécifiques.
PPU-DCGM
PPU-DCGM prend en charge la gestion des ressources et des appareils au niveau du cluster. Les déploiements à grande échelle nécessitent une visibilité globale sur plusieurs accélérateurs et nœuds, et non pas seulement sur une seule carte.
Trois engagements de migration
Pingtouge résume le positionnement développeur de SAIL à travers trois idées fondamentales :
- Pas besoin de réécrire entièrement le code
- Pas besoin d'attendre longtemps pour l'adaptation de l'écosystème
- Pas d'obligation de lier à un framework spécifique
Ces déclarations proviennent du fabricant et doivent être vérifiées en fonction des charges de travail réelles de chaque organisation.
Pas de réécriture complète nécessaire
La conception de SAIL est alignée sur les modèles de programmation et les frameworks courants.
Pingtouge indique que les développeurs peuvent réutiliser une grande partie du code existant, des modèles, de l'expérience technique, des connaissances sur les opérateurs et des pratiques d'optimisation. Les annonces officielles affirment que la migration ne nécessite qu'une petite adaptation du code.
Les modèles standard construits sur des opérations largement supportées peuvent migrer en douceur, tandis que les systèmes contenant des noyaux CUDA personnalisés, des extensions spécifiques au fabricant, des dépendances obscures ou une infrastructure d'inférence étroitement couplée peuvent nécessiter plus de travail.
Pas de délai d'adaptation long
Les frameworks et modèles d'IA évoluent rapidement. Si une plateforme matérielle nécessite des mois pour supporter chaque version majeure, elle sera toujours en retard sur l'écosystème logiciel.
Pingtouge indique que le temps d'adaptation moyen de SAIL aux principaux frameworks d'inférence IA est inférieur à 7 jours.
Il s'agit d'une moyenne rapportée par le fabricant, et non d'une garantie pour tous les modèles, versions de framework, opérateurs ou fonctionnalités.
Les développeurs doivent confirmer les versions supportées, si l'implémentation est de niveau production, les types de données disponibles, et si l'exécution distribuée a été vérifiée.
Pas de verrouillage de framework
Pingtouge indique que SAIL a été adapté à plus de 260 frameworks d'entraînement, d'inférence et composants écosystémiques courants, y compris PyTorch, TensorFlow, vLLM et SGLang.
Ce nombre peut inclure des frameworks, des modules d'intégration, des modèles, des bibliothèques et des composants associés, et non 260 frameworks de haut niveau complètement indépendants. Il est recommandé d'utiliser le catalogue de compatibilité en temps réel comme référence faisant autorité.
L'intention stratégique est que les développeurs puissent conserver le framework de leur choix, plutôt que d'être contraints de migrer vers un environnement applicatif propriétaire unique.
Processus d'évaluation pragmatique
Les équipes envisageant d'adopter SAIL doivent tester leurs propres modèles, sans se fier uniquement aux déclarations de compatibilité.
1. Confirmation des besoins
Vérifiez :
- Le matériel Zhenwu supporté.
- La version du système d'exploitation et du noyau.
- Les versions des pilotes et de l'environnement d'exécution.
- Le support des conteneurs.
- La version de Python.
- La version du framework.
- Les exigences du compilateur.
- Les exigences réseau du cluster.
2. Commencez par des exemples vérifiés
Utilisez les modèles listés dans la documentation officielle, confirmez l'installation, la compilation, que les résultats produits sont corrects, qu'ils peuvent être exécutés via le profileur, et rapportez un état de périphérique normal.
3. Comparez la précision fonctionnelle
Mesurez :
- La précision du modèle.
- La déviation numérique.
- Les performances de précision.
- La déterminisme.
- Les opérateurs non supportés.
- L'exécution de repli.
4. Mesurez les performances
Enregistrez :
- Le débit.
- La latence du premier token.
- La latence entre les tokens.
- La latence par lot.
- L'utilisation de l'appareil.
- La consommation mémoire.
- Le temps de compilation.
- La capacité d'extension multi-appareils.
5. Documentez le travail de migration
Suivez chaque modification de code, de construction, d'opérateur, d'environnement et de déploiement. Cela donne une estimation plus réaliste des coûts de migration qu'une simple démonstration réussie unique.
6. Testez l'exploitation
L'évaluation en production doit inclure les pannes d'appareil, les redémarrages de processus, les mises à niveau de framework, les mises à jour de pilote, l'ordonnancement, la surveillance, la collecte de logs, le rollback et l'analyse de régression de performance.
Histoire matérielle derrière SAIL
SAIL fait partie du plan d'infrastructure à long terme de Pingtouge.
Hanguang 800
Pingtouge a lancé le Hanguang 800 en 2019, la première puce d'inférence IA d'Alibaba.
Selon les annonces officielles d'Alibaba, ses performances de pointe atteignent 78 563 images par seconde et 500 IPS par watt sur le test ResNet-50.
La puce a été déployée dans des activités internes telles que la recherche de produits, les recommandations, le traitement d'images, la publicité et le service client. Alibaba a indiqué que, dans les cas présentés au lancement, le traitement d'un milliard d'images de produits pouvait passer d'environ une heure à environ cinq minutes.
Le Hanguang 800 démontre la valeur du matériel dédié combiné à des logiciels et algorithmes optimisés.
Yitian 710
En 2021, Alibaba a lancé le Yitian 710, un processeur serveur Arm 5 nanomètres avec 128 cœurs et 60 milliards de transistors.
Alibaba a rapporté un score SPECint2017 de 440, avec une amélioration de performance de 20 % et une efficacité énergétique de 50 % par rapport au processeur serveur Arm de comparaison.
Yitian a étendu le positionnement de Pingtouge de l'inférence IA au cloud computing général. Alibaba Cloud propose une série d'instances ECS basées sur le processeur Yitian.
Famille d'accélérateurs Zhenwu
La famille Zhenwu de Pingtouge prend en charge à la fois l'entraînement et l'inférence IA.
L'article source décrit le déploiement de la série initiale Zhenwu 810 dans l'environnement Tongyi Qianwen d'Alibaba et chez des utilisateurs industriels externes. Comme les différentes versions précédentes de Zhenwu ne disposent pas de spécifications officielles détaillées et uniformisées en anglais, cet article ne reproduit pas toutes les données matérielles de la source.
Le plus récent Zhenwu M890 a été présenté officiellement par Alibaba.
Zhenwu M890
Alibaba a lancé le Zhenwu M890 en 2026.
| Spécification | Zhenwu M890 |
|---|---|
| Mémoire | 144 Go |
| Bande passante inter-puce | 800 Go/s |
| Performance relative | Trois fois celle du Zhenwu 810E |
| Support de précision | Entraînement et inférence, y compris FP4 natif |
La puce est conçue pour l'inférence à haute concurrence, les contextes longs, les appels d'outils répétés et les charges de travail d'agents avec des exigences imprévisibles.
Alibaba associe le M890 à l'ICN Switch 1.0, revendiquant une bande passante totale allant jusqu'à 25,6 Tbps et une communication sans congestion entre des clusters de 64 accélérateurs.
Le super-nœud Panjiu AL128 intègre 128 accélérateurs dans un système au niveau rack, tandis que SAIL fournit la couche logicielle nécessaire pour exposer, compiler, analyser et exploiter ce matériel.
Calcul, réseau et stockage
L'article original aborde la stratégie de puces pour centre de données de Pingtouge à travers trois domaines :
Calcul
- Accélérateurs IA Zhenwu
- Processeurs serveur Arm Yitian
- Technologie d'inférence Hanguang
Réseau
- Technologie d'interconnexion par commutateur ICN
- Produits de carte réseau intelligente Panhai
Stockage
- Produits contrôleur de stockage Zhenyue
Les clusters IA modernes dépendent de la performance conjointe entre calcul, mémoire, interconnexion, stockage, réseau, ordonnancement, logiciel d'exécution et intégration de frameworks. Un goulot d'étranglement dans un domaine peut réduire la valeur de l'ensemble du système.
Pourquoi ouvrir SAIL après avoir livré 560 000 puces ?
Une entreprise qui vend des accélérateurs n'a pas besoin de construire une plateforme développeur étendue. Mais un écosystème a besoin de documentation, d'exemples, de bibliothèques, de compatibilité, de support, de versions prévisibles, et de moyens pour les développeurs externes d'influencer l'évolution future.
Pingtouge utilise ses puces en interne chez Alibaba et dans les déploiements clients. Ouvrir SAIL pourrait aider à :
- Attirer davantage de développeurs vers le matériel Zhenwu
- Étendre le support des frameworks et des modèles
- Aider les équipes externes à diagnostiquer les problèmes
- Soutenir la recherche sur la pile technologique dans les universités et instituts de recherche
- Encourager les entreprises logicielles à créer des solutions intégrées
- Donner aux clients plus de contrôle sur l'optimisation des déploiements
- Réduire le coût de migration depuis l'écosystème d'accélérateurs existant
Cette publication répond également à un problème récurrent dans le domaine du calcul IA national : le développement matériel est plus rapide que la maturité logicielle et la connaissance des développeurs.
La pile technologique open source attirera une participation communautaire plus large pour combler ce manque.
Facteurs déterminants du succès de SAIL
La première publication n’est qu’un début. Le taux d’adoption dépendra de :
- La qualité de la documentation
- La reproductibilité des builds
- La clarté des licences
- La couverture des opérateurs
- Le support des versions de frameworks
- La transparence des performances
- La publication de versions stables
- La gouvernance communautaire
- L’accès au matériel
- Le support international
Les développeurs surveilleront également si les phases open source suivantes avancent comme prévu et si la communauté peut apporter des contributions substantielles.
Limitations importantes et problèmes à résoudre
Certains composants ne sont pas encore prêts
La feuille de route officielle indique que certains logiciels de communication, bibliothèques d’accélération, composants de moteur d’inférence et dépôts Docker/PIP seront lancés dans les phases ultérieures.
Les structures de dépôt et de téléchargement peuvent varier
Le portail d’accès officiel est la communauté des développeurs T-Head. Chaque composant peut avoir des workflows différents pour le téléchargement, la documentation, la connexion, la gestion des paquets ou les dépôts.
Les licences de chaque composant doivent être vérifiées individuellement
Licences des pilotes, outils, bibliothèques, exemples et logiciels tiers —
Tous les paquets n’utilisent pas la même licence. Avant de modifier ou de redistribuer, veuillez vérifier la licence accompagnant chaque paquet téléchargé.
La compatibilité CUDA n’est pas automatique
Lorsque les opérations nécessaires sont prises en charge, les applications au niveau framework peuvent nécessiter peu de modifications pour être migrées. Les noyaux CUDA personnalisés et les extensions CUDA dédiées nécessitent généralement un travail de portage distinct.
L’adoption internationale reste un problème à résoudre
Le support linguistique, la gouvernance communautaire, les canaux d’assistance, l’accès au cloud et la disponibilité matérielle influenceront l’adoption en dehors de la Chine.
Questions fréquentes
Qu’est-ce que T-Head SAIL ?
T-Head SAIL est la pile logicielle IA créée par T-Head, filiale d’Alibaba, pour son accélérateur ZhenYue. Elle couvre les pilotes, les logiciels d’exécution, les interfaces linguistiques, la compilation, les bibliothèques d’optimisation, l’analyse de performances, le débogage, la surveillance des appareils et la gestion des clusters.
Que signifie SAIL ?
SAIL signifie Seed of AI Library (Graine de bibliothèque IA). T-Head indique que ce nom reflète son objectif : utiliser le code ouvert comme une graine pour un écosystème de calcul IA plus large.
Toute la pile SAIL est-elle entièrement open source ?
Tous les composants prévus ne sont pas publiés lors de la première phase. La première publication open source comprend de la documentation, des paquets SDK, des pilotes noyau, des outils de performance et des ressources de débogage. Les phases ultérieures couvriront davantage de logiciels de communication, de code source de paquets, de bibliothèques d’accélération et de moteurs d’inférence.
Où les développeurs peuvent-ils télécharger T-Head SAIL ?
Le portail officiel est la communauté des développeurs T-Head. Veuillez utiliser le portail en temps réel pour confirmer la disponibilité des paquets, les exigences matérielles, les licences et les instructions d’installation.
Quels frameworks IA SAIL prend-il en charge ?
T-Head liste PyTorch, TensorFlow, vLLM et SGLang parmi les écosystèmes pris en charge, et indique que la pile logicielle s’est adaptée à plus de 260 frameworks et composants écosystémiques. Pour les versions spécifiques et l’état de production, consultez la documentation de compatibilité.
Les applications CUDA peuvent-elles fonctionner sur SAIL sans modification ?
Les applications au niveau framework utilisant des opérations prises en charge peuvent nécessiter peu d’adaptation. Le code CUDA personnalisé, les extensions CUDA dédiées, les opérations non prises en charge et les prérequis dépendant du matériel peuvent encore nécessiter un portage.
Quels outils d’analyse de performances et de gestion sont inclus ?
T-Head liste : Asight Compute pour l’analyse des opérateurs, Asight Systems pour l’analyse des performances système, PPU-SMI pour la surveillance des appareils, PPU-DCGM pour la gestion au niveau cluster.
Quelles puces utilisent T-Head SAIL ?
SAIL est conçu pour la série d’accélérateurs IA ZhenYue. Alibaba indique qu’en avril 2026, les livraisons cumulées de ZhenYue atteignent 560 000 unités, et que la pile logicielle est déjà utilisée dans Alibaba Cloud et en production externe.
Outils associés
- Communauté des développeurs T-Head : Portail officiel pour la documentation SAIL, les paquets SDK, les pilotes, les outils de performance et les ressources de débogage.
- PyTorch : Framework d’apprentissage automatique open source, faisant partie de l’écosystème pris en charge par SAIL.
- TensorFlow : Framework open source de formation et d’inférence soutenu par l’écosystème SAIL.
- vLLM : Moteur de service LLM open source à haut débit mentionné dans l’annonce de compatibilité T-Head.
- SGLang : Framework open source de service pour modèles linguistiques et multimodaux soutenu par SAIL.
- Anolis OS : Distribution Linux figurant dans la liste des systèmes d’exploitation de l’architecture SAIL publiée par T-Head.
- Alibaba Cloud Bailian : Plateforme Alibaba Cloud pour la construction et le déploiement d’applications basées sur des modèles fondamentaux.
Liens connexes
- Annonce officielle de T-Head SAIL : Annonce de la communauté Alibaba Cloud Developer couvrant la pile technologique, les bibliothèques, les outils, la déclaration de compatibilité et la feuille de route par phases.
- Communauté des développeurs T-Head : Portail officiel actuel pour la documentation et les téléchargements SAIL.
- Aperçu d’Alibaba Cloud WAIC 2026 : Reportage officiel en anglais confirmant l’open source de SAIL et les données d’expédition de ZhenYue.
- Présentation officielle de ZhenYue M890 : Informations officielles sur la mémoire M890, la bande passante d’interconnexion, les performances et l’infrastructure associée.
- Annonce officielle de Yitian 710 : Spécifications officielles et données de référence du processeur serveur Arm d’Alibaba Cloud.
- Annonce officielle de Hanguang 800 : Informations de lancement originales de la première puce d’inférence IA d’Alibaba.
- Étude de cas Double 11 d’Alibaba Cloud : Informations de cas de production officielles impliquant l’infrastructure Alibaba Cloud et Hanguang 800.
Résumé
T-Head a ouvert SAIL après le déploiement à grande échelle de l’accélérateur ZhenYue. La pile technologique connecte le matériel ZhenYue aux systèmes d’exploitation, langages de programmation, compilateurs, bibliothèques d’optimisation, frameworks IA, outils d’analyse de performances et systèmes de gestion de clusters.
Sa promesse principale est de réduire les barrières de migration : réutiliser du code et des frameworks familiers, obtenir un support plus rapide pour les nouveaux logiciels IA, et éviter d’être enfermé dans une voie de développement unique et fermée. Ces promesses doivent encore être vérifiées à travers des modèles réels, des noyaux personnalisés, des versions de frameworks, des objectifs de performance et des exigences opérationnelles.
Cette ouverture est substantielle mais progressive. La documentation, les SDK, les pilotes, les outils de performance et les ressources de débogage sont disponibles via la communauté des développeurs, tandis que des bibliothèques de communication supplémentaires, des sources de paquets, des bibliothèques d’accélération et des composants de moteur d’inférence sont prévus dans les versions ultérieures.
L’initiative la plus importante de T-Head n’est pas de simplement lancer un autre processeur, mais d’inviter les développeurs à examiner, utiliser et finalement co-créer la couche logicielle qui déterminera si ces processeurs peuvent devenir des plateformes de calcul durables.