Un accélérateur IA ne se résume pas à ses seules spécifications matérielles. Les développeurs travaillent avec des frameworks tels que PyTor...

Les accélérateurs IA ne deviennent pas pratiques simplement parce qu'ils possèdent des spécifications matérielles puissantes.
Les développeurs travaillent via des frameworks tels que PyTorch, TensorFlow, vLLM et SGLang. Leurs modèles doivent être compilés, planifiés, exécutés, profilés, débogués et déployés de manière distribuée entre les appareils. Entre l'application et la puce, il existe une vaste couche d'infrastructure qui détermine si les performances théoriques peuvent être transformées en puissance de calcul utilisable.
Lors de la Conférence Mondiale sur l'Intelligence Artificielle 2026, T-Head, la société de semi-conducteurs du groupe Alibaba, a open sourcé T-Head SAIL, sa pile logicielle IA pour la série d'accélérateurs XuanTie.
SAIL signifie Seed of AI Library (Graine de Bibliothèque IA).
T-Head décrit ce projet comme un chemin complet, couvrant le support du système d'exploitation, les composants SDK, les interfaces de programmation, les bibliothèques optimisées, les compilateurs, les logiciels d'exécution et les outils pour développeurs. Son objectif explicite est de rendre le matériel XuanTie plus facile à adopter, sans forcer les développeurs à abandonner leurs langages, frameworks, codes ou flux de travail familiers.
Alibaba indique qu'en avril 2026, les expéditions cumulées de puces IA XuanTie ont atteint 560 000 unités, servant plus de 400 clients dans plus de 20 secteurs. Avant sa divulgation publique, ce matériel et cette pile logicielle étaient déjà utilisés dans les environnements de production d'Alibaba Cloud et externes.
Par conséquent, T-Head ne présente pas SAIL comme un petit prototype de recherche. Il ouvre sourcé une base logicielle déjà éprouvée par des charges de travail à grande échelle et les exigences des services de production.
Un accélérateur nouvellement fabriqué ne peut pas exécuter directement le code Python utilisé pour définir les réseaux de neurones.
La pile logicielle doit transformer les programmes de haut niveau en opérations que le matériel peut exécuter efficacement. Ce processus comprend :
Une faiblesse à n'importe quel niveau peut dégrader les performances ou rendre le déploiement difficile.
L'absence d'un opérateur peut entraîner un repli lent. Un logiciel de communication médiocre peut limiter la capacité d'extension multi-appareils. Un compilateur opaque rend l'optimisation difficile. Des outils de profilage faibles transforment le travail de performance en conjectures aveugles.
C'est pourquoi la position concurrentielle de Nvidia n'est pas seulement soutenue par le matériel GPU, mais aussi par CUDA, ses bibliothèques, sa chaîne d'outils de compilation, sa documentation et l'expérience des développeurs accumulée sur le long terme.
La décision de T-Head d'open sourcer SAIL vise précisément à concurrencer au niveau de l'écosystème.
Les logiciels des accélérateurs IA étaient souvent distribués sous forme de binaires précompilés. Les développeurs pouvaient appeler des API documentées, mais la visibilité sur la manière dont les modèles sont transformés et exécutés était souvent limitée.
Les problèmes courants incluent :
L'ouverture du code source, de la documentation, des pilotes et des outils offre aux développeurs plus d'options pour inspecter, diagnostiquer, ajuster et optimiser la plateforme.
L'open source ne crée pas automatiquement un écosystème mature. Les composants associés doivent toujours être documentés, maintenus, testés, sous licence claire et supportés dans des charges de travail réelles. La gouvernance communautaire et la stabilité des versions sont tout aussi importantes que la première publication de code.
Le principal portail d'accès officiel est la "Communauté des Développeurs T-Head" :
https://developer.t-head.cn/home
L'annonce officielle indique que ce portail fournit :
La première ouverture ne doit pas être considérée comme l'achèvement de l'ensemble de la feuille de route open source.
| Phase | Plan publié |
|---|---|
| Première ouverture | Documentation, paquets SDK, pilotes noyau, outils de performance et ressources de débogage |
| Deuxième phase | Logiciel de bibliothèque de communication supplémentaire, sources Docker et PIP version 2.2, et forum développeurs |
| Troisième phase | Bibliothèque d'accélération de calcul, logiciel de moteur d'inférence, et sources Docker et PIP version 2.3 |
| Développement ultérieur | Plus de mises à jour, d'outils, d'activités communautaires et d'extension de l'écosystème |
Comme les versions sont continuellement publiées, la disponibilité des paquets, les licences, les exigences matérielles et les instructions de construction doivent être confirmées via le portail en temps réel.
T-Head décrit SAIL comme une pile de développement technologique à cinq couches, allant du contrôle des appareils aux outils de production.
| Couche | Composants principaux | Utilisation |
|---|---|---|
| Pilote et Runtime | Pilote PPU, KMD, UMD, Runtime PPU | Accès aux appareils, gestion de la mémoire, soumission de commandes et contexte d'exécution |
| Langage de programmation | C, C++, Python | Interfaces familières pour le développement d'applications et de systèmes |
| Compilateur | Compilateur, Débogueur | Transformation, optimisation, inspection et débogage de graphes et de code |
| Bibliothèques haute performance | acBLAS, acDNN, acFFT, acRAND, acSOLVER, acSPARSE, bibliothèques multimédia et de communication | Implémentations optimisées pour les charges de travail IA et numériques courantes |
| Outils développeurs | Asight Compute, Asight Systems, PPU-SMI, PPU-DCGM | Profilage, débogage, surveillance et gestion de cluster |
La couche la plus basse connecte le système d'exploitation à l'accélérateur.
T-Head divise le pilote en :
Le composant en mode noyau gère les interactions privilégiées avec le système d'exploitation et l'appareil. Le composant en mode utilisateur expose les capacités de l'appareil aux logiciels d'exécution et d'application de niveau supérieur.
Le runtime PPU gère les ressources, notamment :
Couche de coordination. Elle détermine si le matériel peut être découvert, alloué et utilisé de manière prévisible par les applications.
SAIL prend en charge les langages C, C++ et Python. Cela réduit le besoin pour les développeurs d'apprendre un langage spécifique au fournisseur avant d'essayer le matériel. Python reste le langage principal pour la définition et l'expérimentation des modèles, tandis que C et C++ sont toujours essentiels pour les bibliothèques de performance, les runtimes, les extensions de framework et l'intégration système. La prise en charge de ces langages dominants aide les équipes à réutiliser le code existant, les bibliothèques internes, les pratiques de débogage, les systèmes de construction et l'expérience en ingénierie. La compatibilité linguistique ne garantit pas que toutes les applications fonctionneront de manière transparente. Les extensions CUDA personnalisées, les opérateurs non supportés, les hypothèses spécifiques au matériel ou les dépendances particulières peuvent encore nécessiter un travail de portage.
Le compilateur transforme les graphes de modèle et les opérations au niveau du code source en code exécutable sur le matériel Zhenwu. Les travaux typiques d'un compilateur IA comprennent :
T-Head liste également un débogueur au niveau du compilateur. C'est extrêmement important – les développeurs ont besoin de comprendre pourquoi un graphe compilé se comporte anormalement ou pourquoi une section de code est moins performante que prévu. L'annonce officielle décrit le compilateur et le débogueur comme formant une boucle de développement complète. Les capacités spécifiques d'inspection et de débogage doivent être vérifiées dans la documentation de la version actuelle.
Les bibliothèques optimisées sont parmi les composants les plus précieux d'un écosystème d'accélérateur. La plupart des systèmes IA utilisent de manière répétée les mêmes catégories de tâches de calcul. Les bibliothèques optimisées permettent aux frameworks d'appeler des implémentations efficaces, plutôt que de forcer chaque développeur à écrire des kernels spécifiques à l'appareil.
| Nom de la bibliothèque | Rôle principal |
|---|---|
acBLAS | Opérations d'algèbre linéaire de base |
acDNN | Calculs de réseaux de neurones profonds |
acFFT | Transformée de Fourier rapide |
acRAND | Génération de nombres aléatoires |
acSOLVER | Solveurs numériques |
acSPARSE | Opérations sur matrices creuses |
Leur valeur réelle dépend de la couverture des opérateurs, des types de données, de la stabilité numérique, de la documentation technique, de la qualité des kernels et du degré d'intégration avec les frameworks supportés.
| Nom de la bibliothèque | Rôle principal |
|---|---|
HGDEC | Décodage vidéo |
HGENC | Encodage vidéo |
HGJPEG |
JPEG Traitement d'images |
| HGPP | Prétraitement des données |
Le traitement multimédia devient de plus en plus important pour les modèles multimodaux. Le codage/décodage d'images/vidéos, la mise à l'échelle, la conversion de format et le prétraitement peuvent devenir les principaux goulots d'étranglement du pipeline.
Pingtouge liste :
PCCLsailSHMEMLes bibliothèques de communication collective prennent en charge les opérations nécessaires à l'entraînement multi-appareils et multi-nœuds, notamment All-Reduce, All-Gather, Reduce-scatter, Broadcast et Synchronisation. La performance de la communication détermine souvent l'efficacité de l'extension des grands clusters. La feuille de route officielle indique que davantage de logiciels de communication seront ouverts dans les phases ultérieures.
Les développeurs doivent vérifier l'état actuel du code source de chaque composant.
La pile technologique liste également les composants suivants :
acextHGMLCes composants étendent l'ensemble de bibliothèques de base et prennent en charge des fonctionnalités supplémentaires d'apprentissage automatique. Il est recommandé de consulter la documentation en temps réel des packages logiciels pour obtenir les dernières informations sur les API.
Asight Compute est un outil d'analyse des performances au niveau des opérateurs, conçu pour aider les développeurs à examiner l'exécution des noyaux, l'utilisation, le comportement mémoire et les goulots d'étranglement de performance bas niveau.
Asight Systems offre une vue au niveau système de l'exécution inter-cadres, des activités d'exécution, des noyaux, des transferts mémoire, des communications, du travail hôte et des cycles d'inactivité.
PPU-SMI prend en charge la surveillance et la gestion en temps réel des appareils. Consultez la documentation actuelle pour les métriques et commandes spécifiques.
PPU-DCGM prend en charge la gestion des ressources et des appareils au niveau du cluster. Les déploiements à grande échelle nécessitent une visibilité globale sur plusieurs accélérateurs et nœuds, et non pas seulement sur une seule carte.
Pingtouge résume le positionnement développeur de SAIL à travers trois idées fondamentales :
Ces déclarations proviennent du fabricant et doivent être vérifiées en fonction des charges de travail réelles de chaque organisation.
La conception de SAIL est alignée sur les modèles de programmation et les frameworks courants.
Pingtouge indique que les développeurs peuvent réutiliser une grande partie du code existant, des modèles, de l'expérience technique, des connaissances sur les opérateurs et des pratiques d'optimisation. Les annonces officielles affirment que la migration ne nécessite qu'une petite adaptation du code.
Les modèles standard construits sur des opérations largement supportées peuvent migrer en douceur, tandis que les systèmes contenant des noyaux CUDA personnalisés, des extensions spécifiques au fabricant, des dépendances obscures ou une infrastructure d'inférence étroitement couplée peuvent nécessiter plus de travail.
Les frameworks et modèles d'IA évoluent rapidement. Si une plateforme matérielle nécessite des mois pour supporter chaque version majeure, elle sera toujours en retard sur l'écosystème logiciel.
Pingtouge indique que le temps d'adaptation moyen de SAIL aux principaux frameworks d'inférence IA est inférieur à 7 jours.
Il s'agit d'une moyenne rapportée par le fabricant, et non d'une garantie pour tous les modèles, versions de framework, opérateurs ou fonctionnalités.
Les développeurs doivent confirmer les versions supportées, si l'implémentation est de niveau production, les types de données disponibles, et si l'exécution distribuée a été vérifiée.
Pingtouge indique que SAIL a été adapté à plus de 260 frameworks d'entraînement, d'inférence et composants écosystémiques courants, y compris PyTorch, TensorFlow, vLLM et SGLang.
Ce nombre peut inclure des frameworks, des modules d'intégration, des modèles, des bibliothèques et des composants associés, et non 260 frameworks de haut niveau complètement indépendants. Il est recommandé d'utiliser le catalogue de compatibilité en temps réel comme référence faisant autorité.
Decrivez votre idee une fois, et We0 AI peut generer un site vitrine, des pages et un CMS, puis vous aider a attirer clients et trafic apres le lancement.
Une génération de projet complète pour une inscription gratuite
Idéal pour essayer un flux de génération complet et voir rapidement une première ébauche de projet.
L'intention stratégique est que les développeurs puissent conserver le framework de leur choix, plutôt que d'être contraints de migrer vers un environnement applicatif propriétaire unique.
Les équipes envisageant d'adopter SAIL doivent tester leurs propres modèles, sans se fier uniquement aux déclarations de compatibilité.
Vérifiez :
Utilisez les modèles listés dans la documentation officielle, confirmez l'installation, la compilation, que les résultats produits sont corrects, qu'ils peuvent être exécutés via le profileur, et rapportez un état de périphérique normal.
Mesurez :
Enregistrez :
Suivez chaque modification de code, de construction, d'opérateur, d'environnement et de déploiement. Cela donne une estimation plus réaliste des coûts de migration qu'une simple démonstration réussie unique.
L'évaluation en production doit inclure les pannes d'appareil, les redémarrages de processus, les mises à niveau de framework, les mises à jour de pilote, l'ordonnancement, la surveillance, la collecte de logs, le rollback et l'analyse de régression de performance.
SAIL fait partie du plan d'infrastructure à long terme de Pingtouge.
Pingtouge a lancé le Hanguang 800 en 2019, la première puce d'inférence IA d'Alibaba.
Selon les annonces officielles d'Alibaba, ses performances de pointe atteignent 78 563 images par seconde et 500 IPS par watt sur le test ResNet-50.
La puce a été déployée dans des activités internes telles que la recherche de produits, les recommandations, le traitement d'images, la publicité et le service client. Alibaba a indiqué que, dans les cas présentés au lancement, le traitement d'un milliard d'images de produits pouvait passer d'environ une heure à environ cinq minutes.
Le Hanguang 800 démontre la valeur du matériel dédié combiné à des logiciels et algorithmes optimisés.
En 2021, Alibaba a lancé le Yitian 710, un processeur serveur Arm 5 nanomètres avec 128 cœurs et 60 milliards de transistors.
Alibaba a rapporté un score SPECint2017 de 440, avec une amélioration de performance de 20 % et une efficacité énergétique de 50 % par rapport au processeur serveur Arm de comparaison.
Yitian a étendu le positionnement de Pingtouge de l'inférence IA au cloud computing général. Alibaba Cloud propose une série d'instances ECS basées sur le processeur Yitian.
La famille Zhenwu de Pingtouge prend en charge à la fois l'entraînement et l'inférence IA.
L'article source décrit le déploiement de la série initiale Zhenwu 810 dans l'environnement Tongyi Qianwen d'Alibaba et chez des utilisateurs industriels externes. Comme les différentes versions précédentes de Zhenwu ne disposent pas de spécifications officielles détaillées et uniformisées en anglais, cet article ne reproduit pas toutes les données matérielles de la source.
Le plus récent Zhenwu M890 a été présenté officiellement par Alibaba.
Alibaba a lancé le Zhenwu M890 en 2026.
| Spécification | Zhenwu M890 |
|---|---|
| Mémoire | 144 Go |
| Bande passante inter-puce | 800 Go/s |
| Performance relative | Trois fois celle du Zhenwu 810E |
| Support de précision | Entraînement et inférence, y compris FP4 natif |
La puce est conçue pour l'inférence à haute concurrence, les contextes longs, les appels d'outils répétés et les charges de travail d'agents avec des exigences imprévisibles.
Alibaba associe le M890 à l'ICN Switch 1.0, revendiquant une bande passante totale allant jusqu'à 25,6 Tbps et une communication sans congestion entre des clusters de 64 accélérateurs.
Le super-nœud Panjiu AL128 intègre 128 accélérateurs dans un système au niveau rack, tandis que SAIL fournit la couche logicielle nécessaire pour exposer, compiler, analyser et exploiter ce matériel.
L'article original aborde la stratégie de puces pour centre de données de Pingtouge à travers trois domaines :
Les clusters IA modernes dépendent de la performance conjointe entre calcul, mémoire, interconnexion, stockage, réseau, ordonnancement, logiciel d'exécution et intégration de frameworks. Un goulot d'étranglement dans un domaine peut réduire la valeur de l'ensemble du système.
Une entreprise qui vend des accélérateurs n'a pas besoin de construire une plateforme développeur étendue. Mais un écosystème a besoin de documentation, d'exemples, de bibliothèques, de compatibilité, de support, de versions prévisibles, et de moyens pour les développeurs externes d'influencer l'évolution future.
Pingtouge utilise ses puces en interne chez Alibaba et dans les déploiements clients. Ouvrir SAIL pourrait aider à :
Cette publication répond également à un problème récurrent dans le domaine du calcul IA national : le développement matériel est plus rapide que la maturité logicielle et la connaissance des développeurs.
La pile technologique open source attirera une participation communautaire plus large pour combler ce manque.
La première publication n’est qu’un début. Le taux d’adoption dépendra de :
Les développeurs surveilleront également si les phases open source suivantes avancent comme prévu et si la communauté peut apporter des contributions substantielles.
La feuille de route officielle indique que certains logiciels de communication, bibliothèques d’accélération, composants de moteur d’inférence et dépôts Docker/PIP seront lancés dans les phases ultérieures.
Le portail d’accès officiel est la communauté des développeurs T-Head. Chaque composant peut avoir des workflows différents pour le téléchargement, la documentation, la connexion, la gestion des paquets ou les dépôts.
Licences des pilotes, outils, bibliothèques, exemples et logiciels tiers —
Tous les paquets n’utilisent pas la même licence. Avant de modifier ou de redistribuer, veuillez vérifier la licence accompagnant chaque paquet téléchargé.
Lorsque les opérations nécessaires sont prises en charge, les applications au niveau framework peuvent nécessiter peu de modifications pour être migrées. Les noyaux CUDA personnalisés et les extensions CUDA dédiées nécessitent généralement un travail de portage distinct.
Le support linguistique, la gouvernance communautaire, les canaux d’assistance, l’accès au cloud et la disponibilité matérielle influenceront l’adoption en dehors de la Chine.
T-Head SAIL est la pile logicielle IA créée par T-Head, filiale d’Alibaba, pour son accélérateur ZhenYue. Elle couvre les pilotes, les logiciels d’exécution, les interfaces linguistiques, la compilation, les bibliothèques d’optimisation, l’analyse de performances, le débogage, la surveillance des appareils et la gestion des clusters.
SAIL signifie Seed of AI Library (Graine de bibliothèque IA). T-Head indique que ce nom reflète son objectif : utiliser le code ouvert comme une graine pour un écosystème de calcul IA plus large.
Tous les composants prévus ne sont pas publiés lors de la première phase. La première publication open source comprend de la documentation, des paquets SDK, des pilotes noyau, des outils de performance et des ressources de débogage. Les phases ultérieures couvriront davantage de logiciels de communication, de code source de paquets, de bibliothèques d’accélération et de moteurs d’inférence.
Le portail officiel est la communauté des développeurs T-Head. Veuillez utiliser le portail en temps réel pour confirmer la disponibilité des paquets, les exigences matérielles, les licences et les instructions d’installation.
T-Head liste PyTorch, TensorFlow, vLLM et SGLang parmi les écosystèmes pris en charge, et indique que la pile logicielle s’est adaptée à plus de 260 frameworks et composants écosystémiques. Pour les versions spécifiques et l’état de production, consultez la documentation de compatibilité.
Les applications au niveau framework utilisant des opérations prises en charge peuvent nécessiter peu d’adaptation. Le code CUDA personnalisé, les extensions CUDA dédiées, les opérations non prises en charge et les prérequis dépendant du matériel peuvent encore nécessiter un portage.
T-Head liste : Asight Compute pour l’analyse des opérateurs, Asight Systems pour l’analyse des performances système, PPU-SMI pour la surveillance des appareils, PPU-DCGM pour la gestion au niveau cluster.
SAIL est conçu pour la série d’accélérateurs IA ZhenYue. Alibaba indique qu’en avril 2026, les livraisons cumulées de ZhenYue atteignent 560 000 unités, et que la pile logicielle est déjà utilisée dans Alibaba Cloud et en production externe.
T-Head a ouvert SAIL après le déploiement à grande échelle de l’accélérateur ZhenYue. La pile technologique connecte le matériel ZhenYue aux systèmes d’exploitation, langages de programmation, compilateurs, bibliothèques d’optimisation, frameworks IA, outils d’analyse de performances et systèmes de gestion de clusters.
Sa promesse principale est de réduire les barrières de migration : réutiliser du code et des frameworks familiers, obtenir un support plus rapide pour les nouveaux logiciels IA, et éviter d’être enfermé dans une voie de développement unique et fermée. Ces promesses doivent encore être vérifiées à travers des modèles réels, des noyaux personnalisés, des versions de frameworks, des objectifs de performance et des exigences opérationnelles.
Cette ouverture est substantielle mais progressive. La documentation, les SDK, les pilotes, les outils de performance et les ressources de débogage sont disponibles via la communauté des développeurs, tandis que des bibliothèques de communication supplémentaires, des sources de paquets, des bibliothèques d’accélération et des composants de moteur d’inférence sont prévus dans les versions ultérieures.
L’initiative la plus importante de T-Head n’est pas de simplement lancer un autre processeur, mais d’inviter les développeurs à examiner, utiliser et finalement co-créer la couche logicielle qui déterminera si ces processeurs peuvent devenir des plateformes de calcul durables.
Partez d’une phrase et obtenez un site complet en quelques minutes.