com/assets/cms-assets/image/2026/08/3f0a1b2c-4d5e-6f7a-8b9c-0d1e2f3a4b5c-6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d
com/cms-assets/image/2026/08/9a7908b8-ffee-4250-b280-649499618ce5-658d1e86-10d7-4116-a564-e2b43d0c3a24.png)
Les ingénieurs humains fournissent toujours les objectifs, les informations matérielles, les contraintes, les critères d'acceptation et l'orientation générale. Ignition, quant à lui, effectue une grande partie du travail répétitif de recherche et d'optimisation.
Ce type de tâche est particulièrement adapté aux agents, car l'environnement génère un retour d'information exceptionnellement clair.
Les kernels générés peuvent être évalués par rapport à des critères spécifiques :
- Compile-t-il ?
- S'exécute-t-il ?
- Les sorties numériques sont-elles correctes ?
- Est-il stable ?
- Quel niveau de performance matérielle atteint-il ?
- Les dernières modifications ont-elles amélioré les résultats ?
Le matériel et les tests fournissent une base factuelle objective.
De nombreuses tâches logicielles présentent des critères d'acceptation ambigus. L'optimisation des kernels, bien que difficile, comporte des aspects mesurables.
Une implémentation efficace doit satisfaire deux critères indépendants.
Exactitude
Le kernel doit produire des sorties dans des tolérances numériques acceptables.
Performance
Le kernel doit exploiter le matériel cible de manière suffisamment efficace pour justifier le remplacement d'une implémentation existante.
L'agent peut générer des centaines de candidats, rejeter les solutions incorrectes, tester les performances des solutions restantes et affiner continuellement les pistes les plus prometteuses.
Ce même schéma se retrouve dans les agents spécialisés en CUDA de NVIDIA, la PTX Kernel Factory d'INT21, les travaux TileKernels de DeepSeek, ainsi que dans les systèmes de recherche générant des kernels Triton ou TileLang.
La nouveauté récente réside dans le fait que les modèles de base peuvent désormais participer à une boucle beaucoup plus complète, au lieu de simplement combler quelques lignes de code syntaxique.
Infinity lève 15 millions de dollars à une valorisation de 100 millions
L'histoire technologique d'Infinity a attiré les investisseurs.
L'entreprise a annoncé en juillet 2026 la clôture d'un tour de financement d'amorçage de 15 millions de dollars, avec une valorisation post-argent estimée à 100 millions de dollars, selon les rapports. Touring Capital et Principal Venture Partners ont participé à l'investissement, aux côtés de dirigeants de l'industrie des semi-conducteurs et de chercheurs liés aux principaux laboratoires d'IA.

Infinity construit une couche logicielle d'inférence sensible au modèle pour les fournisseurs de matériel et les prestataires de services d'inférence. Son flux de travail déclaré est en réalité le suivant :
Spécifications matérielles
→ Logiciel d'inférence de qualité production généré
Infinity aurait également généré un moteur d'inférence NVIDIA à partir de zéro, offrant des performances supérieures de jusqu'à 34,3 % à une implémentation vLLM configurée de manière équivalente sur Qwen3-8B.
Ce résultat est auto-déclaré par l'entreprise et dépend du matériel, des configurations de traitement par lots, de la configuration du modèle et des méthodes de mesure. Néanmoins, cela indique que les ambitions d'Infinity vont bien au-delà du simple démarrage de puces.
Les TileKernels de DeepSeek exigent la même précision
Le texte original mentionne également le dépôt TileKernels de DeepSeek.
TileKernels est une bibliothèque de kernels GPU optimisés écrite à l'aide de TileLang, un langage spécifique au domaine basé sur Python pour le développement de kernels haute performance.
Le dépôt contient les opérations suivantes :
- Gating Mixture of Experts (MoE).
- Routage MoE.
- Quantification FP8 et FP4.
- Transposition.
- Gating Engram.
- Hyperconnexion de variétés (Manifold HyperConnection).
- Wrappers de différenciation automatique PyTorch.
DeepSeek indique que de nombreux kernels approchent des limites matérielles en termes d'intensité de calcul ou de bande passante mémoire, et que certains sont déjà utilisés en interne.
TileLang réduit la quantité de code CUDA C++ de bas niveau que les ingénieurs doivent écrire manuellement.
Sous sa forme actuelle, cela n'indique pas que DeepSeek a éliminé sa dépendance à la pile technologique NVIDIA.
Les exigences actuelles officielles de TileKernels comprennent :
GPU NVIDIA SM90 ou SM100
CUDA Toolkit 13.1 ou version ultérieure
PyTorch 2.10 ou version ultérieure
TileLang 0.1.9 ou version ultérieure
La bibliothèque actuelle est conçue pour les architectures NVIDIA les plus récentes. Elle réduit la dépendance au code source CUDA écrit à la main, mais pas la dépendance au matériel NVIDIA ou à la boîte à outils CUDA.
La portée de TileLang est plus large que la bibliothèque actuelle de DeepSeek
TileLang lui-même a des ambitions plus vastes.
Le projet décrit un modèle de programmation en tuiles (tiled) pour les kernels GPU, CPU et accélérateurs, basé sur l'infrastructure du compilateur TVM et utilisant une syntaxe de style Python.
Son objectif est de séparer le flux de données souhaité par l'ingénieur de l'ordonnancement de bas niveau nécessaire à une exécution efficace.
TileLang ajoute continuellement la prise en charge de plusieurs langages backend ainsi que des chemins matériels impliquant CUDA, ROCm et Metal.
Cette portabilité peut réduire les coûts de changement de fournisseur, à condition que les résultats générés soient corrects, stables, débogables et compétitifs par rapport aux bibliothèques des fournisseurs.
Un kernel qui s'exécute partout mais avec de mauvaises performances ne remplacera pas un chemin CUDA en environnement de production.
Un code correct peut encore être des centaines de fois plus lent
Un article de recherche de juillet 2026 a examiné l'écart entre l'exactitude des kernels et la qualité de substitution dans Triton et TileLang.
Les auteurs ont constaté que les kernels peuvent réussir les tests de correction numérique tout en ayant des performances bien inférieures aux références optimisées. Selon les rapports, une implémentation LayerNorm TileLang, bien qu'elle ait réussi les contrôles d'exactitude, s'exécutait plus de 300 fois plus lentement que la référence PyTorch.
Cet article n'est pas contre TileLang, mais plaide en faveur d'une évaluation des kernels générés selon deux dimensions :
Exactitude
+
Efficacité matérielle
La génération de code devient de plus en plus rapide. Mais prouver que le code généré est suffisant pour remplacer un logiciel de production mature reste difficile.
L'inférence est le premier champ de bataille principal
Le défi à CUDA est plus crédible dans le domaine de l'inférence que dans celui de l'entraînement des modèles de pointe.
L'entraînement privilégie l'échelle maximale et la stabilité
Les opérations d'entraînement à grande échelle peuvent impliquer des milliers ou des dizaines de milliers d'accélérateurs fonctionnant ensemble pendant des semaines ou des mois.
Les plateformes d'entraînement doivent gérer la communication distribuée, les points de contrôle, la récupération après panne, la gestion de la mémoire, le parallélisme, la reproductibilité et le débogage sur un grand nombre d'appareils.
Une panne matérielle ou logicielle peut gaspiller d'énormes quantités de puissance de calcul. Par conséquent, les institutions sont souvent très prudentes lorsqu'il s'agit de migrer des charges d'entraînement critiques depuis des systèmes matures.
CUDA, les bibliothèques CUDA-X, NCCL, le support PyTorch et les capacités réseau intégrées de NVIDIA confèrent à l'entreprise une position dominante dans ce domaine.
L'inférence se concentre sur le coût par réponse utile
L'inférence est l'étape de service après l'entraînement du modèle.
Les mesures commerciales pertinentes sont généralement plus proches de :
Qualité de sortie acceptable
÷
Coût total de service
L'inférence peut être répartie sur un seul accélérateur, de petits clusters, des flottes à grande échelle et du matériel spécialisé.
Une nouvelle puce n'a pas besoin de remplacer NVIDIA dans tous les scénarios. Elle doit simplement démontrer un avantage pour un modèle ou une charge donné, en termes de coût réduit, de vitesse accrue, de consommation d'énergie plus faible, de débit supérieur ou de latence plus prévisible.
Cet objectif plus restreint offre un point d'entrée réaliste pour le matériel spécialisé.
d-Matrix est conçu autour de l'inférence d'IA générative
d-Matrix, fondée en 2019, se concentre sur l'accélération de l'inférence. Sa plateforme Corsair, qui exploite une grande quantité de SRAM sur puce, vise à réduire le coût et la consommation d'énergie liés à l'exécution de modèles génératifs.

Le travail d'Infinity résout l'un des problèmes classiques rencontrés par les nouveaux accélérateurs.
Une puce peut avoir un matériel prometteur, mais tant que le noyau, l'exécution du modèle, la gestion de la mémoire, la quantification, la logique de service et le schéma d'intégration ne sont pas prêts, les clients ne peuvent pas l'utiliser efficacement.
Si un agent peut réduire ce processus de démarrage de plusieurs mois à quelques jours, les startups matérielles peuvent offrir un support proche de la date de sortie des modèles et démontrer leurs capacités matérielles plus tôt.
Cela réduit une partie de l'avantage logiciel de NVIDIA, mais ne l'élimine pas entièrement.
D'autres acteurs visent également cette brèche
Le marché de l'inférence comprend plusieurs challengers :
| Acteur ou plateforme | Positionnement général |
|---|---|
| Rebellions | Accélérateurs et systèmes d'inférence IA dédiés |
| Cerebras | Systèmes à l'échelle d'une tranche de silicium pour l'entraînement et l'inférence |
| AWS Inferentia | Puce d'inférence conçue par Amazon, utilisant le SDK Neuron |
| Google TPU | Accélérateurs Google pris en charge via XLA et les frameworks courants |
| AMD Instinct | GPU de centre de données utilisant la plateforme ROCm |
| d-Matrix | Accélération d'inférence IA générative centrée sur la SRAM |
| NVIDIA | GPU et pile de calcul accéléré CUDA |
La pression vient des couches logicielles qui permettent aux utilisateurs de déployer des modèles sans réécrire manuellement chaque opération, notamment AWS Neuron, Google XLA, AMD ROCm, Modular MAX et Mojo, TileLang, Triton et les systèmes de génération de noyaux IA.
Plus ces couches logicielles automatisent de choses, moins les développeurs d'applications ont besoin d'intervenir manuellement.
Contenu directement lié à CUDA.
Un logiciel multi-puces peut réduire l'effet de verrouillage
L'effet de verrouillage de CUDA est le plus fort lorsque les applications et leurs noyaux optimisés sont étroitement liés au matériel NVIDIA.
Une couche d'inférence portable vise le flux de travail suivant :
Modèle
→ Couche d'exécution portable
→ Génération ou sélection de noyaux matériels
→ Accélérateur cible
Le monde réel est plus complexe, car différentes puces ont des hiérarchies de mémoire, des formats numériques, des interconnexions, des comportements d'ordonnancement et des opérations prises en charge différents.
Des performances élevées nécessitent souvent encore un travail spécifique au matériel.
Le point central d'Infinity est qu'un agent peut automatiquement générer ce travail de spécialisation.
Le fossé de CUDA ne se limite pas au code existant
Un résultat de 10 heures ne peut pas reproduire les actifs qui rendent CUDA difficile à remplacer.
Ces actifs comprennent :
Bibliothèques matures
De nombreuses organisations utilisent des bibliothèques fournisseurs plutôt que d'écrire directement des noyaux. cuBLAS, cuDNN, TensorRT, NCCL et d'autres bibliothèques contiennent des années d'expérience en optimisation.
Outils de débogage et d'analyse
NVIDIA Nsight et les outils associés aident les ingénieurs à comprendre l'exactitude, le comportement mémoire, les chronologies, les communications et les performances.
Support des frameworks
Les nouvelles fonctionnalités de modèles sont généralement intégrées et optimisées en priorité pour le matériel NVIDIA.
Connaissances de déploiement
Les équipes de production comprennent le comportement des systèmes NVIDIA sous charge.
Documentation et formation
Creez un site vitrine et genere des leads en quelques minutes
Decrivez votre idee une fois, et We0 AI peut generer un site vitrine, des pages et un CMS, puis vous aider a attirer clients et trafic apres le lancement.
Une génération de projet complète pour une inscription gratuite
Idéal pour essayer un flux de génération complet et voir rapidement une première ébauche de projet.
L'écosystème comprend des exemples, des cours, des présentations de conférences, des réponses communautaires et des ressources d'experts.
Investissements existants
Les entreprises ont des millions de lignes de code, des tests, des processus d'achat et des compétences d'employés liés à cette plateforme.
L'IA peut réduire les coûts de traduction, mais elle n'élimine pas automatiquement les coûts de changement au niveau organisationnel.
La validation pourrait devenir le prochain fossé de CUDA
Bing Xu, fondateur d'INT21 et ancien fondateur de HippoML acquis par NVIDIA, estime que la validation est le principal goulot d'étranglement.

Un agent peut générer du code rapidement. Mais les équipes de production ont encore besoin de preuves qu'il :
- Produit des sorties numériques correctes.
- Fonctionne pour diverses formes et types de données.
- Gère les cas limites.
- Ne casse pas la mémoire.
- Reste stable sous concurrence.
- Fonctionne bien sous diverses charges de travail.
- Peut faire face aux changements de pilotes et de matériel.
- Interagit correctement avec le reste de la pile logicielle.
NVIDIA dispose déjà d'une grande quantité de tests de conformité, de tests de performance, d'implémentations de référence, de simulateurs, d'analyseurs de performances, de diagnostics de compilateur, de charges de travail de production et de données historiques sur les erreurs.
Ces actifs rendent les agents plus utiles.
Ainsi, l'IA pourrait déplacer le fossé de la génération de code vers la qualité de l'environnement de validation.
NVIDIA construit ses propres agents CUDA
Les technologies qui défient CUDA s'appliquent également à NVIDIA.
Business Insider cite Ankit Patel, vice-président de l'écosystème développeurs de NVIDIA, qui indique que l'entreprise utilise des agents de codage IA pour développer CUDA plus rapidement et effectuer des validations à plus grande échelle.
NVIDIA possède déjà
propose également une stratégie CUDA Intelligence, combinant les connaissances CUDA existantes, l'expertise en optimisation, le profilage de performance cloud, les outils Nsight, les benchmarks et les services basés sur MCP.
NVIDIA maintient ComputeEval, un benchmark ouvert pour le code CUDA et les bibliothèques de calcul de base CUDA générés par IA.
Ce benchmark couvre des tâches impliquant les tensor cores, la mémoire partagée, les primitives au niveau warp, les CUDA graphs, les flux et les événements.
La course est donc relative :
La vitesse à laquelle le logiciel challenger rattrape
contre
La vitesse d'amélioration du logiciel NVIDIA
Chris Lattner : le battage médiatique est réel mais exagéré
Chris Lattner, cofondateur et PDG de Modular, offre un point de vue plus prudent.

Il considère que les agents de codage apportent une amélioration incrémentale, et non une destruction immédiate de l'avantage de CUDA.
L'article source résume trois raisons.
Écrire du code n'est qu'une partie de l'ingénierie
L'optimisation en environnement de production détermine la viabilité économique d'une puce. Les derniers points de pourcentage de performance peuvent nécessiter un travail d'expert considérable.
Les données d'entraînement publiques pour les logiciels GPU sont moins nombreuses
Le code d'application est abondant en ligne.
L'ingénierie de pointe en matière de noyaux et de compilateurs est un domaine restreint, et une grande partie du travail le plus avancé demeure propriétaire.
Les systèmes existants doivent encore migrer
La faisabilité technique n'élimine pas les coûts de certification, les risques opérationnels, la reconversion des équipes, les contrats, les exigences de fiabilité ou les coûts d'opportunité.
Ces considérations ne signifient pas que l'ingénierie des noyaux par agents est sans importance. Elles expliquent pourquoi une démonstration impressionnante ne se transforme pas immédiatement en remplacement sur le marché.
Les fossés défensifs se déplacent, ils ne disparaissent pas
L'interprétation la plus solide n'est pas « CUDA est mort ».
C'est plutôt qu'une couche de l'avantage historique de CUDA devient plus facile à reproduire.
Les agents, les langages dédiés et les compilateurs automatisés peuvent réduire le temps nécessaire pour construire des noyaux, des exécutants et le support de modèles pour de nouvelles puces.
La couche la plus exposée est l'adaptation rapide pour l'inférence précoce.
La couche la plus protégée reste l'entraînement à grande échelle, les bibliothèques de génération matures, la validation, le débogage, l'orchestration de clusters, l'intégration avec les frameworks, les flux de travail clients existants et l'optimisation continue.
La question stratégique pourrait passer de :
Qui possède la plus grande quantité de code de noyaux écrit à la main ?
à :
Qui possède la meilleure boucle automatisée de génération, de mesure,
de validation et d'optimisation ?
NVIDIA est bien positionnée car elle possède déjà le matériel, les outils, les bibliothèques, les charges de travail et les données de retour. Les challengers bénéficient de la baisse des barrières à l'entrée grâce aux agents.
Ces deux affirmations peuvent être vraies simultanément.
Ce que le résultat en 10 heures change réellement
Le résultat d'Infinity change les attentes des startups matérielles.
Un nouvel accélérateur ne doit plus nécessairement supposer que chaque noyau utile sera écrit manuellement par une petite équipe d'experts.
Un agent peut
éventuellement :
- Lire la description de l'architecture.
- Générer un noyau initial.
- Compiler et exécuter.
- Comparer la sortie avec des résultats de référence.
- Mesurer l'utilisation du matériel.
- Rechercher des schémas de planification alternatifs.
- Conserver la meilleure implémentation.
- Étendre des opérateurs au modèle complet.
Cela peut réduire le temps entre le premier retour de puce et l'obtention d'une inférence de modèle exploitable.
Cette réduction permet aux fournisseurs de puces de montrer leur matériel plus tôt, de supporter de nouveaux modèles plus rapidement, d'alléger la pression sur le personnel logiciel, de tester davantage d'idées et de concurrencer sur des marchés d'inférence plus spécialisés.
Ce résultat n'efface pas CUDA, mais il rend le premier pas vers la concurrence avec CUDA beaucoup moins intimidant.
Ce qu'il faut surveiller ensuite
Reproduction indépendante
Les résultats publiés par Infinity proviennent de l'entreprise et de ses partenaires matériels. Des benchmarks externes fourniront des preuves plus solides.
Couverture des modèles
Une couche d'inférence générale doit supporter plusieurs architectures, modalités, formats de quantification et modes de service.
Fiabilité en production
Une démonstration de bout en bout diffère d'un logiciel qui fonctionne pendant des mois sous le trafic client.
Échelle de validation
La question clé est de savoir comment les systèmes d'agents peuvent prouver la correction et la performance sur un vaste espace de test.
Portabilité
Si une implémentation obtient d'excellents résultats sur NVIDIA, AMD, Apple et d'autres accélérateurs, TileLang et d'autres langages dédiés deviendront plus stratégiques.
La réponse de NVIDIA
NVIDIA construit activement des agents, des benchmarks, de l'intelligence de compilateur et de nouvelles abstractions CUDA. Le géant existant ne reste pas immobile.
Questions fréquentes
Les agents IA ont-ils vraiment réimplémenté CUDA en 10 heures ?
Non. Infinity indique qu'Ignition a généré en 10 heures un logiciel de multiplication matricielle parallèle par tenseurs pour d-Matrix Corsair, atteignant 92 % du plafond de calcul empirique de la puce. L'inférence de bout en bout de Qwen3 a pris environ 10 jours, et le projet n'a pas reproduit l'écosystème complet de CUDA.
Qu'est-ce qu'Infinity Ignition ?
Ignition est l'agent de recherche et d'ingénierie IA d'Infinity, utilisé pour générer, tester, déboguer et optimiser des logiciels d'inférence de bas niveau. Il exploite le retour du matériel réel pour améliorer itérativement les noyaux et les exécutants de modèles.
Qu'est-ce que le d-Matrix Corsair ?
Le Corsair est une plateforme d'inférence IA générative de d-Matrix. Infinity l'utilise comme plateforme cible pour générer automatiquement des opérations parallèles par tenseurs et une pile d'inférence complète pour modèles.
Les TileKernels de DeepSeek remplaceront-ils CUDA ?
Non. TileKernels réduit le besoin d'écrire manuellement des noyaux CUDA de bas niveau en utilisant TileLang, mais ses exigences actuelles incluent le matériel NVIDIA SM90 ou SM100 ainsi que le Toolkit CUDA 13.1 ou une version ultérieure.
Pourquoi l'inférence est-elle plus ouverte aux alternatives à CUDA que l'entraînement ?
L'inférence peut s'exécuter sur des systèmes plus petits et est souvent évaluée sur le coût, la consommation, le débit ou la latence d'un modèle unique. L'entraînement de pointe nécessite des clusters plus grands, des systèmes de communication matures, une capacité de récupération après panne et une stabilité éprouvée.
Quel est le plus grand fossé défensif de CUDA ?
Le fossé de CUDA comprend des bibliothèques matures, l'intégration avec les frameworks, les outils de débogage et de profilage, les systèmes distribués, la documentation, l'historique de production et le code client existant. La validation et l'optimisation continues pourraient
devenir encore plus importantes à mesure que le coût de génération de code diminue.
Les noyaux générés par IA peuvent-ils être à la fois corrects et trop lents ?
Oui. Des recherches montrent que des noyaux peuvent passer les tests de correction numérique tout en ayant des performances bien inférieures aux implémentations de bibliothèques optimisées. Une évaluation de niveau production nécessite à la fois des vérifications de correction et de l'efficacité matérielle.
NVIDIA utilise-t-elle également des agents de codage IA ?
Oui. NVIDIA indique utiliser des agents pour accélérer le développement et la validation de CUDA, et a présenté publiquement des flux de travail d'agents pour CUDA, des intégrations de profilage de performance et le benchmark ComputeEval.
Outils associés
- NVIDIA CUDA : La plateforme de calcul accéléré de NVIDIA, comprenant compilateurs, exécutants, bibliothèques et outils pour développeurs.
- Infinity : L'entreprise qui construit Ignition et des logiciels d'inférence conscients des modèles pour les nouveaux accélérateurs IA.
- DeepSeek TileKernels : Une collection de noyaux LLM optimisés écrits par DeepSeek avec TileLang, sous licence MIT.
- TileLang : Un langage dédié de style Python et une pile de compilateur pour générer des noyaux haute performance sur plusieurs backends.
- INT21 PTX Kernel Factory : Un système par agents pour générer et améliorer des noyaux GPU NVIDIA de bas niveau.
- AMD ROCm : La plateforme logicielle AMD pour le calcul GPU, l'IA et le HPC.
- AWS Neuron : Le SDK pour déployer et optimiser des modèles sur les puces AWS Trainium et Inferentia.
- Modular MAX : Un framework de modélisation et de service optimisé pour le matériel, pour une exécution IA haute performance et portable.
Liens associés
- Business Insider : L'IA réécrit le fossé logiciel de NVIDIA : Reportage principal avec des interviews d'Infinity, NVIDIA, INT21, Modular et Rebellions.
- Étude de cas Infinity d-Matrix Corsair : La communication officielle d'Infinity sur le résultat de multiplication matricielle en 10 heures et la mise en service de bout en bout en 10 jours.
- Recherche Infinity : Le centre de recherche d'Infinity sur les agents, les noyaux IA et les logiciels d'inférence.
inc/research) : couvre les études de cas officielles sur d-Matrix, le logiciel d'inférence générative et le système de recherche OMEGA de l'entreprise.
- Plateforme NVIDIA CUDA : aperçu officiel du compilateur CUDA, de l'exécution, des bibliothèques, des outils et de l'écosystème.
- Dépôt DeepSeek TileKernels : code source officiel, exigences de dépendances, commandes de test, fonctionnalités et licence MIT.
- Article TileLang : article de recherche décrivant le modèle de programmation par tuiles de TileLang et son approche de compilation.
- NVIDIA ComputeEval : benchmark NVIDIA pour évaluer les tâches de programmation CUDA modernes.
Résumé
L'agent Ignition d'Infinity n'a pas réinventé NVIDIA CUDA en 10 heures. Il a généré une multiplication matricielle tensorielle parallèle haute performance pour une architecture inconnue.
À l'époque, l'accélérateur d-Matrix atteignait prétendument 92 % de la limite de calcul empirique de la puce. Environ dix jours plus tard, le chemin d'inférence complet de Qwen3 était réalisé.
Ce résultat reste significatif aujourd'hui. Il démontre que les agents peuvent accélérer le démarrage logiciel initial des nouvelles puces IA, en particulier dans le domaine de l'inférence — où les clients se soucient du coût par réponse et peuvent adopter du matériel dédié pour des charges de travail plus étroites.
Les TileKernels et TileLang de DeepSeek pointent également dans la même direction : davantage de travail sur les noyaux peut être exprimé via des systèmes de plus haut niveau et optimisé automatiquement. La version actuelle de TileKernels dépend encore des GPU et de CUDA les plus récents de NVIDIA ; elle réduit donc le travail de programmation CUDA manuelle, mais n'élimine pas cette plateforme.
La douve de CUDA reste profonde, car elle comprend bien plus que le code source. Les bibliothèques, la validation, l'analyse de performance, le support des frameworks, l'entraînement distribué, l'historique de production et les investissements organisationnels existants sont difficiles à reproduire.
L'IA n'a pas franchi toute la douve de CUDA en 10 heures — mais elle a peut-être réduit le coût pour atteindre le premier rempart, déplaçant la concurrence à long terme de la propriété du code vers la génération, la validation et l'optimisation automatisées.



