La forteresse CUDA de NVIDIA a été déclarée morte tellement de fois que cette déclaration est presque devenue un rituel de l'industrie. Un n...

com/assets/cms-assets/image/2026/08/3f0a1b2c-4d5e-6f7a-8b9c-0d1e2f3a4b5c-6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d1e2f3a4b5c6d7e8f9a0b1c2d3e4f5a6b7c8d9e0f1a2b3c4d5e6f7a8b9c0d
com/cms-assets/image/2026/08/9a7908b8-ffee-4250-b280-649499618ce5-658d1e86-10d7-4116-a564-e2b43d0c3a24.png)
Les ingénieurs humains fournissent toujours les objectifs, les informations matérielles, les contraintes, les critères d'acceptation et l'orientation générale. Ignition, quant à lui, effectue une grande partie du travail répétitif de recherche et d'optimisation.
Ce type de tâche est particulièrement adapté aux agents, car l'environnement génère un retour d'information exceptionnellement clair.
Les kernels générés peuvent être évalués par rapport à des critères spécifiques :
Le matériel et les tests fournissent une base factuelle objective.
De nombreuses tâches logicielles présentent des critères d'acceptation ambigus. L'optimisation des kernels, bien que difficile, comporte des aspects mesurables.
Une implémentation efficace doit satisfaire deux critères indépendants.
Le kernel doit produire des sorties dans des tolérances numériques acceptables.
Le kernel doit exploiter le matériel cible de manière suffisamment efficace pour justifier le remplacement d'une implémentation existante.
L'agent peut générer des centaines de candidats, rejeter les solutions incorrectes, tester les performances des solutions restantes et affiner continuellement les pistes les plus prometteuses.
Ce même schéma se retrouve dans les agents spécialisés en CUDA de NVIDIA, la PTX Kernel Factory d'INT21, les travaux TileKernels de DeepSeek, ainsi que dans les systèmes de recherche générant des kernels Triton ou TileLang.
La nouveauté récente réside dans le fait que les modèles de base peuvent désormais participer à une boucle beaucoup plus complète, au lieu de simplement combler quelques lignes de code syntaxique.
L'histoire technologique d'Infinity a attiré les investisseurs.
L'entreprise a annoncé en juillet 2026 la clôture d'un tour de financement d'amorçage de 15 millions de dollars, avec une valorisation post-argent estimée à 100 millions de dollars, selon les rapports. Touring Capital et Principal Venture Partners ont participé à l'investissement, aux côtés de dirigeants de l'industrie des semi-conducteurs et de chercheurs liés aux principaux laboratoires d'IA.

Infinity construit une couche logicielle d'inférence sensible au modèle pour les fournisseurs de matériel et les prestataires de services d'inférence. Son flux de travail déclaré est en réalité le suivant :
Spécifications matérielles
→ Logiciel d'inférence de qualité production généré
Infinity aurait également généré un moteur d'inférence NVIDIA à partir de zéro, offrant des performances supérieures de jusqu'à 34,3 % à une implémentation vLLM configurée de manière équivalente sur Qwen3-8B.
Ce résultat est auto-déclaré par l'entreprise et dépend du matériel, des configurations de traitement par lots, de la configuration du modèle et des méthodes de mesure. Néanmoins, cela indique que les ambitions d'Infinity vont bien au-delà du simple démarrage de puces.
Le texte original mentionne également le dépôt TileKernels de DeepSeek.
TileKernels est une bibliothèque de kernels GPU optimisés écrite à l'aide de TileLang, un langage spécifique au domaine basé sur Python pour le développement de kernels haute performance.
Le dépôt contient les opérations suivantes :
DeepSeek indique que de nombreux kernels approchent des limites matérielles en termes d'intensité de calcul ou de bande passante mémoire, et que certains sont déjà utilisés en interne.
TileLang réduit la quantité de code CUDA C++ de bas niveau que les ingénieurs doivent écrire manuellement.
Sous sa forme actuelle, cela n'indique pas que DeepSeek a éliminé sa dépendance à la pile technologique NVIDIA.
Les exigences actuelles officielles de TileKernels comprennent :
GPU NVIDIA SM90 ou SM100
CUDA Toolkit 13.1 ou version ultérieure
PyTorch 2.10 ou version ultérieure
TileLang 0.1.9 ou version ultérieure
La bibliothèque actuelle est conçue pour les architectures NVIDIA les plus récentes. Elle réduit la dépendance au code source CUDA écrit à la main, mais pas la dépendance au matériel NVIDIA ou à la boîte à outils CUDA.
TileLang lui-même a des ambitions plus vastes.
Le projet décrit un modèle de programmation en tuiles (tiled) pour les kernels GPU, CPU et accélérateurs, basé sur l'infrastructure du compilateur TVM et utilisant une syntaxe de style Python.
Son objectif est de séparer le flux de données souhaité par l'ingénieur de l'ordonnancement de bas niveau nécessaire à une exécution efficace.
TileLang ajoute continuellement la prise en charge de plusieurs langages backend ainsi que des chemins matériels impliquant CUDA, ROCm et Metal.
Cette portabilité peut réduire les coûts de changement de fournisseur, à condition que les résultats générés soient corrects, stables, débogables et compétitifs par rapport aux bibliothèques des fournisseurs.
Un kernel qui s'exécute partout mais avec de mauvaises performances ne remplacera pas un chemin CUDA en environnement de production.
Un article de recherche de juillet 2026 a examiné l'écart entre l'exactitude des kernels et la qualité de substitution dans Triton et TileLang.
Les auteurs ont constaté que les kernels peuvent réussir les tests de correction numérique tout en ayant des performances bien inférieures aux références optimisées. Selon les rapports, une implémentation LayerNorm TileLang, bien qu'elle ait réussi les contrôles d'exactitude, s'exécutait plus de 300 fois plus lentement que la référence PyTorch.
Cet article n'est pas contre TileLang, mais plaide en faveur d'une évaluation des kernels générés selon deux dimensions :
Exactitude
+
Efficacité matérielle
La génération de code devient de plus en plus rapide. Mais prouver que le code généré est suffisant pour remplacer un logiciel de production mature reste difficile.
Le défi à CUDA est plus crédible dans le domaine de l'inférence que dans celui de l'entraînement des modèles de pointe.
Les opérations d'entraînement à grande échelle peuvent impliquer des milliers ou des dizaines de milliers d'accélérateurs fonctionnant ensemble pendant des semaines ou des mois.
Les plateformes d'entraînement doivent gérer la communication distribuée, les points de contrôle, la récupération après panne, la gestion de la mémoire, le parallélisme, la reproductibilité et le débogage sur un grand nombre d'appareils.
Une panne matérielle ou logicielle peut gaspiller d'énormes quantités de puissance de calcul. Par conséquent, les institutions sont souvent très prudentes lorsqu'il s'agit de migrer des charges d'entraînement critiques depuis des systèmes matures.
CUDA, les bibliothèques CUDA-X, NCCL, le support PyTorch et les capacités réseau intégrées de NVIDIA confèrent à l'entreprise une position dominante dans ce domaine.
L'inférence est l'étape de service après l'entraînement du modèle.
Les mesures commerciales pertinentes sont généralement plus proches de :
Qualité de sortie acceptable
÷
Coût total de service
L'inférence peut être répartie sur un seul accélérateur, de petits clusters, des flottes à grande échelle et du matériel spécialisé.
Une nouvelle puce n'a pas besoin de remplacer NVIDIA dans tous les scénarios. Elle doit simplement démontrer un avantage pour un modèle ou une charge donné, en termes de coût réduit, de vitesse accrue, de consommation d'énergie plus faible, de débit supérieur ou de latence plus prévisible.
Cet objectif plus restreint offre un point d'entrée réaliste pour le matériel spécialisé.
d-Matrix, fondée en 2019, se concentre sur l'accélération de l'inférence. Sa plateforme Corsair, qui exploite une grande quantité de SRAM sur puce, vise à réduire le coût et la consommation d'énergie liés à l'exécution de modèles génératifs.

Le travail d'Infinity résout l'un des problèmes classiques rencontrés par les nouveaux accélérateurs.
Une puce peut avoir un matériel prometteur, mais tant que le noyau, l'exécution du modèle, la gestion de la mémoire, la quantification, la logique de service et le schéma d'intégration ne sont pas prêts, les clients ne peuvent pas l'utiliser efficacement.
Si un agent peut réduire ce processus de démarrage de plusieurs mois à quelques jours, les startups matérielles peuvent offrir un support proche de la date de sortie des modèles et démontrer leurs capacités matérielles plus tôt.
Cela réduit une partie de l'avantage logiciel de NVIDIA, mais ne l'élimine pas entièrement.
Le marché de l'inférence comprend plusieurs challengers :
| Acteur ou plateforme | Positionnement général |
|---|---|
| Rebellions | Accélérateurs et systèmes d'inférence IA dédiés |
| Cerebras | Systèmes à l'échelle d'une tranche de silicium pour l'entraînement et l'inférence |
| AWS Inferentia | Puce d'inférence conçue par Amazon, utilisant le SDK Neuron |
| Google TPU | Accélérateurs Google pris en charge via XLA et les frameworks courants |
| AMD Instinct | GPU de centre de données utilisant la plateforme ROCm |
| d-Matrix | Accélération d'inférence IA générative centrée sur la SRAM |
| NVIDIA | GPU et pile de calcul accéléré CUDA |
La pression vient des couches logicielles qui permettent aux utilisateurs de déployer des modèles sans réécrire manuellement chaque opération, notamment AWS Neuron, Google XLA, AMD ROCm, Modular MAX et Mojo, TileLang, Triton et les systèmes de génération de noyaux IA.
Plus ces couches logicielles automatisent de choses, moins les développeurs d'applications ont besoin d'intervenir manuellement.
Contenu directement lié à CUDA.
L'effet de verrouillage de CUDA est le plus fort lorsque les applications et leurs noyaux optimisés sont étroitement liés au matériel NVIDIA.
Une couche d'inférence portable vise le flux de travail suivant :
Modèle
→ Couche d'exécution portable
→ Génération ou sélection de noyaux matériels
→ Accélérateur cible
Le monde réel est plus complexe, car différentes puces ont des hiérarchies de mémoire, des formats numériques, des interconnexions, des comportements d'ordonnancement et des opérations prises en charge différents.
Des performances élevées nécessitent souvent encore un travail spécifique au matériel.
Le point central d'Infinity est qu'un agent peut automatiquement générer ce travail de spécialisation.
Un résultat de 10 heures ne peut pas reproduire les actifs qui rendent CUDA difficile à remplacer.
Ces actifs comprennent :
De nombreuses organisations utilisent des bibliothèques fournisseurs plutôt que d'écrire directement des noyaux. cuBLAS, cuDNN, TensorRT, NCCL et d'autres bibliothèques contiennent des années d'expérience en optimisation.
NVIDIA Nsight et les outils associés aident les ingénieurs à comprendre l'exactitude, le comportement mémoire, les chronologies, les communications et les performances.
Les nouvelles fonctionnalités de modèles sont généralement intégrées et optimisées en priorité pour le matériel NVIDIA.
Les équipes de production comprennent le comportement des systèmes NVIDIA sous charge.
Decrivez votre idee une fois, et We0 AI peut generer un site vitrine, des pages et un CMS, puis vous aider a attirer clients et trafic apres le lancement.
Une génération de projet complète pour une inscription gratuite
Idéal pour essayer un flux de génération complet et voir rapidement une première ébauche de projet.
L'écosystème comprend des exemples, des cours, des présentations de conférences, des réponses communautaires et des ressources d'experts.
Les entreprises ont des millions de lignes de code, des tests, des processus d'achat et des compétences d'employés liés à cette plateforme.
L'IA peut réduire les coûts de traduction, mais elle n'élimine pas automatiquement les coûts de changement au niveau organisationnel.
Bing Xu, fondateur d'INT21 et ancien fondateur de HippoML acquis par NVIDIA, estime que la validation est le principal goulot d'étranglement.

Un agent peut générer du code rapidement. Mais les équipes de production ont encore besoin de preuves qu'il :
NVIDIA dispose déjà d'une grande quantité de tests de conformité, de tests de performance, d'implémentations de référence, de simulateurs, d'analyseurs de performances, de diagnostics de compilateur, de charges de travail de production et de données historiques sur les erreurs.
Ces actifs rendent les agents plus utiles.
Ainsi, l'IA pourrait déplacer le fossé de la génération de code vers la qualité de l'environnement de validation.
Les technologies qui défient CUDA s'appliquent également à NVIDIA.
Business Insider cite Ankit Patel, vice-président de l'écosystème développeurs de NVIDIA, qui indique que l'entreprise utilise des agents de codage IA pour développer CUDA plus rapidement et effectuer des validations à plus grande échelle.
NVIDIA possède déjà
propose également une stratégie CUDA Intelligence, combinant les connaissances CUDA existantes, l'expertise en optimisation, le profilage de performance cloud, les outils Nsight, les benchmarks et les services basés sur MCP.
NVIDIA maintient ComputeEval, un benchmark ouvert pour le code CUDA et les bibliothèques de calcul de base CUDA générés par IA.
Ce benchmark couvre des tâches impliquant les tensor cores, la mémoire partagée, les primitives au niveau warp, les CUDA graphs, les flux et les événements.
La course est donc relative :
La vitesse à laquelle le logiciel challenger rattrape
contre
La vitesse d'amélioration du logiciel NVIDIA
Chris Lattner, cofondateur et PDG de Modular, offre un point de vue plus prudent.

Il considère que les agents de codage apportent une amélioration incrémentale, et non une destruction immédiate de l'avantage de CUDA.
L'article source résume trois raisons.
L'optimisation en environnement de production détermine la viabilité économique d'une puce. Les derniers points de pourcentage de performance peuvent nécessiter un travail d'expert considérable.
Le code d'application est abondant en ligne.
L'ingénierie de pointe en matière de noyaux et de compilateurs est un domaine restreint, et une grande partie du travail le plus avancé demeure propriétaire.
La faisabilité technique n'élimine pas les coûts de certification, les risques opérationnels, la reconversion des équipes, les contrats, les exigences de fiabilité ou les coûts d'opportunité.
Ces considérations ne signifient pas que l'ingénierie des noyaux par agents est sans importance. Elles expliquent pourquoi une démonstration impressionnante ne se transforme pas immédiatement en remplacement sur le marché.
L'interprétation la plus solide n'est pas « CUDA est mort ».
C'est plutôt qu'une couche de l'avantage historique de CUDA devient plus facile à reproduire.
Les agents, les langages dédiés et les compilateurs automatisés peuvent réduire le temps nécessaire pour construire des noyaux, des exécutants et le support de modèles pour de nouvelles puces.
La couche la plus exposée est l'adaptation rapide pour l'inférence précoce.
La couche la plus protégée reste l'entraînement à grande échelle, les bibliothèques de génération matures, la validation, le débogage, l'orchestration de clusters, l'intégration avec les frameworks, les flux de travail clients existants et l'optimisation continue.
La question stratégique pourrait passer de :
Qui possède la plus grande quantité de code de noyaux écrit à la main ?
à :
Qui possède la meilleure boucle automatisée de génération, de mesure,
de validation et d'optimisation ?
NVIDIA est bien positionnée car elle possède déjà le matériel, les outils, les bibliothèques, les charges de travail et les données de retour. Les challengers bénéficient de la baisse des barrières à l'entrée grâce aux agents.
Ces deux affirmations peuvent être vraies simultanément.
Le résultat d'Infinity change les attentes des startups matérielles.
Un nouvel accélérateur ne doit plus nécessairement supposer que chaque noyau utile sera écrit manuellement par une petite équipe d'experts.
Un agent peut
éventuellement :
Cela peut réduire le temps entre le premier retour de puce et l'obtention d'une inférence de modèle exploitable.
Cette réduction permet aux fournisseurs de puces de montrer leur matériel plus tôt, de supporter de nouveaux modèles plus rapidement, d'alléger la pression sur le personnel logiciel, de tester davantage d'idées et de concurrencer sur des marchés d'inférence plus spécialisés.
Ce résultat n'efface pas CUDA, mais il rend le premier pas vers la concurrence avec CUDA beaucoup moins intimidant.
Les résultats publiés par Infinity proviennent de l'entreprise et de ses partenaires matériels. Des benchmarks externes fourniront des preuves plus solides.
Une couche d'inférence générale doit supporter plusieurs architectures, modalités, formats de quantification et modes de service.
Une démonstration de bout en bout diffère d'un logiciel qui fonctionne pendant des mois sous le trafic client.
La question clé est de savoir comment les systèmes d'agents peuvent prouver la correction et la performance sur un vaste espace de test.
Si une implémentation obtient d'excellents résultats sur NVIDIA, AMD, Apple et d'autres accélérateurs, TileLang et d'autres langages dédiés deviendront plus stratégiques.
NVIDIA construit activement des agents, des benchmarks, de l'intelligence de compilateur et de nouvelles abstractions CUDA. Le géant existant ne reste pas immobile.
Non. Infinity indique qu'Ignition a généré en 10 heures un logiciel de multiplication matricielle parallèle par tenseurs pour d-Matrix Corsair, atteignant 92 % du plafond de calcul empirique de la puce. L'inférence de bout en bout de Qwen3 a pris environ 10 jours, et le projet n'a pas reproduit l'écosystème complet de CUDA.
Ignition est l'agent de recherche et d'ingénierie IA d'Infinity, utilisé pour générer, tester, déboguer et optimiser des logiciels d'inférence de bas niveau. Il exploite le retour du matériel réel pour améliorer itérativement les noyaux et les exécutants de modèles.
Le Corsair est une plateforme d'inférence IA générative de d-Matrix. Infinity l'utilise comme plateforme cible pour générer automatiquement des opérations parallèles par tenseurs et une pile d'inférence complète pour modèles.
Non. TileKernels réduit le besoin d'écrire manuellement des noyaux CUDA de bas niveau en utilisant TileLang, mais ses exigences actuelles incluent le matériel NVIDIA SM90 ou SM100 ainsi que le Toolkit CUDA 13.1 ou une version ultérieure.
L'inférence peut s'exécuter sur des systèmes plus petits et est souvent évaluée sur le coût, la consommation, le débit ou la latence d'un modèle unique. L'entraînement de pointe nécessite des clusters plus grands, des systèmes de communication matures, une capacité de récupération après panne et une stabilité éprouvée.
Le fossé de CUDA comprend des bibliothèques matures, l'intégration avec les frameworks, les outils de débogage et de profilage, les systèmes distribués, la documentation, l'historique de production et le code client existant. La validation et l'optimisation continues pourraient
devenir encore plus importantes à mesure que le coût de génération de code diminue.
Oui. Des recherches montrent que des noyaux peuvent passer les tests de correction numérique tout en ayant des performances bien inférieures aux implémentations de bibliothèques optimisées. Une évaluation de niveau production nécessite à la fois des vérifications de correction et de l'efficacité matérielle.
Oui. NVIDIA indique utiliser des agents pour accélérer le développement et la validation de CUDA, et a présenté publiquement des flux de travail d'agents pour CUDA, des intégrations de profilage de performance et le benchmark ComputeEval.
inc/research) : couvre les études de cas officielles sur d-Matrix, le logiciel d'inférence générative et le système de recherche OMEGA de l'entreprise.
L'agent Ignition d'Infinity n'a pas réinventé NVIDIA CUDA en 10 heures. Il a généré une multiplication matricielle tensorielle parallèle haute performance pour une architecture inconnue.
À l'époque, l'accélérateur d-Matrix atteignait prétendument 92 % de la limite de calcul empirique de la puce. Environ dix jours plus tard, le chemin d'inférence complet de Qwen3 était réalisé.
Ce résultat reste significatif aujourd'hui. Il démontre que les agents peuvent accélérer le démarrage logiciel initial des nouvelles puces IA, en particulier dans le domaine de l'inférence — où les clients se soucient du coût par réponse et peuvent adopter du matériel dédié pour des charges de travail plus étroites.
Les TileKernels et TileLang de DeepSeek pointent également dans la même direction : davantage de travail sur les noyaux peut être exprimé via des systèmes de plus haut niveau et optimisé automatiquement. La version actuelle de TileKernels dépend encore des GPU et de CUDA les plus récents de NVIDIA ; elle réduit donc le travail de programmation CUDA manuelle, mais n'élimine pas cette plateforme.
La douve de CUDA reste profonde, car elle comprend bien plus que le code source. Les bibliothèques, la validation, l'analyse de performance, le support des frameworks, l'entraînement distribué, l'historique de production et les investissements organisationnels existants sont difficiles à reproduire.
L'IA n'a pas franchi toute la douve de CUDA en 10 heures — mais elle a peut-être réduit le coût pour atteindre le premier rempart, déplaçant la concurrence à long terme de la propriété du code vers la génération, la validation et l'optimisation automatisées.
Partez d’une phrase et obtenez un site complet en quelques minutes.