Moonshot AI a lancé Kimi K3, un modèle natif multimodal conçu pour le codage de longue durée, le travail de connaissance, le raisonnement vi...

Moonshot AI a lancé Kimi K3, un modèle natif multimodal conçu pour le codage de longue durée, le travail de connaissance, le raisonnement visuel et les workflows basés sur des agents.
Ce modèle dispose de 2,8 billions de paramètres au total, d’une fenêtre contextuelle d’1 million de tokens et d’une architecture de mélange d’experts hautement clairsemée — pour chaque token, seuls 16 de ses 896 experts sont activés. Moonshot le décrit comme le premier modèle ouvert de la classe 3T, bien que l’annonce de la société précise que les poids complets du modèle devraient être publiés le 27 juillet 2026.
Kimi K3 a immédiatement attiré l’attention pour ses résultats en développement front-end, en optimisation autonome de noyaux GPU, en création d’un petit compilateur GPU nommé MiniTriton, et en une expérience de conception de puce réalisée en 48 heures à l’aide d’outils open source de conception assistée par ordinateur.
Moonshot reconnaît également que le K3 n’est pas en tête dans toutes les catégories. Sa propre évaluation montre que le modèle est en retard sur Claude Fable 5 et GPT-5.6 Sol en performance globale, mais qu’il obtient de meilleurs résultats dans plusieurs tâches de codage et d’agents de longue durée.
L’image source provient de la comparaison intelligente Artificial Analysis partagée dans l’article, montrant la position de Kimi K3.
Kimi K3 place la tarification de l’API de Moonshot à un niveau supérieur à celui des premiers modèles de codage Kimi.
Le tableau des prix du rapport original indique les tarifs suivants pour l’API en Chine :
| Modèle | Entrée avec cache atteint | Entrée sans cache | Sortie |
|---|---|---|---|
| Kimi K3 | ¥2 par million de tokens | ¥20 par million de tokens | ¥100 par million de tokens |
| Kimi K2.7 Code | ¥1,30 par million de tokens | ¥6,50 par million de tokens | ¥27 par million de tokens |
Comparaison des prix entre Kimi K3 et Kimi K2.7 Code dans l’article source.
Sur la plateforme API internationale de Moonshot, les prix de Kimi K3 sont les suivants :
C’est nettement plus cher que Kimi K2.7 Code, mais toujours inférieur aux prix de Claude Fable 5 cités par Moonshot dans sa comparaison de lancement.
(Image du tableau de comparaison des prix montrant que la tarification de sortie de Kimi K3 ne représente que 30 % de celle de Claude Fable 5.)
Il convient d’être prudent lors de la lecture de la comparaison des prix. Les tarifs des API peuvent varier selon la région, le fournisseur, le comportement du cache et les mises à jour ultérieures des produits. Avant tout déploiement, la page officielle de l’API Kimi est le meilleur moyen de vérifier les barèmes de facturation en vigueur.
Le résultat le plus remarquable concerne le développement front-end.
Au moment de la rédaction de cet article, Kimi K3 est en tête du classement préliminaire WebDev de l’Arena Frontend Code Arena. Le graphique source indique un taux de victoire de 76 %, devançant Claude Fable 5 et GPT-5.6 Sol.
(Image montrant le classement préliminaire WebDev de la Frontend Code Arena, avec Kimi-K3 en tête avec un taux de victoire de 76 %. En dessous figurent les taux de victoire d’autres modèles, tels que Claude Fable 5 à 63 %, GPT-5.6 Sol (xHigh) à 58 %, GLM-5.2 (Max) à 55 %, Grok-4.5 à 53 %, Claude Opus 4.8 (Thinking) et Muse Spark 1.1 à 50 % chacun, et Claude Opus 4.7 (Thinking) à 49 %. Ce graphique, étroitement lié au contexte, illustre visuellement la position dominante de Kimi-K3 dans l’arène du code front-end et la comparaison des taux de victoire avec d’autres modèles.)
Kimi K3 occupe la première place dans les résultats préliminaires de la Frontend Code Arena présentés dans le rapport.
Parmi les sept catégories front-end, le rapport original indique que le K3 est classé premier dans six d’entre elles :
Il serait classé deuxième dans la catégorie des jeux.
Ces résultats sont particulièrement importants car le travail front-end n’est pas seulement un problème de génération de code. Un modèle performant doit être capable d’interpréter des besoins visuels, de créer des applications fonctionnelles, de les exécuter, d’en vérifier les résultats et de modifier l’implémentation lorsque l’interface ne correspond pas à la conception souhaitée.
Un exemple cité dans l’article original est la reproduction d’une interface de style macOS 27 à l’aide d’un cluster d’agents en environ six heures.
Le résultat n’est pas simplement une capture d’écran statique. Le rapport indique qu’à l’exception de quelques applications comme le navigateur et la fonction téléphonique, la plupart des applications et interactions de bureau fonctionnent correctement.
(Image montrant un exemple d’interface de style macOS 27 générée par Kimi K3. À gauche, un bureau simulé de style macOS 27 avec des options de menu comme « About This Mac » et un échiquier en dessous. À droite, l’interface Freeform présente des tâches telles que « macOS 27 Brainstorm », avec des notes autocollantes, des diagrammes de flux et d’autres éléments. Cette image, étroitement liée au contexte, illustre visuellement le résultat de Kimi K3 dans la Frontend Code Arena en reconstruisant l’interface de style macOS 27, démontrant ses capacités en génération de code et en conception d’interface.)
Une interface de navigateur générée par des agents imitant un système d’exploitation de bureau moderne.
D’autres démonstrations incluent un simulateur de main robotique et un jeu 3D entièrement programmatique, basé sur un navigateur, utilisant Three.js et WebGPU.
Ces exemples restent des démonstrations plutôt que des benchmarks standardisés, mais ils montrent le type de workflows que Moonshot souhaite que le K3 prenne en charge : une création logicielle longue, visuelle et itérative.
Moonshot décrit le workflow front-end du K3 comme le visuel dans la boucle.
Le modèle ne se contente pas de générer du code et de s’arrêter ; il est capable de :
Ce workflow comble l’écart entre la génération de code et l’évaluation visuelle.
Un modèle peut générer du HTML, du CSS et du JavaScript syntaxiquement valides tout en produisant une interface médiocre. En observant la sortie rendue, le K3 peut identifier des problèmes difficiles à détecter à partir du seul code source.
Pour les grands référentiels front-end, la fenêtre contextuelle d’1 million de tokens est également cruciale. Elle peut contenir, dans un seul contexte de travail, de nombreux composants, définitions de types, règles de système de conception, documents de projet et dépendances entre fichiers.
L’article original mentionne également un compromis : certains utilisateurs rapportent que les tâches front-end complexes prennent entre 20 minutes et une heure. Ce ne sont que des observations individuelles, et non des mesures de latence contrôlées, mais elles indiquent que le K3
Peut-être préfère-t-il les itérations longues aux sorties immédiates.
La programmation est l’un des atouts majeurs de Kimi K3.
Le tableau de référence du rapport original présente les résultats suivants :
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| DeepSWE | 67,5 | 70,0 | 73,0 |
| Program Bench | 77,8 | 76,8 | 77,6 |
| SWE Marathon | 42,0 | 35,0 | 39,0 |

Résultats rapportés de Kimi K3 dans plusieurs évaluations de programmation et de génie logiciel.
Le blog officiel de Kimi K3 fournit des éclaircissements méthodologiques importants.
Pour DeepSWE, Moonshot rapporte dans sa comparaison principale les résultats du framework Kimi Code, tandis que le classement public du mini-SWE-agent affiche 67,3. Ainsi, de légères variations peuvent apparaître selon le framework et les réglages d’évaluation.
Pour SWE Marathon, Moonshot a utilisé la branche de calibration H20 des tâches officielles. La société indique également que Claude Fable 5 a présenté un comportement de repli dans certaines évaluations, ce qui a pu réduire son score mesuré.
Ces détails n’invalident pas les résultats, mais sont importants pour comparer les modèles. Le framework d’agent, les permissions des outils, le matériel, les réglages d’inférence, les comportements de repli et la calibration des tâches peuvent tous affecter le score final.
Moonshot a testé la capacité de Kimi K3 à optimiser des noyaux GPU avec une supervision humaine minimale.
Chaque modèle a reçu le même environnement sandbox et pouvait, en 24 heures maximum, analyser, réécrire, benchmarker et optimiser les noyaux suivants :
Les tests NVIDIA ont été exécutés sur du matériel H200.
Pour la charge de travail des résidus d’attention, le texte indique que K3 a conçu un nouvel algorithme de noyau en deux phases, réduisant
le temps combiné des exécutions forward et backward de 283,6 ms à 114,4 ms.
Cela représente une accélération d’environ 59,7 % par rapport à la ligne de base, rapprochant Kimi K3 des performances de Claude Fable 5 dans la configuration expérimentale de Moonshot.

Graphique de l’amélioration rapportée de Kimi K3 dans la tâche de noyau AttnRes.
Le graphique montre également le progrès de l’agent au fil du temps. K3 a réalisé plusieurs avancées majeures dès le début de l’exécution, puis a continuellement optimisé le noyau lors des itérations suivantes.
Pour la tâche MLA-512 à partir de zéro, le noyau de Kimi K3 a atteint, sous charge combinée forward et backward, les 517,8 TFLOPS rapportés.
Le deuxième meilleur résultat présenté dans le rapport est d’environ 492,7 TFLOPS.

Kimi K3 a atteint les 517,8 TFLOPS rapportés dans la tâche d’optimisation MLA-512.
Moonshot indique que, dans les phases ultérieures du développement du modèle, les premières versions de K3 ont assumé la majeure partie du travail d’optimisation des noyaux de l’équipe. Il s’agit d’un flux de travail auto-rapporté par l’entreprise, qui n’a pas été vérifié de manière indépendante dans les documents liés à la source.
L’expérience suivante dépasse l’optimisation d’un seul noyau.
Moonshot a exploré si Kimi K3 pouvait construire un petit système de programmation GPU à partir de zéro. Le résultat est MiniTriton, un compilateur compact, semblable à Triton, comprenant :
Moonshot rapporte que MiniTriton atteint ou dépasse les performances de Triton et de torch.compile dans les benchmarks de roofline supportés, y compris une supériorité sur Triton pour certaines charges de travail.

Performances de toit en CUDA du MiniTriton rapportées sur un GPU NVIDIA L20.
Le compilateur prend également en charge l’entraînement de nanoGPT de bout en bout, avec une convergence stable. Selon Moonshot, sa courbe de perte reste proche de l’implémentation de référence, avec seulement des écarts mineurs.
Cela a plus de sens que des micro-benchmarks isolés. Cela montre que le système généré est capable de relier le langage front-end, la représentation intermédiaire, le pipeline d’optimisation, la génération PTX et l’exécution en un flux de travail cohérent.
Cependant, au moment de la rédaction de cet article, Moonshot n’a pas encore publié publiquement le code source de MiniTriton. Par conséquent, les affirmations de performance proviennent des documents de lancement de Kimi K3 et ne peuvent pas encore être reproduites à partir du code officiellement publié.
Kimi K3 a également été testé dans la conception de puces.
En 48 heures d’exécution autonome, le modèle a construit, optimisé et validé une puce destinée à servir de petits modèles basés sur l’architecture K3, en utilisant des outils EDA open source et le kit de conception de procédé Nangate 45nm.
Moonshot a rapporté les résultats de conception simulée suivants :
Decrivez votre idee une fois, et We0 AI peut generer un site vitrine, des pages et un CMS, puis vous aider a attirer clients et trafic apres le lancement.
Une génération de projet complète pour une inscription gratuite
Idéal pour essayer un flux de génération complet et voir rapidement une première ébauche de projet.

Cette étude de cas de conception de puce rapporte un débit de traitement supérieur à 8 700 tokens par seconde en simulation.
La distinction entre une conception numérique validée et une puce physique fabriquée est importante.
Les documents publics décrivent un exercice de conception, d’optimisation, de synchronisation temporelle et de simulation EDA. Ils n’indiquent pas que la puce a été finalisée pour la fabrication, encapsulée et testée sur silicium.
Même avec cette limitation, la réalisation d’un pipeline étendu de conception matérielle constitue un cas notable de codage à long terme. Elle exige que l’agent coordonne les décisions architecturales, la description matérielle, la synthèse, le placement et le routage, la vérification temporelle, la validation et les optimisations itératives.
Kimi K3 est construit sur deux technologies développées par Moonshot AI :
Le modèle combine ces technologies avec une architecture de mélange d’experts à activation plus clairsemée.

Kimi K3 intègre KDA, les résidus d’attention, Gated MLA et Stable LatentMoE.
Kimi Delta Attention, abrégé en KDA, vise à rendre le mécanisme d’attention plus efficace sur les longues séquences.
Au lieu de s’appuyer entièrement sur l’attention totale standard sur l’ensemble du contexte, KDA offre un mécanisme efficace pour traiter les entrées longues tout en préservant les informations nécessaires pour le codage, le raisonnement et les tâches agentiques.
C’est l’une des bases du contexte de niveau million de tokens du modèle K3.
Les couches Transformer traditionnelles ajoutent de manière répétée la sortie de chaque nouvelle couche à l’état caché cumulé.
Le mécanisme de résidus d’attention (AttnRes) change ce modèle. Il permet aux couches suivantes de sélectionner de manière sélective des représentations à différentes profondeurs, plutôt que de simplement traiter toutes les couches précédentes comme faisant partie d’un flux de cumul uniforme.
Moonshot le décrit comme une manière plus flexible de transmettre l’information dans les modèles très profonds.
Kimi K3 possède 896 modules experts, mais chaque token n’active que 16 experts.
Cette extrême parcimonie réduit le calcul par token (par rapport à la taille globale du modèle), mais augmente la difficulté du routage et de l’équilibrage de charge. Le cadre Stable LatentMoE de Moonshot vise à maintenir la stabilité de l’entraînement dans cette configuration parcimonieuse.
Les modèles de mélange d’experts doivent répartir les tokens équitablement entre les experts pour éviter la surcharge de quelques-uns.
K3 utilise la technique d’équilibrage par quantiles, qui assigne les experts en fonction des quantiles des scores du routeur, plutôt que de s’appuyer sur des stratégies d’équilibrage par réglage manuel. Moonshot indique que cela élimine les hyperparamètres sensibles d’équilibrage de charge, rendant l’attribution des experts à grande échelle plus stable.
K3 étend l’optimiseur Muon pour réaliser une optimisation Muon par tête.
Cette approche décompose les paramètres d’attention en structures indépendantes, optimisant chaque tête d’attention séparément. L’objectif est de fournir un comportement d’optimisation plus adaptatif pour chaque tête d’attention lors de l’entraînement à grande échelle.
Deux composants supplémentaires soutiennent le contrôle de l’activation et de l’attention :
En combinant KDA, AttnRes, Stable LatentMoE, l’équilibrage par quantiles et l’optimisation Muon par tête, Moonshot affirme que ces améliorations offrent une efficacité d’expansion globale environ 2,5 fois supérieure à celle de Kimi K2.
Kimi K3 adopte un entraînement conscient de la quantification dès la phase de réglage supervisé.
Le blog technique officiel liste :
L’objectif est d’améliorer la compatibilité entre différents accélérateurs matériels tout en maintenant la capacité d’entraînement et de déploiement d’un modèle de cette taille.
Moonshot recommande également un déploiement en super-nœud avec plus de 64 accélérateurs pour une inférence efficace. Cela indique clairement que des poids ouverts ne signifient pas un déploiement local facile — ce modèle de 2,8 billions de paramètres reste un système d’infrastructure lourde.
KDA apporte de nouveaux défis au cache de préfixe traditionnel.
Moonshot indique avoir développé une implémentation de cache de pré-remplissage correspondante et l’avoir contribuée à l’écosystème vLLM. Son API officielle a un taux de succès du cache supérieur à 90 % dans les charges de travail de type code.
Cette couche de cache explique la grande différence de prix entre les entrées mises en cache et non mises en cache. Cette implémentation sera open source en même temps que le modèle, et les développeurs peuvent consulter les annonces officielles de Kimi et de vLLM.
Les dépôts de code actuellement disponibles et leur état d’intégration.
Moonshot liste trois limitations importantes de Kimi K3.
Le mode d’entraînement de K3 conserve l’historique de réflexion précédent du modèle.
Si le cadre agentique ne renvoie pas l’intégralité de l’historique attendu, la qualité de génération peut devenir instable. Lorsqu’un utilisateur passe d’un autre modèle au milieu d’une session active,
En K3, le même problème peut également se produire.
Moonshot AI recommande d'utiliser des outils compatibles validés (comme Kimi Code) et d'éviter de changer de modèle en cours de session.
K3 a été massivement entraîné sur des tâches longues et difficiles.
Par conséquent, il peut réagir de manière excessive à des problèmes mineurs ou à des instructions floues, prenant des décisions que l'utilisateur n'avait pas anticipées.
Les applications nécessitant des limites strictes doivent définir clairement ces limites dans le prompt système ou dans le fichier AGENTS.md.
Moonshot AI indique que K3 présente encore un écart d'expérience utilisateur notable par rapport à Claude Fable 5 et GPT-5.6 Sol.
Cette nuance est précieuse : les scores de benchmark et les démonstrations d'ingénierie autonome ne couvrent pas tous les aspects de l'expérience de production, notamment la cohérence des réponses, la latence, l'interprétation des instructions, la fiabilité des outils et la fluidité des dialogues.
Kimi K3 est accessible via les canaux suivants :
Lors de son lancement, K3 utilise par défaut l'intensité de réflexion maximale. Moonshot AI indique que des options d'intensité de réflexion plus faible et plus élevée seront ajoutées dans les futures mises à jour.
L'entreprise a annoncé que les poids complets du modèle seront publiés d'ici le 27 juillet 2026. En attendant la publication de ces poids et du rapport technique, certaines parties de l'architecture, des configurations de benchmark, de l'implémentation MiniTriton et du flux de conception de puces reposent sur les descriptions déjà publiées par Moonshot AI.

Kimi K3 porte l'échelle des modèles ouverts rapportée par Moonshot AI à 2,8 billions de paramètres.
Kimi K3 est un modèle multimodal natif de 2,8 billions de paramètres développé par Moonshot AI, adapté au codage de longue durée, au travail de la connaissance, au raisonnement visuel et aux tâches agent. Il prend en charge une fenêtre de contexte d'1 million de jetons, activant 16 des 896 experts par jeton.
Moonshot AI qualifie K3 de modèle ouvert de niveau 3T et a annoncé que les poids complets du modèle seront publiés d'ici le 27 juillet 2026. Au moment de la rédaction de cet article, la publication des poids complets et du rapport technique de K3 n'est pas encore terminée.
La tarification de l'API Kimi internationale est la suivante : 0,30 $ par million de jetons d'entrée en cache, 3,00 $ par million de jetons d'entrée non mis en cache, et 15,00 $ par million de jetons de sortie. Les prix sont sujets à changement.
Par conséquent, les utilisateurs en production doivent vérifier les tarifs actuels sur la plateforme API officielle.
Lors de son lancement, Kimi K3 se classe temporairement en tête du classement Arena WebDev. Comme le classement évolue dynamiquement avec l'ajout de nouveaux votes et modèles, veuillez consulter la page Arena en temps réel pour le dernier classement.
MiniTriton est un compilateur GPU compact que Moonshot AI a déclaré avoir construit à partir de zéro pour Kimi K3. Il comprend une représentation intermédiaire de niveau tuile basée sur MLIR, des passes d'optimisation, un pipeline de génération de code PTX et prend en charge l'entraînement nanoGPT de bout en bout.
Aucune information officielle sur le tape-out physique n'a été publiée. Moonshot AI décrit une exécution d'automatisation de la conception électronique (EDA) autonome de 48 heures, qui a utilisé la bibliothèque Nangate 45nm pour réaliser la conception, l'optimisation, la vérification et la simulation de la puce.
Le modèle est extrêmement volumineux. Moonshot AI suggère qu'une configuration d'inférence pour le déploiement nécessite au moins 64 accélérateurs pour une exécution efficace. Même après l'ouverture des poids, l'exécution locale nécessite encore beaucoup d'infrastructures spécialisées ou des solutions de déploiement considérablement modifiées.
Moonshot AI souligne sa sensibilité à l'historique des pensées retenues, sa tendance à être trop proactif dans les tâches ambiguës, ainsi qu'un écart d'expérience utilisateur par rapport à Claude Fable 5 et GPT-5.6 Sol. L'utilisation de contraintes agent explicites et de cadres d'adaptation compatibles est recommandée.
kimi-k3 et à d'autres modèles Kimi.Kimi K3 est le plus grand modèle de Moonshot AI à ce jour, avec un total de 2,
8 billions de paramètres, support multimodal natif, fenêtre contextuelle d'un million de tokens, et activation éparse de 16 experts parmi 896.
Son résultat précoce le plus remarquable se manifeste dans le domaine de l'ingénierie à long cycle. K3 s'est classé premier dans le classement préliminaire de l'arène de code front-end, a optimisé les noyaux GPU, a construit le compilateur MiniTriton, et a réalisé un flux de travail de conception de puces analogiques de 48 heures à l'aide d'outils EDA open source.
L'architecture intègre le mécanisme d'attention Kimi Delta, les connexions résiduelles d'attention, le MoE latent stable, l'équilibrage quantile, l'optimiseur Muon par tête, SiTU et le MLA à porte. Moonshot AI rapporte que l'efficacité de l'extension a été multipliée par 2,5 par rapport à Kimi K2, tout en reconnaissant des limitations importantes en matière de compatibilité agentive, de proactivité et d'expérience utilisateur globale.
La déclaration la plus importante de Kimi K3 n'est pas qu'il remporte tous les benchmarks, mais qu'il maintient une production efficace dans des tâches d'ingénierie exceptionnellement longues, visuelles et dépendantes de chaînes d'outils.
Partez d’une phrase et obtenez un site complet en quelques minutes.