Google a lancé trois nouveaux modèles Gemini, ciblant différents segments du marché des agents :

Google a lancé trois nouveaux modèles Gemini, ciblant différents segments du marché des agents :
Les annonces de Google mettent l'accent sur l'efficacité. L'entreprise indique que le nouveau modèle Flash peut accomplir des tâches avec moins de tokens de sortie, moins d'appels d'outils et un moindre surcoût de boucle d'exécution. Le prix est également inférieur à celui du Gemini 3.5 Flash.
Ces affirmations sont corroborées par les benchmarks internes de Google et les premiers tests indépendants.
La question plus complexe est de savoir si Gemini 3.6 Flash apporte une amélioration substantielle de l'intelligence par rapport au modèle qu'il remplace.
Artificial Analysis a mesuré que le nouveau modèle obtient le même score que Gemini 3.5 Flash dans son indice d'intelligence composite. Les premiers utilisateurs rapportent également des expériences mitigées, notamment en matière de conception visuelle, de génération en chinois, de sélection d'outils et de respect des instructions.
Les résultats ne sont pas un simple échec. Gemini 3.6 Flash semble plus rapide, plus concis dans ses sorties, et moins coûteux par tâche accomplie pour de nombreuses charges de travail. Il améliore également plusieurs benchmarks en codage, utilisation informatique, apprentissage automatique et travail de connaissance.
Mais cette sortie illustre une distinction importante :
Un modèle peut gagner en efficacité sans une amélioration équivalente de son intelligence générale ou de la qualité subjective de ses sorties.

| Modèle | Rôle principal | Prix API par million de tokens | Niveau de réflexion par défaut | Disponibilité |
|---|---|---|---|---|
| Gemini 3.6 Flash | Codage, travail multimodal et workflows agents complexes | Entrée 1,50 $ / Sortie 7,50 $ | Moyen | Disponible partout |
| Gemini 3.5 Flash-Lite | Extraction à haut volume, recherche, traduction, routage et sous-agents | Entrée 0,30 $ / Sortie 2,50 $ | Minimal | Disponible partout |
| Gemini 3.5 Flash Cyber | Détection, validation et correction de vulnérabilités | Non publié publiquement | Spécialisé | Pilote limité pour les gouvernements et partenaires de confiance |
Gemini 3.6 Flash et Gemini 3.5 Flash-Lite prennent tous deux en charge :
La fiche technique de Google indique la date limite de connaissances des deux modèles généralement disponibles en mars 2026.
Gemini 3.6 Flash est basé sur
Gemini 3.5 Flash et vise à le remplacer pour de nombreuses charges de travail de codage, de travail de connaissance, multimodales et agentiques.
L'amélioration la plus constante est l'efficacité.
Google rapporte que, selon l'indice Artificial Analysis, Gemini 3.6 Flash utilise 17% de tokens de sortie en moins que Gemini 3.5 Flash. Dans certaines évaluations de codage agentique (notamment DeepSWE), Google a observé une réduction des tokens de sortie allant jusqu'à 65%.
Le modèle a également tendance à utiliser :
Ces changements sont importants car le coût d'un agent ne dépend pas seulement du prix par token annoncé.
Un agent de longue durée peut appeler le modèle à plusieurs reprises, envoyer de grandes définitions d'outils, vérifier des fichiers, exécuter du code, se remettre d'erreurs et générer beaucoup de sorties de raisonnement. Même si le prix par token change peu, la réduction du nombre de tours d'appel et de tokens diminue le coût total.
Google répertorie les prix API suivants :
| Type de token | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| Entrée | 1,50 $ par million de tokens | 1,50 $ par million de tokens |
| Sortie | 7,50 $ par million de tokens | 9,00 $ par million de tokens |
Le prix d'entrée reste inchangé, tandis que le prix de sortie baisse d'environ 16,7%.
Dans son cadre d'évaluation, Artificial Analysis a mesuré un coût moyen par tâche d'environ 0,50 $ pour Gemini 3.6 Flash, contre 0,59 $ pour Gemini 3.5 Flash. Cela représente une baisse d'environ 18 %, due à la baisse du prix de sortie et à la réduction des tokens générés.
Ces chiffres doivent être considérés comme spécifiques à la charge de travail, et non universels. Le coût réel dépend de :
Artificial Analysis rapporte que le temps moyen par tâche pour Gemini 3.6 Flash est d'environ 1,3 minute, contre environ 2,7 minutes pour Gemini 3.5 Flash.
Cette amélioration provient d'une sortie plus rapide et d'un processus de raisonnement plus économique.
Un modèle qui génère des tokens rapidement peut encore prendre beaucoup de temps s'il s'engage dans une boucle d'appels d'outils répétitifs. À l'inverse, un modèle légèrement plus lent qui trouve la bonne solution avec moins d'appels peut terminer plus tôt.
Pour les développeurs d'agents, le temps par tâche accomplie est souvent plus utile que le nombre brut de tokens générés par seconde.
Google rapporte des améliorations dans plusieurs catégories de benchmarks.
Sur DeepSWE, par rapport à Gemini 3.5 Flash, le score de Gemini 3.6 Flash est passé de 37% à 49%.
Google indique que le modèle :
Ce dernier point présente un compromis.
Le guide développeur de Google précise que Gemini 3.6 Flash peut exécuter des scripts de diagnostic avant de modifier, ce qui peut améliorer la précision pour les tâches complexes. Mais pour des tâches front-end simples, ces étapes d'exploration supplémentaires peuvent augmenter la latence sans toujours améliorer le résultat.
Google a également indiqué que les évaluateurs humains préfèrent parfois la mise en page et le style visuels des modèles antérieurs, même si Gemini 3.6 Flash génère un code plus pratique. Par conséquent, les développeurs qui construisent des interfaces devront peut-être fournir des contraintes de conception visuelle plus claires.
Sur le banc MLE-Bench, Google rapporte une amélioration de 49,7 % à 63,9 %.
Cette évaluation se concentre sur les tâches pratiques d'ingénierie et de recherche en apprentissage automatique, plutôt que sur des problèmes de codage isolés. Cette amélioration suggère que le modèle est plus performant dans les flux de travail qui nécessitent des expériences, du traitement de données, de la mise en œuvre et des améliorations itératives.
Sur OSWorld-Verified, selon la comparaison publiée par Google, Gemini 3.6 Flash passe de 78,4 % à 83,0 %.
Les capacités informatiques sont désormais disponibles en tant qu'outil client intégré via l'API Gemini et Gemini Enterprise. Il permet aux systèmes d'agents d'interagir avec les interfaces graphiques, et pas seulement de s'appuyer sur des API directes.
Les résultats des tests de référence pour les capacités informatiques restent influencés par le cadre de l'agent, l'environnement de l'écran, la conception des tâches et la stratégie de récupération après panne. Des scores plus élevés sont bénéfiques, mais les systèmes de production doivent toujours définir des autorisations strictes et des étapes de confirmation pour les opérations importantes.
Sur GDPval-AA v2, Gemini 3.6 Flash passe de 1349 à 1421.
Google a mis en avant les scénarios d'application suivants :
Des clients, notamment Figma, Harvey, Hebbia et JetBrains, ont fourni des commentaires positifs pour la déclaration de lancement de Google. Ces recommandations reflètent l'expérience client et ne doivent pas être considérées comme des références indépendantes.
Gemini 3.6 Flash prend en charge une fenêtre de contexte allant jusqu'à 1 million de tokens et une sortie maximale de 64 000 tokens.
Sa fiche technique indique une date limite de connaissances de mars 2026, ce qui constitue une amélioration par rapport aux premières versions de Gemini (dont la date limite était nettement plus ancienne).
Une date limite de connaissances plus récente réduit la quantité d'informations contextuelles récentes de base que les développeurs doivent fournir manuellement. Cependant, cela ne permet pas au modèle de traiter de manière fiable les actualités en temps réel, les prix en direct, les lois changeantes, les versions de logiciels ou d'autres informations temporelles.
Les applications qui traitent des informations fraîches doivent toujours utiliser la récupération, la recherche, des bases de données vérifiées ou des appels d'outils.
Une grande fenêtre de contexte ne garantit pas non plus que le modèle puisse utiliser aussi efficacement chaque partie d'un long document. Les développeurs doivent tester :
Google indique que Gemini 3.6 Flash comprend des mesures de sécurité de pointe plus fortes contre :
Le rapport de la fiche technique indique une amélioration des résultats de sécurité multilingue et de contenu automatiques par rapport à Gemini 3.5 Flash, tout en maintenant un taux de refus injustifié relativement faible.
Google souligne également
plusieurs limites :
L'évaluation de sécurité de pointe de Google conclut que Gemini 3.6 Flash reste en dessous des niveaux de capacité critique fixés par l'entreprise, y compris le seuil de cybersécurité.
Cette conclusion est basée sur le cadre d'évaluation de Google et doit être interprétée conjointement avec les résultats des tests de sécurité indépendants ultérieurs disponibles.
Gemini 3.5 Flash-Lite est conçu pour les tâches où la vitesse, le débit et le coût sont prioritaires par rapport à la profondeur de raisonnement la plus élevée.
Les cas d'utilisation typiques incluent :
Google le décrit comme le modèle le plus rapide et le moins cher de la série Gemini 3.5.
| Type de jeton | Prix par million de jetons |
|---|---|
| Entrée | 0,30 $ |
| Sortie | 2,50 $ |
Son niveau de réflexion par défaut est le plus bas, privilégiant le débit et la faible latence.
Pour les sous-tâches autonomes, l'exécution de code, les appels d'outils ou la planification en plusieurs étapes, Google suggère d'augmenter le niveau de réflexion à intermédiaire ou élevé si nécessaire. Des réglages plus élevés améliorent le taux d'achèvement des tâches, mais augmentent généralement l'utilisation des jetons et la latence.
Le communiqué de presse de Google cite des données d'Artificial Analysis issues de tests de pré-lancement, indiquant environ 350 jetons de sortie par seconde.
Artificial Analysis a ensuite enregistré des vitesses de fournisseur spécifiques qui peuvent varier dans le temps. Le débit dépend de :
La conclusion stable est que la vitesse de conception de Flash-Lite est nettement plus rapide que celle du modèle Flash plus grand.
Google rapporte les améliorations suivantes par rapport à Gemini 3.1 Flash-Lite :
| Test de référence | Gemini 3.1 Flash-Lite | Gemini 3.5 Flash-Lite |
|---|---|---|
| Terminal-Bench 2.1 | 31 % | 54 % |
| GDM-MRCR v2 | 60,1 % | 72,2 % |
| GDPval-AA v2 | 642 | 1140 |
Google rapporte également que Gemini 3.5 Flash-Lite surpasse Gemini 3 Flash dans plusieurs tests de référence d'agents et de codage :
Cela fait de Flash-Lite plus qu'un simple modèle économique de faible qualité. Pour certaines tâches d'agent à haut débit, il peut offrir un meilleur équilibre que l'ancien Gemini 3 Flash.
Artificial Analysis a attribué à Gemini 3.5 Flash-Lite un score de 36 dans son indice d'intelligence, contre 25 pour Gemini 3.1 Flash-Lite.
Cette amélioration de 11 points est l'une des plus significatives en matière d'intelligence de cette version.
Flash-Lite reste en dessous des modèles de pointe les plus puissants, mais son objectif n'est pas de les concurrencer sur toutes les tâches de raisonnement complexes. Son rôle est de traiter de grands volumes de travail rapidement et à moindre coût.
La troisième version publiée, Gemini 3.5 Flash
Cyber, a un objectif différent.
Il s'agit d'un modèle spécialisé basé sur Gemini 3.5 Flash, affiné pour :
Ce modèle fonctionne de concert avec CodeMender, l'agent de sécurité du code de Google DeepMind.
Dans CodeMender, plusieurs agents Flash Cyber peuvent rechercher différentes parties de la base de code et consolider leurs découvertes dans un rapport.
Google estime que l'utilisation de modèles plus petits et moins coûteux est précieuse dans le domaine de la cybersécurité, car la recherche de vulnérabilités implique souvent d'explorer un grand nombre de chemins d'exécution possibles. L'appel répété à de grands modèles coûteux peut devenir un goulot d'étranglement.
Google indique que, lorsqu'il est utilisé via le système CodeMender, Gemini 3.5 Flash Cyber atteint des performances de pointe compétitives sur CyberGym.
Ce résultat dépend de l'infrastructure complète de l'agent, et pas seulement du modèle sous-jacent. L'orchestration, les outils, la validation et l'agrégation des rapports contribuent tous au score final.
Gemini 3.5 Flash Cyber ne sera pas disponible via le public
Decrivez votre idee une fois, et We0 AI peut generer un site vitrine, des pages et un CMS, puis vous aider a attirer clients et trafic apres le lancement.
Une génération de projet complète pour une inscription gratuite
Idéal pour essayer un flux de génération complet et voir rapidement une première ébauche de projet.
L'API Gemini est largement disponible.
Google prévoit de proposer le modèle via un programme pilote limité appelé CodeMender aux entités suivantes :
Cette diffusion limitée reflète la nature à double usage du modèle. Un système capable de trouver et de vérifier des vulnérabilités peut aider les défenseurs à corriger des logiciels, mais des capacités similaires pourraient également soutenir des activités offensives.

Google indique que Gemini 3.5 Pro est en cours de test avec des partenaires et sera déployé plus largement lorsqu'il sera prêt.
L'article source d'AIBase relie ce retard à des reportages externes et à des rumeurs en ligne concernant les performances de codage et un éventuel réentraînement.
Google n'a pas officiellement confirmé les affirmations concernant l'abandon du plan d'entraînement original du modèle ou un redémarrage du système à zéro.
Les informations vérifiées sont assez limitées :
L'absence de la version Pro phare rend la sortie de Flash stratégiquement plus importante. En l'absence d'un modèle haut de gamme disponible, Gemini 3.6 Flash et Flash-Lite doivent couvrir une plus grande partie des besoins de production.
Cela ne signifie pas nécessairement que Google a abandonné Gemini 3.5 Pro, ou que Gemini 4 est imminent.
Les calendriers de développement des modèles peuvent changer, et le pré-entraînement n'est qu'une étape. Le post-entraînement, les tests de sécurité, l'intégration d'outils, l'optimisation de la latence et la préparation au déploiement peuvent encore nécessiter beaucoup de temps supplémentaire.
Les conclusions de l'analyse manuelle sont plus mesurées que les annonces de produits Google.
Gemini 3.6 Flash obtient un score de 50 points dans l'indice d'intelligence de l'analyse manuelle.
Gemini 3.5 Flash obtient également un score de 50 points.
Par conséquent, bien que l'évaluation montre des améliorations dans certaines catégories, le score d'intelligence global du nouveau modèle dans ce test n'a pas augmenté.
Le rapport d'analyse manuelle indique :
Il s'agit d'une mise à niveau d'efficacité crédible, mais pas d'un saut d'intelligence généralisé.
L'analyse manuelle mesure :
Le modèle a réduit de plus de moitié le temps nécessaire pour terminer la charge de travail d'évaluation.
Estimation de l'analyse manuelle :
Pour les agents à grande échelle, cette réduction des coûts est significative, surtout lorsque le système exécute des milliers de tâches.
L'analyse manuelle combine plusieurs évaluations en un seul indice. Le score composite peut être utilisé pour une comparaison approximative, mais peut masquer des différences importantes entre les différentes charges de travail.
Des modèles avec le même score total peuvent être meilleurs dans certains domaines, par exemple :
Mais peuvent être plus faibles dans d'autres :
Choisir le bon modèle dépend du cas d'utilisation spécifique.
L'article original a recueilli plusieurs réactions critiques sur les réseaux sociaux.
Les problèmes signalés par les utilisateurs incluent :
Ces retours sont importants car les benchmarks ne peuvent pas couvrir tous les aspects de la qualité du produit.
Un modèle peut exceller dans les tâches de base de code, mais produire des mises en page de moindre qualité ; utiliser moins de tokens mais devenir trop concis ; être plus précis sur un benchmark de programmation, mais perdre en fiabilité dans une langue spécifique.
Parallèlement, les tests sur les réseaux sociaux présentent des limites sérieuses :
Par conséquent, les premiers retours d'utilisateurs doivent être considérés comme des signaux pour des tests ciblés, et non comme une conclusion définitive.
Les équipes qui envisagent d'adopter Gemini 3.6 Flash ne devraient pas le faire uniquement parce que Google
rapporte des benchmarks plus élevés, ni le rejeter simplement parce que quelques démos en ligne sont décevantes.
Un test de migration utile devrait comparer l'ancien et le nouveau modèle sur la même application.
Construire un ensemble d'évaluation à partir du travail réel :
Suivre :
Gemini 3.6 Flash utilise par défaut un niveau de réflexion moyen.
Gemini 3.5 Flash-Lite utilise par défaut le niveau de réflexion le plus bas.
Un modèle peut sembler sous-performant simplement parce que le paramètre de raisonnement est trop bas pour la tâche en cours. Inversement, utiliser un niveau de réflexion élevé pour une simple tâche d'extraction d'informations peut gaspiller du temps et de l'argent.
Les benchmarks de codage ne mesurent pas si un site web est esthétique ou si le choix des mots en chinois est naturel.
Utiliser une révision manuelle dédiée pour évaluer :
Les résultats d'un agent ne dépendent pas uniquement du modèle.
Comparer :
La migration du modèle peut nécessiter d'ajuster en conséquence l'ensemble de l'environnement du système.
L'application doit traiter un grand volume de documents.
Il est plus facile de considérer Gemini 3.6 Flash comme une amélioration de l'expérience opérationnelle plutôt que comme une percée spectaculaire en matière d'intelligence.
Il est conçu pour réduire les gaspillages qui rendent les agents coûteux :
Ces améliorations peuvent avoir plus de valeur en production que de légers progrès sur des benchmarks de raisonnement abstrait.
Cependant, l'efficacité ne remplace pas la qualité dans toutes les applications.
Un modèle capable d'effectuer des tâches à moindre coût est inutile si les résultats nécessitent d'importantes corrections manuelles. Un modèle performant en programmation peut encore décevoir en conception. Un modèle compétent en anglais peut nécessiter une validation supplémentaire en chinois ou dans d'autres langues.
La nouvelle série Flash de Google crée des options plus spécialisées :
Ainsi, cette sortie consiste moins à remplacer un modèle par un autre qu'à attribuer le bon niveau d'intelligence et le bon coût à chaque partie d'un système d'agents.
Gemini 3.6 Flash est le modèle polyvalent principal de Google pour la programmation, les tâches multimodales, le travail cognitif et les workflows d'agents. Il est basé sur Gemini 3.5 Flash mais vise à utiliser moins de jetons, moins de tours d'interaction et moins d'appels d'outils.
Google rapporte des améliorations sur plusieurs benchmarks de programmation, d'utilisation informatique, d'apprentissage automatique et de travail cognitif. Artificial Analysis attribue aux deux modèles le même score global d'indice d'intelligence de 50, donc l'amélioration la plus évidente semble être l'efficacité et la vitesse d'exécution des tâches, plutôt qu'une augmentation de l'intelligence globale.
Google a fixé le prix du modèle à 1,50 dollar par million de jetons d'entrée et 7,50 dollars par million de jetons de sortie. Les prix sont susceptibles de changer, et le coût total d'un agent dépend également du raisonnement, de la taille du contexte, des appels d'outils, des tentatives et de la longueur de la sortie.
Flash-Lite est adapté aux charges de travail à haut débit et sensibles à la latence, telles que l'extraction, la classification, la recherche, la traduction, le routage, le traitement de données structurées et l'exécution de sous-agents. Il est moins cher et plus rapide que Gemini 3.6 Flash, mais n'est pas conçu pour remplacer les modèles plus puissants dans toutes les tâches difficiles.
Oui. Sa fiche technique indique qu'il prend en charge les entrées de texte, d'images, d'audio et de vidéo, avec une sortie en texte. La fenêtre de contexte du modèle atteint jusqu'à 1 million de jetons.
Il s'agit d'une version professionnelle de Gemini 3.5 Flash, spécialement entraînée pour la détection, la validation et la correction de vulnérabilités. Google prévoit de proposer ce modèle aux gouvernements et aux partenaires de défense de confiance via un programme pilote restreint appelé CodeMender.
Google n'a pas indiqué qu'il était annulé. La société a déclaré que Gemini 3.5 Pro était testé avec des partenaires et serait largement disponible lorsqu'il serait prêt.
Pas nécessairement immédiatement. Avant de basculer, exécutez les deux modèles sur des tâches de production représentatives et comparez les taux de succès, le temps de correction manuelle, la fiabilité des outils, la latence, l'utilisation des jetons et le coût total.
La dernière version Flash de Google comprend trois produits distincts. Gemini 3.6 Flash est destiné aux agents complexes et aux scénarios de codage, Gemini 3.5 Flash-Lite est axé sur l'exécution à haut débit, et
Gemini 3.5 Flash Cyber se concentre sur la recherche défensive en matière de vulnérabilités, avec un accès restreint.
Gemini 3.6 Flash améliore plusieurs tests de référence au niveau des tâches, réduit l'utilisation des tokens de sortie, accélère l'exécution des tâches agentiques et diminue le prix de la sortie. Cependant, des tests indépendants montrent que son score d'intelligence globale n'a pas augmenté par rapport à Gemini 3.5 Flash.
Par conséquent, la réaction complexe du marché est compréhensible. Cette version est avant tout une démonstration convaincante en matière d'efficacité, plutôt qu'un bond en avant en termes de capacités générales.
La meilleure façon de qualifier Gemini 3.6 Flash est de dire qu'il s'agit d'un modèle de production plus rapide et plus léger — sans pour autant prouver que toutes les formes d'intelligence ou la qualité des sorties aient progressé de manière uniforme.
Partez d’une phrase et obtenez un site complet en quelques minutes.