For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/fr/articles/nano-banana-2-1-vs-gpt-image-2-5-editing-215e3bff.md.
Google a lancé **Nano Banana 2.1**, son dernier modèle haute efficacité de génération d’images et d’édition conversationnelle.

Google a lancé Nano Banana 2.1, son dernier modèle haute efficacité de génération d’images et d’édition conversationnelle.
Le modèle est présenté comme une mise à jour de Nano Banana 2, officiellement connu sous le nom de Gemini 3.1 Flash Image, mais il repose sur la nouvelle architecture Gemini 3.6 Flash.
L’annonce principale ne se résume pas à une « meilleure génération d’images ».
Nano Banana 2.1 se concentre fortement sur les aspects des flux de travail d’image qui deviennent problématiques après la première génération :
Au lancement, l’article source résumait la mise à jour en six points :
Cette vue d’ensemble reste exacte, mais certains détails de tarification et de retrait ont évolué dans la documentation en ligne de Google et sont corrigés ci-dessous.
Nano Banana 2.1 appartient à la famille Gemini 3 et repose sur Gemini 3.6 Flash.

Cela compte, car le modèle vise à préserver le profil de vitesse et de coût généralement associé aux systèmes de classe Flash, tout en améliorant nettement la qualité d’image et la précision de l’édition.
La fiche officielle de Google compare Nano Banana 2.1 à Gemini 3.1 Flash Image (Nano Banana 2) ainsi qu’à Gemini 3 Pro Image (Nano Banana Pro).
Pour la génération d’images à partir de texte, Google rapporte les résultats suivants :
| Capacité | Nano Banana 2.1 Thinking | Nano Banana 2.1 sans Thinking | Nano Banana 2 | Nano Banana Pro |
|---|---|---|---|---|
| Préférence globale | 1050 ± 14 | 1015 ± 13 | 990 ± 7 | 935 ± 8 |
| Conception d’infographies | 1048 ± 17 | 1001 ± 17 | 961 ± 12 | 912 ± 12 |
| Exactitude factuelle des infographies | 0.521 | 0.328 | 0.179 | 0.265 |

Dans l’évaluation de Google, le modèle Flash 2.1 ne se contente pas de réduire l’écart avec Nano Banana Pro. Il dépasse le modèle Pro sur les mesures publiées de préférence globale, de conception d’infographies et d’exactitude factuelle des infographies.
C’est la base de la formulation de l’article source selon laquelle « Flash dépasse Pro ».
Il reste toutefois important de lire ces chiffres avec prudence.
Il s’agit des résultats des évaluations de Google, et non d’une garantie universelle que 2.1 sera supérieur à Pro pour chaque invite. La fiche officielle du modèle répertorie également plusieurs faiblesses persistantes, notamment :
La mise à jour est donc importante, mais elle ne signifie pas que la génération d’images est « résolue ».
La source cite également les votes de la communauté Arena.
Dans l’instantané utilisé par l’article, Nano Banana 2.1 se classait :

La même source indique que Nano Banana 2 occupait auparavant les 7e, 11e et 14e places dans les catégories correspondantes.
Il s’agit d’une progression notable, en particulier pour l’édition.
Cependant, Arena est un classement communautaire dynamique. Les nouveaux modèles, les votes supplémentaires, les variantes non visibles et les changements d’évaluation peuvent faire évoluer rapidement les positions. Ces rangs doivent donc être considérés comme un instantané du lancement et non comme un tableau de scores permanent.
L’une des améliorations pratiques les plus importantes est l’édition fondée sur un masque.
Toute personne ayant utilisé Photoshop comprend immédiatement le principe : sélectionner une région, la modifier et conserver inchangé tout ce qui se trouve à l’extérieur.
Cela paraît simple, mais les modèles de génération d’images ont historiquement eu du mal à gérer cette opération.
Supposons que vous demandiez à un modèle d’image :
« Change la tasse située dans le coin inférieur gauche en rouge. »
Un modèle dépourvu d’édition localisée précise doit déterminer quelle tasse vous désignez, puis régénérer une grande partie de l’image. Même lorsque la tasse demandée est correctement modifiée, d’autres détails peuvent varier :
Nano Banana 2.1 est conçu pour réduire ce problème.
L’évaluation officielle de Google consacrée à l’édition rapporte un score de 1049 ± 15 pour l’édition fondée sur un masque ou une encre en mode Thinking, contre 965 ± 12 pour Nano Banana 2 et 927 ± 12 pour Nano Banana Pro.
| Benchmark d’édition | Nano Banana 2.1 Thinking | 2.1 sans Thinking | Nano Banana 2 | Nano Banana Pro |
|---|---|---|---|---|
| Édition générale | 1026 | 980 | 938 | 939 |
| Cohérence d’un personnage unique | 1028 | 1021 | 981 | 991 |
| Cohérence de plusieurs personnages | 1106 | 1068 | 978 | 1011 |
| Édition fondée sur un masque ou une encre | 1049 | 1042 | 965 | 927 |
| Cohérence des produits | 1024 | 981 | 955 | 965 |
| Stylisation | 1062 | 1036 | 991 | 990 |
| Édition avec plusieurs références | 1066 | 1041 | 988 | 989 |

L’élément important n’est pas seulement le meilleur score.
Même lorsque Thinking est désactivé, le modèle reste devant les anciens modèles de comparaison dans toutes les catégories d’édition indiquées.
Cela rend 2.1 plus pratique pour les flux de travail dans lesquels chaque étape supplémentaire de raisonnement augmente la latence ou le coût.
La source met en avant un test réalisé par ibexdream.
La première invite a généré une illustration ornée, dans le style d’un billet de banque, représentant un ancien philosophe dont les cheveux se transformaient en labyrinthe.
La deuxième invite a modifié le résultat existant :
L’observation essentielle était que le labyrinthe, la robe, la barbe et la composition générale restaient beaucoup plus stables que ce que les utilisateurs attendent souvent d’une édition générative.

Une troisième invite a ensuite transformé la scène en peinture à l’huile tout en préservant la composition principale.

C’est exactement le type de flux de travail dans lequel la qualité de l’édition compte davantage qu’une première image spectaculaire.
Une création commerciale s’arrête rarement après la première génération.
Elle passe généralement par révision après révision.
Le deuxième grand thème est la cohérence.
Pour le commerce électronique, la publicité, les bandes dessinées en série, les campagnes sociales et la photographie de marque, la même personne ou le même produit doit souvent apparaître dans plusieurs scènes.
Le mode d’échec frustrant est bien connu :
même personne
→ pose différente
→ le visage dérive
→ nouvelle édition
→ les vêtements changent
→ nouvelle édition
→ les détails du produit évoluent
Nano Banana 2.1 est conçu pour maintenir plus régulièrement ces identités au fil des générations et des modifications successives.
La documentation API de Google indique que les modèles Nano Banana peuvent mélanger jusqu’à 14 images de référence dans un même flux de travail. Pour Nano Banana 2.1, la documentation du modèle décrit une prise en charge haute fidélité de plusieurs références d’objets et de personnages, avec une composition recommandée qui varie selon le cas d’usage.
L’article source résume la configuration pratique comme pouvant inclure jusqu’à 10 références d’objets ainsi que plusieurs références de personnages dans la limite globale d’images de référence.
L’article cite un test réalisé par BG-VC.
Le testeur a fourni :
Le modèle a ensuite produit six scènes différentes dans un même flux de travail.

Dans les poses en marche, assise et penchée, le testeur a rapporté que le visage, les vêtements, le sac et les accessoires restaient exceptionnellement cohérents.
Il s’agit d’un test bien plus pertinent commercialement qu’un portrait unique.
La génération d’images de produits n’a de valeur que si le produit ressemble toujours au produit d’origine après un changement de pose, de lieu, d’angle de caméra ou de style.
La source signale également des images d’exemple de Google qui semblent moins manifestement synthétiques.
Parmi les exemples figurent un scarabée couvert de gouttelettes d’eau et une femme en robe verte dans l’escalier d’un bâtiment rose.

Le changement ne se résume pas à « davantage de détails ».
Un réalisme plus convaincant dépend de la combinaison de plusieurs facteurs :
La page officielle du modèle de Google décrit la mise à jour comme une amélioration de la qualité visuelle et du réalisme sur des sorties en 1K, 2K et 4K.
Le modèle prend également en charge des rapports d’aspect particulièrement larges dans les hautes résolutions, avec des corrections des artefacts de mosaïque susceptibles d’affecter les images panoramiques.
Nano Banana 2.1 peut utiliser la recherche Google sur le Web et la recherche d’images comme sources d’ancrage dans les flux de travail API pris en charge.
Cela est particulièrement pertinent pour les infographies.
Un modèle d’image classique peut créer un graphique visuellement attrayant tout en inventant des chiffres, des libellés ou des relations factuelles.
L’ancrage dans la recherche donne au flux de génération la possibilité de récupérer des informations réelles avant de composer l’image.
La fiche officielle du modèle de Google rapporte une exactitude factuelle des infographies de :

L’amélioration est importante, mais 0.521 n’est pas égal à 1.0.
La conclusion correcte n’est donc pas :
« Le modèle produit désormais automatiquement des infographies factuelles. »
Elle est plutôt :
« L’ancrage dans la recherche et le nouveau modèle réduisent nettement les erreurs factuelles dans l’évaluation de Google, mais les infographies générées doivent encore être vérifiées. »
Cette distinction est importante pour l’éducation, le journalisme, la médecine, la finance et tout autre domaine dans lequel une étiquette erronée peut être plus dommageable qu’une mise en page peu esthétique.
C’est ici que la sortie devient particulièrement intéressante.
Google a fortement réduit le tarif de la sortie d’image, mais a augmenté le prix des entrées texte/image ainsi que des sorties texte/raisonnement par rapport à l’ancienne tarification de Nano Banana 2 citée dans la source.
La tarification API Standard officielle actuelle de Nano Banana 2.1 est la suivante :
| Élément facturé | Tarif officiel actuel |
|---|---|
| Entrée texte / image / vidéo | 1,50 $ par million de tokens |
| Sortie texte et raisonnement | 7,50 $ par million de tokens |
| Sortie d’image | 30,00 $ par million de tokens de sortie d’image |
| Image 1K | environ 0,0336 $ |
| Image 2K | environ 0,0504 $ |
| Image 4K | environ 0,113 $ |

L’article source décrit cette évolution comme un déplacement du coût du « dessin » vers le « raisonnement ».
Il s’agit d’un raccourci utile.
Si votre charge de travail est principalement composée de générations simples, la baisse du coût de sortie des images peut avoir un impact important.
Si votre flux de travail utilise :
le coût final dépend de bien plus que du tarif affiché par image.
La source originale indique qu’une sortie 4K coûte environ 0,076 $ par image.
La page tarifaire actuelle de Google indique plutôt 0,113 $ par image 4K.
Les montants pour les images 1K et 2K restent respectivement d’environ 0,0336 $ et 0,0504 $.
Pour établir un budget de production, utilisez la page tarifaire officielle en ligne plutôt que des captures d’écran du lancement ou des calculs de tiers.
Decrivez votre idee une fois, et We0 AI peut generer un site vitrine, des pages et un CMS, puis vous aider a attirer clients et trafic apres le lancement.
Une génération de projet complète pour une inscription gratuite
Idéal pour essayer un flux de génération complet et voir rapidement une première ébauche de projet.
La fiche du modèle de Google répertorie Nano Banana 2.1 sur les canaux suivants :
Pour les développeurs, l’identifiant du modèle API est :
gemini-nano-banana-2.1
Le modèle prend en charge la génération d’images et l’édition conversationnelle, notamment les flux de travail utilisant plusieurs images de référence.
La documentation actuelle de Google répertorie également plusieurs niveaux de Thinking configurables :
minimalmedium — valeur par défauthighLa source indique que l’ancienne API Nano Banana 2 serait arrêtée le 29 octobre.
Le tableau de retrait actuel de Google n’indique pas cette date d’arrêt pour gemini-3.1-flash-image.
Il mentionne actuellement :
Remplacement recommandé : gemini-nano-banana-2.1
Date d’arrêt : aucune date d’arrêt annoncée
Cela ne signifie pas que l’ancien modèle restera disponible indéfiniment.
Cela signifie que les développeurs ne doivent pas construire leur plan de migration autour de la date du 29 octobre, sauf si Google l’ajoute à la documentation officielle de retrait.
L’article source passe ensuite des benchmarks officiels aux tests communautaires.
Cette distinction est importante.
Les benchmarks officiels indiquent comment Google a mesuré le modèle dans des conditions d’évaluation définies.
Les tests communautaires montrent comment le modèle se comporte dans des flux de travail créatifs réels.
Les deux approches sont utiles, mais elles répondent à des questions différentes.
Mark Kretschmann aurait soumis au modèle une scène volontairement difficile contenant :
L’objectif était de vérifier si le résultat ressemblait toujours à une photographie cohérente plutôt qu’à un collage de fragments localement plausibles.
Ce type de test est utile, car les modèles d’image échouent souvent lorsque plusieurs contraintes difficiles apparaissent simultanément.
Luis Catacora a testé un tableau de menu de salon de thé dans lequel le même élément devait être rendu en anglais, en japonais, en arabe et en hindi.
La source indique que le modèle a correctement traité presque tout le texte en une seule génération.

La fiche officielle du modèle de Google rapporte également une amélioration du rendu du texte international. L’observation de la communauté est donc cohérente avec l’objectif annoncé pour cette version.
Le texte intégré dans les images doit toutefois être relu.
La source présente ensuite une affiche contenant du texte asiatique dont les grands caractères sont nets, mais où une petite ligne verticale en anglais se dégrade en texte illisible.
Cela rappelle utilement que « beaucoup mieux » ne signifie pas « logiciel de composition typographique ».
La sortie a immédiatement suscité des comparaisons avec la gamme actuelle de modèles d’image d’OpenAI.
OpenAI a lancé ChatGPT Images 2.5 en septembre 2026 et propose deux variantes API :
gpt-image-2.5-flare pour une génération quotidienne rapide et de haute qualité.gpt-image-2.5-sunburst pour un travail créatif détaillé et plus précis.OpenAI affirme que Images 2.5 améliore les détails, la précision de l’édition, la préservation des sujets, l’édition en plusieurs tours et la vitesse de génération.
Google et OpenAI se livrent donc une concurrence croissante autour du même problème :
Le modèle peut-il supporter des modifications répétées sans détruire tout ce qui était déjà correct ?
Un testeur a soumis à Nano Banana 2.1 et GPT Image 2.5 une invite empilant volontairement plusieurs détails fragiles :
Dans le résultat côte à côte présenté par la source, Nano Banana 2.1 a placé la plupart des détails demandés aux bons endroits, même si la teinte des lunettes n’a pas été respectée et que le teint de la peau a changé.

Ce type de comparaison doit précisément être considéré comme qualitatif.
Une seule image peut révéler des modes d’échec, mais elle ne permet pas d’établir une supériorité globale.
Un autre testeur a demandé à Nano Banana 2.1 et à GPT Image 2 de créer la même scène représentant une montre posée sur un bureau.
La source décrit le résultat de Google comme davantage comparable à une photographie ordinaire prise à la lumière naturelle, tandis que la version d’OpenAI ressemblait davantage à une publicité soignée, avec un éclairage dramatique et un cadran plus stylisé.

Il ne s’agit pas nécessairement d’un résultat « meilleur contre moins bon ».
Cette comparaison illustre une différence courante entre les modèles d’image :
Le choix préférable dépend du flux de travail.
Pour la photographie de catalogue en commerce électronique, la fidélité littérale peut être prioritaire.
Pour l’art marketing, davantage de stylisation peut être utile.
La source cite un test communautaire d’IA et de machine learning mené sur cinq invites.
Dans ce test, les moyennes rapportées étaient approximativement les suivantes :
| Modèle | Temps rapporté par image | Coût rapporté par image |
|---|---|---|
| Nano Banana 2.1 | environ 11 secondes | environ 0,044 $ |
| GPT Images 2.5 | environ 50 secondes | environ 0,069 $ |
La même source cite également un test de quatre images sur le thème de l’espace dans lequel Nano Banana 2.1 aurait coûté 0,178 $ au total, contre 0,284 $ pour GPT Image 2.5.
Il s’agit de mesures effectuées par une plateforme tierce, et non de tableaux tarifaires officiels des fournisseurs.
Plusieurs variables peuvent modifier le résultat :
Pour planifier une mise en production, comparez la configuration API exacte que vous prévoyez de déployer plutôt que de supposer qu’un seul test communautaire se généralise à toutes les charges de travail.
La source met également en avant des tests réalisés par un créateur sinophone.
L’impression générale était positive :
Un exemple présenté dans la source paraît soigné au premier regard.

Mais un agrandissement révèle qu’une petite ligne verticale en anglais s’est transformée en charabia.
Il s’agit d’une limite pratique importante.
Si l’image est destinée à une véritable publicité, un menu, une étiquette, un emballage ou une affiche publique, le texte final doit encore être vérifié manuellement ou remplacé dans un outil de conception.
Les modèles d’image progressent dans le domaine de la typographie, mais ils ne remplacent pas une relecture finale.
La source conclut par une observation plus générale : la concurrence entre les modèles d’image se déplace de la question « qui peut créer la première image la plus impressionnante ? » vers la question « qui peut continuer à modifier la même image sans la détériorer ? »
Ce changement est facile à comprendre.
Le travail créatif commercial suit rarement ce schéma :
brief
→ une image
→ terminé
Il ressemble généralement davantage à ceci :
brief
→ version 1
→ déplacer le produit vers la gauche
→ changer la chemise
→ conserver exactement le même visage
→ remplacer l’enseigne
→ mettre à jour le texte
→ supprimer la personne en arrière-plan
→ changer le style
→ validation finale
Si la dixième version ne ressemble plus à la première, le système est peu utile pour l’itération professionnelle.
L’annonce d’Images 2.5 par OpenAI met en avant une édition plus précise, une meilleure préservation des sujets, l’ajout de commentaires sur les images et les flux de travail créatifs en plusieurs tours.
La sortie de Nano Banana 2.1 par Google met en avant l’édition fondée sur un masque, la cohérence des sujets, l’édition avec plusieurs références et l’itération conversationnelle.
Les deux orientations produits convergent clairement.
La logique commerciale est simple.
La publicité, le commerce électronique, la conception de marque et les contenus sociaux nécessitent des révisions incessantes.
Un modèle capable de préserver :
tout en ne modifiant que la région demandée est bien plus utile qu’un modèle qui crée une belle image, mais instable.
Cela explique en partie pourquoi Google distribue Nano Banana 2.1 non seulement au moyen d’API destinées aux développeurs, mais aussi dans des produits comme Google Ads et Stitch.
La sortie concerne donc moins la victoire dans un concours esthétique ponctuel de génération d’images que l’intégration de l’imagerie générative dans les flux de travail itératifs réels.
Nano Banana 2.1 est le dernier modèle haute efficacité de Google pour la génération d’images et l’édition conversationnelle au sein de la famille Gemini 3. Son identifiant de modèle API est gemini-nano-banana-2.1, et Google indique qu’il repose sur Gemini 3.6 Flash.
Oui. La documentation officielle de Google indique une prise en charge des sorties 1K, 2K et 4K. La page tarifaire actuelle de l’API indique qu’une image 4K coûte environ 0,113 $ dans le cadre de la tarification Standard payante.
La documentation de Google consacrée à la génération d’images indique que les flux de travail Nano Banana peuvent mélanger jusqu’à 14 images de référence. Pour la version 2.1, les limites pratiques dépendent de la façon dont ces références sont utilisées pour les personnages, les objets et la fusion de plusieurs images. Les développeurs doivent donc suivre le guide API actuel plutôt que supposer que les 14 références se comportent de manière identique.
Oui. L’édition fondée sur un masque ou une encre constitue une catégorie d’évaluation explicite dans la fiche du modèle de Google, et la version 2.1 obtient des scores nettement supérieurs à ceux de Nano Banana 2 et de Nano Banana Pro dans l’évaluation d’édition publiée par Google.
Oui. Les flux de génération d’images pris en charge par l’API Gemini peuvent utiliser la recherche Google sur le Web et les images comme sources d’ancrage. Cette fonction est particulièrement utile pour la génération d’infographies et pour les tâches nécessitant des informations actuelles ou factuelles.
La sortie d’image est proposée à un tarif particulièrement bas de 30 $ par million de tokens de sortie d’image, et une génération 1K coûte environ 0,0336 $ dans le cadre de la tarification Standard actuelle. Toutefois, les entrées texte/image et les sorties texte/raisonnement sont également facturées. Le coût total du flux de travail dépend donc de la taille de l’invite, des références, du raisonnement, de l’ancrage et du nombre d’itérations.
La page officielle actuelle de Google consacrée aux retraits n’indique pas d’arrêt au 29 octobre pour gemini-3.1-flash-image. Elle précise actuellement qu’aucune date d’arrêt n’a été annoncée et recommande gemini-nano-banana-2.1 comme remplacement.
Il n’existe pas de réponse unique valable pour tous les flux de travail. L’article source présente plusieurs tests communautaires dans lesquels Nano Banana 2.1 s’est montré performant en matière de vitesse, de réalisme, d’édition et de coût, tandis que la gamme officielle Images 2.5 d’OpenAI met également l’accent sur l’édition précise, la préservation des sujets et la génération haute fidélité. L’approche la plus sûre consiste à évaluer les deux modèles avec vos propres invites, images de référence, résolutions et flux de révision.
Nano Banana 2.1 ne consiste pas tant à créer une catégorie entièrement nouvelle d’images générées par IA qu’à corriger les faiblesses qui rendent les images génératives difficiles à utiliser en production : édition locale, dérive des sujets, incohérence des produits, rendu du texte, infographies factuelles et révisions répétées.
Les évaluations officielles de Google montrent des progrès importants par rapport à Nano Banana 2 et Nano Banana Pro dans plusieurs catégories de génération et d’édition. Le modèle associe également un déploiement de niveau Flash à la prise en charge de jusqu’à 14 images de référence, à l’ancrage dans la recherche et aux sorties 1K, 2K et 4K, ce qui en fait un outil créatif bien plus pratique qu’un générateur à usage unique.
La tarification officielle actuelle rend également la sortie d’image peu coûteuse, mais le coût total dépend encore des entrées, du raisonnement, de l’ancrage et de la résolution. Les développeurs doivent consulter les pages tarifaires et de retrait en ligne de Google plutôt que des captures d’écran du lancement : le tarif actuel d’une image 4K est d’environ 0,113 $, et Google n’indique actuellement aucun arrêt de Nano Banana 2 au 29 octobre.
La véritable concurrence entre Nano Banana 2.1 et GPT Image 2.5 ne porte plus seulement sur le modèle capable de produire la plus belle première image : elle concerne celui qui peut survivre à la dixième modification sans perdre le sujet, le produit, le texte ou la composition qui étaient déjà corrects.
Partez d’une phrase et obtenez un site complet en quelques minutes.