For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/pt/articles/nano-banana-2-1-vs-gpt-image-2-5-editing-215e3bff.md.
O Google lançou o **Nano Banana 2.1**, seu mais recente modelo de geração de imagens de alta eficiência e edição conversacional.

O Google lançou o Nano Banana 2.1, seu mais recente modelo de geração de imagens de alta eficiência e edição conversacional.
O modelo é apresentado como uma atualização do Nano Banana 2, oficialmente conhecido como Gemini 3.1 Flash Image, mas foi desenvolvido sobre a nova base Gemini 3.6 Flash.
A principal novidade não é simplesmente uma “geração de imagens melhor”.
O Nano Banana 2.1 concentra-se especialmente nas partes dos fluxos de trabalho de imagem que se tornam problemáticas depois da primeira geração:
No lançamento, o artigo de origem resumiu a atualização em seis pontos:
Esse panorama geral continua correto, mas alguns detalhes de preços e depreciação mudaram na documentação ativa do Google e são corrigidos abaixo.
O Nano Banana 2.1 pertence à família Gemini 3 e é baseado no Gemini 3.6 Flash.

Isso é importante porque o modelo pretende preservar o perfil de velocidade e custo associado aos sistemas da classe Flash, enquanto avança significativamente em qualidade de imagem e precisão de edição.
O cartão oficial do modelo do Google compara o Nano Banana 2.1 tanto com o Gemini 3.1 Flash Image (Nano Banana 2) quanto com o Gemini 3 Pro Image (Nano Banana Pro).
Para geração de texto para imagem, o Google informa:
| Capacidade | Nano Banana 2.1 Thinking | Nano Banana 2.1 No Thinking | Nano Banana 2 | Nano Banana Pro |
|---|---|---|---|---|
| Preferência geral | 1050 ± 14 | 1015 ± 13 | 990 ± 7 | 935 ± 8 |
| Design de infográficos | 1048 ± 17 | 1001 ± 17 | 961 ± 12 | 912 ± 12 |
| Factualidade de infográficos | 0.521 | 0.328 | 0.179 | 0.265 |

Na avaliação do próprio Google, o modelo 2.1 da classe Flash não apenas reduz a distância em relação ao Nano Banana Pro. Ele supera o modelo Pro nas medidas listadas de preferência geral, design de infográficos e factualidade de infográficos.
Essa é a base para a caracterização do artigo de origem de que “Flash supera Pro”.
Ainda assim, é importante interpretar os números com cuidado.
Esses são resultados das avaliações do Google, não uma garantia universal de que o 2.1 terá desempenho superior ao Pro em todos os prompts. O cartão oficial do modelo também lista limitações que permanecem, incluindo:
Portanto, a atualização é substancial, mas não afirma que a geração de imagens esteja “resolvida”.
A fonte também cita a votação da comunidade no Arena.
No recorte usado no artigo, o Nano Banana 2.1 ficou em:

A mesma fonte afirma que o Nano Banana 2 havia ficado anteriormente em 7º, 11º e 14º lugar nas categorias correspondentes.
É um avanço significativo, especialmente em edição.
Mas o Arena é um ranking comunitário dinâmico. Novos modelos, votos adicionais, variantes ocultas e mudanças na avaliação podem alterar rapidamente as posições. Por isso, essas classificações devem ser tratadas como um retrato do lançamento, e não como uma tabela permanente de desempenho.
Uma das melhorias práticas mais importantes é a edição baseada em máscaras.
Qualquer pessoa que tenha usado o Photoshop entende imediatamente a ideia: selecione uma região, edite essa região e mantenha inalterado tudo o que estiver fora dela.
Parece simples, mas os modelos de geração de imagens historicamente têm dificuldade com esse processo.
Suponha que você diga a um modelo de imagem:
“Mude para vermelho o copo no canto inferior esquerdo.”
Um modelo sem edição localizada precisa inferir a qual copo você se refere e, em seguida, regenerar grande parte da imagem inteira. Mesmo quando o copo solicitado é alterado corretamente, outros detalhes podem sofrer mudanças:
O Nano Banana 2.1 foi projetado para reduzir esse problema.
A avaliação oficial de edição do Google informa uma pontuação de 1049 ± 15 para edição baseada em máscara/tinta no modo Thinking, em comparação com 965 ± 12 do Nano Banana 2 e 927 ± 12 do Nano Banana Pro.
| Benchmark de edição | Nano Banana 2.1 Thinking | 2.1 No Thinking | Nano Banana 2 | Nano Banana Pro |
|---|---|---|---|---|
| Edição geral | 1026 | 980 | 938 | 939 |
| Consistência de personagem único | 1028 | 1021 | 981 | 991 |
| Consistência de múltiplos personagens | 1106 | 1068 | 978 | 1011 |
| Edição baseada em máscara/tinta | 1049 | 1042 | 965 | 927 |
| Consistência de produto | 1024 | 981 | 955 | 965 |
| Estilização | 1062 | 1036 | 991 | 990 |
| Edição com múltiplas referências | 1066 | 1041 | 988 | 989 |

O ponto importante não é apenas a pontuação mais alta.
Mesmo com o Thinking desativado, o modelo permanece à frente dos modelos de comparação mais antigos em todas as categorias de edição listadas.
Isso torna o 2.1 mais prático para fluxos de trabalho em que cada etapa adicional de raciocínio aumenta a latência ou o custo.
A fonte destaca um teste realizado por ibexdream.
O primeiro prompt gerou uma ilustração ornamentada no estilo de uma cédula, com um filósofo antigo cujo cabelo se transformava em um labirinto.
O segundo prompt editou o resultado existente:
A principal observação foi que o labirinto, a túnica, a barba e a composição geral permaneceram muito mais estáveis do que os usuários normalmente esperam de uma edição generativa.

Um terceiro prompt então converteu a cena para o estilo de uma pintura a óleo, preservando a composição principal.

Esse é exatamente o tipo de fluxo de trabalho em que a qualidade da edição importa mais do que uma primeira imagem espetacular.
Um design comercial raramente termina na primeira geração.
Ele passa por uma revisão após outra.
O segundo grande tema é a consistência.
Para comércio eletrônico, publicidade, quadrinhos seriados, campanhas sociais e fotografia de marca, muitas vezes a mesma pessoa ou o mesmo produto precisa aparecer em várias cenas diferentes.
O modo frustrante de falha é conhecido:
mesma pessoa
→ pose diferente
→ rosto muda
→ outra edição
→ roupas mudam
→ outra edição
→ detalhes do produto se transformam
O Nano Banana 2.1 foi projetado para preservar essas identidades de forma mais estável ao longo de gerações e edições repetidas.
A documentação da API do Google afirma que os modelos Nano Banana podem combinar até 14 imagens de referência em um fluxo de trabalho. Para o Nano Banana 2.1, a documentação do modelo descreve suporte de alta fidelidade a várias referências de objetos e personagens, com a composição recomendada exata dependendo do caso de uso.
O artigo de origem resume a configuração prática como até 10 referências de objetos, além de várias referências de personagens dentro do limite geral de imagens de referência.
O artigo cita um teste realizado por BG-VC.
O avaliador forneceu:
Em seguida, o modelo produziu seis cenas diferentes em um único fluxo de trabalho.

Em poses caminhando, sentadas e inclinadas, o avaliador relatou que o rosto, as roupas, a bolsa e os acessórios permaneceram excepcionalmente consistentes.
Esse é um teste muito mais relevante comercialmente do que um único retrato.
A geração de imagens de produtos só é valiosa se o produto continuar parecendo o mesmo depois de mudanças na pose, no local, no ângulo da câmera ou no estilo.
A fonte também aponta para imagens de amostra do Google que parecem menos obviamente sintéticas.
Os exemplos incluem um besouro coberto de gotas de água e uma mulher usando um vestido verde nas escadas de um edifício rosa.

A mudança não é apenas “mais detalhes”.
Um realismo mais convincente depende de uma combinação de:
A página oficial do modelo do Google descreve a atualização como uma melhoria na qualidade visual e no realismo em resoluções de saída de 1K, 2K e 4K.
Ele também oferece suporte a proporções de aspecto excepcionalmente amplas em resoluções maiores, com correções para artefatos de mosaico que poderiam afetar imagens panorâmicas.
O Nano Banana 2.1 pode usar o Google Web Search e o Google Image Search como fontes de grounding em fluxos de trabalho de API compatíveis.
Isso é especialmente relevante para infográficos.
Um modelo de imagem comum pode criar um gráfico visualmente atraente enquanto inventa números, rótulos ou relações factuais.
O grounding de pesquisa dá ao fluxo de geração a oportunidade de buscar informações reais antes de compor a imagem.
O cartão oficial do modelo do Google informa a seguinte factualidade de infográficos:

A melhoria é grande, mas 0.521 não é 1.0.
Portanto, a conclusão correta não é:
“O modelo agora cria infográficos factuais automaticamente.”
É:
“O grounding de pesquisa e o novo modelo reduzem substancialmente as falhas factuais na avaliação do Google, mas os infográficos gerados ainda precisam ser verificados.”
Essa distinção é importante para educação, jornalismo, medicina, finanças e qualquer outro domínio em que um rótulo incorreto possa ser mais prejudicial do que um layout pouco atraente.
É aqui que o lançamento se torna especialmente interessante.
O Google reduziu agressivamente o preço da saída de imagens, mas aumentou o preço da entrada de texto/imagem e da saída de texto/raciocínio em comparação com os preços mais antigos do Nano Banana 2 citados na fonte.
Os preços atuais oficiais da API Standard do Nano Banana 2.1 são:
| Item de cobrança | Preço oficial atual |
|---|---|
| Entrada de texto/imagem/vídeo | US$ 1,50 por 1 milhão de tokens |
| Saída de texto e raciocínio | US$ 7,50 por 1 milhão de tokens |
| Saída de imagem | US$ 30,00 por 1 milhão de tokens de saída de imagem |
| Imagem 1K | cerca de US$ 0,0336 |
| Imagem 2K | cerca de US$ 0,0504 |
| Imagem 4K | cerca de US$ 0,113 |

O artigo de origem descreve isso como uma transferência de custos do “desenho” para o “raciocínio” por parte do Google.
É uma forma útil de resumir a mudança.
Se o seu fluxo de trabalho for dominado por geração direta, a redução do custo de saída de imagens pode ser muito relevante.
Se o seu fluxo de trabalho utilizar:
então o custo final dependerá de mais fatores do que o preço destacado por imagem.
A fonte original afirma que a saída 4K custa cerca de US$ 0,076 por imagem.
A página de preços atual do Google, no entanto, informa US$ 0,113 por imagem 4K.
Os valores de 1K e 2K permanecem em aproximadamente US$ 0,0336 e US$ 0,0504, respectivamente.
Para o planejamento de produção, use a página oficial de preços atualizada, e não capturas de tela do lançamento ou cálculos de terceiros.
O cartão do modelo do Google lista o Nano Banana 2.1 nos seguintes canais:
Descreva sua ideia uma vez e o We0 AI pode gerar um site de apresentacao, paginas e CMS, alem de ajudar a atrair clientes e trafego apos o lancamento.
Uma geração completa de projetos para registro gratuito
Melhor para experimentar um fluxo de geração completo e ver rapidamente um primeiro rascunho do projeto.
Para desenvolvedores, o ID do modelo na API é:
gemini-nano-banana-2.1
O modelo oferece suporte à geração de imagens e à edição conversacional, incluindo fluxos de trabalho com várias imagens de referência.
A documentação atual do Google também lista níveis de Thinking configuráveis:
minimalmedium — padrãohighA fonte afirma que a API do antigo Nano Banana 2 seria encerrada em 29 de outubro.
A tabela de depreciação atual do Google não mostra essa data de encerramento para gemini-3.1-flash-image.
Em vez disso, ela lista atualmente:
Substituição recomendada: gemini-nano-banana-2.1
Data de encerramento: nenhuma data de encerramento anunciada
Isso não significa que o modelo antigo permanecerá disponível para sempre.
Significa que os desenvolvedores não devem basear os planos de migração na data de 29 de outubro, a menos que o Google a adicione à documentação oficial de depreciação.
O artigo de origem passa então dos benchmarks oficiais para os testes da comunidade.
Essa distinção é importante.
Os benchmarks oficiais mostram como o Google mediu o modelo em condições de avaliação definidas.
Os testes da comunidade mostram como o modelo se comporta em fluxos de trabalho criativos reais.
Ambos são úteis, mas respondem a perguntas diferentes.
Segundo o relato, Mark Kretschmann forneceu ao modelo uma cena deliberadamente difícil contendo:
A ideia era verificar se o resultado ainda pareceria uma fotografia coerente, em vez de uma colagem de fragmentos localmente plausíveis.
Testes desse tipo são valiosos porque os modelos de imagem costumam falhar quando várias restrições difíceis aparecem ao mesmo tempo.
Luis Catacora testou um quadro de menu de uma casa de chá que precisava renderizar o mesmo item em:
A fonte afirma que o modelo tratou corretamente quase todo o texto em uma única geração.

O cartão oficial do modelo do Google também informa uma melhoria na renderização de texto internacional, portanto a observação da comunidade é consistente com o objetivo declarado do lançamento.
Ainda assim, o texto em imagens deve ser revisado.
A fonte mostra posteriormente um pôster em que os caracteres grandes estavam limpos, mas uma pequena linha vertical em inglês se deteriorou e se transformou em um texto ilegível.
É um bom lembrete de que “muito melhor” não é o mesmo que “software de composição tipográfica”.
O lançamento imediatamente estimulou comparações com o atual conjunto de modelos de imagem da OpenAI.
A OpenAI lançou o ChatGPT Images 2.5 em setembro de 2026 e oferece duas variantes de API:
gpt-image-2.5-flare para geração rápida e de alta qualidade no dia a dia.gpt-image-2.5-sunburst para trabalhos criativos detalhados e mais precisos.A OpenAI afirma que o Images 2.5 melhora os detalhes, a precisão de edição, a preservação de objetos, a edição em várias interações e a velocidade de geração.
Isso significa que Google e OpenAI estão competindo cada vez mais pelo mesmo objetivo:
O modelo consegue sobreviver a edições repetidas sem destruir tudo o que já estava correto?
Um avaliador forneceu ao Nano Banana 2.1 e ao GPT Image 2.5 um prompt que combinava deliberadamente vários detalhes frágeis:
No resultado lado a lado da fonte, o Nano Banana 2.1 posicionou a maioria dos detalhes solicitados nos locais corretos, embora tenha deixado passar a coloração dos óculos e alterado o tom de pele.

Esse é exatamente o tipo de comparação que deve ser tratado de forma qualitativa.
Uma única imagem pode revelar modos de falha, mas não consegue estabelecer uma superioridade geral.
Outro avaliador pediu ao Nano Banana 2.1 e ao GPT Image 2 que criassem a mesma cena de um relógio sobre uma mesa.
A fonte descreve o resultado do Google como mais próximo de uma fotografia comum em luz natural, enquanto a versão da OpenAI parecia mais um anúncio refinado, com iluminação dramática e um mostrador mais estilizado.

Isso não é necessariamente um resultado de “melhor contra pior”.
Ele ilustra uma diferença comum entre modelos de imagem:
Qual opção é preferível depende do fluxo de trabalho.
Para fotografia de catálogo de comércio eletrônico, a fidelidade literal pode ser mais importante.
Para arte de marketing, mais estilização pode ser útil.
A fonte cita um teste comunitário de uma plataforma de IA e machine learning que utilizou cinco prompts.
Nesse teste, as médias informadas foram aproximadamente:
| Modelo | Tempo informado por imagem | Custo informado por imagem |
|---|---|---|
| Nano Banana 2.1 | ~11 segundos | ~US$ 0,044 |
| GPT Images 2.5 | ~50 segundos | ~US$ 0,069 |
A mesma fonte também cita um teste com quatro imagens sobre o tema espacial, no qual o Nano Banana 2.1 teria custado US$ 0,178 no total, contra US$ 0,284 do GPT Image 2.5.
Essas são medições de plataformas de terceiros, e não tabelas oficiais de preços dos fornecedores.
Vários fatores podem alterar o resultado:
Para o planejamento de produção, compare a configuração exata da API que você pretende implementar, em vez de presumir que um único teste da comunidade se aplica a todos os fluxos de trabalho.
A fonte também destaca testes do criador de língua chinesa Guizang.
A impressão geral foi positiva:
Um exemplo da fonte parece refinado à primeira vista.

Mas, ao ampliar a imagem, percebe-se que uma pequena linha vertical em inglês se transformou em texto sem sentido.
Esse é um limite prático importante.
Se a imagem for destinada a um anúncio real, menu, rótulo, embalagem ou pôster público, o texto final ainda deve ser verificado manualmente ou substituído em uma ferramenta de design.
Os modelos de imagem estão ficando melhores em tipografia, mas não substituem a revisão final.
A fonte termina com uma observação mais ampla: a competição entre modelos de imagem está mudando de “quem consegue criar a primeira imagem mais impressionante?” para “quem consegue continuar editando a mesma imagem sem quebrá-la?”.
A mudança é fácil de entender.
O trabalho criativo comercial raramente segue este padrão:
briefing
→ uma imagem
→ concluído
Geralmente, ele se parece mais com isto:
briefing
→ versão 1
→ mover o produto para a esquerda
→ mudar a camisa
→ manter o rosto idêntico
→ substituir a placa
→ atualizar o texto
→ remover a pessoa do plano de fundo
→ mudar o estilo
→ aprovação final
Se a versão dez já não se parecer com a versão um, o sistema não será muito útil para iterações profissionais.
O anúncio do Images 2.5 da OpenAI enfatiza edição mais precisa, melhor preservação de objetos, comentários sobre imagens e fluxos de trabalho criativos com várias interações.
O lançamento do Nano Banana 2.1 pelo Google enfatiza edição baseada em máscaras, consistência de objetos, edição com múltiplas referências e iteração conversacional.
As duas direções de produto estão claramente convergindo.
A lógica comercial é direta.
Publicidade, comércio eletrônico, design de marca e conteúdo para redes sociais exigem revisões contínuas.
Um modelo capaz de preservar:
enquanto altera apenas a região solicitada é muito mais valioso do que um modelo que cria uma imagem bonita, mas instável.
Isso ajuda a explicar por que o Google está distribuindo o Nano Banana 2.1 não apenas por meio de APIs para desenvolvedores, mas também em produtos como Google Ads e Stitch.
Portanto, o lançamento trata menos de vencer um concurso isolado de beleza em geração de imagens e mais de fazer a geração visual se adequar a fluxos de trabalho iterativos reais.
O Nano Banana 2.1 é o mais recente modelo de geração de imagens de alta eficiência e edição conversacional do Google na família Gemini 3. Seu ID de modelo na API é gemini-nano-banana-2.1, e o Google afirma que ele é baseado no Gemini 3.6 Flash.
Sim. A documentação oficial do Google lista suporte às saídas em 1K, 2K e 4K. A página atual de preços da API informa que uma imagem 4K custa cerca de US$ 0,113 na modalidade Standard paga.
A documentação de geração de imagens do Google afirma que os fluxos de trabalho Nano Banana podem combinar até 14 imagens de referência. Para o 2.1, os limites práticos dependem de como essas referências são usadas para personagens, objetos e fusão de várias imagens. Portanto, os desenvolvedores devem seguir o guia atual da API, em vez de presumir que todas as 14 referências funcionarão de forma idêntica.
Sim. A edição baseada em máscaras e tinta aparece como uma categoria explícita de avaliação no cartão do modelo do Google, e o 2.1 obtém uma pontuação significativamente superior à do Nano Banana 2 e do Nano Banana Pro na avaliação de edição publicada pelo Google.
Sim. Os fluxos de trabalho compatíveis de geração de imagens da Gemini API podem usar o Google Web Search e o Google Image Search como fontes de grounding. Isso é especialmente útil para gerar infográficos e outras tarefas em que informações atuais ou factuais são importantes.
A saída de imagens tem um preço agressivo de US$ 30 por milhão de tokens de saída de imagem, com a geração em 1K custando cerca de US$ 0,0336 na modalidade Standard atual. No entanto, a entrada de texto/imagem e a saída de texto/raciocínio também têm seus próprios preços. Portanto, o custo total do fluxo de trabalho depende do tamanho do prompt, das referências, do raciocínio, do grounding e do número de iterações.
A página oficial atual de depreciação do Google não lista um encerramento em 29 de outubro para gemini-3.1-flash-image. Atualmente, ela informa que nenhuma data de encerramento foi anunciada e recomenda gemini-nano-banana-2.1 como substituto.
Não existe uma resposta única para todos os fluxos de trabalho. O artigo de origem mostra vários testes da comunidade nos quais o Nano Banana 2.1 apresentou bons resultados em velocidade, realismo, edição e custo, enquanto o conjunto Images 2.5 oficial da OpenAI também enfatiza edição precisa, preservação de objetos e geração de alta fidelidade. A abordagem mais segura é comparar os dois modelos usando seus próprios prompts, imagens de referência, resoluções e fluxos de revisão.
O Nano Banana 2.1 trata menos de criar uma categoria completamente nova de imagens geradas por IA e mais de corrigir as fragilidades que dificultam o uso de imagens generativas em produção: edição local, alteração de objetos, inconsistência de produtos, renderização de texto, infográficos factuais e revisões repetidas.
As avaliações oficiais do Google mostram ganhos substanciais em relação ao Nano Banana 2 e ao Nano Banana Pro em várias categorias de geração e edição. O modelo também combina implantação no nível Flash com até 14 imagens de referência, grounding de pesquisa e saída em 1K/2K/4K, tornando-se uma ferramenta criativa muito mais prática do que um gerador de uso único.
Os preços oficiais atuais também tornam a saída de imagens barata, mas o custo total ainda depende da entrada, do raciocínio, do grounding e da resolução. Os desenvolvedores devem consultar as páginas atualizadas de preços e depreciação do Google, em vez de capturas de tela do lançamento: o preço atual de uma imagem 4K é de cerca de US$ 0,113, e o Google não lista atualmente um encerramento do Nano Banana 2 em 29 de outubro.
A verdadeira competição entre o Nano Banana 2.1 e o GPT Image 2.5 já não é apenas saber quem cria a primeira imagem mais bonita — é saber quem consegue chegar à décima edição sem perder o objeto, o produto, o texto ou a composição que já estavam corretos.
Comece com uma frase e tenha um site completo em minutos.