For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/ja/articles/nano-banana-2-1-vs-gpt-image-2-5-editing-215e3bff.md.
Googleは、最新の高効率画像生成・会話型編集モデルである**Nano Banana 2.1**をリリースしました。

Googleは、最新の高効率画像生成・会話型編集モデルであるNano Banana 2.1をリリースしました。
このモデルは、正式にはGemini 3.1 Flash Imageとして知られるNano Banana 2のアップデートに位置付けられていますが、より新しいGemini 3.6 Flashを基盤として構築されています。
注目点は、単に「画像生成がより優れている」ということではありません。
Nano Banana 2.1は、最初の画像を生成した後に問題になりやすい画像ワークフローの部分に重点を置いています。
リリース時点で、元記事は今回のアップデートを次の6点にまとめていました。
この全体像は現在もおおむね正確ですが、Googleの最新ドキュメントでは料金と提供終了に関する一部の情報が変更されているため、以下で修正しています。
Nano Banana 2.1はGemini 3ファミリーに属し、Gemini 3.6 Flashをベースにしています。

これは、Flashクラスのシステムに期待される速度とコスト特性を維持しながら、画像品質と編集精度を大きく高めることを目指したモデルであることを意味します。
Googleの公式モデルカードでは、Nano Banana 2.1を**Gemini 3.1 Flash Image(Nano Banana 2)およびGemini 3 Pro Image(Nano Banana Pro)**と比較しています。
テキストから画像を生成する評価について、Googleは次の結果を報告しています。
| 能力 | Nano Banana 2.1 Thinking | Nano Banana 2.1 No Thinking | Nano Banana 2 | Nano Banana Pro |
|---|---|---|---|---|
| 総合的な好み | 1050 ± 14 | 1015 ± 13 | 990 ± 7 | 935 ± 8 |
| インフォグラフィックデザイン | 1048 ± 17 | 1001 ± 17 | 961 ± 12 | 912 ± 12 |
| インフォグラフィックの事実性 | 0.521 | 0.328 | 0.179 | 0.265 |

Google独自の評価では、Flashクラスの2.1モデルはNano Banana Proとの差を縮めただけではありません。総合的な好み、インフォグラフィックデザイン、インフォグラフィックの事実性に関する掲載指標で、Proモデルを上回っています。
これが、元記事で「FlashがProを上回る」と表現された根拠です。
ただし、数値は慎重に読む必要があります。
これらはGoogleによる評価結果であり、2.1があらゆるプロンプトでProを上回ることを保証するものではありません。公式モデルカードには、次のような残された弱点も記載されています。
したがって今回のアップデートは大きな進歩ですが、画像生成が「解決済み」になったという主張ではありません。
元記事では、Arenaのコミュニティ投票も引用されています。
記事で使用されたスナップショットでは、Nano Banana 2.1の順位は次のとおりでした。

同じ情報源によると、Nano Banana 2は以前、対応するカテゴリーでそれぞれ7位、11位、14位でした。
特に編集分野では、意味のある上昇です。
ただし、Arenaはリアルタイムで変動するコミュニティのリーダーボードです。新しいモデル、追加投票、非公開のバリエーション、評価方法の変更によって順位は短期間で動く可能性があるため、これらの順位は恒久的な評価表ではなく、リリース時点のスナップショットとして扱うべきです。
最も大きな実用上の改善の1つが、マスクベースの編集です。
Photoshopを使ったことがある人なら、考え方はすぐに理解できるでしょう。領域を選択し、その領域を編集し、選択範囲の外側は変更しないという方法です。
簡単に聞こえますが、画像生成モデルはこれまで、この処理に苦戦してきました。
たとえば、画像モデルに次のように指示するとします。
「左下にあるカップを赤に変えてください」
精密な局所編集に対応していないモデルは、どのカップを指しているのかを推測し、画像全体の大部分を再生成しなければなりません。指定したカップが正しく変わったとしても、ほかのディテールが変化することがあります。
Nano Banana 2.1は、この問題を抑えるように設計されています。
Googleの公式編集評価では、Thinkingモードにおけるマスク/インクベース編集のスコアは1049 ± 15でした。Nano Banana 2は965 ± 12、Nano Banana Proは927 ± 12です。
| 編集ベンチマーク | Nano Banana 2.1 Thinking | 2.1 No Thinking | Nano Banana 2 | Nano Banana Pro |
|---|---|---|---|---|
| 一般編集 | 1026 | 980 | 938 | 939 |
| 単一キャラクターの一貫性 | 1028 | 1021 | 981 | 991 |
| 複数キャラクターの一貫性 | 1106 | 1068 | 978 | 1011 |
| マスク/インクベース編集 | 1049 | 1042 | 965 | 927 |
| 製品の一貫性 | 1024 | 981 | 955 | 965 |
| スタイライズ | 1062 | 1036 | 991 | 990 |
| 複数参照画像の編集 | 1066 | 1041 | 988 | 989 |

重要なのは、最高スコアだけではありません。
Thinkingを無効にした場合でも、掲載された編集カテゴリー全体で、モデルは比較対象となった旧モデルを上回っています。
このため、追加の思考ステップがレイテンシーやコストを増やすワークフローでも、2.1はより実用的です。
元記事では、ibexdreamによるテストが取り上げられています。
最初のプロンプトでは、髪が迷路になっている古い哲学者を描いた、装飾的な紙幣風イラストを生成しました。
2つ目のプロンプトでは、既存の結果を編集しました。
重要な観察結果は、迷路、ローブ、ひげ、全体的な構図が、生成編集で一般的に予想されるよりもはるかに安定していたことです。

その後、3つ目のプロンプトで、中心となる構図を維持したまま、シーンを油絵風に変換しました。

これは、最初の1枚の華やかさよりも編集品質が重要になる、まさに典型的なワークフローです。
商用デザインは、最初の生成で終わることがほとんどありません。
何度も修正を重ねて完成します。
2つ目の大きなテーマは、一貫性です。
EC、広告、連載漫画、ソーシャルキャンペーン、ブランド写真では、同じ人物や製品を複数の異なるシーンに登場させる必要が頻繁にあります。
よくある失敗パターンは次のとおりです。
同じ人物
→ ポーズが変わる
→ 顔が変化する
→ もう一度編集
→ 服装が変わる
→ もう一度編集
→ 製品のディテールが変化する
Nano Banana 2.1は、生成と編集を繰り返しても、こうしたアイデンティティをより安定して維持できるように設計されています。
GoogleのAPIドキュメントによると、Nano Bananaモデルは1つのワークフローで最大14枚の参照画像を組み合わせられます。Nano Banana 2.1については、モデルドキュメントで複数のオブジェクト参照とキャラクター参照を高い忠実度で扱えると説明されていますが、推奨される構成は用途によって異なります。
元記事では、実用上の構成として、全体の参照画像上限の範囲内で最大10枚のオブジェクト参照と複数のキャラクター参照を使用できるとまとめています。
記事では、BG-VCによるテストが引用されています。
テスターは次の画像を入力しました。
その後、モデルは1つのワークフローで6つの異なるシーンを生成しました。

歩く、座る、寄りかかるといったポーズ全体で、顔、服、バッグ、アクセサリーが非常に一貫していたとテスターは報告しています。
これは、1枚のポートレートよりもはるかに商業的な意味のあるテストです。
ポーズ、場所、カメラアングル、スタイリングを変えても製品が製品として見える場合にのみ、製品画像の生成は価値を持ちます。
元記事では、合成画像らしさが目立ちにくいGoogleのサンプル画像も示されています。
例として、水滴に覆われた甲虫や、ピンク色の建物の階段に立つ緑のドレスの女性が挙げられています。

変化は単に「ディテールが増えた」ことだけではありません。
説得力のあるリアリティは、次の要素の組み合わせに左右されます。
Googleの公式モデルページでは、このアップデートにより、1K、2K、4Kの出力解像度全体でビジュアル品質とリアリティが向上したと説明しています。
また、高解像度で非常にワイドなアスペクト比にも対応し、パノラマ画像に影響する可能性のあるタイル状アーティファクトも修正されています。
Nano Banana 2.1は、対応するAPIワークフローでGoogleウェブ検索と画像検索によるグラウンディングを利用できます。
これはインフォグラフィックに特に関係します。
通常の画像モデルは、見た目は魅力的なグラフを作りながら、数値、ラベル、事実関係を創作してしまうことがあります。
検索グラウンディングを使うと、画像を構成する前に、生成ワークフローが実際の情報を取得できる可能性があります。
Googleの公式モデルカードでは、インフォグラフィックの事実性について次の数値を報告しています。

改善幅は大きいものの、0.521は1.0ではありません。
したがって、正しい受け止め方は次のとおりです。
「このモデルは、事実に基づくインフォグラフィックを自動的に作れるようになった」
ではありません。
「検索グラウンディングと新しいモデルによって、Googleの評価では事実性に関する失敗が大幅に減少したが、生成されたインフォグラフィックには依然として検証が必要である」
ということです。
教育、報道、医療、金融など、誤ったラベルが見栄えの悪いレイアウトよりも大きな損害をもたらす分野では、この違いが重要です。
ここが今回のリリースで特に興味深い点です。
Googleは画像出力の料金を大幅に引き下げましたが、元記事で引用された旧Nano Banana 2の料金と比べると、テキスト/画像入力とテキスト/思考出力の料金は引き上げています。
現在の公式Nano Banana 2.1 Standard API料金は次のとおりです。
| 課金項目 | 現在の公式料金 |
|---|---|
| テキスト/画像/動画入力 | 100万トークンあたり1.50ドル |
| テキストおよび思考出力 | 100万トークンあたり7.50ドル |
| 画像出力 | 100万画像出力トークンあたり30.00ドル |
| 1K画像 | 約0.0336ドル |
| 2K画像 | 約0.0504ドル |
| 4K画像 | 約0.113ドル |

元記事では、これをGoogleが「描画」から「思考」へコストを移したと表現しています。
これは有用な簡略表現です。
ワークロードの大部分が単純な生成であれば、画像出力料金の低下は大きな意味を持ちます。
一方、次のようなワークフローでは、最終的なコストは画像1枚あたりの見出し料金だけでは決まりません。
元の情報源では、4K出力の料金は1枚あたり約0.076ドルとされています。
しかし、Googleの現在の料金ページでは、4K画像を0.113ドルと記載しています。
1Kと2Kの料金は、それぞれ約0.0336ドルと0.0504ドルのままです。
本番環境の予算を立てる際は、リリース当日のスクリーンショットや第三者の計算ではなく、最新の公式料金ページを使用してください。
アイデアを一文で入力するだけで、We0 AI が紹介サイト、ページ、CMS を生成し、公開後の顧客獲得と流入拡大を支援します。
無料登録で完全なプロジェクトを 1 つ生成
1 つの完全な生成フローを試し、最初のプロジェクトのドラフトをすぐに確認するのに最適です。
Googleのモデルカードでは、Nano Banana 2.1を次のチャネルで提供すると記載しています。
開発者向けのAPIモデルIDは次のとおりです。
gemini-nano-banana-2.1
このモデルは、複数の画像参照を含むワークフローで、画像生成と会話型編集に対応しています。
現在のGoogleドキュメントでは、設定可能なThinkingレベルも次のように記載されています。
minimalmedium — デフォルトhigh元記事では、旧Nano Banana 2 APIが10月29日に停止すると説明しています。
しかし、Googleの現在の非推奨モデル一覧には、gemini-3.1-flash-imageについてその停止日は記載されていません。
現在は次のように記載されています。
推奨される置き換え:gemini-nano-banana-2.1
停止日:停止日は未発表
これは、旧モデルが永続的に提供されるという意味ではありません。
Googleが公式の非推奨ドキュメントに追加しない限り、開発者は10月29日という日付を前提に移行計画を立てるべきではないという意味です。
元記事はその後、公式ベンチマークからコミュニティテストへと移ります。
この区別は重要です。
公式ベンチマークは、定義された評価条件の下でGoogleがモデルをどのように測定したかを示します。
コミュニティテストは、実際のクリエイティブワークフローでモデルがどのように感じられるかを示します。
どちらも有用ですが、答えている問いは異なります。
Mark Kretschmannは、意図的に難しいシーンをモデルに与えたと報告されています。そこには次の要素が含まれていました。
目的は、結果が局所的にはもっともらしい断片のコラージュではなく、1枚のまとまりのある写真に見えるかを確認することでした。
このようなテストは、複数の難しい制約が同時に現れたときに画像モデルが失敗しやすいため、価値があります。
Luis Catacoraは、次の言語で同じ商品名を表示する茶館のメニューボードをテストしました。
元記事によると、モデルは1回の生成で、ほぼすべてのテキストを正しく処理しました。

Googleの公式モデルカードでも国際的なテキスト描画の改善が報告されているため、このコミュニティの観察結果はリリース時の目標と一致しています。
それでも、画像内のテキストは校正が必要です。
元記事の後半では、大きな文字はきれいに描画されているものの、小さな縦書きの英語行が判読不能なテキストに変化した日本語ポスターの例が示されています。
これは、「大幅に改善した」と「組版ソフトウェアになった」は同じではないことを示す良い例です。
今回のリリースは、OpenAIの現行画像生成スタックとの比較をすぐに引き起こしました。
OpenAIは2026年9月にChatGPT Images 2.5をリリースし、APIでは次の2つのバリエーションを提供しています。
gpt-image-2.5-flare。gpt-image-2.5-sunburst。OpenAIは、Images 2.5によってディテール、編集精度、対象の保持、複数ターン編集、生成速度が向上したと説明しています。
これは、GoogleとOpenAIが同じ問題をめぐって競争を強めていることを意味します。
すでに正しい部分をすべて壊さずに、繰り返しの編集に耐えられるか。
あるテスターは、Nano Banana 2.1とGPT Image 2.5に、壊れやすいディテールを意図的に積み重ねたプロンプトを与えました。
元記事の比較画像では、Nano Banana 2.1は指定されたディテールの大部分を正しい位置に配置しました。ただし、メガネの色は反映されず、肌の色は変化しました。

この種の比較は、定性的なものとして扱うべきです。
1枚の画像から失敗パターンを確認することはできますが、全体的な優位性を証明することはできません。
別のテスターは、Nano Banana 2.1とGPT Image 2に、同じ机上の時計のシーンを作成するよう依頼しました。
元記事では、Googleの結果は自然光で撮影された一般的な写真に近く、OpenAIの結果はドラマチックな照明と、より様式化された文字盤を備えた洗練された広告のように見えたと説明しています。

これは必ずしも「優れているものと劣っているもの」の比較ではありません。
画像モデルにおける一般的な違いを示しています。
どちらが好ましいかは、ワークフローによって異なります。
ECのカタログ写真では、文字どおりの忠実度が勝るかもしれません。
マーケティング用アートでは、より強いスタイル化が役立つ場合があります。
元記事では、AI/ML APIコミュニティによる5つのプロンプトを使ったテストが引用されています。
そのテストで報告された平均値は、おおむね次のとおりでした。
| モデル | 画像1枚あたりの報告時間 | 画像1枚あたりの報告コスト |
|---|---|---|
| Nano Banana 2.1 | 約11秒 | 約0.044ドル |
| GPT Images 2.5 | 約50秒 | 約0.069ドル |
同じ情報源では、宇宙をテーマにした4枚の画像によるテストで、Nano Banana 2.1の合計コストは0.178ドル、GPT Image 2.5は0.284ドルだったとも報告されています。
これらは第三者プラットフォームによる測定値であり、公式ベンダーの料金表ではありません。
次のような変数によって結果は変わります。
本番環境の計画では、1つのコミュニティテストがすべてのワークロードに当てはまると考えるのではなく、導入予定の正確なAPI構成で比較してください。
元記事では、中国語圏のクリエイターである歸藏によるテストも紹介されています。
全体的な印象は肯定的でした。
最初は洗練されて見える情報源の例もあります。

しかし、拡大すると、小さな縦書きの英語行が意味不明な文字列に変わっていることが分かります。
これは重要な実用上の限界です。
画像を実際の広告、メニュー、ラベル、公共ポスターに使用する場合、最終的なテキストは手作業で確認するか、デザインツールで置き換える必要があります。
画像モデルのタイポグラフィ処理は向上していますが、最終校正の代替にはなりません。
元記事は、画像モデルの競争が「誰が最も印象的な最初の画像を作れるか」から、「誰が同じ画像を壊さずに編集し続けられるか」へ移っているという、より大きな見解で締めくくられています。
この変化は理解しやすいものです。
商用クリエイティブの作業が、次のように進むことはほとんどありません。
要件
→ 1枚の画像
→ 完了
実際には、次のようになることが多いでしょう。
要件
→ バージョン1
→ 製品を左に移動
→ シャツを変更
→ 顔を完全に同じに維持
→ 看板を差し替え
→ テキストを更新
→ 背景の人物を削除
→ スタイルを変更
→ 最終承認
10回目のバージョンが1回目のバージョンに似ていないなら、そのシステムはプロフェッショナルな反復作業にはあまり役立ちません。
OpenAIのImages 2.5の発表では、より精密な編集、対象の保持、画像へのコメント、複数ターンのクリエイティブワークフローが強調されています。
GoogleのNano Banana 2.1リリースでは、マスクベースの編集、対象の一貫性、複数参照画像の編集、会話型の反復が強調されています。
両社の製品の方向性は明らかに収束しています。
商業的なロジックは明快です。
広告、EC、ブランドデザイン、ソーシャルコンテンツでは、終わりのない修正が必要になります。
次の要素を維持しながら、指定された領域だけを変更できるモデルは、1枚の美しい画像を作れるだけで不安定なモデルよりもはるかに価値があります。
このことは、GoogleがNano Banana 2.1を開発者向けAPIだけでなく、Google広告やStitchなどの製品にも展開している理由を説明します。
したがって今回のリリースは、1回の画像生成コンテストで勝つことよりも、生成画像を現実の反復的なワークフローに適合させることに重点があります。
Nano Banana 2.1は、Gemini 3ファミリーに属する、Googleの最新の高効率画像生成・会話型編集モデルです。APIモデルIDはgemini-nano-banana-2.1で、GoogleによるとGemini 3.6 Flashをベースにしています。
はい。Googleの公式ドキュメントでは、1K、2K、4Kの出力に対応しています。現在のAPI料金ページでは、Standardの有料料金における4K画像は約0.113ドルと記載されています。
Googleの画像生成ドキュメントによると、Nano Bananaのワークフローでは最大14枚の参照画像を組み合わせられます。2.1では、キャラクター、オブジェクト、複数画像の融合に参照画像をどう使うかによって実用上の制限が異なるため、14枚すべてが同じように機能すると考えず、最新のAPIガイドに従う必要があります。
はい。マスクベースおよびインクベースの編集は、Googleのモデルカードに明記された評価カテゴリーです。Googleが公開した編集評価では、2.1はNano Banana 2とNano Banana Proを大幅に上回っています。
はい。対応するGemini APIの画像生成ワークフローでは、Googleウェブ検索と画像検索によるグラウンディングを利用できます。これは、インフォグラフィックの生成や、最新情報・事実情報が重要なタスクで特に役立ちます。
画像出力は100万画像出力トークンあたり30ドルと積極的に価格設定されており、現在のStandard料金では1K画像の生成は約0.0336ドルです。ただし、テキスト/画像入力とテキスト/思考出力にもそれぞれ料金がかかるため、ワークフロー全体のコストはプロンプトの長さ、参照画像、推論、グラウンディング、反復回数によって変わります。
Googleの現在の公式非推奨ページには、gemini-3.1-flash-imageの10月29日の提供終了は記載されていません。現在は停止日未発表とされ、代替モデルとしてgemini-nano-banana-2.1が推奨されています。
すべてのワークフローに共通する答えはありません。元記事では、速度、リアリズム、編集、コストについてNano Banana 2.1が優れているように見えるコミュニティテストが複数紹介されています。一方、OpenAIの公式Images 2.5スタックも、精密な編集、対象の保持、高忠実度の生成を重視しています。最も安全な方法は、実際に使用するプロンプト、参照画像、解像度、修正ワークフローで両方をベンチマークすることです。
Nano Banana 2.1は、まったく新しいAI画像のカテゴリーを生み出すというよりも、生成画像を実際の制作現場で使いにくくしていた弱点、つまり局所編集、対象のドリフト、製品の不一致、テキスト描画、事実に基づくインフォグラフィック、繰り返しの修正を改善することに重点を置いています。
Googleの公式評価では、複数の生成・編集カテゴリーで、Nano Banana 2とNano Banana Proを大きく上回る成果が示されています。最大14枚の参照画像、検索グラウンディング、1K/2K/4K出力をFlashクラスのデプロイメントと組み合わせているため、単発の生成モデルよりもはるかに実用的なクリエイティブツールになっています。
現在の公式料金では画像出力も安価ですが、総コストは入力、推論、グラウンディング、解像度によって変わります。開発者はリリース当日のスクリーンショットではなく、Googleの最新料金ページと非推奨情報を使用すべきです。現在の4K料金は約0.113ドルで、Googleは現時点でNano Banana 2の10月29日の提供終了を記載していません。
Nano Banana 2.1とGPT Image 2.5の本当の競争は、もはやどちらが最初の画像を美しく作れるかだけではありません。すでに正しかった対象、製品、テキスト、構図を失わずに、10回目の編集に耐えられるのはどちらかという点にあります。
ひとことから始めて、数分で完全なサイトを手に入れましょう。