For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/zh-HK/articles/nano-banana-2-1-vs-gpt-image-2-5-editing-215e3bff.md.
Google 已發布 **Nano Banana 2.1**,這是其最新的高效率影像生成與對話式編輯模型。

Google 已發布 Nano Banana 2.1,這是其最新的高效率影像生成與對話式編輯模型。
該模型被定位為 Nano Banana 2 的更新版本,官方名稱為 Gemini 3.1 Flash Image,但其基礎架構建立在更新的 Gemini 3.6 Flash 之上。
其重點並不只是「更好的影像生成」。
Nano Banana 2.1 尤其著重於影像工作流程中首次生成之後最容易變得棘手的部分:
發布時,來源文章從六個方面總結了這次更新:
整體描述仍然準確,但 Google 即時文件中的部分定價與棄用細節已經發生變化,以下將進行修正。
Nano Banana 2.1 屬於 Gemini 3 系列,基於 Gemini 3.6 Flash。

這一點很重要,因為該模型旨在保留人們對 Flash 級系統所期待的速度與成本特徵,同時大幅提升影像品質與編輯精準度。
Google 的官方模型卡將 Nano Banana 2.1 與 Gemini 3.1 Flash Image(Nano Banana 2) 和 Gemini 3 Pro Image(Nano Banana Pro) 進行了比較。
對於文字生成影像,Google 報告如下:
| 能力 | Nano Banana 2.1 Thinking | Nano Banana 2.1 No Thinking | Nano Banana 2 | Nano Banana Pro |
|---|---|---|---|---|
| 整體偏好 | 1050 ± 14 | 1015 ± 13 | 990 ± 7 | 935 ± 8 |
| 資訊圖表設計 | 1048 ± 17 | 1001 ± 17 | 961 ± 12 | 912 ± 12 |
| 資訊圖表事實性 | 0.521 | 0.328 | 0.179 | 0.265 |

在 Google 自身的評測中,Flash 級的 2.1 模型不只是縮小了與 Nano Banana Pro 之間的差距,還在列出的整體偏好、資訊圖表設計和資訊圖表事實性指標上超越了 Pro 模型。
這也是來源文章採用「Flash 超越 Pro」這一表述的依據。
不過,仍然有必要仔細解讀這些數字。
這些是 Google 的評測結果,並不代表 2.1 能在每個提示詞上都普遍優於 Pro。官方模型卡也列出了仍然存在的弱點,包括:
因此,這是一次重要更新,但並不代表影像生成已經「被解決」。
來源文章也引用了 Arena 社群投票結果。
在文章採用的快照中,Nano Banana 2.1 的排名為:

同一來源表示,Nano Banana 2 此前在相應類別中分別排名第 7、第 11 和第 14。
這是一個具有意義的提升,尤其是在編輯方面。
但 Arena 是一個即時更新的社群排行榜。新模型、更多投票、隱藏版本以及評測變化都可能迅速改變排名,因此這些名次應被視為發布初期的快照,而不是永久性的成績表。
其中一項最大的實際改進是基於遮罩的編輯。
任何使用過 Photoshop 的人都能立即理解這個概念:選取一個區域,編輯該區域,並保持選區以外的內容不變。
這聽起來很簡單,但影像生成模型過去一直難以做到。
假設你告訴影像模型:
「把左下角的杯子改成紅色。」
缺乏精確局部編輯能力的模型必須推斷你指的是哪一個杯子,然後重新生成整張影像的大部分內容。即使指定的杯子確實成功變色,其他細節也可能發生漂移:
Nano Banana 2.1 的設計目標就是降低這類問題。
Google 的官方編輯評測顯示,在 Thinking 模式下,遮罩/墨線式編輯分數為 1049 ± 15,而 Nano Banana 2 為 965 ± 12,Nano Banana Pro 為 927 ± 12。
| 編輯基準測試 | Nano Banana 2.1 Thinking | 2.1 No Thinking | Nano Banana 2 | Nano Banana Pro |
|---|---|---|---|---|
| 一般編輯 | 1026 | 980 | 938 | 939 |
| 單一角色一致性 | 1028 | 1021 | 981 | 991 |
| 多角色一致性 | 1106 | 1068 | 978 | 1011 |
| 遮罩/墨線式編輯 | 1049 | 1042 | 965 | 927 |
| 產品一致性 | 1024 | 981 | 955 | 965 |
| 風格化 | 1062 | 1036 | 991 | 990 |
| 多參考影像編輯 | 1066 | 1041 | 988 | 989 |

重要的不只是最高分。
即使停用 Thinking,該模型在列出的所有編輯類別中仍然領先較舊的比較模型。
這使 2.1 更適合那些每增加一次思考步驟,就會增加延遲或成本的工作流程。
來源文章強調了 ibexdream 的一項測試。
第一個提示詞生成了一幅華麗的鈔票風格插畫,畫面中的古代哲學家頭髮變成了迷宮。
第二個提示詞編輯了現有結果:
關鍵觀察是,與使用者通常對生成式編輯的預期相比,迷宮、長袍、鬍鬚和整體構圖都保持了更高的穩定性。

第三個提示詞接著將場景轉換為油畫風格,同時保留核心構圖。

這正是編輯品質比第一張影像是否足夠驚艷更重要的工作流程。
商業設計很少在第一次生成後就結束。
它通常會經歷一輪又一輪的修改。
第二個重要主題是一致性。
對於電子商務、廣告、連載漫畫、社群活動和品牌攝影來說,同一個人物或產品往往需要出現在多個不同場景中。
令人挫折的失敗模式很熟悉:
同一個人
→ 不同姿勢
→ 臉部漂移
→ 再次編輯
→ 服裝改變
→ 再次編輯
→ 產品細節變形
Nano Banana 2.1 的設計目標,是在重複生成與編輯過程中更穩定地保持這些身份特徵。
Google 的 API 文件表示,Nano Banana 模型可以在一個工作流程中混合使用最多 14 張參考影像。對於 Nano Banana 2.1,模型文件描述了對多個物件參考和角色參考的高保真支援,具體建議組合則取決於使用情境。
來源文章將實際設定總結為:在整體參考影像上限內,最多使用 10 個物件參考,以及多個角色參考。
文章引用了 BG-VC 的一項測試。
測試者提供了:
模型接著在同一個工作流程中生成了六個不同場景。

在行走、坐下和倚靠等姿勢中,測試者表示臉部、服裝、包包和配件都保持了異常一致。
與單一人像相比,這是一項更具商業相關性的測試。
只有當產品在姿勢、地點、攝影角度或造型發生變化後仍然像原本的產品時,產品影像生成才真正具有價值。
來源文章也指出,Google 提供的範例影像看起來不那麼明顯是合成影像。
範例包括一隻覆蓋水珠的甲蟲,以及一名身穿綠色洋裝、站在粉紅色建築樓梯上的女性。

變化不只是「細節更多」。
更令人信服的逼真度取決於多種因素的組合:
Google 官方模型頁面表示,此次更新改善了 1K、2K 和 4K 輸出解析度下的視覺品質與逼真度。
它也支援高解析度下異常寬的長寬比,並修復可能影響全景影像的拼接瑕疵。
Nano Banana 2.1 可以在支援的 API 工作流程中使用** Google 網頁搜尋與圖片搜尋接地**。
這對資訊圖表尤其重要。
一般影像模型可能生成一張視覺上吸引人的圖表,同時捏造數字、標籤或事實關係。
搜尋接地讓生成工作流程有機會在組合影像之前先取得真實資訊。
Google 的官方模型卡報告了以下資訊圖表事實性分數:

這項提升幅度很大,但 0.521 並不是 1.0。
因此,正確的結論不是:
「該模型現在可以自動製作具備事實準確性的資訊圖表。」
而是:
「搜尋接地與更新後的模型,在 Google 的評測中大幅降低了事實錯誤,但生成式資訊圖表仍然需要核查。」
這一區別對教育、新聞、醫療、金融及其他標籤錯誤可能比版面醜陋更具破壞性的領域非常重要。
這是此次發布特別值得關注的地方。
Google 大幅降低了影像輸出價格,但與來源文章引用的舊版 Nano Banana 2 定價相比,提高了文字/影像輸入及文字/思考輸出的價格。
目前官方 Nano Banana 2.1 Standard API 定價如下:
| 計費項目 | 目前官方價格 |
|---|---|
| 文字/影像/影片輸入 | 每 100 萬 tokens 1.50 美元 |
| 文字與思考輸出 | 每 100 萬 tokens 7.50 美元 |
| 影像輸出 | 每 100 萬影像輸出 tokens 30.00 美元 |
| 1K 影像 | 約 0.0336 美元 |
| 2K 影像 | 約 0.0504 美元 |
| 4K 影像 | 約 0.113 美元 |

來源文章將此描述為 Google 將成本從「繪圖」轉移到「思考」。
這是一種有用的簡化說法。
如果你的工作負載主要是直接生成,較低的影像輸出成本可能非常重要。
如果你的工作流程使用:
那麼最終成本就不只取決於每張影像的標示價格。
原始來源表示,4K 輸出每張約需 0.076 美元。
但 Google 目前的定價頁面列出的 4K 影像價格為 0.113 美元。
1K 和 2K 的價格仍分別約為 0.0336 美元與 0.0504 美元。
進行生產預算規劃時,應以即時官方定價頁面為準,而不是發布當天的截圖或第三方計算結果。
Google 的模型卡列出了 Nano Banana 2.1 的以下使用渠道:
輸入一句想法,We0 AI 即可生成展示站、頁面與 CMS。發佈上線後並幫你獲取客戶和流量。
用戶註冊贈送一次完整項目生成
適合先體驗一次完整生成流程,快速看到專案初稿。
對開發者而言,API 模型 ID 為:
gemini-nano-banana-2.1
該模型支援影像生成與對話式編輯,包括使用多張影像參考的工作流程。
目前 Google 文件也列出了可設定的 Thinking 等級:
minimalmedium — 預設值high來源文章表示,舊版 Nano Banana 2 API 將於 10 月 29 日關閉。
Google 目前的棄用表並未為 gemini-3.1-flash-image 顯示這個關閉日期。
相反,目前的資訊是:
建議替代模型:gemini-nano-banana-2.1
關閉日期:尚未宣布關閉日期
這並不代表舊模型永遠不會停用。
這表示除非 Google 將該日期加入官方棄用文件,否則開發者不應圍繞 10 月 29 日這個日期制定遷移計畫。
來源文章接著從官方基準測試轉向社群測試。
這種區分很重要。
官方基準測試告訴我們 Google 如何在明確定義的評測設定下衡量模型。
社群測試則展示模型在真實創意工作流程中的使用感受。
兩者都很有用,但回答的是不同問題。
據報導,Mark Kretschmann 給模型提供了一個刻意設計的困難場景,其中包含:
測試目的是觀察結果是否仍然像一張連貫的照片,而不是由許多局部合理的碎片拼成的拼貼圖。
這類測試很有價值,因為當多個困難限制同時出現時,影像模型往往會失敗。
Luis Catacora 測試了一塊茶館菜單板,要求在同一次生成中使用以下語言呈現相同項目:
來源表示,模型在一次生成中幾乎正確處理了所有文字。

Google 的官方模型卡也報告了國際文字渲染能力的提升,因此社群觀察與此次發布所宣稱的目標一致。
不過,影像中的文字仍應進行校對。
來源文章稍後展示了一張中文海報,其中大型中文字元清晰,但一小段垂直英文文字已退化成無法辨識的內容。
這很好地提醒我們:「大幅改善」並不等於「排版軟體」。
這次發布立即引發了與 OpenAI 目前影像產品線的比較。
OpenAI 於 2026 年 9 月推出 ChatGPT Images 2.5,並提供兩個 API 版本:
gpt-image-2.5-flare,用於快速、高品質的日常生成。gpt-image-2.5-sunburst,用於更精準的詳細創意工作。OpenAI 表示,Images 2.5 改善了細節、編輯精準度、主體保留、多輪編輯和生成速度。
這代表 Google 與 OpenAI 越來越集中競爭於同一個問題:
模型能否在多次編輯後仍然不破壞原本已經正確的內容?
一名測試者向 Nano Banana 2.1 和 GPT Image 2.5 提供了一個刻意堆疊脆弱細節的提示詞:
在來源文章的並列結果中,Nano Banana 2.1 將大部分要求的細節放在了正確位置,但遺漏了眼鏡的色調,且膚色發生了變化。

這正是應該以定性方式解讀的比較。
一張影像可以揭示失敗模式,但不能證明整體優越性。
另一名測試者要求 Nano Banana 2.1 和 GPT Image 2 生成相同的桌面手錶場景。
來源描述稱,Google 的結果更像普通的自然光攝影,而 OpenAI 的版本更像經過精心製作的廣告,採用了戲劇化光線和更具風格化的錶面。

這不一定是「更好」與「更差」的結果。
它呈現了影像模型之間常見的差異:
哪一個更適合,取決於工作流程。
對電子商務目錄攝影而言,字面忠實度可能更重要。
對行銷藝術而言,更高程度的風格化可能更有用。
來源文章引用了一項 AI/ML API 社群測試,測試使用了五個提示詞。
在該測試中,報告的平均值大致如下:
| 模型 | 報告的每張影像所需時間 | 報告的每張影像成本 |
|---|---|---|
| Nano Banana 2.1 | 約 11 秒 | 約 0.044 美元 |
| GPT Images 2.5 | 約 50 秒 | 約 0.069 美元 |
同一來源也引用了一項四張太空主題影像的測試,其中 Nano Banana 2.1 的總成本據報為 0.178 美元,而 GPT Image 2.5 為 0.284 美元。
這些是第三方平台測量結果,不是官方供應商的價格表。
多項變數都可能改變結果:
進行生產規劃時,應比較計畫部署的確切 API 設定,而不是假設某一項社群測試可以推廣到所有工作負載。
來源文章也強調了中文創作者歸藏的測試。
整體印象是正面的:
其中一個來源範例乍看之下相當精緻。

但放大後可以發現,一小段垂直英文文字已經變成亂碼。
這是一項重要的實際限制。
如果影像最終要用於真實廣告、菜單、標籤、包裝或公開海報,仍應人工檢查最終文字,或在設計工具中重新替換文字。
影像模型在排版方面正變得越來越好,但它們仍然不能取代最終校對。
來源文章最後提出了更廣泛的觀察:影像模型之間的競爭正從「誰能製作最令人印象深刻的第一張影像?」轉向「誰能在不破壞影像的情況下持續編輯同一張影像?」
這一變化很容易理解。
商業創意工作很少遵循以下模式:
簡報
→ 一張影像
→ 完成
它通常更接近:
簡報
→ 版本 1
→ 將產品向左移動
→ 更換襯衫
→ 保持臉部完全一致
→ 替換招牌
→ 更新文字
→ 移除背景人物
→ 改變風格
→ 最終核准
如果第十個版本已經不像第一個版本,那麼這個系統對專業迭代而言就不太實用。
OpenAI 的 Images 2.5 發布公告強調了更精準的編輯、更好的主體保留、在影像上加入評論,以及多輪創意工作流程。
Google 的 Nano Banana 2.1 發布則強調基於遮罩的編輯、主體一致性、多參考影像編輯和對話式迭代。
兩者的產品方向顯然正在趨同。
商業邏輯很直接。
廣告、電子商務、品牌設計和社群內容都需要不斷修改。
一個能夠在只改變指定區域的同時保留以下內容的模型:
其價值遠高於只能生成一張漂亮但不穩定影像的模型。
這有助於解釋 Google 為何不只透過開發者 API 發布 Nano Banana 2.1,也將其導入 Google Ads 和 Stitch 等產品。
因此,這次發布的重點不只是贏得一場單張影像生成的美感競賽,而是讓生成式影像更適合真實的迭代工作流程。
Nano Banana 2.1 是 Google 最新的高效率影像生成與對話式編輯模型,屬於 Gemini 3 系列。其 API 模型 ID 為 gemini-nano-banana-2.1,Google 表示它基於 Gemini 3.6 Flash。
支援。Google 官方文件列出了 1K、2K 和 4K 輸出支援。目前 API 定價頁面列出的 Standard 付費價格中,4K 影像約為 0.113 美元。
Google 的影像生成文件表示,Nano Banana 工作流程可以混合使用最多 14 張參考影像。對於 2.1,實際限制取決於這些參考影像如何用於角色、物件和多影像融合,因此開發者應遵循目前的 API 指南,而不要假設所有 14 張參考影像的行為完全相同。
支援。遮罩式與墨線式編輯是 Google 模型卡中的明確評測類別,在 Google 發布的編輯評測中,2.1 的分數明顯高於 Nano Banana 2 和 Nano Banana Pro。
可以。支援的 Gemini API 影像生成工作流程可以使用 Google 網頁搜尋與圖片搜尋接地。這對資訊圖表生成及其他需要即時或具備事實依據資訊的任務尤其有用。
影像輸出定價非常積極,每 100 萬影像輸出 tokens 為 30 美元;按照目前 Standard 定價,1K 影像生成約為 0.0336 美元。不過,文字/影像輸入與文字/思考輸出也有各自的價格,因此總工作流程成本取決於提示詞長度、參考影像、推理、接地和迭代次數。
Google 目前的官方棄用頁面沒有列出 gemini-3.1-flash-image 在 10 月 29 日關閉。頁面目前表示尚未宣布關閉日期,並建議使用 gemini-nano-banana-2.1 作為替代模型。
沒有適用於所有工作流程的單一答案。來源文章展示了多項社群測試,其中 Nano Banana 2.1 在速度、逼真度、編輯和成本方面表現強勁;同時,OpenAI 官方的 Images 2.5 產品線也強調精準編輯、主體保留和高保真生成。最穩妥的做法,是使用你自己的提示詞、參考影像、解析度和修改流程對兩者進行基準測試。
Nano Banana 2.1 的重點不在於打造一個全新的 AI 影像類別,而在於修補讓生成式影像難以用於真實生產的弱點:局部編輯、主體漂移、產品不一致、文字渲染、具備事實性的資訊圖表,以及反覆修改。
Google 的官方評測顯示,與 Nano Banana 2 和 Nano Banana Pro 相比,該模型在多項生成與編輯類別中都有大幅提升。該模型也將 Flash 級部署能力與最多 14 張參考影像、搜尋接地以及 1K/2K/4K 輸出結合,使其成為比一次性生成器更實用的創意工具。
目前官方定價也使影像輸出成本較低,但總成本仍取決於輸入、推理、接地和解析度。開發者應使用 Google 的即時定價與棄用頁面,而不是發布當天的截圖:目前 4K 價格約為 0.113 美元,且 Google 目前沒有列出 Nano Banana 2 在 10 月 29 日關閉的日期。
Nano Banana 2.1 與 GPT Image 2.5 之間真正的競爭,已不再只是誰能生成更漂亮的第一張影像,而是誰能在第十次編輯後,仍然保留原本已經正確的人物、產品、文字或構圖。
從一句話開始,幾分鐘內拿到完整網站。