For AI agents: the public content index is available at https://we0.ai/llms.txt, and the English article bundle is available at https://we0.ai/llms-full.txt.
For AI agents: the complete content index is available at https://we0.ai/llms.txt, the full English article bundle is available at https://we0.ai/llms-full.txt, and this page is available as Markdown at https://we0.ai/zh/articles/nano-banana-2-1-vs-gpt-image-2-5-editing-215e3bff.md.
Google 已发布 Nano Banana 2.1,这是其最新的高效率图像生成与对话式编辑模型。

Google 已发布 Nano Banana 2.1,这是其最新的高效率图像生成与对话式编辑模型。
该模型被定位为 Nano Banana 2 的更新版本,官方名称为 Gemini 3.1 Flash Image,但它基于更新的 Gemini 3.6 Flash 基础模型构建。
其核心亮点并不只是“更好的图像生成”。
Nano Banana 2.1 重点解决了首次生成之后图像工作流中最容易变得棘手的问题:
发布之初,来源文章从六个方面概括了这次更新:
这一总体判断仍然准确,但 Google 在线文档中的部分定价和弃用信息已经发生变化,以下内容将进行修正。
Nano Banana 2.1 属于 Gemini 3 系列,基于 Gemini 3.6 Flash 构建。

这很重要,因为该模型旨在保留人们对 Flash 级系统的速度和成本预期,同时大幅提升图像质量和编辑精度。
Google 的官方模型卡将 Nano Banana 2.1 与 Gemini 3.1 Flash Image(Nano Banana 2) 和 Gemini 3 Pro Image(Nano Banana Pro) 进行了比较。
在文生图方面,Google 报告的数据如下:
| 能力 | Nano Banana 2.1 Thinking | Nano Banana 2.1 No Thinking | Nano Banana 2 | Nano Banana Pro |
|---|---|---|---|---|
| 综合偏好度 | 1050 ± 14 | 1015 ± 13 | 990 ± 7 | 935 ± 8 |
| 信息图设计 | 1048 ± 17 | 1001 ± 17 | 961 ± 12 | 912 ± 12 |
| 信息图事实准确性 | 0.521 | 0.328 | 0.179 | 0.265 |

根据 Google 自己的评测,这款 Flash 级的 2.1 模型不仅缩小了与 Nano Banana Pro 之间的差距,还在列出的综合偏好度、信息图设计和信息图事实准确性指标上超过了 Pro 模型。
这正是来源文章提出“Flash 击败 Pro”这一说法的依据。
不过,仍然有必要仔细解读这些数字。
这些是 Google 的评测结果,并不意味着 2.1 会在每一个提示词上都超过 Pro。官方模型卡还列出了当前仍然存在的不足,包括:
因此,这次更新意义重大,但并不是在宣称图像生成问题已经“解决”。
来源文章还引用了 Arena 社区投票结果。
在文章所采用的快照中,Nano Banana 2.1 的排名为:

同一来源称,Nano Banana 2 此前在对应类别中分别排名第 7、第 11 和第 14。
这是一项有意义的提升,尤其是在编辑方面。
但 Arena 是一个实时更新的社区排行榜。新模型、更多投票、隐藏版本和评测变化都可能迅速改变排名,因此这些名次应被视为发布时的快照,而不是永久有效的评分表。
最重要的实际改进之一是基于蒙版的编辑。
任何使用过 Photoshop 的人都能立即理解这一概念:选中一个区域,编辑该区域,并保持选区之外的内容不变。
这听起来很简单,但图像生成模型过去一直难以实现。
假设你对图像模型说:
“把左下角的杯子改成红色。”
没有精确局部编辑能力的模型必须推断你指的是哪个杯子,然后重新生成整张图像的大部分内容。即使目标杯子被正确改变,其他细节也可能发生漂移:
Nano Banana 2.1 旨在减少这一问题。
Google 的官方编辑评测显示,Nano Banana 2.1 Thinking 的蒙版/笔刷编辑得分为 1049 ± 15,而 Nano Banana 2 为 965 ± 12,Nano Banana Pro 为 927 ± 12。
| 编辑基准 | Nano Banana 2.1 Thinking | 2.1 No Thinking | Nano Banana 2 | Nano Banana Pro |
|---|---|---|---|---|
| 通用编辑 | 1026 | 980 | 938 | 939 |
| 单人物一致性 | 1028 | 1021 | 981 | 991 |
| 多人物一致性 | 1106 | 1068 | 978 | 1011 |
| 蒙版/笔刷编辑 | 1049 | 1042 | 965 | 927 |
| 产品一致性 | 1024 | 981 | 955 | 965 |
| 风格化 | 1062 | 1036 | 991 | 990 |
| 多参考图编辑 | 1066 | 1041 | 988 | 989 |

重要的不只是最高分。
即使关闭 Thinking,该模型在列出的所有编辑类别中仍然领先于较早的对比模型。
这使 2.1 更适合那些每增加一次思考步骤就会带来额外延迟或成本的工作流。
来源文章重点介绍了 ibexdream 进行的一项测试。
第一个提示词生成了一幅装饰华丽的钞票风格插画,画面中一位古代哲学家的头发变成了迷宫。
第二个提示词对已有结果进行了编辑:
关键观察是,与用户通常对生成式编辑的预期相比,迷宫、长袍、胡须和整体构图保持得更加稳定。

第三个提示词随后将场景转换为油画风格,同时保留核心构图。

这正是编辑质量比第一张图是否足够惊艳更重要的工作流类型。
商业设计很少在第一次生成后就结束。
它通常要经过一轮又一轮的修改。
第二个重点是一致性。
对于电子商务、广告、连载漫画、社交媒体活动和品牌摄影来说,同一个人物或产品经常需要出现在多个不同场景中。
令人沮丧的失败模式十分常见:
同一个人
→ 姿势不同
→ 人脸发生漂移
→ 再次编辑
→ 服装发生变化
→ 再次编辑
→ 产品细节变形
Nano Banana 2.1 旨在让这些身份在反复生成和编辑过程中保持得更加稳定。
Google 的 API 文档表示,Nano Banana 模型可以在一个工作流中混合使用最多 14 张参考图像。对于 Nano Banana 2.1,模型文档描述了对多物体参考图和人物参考图的高保真支持,但具体推荐组合取决于使用场景。
来源文章将实际设置概括为:在整体参考图像数量限制内,最多使用 10 张物体参考图以及多张人物参考图。
文章引用了 BG-VC 的一项测试。
测试人员提供了:
随后,模型在一个工作流中生成了六个不同场景。

测试人员称,在行走、坐姿和倚靠等姿势中,人脸、服装、手袋和配饰都保持了异常稳定的一致性。
这比单张肖像测试更具商业相关性。
只有当产品在姿势、地点、相机角度或造型发生变化后仍然像原来的产品,产品图像生成才真正有价值。
来源文章还指出,Google 提供的示例图像看起来不那么明显是合成的。
示例包括一只布满水珠的甲虫,以及一名站在粉色建筑楼梯上的绿色连衣裙女性。

变化并不只是“细节更多”。
更可信的真实感取决于多个因素的组合:
Google 官方模型页面称,该更新提升了 1K、2K 和 4K 输出分辨率下的视觉质量和真实感。
它还支持更高分辨率下异常宽的宽高比,并修复了可能影响全景图像的拼接伪影问题。
Nano Banana 2.1 可以在受支持的 API 工作流中使用Google 网页搜索和图片搜索接地。
这对信息图尤其重要。
普通图像模型可能会创建视觉上很有吸引力的图表,同时编造数字、标签或事实关系。
搜索接地让生成工作流有机会在构图之前检索真实信息。
Google 官方模型卡报告的信息图事实准确性如下:

提升幅度很大,但 0.521 并不等于 1.0。
因此,正确的结论不是:
“该模型现在可以自动制作事实准确的信息图。”
而是:
“搜索接地和更新后的模型在 Google 的评测中显著降低了事实错误,但生成式信息图仍然需要人工核验。”
这一点对于教育、新闻、医疗、金融以及任何错误标签可能比糟糕布局造成更大损害的领域都很重要。
这正是这次发布尤其值得关注的地方。
Google 大幅下调了图像输出价格,但与来源文章引用的旧版 Nano Banana 2 定价相比,提高了文本/图像输入以及文本/思考输出的价格。
当前官方 Nano Banana 2.1 Standard API 定价如下:
| 计费项目 | 当前官方价格 |
|---|---|
| 文本/图像/视频输入 | 每 100 万 token 1.50 美元 |
| 文本和思考输出 | 每 100 万 token 7.50 美元 |
| 图像输出 | 每 100 万图像输出 token 30.00 美元 |
| 1K 图像 | 约 0.0336 美元 |
| 2K 图像 | 约 0.0504 美元 |
| 4K 图像 | 约 0.113 美元 |

来源文章将其描述为 Google 把成本从“绘图”转移到了“思考”。
这是一个有用的简化说法。
如果你的工作负载主要是直接生成,较低的图像输出成本可能非常重要。
如果你的工作流使用了:
那么最终成本就不只取决于每张图像的 headline 价格。
原始来源称,4K 输出每张图像的成本约为 0.076 美元。
但 Google 当前定价页面列出的 4K 图像价格为 0.113 美元。
1K 和 2K 的价格仍分别约为 0.0336 美元和 0.0504 美元。
在进行生产预算规划时,应使用实时官方定价页面,而不是发布当天的截图或第三方计算结果。
Google 的模型卡列出了 Nano Banana 2.1 的以下可用渠道:
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
对于开发者来说,API 模型 ID 为:
gemini-nano-banana-2.1
该模型支持图像生成和对话式编辑,包括使用多张图像参考的工作流。
当前 Google 文档还列出了可配置的 Thinking 级别:
minimalmedium — 默认值high来源文章称,旧版 Nano Banana 2 API 将于 10 月 29 日停止服务。
Google 当前的弃用表并未为 gemini-3.1-flash-image 列出这一停止日期。
目前的记录是:
推荐替代模型:gemini-nano-banana-2.1
停止服务日期:尚未公布停止服务日期
这并不意味着旧模型会永久保留。
这意味着开发者不应围绕 10 月 29 日这一日期制定迁移计划,除非 Google 将其加入官方弃用文档。
来源文章随后从官方基准测试转向社区测试。
区分这两者很重要。
官方基准测试告诉我们 Google 如何在定义好的评测设置下衡量模型。
社区测试则展示模型在真实创意工作流中的使用感受。
两者都很有用,但回答的是不同问题。
据报道,Mark Kretschmann 向模型提供了一个刻意设计的困难场景,其中包含:
测试的目的是观察最终结果是否仍然像一张连贯的照片,而不是由多个局部合理的碎片拼成的拼贴画。
这类测试很有价值,因为当多个困难约束同时出现时,图像模型往往容易失败。
Luis Catacora 测试了一块茶馆菜单板,要求同一项目以以下语言呈现:
来源称,模型在一次生成中几乎正确处理了全部文本。

Google 官方模型卡也报告了国际文本渲染能力的提升,因此社区观察与该版本的既定目标一致。
不过,图像中的文本仍然应当进行校对。
来源文章随后展示了一张中文海报,其中大号中文字符很清晰,但一行较小的竖排英文文字已经退化为无法阅读的内容。
这很好地提醒我们,“好得多”并不等于“排版软件”。
这次发布立即引发了与 OpenAI 当前图像产品栈的比较。
OpenAI 于 2026 年 9 月推出了 ChatGPT Images 2.5,并提供两个 API 版本:
gpt-image-2.5-flare,用于快速、高质量的日常生成。gpt-image-2.5-sunburst,用于更精确的详细创意工作。OpenAI 表示,Images 2.5 改进了细节、编辑精度、主体保留、多轮编辑和生成速度。
这意味着 Google 和 OpenAI 正在越来越直接地竞争同一个问题:
模型能否在反复编辑过程中保留已经正确的内容,而不破坏其他部分?
一名测试人员向 Nano Banana 2.1 和 GPT Image 2.5 提供了一个刻意叠加多项脆弱细节的提示词:
在来源文章的并排结果中,Nano Banana 2.1 将大多数要求的细节放置在正确位置,但遗漏了眼镜的颜色,并且肤色发生了变化。

这类比较应当被视为定性比较。
一张图像可以揭示失败模式,但无法证明总体优越性。
另一名测试人员要求 Nano Banana 2.1 和 GPT Image 2 生成同一幅桌面手表场景。
来源称,Google 的结果更像普通的自然光照片,而 OpenAI 的版本更像经过精心制作的广告,采用了更戏剧化的光照和更具风格化的表盘。

这不一定是“更好”与“更差”的结果。
它体现了图像模型之间常见的差异:
哪一种更好取决于工作流。
对于电子商务目录摄影,字面上的准确性可能更重要。
对于营销艺术创作,更强的风格化可能更有用。
来源文章引用了一项 AI/ML API 社区测试,测试使用了五个提示词。
在该测试中,报告的平均值大致如下:
| 模型 | 报告的每张图像耗时 | 报告的每张图像成本 |
|---|---|---|
| Nano Banana 2.1 | 约 11 秒 | 约 0.044 美元 |
| GPT Images 2.5 | 约 50 秒 | 约 0.069 美元 |
同一来源还引用了一项四张太空主题图像测试:据报告,Nano Banana 2.1 的总成本为 0.178 美元,而 GPT Image 2.5 为 0.284 美元。
这些是第三方平台测量结果,不是供应商官方价目表。
多项变量都会改变结果:
在进行生产规划时,应比较计划部署的确切 API 配置,而不是假设一项社区测试可以适用于所有工作负载。
来源文章还重点介绍了中文创作者歸藏的测试。
总体印象是积极的:
一个来源示例乍看之下十分精致。

但放大后可以看到,一行较小的竖排英文已经变成了乱码。
这是一个重要的实际边界。
如果图像将用于真实广告、菜单、标签、包装或公共海报,仍然应当人工检查最终文本,或在设计工具中替换文本。
图像模型在排版方面越来越好,但还不能替代最终校对。
来源文章最后提出了一个更宏观的观察:图像模型之间的竞争正在从“谁能制作出最令人印象深刻的第一张图”,转向“谁能在不破坏图像的情况下持续编辑同一张图”。
这一变化很容易理解。
商业创意工作很少遵循以下模式:
需求
→ 一张图
→ 完成
它通常更像这样:
需求
→ 第 1 版
→ 将产品向左移动
→ 更换衬衫
→ 保持人脸完全一致
→ 替换标牌
→ 更新文本
→ 移除背景人物
→ 改变风格
→ 最终审核
如果第十个版本已经不像第一个版本,那么这个系统对专业迭代来说就不太有用。
OpenAI 的 Images 2.5 发布公告强调了更精确的编辑、更好的主体保留、对图像添加评论以及多轮创意工作流。
Google 的 Nano Banana 2.1 发布则强调基于蒙版的编辑、主体一致性、多参考图编辑和对话式迭代。
两种产品的发展方向正在明显趋同。
商业逻辑很直接。
广告、电子商务、品牌设计和社交内容都需要无休止的修改。
能够在只改变指定区域的同时保留以下内容的模型:
其价值远高于只能生成一张漂亮但不稳定图像的模型。
这有助于解释 Google 为什么不仅通过开发者 API 分发 Nano Banana 2.1,还将其加入 Google Ads 和 Stitch 等产品。
因此,这次发布与其说是在一场单张图像生成的审美比赛中取胜,不如说是在让生成式图像更适合真实的迭代式工作流。
Nano Banana 2.1 是 Google 最新的高效率图像生成与对话式编辑模型,属于 Gemini 3 系列。其 API 模型 ID 为 gemini-nano-banana-2.1,Google 表示该模型基于 Gemini 3.6 Flash 构建。
支持。Google 官方文档列出了 1K、2K 和 4K 输出支持。当前 API 定价页面显示,在 Standard 付费定价下,生成一张 4K 图像的价格约为 0.113 美元。
Google 的图像生成文档表示,Nano Banana 工作流可以混合使用最多 14 张参考图像。对于 2.1,具体限制取决于这些参考图像如何用于人物、物体和多图融合,因此开发者应遵循当前 API 指南,而不能假设全部 14 张参考图像的行为完全相同。
支持。蒙版和笔刷编辑是 Google 模型卡中明确列出的评测类别。在 Google 发布的编辑评测中,2.1 的得分明显高于 Nano Banana 2 和 Nano Banana Pro。
可以。受支持的 Gemini API 图像生成工作流可以使用 Google 网页搜索和图片搜索接地。这对于信息图生成以及其他需要当前信息或事实信息的任务尤其有用。
图像输出按照每百万图像输出 token 30 美元的价格提供,在当前 Standard 定价下,生成 1K 图像的成本约为 0.0336 美元。不过,文本/图像输入和文本/思考输出也分别计费,因此工作流总成本取决于提示词长度、参考图像、推理、接地和迭代次数。
Google 当前的官方弃用页面没有为 gemini-3.1-flash-image 列出 10 月 29 日的停止服务日期。目前页面显示尚未公布停止服务日期,并推荐使用 gemini-nano-banana-2.1 作为替代模型。
没有一个答案适用于所有工作流。来源文章展示了多项社区测试,在速度、真实感、编辑和成本方面,Nano Banana 2.1 都表现强劲;与此同时,OpenAI 官方 Images 2.5 产品栈也强调精确编辑、主体保留和高保真生成。最稳妥的方法是使用自己的提示词、参考图像、分辨率和修改工作流,对两者进行基准测试。
Nano Banana 2.1 的重点并不是创造一个全新的 AI 图像类别,而是修复那些让生成式图像难以用于真实生产的问题:局部编辑、主体漂移、产品不一致、文本渲染、事实型信息图和反复修改。
Google 的官方评测显示,与 Nano Banana 2 和 Nano Banana Pro 相比,该模型在多个生成和编辑类别中取得了显著提升。该模型还结合了 Flash 级部署能力、最多 14 张参考图像、搜索接地以及 1K/2K/4K 输出,使其成为比一次性生成器更实用的创意工具。
当前官方定价也让图像输出成本较低,但总成本仍然取决于输入、推理、接地和分辨率。开发者应使用 Google 的实时定价和弃用页面,而不是发布当天的截图:当前 4K 价格约为 0.113 美元,Google 目前也没有列出 Nano Banana 2 在 10 月 29 日停止服务的安排。
Nano Banana 2.1 与 GPT Image 2.5 之间真正的竞争,已经不只是看谁能生成更漂亮的第一张图,而是看谁能在第十次编辑后,仍然保留原本正确的人物、产品、文本或构图。
从一句话开始,几分钟内拿到完整网站。