引言
谷歌DeepMind发布了三款新的Gemini模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber。
然而,许多开发者期待的 Gemini 3.5 Pro 并未如期到来。
谷歌表示,3.5 Pro仍在与合作伙伴进行测试,待准备就绪后将广泛发布。与此同时,该公司确认已通过其所谓"迄今为止最具雄心的预训练运行"启动了Gemini 4的相关工作。

谷歌推出了Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber。
该发布在开发者社区中迅速引发争议。数位早期用户批评Gemini 3.6 Flash前端输出薄弱、空间推理不一致,且与竞品前沿模型相比编码效果令人失望。
这种批评的激烈程度远超现有证据所能支撑。早期的实际使用抱怨确实存在,但谷歌自身的基准测试结果以及独立的Artificial Analysis测试则显示出一幅更为复杂的图景:Gemini 3.6 Flash在多项编码、计算机使用、长上下文和知识工作评估中相比3.5 Flash有所提升,同时保持了相同的总体Artificial Analysis智能指数评分。
本文遵循原始报告的结构,同时将官方基准数据与社区反应区分开来。
Gemini 3.6 Flash 一经发布便招致批评
谷歌将 Gemini 3.6 Flash 定位为面向生产环境AI代理的主力模型。
该模型现已广泛可用,支持文本、图像、视频、音频和PDF输入,上下文窗口为 1,048,576 输入token,最多 65,536 输出token。它支持的功能包括代码执行、计算机使用、函数调用、文件搜索、结构化输出、搜索接地、URL上下文和思维推理。
谷歌表示其主要目标不仅仅是实现更高的基准智能。重点在于以比Gemini 3.5 Flash更少的输出token、更少的推理步骤、更低的延迟以及更低的输出token价格来完成任务。
尽管如此,一些最初的公开测试结果远非积极。
前端生成收到严厉的早期反馈
原始报告着重提到了一项开发者测试,其中Gemini 3.6 Flash被要求完成一项两-shot的前端生成任务。
该开发者描述此结果为异常糟糕,批评生成的应用程序组件结构支离破碎、逻辑不一致且交互不可靠。

一次早期社区测试使用 Gemini 3.6 Flash 生成了交互式前端体验。
其他开发者在现有代码库上尝试该模型后也报告了类似问题。抱怨包括忽略设计系统约束、意外的 UI 变化,以及结果看起来比早期 Gemini Pro 模型生成的界面更差。
这些观察之所以重要,是因为前端编码同时结合了多种能力:
- 理解现有代码库
- 遵循设计约束
- 生成有效代码
- 保留现有行为
- 创建视觉连贯的布局
- 处理多步编辑而不破坏工作组件
一个模型可能在编程基准测试中得分很高,但在实际前端工作中仍可能感觉不可靠。
与此同时,个例展示并非受控的基准测试。提示质量、代理框架、代码库结构、思考水平、工具访问权限以及允许的迭代次数都可能显著改变结果。
前端竞技场结果尚不支持简单的“最佳”论断
源报告指出,在前端编码方面,Gemini 3.6 Flash 的表现不如 Claude Fable 5、GPT-5.6 Sol 和 Meta Muse Spark 1.1 等模型。
WebDev 实时竞技场排行榜持续更新,因此随着更多投票的到来,排名可能会发生变化。在本稿准备时,Kimi K3 仍暂居领先地位,其次是 Claude Fable 5 和 GPT-5.6 Sol。
由于 Gemini 3.6 Flash 于 7 月 21 日才发布,静态截图和早期排行榜快照不应被视为永久排名。
更有用的结论是,尽管谷歌称该模型在编码方面更强,但这款新的 Flash 模型并未立即确立其作为明确前端领导者的地位。
空间推理也引发负面反应
源报告随后转向空间推理。
一位开发者记录了 Gemini 3.6 Flash 在基本位置和方向关系上的测试,并报告错误数量多于 Gemini 3.5 Flash。
该用户最初怀疑较弱输出是否因未选择高思考水平所致。其他用户随后尝试了更高的推理设置,但仍报告了喜忧参半的初步印象。
抱怨包括空间关系不正确和视觉场景不一致。
这些测试再次代表的是社区观察,而非标准化评估。它们作为现实世界摩擦的案例很有用,但不应推广为模型在空间推理上普遍退步的论断。
谷歌官方文档将 Gemini 3.6 Flash 描述为专为多模态和空间任务设计。独立视觉测试也发现其在多个图像和视频类别中有优势,尽管并非所有视觉任务都优于 3.5 Flash。
CursorBench 显示相比 3.5 Flash 有改进,但未达前沿领先地位
源报告还指出了 CursorBench,这是一项针对现实
在 Cursor 环境中的软件工程工作。
一张广为流传的截图将 Gemini 3.6 Flash 与 Cursor Composer 2.5、Claude Fable 5、GPT-5.6 Sol、Grok 4.5 和 Claude Sonnet 5 等模型进行了对比。

在消息源分享的截图中,CursorBench 将 Gemini 3.6 Flash 置于几个得分更高的编码模型之后。
当前的 CursorBench 页面显示了 Gemini 3.6 Flash 的几个推理层级。在编写此内容时可用的最新已发布结果中:
- Gemini 3.6 Flash Medium 得分 51.2%
- Gemini 3.5 Flash 得分 48.8%
- Gemini 3.6 Flash Low 得分 47.4%
这意味着在该基准测试中,中等推理配置相较于 Gemini 3.5 Flash 有所提升,尽管它仍落后于许多更强的编码模型。
这也是说明模型评估需要结合上下文的一个很好的例子。
“Gemini 3.6 Flash 比竞争对手差”这一论断,对于特定的基准测试和比较集来说可能是正确的;同时,“Gemini 3.6 Flash 相较于 3.5 Flash 有所改进”也可能成立。
谷歌自有基准测试显示真实进步
谷歌公布的评估结果,比社区最严厉的反应描绘出了更加积极的图景。
该公司报告称,在编码、机器学习工程、计算机使用、知识工作、图表推理和长上下文任务方面,相较于 Gemini 3.5 Flash 均有改进。

谷歌于2026年7月公布的基准测试表,将 Gemini 3.6 Flash 与几个竞品模型进行了对比。
谷歌报告的部分选定结果包括:
| 基准测试 | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| SWE-Bench Pro | 58.7% | 55.1% |
| DeepSWE v1.1 | 49% | 37% |
| Terminal-Bench 2.1 | 78.0% | 76.2% |
| MLE-Bench | 63.9% | 49.7% |
| GDPval-AA v2 | 1421 | 1349 |
| OSWorld-Verified | 83.0% | 78.4% |
| CharXiv 推理,无工具 | 85.2% | 84.2% |
| GDM-MRCR v2,128K | 91.8% | 77.3% |
| GDM-MRCR v2,1M | 54.0% | 26.6% |
谷歌还表示,在 Artificial Analysis Index 上,Gemini 3.6 Flash 比 Gemini 3.5 Flash 少消耗 17% 的输出 token,并且在某些 DeepSWE 工作负载中,token 使用量可减少多达 65%。
新模型的定价为:
- 每 100 万个输入 token 1.50 美元
- 每 100 万个输出 token 7.50 美元
Gemini 3.5 Flash 具有相同的列示输入价格,但在谷歌的定价中,输出价格为更高的 9.00 美元。
启动对比。
对于智能体工作负载而言,这种区别很重要,因为成本不仅取决于基准测试质量,还取决于模型完成任务所用到的推理令牌数和工具循环次数。
Artificial Analysis 给 3.6 Flash 的智能评分与 3.5 Flash 相同
第三方测试给出了一个更为克制的结论。
Artificial Analysis 给 Gemini 3.6 Flash(高推理模式)的 智能指数评分为 50。
这与 Gemini 3.5 Flash 的得分相同。

Artificial Analysis 发现,从 3.5 Flash 到 3.6 Flash,其整体智能指数评分并无提升。
该结果解释了部分失望情绪的原因。
仅看模型编号的开发者可能期望整体智能有明显跃升。相反,Artificial Analysis 发现,在衡量效率和任务完成时间的改进时,其整体智能水平大致相同。
其测试显示,Gemini 3.6 Flash 的速率约为 每秒 251 个输出令牌,使其成为比较中速度最快的模型之一。
Artificial Analysis 还报告称,Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 的每任务耗时均比前代产品缩短约一半。
因此,主要的改进更准确地描述为:
整体智能相似,完成速度更快,输出令牌更少,许多工作负载的每完成任务成本更低。
这不如重大智能突破那样引人注目,但对于高容量的生产级智能体而言,仍然具有重要意义。
性价比比网络上的抱怨所暗示的要更微妙
一些用户批评 Gemini 3.6 Flash 比某些在智能基准测试中得分更高的竞品模型更贵。

该来源指出了对 Gemini 3.6 Flash 在成本与智能权衡方面的担忧。
原始的每令牌定价并不能说明全部问题。
一个使用较少推理步骤或较少输出令牌的模型,有时即使其公布的令牌价格并非最低,也能更便宜地完成任务。
相反,一个更便宜的模型如果需要反复重试或更长的生成,在实际使用中可能会变得更贵。
几分钟搭建展示站并增长获客
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
对开发者而言,更好的衡量指标通常是基于自身工作负载测量的 每次成功任务成本。
关于
知识截止日期需要更多证据
源文章还引用了一位用户的说法,该用户声称Gemini 3.6 Flash对2025年和2026年的许多事件一无所知,尽管它表面上显示出了更新的知识日期。
该用户得出结论,该模型的实际知识似乎止步于2025年1月左右。
我们应该谨慎对待这一测试。
一个语言模型无法回忆某个事件,其本身并不能证明其训练数据有特定的截止日期。模型可能出现这种情况的原因包括:检索行为、推理错误、提示措辞、安全过滤、训练覆盖不全面或不确定性。
谷歌公开的模型文档并未提供足够信息,来独立证实社交媒体测试中声称的那个具体截止日期。
对于当前信息,开发者应使用谷歌搜索作为依据或通过其他经过验证的检索来源,而不是假设模型内部记忆截止到某个特定日期之前都是完整的。
Gemini 3.5 Flash-Lite 聚焦速度
谷歌还发布了 Gemini 3.5 Flash-Lite,专为高吞吐量、低延迟的智能体工作负载而设计。
人工智能分析机构测得该模型的速度约为每秒输出 350 个词元。
谷歌列出的API价格为:
- 每100万个输入词元 0.30 美元
- 每100万个输出词元 2.50 美元
这使其比Gemini 3.6 Flash便宜得多。
该模型适用于以下工作负载:
- 智能体搜索
- 文档处理
- 高吞吐量数据提取
- 翻译
- 摘要生成
- 子智能体执行
谷歌表示,Flash-Lite 还支持可配置的思考级别和内置的计算机使用功能。
其官方对比显示,与Gemini 3.1 Flash-Lite相比有显著提升,包括:
- 终端基准测试 2.1:54% 对比 31%
- GDM-MRCR v2:72.2% 对比 60.1%
- GDPval-AA v2:1140 对比 642
它在几项智能体基准测试上甚至超过了旧款Gemini 3 Flash。
最初的报道认为,如果答案错误,那么速度再快也无济于事。作为一般原则,这是公平的,但基准测试的证据并不支持将Flash-Lite简单视为“更快但更差”的模型。
谷歌声明的目标不同:在不需要完整前沿智能能力的高吞吐量工作负载中使用更小的模型。
Gemini 3.5 Flash Cyber 聚焦漏洞研究
第三个新模型是 Gemini 3.5 Flash Cyber。
它基于Gemini 3.5 Flash构建,并针对网络安全工作进行了微调,例如:
- 寻找软件漏洞
- 验证安全问题
- 生成补丁
- 支持自动化防御分析
谷歌表示,该模型在 CodeMender 内部使用,多个 Flash Cyber 智能体可以协同工作,并将各自的发现合并到一份报告中。
与Gemini 3.6 Flash和Flash-Lite不同,Flash Cyber 并未作为通用公共模型发布。
谷歌表示,由于自动化漏洞发现带来的双重用途风险,它将通过受限访问的 CodeMender 试点项目向政府和受信任的合作伙伴提供。
谷歌DeepMind的单独公告称,该模型旨在让大规模漏洞发现和修补比使用更大的前沿模型更便宜。
Gemini 3.5 Pro 仍未就绪
对许多开发者而言,最大的新闻是那个没有发布的模型。谷歌表示:
Gemini 3.5 Pro 目前正与合作伙伴进行测试,一旦准备就绪,将向大众广泛开放。
这证实了旗舰模型相较于早前预期有所延迟。路透社等媒体报道称,Gemini 3.5 Pro 原定于六月发布,编码性能是导致延迟的领域之一。谷歌在7月21日的公告中并未给出新的公开发布日期,而是强调希望在模型达到其质量标准时再发布。
这对于 3.6 Flash 的发布至关重要。这款新的 Flash 模型并非 Gemini 3.5 Pro 的替代品,它在产品线中占据不同位置:这是一款面向生产的模型,针对成本、速度、多模态任务和自主执行进行了优化。
Gemini 4 已启动其最大规模的预训练
与此同时,谷歌确认已开始训练下一代 Gemini。谷歌将 Gemini 4 描述为 迄今为止最雄心勃勃的预训练项目。

谷歌表示其 Gemini 4 预训练工作已在进行中。
这形成了一个不寻常的产品时间线:
- Gemini 3.6 Flash 现已普遍可用。
- Gemini 3.5 Flash-Lite 现已普遍可用。
- Gemini 3.5 Flash Cyber 进入有限部署阶段。
- Gemini 3.5 Pro 仍在与合作伙伴测试。
- Gemini 4 预训练已经开始。
消息来源文章将此解读为,谷歌在其旗舰 Pro 模型尚未完成的情况下,正急于推进版本号。这种解读属于推测。大型 AI 组织通常会在当前代际所有产品完成发布流程之前,就开始训练未来代际的模型。预训练、后训练、安全评估、产品集成和服务部署可以并行推进。
尽管如此,Pro 版本的延迟发布显然增加了谷歌的压力,因为编码和自主工作流已成为 OpenAI、Anthropic、Moonshot、xAI、Meta 及其他模型提供商的主要竞争领域。
Gemini 3.6 Flash 真的是谷歌最差的模型吗?
现有证据并不支持这一结论。目前有三件独立的事情同时发生。
- 一些早期开发者确实不喜欢该模型
负面的前端和空间推理测试结果来自真实的用户报告。这些报告值得关注,因为基准测试无法完全反映生产质量。
- 谷歌自身数据显示出相对于 3.5 Flash 的显著改进
该模型在 DeepSWE、MLE-Bench、OSWorld、GDPval 和长上下文评估中均有提升,同时使用了更少的输出 tokens。
- 第三方综合智能指标几乎未变
Artificial Analysis 给 3.6 Flash 的评分为
其智能指数得分与 3.5 Flash 相同。这支持了一个观点:本次发布主要侧重效率提升,而非原始智能的重大飞跃。
对于开发者而言,正确的问题并非该模型是否配得上一个引人注目的标签。
更恰当的问题是:速度、成本、质量和可靠性的组合,是否适用于特定应用场景。
Gemini 3.6 Flash 可能不适合某个前端工作流,但对于高吞吐量的多模态智能体而言却是不错的选择。这两种情况并不矛盾。
常见问题
什么是 Gemini 3.6 Flash?
Gemini 3.6 Flash 是谷歌面向生产环境的多模态模型,适用于编程、知识工作、计算机使用及智能体工作流。它支持超过 100 万输入 token 的上下文窗口,可通过 Gemini API 及其他谷歌产品公开使用。
Gemini 3.6 Flash 比 Gemini 3.5 Flash 更差吗?
整体而言并非如此。Artificial Analysis 给两者打出了相同的智能指数得分,但谷歌报告称,3.6 Flash 在多个编程、计算机使用、知识工作和长上下文基准测试上有所改进,同时使用的输出 token 更少。
开发者为何批评 Gemini 3.6 Flash?
部分早期用户反馈前端生成能力薄弱、UI 编辑易出错、空间推理不一致。这些属于单次测试而非受控基准测试,因此结果可能因提示词、代码库、工具及思考层级而异。
Gemini 3.6 Flash 的价格是多少?
谷歌标价 Gemini 3.6 Flash 为每百万输入 token 1.50 美元,每百万输出 token 7.50 美元。价格可能变动,开发者应查阅 Gemini API 官方文档确认当前费率。
Gemini 3.5 Flash-Lite 的速度如何?
Artificial Analysis 测得 Gemini 3.5 Flash-Lite 每秒约处理 350 个输出 token。谷歌将其设计用于高吞吐、低延迟任务,如文档处理和智能体搜索。
什么是 Gemini 3.5 Flash Cyber?
Gemini 3.5 Flash Cyber 是基于 Gemini 3.5 Flash 的网络安全专用模型。谷歌计划通过 CodeMender 向政府及受信合作伙伴提供,而非作为通用公开 API 模型发布。
Gemini 3.5 Pro 何时发布?
谷歌尚未公布新的公开发布日期。公司表示 Gemini 3.5 Pro 正在与合作伙伴进行测试,待准备就绪后便会广泛发布。
谷歌已在训练 Gemini 4 吗?
是的。谷歌表示已启动 Gemini 4 迄今为止最雄心勃勃的预训练计划。该公司尚未公布 Gemini 4 的公开发布日期。
相关工具
- Google AI Studio:谷歌基于浏览器的环境,用于测试 Gemini 模型并通过 Gemini API 进行构建。
- Gemini API:Gemini 3.6 Flash 功能、限制及模型标识符的官方开发者文档。
- Gemini:谷歌面向消费者的界面,用于使用当前 Gemini 模型。
- Vertex AI:谷歌云的企业级平台,用于部署和管理 Gemini 模型。
CursorBench:Cursor 用于评估代码库理解、编辑、调试及智能软件工程任务的基准测试平台。
- Artificial Analysis:独立模型测试,涵盖智能水平、速度、延迟、定价及 Token 使用情况。
- CodeMender:谷歌 DeepMind 基于 Gemini 3.5 Flash Cyber 构建的安全智能体环境。
相关链接
- 谷歌官方:Gemini 3.6 Flash、3.5 Flash-Lite 及 3.5 Flash Cyber 发布介绍:官方发布公告、定价、基准测试结果及可用性详情。
- Gemini 3.6 Flash 开发者文档:官方模型限制、支持模态、工具及 API 细节。
- 谷歌最新 Gemini 模型指南:Gemini 3.6 Flash 与 Gemini 3.5 Flash-Lite 的官方迁移及使用指南。
- Artificial Analysis 对 Gemini 3.6 Flash 的测评:独立的智能水平、速度、延迟及价格测量数据。
- Artificial Analysis 发布评估:3.6 Flash 和 3.5 Flash-Lite 与上一代模型的详细对比。
- CursorBench:Gemini 3.6 Flash 及竞品模型的当前编码智能体基准测试结果。
- 谷歌 DeepMind:Gemini 3.5 Flash Cyber 发布:网络安全模型、CodeMender 集成及受限部署的官方说明。
总结
谷歌 7 月发布的 Gemini 系列包括 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber,而 Gemini 3.5 Pro 仍处于合作伙伴测试阶段。
早期开发者对 3.6 Flash 在前端及空间推理测试中的反应异常负面,且该模型并未在最强编码基准测试中领先。然而,谷歌公布的测试结果显示,该模型在多个重要任务上相较 3.5 Flash 有明显提升,而 Artificial Analysis 也证实其在保持相同综合智能得分的同时,拥有更优的速度和效率。
Gemini 3.5 Flash-Lite 针对高吞吐量任务,Flash Cyber 专注于防御性安全领域,且谷歌已启动 Gemini 4 的预训练工作。
最准确的解读并非 Gemini 3.6 Flash 是谷歌“最差模型”,而是一次以效率为核心的发布——其实际早期市场反响远比谷歌官方基准测试所呈现的结果更为复杂。



