Google DeepMind 发布了三款新的 Gemini 模型:**Gemini 3.6 Flash**、**Gemini 3.5 Flash-Lite** 和 **Gemini 3.5 Flash Cyber**。但许多开发者期待的 **Gemini 3.5 Pro** 并...

谷歌DeepMind发布了三款新的Gemini模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber。
然而,许多开发者期待的 Gemini 3.5 Pro 并未如期到来。
谷歌表示,3.5 Pro仍在与合作伙伴进行测试,待准备就绪后将广泛发布。与此同时,该公司确认已通过其所谓"迄今为止最具雄心的预训练运行"启动了Gemini 4的相关工作。

谷歌推出了Gemini 3.6 Flash、Gemini 3.5 Flash-Lite和Gemini 3.5 Flash Cyber。
该发布在开发者社区中迅速引发争议。数位早期用户批评Gemini 3.6 Flash前端输出薄弱、空间推理不一致,且与竞品前沿模型相比编码效果令人失望。
这种批评的激烈程度远超现有证据所能支撑。早期的实际使用抱怨确实存在,但谷歌自身的基准测试结果以及独立的Artificial Analysis测试则显示出一幅更为复杂的图景:Gemini 3.6 Flash在多项编码、计算机使用、长上下文和知识工作评估中相比3.5 Flash有所提升,同时保持了相同的总体Artificial Analysis智能指数评分。
本文遵循原始报告的结构,同时将官方基准数据与社区反应区分开来。
谷歌将 Gemini 3.6 Flash 定位为面向生产环境AI代理的主力模型。
该模型现已广泛可用,支持文本、图像、视频、音频和PDF输入,上下文窗口为 1,048,576 输入token,最多 65,536 输出token。它支持的功能包括代码执行、计算机使用、函数调用、文件搜索、结构化输出、搜索接地、URL上下文和思维推理。
谷歌表示其主要目标不仅仅是实现更高的基准智能。重点在于以比Gemini 3.5 Flash更少的输出token、更少的推理步骤、更低的延迟以及更低的输出token价格来完成任务。
尽管如此,一些最初的公开测试结果远非积极。
原始报告着重提到了一项开发者测试,其中Gemini 3.6 Flash被要求完成一项两-shot的前端生成任务。
该开发者描述此结果为异常糟糕,批评生成的应用程序组件结构支离破碎、逻辑不一致且交互不可靠。

一次早期社区测试使用 Gemini 3.6 Flash 生成了交互式前端体验。
其他开发者在现有代码库上尝试该模型后也报告了类似问题。抱怨包括忽略设计系统约束、意外的 UI 变化,以及结果看起来比早期 Gemini Pro 模型生成的界面更差。
这些观察之所以重要,是因为前端编码同时结合了多种能力:
一个模型可能在编程基准测试中得分很高,但在实际前端工作中仍可能感觉不可靠。
与此同时,个例展示并非受控的基准测试。提示质量、代理框架、代码库结构、思考水平、工具访问权限以及允许的迭代次数都可能显著改变结果。
源报告指出,在前端编码方面,Gemini 3.6 Flash 的表现不如 Claude Fable 5、GPT-5.6 Sol 和 Meta Muse Spark 1.1 等模型。
WebDev 实时竞技场排行榜持续更新,因此随着更多投票的到来,排名可能会发生变化。在本稿准备时,Kimi K3 仍暂居领先地位,其次是 Claude Fable 5 和 GPT-5.6 Sol。
由于 Gemini 3.6 Flash 于 7 月 21 日才发布,静态截图和早期排行榜快照不应被视为永久排名。
更有用的结论是,尽管谷歌称该模型在编码方面更强,但这款新的 Flash 模型并未立即确立其作为明确前端领导者的地位。
源报告随后转向空间推理。
一位开发者记录了 Gemini 3.6 Flash 在基本位置和方向关系上的测试,并报告错误数量多于 Gemini 3.5 Flash。
该用户最初怀疑较弱输出是否因未选择高思考水平所致。其他用户随后尝试了更高的推理设置,但仍报告了喜忧参半的初步印象。
抱怨包括空间关系不正确和视觉场景不一致。
这些测试再次代表的是社区观察,而非标准化评估。它们作为现实世界摩擦的案例很有用,但不应推广为模型在空间推理上普遍退步的论断。
谷歌官方文档将 Gemini 3.6 Flash 描述为专为多模态和空间任务设计。独立视觉测试也发现其在多个图像和视频类别中有优势,尽管并非所有视觉任务都优于 3.5 Flash。
源报告还指出了 CursorBench,这是一项针对现实
在 Cursor 环境中的软件工程工作。
一张广为流传的截图将 Gemini 3.6 Flash 与 Cursor Composer 2.5、Claude Fable 5、GPT-5.6 Sol、Grok 4.5 和 Claude Sonnet 5 等模型进行了对比。

在消息源分享的截图中,CursorBench 将 Gemini 3.6 Flash 置于几个得分更高的编码模型之后。
当前的 CursorBench 页面显示了 Gemini 3.6 Flash 的几个推理层级。在编写此内容时可用的最新已发布结果中:
这意味着在该基准测试中,中等推理配置相较于 Gemini 3.5 Flash 有所提升,尽管它仍落后于许多更强的编码模型。
这也是说明模型评估需要结合上下文的一个很好的例子。
“Gemini 3.6 Flash 比竞争对手差”这一论断,对于特定的基准测试和比较集来说可能是正确的;同时,“Gemini 3.6 Flash 相较于 3.5 Flash 有所改进”也可能成立。
谷歌公布的评估结果,比社区最严厉的反应描绘出了更加积极的图景。
该公司报告称,在编码、机器学习工程、计算机使用、知识工作、图表推理和长上下文任务方面,相较于 Gemini 3.5 Flash 均有改进。

谷歌于2026年7月公布的基准测试表,将 Gemini 3.6 Flash 与几个竞品模型进行了对比。
谷歌报告的部分选定结果包括:
| 基准测试 | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| SWE-Bench Pro | 58.7% | 55.1% |
| DeepSWE v1.1 | 49% | 37% |
| Terminal-Bench 2.1 | 78.0% | 76.2% |
| MLE-Bench | 63.9% | 49.7% |
| GDPval-AA v2 | 1421 | 1349 |
| OSWorld-Verified | 83.0% | 78.4% |
| CharXiv 推理,无工具 | 85.2% | 84.2% |
| GDM-MRCR v2,128K | 91.8% | 77.3% |
| GDM-MRCR v2,1M | 54.0% | 26.6% |
谷歌还表示,在 Artificial Analysis Index 上,Gemini 3.6 Flash 比 Gemini 3.5 Flash 少消耗 17% 的输出 token,并且在某些 DeepSWE 工作负载中,token 使用量可减少多达 65%。
新模型的定价为:
Gemini 3.5 Flash 具有相同的列示输入价格,但在谷歌的定价中,输出价格为更高的 9.00 美元。
启动对比。
对于智能体工作负载而言,这种区别很重要,因为成本不仅取决于基准测试质量,还取决于模型完成任务所用到的推理令牌数和工具循环次数。
第三方测试给出了一个更为克制的结论。
Artificial Analysis 给 Gemini 3.6 Flash(高推理模式)的 智能指数评分为 50。
这与 Gemini 3.5 Flash 的得分相同。

Artificial Analysis 发现,从 3.5 Flash 到 3.6 Flash,其整体智能指数评分并无提升。
该结果解释了部分失望情绪的原因。
仅看模型编号的开发者可能期望整体智能有明显跃升。相反,Artificial Analysis 发现,在衡量效率和任务完成时间的改进时,其整体智能水平大致相同。
其测试显示,Gemini 3.6 Flash 的速率约为 每秒 251 个输出令牌,使其成为比较中速度最快的模型之一。
Artificial Analysis 还报告称,Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 的每任务耗时均比前代产品缩短约一半。
因此,主要的改进更准确地描述为:
整体智能相似,完成速度更快,输出令牌更少,许多工作负载的每完成任务成本更低。
这不如重大智能突破那样引人注目,但对于高容量的生产级智能体而言,仍然具有重要意义。
一些用户批评 Gemini 3.6 Flash 比某些在智能基准测试中得分更高的竞品模型更贵。

该来源指出了对 Gemini 3.6 Flash 在成本与智能权衡方面的担忧。
原始的每令牌定价并不能说明全部问题。
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
一个使用较少推理步骤或较少输出令牌的模型,有时即使其公布的令牌价格并非最低,也能更便宜地完成任务。
相反,一个更便宜的模型如果需要反复重试或更长的生成,在实际使用中可能会变得更贵。
对开发者而言,更好的衡量指标通常是基于自身工作负载测量的 每次成功任务成本。
源文章还引用了一位用户的说法,该用户声称Gemini 3.6 Flash对2025年和2026年的许多事件一无所知,尽管它表面上显示出了更新的知识日期。
该用户得出结论,该模型的实际知识似乎止步于2025年1月左右。
我们应该谨慎对待这一测试。
一个语言模型无法回忆某个事件,其本身并不能证明其训练数据有特定的截止日期。模型可能出现这种情况的原因包括:检索行为、推理错误、提示措辞、安全过滤、训练覆盖不全面或不确定性。
谷歌公开的模型文档并未提供足够信息,来独立证实社交媒体测试中声称的那个具体截止日期。
对于当前信息,开发者应使用谷歌搜索作为依据或通过其他经过验证的检索来源,而不是假设模型内部记忆截止到某个特定日期之前都是完整的。
谷歌还发布了 Gemini 3.5 Flash-Lite,专为高吞吐量、低延迟的智能体工作负载而设计。
人工智能分析机构测得该模型的速度约为每秒输出 350 个词元。
谷歌列出的API价格为:
这使其比Gemini 3.6 Flash便宜得多。
该模型适用于以下工作负载:
谷歌表示,Flash-Lite 还支持可配置的思考级别和内置的计算机使用功能。
其官方对比显示,与Gemini 3.1 Flash-Lite相比有显著提升,包括:
它在几项智能体基准测试上甚至超过了旧款Gemini 3 Flash。
最初的报道认为,如果答案错误,那么速度再快也无济于事。作为一般原则,这是公平的,但基准测试的证据并不支持将Flash-Lite简单视为“更快但更差”的模型。
谷歌声明的目标不同:在不需要完整前沿智能能力的高吞吐量工作负载中使用更小的模型。
第三个新模型是 Gemini 3.5 Flash Cyber。
它基于Gemini 3.5 Flash构建,并针对网络安全工作进行了微调,例如:
谷歌表示,该模型在 CodeMender 内部使用,多个 Flash Cyber 智能体可以协同工作,并将各自的发现合并到一份报告中。
与Gemini 3.6 Flash和Flash-Lite不同,Flash Cyber 并未作为通用公共模型发布。
谷歌表示,由于自动化漏洞发现带来的双重用途风险,它将通过受限访问的 CodeMender 试点项目向政府和受信任的合作伙伴提供。
谷歌DeepMind的单独公告称,该模型旨在让大规模漏洞发现和修补比使用更大的前沿模型更便宜。
对许多开发者而言,最大的新闻是那个没有发布的模型。谷歌表示:
Gemini 3.5 Pro 目前正与合作伙伴进行测试,一旦准备就绪,将向大众广泛开放。
这证实了旗舰模型相较于早前预期有所延迟。路透社等媒体报道称,Gemini 3.5 Pro 原定于六月发布,编码性能是导致延迟的领域之一。谷歌在7月21日的公告中并未给出新的公开发布日期,而是强调希望在模型达到其质量标准时再发布。
这对于 3.6 Flash 的发布至关重要。这款新的 Flash 模型并非 Gemini 3.5 Pro 的替代品,它在产品线中占据不同位置:这是一款面向生产的模型,针对成本、速度、多模态任务和自主执行进行了优化。
与此同时,谷歌确认已开始训练下一代 Gemini。谷歌将 Gemini 4 描述为 迄今为止最雄心勃勃的预训练项目。

谷歌表示其 Gemini 4 预训练工作已在进行中。
这形成了一个不寻常的产品时间线:
消息来源文章将此解读为,谷歌在其旗舰 Pro 模型尚未完成的情况下,正急于推进版本号。这种解读属于推测。大型 AI 组织通常会在当前代际所有产品完成发布流程之前,就开始训练未来代际的模型。预训练、后训练、安全评估、产品集成和服务部署可以并行推进。
尽管如此,Pro 版本的延迟发布显然增加了谷歌的压力,因为编码和自主工作流已成为 OpenAI、Anthropic、Moonshot、xAI、Meta 及其他模型提供商的主要竞争领域。
现有证据并不支持这一结论。目前有三件独立的事情同时发生。
负面的前端和空间推理测试结果来自真实的用户报告。这些报告值得关注,因为基准测试无法完全反映生产质量。
该模型在 DeepSWE、MLE-Bench、OSWorld、GDPval 和长上下文评估中均有提升,同时使用了更少的输出 tokens。
Artificial Analysis 给 3.6 Flash 的评分为
其智能指数得分与 3.5 Flash 相同。这支持了一个观点:本次发布主要侧重效率提升,而非原始智能的重大飞跃。
对于开发者而言,正确的问题并非该模型是否配得上一个引人注目的标签。
更恰当的问题是:速度、成本、质量和可靠性的组合,是否适用于特定应用场景。
Gemini 3.6 Flash 可能不适合某个前端工作流,但对于高吞吐量的多模态智能体而言却是不错的选择。这两种情况并不矛盾。
Gemini 3.6 Flash 是谷歌面向生产环境的多模态模型,适用于编程、知识工作、计算机使用及智能体工作流。它支持超过 100 万输入 token 的上下文窗口,可通过 Gemini API 及其他谷歌产品公开使用。
整体而言并非如此。Artificial Analysis 给两者打出了相同的智能指数得分,但谷歌报告称,3.6 Flash 在多个编程、计算机使用、知识工作和长上下文基准测试上有所改进,同时使用的输出 token 更少。
部分早期用户反馈前端生成能力薄弱、UI 编辑易出错、空间推理不一致。这些属于单次测试而非受控基准测试,因此结果可能因提示词、代码库、工具及思考层级而异。
谷歌标价 Gemini 3.6 Flash 为每百万输入 token 1.50 美元,每百万输出 token 7.50 美元。价格可能变动,开发者应查阅 Gemini API 官方文档确认当前费率。
Artificial Analysis 测得 Gemini 3.5 Flash-Lite 每秒约处理 350 个输出 token。谷歌将其设计用于高吞吐、低延迟任务,如文档处理和智能体搜索。
Gemini 3.5 Flash Cyber 是基于 Gemini 3.5 Flash 的网络安全专用模型。谷歌计划通过 CodeMender 向政府及受信合作伙伴提供,而非作为通用公开 API 模型发布。
谷歌尚未公布新的公开发布日期。公司表示 Gemini 3.5 Pro 正在与合作伙伴进行测试,待准备就绪后便会广泛发布。
是的。谷歌表示已启动 Gemini 4 迄今为止最雄心勃勃的预训练计划。该公司尚未公布 Gemini 4 的公开发布日期。
CursorBench:Cursor 用于评估代码库理解、编辑、调试及智能软件工程任务的基准测试平台。
谷歌 7 月发布的 Gemini 系列包括 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber,而 Gemini 3.5 Pro 仍处于合作伙伴测试阶段。
早期开发者对 3.6 Flash 在前端及空间推理测试中的反应异常负面,且该模型并未在最强编码基准测试中领先。然而,谷歌公布的测试结果显示,该模型在多个重要任务上相较 3.5 Flash 有明显提升,而 Artificial Analysis 也证实其在保持相同综合智能得分的同时,拥有更优的速度和效率。
Gemini 3.5 Flash-Lite 针对高吞吐量任务,Flash Cyber 专注于防御性安全领域,且谷歌已启动 Gemini 4 的预训练工作。
最准确的解读并非 Gemini 3.6 Flash 是谷歌“最差模型”,而是一次以效率为核心的发布——其实际早期市场反响远比谷歌官方基准测试所呈现的结果更为复杂。
从一句话开始,几分钟内拿到完整网站。