谷歌的发布信息以效率为核心。该公司表示,新的Flash模型能够用更少的输出令牌、更少的工具调用以及更低的执行循环开销来完成任务。价格也低于Gemini 3.5 Flash。

谷歌推出了三款新的Gemini模型,分别针对代理市场的不同领域:
谷歌的发布信息以效率为核心。该公司表示,新的Flash模型能够用更少的输出令牌、更少的工具调用以及更低的执行循环开销来完成任务。价格也低于Gemini 3.5 Flash。
这部分说法得到了谷歌内部基准测试和早期独立测试的支持。
更复杂的问题是,Gemini 3.6 Flash是否比其替代的模型在智能方面有实质性的提升。
Artificial Analysis 在其综合智能指数中测得新模型的得分与Gemini 3.5 Flash相同。早期用户也反馈了喜忧参半的体验,尤其是在视觉设计、中文生成、工具选择和指令遵循方面。
结果并非简单的失败。Gemini 3.6 Flash看起来速度更快、输出更简洁,并且在许多工作负载中每完成一项任务的成本更低。它还改进了多项编码、计算机使用、机器学习以及知识工作的基准测试。
但这次发布说明了一个重要的区别:
一个模型可以在通用智能或主观输出质量没有同样大幅提升的情况下,变得更具效率。

| 模型 | 主要作用 | 每百万令牌API价格 | 默认思考级别 | 可用性 |
|---|---|---|---|---|
| Gemini 3.6 Flash | 编码、多模态工作和复杂代理工作流 | 输入$1.50 / 输出$7.50 | 中等 | 全面可用 |
| Gemini 3.5 Flash-Lite | 高容量提取、搜索、翻译、路由和子代理 | 输入$0.30 / 输出$2.50 | 最少 | 全面可用 |
| Gemini 3.5 Flash Cyber | 漏洞发现、验证和修补 | 未公开发布 | 专业化 | 面向政府和信任合作伙伴的有限试点 |
Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 均支持:
谷歌的模型卡将这两款普遍可用模型的知识截止日期列为 2026年3月。
Gemini 3.6 Flash 基于
Gemini 3.5 Flash,旨在替代它处理许多编码、知识工作、多模态和智能体工作负载。
最一致的改进是效率。
谷歌报告称,在人工智能分析指数上,Gemini 3.6 Flash 使用的输出 Token 比 Gemini 3.5 Flash 少 17%。在一些智能体编码评估(包括 DeepSWE)中,谷歌观察到输出 Token 减少了高达 65%。
该模型还倾向于使用:
这些变化之所以重要,是因为智能体成本不仅仅取决于公布的每 Token 价格。
一个长时间运行的智能体可能会反复调用模型、发送大型工具定义、检查文件、执行代码、从故障中恢复,并生成大量推理输出。即使每 Token 价格变化不大,减少调用轮次和 Token 数量也能降低总成本。
谷歌列出了以下 API 价格:
| Token 类型 | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| 输入 | 每 100 万个 Token 1.50 美元 | 每 100 万个 Token 1.50 美元 |
| 输出 | 每 100 万个 Token 7.50 美元 | 每 100 万个 Token 9.00 美元 |
输入定价保持不变,而输出定价下降了约 16.7%。
在其评估设置中,Artificial Analysis 测得 Gemini 3.6 Flash 的每项任务平均成本约为 0.50 美元,而 Gemini 3.5 Flash 为 0.59 美元。由于输出定价降低和生成的 Token 减少,这代表了约 18% 的降幅。
这些数字应被视为特定于工作负载的,而非普遍适用。实际成本取决于:
Artificial Analysis 报告称,Gemini 3.6 Flash 的平均任务时间约为 1.3 分钟,低于 Gemini 3.5 Flash 的大约 2.7 分钟。
这一改进来自更快的输出和更经济的推理过程。
一个能快速生成 Token 的模型,如果陷入重复的工具调用循环,仍可能需要很长时间。相反,一个稍慢的模型如果通过更少的调用找到正确的方案,可能会更早完成。
对于智能体开发者来说,每个已完成任务所需的时间通常比原始的每秒 Token 生成数更有用。
谷歌报告了在多个基准测试类别上的改进。
在 DeepSWE 上,与 Gemini 3.5 Flash 相比,Gemini 3.6 Flash 的成绩从 37% 提高到 49%。
谷歌表示该模型:
最后一点存在一个权衡。
谷歌的开发者指南指出,Gemini 3.6 Flash 在编辑前可能会运行诊断脚本,这可以提高复杂任务的准确性。但在简单的前端工作上,那些额外的探索性操作。
步骤可能增加延迟,但并不总能改善结果。
谷歌也表示,人类评估者有时会更偏好早期模型的视觉布局和样式,即便Gemini 3.6 Flash生成了更实用的代码。因此,构建界面的开发者可能需要提供更清晰的视觉设计约束。
在MLE-Bench上,谷歌报告的结果从49.7%提升至63.9%。
这项评估侧重于实际的机器学习工程和研究任务,而非孤立的编码问题。这一提升表明,在需要实验、数据处理、实施和迭代改进的工作流程中,模型表现更佳。
在OSWorld-Verified上,根据谷歌公布的对比,Gemini 3.6 Flash从78.4%提升至83.0%。
计算机使用能力现已作为内置客户端工具,通过Gemini API和Gemini Enterprise提供。它允许代理系统与图形界面交互,而不仅仅依赖直接API。
计算机使用能力的基准测试结果仍受代理框架、屏幕环境、任务设计和故障恢复策略的影响。更高的分数是有益的,但生产系统仍需对重要操作设置严格权限和确认步骤。
在GDPval-AA v2上,Gemini 3.6 Flash从1349提升至1421。
谷歌强调了以下应用场景:
包括Figma、Harvey、Hebbia和JetBrains在内的客户为谷歌的发布声明提供了正面评价。这些推荐语反映了客户体验,不应被视为独立基准。
Gemini 3.6 Flash支持高达100万tokens的上下文窗口和最大64000 tokens的输出。
其模型卡片列出的知识截止时间为2026年3月,相比早期Gemini版本(其截止时间明显更早)有所改进。
较新的知识截止时间减少了开发者必须手动提供的基本近期上下文信息量。但这并不能使模型可靠地处理当前新闻、实时价格、变化的法律、软件发布或其他时效性信息。
处理新鲜信息的应用应仍使用检索、搜索、经过验证的数据库或工具调用。
大的上下文窗口也不能保证模型能同样有效地利用长文档的每一个部分。开发者应测试:
谷歌表示Gemini 3.6 Flash包含更强的前沿安全防护措施,针对:
模型卡片报告显示,与Gemini 3.5 Flash相比,自动多语言和内容安全结果有所改善,同时保持了相对较低的不合理拒绝率。
谷歌还指出
若干限制:
谷歌前沿安全评估得出结论:Gemini 3.6 Flash 仍低于公司设定的关键能力水平,包括网络安全阈值。
该结论基于谷歌的评估框架,应结合后续可获取的独立安全测试结果一并解读。
Gemini 3.5 Flash-Lite 专为更注重速度、吞吐量和成本而非最高推理深度的任务而设计。
典型应用场景包括:
谷歌将其描述为 Gemini 3.5 系列中速度最快且成本最低的模型。
| 令牌类型 | 每百万令牌价格 |
|---|---|
| 输入 | 0.30 美元 |
| 输出 | 2.50 美元 |
其默认思考级别为最低,优先保障吞吐量和低延迟。
对于自主子任务、代码执行、工具调用或多步骤规划,谷歌建议在需要时将思考级别提升至中级或高级。更高的设置可改善任务完成率,但通常会增加令牌使用量和延迟。
谷歌发布公告引用了 Artificial Analysis 在预发布测试中测得的约每秒 350 个输出令牌的数据。
Artificial Analysis 随后记录了可能随时间变化的特定供应商速度。吞吐量取决于:
稳定的结论是:Flash-Lite 的设计速度显著快于更大的 Flash 模型。
谷歌报告了以下相对于 Gemini 3.1 Flash-Lite 的提升:
| 基准测试 | Gemini 3.1 Flash-Lite | Gemini 3.5 Flash-Lite |
|---|---|---|
| Terminal-Bench 2.1 | 31% | 54% |
| GDM-MRCR v2 | 60.1% | 72.2% |
| GDPval-AA v2 | 642 | 1140 |
谷歌还报告称,Gemini 3.5 Flash-Lite 在多个智能体和编码基准测试中优于 Gemini 3 Flash:
这使得 Flash-Lite 不仅仅是一个低质量的经济型模型。对于某些狭窄的高吞吐量智能体任务,它可能比旧款 Gemini 3 Flash 提供更好的平衡。
Artificial Analysis 将 Gemini 3.5 Flash-Lite 在其智能指数中的得分评为 36,高于 Gemini 3.1 Flash-Lite 的 25 分。
这 11 分的提升是本次发布中最显著的智能提升之一。
Flash-Lite 仍低于最强大的前沿模型,但其目标并非在每一项复杂推理任务上与它们竞争。它的作用是快速且经济地处理大量工作。
第三个发布版本,Gemini 3.5 Flash
网络,具有不同的目的。
它是一个基于 Gemini 3.5 Flash 的专用模型,经过微调以实现以下功能:
该模型与 Google DeepMind 的代码安全代理 CodeMender 协同工作。
在 CodeMender 中,多个 Flash 网络代理可以搜索代码库的不同部分,并将它们的发现整合到一份报告中。
Google 认为,在网络安全领域,使用更小、成本更低的模型很有价值,因为漏洞研究通常需要探索大量可能的执行路径。反复调用大型、昂贵的模型可能会成为瓶颈。
Google 表示,通过 CodeMender 系统使用时,Gemini 3.5 Flash 网络在 CyberGym 上的性能达到了具有竞争力的前沿水平。
这一结果依赖于完整的代理基础设施,而不仅仅是底层模型。编排、工具、验证和报告聚合都对最终评分有所贡献。
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
Gemini 3.5 Flash 网络不会通过公开的 Gemini API 广泛提供。
Google 计划通过有限的 CodeMender 试点项目向以下对象提供:
这种有限的发布反映了该模型的双重用途性质。一个能够查找和验证漏洞的系统可以帮助防御者修补软件,但类似的能力也可能支持攻击性活动。

Google 表示,Gemini 3.5 Pro 正在与合作伙伴进行测试,将在准备就绪后更广泛地发布。
AIBase 的源文章将这一延迟与外部报道和关于编码性能及可能重新训练的在线传闻联系起来。
Google 尚未公开证实有关该模型的原始训练计划被放弃或系统从零重新启动的说法。
已核实的信息较为有限:
旗舰级 Pro 版本的缺席使得 Flash 的发布在战略上更加重要。在高端模型尚未可用的情况下,Gemini 3.6 Flash 和 Flash-Lite 必须覆盖更大比例的生产需求。
这并不一定意味着 Google 已经放弃了 Gemini 3.5 Pro,或者 Gemini 4 即将到来。
模型开发时间表可能发生变化,预训练仅是一个阶段。后训练、安全测试、工具集成、延迟优化和部署准备可能还需要大量额外时间。
人工分析得出的结论比谷歌产品公告更为克制。
Gemini 3.6 Flash在人工分析智能指数中得分50分。
Gemini 3.5 Flash同样得分50分。
因此,尽管评估显示某些类别有所提升,但新模型在该测试中的综合智能得分并未提高。
人工分析报告指出:
这是一次可信的效率升级,但并非广泛的智能跃升。
人工分析测得:
该模型完成评估工作负载的时间缩短了一半以上。
人工分析估算:
对于大规模智能代理而言,这种成本降低意义重大,尤其是当系统执行成千上万项任务时。
人工分析将多项评估合并为一个指数。综合得分可用于粗略比较,但可能会掩盖不同工作负载间的重大差异。
总分相同的模型在某些方面可能更胜一筹,例如:
但在以下方面可能表现较弱:
选择正确的模型取决于具体应用场景。
原文收集了社交媒体上的若干批评反应。
用户抱怨的问题包括:
这些反馈之所以重要,是因为基准测试无法涵盖产品质量的方方面面。
一个模型可能在代码库任务中表现出色,但布局生成效果较差;可能使用更少的token但变得过于简洁;可能在某个编程基准上更准确,但在特定语言中可靠性下降。
同时,社交媒体测试存在严重局限性:
因此,早期用户反馈应被视为针对性测试的信号,而非最终定论。
考虑采用Gemini 3.6 Flash的团队不应仅因为谷歌
报告更高基准,也不应仅仅因为几个在线演示令人失望就拒绝它。
有用的迁移测试应在同一应用上比较新旧模型。
从实际工作中构建评估集:
追踪:
Gemini 3.6 Flash 默认为中等思考层级。
Gemini 3.5 Flash-Lite 默认为最低思考层级。
一个模型可能仅仅因为推理设置对于当前任务来说过低而显得能力不足。反之,对简单的信息提取任务使用高思考层级则可能浪费时间和金钱。
编码基准测试无法衡量网站外观是否精美,或中文措辞是否自然。
应使用专门的人工审核来评估:
代理的运行结果不仅仅取决于模型。
需比较:
模型迁移可能需要相应调整整个系统环境。
将 Gemini 3.6 Flash 视为一次操作体验升级,而非一次戏剧性的智能突破,会更容易理解。
它旨在减少使代理成本高昂的浪费:
这些改进在生产环境中的价值可能高于抽象推理基准测试上的微小提升。
然而,效率并不能在每个应用中取代质量。
能够廉价完成任务的模型,如果结果需要大量人工修复,则毫无用处。在编程方面得分高的模型,在设计上可能仍会令人失望。英语能力强的模型,在中文或其他语言中可能需要额外验证。
谷歌新的 Flash 系列创造了更专业的选择:
因此,此次发布与其说是一个模型取代所有其他模型,不如说是为智能体系统的每个部分分配合适的智能水平和成本。
Gemini 3.6 Flash 是谷歌用于编程、多模态任务、知识工作和智能体工作流程的通用主力模型。它基于 Gemini 3.5 Flash,但旨在使用更少的 token、更少的交互轮次和更少的工具调用。
谷歌报告称,在多个编程、计算机使用、机器学习和知识工作基准测试上有所改进。Artificial Analysis 给两个模型相同的总体智能指数得分 50,因此最明显的提升似乎是效率和任务完成速度,而非整体智能的提升。
谷歌将该模型的价格定为每百万输入 token 1.50 美元,每百万输出 token 7.50 美元。价格可能会变动,智能体的总成本还取决于推理、上下文大小、工具调用、重试和输出长度。
Flash-Lite 适用于对延迟敏感的高吞吐量工作负载,例如提取、分类、搜索、翻译、路由、结构化数据处理和子智能体执行。它比 Gemini 3.6 Flash 更便宜、更快,但并非旨在替代所有困难任务中的更强模型。
是的。其模型卡片列出的功能包括支持文本、图像、音频和视频输入,输出为文本。该模型的上下文窗口高达 100 万个 token。
它是 Gemini 3.5 Flash 的一个专业版本,专为漏洞发现、验证和修补而训练。谷歌计划通过一个名为 CodeMender 的受限试点项目,向政府和受信任的防御合作伙伴提供该模型。
谷歌并未表示它被取消。该公司表示,Gemini 3.5 Pro 正在与合作伙伴进行测试,准备就绪后将广泛提供。
不一定要立即迁移。在切换之前,应在代表性生产任务上运行这两个模型,并比较成功率、人工修正时间、工具可靠性、延迟、token 使用量和总成本。
反重力(链接:https://antigravity.google/):谷歌的智能体开发环境,内置 Gemini 3.6 Flash 用于编码工作流。
谷歌最新的 Flash 版本包含三款独立产品。Gemini 3.6 Flash 面向复杂智能体和编码场景,Gemini 3.5 Flash-Lite 主打高吞吐量执行,而 Gemini 3.5 Flash Cyber 则在受限访问下专注于防御性漏洞研究。
Gemini 3.6 Flash 改进了多项任务级基准测试,减少了输出 token 使用量,加快了智能体任务完成速度,并降低了输出定价。然而,独立测试发现其综合智力评分相较 Gemini 3.5 Flash 并未提升。
因此,市场的复杂反应是可以理解的。此次发布更多是在效率方面给出有力证明,而非在通用能力上实现飞跃。
对 Gemini 3.6 Flash 的最佳评价是:它是一款更快、更精简的生产模型——而非证明所有形式的智能或输出质量都已同步提升。
从一句话开始,几分钟内拿到完整网站。