引言
谷歌推出了三款新的Gemini模型,分别针对代理市场的不同领域:
- Gemini 3.6 Flash,定位为主要用于编码、多模态工作和多步骤代理的主力模型
- Gemini 3.5 Flash-Lite,针对高吞吐量和延迟敏感型工作负载进行了优化
- Gemini 3.5 Flash Cyber,一款受限的网络安全模型,旨在发现、验证和修补软件漏洞
谷歌的发布信息以效率为核心。该公司表示,新的Flash模型能够用更少的输出令牌、更少的工具调用以及更低的执行循环开销来完成任务。价格也低于Gemini 3.5 Flash。
这部分说法得到了谷歌内部基准测试和早期独立测试的支持。
更复杂的问题是,Gemini 3.6 Flash是否比其替代的模型在智能方面有实质性的提升。
Artificial Analysis 在其综合智能指数中测得新模型的得分与Gemini 3.5 Flash相同。早期用户也反馈了喜忧参半的体验,尤其是在视觉设计、中文生成、工具选择和指令遵循方面。
结果并非简单的失败。Gemini 3.6 Flash看起来速度更快、输出更简洁,并且在许多工作负载中每完成一项任务的成本更低。它还改进了多项编码、计算机使用、机器学习以及知识工作的基准测试。
但这次发布说明了一个重要的区别:
一个模型可以在通用智能或主观输出质量没有同样大幅提升的情况下,变得更具效率。

三款新Gemini模型概览
| 模型 | 主要作用 | 每百万令牌API价格 | 默认思考级别 | 可用性 |
|---|---|---|---|---|
| Gemini 3.6 Flash | 编码、多模态工作和复杂代理工作流 | 输入$1.50 / 输出$7.50 | 中等 | 全面可用 |
| Gemini 3.5 Flash-Lite | 高容量提取、搜索、翻译、路由和子代理 | 输入$0.30 / 输出$2.50 | 最少 | 全面可用 |
| Gemini 3.5 Flash Cyber | 漏洞发现、验证和修补 | 未公开发布 | 专业化 | 面向政府和信任合作伙伴的有限试点 |
Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 均支持:
- 最多 100万个令牌 的上下文
- 最多 64,000个 输出令牌
- 文本、图像、音频和视频输入
- 文本输出
- 可配置的思考级别
- 内置工具,包括计算机使用
- 通过Gemini API和Google AI Studio访问
谷歌的模型卡将这两款普遍可用模型的知识截止日期列为 2026年3月。
Gemini 3.6 Flash:更少的令牌和更低的任务成本
Gemini 3.6 Flash 基于
Gemini 3.5 Flash,旨在替代它处理许多编码、知识工作、多模态和智能体工作负载。
最一致的改进是效率。
谷歌报告称,在人工智能分析指数上,Gemini 3.6 Flash 使用的输出 Token 比 Gemini 3.5 Flash 少 17%。在一些智能体编码评估(包括 DeepSWE)中,谷歌观察到输出 Token 减少了高达 65%。
该模型还倾向于使用:
- 更少的推理步骤
- 更少的工具调用
- 更短的执行循环
- 更少的不必要代码更改
- 更简洁的最终输出
这些变化之所以重要,是因为智能体成本不仅仅取决于公布的每 Token 价格。
一个长时间运行的智能体可能会反复调用模型、发送大型工具定义、检查文件、执行代码、从故障中恢复,并生成大量推理输出。即使每 Token 价格变化不大,减少调用轮次和 Token 数量也能降低总成本。
Gemini 3.6 Flash 定价
谷歌列出了以下 API 价格:
| Token 类型 | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| 输入 | 每 100 万个 Token 1.50 美元 | 每 100 万个 Token 1.50 美元 |
| 输出 | 每 100 万个 Token 7.50 美元 | 每 100 万个 Token 9.00 美元 |
输入定价保持不变,而输出定价下降了约 16.7%。
在其评估设置中,Artificial Analysis 测得 Gemini 3.6 Flash 的每项任务平均成本约为 0.50 美元,而 Gemini 3.5 Flash 为 0.59 美元。由于输出定价降低和生成的 Token 减少,这代表了约 18% 的降幅。
这些数字应被视为特定于工作负载的,而非普遍适用。实际成本取决于:
- 提示大小
- 思考级别
- 输出长度
- 调用轮次
- 工具使用
- 上下文缓存
- 重试行为
- 智能体框架类型
- 应用程序是否在每轮都发送完整对话
更快的完成速度,不仅仅是更快的 Token 生成速度
Artificial Analysis 报告称,Gemini 3.6 Flash 的平均任务时间约为 1.3 分钟,低于 Gemini 3.5 Flash 的大约 2.7 分钟。
这一改进来自更快的输出和更经济的推理过程。
一个能快速生成 Token 的模型,如果陷入重复的工具调用循环,仍可能需要很长时间。相反,一个稍慢的模型如果通过更少的调用找到正确的方案,可能会更早完成。
对于智能体开发者来说,每个已完成任务所需的时间通常比原始的每秒 Token 生成数更有用。
编码、机器学习、计算机使用和知识工作
谷歌报告了在多个基准测试类别上的改进。
编码和软件工程
在 DeepSWE 上,与 Gemini 3.5 Flash 相比,Gemini 3.6 Flash 的成绩从 37% 提高到 49%。
谷歌表示该模型:
- 产生更少的不需要的编辑
- 使用更短的调试循环
- 更严格遵循要求的范围
- 生成更接近生产水平的代码
- 在更改之前更倾向于以编程方式检查项目
最后一点存在一个权衡。
谷歌的开发者指南指出,Gemini 3.6 Flash 在编辑前可能会运行诊断脚本,这可以提高复杂任务的准确性。但在简单的前端工作上,那些额外的探索性操作。
步骤可能增加延迟,但并不总能改善结果。
谷歌也表示,人类评估者有时会更偏好早期模型的视觉布局和样式,即便Gemini 3.6 Flash生成了更实用的代码。因此,构建界面的开发者可能需要提供更清晰的视觉设计约束。
机器学习研究
在MLE-Bench上,谷歌报告的结果从49.7%提升至63.9%。
这项评估侧重于实际的机器学习工程和研究任务,而非孤立的编码问题。这一提升表明,在需要实验、数据处理、实施和迭代改进的工作流程中,模型表现更佳。
计算机使用能力
在OSWorld-Verified上,根据谷歌公布的对比,Gemini 3.6 Flash从78.4%提升至83.0%。
计算机使用能力现已作为内置客户端工具,通过Gemini API和Gemini Enterprise提供。它允许代理系统与图形界面交互,而不仅仅依赖直接API。
计算机使用能力的基准测试结果仍受代理框架、屏幕环境、任务设计和故障恢复策略的影响。更高的分数是有益的,但生产系统仍需对重要操作设置严格权限和确认步骤。
知识工作
在GDPval-AA v2上,Gemini 3.6 Flash从1349提升至1421。
谷歌强调了以下应用场景:
- 文档解析
- 图表解读
- 财务数据分析
- 报告起草
- 录音分析
- 代码迁移
- 多模态研究工作流
包括Figma、Harvey、Hebbia和JetBrains在内的客户为谷歌的发布声明提供了正面评价。这些推荐语反映了客户体验,不应被视为独立基准。
知识截止时间与上下文窗口
Gemini 3.6 Flash支持高达100万tokens的上下文窗口和最大64000 tokens的输出。
其模型卡片列出的知识截止时间为2026年3月,相比早期Gemini版本(其截止时间明显更早)有所改进。
较新的知识截止时间减少了开发者必须手动提供的基本近期上下文信息量。但这并不能使模型可靠地处理当前新闻、实时价格、变化的法律、软件发布或其他时效性信息。
处理新鲜信息的应用应仍使用检索、搜索、经过验证的数据库或工具调用。
大的上下文窗口也不能保证模型能同样有效地利用长文档的每一个部分。开发者应测试:
- 跨远距离部分的检索准确性
- 长对话中的一致性
- 关键规则是否保持有效
- 包含无关材料时的性能
- 在真实上下文长度下的成本和延迟
Gemini 3.6 Flash的安全升级
谷歌表示Gemini 3.6 Flash包含更强的前沿安全防护措施,针对:
- 化学、生物、放射性和核能滥用
- 网络攻击滥用
- 越狱抵抗
模型卡片报告显示,与Gemini 3.5 Flash相比,自动多语言和内容安全结果有所改善,同时保持了相对较低的不合理拒绝率。
谷歌还指出
若干限制:
- 模型可能产生幻觉。
- 偶尔会出现响应缓慢或超时的情况。
- 部分内部测试显示语气略有倒退。
- 越狱防护仍是持续改进的领域。
谷歌前沿安全评估得出结论:Gemini 3.6 Flash 仍低于公司设定的关键能力水平,包括网络安全阈值。
该结论基于谷歌的评估框架,应结合后续可获取的独立安全测试结果一并解读。
Gemini 3.5 Flash-Lite:高吞吐量选择
Gemini 3.5 Flash-Lite 专为更注重速度、吞吐量和成本而非最高推理深度的任务而设计。
典型应用场景包括:
- 文档提取
- 分类
- 搜索
- 翻译
- 数据路由
- 结构化 JSON 生成
- 收据处理
- 电商数据分析
- 高容量子任务执行
谷歌将其描述为 Gemini 3.5 系列中速度最快且成本最低的模型。
Gemini 3.5 Flash-Lite 定价
| 令牌类型 | 每百万令牌价格 |
|---|---|
| 输入 | 0.30 美元 |
| 输出 | 2.50 美元 |
其默认思考级别为最低,优先保障吞吐量和低延迟。
对于自主子任务、代码执行、工具调用或多步骤规划,谷歌建议在需要时将思考级别提升至中级或高级。更高的设置可改善任务完成率,但通常会增加令牌使用量和延迟。
速度
谷歌发布公告引用了 Artificial Analysis 在预发布测试中测得的约每秒 350 个输出令牌的数据。
Artificial Analysis 随后记录了可能随时间变化的特定供应商速度。吞吐量取决于:
- 供应商容量
- 请求大小
- 推理设置
- 输出长度
- 区域路由
- 当前需求
- 测试测量的是可见输出还是隐藏推理
稳定的结论是:Flash-Lite 的设计速度显著快于更大的 Flash 模型。
基准测试改进
谷歌报告了以下相对于 Gemini 3.1 Flash-Lite 的提升:
| 基准测试 | Gemini 3.1 Flash-Lite | Gemini 3.5 Flash-Lite |
|---|---|---|
| Terminal-Bench 2.1 | 31% | 54% |
| GDM-MRCR v2 | 60.1% | 72.2% |
| GDPval-AA v2 | 642 | 1140 |
谷歌还报告称,Gemini 3.5 Flash-Lite 在多个智能体和编码基准测试中优于 Gemini 3 Flash:
- SWE-Bench Pro:54.2% vs. 49.6%
- OSWorld-Verified:74.0% vs. 65.1%
这使得 Flash-Lite 不仅仅是一个低质量的经济型模型。对于某些狭窄的高吞吐量智能体任务,它可能比旧款 Gemini 3 Flash 提供更好的平衡。
独立智能提升
Artificial Analysis 将 Gemini 3.5 Flash-Lite 在其智能指数中的得分评为 36,高于 Gemini 3.1 Flash-Lite 的 25 分。
这 11 分的提升是本次发布中最显著的智能提升之一。
Flash-Lite 仍低于最强大的前沿模型,但其目标并非在每一项复杂推理任务上与它们竞争。它的作用是快速且经济地处理大量工作。
Gemini 3.5 Flash Cyber:受限安全模型
第三个发布版本,Gemini 3.5 Flash
网络,具有不同的目的。
它是一个基于 Gemini 3.5 Flash 的专用模型,经过微调以实现以下功能:
- 查找软件漏洞
- 验证漏洞是否真实存在
- 追踪相关代码路径
- 提出补丁方案
- 支持反复扫描
- 以低于大型网络模型的成本分析大型代码库
该模型与 Google DeepMind 的代码安全代理 CodeMender 协同工作。
在 CodeMender 中,多个 Flash 网络代理可以搜索代码库的不同部分,并将它们的发现整合到一份报告中。
Google 认为,在网络安全领域,使用更小、成本更低的模型很有价值,因为漏洞研究通常需要探索大量可能的执行路径。反复调用大型、昂贵的模型可能会成为瓶颈。
CyberGym 性能
Google 表示,通过 CodeMender 系统使用时,Gemini 3.5 Flash 网络在 CyberGym 上的性能达到了具有竞争力的前沿水平。
这一结果依赖于完整的代理基础设施,而不仅仅是底层模型。编排、工具、验证和报告聚合都对最终评分有所贡献。
有限可用性
Gemini 3.5 Flash 网络不会通过公开的 Gemini API 广泛提供。
幾分鐘搭建展示站並增長獲客
輸入一句想法,We0 AI 即可生成展示站、頁面與 CMS。發佈上線後並幫你獲取客戶和流量。
用戶註冊贈送一次完整項目生成
適合先體驗一次完整生成流程,快速看到專案初稿。
Google 计划通过有限的 CodeMender 试点项目向以下对象提供:
- 政府机构
- 受信任的合作伙伴
- 一线防御安全团队
这种有限的发布反映了该模型的双重用途性质。一个能够查找和验证漏洞的系统可以帮助防御者修补软件,但类似的能力也可能支持攻击性活动。

Gemini 3.5 Pro 在哪里?
Google 表示,Gemini 3.5 Pro 正在与合作伙伴进行测试,将在准备就绪后更广泛地发布。
AIBase 的源文章将这一延迟与外部报道和关于编码性能及可能重新训练的在线传闻联系起来。
Google 尚未公开证实有关该模型的原始训练计划被放弃或系统从零重新启动的说法。
已核实的信息较为有限:
- Gemini 3.5 Pro 仍处于合作伙伴测试阶段。
- Google 尚未公布通用发布时间。
- 该公司已开始其所谓的 Gemini 4 最具雄心的预训练运行。
- Google 表示,下一代模型的进展令其备受鼓舞。
旗舰级 Pro 版本的缺席使得 Flash 的发布在战略上更加重要。在高端模型尚未可用的情况下,Gemini 3.6 Flash 和 Flash-Lite 必须覆盖更大比例的生产需求。
这并不一定意味着 Google 已经放弃了 Gemini 3.5 Pro,或者 Gemini 4 即将到来。
模型开发时间表可能发生变化,预训练仅是一个阶段。后训练、安全测试、工具集成、延迟优化和部署准备可能还需要大量额外时间。
独立测试:
效率提升大于智能跃升
人工分析得出的结论比谷歌产品公告更为克制。
智能指数
Gemini 3.6 Flash在人工分析智能指数中得分50分。
Gemini 3.5 Flash同样得分50分。
因此,尽管评估显示某些类别有所提升,但新模型在该测试中的综合智能得分并未提高。
人工分析报告指出:
- GDPval-AA v2得分更高
- 在人类最后考试中略有退步
- 整体智能水平相似
- 输出token使用量更低
- 任务完成速度更快
- 每项任务成本更低
这是一次可信的效率升级,但并非广泛的智能跃升。
每项任务耗时
人工分析测得:
- Gemini 3.5 Flash:约2.7分钟
- Gemini 3.6 Flash:约1.3分钟
该模型完成评估工作负载的时间缩短了一半以上。
每项任务成本
人工分析估算:
- Gemini 3.5 Flash:每项任务约0.59美元
- Gemini 3.6 Flash:每项任务约0.50美元
对于大规模智能代理而言,这种成本降低意义重大,尤其是当系统执行成千上万项任务时。
基准测试不应被视为通用排名
人工分析将多项评估合并为一个指数。综合得分可用于粗略比较,但可能会掩盖不同工作负载间的重大差异。
总分相同的模型在某些方面可能更胜一筹,例如:
- 编程
- 多模态文档处理
- 计算机操作
- 速度敏感型代理
- 长上下文提取
但在以下方面可能表现较弱:
- 困难的抽象推理
- 视觉风格设计
- 特定语言处理
- 创意生成
- 需要深度规划的任务
选择正确的模型取决于具体应用场景。
为何早期用户反馈更消极
原文收集了社交媒体上的若干批评反应。
用户抱怨的问题包括:
- 中文词汇选择不自然
- 记忆一致性差
- 工具选择错误
- 视觉风格设计薄弱
- 生成的游戏纹理质量下降
- 指令与视觉输出不匹配
- 使用限制
- 通用智能无明显提升
这些反馈之所以重要,是因为基准测试无法涵盖产品质量的方方面面。
一个模型可能在代码库任务中表现出色,但布局生成效果较差;可能使用更少的token但变得过于简洁;可能在某个编程基准上更准确,但在特定语言中可靠性下降。
同时,社交媒体测试存在严重局限性:
- 提示词并非总是公开
- 模型设置可能不同
- 用户可能比较不同产品界面
- 预览版与API可能使用不同配置
- 工具可用性会影响结果
- 单个失败案例不能证明普遍退步
- 病毒式批评往往放大最严重的失败案例
因此,早期用户反馈应被视为针对性测试的信号,而非最终定论。
实用评估框架
考虑采用Gemini 3.6 Flash的团队不应仅因为谷歌
报告更高基准,也不应仅仅因为几个在线演示令人失望就拒绝它。
有用的迁移测试应在同一应用上比较新旧模型。
- 使用代表性任务
从实际工作中构建评估集:
- 实际代码仓库
- 真实文档
- 典型工具调用
- 常见用户请求
- 已知失败案例
- 多语言提示词
- 长上下文示例
- 衡量任务完成度,而不仅仅是输出质量
追踪:
- 任务成功率
- 工具调用次数
- 重试次数
- 非期望文件更改
- 人工修正时间
- 延迟
- 输出令牌数
- 总成本
- 失败严重程度
- 测试不同思考层级
Gemini 3.6 Flash 默认为中等思考层级。
Gemini 3.5 Flash-Lite 默认为最低思考层级。
一个模型可能仅仅因为推理设置对于当前任务来说过低而显得能力不足。反之,对简单的信息提取任务使用高思考层级则可能浪费时间和金钱。
- 分别评估视觉与语言质量
编码基准测试无法衡量网站外观是否精美,或中文措辞是否自然。
应使用专门的人工审核来评估:
- 视觉层次
- 品牌一致性
- 语气风格
- 翻译质量
- 文化适宜性
- 指令遵循度
- 测试完整代理栈
代理的运行结果不仅仅取决于模型。
需比较:
- 工具定义
- 提示词结构
- 记忆策略
- 上下文缓存
- 重试规则
- 批准边界
- 浏览器或电脑使用环境
- 编排框架
模型迁移可能需要相应调整整个系统环境。
开发者应选择哪个模型?
选择 Gemini 3.6 Flash 的情况:
- 任务需要多步推理。
- 代码质量至关重要。
- 代理使用多种工具。
- 工作负载包含图像、图表、视频或大型文档。
- 需要使用计算机操控功能 (Computer Use)。
- 更少轮次和更低任务延迟很有价值。
- Gemini 3.5 Flash 当前可用但过于冗长或成本过高。
选择 Gemini 3.5 Flash-Lite 的情况:
- 吞吐量是首要考量。
- 工作涉及信息提取、分类、翻译或路由分发。
- 许多子代理并行运行。
- 应用程序需要处理大量文档。
- 追求较低的每令牌价格。
- 复杂任务可以转派给更强的主模型处理。
仅在通过批准访问时使用 Gemini 3.5 Flash Cyber 的情况:
- 组织是谷歌有限试点的一部分。
- 工作负载是防御性网络安全。
- 在采取行动前,漏洞发现结果已得到验证。
- 敏感存储库在严格权限下处理。
- 组织能够管理双重用途风险。
Flash 版本发布带来的更大启示
将 Gemini 3.6 Flash 视为一次操作体验升级,而非一次戏剧性的智能突破,会更容易理解。
它旨在减少使代理成本高昂的浪费:
- 过度的推理
- 重复的工具调用
- 冗长的输出
- 调试循环
- 不必要的代码编辑
- 缓慢的任务完成
这些改进在生产环境中的价值可能高于抽象推理基准测试上的微小提升。
然而,效率并不能在每个应用中取代质量。
能够廉价完成任务的模型,如果结果需要大量人工修复,则毫无用处。在编程方面得分高的模型,在设计上可能仍会令人失望。英语能力强的模型,在中文或其他语言中可能需要额外验证。
谷歌新的 Flash 系列创造了更专业的选择:
- 3.6 Flash:用于更强的智能体工作
- 3.5 Flash-Lite:用于大规模扩展
- Flash Cyber:用于受控的安全使用
因此,此次发布与其说是一个模型取代所有其他模型,不如说是为智能体系统的每个部分分配合适的智能水平和成本。
常见问题
什么是 Gemini 3.6 Flash?
Gemini 3.6 Flash 是谷歌用于编程、多模态任务、知识工作和智能体工作流程的通用主力模型。它基于 Gemini 3.5 Flash,但旨在使用更少的 token、更少的交互轮次和更少的工具调用。
Gemini 3.6 Flash 比 Gemini 3.5 Flash 更智能吗?
谷歌报告称,在多个编程、计算机使用、机器学习和知识工作基准测试上有所改进。Artificial Analysis 给两个模型相同的总体智能指数得分 50,因此最明显的提升似乎是效率和任务完成速度,而非整体智能的提升。
Gemini 3.6 Flash 的费用是多少?
谷歌将该模型的价格定为每百万输入 token 1.50 美元,每百万输出 token 7.50 美元。价格可能会变动,智能体的总成本还取决于推理、上下文大小、工具调用、重试和输出长度。
Gemini 3.5 Flash-Lite 有什么用途?
Flash-Lite 适用于对延迟敏感的高吞吐量工作负载,例如提取、分类、搜索、翻译、路由、结构化数据处理和子智能体执行。它比 Gemini 3.6 Flash 更便宜、更快,但并非旨在替代所有困难任务中的更强模型。
Gemini 3.6 Flash 支持图像和视频吗?
是的。其模型卡片列出的功能包括支持文本、图像、音频和视频输入,输出为文本。该模型的上下文窗口高达 100 万个 token。
什么是 Gemini 3.5 Flash Cyber?
它是 Gemini 3.5 Flash 的一个专业版本,专为漏洞发现、验证和修补而训练。谷歌计划通过一个名为 CodeMender 的受限试点项目,向政府和受信任的防御合作伙伴提供该模型。
Gemini 3.5 Pro 被取消了吗?
谷歌并未表示它被取消。该公司表示,Gemini 3.5 Pro 正在与合作伙伴进行测试,准备就绪后将广泛提供。
我应该立即从 Gemini 3.5 Flash 迁移吗?
不一定要立即迁移。在切换之前,应在代表性生产任务上运行这两个模型,并比较成功率、人工修正时间、工具可靠性、延迟、token 使用量和总成本。
相关工具
- Google AI Studio:谷歌基于浏览器的环境,用于测试 Gemini 模型、提示词、工具和 API 配置。
- Gemini API:用于将 Gemini 模型集成到应用程序和智能体工作流程中的官方 API。
- Gemini 应用:谷歌面向消费者的界面,用于直接使用 Gemini 模型。
反重力(链接:https://antigravity.google/):谷歌的智能体开发环境,内置 Gemini 3.6 Flash 用于编码工作流。
- CodeMender(链接:https://deepmind.google/models/codemender/):谷歌 DeepMind 的智能体,用于发现和修复软件漏洞。
- Artificial Analysis(链接:https://artificialanalysis.ai/):独立的模型对比平台,涵盖智能水平、速度、延迟、token 使用和定价信息。
相关链接
- Gemini Flash 正式发布公告:谷歌提供的规格、基准测试结果、定价、客户案例及可用性信息。
- Gemini 3.6 Flash 模型卡:关于输入、上下文长度、限制、安全测试和知识截止日期的官方详情。
- Gemini 3.5 Flash-Lite 模型卡:关于预期用途、模型限制、安全评估和分发的官方信息。
- Gemini 3.5 Flash Cyber:谷歌 DeepMind 对专用网络安全模型及限制性试点的说明。
- Gemini API 最新模型指南:官方模型 ID、迁移指南、API 变更、定价及推荐用例。
- Gemini API 定价:Gemini API 模型和服务的当前官方定价页面。
- Artificial Analysis 评估:关于智能水平、单任务成本、输出速度、token 效率及任务时长的独立分析。
总结
谷歌最新的 Flash 版本包含三款独立产品。Gemini 3.6 Flash 面向复杂智能体和编码场景,Gemini 3.5 Flash-Lite 主打高吞吐量执行,而 Gemini 3.5 Flash Cyber 则在受限访问下专注于防御性漏洞研究。
Gemini 3.6 Flash 改进了多项任务级基准测试,减少了输出 token 使用量,加快了智能体任务完成速度,并降低了输出定价。然而,独立测试发现其综合智力评分相较 Gemini 3.5 Flash 并未提升。
因此,市场的复杂反应是可以理解的。此次发布更多是在效率方面给出有力证明,而非在通用能力上实现飞跃。
对 Gemini 3.6 Flash 的最佳评价是:它是一款更快、更精简的生产模型——而非证明所有形式的智能或输出质量都已同步提升。



