Googleは、エージェント市場の異なる領域をターゲットとした3つの新たなGeminiモデルを発表しました。

Googleは、エージェント市場の異なる領域をターゲットとした3つの新たなGeminiモデルを発表しました。
Googleの発表は効率性を中心に据えています。同社によると、新しいFlashモデルは、より少ない出力トークン、より少ないツール呼び出し、より低い実行ループのオーバーヘッドでタスクを完了できるとしています。価格もGemini 3.5 Flashよりも低くなっています。
この点については、Googleの内部ベンチマークと初期の独立テストによって裏付けられています。
より複雑な問題は、Gemini 3.6 Flashが、従来のモデルと比較して知能面で実質的な向上を遂げているかどうかです。
Artificial Analysisは、総合知能指数において新モデルがGemini 3.5 Flashと同じスコアを記録したと報告しています。初期ユーザーからも、特にビジュアルデザイン、中国語生成、ツール選択、指示追従能力において、賛否両論のフィードバックが寄せられています。
結果は単なる失敗ではありません。Gemini 3.6 Flashは、より高速で出力が簡潔になり、多くのワークロードにおいてタスクあたりのコストが低減しているように見えます。また、コーディング、コンピューター使用、機械学習、ナレッジワークに関する複数のベンチマークでも改善が見られます。
しかし、今回の発表は重要な違いを示しています。
モデルは、汎用知能や主観的な出力品質が同様に大幅に向上しなくても、効率性を高めることができるのです。

| モデル | 主な用途 | API価格(100万トークンあたり) | デフォルトの思考レベル | 利用可能性 |
|---|---|---|---|---|
| Gemini 3.6 Flash | コーディング、マルチモーダルワーク、複雑なエージェントワークフロー | 入力$1.50 / 出力$7.50 | 中 | 一般公開 |
| Gemini 3.5 Flash-Lite | 高容量の抽出、検索、翻訳、ルーティング、サブエージェント | 入力$0.30 / 出力$2.50 | 最小 | 一般公開 |
| Gemini 3.5 Flash Cyber | 脆弱性の発見、検証、修正 | 未公開 | 特化型 | 政府および信頼できるパートナー向けの限定パイロット |
Gemini 3.6 Flash および Gemini 3.5 Flash-Lite は、以下をサポートします。
Googleのモデルカードでは、これら2つの一般公開モデルの知識カットオフ日は 2026年3月 とされています。
Gemini 3.6 FlashはGemini 3.5 Flashをベースにしており、コーディング、ナレッジワーク、マルチモーダルワーク、エージェントワークロードの多くにおいて、後者の代替となることを目的としています。
最も一貫した改善点は効率性です。
Googleは、AI分析指数において、Gemini 3.6 FlashがGemini 3.5 Flashよりも出力トークンを17%削減したと報告しています。DeepSWEを含む一部のエージェントコーディング評価では、出力トークンが最大**65%**削減されたことを観測しています。
また、このモデルは以下のような傾向があります。
これらの変更が重要なのは、エージェントのコストが公表されたトークン単価だけに依存しないからです。
長時間実行されるエージェントは、モデルを繰り返し呼び出し、大規模なツール定義を送信し、ファイルをチェックし、コードを実行し、障害から回復し、大量の推論出力を生成する可能性があります。トークン単価の変動が小さくても、呼び出し回数とトークン数を削減することで総コストを削減できます。
Googleは以下のAPI価格を発表しています。
| トークンタイプ | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| 入力 | 100万トークンあたり1.50ドル | 100万トークンあたり1.50ドル |
| 出力 | 100万トークンあたり7.50ドル | 100万トークンあたり9.00ドル |
入力価格は変わらず、出力価格は約**16.7%**低下しました。
その評価設定において、Artificial AnalysisはGemini 3.6 Flashのタスクあたりの平均コストを約0.50ドル、Gemini 3.5 Flashを0.59ドルと測定しました。これは、出力価格の低下と生成トークンの削減により、約18%の減少に相当します。
これらの数値はワークロード固有のものであり、普遍的に適用できるものではありません。実際のコストは以下に依存します。
Artificial Analysisは、Gemini 3.6 Flashの平均タスク時間が約1.3分であり、Gemini 3.5 Flashの約2.7分から短縮されたと報告しています。
この改善は、より高速な出力とより効率的な推論プロセスによるものです。
高速にトークンを生成できるモデルでも、ツール呼び出しの繰り返しループに陥ると、長い時間がかかる可能性があります。逆に、やや遅いモデルでも、少ない呼び出しで正しい解決策を見つければ、より早く完了する可能性があります。
エージェント開発者にとって、完了したタスクあたりの所要時間は、生の秒間トークン生成数よりも有用であることが多いです。
Googleは、複数のベンチマークカテゴリでの改善を報告しています。
DeepSWEにおいて、Gemini 3.6 FlashはGemini 3.5 Flashと比較して、スコアが**37%から49%**に向上しました。
Googleによると、このモデルは以下の特徴を持ちます。
最後の点にはトレードオフが存在します。
Googleの開発者ガイドによると、Gemini 3.6 Flashは編集前に診断スクリプトを実行する可能性があり、これにより複雑なタスクの精度は向上します。しかし、単純なフロントエンド作業では、それらの追加の探索的操作が遅延を増加させ、結果を改善しない場合があります。
Googleも、人間の評価者が時に初期モデルのビジュアルレイアウトやスタイルを好むことがあり、Gemini 3.6 Flashがより実用的なコードを生成しても同様である、と述べています。そのため、インターフェースを構築する開発者は、より明確なビジュアルデザインの制約を提供する必要があるかもしれません。
MLE-Benchでは、Googleは結果が**49.7%から63.9%**に改善したと報告しています。
この評価は、孤立したコーディング問題ではなく、実際の機械学習エンジニアリングおよび研究タスクに焦点を当てています。この改善は、実験、データ処理、実装、反復的な改善を必要とするワークフローにおいて、モデルのパフォーマンスが向上したことを示しています。
OSWorld-Verifiedでは、Googleの公開比較によると、Gemini 3.6 Flashは**78.4%から83.0%**に改善しました。
コンピュータ使用能力は、Gemini APIおよびGemini Enterpriseを通じて、組み込みのクライアントツールとして提供されるようになりました。これにより、エージェントシステムは直接APIに依存するだけでなく、グラフィカルインターフェースと対話できるようになります。
コンピュータ使用能力のベンチマーク結果は、依然としてエージェントフレームワーク、画面環境、タスク設計、障害回復戦略の影響を受けます。スコアが高いことは有益ですが、本番システムでは重要な操作に対して厳格な権限と確認手順を引き続き設定する必要があります。
GDPval-AA v2では、Gemini 3.6 Flashは1349から1421に改善しました。
Googleは以下のユースケースを強調しています:
Figma、Harvey、Hebbia、JetBrainsなどの顧客は、Googleの発表に対して肯定的な評価を提供しました。これらの推薦コメントは顧客体験を反映したものであり、独立したベンチマークとして扱われるべきではありません。
Gemini 3.6 Flashは、最大100万トークンのコンテキストウィンドウと、最大64000トークンの出力をサポートしています。
そのモデルカードに記載されている知識カットオフ日は2026年3月であり、これは初期のGeminiバージョン(カットオフ日が著しく早い)からの改善です。
新しい知識カットオフ日により、開発者が手動で提供しなければならない基本的な最近のコンテキスト情報の量が減少します。しかし、これによりモデルが現在のニュース、リアルタイム価格、変化する法律、ソフトウェアリリース、その他の時事情報を確実に処理できるようになるわけではありません。
新しい情報を扱うアプリケーションは、引き続き検索、サーチ、検証済みデータベース、ツールコールを使用する必要があります。
また、大きなコンテキストウィンドウは、モデルが長い文書のすべての部分を同等に効果的に活用できることを保証するものではありません。開発者は以下をテストする必要があります:
Googleは、Gemini 3.6 Flashには、以下に対するより強力な最先端のセキュリティ対策が含まれていると述べています:
モデルカードの報告によると、Gemini 3.5 Flashと比較して、自動多言語およびコンテンツセキュリティの結果が改善され、不合理な拒否率は比較的低く維持されています。
Googleはまた、いくつかの制限を指摘しています:
Googleの最先端セキュリティ評価では、Gemini 3.6 Flashは依然として同社が設定した重要な能力レベル(サイバーセキュリティのしきい値を含む)を下回っていると結論付けています。
この結論はGoogleの評価フレームワークに基づいており、入手可能な独立したセキュリティテスト結果と併せて解釈されるべきです。
Gemini 3.5 Flash-Liteは、最大の推論深度よりも、速度、スループット、コストを重視するタスク向けに設計されています。
典型的なユースケースは次のとおりです:
Googleはこれを、Gemini 3.5シリーズの中で最速かつ最も低コストなモデルであると説明しています。
| トークンタイプ | 百万トークンあたりの価格 |
|---|---|
| 入力 | 0.30 米ドル |
| 出力 | 2.50 米ドル |
デフォルトの思考レベルは最低で、スループットと低レイテンシを優先します。
自律的なサブタスク、コード実行、ツールコール、マルチステッププランニングについては、Googleは必要に応じて思考レベルを中程度または高程度に引き上げることを推奨しています。高い設定にするとタスク完了率が向上しますが、通常はトークン使用量とレイテンシが増加します。
Googleの発表では、Artificial Analysisがプレリリーステストで測定した、約毎秒350出力トークンというデータが引用されています。
Artificial Analysisはその後、時間とともに変化する可能性のある特定ベンダーの速度を記録しました。スループットは以下に依存します:
安定した結論は、Flash-Liteは設計上、より大きなFlashモデルよりも大幅に高速であるということです。
Googleは、Gemini 3.1 Flash-Liteに対する以下の改善を報告しています:
| ベンチマーク | Gemini 3.1 Flash-Lite | Gemini 3.5 Flash-Lite |
|---|---|---|
| Terminal-Bench 2.1 | 31% | 54% |
| GDM-MRCR v2 | 60.1% | 72.2% |
| GDPval-AA v2 | 642 | 1140 |
Googleはまた、Gemini 3.5 Flash-Liteが複数のエージェントおよびコーディングベンチマークでGemini 3 Flashを上回ったと報告しています:
これにより、Flash-Liteは単なる低品質の経済的モデルではありません。特定の限定的な高スループットエージェントタスクでは、旧モデルのGemini 3 Flashよりも優れたバランスを提供する可能性があります。
Artificial Analysisは、Gemini 3.5 Flash-Liteのインテリジェンス指数スコアを36と評価しており、これはGemini 3.1 Flash-Liteの25点から向上しています。
この11点の向上は、今回のリリースの中で最も顕著なインテリジェンスの向上の1つです。
Flash-Liteは依然として最も強力な最先端モデルには劣りますが、その目的は複雑な推論タスクすべてでそれらと競合することではありません。その役割は、大量の作業を迅速かつ経済的に処理することです。
3番目のリリースであるGemini 3.5 Flash Cyberは、異なる目的を持っています。
これはGemini 3.5 Flashをベースとした専用モデルであり、以下の機能のために微調整されています:
このモデルは、Google DeepMindのコードセキュリティエージェントCodeMenderと連携して動作します。
CodeMenderでは、複数のFlash Cyberエージェントがコードベースの異なる部分を検索し、それらの発見を1つのレポートに統合できます。
Googleは、サイバーセキュリティの分野では、より小さく低コストなモデルを使用することに価値があると考えています。なぜなら、脆弱性調査では多くの場合、多数の実行可能なパスを探索する必要があるからです。大規模で高価なモデルを繰り返し呼び出すことはボトルネックになる可能性があります。
Googleは、CodeMenderシステムを介して使用された場合、Gemini 3.5 Flash CyberはCyberGymで競争力のある最先端レベルのパフォーマンスを達成したと述べています。
この結果は、基盤となるモデルだけでなく、完全なエージェントインフラストラクチャに依存しています。オーケストレーション、ツール、検証、レポート集約がすべて最終スコアに貢献しています。
Gemini 3.5 Flash Cyberは、公開されては提供されません。
Gemini API は広く利用可能です。
Googleは、限定されたCodeMenderパイロットプログラムを通じて、以下を対象に提供する計画です。
アイデアを一文で入力するだけで、We0 AI が紹介サイト、ページ、CMS を生成し、公開後の顧客獲得と流入拡大を支援します。
無料登録で完全なプロジェクトを 1 つ生成
1 つの完全な生成フローを試し、最初のプロジェクトのドラフトをすぐに確認するのに最適です。
この限定的なリリースは、本モデルのデュアルユース性を反映しています。脆弱性を発見し検証できるシステムは、防御側がソフトウェアを修正するのに役立ちますが、同様の能力は攻撃活動を支援する可能性もあります。

Googleは、Gemini 3.5 Proはパートナーとテスト中であり、準備が整い次第、より広くリリースすると述べています。
AIBaseの元記事は、この遅延を、コーディング性能や再トレーニングの可能性に関する外部の報道やオンライン上の噂と関連付けています。
Googleは、本モデルの当初のトレーニング計画が破棄されたり、システムがゼロから再起動されたりしたという主張について、公に確認していません。
確認された情報は限られています:
主力のProバージョンがないことで、Flashのリリースは戦略的にさらに重要になっています。ハイエンドモデルがまだ利用できない中、Gemini 3.6 FlashとFlash-Liteは、より多くの本番環境のニーズをカバーする必要があります。
これは必ずしも、GoogleがGemini 3.5 Proを放棄したか、Gemini 4が間近であることを意味するわけではありません。
モデル開発のスケジュールは変わる可能性があり、事前トレーニングは単なる1つの段階です。事後トレーニング、安全性テスト、ツール統合、レイテンシ最適化、デプロイ準備には、さらにかなりの追加時間が必要になる可能性があります。
人工分析(Humanity’s Last Exam)による結論は、Googleの製品発表よりも控えめです。
人工分析の知能指数において、Gemini 3.6 Flashは50点を獲得しました。
Gemini 3.5 Flashも同じく50点でした。
したがって、評価では特定のカテゴリで改善が見られるものの、新しいモデルのこのテストにおける総合的な知能スコアは向上していません。
人工分析レポートは次のように指摘しています:
これは信頼できる効率性のアップグレードですが、広範な知能の飛躍ではありません。
人工分析による測定:
本モデルは、評価ワークロードを完了する時間を半分以上短縮しました。
人工分析による推定:
大規模なインテリジェントエージェントにとって、このコスト削減は重要であり、特にシステムが数千、数万ものタスクを実行する場合に顕著です。
人工分析は複数の評価を一つの指数に統合しています。複合スコアは大まかな比較には使用できますが、異なるワークロード間の大きな差異を隠してしまう可能性があります。
同じ合計スコアのモデルでも、以下のような点で優れている場合があります:
しかし、以下のような点では劣る可能性があります:
適切なモデルの選択は、具体的なアプリケーションシナリオに依存します。
原文は、ソーシャルメディア上のいくつかの批判的な反応を収集しています。
ユーザーが不満に思っている問題は以下の通りです:
これらのフィードバックが重要なのは、ベンチマークでは製品品質のあらゆる側面をカバーできないからです。
あるモデルはコードベースタスクでは優れているが、レイアウト生成は苦手であったり、トークン使用量が少ない代わりに簡潔すぎる場合があります。特定のプログラミングベンチマークでは正確でも、特定の言語では信頼性が低下する可能性があります。
同時に、ソーシャルメディア上のテストには深刻な限界があります:
したがって、初期ユーザーフィードバックは、最終的な判断ではなく、対象を絞ったテストのシグナルとして見なされるべきです。
Gemini 3.6 Flashの導入を検討しているチームは、Googleがより高いベンチマークを報告したからといって受け入れ、また、いくつかのオンラインデモが期待外れだったからといって拒否するべきではありません。
有用な移行テストでは、同じアプリケーション上で新旧モデルを比較する必要があります。
実際の作業から評価セットを構築します:
以下を追跡します:
Gemini 3.6 Flashはデフォルトで中程度の思考レベルです。
Gemini 3.5 Flash-Liteはデフォルトで最低の思考レベルです。
あるモデルが、単に現在のタスクに対して推論設定が低すぎるために能力不足に見える可能性があります。逆に、単純な情報抽出タスクに高い思考レベルを使用すると、時間と費用の無駄になります。
コーディングベンチマークは、Webサイトの見た目の美しさや、中国語の言い回しが自然かどうかを測定できません。
以下の評価には、専用の人間によるレビューを使用します:
エージェントの実行結果は、モデルだけに依存するわけではありません。
以下を比較する必要があります:
モデル移行には、システム環境全体の対応する調整が必要になる場合があります。
アプリケーションは大量のドキュメントを処理する必要があります。
Gemini 3.6 Flash は、劇的な知能のブレークスルーではなく、操作体験のアップグレードと捉えると理解しやすいでしょう。
これは、エージェントのコストを高騰させる無駄を削減することを目的としています:
これらの改善は、抽象的な推論ベンチマークでの微細な向上よりも、本番環境での価値が高い可能性があります。
しかし、効率性がすべてのアプリケーションで品質に取って代わるわけではありません。
タスクを安価に実行できるモデルでも、結果に多大な手動修正が必要であれば無価値です。プログラミングで高得点を取るモデルでも、設計面では期待を裏切る可能性があります。英語に優れたモデルでも、中国語やその他の言語では追加検証が必要になるでしょう。
Googleの新しいFlashシリーズは、より専門化された選択肢を生み出しました:
したがって、今回のリリースは、一つのモデルが他すべてを置き換えるというよりも、エージェントシステムの各部分に適切な知能レベルとコストを割り当てることに関するものです。
Gemini 3.6 Flash は、プログラミング、マルチモーダルタスク、ナレッジワーク、エージェントワークフローのためのGoogleの汎用主力モデルです。Gemini 3.5 Flash をベースにしていますが、より少ないトークン、より少ないインタラクション回数、より少ないツール呼び出しで動作することを目指しています。
Googleは、複数のプログラミング、コンピューター利用、機械学習、ナレッジワークのベンチマークで改善を報告しています。Artificial Analysis は両モデルに同じ総合知能指数スコア50を与えており、最も顕著な向上は知能全体ではなく、効率性とタスク完了速度にあるようです。
Googleはこのモデルの価格を、入力トークン100万あたり1.50ドル、出力トークン100万あたり7.50ドルと設定しています。価格は変動する可能性があり、エージェントの総コストは推論、コンテキストサイズ、ツール呼び出し、リトライ、出力長にも依存します。
Flash-Lite は、抽出、分類、検索、翻訳、ルーティング、構造化データ処理、サブエージェント実行など、レイテンシーに敏感な高スループットワークロードに適しています。Gemini 3.6 Flash より安価で高速ですが、すべての困難なタスクにおいて強力なモデルを置き換えることを目的としていません。
はい。モデルカードには、テキスト、画像、音声、動画の入力とテキスト出力のサポートが記載されています。このモデルのコンテキストウィンドウは最大100万トークンです。
これは、脆弱性の発見、検証、修正のためにトレーニングされた、Gemini 3.5 Flash の専門バージョンです。Googleは、CodeMender と呼ばれる制限付きパイロットプログラムを通じて、政府および信頼された防御パートナーにこのモデルを提供する予定です。
Googleは中止されたとは発表していません。同社は、Gemini 3.5 Pro はパートナーとテスト中であり、準備が整い次第広く提供されると述べています。
必ずしもすぐに移行する必要はありません。切り替える前に、代表的な本番タスクで両方のモデルを実行し、成功率、手動修正時間、ツールの信頼性、レイテンシー、トークン使用量、総コストを比較してください。
反重力 (Antigravity) (https://antigravity.google/):Gemini 3.6 Flash を組み込んだGoogleのエージェント開発環境。コーディングワークフロー用。
Googleの最新Flashリリースは、3つの異なる製品で構成されています。Gemini 3.6 Flash は複雑なエージェントやコーディングシナリオ向け、Gemini 3.5 Flash-Lite は高スループット実行向け、そして Flash Cyber は生の推論能力が最も重要なセキュリティタスク向けです。今回のリリースでは、知能の大幅な飛躍はありませんが、モデル選択の柔軟性が向上し、特にエージェントワークロードにおいて、コストとパフォーマンスのバランスを最適化できるようになりました。
Gemini 3.5 Flash Cyberは、アクセスが制限された環境において、防御的な脆弱性調査に特化しています。
Gemini 3.6 Flashは、複数のタスクレベルのベンチマークを改善し、出力トークン使用量を削減し、エージェントタスクの完了速度を向上させ、出力価格を引き下げました。しかし、独立したテストでは、総合的な知能スコアはGemini 3.5 Flashと比較して向上していません。
したがって、市場の複雑な反応は理解できるものです。今回のリリースは、汎用的な能力の飛躍的向上というよりも、効率面での有力な証明を提供するものと言えます。
Gemini 3.6 Flashに対する最も適切な評価は、あらゆる形態の知能や出力品質が一律に向上したことを示すものではなく、より高速で、より効率的なプロダクションモデルであるという点です。
ひとことから始めて、数分で完全なサイトを手に入れましょう。