マイクロソフトは、セキュリティ脅威の特定、検証、優先順位付け、修復に使用される多モデル・多エージェントシステム MDASH の新しい構成が、CyberGym で 95.95% の成功率を達成したと報告しました。

マイクロソフトは、マルチモデル・マルチエージェントシステム「MDASH」の新構成がCyberGymで95.95%の成功率を達成したと報告しました。このシステムは、ソフトウェアの脆弱性の識別、検証、優先順位付け、および修復に使用されます。
この数字は注目に値します。当初のCyberGym論文では、テストされた最も強力な組み合わせであるOpenHandsとClaude 3.7 Sonnetが、初版の評価でベンチマークの脆弱性のうち11.9%しか再現できなかったと報告されています。
マイクロソフトの最新結果はこれをはるかに上回ります。しかし、この発表で最も重要な点は、単に新しいモデルの能力が向上したことだけではありません。
95.95%というスコアは、以下の要素を組み合わせた完全なセキュリティシステムによって達成されました:
マイクロソフトはこのアプローチを3つの言葉で要約しています:
モデル
データ
フレームワーク
モデルはインテリジェンスを提供します。データはインテリジェンスにセキュリティコンテキストを与えます。フレームワークはモデルの出力を反復可能で検証可能なワークフローに変換します。
この区別が重要なのは、企業のセキュリティチームがベンチマークの回答を購入するわけではないからです。彼らが必要とするのは、継続的に実行でき、誤検知を制御し、発見が実際に存在することを証明し、結果をセキュリティ修正に結び付けるのに役立つシステムです。

マイクロソフトが公開したCyberGymの図表では、5つのモデルとエージェント構成を比較しています:
| システムまたはモデル構成 | マイクロソフトが報告したCyberGym成功率 |
|---|---|
| MDASH: MAI-Cyber-1-Flash + GPT-5.4 | 95.95% |
| GPT-5.5 Cyber | 85.6% |
| Mythos 5 | 83.8% |
| GPT-5.6 Sol | 83.6% |
| Gemini 3.5 Flash Cyber in CodeMender | 83.2% |
MDASH構成は、マイクロソフトの図表において2位に10ポイント以上の差をつけています。
マイクロソフトはまた、この構成のコストが、これまで最強だったMDASH設定(GPT-5.4、GPT-5.4 mini、GPT-5.3 Codexを使用)と比較して約50%削減されたと述べています。
したがって、比較には2つの側面があります:
セキュリティスキャンは一度きりの問題ではありません。大規模な組織は、数百万行のコードを検査し、変更のたびにスキャンを繰り返し、疑わしい脆弱性を検証し、パッチを再テストし、変化し続けるソフトウェア資産を監視する必要があるかもしれません。
能力が非常に高いが頻繁な実行にはコストがかかりすぎる構成よりも、より優れたルーティングと検証システムに組み込まれたやや小型のモデルの方が、実際の保護においてより大きな価値を提供できる可能性があります。
マイクロソフトは、MAI-Cyber-1-Flash がMDASHワークフローのタスクの最大**90%**を処理するように設計されていると述べています。
最も困難な10%のタスクはより大きなモデルにルーティングでき、マイクロソフトは公開されている構成でこれをGPT-5.4と特定しています。

この戦略は次のように表すことができます:
一般的で頻度の高いセキュリティタスク
→ MAI-Cyber-1-Flash
異常に困難なタスク
→ GPT-5.4
これは、MAI-Cyber-1-Flashが単独で脆弱性の90%を修正するという意味ではありません。
90%という数字は、ルーティングワークフローにおいて小型モデルがカバーするように設計されたタスクの割合を指しています。完全なMDASHの結果は依然として、タスクルーター、より大きなモデル、専用エージェント、検証、証明生成、重複排除、セキュリティツール、実行環境、およびシステムレベルの制御に依存しています。
小型モデルはワークフローの平均コストを削減しますが、最も困難なケースにおけるより強力なモデルの必要性を排除するものではありません。
マイクロソフトは、MAI-Cyber-1-Flashを同社初のサイバーセキュリティ専用モデルと説明しています。
公式モデルカードには以下のように記載されています:
| 仕様 | MAI-Cyber-1-Flash |
|---|---|
| アーキテクチャ | スパース混合エキスパートTransformer |
| 総パラメータ数 | 137B |
| アクティブパラメータ数 | 5B |
| コンテキスト長 | 256K |
| 入力 | テキスト |
| 出力 | テキスト |
| ベースモデル | MAI-Code-1-Flash |
| 主要環境 | マイクロソフトコードネームMDASH |
| リリース日 | 2026年7月27日 |
| 利用可能性 | Azure AI Foundry プライベートプレビュー(承認済みMDASH顧客向け) |
このモデルは MAI-Code-1-Flash のサイバーセキュリティ専用ファインチューニング版です。
脆弱性の識別、検証、優先順位付け、分類、修復サポート、エンタープライズレベルのコードスキャンなどのワークフロー向けに設計されています。
これは一般公開向けの汎用ネットワークモデルではありません。
マイクロソフトのモデルカードでは、高度なサイバーセキュリティ機能はデュアルユース技術に該当するため、アクセスは選定されたMDASH顧客に限定され、追加の審査が必要であると記載されています。
また、このモデルはMDASHとの統合専用に設計されており、スタンドアロンのダウンロード可能なモデルや無制限の公開APIとしては提供されていません。
MAI-Cyber-1-Flashは総パラメータ数が1370億ですが、トークンごとにアクティブになるのは約50億パラメータのみです。
このスパース混合エキスパート設計により、モデルはより大きな総容量にアクセスしながら、比較的小さなアクティブ推論オーバーヘッドを維持できます。
しかし、より重要な最適化は専門化にあります。
汎用フロンティアモデルは、文章作成、数学、研究、コーディング、会話、計画、マルチモーダル作業、ツール使用をサポートする必要があります。一方、専用モデルは、トレーニングとポストトレーニングのより多くを単一の運用領域に集中させることができます。
MAI-Cyber-1-Flashの場合、その領域には実行可能なセキュリティ環境と脆弱性管理ワークフローが含まれます。
モデルがトレーニングおよび評価環境に類似したタスクに繰り返し直面する場合、専門化はコストパフォーマンスを向上させることができます。
システムには依然として予備手段が必要です。なぜなら、困難または特殊なケースは専用モデルの能力範囲を超える可能性があるからです。
これにより、実用的なマルチモデルアーキテクチャが生まれます:
低コストの専用モデルが広範囲を担当
+
フロンティアモデルが例外を担当
+
検証システムが信頼性を保証
モデルカードには、特に有用なシステムレベルの比較が記載されています。
マイクロソフトは、以前のMDASH構成がCyberGymで**88.4%**を獲得したと述べています。
ワークフロー内の既存モデル呼び出しの80% をMAI-Cyber-1-Flashに置き換えた後、結果は**95.95%**に向上しました。
コストも、これまで最強だった構成と比較して約半分に削減されました。
この結果は、一般的な前提に挑戦します:
より安価なモデルは必然的に品質を低下させる。
モデルが同じタスクに単独で直面した場合、これは当てはまるかもしれません。しかし、ルーティングシステム内では、常にそうとは限りません。
専用モデルは、特定のタスク向けにトレーニングされているため、一般的なタスクでより安定したパフォーマンスを発揮する可能性があります。ルーターは、高価なフロンティアモデルを最も価値を生み出すシナリオに留めておくことができます。
最終的な結果は、次の3つの質問に正しく答えられるかどうかにかかっています:
モデルルーティングは、製品品質の一部となります。
マイクロソフトのモデルカードにはまた、以下の報告があります。
MAI-Cyber-1-Flashの他のサイバーセキュリティ評価における単体スコア。
これらの結果はモデル単体のものであり、MDASHのCyberGymでのスコアとは同一ではありません。
モデルカードは以下の通りです:
| ベンチマーク | MAI-Cyber-1-Flash単体結果 |
|---|---|
| CVEBench | 0.314 |
| CyberSecEval4 脅威インテリジェンス | 0.553 |
| CyberSecEval4 マルウェア解析 | 0.33 |
| CRSBench | 0.651(POV=1200) |
| ExploitGym カーネル | 0 |
| ExploitGym ユーザー空間 | 0 |
| ExploitGym ブラウザ | 0 |
これらのデータは、システムレベルの区別の重要性を示しています。
小規模モデルは、すべてのネットワークベンチマークで一貫して先頭に立つわけではありません。最も強力な公開結果は、MDASH内部で他のモデル、エージェント、ツール、データ、検証段階と連携して動作した際に達成されたものです。
これは、マイクロソフトの中心的なメッセージを裏付けています:
モデルは部品である。
システムこそが製品である。
MDASHは、マイクロソフトのマルチモデル・マルチエージェント脆弱性特定・修復フレームワークです。
マイクロソフトは、セキュリティ専門家がシステム内に100以上の専門エージェントを作成したと述べています。
各エージェントは、コードの特定、候補の発見、脆弱性の推論、検証、証明の構築、分類、重複排除、修復、パッチ関連作業、発見結果間の比較など、ワークフローのさまざまな部分を担当します。
簡略化されたシステムフローはおおよそ次のとおりです:
コードとセキュリティコンテキスト
↓
候補発見エージェント
↓
検証エージェント
↓
議論と比較
↓
重複排除
↓
概念実証(PoC)生成
↓
パッチまたは修正サポート
人間によるレビューと管理された運用
具体的な内部実装は専有情報ですが、マイクロソフトはいくつかの重要な設計原則を説明しています。
マイクロソフトは、MDASHがパイプラインの各部分(ターゲット特定、検証、重複排除、証明など)を単一のモデルから分離していると述べています。
これにより、モデルの交換や比較が容易になります。
新しいモデルが利用可能になると、システムはそれを現在のモデルグループとA/Bテストできます。
組織のこれまでの投資は引き続き有効です:
これにより、単一のモデルベンダーやチェックポイントへの依存が軽減されます。
また、継続的な改善も可能になります。ある段階で最適なモデルが、別の段階で最適であるとは限りません。
一部の脆弱性の発見には、ソースコードの読み取りだけでは不十分です。
システムは、プロジェクトのビルド、トリガー入力の作成、脆弱性のあるバージョンの実行、パッチ適用済みバージョンの実行、クラッシュの確認、コード解析データベースの照会、制御フローの比較、その動作が再現可能かどうかの検証を行う必要があるかもしれません。
マイクロソフトは、MDASHが専門のドメインプラグインやコード解析システムを使用できると述べています。
5月の発表では、汎用ログファイルシステムの脆弱性向け検証プラグインについて議論し、CodeQLデータベースも使用可能であると述べました。
モデルは、自由形式のテキストですべての操作を実行する必要はありません。
ソフトウェアによる処理が適しているタスクでは、ツールが決定的な能力を提供できます。
セキュリティモデルは、もっともらしく見えても実際には誤った脆弱性の記述を生成する可能性があります。
システムがすべての推測的な結果を開発者に転送すると、アラート疲れを引き起こします。
運用上の価値は、発見が実際に存在することを証明することにあります。
有用な証拠には以下が含まれる可能性があります:
これが、CyberGymのようなベンチマークが関連性を持つ理由です。
これは、書面による説明の説得力だけを評価するものではありません。
生成された証明が実際に対象の動作を再現できるかをチェックします。
CyberGymは、カリフォルニア大学バークレー校関連の研究者によって作成された大規模ベンチマークです。
現在の公開プロジェクトには、188のソフトウェアプロジェクトにわたる1,507件の実際の脆弱性インスタンスが含まれています。

その主要なPoC生成設定では、エージェントは以下を受け取ります:
エージェントは、その脆弱性を引き起こす概念実証を生成する必要があります。
その後、ベンチマークは動作を評価します。
脆弱性のあるバージョンとパッチ適用済みバージョンの両方に対して評価します。
再現が成功する場合、通常は期待される対比を満たすはずです:
パッチ適用前のバージョン:
PoCが対象の脆弱性を引き起こした。
パッチ適用後のバージョン:
同じPoCではその脆弱性が発生しない。
CyberGymは、OSS-Fuzzエコシステムのプロジェクトを含む主要なオープンソースプロジェクトからの実際の脆弱性を使用しています。
その実行ベースのアーキテクチャは、コードの分類や説明文の生成のみをモデルに要求するベンチマークよりも厳密です。
95.95%という数字は慎重に解釈する必要があります。
CyberGymの主要設定では、エージェントに脆弱性の説明が提供されます。
エージェントは、完全に未知のコードベースから脆弱性の存在の手がかりなしに開始するわけではありません。
したがって、このベンチマークは既知の脆弱性の再現の一形式を測定しています。
これは直接的に以下を意味するものではありません:
このベンチマークは依然として困難な作業を必要とします。エージェントは実際のコードベース内をナビゲートし、関連する動作を特定し、有効なトリガーを構築し、ソフトウェアをビルドまたは実行し、結果を検証する必要があります。
正確な説明は次のとおりです:
報告されたスコアは、マイクロソフトが使用するCyberGym評価構成における脆弱性再現成功率です。
CyberGymの元の論文の最初のバージョンでは、最も強力なテスト構成であるOpenHandsとClaude 3.7 Sonnetの組み合わせが11.9%の再現成功率を達成したと報告されました。
その後のベンチマーク改訂、エージェントフレームワーク、モデル世代、システム設計により、結果は大幅に改善されました。
マイクロソフトが報告した95.95%は、モデルとツールフレームワークの組み合わせによる進歩の速さを示しています。
ただし、この比較は純粋なモデル対モデルの改善として解釈されるべきではありません。
これらのシステムは、モデル世代、エージェントフレームワーク、プロンプト、ツール、検証、計算予算、コスト、タスクルーティング、ベンチマークバージョン、インフラストラクチャ、再試行戦略などにおいて異なります。
進歩は本物ですが、それはシステムレベルの進歩です。
元の記事によると、公開時点でマイクロソフトの95.95%の結果は公開のCyberGymリーダーボードに反映されていませんでした。
マイクロソフトの以前の5月の構成は約88.4%〜88.45%と報告されており、これは以前にベンチマークリーダーとして公開されていました。
新しい95.95%の数字は、MAI-Cyber-1-Flashの発表、モデルカード、およびマイクロソフトのProject Perception発表で公開されました。
外部のリーダーボードエントリや独立した再現が利用可能になるまで、これはマイクロソフト報告の結果として説明されるべきです。
これにより結果が無意味になるわけではありません。読者は以下を区別すべきであることを意味します:
ベンダー報告の評価
と
独立して再現された公開結果
この区別は、急速に変化するベンチマーク比較において特に重要です。
マイクロソフトは、その歴史的なセキュリティデータを最も深い強みと考えています。
同社は、毎日100兆を超えるセキュリティシグナルを処理し、160万の顧客からの運用上の洞察を持っていると述べています。
そのセキュリティ可視性は、アイデンティティ、エンドポイント、クラウド、ネットワーク、データ、ブラウザ、アプリケーションをカバーしています。
価値は単なるイベントの数だけではありません。
同社はセキュリティ行動を結果と結び付けることができます:
どのパッチが問題を解決したか。
これによりフィードバックのループが形成される。
セキュリティインシデント
→ 調査
→ 検証
→ 修正
→ 観察された結果
→ より良いデータとフィードバック
→ 改善されたモデルとエージェント
競合他社も同様の基盤モデルを入手できる。
しかし、数十年かけて検証されてきた運用実績を一夜で再現することはできない。
大量のデータは、それがトレーニング、評価、運用コンテキストに変換されて初めて価値を持つ。
生のセキュリティシグナルは、反復的で、ノイズが多く、不完全で、顧客固有で、機密性が高く、ラベルが誤っている可能性があり、可視化された攻撃に偏っているか、最終結果が欠けている場合がある。
データパイプラインは、イベントを信頼できるラベルおよび結果と結びつける必要がある。
例えば:
アラート発動
→ アナリストが調査
→ 脆弱性を確認
→ パッチを適用
→ エクスプロイトが無効化
この一連の流れは、単独のアラートよりも価値がある。
堀は、データと、データの整理、フィードバック、評価、セキュリティ運用へのアクセスから生まれる。
マイクロソフトの3つの部分からなるフレームワークは、エンタープライズ向けAIセキュリティシステムを評価するための有用な方法を提供する。
質問には以下が含まれる:
質問には以下が含まれる:
質問には以下が含まれる:
モデルは強力だがデータが弱く検証が不足しているシステムは、印象的だが信頼性に欠けるレポートを生成する可能性がある。
アイデアを一文で入力するだけで、We0 AI が紹介サイト、ページ、CMS を生成し、公開後の顧客獲得と流入拡大を支援します。
無料登録で完全なプロジェクトを 1 つ生成
1 つの完全な生成フローを試し、最初のプロジェクトのドラフトをすぐに確認するのに最適です。
適切に設計されたシステムは、小規模モデルに正しいタスクを割り当て、その作業をチェックすることで、より有用にできる。
マイクロソフトは、セキュリティスキャンが継続的に実行される場合、トークンコストが中核的な制約になると考えている。
簡略化したワークロードを考えてみる:
月間1000万件のコード分析タスク
各タスクに最も高価な最先端モデルを使用すると、完全なカバレッジでの実行が難しくなる可能性がある。
ルーティング設計により、平均コストが変化する:
90%は低コストの専門モデル
+
10%は高価な最先端モデル
実際の
経済性は、入力長、出力長、ツール呼び出し、リトライ、サンドボックス実行、コードインデックス、検証、人間によるレビュー、インフラストラクチャ、データストレージにも依存する。
モデルのトークン費用は構成要素の一つに過ぎない。
それでも、ルーティングメカニズムは、高価なモデルが選択的に使用されるため、強力な最適化の機会を生み出す。
ベンチマークは、統一されたテストフレームワークで個々のモデルを比較できる。
製品は完全なワークフローを最適化する必要がある。
最良のシステムは、個別のランキングで首位ではないモデルを使用している可能性がある。そのモデルが、より良い速度、コスト、専門性、予測可能性、ツール使用、コンテキスト効率、セキュリティ調整、テストフレームワークとの互換性を提供する場合である。
これは他の本番システムと同様である。
データベースはすべてのクエリに同じアルゴリズムを選択しない。クラウドスケジューラはすべてのワークロードを最大のマシンに配置しない。セキュリティシステムはすべてのタスクを最も高価なモデルに送るべきではない。
サイバーセキュリティモデルは、特別なセキュリティリスクをもたらす。
防御者が脆弱性を検証するのを支援する同じ能力が、攻撃者が脆弱性を悪用するのを支援する可能性もある。
そのため、マイクロソフトは MAI-Cyber-1-Flash へのアクセスを制限している。
モデルカードには次のように記載されている:
マイクロソフトは、このモデルがセキュリティファーストのアプローチで調整され、マイクロソフト AI レッドチームによって評価され、自動化された敵対的演習によってテストされ、セキュリティ専門家によってテストされ、独立した第三者によって評価されたと述べている。
独立した評価では重大度の高い問題は見つからなかったとされている。
これは、このモデルにリスクがないことを証明するものではない。企業が無制限の公開リリースではなく、制限付き展開から始める理由を説明している。
マイクロソフトのモデルカードには、いくつかの限界が記載されている。
このモデルは主に英語でトレーニングおよび評価されている。他の言語では性能が低下する可能性がある。
他の言語モデルと同様に、不正確、不完全、または誤ったコードやテキストを生成する可能性がある。出力はレビューと検証が必要である。
このモデルは意図的に慎重に動作するように調整されている。正当な防御的リクエストが曖昧であったり、有害な活動に類似している場合、セーフガードが発動する可能性がある。
このモデルは MDASH 専用に設計されている。単独の結果は、完全なシステムの能力を表すものではない。
承認された防御的セキュリティ運用以外での使用はサポートされていない。
マイクロソフトの5月の MDASH 発表には、実際のセキュリティ研究からの例が含まれていた。
同社は、21個の意図的に埋め込まれた脆弱性を含む未公開のサンプルドライバーでテストフレームワークを試験したと報告している。管理されたテストで、MDASH は21個すべての脆弱性を特定し、誤検知はゼロだったと述べている。
マイクロソフトはまた、MDASH が5月に発表された16件の CVE の特定に貢献したと報告している。
2026年の Windows パッチチューズデーのリリースである。
これらはマイクロソフト自身の製品および研究に関する主張である。
これらは、プライベートコード、実際のエンジニアリングワークフロー、脆弱性検証、パッチプロセス、セキュリティチームによるレビューを含むため、ベンチマークスコアよりも展開との関連性が高い。
一方、選択されたケーススタディは、すべてのコードベースで普遍的な誤検知率や成功率を確立するものではない。
マイクロソフトは、より大規模なエージェント型セキュリティシステムとして Project Perception を発表した。
その目標は、防御者を支援する AI から、重要な判断を人間の管理下に置きつつ、より多くのセキュリティワークフローを引き受けられる AI への移行である。
Project Perception は3つのカテゴリのエージェントを調整する:
| エージェントカテゴリ | 主な責務 |
|---|---|
| レッドエージェント | 攻撃者の思考をシミュレートし、潜在的な侵入経路を特定する |
| ブルーエージェント | 調査を実施し、コンテキストに基づいて推論し、有意義なリスクを検出およびトリアージする |
| グリーンエージェント | 修正、システム強化、露出面の低減を行う |

この3つの役割はループを形成する:
レッドエージェントが経路を発見
→ ブルーエージェントが検証し優先順位を決定
→ グリーンエージェントが修正
→ システムが結果を観察
→ 将来の防御能力が改善
マイクロソフトは、Project Perception が2026年8月3日にパブリックプレビューに入ったと述べている。
マイクロソフトは、このシステムを相互接続された複数のレイヤーとして説明している。
システムは、エンドポイント、アイデンティティ、クラウド、アプリケーション、その他のデジタル資産を監視する。
生のシグナルは、資産、アイデンティティ、関係、ポリシー、リスク、アクティビティ、履歴イベントの関連表現に変換される。
このプラットフォームは、MAI-Cyber-1-Flash などの専門的なネットワークモデルを含むマルチモデル戦略を採用している。
調整フレームワークは、モデル、エージェント、ツール、ワークフロー、テスト、権限、制御手段を調整する。
レッド、ブルー、グリーンのエージェントが専門的なセキュリティ作業を実行する。
アクチュエーターは、意思決定を統合セキュリティ製品における実際のアクションに変換する。
このアーキテクチャはチャットボットよりもはるかに広範囲である。これは、継続的に実行されるセキュリティオペレーティングシステムを形成することを意図している。
人間は依然として重要な意思決定に責任を負う
マイクロソフトは、影響の大きい操作は人間が管理し続けると明確に述べている。
Project Perceptionのページでは、役割分担を次のように説明している:
エージェントが作業を実行する。
人間が判断を下す。
防御側は、目標、戦略、防御境界、承認要件、範囲、対応優先順位を設定する。
影響の大きい操作には、依然として人間の承認が必要である。
これは、セキュリティ修正自体が害を及ぼす可能性があるためである。
自動化システムは、正当なアカウントを無効化したり、本番トラフィックをブロックしたり、重要なファイルを削除したり、
業務システムを隔離したり、欠陥のあるパッチを展開したり、運用を中断させたりする可能性がある。
誤った行動のコストは、見逃しのコストよりも高くなる可能性がある。
マイクロソフトは Security Copilot を、AI支援による対話型インターフェースとして説明している。
Project Perceptionは、より広範なエージェントシステムとして位置づけられている。
| 製品コンセプト | 役割 |
|---|---|
| Security Copilot | 生成系インターフェースを通じて支援を提供するAI |
| Project Perception | セキュリティワークフロー内で継続的に推論し行動するAIエージェント |
これら2つの製品は連携して機能するように設計されている。
人間はCopilotを使って作業を理解・指導し、Perceptionエージェントは継続的な運用プロセスのより多くの部分を引き受けることができる。
マイクロソフトによると、Project Perceptionはセキュリティコンピューティングユニット(SCU)を単位とする消費量ベースの価格設定を採用している。
エージェントの種類によって、タスクの強度に応じて消費するリソースが異なる。
これにより、モデルとワークフローの効率性が経済的に極めて重要になる。
レッドチームシミュレーション、迅速なトリアージタスク、長期的な修復ワークフローでは、消費するリソースが異なる可能性がある。
MDASHで使用されるマルチモデルルーティング戦略は、このより広範な価格設定モデルと一致している。
通常の作業をより小型の専用モデルで処理できれば、同じ予算でより多くのセキュリティカバレッジを実現できる可能性がある。
最先端モデルへのアクセスは希少性を失いつつある。
組織はますますAPIを通じて強力な公開モデルを呼び出せるようになっている。
希少な部分は、モデルのセキュリティ主張が真実かどうかを判断できるシステムである可能性がある。
そのシステムには、実行環境、ビルドインフラストラクチャ、バージョン管理、証明生成、パッチ比較、セキュリティ知識、サンドボックス、重複排除、人間によるレビュー、証跡追跡が必要である。
セキュリティの分野では、証拠のない見栄えの良い説明では不十分なことが多い。
堀は次のものから:
強力なモデルへのアクセス
次のものへと移行する:
モデルの作業を検証し実際に展開するための信頼できるプロセス
すべての操作に自動的に最も高価なモデルを使用しないこと。
評価セットを構築し、どのタスクを小型の専用モデルで確実に処理できるかを判断する。
1つのエージェントまたはモデルが候補結果を生成できる。別のエージェント、ツール、または決定的テストがそれを検証する必要がある。
可能な場合は、文章による主張を受け入れるのではなく、再現可能なテストを要求する。
収集、分析、検証の自動化を優先する。破壊的または本番に影響を与える操作は、承認ゲートの後ろに残す。
トークン価格だけでは正しい指標ではない。
多くの誤検知を生成する安価なモデルは、運用レベルでよりコストがかかる可能性がある。
有用な指標には、確認された脆弱性ごとのコスト、検証時間、誤検知率、人間によるレビュー時間、パッチ受け入れ率、回帰率などがある。
モデルの世代交代は速い。
タスク定義、ツール、検証、セキュリティコントロールを、基盤となるモデルが変更された場合でも再利用可能に保つ。
アラートだけでなく結果も記録する。
システムは、どの発見が真実で、どの修正が効果的かを学習する必要がある。
CyberGymのリポジトリは、そのサービスを公開インターネットに公開しないよう警告している。
マイクロソフトも、テスト用のサンドボックス化されたネットワーク分離環境を説明している。
脆弱性の再現は、管理されたインフラストラクチャ内で行う必要がある。
真剣な評価は、単一のヘッドラインスコアだけで構成されるべきではない。
95.95%というスコアは重要だが、証拠の範囲を超えて一般化すべきではない。
この結果は、MDASH、複数のエージェント、2つのモデル層、ツール、データによって共同で生み出されたものである。
この結果はマイクロソフトによって公開された。独立した再現検証には依然として価値がある。
CyberGymは、明確に定義された脆弱性再現タスクを測定する。
本番環境での誤検知の挙動は、別途測定する必要がある。
マイクロソフトは重要な操作について人間の署名を保持している。
MAI-Cyber-1-Flashは、承認されたMDASH顧客のみがプライベートプレビューで利用できる。
結果は、言語、脆弱性カテゴリ、コードベース、ツール、ベンチマークフレームワークによって異なる可能性がある。
MDASHは、ソフトウェアの脆弱性を識別、検証、優先順位付け、修復するためのマイクロソフトのマルチモデル・マルチエージェントシステムである。専門エージェント、複数のモデル、コード分析ツール、検証証明生成、検証、企業セキュリティコントロールを組み合わせている。
MAI-Cyber-1-Flashは、マイクロソフトのサイバーセキュリティ専用スパースMoEモデルである。公式モデルカードによると、総パラメータは1370億、アクティブパラメータは50億、コンテキストウィンドウは256Kで、アクセスは制御されている。
Azure AI FoundryのプライベートプレビューでMDASHを通じて提供される。
いいえ。95.95%の結果は、MAI-Cyber-1-Flash、GPT-5.4、エージェント、ツール、データ、検証プロセスを使用した完全なMDASH構成に属する。マイクロソフトの独立したモデルカードの結果は、他の複数のネットワークベンチマークで異なり、スコアも低い。
マイクロソフトは、MAI-Cyber-1-Flashがルーティング型MDASHワークフロー内のタスクの最大90%を処理するように設計されていると述べている。これは、そのモデルがすべての脆弱性の90%を独立して発見または修正したことを意味するものではない。
CyberGymは主に、エージェントが脆弱性の説明とパッチ適用前のコードベースに基づいて、既知の現実世界の脆弱性を再現できる概念実証(PoC)を生成できるかどうかを評価する。このPoCは、脆弱なバージョンとパッチ適用済みバージョンの両方に対してテストされる。
このスコアはマイクロソフトによってその発表とモデルカードで公開された。ソース記事で説明されている時点では、この結果は更新された結果として公開ベンチマークリーダーボードにまだ掲載されていないため、マイクロソフトの自己報告データとして説明すべきである。
公開されているモデルのダウンロード記録はない。マイクロソフトは、このモデルがAzure AI Foundryのプライベートプレビューを通じて選定されたMDASH
お客様が提供し、審査と承認を経る必要があります。
Project Perception は、マイクロソフトのより広範なエージェント型セキュリティシステムです。レッドチームエージェント、ブルーチームエージェント、グリーンチームエージェントを調整し、検出、調査、修復、強化のワークフローをカバーしながら、重要な意思決定は人間に委ねます。
マイクロソフトは、MAI-Cyber-1-Flashを統合し、最も困難なケースをGPT-5.4にルーティングした後、MDASHがCyberGymで95.95%の成功率に達したと報告しています。また、従来の最強モデル構成と比較してコストが50%削減されたとも報告しています。
この結果は単一のモデルによるものではありません。100を超えるエージェント、履歴セキュリティデータ、専用ツール、証明生成、検証、重複排除、サンドボックス、人間による設計されたオーケストレーションを含む、マルチモデルセキュリティシステムによるものです。
CyberGymは主に、説明文とパッチ適用前のコードから既知の脆弱性を再現する能力をテストします。したがって、このスコアは、このベンチマークにおける強力な脆弱性再現性能を証明するものであり、一般的なゼロデイ脆弱性の発見や自律的な修復率を証明するものではありません。
Project Perception は、同じシステム思想をコードスキャン以外にも拡張します。赤エージェントがリスクを露呈し、青エージェントがリスクを調査し、緑エージェントがリスクを修復し、重要な意思決定は引き続き人間が担います。
核心となる教訓は、最先端のサイバーセキュリティの優位性が、単一の強力なモデルを入手することから、信頼できるセキュリティシステム内で複数のモデルをルーティング、検証、運用する能力へと移行していることです。
ひとことから始めて、数分で完全なサイトを手に入れましょう。