引言
微软报告称,其多模型、多代理系统MDASH的新配置在CyberGym上的成功率达到95.95%。该系统用于识别、验证、优先级排序和修复软件漏洞。
这个数字令人瞩目。最初的CyberGym论文报告称,其测试的最强组合——OpenHands搭配Claude 3.7 Sonnet——在首次发布的评估中仅复现了基准测试中11.9%的漏洞。
微软的最新结果远高于此。然而,这一公告最重要的部分不仅仅是新模型能力更强。
95.95%的得分是由一个完整的安全系统产生的,该系统结合了:
- 一个小型网络安全专项模型。
- 一个用于处理疑难案例的大型前沿模型。
- 超过100个专业代理。
- 代码分析和验证工具。
- 历史安全数据。
- 证明生成。
- 去重机制。
- 沙盒执行环境。
- 人工设计的编排流程。
微软用三个词总结了这一方法:
模型
数据
框架
模型贡献智能。数据赋予智能以安全上下文。框架将模型输出转化为可重复、可验证的工作流程。
这一区分之所以重要,是因为企业安全团队不会购买基准测试答案。他们需要的是一套能够持续运行、控制误报、证明发现真实存在,并帮助将结果转化为安全修复的系统。

报告中的95.95%结果
微软发布的CyberGym图表比较了五种模型与代理配置:
| 系统或模型配置 | 微软报告的CyberGym成功率 |
|---|---|
| MDASH: MAI-Cyber-1-Flash + GPT-5.4 | 95.95% |
| GPT-5.5 Cyber | 85.6% |
| Mythos 5 | 83.8% |
| GPT-5.6 Sol | 83.6% |
| Gemini 3.5 Flash Cyber in CodeMender | 83.2% |
MDASH配置在微软图表中领先第二名超过十个百分点。
微软还表示,该配置的成本比此前最强的MDASH设置(使用GPT-5.4、GPT-5.4 mini和GPT-5.3 Codex)降低了约50%。
因此,比较涉及两个维度:
- 安全性能。
- 持续运行该性能的经济性。
安全扫描不是一次性问题。大型组织可能需要检查数百万行代码,在每次变更后重复扫描,验证疑似漏洞,重新测试补丁,并监控不断变化的软件资产。
一个能力极强但频繁运行成本过高的配置,可能还不如一个嵌入在更优路由和验证系统中的稍小模型带来更多实际保护。
更重要的数字可能是
达到90%
微软表示,MAI-Cyber-1-Flash 的设计目标是处理 MDASH 工作流程中高达90%的任务。
最困难的10%任务可以路由到更大的模型,微软在已发布的配置中将其标识为 GPT-5.4。

该策略可以表述为:
常见且频繁的安全任务
→ MAI-Cyber-1-Flash
异常困难的任务
→ GPT-5.4
这并不等于说 MAI-Cyber-1-Flash 独自修复了90%的漏洞。
90%这一数字指的是小型模型在路由工作流程中设计覆盖的任务份额。完整的 MDASH 结果仍然依赖于任务路由器、更大的模型、专用代理、验证、证明生成、去重、安全工具、执行环境和系统级控制。
小型模型降低了工作流程的平均成本,但并未消除在最具难度的案例中对更强模型的需求。
MAI-Cyber-1-Flash 模型规格
微软将 MAI-Cyber-1-Flash 描述为其首款网络安全专用模型。
官方模型卡列出:
| 规格 | MAI-Cyber-1-Flash |
|---|---|
| 架构 | 稀疏混合专家 Transformer |
| 总参数 | 137B |
| 激活参数 | 5B |
| 上下文长度 | 256K |
| 输入 | 文本 |
| 输出 | 文本 |
| 基础模型 | MAI-Code-1-Flash |
| 主要环境 | 微软代号 MDASH |
| 发布日期 | 2026年7月27日 |
| 可用性 | Azure AI Foundry 私有预览,面向获批的 MDASH 客户 |
该模型是 MAI-Code-1-Flash 的网络安全专用微调版本。
它专为漏洞识别、验证、优先级排序、分类、修复支持和企业级代码扫描等工作流程而设计。
它不是一个面向公众的通用网络模型。
微软的模型卡指出,访问权限仅限于选定的 MDASH 客户,并且需要额外审查,因为高级网络安全能力属于双重用途技术。
该模型还专门为与 MDASH 集成而设计,而不是作为独立的可下载模型或不受限制的公共 API。
为什么一个5B激活参数的模型能承担大部分工作
MAI-Cyber-1-Flash 总参数为1370亿,但每个 token 仅激活约50亿参数。
这种稀疏混合专家设计使模型能够访问更大的总容量,同时保持相对较小的激活推理开销。
然而,更重要的优化在于专业化。
通用前沿模型必须支持写作、数学、研究、编码、对话、规划、多模态工作和工具使用。而专用模型可以将更多训练和后训练集中在单一操作领域。
对于 MAI-Cyber-1-Flash 而言,该领域包括可执行安全环境和漏洞管理。
工作流。
当模型反复遇到与其训练和评估环境相似的任务时,专业化可以提升性价比。
系统仍然需要备用方案,因为困难或特殊的案例可能超出专精模型的能力范围。
这催生了一种实用的多模型架构:
低成本专精模型负责广度
+
前沿模型负责例外情况
+
验证系统负责信任保障
用专精模型替换 80% 的模型调用后,系统得分显著提升
模型卡提供了一项特别有用的系统级对比。
微软表示,此前的 MDASH 配置在 CyberGym 上得分 88.4%。
在将工作流中 80% 的现有模型调用 替换为 MAI-Cyber-1-Flash 后,结果提升至 95.95%。
成本相较此前最强的配置也下降了约一半。
这一结果挑战了一个常见假设:
更便宜的模型必然降低质量。
在模型单独面对同一任务进行比较时,这或许成立。但在路由系统内部,情况并非总是如此。
专精模型可能因为针对特定任务训练而在处理常见任务时表现更稳定。路由器可以将昂贵的前沿模型保留在能创造最大价值的场景中。
最终结果取决于能否正确回答三个问题:
- 哪些任务应使用专精模型?
- 哪些任务需要前沿模型?
- 每个结果应如何验证?
模型路由成为产品质量的一部分。
95.95% 的得分属于 MDASH,而非小模型本身
微软的模型卡还报告了 MAI-Cyber-1-Flash 在其他网络安全评估中的独立成绩。
这些仅限模型本身的结果并不等同于 MDASH 在 CyberGym 上的得分。
模型卡列出如下:
| 基准测试 | MAI-Cyber-1-Flash 独立结果 |
|---|---|
| CVEBench | 0.314 |
| CyberSecEval4 威胁情报 | 0.553 |
| CyberSecEval4 恶意软件分析 | 0.33 |
| CRSBench | 0.651(POV=1200) |
| ExploitGym 内核 | 0 |
| ExploitGym 用户态 | 0 |
| ExploitGym 浏览器 | 0 |
这些数据说明了系统级区分的重要性。
小模型并非在所有网络基准上都全面领先。它最强的已发布结果是在 MDASH 内部与其他模型、代理、工具、数据和验证阶段协同运作时取得的。
这印证了微软的核心信息:
模型是组件。
系统才是产品。
MDASH 的功能
MDASH 是微软的多模型、多代理漏洞识别与修复框架。
微软表示,其安全专家已在系统中创建了 100 多个专业化代理。
不同代理负责工作流的不同环节,包括代码定位、候选发现、漏洞推理、验证、证明构建、分类、去重、修复、补丁相关工作以及发现结果之间的比对。
简化后的系统流程大致如下:
代码与安全上下文
↓
候选发现代理
↓
验证代理
↓
辩论与比对
↓
去重
↓
概念验证生成
↓
补丁或修复支持
人工审查与受控操作
具体的内部实现属于专有信息,但微软已阐述了若干重要的设计原则。
该框架在设计上与模型无关
微软表示,MDASH将流水线的各个部分(如目标定位、验证、去重和证明)与任何单一模型分离开来。
这使得替换或比较模型更加容易。
当新模型可用时,系统可以将其与当前模型组进行A/B测试。
组织此前的投资仍可保持有效:
- 范围文件。
- 插件。
- 配置。
- 校准。
- 验证规则。
- 安全工作流。
这减少了对单一模型供应商或检查点的依赖。
同时也使持续改进成为可能。某个阶段的最佳模型未必是另一阶段的最佳模型。
专业化工具扩展模型推理能力
某些漏洞的发现不仅仅需要阅读源代码。
系统可能需要构建项目、创建触发输入、运行存在漏洞的版本、运行已修补的版本、检查崩溃、查询代码分析数据库、比较控制流,并验证该行为是否可复现。
微软表示,MDASH可以使用专门的领域插件和代码分析系统。
其五月份的公告讨论了用于通用日志文件系统漏洞的验证插件,并指出也可以使用CodeQL数据库。
模型无需通过自由格式文本执行所有操作。
对于更适合由软件处理的任务,工具可以提供确定性的能力。
验证才是真正的产品边界
安全模型可能产生看似合理但实际上错误的漏洞描述。
如果系统将每个推测性结果都转发给开发人员,就会造成警报疲劳。
运营价值在于证明发现是真实存在的。
有用的证据可能包括:
- 可复现的崩溃。
- 概念验证输入。
- 失败的测试。
- 补丁前成功执行。
- 补丁后执行失败。
- 精确的代码路径。
- 已验证的受影响版本。
- 去重后的报告。
- 通过测试的补丁。
这就是为什么像CyberGym这样的基准测试具有相关性。
它不仅对书面解释的说服力进行评分。
它检查生成的证明是否确实能够复现目标行为。
CyberGym评估的内容
CyberGym是由加州大学伯克利分校相关研究人员创建的大规模基准测试。
当前公开项目包含跨188个软件项目的1,507个真实漏洞实例。

在其主要的PoC生成设置中,智能体接收:
- 漏洞描述。
- 相应的补丁前代码库。
- 执行环境。
智能体必须生成能够触发该漏洞的概念验证。
然后基准测试评估行为
针对易受攻击版本和已修补版本。
一次成功的复现通常应当满足预期的对比:
补丁前版本:
PoC 触发了目标漏洞。
补丁后版本:
相同的 PoC 不再触发该漏洞。
CyberGym 使用来自主要开源项目(包括 OSS-Fuzz 生态系统中的项目)的真实漏洞。
其基于执行的架构使其比仅要求模型对代码进行分类或撰写解释的基准测试更加严谨。
CyberGym 未衡量的内容
95.95% 这个数字需要仔细解读。
CyberGym 的主要设置会为智能体提供漏洞描述。
智能体不一定是从一个完全未知的代码库开始,且对漏洞存在毫无线索。
因此,该基准衡量的是已知漏洞复现的一种形式。
它并不直接意味着:
- 95.95% 的未知漏洞被发现。
- 95.95% 的所有软件漏洞被修复。
- 该模型能够自主保护任何代码库。
- 该系统具有 95.95% 的零日漏洞发现准确率。
- 该系统在生产环境中不产生误报。
该基准仍然需要艰巨的工作。智能体必须在真实代码库中导航,定位相关行为,构造有效的触发器,构建或执行软件,并验证结果。
正确的描述是:
所报告的分数是在微软使用的 CyberGym 评估配置上的漏洞复现成功率。
从 11.9% 到 95.95%
CyberGym 原始论文的第一版报告称,最强的测试组合——OpenHands 搭配 Claude 3.7 Sonnet——达到了 11.9% 的复现成功率。
后来的基准修订、智能体框架、模型代际和系统设计大幅改善了结果。
微软报告的 95.95% 展示了模型与工具框架的结合进步速度之快。
然而,这种比较不应被解读为纯粹的模型与模型之间的改进。
这些系统在模型代际、智能体框架、提示词、工具、验证、计算预算、成本、任务路由、基准版本、基础设施和重试策略等方面各不相同。
进步是真实的,但这是系统层面的进步。
公开排行榜与公司报告的结果
源文章指出,在发布时,微软 95.95% 的结果尚未反映在公开的 CyberGym 排行榜上。
微软早先的 5 月配置报告约为 88.4%–88.45%,此前已作为基准领先者公开发布。
新的 95.95% 数据由微软在 MAI-Cyber-1-Flash 公告、模型卡以及微软的 Project Perception 公告中发布。
在外部排行榜条目或独立复现可用之前,它应被描述为微软报告的结果。
这并不会使该结果失去意义。这意味着读者应区分:
供应商报告的评估
与
独立复现的公开结果
这种区分在快速变化的基准比较中尤为重要。
数据是最难复制的层
微软
将其历史安全数据视为其最深厚的优势。
该公司表示,每天处理超过100万亿条安全信号,并拥有来自160万客户的运营洞察。
其安全可见性覆盖身份、端点、云、网络、数据、浏览器和应用程序。
价值不仅仅在于事件数量。
该公司能够将安全行动与结果联系起来:
- 哪些漏洞可被利用。
- 哪些攻击已被遏制。
- 哪些检测是误报。
- 哪些缓解措施有效。
- 哪些补丁解决了问题。
- 哪些配置降低了风险。
这形成了一个反馈闭环。
安全事件
→ 调查
→ 验证
→ 修复
→ 观察到的结果
→ 更好的数据和回报
→ 改进的模型和智能体
竞争对手可以获得类似的基础模型。
但无法在一夜之间重现数十年验证过的运营历史。
数据量本身并不足够
只有当大量数据被转化为训练、评估和运营上下文时,它才有价值。
原始安全信号可能具有重复性、噪声大、不完整、客户特定、敏感、标签错误、偏向于可见攻击,或缺少最终结果。
数据管道必须将事件与可信标签和结果连接起来。
例如:
告警触发
→ 分析师调查
→ 确认漏洞
→ 部署补丁
→ 漏洞利用不再生效
这一序列比单独的告警更有价值。
护城河来自数据加上数据整理、反馈、评估和安全运营访问。
模型、数据与工具框架
微软的三部分框架为评估任何企业级AI安全系统提供了有用的方法。
模型
问题包括:
- 使用了哪些模型?
- 它们如何专业化?
- 延迟是多少?
- 令牌成本是多少?
- 哪些任务需要更大的模型?
- 安全限制是什么?
数据
问题包括:
- 有哪些安全上下文可用?
- 最新程度如何?
- 如何标注?
- 是否包含已验证的结果?
- 是否针对特定客户?
- 隐私和权限如何处理?
- 数据质量如何衡量?
工具框架
问题包括:
- 任务如何分解?
- 模型如何路由?
- 工具如何调用?
- 发现如何验证?
- 重复项如何去除?
- 何时需要人工介入?
- 失败如何审计?
- 模型能否在不重建系统的情况下被替换?
一个模型强大但数据薄弱且缺乏验证的系统,可能会生成令人印象深刻但不可靠的报告。
一个设计良好的系统可以通过为较小模型分配正确任务并检查其工作,使其变得更加有用。
持续安全运营的经济性
微软认为,当安全扫描持续运行时,令牌成本成为核心约束。
考虑一个简化的工作负载:
每月1000万次代码分析任务
如果每个任务都使用最昂贵的尖端模型,系统可能难以在完整覆盖范围内运行。
一种路由设计改变了平均成本:
几分钟搭建展示站并增长获客
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
90%低成本专业模型
+
10%昂贵尖端模型
实际
经济性也取决于输入长度、输出长度、工具调用、重试、沙箱执行、代码索引、验证、人工审查、基础设施和数据存储。
模型 token 费用只是其中一个组成部分。
尽管如此,路由机制创造了一个强大的优化机会,因为昂贵的模型被选择性使用。
为什么最好的模型不一定产生最好的系统
基准测试可以在统一的测试框架下比较单个模型。
产品需要优化完整的工作流程。
最好的系统可能使用的模型在单项排名中并非第一,如果该模型能提供更好的速度、成本、专业性、可预测性、工具使用、上下文效率、安全校准以及与测试框架的兼容性。
这与其它生产系统类似。
数据库不会为每个查询选择同一种算法。云调度器不会把每个工作负载都放在最大的机器上。安全系统不应该把每个任务都发送给最昂贵的模型。
安全性与受限可用性
网络安全模型带来了特殊的安全风险。
帮助防御者验证漏洞的同一能力,也可能帮助攻击者利用漏洞。
因此,微软限制了 MAI-Cyber-1-Flash 的访问权限。
模型卡说明:
- 它通过 Azure AI Foundry 私人预览版提供。
- 它仅用于 MDASH。
- 访问权限仅限于特定客户。
- 需要额外的审批。
- 防御性工作流在适用范围之内。
- 在 MDASH 之外的防御性安全操作中使用不在适用范围之内。
微软表示,该模型以安全优先的方法进行了校准,由微软 AI 红队进行了评估,通过自动化对抗性演练进行了测试,由安全专家进行了测试,并由独立的第三方进行了评估。
据称,独立评估未发现严重级别的问题。
这并不能证明该模型没有风险。它解释了为什么公司以受限部署而非不受限制的公开发布作为开端。
已知模型局限性
微软的模型卡列出了几个局限性。
语言表现
该模型主要使用英语进行训练和评估。在其他语言中,性能可能较低。
错误输出
与其他语言模型一样,它可能生成不准确、不完整或错误的代码和文本。输出需要审查和验证。
保守的安全防护
该模型有意被校准为谨慎行事。当合法的防御性请求存在歧义或类似于有害活动时,安全防护机制可能会被触发。
系统依赖性
该模型专为 MDASH 设计。单独的结果并不代表完整系统的能力。
有限的范围
不支持在经批准的防御性安全操作之外使用。
MDASH 不仅仅是基准测试系统
微软五月份的 MDASH 公告包含了实际安全研究中的示例。
该公司报告称,在一个包含 21 个故意植入漏洞的未发布示例驱动程序上测试了该测试框架。它表示,在受控测试中,MDASH 识别了全部 21 个漏洞,且零误报。
微软还报告称,MDASH 有助于识别五月发布的 16 个 CVE。
2026年Windows补丁星期二发布。
这些是微软自身的产品和研究声明。
它们与部署的相关性比基准测试分数更高,因为它们涉及私有代码、真实的工程工作流、漏洞验证、补丁流程以及安全团队审查。
与此同时,选定的案例研究并不能在所有代码库中确立普遍的误报率或成功率。
从Security Copilot到安全行动系统
微软推出了Project Perception,作为一个更大规模的智能体安全系统。
其目标是从辅助防御者的AI,转变为能够承担更多安全工作流程的AI,同时将关键判断保留在人工控制之下。
Project Perception协调三类智能体:
| 智能体类别 | 主要职责 |
|---|---|
| 红色智能体 | 模拟攻击者思维,识别可能的入侵路径 |
| 蓝色智能体 | 进行调查、基于上下文推理、检测并对有意义的风险进行分诊 |
| 绿色智能体 | 修复、加固系统并降低暴露面 |

这三个角色形成一个循环:
红色智能体发现路径
→ 蓝色智能体验证并确定优先级
→ 绿色智能体进行修复
→ 系统观察结果
→ 未来防御能力得到改进
微软表示,Project Perception于2026年8月3日进入公开预览阶段。
Project Perception技术栈
微软将该系统描述为多个相互连接的层级。
信号与传感器
系统观察端点、身份、云、应用程序以及数字资产的其他部分。
安全上下文
原始信号被转换为资产、身份、关系、策略、风险、活动和历史事件的关联表示。
模型
该平台采用多模型策略,包括MAI-Cyber-1-Flash等专用网络模型。
协调框架(Harness)
协调框架负责协调模型、智能体、工具、工作流、测试、权限和控制措施。
智能体
红色、蓝色和绿色智能体执行专门的安全工作。
执行器
执行器将决策转化为集成安全产品中的实际行动。
该架构比聊天机器人更为广泛。它旨在形成一个持续运行的安全操作系统。
人类仍需对关键决策负责
微软明确表示,人类仍然控制着高影响操作。
其Project Perception页面将分工表述为:
智能体承担工作。
人类承担判断。
防御者设定目标、策略、防护边界、审批要求、范围以及响应优先级。
高影响操作仍需人工审批。
这是必要的,因为安全修复本身也可能造成伤害。
自动化系统可能会禁用合法账户、阻止生产流量、删除关键文件,
隔离某个业务系统、部署有缺陷的补丁或中断运营。
错误行动的成本可能高于漏报的成本。
项目感知与安全副驾驶不同
微软将 Security Copilot 描述为一种人工智能辅助的对话界面。
项目感知则被定位为更广泛的智能体系统。
| 产品概念 | 角色 |
|---|---|
| Security Copilot | 通过生成式界面提供辅助的人工智能 |
| 项目感知 | 在安全工作流中持续推理和行动的AI智能体 |
这两款产品旨在协同工作。
人类可以使用 Copilot 来理解和指导工作,而感知智能体则承担更多持续运营流程的工作。
基于消耗量的定价
微软表示,项目感知采用基于消耗量的定价,以安全计算单元(即SCU)为计量单位。
不同的智能体根据任务的强度消耗不同的资源。
这使得模型和工作流效率在经济上变得至关重要。
红队模拟、快速分类任务和长期修复工作流可能消耗不同的资源。
MDASH 中使用的多模型路由策略符合这一更广泛的定价模式。
如果常规工作可以交由较小的专用模型处理,同样的预算可能覆盖更多的安全防护。
验证可能成为最强护城河
对前沿模型的访问正变得不再稀缺。
各组织越来越能通过API调用强大的公共模型。
稀缺的部分可能是能够确定模型的安全声明是否属实的系统。
该系统需要可执行环境、构建基础设施、版本控制、证明生成、补丁比较、安全知识、沙箱、去重、人工审查和证据追踪。
在安全领域,没有证据的漂亮解释往往是不够的。
护城河从:
访问强大的模型
转向:
验证并落地模型工作的可信流程
安全团队应从 MDASH 学到什么
- 按难度分派任务
不要自动为每项操作使用最昂贵的模型。
建立评估集,确定哪些任务可以由较小的专用模型可靠处理。
- 将发现与验证分离
一个智能体或模型可以生成候选结果。另一个智能体、工具或确定性测试应对其进行验证。
- 要求可执行的证据
在可能的情况下,要求可复现的测试,而不是接受文字化的声明。
- 对重大行动保留人工审批
优先自动化收集、分析和验证。将破坏性或影响生产的操作保留在审批门禁之后。
- 衡量每个已验证发现物的成本
仅凭代币价格并不是正确的衡量指标。
一个产生大量误报的廉价模型,可能在运维层面成本更高。
有用的指标包括每个已确认漏洞的成本、验证时间、误报率、人工审查时间、补丁接受率和回归率。
- 构建与模型无关的测试平台
模型代际更迭迅速。
保持任务
定义、工具、验证以及安全控制,在底层模型更换时依然可以复用。
- 将安全数据视为反馈系统
记录结果,而不仅仅是告警。
系统应当学习哪些发现是真实的,哪些修复措施是有效的。
- 在隔离环境中进行测试
CyberGym 的仓库警告不要将其服务暴露于公共互联网。
微软也描述了用于测试的沙箱化、网络隔离环境。
漏洞复现应当在受控的基础设施中进行。
如何评估 AI 漏洞系统
一项严肃的评估不应只包含一个 headline 分数。
检测与复现
- 系统能否识别相关代码?
- 系统能否生成可行的验证证明?
- 该证明能否区分补丁前后行为?
误报
- 有多少发现无法通过验证?
- 人工审核这些发现需要花费多少时间?
覆盖率
- 支持哪些语言?
- 支持哪些项目类型?
- 处理哪些漏洞类别?
成本
- 每个仓库的成本是多少?
- 每百万行代码的成本是多少?
- 每个确认漏洞的成本是多少?
延迟
- 扫描需要多长时间?
- 验证需要多长时间?
- 系统能否适配 CI 工作流?
修复
- 系统能否提出补丁?
- 补丁能否编译通过?
- 测试能否通过?
- 补丁是否引入回归问题?
安全性
- 代码是否被隔离?
- 执行环境是否限制网络访问?
- 机密信息是否受到保护?
- 操作是否可审计?
人工控制
- 哪些操作需要审批?
- 完整的推理过程和证据能否重放?
- 审核人员能否拒绝或修改建议?
headline 结果的重要局限性
95.95% 这个分数很重要,但不应在证据范围之外进行泛化。
这是一个系统级结果
该结果由 MDASH、多个代理、两个模型层级、工具和数据共同产生。
这是供应商报告的
该结果由微软发布。独立的复现验证仍然有价值。
这是针对特定基准的
CyberGym 衡量的是一个定义明确的漏洞复现任务。
它并不能消除误报
生产环境中的误报行为需要单独进行度量。
它并不代表完全自主
微软对关键操作保留人工签核。
它并不表示模型是公开的
MAI-Cyber-1-Flash 仅限经批准的 MDASH 客户在私人预览中使用。
它不能证明普适的优越性
结果可能因语言、漏洞类别、代码库、工具和基准测试框架的不同而有所差异。
常见问题
什么是 Microsoft MDASH?
MDASH 是微软的多模型、多代理系统,用于识别、验证、确定优先级并修复软件漏洞。它结合了专业代理、多个模型、代码分析工具、验证证明生成、验证以及企业安全控制。
什么是 MAI-Cyber-1-Flash?
MAI-Cyber-1-Flash 是微软的网络安全专用稀疏 MoE 模型。官方模型卡显示其总参数为 1370 亿,活跃参数为 50 亿,上下文窗口为 256K,并且仅限受控访问。
在 Azure AI Foundry 私人预览版中通过 MDASH 提供。
MAI-Cyber-1-Flash 是否独自取得了 95.95% 的得分?
不是。95.95% 的结果属于完整的 MDASH 配置,使用了 MAI-Cyber-1-Flash、GPT-5.4、代理、工具、数据以及验证流程。微软独立的模型卡结果在其他多个网络基准测试上有所不同,且得分更低。
90% 这个数字意味着什么?
微软表示,MAI-Cyber-1-Flash 被设计用于处理路由式 MDASH 工作流中高达 90% 的任务。这并不意味着该模型独立发现或修复了 90% 的所有漏洞。
CyberGym 衡量什么?
CyberGym 主要评估代理是否能够根据漏洞描述和补丁前的代码库,生成一个可复现已知真实世界漏洞的概念验证(PoC)。该 PoC 会针对易受攻击版本和已修补版本进行测试。
95.95% 的结果是否经过独立验证?
该得分由微软在其公告和模型卡中发布。在源文章所描述的时间,该结果尚未作为更新后的结果出现在公开基准测试排行榜上,因此应将其描述为微软自行报告的数据。
开发者可以下载 MAI-Cyber-1-Flash 吗?
没有公开的模型下载记录。微软表示,该模型仅通过 Azure AI Foundry 私人预览版向选定的 MDASH 客户提供,并需经过审查和批准。
什么是 Project Perception?
Project Perception 是微软更广泛的代理式安全系统。它协调红队代理、蓝队代理和绿队代理,覆盖检测、调查、修复和加固工作流,同时将关键决策留由人类负责。
相关工具
- CyberGym:官方开源基准测试工具,用于在真实世界漏洞复现任务中评估 AI 代理。
- Microsoft CodeQL:一种语义代码分析引擎,可以查询代码库中的安全相关模式和数据结构。
- PyRIT:微软的开源 Python 风险识别工具包,用于对生成式 AI 系统进行红队测试。
- Microsoft Foundry:微软的企业级平台,用于构建、评估和管理 AI 模型及代理。
- OpenHands:一个开源的软件开发代理,用于原始 CyberGym 研究评估。
- OSS-Fuzz:谷歌针对开源软件的持续模糊测试基础设施,也是 CyberGym 使用的漏洞数据来源之一。
相关链接
- 在 MDASH 中引入 MAI-Cyber-1-Flash:微软官方公告,涵盖模型路由策略、95.95% 的结果、成本降低以及“模型-数据-架构”框架。
- MAI-Cyber-1-Flash 模型卡:官方规格、访问条件、局限性、安全方法及基准测试详情。
com/en-us/security/blog/2026/05/12/defense-at-ai-speed-microsofts-new-multi-model-agentic-security-system-tops-leading-industry-benchmark/:微软关于该框架、验证架构、安全研究及初始 CyberGym 结果的技术概述。
- Project Perception 公告:微软对红、蓝、绿代理系统及新型网络堆栈的说明。
- Project Perception 产品页面:官方能力、治理模型、定价方式及与 Security Copilot 的关系。
- CyberGym 研究论文:描述基准、任务、数据及原始评估结果的研究论文。
- CyberGym GitHub 仓库:安装、数据集、评估、提交、防火墙及本地部署指南。
摘要
微软报告称,在集成 MAI-Cyber-1-Flash 并将最困难案例路由至 GPT-5.4 后,MDASH 在 CyberGym 上达到了 95.95% 的成功率。该公司还报告称,与此前最强模型配置相比,成本降低了 50%。
该结果并非属于单一模型。它来自一个包含超过 100 个代理、历史安全数据、专用工具、证明生成、验证、去重、沙箱及人工设计编排的多模型安全系统。
CyberGym 主要测试从描述和补丁前代码中复现已知漏洞的能力。因此,该分数证明了在该基准上强大的漏洞复现性能,而非通用的零日漏洞发现或自主修复率。
Project Perception 将相同的系统理念延伸至代码扫描之外:红代理暴露风险,蓝代理调查风险,绿代理修复风险,而关键决策仍由人工掌控。
核心启示在于,前沿网络安全优势正从获取单一强大模型转向在可信安全系统内路由、验证和运营多种模型的能力。



