微软报告其多模型、多代理系统 MDASH 的新配置在 CyberGym 上取得了95.95%的成功率,该系统用于识别、验证、确定优先级并修复安全威胁。

微软报告称,其多模型、多代理系统MDASH的新配置在CyberGym上的成功率达到95.95%。该系统用于识别、验证、优先级排序和修复软件漏洞。
这个数字令人瞩目。最初的CyberGym论文报告称,其测试的最强组合——OpenHands搭配Claude 3.7 Sonnet——在首次发布的评估中仅复现了基准测试中11.9%的漏洞。
微软的最新结果远高于此。然而,这一公告最重要的部分不仅仅是新模型能力更强。
95.95%的得分是由一个完整的安全系统产生的,该系统结合了:
微软用三个词总结了这一方法:
模型
数据
框架
模型贡献智能。数据赋予智能以安全上下文。框架将模型输出转化为可重复、可验证的工作流程。
这一区分之所以重要,是因为企业安全团队不会购买基准测试答案。他们需要的是一套能够持续运行、控制误报、证明发现真实存在,并帮助将结果转化为安全修复的系统。

微软发布的CyberGym图表比较了五种模型与代理配置:
| 系统或模型配置 | 微软报告的CyberGym成功率 |
|---|---|
| MDASH: MAI-Cyber-1-Flash + GPT-5.4 | 95.95% |
| GPT-5.5 Cyber | 85.6% |
| Mythos 5 | 83.8% |
| GPT-5.6 Sol | 83.6% |
| Gemini 3.5 Flash Cyber in CodeMender | 83.2% |
MDASH配置在微软图表中领先第二名超过十个百分点。
微软还表示,该配置的成本比此前最强的MDASH设置(使用GPT-5.4、GPT-5.4 mini和GPT-5.3 Codex)降低了约50%。
因此,比较涉及两个维度:
安全扫描不是一次性问题。大型组织可能需要检查数百万行代码,在每次变更后重复扫描,验证疑似漏洞,重新测试补丁,并监控不断变化的软件资产。
一个能力极强但频繁运行成本过高的配置,可能还不如一个嵌入在更优路由和验证系统中的稍小模型带来更多实际保护。
达到90%
微软表示,MAI-Cyber-1-Flash 的设计目标是处理 MDASH 工作流程中高达90%的任务。
最困难的10%任务可以路由到更大的模型,微软在已发布的配置中将其标识为 GPT-5.4。

该策略可以表述为:
常见且频繁的安全任务
→ MAI-Cyber-1-Flash
异常困难的任务
→ GPT-5.4
这并不等于说 MAI-Cyber-1-Flash 独自修复了90%的漏洞。
90%这一数字指的是小型模型在路由工作流程中设计覆盖的任务份额。完整的 MDASH 结果仍然依赖于任务路由器、更大的模型、专用代理、验证、证明生成、去重、安全工具、执行环境和系统级控制。
小型模型降低了工作流程的平均成本,但并未消除在最具难度的案例中对更强模型的需求。
微软将 MAI-Cyber-1-Flash 描述为其首款网络安全专用模型。
官方模型卡列出:
| 规格 | MAI-Cyber-1-Flash |
|---|---|
| 架构 | 稀疏混合专家 Transformer |
| 总参数 | 137B |
| 激活参数 | 5B |
| 上下文长度 | 256K |
| 输入 | 文本 |
| 输出 | 文本 |
| 基础模型 | MAI-Code-1-Flash |
| 主要环境 | 微软代号 MDASH |
| 发布日期 | 2026年7月27日 |
| 可用性 | Azure AI Foundry 私有预览,面向获批的 MDASH 客户 |
该模型是 MAI-Code-1-Flash 的网络安全专用微调版本。
它专为漏洞识别、验证、优先级排序、分类、修复支持和企业级代码扫描等工作流程而设计。
它不是一个面向公众的通用网络模型。
微软的模型卡指出,访问权限仅限于选定的 MDASH 客户,并且需要额外审查,因为高级网络安全能力属于双重用途技术。
该模型还专门为与 MDASH 集成而设计,而不是作为独立的可下载模型或不受限制的公共 API。
MAI-Cyber-1-Flash 总参数为1370亿,但每个 token 仅激活约50亿参数。
这种稀疏混合专家设计使模型能够访问更大的总容量,同时保持相对较小的激活推理开销。
然而,更重要的优化在于专业化。
通用前沿模型必须支持写作、数学、研究、编码、对话、规划、多模态工作和工具使用。而专用模型可以将更多训练和后训练集中在单一操作领域。
对于 MAI-Cyber-1-Flash 而言,该领域包括可执行安全环境和漏洞管理。
工作流。
当模型反复遇到与其训练和评估环境相似的任务时,专业化可以提升性价比。
系统仍然需要备用方案,因为困难或特殊的案例可能超出专精模型的能力范围。
这催生了一种实用的多模型架构:
低成本专精模型负责广度
+
前沿模型负责例外情况
+
验证系统负责信任保障
模型卡提供了一项特别有用的系统级对比。
微软表示,此前的 MDASH 配置在 CyberGym 上得分 88.4%。
在将工作流中 80% 的现有模型调用 替换为 MAI-Cyber-1-Flash 后,结果提升至 95.95%。
成本相较此前最强的配置也下降了约一半。
这一结果挑战了一个常见假设:
更便宜的模型必然降低质量。
在模型单独面对同一任务进行比较时,这或许成立。但在路由系统内部,情况并非总是如此。
专精模型可能因为针对特定任务训练而在处理常见任务时表现更稳定。路由器可以将昂贵的前沿模型保留在能创造最大价值的场景中。
最终结果取决于能否正确回答三个问题:
模型路由成为产品质量的一部分。
微软的模型卡还报告了 MAI-Cyber-1-Flash 在其他网络安全评估中的独立成绩。
这些仅限模型本身的结果并不等同于 MDASH 在 CyberGym 上的得分。
模型卡列出如下:
| 基准测试 | MAI-Cyber-1-Flash 独立结果 |
|---|---|
| CVEBench | 0.314 |
| CyberSecEval4 威胁情报 | 0.553 |
| CyberSecEval4 恶意软件分析 | 0.33 |
| CRSBench | 0.651(POV=1200) |
| ExploitGym 内核 | 0 |
| ExploitGym 用户态 | 0 |
| ExploitGym 浏览器 | 0 |
这些数据说明了系统级区分的重要性。
小模型并非在所有网络基准上都全面领先。它最强的已发布结果是在 MDASH 内部与其他模型、代理、工具、数据和验证阶段协同运作时取得的。
这印证了微软的核心信息:
模型是组件。
系统才是产品。
MDASH 是微软的多模型、多代理漏洞识别与修复框架。
微软表示,其安全专家已在系统中创建了 100 多个专业化代理。
不同代理负责工作流的不同环节,包括代码定位、候选发现、漏洞推理、验证、证明构建、分类、去重、修复、补丁相关工作以及发现结果之间的比对。
简化后的系统流程大致如下:
代码与安全上下文
↓
候选发现代理
↓
验证代理
↓
辩论与比对
↓
去重
↓
概念验证生成
↓
补丁或修复支持
人工审查与受控操作
具体的内部实现属于专有信息,但微软已阐述了若干重要的设计原则。
微软表示,MDASH将流水线的各个部分(如目标定位、验证、去重和证明)与任何单一模型分离开来。
这使得替换或比较模型更加容易。
当新模型可用时,系统可以将其与当前模型组进行A/B测试。
组织此前的投资仍可保持有效:
这减少了对单一模型供应商或检查点的依赖。
同时也使持续改进成为可能。某个阶段的最佳模型未必是另一阶段的最佳模型。
某些漏洞的发现不仅仅需要阅读源代码。
系统可能需要构建项目、创建触发输入、运行存在漏洞的版本、运行已修补的版本、检查崩溃、查询代码分析数据库、比较控制流,并验证该行为是否可复现。
微软表示,MDASH可以使用专门的领域插件和代码分析系统。
其五月份的公告讨论了用于通用日志文件系统漏洞的验证插件,并指出也可以使用CodeQL数据库。
模型无需通过自由格式文本执行所有操作。
对于更适合由软件处理的任务,工具可以提供确定性的能力。
安全模型可能产生看似合理但实际上错误的漏洞描述。
如果系统将每个推测性结果都转发给开发人员,就会造成警报疲劳。
运营价值在于证明发现是真实存在的。
有用的证据可能包括:
这就是为什么像CyberGym这样的基准测试具有相关性。
它不仅对书面解释的说服力进行评分。
它检查生成的证明是否确实能够复现目标行为。
CyberGym是由加州大学伯克利分校相关研究人员创建的大规模基准测试。
当前公开项目包含跨188个软件项目的1,507个真实漏洞实例。

在其主要的PoC生成设置中,智能体接收:
智能体必须生成能够触发该漏洞的概念验证。
然后基准测试评估行为
针对易受攻击版本和已修补版本。
一次成功的复现通常应当满足预期的对比:
补丁前版本:
PoC 触发了目标漏洞。
补丁后版本:
相同的 PoC 不再触发该漏洞。
CyberGym 使用来自主要开源项目(包括 OSS-Fuzz 生态系统中的项目)的真实漏洞。
其基于执行的架构使其比仅要求模型对代码进行分类或撰写解释的基准测试更加严谨。
95.95% 这个数字需要仔细解读。
CyberGym 的主要设置会为智能体提供漏洞描述。
智能体不一定是从一个完全未知的代码库开始,且对漏洞存在毫无线索。
因此,该基准衡量的是已知漏洞复现的一种形式。
它并不直接意味着:
该基准仍然需要艰巨的工作。智能体必须在真实代码库中导航,定位相关行为,构造有效的触发器,构建或执行软件,并验证结果。
正确的描述是:
所报告的分数是在微软使用的 CyberGym 评估配置上的漏洞复现成功率。
CyberGym 原始论文的第一版报告称,最强的测试组合——OpenHands 搭配 Claude 3.7 Sonnet——达到了 11.9% 的复现成功率。
后来的基准修订、智能体框架、模型代际和系统设计大幅改善了结果。
微软报告的 95.95% 展示了模型与工具框架的结合进步速度之快。
然而,这种比较不应被解读为纯粹的模型与模型之间的改进。
这些系统在模型代际、智能体框架、提示词、工具、验证、计算预算、成本、任务路由、基准版本、基础设施和重试策略等方面各不相同。
进步是真实的,但这是系统层面的进步。
源文章指出,在发布时,微软 95.95% 的结果尚未反映在公开的 CyberGym 排行榜上。
微软早先的 5 月配置报告约为 88.4%–88.45%,此前已作为基准领先者公开发布。
新的 95.95% 数据由微软在 MAI-Cyber-1-Flash 公告、模型卡以及微软的 Project Perception 公告中发布。
在外部排行榜条目或独立复现可用之前,它应被描述为微软报告的结果。
这并不会使该结果失去意义。这意味着读者应区分:
供应商报告的评估
与
独立复现的公开结果
这种区分在快速变化的基准比较中尤为重要。
微软
将其历史安全数据视为其最深厚的优势。
该公司表示,每天处理超过100万亿条安全信号,并拥有来自160万客户的运营洞察。
其安全可见性覆盖身份、端点、云、网络、数据、浏览器和应用程序。
价值不仅仅在于事件数量。
该公司能够将安全行动与结果联系起来:
这形成了一个反馈闭环。
安全事件
→ 调查
→ 验证
→ 修复
→ 观察到的结果
→ 更好的数据和回报
→ 改进的模型和智能体
竞争对手可以获得类似的基础模型。
但无法在一夜之间重现数十年验证过的运营历史。
只有当大量数据被转化为训练、评估和运营上下文时,它才有价值。
原始安全信号可能具有重复性、噪声大、不完整、客户特定、敏感、标签错误、偏向于可见攻击,或缺少最终结果。
数据管道必须将事件与可信标签和结果连接起来。
例如:
告警触发
→ 分析师调查
→ 确认漏洞
→ 部署补丁
→ 漏洞利用不再生效
这一序列比单独的告警更有价值。
护城河来自数据加上数据整理、反馈、评估和安全运营访问。
微软的三部分框架为评估任何企业级AI安全系统提供了有用的方法。
问题包括:
问题包括:
问题包括:
一个模型强大但数据薄弱且缺乏验证的系统,可能会生成令人印象深刻但不可靠的报告。
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
一个设计良好的系统可以通过为较小模型分配正确任务并检查其工作,使其变得更加有用。
微软认为,当安全扫描持续运行时,令牌成本成为核心约束。
考虑一个简化的工作负载:
每月1000万次代码分析任务
如果每个任务都使用最昂贵的尖端模型,系统可能难以在完整覆盖范围内运行。
一种路由设计改变了平均成本:
90%低成本专业模型
+
10%昂贵尖端模型
实际
经济性也取决于输入长度、输出长度、工具调用、重试、沙箱执行、代码索引、验证、人工审查、基础设施和数据存储。
模型 token 费用只是其中一个组成部分。
尽管如此,路由机制创造了一个强大的优化机会,因为昂贵的模型被选择性使用。
基准测试可以在统一的测试框架下比较单个模型。
产品需要优化完整的工作流程。
最好的系统可能使用的模型在单项排名中并非第一,如果该模型能提供更好的速度、成本、专业性、可预测性、工具使用、上下文效率、安全校准以及与测试框架的兼容性。
这与其它生产系统类似。
数据库不会为每个查询选择同一种算法。云调度器不会把每个工作负载都放在最大的机器上。安全系统不应该把每个任务都发送给最昂贵的模型。
网络安全模型带来了特殊的安全风险。
帮助防御者验证漏洞的同一能力,也可能帮助攻击者利用漏洞。
因此,微软限制了 MAI-Cyber-1-Flash 的访问权限。
模型卡说明:
微软表示,该模型以安全优先的方法进行了校准,由微软 AI 红队进行了评估,通过自动化对抗性演练进行了测试,由安全专家进行了测试,并由独立的第三方进行了评估。
据称,独立评估未发现严重级别的问题。
这并不能证明该模型没有风险。它解释了为什么公司以受限部署而非不受限制的公开发布作为开端。
微软的模型卡列出了几个局限性。
该模型主要使用英语进行训练和评估。在其他语言中,性能可能较低。
与其他语言模型一样,它可能生成不准确、不完整或错误的代码和文本。输出需要审查和验证。
该模型有意被校准为谨慎行事。当合法的防御性请求存在歧义或类似于有害活动时,安全防护机制可能会被触发。
该模型专为 MDASH 设计。单独的结果并不代表完整系统的能力。
不支持在经批准的防御性安全操作之外使用。
微软五月份的 MDASH 公告包含了实际安全研究中的示例。
该公司报告称,在一个包含 21 个故意植入漏洞的未发布示例驱动程序上测试了该测试框架。它表示,在受控测试中,MDASH 识别了全部 21 个漏洞,且零误报。
微软还报告称,MDASH 有助于识别五月发布的 16 个 CVE。
2026年Windows补丁星期二发布。
这些是微软自身的产品和研究声明。
它们与部署的相关性比基准测试分数更高,因为它们涉及私有代码、真实的工程工作流、漏洞验证、补丁流程以及安全团队审查。
与此同时,选定的案例研究并不能在所有代码库中确立普遍的误报率或成功率。
微软推出了Project Perception,作为一个更大规模的智能体安全系统。
其目标是从辅助防御者的AI,转变为能够承担更多安全工作流程的AI,同时将关键判断保留在人工控制之下。
Project Perception协调三类智能体:
| 智能体类别 | 主要职责 |
|---|---|
| 红色智能体 | 模拟攻击者思维,识别可能的入侵路径 |
| 蓝色智能体 | 进行调查、基于上下文推理、检测并对有意义的风险进行分诊 |
| 绿色智能体 | 修复、加固系统并降低暴露面 |

这三个角色形成一个循环:
红色智能体发现路径
→ 蓝色智能体验证并确定优先级
→ 绿色智能体进行修复
→ 系统观察结果
→ 未来防御能力得到改进
微软表示,Project Perception于2026年8月3日进入公开预览阶段。
微软将该系统描述为多个相互连接的层级。
系统观察端点、身份、云、应用程序以及数字资产的其他部分。
原始信号被转换为资产、身份、关系、策略、风险、活动和历史事件的关联表示。
该平台采用多模型策略,包括MAI-Cyber-1-Flash等专用网络模型。
协调框架负责协调模型、智能体、工具、工作流、测试、权限和控制措施。
红色、蓝色和绿色智能体执行专门的安全工作。
执行器将决策转化为集成安全产品中的实际行动。
该架构比聊天机器人更为广泛。它旨在形成一个持续运行的安全操作系统。
微软明确表示,人类仍然控制着高影响操作。
其Project Perception页面将分工表述为:
智能体承担工作。
人类承担判断。
防御者设定目标、策略、防护边界、审批要求、范围以及响应优先级。
高影响操作仍需人工审批。
这是必要的,因为安全修复本身也可能造成伤害。
自动化系统可能会禁用合法账户、阻止生产流量、删除关键文件,
隔离某个业务系统、部署有缺陷的补丁或中断运营。
错误行动的成本可能高于漏报的成本。
微软将 Security Copilot 描述为一种人工智能辅助的对话界面。
项目感知则被定位为更广泛的智能体系统。
| 产品概念 | 角色 |
|---|---|
| Security Copilot | 通过生成式界面提供辅助的人工智能 |
| 项目感知 | 在安全工作流中持续推理和行动的AI智能体 |
这两款产品旨在协同工作。
人类可以使用 Copilot 来理解和指导工作,而感知智能体则承担更多持续运营流程的工作。
微软表示,项目感知采用基于消耗量的定价,以安全计算单元(即SCU)为计量单位。
不同的智能体根据任务的强度消耗不同的资源。
这使得模型和工作流效率在经济上变得至关重要。
红队模拟、快速分类任务和长期修复工作流可能消耗不同的资源。
MDASH 中使用的多模型路由策略符合这一更广泛的定价模式。
如果常规工作可以交由较小的专用模型处理,同样的预算可能覆盖更多的安全防护。
对前沿模型的访问正变得不再稀缺。
各组织越来越能通过API调用强大的公共模型。
稀缺的部分可能是能够确定模型的安全声明是否属实的系统。
该系统需要可执行环境、构建基础设施、版本控制、证明生成、补丁比较、安全知识、沙箱、去重、人工审查和证据追踪。
在安全领域,没有证据的漂亮解释往往是不够的。
护城河从:
访问强大的模型
转向:
验证并落地模型工作的可信流程
不要自动为每项操作使用最昂贵的模型。
建立评估集,确定哪些任务可以由较小的专用模型可靠处理。
一个智能体或模型可以生成候选结果。另一个智能体、工具或确定性测试应对其进行验证。
在可能的情况下,要求可复现的测试,而不是接受文字化的声明。
优先自动化收集、分析和验证。将破坏性或影响生产的操作保留在审批门禁之后。
仅凭代币价格并不是正确的衡量指标。
一个产生大量误报的廉价模型,可能在运维层面成本更高。
有用的指标包括每个已确认漏洞的成本、验证时间、误报率、人工审查时间、补丁接受率和回归率。
模型代际更迭迅速。
保持任务
定义、工具、验证以及安全控制,在底层模型更换时依然可以复用。
记录结果,而不仅仅是告警。
系统应当学习哪些发现是真实的,哪些修复措施是有效的。
CyberGym 的仓库警告不要将其服务暴露于公共互联网。
微软也描述了用于测试的沙箱化、网络隔离环境。
漏洞复现应当在受控的基础设施中进行。
一项严肃的评估不应只包含一个 headline 分数。
95.95% 这个分数很重要,但不应在证据范围之外进行泛化。
该结果由 MDASH、多个代理、两个模型层级、工具和数据共同产生。
该结果由微软发布。独立的复现验证仍然有价值。
CyberGym 衡量的是一个定义明确的漏洞复现任务。
生产环境中的误报行为需要单独进行度量。
微软对关键操作保留人工签核。
MAI-Cyber-1-Flash 仅限经批准的 MDASH 客户在私人预览中使用。
结果可能因语言、漏洞类别、代码库、工具和基准测试框架的不同而有所差异。
MDASH 是微软的多模型、多代理系统,用于识别、验证、确定优先级并修复软件漏洞。它结合了专业代理、多个模型、代码分析工具、验证证明生成、验证以及企业安全控制。
MAI-Cyber-1-Flash 是微软的网络安全专用稀疏 MoE 模型。官方模型卡显示其总参数为 1370 亿,活跃参数为 50 亿,上下文窗口为 256K,并且仅限受控访问。
在 Azure AI Foundry 私人预览版中通过 MDASH 提供。
不是。95.95% 的结果属于完整的 MDASH 配置,使用了 MAI-Cyber-1-Flash、GPT-5.4、代理、工具、数据以及验证流程。微软独立的模型卡结果在其他多个网络基准测试上有所不同,且得分更低。
微软表示,MAI-Cyber-1-Flash 被设计用于处理路由式 MDASH 工作流中高达 90% 的任务。这并不意味着该模型独立发现或修复了 90% 的所有漏洞。
CyberGym 主要评估代理是否能够根据漏洞描述和补丁前的代码库,生成一个可复现已知真实世界漏洞的概念验证(PoC)。该 PoC 会针对易受攻击版本和已修补版本进行测试。
该得分由微软在其公告和模型卡中发布。在源文章所描述的时间,该结果尚未作为更新后的结果出现在公开基准测试排行榜上,因此应将其描述为微软自行报告的数据。
没有公开的模型下载记录。微软表示,该模型仅通过 Azure AI Foundry 私人预览版向选定的 MDASH 客户提供,并需经过审查和批准。
Project Perception 是微软更广泛的代理式安全系统。它协调红队代理、蓝队代理和绿队代理,覆盖检测、调查、修复和加固工作流,同时将关键决策留由人类负责。
com/en-us/security/blog/2026/05/12/defense-at-ai-speed-microsofts-new-multi-model-agentic-security-system-tops-leading-industry-benchmark/:微软关于该框架、验证架构、安全研究及初始 CyberGym 结果的技术概述。
微软报告称,在集成 MAI-Cyber-1-Flash 并将最困难案例路由至 GPT-5.4 后,MDASH 在 CyberGym 上达到了 95.95% 的成功率。该公司还报告称,与此前最强模型配置相比,成本降低了 50%。
该结果并非属于单一模型。它来自一个包含超过 100 个代理、历史安全数据、专用工具、证明生成、验证、去重、沙箱及人工设计编排的多模型安全系统。
CyberGym 主要测试从描述和补丁前代码中复现已知漏洞的能力。因此,该分数证明了在该基准上强大的漏洞复现性能,而非通用的零日漏洞发现或自主修复率。
Project Perception 将相同的系统理念延伸至代码扫描之外:红代理暴露风险,蓝代理调查风险,绿代理修复风险,而关键决策仍由人工掌控。
核心启示在于,前沿网络安全优势正从获取单一强大模型转向在可信安全系统内路由、验证和运营多种模型的能力。
从一句话开始,几分钟内拿到完整网站。