GPT-5.6 Sol 在网络安全测试中略胜 Claude Mythos 5,显示开放模型正在缩小与前沿闭源模型的差距。本文梳理测试结果、能力边界及其对企业安全评估和模型选型的意义。

在英国人工智能安全研究所(AISI)发布的两项网络安全评估中,GPT-5.6 Sol 的排名略高于 Claude Mythos 5。这一结果值得关注,但需审慎解读。
AISI 并未发布涵盖所有攻防网络安全能力的通用排名。它测试了模型在若干具体技术任务以及模拟的长期企业网络攻击中的表现。在这些设定下,GPT-5.6 Sol 取得了最高的平均成绩,而 Mythos 5 与之非常接近。
更重要的发现来自开放权重模型。AISI 发现,GLM-5.2 和 DeepSeek V4-Pro 的性能现已与仅在四至七个月前发布的领先封闭模型相当。在 AISI 2025 年的内部测试中,当时的时间差为六至十个月。
这一时间差的缩短意义重大,因为开放权重模型可以被下载、修改、私有部署,并且在没有提供商监控的情况下运行。这种支持研究、保护隐私和降低成本灵活性,也可能使得先进的网络能力在发布后更难被控制。
AISI 采用了两个互补的评估系统。
第一套评估系统通过从包含 96 个任务的更大集合中选出的 70 个任务,来衡量特定的网络安全技能。
这些任务涵盖四个主要领域:
它们根据人类所需的预估经验划分为四个难度级别:
| 难度级别 | 近似人类经验 | 任务数量 |
|---|---|---|
| 技术非专家 | 具备技术背景但网络安全经验有限 | 18 |
| 学徒 | 大约 1-3 年 | 25 |
| 实践者 | 大约 3-10 年 | 19 |
| 专家 | 超过 10 年 | 8 |
每个模型在每个任务上有五次尝试机会,每次尝试的 token 限制为 250 万。AISI 随后计算平均成功率。
第二个系统衡量模型是否能在模拟网络中自主维持多步骤攻击。
报告中讨论的主要场景名为最后的幸存者。它包含:
每个主要模型的轨迹代表十次运行的平均值,每次运行的 token 限制为一亿。
这些环境并未复现攻击一个防守严密真实组织的所有困难。AISI 指出,这些靶场目前不包括主动的人类防御者、防御工具,也不对触发警报进行惩罚。
在窄任务套件中,GPT-5.6 Sol 在 AISI 发布的图表中记录了最高的平均成功率。Claude Mythos 5 紧随其后,两者的不确定性范围重叠。
图表显示,GPT-5.6 Sol的平均成功率略高于90%,而Mythos 5约为90%。由于不确定性条存在重叠,该结果应描述为本次评估中的微弱领先——并不能证明Sol在所有网络安全场景中绝对更优。
长期范围任务也呈现出类似的情况。
平均而言,GPT-5.6 Sol完成了32个步骤中的约29个,而Claude Mythos 5约为27个。两个模型的最佳尝试均完成了全部步骤。
由此可得出以下结论:
AISI的报告主要关注开源与闭源模型之间的能力差距,而非判定Sol和Mythos之间谁是总体赢家。
AISI选择GLM-5.2和DeepSeek V4-Pro,是因为它们在进行测试时是领先的开源模型候选。
报告的核心比较基于性能相近的模型及其发布日期间隔。
| 开源模型 | 评估任务 | 可比较的闭源模型 | 估计发布日期差距 |
|---|---|---|---|
| GLM-5.2 | 狭窄网络任务 | Claude Opus 4.6和GPT-5.3-Codex | 约4个月 |
| GLM-5.2 | "最后的幸存者"网络安全范围 | Claude Opus 4.5 | 不到7个月 |
| DeepSeek V4-Pro | 狭窄网络任务 | Claude Opus 4.5 | 约5个月 |
| DeepSeek V4-Pro | 网络安全范围任务 | 在特定范围内低于Sonnet 4.5 | 未被视为直接前沿匹配 |
GLM-5.2在所有四个狭窄任务难度级别上的表现与Opus 4.6相当。在"最后的幸存者"范围任务中,它达到了与Opus 4.5相同的最终平均步骤数。
DeepSeek V4-Pro在狭窄任务上与Opus 4.5相匹配,但在长期范围任务上表现较弱。
AISI的2025年内部测试显示,领先的开源模型落后于闭源前沿模型六到十个月。而最新的四到七个月的估计表明,防御方的准备窗口可能正在缩短。
四到七个月的数字仅描述了AISI所测试的模型和评估任务。它并非预测每个未来的开源模型都将保持这一固定的落后程度。
多种因素可能使差距向任意方向移动:
权重。
AISI 同时表示,其设置可能略微低估了开源权重模型的最大能力,因为他们并未针对模型进行深入的特定提取或优化。
本报告仅适用于网络安全领域,不应据此推断科学、编程、通用推理或其他领域的同等差距。
能力差距很小,但价格差距很大。
AISI 对性能相近的模型所公布的第一方 token 价格进行了比较。
| 模型 | 近似成本 |
|---|---|
| Claude Opus 4.5 | 85 美元 |
| Claude Opus 4.6 | 85 美元 |
| GLM-5.2 | 46 美元 |
| DeepSeek V4-Pro | 1.19 美元 |
| 对比项 | 闭源模型成本 | 开源权重模型成本 |
|---|---|---|
| Opus 4.6 vs GLM-5.2 | 15.17 美元 | 6.12 美元 |
| Opus 4.5 vs DeepSeek V4-Pro | 12.50 美元 | 0.28 美元 |
在这些示例中,DeepSeek V4-Pro 公布的价格比同类闭源模型低一至两个数量级。
该比较存在局限性。AISI 未通过其第一方提供商运行所测试的开源权重模型,因此实际基础设施费用可能存在差异。自托管还会引入硬件、工程、电力、网络及维护等成本,这些并不体现在 API 价格中。
即便如此,更低的推理成本仍使得反复实验、微调和私有部署更加可行。
开源权重模型具有实际优势:
同样的特性也限制了发布后所能采取的安全措施。
闭源模型提供商可以:
一旦模型权重公开,副本便可被重新分发并私下运行。拒绝行为可能被修改,部署监测可能被移除,原始开发者也无法可靠地收回每个副本。
AISI 发现,安全措施并未实质性阻碍其对两款开源模型的多数测试。DeepSeek V4-Pro 偶尔会拒绝逆向工程任务,但少量重试通常就能绕过这些拒绝。
这并不意味着所有开源权重模型都会被恶意使用,而是意味着当模型达到风险相关的能力水平时,发布决定将变得难以逆转。
闭源访问并非安全保证。
Anthropic 发布了 Claude Fable 5 和 Claude
2026年6月9日发布了Mythos 5。Fable 5使用更强的分类器进行常规访问,而Mythos 5则向有限的可信防御者群体暴露了更多底层模型的网络安全能力。
6月12日,美国出口管制要求Anthropic暂停访问。Anthropic表示,该指令是在亚马逊研究人员提交一份报告后发出的,该报告描述了一种在有限的网络安全场景下绕过Fable 5防护措施的方法。
Anthropic随后训练了一个更新的分类器,与政府和行业合作伙伴共同制定了越狱严重性评估框架,并在限制解除后于7月1日全球恢复Fable 5。
该事件揭示了几点:
封闭部署提供了更多干预选项,但这些选项仍需有效的监控、测试、政策和技术控制。
AISI将开放与封闭的差距描述为准备时间。
如果最强系统在等效开放权重发布前被控制数月,防御者可以利用这段时间:
从六到十个月缩短至四到七个月,意味着组织在类似能力变得更便宜、更普及之前,完成这些工作的时间可能减少。
英国国家网络安全中心警告称,AI将放大强弱安全实践之间的差距。其指导方针强调,AI工具无法弥补薄弱的基础。
修补管理不善、服务暴露、凭证重复使用、备份不完整和监控有限的组织,无论攻击者使用何种AI模型,仍将处于脆弱状态。
用于攻击性评估的相同能力可帮助防御者审计代码、生成测试、调查故障并扩展漏洞研究。
近期案例来自游戏网络开发者Glenn Fiedler,他使用Claude Code与Claude Fable 5审计了四个成熟的开源库:
输入一句想法,We0 AI 即可生成展示站、页面与 CMS。发布上线后并帮你获取客户和流量。
用户注册赠送一次完整项目生成
适合先体验一次完整生成流程,快速看到项目初稿。
netcodereliableserializeyojimbo该审计新增了libFuzzer目标、基于消毒器的持续集成、数百万次迭代的压力测试、黄金线路格式测试及逐行审查。
公开漏洞记录展示了43项修复:
| 库 | 总修复数 | 网络可达修复数 |
|---|---|---|
| netcode | 7 | 2 |
| reliable | 7 | 6 |
| serialize | 11 | 7 |
| yojimbo | 18 | 12 |
| 总计 | 43 | 27 |
最
一个严重问题是yojimbo中存在一个自2019年以来就可远程触发的堆溢出漏洞。精心构造的块片段在大小验证前可能被复制到重组缓冲区中。
每个列出的问题都附有修复提交和版本链接,每个修复都包含回归测试。开发人员报告在为期两周的修复过程中,在Claude Code上花费了超过2500美元。
受影响库的用户被建议升级到公开漏洞记录中指定的最新版本。
此案例并不能证明AI代理能够独立保护任意软件的安全。它表明,知识渊博的维护者可以利用AI来扩大对现有代码库的模糊测试、消毒器覆盖、审查和测试生成的规模。
AI可以协助双方,但部署模式不同。
攻击者只需要一个可利用的漏洞、一个可访问的目标和一条成功的路径。开源权重模型在发布后可以被反复复制和重复使用。
防御者必须保护众多系统、维护资产清单、优先处理补丁、测试变更、管理停机时间,并跨团队协调。防御改进必须逐个组织实施。
这就造成了不对称性:
合适的应对措施不是避免使用防御性AI,而是将其与强大的工程实践、人类专业知识和经过验证的安全控制相结合。
AISI和NCSC的发现支持一套切实可行的行动。
优先考虑:
当这些基础已经存在时,AI增强的防御效果最佳。
对于软件项目,引入:
Mas Bandwidth审计之所以有用,是因为它将AI审查与机械证据相结合,而不是信任生成的解释。
AI生成的漏洞报告可能是正确的、不完整的或具有误导性的。
要求:
防御性编码代理默认不应获得不受限制的访问权限。
限制:
使用隔离环境,并
将重要行动置于人类批准之后。
追踪以下指标:
如果模型产出不可靠的结果或需要大量审查,那么最廉价的模型未必最具成本效益。
网络安全基准测试很有用,但必须清楚其适用范围。
模拟靶场简化了环境。真实网络可能包含主动防御者、端点防护、告警机制、速率限制、欺骗系统以及不完整信息。
长周期任务的结果不仅仅取决于模型知识。工具设计、记忆、上下文管理、重试策略、提示结构以及执行可靠性都会影响性能。
最佳尝试显示系统有时能做到什么。平均结果则显示系统在多次运行中进展的可靠性。
对于运营风险而言,两者都很重要。
性能与旧模型相似的模型并非与旧模型完全相同。这些系统可能具有不同的优势、劣势、防护措施、成本和部署限制。
相同的技能可以用于渗透测试、安全代码审查、事件响应、漏洞发现或恶意入侵。
评估结果应同时为风险管理与防御性安全接入的投资提供依据。
GPT-5.6 Sol 在 AISI 的狭窄网络安全任务及重点提及的长周期靶场中取得了略高的平均结果。Mythos 5 的成绩接近,两者在狭窄任务套件上的不确定性范围存在重叠,且两款模型在最佳尝试中均完成了全部 32 个靶场步骤。
不一定。AISI 测试的是特定的任务套件和模拟环境,而非所有真实的防御或攻击场景。结果支持的是狭窄的基准比较,而非通用排名。
AISI 估计,其测试的领先开源权重模型存在四到七个月的差距。该数据基于将实测性能与可比闭源模型的发布日期进行匹配得出。
在报告发布时,GLM-5.2 是 AISI 测试中表现最强的开源权重模型。它在狭窄任务上与 Opus 4.6 持平,并在重点提及的网络安全靶场上达到了与 Opus 4.5 相同的平均分。
它们的权重可以被下载、修改、私有化部署和重新分发。这带来了研究和隐私方面的益处,但也限制了原始开发者监控滥用、更新部署安全措施、暂停用户或收回所有副本的能力。
在 AISI 的评估中?
是的。按公布的首方定价,GLM-5.2 尤其是 DeepSeek V4-Pro 比同类闭源模型便宜得多。实际自托管和第三方部署成本可能有所不同。
可以。AI 能够辅助代码审查、模糊测试生成、漏洞分析、日志调查和修复。在 Claude Code 辅助的安全工作后,Mas Bandwidth 审计记录了四个网络库的 43 项修复。
在依赖 AI 工具之前,先加强基本安全控制。资产可见性、补丁管理、身份保护、备份、网络分段、监控和经过测试的事件响应仍然至关重要。
AISI 的最新结果显示,在两项指定的网络安全评估平均得分上,GPT-5.6 Sol 略领先于 Claude Mythos 5。这一领先优势很小,不应被视为普遍优越性的证据。
报告的主要
结论更为宽泛:GLM-5.2和DeepSeek V4-Pro目前落后于同类前沿闭源模型的时间已缩短至4至7个月,而AISI在2025年内部测试中,这一差距曾为6至10个月。其标价也远低于对手。
这种缩短的滞后时间,意味着在高级能力变得更容易下载、修改和本地运行之前,防御方可能拥有的应对时间窗口进一步减少。同时,Claude Code在四个网络库中发现43个漏洞的表现表明,强大模型也能加速防御性工作。
实际应对之策并非单纯依赖模型防护或AI安全工具,而是要夯实安全基线,并在受控、测试驱动、人工审核的防御流程中运用AI。
从一句话开始,几分钟内拿到完整网站。