GPT-5.6 Sol 在网络安全测试中略胜 Claude Mythos 5,开源模型缩小差距
英国人工智能安全研究所(AISI)发布的两项网络安全评估显示,GPT-5.6 Sol 略优于 Claude Mythos 5。这一结果值得关注,但需谨慎解读。AISI 并未发布全面的进攻与防御网络安全能力排名,而是在一组特定的狭义技术任务以及模拟的长期企业网络攻击场景中测试了模型。在这些设定下,GPT-5.6 Sol 取得了最高平均成绩,而 Mythos

GPT-5.6 Sol 在网络安全测试中略胜 Claude Mythos 5,开源模型缩小差距
引言
在英国人工智能安全研究所(AISI)发布的两项网络安全评估中,GPT-5.6 Sol 的排名略高于 Claude Mythos 5。这一结果值得关注,但需审慎解读。
AISI 并未发布涵盖所有攻防网络安全能力的通用排名。它测试了模型在若干具体技术任务以及模拟的长期企业网络攻击中的表现。在这些设定下,GPT-5.6 Sol 取得了最高的平均成绩,而 Mythos 5 与之非常接近。
更重要的发现来自开放权重模型。AISI 发现,GLM-5.2 和 DeepSeek V4-Pro 的性能现已与仅在四至七个月前发布的领先封闭模型相当。在 AISI 2025 年的内部测试中,当时的时间差为六至十个月。
这一时间差的缩短意义重大,因为开放权重模型可以被下载、修改、私有部署,并且在没有提供商监控的情况下运行。这种支持研究、保护隐私和降低成本灵活性,也可能使得先进的网络能力在发布后更难被控制。
AISI 评估了什么
AISI 采用了两个互补的评估系统。
窄领域网络任务
第一套评估系统通过从包含 96 个任务的更大集合中选出的 70 个任务,来衡量特定的网络安全技能。
这些任务涵盖四个主要领域:
- 漏洞研究与利用
- 逆向工程
- 网络利用
- 密码学
它们根据人类所需的预估经验划分为四个难度级别:
| 难度级别 | 近似人类经验 | 任务数量 |
|---|---|---|
| 技术非专家 | 具备技术背景但网络安全经验有限 | 18 |
| 学徒 | 大约 1-3 年 | 25 |
| 实践者 | 大约 3-10 年 | 19 |
| 专家 | 超过 10 年 | 8 |
每个模型在每个任务上有五次尝试机会,每次尝试的 token 限制为 250 万。AISI 随后计算平均成功率。
网络靶场
第二个系统衡量模型是否能在模拟网络中自主维持多步骤攻击。
报告中讨论的主要场景名为最后的幸存者。它包含:
- 32 个连续的攻击步骤
- 四个网络子网
- 约 20 个主机
- 数个命名里程碑
- 人类专家估计需要 20 小时的工作量
每个主要模型的轨迹代表十次运行的平均值,每次运行的 token 限制为一亿。
这些环境并未复现攻击一个防守严密真实组织的所有困难。AISI 指出,这些靶场目前不包括主动的人类防御者、防御工具,也不对触发警报进行惩罚。
GPT-5.6 Sol 与 Mythos 5 的结果实际说明了什么
在窄任务套件中,GPT-5.6 Sol 在 AISI 发布的图表中记录了最高的平均成功率。Claude Mythos 5 紧随其后,两者的不确定性范围重叠。

由此可得出以下结论:
- GPT-5.6 Sol在该特定范围任务中平均表现最好。
- Mythos 5表现接近,并且在其最佳尝试中也完成了全部32个步骤。
- 差异可能反映了模型能力、智能体可靠性、工具使用、长期规划能力,或这些因素的综合作用。
- 单一网络安全范围的证据力度弱于大量多样化任务的数据。
- 这些结果并不能确立一个通用的进攻性安全排名。
AISI的报告主要关注开源与闭源模型之间的能力差距,而非判定Sol和Mythos之间谁是总体赢家。
开源模型如今仅落后4至7个月
AISI选择GLM-5.2和DeepSeek V4-Pro,是因为它们在进行测试时是领先的开源模型候选。
报告的核心比较基于性能相近的模型及其发布日期间隔。
| 开源模型 | 评估任务 | 可比较的闭源模型 | 估计发布日期差距 |
|---|---|---|---|
| GLM-5.2 | 狭窄网络任务 | Claude Opus 4.6和GPT-5.3-Codex | 约4个月 |
| GLM-5.2 | "最后的幸存者"网络安全范围 | Claude Opus 4.5 | 不到7个月 |
| DeepSeek V4-Pro | 狭窄网络任务 | Claude Opus 4.5 | 约5个月 |
| DeepSeek V4-Pro | 网络安全范围任务 | 在特定范围内低于Sonnet 4.5 | 未被视为直接前沿匹配 |
GLM-5.2在所有四个狭窄任务难度级别上的表现与Opus 4.6相当。在"最后的幸存者"范围任务中,它达到了与Opus 4.5相同的最终平均步骤数。
DeepSeek V4-Pro在狭窄任务上与Opus 4.5相匹配,但在长期范围任务上表现较弱。
AISI的2025年内部测试显示,领先的开源模型落后于闭源前沿模型六到十个月。而最新的四到七个月的估计表明,防御方的准备窗口可能正在缩短。
为何这一差距并非固定预测
四到七个月的数字仅描述了AISI所测试的模型和评估任务。它并非预测每个未来的开源模型都将保持这一固定的落后程度。
多种因素可能使差距向任意方向移动:
- 闭源开发者可能突然实现能力飞跃。
- 开源模型可能再现近期前沿改进。
- 更好的智能体框架可能从现有模型中释放更多性能。
权重。
- 微调与模型特定提示可能会改变测量到的能力。
- 新的基准测试可能会暴露当前测试未能发现的弱点。
- 部署成本与可用硬件可能限制实际滥用风险。
- 安全措施与访问控制可能改变托管模型的可用能力。
AISI 同时表示,其设置可能略微低估了开源权重模型的最大能力,因为他们并未针对模型进行深入的特定提取或优化。
本报告仅适用于网络安全领域,不应据此推断科学、编程、通用推理或其他领域的同等差距。
开源模型在相似能力水平下成本大幅降低
能力差距很小,但价格差距很大。
AISI 对性能相近的模型所公布的第一方 token 价格进行了比较。
运行 1 亿 token 网络靶场的成本
| 模型 | 近似成本 |
|---|---|
| Claude Opus 4.5 | 85 美元 |
| Claude Opus 4.6 | 85 美元 |
| GLM-5.2 | 46 美元 |
| DeepSeek V4-Pro | 1.19 美元 |
以 100% 可靠性解决单一特定任务的成本
| 对比项 | 闭源模型成本 | 开源权重模型成本 |
|---|---|---|
| Opus 4.6 vs GLM-5.2 | 15.17 美元 | 6.12 美元 |
| Opus 4.5 vs DeepSeek V4-Pro | 12.50 美元 | 0.28 美元 |
在这些示例中,DeepSeek V4-Pro 公布的价格比同类闭源模型低一至两个数量级。
该比较存在局限性。AISI 未通过其第一方提供商运行所测试的开源权重模型,因此实际基础设施费用可能存在差异。自托管还会引入硬件、工程、电力、网络及维护等成本,这些并不体现在 API 价格中。
即便如此,更低的推理成本仍使得反复实验、微调和私有部署更加可行。
为何开源权重改变了安全问题
开源权重模型具有实际优势:
- 私有部署
- 无需将数据回传至原始提供商
- 针对特定任务进行定制
- 不受提供商停止服务影响
- 可重复的研究
- 模型权重的检查与修改
- 跨组织协作
同样的特性也限制了发布后所能采取的安全措施。
闭源模型提供商可以:
- 监控异常使用模式
- 应用分类器
- 暂停账户
- 限制访问速率
- 更新安全措施
- 限制特定工具
- 撤回或替换模型
一旦模型权重公开,副本便可被重新分发并私下运行。拒绝行为可能被修改,部署监测可能被移除,原始开发者也无法可靠地收回每个副本。
AISI 发现,安全措施并未实质性阻碍其对两款开源模型的多数测试。DeepSeek V4-Pro 偶尔会拒绝逆向工程任务,但少量重试通常就能绕过这些拒绝。
这并不意味着所有开源权重模型都会被恶意使用,而是意味着当模型达到风险相关的能力水平时,发布决定将变得难以逆转。
闭源模型同样需要更强的安全措施
闭源访问并非安全保证。
Anthropic 发布了 Claude Fable 5 和 Claude
2026年6月9日发布了Mythos 5。Fable 5使用更强的分类器进行常规访问,而Mythos 5则向有限的可信防御者群体暴露了更多底层模型的网络安全能力。
6月12日,美国出口管制要求Anthropic暂停访问。Anthropic表示,该指令是在亚马逊研究人员提交一份报告后发出的,该报告描述了一种在有限的网络安全场景下绕过Fable 5防护措施的方法。
Anthropic随后训练了一个更新的分类器,与政府和行业合作伙伴共同制定了越狱严重性评估框架,并在限制解除后于7月1日全球恢复Fable 5。
该事件揭示了几点:
- 分类器可能产生假阴性和假阳性。
- 越狱手段的严重性差异很大。
- 绕过手段不一定揭示模型最危险的能力。
- 封闭提供商可以更新防护措施并暂停访问。
- 这些干预措施也可能阻碍合法的安全工作。
- 行业和政府仍缺乏判断网络越狱的统一标准。
封闭部署提供了更多干预选项,但这些选项仍需有效的监控、测试、政策和技术控制。
防御准备窗口正在缩小
AISI将开放与封闭的差距描述为准备时间。
如果最强系统在等效开放权重发布前被控制数月,防御者可以利用这段时间:
- 发现并修补漏洞
- 改进资产清单
- 移除不受支持的软件
- 加强身份控制
- 部署抗钓鱼认证
- 改进网络分段
- 扩展日志记录与检测
- 测试事件响应计划
- 应用AI辅助代码审查与威胁分析
从六到十个月缩短至四到七个月,意味着组织在类似能力变得更便宜、更普及之前,完成这些工作的时间可能减少。
英国国家网络安全中心警告称,AI将放大强弱安全实践之间的差距。其指导方针强调,AI工具无法弥补薄弱的基础。
修补管理不善、服务暴露、凭证重复使用、备份不完整和监控有限的组织,无论攻击者使用何种AI模型,仍将处于脆弱状态。
AI也在加速防御性安全工作
用于攻击性评估的相同能力可帮助防御者审计代码、生成测试、调查故障并扩展漏洞研究。
近期案例来自游戏网络开发者Glenn Fiedler,他使用Claude Code与Claude Fable 5审计了四个成熟的开源库:
netcodereliableserializeyojimbo
该审计新增了libFuzzer目标、基于消毒器的持续集成、数百万次迭代的压力测试、黄金线路格式测试及逐行审查。
公开漏洞记录展示了43项修复:
| 库 | 总修复数 | 网络可达修复数 |
|---|---|---|
| netcode | 7 | 2 |
| reliable | 7 | 6 |
| serialize | 11 | 7 |
| yojimbo | 18 | 12 |
| 总计 | 43 | 27 |
最
一个严重问题是yojimbo中存在一个自2019年以来就可远程触发的堆溢出漏洞。精心构造的块片段在大小验证前可能被复制到重组缓冲区中。
每个列出的问题都附有修复提交和版本链接,每个修复都包含回归测试。开发人员报告在为期两周的修复过程中,在Claude Code上花费了超过2500美元。
受影响库的用户被建议升级到公开漏洞记录中指定的最新版本。
此案例并不能证明AI代理能够独立保护任意软件的安全。它表明,知识渊博的维护者可以利用AI来扩大对现有代码库的模糊测试、消毒器覆盖、审查和测试生成的规模。
攻防加速不对称
AI可以协助双方,但部署模式不同。
攻击者只需要一个可利用的漏洞、一个可访问的目标和一条成功的路径。开源权重模型在发布后可以被反复复制和重复使用。
防御者必须保护众多系统、维护资产清单、优先处理补丁、测试变更、管理停机时间,并跨团队协调。防御改进必须逐个组织实施。
这就造成了不对称性:
- 攻击能力可以快速传播。
- 防御能力必须在本地实施。
- 模型发布可以一次完成。
- 安全更新必须多次部署。
- 攻击者可以选择最薄弱的目标。
- 防御者必须覆盖所有关键路径。
合适的应对措施不是避免使用防御性AI,而是将其与强大的工程实践、人类专业知识和经过验证的安全控制相结合。
组织应如何应对
AISI和NCSC的发现支持一套切实可行的行动。
1. 首先加强基线
优先考虑:
- 资产清单
- 受支持的软件
- 快速打补丁
- 多因素认证
- 最小权限访问
- 网络分段
- 经过测试的备份
- 集中式日志记录
- 事件响应演练
当这些基础已经存在时,AI增强的防御效果最佳。
2. 扩展持续安全测试
对于软件项目,引入:
- 模糊测试
- AddressSanitizer
- UndefinedBehaviorSanitizer
- 在支持的地方使用MemorySanitizer
- 静态分析
- 依赖项扫描
- 每个已确认错误的回归测试
- 对不可信输入路径的安全审查
Mas Bandwidth审计之所以有用,是因为它将AI审查与机械证据相结合,而不是信任生成的解释。
3. 将AI发现视为线索,而非证据
AI生成的漏洞报告可能是正确的、不完整的或具有误导性的。
要求:
- 复现
- 根本原因分析
- 人工审查
- 最小修复
- 回归测试
- 发布文档
- 酌情进行协调披露
4. 限制代理权限
防御性编码代理默认不应获得不受限制的访问权限。
限制:
- 生产凭证
- 网络访问
- 破坏性Shell命令
- 仓库写入范围
- 密钥访问
- 部署权限
- 外部通信
使用隔离环境,并
将重要行动置于人类批准之后。
5. 衡量成本与效能
追踪以下指标:
- 已确认的漏洞
- 误报
- 复现所需时间
- 修复所需时间
- 新增测试覆盖率
- Token 与基础设施成本
- 人工审查时间
- 部署后的安全回退情况
如果模型产出不可靠的结果或需要大量审查,那么最廉价的模型未必最具成本效益。
如何解读 AI 网络安全基准测试
网络安全基准测试很有用,但必须清楚其适用范围。
高分并不等于真实世界中的攻破
模拟靶场简化了环境。真实网络可能包含主动防御者、端点防护、告警机制、速率限制、欺骗系统以及不完整信息。
模型能力与智能体能力相互交织
长周期任务的结果不仅仅取决于模型知识。工具设计、记忆、上下文管理、重试策略、提示结构以及执行可靠性都会影响性能。
平均结果与最佳尝试结果回答不同问题
最佳尝试显示系统有时能做到什么。平均结果则显示系统在多次运行中进展的可靠性。
对于运营风险而言,两者都很重要。
基于发布日期的比较仅为近似值
性能与旧模型相似的模型并非与旧模型完全相同。这些系统可能具有不同的优势、劣势、防护措施、成本和部署限制。
网络安全能力具有双重用途
相同的技能可以用于渗透测试、安全代码审查、事件响应、漏洞发现或恶意入侵。
评估结果应同时为风险管理与防御性安全接入的投资提供依据。
常见问题
GPT-5.6 Sol 在 AISI 的测试中是否优于 Claude Mythos 5?
GPT-5.6 Sol 在 AISI 的狭窄网络安全任务及重点提及的长周期靶场中取得了略高的平均结果。Mythos 5 的成绩接近,两者在狭窄任务套件上的不确定性范围存在重叠,且两款模型在最佳尝试中均完成了全部 32 个靶场步骤。
这是否意味着 GPT-5.6 Sol 是最佳网络安全模型?
不一定。AISI 测试的是特定的任务套件和模拟环境,而非所有真实的防御或攻击场景。结果支持的是狭窄的基准比较,而非通用排名。
开源权重模型与前沿闭源模型差距有多大?
AISI 估计,其测试的领先开源权重模型存在四到七个月的差距。该数据基于将实测性能与可比闭源模型的发布日期进行匹配得出。
哪款开源权重模型表现最佳?
在报告发布时,GLM-5.2 是 AISI 测试中表现最强的开源权重模型。它在狭窄任务上与 Opus 4.6 持平,并在重点提及的网络安全靶场上达到了与 Opus 4.5 相同的平均分。
为什么开源权重模型会带来网络安全担忧?
它们的权重可以被下载、修改、私有化部署和重新分发。这带来了研究和隐私方面的益处,但也限制了原始开发者监控滥用、更新部署安全措施、暂停用户或收回所有副本的能力。
开
在 AISI 的评估中?
是的。按公布的首方定价,GLM-5.2 尤其是 DeepSeek V4-Pro 比同类闭源模型便宜得多。实际自托管和第三方部署成本可能有所不同。
AI 模型能否同时帮助防御者和攻击者?
可以。AI 能够辅助代码审查、模糊测试生成、漏洞分析、日志调查和修复。在 Claude Code 辅助的安全工作后,Mas Bandwidth 审计记录了四个网络库的 43 项修复。
组织应该优先做什么?
在依赖 AI 工具之前,先加强基本安全控制。资产可见性、补丁管理、身份保护、备份、网络分段、监控和经过测试的事件响应仍然至关重要。
相关工具
- AISI Inspect Cyber:用于创建和运行智能体网络安全任务的评估框架。
- Inspect AI:AISI 用于评估大语言模型的开源框架。
- GLM-5.2:来自 Z.ai 的官方开源权重模型仓库。
- DeepSeek API:DeepSeek 模型的官方文档和当前访问信息。
- Claude Code:Anthropic 的智能体编码环境,用于仓库工作、测试和安全审查。
- NCSC Cyber Essentials:英国支持的保护组织免受常见网络威胁的基线标准。
相关链接
- AISI 开源权重网络能力差距报告:2026 年 7 月官方分析、方法论、图表、成本比较、局限性和结论。
- Inspect Cyber 介绍:AISI 对其用于智能体网络安全评估的开放框架的解释。
- AISI 前沿 AI 趋势报告:关于前沿模型能力(包括网络安全)进展的更广泛证据。
- NCSC 前沿 AI 网络风险指南:关于安全基线和谨慎部署 AI 增强防御的指南。
- Anthropic 的 Fable 5 重新部署报告:Anthropic 对 2026 年 6 月暂停、分类器更新和恢复访问的说明。
- Mas Bandwidth 安全漏洞记录:包含 43 项修复的可验证列表,附有提交信息、严重级别、网络可达性和发布信息。
- Mas Bandwidth 升级通知:维护者建议用户升级受影响网络库的通知。
总结
AISI 的最新结果显示,在两项指定的网络安全评估平均得分上,GPT-5.6 Sol 略领先于 Claude Mythos 5。这一领先优势很小,不应被视为普遍优越性的证据。
报告的主要
结论更为宽泛:GLM-5.2和DeepSeek V4-Pro目前落后于同类前沿闭源模型的时间已缩短至4至7个月,而AISI在2025年内部测试中,这一差距曾为6至10个月。其标价也远低于对手。
这种缩短的滞后时间,意味着在高级能力变得更容易下载、修改和本地运行之前,防御方可能拥有的应对时间窗口进一步减少。同时,Claude Code在四个网络库中发现43个漏洞的表现表明,强大模型也能加速防御性工作。
实际应对之策并非单纯依赖模型防护或AI安全工具,而是要夯实安全基线,并在受控、测试驱动、人工审核的防御流程中运用AI。