微软发布首个专用网络安全模型MAI-Cyber-1-Flash,并将其整合到漏洞狩猎系统MDASH中。据微软称,该系统在CyberGym基准测试中取得了95.95%的得分,击败了Anthropic的Mythos 5(83.8%)、OpenAI的GPT-5.6 Sol(83.6%)以及GPT-5.5 Cyber(85.6%)等模型,同时成本比微软当前最佳MDASH配置降低50%。
CyberGym基准测试要求AI代理在188个开源项目中重现1507个已知漏洞,按受控环境下的成功重现比例评分。微软CEO萨提亚·纳德拉表示:“当与MDASH结合时,MAI-Cyber-1-Flash以领先模型50%的成本提供了世界级的性能。”
MAI-Cyber-1-Flash并非独立工作。微软称它处理高达90%的任务,而MDASH将最困难的10%路由到GPT-5.4。MDASH是一个由超过100个专用代理组成的系统,负责审计代码、辩论发现是否真实、构建漏洞利用证明。
微软认为,随着AI降低漏洞发现成本,定期扫描和延迟补丁正在过时。该公司强调,数十年的安全数据为其提供了优势,“没有人能制造这段历史”。
自从Claude Mythos发布以来,网络安全专家一直在尝试超越或匹配其能力。研究人员已用公开模型以每次扫描低于30美元的成本重现了Mythos风格的漏洞狩猎。参与的研究员Dawid Moczadło表示:“护城河正在从模型访问转向验证。”稀缺的部分变成了能够证明发现而不被误报淹没的系统。
此前Decrypt报道,GPT-5.5 Cyber以85.6%的得分暂居CyberGym公开排行榜首位,略高于Mythos。微软的得分比GPT-5.5 Cyber高出约10个百分点,比MDASH之前的结果高出7.5个百分点,但该得分评估的是整个系统而非MAI-Cyber-1-Flash本身。
微软通过Defender门户中的Microsoft Security Exposure Management提供MDASH的私人预览。客户可以扫描Git仓库,查看从“不可能”到“已证明”的发现排名,并使用Defender CLI生成代码修复建议供开发者审查。当前预览版限制仓库大小约256MB,每个租户仅允许一次并发扫描。Project Perception预计将把同样的多代理方法扩展到代码扫描之外,用于更广泛的威胁监控和修复工作流。
