导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜
快讯 机构 观点 人物 专题

微软发布专属网络安全模型MDASH,在CyberGym测试中击败Claude Mythos和GPT-5.6 Sol,成本降低50%

微软发布了其首个专用网络安全模型MAI-Cyber-1-Flash,并将其集成到漏洞狩猎系统MDASH中。据微软称,该系统在性能上击败了Anthropic的Mythos 5和OpenAI的GPT-5.6 Sol,同时成本比微软当前最佳MDASH配置降低50%。

在CyberGym基准测试中,这套组合方案得分为95.95%。CyberGym要求AI代理在188个开源项目中复现1507个已知漏洞,并根据在受控环境中成功复现的百分比进行评分。MDASH的得分超过了GPT-5.5 Cyber(85.6%)、Mythos 5(83.8%)、GPT-5.6 Sol(83.6%)和Gemini 3.5 Flash Cyber(83.2%)。该结果由微软自行报告,截至发稿时尚未出现在CyberGym的公开排行榜上,但该基准测试使用的是公开测试集和明确的成功指标。

MAI-Cyber-1-Flash并非独立工作。微软表示,它处理高达90%的任务,而MDASH将最困难的10%路由至GPT-5.4。这一点至关重要,因为AI处理文本的令牌(token)每次读取代码或生成答案都会产生成本。

Microsoft Says MDASH Beats Claude Mythos and GPT-5.6 Sol in Cybersecurity Test

这是微软首个为效率而构建的模型能够击败为通用能力设计的密集先进模型。微软CEO萨提亚·纳德拉写道:“当与MDASH结合时,(MAI-Cyber-1-Flash)以领先模型50%的成本提供了世界级性能。”

模型(此处指MAI-Cyber-1-Flash)是对代码进行推理的AI。而MDASH则是一个框架,包含代理、工具、检查和工作流程,决定搜索位置、质疑可疑发现、去重并证明漏洞可被触发。MDASH使用超过100个专业代理,负责审计代码、辩论发现是否真实,并构建概念验证——一个证明漏洞存在的可工作演示。

微软表示,随着AI使漏洞发现成本降低,定期扫描和延迟补丁正变得过时。该公司认为,数十年的安全数据使其具有优势,并补充道:“没人能制造出这段历史。”自Claude Mythos发布以来,网络安全专家一直试图击败或匹敌其能力。研究人员使用公共模型以每次扫描不到30美元的成本复现了Mythos风格的漏洞狩猎。研究人员Dawid Moczadło表示:“护城河正从模型访问转向验证。”稀缺的部分正在变成能够证明发现结果而不让开发者被误报淹没的系统。

据Decrypt报道,GPT-5.5 Cyber最近以85.6%的得分领先CyberGym公开榜,略胜Mythos。微软的得分比GPT-5.5 Cyber高出约10个百分点,比MDASH此前的结果高出7.5个百分点,但评估的是完整系统而非单独的MAI-Cyber-1-Flash。

微软正在通过Defender门户中的Microsoft Security Exposure Management将MDASH投入私有预览。客户可以扫描Git仓库,查看从“不太可能”到“已证明”的发现结果,并使用Defender CLI生成建议的代码修复供开发者审查。预览版目前将仓库大小限制在约256MB,并允许每个租户同时进行一次扫描。Project Perception预计将把同样的多代理方法扩展到更广泛的威胁监控和修复工作流程中。