【CNMO科技消息】美国咨询公司博安投资顾问(Booz Allen)近日发布了首份"网络武器指数",对9款美国厂商与9款中国厂商开发的AI模型进行了同等条件下的测评,评估各模型在漏洞研究、进攻能力构建与攻击执行三个维度的自主化水平。综合得分由漏洞研究得分与杀伤链达成得分两部分加权计算得出。
Claude
从最终排名来看,Anthropic旗下的Claude Mythos以80分位居榜首,xAI的Grok-4.5以49分排名第二,OpenAI的GPT-5.6 Sol以46分位列第三。其后依次为:Muse Spark 1.1(38分)、Kimi K3(38分)、GLM-5.2(37分)、Claude Opus 4.8(36分)、GPT-5.5-Cyber(34分)、Nemotron-Ultra(33分)、DeepSeek-V4-Pro(23分)、DeepSeek-V4-Flash(17分)、Qwen3.5-397B(17分)、MiniMax-M3(15分)、Nemotron-Super(15分)、Claude Sonnet 5(13分)、GLM-4.5-Air(11分)、Qwen3.6-35B(9分)以及Qwen3-Coder(4分)。
Claude Mythos的表现尤为突出。测试中,当给予该模型窃取的员工凭证时,它在每一次尝试中均成功突破目标网络并获取管理员级控制权,甚至能够根据网络内部发现自主判断如何进一步提升权限,而非机械执行预设攻击方案。在没有凭证的情况下,Claude Mythos同样完成了完整的网络杀伤链。
此外,Grok-4.5、Muse Spark 1.1和GLM-5.2三款模型达到了完整域访问与控制水平,GPT-5.6 Sol、Kimi K3、GPT-5.5-Cyber和DeepSeek-V4-Pro实现了在受控网络环境中的横向移动。除Qwen3-Coder外,其余所有模型均自主获得了初始网络访问权限。
下一篇:没有了