英美联合评测:Kimi K3 网络攻击能力落后美国前沿模型,但优于国内竞品
英国人工智能安全研究所(UK AISI)与美国人工智能标准与创新中心(CAISI)日前发布联合评测报告,揭示了月之暗面最新模型 Kimi K3 在网络安全任务中的表现。结果显示,该模型在漏洞利用开发和模拟网络攻击方面显著落后于美国领先模型,但优于同样来自中国智谱的 GLM-5.2,在开放权重模型中树立了新的标杆。值得注意的是,评测指出 Kimi K3 的安全护栏在阻止漏洞利用开发方面几乎未能发挥作用。
ExploitBench 基准测试:分差显著,未达最高威胁等级
评测采用卡内基梅隆大学开发的 ExploitBench 基准,该测试从 2023 年后的 Chrome V8 引擎中提取 41 个真实漏洞,沿软件利用的推进过程进行评分。美国领先模型平均得分 76.2%,Kimi K3 为 32.2%,GLM-5.2 则以 24.4% 垫底。在威胁等级方面,41 项任务中 Kimi K3 无一达到"任意代码执行"(ACE)级别——这意味着攻击者可完全控制目标系统;而美国模型在 41 项中成功实现 20 项 ACE。评测方说明,测试美国闭源模型时关闭了系统级安全防护,以测量其最大能力,而这些防护在公开版本中默认开启。
"最后的幸存者"模拟测试:能力存在但稳定性不足
第二项测试 "最后的幸存者"(TLO)模拟跨四个子网、约 20 台主机的企业网络攻击,完整路径包含 32 个步骤,人类专家预计需约 20 小时完成。目前全球仅少数模型能够通关,四个公开可用的闭源权重模型已实现这一目标,最强者在十次尝试中成功六至七次。Kimi K3 平均推进至第 17 步即受阻,美国领先模型可达第 28.5 步,GLM-5.2 仅到第 11 步。不过,Kimi K3 在十次尝试中有一次在 1 亿 token 限制内完成整条攻击链,表明其具备相应能力,但调用稳定性不足。评测机构判断,若给予初始网络访问权限并下达指令,Kimi K3 能够自主攻陷规模较小、防御薄弱的企业系统。需要指出的是,TLO 未计入主动防御机制,与真实场景存在差距。而就在本周,OpenAI 模型试图自主入侵 Hugging Face 的事件刚被披露,尽管使用了开放权重模型,攻击最终被成功拦截。
中美模型差距持续,开源能力引发安全担忧
CAISI 采用 Elo 评分体系追踪 2025 年初以来中美模型的网络能力,两条曲线均呈上升趋势,但中国模型与美国模型之间始终存在差距。Elo 分数提升 400 分意味着解决任务的概率增长十倍。英国机构此前估算开源模型与美国系统的性能差距为四到七个月,2025 年初扩大至六到十个月,本次结果符合这一规律。AISI 警告称,开源模型日益增长的网络能力构成"持续且不可逆的滥用风险",不容忽视。
评测结果与蒸馏指控形成交叉印证
测试结果与近期围绕 Kimi K3 的训练方式争议形成呼应。美国科学顾问迈克尔·克拉齐奥斯曾公开指控月之暗面,称其将 Anthropic 的 Fable 模型最优输出作为训练数据对 Kimi K3 进行"蒸馏"提质,并指其获取了受美国出口管制的英伟达 GB300 芯片。评测显示 Kimi K3 通用基准成绩优异、网络安全得分却明显偏低,这一现象与上述指控存在逻辑关联:若 Kimi K3 主要蒸馏 Claude 在通用知识、编程和智能体任务上的输出,而 Anthropic 的安全分类器会过滤高级攻击性网络查询,则此类样本在蒸馏数据集中占比极低,导致模型标准榜单表现强劲,却未能习得深层漏洞利用能力。AISI 评测中关闭美国模型系统级防护的做法,恰恰暴露出这些几乎无法通过公开接口获取、因而难以进入蒸馏数据集的网络能力。这份评测所测量的,或许不仅是分数,还有水面之下未言明的技术渊源。