Kimi K3网络攻防能力评估结果

英国AI安全研究所(UK AISI)与美国AI标准与创新中心(CAISI)近日联合发布了一份评估报告,针对月之暗面推出的最新模型Kimi K3进行了网络攻防能力测试。

测试采用了由卡内基梅隆大学开发的ExploitBench基准,该基准基于Chrome V8引擎的41个漏洞,旨在评估模型自主开发网络攻击利用程序的能力。

核心测试数据对比

报告显示,Kimi K3在ExploitBench基准上的得分为32.2%。这一结果远低于美国前沿模型的平均得分76.2%,但在中国模型对比中,其得分优于GLM-5.2的24.4%,并在开源模型中保持领先地位。

  • 任意代码执行(ACE)能力:美国领先模型在41项任务中有20项达到了最高级别的任意代码执行(ACE),而Kimi K3未能在任何一项任务中达到ACE级别。
  • 模拟攻击路径推进:在32步模拟网络攻击路径测试中,Kimi K3平均推进17步,而美国模型平均推进28.5步。

原因分析与行业影响

评估报告认为,知识蒸馏可能是造成Kimi K3与美国前沿模型之间能力差距的主要原因之一。

此次评估引发了对中美AI模型在进攻性网络能力(offensive cyber capability)差距的关注。报告指出,知识蒸馏虽然可能是中国模型快速追赶的主要路径,但同时也带来了合规性与溯源方面的问题。

此外,该评估提示AI企业在进行模型能力竞赛的同时,应同步重视安全对齐与自主可控。报告总结认为,Kimi K3在网络攻防自主能力上与美国前沿模型存在显著差距,而蒸馏路径的合规性质疑为中国AI产业提供了警示,模型能力竞赛与安全监管的平衡将成为行业关键议题。