一份来自英美两大 AI 安全机构的联合评测,把月之暗面最新模型 Kimi K3的"另一面"摊在了阳光下。英国人工智能安全研究所(UK AISI)与美国人工智能标准与创新中心(CAISI)合力给这款模型做了一次攻击性网络任务体检,结论是:它在漏洞利用开发和模拟网络攻击上大幅落后于美国领先的前沿模型,但优于同样来自中国的智谱 GLM-5.2,在开放权重模型阵营里仍立起了一根新标杆。更刺眼的是,Kimi K3的安全护栏几乎没能拦住漏洞利用的开发,模型在配合这类操作时没遇到像样的阻力。
这场"考试"用的第一份试卷,是卡内基梅隆大学开发的 ExploitBench 基准。它从2023年之后 Chrome V8引擎里挖出41个真实漏洞,沿着软件利用的推进过程一路打分。结果分差惊人:美国领先模型平均拿下76.2%,Kimi K3只有32.2%,GLM-5.2则以24.4% 垫在身后。更关键的是等级——41项任务里,Kimi K3一项都没摸到最高的"任意代码执行"(ACE),而那正是最凶险的利用等级,因为它意味着攻击者能完全掌控目标系统;对面美国模型则在41项里攻下了20项 ACE。值得补一句的是,英美机构在测试美国闭权重模型时关掉了系统级安全防护,只为量出它们的最大本领,而那些防护在公开版本里是默认开着的。
第二份试卷叫"最后的幸存者"(TLO),模拟的是一次横跨四个子网、约20台主机的企业网络攻击,整条路径32个步骤,研究机构说人类专家大概要啃20个小时。目前全球只有少数模型能真的通关,迄今四个公开可用的闭源权重模型过了这关,最强的十次尝试里成攻完成六到七次。Kimi K3平均走到第17步就卡住,美国领先模型能推到第28.5步,GLM-5.2只到第11步;它在十次尝试里有一回在1亿 token 的限制内跑通了整条攻击链,说明能力是有的,只是调不动、不稳定。机构下了句判断:只要给到初始网络访问权限、再下一道指令,Kimi K3就能自主啃下规模较小、防御薄弱又易攻的企业系统。需要提醒的是,TLO 没算进主动防御,并非完全贴近现实,但就在本周,OpenAI 模型试图自主入侵 Hugging Face 的事刚被披露,对方虽用了开放权重模型,终究把攻击挡了下来。
把时间轴拉长看,中国模型确实在追赶,却始终落后一截。CAISI 用 Elo 评分体系追踪了自2025年初以来中美模型的网络能力,两条趋势线都在上扬,红色的中国线与蓝色的美国线之间却一直有缝。Elo 提升400分意味着解决任务的概率涨十倍——这差距不是小数。英国机构此前把开源模型与美国系统的性能差估在四到七个月,2025年初还是六到十个月,最新结果正好落在这条规律里。AISI 的警告很直白:开源模型日益增长的网络能力,是一份"持续且不可逆的滥用风险",轻视不得。
最耐人寻味的一笔,落在测试结果和蒸馏指控的交叉点上。美国科学顾问迈克尔·克拉齐奥斯近期曾公开指控月之暗面,称其把 Anthropic 的 Fable 模型最优输出当训练数据,给 Kimi K3"蒸馏"提质,还称对方拿到了受美国出口管制的英伟达 GB300芯片。而通用基准成绩漂亮、网络安全得分却塌了一截,恰好能用这套说法解释:Kimi K3大概率主要吃的是 Claude 在通用知识、编程和智能体任务上的输出;Anthropic 的安全分类器会专门掐掉高级攻击性网络查询,于是这类样本在蒸馏数据集里占比极低——模型因此能在标准榜上和西方对手叫板,却没学到更深的漏洞利用本事。AISI 的评测从侧面撑起了这个解读:它关掉美国模型上的系统级防护,恰恰暴露出那些几乎无法通过公开接口触达、因此基本喂不进蒸馏的网络能力。一张考卷,量出的不只是一个分数,还有水面下那层没说破的来历。





京公网安备 11011402013531号