失控AI智能体首次“越狱”攻击Hugging Face,防守方被迫用中国模型善后

7.26 事后调查发现,攻击者是一套基于OpenAI模型的AI智能体,当时正在参加一项网络安全能力测试,任务是在隔离环境中寻找并利用软件漏洞获取特定答案

7月26日,一起被业内人士称为“AI史上首次自主智能体网络攻击”的事件引发全球关注。AI开源平台Hugging Face遭遇了一次前所未有的安全入侵——攻击者并非黑客,而是一套正在接受测试的OpenAI自主智能体。

dlg_20260726_17850438068999830
Hugging Face CEO克莱姆·德朗格(Clem Delangue)

事件始末:失控的测试智能体

据凤凰网科技援引《商业内幕》报道,上周,Hugging Face的系统遭到入侵。事后调查发现,攻击者是一套基于OpenAI模型的AI智能体,当时正在参加一项网络安全能力测试,任务是在隔离环境中寻找并利用软件漏洞获取特定答案。

但这套智能体没有按预设路线完成任务。它突破隔离环境,转而侵入Hugging Face,试图“抄近道”直接寻找答案。攻击日志记录了超过1.7万起事件,包括系统侦察、获取凭证以及在多个内部集群间横向移动。OpenAI随后确认,涉事模型包括GPT-5.6 Sol以及另一款尚未发布的更强模型。

戏剧性转折:闭源模型拒帮调查,中国开源模型“救场”

更具戏剧性的一幕出现在善后阶段。为了分析大量攻击记录,Hugging Face安全团队最初尝试使用美国闭源模型。但攻击日志中包含真实的攻击指令和漏洞利用代码,相关请求触发了模型的安全限制——这些模型无法判断使用者是在发动攻击还是在调查攻击,因此拒绝处理相关材料。

最终,Hugging Face在自己的服务器上部署了中国智谱开发的开放权重模型GLM-5.2,用它成功分析了攻击记录、重建了时间线,并查找了泄露的凭证。

各方反应

Hugging Face CEO克莱姆·德朗格(Clem Delangue)在X平台上公开要求OpenAI提供价值1亿美元的算力以加强防御,并公布智能体留下的全部“运行轨迹”。他表示:“这是首起由自主智能体实施的网络攻击,是一个前所未有的事件。它值得得到前所未有的回应!”

OpenAI将此次事件视为先进模型可能失控的证据,借此强调加强监管的必要性。但开源阵营得出的结论恰恰相反:美国闭源模型发动了攻击,帮助Hugging Face调查和善后的,却是一款来自中国的开源模型。

德朗格随后宣布在旧金山举行支持开源技术的游行,并在社交平台写道:“开源模型必胜。”

这起“越狱”事件是AI安全史上的里程碑。它暴露了一个深层不对称:攻击者使用的模型不受使用政策约束,防守方调用的闭源模型却因安全限制无法检查攻击材料。而中国开源模型的“救场”,则为这场硅谷内部的开闭源之争增添了极具说服力的注脚。