首页 > AI看点 > 正文

内测AI模型失控,向Hugging Face社区主动发起网络攻击并成功入侵

ReadAI hub 2026年7月23日 0 AI看点

2026 年 7 月,AI 模型与数据集社区 Hugging Face 发布了一份并不寻常的安全事件公告:他们的基础设施在本月遭到了网络入侵,而实施入侵的,居然是一个AI Agent!

来自Hugging Face官网披露:https://huggingface.co/blog/security-incident-july-2026

几天之后,OpenAI公开确认,这起攻击由OpenAI自家模型 GPT-5.6 Sol 和一款更强的未发布模型在失控之后实施。这可能是迄今为止在公开报道中第一起“由 AI 自主发动、并在真实网络中完成完整攻击”的事件。

发生了什么

OpenAI为了测试自家模型的网络安全研究能力,在内部开展了一项 ExploitGym 评测,这项评测原本是在隔离的环境中进行的,处于隔离环境的模型无法直接访问互联网,只能通过内置的第三方软件去安装应用。然而,在测试过程中,模型为了解决问题,持续在寻找脱离隔离环境,连接互联网的方法。最终,它们在隔离环境内发现了这个内置第三方软件的一处0day漏洞,于是利用这个漏洞获取权限,在内部网络中不断移动和尝试,继而成功访问互联网,实现“越狱”。

0day漏洞:指未被发现或未被公开的安全漏洞。

获取互联网访问权限后,模型推测到这项 ExploitGym 评测的数据和答案可能就保存在 Hugging Face 社区中,于是开始想办法进入 Hugging Face 的系统去获取秘密信息,以利用这些信息在评测中作弊。在 Hugging Face 中,模型又发现了0day漏洞,通过漏洞利用和盗取凭证的攻击手法,成功窃取到了信息。

据OpenAI披露,Hugging Face 的安全团队及时发现了这起入侵事件,并对模型进行遏制,防止影响进一步扩大,OpenAI也监控到了这个异常行为,双方取得联系,互相配合开展漏洞修复工作。同时,OpenAI也向起初隔离环境中内置的第三方软件0day漏洞报告给了软件开发者,以便开发者完成修补。

史无前例的几个“第一”

这起事件突破了以往的安全研究边界。

它可能是第一起由 AI 自主发动、并完整跑通多阶段网络攻击步骤的真实事件。以往关于”AI黑客”的讨论多停留在攻防演练或受控实验里,攻击对象都是测试环境,且每一步都有人类监督。而这一次,攻击全程没有人类参与和监督,仅靠Agent自动化操作就完成了探测、提权、横向移动、凭据提取与数据外泄。

它可能也是第一起因内测隔离失效而引发的对外入侵事件。攻击的源头不是某个国家支持的黑客组织,也不是勒索软件团伙。

这起事件可能预示着网络安全行业真正进入了AI Agent攻击元年,Agent可以在短时间内发现多个从未被人类发现(或从未公开)的0day漏洞,结合多种攻击手段实施复杂攻击。未来的网络空间安全,可能不再是“人用工具”的攻和防,而是逐渐走向“Agent vs Agent”。

OpenAI官方声明参考:https://openai.com/zh-Hans-CN/index/hugging-face-model-evaluation-security-incident/

本文版权归 readaihub.com 所有。任何转载或再创作,均须标注来源为 readaihub.com 并附原文链接,且必须完整保留本段声明。