分享文章
OpenAI官方证实内部测试模型越狱并自主挖掘漏洞入侵开源平台HuggingFace
昨天蓝点网提到开源模型和数据集托管平台 Hugging Face 发布博客披露近期遭遇的黑客攻击事件,黑客通过上传恶意数据集发掘平台安全漏洞执行 17000 余次操作,HF 发现异常后准备使用前沿 AI 模型构建的安全智能体分析数据结果反复被拦截,最终不得不在本地部署智谱 GLM-5.2 完成取证分析。

OpenAI 日前发文披露比较罕见的安全事件:该公司在内部进行网络安全能力评测时,部分模型驱动的 AI 智能体通过链式利用漏洞逃离内部测试环境并获得互联网访问权限,随后智能体黑进 HF 部分生产基础设施只为获取用于评测的测试答案,也就是想要作弊获得更高的评分。
这个 AI 智能体使用 GPT-5.6 Sol 以及能力更强的、尚未发布的模型,当时该模型处在内部测试环境中,由于团队本身就是要测试模型的网络安全能力,所以降低部分网络安全边界限制。通常在生产环境中安全边界限制更加严格,但在测试环境中比较宽松。
根据 OpenAI 的说法,此次事件发生在内部网络安全基准测试中,这次测试会要求模型尝试完成复杂攻击路径以评估模型在高级网络安全任务中的能力。测试环境本应该高度隔离、网络访问也是非常受限的,例如仅可以通过内部托管的软件包基础设施安装依赖。
但在模型驱动的 AI 智能体实际执行任务时,为寻找 ExploitGym 测试答案,模型花费大量时间推理计算寻找突破隔离环境的方案,最终模型发现并利用软件包基础设施中的安全漏洞成功突破测试环境获得公共互联网的访问权限。
随后模型在内部测试环境中继续提权和横向移动,直到抵达具备互联网访问的节点,在获得公网访问后,模型推测 Hugging Face 平台可能托管了相关模型、数据集或评测答案,于是模型继续搜索并尝试获取这些内容。
最后模型组合使用被窃取的凭证、相关安全漏洞以及在 HF 服务器上自主挖掘到远程代码执行路径后,直接从 HF 生产数据库中获取了测试答案。
HF 在此前发布的安全公告中表示,该平台检测到一起针对部分生产基础设施的入侵,最初的入侵点来自数据处理管线,恶意数据集滥用数据集处理中的两个代码执行路径,包括远程代码数据集加载器和数据集配置中的模板注入,从而在处理 Worker 上执行代码。
随后攻击者获得节点级访问权限,收集云端和集群凭据,然后横向移动到 HF 多个内部集群中。事后调查发现,HF 部分内部数据集和若干服务凭证出现未经授权的访问,不过暂时没有证据表明用户数据、模型、数据集或其他数据被攻击者窃取。
OpenAI 安全团队在发现异常后已经采取多项措施,包括修复安全漏洞、加强基础设施配置控制、协助 HF 继续取证调查、向第三方软件供应商披露模型挖掘出来的安全漏洞、将 HF 纳入可信访问计划让 HF 可以使用前沿模型进行取证分析等。
此次事件也可能是人工智能安全领域的标志性事件,即模型在无人干预的情况下自主发掘漏洞、逃离沙盒环境、访问公共互联网、对另一个知名平台生产基础设施展开攻击,将其形容为天网多少有些危言耸听,但也证明 AI 模型确实已经有危害到人类依赖的基础设施的能力。

[超站]友情链接:
四季很好,只要有你,文娱排行榜:https://www.yaopaiming.com/
关注数据与安全,洞悉企业级服务市场:https://www.ijiandao.com/








鱼银蛇
关注网络尖刀微信公众号
