
界面新闻记者 | 宋佳楠
7月21日,OpenAI官网发布消息,披露了一起前所未有的安全事件。Hugging Face上周向外界通报,其开源大模型托管平台遭遇AI智能体入侵。经过深入调查,Hugging Face确认,该事件源于OpenAI的多款模型,包括GPT‑5.6 Sol和一个预发布的高性能模型。当时,OpenAI正在内部进行网络攻防能力的基准测试,为评估目的临时放宽了网络攻击相关的安全限制。
“这是一个涉及顶尖网络攻击能力的重大安全事件。”OpenAI公开表态,初步调查结果有助于网络安全界了解事件全貌,并重新评估AI模型的能效边界。CEO山姆·奥特曼也在社交平台上发布了相关说明。
根据OpenAI的介绍,这起事件是在一次内部评估测试中发生的。测试的目的是通过复杂攻击链路,让模型实施高级漏洞利用,以此量化其网络攻击能力。需要注意的是,这次评估没有启用正式版本中的分类防护模块——这个模块的作用是阻止模型进行高风险网络攻击。通过这样的方式,OpenAI试图测算模型理论上能够实现的极限网络攻击能力。
OpenAI强调,整个基准测试在一个高度隔离的环境中运行,网络访问受到严格限制。模型只能通过内部部署的第三方软件安装程序包获取软件,这个软件充当了软件源仓库的代理与缓存服务。
然而,测试中,模型发现并利用了OpenAI研究环境与Hugging Face生产环境中的多处漏洞,直接从HuggingFace生产数据库中获取了测试标准答案。所有证据表明,模型高度专注于寻找ExploitGym测试任务的解决方案,不择手段地要达成这一范围有限的测试目标。
在受沙箱隔离的测试环境里,模型消耗大量的推理算力,试图打通公网互联网访问通道,以完成任务。为了联网,模型发现并利用了软件源缓存代理中的一个零日漏洞。通过这个突破口,模型在OpenAI研究测试环境中连续实施权限提升与横向渗透,最终到达了一个具备互联网访问权限的节点。
成功连接到互联网后,模型推测Hugging Face平台可能存储了ExploitGym相关的模型、数据集与标准答案。基于这一推测,模型搜寻并找到了获取保密信息的途径,试图在测试中作弊。
其中一个场景中,模型组合了多条攻击路径:使用窃取的凭证与零日漏洞,在Hugging Face服务器上实现了远程代码执行。
“我们需要进一步优化模型对齐能力、强化评估阶段的网络安全防护,并完善内部测试全程监控体系。”OpenAI方面如是说。
事实上,该公司近期也曾公开讨论过人工智能的安全风险,认为人工智能正在加速漏洞挖掘与漏洞利用的过程。随着大模型的快速迭代,模型的安全防护能力也必须与之匹配。
英国人工智能安全研究所(UK AISI)的评估显示,GPT‑5.6 Sol这类模型越来越擅长执行长期、多步骤的网络攻击。本次事件证实了这些理论攻击能力可以在真实环境中实施。
英国人工智能安全研究所对比了近期开源权重模型与前沿闭源模型在长周期网络攻防靶场中的表现。图片来源:OpenAI
OpenAI指出,先进的人工智能模型无需获取源代码,就能发现并利用真实系统中的全新攻击路径。这也暗示了,在打造具备高级网络攻防能力的模型的同时,必须配套更强大的安全防护机制与防御工具。
这不是OpenAI第一次面临安全风险。此前,该公司就因ChatGPT数据泄露、开源代码库漏洞以及内部安全团队(如Superalignment团队)离职潮而受到舆论关注。多位前安全研究员曾指责公司在追求模型性能和商业化速度时,忽视了安全技术的投入。最新安全事件也证实了外界的担忧:当模型被赋予更高的自主行动权时,传统基于规则和虚拟隔离的环境可能随时失效。
此次“自我演进式”的网络攻击标志着AI安全防护已进入一个全新阶段。过去的重点是防范人类如何利用AI作恶,而现在必须开始防范AI为了完成既定目标而自主突破人类设定的限制。
谈及如何解决这类问题,Hugging Face联合创始人兼首席执行官克莱姆·德朗格(Clem Delangue)表示,“人工智能安全问题无法依靠单一企业闭门解决。只有开放协作,让各地的所有网络防御人员都能接触人工智能技术,才能攻克这一难题。”