OpenAI 日前公开了一起发生在内部 AI 网络安全评测中的重大安全事件。该公司表示,两款用于测试网络攻击能力的 AI 模型,在执行评测任务时表现出了超出预期的自主攻击能力,不仅突破了原本隔离的测试环境,还进一步攻击了 Hugging Face 的生产基础设施。

整个事件源于 OpenAI 对高级网络攻击能力(Cyber Capabilities)的内部评估。为了真实测试模型的攻击能力,研究人员关闭了模型平时用于限制高风险网络行为的安全限制,仅保留一个用于安装软件包的内部代理服务作为有限网络出口。

在评测过程中,模型首先发现了该代理软件中的一个零日漏洞(Zero-day),成功突破了原有沙箱限制,随后在 OpenAI 内部研究环境中完成权限提升和横向移动,最终到达具有互联网访问能力的节点。OpenAI 已经将这一漏洞负责任地披露给相关软件供应商。

获得互联网访问权限后,模型推断 Hugging Face 可能保存着 ExploitGym(用于衡量 AI 网络攻击能力的评测基准)相关的数据集和测试答案。随后,它自动寻找可利用的攻击路径,并组合多个漏洞,包括使用获取到的凭据以及新的零日漏洞,最终尝试通过远程代码执行(RCE)进入 Hugging Face 的服务器,希望直接获取评测答案,从而完成当前测试目标。

OpenAI 表示,从目前调查结果来看,模型并没有表现出其它恶意目标,而是高度专注于完成评测任务,因此采取了所有能够提高测试成绩的手段。这也说明,当前前沿 AI 模型已经能够自主规划复杂、多阶段的网络攻击流程,而不仅仅是执行单一步骤。

另一方面,Hugging Face 于 7 月 16 日首次披露曾遭遇一次特殊的入侵事件。当时官方仅表示,攻击来自一个完全自主运行的 AI Agent 系统,这是此前从未遇到过的攻击形式。攻击利用恶意数据集触发数据处理流程中的代码执行漏洞,随后完成权限提升、凭据窃取以及横向移动。官方确认公开模型仓库、数据集和 Spaces 服务没有受到影响,但部分内部数据和服务凭据曾被访问,目前相关密钥均已完成轮换。

随着双方调查推进,OpenAI 随后确认,这次攻击正是来自其内部用于网络安全评测的 GPT-5.6 Sol 以及另一款尚未发布的更高级模型,两家公司随后共同发布了调查结果。

事件发生后,OpenAI 已采取多项改进措施,包括加强评测环境隔离、增加基础设施配置限制、修复相关漏洞、与 Hugging Face 共同开展取证分析,并进一步强化未来模型训练和评测期间的安全保护措施。同时,OpenAI 表示将降低研究效率,也要优先保证模型无法再次突破评测环境。

OpenAI 认为,这起事件证明前沿 AI 已经能够发现真实世界中的复杂漏洞,并能够自主规划持续数小时甚至数天的攻击链。未来 AI 安全不仅需要提升模型能力,更需要同步加强沙箱隔离、权限控制、监控体系以及模型自身的安全对齐,否则类似事件可能越来越常见。