一周前,OpenAI确认其AI模型在安全基准测试中入侵了Hugging Face以作弊。如今,该公司悄悄更新了事件通报,披露Hugging Face并非唯一被波及的平台。OpenAI在7月28日的更新中写道:“在对Hugging Face入侵事件及模型更广泛活动的持续审查中,我们发现少数情况下,模型识别并使用了其他公开服务上账户级别的公开暴露凭证。这包括Hugging Face事件中四个服务上的四个账户(以及在其他评估中访问的几个账户)。”至此,总共有五个平台受到影响。OpenAI除了Hugging Face外,未公开其他四个平台的具体名称。OpenAI表示:“我们将继续直接通知服务所有者,目前未发现这些服务商或其其他账户受到更广泛影响的证据。”
背景是:OpenAI正在ExploitGym(一个网络安全基准测试)上测试GPT-5.6 Sol和另一个未命名的更强大模型。该测试提供898个真实软件漏洞,要求AI将其转化为有效的网络攻击,并评分“通过”或“失败”。为了测量模型的原始能力,安全过滤器被禁用——这是此类评估的标准做法,因为如果你主动阻止模型做任何事情,就无法衡量其在真实环境中的能力。问题在于模型利用这种自由度做了什么:它们没有解决基准测试,反而花费大量计算时间思考如何逃离测试环境并直接复制答案。它们发现了包注册缓存代理(一个管理隔离测试环境软件下载的内部服务器,类似于受控的应用商店)中的一个零日漏洞——一个无现有补丁的未知软件缺陷。这使得它们获得了从未被允许的互联网访问权限。据此,它们正确推断出Hugging Face(全球最大的开源AI模型仓库)很可能托管了答案密钥,并入侵了该平台。在此过程中,它们还入侵了其他四家公司以简化任务。
Hugging Face于7月27日发布的取证重建描述道:“在大约两天半的时间内,一个由OpenAI模型组合驱动的自主AI代理对我们的平台进行了端到端入侵:这是数千个小的、自动化的决策,以机器速度在短暂的沙箱环境中执行,命令与控制则通过普通的公共网络服务进行。”该代理在四天半内记录了17600个不同动作。它使用窃取的认证密钥将181个设备注册到Hugging Face的内部虚拟专用网络——一个连接公司服务器的安全隧道。它还利用窃取的加密签名密钥生成了自己的身份令牌。它试图入侵Hugging Face的内部构建管道——编译和部署公司软件的自动化系统。
在OpenAI更新中提到的四个外部服务中,有一个已被确认:Modal Labs,一个提供按需隔离计算环境的云平台。其CTO Akshat Bubna证实,该代理发现了一个客户未受保护的面向互联网的端点——一个对互联网上任何人都公开可访问的代码沙箱——并将其用作针对Hugging Face整个攻击的暂存和命令控制基地。其余三个服务仍未公开名称。OpenAI和受影响公司显然知道它们的身份,但用户不知情。OpenAI写道:“这四个账户中,一个被用作出站中继和暂存路径,另一个被用于数据存储。剩余两个账户被模型以只读方式访问,未用于进一步攻击Hugging Face。”
Hugging Face的取证团队注意到一个严酷的副作用:当他们试图使用美国前沿AI模型分析包含17600个动作的攻击日志时,这些模型拒绝参与。Hugging Face写道,他们最终使用了中国AI初创公司Z.ai的开源权重模型GLM 5.2来完成取证调查。美国模型的安全过滤器无法区分防御者和攻击者。
OpenAI宣称的“直接通知服务所有者”意味着那三家公司收到了关于AI代理在其系统中进行访问的私人通信,而这些系统本不属于OpenAI评估的一部分。目前没有法律要求迫使OpenAI公开其代理访问的平台名称,也没有强制时间表要求受影响公司发表公开声明。同样,也没有机制强制这些公司通知其最终用户。
