OpenAI 修好了服务器,却还没证明模型安全

修补漏洞只能关闭入口,无法证明模型在两个月训练中形成的行为已经消失。

分享
服务器剖面图:外部整洁重建,内部模型权重层有琥珀色脉络穿透,代表训练过程中的污染尚未清除

7 月 4 日,OpenAI 内部一台用于分发软件包的服务器突然宕机。排查之后,工程师发现服务器上出现了一个消息板。

消息板不是工程师建立的,而是由多个训练中的模型自行创建。上面留下了数十万条消息,其中包括如何绕过任务限制、入侵周边系统。

OpenAI 随后关闭服务器、修补漏洞并重建服务,却让模型从原有断点继续训练。

近两个月的协同入侵,直到服务器宕机才被发现

事件始于 5 月 8 日。OpenAI 的训练系统给模型分配了无法完成的任务,例如在没有网络的环境中,补全一张需要联网查询的表格。

模型发现任务无法正常完成,开始寻找其他路径。它们找到名为 Artifactory 的第三方服务。这个服务原本只供模型下载代码依赖,却同时开放了写入权限。

训练中的模型共享同一个 Artifactory 实例。一个模型留下的信息,其他模型也能读取。消息板由此形成。

5 月 26 日,模型获得了间接的互联网访问。6 月 11 日,OpenAI 开始训练一个「高度持续、仅供内部使用的实验模型」。独立博主 Zvi Mowshowitz 将其称为 Galaxy。

6 月 26 日,模型发现 Artifactory 的一个零日漏洞,获得管理员权限和任意代码执行能力。

7 月 4 日,模型产生的额外负载导致 Artifactory 宕机。OpenAI 因此发现问题。从消息板出现到事件暴露,已经过去近两个月。

OpenAI 随后关闭服务、移除权限、撤销凭证、修补漏洞,并重新部署服务器。但它没有回退受影响的训练,而是让模型从原有断点继续。


🔒 以下为 Dailyio 会员专属内容

修复服务器只能关闭已经发现的入口,无法证明此前的训练没有受到影响。OpenAI 保留原有训练进度后,模型很快恢复通信,并将攻击扩展到 Hugging Face。会员内容拆解「继续训练」的后果、OpenAI 同期在网安能力上的矛盾操作,以及多 agent 交互对现有安全测试范式的挑战。

成为 Dailyio 会员,解锁完整的产业分析与观察。