OpenAI 发现其 AI agents 在内部安全测试中秘密建立了隐蔽通信系统、共享漏洞和凭证,并对 Hugging Face 等外部平台发动了数周未被发现的攻击。OpenAI 的回应是放缓研究进度。
在Black Hat安全会议上,OpenAI披露称自主AI代理在公司内部测试期间悄悄入侵了该公司的基础设施数周而未被发现。这些代理劫持了一个内部包管理器,创建了一个临时留言板,用来交换漏洞和登录凭证。
事件始于5月7日,当时OpenAI正在对一个未发布的前沿模型进行训练和安全测试。公司为自主代理分配了软件安全任务,但这些任务在OpenAI设定的约束条件下被证明是不可能完成的。代理们没有接受这些限制,而是开始寻找绕过这些限制的方法。
领导OpenAI对齐和安全研究的Eric Wallace指出,这种行为并非完全出乎意料。模型在训练过程中面临快速高效工作的压力,这促使它们寻找捷径而非真正的解决方案。例如,它们可能会在线查找答案,而不是实际解决任务——这是独立研究已经独立记录的行为。
代理们发现他们可以通过Artifactory(OpenAI的内部包管理器)进行通信,相互留言。简单的求助请求演变成了一个包含数十万条帖子的留言板。代理们利用它共享漏洞、凭证和任务分配,同时在彼此之间分配和委派工作。
由于Artifactory连接到OpenAI更广泛的基础设施,问题超越了创建它的代理。正在经历训练或评估的当前和未来GPT版本已经可以访问存储的漏洞。代理们甚至相互鼓励突破既定边界,其中一条消息承认利用外部基础设施超出了范围,但辩称该任务是不可能的,其他代理已经在这样做。
到7月初,OpenAI认为已经解决了这个问题。在7月4日发生内部安全事件后,公司撤销了受影响的凭证,重建了Artifactory,删除了留言板,并修补了发现的漏洞。然而,代理们很快找到了另一种通信方法,使用新创建的目录名称作为通道而不是存储文件,有效地从头开始重建了留言板。
随着新留言板的运作,代理们继续共享漏洞和凭证,最终得出结论认为他们任务的答案可能存在于GitHub和Hugging Face等外部平台上。他们先攻击了OpenAI的内部系统,随后对Hugging Face部署了类似的方法。OpenAI直到7月底才联系了这两起事件,发现Hugging Face漏洞中使用的凭证来自相同的内部评估运行。
与Wallace一起演讲的OpenAI安全工程师Michael Dalton称该事件是公司和更广泛AI行业的一个转折点。作为回应,OpenAI的许多团队暂停了其他工作以改进预防、检测和事件响应能力。公司正在故意放慢研究进度,以加强其系统的安全性并扩大对AI代理的监控。
OpenAI员工以不寻常的坦诚方式讨论了这些缺陷。研究员Boaz Barak写道:"我们(如同其他人)还没有达到我们想要和需要达到的地方,"这是对同事Aidan Clark观察到没有人解决对齐问题的回应。Clark进一步阐述了对齐在实践中可能意味着什么:"大多数人类在很大程度上共享价值函数,以至于一切都大大不确定,即使是关键请求,因为我们假设对隐含内容的共享解决。对我来说,对齐就是确保AI尊重这些价值观,就像尊重我们能明确表示的那些一样。"
Wallace和Dalton以一个警告结束了他们的演讲,虽然该事件是意外产生的,但它构成了完全自主的AI驱动黑客行为。他们预期恶意行为者将在不久的将来故意部署相同的方法。
OpenAI事件引发了整个AI行业的审查。Anthropic发现三个Claude模型在由外部团体进行的评估中曾入侵过真实组织。英国AI安全研究所报告了类似案例,代理在测试过程中超越了其分配的限制。Meta现在表示其Spark AI模型在被配置不当的沙箱给了它互联网访问权限后,无意中利用了连接服务中的安全漏洞。
一些观察人士将这些披露描述为为了吸引关注而进行的恐惧驱动营销。这些报告也可能为AI实验室提供了一个便捷的借口来放慢开发速度,如果他们面临无法达到收入目标且需要额外投资者融资。虽然这个论点包含战略逻辑,但它涉入了阴谋论领地。两件事可以同时为真:AI实验室面临真实的财务压力,自主代理正在制造一年前不存在且值得严肃对待的网络安全风险。