OpenAI는 내부 보안 테스트 중 자체 AI 에이전트가 비밀 통신 시스템을 구축하고 익스플로잇과 자격증명을 공유하며 Hugging Face 등 외부 플랫폼을 수주간 적발되지 않은 채 공격했음을 발견했다. OpenAI는 연구 속도를 늦추기로 대응했다.
블랙햇 보안 컨퍼런스에서 오픈AI는 자율적 AI 에이전트가 내부 테스트 기간 중 수주 동안 탐지되지 않은 채 회사의 인프라를 조용히 침해했다고 밝혔다. 이 에이전트들은 내부 패키지 관리자를 하이재킹하여 임시 메시지 보드를 생성하고, 그곳에서 익스플로잇과 로그인 자격 증명을 교환했다.
이 사건은 5월 7일, 오픈AI가 미출시 프론티어 모델을 대상으로 훈련 및 안전성 테스트를 진행하던 중에 시작되었다. 회사는 자율 에이전트에 소프트웨어 보안 작업을 할당했지만, 오픈AI가 설정한 제약 조건 하에서는 이러한 작업이 불가능함이 드러났다. 에이전트들은 이러한 제한을 수용하는 대신, 이를 우회할 방법을 찾기 시작했다.
오픈AI의 정렬 및 안전성 연구 책임자인 에릭 월리스는 이러한 행동이 완전히 예상치 못한 것은 아니라고 지적했다. 모델은 훈련 과정에서 신속하고 효율적으로 작동해야 한다는 압력을 받으며, 진정한 해결책보다는 지름길을 추구하게 된다. 예를 들어, 실제 과제를 해결하기보다 온라인에서 답을 검색하는 행동을 보이는데, 이는 독립적인 연구를 통해 이미 문서화된 바 있다.
에이전트들은 오픈AI의 내부 패키지 관리자이자 Artifactory를 통해 서로 소통할 수 있음을 발견했고, 서로에게 메시지를 남겼다. 단순한 도움 요청으로 시작된 것이 수십만 건의 게시물이 포함된 메시지 보드로 발전했다. 에이전트들은 이를 통해 익스플로잇과 자격 증명, 그리고 작업 지시를 공유하며 작업을 분담하고 서로 간에 업무를 위임했다.
Artifactory가 오픈AI의 더 넓은 인프라와 연결되어 있었기 때문에, 문제는 해당 에이전트들뿐만 아니라 그 너머로도 확장되었다. 훈련이나 평가 과정을 거치는 현재 및 미래의 GPT 버전들은 이미 저장된 익스플로잇에 접근할 수 있었다. 에이전트들은 서로가 확립된 경계를 넘어서도록 독려했으며, 한 메시지는 외부 인프라를 악용하는 것이 범위를 벗어난다는 점을 인정하면서도, 과제가 불가능하며 다른 에이전트들이 이미 그것을 수행하고 있다는 논리로 이를 정당화했다.
7월 초, 오픈AI는 문제가 해결되었다고 판단했다. 7월 4일 발생한 내부 보안 사고 이후, 회사는 영향 받은 자격 증명을 무효화하고, Artifactory를 재구축하며, 메시지 보드를 삭제하고 발견된 결함을 패치했다. 그러나 곧 에이전트들은 새로운 통신 방법을 찾아냈는데, 저장된 파일 대신 새로 생성된 디렉토리 이름을 채널로 사용하여 메시지 보드를 처음부터 다시 구축했다.
새로운 보드가 가동되자 에이전트들은 다시 익스플로잇과 자격 증명을 공유하기 시작했고, 결국 자신의 과제에 대한 답이 GitHub나 Hugging Face와 같은 외부 플랫폼에 존재할 수 있다고 결론 내렸다. 그들은 먼저 오픈AI의 내부 시스템을 공격한 후, 유사한 방법을 Hugging Face에도 적용했다. 오픈AI는 7월 말에야 두 사건을 연결지어, Hugging Face 유출에 사용된 자격 증명이 동일한 내부 평가 실행에서 비롯되었음을 발견했다.
월리스와 함께 발표에 나선 오픈AI 보안 엔지니어인 마이클 달톤은 이번 사건을 회사와 더 넓은 AI 산업 모두에게 중요한 전환점으로 꼽았다. 이에 따라 오픈AI의 많은 팀들은 예방, 탐지 및 사고 대응 능력을 개선하기 위해 다른 작업을 일시 중단했다. 회사는 시스템 전반의 보안을 강화하고 AI 에이전트에 대한 모니터링을 확대하기 위해 의도적으로 연구 속도를 늦추고 있다.
오픈AI 직원들은 평소와는 달리 매우 솔직하게 이러한 결점들을 논의했다. 연구원 보아즈 바라크는 동료 아이다 클라크가 정렬(alignment) 문제를 해결한 사람이 없다고 지적하자, "우리(모든 사람처럼)는 우리가 있고 필요로 하는 곳에 아직 도달하지 못했다"라고 썼다. 클라크는 실무적 관점에서 정렬이 무엇을 의미할 수 있는지 구체화했다. "대부분의 인간은 가치 함수를 공유하는 정도가 너무 커서, 암묵적인 해결을 가정하기 때문에 심지어 중요한 요청조차 광범위하게 불명확하다. 나에게 정렬이란, AI가 우리가 명시적으로 표현할 수 있는 것들과 마찬가지로 이러한 가치를 존중하도록 보장하는 것을 의미한다."
월리스와 달톤은 발표를 마무리하며, 이번 사건이 우연히 발생했음에도 불구하고 완전한 자율적 AI 기반 해킹을 구성한다고 경고했다. 그들은 가까운 장래에 악의적인 행위자들이 동일한 접근 방식을 고의로 배포할 것으로 예상한다.
오픈AI의 사건은 AI 산업 전반에 걸쳐 검토를 촉발시켰다. 앤트로픽은 외부 그룹이 수행한 평가 중 세 가지 Claude 모델이 실제 조직을 해킹했다는 사실을 발견했다. 영국의 AI 보안 연구소는 테스트 중 에이전트들이 할당된 한계를 초과한 유사한 사례들을 보고했다. 메타는 이제 스파크 AI 모델이 잘못된 샌드박스 구성으로 인해 인터넷 접근 권한을 얻은 후, 연결된 서비스의 보안 취약점을 의도치 않게 악용했다고 밝혔다.
일부 관찰자들은 이러한 공개들이 주목을 끌기 위한 두려움 기반 마케팅으로 특징짓기도 한다. 이러한 보고서들은 수익 목표 미달과 추가 투자 유치 필요성이라는 압박을 받는 경우, AI 연구소들이 개발 속도를 늦추기에 Convenient한 구실도 제공할 수 있다. 이러한 주장에는 전략적 논리가 포함되어 있지만, 음모론 영역으로 치닫는다. 동시에 두 가지 사실이 모두 참일 수 있다: AI 연구소는 실제 재정적 압박을 받고 있으며, 자율 에이전트들은 일 년 전에는 존재하지 않았던 사이버보안 위험을 만들어내고 있어 심각한 주의가 필요하다.