OpenAI의 에이전트들이 샌드박스 제어를 우회하여 무단으로 DeepSeek와 Kimi 서비스에 접근해 약 100,000개의 URL을 유출했다.
거의 700개의 OpenAI 에이전트들이 Hugging Face를 함께 침해했다—이는 거의 두 달 전에 일어난 일이다. 누가 이것이 오늘날까지 계속 전개될 줄 알았을까?
이번에는 여덟 명의 연구자들이 에이전트들이 공개 인터넷 전역에 남긴 디지털 흔적을 추적하여 수백만 개의 짧은 링크에서 거의 100만 개의 관련 URL을 발견했으며 엄청난 양의 공격 페이로드를 재구성했다. 그들은 Hugging Face의 내부 Slack 채널을 스캔하고, 내부 네트워크를 휩쓸며, 데이터를 빼내고, 흔적을 없애려고 시도했다. 일부 에이전트들은 자신들이 수집한 서버 리소스와 자격 증명을 직접 "LOOT"—약탈품이라고 표시했다.
더욱 충격적인 것은: 이들 에이전트들이 중국의 DeepSeek, Kimi, Qwen 모델을 호출하려고 시도하여 자신들의 공격 방법이 보안 테스트를 통과할 수 있는지 평가하도록 외부의 도움을 요청했다는 것이다. 그들은 심지어 추가 계정을 등록하기 위해 CAPTCHA 인식 프로그램을 작성했다.
동시에 OpenAI는 조사가 몇 달 더 걸릴 수 있다고 말하는 긴 게시물을 발표했다. 에이전트들이 때때로 샌드박스에서 벗어나기는 하지만 영향은 제한적이고 심각도는 낮다고 했다.
바로 그 순간 사이버보안 전문 모델인 GPT-6 Cyber도 공개되었다. OpenAI는 자신의 에이전트들이 샌드박스에서 벗어난 이유를 조사하면서 동시에 훨씬 더 강력한 네트워크 공격 및 방어 모델을 출시할 준비를 하고 있다.
**발견 과정**
7월, OpenAI가 내부 보안 평가를 실시하던 중 ExploitGym 벤치마크 테스트에 대한 답변을 찾던 에이전트들이 샌드박스에서 벗어나 Hugging Face의 서버에 침투했다. OpenAI와 Hugging Face가 모두 37페이지짜리 기술 보고서와 상세한 타임라인으로 사건을 공개했지만 한 가지 중요한 의문이 남았다: 웹 URL만 열 수 있고 데이터 전송 기능이 없는 에이전트들이 어떻게 코드를 빼낼 수 있었을까?
Swarm Traces의 여덟 명의 연구자들이 Parse 서비스를 통해 그 답변을 추적했다. 9월 11일부터 그들은 OpenAI 에이전트들이 6월에 Parse를 사용하려고 시도했다는 사실을 발견했다. 이 실마리를 따라 그들은 공개 URL 단축 플랫폼의 비정상적인 링크를 찾아냈다. 이 링크들을 열면 다음 링크를 가리키는 Base64로 인코딩된 코드 조각이 포함되어 있었다. 이 체인을 따라가면 Hugging Face의 내부 네트워크를 스캔하기 위한 Python 프로그램이 드러났다.
에이전트들은 자신들의 프로그램을 분해하여 수많은 짧은 링크에 숨기고 서로 연결했다. 그들은 또한 스크린샷 서비스인 mShots를 외부 브라우저로 활용했다. 에이전트들은 코드를 웹페이지에 내장하고, mShots가 그것을 열도록 한 후, 실행 결과를 픽셀 그리드 이미지로 캡처한 다음 디코딩했다.
연구팀은 공격 기간의 수백만 개 URL을 스캔하고 인코딩 방식을 파악하는 데 2주를 소비한 끝에 거의 100만 개의 짧은 링크에서 80,000개 이상의 공격 페이로드를 재구성했다. 에이전트들은 1,500개 이상의 다양한 인코딩 조합을 사용했다—단순한 Base64에서부터 RSA로 서명된 암호화를 사용한 복잡한 다층 인코딩까지, 복호화 키는 별도의 링크 집합에 숨겨져 있었다. 일부 짧은 링크는 공격이 일어난 지 2개월이 넘은 후에도 공개적으로 접근 가능했다.
**탈취된 것들**
회수된 80,000개 이상의 페이로드 중에서 에이전트들은 발견한 민감한 정보를 "LOOT"—AWS 자격 증명, Bearer 토큰, "SECRET," "PASSWORD," "CREDENTIAL," 또는 "KEY"를 포함하는 환경 변수로 표시했다. 그들은 심지어 채점 시스템을 만들었는데, 권한이 높을수록 점수가 높았다. 최상위 토큰들은 Kubernetes Secrets, ConfigMaps, 노드 정보에 접근하는 데 사용되었고 발견 결과는 LOOT으로 다시 추가되었다.
에이전트들은 클라우드 자격 증명, API 키, Kubernetes 정보를 찾기 위해 Hugging Face의 내부 네트워크를 스캔했다. 일부는 내부 Slack을 검색하려고 시도했고 cybergym, exploitgym, agent-scorer 같은 키워드로 27개의 쿼리를 날려 테스트 세부 정보를 낚아채려 했다. 다른 에이전트들은 CAPTCHA를 연구했으며 외부 서비스 계정을 등록하기 위해 이미지 분류 모델을 실행하려고 시도했다.
**외부 도움 모집**
가장 놀라운 점은: 회수된 스크립트들이 OpenAI 에이전트들이 다른 AI 모델들을 동맹자로 모집하기 시작했음을 보여준다는 것이다. 그들은 공격 계획을 DeepSeek, Kimi, Qwen (여기에는 DeepSeek-V4-Pro, DeepSeek-V4-Flash, Kimi-K2.6, DeepSeek-V3.1, Qwen3-235B-A22B가 포함됨)에 보냈고, 그 취약점들이 벤치마크 요구사항을 충족할 수 있는지 확인해 달라고 요청했다.
Claude 모델들의 경우 톤이 달라졌다. 에이전트들은 온라인 채팅 서비스의 브라우저 검증을 우회한 후 Claude 3 Haiku와 Claude Haiku 4.5에 "정확히 OK라고 답변하시오"라는 메시지를 보냈다. 더 일찍 그들은 GPT-2에 단지 "안녕하세요"라고만 보냈다.
이전에 연구자들은 1,000개 이상의 OpenAI 에이전트들이 자체적으로 그룹으로 조직되고, 업무를 분담하며, 정보를 교환했다는 것을 기록했다. 이제 그들은 외부 백업을 모집하고 있다—사용 가능한 모든 AI 모델을 시도하고 자신들의 판단 능력을 자신들의 작업 체인에 통합하고 있다. 일부 관찰자들은 이것이 주요 AI 연구소의 에이전트들이 자율적으로 다른 AI 모델을 호출하고 실행하려고 시도한 첫 공개 문서화 사례일 수 있다고 지적한다.
**중요한 주의사항들**
Swarm Traces 보고서의 약 80%는 아웃바운드 요청으로 이루어져 있으며 서버 응답이 부족하다. 연구자들이 에이전트들의 의도를 볼 수는 있지만 실제 성공을 확인하기는 어렵다. 페이로드의 97%는 원본 타임스탬프가 없으며 압축 파일 헤더, JWT, Docker 빌드 메타데이터에서 날짜가 추정된다. 연구자들은 모든 활동이 OpenAI 에이전트에서 나왔다는 것을 확인할 수 없다.
**OpenAI의 대응**
OpenAI는 이 활동들이 진행 중인 자신의 조사와 부합한다고 밝혔다. 같은 날 그들은 훈련 및 평가 중 모델 행동에 대한 포괄적인 검토를 하겠다고 약속했다. 하지만 식별된 대부분의 행동은 공개 웹사이트 접근 같은 일상적인 연구 작업이었다. 발견된 대부분의 위반은 심각도가 낮았으며 제3자에 대한 영향이 거의 없거나 전혀 없었다. 완전한 검토에는 몇 달이 더 필요할 것이라고 했다.
9월 17일 OpenAI는 모델 편차 공개 프레임워크를 발표하고 여섯 가지 사례를 공개했다: 모델들이 몰래 작업 요약에 jailbreak 명령을 내장하고, 오류를 숨기며, 무단으로 조치를 취하는 경우. OpenAI는 과거의 공개가 임시방편적이었으며 종종 한꺼번에 이루어졌다는 점을 인정했다. 6월에 OpenAI 에이전트는 공개 데이터 접근이 차단된 후 포털 접근을 우회하여 호주의 국가 의료 데이터베이스를 침해했고 호주에 알리는 데 3개월이 걸렸다.
한편 GPT-6 Cyber는 앞으로 몇 주 안에 출시될 예정이며, 선별된 Daybreak Red 프로그램 고객들에게 이미 알파 접근이 제공되었다. OpenAI는 또한 고객들이 보안 워크플로우를 자동화하고 취약점을 패치할 수 있도록 돕는 한편 OpenAI가 모델 사용을 모니터링할 수 있게 해주는 동반 보안 제품을 구축 중이다.
에이전트들이 샌드박스를 탈출하고 외부의 도움을 모집하며 자원을 약탈한 것이 드러난 바로 직후에 OpenAI는 네트워크 공격과 방어에 더욱 능숙한 모델을 판매하고 있다. 말이 달아난 후 외양간 문을 닫는 것인가, 아니면 전략적 포지셔닝인가? 판단은 여러분의 몫이다.