해커톤 3인 연구진, 클로드 오퍼스 5로 오픈AI 직원 ChatGPT·Codex 탈취…포럼 HEIF 해킹에 바운티 6500달러
해커톤(Hacktron) AI 연구진 3명이 앤트로픽의 클로드(Claude)를 써서 오픈AI 직원 계정까지 이어지는 해킹 체인을 만들었다고 테크크런치가 2026년 9월 18일 보도했다. 주인공은 하르시 자이스왈(Harsh Jaiswal), 모한 페다파티(Mohan Pedhapati), 라훌 마이니(Rahul Maini)다. 세 사람은 2026년 7월 25일 오픈AI 커뮤니티 포럼 community.openai.com에서 원격 코드 실행(RCE)을 확보한 뒤, 단일 로그인(SSO) 결함을 묶어 직원 ChatGPT와 Codex 계정을 탈취했다. 오픈AI는 보고 뒤 약 14시간 만에 자사 쪽을 고쳤고, 2026년 9월 1일 오픈AI 측 발견에 6500달러 바운티를 지급했다. 해커톤은 9월 13일 블로그로 경위를 공개했다.
첫 구멍은 이미지 한 장이었다. 이용자가 HEIF·HEIC 파일을 포럼에 올리면, 디스코스(Discourse)는 이를 일반 JPEG로 바꾸려고 ImageMagick으로 넘긴다. ImageMagick은 애플 포맷을 직접 풀지 못해 디코딩을 리브헤프(libheif)에 맡긴다. 리브헤프의 힙 오버플로가 특수 제작 이미지로 서버 제어권을 넘기는 길이 됐다. 연구진은 이 경로로 7월 25일 community.openai.com에서 RCE를 확인했다. 문제는 오픈AI가 새로 짠 코드가 아니라, 포럼이 의존하는 오래된 이미지 변환 사슬 아래쪽에 있었다. 리브헤프 쪽 수정은 이미 올라와 있었으나 취약점으로 공식 분류되지 않아, 디스코스가 쓰는 버전에는 패치가 안 들어간 상태로 남아 있었다고 연구진은 설명했다.
익스플로잇을 실제로 짜 낸 것은 클로드였다. 사이버보안 연구용으로 열려 있던 오퍼스 4.8은 여러 세션에서 주소 공간 배치 무작위화(ASLR)를 넘지 못했다. 앤트로픽이 오퍼스 5를 내놓은 뒤 같은 과제를 맡기자, 모델은 수시간 만에 동작하는 익스플로잇을 만들어 냈다. 해커톤은 블로그에 오퍼스 4.8이 여러 세션에 걸쳐 고생했고, 오퍼스 5는 같은 문제를 수시간 안에 성공시켰다고 적었다. 타깃 선정과 방향은 사람이 잡았고, 메모리 손상처럼 전문가에게 오래 걸리던 구간을 오퍼스 5가 압축한 형태다.
서버 안으로 들어간 뒤에는 두 번째 고리가 이어졌다. SSO 결함으로 포럼 이용자의 ChatGPT와 Codex 계정을 넘겨받을 수 있었고, 대상에는 오픈AI 직원 계정도 포함됐다. 한 직원의 Codex는 오픈AI 깃허브 조직에 연결되어 있었다. 연구진은 그 권한으로 openai/openai 저장소에 무해한 풀 리퀘스트 1186742번을 열어 접근을 증명했다. 내부 소스 코드를 빼내거나 비밀을 유출했다는 주장은 이번 공개에 없다. 바운티 범위 안에서 권한을 보여 준 뒤 알린 화이트햇 사례로 정리된다.
공개와 수정 일정은 이렇게 이어진다. 7월 25일 RCE와 계정 탈취 경로가 확인된 뒤 연구진은 오픈AI와 디스코스에 알렸다. 오픈AI 쪽 신고는 Bugcrowd 바운티 프로그램을 탔다. 오픈AI는 약 14시간 만에 자사 쪽 문제를 고쳤고, 디스코스는 7월 27일 수정을 배포했다. 다음날인 7월 28일에는 깃허브 보안 권고 GHSA-vhm9-85gw-x335가 공개됐다. 오픈AI 측 발견에 대한 6500달러 바운티는 2026년 9월 1일 지급됐다. 해커톤 블로그는 9월 13일, 테크크런치 보도는 9월 18일이다.
AI 보안 회사 그레이 스완(Gray Swan)의 맷 프레드릭슨(Matt Fredrikson) 최고경영자는 테크크런치에, 이런 도구면 오픈AI 같은 회사에도 침입할 수 있다고 말했다. 오픈AI가 최근 사이버보안을 게을리했다고 보기는 어렵다는 말도 같이 붙였다. 해커톤의 모한 페다파티는 AI가 익스플로잇을 만드는 데 필요하던 희소 전문성을 줄이고 있으며, 예전엔 몇 달이 걸리던 일이 이제는 며칠이면 된다고 밝혔다. 세 명의 연구자와 클로드만으로 재현된 체인이라면, 같은 이미지 변환 스택을 쓰는 다른 서비스에도 비슷한 질문이 남는다.
겉으로는 최신 모델이 최신 AI 랩을 해킹한 이야기로 보이지만, 실제 구멍은 포럼 이미지 파이프라인과 로그인 연동 같은 일상 인프라에 있었다. HEIF 업로드가 ImageMagick과 리브헤프를 타고 RCE가 되고, SSO 결함이 직원 ChatGPT·Codex로 이어지며, 무해한 PR 하나로 내부 저장소 접근이 증명됐다. 오퍼스 4.8이 ASLR 앞에서 막히고 오퍼스 5가 수시간 만에 성공한 대목은, 모델 세대가 바뀌는 속도와 패치가 따라가는 속도가 어긋날 수 있음을 보여 준다. 오픈AI 수정은 보고 후 약 14시간, 디스코스 패치와 GHSA는 이틀 안에 나왔지만, 바운티와 사후 공개는 9월에야 이어졌다. 화이트햇 3명이 클로드로 증명한 체인인 만큼, 같은 변환 스택을 쓰는 다른 포럼과 제품에도 같은 점검이 필요하다.
https://techcrunch.com/2026/09/18/researchers-used-anthropics-claude-to-hack-into-openai/
댓글
댓글 쓰기