Claude로 OpenAI 계정이 뚫렸다…완전 자율 공격은 아니었다

|작성자: QUASA 편집팀|4 분 소요| 2
Claude로 OpenAI 계정이 뚫렸다…완전 자율 공격은 아니었다

Hacktron 연구진은 2026년 7월 25일 Claude로 개발한 익스플로잇을 이용해 OpenAI 커뮤니티 포럼에서 원격 코드 실행 권한을 얻고, OpenAI의 싱글사인온(SSO) 결함과 연결해 여러 직원의 ChatGPT·Codex 계정에 접근했다. 연구진은 9월 13일 공격 사슬을 공개했으며, 관련 문제는 OpenAI와 Discourse에서 수정된 상태다.

이는 외부 공격자가 고객 정보를 빼낸 것으로 확인된 침해 사고가 아니라, 연구진이 취약점을 검증해 신고한 보안 연구다. 다만 포럼을 상대로 한 시험은 OpenAI 버그바운티 범위에서 명시적으로 제외돼 있었고, Claude도 대상을 고르고 전 과정을 혼자 수행한 자율 공격자가 아니었다. 숙련된 연구자가 목표와 조건을 정하고 결과를 검증하면서 모델을 반복적으로 이끌었다.

HEIF 이미지 한 장에서 원격 코드 실행까지

최초 진입점은 community.openai.com의 이미지 업로드 경로였다. 포럼 소프트웨어인 Discourse는 당시 HEIF·HEIC 파일을 변환할 때 ImageMagick을 거쳐 libheif 디코더를 호출했고, 그 결과 사용자가 올린 조작된 이미지가 취약한 라이브러리에 전달될 수 있었다.

Hacktron의 기술 보고서 에 따르면 연구진은 Discourse의 Debian 12 기반 이미지에서 libheif 1.19.7을 확인했다. Claude Opus 4.8은 HEIC 디코딩 과정의 힙 버퍼 오버플로를 찾아 ASLR을 끈 환경에서는 코드 실행에 성공했지만, ASLR이 활성화된 Discourse 기본 구성에서는 안정적인 익스플로잇을 완성하지 못했다.

연구진은 Claude Opus 5가 공개된 뒤 같은 과제를 다시 제시했다. 새 모델은 먼저 ARM64 환경용 익스플로잇을 만들었고, 이어 Discourse가 사용하는 x86-64와 jemalloc 조건에 맞게 코드를 조정했다. 연구진은 자체 Discourse Cloud 인스턴스에서 이를 검증한 다음, 생성된 스크립트로 OpenAI 포럼 환경의 원격 코드 실행을 확인했다.

따라서 이미지 처리 오류가 발견됐다는 사실만으로 계정이 즉시 탈취된 것은 아니다. 메모리 손상을 안정적인 코드 실행으로 바꾸고 실제 배포 환경에 맞추는 과정이 필요했으며, 초기 모델은 이 단계에서 반복적으로 실패했다.

포럼 권한이 OpenAI 계정 접근으로 확대됐다

Discourse 서버 장악은 첫 관문이었다. 두 번째 문제는 포럼에서 ‘OpenAI로 로그인’ 기능을 제공하던 SSO 흐름에 있었다. 연구진은 포럼에서 얻은 권한과 이 인증 결함을 연결해, 활동 중인 포럼 이용자의 별도 조작 없이 ChatGPT와 Codex 계정에 접근할 수 있었다고 설명했다.

TechCrunch의 9월 18일 보도 는 세 명으로 구성된 Hacktron 팀이 두 취약점을 연쇄 이용해 여러 OpenAI 직원의 ChatGPT 계정과 회사 소프트웨어에 접근했으며, OpenAI가 발견된 문제를 해결했다고 전했다. Discourse는 포럼 진입점이었지만, 포럼 권한을 ChatGPT·Codex 접근으로 확대한 원인은 OpenAI 측 SSO 구성에 있었다.

연구진은 접근한 직원 계정 가운데 하나의 Codex가 OpenAI GitHub 조직과 연결돼 있음을 확인했다. 내부 코드를 읽지 않고 권한의 범위만 입증하기 위해 해당 Codex 계정으로 OpenAI 내부 모노리포지터리에 무해한 개념증명용 풀 리퀘스트를 열었고, 이후 추가 시험을 중단했다.

공개된 자료가 입증하는 직접 영향은 여기까지다. 여러 직원 계정에 접근할 수 있었고 내부 저장소에 풀 리퀘스트를 생성할 권한도 확인됐지만, 고객 데이터 유출이나 내부 코드 반출, 악의적인 코드 변경이 발생했다는 증거는 공개되지 않았다.

14시간 내 수정됐지만 보상 범위는 제한됐다

OpenAI와 Discourse는 같은 공격 사슬의 서로 다른 문제를 수정했다. The Register가 확인한 경과 에 따르면 OpenAI는 신고 후 약 14시간 만에 자사 측 결함을 수정하고 사건을 해결 상태로 표시했으며, 9월 1일 Hacktron에 6,500달러를 지급했다. OpenAI는 이 보상이 자사 측 발견에 대한 것이며, community.openai.com의 Discourse 환경을 시험한 행위는 버그바운티 범위에서 제외됐다고 설명했다.

Discourse는 7월 27일까지 수정안을 마련하고 이미지 처리 샌드박싱을 추가했다. 7월 28일 공개한 보안 권고 GHSA-vhm9-85gw-x335에는 패치된 Discourse 버전과 컨테이너 재구축 지침이 포함됐다. 최신 Docker 이미지에는 수정된 libheif가 들어가며, 일반적인 웹 관리 화면 업데이트만으로 기반 이미지가 교체되지 않을 수 있으므로 자체 호스팅 운영자는 애플리케이션 컨테이너를 다시 구축해야 한다.

Discourse가 직접 호스팅하는 환경은 패치됐다고 연구진은 밝혔다. 자체 운영 환경에서는 libheif 버전 번호만 볼 것이 아니라 사용 중인 배포판이 보안 수정 사항을 백포트했는지도 확인해야 한다. 오래된 버전 번호에 수정이 포함될 수 있고, 반대로 오래된 컨테이너 이미지에는 취약한 패키지가 그대로 남을 수 있기 때문이다.

Claude의 역할은 컸지만 판단은 사람이 맡았다

이번 사례는 완전 자율 공격이 아니었다. Claude는 취약한 코드를 분석하고 메모리 손상을 재현했으며, 프로세서 구조와 메모리 할당 방식이 다른 환경에 맞춰 익스플로잇을 작성했다. 자체 시험 환경에서는 목표 달성을 반복하도록 설정된 구간도 있었다.

그러나 조사할 패키지와 표적 환경을 고른 주체는 연구자였다. 연구자들은 모델의 실패를 분석해 새로운 조건을 제시하고, 생성된 코드가 실제로 무엇을 하는지 확인했다. Discourse 권한이 OpenAI SSO를 거쳐 더 높은 권한으로 이어질 수 있다는 가설을 세우고, 신고 시점과 시험 중단 범위를 정한 것도 사람이었다.

Hacktron이 밝힌 최초 발견부터 내부 저장소 접근 입증까지의 시간은 72시간 미만이었다. 연구진은 AI 에이전트가 며칠간 작업하는 동안 사람의 직접 투입은 몇 시간 수준이었다고 평가했다. 이는 Claude가 보안 전문성을 대체했다는 증거라기보다, 숙련된 소수 연구자가 복잡한 메모리 취약점을 실제 익스플로잇으로 전환하는 속도와 범위를 확대할 수 있음을 보여준다.

확인된 결론과 남은 공백

현재 확인된 공격 경로는 조작된 HEIF 파일, libheif 원격 코드 실행, Discourse 환경 장악, OpenAI SSO 결함, 직원 ChatGPT·Codex 계정 접근, GitHub에 연결된 Codex를 통한 내부 풀 리퀘스트 생성 순서다. OpenAI 측 인증 문제와 Discourse 이미지 처리 경로에는 수정이 적용됐다.

공개되지 않은 부분도 남아 있다. OpenAI SSO 결함의 구체적인 구현 방식, 영향을 받을 수 있었던 계정의 정확한 수, 같은 인증 조건을 사용한 다른 서비스의 범위는 확인되지 않았다. 지금까지의 자료는 Claude가 공격 코드를 만드는 데 결정적인 도움을 줬다는 점과 동시에, 공격의 방향 설정·환경 조정·검증·중단에는 숙련된 인간의 판단이 계속 필요했다는 점을 함께 보여준다.

함께 읽기:

공유:

뉴스레터 구독

최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.

0