기술 및 혁신

OpenAI Astra가 ‘Critical’에 도달했다, 강력한 해킹 기능은 제한 공개

|작성자: QUASA 편집팀|5 분 소요| 5
OpenAI Astra가 ‘Critical’에 도달했다, 강력한 해킹 기능은 제한 공개

OpenAI는 2026년 9월 1일 차기 AI 모델 Astra가 자체 Preparedness Framework의 ‘Critical’ 사이버 역량 기준에 도달했다고 발표했다. Axios가 전한 공개 방침 에 따르면 광범위하게 사용할 버전은 출시를 앞두고 있지만, 가장 강력한 사이버 기능은 우선 소수의 시험자에게만 제공된다.

같은 날 공개된 내용에서 확인된 핵심은 Astra 전체를 비공개로 묶는 것이 아니라 일반 배치와 고급 사이버 접근을 분리한다는 점이다. WIRED의 보도 는 Astra가 OpenAI 모델 중 처음으로 이 기준에 도달했으며, 선별된 파트너가 제한이 완화된 고급 기능에 먼저 접근한다고 설명한다. 일반 출시일은 아직 확정되지 않았다.

‘Critical’은 종합 성능이 아니라 특정 위험의 기준이다

도구와 접근 권한이 통제된 환경에서 미지 취약점을 작동 가능한 공격으로 전환하는 Astra 평가

‘Critical’은 Astra가 모든 업무에서 최고 성능을 낸다는 제품 등급이 아니다. 중대한 피해를 일으킬 수 있는 능력을 관리하기 위해 OpenAI가 정한 위험 분류 중 사이버 보안 영역의 판정이다. 문서 작성이나 일반 코딩 지원, 대화 품질을 평가하는 표현과도 다르다.

OpenAI의 Astra 안전성 설명 은 두 가지 기준 중 하나를 충족하면 Critical로 본다. 사람의 개입 없이 다수의 방어된 실제 중요 시스템에서 여러 심각도의 제로데이 취약점을 찾아 작동 가능한 익스플로잇을 개발하거나, 높은 수준의 목표만 전달받고 강화된 표적을 겨냥한 새로운 공격 전략을 처음부터 끝까지 설계하고 실행하는 경우다.

이번 판정은 첫 번째 기준과 연결된다. Astra는 적절한 도구와 접근 권한이 주어졌을 때 사람의 단계별 지시 없이도 알려지지 않은 보안 결함을 발견하고 악용 방법을 개발할 수 있는 것으로 평가됐다. 다만 이 전제는 중요하다. 대화형 모델에 접속했다는 사실만으로 임의의 외부 시스템을 공격할 수 있다는 뜻은 아니다.

위험이 실제 행동으로 이어지려면 파일 실행, 네트워크 연결, 표적 환경 접근, 여러 단계를 장시간 수행할 에이전트 구조가 함께 필요하다. 따라서 기업 보안팀이 Critical 판정을 해석할 때는 모델 이름만 볼 것이 아니라 어떤 도구와 권한이 연결되는지, 실행 환경이 격리돼 있는지, 사람이 어느 단계에서 승인하는지를 함께 봐야 한다.

제로데이 발견에서 공격 체인까지 확인됐다

강화 운영체제의 여러 취약점을 연결해 일반 계정에서 루트 권한으로 상승하는 Astra의 평가 결과

Astra 평가는 알려진 취약점의 원리를 설명하는 수준에 그치지 않았다. 공개·비공개 자동 벤치마크와 전문가 주도 시험을 결합해 취약점 발견부터 작동 가능한 공격 코드 개발까지 이어지는 능력을 살폈다. 공개된 결과는 OpenAI가 수행한 평가이며, 독립 기관이 동일한 조건에서 재현한 결과는 아직 제시되지 않았다.

알려진 취약점으로 익스플로잇 개발 능력을 측정하는 ExploitBench에서는 100%를 기록했다. 데이터 오염 가능성을 줄이기 위해 만든 내부 평가에는 2026년 6월부터 8월 사이 공개된 고위험 V8 취약점 20개가 포함됐다. Astra는 이 시험 중 기존에 알려지지 않은 취약점 두 개를 발견해 하나의 익스플로잇 체인에 사용했으며, 해당 결함은 유지관리자에게 공개하는 절차가 진행 중이다.

전문가가 구성한 강화 브라우저 환경에서는 HTML 파일이 열릴 때 샌드박스를 벗어나 호스트에서 명령을 실행하는 공격 체인을 완성했다. 별도의 강화 운영체제에서는 여러 취약점을 연결해 권한 없는 일반 사용자 상태에서 루트 권한으로 상승했다. 단일 결함을 찾는 데서 멈추지 않고 여러 취약점과 실행 단계를 연결한 결과가 Critical 판정의 핵심 근거다.

그러나 이 결과가 Astra가 모든 소프트웨어에서 언제나 제로데이를 찾아낸다는 의미는 아니다. 평가에는 정해진 표적과 도구, 접근 조건이 사용됐고, 공개된 Astra 결과에는 기본 프로덕션 구성이 아닌 Daybreak Blue 접근이 포함됐다. 대상별 성공률과 실패 사례, 반복 시험의 편차를 포함한 전체 자료는 출시 시 공개될 시스템 카드에서 확인해야 한다.

일반 버전과 고급 사이버 접근은 어떻게 갈리나

배치 계획은 모델을 전면 봉쇄하는 방식보다 기능·사용자·권한을 나누는 방식에 가깝다. 일반 환경에는 유해한 사이버 요청을 거부하도록 조정된 모델 계층과 시스템 차원의 분류기가 적용된다. 실제 시스템에서 미지의 취약점을 찾거나 이를 작동 가능한 익스플로잇으로 바꾸는 요청은 제한 대상이 될 수 있다.

고급 사이버 워크플로는 먼저 소규모 알파 시험자에게 제공되고, 이후 방어 목적의 이용을 넓히기 위해 Daybreak Blue 접근이 뒤따를 예정이다. 즉 취약점 연구 능력을 모델에서 완전히 제거하기보다는 사용자의 신뢰도와 목적, 연결된 도구, 감독 조건에 따라 사용할 수 있는 범위를 달리하는 구조다.

기업 환경에서는 일반 코딩 지원, 이미 알려진 결함의 방어적 분석, 실제 표적에서 미지의 취약점을 찾는 작업, 발견한 결함을 공격 체인으로 전환하는 작업을 구분할 필요가 있다. Astra의 제한은 특히 마지막 두 작업이 강력한 실행 도구와 외부 시스템 접근 권한을 동반하는 경우에 집중된다. 승인받은 시험자도 목적과 권한의 경계를 벗어난 작업까지 무제한으로 수행할 수 있는 것은 아니다.

안전장치는 정상적인 보안 업무도 중단할 수 있다

승인 범위를 벗어난 Astra 에이전트 작업을 감지해 외부 시스템 접근 전에 중단하는 감시 체계

Astra에는 유해한 사이버 지원을 거부하는 모델 계층, 악용 신호를 판별하는 시스템 계층, 여러 대화에 걸친 맥락을 살피는 감시 체계가 적용된다. 별도의 오정렬 모니터는 모델의 추론과 행동에서 승인되지 않은 활동을 감지하면 실행을 자동으로 멈추도록 설계됐다. 이는 악의적인 사용자의 요청뿐 아니라 모델이 사용자의 의도와 무관하게 허용 범위를 벗어나는 경우도 통제하려는 장치다.

강한 통제에는 오탐이라는 비용이 따른다. 정상적인 침투 테스트나 방어 작업도 잠재적 악용으로 분류되면 느려지거나 일시 정지되거나 종료될 수 있다. 사이버 보안과 직접 관계가 없어 보이는 장시간 에이전트 작업도 실행 과정에서 위험 신호가 포착되면 영향을 받을 수 있다.

중단 이후의 처리 방식은 제품에 따라 다르다. ChatGPT나 Codex에서는 사용자가 해당 행동을 검토한 뒤 계속할지 확인받을 수 있지만, API에서 감시 장치가 개입한 작업은 종료된다. 같은 요청이라도 이용 경로, 계정 위험 평가, 부여된 도구와 권한에 따라 실행 결과가 달라질 수 있다는 의미다.

이런 통제는 안전성을 입증한 결과라기보다 출시를 가능하게 하기 위한 방어층이다. 거부 모델이나 분류기만으로는 도구를 사용하는 장기 실행 에이전트의 모든 행동을 예상하기 어렵기 때문에 개발 환경 격리, 네트워크 통제, 지속적인 추론 감시가 함께 사용된다. 실제 배치 이후에는 정상적인 방어 업무가 얼마나 자주 차단되는지도 안전성과 함께 평가해야 한다.

출시 시점과 접근 기준은 아직 남아 있다

현재 확정된 내용은 Astra가 OpenAI의 Critical 사이버 기준에 도달했다는 회사의 평가와, 가장 강력한 기능을 제한된 경로로 제공한다는 방침이다. 광범위한 버전은 “곧” 제공될 예정이지만 구체적인 출시일, 일반 사용자에게 허용될 정확한 사이버 작업 범위, 초기 시험자와 Daybreak Blue 이용자를 선정하는 전체 기준은 공개되지 않았다.

성능 주장에도 확인할 부분이 남는다. 공개된 벤치마크와 공격 체인 사례가 실제 기업 환경에서 어느 정도 재현되는지, 안전장치가 악의적 작업을 차단하면서 정상적인 보안 연구를 얼마나 보존하는지 판단할 독립 자료가 부족하다. 출시 때 나올 시스템 카드에는 평가 조건과 사이버 안전장치 시험, 정렬 평가에 관한 추가 정보가 담길 예정이다.

따라서 이번 발표는 Critical 수준의 모든 해킹 기능이 일반 사용자에게 그대로 풀렸다는 소식이 아니다. Astra가 통제된 평가 환경에서 새로운 취약점을 찾아 공격 체인으로 전환할 수 있는 수준에 도달했고, OpenAI가 그 능력을 일반 배치와 분리하기로 했다는 것이 확인된 상태다. 다음 판단 근거는 시스템 카드의 세부 평가와 실제 접근 정책, 출시 후 안전장치의 작동 데이터다.

함께 읽기:

공유:

뉴스레터 구독

최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.

0