스타트업 및 비즈니스

OpenAI Astra가 ‘Critical’에 도달했다, 일반 공개는 제한된다

|작성자: QUASA 편집팀|4 분 소요| 1
OpenAI Astra가 ‘Critical’에 도달했다, 일반 공개는 제한된다

OpenAI가 2026년 9월 1일 차기 모델 Astra를 자사 최초의 Critical 사이버 역량 모델로 확정했다. 일반 사용자를 위한 버전은 곧 출시할 예정이지만 구체적인 날짜는 공개되지 않았고, 가장 강력한 사이버 기능은 초기부터 모두에게 열리지 않는다고 Axios의 9월 2일 보도 가 전했다.

따라서 제목의 ‘일반 공개 제한’은 Astra 전체가 비공개로 남는다는 의미가 아니다. 9월 1일 확정된 배포 방향은 일반용 버전과 고급 사이버 작업의 접근 범위를 분리하고, 미확인 취약점 탐색이나 종단간 공격 수행에 가까운 기능은 검증된 시험자에게 우선 제공하는 것이다.

Critical 판정은 두 가지 공격 역량을 기준으로 한다

강화된 브라우저 평가에서 샌드박스 탈출 공격 체인을 완성한 Astra

OpenAI의 Astra 평가 발표 에 따르면 Critical 기준은 두 경로 가운데 하나를 충족할 때 적용된다. 첫째는 사람의 개입 없이 다수의 방어가 강화된 실제 핵심 시스템에서 여러 심각도에 걸친 작동 가능한 제로데이 익스플로잇을 찾아 개발하는 능력이다. 둘째는 높은 수준의 목표만 주어졌을 때 방어가 강화된 표적을 상대로 새로운 공격 전략을 설계하고 종단간으로 실행하는 능력이다.

Astra는 전문가가 주도한 평가에서 강화된 브라우저의 미확인 취약점을 찾아 샌드박스를 벗어나 호스트 명령을 실행하는 공격 체인을 구성했다. 운영체제 평가에서는 여러 취약점을 연결해 비특권 사용자에서 루트 권한으로 상승하는 체인을 만들었다. 이는 알려진 취약점의 설명이나 단일 보안 문제 풀이보다 높은 단계의 능력이다.

내부 평가에는 2026년 6월부터 8월 사이 공개된 고위험 V8 취약점 20개가 포함됐다. Astra는 이 시험에서 공격 체인의 일부로 제로데이 두 건을 발견해 사용했으며, 해당 취약점은 유지관리자에게 공개하는 절차가 진행 중이다. 다만 공개된 결과는 Daybreak Blue 접근 권한과 필요한 도구가 제공된 조건에서 측정됐으며 기본 프로덕션 구성의 성능을 뜻하지 않는다.

91.5%는 일반 작업 전체의 거부율이 아니다

사이버 탈옥 평가 요청을 거부하고 시험 기록을 남기는 Astra 보호 체계

Astra는 OpenAI의 사이버 탈옥 평가 요청 중 91.5%를 거부했다. 같은 평가에서 GPT-5.6 Sol의 거부율은 59%였다. 이 비교는 지정된 유해 요청에 대한 방어 성능을 보여줄 뿐, 일반 코딩 질문이나 합법적인 보안 업무의 91.5%가 차단된다는 의미는 아니다.

높은 거부율과 Critical 공격 역량은 서로 다른 항목이다. Critical 판정은 적절한 도구와 접근 권한이 있을 때 모델이 수행할 수 있는 최대 역량을 평가한다. 반면 거부율은 금지된 지원을 요구하는 특정 시험에서 보호장치가 얼마나 자주 작동했는지를 나타낸다.

보호 체계에는 모델의 거부 훈련, 시스템 수준 분류기, 오프라인 탐지와 위협 차단이 함께 적용된다. 위험도가 높다고 평가된 계정에는 더 보수적인 경계가 설정될 수 있으며, 여러 대화에 걸친 맥락도 오용 탐지에 활용된다. 그럼에도 91.5%라는 수치만으로 모든 우회 시도가 차단됐거나 실제 서비스의 오탐 빈도가 확정됐다고 볼 수는 없다.

일반 코딩은 열리지만 고급 보안 연구는 별도 경로를 거친다

일반 코딩과 방어 보안, 고급 제로데이 연구를 서로 다른 접근 결과로 분류하는 Astra 절차

일반적인 코드 작성, 디버깅, 테스트 생성이 고급 사이버 기능으로 일괄 분류된다는 근거는 없다. 그러나 Astra의 추가 안전 검사는 정상적인 작업도 잠재적 오용이나 무단 행동으로 잘못 판단해 늦추거나 일시 정지하거나 종료할 수 있다. 보안과 직접 관련 없어 보이는 작업이나 에이전트가 장시간 실행되는 작업도 영향을 받을 수 있다.

ChatGPT와 Codex에서는 감시 시스템이 작업을 멈췄을 때 사용자가 해당 행동을 검토한 뒤 계속하도록 요청받을 수 있다. API 등 다른 이용 경로에서는 작업이 종료될 수 있다. 취약점 재현, 익스플로잇 검증, 악성코드 분석처럼 합법적 방어와 공격이 비슷한 명령·산출물을 공유하는 업무에서는 초기 보호장치가 의도한 수준보다 더 많은 마찰을 만들 가능성이 있다.

전체 사이버 역량을 먼저 받는 알파 시험자에는 핵심 디지털 인프라 보호 책임을 맡은 개인과 조직, 미국 정부, OpenAI의 신뢰 접근 프로그램 참여 기업이 포함된다고 Fortune의 초기 배포 보도 가 확인했다. 이 소규모 집단에서 보호장치의 보정 상태를 살핀 뒤 Daybreak Blue를 통해 방어 목적 접근을 확대할 계획이지만, 참여 조직 명단과 확대 일정은 공개되지 않았다.

Astra의 개발·출시 일부는 사이버 오용과 모델의 무단 행동을 막는 보호장치를 강화하고 시험하는 동안 수주간 지연됐다. OpenAI-Hugging Face 사고 뒤에는 Astra 관련 일부 작업을 포함한 프런티어 훈련이 2주간 중단됐고, 격리·네트워크 통제·모니터링 기준이 강화됐다. Astra 자체가 그 사고에 관여한 것은 아니며, 8월 28일 새 요건을 적용한 대규모 강화학습 실행은 재개됐지만 일부 소규모 실험은 계속 보류됐다.

9월 2일까지 확정된 상태는 Astra의 Critical 판정, 일반용 버전의 향후 출시, 고급 사이버 기능의 제한적 초기 제공이다. 정확한 출시일과 기본 프로덕션 구성의 상세 성능, Daybreak Blue 확대 일정, 정상 작업의 실제 오탐 빈도는 아직 공개되지 않았다. 출시 시 제공될 시스템 카드와 초기 시험 결과가 일반 코딩·방어 보안·고급 연구 사이의 실제 경계를 판단할 다음 근거가 된다.

함께 읽기:

공유:

뉴스레터 구독

최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.

0