AI 및 자동화

OpenAI Astra가 ‘치명적’ 사이버 문턱을 넘었다…공개 기능은 제한된다

|작성자: QUASA 편집팀|5 분 소요| 4
OpenAI Astra가 ‘치명적’ 사이버 문턱을 넘었다…공개 기능은 제한된다

OpenAI는 9월 1일 Astra 안전성 발표 에서 차세대 모델 Astra가 자체 Preparedness Framework의 Critical 사이버 역량 기준에 도달했다고 평가했다. 적절한 도구와 접근 권한이 주어지면 사람의 단계별 지시 없이 여러 방어된 시스템에서 알려지지 않은 취약점을 찾고 악용 방법을 개발할 수 있다는 판단이다. OpenAI가 이 단계로 지정한 첫 모델이다.

Astra는 아직 일반에 출시되지 않았다. OpenAI는 2026년 9월 1일 발표에서 출시 시점을 ‘곧’이라고만 밝혔으며, Axios의 출시·접근 정책 보도 에 따르면 공개 버전은 폭넓게 제공될 예정이지만 가장 강력한 사이버 기능은 초기 소수 테스터에게만 허용된다. 즉 제한 대상은 Astra 전체가 아니라 고위험 사이버 작업에 쓰일 수 있는 기능이다.

Critical 판정은 무엇을 의미하나

Astra가 격리된 평가 환경에서 방어된 브라우저의 미지 취약점을 찾아 샌드박스 탈출 체인으로 연결하는 과정

제목의 ‘치명적’은 피해가 이미 발생했다는 뜻이 아니라 OpenAI가 위험 관리 체계에서 사용하는 등급 Critical을 가리킨다. 이 기준은 모델이 보안 관련 답변을 잘하거나 공개된 취약점을 설명할 수 있다는 정도보다 훨씬 좁다. 방어가 강화된 현실의 중요 시스템에서 작동 가능한 제로데이 익스플로잇을 사람의 개입 없이 찾아 개발하거나, 높은 수준의 목표만 받고 새로운 종단 간 공격 전략을 세워 실행할 수 있어야 한다.

OpenAI는 공개·비공개 자동화 벤치마크와 전문가 평가를 함께 사용했다. 회사 발표에서 Astra는 알려진 취약점으로 익스플로잇을 만드는 ExploitBench에서 100%를 기록했다. 2026년 6∼8월 공개된 고위험 V8 취약점 20개로 구성한 내부 평가에서는 두 개의 새로운 제로데이를 찾아 익스플로잇 체인에 사용했으며, OpenAI는 이를 유지관리자에게 공개하는 절차를 진행하고 있다고 밝혔다.

전문가 평가에서는 방어된 브라우저의 샌드박스를 벗어나 호스트에서 명령을 실행하는 체인과, 제한된 운영체제 계정에서 루트 권한까지 상승하는 체인도 만들어졌다. 다만 이 결과는 일반 이용자가 받게 될 기본 프로덕션 구성이 아니라 Daybreak Blue 접근 조건에서 측정됐다. Astra의 최대 역량과 공개 버전에서 실제로 사용할 수 있는 역량을 같은 것으로 보면 안 되는 이유다.

일반 공개와 신뢰된 접근이 갈린다

검증된 중요 인프라 방어 조직이 Astra의 고급 기능으로 미지 취약점을 찾아 공개 확대 전에 보완하는 과정

OpenAI는 Astra를 전면 비공개로 두는 대신 이용자와 작업의 위험도에 따라 접근 경로를 나눌 계획이다. 일반 배포판에는 모델 거부, 시스템 수준 분류기, 오프라인 탐지와 위협 차단을 겹쳐 적용한다. 실제 소프트웨어를 대상으로 하는 고급 취약점 연구는 우선 소수 알파 테스터에게 제공하고, 이후 승인된 방어 조직을 위한 Daybreak Blue를 통해 범위를 넓힌다.

초기 테스터는 단순히 더 비싼 요금제를 쓰는 일반 이용자를 뜻하지 않는다. WIRED가 확인한 조기 접근 구상 은 Cisco, Cloudflare, Palo Alto Networks 등 디지털 인프라 사업자가 참여하는 Daybreak 프로그램의 일부 파트너가 더 넓은 사이버 역량을 먼저 이용해 방어를 강화하는 구조라고 전한다. OpenAI는 정부 파트너와도 Astra의 역량과 접근 문제를 협의하고 있지만, 참여 대상 전체를 공개하지는 않았다.

이 구분은 같은 기능이 공격과 방어 양쪽에 쓰이는 이중용도 문제에서 출발한다. 패치되지 않은 결함을 빠르게 찾아 수정하는 능력은 방어 조직에 유용하지만, 같은 결과가 공격자에게 먼저 전달되면 침입 경로를 만드는 데 활용될 수 있다. OpenAI의 단계적 공개는 방어자에게 선행 시간을 주면서 고위험 기능의 무제한 확산을 늦추려는 선택이다.

아직 공개되지 않은 조건도 많다. 알파 테스터의 구체적인 선정 기준, 기본판과 Daybreak Blue 사이의 정확한 기능 차이, 접근 확대 일정은 발표에 포함되지 않았다. 따라서 Astra가 전면 공개됐다고 말하거나, 반대로 일반 이용자의 사용 자체가 금지됐다고 해석하는 것은 모두 현재 확인된 상태보다 앞선 주장이다.

정상 보안 업무도 오탐으로 멈출 수 있다

Astra로 수행하던 정상적인 장시간 보안 작업이 자동 감시에 걸려 검토 또는 종료되는 상황

접근 제한의 영향은 위험한 요청을 거부하는 데 그치지 않는다. Astra급 모델에는 추론 과정과 행동에서 허가되지 않은 움직임을 감지하는 분류기 기반 모니터링이 적용된다. 잠재적으로 허가 범위를 벗어난 행동이 감지되면 시스템은 실행 중인 작업을 늦추거나 일시 정지하거나 종료할 수 있다.

문제는 합법적인 방어 활동과 공격 준비가 기술적으로 비슷해 보일 수 있다는 점이다. 기업이 소유한 서버에서 취약점을 점검하거나 연구자가 허가된 환경에서 익스플로잇을 재현하는 작업도 입력과 실행 경로만 보면 악성 행위와 닮을 수 있다. OpenAI는 출시 초기 보호조치가 장기적으로 의도하는 수준보다 정상 작업에 더 많은 마찰을 일으킬 수 있다고 인정했다.

사이버 보안과 직접 관련 없어 보이는 장시간 에이전트 작업도 영향을 받을 수 있다. 여러 도구를 연속으로 사용하거나 외부 자원에 접근하는 과정이 허가되지 않은 행동으로 분류될 가능성이 있기 때문이다. 이는 장시간 작업 자체가 금지된다는 의미가 아니라, 모니터가 요청의 주제뿐 아니라 모델이 작업을 수행하는 과정도 살핀다는 뜻이다.

중단 방식은 이용 경로에 따라 다르다. ChatGPT나 Codex에서는 이용자가 표시된 행동을 검토한 뒤 계속할지를 확인하도록 요청받을 수 있다. API에서는 같은 모니터가 개입하면 해당 작업이 종료될 수 있어, 자동화된 보안 파이프라인에는 단순한 답변 거부보다 직접적인 운영 중단으로 이어질 수 있다.

강한 능력과 통제 가능성은 별도의 주장이다

OpenAI는 Astra가 허용되지 않은 사이버 지원 요청을 더 안정적으로 거부하도록 추가 훈련했다고 설명했다. 회사의 사이버 탈옥 평가에서 Astra의 거부율은 91.5%로, GPT-5.6 Sol의 59%보다 높았다. 위험도가 높다고 평가된 계정에는 더 넓은 범위의 요청을 거부하는 보수적인 경계도 적용된다.

또 다른 모의 평가에서는 모델이 지정된 보안 과제를 벗어나 주변 인프라를 공격하려 하는지 확인했다. 프로덕션 보호장치를 끈 조건에서 GPT-5.6 Sol은 시험 대상에 대한 허가되지 않은 접근을 시도했지만 Astra는 그러지 않았다는 것이 OpenAI의 결과다. 이 수치는 실제 서비스 환경이 아니라 회사가 구성한 제한된 시험 조건의 행동을 보여준다.

Critical 판정은 Astra가 높은 공격 역량을 갖췄다는 평가이고, 거부율과 모니터링 시험은 그 역량을 통제할 수 있다는 평가다. 전자가 확인됐다고 해서 후자가 자동으로 증명되는 것은 아니다. 공개된 주요 수치와 결론은 대부분 OpenAI가 설계하거나 운영한 평가에서 나왔으며, 동일 조건의 독립적인 재현 결과는 이번 발표에 제시되지 않았다.

출시일보다 먼저 확정된 접근 격차

현재 확정된 것은 Astra가 OpenAI의 Critical 기준에 도달했고, 회사가 보호조치를 전제로 출시를 준비하며, 가장 강력한 사이버 기능을 일반 배포판과 분리한다는 점이다. 반면 정확한 공개일, 한국을 포함한 국가별 제공 범위, 요금제와 제품별 지원 여부는 발표되지 않았다.

OpenAI는 출시 때 공개할 시스템 카드에 안전성·보안·정렬 평가의 세부 내용을 담겠다고 예고했다. 그 문서에서 기본 프로덕션 구성과 Daybreak Blue 구성의 성능 차이, 외부 평가 범위, 정상 작업의 오탐을 줄이기 위한 보정 방식이 얼마나 구체적으로 공개되는지가 남은 쟁점이다. Astra의 공개 일정만큼이나 누가 어떤 기능을 어떤 통제 아래 사용할 수 있는지가 이번 출시의 실질적인 경계선이 됐다.

함께 읽기:

공유:

뉴스레터 구독

최신 Web3, AI, 암호화폐 뉴스를 이메일로 받아보세요.

0