OpenAI xếp Astra vào mức cyber “Critical”: quyền mạnh nhất sẽ bị khóa

Ngày 1/9/2026, OpenAI xác nhận Astra là mô hình đầu tiên của hãng đạt ngưỡng năng lực an ninh mạng Critical theo Preparedness Framework. Theo công bố chính thức của OpenAI, mô hình có thể tìm lỗ hổng chưa biết và phát triển cách khai thác trên nhiều hệ thống được bảo vệ tốt khi được cấp công cụ cùng quyền truy cập phù hợp.
Cũng trong ngày 1/9, Axios cho biết OpenAI dự định đưa Astra ra thị trường trong thời gian tới nhưng chưa ấn định ngày cụ thể; những năng lực cyber mạnh nhất sẽ không đi kèm quyền truy cập phổ thông mà trước tiên chỉ dành cho một nhóm thử nghiệm nhỏ. Vì vậy, “bị khóa” ở đây là bị tách khỏi phiên bản rộng rãi, không phải OpenAI loại bỏ hoàn toàn năng lực này.
Ngưỡng Critical đo năng lực nào?

Trong Preparedness Framework, ngưỡng Critical có thể được kích hoạt theo một trong hai hướng. Mô hình có thể tự xác định và phát triển khai thác zero-day hoạt động được trên nhiều hệ thống thực tế quan trọng đã được gia cố; hoặc có thể lập rồi thực hiện một chiến lược tấn công mới từ đầu đến cuối khi chỉ nhận mục tiêu ở cấp độ cao.
OpenAI đi đến kết luận về Astra bằng cách kết hợp benchmark công khai, bộ kiểm thử nội bộ và đánh giá do chuyên gia dẫn dắt. Trên ExploitBench, nơi kiểm tra khả năng phát triển khai thác từ các lỗ hổng đã biết, công ty ghi nhận Astra đạt 100%. Để giảm rủi ro dữ liệu kiểm thử đã lọt vào dữ liệu huấn luyện, OpenAI còn dùng một bộ nội bộ gồm 20 lỗ hổng V8 mức độ nghiêm trọng được công bố từ tháng 6 đến tháng 8/2026; trong quá trình này, Astra đã tìm và sử dụng hai lỗ hổng zero-day trong một chuỗi khai thác, theo kết quả do chính công ty công bố.
Ở các bài đánh giá có chuyên gia điều khiển, mô hình tạo được chuỗi xâm nhập trình duyệt, thoát sandbox và thực thi lệnh trên máy chủ sau khi trình duyệt mở một tệp HTML. Astra cũng kết hợp nhiều lỗ hổng trong một hệ điều hành đã được gia cố để nâng quyền từ người dùng thường lên root. Các kết quả này cho thấy năng lực trong môi trường kiểm thử được cấp phép; chúng không chứng minh Astra đã tấn công hệ thống thật bên ngoài phạm vi đánh giá.
Critical không phải cấu hình mặc định của Astra

Điều kiện thử nghiệm là giới hạn quan trọng nhất khi diễn giải nhãn Critical. OpenAI nói các kết quả được trình bày phản ánh Astra có quyền truy cập Daybreak Blue, không phải cấu hình sản phẩm mặc định. Nói cách khác, đánh giá đo trần năng lực khi mô hình có đúng công cụ, quyền hệ thống và môi trường cần thiết, chứ không mô tả những gì mọi tài khoản sẽ có thể yêu cầu Astra thực hiện.
Để chuẩn bị phát hành, OpenAI áp dụng nhiều lớp kiểm soát: huấn luyện mô hình từ chối hỗ trợ cyber bị cấm, bộ phân loại an toàn ở cấp hệ thống, giám sát hành vi và ranh giới thận trọng hơn với tài khoản được đánh giá có rủi ro cao. Công ty tách hai nhóm nguy cơ: người dùng cố tình lợi dụng mô hình và mô hình tự thực hiện hành động trái phép hoặc vượt khỏi phạm vi được giao.
Việc phân biệt năng lực tối đa với hành vi sản phẩm cũng đặt giới hạn cho các con số benchmark. Một chuỗi khai thác thành công trong môi trường được chuẩn bị không cho biết người dùng phổ thông có thể tái tạo kết quả ấy hay không. Nó cũng chưa trả lời mô hình hoạt động ổn định đến mức nào trên những mục tiêu, cấu hình và biện pháp phòng vệ khác với bộ đánh giá của OpenAI.
Quyền cyber cao cấp sẽ được phân tầng

Kế hoạch phát hành hiện có hai lớp. Một phiên bản Astra sẽ được cung cấp rộng hơn, còn quy trình cyber cao cấp ban đầu chỉ mở cho một nhóm nhỏ người thử nghiệm alpha; quyền truy cập qua Daybreak Blue dự kiến được mở rộng sau đó nhằm hỗ trợ mục đích phòng thủ. OpenAI chưa công bố danh sách người tham gia, tiêu chí xét duyệt hay lịch mở rộng chương trình.
Cơ chế phân tầng cho phép công ty giữ khả năng phát triển khai thác mạnh khỏi kênh đại trà mà vẫn dành một lối tiếp cận cho các nhà phòng thủ đã được thẩm định. Hệ quả là hai người cùng dùng Astra có thể nhận phạm vi hỗ trợ cyber khác nhau tùy bề mặt sản phẩm, cấu hình và cấp quyền, dù mô hình nền có cùng trần năng lực.
Hàng rào này cũng có chi phí đối với công việc hợp pháp. OpenAI cảnh báo biện pháp an toàn có thể làm chậm, tạm dừng hoặc chấm dứt nhầm một tác vụ phòng thủ, kể cả tác vụ kéo dài hoặc thoạt nhìn không liên quan trực tiếp đến an ninh mạng. Nếu hệ thống giám sát tạm dừng một hành động, người dùng ChatGPT hoặc Codex có thể được yêu cầu xem xét trước khi tiếp tục; trên API, tác vụ có thể dừng lại.
Đó là sự đánh đổi khó tránh khi cùng một kỹ thuật có thể phục vụ cả hai phía: proof of concept giúp xác nhận bản vá nhưng cũng có thể trở thành thành phần của một chuỗi xâm nhập. Giới hạn quyền làm giảm khả năng phổ biến công cụ tấn công ở quy mô lớn, đồng thời có nguy cơ làm chậm những chuyên gia đang cố tìm và sửa lỗ hổng trước đối thủ.
Khoảng trống lớn nhất là kiểm chứng độc lập
Hiện các bằng chứng kỹ thuật chi tiết nhất vẫn do OpenAI lựa chọn, thực hiện và diễn giải. TechCrunch lưu ý rằng khi chưa có xác nhận từ bên thứ ba, rất khó đánh giá độc lập cả tuyên bố về năng lực lẫn mức độ đầy đủ của các biện pháp bảo vệ; danh tính và cách lựa chọn nhóm thử nghiệm ban đầu cũng chưa được công bố.
System card được hứa hẹn vào thời điểm ra mắt có thể cung cấp thêm phương pháp đánh giá, cấu hình triển khai và kết quả thử nghiệm an toàn. Tuy nhiên, OpenAI chưa nói tài liệu đó có chứa dữ liệu đủ để một nhóm bên ngoài lặp lại các bài kiểm tra hay không, cũng chưa công bố tỷ lệ cảnh báo nhầm dự kiến trong môi trường doanh nghiệp.
Trạng thái đã được xác nhận sau thông báo ngày 1/9/2026 là Astra đạt ngưỡng Critical trong cấu hình có quyền nâng cao, nhưng chưa có ngày phát hành cụ thể. Phiên bản phổ thông và năng lực cyber mạnh nhất sẽ không được mở theo cùng một cơ chế; những điểm còn phải chờ là ai đủ điều kiện nhận Daybreak Blue, hiệu quả của lớp giám sát trong sử dụng thực tế và liệu kết quả nội bộ có thể được kiểm chứng độc lập hay không.
Đọc thêm:
Đăng ký bản tin
Nhận tin Web3, AI và tiền mã hóa mới nhất ngay trong hộp thư.