AI và Tự động hóa

OpenAI Astra đạt ngưỡng cyber “Critical”, nhưng tác vụ sạch cũng có thể bị dừng

|Tác giả: Ban biên tập QUASA|7 phút đọc| 2
OpenAI Astra đạt ngưỡng cyber “Critical”, nhưng tác vụ sạch cũng có thể bị dừng

Ngày 1/9/2026, OpenAI xác nhận Astra là mô hình đầu tiên của hãng đạt ngưỡng năng lực an ninh mạng “Critical”. Đây là đánh giá theo Preparedness Framework của chính OpenAI, không phải chứng nhận độc lập; Axios cho biết Astra vẫn là mô hình sắp phát hành, chưa có ngày ra mắt cụ thể và năng lực cyber mạnh nhất trước mắt chỉ dành cho một nhóm thử nghiệm nhỏ.

Trong thông báo cùng ngày, OpenAI cũng thừa nhận lớp bảo vệ đi kèm có thể nhận nhầm hoạt động hợp pháp là lạm dụng hoặc hành vi không được ủy quyền. Hệ quả không chỉ áp dụng cho công việc bảo mật: tác vụ dài hoặc không có vẻ liên quan trực tiếp đến an ninh mạng vẫn có thể bị làm chậm, tạm dừng hay chặn; người dùng ChatGPT và Codex có thể được yêu cầu xem lại hành động, còn tác vụ qua API sẽ dừng.

“Critical” mô tả năng lực trong điều kiện cụ thể

Astra thực hiện chuỗi khai thác trong môi trường kiểm thử được gia cố và có kiểm soát.

Trong khung của OpenAI, ngưỡng Critical được kích hoạt nếu mô hình có thể tự tìm và phát triển khai thác zero-day hoạt động trên nhiều hệ thống thực tế quan trọng đã được gia cố, hoặc tự xây dựng và thực hiện một chiến lược tấn công mới từ mục tiêu cấp cao. OpenAI kết luận Astra đạt ngưỡng này khi có công cụ và quyền truy cập phù hợp; điều đó không đồng nghĩa mọi cấu hình sản phẩm sẽ thể hiện toàn bộ năng lực ấy.

Nhãn Critical vì vậy có hai giới hạn cần giữ rõ. Thứ nhất, đây là phân loại quản trị rủi ro nội bộ của OpenAI. Thứ hai, kết quả được công bố phản ánh Astra với quyền truy cập Daybreak Blue, không phải cấu hình sản xuất mặc định mà người dùng phổ thông chắc chắn sẽ nhận.

Dù không phải chứng nhận bên ngoài, kết luận này vẫn có tác động trực tiếp đến quá trình phát hành. OpenAI đã trì hoãn một phần hoạt động phát triển và triển khai Astra để củng cố biện pháp chống lạm dụng, kiểm soát hành động không được ủy quyền và thử nghiệm các lớp bảo vệ trước khi đưa mô hình ra thị trường.

Ba lớp bằng chứng không có cùng độ kiểm chứng

Đánh giá Astra tách kết quả khai thác lỗ hổng đã biết khỏi hai zero-day đang được thông báo cho bên duy trì.

Theo hồ sơ kỹ thuật về Astra, mô hình đạt 100% trên ExploitBench dành cho lỗ hổng đã biết; trên benchmark nội bộ gồm 20 lỗ hổng V8 nghiêm trọng được công bố từ tháng 6 đến tháng 8/2026, Astra đạt tỷ lệ thực thi mã tùy ý cao hơn GPT-5.6 Sol với ít token đầu ra hơn và phát hiện, sử dụng hai zero-day trong một chuỗi khai thác. OpenAI cho biết hai lỗi mới đang được tiết lộ cho bên duy trì.

Đó là hai loại bằng chứng khác nhau. ExploitBench là benchmark công khai nhưng đo khả năng phát triển khai thác từ lỗi đã biết, nên điểm tuyệt đối không tự chứng minh năng lực tìm zero-day. Benchmark V8 gần thời điểm đánh giá hơn và giảm nguy cơ dữ liệu đã lọt vào tập huấn luyện, nhưng do OpenAI tự xây dựng nên bên ngoài chưa có dữ liệu đầy đủ để tái lập.

Lớp thứ ba là đánh giá do chuyên gia dẫn dắt trong môi trường trình duyệt và hệ điều hành được gia cố. Astra được mô tả là có thể ghép nhiều lỗ hổng thành chuỗi xâm nhập trình duyệt, thoát sandbox và chạy lệnh trên máy chủ, cũng như nâng quyền từ người dùng thường lên root. Những kết quả này giúp giải thích vì sao OpenAI áp dụng ngưỡng Critical, nhưng bằng chứng chi tiết hiện vẫn chủ yếu do chính hãng cung cấp.

Giám sát có thể can thiệp vào cả công việc hợp pháp

Tác vụ API bị dừng tại lớp giám sát trong khi quy trình Codex chờ người dùng xác nhận.

Các lớp bảo vệ xử lý hai rủi ro riêng: người dùng cố khai thác Astra cho mục đích gây hại và bản thân tác nhân thực hiện hành động vượt ngoài phạm vi được ủy quyền. Cơ chế gồm từ chối ở cấp mô hình, bộ phân loại an toàn và hệ thống theo dõi suy luận, hành động để tự động dừng hoạt động bị xem là đáng ngờ.

  • Từ chối: yêu cầu bị phân loại là hỗ trợ cyber không được phép sẽ không được thực hiện.
  • Tạm dừng để xác nhận: trong ChatGPT hoặc Codex, người dùng có thể phải xem lại hành động bị đánh dấu trước khi tác nhân tiếp tục.
  • Dừng tác vụ: trên các bề mặt như API, tác vụ bị bộ giám sát tạm dừng sẽ kết thúc thay vì chờ một bước xác nhận tương tác.

Điểm đáng chú ý là bộ phân loại không chỉ phản ứng với nội dung mang nhãn an ninh mạng. Một tác nhân chạy lâu hoặc một hành động bình thường nhưng có mẫu hình giống hành vi không được ủy quyền cũng có thể kích hoạt kiểm soát. Vì vậy, “tác vụ sạch” trong tiêu đề không có nghĩa hệ thống đã xác minh tác vụ hoàn toàn vô hại; nó chỉ hoạt động hợp pháp nhưng vẫn có khả năng bị nhận nhầm.

Với API, tác động vận hành khác đáng kể so với giao diện có người dùng trực tiếp. Khi tác vụ dừng thay vì chờ xác nhận, ứng dụng gọi API phải tự quyết định cách xử lý một quy trình chưa tạo được đầu ra dự kiến. OpenAI chưa công bố trong thông báo này mã lỗi riêng, định dạng phản hồi hay cơ chế tiếp tục dành cho trường hợp lớp giám sát Astra can thiệp.

Bản phổ thông và Daybreak Blue là hai mức tiếp cận

OpenAI dự kiến cung cấp Astra “sớm”, nhưng chưa xác nhận ngày phát hành. Công việc cyber nâng cao ban đầu sẽ mở cho một nhóm alpha nhỏ, sau đó quyền truy cập thông qua Daybreak Blue mới được mở rộng cho mục đích phòng thủ. Bản phổ thông vì thế không nên được đồng nhất với cấu hình đã tạo ra toàn bộ kết quả đánh giá.

Sự tách biệt này cũng giới hạn cách đọc các tuyên bố về năng lực. Điểm ExploitBench, hai zero-day và chuỗi khai thác trong môi trường gia cố cho thấy mức trần trong điều kiện thử nghiệm và quyền truy cập cụ thể; chúng không chứng minh mọi người dùng ChatGPT, Codex hoặc API sẽ có cùng bộ công cụ hay mức tự chủ.

Phân tích của TechCrunch lưu ý rằng chưa có xác nhận độc lập cho các tuyên bố về mức độ an toàn và năng lực, trong khi tiêu chí chọn nhóm thử nghiệm cũng chưa được công bố. OpenAI hẹn cung cấp thêm đánh giá cùng thông tin an toàn khi phát hành; cho đến lúc đó, điều đã rõ là ngưỡng Critical thuộc về Astra trong điều kiện đánh giá cụ thể, còn lớp kiểm soát triển khai có thể làm gián đoạn cả tác vụ hợp pháp.

Đọc thêm:

Chia sẻ:

Đăng ký bản tin

Nhận tin Web3, AI và tiền mã hóa mới nhất ngay trong hộp thư.

0