Trao quyền cho AI agent: thiếu “nút ngắt” có thể mở rộng vùng thiệt hại

Cấu hình an toàn cho AI agent phải coi agent là một workload có thể bị xâm phạm: chạy trong sandbox, dùng danh tính riêng và chỉ được truy cập đúng dữ liệu, mạng, công cụ cần thiết trong thời gian ngắn. Hành động có tác động lớn phải qua chính sách thực thi độc lập hoặc phê duyệt của con người.
Doanh nghiệp cũng cần một cơ chế dừng nằm ngoài quyền kiểm soát của agent, có thể thu hồi credential, chặn lưu lượng và ngừng tiến trình cùng công việc đang chờ. Nếu thiếu cơ chế này, quyền truy cập quá rộng có thể biến một lỗi suy luận, prompt injection hoặc credential bị chiếm dụng thành sự cố lan sang nhiều tài nguyên sản xuất.
Kiến trúc tham chiếu gồm bảy lớp kiểm soát

Bảy lớp dưới đây là cách ánh xạ các khuyến nghị chính thức thành kiến trúc triển khai, không phải bảy tính năng của một nền tảng cụ thể. Hướng dẫn thực hành của NCSC Anh khuyến nghị điều chỉnh biện pháp kiểm soát theo mức tự chủ, luôn chạy agent trong sandbox, hạn chế mạng, cấp danh tính riêng và credential có vòng đời ngắn nhất có thể, đồng thời duy trì khả năng dừng khẩn cấp.
- Phạm vi nhiệm vụ: xác định đầu vào hợp lệ, kết quả mong đợi, giới hạn tài nguyên, điều kiện dừng và các hành động bị cấm. Nhiệm vụ “xử lý sự cố” không mặc nhiên bao gồm quyền sửa cấu hình sản xuất.
- Sandbox thực thi: tách agent, nơi chạy lệnh và hạ tầng suy luận khi rủi ro yêu cầu. Không gắn mã nguồn, socket của container runtime hoặc credential máy chủ vào sandbox nếu nhiệm vụ không cần.
- Biên dữ liệu và mạng: chặn mặc định, sau đó chỉ mở endpoint, giao thức và phương thức API cần thiết. Phân biệt dữ liệu chỉ đọc, dữ liệu được ghi và dữ liệu không được đưa vào ngữ cảnh.
- Danh tính riêng: mỗi agent hoặc vai trò agent có một principal riêng; không dùng tài khoản nhân viên, phiên trình duyệt hay service account dùng chung.
- Quyền ngắn hạn: phát credential theo nhiệm vụ, giới hạn tài nguyên, thao tác và thời gian; thu hồi khi công việc hoàn tất hoặc ngữ cảnh thay đổi.
- Cổng chính sách: kiểm tra từng tool call ở lớp thực thi độc lập với mô hình; từ chối hoặc chuyển thao tác nhạy cảm tới người có thẩm quyền.
- Quan sát và dừng: ghi lại chuỗi hành động theo đúng danh tính, phát hiện lệch chuẩn và cung cấp đường dừng mà agent không thể vô hiệu hóa.
Ánh xạ quyền theo nhiệm vụ, không theo khả năng của công cụ
Không nên cấp toàn bộ quyền mà plugin hoặc API hỗ trợ. Với mỗi nhiệm vụ, policy phải xác định agent nào được gọi công cụ nào, trên tài nguyên nào, bằng thao tác gì và trong bao lâu; quyết định cấp quyền cần được kiểm tra lại khi yêu cầu thực sự chạy.
Hướng dẫn chung đăng trên Cyber.gov.au yêu cầu áp dụng đặc quyền tối thiểu, giới hạn quyền tới đúng tài nguyên, thao tác và thời hạn, thay secret tĩnh dài hạn bằng credential tạm thời, đồng thời coi mỗi agent là một principal riêng. Tài liệu cũng khuyến nghị điểm phê duyệt của con người cho hành động có tác động lớn hoặc khó đảo ngược.
Ví dụ giả định: agent phân loại ticket chỉ cần đọc nội dung và gắn nhãn. Quyền đọc hồ sơ khách hàng có thể được cấp tạm thời sau quyết định của policy; quyền hoàn tiền hoặc sửa tài khoản phải thuộc luồng khác, với danh tính và phê duyệt khác. Nếu agent tạo sub-agent, quyền được ủy quyền phải hẹp theo nhiệm vụ con thay vì sao chép toàn bộ quyền của agent cha.
Ghép mức tự chủ với hậu quả và mức phê duyệt

Mức giám sát nên tăng theo hậu quả, khả năng hoàn tác và độ nhạy cảm của dữ liệu, không chỉ theo độ phức tạp của nhiệm vụ. Một ma trận vận hành có thể chia quyền tự chủ như sau:
- Chỉ đề xuất: agent đọc dữ liệu đã lọc và tạo phương án; con người thực hiện thay đổi.
- Tự động trong sandbox: agent được ghi vào môi trường tạm, chạy thử hoặc tạo pull request nhưng không thể tự hợp nhất hay triển khai.
- Tự động có điều kiện: policy cho phép thao tác ít tác động trong phạm vi cố định; đổi đích, vượt ngưỡng hoặc gọi công cụ mới đều cần phê duyệt.
- Phê duyệt trước thao tác: xóa dữ liệu, thay đổi IAM, chuyển tiền, gửi dữ liệu ra ngoài hoặc triển khai sản xuất phải chờ người có đúng thẩm quyền.
- Tự chủ cao: chỉ phù hợp với nhiệm vụ ít rủi ro, có giới hạn tốc độ, chi phí, thời gian, phạm vi và khả năng hoàn tác.
Màn hình phê duyệt phải cho biết chính xác hành động, đích, dữ liệu sẽ được gửi và quyền tạm thời đang được yêu cầu. Một nút “đồng ý tiếp tục” không tạo ra kiểm soát có ý nghĩa nếu người duyệt không nhìn thấy hậu quả.
Log phải nối được danh tính với thay đổi cuối cùng
NCSC New Zealand xác nhận hướng dẫn chung được sáu cơ quan an ninh mạng thuộc năm quốc gia đồng biên soạn và bao quát rủi ro từ thành phần hệ thống, tích hợp, hành vi agent cùng các mối đe dọa mới nổi. Phạm vi đó cho thấy giám sát không thể chỉ dừng ở prompt và câu trả lời của mô hình.
Log vận hành nên nối được yêu cầu ban đầu, phiên agent, phiên bản policy, tool call, tham số đã lọc, danh tính gọi API, quyết định cho phép hoặc từ chối và thay đổi cuối cùng. Secret, dữ liệu cá nhân và nội dung nhạy cảm cần được che hoặc thay bằng mã tham chiếu thay vì sao chép nguyên văn.
Bản ghi nên được chuyển sang kho mà agent không có quyền sửa hoặc xóa. Cảnh báo tập trung vào tín hiệu có thể hành động: truy cập ngoài allowlist, yêu cầu nâng quyền, tăng bất thường số thao tác, tạo sub-agent ngoài kế hoạch, xác thực thất bại liên tiếp hoặc tiếp tục chạy sau khi nhiệm vụ hết hạn.
“Nút ngắt” là một chuỗi kiểm soát độc lập

Dừng riêng tiến trình agent chưa đủ nếu token vẫn còn hiệu lực, worker khác tiếp tục nhận việc hoặc lưu lượng vẫn đi qua gateway. Runbook khẩn cấp phải bao phủ danh tính, mạng, tiến trình, lịch chạy, hàng đợi và việc phát hành credential mới; kênh kích hoạt không được phụ thuộc vào orchestrator hay công cụ đang bị nghi ngờ.
Một cuộc diễn tập có kiểm soát nên kiểm tra toàn bộ chuỗi:
- Kích hoạt cảnh báo khi agent gọi đích ngoài allowlist hoặc vượt giới hạn hành động.
- Xác nhận cảnh báo tới đúng người trực và chỉ rõ agent, nhiệm vụ, credential cùng tài nguyên liên quan.
- Phát lệnh dừng từ kênh quản trị độc lập; kiểm tra cả tiến trình đang chạy lẫn công việc đã xếp hàng.
- Thu hồi credential và xác nhận yêu cầu tiếp theo bị gateway hoặc dịch vụ đích từ chối.
- Bảo toàn log, xác định thay đổi đã xảy ra và hoàn tác theo quy trình được phê duyệt.
- Chỉ khôi phục bằng credential mới sau khi nguyên nhân, policy và cấu hình sandbox đã được rà soát.
Điều kiện tối thiểu trước khi cấp quyền sản xuất
Trước khi kết nối agent với hệ thống thật, nhóm nền tảng và DevSecOps cần có bằng chứng cho từng lớp: sơ đồ biên tin cậy; danh sách dữ liệu và endpoint được phép; danh tính riêng; cơ chế phát và thu hồi credential; policy cho từng tool call; danh mục thao tác cần phê duyệt; log nằm ngoài quyền sửa của agent; cùng runbook dừng đã được diễn tập.
Nếu chưa thể chỉ rõ ai có quyền ngắt, thao tác nào bị chặn, credential nào sẽ bị thu hồi và yêu cầu đang chờ sẽ được xử lý ra sao, agent chưa sẵn sàng nhận quyền ghi vào sản xuất. Giữ hệ thống ở chế độ đề xuất hoặc giảm mức tự chủ là giới hạn phù hợp cho tới khi các khoảng trống này được đóng.
Đăng ký bản tin
Nhận tin Web3, AI và tiền mã hóa mới nhất ngay trong hộp thư.