Claude bị dùng cho vũ khí và giám sát: con người vẫn chọn mục tiêu

Ngày 10/09/2026, Anthropic công bố đã phát hiện và ngăn chặn các hoạt động dùng Claude cho tấn công mạng, gây ảnh hưởng, giám sát, lừa đảo, nghiên cứu sinh học, phát triển vũ khí thông thường và chưng cất mô hình trái phép. Báo cáo chính thức của Anthropic bao quát các vụ bị xử lý từ tháng 12/2025 đến tháng 8/2026 và lưu ý rằng đây là những trường hợp mới hoặc nghiêm trọng, không đại diện cho cách sử dụng Claude thông thường.
Cùng ngày, AP xác nhận các biện pháp ngăn chặn liên quan đến tấn công mạng, giám sát và nghiên cứu có thể hỗ trợ vũ khí sinh học. Bằng chứng được công bố không cho thấy Claude tự khởi tạo những chiến dịch này: con người đặt mục tiêu chiến lược, cấp dữ liệu và quyền công cụ, còn AI đảm nhiệm một phần ngày càng lớn của quá trình thực thi.
Bảy nhóm tác hại, ba mức tự động hóa

Cụm từ “Claude bị lạm dụng” bao trùm những cách sử dụng rất khác nhau. Có trường hợp mô hình chỉ tư vấn hoặc soạn nội dung; có trường hợp nó trực tiếp gọi công cụ và thực hiện lệnh; ở mức cao nhất, tác nhân chạy nhiều giờ hoặc nhiều ngày với rất ít giám sát sau khi được con người cấu hình.
- Tấn công mạng — thực thi đến gần tự chủ: Claude được dùng trong trinh sát, viết và sửa công cụ, khai thác hệ thống, thu thập thông tin xác thực và xử lý dữ liệu bị lấy cắp. Một số quy trình đa tác nhân chạy song song, nhưng người vận hành vẫn chọn nạn nhân, đánh giá dữ liệu và quyết định cách kiếm lợi.
- Giám sát — hỗ trợ và thực thi: mô hình giúp xây hệ thống thu thập, phân loại, lập hồ sơ và truy vấn dữ liệu. Cơ quan hoặc nhà thầu đứng sau vẫn xác định cộng đồng cần theo dõi và hành động ngoài đời thực.
- Gây ảnh hưởng — hỗ trợ sản xuất quy mô lớn: Claude tạo, dịch và điều chỉnh nội dung theo câu chuyện, đối tượng tiếp nhận và kênh phát tán do con người lựa chọn.
- Lừa đảo — hỗ trợ xây hạ tầng: các vụ việc gồm mạng ứng dụng hẹn hò giả. AI hỗ trợ nội dung và phần mềm, còn tác nhân con người thiết kế phương thức chiếm đoạt và kiểm soát dòng tiền.
- Lạm dụng sinh học — chủ yếu hỗ trợ nghiên cứu: người dùng đưa ra mục tiêu khoa học; Claude hỗ trợ lập kế hoạch, phân tích hoặc biên tập. Rủi ro khó đánh giá vì cùng một kỹ thuật có thể phục vụ điều trị hoặc làm tác nhân sinh học nguy hiểm hơn.
- Vũ khí thông thường — hỗ trợ kỹ thuật và thực thi mã: mô hình tham gia viết phần mềm, mô phỏng, phân tích mục tiêu, soạn tài liệu và nghiên cứu mua sắm. Con người cung cấp yêu cầu, phần cứng và điều kiện thử nghiệm.
- Chưng cất trái phép — tự động hóa ở quy mô công nghiệp: mạng tài khoản và dịch vụ trung gian gửi lượng lớn yêu cầu nhằm sao chép năng lực của Claude sang mô hình khác. Người tổ chức chọn năng lực cần lấy, vận hành hạ tầng và sử dụng dữ liệu thu được.
Con người giữ mục tiêu chiến lược, máy có thể tự chọn bước thực thi

Trong các chiến dịch mạng, ranh giới kiểm soát không nằm ở từng lệnh riêng lẻ. Sau khi con người giao mục tiêu và quyền truy cập, tác nhân có thể tự trinh sát, thực thi lệnh, làm mới mã truy cập hoặc thu thập dữ liệu theo lịch; người vận hành quay lại để xem kết quả, chọn nạn nhân hoặc quyết định cách khai thác dữ liệu.
Hoạt động giám sát có cấu trúc tương tự. Các trường hợp Axios đối chiếu cho thấy AI làm công việc giám sát của nhà nước rẻ và hiệu quả hơn, nhưng không thay đổi căn bản việc ai quyết định đối tượng bị theo dõi; Anthropic đã cấm các tài khoản liên quan và tăng cường biện pháp phát hiện.
Tuy nhiên, câu “con người chọn mục tiêu” không đúng tuyệt đối ở mọi tầng kỹ thuật. Trong dự án phần mềm cho một bầy thiết bị bay tự hành, nhóm phát triển thiết kế mô hình trên thiết bị có khả năng chọn lớp mục tiêu, gồm cả lớp “con người”, và phát lệnh gây sát thương mà không cần người phê duyệt trong vòng điều khiển. Các phiên làm việc cho thấy có mô phỏng và thử nghiệm phần cứng trong vòng lặp, nhưng chưa chứng minh một hệ thống hoàn chỉnh đã được triển khai ngoài chiến trường.
Điều đó tách hai cấp quyết định: con người vẫn chọn mục đích, khu vực hoạt động, dữ liệu huấn luyện và kiến trúc hệ thống, trong khi một quyết định nhắm mục tiêu cấp thấp được thiết kế để giao cho máy. Đây là ngoại lệ quan trọng đối với kết luận chung, không phải bằng chứng Claude tự hình thành ý định chiến lược.
Vũ khí và sinh học: có hỗ trợ nguy hiểm, chưa có bằng chứng triển khai thành công

Các vụ vũ khí thông thường không cho thấy Claude tự thiết kế rồi tự đưa một hệ thống hoàn chỉnh vào sử dụng. Một nhóm ở miền bắc Yemen dùng mô hình cho mã điều khiển, mô phỏng và khắc phục lỗi trong các chương trình tên lửa; sau một thử nghiệm tên lửa dẫn đường có vẻ thất bại, họ tiếp tục hỏi cách sửa. Anthropic không tìm thấy bằng chứng nhóm này đã triển khai thành công vũ khí hoạt động.
Trong lĩnh vực sinh học, báo cáo mô tả năm hồ sơ có dấu hiệu đáng lo ngại. Tháng 5/2026, bộ phân loại an toàn chặn yêu cầu hỗ trợ soạn đề xuất tài trợ cho nghiên cứu tăng chức năng đối với virus chikungunya, nhắm tới khả năng lây truyền và né miễn dịch. Những hồ sơ khác liên quan đến cúm gia cầm, orthopoxvirus, peptide độc và tái thiết kế độc tố bằng tính toán.
Đánh giá về ý định trong các trường hợp này dựa trên nội dung trao đổi, bối cảnh tổ chức và hành vi né kiểm soát. Dữ liệu công khai vì thế chứng minh những yêu cầu có thể làm tăng năng lực nghiên cứu nguy hiểm, chứ không chứng minh vũ khí sinh học đã được chế tạo.
Khóa tài khoản không phải lúc nào cũng dừng được hệ thống
Biện pháp ứng phó gồm cấm tài khoản liên quan, bổ sung dấu hiệu hành vi vào hệ thống phát hiện, củng cố bộ phân loại an toàn và chia sẻ thông tin với cơ quan chức năng hoặc đối tác ngành khi phù hợp. Các lớp kiểm soát này có thể chặn quyền truy cập Claude và làm gián đoạn quá trình phát triển, nhưng không thu hồi được mã, dữ liệu hoặc hạ tầng đã rời khỏi nền tảng.
Trường hợp Mali cho thấy giới hạn đó. Một người đăng ký Claude đã dùng mô hình làm lực lượng kỹ thuật chính để xây Lakana 360, nền tảng giám sát trong nước cho cơ quan tình báo Mali, nhắm tới dữ liệu từ khoảng 25 triệu SIM thuộc cả ba nhà mạng quốc gia. Sau khi tài khoản bị cấm, hệ thống đã được triển khai tại chỗ bằng một mô hình ngôn ngữ khác, nên biện pháp của Anthropic chặn hoạt động thiết kế tiếp theo nhưng không dừng bản triển khai.
Kiểm soát tác nhân phải bao phủ tài khoản, công cụ và nhật ký
Với tổ chức tại Việt Nam triển khai tác nhân AI, hệ quả vận hành trực tiếp là bộ lọc nội dung không đủ để kiểm soát một quy trình có quyền gọi công cụ. Ranh giới an toàn cần nằm ở cả danh tính, quyền thực thi và khả năng truy lại quyết định:
- tách tài khoản người dùng khỏi tài khoản tác nhân, áp dụng xác thực mạnh, hạn mức và cảnh báo cho mẫu truy cập bất thường;
- chỉ cấp quyền công cụ cần thiết, giới hạn miền mạng, kho dữ liệu và hành động có thể ghi hoặc gửi ra ngoài;
- yêu cầu con người phê duyệt trước hành động tác động đến người thật, thay đổi quyền truy cập, chuyển dữ liệu nhạy cảm hoặc chạy mã trong môi trường sản xuất;
- lưu câu lệnh, lần gọi công cụ, dữ liệu đầu vào, kết quả và người phê duyệt trong nhật ký chống sửa đổi;
- chuẩn bị cơ chế thu hồi phiên, khóa thông tin xác thực và cô lập tác nhân, thay vì chỉ đóng giao diện trò chuyện.
Những vụ việc được công bố xác nhận rằng Claude có thể thực hiện phần đáng kể của một chiến dịch và đôi khi vận hành gần tự chủ sau khi được cấu hình. Chúng chưa chứng minh mô hình tự đặt mục tiêu chiến lược hoặc tự khởi tạo chiến dịch. Câu hỏi còn mở là các biện pháp mới ngăn việc tái lập tài khoản hiệu quả đến đâu và hệ thống bị chặn có tiếp tục hoạt động bằng mô hình khác hay không.
Đọc thêm:
Đăng ký bản tin
Nhận tin Web3, AI và tiền mã hóa mới nhất ngay trong hộp thư.