
Dán tài liệu mật vào AI: tắt huấn luyện vẫn chưa đủ an toàn

Chỉ nên nhập dữ liệu công ty vào ChatGPT khi nội dung đã được phân loại, tác vụ cần đến dữ liệu đó và doanh nghiệp cho phép dùng đúng công cụ, tài khoản. Không dán nguyên hồ sơ nhân sự, danh sách khách hàng hoặc hợp đồng mật chỉ vì đã tắt việc dùng nội dung để huấn luyện mô hình: cài đặt ấy không quyết định dữ liệu được lưu bao lâu, ai có quyền xem hoặc người dùng sẽ chia sẻ kết quả cho ai.
Hướng dẫn an toàn của Microsoft khuyên nhân viên chỉ dùng dịch vụ AI được tổ chức phê duyệt, tránh tiết lộ thông tin mật của doanh nghiệp và dữ liệu cá nhân của nhân viên hoặc nhà cung cấp. Quyền đưa tài liệu vào một dịch vụ cần được xác định trước khi viết prompt, kể cả khi tài liệu nằm sẵn trên máy của người dùng.
Không huấn luyện, lưu giữ và quyền truy cập là những việc khác nhau
Huấn luyện liên quan đến việc nhà cung cấp dùng đầu vào hoặc đầu ra để cải thiện mô hình. Một cuộc trò chuyện vẫn có thể được lưu để cung cấp dịch vụ dù nội dung của nó không được dùng cho mục đích này. Ngược lại, xóa cuộc trò chuyện khỏi lịch sử hiển thị cũng không phải là cách xác định toàn bộ thời hạn lưu giữ dữ liệu; thời hạn thực tế phụ thuộc sản phẩm và cấu hình áp dụng.
Lưu giữ trả lời câu hỏi nội dung còn tồn tại trong môi trường xử lý bao lâu. Quyền truy cập xác định người và tính năng nào được phép dùng dữ liệu đó, chẳng hạn thành viên của một không gian làm việc hoặc ứng dụng được kết nối. Chia sẻ còn phụ thuộc hành động của người dùng: họ có thể chuyển tiếp câu trả lời chứa tên khách hàng, sao chép một đoạn vào email hoặc đưa tài liệu sang công cụ khác. Mỗi khâu cần một cách kiểm soát riêng; cài đặt huấn luyện chỉ xử lý một khâu.
Nhãn nhạy cảm trên tài liệu giúp người dùng nhận ra giới hạn sử dụng trước khi sao chép nội dung. Phân quyền giúp giới hạn người được tiếp cận; quy trình rà soát đầu ra giúp chặn thông tin mật xuất hiện trong bản tóm tắt hoặc bản nháp sắp gửi đi. Các biện pháp này hữu ích ngay cả trong một môi trường AI mà nhà cung cấp cam kết không dùng dữ liệu để huấn luyện.
Phân loại tài liệu trước khi chọn prompt
Hãy xét thông tin nhạy cảm nhất trong phần định gửi, gồm cả tệp đính kèm và nội dung chép từ email. Bản giới thiệu sản phẩm đã công bố có thể dùng ở mức công khai, nhưng cùng bản đó khi kèm giá chào riêng và thông tin liên hệ khách hàng phải được xử lý theo mức cao hơn. Sơ đồ bốn mức dưới đây là quy tắc ra quyết định cho công việc; nếu doanh nghiệp đã có hệ thống phân loại, hãy dùng nhãn và quy định của doanh nghiệp.
- Công khai: thông cáo, hướng dẫn hoặc mô tả sản phẩm đã được doanh nghiệp chủ động công bố. Có thể dùng để dịch, tóm tắt hay sửa câu chữ bằng công cụ được cho phép. Kiểm tra bản định gửi để chắc rằng ghi chú nội bộ, thông tin cá nhân hoặc lịch công bố chưa xuất hiện trong đó.
- Nội bộ thông thường: quy trình làm việc hay ghi chú vận hành chưa công khai, nhưng không chứa bí mật trọng yếu. Chỉ nhập đoạn cần thiết vào môi trường đã được phê duyệt cho mức này. Nếu chưa rõ công cụ nào được phép dùng, hỏi người phụ trách dữ liệu hoặc bảo mật trước khi chọn tài khoản cá nhân.
- Mật hoặc có dữ liệu cá nhân: hợp đồng đang đàm phán, danh sách khách hàng, đánh giá nhân sự và hồ sơ tuyển dụng là những ví dụ cần xem xét kỹ. Không đưa nguyên tệp vào prompt thông thường. Tác vụ cần có mục đích rõ, người có thẩm quyền chấp thuận, phạm vi truy cập phù hợp và dữ liệu được giảm đến mức cần thiết; đôi khi một đoạn đã loại bỏ chi tiết nhận dạng là đủ.
- Tối mật hoặc dùng để truy cập hệ thống: mật khẩu, khóa API, mã khôi phục và tài liệu bị hạn chế theo nghĩa vụ hợp đồng không nên được đưa vào chatbot bên ngoài theo thói quen, kể cả qua gói doanh nghiệp. Nếu công việc đòi hỏi xử lý chúng, bộ phận bảo mật phải xác định công cụ và biện pháp kiểm soát riêng.
Khi một tệp trộn nhiều mức, hãy tách phần được phép dùng thay vì hạ mức cho cả tệp. Ví dụ giả định: để nhờ AI sửa cách diễn đạt của một email chăm sóc khách hàng, người dùng có thể giữ lại yêu cầu về giọng văn và thay nội dung đơn hàng, tên, số điện thoại bằng tình huống giả định. Cách đó vẫn phục vụ tác vụ viết mà không cần đưa hồ sơ thật vào prompt.
Tài khoản cá nhân hay môi trường doanh nghiệp?
Tài khoản cá nhân phù hợp nhất với nội dung công khai hoặc ví dụ giả định, nếu chính sách nơi làm việc cho phép. Việc một nhân viên tự tắt huấn luyện không trao cho doanh nghiệp quyền quản lý tài khoản ấy, đặt quy tắc truy cập chung hay quyết định công cụ kết nối nào được dùng. Một gói trả phí do cá nhân tự mua cũng không đồng nghĩa với môi trường đã được doanh nghiệp phê duyệt.
Chính sách dữ liệu doanh nghiệp của OpenAI nêu rằng đầu vào và đầu ra của ChatGPT Business, Enterprise, Edu và nền tảng API mặc định không được dùng để huấn luyện hoặc cải thiện mô hình; tổ chức đủ điều kiện có thể cấu hình thời gian lưu giữ, gồm lựa chọn không lưu giữ dữ liệu trên nền tảng API, còn quyền truy cập được quản lý qua các tính năng dành cho từng sản phẩm. Những khả năng này phụ thuộc gói và cấu hình, nên cần kiểm tra không gian làm việc thực tế thay vì suy từ tên nhà cung cấp.
Với dữ liệu nội bộ, lựa chọn đúng là môi trường được tổ chức cho phép xử lý loại dữ liệu và tác vụ cụ thể. Người phụ trách cần xác định ai được cấp tài khoản, quyền của ứng dụng kết nối, cách chia sẻ cuộc trò chuyện và thời hạn lưu giữ áp dụng. Nếu môi trường hiện có không đáp ứng yêu cầu của tài liệu, hãy dùng luồng nội bộ đã được thiết kế cho việc đó hoặc chuyển yêu cầu cho đội kỹ thuật và bảo mật.
Dữ liệu cá nhân ở Việt Nam cần được xét theo mục đích xử lý
Luật Bảo vệ dữ liệu cá nhân số 91/2025/QH15 có hiệu lực từ ngày 1/1/2026 và đặt nguyên tắc chỉ thu thập, xử lý dữ liệu cá nhân trong phạm vi, mục đích cụ thể, rõ ràng. Vì vậy, trước khi đưa hồ sơ khách hàng hoặc nhân viên vào AI, doanh nghiệp cần xác định mục đích, phạm vi dữ liệu cần dùng và căn cứ xử lý theo quy trình pháp lý của mình. Cài đặt của nhà cung cấp không tự giải quyết các nghĩa vụ đó.
Đổi tên một người thành ký hiệu chưa chắc đã loại bỏ khả năng nhận dạng nếu prompt vẫn giữ chức danh hiếm, địa điểm, thời điểm và hoàn cảnh cụ thể. Khi chỉ cần gợi ý cấu trúc thư, biểu mẫu hoặc cách diễn đạt, một tình huống giả định không gắn với người thật thường đủ dùng. Nếu tác vụ cần dữ liệu cá nhân thật, hãy chuyển nó qua quy trình đã được phê duyệt cho loại dữ liệu ấy.
Quy trình trước khi gửi và sau khi nhận kết quả
- Xác định AI cần làm gì: dịch một đoạn, tóm tắt một mục hay soạn bản nháp. Chọn đúng phần dữ liệu phục vụ việc đó thay vì tải cả thư mục hoặc toàn bộ hồ sơ.
- Gán mức nhạy cảm cho mọi phần sẽ nhập, kể cả ảnh chụp màn hình, tệp đính kèm và văn bản sao chép. Nếu phần cần dùng thuộc mức mật hoặc tối mật mà chưa có luồng xử lý được duyệt, dừng tại đây.
- Kiểm tra tài khoản và không gian làm việc đang mở, các ứng dụng kết nối, quyền chia sẻ và chính sách lưu giữ của tác vụ. Xác nhận chúng phù hợp với nhãn dữ liệu đã gán.
- Giảm nội dung trong prompt: bỏ thông tin liên hệ, mã định danh và chi tiết không cần thiết. Đọc lại phần định gửi để phát hiện dữ liệu nằm trong tên tệp, chú thích hoặc đoạn trích tưởng như vô hại.
Sau khi có câu trả lời, rà soát cả độ chính xác lẫn thông tin có thể bị lặp lại từ đầu vào. Một bản tóm tắt dùng nội bộ có thể trở thành bản gửi đối tác chỉ sau thao tác chuyển tiếp, nên quyền phát hành đầu ra cần được xét riêng. Nếu đã nhập nhầm dữ liệu, hãy báo theo quy trình sự cố của tổ chức để người phụ trách đánh giá phạm vi ảnh hưởng và cách xử lý.
Đọc thêm:
Bài viết liên quan


Nasuni mua DryvIQ: dữ liệu chưa phân loại trở thành nút thắt AI

CV PDF hay DOCX: hãy để hệ thống tuyển dụng quyết định định dạng

Notion hay Obsidian cho công việc: cộng tác nhanh đổi lấy quyền giữ dữ liệu

ChatGPT nâng điểm, huấn luyện tư duy mới tăng độ đa dạng ý tưởng

OpenAI công bố 6 sự cố lệch hướng, mô hình từng tự che giấu sai phạm
Đăng ký bản tin
Nhận tin Web3, AI và tiền mã hóa mới nhất ngay trong hộp thư.