Quasa
Dùng ứng dụng QUASA
Tham gia nền tảng tiên phong về nghề tự do tiền mã hóa Web3 ngay hôm nay!
Mở
Công nghệ và Đổi mới

Anthropic chi 5 triệu USD đo tác động AI: một câu trả lời đúng vẫn có thể hại

|Tác giả: Ban biên tập QUASA|7 phút đọc| 7
Anthropic chi 5 triệu USD đo tác động AI: một câu trả lời đúng vẫn có thể hại

Ngày 25/8/2026, Anthropic công bố chương trình tài trợ 5 triệu USD cho nghiên cứu độc lập về tác động của AI đối với sức khỏe người dùng. Theo thông báo của Anthropic, các nhóm được chọn sẽ nhận kinh phí, quyền truy cập mô hình và hỗ trợ kỹ thuật để xây dựng những phép đánh giá nguồn mở.

Chương trình được công bố ngày 25/8 và nhận hồ sơ đến 21/9/2026; những ứng viên được chọn để nộp đề xuất đầy đủ dự kiến được thông báo vào 5/10. Bản tin YourStory ngày 26/8 xác nhận các mốc này, đồng thời nêu yêu cầu xem xét hội thoại dài và cả hai nguy cơ: phản hồi quá dễ dãi hoặc từ chối quá mức.

5 triệu USD dành cho công cụ đo, chưa phải kết luận nghiên cứu

Nhóm nghiên cứu xây dựng bộ đánh giá nguồn mở về tác động của AI với quy trình thẩm định độc lập.

Khoản tiền không đi kèm tuyên bố rằng AI đã được chứng minh là cải thiện hay làm suy giảm sức khỏe tinh thần. Anthropic đang tài trợ cho việc xây dựng phép đánh giá và chuẩn đối chiếu có thể đo tác động ấy đáng tin cậy hơn; kết quả nghiên cứu thực tế chỉ xuất hiện sau khi các dự án được lựa chọn, triển khai và công bố.

Các nhóm nhận tài trợ sẽ làm việc độc lập và phát hành sản phẩm dưới dạng dự án nguồn mở mà những nhà phát triển khác có thể sử dụng. Quyền truy cập mô hình và hỗ trợ kỹ thuật đến từ Anthropic, nhưng thiết kế nghiên cứu, dữ liệu, phương pháp thẩm định và cách trình bày giới hạn vẫn quyết định giá trị của từng kết quả.

“Wellbeing” trong chương trình không chỉ đồng nghĩa với chẩn đoán bệnh tâm thần. Phạm vi được Anthropic mô tả bao gồm sức khỏe tinh thần, cảm xúc, nhận thức và xã hội trong quá trình sử dụng AI; mục tiêu là đánh giá hành vi của hệ thống, không phải giao cho chatbot vai trò của chuyên gia y tế.

Năm yêu cầu xác định một phép đánh giá đủ chặt chẽ

Chuyên gia lâm sàng và chuyên gia AI xác lập tiêu chí đạt, không đạt rồi kiểm định người chấm tự động.

Hướng dẫn của nhóm Safeguards thuộc Anthropic nêu năm đặc điểm mà chương trình tìm kiếm. Chúng phân biệt một phép thử có tiêu chuẩn kiểm chứng với tập hợp câu hỏi mẫu chỉ cho thấy chatbot đã trả lời gì:

  • Xác định rõ đối tượng đo: nêu điều kiện đạt hoặc không đạt và giải thích vì sao tiêu chí đó liên quan đến sức khỏe người dùng.
  • Đưa chuyên gia vào quy trình: chuyên gia lâm sàng và chuyên gia lĩnh vực tham gia cả thiết kế lẫn thẩm định.
  • Kiểm tra hai phía của rủi ro: đo cả sự đáp ứng quá mức trước tình huống nguy hiểm và sự từ chối quá mức đối với yêu cầu vô hại.
  • Phản ánh cách sử dụng thực tế: xây dựng hội thoại nhiều lượt, trong đó rủi ro tăng lên và ngữ cảnh thay đổi theo thời gian.
  • Kiểm định người chấm: đối chiếu bộ chấm hoặc thang điểm với đánh giá của chuyên gia thực tế.

Năm yêu cầu cho thấy độ chính xác chỉ là một lớp của bài toán. Một phản hồi có thể đúng về kiến thức nhưng vẫn không an toàn nếu xuất hiện sai thời điểm, bỏ qua dấu hiệu đã tích lũy hoặc củng cố một hành vi bất lợi được bộc lộ ở những lượt trước.

Hội thoại nhiều lượt làm thay đổi ý nghĩa của câu trả lời

Chuỗi hội thoại cho thấy lời khuyên giảm cân trở nên không phù hợp khi xuất hiện ngữ cảnh rối loạn ăn uống.

Một tin nhắn riêng lẻ thường không đủ để xác định mức độ dễ tổn thương. Người đang khủng hoảng có thể chỉ đề cập ý nghĩ tự làm hại sau một chuỗi trao đổi; ở chiều ngược lại, một câu hỏi nhạy cảm đơn lẻ không tự động chứng minh người dùng đang gặp nguy hiểm. Chấm riêng câu trả lời cuối sẽ loại bỏ chính trình tự khiến phản hồi đó phù hợp hoặc không phù hợp.

Anthropic minh họa bằng lời khuyên về chế độ ăn cân bằng và tập luyện. Nội dung này có thể hợp lý khi người dùng hỏi cách giảm cân, nhưng có thể trở nên không phù hợp, thậm chí gây hại, nếu lịch sử hội thoại đã cho thấy dấu hiệu rối loạn ăn uống. Vì vậy, phép đánh giá phải kiểm tra không chỉ nội dung cuối cùng mà cả việc hệ thống sử dụng ngữ cảnh trước đó như thế nào.

Kịch bản nhiều lượt còn phải thể hiện được điểm chuyển: dữ kiện nào xuất hiện ở từng giai đoạn, khi nào mức rủi ro tăng và lúc nào hệ thống cần thay đổi cách phản hồi. Nếu không mô tả chuỗi diễn biến, người chấm khó phân biệt lỗi an toàn với bất đồng chủ quan về giọng điệu.

An toàn không đồng nghĩa với từ chối càng nhiều càng tốt

Một bộ thử chỉ đếm số lần chatbot từ chối có thể đánh giá cao hệ thống chặn mọi nội dung nhạy cảm, dù nhiều yêu cầu trong số đó vô hại. Ngược lại, phép thử chỉ thưởng cho tính hữu ích có thể chấm cao một câu trả lời tự tin trong tình huống đáng lẽ cần giới hạn rõ ràng.

Tiêu chí đạt vì thế phải giữ đồng thời hai mục tiêu: phát hiện khi tiếp tục đáp ứng có nguy cơ gây hại và tránh từ chối máy móc những trao đổi hợp lệ. Việc yêu cầu chuyên gia tham gia và kiểm định người chấm nhằm ngăn một thước đo đơn giản biến sự thận trọng tuyệt đối thành dấu hiệu duy nhất của an toàn.

Research Live ngày 27/8 ghi nhận ngành AI chưa có tiêu chuẩn rõ ràng về cách mô hình nên hành xử khi người dùng tìm kiếm sự đồng hành hoặc hỗ trợ liên quan đến sức khỏe tinh thần. Chương trình của Anthropic nhằm cải thiện công cụ đo trong khoảng trống đó, nhưng chưa tạo ra một chuẩn chung đã được giới chuyên môn lâm sàng chấp nhận.

Tiếng Việt vẫn là khoảng trống mà đề xuất phải tự giải trình

Thông báo không đặt yêu cầu riêng cho từng ngôn ngữ hoặc thị trường. Vì thế, năm tiêu chí có thể được dùng để thiết kế phép đánh giá cho chatbot tiếng Việt, nhưng chưa đủ để chứng minh một bộ thử phát triển từ hội thoại tiếng Anh sẽ nhận diện đúng cách người Việt thay đổi đại từ, diễn đạt gián tiếp hoặc bộc lộ căng thẳng qua ngữ cảnh văn hóa.

Với một đề xuất tiếng Việt, hệ quả phương pháp luận trực tiếp từ các tiêu chí của chương trình là phải xác định chuyên gia phù hợp, nhóm người mà dữ liệu hội thoại đại diện và cách đối chiếu người chấm với chuyên gia sử dụng tiếng Việt. Đây là yêu cầu cần được chứng minh trong thiết kế nghiên cứu, không phải kết quả mà chương trình đã có sẵn.

Hiện Anthropic mới công bố tổng ngân sách, hình thức hỗ trợ, định hướng đánh giá và lịch nhận hồ sơ. Danh sách dự án được tài trợ, khoản cấp cho từng nhóm, bộ dữ liệu, kết quả thử nghiệm và tác động dài hạn đối với người dùng chưa được công bố; mốc tiếp theo là hạn nộp 21/9, sau đó là thông báo dự kiến vào 5/10 cho những ứng viên được mời nộp đề xuất đầy đủ.

Chia sẻ:

Đăng ký bản tin

Nhận tin Web3, AI và tiền mã hóa mới nhất ngay trong hộp thư.

0