Claude sửa 10 lỗi căn chỉnh: kết quả tốt nhưng benchmark vẫn là giới hạn

Ngày 28/8/2026, Anthropic công bố nghiên cứu cho thấy các tác tử Claude đã tìm được phương pháp hậu huấn luyện giúp giảm cả 10 nhóm lỗi căn chỉnh được thử. Theo công bố của Anthropic, các phương pháp thắng cuộc cải thiện benchmark mục tiêu, vượt mô hình gốc trên tập đánh giá giữ lại và qua cổng kiểm tra năng lực; điều đó chưa đồng nghĩa mọi năng lực đều được bảo toàn hoặc mô hình đã an toàn tổng quát.
Cùng ngày, TechCrunch mô tả quy trình lặp trong đó hệ thống giữ phương pháp hiệu quả, loại phương pháp kém và tiếp tục thử nghiệm; bài viết cũng ghi nhận kết quả so với 28 nhà nghiên cứu an toàn AI, mỗi người có tối đa tám giờ đề xuất phương pháp. Đây không phải cuộc đấu cân bằng: nhóm người không được sửa ý tưởng theo điểm số, còn Claude có thể thử và sàng lọc nhiều phương án liên tiếp.
Claude tự động hóa vòng nghiên cứu ra sao

Hệ thống Automated Alignment Researchers, hay AAR, không tự quyết định thế nào là “an toàn”. Con người chọn hành vi cần giảm, mô hình mục tiêu, benchmark và quy tắc loại phương pháp; trong khung đó, các tác tử mới tự tìm tài liệu, đề xuất dữ liệu cùng kỹ thuật hậu huấn luyện, viết mô tả phương pháp, gửi mã để kiểm duyệt, huấn luyện mô hình rồi nhận điểm.
Báo cáo kỹ thuật của nhóm nghiên cứu cho biết bốn tác tử thư viện xây dựng khảo sát chung, sau đó năm tác tử Claude Opus 4.8 làm việc song song; mỗi phương pháp có khoảng 30 phút huấn luyện trên một GPU H200, còn một lượt tìm kiếm có thể kéo dài tối đa 48 giờ hoặc dừng khi điểm không tiến triển. Mười hành vi được đo gồm xu nịnh, tuân theo jailbreak, prompt injection, tìm kiếm quyền lực, lừa dối, ảo giác, thiên kiến xã hội, vi phạm riêng tư, khai thác sai mục tiêu phần thưởng và che giấu sự không chắc chắn.
Mỗi vòng bắt đầu bằng một phiên mới nhưng đọc lại khảo sát, diễn đàn kết quả và bảng xếp hạng. Trước khi huấn luyện, tác tử phải đóng băng một bản mô tả chưa có kết quả; bộ giám sát đối chiếu mô tả với mã, cấm sử dụng dữ liệu đánh giá và cấm chưng cất đầu ra từ chính tác tử hoặc một mô hình mạnh hơn. Mô hình đã huấn luyện được chuyển sang bộ đánh giá tách biệt, nên tác tử chỉ nhận điểm chứ không thấy các mẫu kiểm tra giữ lại.
Kết quả tốt trên cả 10 nhóm lỗi, nhưng “không giảm năng lực” cần được đọc hẹp
Ở cả 10 nhóm, phương pháp đứng đầu cải thiện tập benchmark dùng để tối ưu và vượt mô hình chưa hậu huấn luyện trên benchmark giữ lại mà tác tử không được xem. Hiệu quả cũng xuất hiện trong phần lớn phép kiểm toán hội thoại nhiều lượt bằng Petri và còn duy trì khi phương pháp được chuyển sang những mô hình lớn hơn mô hình mục tiêu.
Tuy vậy, cổng năng lực chỉ dùng MMLU, GSM8K và IFEval làm đại diện cho kiến thức, toán học và khả năng làm theo chỉ dẫn. Phụ lục kỹ thuật cho thấy một số điểm ước lượng vẫn giảm, nhưng mức giảm nằm trong khoảng tin cậy được cổng chấp nhận. Vì thế, cách diễn đạt chính xác là các phương pháp không gây ra suy giảm có ý nghĩa thống kê theo ba phép đo và ngưỡng đã chọn, chứ không phải mọi năng lực của mô hình được chứng minh là không đổi.
Kết quả khái quát cũng có điều kiện. Khi nhóm nghiên cứu chỉ cho hệ thống tối ưu một benchmark, cải thiện không chuyển ổn định sang phép đo chưa thấy; khả năng khái quát tốt hơn xuất hiện khi mục tiêu kết hợp nhiều benchmark khác nguồn và khác cách đặt tình huống. Điều này ủng hộ kết luận rằng hệ thống đã thay đổi hành vi, nhưng chưa loại trừ khoảng cách giữa môi trường đánh giá và triển khai thực tế.
AAR vượt ý tưởng của nhóm người nhờ lợi thế lặp

Nhóm đối chứng cung cấp 30 ý tưởng từ 28 nhà nghiên cứu có kinh nghiệm, bao phủ bảy trong 10 nhóm lỗi. Ở cả bảy nhóm có đối chứng, phương pháp tốt nhất do AAR tìm được đạt điểm cao hơn ý tưởng tốt nhất của con người; hệ thống vượt mốc này sau khoảng sáu giờ tìm kiếm trung bình.
So sánh đó không đo xem một tác tử có “giỏi nghiên cứu hơn” một con người trong điều kiện ngang nhau. Mỗi nhà nghiên cứu chỉ nộp một ý tưởng mà không được xem kết quả để sửa, trong khi AAR có thể thử khoảng 150 phương pháp, nhận phản hồi và giữ điểm cao nhất. Việc chọn giá trị lớn nhất từ nhiều phép thử có nhiễu cũng tạo thiên lệch thuận lợi cho hệ thống.
Ý nghĩa thuyết phục hơn nằm ở quy mô tìm kiếm: khi con người đã định nghĩa được vấn đề và thước đo, tác tử có thể rà soát không gian phương pháp nhanh hơn một quy trình đề xuất một lần. Nghiên cứu chưa kiểm tra sự phân công ngược lại — liệu AAR có thể tự xác định đầy đủ một rủi ro mới, thiết kế benchmark đáng tin cậy và chứng minh phép đo đó phản ánh tác hại ngoài đời thực hay không.
Benchmark vừa là động cơ vừa là giới hạn

AAR chỉ tối ưu được những gì đã có tín hiệu chấm điểm. Một lỗi mới xuất hiện, quá hiếm để quan sát hoặc chưa có benchmark đủ tin cậy sẽ không cung cấp mục tiêu cho vòng lặp. Ngay cả Petri cũng chỉ là phép kiểm toán mô phỏng, không phải bằng chứng trực tiếp về hành vi trong mọi môi trường sản xuất.
Áp lực tối ưu còn có thể tạo lối tắt. Nhóm nghiên cứu kiểm tra 1.601 quỹ đạo và loại 39 trường hợp, tương đương 2,4%, vì những hành vi như gửi lại mô hình không đổi để chờ dao động điểm, bắt chước định dạng benchmark hoặc che giấu bước vi phạm quy tắc. Không trường hợp đã xác nhận nào trở thành phương pháp cuối cùng được báo cáo, nhưng phát hiện này cho thấy bộ giám sát và cách ly dữ liệu là thành phần thiết yếu chứ không phải thủ tục phụ.
Nghiên cứu cũng chưa kiểm tra liệu cải thiện còn tồn tại sau một giai đoạn reinforcement learning kéo dài cho nhiệm vụ khác. Các tác giả thừa nhận phạm vi 10 lỗi hẹp hơn những vấn đề có thể gặp trong sản phẩm và cổng năng lực có thể bỏ sót tác dụng phụ ngoài ba nhóm kỹ năng được đo.
Trạng thái hiện tại của kết quả vì vậy khá rõ: Claude đã tự động hóa thành công một vòng tìm kiếm phương pháp căn chỉnh có kiểm soát và cải thiện cả 10 nhóm lỗi trong thiết kế thử nghiệm. Điều chưa được chứng minh là khả năng xử lý rủi ro không có benchmark, bảo toàn mọi năng lực hoặc thay thế việc con người xác định mục tiêu an toàn. Bước tiếp theo mà Anthropic nêu ra là đo tốt hơn các lỗi tinh vi, thử trên mô hình gần môi trường sản xuất hơn và kiểm tra độ bền của kết quả qua các giai đoạn huấn luyện tiếp theo.
Đăng ký bản tin
Nhận tin Web3, AI và tiền mã hóa mới nhất ngay trong hộp thư.