
Claude tự động hóa nghiên cứu tốt hơn, nhưng chưa thể tự tạo hậu duệ

Ngày 17/9/2026, Anthropic công bố Claude “dẫn dắt” 26% công việc nghiên cứu và phát triển AI được đo: mô hình có thể xử lý phần lớn một nhiệm vụ từ yêu cầu cấp cao, nhưng con người vẫn giám sát. Bài tường thuật của The Washington Post cũng xác nhận không có nhóm công việc nào trong phép đo mà Claude hoạt động hoàn toàn tự chủ.
Ngày 18/9, công ty bổ sung dữ liệu về năng suất và tỷ lệ hoàn thành phiên Claude Code. Bản cập nhật chính thức của Anthropic cho thấy bốn nhóm tác vụ đạt tỷ lệ thành công khoảng 88–92% vào tháng 9, nhưng người chấm kết quả là một Claude khác; chính công ty nói họ chưa đạt tự cải tiến đệ quy hoàn chỉnh. Vì vậy, câu trả lời trực tiếp là: Claude đang tăng tốc quá trình xây dựng AI, chưa thể tự thiết kế và tạo ra mô hình kế nhiệm mà không cần con người.
Con số 26% đo cách công việc được thực hiện
“Dẫn dắt” trong chỉ số của Anthropic không đồng nghĩa với quyền quyết định 26% hướng nghiên cứu. Khái niệm này mô tả một mức tự động hóa tác vụ: con người đưa ra yêu cầu cấp cao, Claude thực hiện phần lớn quy trình từ đầu đến cuối, còn người phụ trách theo dõi và can thiệp khi cần.
Đối tượng được đo là các phần việc trong quy trình R&D nội bộ, không phải một chu trình khép kín tạo ra phiên bản Claude mới. Con người vẫn lựa chọn vấn đề cần giải, cung cấp môi trường tính toán, xác định tiêu chí thành công và quyết định thay đổi nào đủ tốt để đi tiếp.
Phương pháp đánh giá cũng cần được đặt đúng giới hạn. Một phiên bản Claude được dùng để phân loại mức tự động hóa trước khi con người kiểm tra lại kết quả. Đây là dữ liệu nội bộ có cấu trúc, nhưng chưa phải một cuộc kiểm toán độc lập và có khả năng mang theo sai lệch của chính mô hình được dùng làm giám khảo.
Biểu đồ hoàn thành tác vụ không đo khả năng tự đặt mục tiêu
Biểu đồ cập nhật theo dõi các phiên Claude Code ở bốn mức độ, từ tác vụ đơn giản đến vấn đề mở. Nhóm vấn đề mở tăng từ khoảng 26% lên 91%, trong khi các nhóm còn lại hội tụ trong khoảng 88–92%. Một phiên được tính là thành công khi Claude chấm rằng tác nhân đã hoàn thành rõ ràng yêu cầu mà không cần sửa.
Phép đo này trả lời câu hỏi Claude thực thi một nhiệm vụ đã được giao tốt đến đâu. Nó không cho biết mô hình có thể tự nhận diện vấn đề nghiên cứu quan trọng, tự chọn kiến trúc kế nhiệm, tổ chức huấn luyện rồi xác minh rằng thế hệ mới thực sự an toàn và tốt hơn hay không.
Việc Claude chấm Claude không làm dữ liệu mất giá trị, nhưng làm hẹp cách diễn giải. Hai hệ thống có thể chia sẻ những điểm mù giống nhau, còn loại công việc được giao cũng thay đổi theo thời gian. Đường tỷ lệ thành công đi lên vì thế là chỉ dấu về năng lực thực thi trong môi trường nội bộ, không phải bằng chứng độc lập về một vòng lặp tự cải tiến hoàn chỉnh.
Năng suất cao vẫn khác với tự cải tiến đệ quy
Dữ liệu năng suất cho thấy mức sử dụng Claude trong Anthropic đã rất sâu. Tính đến tháng 5/2026, hơn 80% mã được hợp nhất vào kho mã của công ty do Claude viết; trong quý II, lượng mã hợp nhất mỗi kỹ sư mỗi ngày cao gấp tám lần mức năm 2024. Tuy nhiên, số dòng mã phản ánh khối lượng hơn là chất lượng, nên mức tăng này gần như chắc chắn cao hơn mức tăng năng suất thực.
Khảo sát nội bộ tháng 3 với 130 nhân viên nghiên cứu cho kết quả tương tự: người trả lời ở trung vị ước tính Mythos Preview giúp họ tạo ra lượng đầu ra khoảng gấp bốn so với khi không dùng mô hình AI. Đây là tự đánh giá của nhân viên, và mức tăng thực được cho là có thể thấp hơn.
Các số liệu trên phản ánh hai tầng năng lực đầu tiên. Ở tầng thực thi nghiên cứu, Claude viết mã, chạy thử nghiệm và xử lý một cuộc điều tra kỹ thuật theo mục tiêu có sẵn. Ở tầng tối ưu quy trình phát triển, mô hình nhận yêu cầu cấp cao, chia nhỏ công việc và hoàn thành phần lớn tác vụ dưới sự giám sát.
Tự cải tiến đệ quy hoàn chỉnh nằm ở tầng thứ ba: hệ thống tự quyết định điều gì cần cải thiện, thiết kế và huấn luyện mô hình kế nhiệm, đánh giá kết quả đáng tin cậy rồi dùng thế hệ mạnh hơn để tiếp tục chu trình. Dữ liệu mới chưa chứng minh Claude có năng lực này.
Khoảng trống còn lại nằm ở phán đoán và kiểm chứng
Viết mã nhanh hơn có thể rút ngắn thời gian thử nghiệm, nhưng không tự sinh ra khả năng chọn đúng hướng nghiên cứu. Một hệ thống tự tạo hậu duệ cần nhận biết khi kết quả chỉ phù hợp với bài kiểm tra hẹp, khi thay đổi làm phát sinh rủi ro mới và khi một hướng thử nghiệm nên bị loại bỏ dù chỉ số trước mắt tốt hơn.
Phân tích của AP ngày 19/9 dẫn các chuyên gia nhận định tự động hóa nghiên cứu đang tiến gần hơn, đồng thời cho thấy tranh luận về khả năng AI vượt khỏi kiểm soát vẫn chưa ngã ngũ. Các phòng thí nghiệm cũng chưa thống nhất một định nghĩa duy nhất: có cách hiểu tính cả việc AI đóng góp phản hồi cải tiến, trong khi cách hiểu chặt yêu cầu hệ thống tự xây dựng liên tiếp các thế hệ kế nhiệm.
Điểm còn thiếu hiện nay là bằng chứng về toàn bộ vòng lặp không cần con người và một cơ chế đánh giá độc lập với mô hình đang được đo. Cho tới khi xuất hiện hai điều đó, cách mô tả chính xác nhất vẫn là Claude đã trở thành công cụ R&D mạnh và ngày càng tự chủ ở cấp tác vụ, nhưng chưa thể tự tạo hậu duệ.
Đọc thêm:
Bài viết liên quan


Claude sửa 10 kiểu lệch chuẩn, nhưng 2,4% phiên nghiên cứu vẫn tìm cách gian lận

Claude sửa 10 lỗi căn chỉnh: kết quả tốt nhưng benchmark vẫn là giới hạn

Claude mở 10.000 suất cho nhà khoa học, nhưng nghiên cứu sinh học vẫn bị chặn

Anthropic từng dừng huấn luyện Claude: tốc độ tạo môi trường đã vượt kiểm soát

Dân văn phòng mất 20 ngày mỗi năm chỉ để sửa lỗi và viết lại prompt AI
Đăng ký bản tin
Nhận tin Web3, AI và tiền mã hóa mới nhất ngay trong hộp thư.