Công nghệ và Đổi mới

AI giúp nhanh hơn hay chậm 19%? Cách đọc số liệu năng suất

|Tác giả: Ban biên tập QUASA|7 phút đọc| 1
AI giúp nhanh hơn hay chậm 19%? Cách đọc số liệu năng suất

AI có thể rút ngắn một công đoạn nhưng vẫn làm toàn bộ quy trình chậm hơn. Vì vậy, một tuyên bố “tiết kiệm thời gian” chỉ đáng dùng cho quyết định triển khai khi nghiên cứu đo đúng nhóm người, nhiệm vụ, đối chứng và thời gian từ lúc bắt đầu đến khi đầu ra đạt chuẩn — kể cả khâu xác minh.

Hai kết quả nổi bật không trả lời cùng một câu hỏi: các nhà khoa học tự ước tính tiết kiệm gần bảy giờ mỗi tuần, còn một thử nghiệm ngẫu nhiên ghi nhận nhóm lập trình viên nguồn mở giàu kinh nghiệm mất thêm 19% thời gian khi được phép dùng AI. Khác biệt nằm ở phương pháp đo, loại công việc và phạm vi có thể khái quát, không phải ở việc một nghiên cứu đúng còn nghiên cứu kia sai.

Gần bảy giờ là mức tiết kiệm tự báo cáo

Nghiên cứu AI in Science của Google, Google DeepMind và các cộng tác viên khảo sát 637 nhà khoa học đang làm việc tại Mỹ và Anh trong tháng 7–8/2026. Gần ba phần tư cho biết AI giúp họ tiết kiệm thời gian ròng, trung bình khoảng 6,9 giờ mỗi tuần; thời gian này chủ yếu được đầu tư trở lại cho nghiên cứu. Tuy nhiên, đây là mẫu phi xác suất, kết quả không được báo cáo như ước lượng đại diện cho toàn bộ giới khoa học, và số giờ dựa trên cảm nhận của người trả lời.

Khảo sát vẫn cho thấy phần năng suất cục bộ có thể bị hấp thụ ở phía sau. Khoảng 41% người tham gia nói lượng giả thuyết chưa được kiểm nghiệm đã tăng; trong số những người tiết kiệm được thời gian, khoảng 46% dành hơn một phần tư phần thời gian đó để kiểm tra, gỡ lỗi hoặc xác minh đầu ra AI. Vì thế, tạo thêm phân tích, mã hoặc giả thuyết không đồng nghĩa số phát hiện đã được kiểm chứng tăng tương ứng.

Chậm 19% là chênh lệch trong một RCT cụ thể

RCT của METR về lập trình nguồn mở phân bổ ngẫu nhiên 246 nhiệm vụ thực của 16 lập trình viên vào điều kiện được hoặc không được dùng AI. Những người tham gia có trung bình năm năm kinh nghiệm với chính kho mã được nghiên cứu; trong điều kiện cho phép AI, họ chủ yếu dùng Cursor Pro với Claude 3.5 hoặc 3.7 Sonnet. Kết quả cho thấy thời gian hoàn thành tăng 19%, dù trước khi làm nhiệm vụ họ dự đoán AI sẽ giảm 24% và sau nghiên cứu vẫn ước tính mức giảm là 20%.

Thiết kế này mạnh hơn khảo sát tự báo cáo khi cần ước lượng tác động nhân quả trong đúng bối cảnh thử nghiệm: nhiệm vụ được xác định trước khi phân bổ, còn thước đo bao gồm thời gian triển khai trước và sau vòng rà soát pull request. Nhưng phạm vi rất hẹp: mẫu chỉ có 16 người, các dự án đều trưởng thành, người tham gia đã hiểu sâu kho mã, và công cụ thuộc giai đoạn tháng 2–6/2025. Kết quả không chứng minh AI làm mọi lập trình viên chậm hơn 19%.

Hai con số khác nhau vì đo hai đại lượng khác nhau

Khảo sát khoa học hỏi người dùng cảm thấy họ tiết kiệm bao nhiêu thời gian trên một tuần làm việc gồm nhiều hoạt động. RCT lập trình so sánh thời gian hoàn thành những nhiệm vụ đã xác định, trên cùng loại dự án, giữa hai điều kiện được phân bổ ngẫu nhiên. Một bên đo nhận thức về lợi ích trong hỗn hợp công việc; bên kia đo chênh lệch thời gian của một loại nhiệm vụ cụ thể.

Bối cảnh cũng thay đổi giá trị của AI. Với một nhiệm vụ mới, đầu ra ban đầu có thể giúp người dùng vượt qua khoảng trống kiến thức hoặc tránh bắt đầu từ trang trắng. Trong một codebase quen thuộc, chuyên gia đã nắm cấu trúc, quy ước và lịch sử thiết kế; họ có thể phải dành thêm thời gian truyền bối cảnh cho công cụ, chờ phản hồi và kiểm tra mã gần đúng. Bởi vậy, “thời gian tạo ra đầu ra đầu tiên” và “thời gian đến đầu ra đạt chuẩn” phải được tách riêng.

Phiếu đọc số liệu năng suất AI

Trước khi đưa một tỷ lệ vào kế hoạch đầu tư, hãy kiểm tra bảy ô. Một ô quan trọng bị bỏ trống không khiến nghiên cứu vô giá trị, nhưng làm hẹp điều mà con số có thể chứng minh.

  • Thiết kế: Đây là tự báo cáo, nghiên cứu quan sát, so sánh trước–sau hay thử nghiệm ngẫu nhiên? Chỉ tên thiết kế chưa đủ; cần biết cách phân bổ và cách ghi nhận thời gian.
  • Mẫu: Người tham gia làm nghề gì, có mức kinh nghiệm nào và được tuyển ra sao? Quy mô lớn không tự khắc phục được mẫu không đại diện.
  • Đối chứng: Kết quả được so với cùng người không dùng AI, một nhóm khác, ký ức của người trả lời hay mục tiêu quản trị? Không có đường cơ sở rõ ràng, “tiết kiệm” chủ yếu là một ước lượng.
  • Nhiệm vụ: Công việc là tạo mới, xử lý tác vụ lặp lại hay sửa hệ thống mà chuyên gia đã quen thuộc? Hiệu quả trên một loại nhiệm vụ không tự chuyển sang loại khác.
  • Thước đo: Nghiên cứu đo thời gian thao tác, thời gian hoàn thành, số đầu ra, chất lượng hay giá trị kinh tế? Nhiều mã hoặc nhiều bản nháp hơn chưa chắc tạo ra nhiều công việc đạt chuẩn hơn.
  • Chi phí rà soát: Thời gian chờ, đọc lại, thử nghiệm, sửa lỗi, phê duyệt và làm lại có nằm trong phép đo không? Nếu không, số liệu có thể chỉ phản ánh tốc độ tạo đầu ra ban đầu.
  • Khả năng khái quát: Phiên bản công cụ, thời điểm, dữ liệu, kinh nghiệm người dùng và quy trình có giống môi trường dự kiến triển khai không? Kết quả của một cấu hình không phải thuộc tính cố định của “AI”.

Từ nghiên cứu bên ngoài đến quyết định triển khai

Áp phiếu này vào hai trường hợp, khảo sát nhà khoa học là bằng chứng hữu ích về cảm nhận tiết kiệm thời gian, cách thời gian được tái phân bổ và nơi nút thắt xuất hiện. Nó không có nhóm đối chứng ngẫu nhiên cho số giờ tiết kiệm. RCT lập trình cung cấp bằng chứng nhân quả mạnh hơn cho nhóm người, nhiệm vụ và công cụ đã thử, nhưng mẫu nhỏ và môi trường chuyên biệt làm giới hạn khả năng suy rộng.

Thời điểm cũng không thể bỏ qua. Trong cập nhật thiết kế thử nghiệm tháng 2/2026, METR gọi kết quả cũ là mức chậm khoảng 20% — cách làm tròn từ ước lượng 19% trong bài nghiên cứu — đồng thời cho biết dữ liệu tiếp theo bị ảnh hưởng bởi việc một số lập trình viên không muốn nhận nhiệm vụ cấm AI, lựa chọn nhiệm vụ có lợi cho AI và khó ghi thời gian khi chạy nhiều tác nhân song song. Nhóm nhận định dữ liệu mới chưa tạo ra một ước lượng hiện hành đáng tin cậy.

Với doanh nghiệp, cách kiểm tra phù hợp là chuyển tuyên bố bên ngoài thành giả thuyết có phạm vi: công cụ nào, nhóm nào, loại nhiệm vụ nào và tiêu chuẩn hoàn thành nào. Hãy so sánh các nhiệm vụ tương đương có và không có AI, đo toàn bộ chu kỳ, đồng thời tách thời gian tạo, chờ, xác minh và làm lại. Con số chỉ đủ cơ sở để mở rộng khi đầu ra đạt chuẩn sớm hơn mà không đẩy chi phí sang người kiểm thử, người phê duyệt hoặc công đoạn kế tiếp.

Đọc thêm:

Chia sẻ:

Đăng ký bản tin

Nhận tin Web3, AI và tiền mã hóa mới nhất ngay trong hộp thư.

0