ChatGPT nâng điểm bài làm, còn tư duy nhân quả tạo ý tưởng khác biệt

Ngày 27/8/2026, Đại học Bocconi và OpenAI công bố kết quả một thử nghiệm ngẫu nhiên cho thấy hai biện pháp hỗ trợ tạo ra hai hiệu ứng khác nhau trong cùng một bài marketing: ChatGPT giúp bài làm được chấm cao hơn và mạch lạc hơn, còn đào tạo tư duy nhân quả khiến các ý tưởng bớt giống nhau. Bản công bố của OpenAI cho biết nhóm nhận cả hai biện pháp giữ được những lợi ích chính của từng bên.
Thử nghiệm gồm 1.053 sinh viên năm nhất ngành kinh tế, tài chính và quản trị, được chia theo tiết học vào bốn điều kiện: dùng ChatGPT Edu với GPT-4o, học tư duy nhân quả, nhận cả hai hoặc không nhận biện pháp nào. Thông tin từ Đại học Bocconi nêu mức tăng ước tính khoảng 0,86 điểm nhờ quyền truy cập ChatGPT, so với điểm nền ước tính 2,09 trên thang năm điểm của nhóm đối chứng.
Ma trận bốn nhóm tách tác động của công cụ và cách tư duy

Tất cả sinh viên giải cùng một bài toán: đề xuất cách tăng mức độ nhận biết và sử dụng cửa hàng bán sản phẩm mang thương hiệu Bocconi trong nhóm cựu sinh viên. Thiết kế 2×2 cho phép nhóm nghiên cứu ước tính riêng tác động của quyền dùng ChatGPT, tác động của bài huấn luyện và kết quả khi hai yếu tố xuất hiện đồng thời.
- Nhóm đối chứng không được dùng ChatGPT và thực hiện một hoạt động thay thế cho huấn luyện tư duy.
- Nhóm AI được dùng ChatGPT Edu với GPT-4o nhưng không học bài tư duy nhân quả.
- Nhóm huấn luyện học cách nối nguyên nhân với kết quả, xác định cơ chế và điều kiện khiến một dự đoán thất bại nhưng không dùng ChatGPT.
- Nhóm kết hợp nhận cả quyền dùng công cụ lẫn bài huấn luyện.
Điểm cần lưu ý là đơn vị phân nhóm là các lớp học, không phải từng sinh viên được bốc thăm độc lập. Vì vậy, đây vẫn là thử nghiệm ngẫu nhiên có đối chứng, nhưng số đơn vị được phân bổ thực tế nhỏ hơn tổng số người tham gia.
Điểm số và độ khác biệt đến từ hai phép đo riêng

Điểm bài làm không phải điểm tư duy phản biện. Người chấm được đào tạo đánh giá các đề xuất bằng thang năm điểm, dựa trên mức độ đáp ứng hai mục tiêu marketing định sẵn: tăng nhận biết và tăng sử dụng cửa hàng. Theo thước đo này, quyền truy cập ChatGPT cải thiện kết quả; bài làm có nhiều ý tưởng hơn, logic rõ hơn và gần với các đề xuất tham chiếu của chuyên gia hơn.
Độ khác biệt của ý tưởng được xác định trong một quy trình phân tích văn bản riêng, không phải bằng điểm sáng tạo do người chấm trực tiếp trao. Quy trình này xem xét số lượng và mức độ đa dạng của ý tưởng, dấu hiệu lập luận nhân quả cùng độ tương đồng với ba bài của chuyên gia. Vì thế, “khác biệt” ở đây có nghĩa là khoảng cách ngữ nghĩa giữa các phương án trong tập bài nộp, không đồng nghĩa với việc chuyên gia xác nhận chúng mới, hữu ích hoặc khả thi.
Đào tạo tư duy nhân quả khiến sinh viên trình bày rõ hơn cơ chế giúp một đề xuất phát huy tác dụng, những giả định đứng sau giải pháp và điều kiện có thể làm dự đoán sai. Các phương án của họ cũng khác nhau hơn, nhưng thay đổi đó không chuyển thành điểm cao hơn trên thang đánh giá marketing tiêu chuẩn.
ChatGPT chủ yếu nâng số lượng ý tưởng, độ mạch lạc và chất lượng theo rubric, chứ không phải động lực chính của độ đa dạng. Ở nhóm kết hợp, điểm số và số lượng ý tưởng gần với nhóm chỉ dùng ChatGPT, còn độ đa dạng gần với nhóm chỉ được huấn luyện; bài làm đồng thời biểu hiện rõ hơn việc tìm cơ chế và xem xét khả năng giả thuyết bị bác bỏ.
Một bài trôi chảy có thể che khuất năng lực cần đánh giá

Kết quả cho thấy rubric quyết định loại năng lực nào được nhìn thấy. Nếu tiêu chí chủ yếu thưởng cho câu trả lời rõ ràng, đầy đủ và phù hợp với các mục tiêu quen thuộc, AI có thể giúp người mới nhanh chóng tạo ra sản phẩm giống bài của chuyên gia. Một phương án đi xa khỏi không gian đáp án thông thường lại có thể không được cộng điểm, dù nó thể hiện việc chất vấn cơ chế và giả định.
Với học phần cho phép AI, đánh giá lập luận và độ mới vì thế cần tách khỏi độ trôi chảy. Rubric có thể dành tiêu chí riêng cho chuỗi nguyên nhân–kết quả, bằng chứng hỗ trợ, giả định, điều kiện thất bại và sự khác biệt giữa các phương án, thay vì suy tất cả từ một điểm tổng.
Điều này không khiến cách chấm truyền thống trở nên vô dụng: nó vẫn đo được mức độ một sản phẩm cuối cùng đáp ứng yêu cầu xác định. Nhưng khi câu hỏi là ChatGPT có cải thiện tư duy phản biện hay không, quan sát bài nộp có hỗ trợ chưa cho biết sinh viên tự hiểu, ghi nhớ hoặc chuyển cách lập luận sang một vấn đề mới đến đâu.
Giới hạn chưa cho phép suy rộng sang toàn bộ giáo dục đại học
Một phân tích độc lập về bản nghiên cứu ghi nhận 13 lớp được phân vào bốn điều kiện, sinh viên hoàn thành một bài khoảng 180 từ trong khoảng 45 phút, và thử nghiệm không có bài kiểm tra trì hoãn hoặc nhiệm vụ không dùng AI sau đó. Công trình đang ở dạng bài nghiên cứu làm việc, chưa có bằng chứng về một lần lặp lại độc lập.
Phạm vi thực nghiệm cũng hẹp: một trường đại học, sinh viên năm nhất thuộc ba nhóm ngành gần nhau và một bài toán quảng bá sản phẩm của trường. Nhiệm vụ có mục tiêu marketing rõ ràng phù hợp với khả năng tạo câu trả lời có cấu trúc của mô hình ngôn ngữ; chưa thể giả định kết quả sẽ giữ nguyên trong toán học, lịch sử, thiết kế nghiên cứu hoặc bài luận đòi hỏi kiểm chứng nguồn.
Bằng chứng hiện có chỉ hỗ trợ kết luận rằng quyền truy cập ChatGPT cải thiện chất lượng được chấm của một bài làm có hỗ trợ, còn đào tạo tư duy nhân quả làm các ý tưởng trong cùng nhiệm vụ đa dạng hơn. Muốn kết luận về học tập lâu dài hay tư duy phản biện nói chung, cần thử nghiệm ở nhiều môn và cơ sở đào tạo hơn, có người đánh giá trực tiếp tính mới, đồng thời kiểm tra khả năng chuyển giao sau khi bỏ công cụ hỗ trợ.
Đọc thêm:
Đăng ký bản tin
Nhận tin Web3, AI và tiền mã hóa mới nhất ngay trong hộp thư.