ChatGPT nâng điểm, huấn luyện tư duy mới tăng độ đa dạng ý tưởng

Ngày 27/8/2026, OpenAI công bố kết quả một thử nghiệm ngẫu nhiên do các nhà nghiên cứu Đại học Bocconi thực hiện cùng OpenAI Economic Research. Bản công bố ngày 27/8 của OpenAI cho thấy ChatGPT giúp bài làm đạt điểm cao hơn và mạch lạc hơn, còn bài huấn luyện suy luận nhân quả mới làm các ý tưởng giữa sinh viên đa dạng hơn.
Kết quả được công bố cùng ngày đưa ra câu trả lời có giới hạn về ảnh hưởng của ChatGPT đối với tư duy phản biện: trong bài toán marketing dành cho sinh viên năm nhất Bocconi, AI cải thiện sản phẩm được chấm điểm nhưng không làm tăng độ đa dạng ý tưởng. Hiệu ứng thứ hai xuất hiện ở nhóm được luyện cách phân tích nguyên nhân, cơ chế và điều kiện khiến một giải pháp có thể thất bại.
Thử nghiệm bốn nhóm tách AI khỏi huấn luyện suy luận

Discussion paper DP21882 của CEPR mô tả thử nghiệm đối chứng ngẫu nhiên 2×2 với 1.053 sinh viên năm nhất ngành kinh tế, quản trị và tài chính. Các lớp được phân vào bốn điều kiện: dùng ChatGPT Edu với GPT-4o, học suy luận nhân quả, nhận cả hai can thiệp hoặc không nhận can thiệp nào.
Tất cả sinh viên giải cùng một bài toán thực tế: đề xuất cách tăng nhận biết và mức sử dụng cửa hàng sản phẩm mang thương hiệu Bocconi trong nhóm cựu sinh viên. Bài làm được chấm theo rubric marketing năm điểm; nhóm nghiên cứu còn phân tích văn bản để đo số lượng và độ đa dạng của ý tưởng, dấu hiệu suy luận nhân quả, độ mạch lạc và mức tương đồng với phương án của chuyên gia.
Thiết kế này cho phép phân biệt ba đầu ra thường bị gộp chung: điểm theo tiêu chí có sẵn, cách tổ chức lập luận và phạm vi ý tưởng xuất hiện trong cả nhóm. Nó cũng giúp kiểm tra liệu việc dùng ChatGPT có làm mất tác động của huấn luyện suy luận hay không.
ChatGPT nâng điểm trong một nhiệm vụ có tiêu chí rõ
Theo kết quả do Đại học Bocconi công bố, quyền truy cập ChatGPT làm điểm tăng khoảng 0,86 trên thang năm điểm, so với mức ước tính 2,09 của nhóm đối chứng. Bài làm có AI cũng giống các đề xuất của chuyên gia hơn.
Lợi thế không chỉ nằm ở câu chữ trau chuốt. Sinh viên dùng ChatGPT đưa ra nhiều ý tưởng hơn và trình bày logic rõ hơn; độ mạch lạc cùng số lượng ý tưởng giải thích khoảng một nửa tác động lên điểm. Phần chênh lệch còn lại cho thấy AI còn giúp người mới tạo nội dung phù hợp hơn với các tiêu chí của nhiệm vụ.
Dù vậy, điểm cao ở đây là kết quả của một bài làm cụ thể, không phải phép đo trực tiếp về năng lực tư duy phản biện lâu dài. Thử nghiệm không xác định sinh viên giữ lại bao nhiêu kiến thức, có thể lặp lại kết quả khi không dùng AI hay sẽ phụ thuộc vào công cụ đến mức nào.
Huấn luyện suy luận mở rộng ý tưởng nhưng không tăng điểm

Sinh viên được huấn luyện suy luận nhân quả giải thích rõ hơn vì sao đề xuất có thể hoạt động, cơ chế nào tạo ra kết quả và trong điều kiện nào giải pháp có thể thất bại. Xét trên toàn nhóm, các phương án của họ cũng khác nhau nhiều hơn; ChatGPT chủ yếu làm tăng số lượng ý tưởng chứ không tạo ra hiệu ứng tương tự về độ đa dạng.
Lợi ích này không chuyển thành điểm cao hơn vì rubric chỉ đánh giá mức độ đáp ứng hai mục tiêu marketing đã định trước: tăng nhận biết và tăng sử dụng cửa hàng. Một phương án khác biệt không được cộng điểm nếu tính nguyên bản hoặc khoảng cách với ý tưởng của những người khác không nằm trong tiêu chí chấm.
“Độ đa dạng ý tưởng” vì thế không đồng nghĩa với mọi sinh viên đều trở nên sáng tạo hơn, cũng không chứng minh từng phương án mới lạ đều đúng hoặc khả thi. Đây là mức độ khác biệt giữa các bài làm trong tập hợp, được đo bằng phân tích văn bản. Can thiệp được kiểm tra cũng chỉ là huấn luyện suy luận nhân quả, không đại diện cho mọi chương trình tư duy phản biện.
Hai can thiệp bổ sung cho nhau thay vì thay thế
Nhóm vừa dùng ChatGPT vừa được huấn luyện duy trì hai kiểu lợi ích. Điểm và số lượng ý tưởng của họ tương tự nhóm chỉ dùng ChatGPT, trong khi độ đa dạng ý tưởng tương đương nhóm chỉ học suy luận nhân quả. Bài làm kết hợp còn thể hiện logic mạch lạc hơn, chú ý nhiều hơn đến cơ chế và việc kiểm tra giả định.
Thử nghiệm do đó không ủng hộ cách đặt vấn đề rằng trường học phải chọn giữa AI và tư duy độc lập. Trong điều kiện được kiểm tra, ChatGPT giúp người mới đáp ứng tốt hơn một chuẩn đánh giá xác định sẵn; huấn luyện suy luận lại mở rộng không gian giải pháp mà cả lớp cùng tạo ra.
Đối với giảng viên Việt Nam, hàm ý hợp lý là không dùng một điểm tổng hợp để đại diện cho mọi năng lực. Rubric có thể tách mức độ đáp ứng yêu cầu, độ mạch lạc và cơ chế lập luận, cùng tính nguyên bản hoặc độ đa dạng. Đây là suy luận thiết kế từ kết quả tại Bocconi, chưa phải mô hình chấm điểm đã được kiểm nghiệm trong lớp học Việt Nam.
Giới hạn của kết quả nằm ở trường, nhiệm vụ và mô hình

Thử nghiệm chỉ diễn ra tại một trường đại học, với sinh viên năm nhất và một bài toán marketing có mục tiêu tương đối rõ. Công cụ được kiểm tra là ChatGPT Edu chạy GPT-4o. Mức tăng điểm không thể tự động áp dụng cho môn học cần chứng minh toán học, phân tích nguồn lịch sử, sáng tác hoặc xử lý vấn đề không có rubric chuẩn.
Nghiên cứu đánh giá bài nộp cuối cùng và các dấu hiệu trong văn bản, chưa theo dõi sự thay đổi bền vững trong năng lực của từng sinh viên. Nó cũng không trả lời liệu hiệu ứng có giữ nguyên ở trường khác, nhóm trình độ khác, ngôn ngữ khác hoặc với thế hệ mô hình khác hay không.
Điều được xác nhận từ kết quả công bố ngày 27/8 là ChatGPT và huấn luyện suy luận nhân quả tác động lên những đầu ra khác nhau nhưng có thể cùng tồn tại. Để kết luận về tư duy độc lập lâu dài, vẫn cần các thử nghiệm lặp lại ở nhiều môn học và cơ sở giáo dục, đồng thời đo cả quá trình lập luận lẫn khả năng làm việc sau khi quyền truy cập AI được rút đi.
Đăng ký bản tin
Nhận tin Web3, AI và tiền mã hóa mới nhất ngay trong hộp thư.