Quasa
Utilice la aplicación QUASA
¡Únase hoy al pionero del trabajo autónomo criptográfico Web3!
Abierto
Tecnología

ChatGPT mejoró las notas; enseñar causalidad produjo ideas menos comunes

|Autor: Equipo editorial de QUASA|5 lectura mínima| 11
ChatGPT mejoró las notas; enseñar causalidad produjo ideas menos comunes

La Universidad Bocconi difundió el 27 de agosto de 2026 los resultados de un ensayo aleatorizado realizado con 1.053 estudiantes de primer curso y desarrollado con OpenAI Economic Research. La publicación de Bocconi atribuye efectos diferentes a las dos intervenciones: el acceso a ChatGPT elevó la evaluación de las respuestas, mientras la formación en razonamiento causal produjo propuestas menos convencionales.

La palabra «notas» tiene aquí un alcance preciso: no eran las calificaciones finales de una asignatura ni una medida de aprendizaje a largo plazo. Eran puntuaciones concedidas a una recomendación empresarial breve, escrita durante una sesión supervisada; por tanto, el experimento muestra una mejora del producto entregado, pero no prueba que ChatGPT aumente por sí solo la comprensión, la retención o el pensamiento crítico de los alumnos.

El ensayo separó el acceso a ChatGPT de la formación causal

Experimento de Bocconi con cuatro condiciones para comparar ChatGPT y formación en razonamiento causal.

El experimento tuvo lugar en noviembre de 2025 dentro de un curso introductorio de gestión. El documento completo del ensayo describe un diseño factorial 2×2: las 13 clases fueron asignadas, dentro de cada programa, a formación causal o a un ejercicio placebo y, de forma independiente, a acceso a ChatGPT Edu con GPT-4o o a trabajar sin esa herramienta.

La aleatorización se hizo por clase, no estudiante por estudiante. Los participantes cursaban programas de economía, finanzas y gestión y dispusieron de unos 45 minutos para escribir hasta 180 palabras con recomendaciones destinadas a aumentar el conocimiento y el uso de los productos de merchandising de la universidad entre antiguos alumnos.

La formación causal no consistía en enseñar a utilizar IA. Mediante un ejercicio previo, introducía la relación entre causas y efectos, la identificación de mecanismos y la búsqueda de condiciones que pudieran refutar una afirmación. Esta separación permitió estimar qué cambiaba por disponer del modelo, qué cambiaba por la instrucción y qué ocurría al combinar ambas intervenciones.

ChatGPT mejoró una puntuación estrecha, pero claramente definida

Evaluadores califican respuestas anónimas y detectan mayor coherencia en las elaboradas con acceso a ChatGPT.

Veinte estudiantes de máster, sin conocer la condición experimental de cada texto, puntuaron las recomendaciones. Cada respuesta recibió tres evaluaciones independientes en escalas de uno a cinco sobre dos objetivos: generar conocimiento del programa de productos y favorecer su uso o compra. El resultado principal fue el promedio de ambas dimensiones.

El acceso a ChatGPT elevó esa puntuación en unos 0,86 puntos frente a una estimación de 2,09 para el grupo de control. Las respuestas de quienes podían utilizarlo también contenían más ideas, mostraban una lógica más coherente y se acercaban más a las recomendaciones elaboradas separadamente por tres personas con experiencia en el problema.

El número de ideas, la coherencia y otras características textuales explicaron aproximadamente la mitad del efecto estimado; la otra mitad permaneció después de introducir esos controles. Los autores interpretan este resultado como indicio de que la ventaja no fue únicamente estilística: en esta tarea bien definida, ChatGPT también influyó en el contenido seleccionado.

La conclusión no puede trasladarse automáticamente a cualquier trabajo académico. El ensayo estudió un único caso de consultoría, una sesión y un modelo concreto; no examinó exámenes sin IA, transferencia a otras materias, retención posterior ni capacidad para reconstruir el razonamiento sin asistencia.

La causalidad cambió el razonamiento y la diversidad, no la nota

La formación causal produce recomendaciones con mecanismos explícitos y una mayor diversidad de ideas.

La formación causal produjo más referencias a mecanismos y a condiciones bajo las cuales una propuesta podía fallar. También aumentó dos formas de diversidad: la distancia entre las ideas incluidas en una misma respuesta y la diferencia entre la propuesta central de un participante y las de sus compañeros. ChatGPT, por sí solo, incrementó la cantidad de ideas, pero no tuvo un efecto distinguible sobre esa diversidad.

Eso explica por qué una respuesta podía ser menos convencional sin recibir una nota superior. La rúbrica humana premiaba la adecuación a dos objetivos de marketing predefinidos, mientras la originalidad se calculó por separado mediante análisis automatizado de los textos. El razonamiento causal, la coherencia, la falsabilidad y la identificación de mecanismos también fueron medidos con una rúbrica aplicada repetidamente por GPT-5, no por los evaluadores humanos que asignaron la puntuación principal.

Las dos mediciones, por tanto, no se contradicen: capturan propiedades distintas. Una solución puede ajustarse bien a criterios conocidos y parecerse a la respuesta de un experto sin alejarse mucho de las demás; otra puede explorar mecanismos o combinaciones poco comunes que la rúbrica de conocimiento y uso no recompensa.

En la condición combinada, disponer de ChatGPT no eliminó la diversidad asociada con la formación causal. Los resultados también muestran complementariedad en aspectos del razonamiento: la combinación reforzó la lógica coherente y la identificación de mecanismos, aunque no añadió un aumento separado y estadísticamente claro a la puntuación principal.

Una sola nota no permite distinguir acabado, razonamiento y originalidad

El registro de CEPR identifica el trabajo como el documento de discusión DP21882, publicado el 27 de agosto de 2026, y resume la separación central: ChatGPT mejoró la evaluación bajo criterios estándar, mientras la formación causal alteró el modo de razonar y amplió la diversidad de ideas.

Para la evaluación universitaria, el resultado señala un problema de medición. La pertinencia y viabilidad del producto final, la explicación de mecanismos, la consideración de supuestos y la originalidad respecto del grupo no representan la misma capacidad. Si todas quedan comprimidas en una única nota centrada en la respuesta esperada, el mejor acabado puede ganar visibilidad mientras una diferencia sustantiva de razonamiento queda fuera de la puntuación.

La evidencia disponible no establece que la IA perjudique la originalidad ni que la formación causal mejore cualquier tipo de creatividad. Tampoco permite afirmar que una intervención haya producido aprendizaje duradero: solo muestra efectos causales sobre textos generados en unas condiciones concretas. Queda por comprobar si el patrón se mantiene en otras universidades, disciplinas, modelos, tareas menos estructuradas y evaluaciones que premien explícitamente la diversidad de soluciones.

Lee también:

Compartir:

Suscríbete a nuestro boletín

Reciba las últimas noticias sobre Web3, IA y criptomonedas directamente en su bandeja de entrada.

0