ChatGPT улучшил ответы студентов, но новые идеи дала другая тренировка

В публикации OpenAI от 27 августа 2026 года представлены результаты случайного контролируемого эксперимента исследователей Bocconi University и OpenAI Economic Research: доступ к ChatGPT повысил качество и связность работ первокурсников, а отдельная тренировка причинного мышления привела к более разнообразным идеям.
Вывод относится к одной короткой маркетинговой задаче, а не к обучению в целом. Эксперимент измерял качество готового ответа и смысловое разнообразие предложений, но не проверял, усвоили ли студенты знания и сохранили ли навык после работы без ИИ.
Как были устроены четыре условия эксперимента

Описание эксперимента Bocconi уточняет, что в нём участвовали 1053 первокурсника, случайно распределённые по учебным группам между четырьмя условиями: ChatGPT Edu на базе GPT-4o, тренировка причинного мышления, сочетание двух вмешательств или контроль без них.
Тренировка не была курсом по составлению запросов к ИИ. Студенты выполняли игровое упражнение с примерами, вопросами и обратной связью, учились связывать причины с последствиями, объяснять механизм ожидаемого результата и формулировать условия, при которых предположение окажется неверным. Контрольная группа вместо этого проходила нейтральное упражнение.
После подготовки все решали одну и ту же практическую задачу: предлагали способы повысить узнаваемость университетской сувенирной продукции среди выпускников и увеличить её использование. Участники групп с ChatGPT могли обращаться к сервису, но самостоятельно выбирали запросы и формировали окончательный ответ.
ChatGPT повысил оценку, но не расширил пространство решений

Главный эффект ChatGPT проявился в качестве ответа по заданной маркетинговой шкале. Работы с доступом к модели содержали больше предложений, отличались более связной логикой и сильнее напоминали рекомендации привлечённых специалистов.
Доступ к ChatGPT увеличил расчётную оценку примерно на 0,86 балла по пятибалльной шкале относительно 2,09 балла у контрольной группы. Более ясный текст и большее число идей объясняли часть разницы, однако после статистического учёта этих характеристик преимущество полностью не исчезло.
При этом большее число предложений не означало большей оригинальности их набора. Сам по себе GPT-4o почти не изменил смысловую дистанцию между решениями студентов и не дал сопоставимого самостоятельного эффекта для объяснения причинных механизмов или формулирования опровержимых предположений.
Тренировка дала разнообразие, которого не заметила обычная оценка
Тренировка причинного мышления изменила другой показатель. После неё студенты чаще объясняли, почему рекомендация должна сработать, через какой механизм возникнет результат и при каких условиях гипотеза окажется неверной. Их идеи сильнее различались как внутри одной работы, так и по сравнению с ответами других участников.
Однако это не повысило балл по маркетинговой шкале. Она оценивала, насколько хорошо ответ решает две заранее заданные задачи — повышение узнаваемости и использования продукции, — но не давала отдельных баллов за необычность подхода. Поэтому качественно оформленный ожидаемый ответ и оригинальное решение измерялись разными показателями.
Группа, получившая оба вмешательства, в основном сохранила преимущества каждого из них: оценки и количество идей были близки к результатам группы с ChatGPT, а разнообразие — к результатам прошедших тренировку. Это точнее описывать как сочетание разных эффектов, а не как универсальное усиление всех показателей.
Что эксперимент измерил — и чего из него нельзя заключить

Оценка «оригинальности» не была экспертным суждением о творческой ценности. Исследователи автоматически выделяли смысловые единицы и рассчитывали расстояние между ними, тогда как предметное качество проверяли подготовленные оценщики по отдельной шкале.
Независимый разбор методики указывает, что участники выполняли одно 45-минутное задание объёмом около 180 слов, каждую работу оценивали три человека из группы 20 подготовленных магистрантов, а результаты опубликованы как рабочая статья без указанного журнального рецензирования.
Отсюда следует ограниченный, но практически важный вывод для устройства подобных заданий: предметное качество и оригинальность нельзя считать одним показателем. Если преподавателю важны оба результата, шкала может отдельно учитывать соответствие задаче, разнообразие подходов, причинный механизм и проверяемость предположения. Это редакционный вывод из дизайна эксперимента, а не проверенная авторами универсальная методика оценки.
Исследование не включало последующий экзамен без ИИ, проверку сохранения знаний или наблюдение в течение семестра. Поэтому оно показывает, как GPT-4o и отдельная когнитивная тренировка повлияли на непосредственный результат одной работы первокурсников, но не устанавливает долгосрочного влияния ChatGPT на обучение. Для переноса вывода на другие дисциплины, модели и типы заданий потребуются независимые повторения.
Читайте также:
Подпишитесь на рассылку
Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.