Эксперимент с участием 1 053 первокурсников университета Боккони показал: доступ к GPT-4o повысил оценки за бизнес-задание почти на балл по пятибалльной шкале, однако краткий урок по каузальному мышлению не повлиял на традиционные оценки, но стимулировал более разнообразные и нестандартные решения. Исследование, проведённое в ноябре 2025 года, случайным образом разделило 13 секций вводного курса менеджмента на четыре группы: контрольную, с уроком каузального мышления, с доступом к GPT-4o и с обоими условиями. Студенты должны были написать маркетинговые рекомендации для университетского магазина мерчандайза объёмом до 180 слов. Урок охватывал логику причинно-следственных связей, фальсифицируемость и объяснение того, как предлагаемое действие может привести к желаемому результату.
Результаты показали, что студенты с GPT-4o в среднем набрали почти на один балл выше по шкале от 1 до 5. Их ответы содержали примерно на две идеи больше, были логически связнее и ближе к рекомендациям трёх экспертов в предметной области. Даже после контроля качества аргументации, количества идей, разнообразия идей и текстовых характеристик измеримое преимущество GPT-4o сохранялось. Авторы связывают это с более высоким качеством контента, а не с большими знаниями студентов. Урок каузального мышления не повысил традиционные оценки: работы таких студентов в среднем оценивались даже немного ниже, но они чаще объясняли, почему предложенное действие должно сработать и при каких условиях может провалиться. Они также генерировали более разнообразные идеи, отличающиеся от работ сверстников. Комбинация урока с GPT-4o не дала дополнительного прироста к традиционным оценкам, но на показателях каузального мышления два подхода дополняли друг друга, и большее разнообразие идей из группы с уроком сохранялось.
| Группа | Средняя оценка (1–5) | Количество идей | Каузальное мышление |
|---|---|---|---|
| Контрольная | базовый уровень | базовый уровень | базовый уровень |
| Урок каузального мышления | ниже базового | выше базового | выше базового |
| GPT-4o | почти на 1 балл выше | примерно на 2 идеи больше | без изменений |
| GPT-4o + урок | почти на 1 балл выше | примерно на 2 идеи больше | выше базового |
Критерии оценки традиционно поощряли стандартные ответы: больше идей, связность и разнообразие одного ответа коррелировали с более высокими баллами. Однако более сильная фальсифицируемость, детальные объяснения механизмов работы предложений и отклонение от идей других студентов коррелировали с более низкими оценками. Это не означает, что оригинальность наказывалась повсеместно: для данного задания традиционная оценка в основном вознаграждала хорошо структурированные ответы, остающиеся в ожидаемом пространстве решений. Авторы заключают, что разнообразие и оригинальность должны быть явно включены в критерии оценивания, если они должны учитываться. Но текущие системы оценивания измеряют полировку, структуру и полноту, а не обучение и понимание, что делает ИИ удобным инструментом для списывания.
Студенты с GPT-4o в среднем набрали почти на один балл выше по шкале от 1 до 5; их ответы содержали примерно на две идеи больше и были логически связнее.

Исследование не показывает, улучшает ли ИИ обучение: не было последующего теста, где студенты должны были бы продемонстрировать понимание без ChatGPT. Авторы прямо признают, что остаётся неясным, связано ли преимущество GPT с реально полученными знаниями или просто с лучшим выводом при поддержке ИИ. Эксперимент охватывал только первокурсников одного университета и узкую маркетинговую задачу. Рандомизация проводилась по 13 секциям, а не индивидуально среди всех 1 053 студентов. Основная оценка выставлялась людьми, не знавшими, к какой группе относится текст; дополнительные показатели, такие как каузальное мышление и разнообразие идей, оценивались с помощью моделей OpenAI и Anthropic. OpenAI предоставляет исследуемую технологию и участвовала в исследовании; несколько авторов работают в OpenAI или были там во время исследования.
Другие исследования показывают, что важно не то, используют ли студенты ИИ, а то, поддерживает ли он их собственное мышление или заменяет его. Когда ИИ заменяет мышление, студенты страдают. Исследование более 500 000 студенческих оценок в США показало, что после запуска ChatGPT рост высоких оценок был наибольшим в курсах с письменными и программистскими заданиями и большой домашней работой. Контролируемые эксперименты показали, что после отключения ИИ участники справлялись хуже контрольной группы, причём наибольшее падение было у тех, кто в основном использовал GPT для получения прямых ответов. Тридцатимесячное исследование с участием более 26 000 студентов в Китае показало аналогичную картину: домашние задания улучшались и выполнялись быстрее с ИИ, но результаты экзаменов падали, а на более поздних вступительных экзаменах снижение составило 18–24 процента в долгосрочной перспективе.



