Эксперимент с участием 1 053 первокурсников университета Боккони показал: доступ к GPT-4o повысил оценки за бизнес-задание почти на балл по пятибалльной шкале, однако краткий урок по каузальному мышлению не повлиял на традиционные оценки, но стимулировал более разнообразные и нестандартные решения. Исследование, проведённое в ноябре 2025 года, случайным образом разделило 13 секций вводного курса менеджмента на четыре группы: контрольную, с уроком каузального мышления, с доступом к GPT-4o и с обоими условиями. Студенты должны были написать маркетинговые рекомендации для университетского магазина мерчандайза объёмом до 180 слов. Урок охватывал логику причинно-следственных связей, фальсифицируемость и объяснение того, как предлагаемое действие может привести к желаемому результату.

Результаты показали, что студенты с GPT-4o в среднем набрали почти на один балл выше по шкале от 1 до 5. Их ответы содержали примерно на две идеи больше, были логически связнее и ближе к рекомендациям трёх экспертов в предметной области. Даже после контроля качества аргументации, количества идей, разнообразия идей и текстовых характеристик измеримое преимущество GPT-4o сохранялось. Авторы связывают это с более высоким качеством контента, а не с большими знаниями студентов. Урок каузального мышления не повысил традиционные оценки: работы таких студентов в среднем оценивались даже немного ниже, но они чаще объясняли, почему предложенное действие должно сработать и при каких условиях может провалиться. Они также генерировали более разнообразные идеи, отличающиеся от работ сверстников. Комбинация урока с GPT-4o не дала дополнительного прироста к традиционным оценкам, но на показателях каузального мышления два подхода дополняли друг друга, и большее разнообразие идей из группы с уроком сохранялось.

ГруппаСредняя оценка (1–5)Количество идейКаузальное мышление
Контрольнаябазовый уровеньбазовый уровеньбазовый уровень
Урок каузального мышленияниже базовоговыше базовоговыше базового
GPT-4oпочти на 1 балл вышепримерно на 2 идеи большебез изменений
GPT-4o + урокпочти на 1 балл вышепримерно на 2 идеи большевыше базового

Критерии оценки традиционно поощряли стандартные ответы: больше идей, связность и разнообразие одного ответа коррелировали с более высокими баллами. Однако более сильная фальсифицируемость, детальные объяснения механизмов работы предложений и отклонение от идей других студентов коррелировали с более низкими оценками. Это не означает, что оригинальность наказывалась повсеместно: для данного задания традиционная оценка в основном вознаграждала хорошо структурированные ответы, остающиеся в ожидаемом пространстве решений. Авторы заключают, что разнообразие и оригинальность должны быть явно включены в критерии оценивания, если они должны учитываться. Но текущие системы оценивания измеряют полировку, структуру и полноту, а не обучение и понимание, что делает ИИ удобным инструментом для списывания.

Студенты с GPT-4o в среднем набрали почти на один балл выше по шкале от 1 до 5; их ответы содержали примерно на две идеи больше и были логически связнее.

ChatGPT access and critical thinking training had complementary effects on student work. ChatGPT alone mainly improved traditional scores, while the teaching intervention fostered causal reasoning and idea diversity. | Image: OpenAI
ChatGPT access and critical thinking training had complementary effects on student work. ChatGPT alone mainly improved traditional scores, while the teaching intervention fostered causal reasoning and idea diversity. | Image: OpenAI · Источник: The Decoder

Исследование не показывает, улучшает ли ИИ обучение: не было последующего теста, где студенты должны были бы продемонстрировать понимание без ChatGPT. Авторы прямо признают, что остаётся неясным, связано ли преимущество GPT с реально полученными знаниями или просто с лучшим выводом при поддержке ИИ. Эксперимент охватывал только первокурсников одного университета и узкую маркетинговую задачу. Рандомизация проводилась по 13 секциям, а не индивидуально среди всех 1 053 студентов. Основная оценка выставлялась людьми, не знавшими, к какой группе относится текст; дополнительные показатели, такие как каузальное мышление и разнообразие идей, оценивались с помощью моделей OpenAI и Anthropic. OpenAI предоставляет исследуемую технологию и участвовала в исследовании; несколько авторов работают в OpenAI или были там во время исследования.

Другие исследования показывают, что важно не то, используют ли студенты ИИ, а то, поддерживает ли он их собственное мышление или заменяет его. Когда ИИ заменяет мышление, студенты страдают. Исследование более 500 000 студенческих оценок в США показало, что после запуска ChatGPT рост высоких оценок был наибольшим в курсах с письменными и программистскими заданиями и большой домашней работой. Контролируемые эксперименты показали, что после отключения ИИ участники справлялись хуже контрольной группы, причём наибольшее падение было у тех, кто в основном использовал GPT для получения прямых ответов. Тридцатимесячное исследование с участием более 26 000 студентов в Китае показало аналогичную картину: домашние задания улучшались и выполнялись быстрее с ИИ, но результаты экзаменов падали, а на более поздних вступительных экзаменах снижение составило 18–24 процента в долгосрочной перспективе.