Обучение ИИ-тьютора на большой и разнообразной группе учеников «непомерно дорого и долго», пишут авторы работы. Из-за этого улучшения тьюторов отстают от прогресса языковых моделей. Исследователи из Microsoft предлагают заменить реальных учеников цифровыми копиями, которые дают быструю обратную связь. Система StudentSim строит отдельную копию для каждого ученика, даже когда записей о его работе совсем мало.
Копия ученика должна не только ошибаться, но и учиться на подсказках. Существующие подходы решают лишь одну из двух задач. Одни модели обучаются на реальных данных и достоверно воспроизводят поведение ученика, но не умеют использовать объяснения тьютора. Другие — это языковые модели, которым поручено играть роль ученика. Они охотно следуют подсказкам, но не соответствуют способностям того, кого изображают. StudentSim превращает оба навыка в измеримые цели: насколько точно копия повторяет ответы ученика, включая типичные ошибки, и насколько охотно пересматривает ответ после помощи тьютора. Для обучения тьютора нужны и реалистичная отправная точка, и смоделированный ученик, который реагирует на инструкции.
| Модель | Шахматы | Английский | Математика |
|---|---|---|---|
| StudentSim | Лучший результат | Лучший результат | Лучший результат |
| GPT-5.4 | Хуже StudentSim | Хуже StudentSim | Хуже StudentSim |
| Maia2 | Предсказывает один ход для всех | — | — |
Главное препятствие — нехватка данных. В наборе по английской письменной речи у среднего ученика всего три эссе, а более двух третей написали пять или меньше. Прямое обучение копии на стольких примерах проваливается, говорят исследователи, потому что модель переобучается на них. StudentSim обучается в два этапа. Сначала базовая модель учится на объединённых данных всех учеников по предмету: она усваивает типичные ошибки и то, как ученики пересматривают ответы после подсказки. Затем исследователи адаптируют модель под конкретного человека по нескольким доступным записям. Во всех предметах в качестве базовой используется языковая модель Alibaba Qwen3-4B-Instruct.
Система обучается в два этапа: сначала на общих данных всех учеников, затем на редких записях конкретного человека.

Метод протестировали на 60 учениках в шахматах, английском как иностранном и математике, используя публичные наборы данных с записями реальных учащихся. StudentSim обошёл более крупную модель GPT-5.4 во всех трёх предметах, когда GPT-5.4 просили играть роль ученика. В шахматах StudentSim примерно вдвое чаще правильно предсказывает следующий ход игрока и почти всегда следует корректирующим указаниям. GPT-5.4 и специализированные шахматные модели отстают. Maia2 предсказывает один и тот же ход для всех трёх игроков; GPT-5.4 ошибается во всех трёх случаях; StudentSim правильно предсказывает ход каждого из трёх.
У каждого существующего метода своя слабость. GPT-5.4 следует подсказкам, но не воспроизводит ошибки конкретного ученика. Шахматные модели повторяют поведение игрока, но не понимают словесных подсказок и игнорируют их. В одной позиции три реальных игрока выбрали три разных хода. StudentSim воспроизвёл выбор каждого, тогда как шахматная модель предсказала один и тот же наиболее вероятный ход для всех троих. GPT-5.4 ошибся во всех трёх случаях.
В качестве ещё одного доказательства концепции исследователи использовали копию ученика для улучшения шахматного тьютора. Профессиональные шахматисты оценили три версии: без такого обучения, обученную с GPT-5.4 в роли ученика и обученную со StudentSim. Тьютор, обученный со StudentSim, получил высшие баллы по всем трём показателям. Он допустил меньше всего серьёзных фактических ошибок и получил наивысшие оценки за качество объяснений и адаптацию к конкретному ученику. В этом случае ученик предпочитал вопросы, которые подводят к решению, а не прямые инструкции. Тьютор, обученный с GPT-5.4, показал худшую фактическую точность, чем тьютор, не получавший дополнительного обучения. Исследователи подчёркивают, что это лишь доказательство концепции, а не заявление о создании лучшего тьютора. Шахматы удобны как тестовый случай, потому что движок может объективно оценить ход в любой позиции. Эссе и открытая математика сложнее: для свободных ответов нет надёжных функций оценки. В дальнейшем команда хочет моделировать, как ученики приобретают, сохраняют и забывают знания за множество тренировочных сессий. Код доступен на GitHub.
В 2024 году исследователи использовали ИИ-агентов для воспроизведения около 1000 реальных людей на основе двухчасовых интервью с каждым участником. Отдельное исследование показало, насколько такие копии подвержены ошибкам. Девять открытых языковых моделей, которым поручили имитировать поведение пользователей в X, Bluesky и Reddit, становились менее точными по содержанию, чем более человечно звучали. Microsoft также тестирует ИИ-тьюторов с реальными учениками. В пилотном проекте в Нигерии студенты работали с Copilot дважды в неделю в течение шести недель.



