В 2026 году Школа анализа данных (ШАД) провела вступительный экзамен, и впервые его первый этап был протестирован на языковых моделях. Академический руководитель ШАД Хелпера Лыков Александр и его коллеги предложили пяти LLM решить 40 задач по математике и алгоритмам за два часа. Результаты оказались неоднородными: зарубежные модели уверенно преодолели проходной порог, тогда как отечественная GigaChat не справилась.

Экзамен состоял из четырёх вариантов (A, B, C, D), каждый включал по 10 задач из матанализа, алгебры и теории вероятностей, а также по 5 задач из дискретной математики и алгоритмов. Проверялись только ответы, решения не рассматривались. Модели тестировались через API или специальные обвязки: для Claude и ChatGPT использовали GitHub Copilot, для Qwen — Qwen CLI, а DeepSeek и GigaChat запускали через Python-скрипты. Такой подход означает, что результаты отражают не только возможности самих моделей, но и способы их применения.

МодельСредний балл% правильныхВремя
Claude: Opus, 4.839.5 / 4098.8%25 мин
DeepSeek-R1-052838.25 / 4095.6%43 мин
ChatGPT: Sol, Medium37.75 / 4094.4%14 мин
Qwen 3.7 Max32.5 / 4081.3%155 мин
Gigachat-3-Ultra25.25 / 4063.1%3–4 мин

Лучший результат показал Claude Opus 4.8 — 39.5 балла из 40 (98.8%), потратив на все варианты 25 минут. DeepSeek-R1-0528 набрал 38.25 балла (95.6%) за 43 минуты, ChatGPT Sol Medium — 37.75 (94.4%) за 14 минут. Qwen 3.7 Max решил 32.5 задачи (81.3%), но затратил 155 минут. GigaChat-3-Ultra остановился на 25.25 балла (63.1%), что ниже проходного порога около 30. Авторы отмечают, что использовали не самые мощные доступные модели, так как задачи первого этапа относительно простые.

DeepSeek-R1-0528 и ChatGPT Sol Medium также превысили проходной балл около 30.

Анализ ошибок показал, что универсальной слабости у всех моделей нет, но алгоритмический блок оказался самым трудным: средний балл по алгоритмам и структурам данных составил 85.5%. Среди конкретных тем хуже всего модели справлялись с системами линейных уравнений (60% правильных ответов) и амортизационным анализом (67.5%). При этом Claude не показал слабых мест ни в одной теме, а GigaChat провалила амортизационный анализ и алгоритм Дейкстры, набрав 0%.

Стоимость вычислений различалась: Claude и ChatGPT работали подписки за 20 долларов, DeepSeek тратил около 15 центов на вариант, а GigaChat — 3–4 минуты на задачу. Авторы подчёркивают, что результаты зависят от инструментов тестирования, и публикуют репозиторий с решениями и скриптами для воспроизведения. Эти данные полезны для понимания текущих возможностей ИИ в решении математических задач и могут повлиять на подходы к обучению и оценке моделей.