В 2026 году Школа анализа данных (ШАД) провела вступительный экзамен, и впервые его первый этап был протестирован на языковых моделях. Академический руководитель ШАД Хелпера Лыков Александр и его коллеги предложили пяти LLM решить 40 задач по математике и алгоритмам за два часа. Результаты оказались неоднородными: зарубежные модели уверенно преодолели проходной порог, тогда как отечественная GigaChat не справилась.
Экзамен состоял из четырёх вариантов (A, B, C, D), каждый включал по 10 задач из матанализа, алгебры и теории вероятностей, а также по 5 задач из дискретной математики и алгоритмов. Проверялись только ответы, решения не рассматривались. Модели тестировались через API или специальные обвязки: для Claude и ChatGPT использовали GitHub Copilot, для Qwen — Qwen CLI, а DeepSeek и GigaChat запускали через Python-скрипты. Такой подход означает, что результаты отражают не только возможности самих моделей, но и способы их применения.
| Модель | Средний балл | % правильных | Время |
|---|---|---|---|
| Claude: Opus, 4.8 | 39.5 / 40 | 98.8% | 25 мин |
| DeepSeek-R1-0528 | 38.25 / 40 | 95.6% | 43 мин |
| ChatGPT: Sol, Medium | 37.75 / 40 | 94.4% | 14 мин |
| Qwen 3.7 Max | 32.5 / 40 | 81.3% | 155 мин |
| Gigachat-3-Ultra | 25.25 / 40 | 63.1% | 3–4 мин |
Лучший результат показал Claude Opus 4.8 — 39.5 балла из 40 (98.8%), потратив на все варианты 25 минут. DeepSeek-R1-0528 набрал 38.25 балла (95.6%) за 43 минуты, ChatGPT Sol Medium — 37.75 (94.4%) за 14 минут. Qwen 3.7 Max решил 32.5 задачи (81.3%), но затратил 155 минут. GigaChat-3-Ultra остановился на 25.25 балла (63.1%), что ниже проходного порога около 30. Авторы отмечают, что использовали не самые мощные доступные модели, так как задачи первого этапа относительно простые.
DeepSeek-R1-0528 и ChatGPT Sol Medium также превысили проходной балл около 30.
Анализ ошибок показал, что универсальной слабости у всех моделей нет, но алгоритмический блок оказался самым трудным: средний балл по алгоритмам и структурам данных составил 85.5%. Среди конкретных тем хуже всего модели справлялись с системами линейных уравнений (60% правильных ответов) и амортизационным анализом (67.5%). При этом Claude не показал слабых мест ни в одной теме, а GigaChat провалила амортизационный анализ и алгоритм Дейкстры, набрав 0%.
Стоимость вычислений различалась: Claude и ChatGPT работали подписки за 20 долларов, DeepSeek тратил около 15 центов на вариант, а GigaChat — 3–4 минуты на задачу. Авторы подчёркивают, что результаты зависят от инструментов тестирования, и публикуют репозиторий с решениями и скриптами для воспроизведения. Эти данные полезны для понимания текущих возможностей ИИ в решении математических задач и могут повлиять на подходы к обучению и оценке моделей.

