Прошло почти два года с момента выхода OpenAI o1 — модели, которая популяризировала reasoning в больших языковых моделях. Примерно через четыре месяца появился DeepSeek-R1, авторы которого подробно описали, как обучать reasoning-модели с помощью reinforcement learning with verifiable rewards (RLVR), то есть обучения с подкреплением на проверяемых наградах. На прошлой неделе OpenAI представила семейство GPT-5.6, включающее модели трех размеров, для каждой из которых предусмотрено пять или шесть настроек reasoning effort. Это подтверждает: reasoning-модели стали стандартной частью современных релизов.

Reasoning-модели — это LLM, которые перед ответом генерируют промежуточный reasoning-трейс: пошаговое решение задачи. В отличие от обычных моделей, которые сразу выдают ответ, reasoning-модели могут возвращаться назад и исправлять ошибки. Такой подход повышает точность на сложных задачах, но требует больше вычислительных ресурсов. Управление reasoning effort позволяет пользователю выбирать баланс между качеством и скоростью: например, для простых запросов можно использовать низкий effort, а для сложных — высокий.

Основной метод обучения reasoning-моделей — RLVR. Он дает бинарный сигнал награды (0 = неверно, 1 = верно) в областях, где результат можно автоматически проверить. Для математики подходят символьные системы вроде SymPy или WolframAlpha, для кода — компилятор, юнит-тесты или платформа LeetCode. Важно, что сам reasoning-трейс не используется для обновления модели: исследователи пробовали включать эту информацию в обучающий сигнал, но в статье DeepSeek-R1 сообщается, что пользы это не принесло. Вопрос о том, стоит ли оценивать промежуточные шаги с помощью process reward models (PRM), остается открытым.

DeepSeek-R1 и Kimi K1.5, опубликованные 22 января 2025 года, популяризировали RLVR — обучение с проверяемыми наградами.

Одной награды за результат оказалось достаточно, чтобы модель научилась рассуждать: записывать промежуточные объяснения, возвращаться назад и исправлять собственные ошибки. Такие ситуации называют ага-моментами. Хотя DeepSeek-R1 — самая известная работа, в тот же день, 22 января 2025 года, на arXiv вышла статья Kimi K1.5, а термин RLVR появился двумя месяцами раньше в работе Tülu 3. DeepSeek-R1 примечательна тем, что показала: reasoning можно получить с помощью чистого reinforcement learning, без предварительного supervised fine-tuning (SFT). Модель DeepSeek-R1-Zero, обученная только с помощью RLVR, слабее полной R1, но демонстрирует достаточность этого подхода.

Для практического применения важно, что reasoning-модели с настройками effort, как в GPT-5.6, позволяют адаптировать модель под конкретные задачи. Например, в чат-ботах можно использовать низкий effort для быстрых ответов, а в аналитических системах — высокий для сложных вычислений. Это снижает затраты на инференс и делает технологию доступнее. Однако остаются открытые вопросы: как оптимально обучать модели с несколькими уровнями effort и как оценивать качество промежуточных рассуждений. Индустрия движется к тому, чтобы reasoning стал настраиваемым параметром, и GPT-5.6 — очередной шаг в этом направлении.