Sber опубликовала GigaChat 3.5 Reasoning — первую модель в линейке GigaChat с полноценным режимом рассуждения. Веса и код запуска выложены на Hugging Face, попробовать модель можно в giga.chat. Обучение заняло больше 9 месяцев и построено на технологии online RL, при которой модель сама производит обучающие данные по ходу решения задач, а не берёт их из заранее собранного датасета.

Ключевое отличие от предыдущей версии GigaChat 3.5 Instant видно по бенчмаркам. На GPQA-Diamond результат вырос с 61,11 до 82,32, на AIME-2026 (mean@32) — с 67 до 92, на IFBench Loose Prompt — с 43,66 до 77,00. GPQA-Diamond — набор сложных научных вопросов уровня аспирантуры, AIME — олимпиадная математика, IFBench проверяет следование инструкциям. Такой рост на всех трёх метриках сразу говорит о том, что модель научилась не просто запоминать шаблоны ответов, а выстраивать цепочку рассуждений.

БенчмаркGigaChat 3.5 InstantGigaChat 3.5 Reasoning
GPQA-Diamond61,1182,32
AIME-2026 (mean@32)6792
IFBench Loose Prompt43,6677,00

Схема обучения выглядит так: из SFT-чекпоинта вырастили шесть отдельных экспертов — по одному на домен, каждый со своей наградой. Это STEM (математика, олимпиадные задачи, естественные науки), Code (алгоритмы, правки кода, генерация тестов), Code Agent (задачи в духе SWE-bench в реальном репозитории), General Agent (function calling, диалог, память, поиск), социальное взаимодействие и следование инструкциям. Затем шесть моделей собрали обратно в одну через on-policy distillation.

Веса и код запуска опубликованы на Hugging Face, доступна также демонстрация в giga.chat.

Почему не учили одну модель сразу всему? В Sber столкнулись с двумя ограничениями. Домены конкурируют за одни и те же веса: прогресс в коде откатывал качество на диалогах. И оценивать домены приходится по-разному — у задачи по алгебре есть эталонный ответ, а у совета, как написать письмо, такого ответа не существует. Разделение на экспертов позволило настроить награду точнее под каждый тип задач.

Для обучения использован алгоритм CISPO из работы MiniMax-M1. Он близок к GRPO: на каждую задачу модель пишет несколько ответов, удачные подкрепляются, неудачные подавляются. Разница в том, как ограничивается размер шага обновления. GRPO выключает обучение на токенах, которые стали слишком вероятными или слишком редкими. У рассуждающей модели самые важные токены как раз редкие — «однако», «проверим», «стоп, здесь ошибка». SFT-модель такие слова почти не пишет, и при обучении они первыми выпадают за границу. CISPO не выключает токены, а придавливает вклад тех, что слишком далеко ушли, — сигнал доходит до всех токенов, включая редкие развилки. Авторы MiniMax показали ускорение сходимости на AIME 2024, в Sber тот же эффект повторился на доменных экспертах.

Отдельная деталь — расписание задач. Если модель решает задачу во всех попытках, награды в группе одинаковые, среднее равно каждому ответу и градиент нулевой. Такие задачи бесполезны для обучения, поэтому сложность поднимается вместе с моделью.

Публикация весов и кода запуска на Hugging Face делает GigaChat 3.5 Reasoning доступной для внешних разработчиков и исследователей. Это ставит её в один ряд с открытыми reasoning-моделями других лабораторий — DeepSeek-R1, Qwen и Llama-серии. Для российского рынка это первый случай, когда модель с режимом рассуждения выходит в open-source, а не остаётся только внутри проприетарного API. Что именно можно будет делать с весами на практике — дообучать под свои задачи, запускать локально или встраивать в продукты — зависит от лицензии и требований к железу, которые в анонсе не детализированы.