Sber опубликовала GigaChat 3.5 Reasoning — первую модель в линейке GigaChat с полноценным режимом рассуждения. Веса и код запуска выложены на Hugging Face, попробовать модель можно в giga.chat. Обучение заняло больше 9 месяцев и построено на технологии online RL, при которой модель сама производит обучающие данные по ходу решения задач, а не берёт их из заранее собранного датасета.
Ключевое отличие от предыдущей версии GigaChat 3.5 Instant видно по бенчмаркам. На GPQA-Diamond результат вырос с 61,11 до 82,32, на AIME-2026 (mean@32) — с 67 до 92, на IFBench Loose Prompt — с 43,66 до 77,00. GPQA-Diamond — набор сложных научных вопросов уровня аспирантуры, AIME — олимпиадная математика, IFBench проверяет следование инструкциям. Такой рост на всех трёх метриках сразу говорит о том, что модель научилась не просто запоминать шаблоны ответов, а выстраивать цепочку рассуждений.
| Бенчмарк | GigaChat 3.5 Instant | GigaChat 3.5 Reasoning |
|---|---|---|
| GPQA-Diamond | 61,11 | 82,32 |
| AIME-2026 (mean@32) | 67 | 92 |
| IFBench Loose Prompt | 43,66 | 77,00 |
Схема обучения выглядит так: из SFT-чекпоинта вырастили шесть отдельных экспертов — по одному на домен, каждый со своей наградой. Это STEM (математика, олимпиадные задачи, естественные науки), Code (алгоритмы, правки кода, генерация тестов), Code Agent (задачи в духе SWE-bench в реальном репозитории), General Agent (function calling, диалог, память, поиск), социальное взаимодействие и следование инструкциям. Затем шесть моделей собрали обратно в одну через on-policy distillation.
Веса и код запуска опубликованы на Hugging Face, доступна также демонстрация в giga.chat.
Почему не учили одну модель сразу всему? В Sber столкнулись с двумя ограничениями. Домены конкурируют за одни и те же веса: прогресс в коде откатывал качество на диалогах. И оценивать домены приходится по-разному — у задачи по алгебре есть эталонный ответ, а у совета, как написать письмо, такого ответа не существует. Разделение на экспертов позволило настроить награду точнее под каждый тип задач.
Для обучения использован алгоритм CISPO из работы MiniMax-M1. Он близок к GRPO: на каждую задачу модель пишет несколько ответов, удачные подкрепляются, неудачные подавляются. Разница в том, как ограничивается размер шага обновления. GRPO выключает обучение на токенах, которые стали слишком вероятными или слишком редкими. У рассуждающей модели самые важные токены как раз редкие — «однако», «проверим», «стоп, здесь ошибка». SFT-модель такие слова почти не пишет, и при обучении они первыми выпадают за границу. CISPO не выключает токены, а придавливает вклад тех, что слишком далеко ушли, — сигнал доходит до всех токенов, включая редкие развилки. Авторы MiniMax показали ускорение сходимости на AIME 2024, в Sber тот же эффект повторился на доменных экспертах.
Отдельная деталь — расписание задач. Если модель решает задачу во всех попытках, награды в группе одинаковые, среднее равно каждому ответу и градиент нулевой. Такие задачи бесполезны для обучения, поэтому сложность поднимается вместе с моделью.
Публикация весов и кода запуска на Hugging Face делает GigaChat 3.5 Reasoning доступной для внешних разработчиков и исследователей. Это ставит её в один ряд с открытыми reasoning-моделями других лабораторий — DeepSeek-R1, Qwen и Llama-серии. Для российского рынка это первый случай, когда модель с режимом рассуждения выходит в open-source, а не остаётся только внутри проприетарного API. Что именно можно будет делать с весами на практике — дообучать под свои задачи, запускать локально или встраивать в продукты — зависит от лицензии и требований к железу, которые в анонсе не детализированы.
