3 августа 2026 года команда Qwen представила Qwen3.8-Max — самую крупную модель в линейке Alibaba. Заявленные характеристики впечатляют: 2,4 триллиона параметров, контекстное окно на миллион токенов (примерно три-четыре романа), а благодаря архитектуре Mixture-of-Experts на каждый запрос активируется лишь около 95 миллиардов параметров, что удерживает скорость и стоимость в разумных пределах. Модель доступна через QwenCloud, Alibaba Cloud Model Studio и новую платформу QwenWork.
Главное отличие от предыдущих релизов — Alibaba впервые открывает веса модели Max-класса. В официальном анонсе в X говорится: «Meet Qwen3.8-Max – our most capable model to date. Next week, the open weights of Qwen3.8-Max will be released, and Qwen3.8-27B is also going open-weights to meet you all!». Это шаг, который выделяет Alibaba на фоне конкурентов, часто оставляющих флагманские модели закрытыми.
| Раунд | Лучшая идея раунда | AIME24 | Прирост |
|---|---|---|---|
| – | Метод статьи (база) | 49,58% | – |
| 1 | Разделить данные по сложности | 50,42% | +0,84 |
| 2 | Взвесить по разрыву энтропии | 51,67% | +2,09 |
| 3 | Считать «сложные точки решения» ★ | 52,29% | +2,71 |
Вместо простой таблицы бенчмарков Alibaba показала пять демонстраций автономной работы. В одной из них модели дали пустую папку и задачу построить самообновляющийся CLI-инструмент oh-my-cli. За 16 дней она самостоятельно превращала запросы в GitHub Issues, писала код, гоняла тесты и мёрджила пул-реквесты. К 30 июля счётчик показывал 265 коммитов, 127 PR и 151 закрытую задачу. Проект открыт на GitHub.
Alibaba впервые открывает веса модели Max-класса — Qwen3.8-Max и Qwen3.8-27B станут доступны на следующей неделе.
В другом кейсе модель воспроизвела научную статью «Unified data selection for LLM reasoning» без единой строчки кода. За пять суток (около 125 часов) она написала примерно 7600 строк кода и провела 33 раунда GPU-обучения. Сначала были воспроизведены все шесть ключевых результатов, затем запущен цикл самоулучшения, который позволил обойти оригинал на 2,7 балла на бенчмарке AIME24. Модель также заявили на реальное соревнование WWW2025 Multimodal Dialogue Intent Recognition Challenge: за 24 часа через 45 итераций точность выросла с 0,60 до 0,853, обойдя 87% участников — 458 из 526 живых команд.
Эти демонстрации подчёркивают сдвиг в индустрии: раньше нейросеть измеряли качеством одного ответа, теперь — тем, сколько дней она способна не терять нить задачи. Однако есть и тревожный сигнал. Независимая проверка разошлась с вендорскими цифрами, что вызвало дискуссию в соцсетях. Показателен пример с бенчмарком ARC-AGI: топовые модели показывали единичные проценты — GPT-5.6 Sol брал 7% при цене прогона $21 тыс. Но когда сторонняя команда поместила ту же модель в улучшенный харнесс, результат подскочил до 95% и 99% без дообучения. Это ставит вопрос: насколько официальные харнессы лабораторий уступают сторонним? Например, GLM-5.2 в стороннем харнессе Pi обходит Opus 4.8 в родном для Anthropic Claude Code.
Релиз Qwen3.8-Max также подсвечивает тренд: дело, возможно, не в самой модели, а в инфраструктуре вокруг неё. Alibaba продолжает расширять экосистему: недавно вышла Qwen-Image-3.0 — генератор изображений с фокусом на реальность, умеющий рендерить текст размером до 10 пикселей. Открытие весов Max-класса может привлечь разработчиков, которые смогут адаптировать модель под свои задачи, что усилит позиции Alibaba на рынке ИИ.

