12 августа Alibaba выложила в открытый доступ веса Qwen3.8-2.4T-A95B — первой модели класса Qwen-Max, доступной в виде open weights. До этого флагманские модели Qwen распространялись только через API, и публикация весов меняет расклад для команд, которые хотят держать inference внутри своей инфраструктуры.
Модель построена на fine-grained Mixture of Experts: 512 routed-экспертов и один shared, из которых на каждом токене активируются 10 routed-экспертов. Всего 92 слоя, 2,4 трлн параметров, но только около 95 млрд активны за один forward pass. Это ключевая деталь: стоимость обслуживания привязана к активным параметрам, а не к полному объёму. Схема слоёв повторяется как 3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE).
| Параметр | Значение |
|---|---|
| Всего параметров | 2,4 трлн |
| Активных параметров на токен | 95 млрд |
| Архитектура | Fine-grained MoE, 512 routed + 1 shared |
| Активируемых routed-экспертов на токен | 10 |
| Слоёв | 92 |
| Схема слоёв | 3 × (Gated DeltaNet → MoE) → 1 × (Gated Attention → MoE) |
| Контекст нативный | 262 144 токена |
| Контекст расширяемый | до 1 010 000 токенов |
| Максимальная длина вывода | 128 тыс. токенов |
| Multi-Token Prediction | Встроенные MTP draft-головы |
Гибридное внимание решает проблему длинного контекста. 69 из 92 слоёв используют Gated DeltaNet — линейное внимание с ограниченным рекуррентным состоянием, которое заменяет растущий KV-кэш памятью фиксированного размера. Оставшиеся 23 слоя — полное квадратичное Gated Attention для точных взаимодействий между токенами. Пропорция 3:1 удерживает и вычисления, и память в разумных границах при масштабировании контекста к 1 млн токенов. Для агентных сценариев, где накапливаются выводы инструментов, код и цепочки рассуждений, это критичное свойство.
Архитектура: fine-grained MoE, 512 routed-экспертов плюс один shared, 92 слоя, 95 млрд активных параметров на токен.

Нативная длина контекста — 262 144 токена, расширяемая до 1 010 000. Максимальная длина вывода — 128 тыс. токенов. Встроенный параметр reasoning_effort (low, medium, high) позволяет управлять глубиной рассуждений на уровне запроса: поднимать для сложных многошаговых задач и опускать для высоконагруженных операций. Модель также поддерживает Multi-Token Prediction через собственные draft-головы, что даёт speculative decoding без отдельной вспомогательной модели.
Веса опубликованы на Hugging Face в стандартном формате Transformers. Квантования MXFP4 и NVFP4 (W4A4) сжимают модель примерно до 1,2 ТБ — этого достаточно, чтобы разместить её на одном узле из 8 GPU NVIDIA B300 Blackwell Ultra. По бенчмаркам вендора Qwen3.8-2.4T-A95 показывает 93,0 на PaperBench, 82,8 на IFBench и 86,6 на terminal-based coding. Запас остаётся на сложных задачах уровня репозитория (SWE-bench Pro) и общем использовании инструментов (Toolathlon).
Развёртывание модели такого размера — не только вопрос GPU. Нужна оркестрация загрузки весов, планирования контейнеров, мониторинга здоровья, автомасштабирования и обработки отказов узлов. AWS описывает запуск на Amazon SageMaker HyperPod с vLLM на инстансе ml.p6-b300: кластеры используют Amazon EKS как control plane, а AWS берёт на себя жизненный цикл инфраструктуры — сеть, хранилище, установку драйверов GPU и плагин NVIDIA. Это второй материал серии AWS про развёртывание открытых триллионных моделей: первый был посвящён Kimi K3.
Для организаций, которые ищут self-hosted альтернативу проприетарным API, Qwen3.8-2.4T-A95B — заявка на frontier-класс, особенно в кодинг-агентах и исследовательских пайплайнах. Открытые веса дают полный контроль: данные не покидают инфраструктуру, поведение inference можно настраивать, а при больших объёмах исчезают per-token платежи. Обратная сторона — операционная: для 2,4-триллионной модели нужен специально подобранный GPU-парк и оптимизированный стек обслуживания.


