Alibaba представила Qwen3.8-Flash-Next, мультимодальную модель на архитектуре смеси экспертов, которая служит предвестником будущей Qwen4. Модель содержит 125 млрд параметров, но активирует лишь 6 млрд на каждый токен, что позволяет добиться высокой производительности при скромных вычислительных затратах. По данным команды Qwen, Flash-Next превосходит Qwen3.7-Plus в большинстве тестов, при этом затраты на обучение составили примерно одну девятую от затрат на предшественника.

Ключевая инновация — N-gram эмбеддинг-слой, содержащий 51 млрд параметров. Этот слой работает как «фразовый словарь»: он хранит часто встречающиеся группы слов как отдельные записи и передает информацию на уровне фраз в начало сети. Важно, что этот слой размещается в обычной системной RAM, а не в памяти GPU, что снижает требования к видеопамяти и общую стоимость инференса. По словам разработчиков, такой подход обходится «относительно недорого» и станет одной из архитектурных особенностей Qwen4.

МодельВсего параметровАктивные параметрыDeepSWESWE-bench ProCoWorkBenchJobBench
Qwen3.8-Flash-Next125B6B58.762.573.955.7
Qwen3.8-27B27B27B42.261.770.733.4
Qwen3.7-Plus397B17B16.555.865.127.6
DeepSeek-V4-Flash-0731284B13B54.456.045.141.3
Claude-Opus-4.6 (Max)------53.468.236.6

Модель поддерживает контекстное окно в 262 144 токена, расширяемое до миллиона с помощью метода YaRN. Технический отчет опубликован на GitHub, веса доступны на Hugging Face и ModelScope. Продакшн-версия под названием Qwen3.8-Flash уже доступна через QwenCloud по цене $0,16 за миллион входных токенов и $0,47 за миллион выходных. API должен заработать в ближайшее время.

Модель включает 51 млрд параметров в N-gram эмбеддинг-слое, который хранится в системной RAM, а не на GPU.

The N-gram embedding layer (bottom, purple) feeds phrase-level information into the start of the network. It accounts for 51 billion parameters but runs in system RAM instead of GPU memory. | Image: Alibaba / Qwen
The N-gram embedding layer (bottom, purple) feeds phrase-level information into the start of the network. It accounts for 51 billion parameters but runs in system RAM instead of GPU memory. | Image: Alibaba / Qwen · Источник: The Decoder

На опубликованных бенчмарках Flash-Next сравнивается с DeepSeek-V4-Flash (284 млрд параметров, 13 млрд активных) и Claude Opus 4.6 (Max). Несмотря на то что конкуренты крупнее или дороже, Flash-Next лидирует в большинстве задач. Особенно сильны результаты в агентном кодинге: 58,7 балла на DeepSWE и 62,5 на SWE-bench Pro, что выше, чем у обоих соперников. Разрыв в офисных задачах еще больше: 73,9 на CoWorkBench против 45,1 у DeepSeek-V4-Flash. На JobBench Flash-Next набрал 55,7, почти вдвое больше, чем Qwen3.7-Plus (27,6). В научных рассуждениях (GPQA Diamond: 91,7) и соревновательном программировании (LiveCodeBench v6: 91,9) модели близки.

Ценовая политика Alibaba продолжает давить на конкурентов. Флагманская Qwen3.8-Max, представленная в начале августа, стоит $2 за миллион входных токенов, тогда как Flash-Next — всего $0,16, то есть примерно в 12 раз дешевле. Это усиливает давление на OpenAI и Anthropic, которые вынуждены снижать цены. Например, OpenAI недавно предложила существенные скидки на линейку GPT-5.6. Для пользователей это выгодно, но для провайдеров ИИ создает проблемы с быстрым ростом выручки, необходимым для поддержания инвестиционной привлекательности.

Как и в случае с любыми бенчмарками, реальная производительность может отличаться от тестовых результатов. Тем не менее Qwen3.8-Flash-Next демонстрирует, что эффективные архитектуры могут конкурировать с гигантскими моделями, открывая путь к более доступным ИИ-решениям.