Alibaba представила Qwen3.8-Flash-Next, мультимодальную модель на архитектуре смеси экспертов, которая служит предвестником будущей Qwen4. Модель содержит 125 млрд параметров, но активирует лишь 6 млрд на каждый токен, что позволяет добиться высокой производительности при скромных вычислительных затратах. По данным команды Qwen, Flash-Next превосходит Qwen3.7-Plus в большинстве тестов, при этом затраты на обучение составили примерно одну девятую от затрат на предшественника.
Ключевая инновация — N-gram эмбеддинг-слой, содержащий 51 млрд параметров. Этот слой работает как «фразовый словарь»: он хранит часто встречающиеся группы слов как отдельные записи и передает информацию на уровне фраз в начало сети. Важно, что этот слой размещается в обычной системной RAM, а не в памяти GPU, что снижает требования к видеопамяти и общую стоимость инференса. По словам разработчиков, такой подход обходится «относительно недорого» и станет одной из архитектурных особенностей Qwen4.
| Модель | Всего параметров | Активные параметры | DeepSWE | SWE-bench Pro | CoWorkBench | JobBench |
|---|---|---|---|---|---|---|
| Qwen3.8-Flash-Next | 125B | 6B | 58.7 | 62.5 | 73.9 | 55.7 |
| Qwen3.8-27B | 27B | 27B | 42.2 | 61.7 | 70.7 | 33.4 |
| Qwen3.7-Plus | 397B | 17B | 16.5 | 55.8 | 65.1 | 27.6 |
| DeepSeek-V4-Flash-0731 | 284B | 13B | 54.4 | 56.0 | 45.1 | 41.3 |
| Claude-Opus-4.6 (Max) | -- | -- | -- | 53.4 | 68.2 | 36.6 |
Модель поддерживает контекстное окно в 262 144 токена, расширяемое до миллиона с помощью метода YaRN. Технический отчет опубликован на GitHub, веса доступны на Hugging Face и ModelScope. Продакшн-версия под названием Qwen3.8-Flash уже доступна через QwenCloud по цене $0,16 за миллион входных токенов и $0,47 за миллион выходных. API должен заработать в ближайшее время.
Модель включает 51 млрд параметров в N-gram эмбеддинг-слое, который хранится в системной RAM, а не на GPU.

На опубликованных бенчмарках Flash-Next сравнивается с DeepSeek-V4-Flash (284 млрд параметров, 13 млрд активных) и Claude Opus 4.6 (Max). Несмотря на то что конкуренты крупнее или дороже, Flash-Next лидирует в большинстве задач. Особенно сильны результаты в агентном кодинге: 58,7 балла на DeepSWE и 62,5 на SWE-bench Pro, что выше, чем у обоих соперников. Разрыв в офисных задачах еще больше: 73,9 на CoWorkBench против 45,1 у DeepSeek-V4-Flash. На JobBench Flash-Next набрал 55,7, почти вдвое больше, чем Qwen3.7-Plus (27,6). В научных рассуждениях (GPQA Diamond: 91,7) и соревновательном программировании (LiveCodeBench v6: 91,9) модели близки.
Ценовая политика Alibaba продолжает давить на конкурентов. Флагманская Qwen3.8-Max, представленная в начале августа, стоит $2 за миллион входных токенов, тогда как Flash-Next — всего $0,16, то есть примерно в 12 раз дешевле. Это усиливает давление на OpenAI и Anthropic, которые вынуждены снижать цены. Например, OpenAI недавно предложила существенные скидки на линейку GPT-5.6. Для пользователей это выгодно, но для провайдеров ИИ создает проблемы с быстрым ростом выручки, необходимым для поддержания инвестиционной привлекательности.
Как и в случае с любыми бенчмарками, реальная производительность может отличаться от тестовых результатов. Тем не менее Qwen3.8-Flash-Next демонстрирует, что эффективные архитектуры могут конкурировать с гигантскими моделями, открывая путь к более доступным ИИ-решениям.



