14 августа 2026 года Alibaba выпустила открытую модель Qwen3.8-27B, которая позиционируется как одно из самых мощных решений для локальной генерации. Релиз сопровождался обратным отсчётом на Hugging Face и ажиотажем в сообществе: модель называют «локальным Opus’ом», намекая на её способность конкурировать с закрытыми облачными моделями уровня Claude Opus 4.6 Max.

Qwen3.8-27B — это dense-модель с 27,78 млрд параметров, то есть при инференсе работают все веса разом, в отличие от MoE-архитектур, где активируются только выбранные эксперты. Вес модели — около 55,6 ГБ в BF16, что позволяет запускать её на одной мощной домашней видеокарте. Архитектурно это гибрид: 64 слоя, из которых 16 — классический full attention, а остальные 48 — линейные Gated DeltaNet слои. Такая схема обеспечивает гигантский контекст в 262 144 токена из коробки, который можно растянуть до миллиона с помощью YaRN, при этом KV-кэш не разрастается, поскольку полное внимание используется только на каждом четвёртом слое.

БенчмаркQwen3.8-27BQwen3.6-27BOpus4.6 Max
Terminal-Bench 2.173.063.078.2
SWE-bench Pro61.753.553.4
DeepSWE 1.142.213.3
QwenSWEBench79.049.363.8
LiveCodeBench v690.383.988.8
GPQA Diamond89.287.891.3
HLE30.824.040.0

По заявленным бенчмаркам модель впечатляет: Terminal-Bench 2.1 — 73.0, SWE-bench Pro — 61.7, LiveCodeBench v6 — 90.3, GPQA Diamond — 89.2. В некоторых тестах она обходит Claude Opus 4.6 Max, например, в SWE-bench Pro (61.7 против 53.4) и QwenSWEBench (79.0 против 63.8). Особенно силён прирост в агентных задачах: OSWorld-Verified вырос с 63.9 до 84.3, WebArena — с 48.8 до 64.8, SWE-MM — с 25.7 до 38.6 по сравнению с предыдущей версией Qwen3.6-27B. Это указывает на то, что модель затачивали не просто для чата, а для работы агентом — с браузером, терминалом и интерфейсами.

Архитектура гибридная: 16 слоёв полного внимания и 48 линейных Gated DeltaNet слоёв, контекст 262 144 токена.

Однако аналитики Kingy.ai отмечают несколько важных нюансов. Во-первых, все цифры предоставлены самой Alibaba, и публичность задач не делает прогон вендора независимым. Во-вторых, сравнение по SWE-bench Pro не совсем честное: компания не гоняла модель Opus заново под тем же харнессом, а взяла её официально опубликованный результат, тогда как остальных участников прогнали через доработанный набор задач с исправленными багами. В-третьих, несколько бенчмарков (QwenSWEBench, CoWorkBench, RecreationBench) — внутренние разработки Alibaba, для которых нет внешней проверяемости.

Пользователи также заметили, что по умолчанию режим размышлений установлен на xhigh прямо в чат-шаблоне, из-за чего модель думает очень долго — иногда до 49 минут. Это может завышать метрики интеллекта, но не отражается в метриках расхода токенов или времени вычислений. Тем не менее, улучшения по сравнению с Qwen3.6-27B реальны и воспроизводимы в независимых прогонах.

Qwen3.8-27B доступна под лицензией Apache 2.0, что делает её полностью открытой для коммерческого использования. Это важный шаг для тех, кто хочет развернуть мощную модель локально, не полагаясь на облачные API. Однако стоит учитывать, что для запуска потребуется видеокарта с большим объёмом памяти — около 55,6 ГБ только для весов, плюс дополнительные ресурсы для KV-кэша и вычислений.

В целом, Qwen3.8-27B — это значимое событие в мире открытых ИИ-моделей. Она демонстрирует, что открытые модели могут конкурировать с закрытыми гигантами, по крайней мере по некоторым метрикам. Но доверять цифрам вендора стоит с осторожностью, и независимые тесты покажут реальную картину.