Компания Alibaba опубликовала на Hugging Face модель Qwen3.8-27B — это 27-миллиардная мультимодальная модель, которая по ряду бенчмарков превосходит Opus 4.6 от Anthropic. Модель уже доступна для локального запуска через llama.cpp, и первые тесты показывают, что она работает с адекватной скоростью на потребительских видеокартах с 24+ ГБ VRAM.

Qwen3.8-27B — это модель с 27 млрд параметров, которая понимает изображения и видео. Контекстное окно составляет 262K токенов, а с помощью YARN его можно расширить до 1M. Поддержка MTP (спекулятивного предсказания) позволяет ускорить генерацию. В тестах на RTX 5090 (32 ГБ VRAM) с квантом UD-Q6_K_XL модель выдаёт 100 токенов/с при контексте 48K, а с квантом UD-Q5_K_XL — 120 токенов/с при контексте 125K.

КвантКонтекстСкорость генерации
UD-Q6_K_XL48K100 т/с
UD-Q5_K_XL125K120 т/с

Для запуска на видеокартах с 24 ГБ VRAM (RTX 3090, RTX 4090) потребуется квант поменьше или частичная выгрузка в обычную память. Специальный квант для 16 ГБ VRAM также доступен на Hugging Face, но автор теста его не проверял. По личным ощущениям, модель стала заметно умнее предыдущих версий, и это, вероятно, лучшая модель, которую можно запустить дома с адекватной скоростью.

По мультимодальным бенчмаркам превосходит Opus 4.6, поддерживает изображения и видео.

Интересно, что у самой Qwen модель пока недоступна по API, но OpenRouter уже предлагает её по цене $0.45 за 1M входных токенов и $3.20 за 1M выходных. Для сравнения, локальный запуск на собственной видеокарте может быть более экономичным, особенно при интенсивном использовании.

Модель доступна в виде GGUF-квантов от unsloth, что упрощает запуск через llama.cpp. Автор теста также предоставил Docker-конфигурацию для запуска в контейнере. Демо-версия, запущенная на RTX 5090, доступна по ссылке, но может не работать из-за нагрузки на сервер.

Qwen3.8-27B — это пример того, как открытые модели догоняют и даже превосходят проприетарные аналоги в отдельных задачах, оставаясь доступными для локального использования. Это важно для разработчиков и исследователей, которым нужна высокая производительность без зависимости от облачных API.