В пятницу вышла новая модель Qwen3.8-27B, и первые тесты показывают, что она заметно отличается от предшественницы Qwen3.6-27B. Автор, отказавшийся от облачных подписок в пользу локальных моделей, провел несколько дней, прогоняя новинку через свои сценарии. Результат: модель отвечает практически мгновенно, не склонна к галлюцинациям и успешно справляется с длинными агентными задачами, которые раньше были не под силу Qwen3.6.

Ключевое отличие — скорость мышления. Qwen3.6-27B перед ответом тратила 20-30 секунд на размышления, иногда зацикливалась, и автору приходилось добавлять параметры вроде presence-penalty и repeat-penalty, чтобы стабилизировать вывод. Qwen3.8-27B начала отвечать сразу, с размышлением около 1 секунды. Это позволило автору увеличить лимит рассуждения (reasoning-budget) с 2048 до 4096 токенов, и он подумывает поднять его еще или вовсе убрать.

Особенно впечатлила работа модели в агентном режиме. У автора есть сценарий из 27 шагов, включающий загрузку данных из интернета, заполнение CSV, использование Python и статистических методов для анализа, а затем формирование отчета. Qwen3.6 обычно останавливалась после 8-12 шагов, из-за чего сценарий приходилось разбивать на фазы. Qwen3.8-27B выполнила все 27 шагов за 22 минуты, корректно логируя промежуточные результаты в markdown и построив финальный отчет.

Автор использует собственные настройки llama.cpp, которые он скопировал с Qwen3.6 и лишь заменил имя модели. Среди параметров: температура 0.6, top-p 0.95, top-k 20, контекст 180000 токенов, квантование Q4_K_M. Он также самостоятельно конвертирует веса в GGUF, так как готовые файлы от Unsloth его не устроили по качеству. Конвертация заняла около 14 минут, квантование — еще 5.

Автор отмечает, что на Хабре были статьи о том, что Qwen3.8 слишком долго думает и галлюцинирует, но считает это некорректным — по крайней мере, при его настройках. Он не претендует на универсальность своих параметров, но надеется, что они будут полезны другим пользователям.

Для тех, кто впервые слышит о Qwen: это семейство открытых языковых моделей от Alibaba, доступных для локального запуска. Qwen3.8-27B — версия с 27 миллиардами параметров, предназначенная для работы на потребительских GPU, таких как NVIDIA RTX 4090. Модель поддерживает агентные сценарии, где ИИ выполняет цепочки действий, используя инструменты и анализируя данные.