Автору нужно было за вечер решить практический вопрос: какой квант ставить на карту и нужна ли RTX 5090 для домашнего использования. Он арендовал у Selectel RTX PRO 6000 (96 ГБ, Blackwell) и прогнал 18 конфигураций: три модели, пять-шесть квантов на каждую, один и тот же набор из 22 реальных задач — код, русскоязычные рассуждения, форматирование. Результаты оказались неожиданными: внутри каждого семейства всё монотонно — меньше вес, быстрее ответ, но между семействами разница в скорости достигает трёх раз, а качество ответов не всегда коррелирует с размером.

Ключевое открытие — скорость MoE-моделей. Ornith-1.5-35B-A3B — это архитектура Mixture of Experts: номинально 35 млрд параметров, но активных на токен около 3 млрд. Поэтому вычисления масштабируются по активным параметрам, а не по общему весу. В отдельном прогоне (omp bench, decode-профиль) Ornith-35B держит 159–198 ток/с против 54–57 у Qwen3.8-27B — разница почти втрое. Это подтверждает, что MoE — реальный способ ускорить инференс без потери качества, но только если модель умная.

МодельКвантВес22/22ток/с
Ornith-9BIQ3_M4.72 ГБ22/22228.7
Ornith-9BQ4_K_M5.91 ГБ22/22195.1
Ornith-9BQ5_K_M6.85 ГБ22/22179.7
Ornith-9BQ6_K7.70 ГБ22/22164.3
Ornith-9BQ8_09.55 ГБ22/22144.8
Ornith-35B (MoE)IQ3_XXS16 ГБ22/22259.2
Ornith-35B (MoE)Q3_K_M16.70 ГБ22/22258.9
Ornith-35B (MoE)Q4_K_M21.86 ГБ22/22252.8
Ornith-35B (MoE)Q5_K_M25.49 ГБ22/22244.3
Ornith-35B (MoE)Q6_K28.43 ГБ21/22236.0
Ornith-35B (MoE)Q8_037.81 ГБ22/22223.7
Ornith-35B (MoE)NVFP4, прод, vLLM20.4 ГБ22/2292.9 (другой движок)
Qwen3.8-27BUD-IQ2_XXS7.27 ГБ22/22, но 2 пустых ответа124.5
Qwen3.8-27BQ3_K_XL13.15 ГБ22/2287.7
Qwen3.8-27BQ4_K_XL18 ГБ22/2271.8
Qwen3.8-27BQ5_K_XL20.88 ГБ22/2263.3
Qwen3.8-27BQ6_K_XL23.56 ГБ22/2254.4
Qwen3.8-27BNVFP4A16, прод, vLLM28.84 ГБ22/2280.7 (другой движок)

Проверка на двух содержательных промптах — числа Фибоначчи и задача про пять яблок с неоднозначным делением пополам — показала, что «быстрее» не значит «умнее». На коде все три модели дали верный ответ, хотя 35B была многословнее. На задачке про яблоки Ornith-35B вставила арабское слово «نصف» («половина») в русское предложение и дала решение с «5,5 яблок»: арифметика верна, но итог физически бессмыслен для целых фруктов. Ни Ornith-9B, ни Qwen3.8-27B этот дефект не воспроизвели: 9B честно разобрала оба варианта округления и дала целое число, Qwen ответила в две строки и сама отметила, что условие некорректно для целых яблок. Заявленные цифры Ornith-35B (Terminal-Bench 67.8 против 52.5 у Qwen3.6, SWE-bench 79 против 73.4 — обе непроверенные, из пресс-релиза) на этой проверке не подтвердились.

Qwen3.8-27B на кванте UD-IQ2_XXS (7.27 ГБ) дала пустые ответы на 2 из 22 задач, что дисквалифицирует квант для реальной работы.

Отдельно автор проверил крайние кванты. Qwen3.8-27B на UD-IQ2_XXS (7.27 ГБ) дала пустой ответ на 2 из 22 реальных задач — не таймаут, не мусор, буквально пустая строка. Обе задачи практические: Ansible-плейбук с файрвол-правилами и Python-функция очистки контактных данных. Вывод: ниже трёх бит модель не то что хуже отвечает — иногда не отвечает вовсе. Квант дисквалифицирован для реальной работы, несмотря на заманчивый размер файла. Автор отмечает, что в интернете встречал рассказы, что Q2 вообще ок, и считал своим долгом прогнать этот тест.

Единичный фактчек (про prefix caching у Mamba-гибридов в vLLM) дал шумный результат: у Ornith-9B — неверно на Q4 и Q8, верно на IQ3_M и Q5_K_M, с оговоркой на Q6_K; у Qwen — неверно на IQ2/Q3/Q5, верно на Q6_K_XL и на боевом NVFP4A16. Единственная устойчивая картина: Ornith-35B ошиблась на этом вопросе на каждом протестированном уровне — включая Q8_0 и продакшн-NVFP4. Раз ошибка не исчезает даже на самом точном кванте, дело не в квантизации, а в самой модели на этом конкретном вопросе. Автор подчёркивает: единичный фактчек — шумный сигнал о кванте, но неплохой сигнал о модели, если повторяется на каждом уровне.

Наконец, автор хотел прогнать все 18 конфигураций не только через Ollama, но и в бою — на vLLM, том же движке, что и в продакшне. Не вышло: с релиза 0.27.1 поддержка GGUF была убрана из vLLM в отдельный плагин, и опубликованный релиз плагина (v0.0.5, тег от 10 августа) вообще не знает архитектуру семейства Qwen3.5 — ни Ornith, ни Qwen3.8, это именно их гибрид Gated DeltaNet + полное внимание + MoE. Поддержка появилась в Гите плагина 19 августа, за 6 дней до замера, и потребовала три нетривиальных числовых багфикса даже для маленькой плотной модели. Единственный тест на vLLM (NVFP4, продакшн-конфигурация) показал 92.9 ток/с у Ornith-35B и 80.7 у Qwen3.8 — но это другой движок и метрика, так что сравнивать напрямую нельзя.

Итог: автор получил ответ на свой вопрос — RTX 5090 ему, скорее всего, не нужна, поскольку арендованная карта справилась со всеми задачами, а MoE-модели дают достаточную скорость. Но два нюанса остаются: двухбитные кванты ненадёжны, а заявленные бенчмарки стоит проверять на своих задачах. Для читателей это напоминание: собственный замер важнее готовой таблицы от релиз-команды, особенно при выборе кванта для продакшна.