Автору нужно было за вечер решить практический вопрос: какой квант ставить на карту и нужна ли RTX 5090 для домашнего использования. Он арендовал у Selectel RTX PRO 6000 (96 ГБ, Blackwell) и прогнал 18 конфигураций: три модели, пять-шесть квантов на каждую, один и тот же набор из 22 реальных задач — код, русскоязычные рассуждения, форматирование. Результаты оказались неожиданными: внутри каждого семейства всё монотонно — меньше вес, быстрее ответ, но между семействами разница в скорости достигает трёх раз, а качество ответов не всегда коррелирует с размером.
Ключевое открытие — скорость MoE-моделей. Ornith-1.5-35B-A3B — это архитектура Mixture of Experts: номинально 35 млрд параметров, но активных на токен около 3 млрд. Поэтому вычисления масштабируются по активным параметрам, а не по общему весу. В отдельном прогоне (omp bench, decode-профиль) Ornith-35B держит 159–198 ток/с против 54–57 у Qwen3.8-27B — разница почти втрое. Это подтверждает, что MoE — реальный способ ускорить инференс без потери качества, но только если модель умная.
| Модель | Квант | Вес | 22/22 | ток/с |
|---|---|---|---|---|
| Ornith-9B | IQ3_M | 4.72 ГБ | 22/22 | 228.7 |
| Ornith-9B | Q4_K_M | 5.91 ГБ | 22/22 | 195.1 |
| Ornith-9B | Q5_K_M | 6.85 ГБ | 22/22 | 179.7 |
| Ornith-9B | Q6_K | 7.70 ГБ | 22/22 | 164.3 |
| Ornith-9B | Q8_0 | 9.55 ГБ | 22/22 | 144.8 |
| Ornith-35B (MoE) | IQ3_XXS | 16 ГБ | 22/22 | 259.2 |
| Ornith-35B (MoE) | Q3_K_M | 16.70 ГБ | 22/22 | 258.9 |
| Ornith-35B (MoE) | Q4_K_M | 21.86 ГБ | 22/22 | 252.8 |
| Ornith-35B (MoE) | Q5_K_M | 25.49 ГБ | 22/22 | 244.3 |
| Ornith-35B (MoE) | Q6_K | 28.43 ГБ | 21/22 | 236.0 |
| Ornith-35B (MoE) | Q8_0 | 37.81 ГБ | 22/22 | 223.7 |
| Ornith-35B (MoE) | NVFP4, прод, vLLM | 20.4 ГБ | 22/22 | 92.9 (другой движок) |
| Qwen3.8-27B | UD-IQ2_XXS | 7.27 ГБ | 22/22, но 2 пустых ответа | 124.5 |
| Qwen3.8-27B | Q3_K_XL | 13.15 ГБ | 22/22 | 87.7 |
| Qwen3.8-27B | Q4_K_XL | 18 ГБ | 22/22 | 71.8 |
| Qwen3.8-27B | Q5_K_XL | 20.88 ГБ | 22/22 | 63.3 |
| Qwen3.8-27B | Q6_K_XL | 23.56 ГБ | 22/22 | 54.4 |
| Qwen3.8-27B | NVFP4A16, прод, vLLM | 28.84 ГБ | 22/22 | 80.7 (другой движок) |
Проверка на двух содержательных промптах — числа Фибоначчи и задача про пять яблок с неоднозначным делением пополам — показала, что «быстрее» не значит «умнее». На коде все три модели дали верный ответ, хотя 35B была многословнее. На задачке про яблоки Ornith-35B вставила арабское слово «نصف» («половина») в русское предложение и дала решение с «5,5 яблок»: арифметика верна, но итог физически бессмыслен для целых фруктов. Ни Ornith-9B, ни Qwen3.8-27B этот дефект не воспроизвели: 9B честно разобрала оба варианта округления и дала целое число, Qwen ответила в две строки и сама отметила, что условие некорректно для целых яблок. Заявленные цифры Ornith-35B (Terminal-Bench 67.8 против 52.5 у Qwen3.6, SWE-bench 79 против 73.4 — обе непроверенные, из пресс-релиза) на этой проверке не подтвердились.
Qwen3.8-27B на кванте UD-IQ2_XXS (7.27 ГБ) дала пустые ответы на 2 из 22 задач, что дисквалифицирует квант для реальной работы.
Отдельно автор проверил крайние кванты. Qwen3.8-27B на UD-IQ2_XXS (7.27 ГБ) дала пустой ответ на 2 из 22 реальных задач — не таймаут, не мусор, буквально пустая строка. Обе задачи практические: Ansible-плейбук с файрвол-правилами и Python-функция очистки контактных данных. Вывод: ниже трёх бит модель не то что хуже отвечает — иногда не отвечает вовсе. Квант дисквалифицирован для реальной работы, несмотря на заманчивый размер файла. Автор отмечает, что в интернете встречал рассказы, что Q2 вообще ок, и считал своим долгом прогнать этот тест.
Единичный фактчек (про prefix caching у Mamba-гибридов в vLLM) дал шумный результат: у Ornith-9B — неверно на Q4 и Q8, верно на IQ3_M и Q5_K_M, с оговоркой на Q6_K; у Qwen — неверно на IQ2/Q3/Q5, верно на Q6_K_XL и на боевом NVFP4A16. Единственная устойчивая картина: Ornith-35B ошиблась на этом вопросе на каждом протестированном уровне — включая Q8_0 и продакшн-NVFP4. Раз ошибка не исчезает даже на самом точном кванте, дело не в квантизации, а в самой модели на этом конкретном вопросе. Автор подчёркивает: единичный фактчек — шумный сигнал о кванте, но неплохой сигнал о модели, если повторяется на каждом уровне.
Наконец, автор хотел прогнать все 18 конфигураций не только через Ollama, но и в бою — на vLLM, том же движке, что и в продакшне. Не вышло: с релиза 0.27.1 поддержка GGUF была убрана из vLLM в отдельный плагин, и опубликованный релиз плагина (v0.0.5, тег от 10 августа) вообще не знает архитектуру семейства Qwen3.5 — ни Ornith, ни Qwen3.8, это именно их гибрид Gated DeltaNet + полное внимание + MoE. Поддержка появилась в Гите плагина 19 августа, за 6 дней до замера, и потребовала три нетривиальных числовых багфикса даже для маленькой плотной модели. Единственный тест на vLLM (NVFP4, продакшн-конфигурация) показал 92.9 ток/с у Ornith-35B и 80.7 у Qwen3.8 — но это другой движок и метрика, так что сравнивать напрямую нельзя.
Итог: автор получил ответ на свой вопрос — RTX 5090 ему, скорее всего, не нужна, поскольку арендованная карта справилась со всеми задачами, а MoE-модели дают достаточную скорость. Но два нюанса остаются: двухбитные кванты ненадёжны, а заявленные бенчмарки стоит проверять на своих задачах. Для читателей это напоминание: собственный замер важнее готовой таблицы от релиз-команды, особенно при выборе кванта для продакшна.

