В прошлом материале автор сравнивал Qwen3.8-27B на арендованной RTX PRO 6000 с DeepSeek V4 Flash по API. Тогда локальная модель показала 0.789 балла, а API — 0.731. Комментаторы задали логичный вопрос: что будет, если поставить DeepSeek на ту же карту, урезав до 2 бит? Автор решил проверить, добавив в тест две новые модели — Ornith-9B и Ornith-35B.

Бенчмарк — lii-code-bench-ru: 50 задач, замороженный сид, ансамбль из трёх судей (gemini + gpt-5.1 + opus-4.8). DeepSeek V4 Flash 0731 — 284 млрд параметров, 13 активных. Квант UD-IQ2_XXS от Unsloth: маршрутизатор и общие эксперты остаются в Q8/F16, сжимаются только эксперты. Перед тестом автор прогнал сетку контекстов на реальной карте: 131072, 393216, 524288, 1048576 токенов, всегда --parallel 1. Реальная цена KV-кэша оказалась ≈9 КБ/токен, а не 26.3 КБ, как было ошибочно рассчитано ранее. Декод держался на ~66 ток/с при любом размере контекста. В работу взяли 512K — вдвое больше потолка Qwen3.8, с запасом 6.4 ГБ до предела карты.

МодельБаллУспешных заданийток/сTTFT
Qwen3.8-27B, NVFP4, своя карта0.78946/5056-59827 мс
DeepSeek V4 Flash, API, полная точность0.73142/5053.315.95 с
Ornith-35B (MoE), своя карта0.72942/50236.54.81 с
DeepSeek V4 Flash, IQ2_XXS, своя карта0.69735/5066.88.48 с
Ornith-9B, своя карта0.62831/50123.69.31 с

Первый прогон DeepSeek оценивался одним судьёй (gemini) и дал 0.681 — выше, чем любой локальный Qwen на тот момент. Автор поспешил заявить победу, но позже заметил ошибку: все сравнимые замеры шли на ансамбле из трёх судей, а его — на одном. Пересчёт на полном ансамбле дал 0.697. Вторая ошибка — автор держал в голове устаревший результат лучшего локального Qwen (0.628 из старой таблицы), тогда как актуальный прогон давал 0.789. Итог: заголовок развернулся на 180 градусов — локальная модель всё-таки уступает API.

Ornith-35B-A3B (MoE) впервые протестирован: 0.729 балла, 42/50 задач, декод 236.5 ток/с — быстрее DeepSeek API в 4.4 раза.

Бенчмарк оказался дорогим: при замере Ornith два прогона подряд возвращали ошибку PermissionDeniedError на трети задач — баланс OpenRouter почти исчерпан (потрачено 456.5 из 460 долларов). Выяснилось, что поле limit_remaining не отражает общий баланс аккаунта; помог GET /api/v1/credits. После пополнения счёта прогоны прошли чисто.

Неожиданностью стал Ornith-35B-A3B (MoE, около трёх активных параметров на токен). Результат: 0.729, 42 из 50 задач — ровно столько же, сколько у DeepSeek по API, но декод в 4.4 раза быстрее (236.5 против 53.3 ток/с). До замены Qwen3.8 в продакшене по чистым цифрам не дотягивает: разница 0.06 балла и 4 задачи.

Отдельно автор разобрал задержку: omp bench с параметрами по умолчанию (--par 4) показал TTFT 14-23 секунды, что выглядело как приговор reasoning-модели. Но причина — в конфигурации: DeepSeek развёрнут с --parallel 1 (единственный слот для максимального контекста). Четыре параллельных запроса упирались в очередь. Перепрогон с --par 1 дал TTFT 239 мс — лучший результат среди всех моделей на карте, включая Qwen (827 мс).

Несмотря на интересные результаты, автор не ставит DeepSeek в продакшн: 304 млрд параметров, MIT, 2-битное сжатие, минус 0.034 балла и 7 задач против полной точности. Судьи цитируют конкретные артефакты: выдуманные цифры производительности несуществующих связок, рекомендации квантования, противоречащие условию задачи. Это ожидаемо для 2-битного сжатия маршрутизируемых экспертов. Тем не менее модель остаётся интересной: лучшее TTFT, второй по скорости декод среди всех измеренных на этой карте, вдвое больший контекст, чем у Qwen.