Инженеры развернули DeepSeek-V4-Flash (284B параметров, ~13B активных на токен, MoE с 256 экспертами) на двух NVIDIA DGX Spark — настольных системах на базе GB10 (Grace-Blackwell, SM121) с unified memory по 128 ГБ на ноду. Целью была параллельная работа исследовательского агента и длительной генерации без очереди. Изначально при двух одновременных запросах скорость генерации падала почти до нуля, поэтому временно запретили параллельность, выставив --max-num-seqs = 1. Это прятало симптом, но не решало проблему.

Диагноз оказался неверным: дело было не в перегрузке GB10 параллельной нагрузкой, а в том, что под SM121 не был включён корректный attention-путь — sparse-MLA. Без него vLLM либо не стартовал, либо сваливался в неподходящий бэкенд. После включения sparse-MLA через переменную VLLM_TRITON_MLA_SPARSE=1 и увеличения max-num-seqs до 8 очередь исчезла. Вторым ключевым изменением стало включение prefix caching (--enable-prefix-caching), критичное для агентных сценариев: ресёрч-агент гоняет один и тот же длинный контекст между шагами, и кэш позволил избежать повторного префилла на 40+ тысяч токенов. В бою доля попаданий в кэш достигла 88%.

ПараметрЗначение
Количество запросов за 2 часа220
Средняя длина промпта42 565 токенов
Пик running / waiting4 / 0
KV-кэш (макс.)44.6%
Пиковая aggregate скорость71 tok/s
Prefix cache hit rate88%

Штатная MTP-спекуляция DeepSeek работала стабильно с acceptance 55–64%. Параллелизм — tensor parallel TP=2 на две ноды через QSFP 200G / RoCEv2 / RDMA. Из неработавших подходов: MRV2, Expert Parallel поверх B12X MoE и внешний DFlash-драфтер. Для проверки использовали простой sanity-check: запрос столицы Франции — ответ «Париж» подтверждал связность, а не просто HTTP 200. Результаты: 220 запросов за 2 часа, средний prompt 42 565 токенов, пик 4 running / 0 waiting, KV-кэш до 44.6%, peak aggregate 71 tok/s. Основные выводы: consumer Blackwell (SM121) требует ручной настройки attention-пути, а не работающие из коробки оптимизации датацентрового Blackwell.

Основной фикс — поднятие --max-num-seqs с 1 до 8 и включение sparse-MLA для SM121.