Запуск больших MoE-моделей вроде Qwen, DeepSeek или Mixtral на локальной машине часто сопровождается разочарованием: скорость генерации токенов оказывается в разы ниже ожидаемой. Проблема почти всегда не в самой модели, а в конфигурации окружения. Практический чек-лист, основанный на опыте автора статьи на стенде с RTX 4070 (12 ГБ), i5-12600K и DDR5-6000, помогает системно выявить узкое место.
Первый шаг — проверка скорости оперативной памяти. В MoE-архитектуре (Mixture of Experts) веса экспертов часто подгружаются из системной RAM, поэтому пропускная способность памяти напрямую влияет на скорость генерации. Теоретический пик dual-channel DDR5-6000 составляет около 96 ГБ/с, что заметно ниже 504 ГБ/с у RTX 4070. Если профиль XMP не активирован, реальная скорость может быть вдвое ниже. Включение XMP в BIOS на стенде автора восстановило скорость генерации MoE примерно с одной трети от нормального уровня. Проверить текущую скорость можно командой `sudo dmidecode -t memory | grep -E "Speed|Configured"`.
| Компонент | Пропускная способность |
|---|---|
| RTX 4070 (VRAM) | 504 ГБ/с |
| Dual-channel DDR5-6000 | 96 ГБ/с |
Второй шаг — размещение слоев модели между GPU и CPU. Для MoE это основная оптимизация: цель — держать как можно больше блоков на GPU, особенно ранние слои и внимание, выгружая веса экспертов в RAM. В llama.cpp доступны ручные параметры (`--n-gpu-layers`, `--override-tensor`), автоматический режим `--fit`, а также утилита `llama-fit-params`, которая рассчитывает параметры размещения без запуска сервера. Важно: если вы явно задаёте параметры размещения, автоматический fitter не переопределяет их.
Оптимальное размещение слоев между GPU и CPU — ключевая настройка для гибридных конфигураций, позволяющая держать ранние слои на GPU.
Третий шаг — привязка процессов к ядрам CPU на гибридных процессорах Intel. На Linux E-ядра (Efficient-core) имеют упрощённую архитектуру и низкую тактовую частоту, что может существенно замедлить инференс. Использование команды `taskset` для привязки llama-server к P-ядрам (Performance-core) устраняет этот фактор.
Эти три шага покрывают большинство случаев, когда MoE-модель тормозит на локальной машине. Начните с памяти — это самая частая причина, затем переходите к размещению слоёв и только потом к привязке ядер. Системный подход позволяет быстро вернуть скорость генерации к ожидаемому уровню.

