Запуск LLM с сотнями миллиардов параметров, таких как LLaMA 3 70B или DeepSeek-V3, обычно ассоциируется с серверными стойками и бюджетами в миллионы рублей. Однако техника квантизации позволяет сжимать модели в 4–8 раз, сохраняя приемлемое качество, и запускать их на потребительских видеокартах. Например, LLaMA 3 70B в формате INT4 занимает около 35 ГБ вместо 280 ГБ в FP32 — это умещается в RTX 4090 с 24 ГБ? Нет, 35 ГБ больше 24 ГБ, но влезает в RTX A6000 или две RTX 4090. На практике это делает большие модели доступными для энтузиастов и небольших компаний.
Квантизация — это процесс снижения точности чисел, которыми представлены веса нейросети. По умолчанию параметры хранятся в FP32 (32-битное число с плавающей запятой), что занимает 4 байта на параметр. Квантизация переводит их в INT8 (1 байт) или INT4 (0,5 байта), уменьшая потребление памяти и ускоряя инференс. Это похоже на сжатие JPEG: файл становится легче, но визуально разница почти незаметна. Для LLM потеря качества при 8-битном сжатии минимальна, а при 4-битном — заметна, но часто приемлема.
| Модель | FP32 (4 байт/пар.) | FP16/BF16 (2 байт/пар.) | INT8 (1 байт/пар.) | INT4 (0.5 байт/пар.) |
|---|---|---|---|---|
| LLaMA 3 8B (8B) | ~32.0 ГБ | ~16.0 ГБ | ~8.0 ГБ | ~4.0 ГБ |
| Mistral 7B (7B) | ~28.0 ГБ | ~14.0 ГБ | ~7.0 ГБ | ~3.5 ГБ |
| LLaMA 3 70B (70B) | ~280.0 ГБ | ~140.0 ГБ | ~70.0 ГБ | ~35.0 ГБ |
| Mixtral 8x7B (MoE) (46.7B) | ~186.8 ГБ | ~93.4 ГБ | ~46.7 ГБ | ~23.4 ГБ |
| DeepSeek-V3 (MoE) (671B) | ~2684.0 ГБ | ~1342.0 ГБ | ~671.0 ГБ | ~335.5 ГБ |
| Qwen 3.5-235B (MoE) (235B) | ~940.0 ГБ | ~470.0 ГБ | ~235.0 ГБ | ~117.5 ГБ |
Существует два основных подхода к квантизации: Post-Training Quantization (PTQ) и Quantization-Aware Training (QAT). PTQ — это конвертация уже обученной модели без дополнительного обучения: быстро и дёшево, но при агрессивном сжатии до 4 бит качество может просесть. QAT — это обучение модели с учётом низкой точности с самого начала: требует GPU и времени, но даёт лучшее качество при том же уровне сжатия. Для большинства задач PTQ достаточно, но для критичных сценариев QAT предпочтительнее.
Для LLaMA 3 70B INT4 требует ~35 ГБ, что умещается в RTX 4090, тогда как FP32 нужно 280 ГБ.
На практике выбор формата квантизации зависит от железа. GPTQ оптимизирован для GPU, обеспечивая высокую скорость и хорошую точность, но плохо поддерживает CPU. GGUF — формат для CPU и гибридного режима, используется в llama.cpp, Ollama и LM Studio; он проще, но может быть медленнее GPTQ на GPU. AWQ — ещё один GPU-ориентированный формат с высокой скоростью и точностью, но менее распространён. Для CPU или гибрида выбирают GGUF, для GPU — GPTQ или AWQ.
Особую сложность представляют MoE-модели (Mixture of Experts), такие как DeepSeek-V3 (671B параметров) или Mixtral 8x7B. В них активируются только часть параметров, что усложняет квантизацию: нужно учитывать разреженность и распределение весов. Без квантизации DeepSeek-V3 требует более 2,6 ТБ памяти в FP32, что делает его запуск на обычном железе невозможным. С INT4 — около 335 ГБ, что всё ещё много, но уже доступно для кластеров с несколькими GPU.
Для практиков: если вы хотите запустить LLaMA 3 70B на одной видеокарте, INT4-квантизация — единственный реальный вариант. Например, RTX 4090 с 24 ГБ не потянет 35 ГБ, но RTX A6000 (48 ГБ) или две RTX 4090 в связке — да. Для 8B-моделей INT4 занимает всего 4 ГБ, что позволяет запускать их даже на бюджетных GPU. Квантизация — это не магия, а математика, и она уже стала стандартом для локального инференса LLM.

