Сжатие больших языковых моделей почти всегда сопровождается потерей качества. Стандартный подход к эффективному развертыванию включает два этапа: сначала сокращают число параметров, удаляя слои, головы внимания или нейроны, затем квантизуют оставшиеся веса до 4 бит, уменьшая память и вычислительные затраты. Оба шага дают значительную экономию, но вместе систематически ухудшают ключевые способности модели: рассуждение, математическое решение задач и генерацию кода. Поэтому в серьезных пайплайнах перед запуском модели в продакшн добавляют этап восстановления, называемый healing (лечение).

Недавние открытые модели, такие как gpt-oss, семейство Nemotron от NVIDIA и Hypernova 60B, используют тот или иной вариант подхода «сожми, затем лечи». Однако вопрос о том, насколько эффективно работает восстановление после структурного сжатия (а не только квантизации), оставался открытым. В новой работе «Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs» исследователи представляют метод QAH, который решает эту проблему.

Benchmark120B teacher (MXFP4)60B BF16 (recovered)60B MXFP4 (QAH)QAH vs BF16
AA-LCR (long-context reasoning)50.035.342.7+7.4
AIME 2025 (math)80.070.776.3+5.6
Aider (agentic coding)45.338.240.9+2.7
τ²-bench (tool use)68.459.461.7+2.3
GPQA Diamond (science)69.065.767.4+1.7
IFBench (instruction following)63.358.459.9+1.5
LiveCodeBench (coding)66.065.566.5+1.0
MMLU-Pro (knowledge)78.074.073.8−0.2
SciCode (science coding)37.535.634.2−1.4

Суть QAH заключается в изменении источника дистилляции. Традиционные методы, такие как quantization-aware training (QAT) и quantization-aware distillation (QAD), имеют ограничения. QAT требует повторного прогона дорогостоящего многоэтапного процесса пост-обучения через зашумленный прямой проход с низкой точностью, что может привести к нестабильности при слишком долгом обучении. QAD, в свою очередь, дистиллирует из замороженного полноточного учителя, но при структурном сжатии такого учителя не существует: единственный доступный учитель — это восстановленный bfloat16-чекпоинт, который сам является приближением. Это ограничивает точность студента потолком восстановленного чекпоинта.

Метод устраняет потолок точности, возникающий при дистилляции из уже сжатой модели.

QAH overview: after structural compression and quantization, capabilities drop sharply. QAH distills from the original pre-compression model as a frozen teacher, restoring performance without retracing the multi-stage post-training.
QAH overview: after structural compression and quantization, capabilities drop sharply. QAH distills from the original pre-compression model as a frozen teacher, restoring performance without retracing the multi-stage post-training. · Источник: Hugging Face Blog

QAH устраняет это ограничение, дистиллируя напрямую из исходной модели до сжатия. Учитель и студент не обязаны иметь одинаковую архитектуру: учитель — полный и полноточный, студент — вдвое меньше и работает в MXFP4. Поскольку распределение выходных данных учителя не зависит от архитектуры, передача знаний возможна. Студент получает только распределение учителя через KL-дивергенцию на логитах, без жестких меток. Это превращает квантизацию из потерь в дополнительный этап дистилляции, что позволяет студенту получить информацию, которую восстановленный чекпоинт не получил.

Кроме того, KL-дивергенция обеспечивает стабильность обучения: после достижения оптимума студент не дрейфует, в отличие от обучения с перекрестной энтропией. Для работы с длинным контекстом (до 32k токенов) используется чанковая KL-дивергенция из сопутствующей работы по эффективной дистилляции. Результаты показывают, что 4-битная модель GPT-OSS 120B, сжатая до 60B параметров, превосходит свой полноточный оригинал по 7 из 9 бенчмарков, что меняет привычное соотношение между 4-битной и 16-битной версиями.