Сжатие больших языковых моделей почти всегда сопровождается потерей качества. Стандартный подход к эффективному развертыванию включает два этапа: сначала сокращают число параметров, удаляя слои, головы внимания или нейроны, затем квантизуют оставшиеся веса до 4 бит, уменьшая память и вычислительные затраты. Оба шага дают значительную экономию, но вместе систематически ухудшают ключевые способности модели: рассуждение, математическое решение задач и генерацию кода. Поэтому в серьезных пайплайнах перед запуском модели в продакшн добавляют этап восстановления, называемый healing (лечение).
Недавние открытые модели, такие как gpt-oss, семейство Nemotron от NVIDIA и Hypernova 60B, используют тот или иной вариант подхода «сожми, затем лечи». Однако вопрос о том, насколько эффективно работает восстановление после структурного сжатия (а не только квантизации), оставался открытым. В новой работе «Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs» исследователи представляют метод QAH, который решает эту проблему.
| Benchmark | 120B teacher (MXFP4) | 60B BF16 (recovered) | 60B MXFP4 (QAH) | QAH vs BF16 |
|---|---|---|---|---|
| AA-LCR (long-context reasoning) | 50.0 | 35.3 | 42.7 | +7.4 |
| AIME 2025 (math) | 80.0 | 70.7 | 76.3 | +5.6 |
| Aider (agentic coding) | 45.3 | 38.2 | 40.9 | +2.7 |
| τ²-bench (tool use) | 68.4 | 59.4 | 61.7 | +2.3 |
| GPQA Diamond (science) | 69.0 | 65.7 | 67.4 | +1.7 |
| IFBench (instruction following) | 63.3 | 58.4 | 59.9 | +1.5 |
| LiveCodeBench (coding) | 66.0 | 65.5 | 66.5 | +1.0 |
| MMLU-Pro (knowledge) | 78.0 | 74.0 | 73.8 | −0.2 |
| SciCode (science coding) | 37.5 | 35.6 | 34.2 | −1.4 |
Суть QAH заключается в изменении источника дистилляции. Традиционные методы, такие как quantization-aware training (QAT) и quantization-aware distillation (QAD), имеют ограничения. QAT требует повторного прогона дорогостоящего многоэтапного процесса пост-обучения через зашумленный прямой проход с низкой точностью, что может привести к нестабильности при слишком долгом обучении. QAD, в свою очередь, дистиллирует из замороженного полноточного учителя, но при структурном сжатии такого учителя не существует: единственный доступный учитель — это восстановленный bfloat16-чекпоинт, который сам является приближением. Это ограничивает точность студента потолком восстановленного чекпоинта.
Метод устраняет потолок точности, возникающий при дистилляции из уже сжатой модели.

QAH устраняет это ограничение, дистиллируя напрямую из исходной модели до сжатия. Учитель и студент не обязаны иметь одинаковую архитектуру: учитель — полный и полноточный, студент — вдвое меньше и работает в MXFP4. Поскольку распределение выходных данных учителя не зависит от архитектуры, передача знаний возможна. Студент получает только распределение учителя через KL-дивергенцию на логитах, без жестких меток. Это превращает квантизацию из потерь в дополнительный этап дистилляции, что позволяет студенту получить информацию, которую восстановленный чекпоинт не получил.
Кроме того, KL-дивергенция обеспечивает стабильность обучения: после достижения оптимума студент не дрейфует, в отличие от обучения с перекрестной энтропией. Для работы с длинным контекстом (до 32k токенов) используется чанковая KL-дивергенция из сопутствующей работы по эффективной дистилляции. Результаты показывают, что 4-битная модель GPT-OSS 120B, сжатая до 60B параметров, превосходит свой полноточный оригинал по 7 из 9 бенчмарков, что меняет привычное соотношение между 4-битной и 16-битной версиями.


