Проект FastWave выполнен в мастерской по сервисам и платформам ИИ Инженерно-математической школы НИУ ВШЭ и VK. Руководили работой Максим Каледин, доцент ФКН НИУ ВШЭ, и Александр Тараканов, исследователь ИИ VK и доцент ФКН. Автор кейса — студент Никита Кузнецов. Задача относится к классу Bandwidth Extension (BWE): модель должна восстановить высокочастотные детали звука, которых нет в исходной записи, и поднять частоту дискретизации до 48 кГц. Это нужно для апскейла старого аудио, телефонных записей, стриминговых треков с низким битрейтом.
В BWE исторически конкурируют два подхода. Диффузионные модели (NU-Wave, NU-Wave 2, AudioSR) дают высокое качество, но требуют множества последовательных вызовов модели при генерации — итеративного денойзинга — и потому медленны. Flow-based модели (FlowHigh) работают за один шаг инференса и близки к SOTA по качеству, но остаются крупными: у FlowHigh 49 млн параметров. Почти все решения в области сосредоточены на качестве звука, а вычислительная сложность ушла на второй план.
| Модель | Параметры | Подход | Особенность |
|---|---|---|---|
| FastWave | 1,3 млн | Диффузионная | Обучение на 1 × V100, 50 GFLOPS |
| NU-Wave 2 | 1,8 млн | Диффузионная | Обучение ~2 недели на 2 × A100 |
| FlowHigh | 49 млн | Flow-based | Один шаг инференса |
FastWave начинается с NU-Wave 2 — самой компактной диффузионной модели для BWE на 1,8 млн параметров, поддерживающей режим any-to-48 kHz. Но даже она обучается около двух недель на двух GPU A100 с большим батчем. У команды были только V100, поэтому эксперименты шли на одной V100. Чтобы уложиться в ресурсы, авторы переработали три направления.
Первое — методология EDM (Elucidating the Design Space of Diffusion Models), работа исследователей NVIDIA (Karras et al., NeurIPS 2022). Изначально EDM создавался для изображений, в FastWave его адаптировали под Audio Super-Resolution. Перенесли σ-параметризацию: вместо предсказания шума модель учится предсказывать чистый сигнал. Добавили предобуславливание входов и выходов, масштабируемое по уровню шума. Использовали log-нормальное распределение уровней шума при обучении вместо равномерного семплирования — параметры распределения вычислены из датасета. На инференсе применили непрерывное шумовое расписание из EDM вместо фиксированного log-SNR из NU-Wave 2. Лосс — взвешенная L2-функция потерь. После этих изменений пиковые метрики были достигнуты за втрое меньше итераций, чем у NU-Wave.
Второе — архитектурные изменения из ConvNeXt V2. Обычные свёртки в NU-Wave 2 заменили на depthwise separable convolutions: сначала каждый канал обрабатывается независимо, затем каналы смешиваются точечной свёрткой 1 × 1. Это снижает параметрическую сложность при сохранении рецептивного поля. Побочный эффект — каналы начинают плохо взаимодействовать друг с другом, и для компенсации добавили Global Response Normalization (GRN).
Итог: 1,3 млн параметров и около 50 GFLOPS. Модель обходит NU-Wave 2 по качеству и сопоставима с SOTA-решениями, но остаётся в 38 раз меньше FlowHigh. Код открыт. Для отрасли это означает, что диффузионный подход к BWE перестаёт быть привилегией лабораторий с кластерами A100 — обучение на одной V100 делает его доступным для небольших команд и студентов. Ограничение — отсутствие прямого сравнения с FlowHigh по всем метрикам и отсутствие данных о задержке инференса в реальном времени.
