Проект FastWave выполнен в мастерской по сервисам и платформам ИИ Инженерно-математической школы НИУ ВШЭ и VK. Руководили работой Максим Каледин, доцент ФКН НИУ ВШЭ, и Александр Тараканов, исследователь ИИ VK и доцент ФКН. Автор кейса — студент Никита Кузнецов. Задача относится к классу Bandwidth Extension (BWE): модель должна восстановить высокочастотные детали звука, которых нет в исходной записи, и поднять частоту дискретизации до 48 кГц. Это нужно для апскейла старого аудио, телефонных записей, стриминговых треков с низким битрейтом.

В BWE исторически конкурируют два подхода. Диффузионные модели (NU-Wave, NU-Wave 2, AudioSR) дают высокое качество, но требуют множества последовательных вызовов модели при генерации — итеративного денойзинга — и потому медленны. Flow-based модели (FlowHigh) работают за один шаг инференса и близки к SOTA по качеству, но остаются крупными: у FlowHigh 49 млн параметров. Почти все решения в области сосредоточены на качестве звука, а вычислительная сложность ушла на второй план.

МодельПараметрыПодходОсобенность
FastWave1,3 млнДиффузионнаяОбучение на 1 × V100, 50 GFLOPS
NU-Wave 21,8 млнДиффузионнаяОбучение ~2 недели на 2 × A100
FlowHigh49 млнFlow-basedОдин шаг инференса

FastWave начинается с NU-Wave 2 — самой компактной диффузионной модели для BWE на 1,8 млн параметров, поддерживающей режим any-to-48 kHz. Но даже она обучается около двух недель на двух GPU A100 с большим батчем. У команды были только V100, поэтому эксперименты шли на одной V100. Чтобы уложиться в ресурсы, авторы переработали три направления.

Первое — методология EDM (Elucidating the Design Space of Diffusion Models), работа исследователей NVIDIA (Karras et al., NeurIPS 2022). Изначально EDM создавался для изображений, в FastWave его адаптировали под Audio Super-Resolution. Перенесли σ-параметризацию: вместо предсказания шума модель учится предсказывать чистый сигнал. Добавили предобуславливание входов и выходов, масштабируемое по уровню шума. Использовали log-нормальное распределение уровней шума при обучении вместо равномерного семплирования — параметры распределения вычислены из датасета. На инференсе применили непрерывное шумовое расписание из EDM вместо фиксированного log-SNR из NU-Wave 2. Лосс — взвешенная L2-функция потерь. После этих изменений пиковые метрики были достигнуты за втрое меньше итераций, чем у NU-Wave.

Второе — архитектурные изменения из ConvNeXt V2. Обычные свёртки в NU-Wave 2 заменили на depthwise separable convolutions: сначала каждый канал обрабатывается независимо, затем каналы смешиваются точечной свёрткой 1 × 1. Это снижает параметрическую сложность при сохранении рецептивного поля. Побочный эффект — каналы начинают плохо взаимодействовать друг с другом, и для компенсации добавили Global Response Normalization (GRN).

Итог: 1,3 млн параметров и около 50 GFLOPS. Модель обходит NU-Wave 2 по качеству и сопоставима с SOTA-решениями, но остаётся в 38 раз меньше FlowHigh. Код открыт. Для отрасли это означает, что диффузионный подход к BWE перестаёт быть привилегией лабораторий с кластерами A100 — обучение на одной V100 делает его доступным для небольших команд и студентов. Ограничение — отсутствие прямого сравнения с FlowHigh по всем метрикам и отсутствие данных о задержке инференса в реальном времени.