Сбер выпустил новую модель GigaChat Audio — audio-native LLM, которая понимает речь, запоминает контекст и даже определяет эмоции говорящего. Мидл-разработчик Данила @pushnoydan решил проверить её в деле: развернул модель локально на рабочем компьютере и целый день использовал для разбора голосовых сообщений коллег, составления саммари по аудиозаписям и извлечения ключевого контекста из встреч. Своим опытом он поделился на Хабре.

GigaChat Audio — это не просто распознавание речи, а полноценная языковая модель, которая работает с аудиоданными как с текстом. Она может анализировать длинные записи, выделять главное и учитывать эмоциональную окраску. Для локального запуска потребовалось серьёзное железо: видеокарта RTX 4090 с 24GB видеопамяти, процессор AMD Ryzen 9 9950X, 128GB оперативной памяти и SSD на 2TB. Даже на такой конфигурации модель нагружала систему почти на 100%, поэтому параллельные задачи пришлось выполнять на ноутбуке. Если ваше железо слабее, особенно по видеопамяти, лучше рассмотреть облачный деплой.

КомпонентХарактеристика
ВидеокартаRTX 4090 24GB
ПроцессорAMD Ryzen 9 9950X, 16 ядер
Оперативная память128 GB DDR5
SSD2TB

Процесс установки включает несколько шагов: подготовка Docker Desktop с WSL2, установка свежих драйверов NVIDIA, создание Docker-образа с vLLM и необходимыми аудиозависимостями (libsndfile, ffmpeg, soundfile, librosa, scipy). Затем нужно настроить файл окружения с токеном HuggingFace и запустить контейнер. Первый запуск занимает около 15 минут, последующие — от трёх до пяти. После запуска модель доступна на http://0.0.0.0:8000, и можно тестировать API-эндпоинты.

Для локального деплоя потребовались RTX 4090 24GB, 128GB RAM и Docker Desktop с WSL2.

Автор отмечает, что локальный деплой имеет преимущество: чувствительные аудиоданные не покидают компьютер, что важно для безопасности. Однако такой подход требует мощного оборудования и времени на настройку. Для большинства пользователей проще использовать облачные сервисы, но для разработчиков, которым нужен контроль над данными, локальный вариант оправдан.

GigaChat Audio — часть экосистемы Сбера, которая активно развивает ИИ-решения для бизнеса и разработчиков. Модель доступна на HuggingFace, что позволяет интегрировать её в свои проекты. Тест-драйв показал, что модель справляется с задачами, но требует ресурсов и технической подготовки.