NVIDIA представила Magpie Multilingual TTS — открытую модель синтеза речи с 364 млн параметров, которая поддерживает 12 языков, включая новые Modern Standard Arabic, Korean и Brazilian Portuguese. Модель предназначена для разработчиков голосовых агентов, которым нужен контроль над латентностью и инфраструктурой, а не просто API-вызов. В отличие от интегрированных решений, Magpie позволяет развернуть TTS на собственном оборудовании, настраивать компоненты под домен и точно измерять задержки.

В голосовом конвейере TTS — финальный этап, и его задержка критична для восприятия. Время до первого аудио (TTFA) — ключевая метрика: чем меньше, тем быстрее пользователь слышит ответ. Magpie показывает TTFA от 32 мс на GPU B200 при одном потоке, 47 мс на H100 и 79 мс на A100. При 64 одновременных потоках B200 достигает TTFA 239 мс и пропускной способности 320× реального времени, то есть генерирует аудио более чем в 300 раз быстрее, чем оно воспроизводится. Это оставляет запас для ASR и LLM, позволяя уложиться в суб-200-мс окно, необходимое для естественного диалога.

GPU1-поток TTFA1-поток RTFX64-потока TTFA64-потока RTFX
B20032 мс12.1×239 мс319.81×
H10047 мс14.7×275 мс290.79×
DGX Spark53 мс9.8×962 мс75.88×
A10079 мс12.2×395 мс197×

Модель доступна в двух формах: открытые веса на Hugging Face для исследований и тонкой настройки, и NVIDIA NIM — оптимизированный контейнер для продакшена, который и обеспечивает указанные показатели латентности. Оба варианта работают на оборудовании, которое контролирует разработчик. Это важно для компаний с требованиями к приватности данных или необходимостью развертывания в определенных регионах.

Время до первого аудио (TTFA) на B200 — 32 мс, на H100 — 47 мс, на A100 — 79 мс при одном потоке.

Magpie поддерживает мужские и женские голоса для каждого языка через общее мультиязычное представление диктора. Новый релиз также улучшает переключение кодов для хинди и японского с помощью IPA-транскрипции и пользовательских словарей произношения, что упрощает корректное произношение имен и технических терминов. Вместо поддержки отдельных моделей для разных регионов разработчики могут строить мультиязычные приложения на одной открытой основе.

Тренд на мультиязычность в голосовых интерфейсах усиливается: глобальная поддержка клиентов, ассистенты для здравоохранения, автоматизация розницы — все это требует естественного общения на нескольких языках. Открытые модели, такие как Magpie, дают возможность развертывать ИИ там, где живут данные, соблюдать корпоративные политики и предсказывать латентность под нагрузкой. Это контрастирует с проприетарными API, где контроль ограничен.

Ограничения модели: хотя Magpie поддерживает 12 языков, это не все языки мира, и качество может варьироваться. Для некоторых доменов может потребоваться тонкая настройка. Тем не менее, открытые веса позволяют адаптировать модель под конкретные задачи, что недоступно при использовании закрытых сервисов.