NVIDIA представила Magpie Multilingual TTS — открытую модель синтеза речи с 364 млн параметров, которая поддерживает 12 языков, включая новые Modern Standard Arabic, Korean и Brazilian Portuguese. Модель предназначена для разработчиков голосовых агентов, которым нужен контроль над латентностью и инфраструктурой, а не просто API-вызов. В отличие от интегрированных решений, Magpie позволяет развернуть TTS на собственном оборудовании, настраивать компоненты под домен и точно измерять задержки.
В голосовом конвейере TTS — финальный этап, и его задержка критична для восприятия. Время до первого аудио (TTFA) — ключевая метрика: чем меньше, тем быстрее пользователь слышит ответ. Magpie показывает TTFA от 32 мс на GPU B200 при одном потоке, 47 мс на H100 и 79 мс на A100. При 64 одновременных потоках B200 достигает TTFA 239 мс и пропускной способности 320× реального времени, то есть генерирует аудио более чем в 300 раз быстрее, чем оно воспроизводится. Это оставляет запас для ASR и LLM, позволяя уложиться в суб-200-мс окно, необходимое для естественного диалога.
| GPU | 1-поток TTFA | 1-поток RTFX | 64-потока TTFA | 64-потока RTFX |
|---|---|---|---|---|
| B200 | 32 мс | 12.1× | 239 мс | 319.81× |
| H100 | 47 мс | 14.7× | 275 мс | 290.79× |
| DGX Spark | 53 мс | 9.8× | 962 мс | 75.88× |
| A100 | 79 мс | 12.2× | 395 мс | 197× |
Модель доступна в двух формах: открытые веса на Hugging Face для исследований и тонкой настройки, и NVIDIA NIM — оптимизированный контейнер для продакшена, который и обеспечивает указанные показатели латентности. Оба варианта работают на оборудовании, которое контролирует разработчик. Это важно для компаний с требованиями к приватности данных или необходимостью развертывания в определенных регионах.
Время до первого аудио (TTFA) на B200 — 32 мс, на H100 — 47 мс, на A100 — 79 мс при одном потоке.
Magpie поддерживает мужские и женские голоса для каждого языка через общее мультиязычное представление диктора. Новый релиз также улучшает переключение кодов для хинди и японского с помощью IPA-транскрипции и пользовательских словарей произношения, что упрощает корректное произношение имен и технических терминов. Вместо поддержки отдельных моделей для разных регионов разработчики могут строить мультиязычные приложения на одной открытой основе.
Тренд на мультиязычность в голосовых интерфейсах усиливается: глобальная поддержка клиентов, ассистенты для здравоохранения, автоматизация розницы — все это требует естественного общения на нескольких языках. Открытые модели, такие как Magpie, дают возможность развертывать ИИ там, где живут данные, соблюдать корпоративные политики и предсказывать латентность под нагрузкой. Это контрастирует с проприетарными API, где контроль ограничен.
Ограничения модели: хотя Magpie поддерживает 12 языков, это не все языки мира, и качество может варьироваться. Для некоторых доменов может потребоваться тонкая настройка. Тем не менее, открытые веса позволяют адаптировать модель под конкретные задачи, что недоступно при использовании закрытых сервисов.



