Meta выпустила Muse Voice Transcribe — первую модель реального времени для аудиовосприятия от Superintelligence Labs. Она распознает речь, различает говорящих и определяет границы предложений в потоке живого разговора. Модель обрабатывает входящее аудио фрагментами по 80 миллисекунд. После каждого фрагмента она решает, продолжать ли слушать или вывести следующее слово в виде текста, контролируя объем контекста перед транскрипцией. Чем дольше ожидание, тем выше точность, но и задержка больше.
Muse Voice Transcribe адаптивно меняет время ожидания для каждого слова в зависимости от сложности. Легкие слова выводятся быстрее, сложные требуют больше времени на прослушивание. Meta обучала модель с помощью обучения с подкреплением, одновременно поощряя низкий уровень ошибок и короткие задержки. Такой подход сдвигает компромисс между скоростью и точностью, поскольку модель сама решает, сколько слушать каждое слово.
| Модель | Word error rate (англ.) | Задержка после конца речи |
|---|---|---|
| Muse Voice Transcribe | 3,1% | 0,16 с |
| ElevenLabs Scribe v2 Realtime | 3,6% | 0,14 с |
| AssemblyAI Universal-3.5 Pro Realtime | 4,0% | — |
| Cartesia Ink-2 | 3,4–4,0% | — |
Разделение говорящих и определение границ предложений встроены в ту же модель, без отдельных систем. Для атрибуции говорящих модель отмечает смену спикера в тексте и помечает каждый фрагмент идентификатором от A до Z. Границы предложений отмечаются там, где начинается и заканчивается высказывание. Обе задачи обучаются совместно с распознаванием речи. Модель может различать более 20 говорящих одновременно и обрабатывать записи длительностью более часа без постобработки. В демонстрации с восемью людьми в комнате система в реальном времени приписывает слова конкретным говорящим.
Модель различает до 20 говорящих одновременно и определяет границы предложений без отдельных систем.

По данным Meta, Muse Voice Transcribe обучена на более чем 70 языках, 25 из которых протестированы углубленно. Модель поддерживает переключение кодов, когда говорящие перескакивают между двумя языками в середине предложения. Подсказки о языке, ключевые слова и контекст могут повысить точность, особенно для имен собственных, таких как «Meta», «Muse» или «Menlo Park».
Независимая оценка Artificial Analysis от 1 сентября 2026 года подтверждает заявления Meta. Muse Voice Transcribe достигает 3,1% ошибок на английском через 0,16 секунды после окончания речи. ElevenLabs Scribe v2 Realtime показывает 3,6% и 0,14 секунды, AssemblyAI Universal-3.5 Pro Realtime — 4,0%. Cartesia Ink-2 набирает 3,4% или 4,0% в зависимости от того, определяет ли модель конец высказывания сама или полагается на внешнюю систему. Конкуренция высока: OpenAI выпустила GPT-Realtime-Whisper в мае и снизила цены на транскрипцию в июле.
Meta связывает выпуск с видением генерального директора Марка Цукерберга о «персональном суперинтеллекте». В постановочной демонстрации сотрудники Meta утверждают, что надежное распознавание речи — основа для персональных ИИ-агентов, которые слушают реальные разговоры через ИИ-очки. В Германии недавно обсуждался запрет на камерные очки Meta, хотя Федеральное сетевое агентство решило не pursue это.
Muse Voice Transcribe уже работает в голосовом вводе Meta ИИ и Muse Code и доступна через Meta Model API. Пользователи могут попробовать ее, удерживая клавишу «Fn» в любом приложении. Meta демпингует по цене: $0,18 за час, или $3 за 1000 аудиоминут, что дешевле Cartesia Ink-2 ($4) и ElevenLabs Scribe v2 Realtime и Deepgram Flux ($6,50 каждый). Это продолжает стратегию Muse Spark 1.1 и Muse Spark 1.2, где Meta конкурирует ценой, а не пиковой производительностью.

Meta не раскрыла количество параметров, объем обучающих данных или источники аудио, а также не выпускает веса модели. Летом 2025 года Meta реорганизовала ИИ-подразделение под эгидой Superintelligence Labs, привлекая ведущих исследователей из OpenAI, Google DeepMind и Apple с пакетами оплаты до $300 миллионов за четыре года. Не все остались: некоторые вернулись в OpenAI через несколько недель.



