Meta выпустила Muse Voice Transcribe — первую модель реального времени для аудиовосприятия от Superintelligence Labs. Она распознает речь, различает говорящих и определяет границы предложений в потоке живого разговора. Модель обрабатывает входящее аудио фрагментами по 80 миллисекунд. После каждого фрагмента она решает, продолжать ли слушать или вывести следующее слово в виде текста, контролируя объем контекста перед транскрипцией. Чем дольше ожидание, тем выше точность, но и задержка больше.

Muse Voice Transcribe адаптивно меняет время ожидания для каждого слова в зависимости от сложности. Легкие слова выводятся быстрее, сложные требуют больше времени на прослушивание. Meta обучала модель с помощью обучения с подкреплением, одновременно поощряя низкий уровень ошибок и короткие задержки. Такой подход сдвигает компромисс между скоростью и точностью, поскольку модель сама решает, сколько слушать каждое слово.

МодельWord error rate (англ.)Задержка после конца речи
Muse Voice Transcribe3,1%0,16 с
ElevenLabs Scribe v2 Realtime3,6%0,14 с
AssemblyAI Universal-3.5 Pro Realtime4,0%
Cartesia Ink-23,4–4,0%

Разделение говорящих и определение границ предложений встроены в ту же модель, без отдельных систем. Для атрибуции говорящих модель отмечает смену спикера в тексте и помечает каждый фрагмент идентификатором от A до Z. Границы предложений отмечаются там, где начинается и заканчивается высказывание. Обе задачи обучаются совместно с распознаванием речи. Модель может различать более 20 говорящих одновременно и обрабатывать записи длительностью более часа без постобработки. В демонстрации с восемью людьми в комнате система в реальном времени приписывает слова конкретным говорящим.

Модель различает до 20 говорящих одновременно и определяет границы предложений без отдельных систем.

Adaptive delay shifts the speed-accuracy trade-off because the model decides per word how long to keep listening. | Image: Meta
Adaptive delay shifts the speed-accuracy trade-off because the model decides per word how long to keep listening. | Image: Meta · Источник: The Decoder

По данным Meta, Muse Voice Transcribe обучена на более чем 70 языках, 25 из которых протестированы углубленно. Модель поддерживает переключение кодов, когда говорящие перескакивают между двумя языками в середине предложения. Подсказки о языке, ключевые слова и контекст могут повысить точность, особенно для имен собственных, таких как «Meta», «Muse» или «Menlo Park».

Независимая оценка Artificial Analysis от 1 сентября 2026 года подтверждает заявления Meta. Muse Voice Transcribe достигает 3,1% ошибок на английском через 0,16 секунды после окончания речи. ElevenLabs Scribe v2 Realtime показывает 3,6% и 0,14 секунды, AssemblyAI Universal-3.5 Pro Realtime — 4,0%. Cartesia Ink-2 набирает 3,4% или 4,0% в зависимости от того, определяет ли модель конец высказывания сама или полагается на внешнюю систему. Конкуренция высока: OpenAI выпустила GPT-Realtime-Whisper в мае и снизила цены на транскрипцию в июле.

Meta связывает выпуск с видением генерального директора Марка Цукерберга о «персональном суперинтеллекте». В постановочной демонстрации сотрудники Meta утверждают, что надежное распознавание речи — основа для персональных ИИ-агентов, которые слушают реальные разговоры через ИИ-очки. В Германии недавно обсуждался запрет на камерные очки Meta, хотя Федеральное сетевое агентство решило не pursue это.

Muse Voice Transcribe уже работает в голосовом вводе Meta ИИ и Muse Code и доступна через Meta Model API. Пользователи могут попробовать ее, удерживая клавишу «Fn» в любом приложении. Meta демпингует по цене: $0,18 за час, или $3 за 1000 аудиоминут, что дешевле Cartesia Ink-2 ($4) и ElevenLabs Scribe v2 Realtime и Deepgram Flux ($6,50 каждый). Это продолжает стратегию Muse Spark 1.1 и Muse Spark 1.2, где Meta конкурирует ценой, а не пиковой производительностью.

In Artificial Analysis testing from September 1, 2026, Muse Voice Transcribe produces the most accurate final transcript after detected end of speech. | Image: Meta
In Artificial Analysis testing from September 1, 2026, Muse Voice Transcribe produces the most accurate final transcript after detected end of speech. | Image: Meta · Источник: The Decoder

Meta не раскрыла количество параметров, объем обучающих данных или источники аудио, а также не выпускает веса модели. Летом 2025 года Meta реорганизовала ИИ-подразделение под эгидой Superintelligence Labs, привлекая ведущих исследователей из OpenAI, Google DeepMind и Apple с пакетами оплаты до $300 миллионов за четыре года. Не все остались: некоторые вернулись в OpenAI через несколько недель.