Google DeepMind представила Gemini 3.5 Transcribe — модель распознавания речи, которая преобразует аудио в отформатированный текст. По данным Artificial Analysis, средний Word Error Rate (WER) модели составляет 4,0% для потокового режима и 2,6% для не потокового. Время до финальной транскрипции улучшено на 70% по сравнению с предыдущей моделью Chirp 3.
Модель доступна через два API: Live API для потоковой транскрипции с субсекундной задержкой и Interactions API для обработки записанного аудио с атрибуцией говорящих и посекундными метками времени. Разработчики могут использовать её в Google ИИ Studio и Gemini Enterprise Agent Platform. В продуктах Google, таких как Gboard и Gemini app, модель уже применяется: функция Rambler на Android и голосовые команды в macOS.
| Режим | WER (Artificial Analysis) | WER (FLEURS) |
|---|---|---|
| Потоковый | 4,0% | 5,50% |
| Не потоковый | 2,6% | 5,04% |
Gemini 3.5 Transcribe решает проблемы, с которыми сталкиваются традиционные системы распознавания речи: шум, сложный жаргон и необходимость очистки от слов-паразитов. Модель автоматически обрабатывает самокоррекции (например, «встретимся во вторник — нет, в среду»), убирает «э-э» и «а-а», форматирует текст. Она поддерживает более 85 языков, распознаёт до трёх говорящих в предзаписанном аудио (для трёх и более — экспериментально) и адаптируется к пользовательскому словарю.
Модель поддерживает более 85 языков, распознает до трех говорящих в предзаписанном аудио и умеет обрабатывать самокоррекции и убирать слова-паразиты.

Особенность модели — функция вызова других моделей Gemini для выполнения задач, таких как генерация изображений или анализ файлов. Это позволяет использовать голосовые команды для сложных рабочих процессов, например, в приложении Gemini на macOS. Модель также интегрирована в Google Antigravity, где учитывает контекст экрана и историю чата для точной транскрипции.
По данным Artificial Analysis, на бенчмарке FLEURS модель достигает WER 5,50% в потоковом режиме и 5,04% в не потоковом, что лучше, чем у Chirp 3. Это делает Gemini 3.5 Transcribe конкурентоспособной среди современных систем распознавания речи, таких как Whisper от OpenAI и Deepgram, хотя прямое сравнение с ними в источнике не приводится.



