Google представила Gemini 3.5 Transcribe — модель для распознавания речи, которая работает в реальном времени и поддерживает более 85 языков. Модель автоматически удаляет слова-паразиты вроде «э-э» и «хм», исправляет оговорки и самостоятельно форматирует текст. По данным Google, показатель word error rate (WER) составляет 4,0% для потоковой передачи и 2,6% для записанного аудио, а задержка снижена на 70% по сравнению с предыдущей моделью Chirp 3.

Gemini 3.5 Transcribe доступна через два интерфейса. Live API (gemini-3.5-transcribe-live) предназначен для потоковой передачи с минимальной задержкой, например для субтитров в реальном времени. Interactions API (gemini-3.5-transcribe) обрабатывает записанное аудио, добавляя атрибуцию спикеров и временные метки. Модель уже доступна в Google ИИ Studio и на платформе Gemini Enterprise Agent Platform. Кроме того, она встроена в Gboard для Android (через функцию «Rambler») и в приложение Gemini на macOS, поддержка Chrome ожидается в ближайшее время.

ПараметрЗначение
Поддерживаемые языки85+
WER для потоковой передачи4,0%
WER для записанного аудио2,6%
Снижение задержки по сравнению с Chirp 370%

Одно из ключевых отличий Gemini 3.5 Transcribe — возможность «function calling»: модель может передавать задачи, такие как генерация изображений или веб-поиск, другим моделям Gemini. Это позволяет создавать более сложные ассистенты, которые не только распознают речь, но и выполняют действия на основе сказанного.

Модель доступна через Live API для потоковой передачи и Interactions API для записанного аудио с разметкой по спикерам.

Технология распознавания речи прошла долгий путь: от простых систем, требующих обучения на конкретного диктора, до универсальных моделей, работающих с десятками языков. Gemini 3.5 Transcribe продолжает эту тенденцию, делая акцент на исправлении ошибок и структурировании текста, что приближает машинную транскрипцию к качеству человеческой редактуры.

Для бизнеса это означает более точные и быстрые решения для транскрибации встреч, субтитров, голосовых помощников и других сценариев. Низкая задержка особенно важна для живых трансляций и синхронного перевода. Однако, как и любая модель, она может ошибаться на специфической лексике или акцентах, поэтому для критически важных задач может потребоваться вычитка человеком.

Конкуренция в области распознавания речи высока: OpenAI Whisper, модели от Amazon и Microsoft также предлагают высокую точность. Однако Gemini 3.5 Transcribe выделяется интеграцией с экосистемой Gemini и возможностью автоматической коррекции, что может стать решающим фактором для разработчиков, уже использующих другие сервисы Google.