Google представила Gemini 3.5 Transcribe — модель для распознавания речи, которая работает в реальном времени и поддерживает более 85 языков. Модель автоматически удаляет слова-паразиты вроде «э-э» и «хм», исправляет оговорки и самостоятельно форматирует текст. По данным Google, показатель word error rate (WER) составляет 4,0% для потоковой передачи и 2,6% для записанного аудио, а задержка снижена на 70% по сравнению с предыдущей моделью Chirp 3.
Gemini 3.5 Transcribe доступна через два интерфейса. Live API (gemini-3.5-transcribe-live) предназначен для потоковой передачи с минимальной задержкой, например для субтитров в реальном времени. Interactions API (gemini-3.5-transcribe) обрабатывает записанное аудио, добавляя атрибуцию спикеров и временные метки. Модель уже доступна в Google ИИ Studio и на платформе Gemini Enterprise Agent Platform. Кроме того, она встроена в Gboard для Android (через функцию «Rambler») и в приложение Gemini на macOS, поддержка Chrome ожидается в ближайшее время.
| Параметр | Значение |
|---|---|
| Поддерживаемые языки | 85+ |
| WER для потоковой передачи | 4,0% |
| WER для записанного аудио | 2,6% |
| Снижение задержки по сравнению с Chirp 3 | 70% |
Одно из ключевых отличий Gemini 3.5 Transcribe — возможность «function calling»: модель может передавать задачи, такие как генерация изображений или веб-поиск, другим моделям Gemini. Это позволяет создавать более сложные ассистенты, которые не только распознают речь, но и выполняют действия на основе сказанного.
Модель доступна через Live API для потоковой передачи и Interactions API для записанного аудио с разметкой по спикерам.
Технология распознавания речи прошла долгий путь: от простых систем, требующих обучения на конкретного диктора, до универсальных моделей, работающих с десятками языков. Gemini 3.5 Transcribe продолжает эту тенденцию, делая акцент на исправлении ошибок и структурировании текста, что приближает машинную транскрипцию к качеству человеческой редактуры.
Для бизнеса это означает более точные и быстрые решения для транскрибации встреч, субтитров, голосовых помощников и других сценариев. Низкая задержка особенно важна для живых трансляций и синхронного перевода. Однако, как и любая модель, она может ошибаться на специфической лексике или акцентах, поэтому для критически важных задач может потребоваться вычитка человеком.
Конкуренция в области распознавания речи высока: OpenAI Whisper, модели от Amazon и Microsoft также предлагают высокую точность. Однако Gemini 3.5 Transcribe выделяется интеграцией с экосистемой Gemini и возможностью автоматической коррекции, что может стать решающим фактором для разработчиков, уже использующих другие сервисы Google.



