Google представила Gemini 3.5 Transcribe — модель для преобразования речи в текст, которая уже используется в функции Rambler на смартфонах Pixel 11 и в ближайшее время появится в других продуктах компании. Новая модель призвана упростить голосовой ввод: она не только распознаёт слова, но и убирает «э-э» и «м-м», исправляет оговорки и редактирует текст на лету, если говорящий поправляет сам себя. По заявлению Google,
Технически модель относится к семейству Gemini 3.5, хотя и не является полноценной мультимодальной моделью уровня Gemini 3.5 Pro. Она специализируется на одной задаче — превращении устной речи в чистый текст. Это позволяет оптимизировать модель под скорость и точность, что критично для голосового ввода: пользователи редко готовы ждать несколько секунд после произнесённой фразы. Ускорение на 70% означает, что текст появляется почти мгновенно, а снижение ошибок сокращает время на ручные правки.
| Модель | Скорость | Частота ошибок |
|---|---|---|
| Chirp 3 | Базовая | 7,32% |
| Gemini 3.5 Transcribe | На 70% быстрее | 5,5% |
Одно из ключевых отличий Gemini 3.5 Transcribe от предшественников — способность редактировать смысл сказанного. Модель не просто транскрибирует слова, а пытается понять намерение говорящего: убирает слова-паразиты, исправляет грамматические огрехи и может заменять формулировки на более точные. Для этого она использует пользовательский словарь, который позволяет распознавать специализированную лексику — например, медицинские термины или профессиональный жаргон. Поддерживаются 85 языков, а в предзаписанном аудио модель различает до трёх говорящих.
Модель на 70% быстрее Chirp 3, частота ошибок при живой речи — 5,5% против 7,32% у предшественника.

Однако у такого подхода есть обратная сторона. Поскольку ИИ редактирует текст, он технически изменяет то, что было сказано. Для коротких сообщений это удобно: модель хорошо справляется с очисткой речи от запинок и повторов. Но в ситуациях, где важна дословная точность — например, при стенографировании интервью или юридических записей — такие изменения могут быть нежелательны. Google не раскрывает, насколько сильно модель может искажать исходный смысл, но предупреждает, что полагаться на неё стоит с осторожностью.
Gemini 3.5 Transcribe уже доступна в Gboard на Pixel 11, и Google планирует интегрировать её в другие сервисы, включая, вероятно, Google Assistant и приложения для заметок. Это шаг в сторону более естественного взаимодействия с устройствами: пользователь говорит, а ИИ берёт на себя рутинную работу по форматированию текста. Пока неясно, когда модель появится на других устройствах Android и будет ли доступна через API для сторонних разработчиков, но анонс подтверждает, что Google продолжает развивать специализированные ИИ-модели в дополнение к универсальным.
Для отрасли это ещё одно подтверждение тренда на узкоспециализированные модели, которые решают конкретные задачи эффективнее, чем большие универсальные системы. В то время как конкуренты, такие как OpenAI и Anthropic, делают ставку на мультимодальные модели, Google показывает, что точечная оптимизация под задачу может дать ощутимый выигрыш в скорости и качестве. Для пользователей это означает, что голосовой ввод становится всё более комфортным, а для разработчиков — что появляются новые инструменты для создания приложений с голосовым управлением.



