Google DeepMind выпустила две модели для голосового взаимодействия — Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Обе построены командой Gemini Audio и позиционируются как инструменты для создания голосовых агентов, которые не просто распознают речь, а ведут диалог, выполняют задачи и рассуждают в реальном времени. Младшая версия ориентирована на масштаб и экономичность, старшая — на сложные многошаговые сценарии.
Ключевое техническое отличие от предыдущих поколений — параллельное рассуждение. Gemini 3.8 Live Extended Thinking умеет думать и говорить одновременно: модель использует ранние вербальные сигналы вроде «Let me check that…», чтобы подтвердить запрос, и проговаривает прогресс фоновых задач по мере их выполнения. Это решает давнюю проблему голосовых ассистентов — паузу, во время которой система молчит, обрабатывая запрос. Вместо тишины пользователь слышит естественную реакцию и понимает, что происходит.
| Модель | Назначение | Ключевые метрики | Доступ |
|---|---|---|---|
| Gemini 3.8 Live | Масштаб и экономичность, визуальный ввод, 97 языков | 2-е место в Speech Agent Arena | Gemini API, AI Studio, Search Live |
| Gemini 3.8 Live Extended Thinking | Сложные многошаговые задачи, параллельное рассуждение | 82,6 в Speech to Speech Quality Index; 68,6% τ-Voice; 35,1% τ-Voice-banking; 97,7% Big Bench Audio | Gemini API, AI Studio, Gemini Enterprise (приватное превью), Gemini Live, Workspace |
По бенчмаркам старшая модель занимает первое место в Speech to Speech Quality Index от Artificial Analysis с результатом 82,6. На τ-Voice она набирает 68,6%, на τ-Voice-banking от Sierra — 35,1%, на Big Bench Audio — 97,7%. Младшая Gemini 3.8 Live заняла второе место в Speech Agent Arena. На бенчмарке EVA-Bench от ServiceNow обе модели, по заявлению Google, сдвигают границу Парето для сложных рабочих процессов, балансируя точность и качество диалога. Замеры проводились на Live API в Gemini Enterprise Agent Platform.
Gemini 3.8 Live Extended Thinking рассуждает и говорит одновременно, набирает 97,7% на Big Bench Audio и 68,6% на τ-Voice.

Gemini 3.8 Live обрабатывает визуальный ввод почти в реальном времени, автоматически определяет и переключает 97 поддерживаемых языков прямо посреди разговора. Модель выполняет вызовы инструментов и API в фоне, продолжая беседу: она подтверждает запрос и поддерживает диалог, пока задача завершается. Это отличает её от агентов, которые блокируют разговор на время выполнения действия.
Для разработчиков обе модели доступны через Gemini API и Google ИИ Studio. Корпоративным клиентам — в приватном превью в Gemini Enterprise, позже в Gemini Enterprise for Customer Experience и Google Workspace для бизнеса. Обычные пользователи получают доступ через Search Live, Gemini Live и Workspace в Docs для подписчиков Google ИИ Pro и Ultra. Платформы Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel и Vision Agents используют Gemini Live API для создания голосовых интерфейсов, беря на себя инфраструктуру потоковой передачи медиа. Среди партнёров-заказчиков — Salesforce, Genspark и Lumeris.
Весь аудиоконтент, генерируемый продуктами Google, помечается водяным знаком SynthID. Он встраивается непосредственно в звук и остаётся невоспринимаемым на слух, но детектируется алгоритмически — это должно помочь в борьбе с дезинформацией. Детали подхода к безопасности описаны в карточке модели.
Выход Gemini 3.8 Live продолжает линию Google на голосовые интерфейсы как отдельный класс продуктов. Конкуренты — OpenAI с голосовыми режимами GPT-4o и Anthropic с Claude — также развивают диалоговые агенты, но Google делает ставку на сочетание низкой задержки, фонового выполнения задач и мультиязычности. Для рынка это означает, что голосовые агенты переходят из категории демонстраций в production-инструменты с измеримыми метриками.



