OpenAI открыла доступ к голосовой модели GPT-Live-1 через API. Ключевая особенность — режим full-duplex: модель принимает речь и генерирует ответ одновременно, а не по очереди. Это отличает её от большинства голосовых ассистентов, которые сначала ждут окончания фразы пользователя, затем обрабатывают запрос и только потом отвечают. GPT-Live-1 уже работает внутри ChatGPT.

Техническая разница проявляется в задержках и качестве диалога. На бенчмарках OpenAI модель набирает 80,1% в тестах интерактивности full-duplex против 45,4% у предыдущей GPT-Realtime-2.1. Задержка при передаче реплики сократилась с 1,4 до 0,8 секунды. Точность вызова инструментов выросла с 60% до 87%. В банковском голосовом сценарии pass rate поднялся с 12,4% до 32%. Эти цифры показывают, что модель лучше удерживает контекст разговора и точнее выполняет команды в реальном времени.

МетрикаGPT-Live-1GPT-Realtime-2.1
Full-duplex интерактивность80,1%45,4%
Задержка передачи реплики0,8 с1,4 с
Точность вызова инструментов87%60%
Банковский голосовой бенчмарк (pass rate)32%12,4%

Разработчики могут комбинировать GPT-Live-1 с разными бэкенд-моделями в зависимости от задачи, подбирая баланс между глубиной рассуждений, скоростью и стоимостью. Цена — $0,05 за минуту, что заметно выше многих текстовых API, но сопоставимо с другими голосовыми решениями. Модель поставляется с двенадцатью новыми голосами, охватывающими разные акценты, диалекты и языки. Из коробки доступны транскрипты ASR и текст ответов.

В тестах интерактивности модель набирает 80,1% против 45,4% у GPT-Realtime-2.1.

Один из примеров применения — Yelp. Компания использует GPT-Live-1 для бронирования по телефону и, по словам технического директора Алекса Леви, фиксирует улучшение обработки звонков. Это показывает, что модель ориентирована на задачи, где важна естественность диалога и низкая задержка: службы поддержки, запись на приём, обработка заказов.

Полные детали будут доступны в документации API. Для рынка это означает, что голосовые интерфейсы становятся ближе к человеческому разговору: можно перебивать, уточнять и получать ответ без пауз. Ограничение — цена и зависимость от бэкенд-модели: для сложных сценариев придётся комбинировать GPT-Live-1 с более мощными моделями, что увеличивает итоговую стоимость.