OpenAI открыла доступ к голосовой модели GPT-Live-1 через API. Ключевая особенность — режим full-duplex: модель принимает речь и генерирует ответ одновременно, а не по очереди. Это отличает её от большинства голосовых ассистентов, которые сначала ждут окончания фразы пользователя, затем обрабатывают запрос и только потом отвечают. GPT-Live-1 уже работает внутри ChatGPT.
Техническая разница проявляется в задержках и качестве диалога. На бенчмарках OpenAI модель набирает 80,1% в тестах интерактивности full-duplex против 45,4% у предыдущей GPT-Realtime-2.1. Задержка при передаче реплики сократилась с 1,4 до 0,8 секунды. Точность вызова инструментов выросла с 60% до 87%. В банковском голосовом сценарии pass rate поднялся с 12,4% до 32%. Эти цифры показывают, что модель лучше удерживает контекст разговора и точнее выполняет команды в реальном времени.
| Метрика | GPT-Live-1 | GPT-Realtime-2.1 |
|---|---|---|
| Full-duplex интерактивность | 80,1% | 45,4% |
| Задержка передачи реплики | 0,8 с | 1,4 с |
| Точность вызова инструментов | 87% | 60% |
| Банковский голосовой бенчмарк (pass rate) | 32% | 12,4% |
Разработчики могут комбинировать GPT-Live-1 с разными бэкенд-моделями в зависимости от задачи, подбирая баланс между глубиной рассуждений, скоростью и стоимостью. Цена — $0,05 за минуту, что заметно выше многих текстовых API, но сопоставимо с другими голосовыми решениями. Модель поставляется с двенадцатью новыми голосами, охватывающими разные акценты, диалекты и языки. Из коробки доступны транскрипты ASR и текст ответов.
В тестах интерактивности модель набирает 80,1% против 45,4% у GPT-Realtime-2.1.
Один из примеров применения — Yelp. Компания использует GPT-Live-1 для бронирования по телефону и, по словам технического директора Алекса Леви, фиксирует улучшение обработки звонков. Это показывает, что модель ориентирована на задачи, где важна естественность диалога и низкая задержка: службы поддержки, запись на приём, обработка заказов.
Полные детали будут доступны в документации API. Для рынка это означает, что голосовые интерфейсы становятся ближе к человеческому разговору: можно перебивать, уточнять и получать ответ без пауз. Ограничение — цена и зависимость от бэкенд-модели: для сложных сценариев придётся комбинировать GPT-Live-1 с более мощными моделями, что увеличивает итоговую стоимость.



