GPT-Live-1 теперь в API: голосовая модель из ChatGPT доступна разработчикам
OpenAI открыла GPT-Live-1 в API: full duplex, отдельная модель для выполнения задач, 12 голосов и цена 0,05 доллара за минуту голосовой части.
Содержание
10 сентября OpenAI открыла GPT-Live-1 через API. Голосовую модель, ранее представленную в ChatGPT, теперь можно встроить в собственное приложение или рабочий сервис. Главная особенность — full duplex: модель слушает и говорит одновременно, поэтому человеку не нужно ждать окончания ответа, чтобы добавить подробность или поправить запрос. Анонс OpenAI.
Что умеет GPT-Live-1
Модель объединяет слушание и речь вместо последовательной цепочки «распознать аудио → подготовить текст → озвучить». OpenAI делает акцент на обработке перебиваний и пауз, работе с фоновым шумом и сохранении качества длинных разговоров. Тон, темп и стиль речи можно задавать системной инструкцией.
При этом разговор и выполнение задач разделены. GPT-Live ведёт беседу, а рассуждения, поиск данных и вызов инструментов передаёт модели или агенту на сервере. Пока тот работает, разговор может продолжаться. Разработчик выбирает исполнителя отдельно: в анонсе OpenAI приводит Astra и Luna, а документация позволяет при управлении со стороны приложения подключить свою модель, агента или сервис. Как устроено подключение.
Например, голосовой помощник может уточнять вопрос клиента, пока серверный агент проверяет заказ. Это сценарий, описанный в документации, а не результат моего эксперимента. Для команды, у которой уже есть агент с доступом к рабочим системам, такая схема даёт возможность отдельно выбирать голосовую часть и исполнителя задач.
Какие результаты приводит OpenAI
В анонсе компания публикует два показателя:
- Full Duplex Bench: плюс 30 процентных пунктов относительно GPT-Realtime-2.1. Этот тест оценивает поведение в разговоре, включая паузы и перебивания.
- Speak: почти на 80% меньше перебиваний во время пауз на размышление в ранних оценках по сравнению с прежними системами, где участники говорят по очереди.
Голоса и телефонные звонки
В анонсе представлены 12 голосов. Для телефонных интеграций документация описывает подключение через SIP и провайдеров, включая Twilio и Telnyx. Также предусмотрены WebRTC для браузерных приложений и WebSocket для серверной работы с аудио. Это способы подключения, которые нужно настроить в своём приложении. Голоса в анонсе, варианты интеграции.
Цена: 0,05 доллара за минуту
Голосовая часть GPT-Live-1 стоит 0,05 доллара за минуту, то есть 3 доллара за час оплачиваемой длительности сессии. Расчёт идёт посекундно. Работа модели на сервере и её инструментов оплачивается отдельно. Это цена API, а не подписки ChatGPT. Карточка модели.
При оценке телефонного сервиса нужно также учесть расходы на телефонию. Поэтому 3 доллара в час удобно использовать как исходную ставку голосовой части, но полный бюджет будет зависеть от задач агента и выбранной интеграции.
Для меня главный повод попробовать релиз — возможность добавить разговорный интерфейс к уже собранному рабочему агенту. Как и в других сценариях внедрения AI, дальше стоит проверить весь путь до результата: понял ли помощник просьбу и выполнил ли нужную задачу. Но начать теперь можно с доступной через API голосовой модели, не собирая распознавание и озвучку в отдельную цепочку.