GPT-Live-1 говорит и слушает одновременно — цена начинается с $0,05 в минуту

Анонс OpenAI от 10 сентября 2026 года фиксирует выпуск GPT-Live-1 в API по цене $0,05 в минуту за передний голосовой слой. Модель одновременно принимает и генерирует звук, обрабатывает перебивания и может продолжать разговор, пока отдельная серверная система выполняет более сложную задачу.
Для разработчиков голосовых сервисов это означает отказ от обязательной последовательной цепочки распознавания речи, языковой модели и синтеза речи в наиболее чувствительной к задержкам части агента. Однако ставка $0,05 не равна полной стоимости звонка: серверная модель, инструменты, агентная обвязка и услуги связи оплачиваются отдельно.
Одна модель заменяет три последовательных речевых этапа

В каскадной архитектуре запись сначала преобразуется в текст, затем языковая модель готовит ответ, после чего синтезатор превращает его обратно в звук. Приложение должно передавать контекст между компонентами, определять окончание реплики и останавливать воспроизведение, если собеседник заговорил снова.
GPT-Live-1 объединяет восприятие и генерацию речи в одном голосовом контуре. Благодаря полнодуплексной работе модель слышит новую реплику во время собственного ответа, учитывает короткие подтверждения и паузы и может прекратить речь при перебивании. Это сокращает число переходов внутри разговора, но не устраняет серверную бизнес-логику.
Модель также выдаёт расшифровку входящей речи и текст своего ответа, поддерживает определение границ реплик и подсказки для распознавания ключевых слов. Эти функции позволяют сохранить текстовый журнал и встроить новый голосовой слой в системы, где отдельные этапы обработки по-прежнему нужны для контроля или аудита.
Ставка $0,05 покрывает только голосовой сеанс

Базовая цена относится к длительности работы GPT-Live-1, а не к решённому обращению. При ставке $0,05 десятиминутный сеанс стоит $0,50, а часовой — $3,00. Это прямой арифметический расчёт без серверных вычислений, вызовов инструментов и связи.
Руководство OpenAI по GPT-Live уточняет, что голосовые сеансы тарифицируются посекундно, тогда как серверная модель и инструменты учитываются отдельно. Оно же описывает WebRTC для браузерных приложений, WebSocket для серверной передачи звука, боковое соединение для управления действующим сеансом, а также телефонию и SIP.
Полная себестоимость работающего агента складывается из нескольких уровней:
- времени голосового сеанса GPT-Live-1;
- токенов выбранной серверной модели и платных вызовов инструментов;
- телефонного номера, SIP-транка или другой услуги связи;
- маршрутизации, хранения состояния, интеграции с CRM и наблюдения за качеством.
Поэтому одинаковая продолжительность звонков не гарантирует одинаковой итоговой цены. Запрос, который требует поиска данных, нескольких операций в рабочей системе или более ресурсоёмкого рассуждения, добавит расходы поверх тарифа голосового слоя.
Рассуждение и действия вынесены на сервер
GPT-Live-1 отвечает за течение разговора и решает, когда запросу нужна помощь серверной части. Пока сервер ищет сведения или вызывает инструменты, голосовой сеанс может оставаться активным; после завершения операции результат возвращается модели для озвучивания.
При управляемом делегировании через Responses API голосовая модель обращается к настроенной серверной модели и передаёт ей контекст. Клиентское делегирование оставляет исполнение под контролем приложения и позволяет подключить собственный сервис, агентную систему либо модель другого поставщика.
Такое разделение даёт возможность выбирать глубину рассуждения и стоимость серверной модели под задачу, но требует самостоятельного управления разрешениями, подтверждениями, закрытыми функциями и долговременным состоянием. Перебивание голосового ответа само по себе не отменяет уже запущенную серверную операцию.
Телефония подключается как отдельная инфраструктура

Поддержка телефонных сценариев не означает, что OpenAI предоставляет номер, операторскую сеть или маршрутизацию вызовов. GPT-Live-1 получает медиапоток через выбранное соединение, а доставку звонка обеспечивает приложение или коммуникационная платформа.
Публикация Twilio от 10 сентября описывает интеграцию Agent Connect с GPT-Live-1: встроенный провайдер соединяет Twilio Voice Media Streams с API модели без отдельной реализации связки через WebSocket. Комплект Twilio берёт на себя передачу звука, смену реплик, обработку перебиваний и сохранение состояния между каналами.
Для контакт-центра итоговая схема по-прежнему включает платформу связи, голосовой слой, серверную модель и доступ к рабочим системам. Новая модель упрощает речевой контур, но не заменяет телефонию, правила доступа, CRM и бизнес-процессы.
Доступность подтверждена, полная цена зависит от конфигурации
GPT-Live-1 уже доступна разработчикам через API, поддерживает продолжительные сеансы, перебивания, серверное делегирование и телефонные подключения. Для запуска можно выбрать браузерное или серверное соединение либо передать телефонный медиапоток через совместимого провайдера.
Единого тарифа на полностью работающего агента нет: он зависит от продолжительности разговоров, частоты делегирования, выбранной серверной модели, числа обращений к инструментам и тарификации оператора связи. Таким образом, $0,05 в минуту остаётся ценой переднего голосового слоя, а не фиксированной стоимостью звонка или успешно обработанного обращения.
Читайте также:
Подпишитесь на рассылку
Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.