Технологии

GPT-Live-1 говорит и слушает одновременно — цена начинается с $0,05 в минуту

|Автор: Редакция QUASA|4 мин чтения
GPT-Live-1 говорит и слушает одновременно — цена начинается с $0,05 в минуту

Анонс OpenAI от 10 сентября 2026 года фиксирует выпуск GPT-Live-1 в API по цене $0,05 в минуту за передний голосовой слой. Модель одновременно принимает и генерирует звук, обрабатывает перебивания и может продолжать разговор, пока отдельная серверная система выполняет более сложную задачу.

Для разработчиков голосовых сервисов это означает отказ от обязательной последовательной цепочки распознавания речи, языковой модели и синтеза речи в наиболее чувствительной к задержкам части агента. Однако ставка $0,05 не равна полной стоимости звонка: серверная модель, инструменты, агентная обвязка и услуги связи оплачиваются отдельно.

Одна модель заменяет три последовательных речевых этапа

GPT-Live-1 одновременно слушает звонящего и отвечает, прекращая реплику при перебивании.

В каскадной архитектуре запись сначала преобразуется в текст, затем языковая модель готовит ответ, после чего синтезатор превращает его обратно в звук. Приложение должно передавать контекст между компонентами, определять окончание реплики и останавливать воспроизведение, если собеседник заговорил снова.

GPT-Live-1 объединяет восприятие и генерацию речи в одном голосовом контуре. Благодаря полнодуплексной работе модель слышит новую реплику во время собственного ответа, учитывает короткие подтверждения и паузы и может прекратить речь при перебивании. Это сокращает число переходов внутри разговора, но не устраняет серверную бизнес-логику.

Модель также выдаёт расшифровку входящей речи и текст своего ответа, поддерживает определение границ реплик и подсказки для распознавания ключевых слов. Эти функции позволяют сохранить текстовый журнал и встроить новый голосовой слой в системы, где отдельные этапы обработки по-прежнему нужны для контроля или аудита.

Ставка $0,05 покрывает только голосовой сеанс

Стоимость десятиминутного сеанса GPT-Live-1 разделена на $0,50 за голосовой слой и дополнительные расходы системы.

Базовая цена относится к длительности работы GPT-Live-1, а не к решённому обращению. При ставке $0,05 десятиминутный сеанс стоит $0,50, а часовой — $3,00. Это прямой арифметический расчёт без серверных вычислений, вызовов инструментов и связи.

Руководство OpenAI по GPT-Live уточняет, что голосовые сеансы тарифицируются посекундно, тогда как серверная модель и инструменты учитываются отдельно. Оно же описывает WebRTC для браузерных приложений, WebSocket для серверной передачи звука, боковое соединение для управления действующим сеансом, а также телефонию и SIP.

Полная себестоимость работающего агента складывается из нескольких уровней:

  • времени голосового сеанса GPT-Live-1;
  • токенов выбранной серверной модели и платных вызовов инструментов;
  • телефонного номера, SIP-транка или другой услуги связи;
  • маршрутизации, хранения состояния, интеграции с CRM и наблюдения за качеством.

Поэтому одинаковая продолжительность звонков не гарантирует одинаковой итоговой цены. Запрос, который требует поиска данных, нескольких операций в рабочей системе или более ресурсоёмкого рассуждения, добавит расходы поверх тарифа голосового слоя.

Рассуждение и действия вынесены на сервер

GPT-Live-1 отвечает за течение разговора и решает, когда запросу нужна помощь серверной части. Пока сервер ищет сведения или вызывает инструменты, голосовой сеанс может оставаться активным; после завершения операции результат возвращается модели для озвучивания.

При управляемом делегировании через Responses API голосовая модель обращается к настроенной серверной модели и передаёт ей контекст. Клиентское делегирование оставляет исполнение под контролем приложения и позволяет подключить собственный сервис, агентную систему либо модель другого поставщика.

Такое разделение даёт возможность выбирать глубину рассуждения и стоимость серверной модели под задачу, но требует самостоятельного управления разрешениями, подтверждениями, закрытыми функциями и долговременным состоянием. Перебивание голосового ответа само по себе не отменяет уже запущенную серверную операцию.

Телефония подключается как отдельная инфраструктура

Телефонный звонок проходит через GPT-Live-1, а отдельный серверный агент обращается к рабочей системе.

Поддержка телефонных сценариев не означает, что OpenAI предоставляет номер, операторскую сеть или маршрутизацию вызовов. GPT-Live-1 получает медиапоток через выбранное соединение, а доставку звонка обеспечивает приложение или коммуникационная платформа.

Публикация Twilio от 10 сентября описывает интеграцию Agent Connect с GPT-Live-1: встроенный провайдер соединяет Twilio Voice Media Streams с API модели без отдельной реализации связки через WebSocket. Комплект Twilio берёт на себя передачу звука, смену реплик, обработку перебиваний и сохранение состояния между каналами.

Для контакт-центра итоговая схема по-прежнему включает платформу связи, голосовой слой, серверную модель и доступ к рабочим системам. Новая модель упрощает речевой контур, но не заменяет телефонию, правила доступа, CRM и бизнес-процессы.

Доступность подтверждена, полная цена зависит от конфигурации

GPT-Live-1 уже доступна разработчикам через API, поддерживает продолжительные сеансы, перебивания, серверное делегирование и телефонные подключения. Для запуска можно выбрать браузерное или серверное соединение либо передать телефонный медиапоток через совместимого провайдера.

Единого тарифа на полностью работающего агента нет: он зависит от продолжительности разговоров, частоты делегирования, выбранной серверной модели, числа обращений к инструментам и тарификации оператора связи. Таким образом, $0,05 в минуту остаётся ценой переднего голосового слоя, а не фиксированной стоимостью звонка или успешно обработанного обращения.

Читайте также:

Поделиться:

Подпишитесь на рассылку

Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.

0