Технологии

Gemini 3.8 Live говорит во время вычислений — базовая версия слабее в сложных задачах

|Автор: Редакция QUASA|4 мин чтения| 1
Gemini 3.8 Live говорит во время вычислений — базовая версия слабее в сложных задачах

Google 15 сентября 2026 года выпустила Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking для голосовых приложений. Согласно официальному описанию моделей, базовая версия рассчитана на диалог с малой задержкой, а старшая может продолжать вычисления и обращаться к функциям, не прерывая общение с пользователем.

Обе модели доступны через Gemini API, но предназначены для разных типов голосовых агентов. Базовая Gemini 3.8 Live подходит для быстрого обмена репликами и коротких операций; версия Extended Thinking — для задач, где требуется выполнить несколько связанных действий, дождаться ответов внешних систем и сохранить промежуточное состояние.

Голосовой ответ больше не означает завершение вычислений

Обе версии работают непосредственно с речью и могут вызывать функции в фоне. Агент способен сообщить, что запрос принят, пока подключённая система ищет данные или выполняет операцию, поэтому пользователю не приходится ждать полной тишины до окончательного ответа.

Главное различие проявляется после первой реплики. Базовая модель использует чередование ответа и рассуждения, сохраняя приоритет малой задержки. Старшая версия рассчитана на более продолжительные вычисления: она может озвучивать промежуточное состояние, последовательно обращаться к нескольким функциям и менять дальнейшие действия с учётом полученных результатов.

Способность говорить во время вычислений полнее раскрывается в Gemini 3.8 Live Extended Thinking. Базовая версия также поддерживает фоновый вызов функции, но её назначение — короткий разговорный цикл, а не длительное построение и пересмотр многошагового плана.

Через API доступны обе версии

В журнале изменений Gemini API зафиксирован выпуск обеих моделей для разработчиков. Команда может выбрать вариант с приоритетом скорости либо модель с продолжительным рассуждением, не меняя сам способ доступа к семейству Gemini.

Базовая Gemini 3.8 Live соответствует сценарию, в котором агенту нужно распознать намерение, получить один результат из внешней системы и быстро его озвучить. К этой группе относятся проверка состояния заявки, поиск существующей записи и перенаправление обращения, если операция не требует цепочки взаимозависимых решений.

Старшая версия предназначена для запросов с несколькими ограничениями и последовательными вызовами функций. Условный пример — подбор поездки, при котором агент по очереди проверяет даты, доступность мест и пересечения в календаре. В таком разговоре приложение должно хранить не только историю реплик, но и состояние незавершённой операции, полученные ответы функций и сведения, которые ещё требуют подтверждения.

В сложных заданиях разрыв достиг 38,5 процентного пункта

В независимой таблице испытаний речевых моделей конфигурация Gemini 3.8 Live Extended Thinking с высоким уровнем рассуждения получила 68,6% в τ-Voice, тогда как базовая Gemini 3.8 Live набрала 30,1%. Разница составила 38,5 процентного пункта; доля выполненных заданий у старшей конфигурации была более чем вдвое выше.

Испытание τ-Voice оценивает выполнение агентных задач с применением функций, а не только естественность речи или качество одной реплики. Такой формат выявляет преимущество продолжительного рассуждения в заданиях, где результат зависит от правильной последовательности действий, сохранения контекста и корректного обращения к внешним системам.

Показатели не описывают все возможные голосовые разговоры. Короткая справка или распределение обращений не требуют той же глубины рассуждения, что операция из нескольких зависимых этапов. Результат 68,6% также показывает, что старшая конфигурация не завершила успешно почти треть заданий этого испытания.

Приложению придётся разделять речь и состояние операции

У Gemini 3.8 Live Extended Thinking законченная голосовая реплика может быть лишь уведомлением о ходе работы. Вычисления и вызовы функций в этот момент продолжаются, поэтому интерфейс агента не должен считать каждую озвученную фразу окончательным результатом.

Состояние разговора, незавершённые вызовы и подтверждённый ответ внешней системы необходимо учитывать раздельно. Если агент произнёс, что проверяет бронирование, это ещё не подтверждает создание записи: окончательный статус определяется результатом соответствующей функции.

Публичные материалы о выпуске не дают оснований считать старшую модель лучшим выбором для любого голосового приложения. На 20 сентября подтверждены её преимущество в опубликованном многошаговом испытании и ориентация базовой версии на малую задержку; точный выбор зависит от того, нужен ли агенту быстрый ответ после одного действия или продолжительная цепочка операций. Дополнительных данных о поведении обеих моделей в разных предметных областях и при длительных сеансах пока недостаточно для более широкого вывода.

Читайте также:

Поделиться:

Подпишитесь на рассылку

Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.

0