Quasa
Установите приложение QUASA
Присоединяйся к пионеру Web3 крипто фриланса сейчас!
Открыть
Технологии

Google ADK тестирует голосовых агентов — пользователя сыграет другой ИИ

|Автор: Редакция QUASA|4 мин чтения| 6
Google ADK тестирует голосовых агентов — пользователя сыграет другой ИИ

В публикации Google от 24 августа 2026 года представлен встроенный режим проверки голосовых агентов в ADK. Модель формирует реплики условного пользователя, Gemini TTS превращает их в речь, а проверяемый агент получает аудио так, как получил бы его во время обычного разговора.

Проверка охватывает не только итоговый ответ. ADK сохраняет последовательность реплик и действий, поэтому разработчик может оценить отдельные ответы, вызовы инструментов и всю траекторию разговора — от первой фразы до достижения цели сценария.

Как ИИ воспроизводит роль пользователя

ИИ-симулятор в Google ADK ведёт голосовой разговор по плану и персоне, отвечая на уточнения агента.

Проверочный разговор можно задать динамически или зафиксировать дословно. В динамическом варианте разработчик указывает начальную реплику, цель и персону, после чего симулятор самостоятельно отвечает агенту и завершает беседу, когда считает план выполненным. В фиксированном варианте все реплики пользователя перечисляются заранее.

Персона определяет, насколько охотно условный собеседник раскрывает сведения и ждёт ли он уточняющих вопросов. Например, начинающий пользователь может сообщить только общую цель и предоставлять детали по запросу агента. Для сценария также задаётся предел обращений, который останавливает затянувшийся диалог.

Формирование ответа и его озвучивание выполняют разные компоненты. Одна модель управляет содержанием реплик и очередностью ходов, другая синтезирует речь; голос и язык выбираются отдельно. Это позволяет менять речевой вход, не переписывая цель разговора, но единичный прогон с выбранным голосом ничего не доказывает об устойчивости к другим акцентам, шуму или перебиваниям.

Минимальный воспроизводимый сценарий проверки

Сценарий и живая конфигурация ADK запускают воспроизводимую голосовую проверку агента.

Для запуска нужны проверяемый агент, набор сценариев в формате JSON и конфигурация оценивания. Минимальная последовательность выглядит так:

  1. В наборе сценариев указать начальную фразу, цель разговора и персону условного пользователя. Если импровизация не нужна, вместо этого зафиксировать его реплики.
  2. В конфигурации включить двунаправленный голосовой режим и выбрать речевой симулятор. Там же задать модель, которая ведёт разговор, синтезатор речи, голос, язык и предел обращений.
  3. Добавить критерии для нужного уровня проверки: отдельного ответа, вызова инструмента или всей многоходовой траектории.
  4. Запустить команду adk eval, передав пути к агенту, набору сценариев и конфигурации.
  5. Открыть завершённый прогон в ADK Web, где доступны расшифрованные ходы и сохранённые аудиофрагменты.

Если голосовой режим отключить, тот же набор сценариев можно выполнить как текстовый. Благодаря этому цель и персона остаются прежними, а меняется только способ передачи реплик. Такое сравнение помогает отделить ошибки логики агента от проблем распознавания или синтеза речи, хотя само по себе не заменяет повторные прогоны.

Что измеряется, а что пока не доказано

Открытый код генератора ADK подтверждает двунаправленную передачу аудио порциями по 16 000 байт, явное обозначение начала и конца речевой активности и сохранение расшифровок входящей и исходящей речи. Если сообщение содержит аудио, агенту передаётся именно звуковая часть, а полное содержимое сохраняется в записи для последующей оценки.

  • Измеряется: соответствие отдельных ответов заданному критерию, если для них настроена поэтапная оценка.
  • Измеряется: факт вызова инструмента, его аргументы и место вызова в последовательности действий.
  • Измеряется: прохождение всей траектории по рубрике на естественном языке — например, соблюдение требуемого порядка проверки данных и выполнения действий.
  • Не доказано: что вызов инструмента привёл к правильному изменению во внешней системе. Для этого нужна отдельная программная проверка результата.
  • Не доказано: что высокая оценка сохранится при другом акценте, голосе, уровне шума или способе перебивания.
  • Не доказано: что режим сам по себе количественно измеряет задержку и естественность речи. В показанной конфигурации таких результатов нет.

Расшифровка также не равна исходному звуку: ошибка распознавания способна изменить материал, который увидит модель-судья. Поэтому для спорного результата важно различать аудио, полученную расшифровку, действие агента и выставленную оценку — это разные части одной записи.

Почему решение модели-судьи остаётся субъективным

Повторные проверки голосового агента фиксируют модель-судью, голос, язык и персону, выявляя разброс оценок.

Рубрика на естественном языке полезна, когда правильную реплику нельзя свести к точному совпадению строк. Однако итог зависит от выбранной модели-судьи, формулировки критерия и конкретной траектории. Высокий балл означает соответствие этой конфигурации, а не объективную правильность агента при любых условиях.

Симулятор тоже влияет на результат: другая персона может раньше сообщить важную деталь, иначе отреагировать на уточнение или завершить разговор в другой момент. Если одновременно поменять судью, персону, синтезатор и голос, определить причину изменения оценки будет невозможно. Для сопоставимых серий эти параметры следует фиксировать и менять по одному.

Независимая сверка от 25 августа 2026 года выявила различие между названиями моделей в публикации и связанном образце конфигурации, а также отсутствие ряда новых полей на проверенных страницах документации. Это не опровергает работающий механизм в открытом коде, но указывает, что образцы и документация обновлялись несинхронно.

На 28 августа подтверждены голосовой прогон, сохранение расшифровок и действий, а также оценивание отдельных ходов и полной траектории. В доступных материалах пока нет данных о стоимости крупных серий, разбросе оценок при повторении и сравнительных результатах для разных акцентов, фонового шума и перебиваний. Именно эти показатели нужны, чтобы судить не только о работоспособности режима, но и о повторяемости его выводов.

Читайте также:

Поделиться:

Подпишитесь на рассылку

Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.

0