Google ADK тестирует голосовых агентов — пользователя сыграет другой ИИ

В публикации Google от 24 августа 2026 года представлен встроенный режим проверки голосовых агентов в ADK. Модель формирует реплики условного пользователя, Gemini TTS превращает их в речь, а проверяемый агент получает аудио так, как получил бы его во время обычного разговора.
Проверка охватывает не только итоговый ответ. ADK сохраняет последовательность реплик и действий, поэтому разработчик может оценить отдельные ответы, вызовы инструментов и всю траекторию разговора — от первой фразы до достижения цели сценария.
Как ИИ воспроизводит роль пользователя

Проверочный разговор можно задать динамически или зафиксировать дословно. В динамическом варианте разработчик указывает начальную реплику, цель и персону, после чего симулятор самостоятельно отвечает агенту и завершает беседу, когда считает план выполненным. В фиксированном варианте все реплики пользователя перечисляются заранее.
Персона определяет, насколько охотно условный собеседник раскрывает сведения и ждёт ли он уточняющих вопросов. Например, начинающий пользователь может сообщить только общую цель и предоставлять детали по запросу агента. Для сценария также задаётся предел обращений, который останавливает затянувшийся диалог.
Формирование ответа и его озвучивание выполняют разные компоненты. Одна модель управляет содержанием реплик и очередностью ходов, другая синтезирует речь; голос и язык выбираются отдельно. Это позволяет менять речевой вход, не переписывая цель разговора, но единичный прогон с выбранным голосом ничего не доказывает об устойчивости к другим акцентам, шуму или перебиваниям.
Минимальный воспроизводимый сценарий проверки

Для запуска нужны проверяемый агент, набор сценариев в формате JSON и конфигурация оценивания. Минимальная последовательность выглядит так:
- В наборе сценариев указать начальную фразу, цель разговора и персону условного пользователя. Если импровизация не нужна, вместо этого зафиксировать его реплики.
- В конфигурации включить двунаправленный голосовой режим и выбрать речевой симулятор. Там же задать модель, которая ведёт разговор, синтезатор речи, голос, язык и предел обращений.
- Добавить критерии для нужного уровня проверки: отдельного ответа, вызова инструмента или всей многоходовой траектории.
- Запустить команду adk eval, передав пути к агенту, набору сценариев и конфигурации.
- Открыть завершённый прогон в ADK Web, где доступны расшифрованные ходы и сохранённые аудиофрагменты.
Если голосовой режим отключить, тот же набор сценариев можно выполнить как текстовый. Благодаря этому цель и персона остаются прежними, а меняется только способ передачи реплик. Такое сравнение помогает отделить ошибки логики агента от проблем распознавания или синтеза речи, хотя само по себе не заменяет повторные прогоны.
Что измеряется, а что пока не доказано
Открытый код генератора ADK подтверждает двунаправленную передачу аудио порциями по 16 000 байт, явное обозначение начала и конца речевой активности и сохранение расшифровок входящей и исходящей речи. Если сообщение содержит аудио, агенту передаётся именно звуковая часть, а полное содержимое сохраняется в записи для последующей оценки.
- Измеряется: соответствие отдельных ответов заданному критерию, если для них настроена поэтапная оценка.
- Измеряется: факт вызова инструмента, его аргументы и место вызова в последовательности действий.
- Измеряется: прохождение всей траектории по рубрике на естественном языке — например, соблюдение требуемого порядка проверки данных и выполнения действий.
- Не доказано: что вызов инструмента привёл к правильному изменению во внешней системе. Для этого нужна отдельная программная проверка результата.
- Не доказано: что высокая оценка сохранится при другом акценте, голосе, уровне шума или способе перебивания.
- Не доказано: что режим сам по себе количественно измеряет задержку и естественность речи. В показанной конфигурации таких результатов нет.
Расшифровка также не равна исходному звуку: ошибка распознавания способна изменить материал, который увидит модель-судья. Поэтому для спорного результата важно различать аудио, полученную расшифровку, действие агента и выставленную оценку — это разные части одной записи.
Почему решение модели-судьи остаётся субъективным

Рубрика на естественном языке полезна, когда правильную реплику нельзя свести к точному совпадению строк. Однако итог зависит от выбранной модели-судьи, формулировки критерия и конкретной траектории. Высокий балл означает соответствие этой конфигурации, а не объективную правильность агента при любых условиях.
Симулятор тоже влияет на результат: другая персона может раньше сообщить важную деталь, иначе отреагировать на уточнение или завершить разговор в другой момент. Если одновременно поменять судью, персону, синтезатор и голос, определить причину изменения оценки будет невозможно. Для сопоставимых серий эти параметры следует фиксировать и менять по одному.
Независимая сверка от 25 августа 2026 года выявила различие между названиями моделей в публикации и связанном образце конфигурации, а также отсутствие ряда новых полей на проверенных страницах документации. Это не опровергает работающий механизм в открытом коде, но указывает, что образцы и документация обновлялись несинхронно.
На 28 августа подтверждены голосовой прогон, сохранение расшифровок и действий, а также оценивание отдельных ходов и полной траектории. В доступных материалах пока нет данных о стоимости крупных серий, разбросе оценок при повторении и сравнительных результатах для разных акцентов, фонового шума и перебиваний. Именно эти показатели нужны, чтобы судить не только о работоспособности режима, но и о повторяемости его выводов.
Читайте также:
Подпишитесь на рассылку
Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.