Quasa
Установите приложение QUASA
Присоединяйся к пионеру Web3 крипто фриланса сейчас!
Открыть
Новости

AgentCore теперь проверяет агентов вне зависимости от платформы

|Автор: Редакция QUASA|4 мин чтения| 1
AgentCore теперь проверяет агентов вне зависимости от платформы

Публикация AWS от 26 августа 2026 года описывает независимое от фреймворка оценивание в Amazon Bedrock AgentCore Evaluations. Сервис восстанавливает сеансы из совместимой телеметрии и передаёт их одному набору встроенных или пользовательских оценщиков.

Короткий ответ: одним сервисом можно проверять агентов на LangGraph, LlamaIndex, OpenAI Agents SDK, Google ADK, Claude Agent SDK и Strands Agents. Но независимость относится к агентному фреймворку, а не к произвольному формату журналов: AgentCore должен получить распознаваемые трассировки OpenTelemetry или OpenInference с запросами, ответами модели и вызовами инструментов.

Общим слоем стала телеметрия, а не код агента

AgentCore распознаёт телеметрию разных агентных фреймворков и приводит её к общему входу для оценки

AgentCore Evaluations не запускает единый программный адаптер внутри каждого SDK. Вместо этого библиотеки инструментирования фиксируют выполнение агента в своих структурах, после чего сервис извлекает из них одинаковые смысловые элементы.

Для оценивания нужны три роли участков трассировки. Верхнеуровневый участок обращения к агенту содержит запрос пользователя и итоговый ответ; участки вывода модели — историю сообщений и ответ модели; участки инструментов — название функции, переданные параметры и результат. Записи о поиске, памяти, переранжировании или защитных проверках могут сохраняться как дополнительный контекст, но не заменяют эти основные данные.

Сервис определяет происхождение записи по полю scope.name. Области с документированными префиксами OpenTelemetry и OpenInference направляются в соответствующий обработчик, который знает расположение нужных атрибутов. Произвольное имя области не становится совместимым только потому, что вложенные поля внешне похожи на стандартные.

От трассировки до результата оценки

Трассировки с запросами, ответами и вызовами инструментов объединяются в сеанс перед оценкой AgentCore

Путь данных начинается с инструментированного обращения к агенту. Телеметрия поступает в Amazon CloudWatch, а AgentCore группирует связанные записи по идентификатору сеанса; отдельная трассировка при этом представляет один ход диалога.

  1. Библиотека инструментирования записывает запрос, операции модели и вызовы инструментов.
  2. AgentCore классифицирует участки трассировки и извлекает содержимое сообщений, параметры и результаты операций.
  3. Связанные ходы объединяются в восстановленный пользовательский сеанс.
  4. Сеанс поступает оценщикам, которым уже не требуется знать, какой агентный SDK создал исходные записи.

Из этого следует важное ограничение: наличие дерева трассировки ещё не гарантирует пригодность данных. Если в CloudWatch попали только технические участки без содержимого сообщений либо отсутствует верхнеуровневая запись обращения к агенту, сервис не сможет полноценно оценить ответ или восстановить ход диалога.

Какие сочетания фреймворков и телеметрии поддержаны

Матрица совместимости AgentCore относится к версиям библиотек для Python и предусматривает разные маршруты инструментирования:

  • Strands Agents — встроенная телеметрия SDK;
  • LangGraph — инструментарий OpenTelemetry или OpenInference для LangChain;
  • OpenAI Agents SDK — OpenTelemetry или OpenInference;
  • LlamaIndex — OpenTelemetry или OpenInference;
  • Google ADK — OpenInference;
  • Claude Agent SDK — OpenInference.

Таким образом, «один сервис» не означает одну библиотеку инструментирования для всех проектов. Общими становятся восстановленная структура сеанса и конвейер оценивания, тогда как пакет, имя области и расположение атрибутов зависят от исходного фреймворка.

Предусмотрен и универсальный путь для других агентов, если инструментарий соблюдает семантические соглашения OpenTelemetry для генеративного ИИ или OpenInference и использует распознаваемую область. Обычные трассировки HTTP-клиента, веб-фреймворка или AWS SDK сами по себе не описывают поведение агента и потому не заменяют агентную телеметрию.

Переносимость не определяет, какой ответ правильный

Сопоставление полной и неполной трассировок показывает необходимость эталонных задач и предметных критериев

Общий формат трассировок решает интеграционную задачу, но не задаёт предметные критерии качества. Из телеметрии можно узнать, что ответил агент, к какой модели обращался и какие инструменты вызвал. Однако OpenTelemetry и OpenInference не определяют, соответствует ли результат внутреннему регламенту, условиям операции или ожидаемому бизнес-исходу.

Для контролируемой оценки AgentCore принимает эталонные ответы, ожидаемую последовательность инструментов и утверждения о требуемом поведении. Такие данные позволяют проверять не только правдоподобие текста, но и достижение заранее известного результата. При смене фреймворка набор задач и правила прохождения проверки должны оставаться одинаковыми, иначе сравниваться будут одновременно и технология, и разные условия эксперимента.

Независимый разбор StarterStax также отделяет общий конвейер от полноты доказательств: для сопоставления фреймворков предлагается фиксировать одинаковые задания, ожидаемый результат и обязательные роли трассировки. Если один агент сохраняет параметры инструментов и контекст диалога, а другой теряет эти сведения, формальная совместимость ещё не делает результаты равноценными.

У оценки производственного трафика есть дополнительная граница: живые обращения обычно не сопровождаются заранее подготовленным правильным ответом. Для них остаются показатели, не требующие эталона, и собственные сигналы продукта; регрессионные наборы с ожидаемыми ответами, допустимыми инструментами и предметными правилами по-прежнему нужны для контролируемых запусков.

На 31 августа подтверждена поддержка перечисленных Python-фреймворков и универсального пути для совместимой инструментации. Главный открытый вопрос для платформенных команд теперь находится не на уровне подключения SDK, а в полноте собираемых трассировок и качестве собственных проверочных наборов.

Читайте также:

Поделиться:

Подпишитесь на рассылку

Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.

0