AgentCore теперь проверяет агентов вне зависимости от платформы

Публикация AWS от 26 августа 2026 года описывает независимое от фреймворка оценивание в Amazon Bedrock AgentCore Evaluations. Сервис восстанавливает сеансы из совместимой телеметрии и передаёт их одному набору встроенных или пользовательских оценщиков.
Короткий ответ: одним сервисом можно проверять агентов на LangGraph, LlamaIndex, OpenAI Agents SDK, Google ADK, Claude Agent SDK и Strands Agents. Но независимость относится к агентному фреймворку, а не к произвольному формату журналов: AgentCore должен получить распознаваемые трассировки OpenTelemetry или OpenInference с запросами, ответами модели и вызовами инструментов.
Общим слоем стала телеметрия, а не код агента

AgentCore Evaluations не запускает единый программный адаптер внутри каждого SDK. Вместо этого библиотеки инструментирования фиксируют выполнение агента в своих структурах, после чего сервис извлекает из них одинаковые смысловые элементы.
Для оценивания нужны три роли участков трассировки. Верхнеуровневый участок обращения к агенту содержит запрос пользователя и итоговый ответ; участки вывода модели — историю сообщений и ответ модели; участки инструментов — название функции, переданные параметры и результат. Записи о поиске, памяти, переранжировании или защитных проверках могут сохраняться как дополнительный контекст, но не заменяют эти основные данные.
Сервис определяет происхождение записи по полю scope.name. Области с документированными префиксами OpenTelemetry и OpenInference направляются в соответствующий обработчик, который знает расположение нужных атрибутов. Произвольное имя области не становится совместимым только потому, что вложенные поля внешне похожи на стандартные.
От трассировки до результата оценки

Путь данных начинается с инструментированного обращения к агенту. Телеметрия поступает в Amazon CloudWatch, а AgentCore группирует связанные записи по идентификатору сеанса; отдельная трассировка при этом представляет один ход диалога.
- Библиотека инструментирования записывает запрос, операции модели и вызовы инструментов.
- AgentCore классифицирует участки трассировки и извлекает содержимое сообщений, параметры и результаты операций.
- Связанные ходы объединяются в восстановленный пользовательский сеанс.
- Сеанс поступает оценщикам, которым уже не требуется знать, какой агентный SDK создал исходные записи.
Из этого следует важное ограничение: наличие дерева трассировки ещё не гарантирует пригодность данных. Если в CloudWatch попали только технические участки без содержимого сообщений либо отсутствует верхнеуровневая запись обращения к агенту, сервис не сможет полноценно оценить ответ или восстановить ход диалога.
Какие сочетания фреймворков и телеметрии поддержаны
Матрица совместимости AgentCore относится к версиям библиотек для Python и предусматривает разные маршруты инструментирования:
- Strands Agents — встроенная телеметрия SDK;
- LangGraph — инструментарий OpenTelemetry или OpenInference для LangChain;
- OpenAI Agents SDK — OpenTelemetry или OpenInference;
- LlamaIndex — OpenTelemetry или OpenInference;
- Google ADK — OpenInference;
- Claude Agent SDK — OpenInference.
Таким образом, «один сервис» не означает одну библиотеку инструментирования для всех проектов. Общими становятся восстановленная структура сеанса и конвейер оценивания, тогда как пакет, имя области и расположение атрибутов зависят от исходного фреймворка.
Предусмотрен и универсальный путь для других агентов, если инструментарий соблюдает семантические соглашения OpenTelemetry для генеративного ИИ или OpenInference и использует распознаваемую область. Обычные трассировки HTTP-клиента, веб-фреймворка или AWS SDK сами по себе не описывают поведение агента и потому не заменяют агентную телеметрию.
Переносимость не определяет, какой ответ правильный

Общий формат трассировок решает интеграционную задачу, но не задаёт предметные критерии качества. Из телеметрии можно узнать, что ответил агент, к какой модели обращался и какие инструменты вызвал. Однако OpenTelemetry и OpenInference не определяют, соответствует ли результат внутреннему регламенту, условиям операции или ожидаемому бизнес-исходу.
Для контролируемой оценки AgentCore принимает эталонные ответы, ожидаемую последовательность инструментов и утверждения о требуемом поведении. Такие данные позволяют проверять не только правдоподобие текста, но и достижение заранее известного результата. При смене фреймворка набор задач и правила прохождения проверки должны оставаться одинаковыми, иначе сравниваться будут одновременно и технология, и разные условия эксперимента.
Независимый разбор StarterStax также отделяет общий конвейер от полноты доказательств: для сопоставления фреймворков предлагается фиксировать одинаковые задания, ожидаемый результат и обязательные роли трассировки. Если один агент сохраняет параметры инструментов и контекст диалога, а другой теряет эти сведения, формальная совместимость ещё не делает результаты равноценными.
У оценки производственного трафика есть дополнительная граница: живые обращения обычно не сопровождаются заранее подготовленным правильным ответом. Для них остаются показатели, не требующие эталона, и собственные сигналы продукта; регрессионные наборы с ожидаемыми ответами, допустимыми инструментами и предметными правилами по-прежнему нужны для контролируемых запусков.
На 31 августа подтверждена поддержка перечисленных Python-фреймворков и универсального пути для совместимой инструментации. Главный открытый вопрос для платформенных команд теперь находится не на уровне подключения SDK, а в полноте собираемых трассировок и качестве собственных проверочных наборов.
Читайте также:
Подпишитесь на рассылку
Получайте свежие новости Web3, AI и криптовалют прямо на вашу почту.