Amazon Bedrock AgentCore получил инструменты для автоматической оценки агентов ИИ в пайплайне CI/CD. В референсной реализации, описанной в блоге AWS, GitHub Actions разворачивает агента на AgentCore runtime, прогоняет его через набор оценочных промптов и блокирует pull request, если метрики качества упали ниже порога. Такой подход закрывает давнюю проблему: изменения в системном промпте, модели или конфигурации инструментов часто приводят к деградации агента, которую не замечают до жалоб пользователей.

Ключевой элемент — AgentCore Evaluations, capability платформы Amazon Bedrock AgentCore, которая оценивает поведение агента с помощью LLM-as-a-judge. Сервис читает OpenTelemetry-трейсы из Amazon CloudWatch и выставляет баллы по таким измерениям, как helpfulness, correctness и tool selection accuracy. Для CI/CD используется on-demand режим: вы передаете span data прямо в API-вызове, выбираете оценщиков и получаете результаты. Онлайн-режим мониторит продакшн-трафик с настраиваемой семплируемостью, а батч-режим скорит несколько сессий асинхронно.

Режим оценкиКогда используетсяКак работает
On-demandCI/CD quality gatesПередача span data в API-вызове, получение баллов
OnlineМониторинг продакшн-трафикаНепрерывная оценка с настраиваемой семплируемостью, результаты в CloudWatch
BatchПакетная оценка сессийАсинхронное скоринг множества сессий

Сложность, которую пришлось решать авторам, — аутентификация. MCP-сервер, к которому обращается агент, защищен OAuth с ролевым доступом: часть инструментов публична, часть доступна только определенным ролям. CI-пайплайн не имеет пользовательского контекста, поэтому используется machine-to-machine (M2M) flow client_credentials. Для доступа к AWS из GitHub Actions применяется OIDC-федерация: GitHub выпускает короткоживущий токен, AWS его валидирует и выдает временные IAM-роли без хранения долгоживущих секретов.

Architecture diagram showing a Strands agent runtime and an MCP server runtime on Amazon Bedrock AgentCore behind a shared Amazon Cognito user pool, with the GitHub Actions pipeline invoking the agent and evaluating traces
Architecture diagram showing a Strands agent runtime and an MCP server runtime on Amazon Bedrock AgentCore behind a shared Amazon Cognito user pool, with the GitHub Actions pipeline invoking the agent and evaluating traces · Источник: AWS Machine Learning Blog

Архитектура референсного решения включает агента Strands, который подключается к MCP-серверу с ролевым доступом, общий пул Cognito для M2M и пользовательских auth-потоков, CDK-инфраструктуру как код и единый скрипт оценки. Полный код доступен в сопроводительном репозитории. Quality gate — это CI/CD-паттерн, где шаг пайплайна должен пройти порог (например, 0.8 из 1.0), иначе PR остается заблокированным.

Для отрасли это шаг к объективизации качества агентов. Ручное тестирование не масштабируется, а субъективные оценки «стало лучше или хуже» не работают в командной разработке. Интеграция оценки в CI/CD — естественный аналог unit-тестов и code review для ИИ-агентов. Подход AWS не уникален: похожие механизмы появляются у других платформ, но реализация на AgentCore с OAuth-защищенными MCP-инструментами и OIDC-федерацией выглядит законченной и воспроизводимой.