В корпоративном блоге Amazon Web Services описан эксперимент: команда собрала систему бронирования авиабилетов на четырёх специализированных ИИ-агентах и подключила к ней два независимых контура наблюдения. Первый — Amazon Bedrock AgentCore Evaluations, второй — AWS DevOps Agent. Задача демонстрации — показать, что качество работы агента и здоровье инфраструктуры требуют разных инструментов.

Проблема, которую решает такая архитектура, знакома всем, кто выводил агентов в продакшен. Агент может успешно вызвать Amazon Bedrock, выполнить все инструменты без ошибок и вернуть ответ, но при этом не понять, что нужно пользователю. Метрики Amazon CloudWatch покажут, что система работала корректно, но не ответят на вопрос, помог ли агент достичь цели. Инфраструктурные сбои часто проявляются не как явные ошибки, а как снижение качества поведения. Например, у агента бронирования перестают проходить резервации, а логи показывают успешные вызовы инструментов, потому что проблема возникла на три вызова глубже по цепочке и не выбросила исключение. Другой пример из материала: у супервизора плохо прописан промпт, и он начинает направлять 20% запросов не тому специалисту, при этом инфраструктурные метрики остаются зелёными.

КомпонентРоль в системе
Amazon BedrockAPI-доступ к фундаментальным моделям от Anthropic, Meta, Mistral и Amazon
AgentCore runtimeОркестрация агентов и управление жизненным циклом взаимодействий
AgentCore EvaluationsНепрерывная оценка качества ответов по полезности, корректности и завершённости задачи
AWS DevOps AgentАвтономный разбор инцидентов: анализ логов, трассировка сбоев, анализ первопричины
Strands AgentsOpen-source SDK для построения агентов с поддержкой Swarm, Graph и Agents-as-Tools
OpenTelemetryСбор трассировок, метрик и логов с передачей в Amazon CloudWatch

AgentCore Evaluations встроен в AgentCore runtime и непрерывно оценивает живые взаимодействия. Система выбирает настраиваемый процент продакшен-запросов и в фоне прогоняет их через методологию LLM-as-a-Judge, выставляя оценки по полезности, корректности, завершённости задачи и другим измерениям качества. Это позволяет ловить неверный выбор инструмента, провалы в выполнении задачи и регрессии качества, которые не видны в инфраструктурных метриках. AWS DevOps Agent работает на другом уровне: при инциденте он берёт на себя роль дежурного инженера, анализирует логи CloudWatch, прослеживает сбои через границы сервисов и выдаёт анализ первопричины с рекомендациями по устранению. В демонстрационной системе он сопоставляет IAM-политики, логи вызовов и трассировки оркестрации без ручного разбора.

Diagram of the Swarm multi-agent pattern with a supervisor agent routing work to flight, user, and reservation agents
Diagram of the Swarm multi-agent pattern with a supervisor agent routing work to flight, user, and reservation agents · Источник: AWS Machine Learning Blog

Мультиагентные системы усложняют задачу. Один запрос пользователя запускает супервизора, который распределяет работу между специалистами, у каждого свои инструменты и вызовы моделей. Фиксированного графа исполнения, который можно было бы инструментировать, обычно нет. Сбои возникают в точках передачи управления, а их распространение по системе не всегда предсказуемо. В демо использован паттерн Swarm из open-source SDK Strands Agents: супервизор динамически маршрутизирует задачи, и путь исполнения меняется в зависимости от решений во время работы. Это удобно для сложных сценариев, но затрудняет наблюдение.

Техническая основа демонстрации — Amazon Bedrock для доступа к фундаментальным моделям от Anthropic, Meta, Mistral и самой Amazon, AgentCore runtime для оркестрации и управления жизненным циклом взаимодействий со встроенной наблюдаемостью через OpenTelemetry. Для быстрого развёртывания защищённого React-фронтенда с бэкендом AgentCore существует Fullstack AgentCore Solution Template (FAST). OpenTelemetry передаёт трассировки, метрики и логи в Amazon CloudWatch, обеспечивая единый сбор данных по всей системе.

Практический вывод для команд, которые выводят агентов в продакшен, такой: одного слоя мониторинга недостаточно. Инфраструктурные метрики отвечают на вопрос, работает ли система, а оценка качества — на вопрос, помогает ли агент пользователю. AWS предлагает закрывать оба контура: AgentCore Evaluations для непрерывной оценки качества и DevOps Agent для автономного разбора инцидентов.