AWS представила Amazon Bedrock AgentCore Evaluations — сервис для оценки ИИ-агентов, который работает независимо от фреймворка, на котором агент построен. Это стало ответом на давнюю проблему: команды, разрабатывающие продакшн-агентов, сталкиваются с тем, что большинство систем оценки привязаны к конкретному SDK, LLM-клиенту или паттерну трассировки. Как только разработчик выходит за узкую зону совместимости, пайплайн оценки ломается.
Проблема фрагментации усугубляется разнообразием фреймворков: LangGraph популярен за свою модель оркестрации, LlamaIndex — за интеграцию с пайплайнами ретрива, OpenAI Agents SDK выбирают организации, стандартизированные на GPT-моделях. Google ADK используется для координации мультиагентных систем, а Claude Agent SDK — для нативных возможностей Anthropic. Strands Agents позволяет запустить рабочего агента на Amazon Bedrock AgentCore за минуты, а не дни. Все эти фреймворки всё чаще разворачиваются на Amazon Bedrock AgentCore runtime, который берёт на себя хостинг, масштабирование, память и наблюдаемость.
AgentCore Evaluations решает эту фрагментацию, отделяя оценку от выбора фреймворка. Ключевая идея — использование OpenTelemetry как общего языка. OpenTelemetry — это вендор-нейтральный инструментарий, стандартизирующий эмиссию трейсов, метрик и логов. Трейс представляет собой дерево спанов, где каждый спан — это один шаг запроса: единица работы с именем, временными метками, атрибутами и событиями. Спаны экспортируются по протоколу OTLP и собираются бэкендом телеметрии. На AgentCore runtime этим бэкендом является AWS Distro for OpenTelemetry (ADOT), который направляет спаны в Amazon CloudWatch.
Сервис анализирует три ключевых типа спанов: invoke agent, inference и execute tool, игнорируя остальные как контекст.

Для оценки сервису нужны три роли спанов: invoke agent (верхнеуровневый цикл запрос-ответ, содержащий пользовательский промпт и финальный ответ агента), inference (отдельные вызовы моделей с историей сообщений и ответом) и execute tool (вызовы инструментов с именем, параметрами и результатом). Остальные спаны — ретриверы, гардрейлы, память, реранкинг — рассматриваются как контекст и не требуют специальной настройки. Это делает подход перспективно-совместимым: новые типы спанов просто игнорируются, а не вызывают ошибки.
Сервис классифицирует каждый спан, читает значения из этих трёх ролей и пропускает остальные. Разные фреймворки используют разные имена атрибутов и структуры, но OpenTelemetry GenAI и OpenInference конвенции стандартизируют запись этих ролей. Это позволяет оценивать агентов на любом фреймворке, если телеметрия проходит через OpenTelemetry.
Для читателей, которые впервые слышат об этой теме, важно понимать: оценка агентов — это критический этап разработки, который раньше требовал ручной настройки под каждый фреймворк. AgentCore Evaluations упрощает этот процесс, делая оценку универсальной. Это особенно актуально для команд, которые используют несколько фреймворков или планируют миграцию между ними.



