Amazon Web Services опубликовала разбор миграции мультимодельного медицинского ИИ-агента с самостоятельно управляемой инфраструктуры на управляемый runtime Amazon Bedrock AgentCore. В предыдущем материале компании тот же агент разворачивался на Amazon Elastic Container Service (Amazon ECS) с AWS Fargate, где оркестрацию контейнеров, политики масштабирования, идентификацию и наблюдаемость настраивал пользователь. Теперь эти задачи переходят к AgentCore runtime, а команда занимается только кодом агента.
Агент обрабатывает медицинские запросы через три бэкенда. Специализированные биомедицинские вопросы уходят к модели BioM-ELECTRA-Large-SQuAD2, развёрнутой на Amazon SageMaker ИИ. Более широкие медицинские рассуждения берёт на себя фундаментальная модель Llama 3.1 70B Instruct от Meta на Amazon Bedrock. Третий бэкенд — контейнерный сервер с той же BioM-ELECTRA для самостоятельного развёртывания. Векторный поиск по медицинской базе знаний обеспечивает Amazon OpenSearch Service. Всё это работает внутри одного контейнера, которым управляет AgentCore.
| Компонент | Роль в решении |
|---|---|
| Amazon Bedrock AgentCore runtime | Управляемое развёртывание контейнера агента, масштабирование, идентификация, наблюдаемость |
| Amazon Bedrock с Llama 3.1 70B Instruct | Сложные медицинские рассуждения |
| Amazon SageMaker AI с BioM-ELECTRA-Large-SQuAD2 | Специализированные биомедицинские запросы, управляемое автомасштабирование |
| Amazon OpenSearch Service | Векторное сопоставление и извлечение контекста из медицинской базы знаний |
| Контейнерный сервер модели BioM-ELECTRA | Самостоятельное развёртывание модели |
| AWS IAM | Безопасность и контроль доступа |
С технической стороны миграция свелась к обёртке существующей логики декоратором AgentCore runtime. Агент написан на Hugging Face smolagents — открытой Python-библиотеке, которая позволяет собирать и запускать агентов в несколько строк кода. AWS использует её как референсную реализацию, чтобы показать: AgentCore runtime не привязан к конкретному фреймворку. Подход bring-your-own agent означает, что разворачивать можно уже готовый код, не переписывая его под требования платформы.

Показательна и смена модели между двумя публикациями. В standalone-версии применялась Claude 3.5 Sonnet V2 от Anthropic, в версии на AgentCore — Llama 3.1 70B Instruct от Meta. AWS подчёркивает, что выбор модели — решение реализации, а не требование платформы: runtime остаётся модель-агностичным. Это отличает его от сценариев, где управляемый сервис диктует конкретного поставщика модели.
Для команд, которые строят агентные приложения, такой перенос меняет распределение трудозатрат. На самостоятельно управляемой инфраструктуре значительная часть времени уходит на конфигурацию контейнеров, масштабирование и наблюдаемость, а не на логику агента. Управляемый runtime забирает эти операционные задачи, оставляя разработчику оркестрацию моделей и работу с данными. Ограничение в том, что это демонстрационная реализация: для продакшена с медицинскими или другими чувствительными запросами AWS рекомендует Amazon Bedrock Guardrails для фильтрации контента и проверки обоснованности ответов.
Архитектура опирается на несколько сервисов AWS. Помимо AgentCore runtime и двух модельных бэкендов, в схему входят Amazon OpenSearch Service для векторного сопоставления и извлечения контекста, контейнерный сервер модели и AWS Identity and Access Management (IAM) для контроля доступа. Клиентский веб-интерфейс подключается к AgentCore runtime, который размещает контейнер агента со встроенными идентификацией и наблюдаемостью. Такой набор показывает типовой стек для мультимодельного агента: разные модели под разные типы задач, векторный поиск для знаний и управляемый слой для инфраструктуры.



