AWS опубликовала руководство по созданию агентных рабочих процессов, которые сочетают управляемые фундаментальные модели (FM) с собственными оптимизированными или доменными моделями, не переписывая агентный фреймворк. В центре материала — интеграция OpenAI-совместимых эндпоинтов Amazon SageMaker ИИ с Amazon Bedrock AgentCore runtime. Такой подход позволяет специализированным агентам решать сложные задачи, используя модель, наиболее подходящую для каждой конкретной функции, что дает оптимизацию затрат, контроль над размещением данных и гибкость выбора моделей в единой production-ready архитектуре.
В примере рассматривается развертывание Qwen 3.5 9B на Amazon SageMaker ИИ и его интеграция в многогагентную систему Strands Agents вместе с моделями на Amazon Bedrock. Архитектура включает три агента: оркестратор на Claude Haiku 4.5, который классифицирует намерения пользователя и маршрутизирует задачи через глобальный кросс-региональный инференс; бюджетный агент на Claude Sonnet 4.6, обрабатывающий разбивку бюджета 50/30/20 со структурированным выводом Pydantic; и финансовый аналитик на Qwen 3.5 9B, выполняющий анализ акций и формирование портфеля с помощью вызова инструментов. Пользовательский запрос поступает в оркестратор, работающий внутри Amazon Bedrock AgentCore runtime, который использует паттерн «агенты как инструменты» из Strands Agents для маршрутизации запроса к соответствующему специализированному агенту.
| Агент | Модель | Хостинг | Функция |
|---|---|---|---|
| Оркестратор | Claude Haiku 4.5 | Amazon Bedrock | Классификация намерений, маршрутизация |
| Бюджетный агент | Claude Sonnet 4.6 | Amazon Bedrock | Разбивка бюджета 50/30/20 |
| Финансовый аналитик | Qwen 3.5 9B | Amazon SageMaker AI | Анализ акций, формирование портфеля |
Ключевая особенность — использование OpenAI-совместимого API SageMaker ИИ, который ожидает bearer-токен. Токены истекают, поэтому для длительных сессий требуется механизм автообновления на каждый запрос. В руководстве предлагается реализация через httpx.Auth, которая генерирует новый токен при каждом запросе. Это критично для production-сценариев, где агентные сессии могут длиться долго.
Архитектура включает три агента: оркестратор на Claude Haiku 4.5, бюджетный агент на Claude Sonnet 4.6 и финансовый аналитик на Qwen 3.5 9B.

Развертывание Qwen 3.5 9B выполняется с помощью vLLM Deep Learning Container (DLC) на инстансе ml.g6e.2xlarge (1x L40S, 48GB VRAM). Используется образ vllm:0.22.1-gpu-py312-cu130, Python 3.12, CUDA 13.0. Это позволяет запускать модель с максимальной длиной контекста 32768 токенов. Выбор SageMaker ИИ для этой модели обусловлен возможностью оптимизации затрат и контроля над данными, в отличие от управляемых моделей Bedrock.
Интеграция с Amazon Bedrock AgentCore обеспечивает единую точку управления для всех агентов, независимо от того, где размещена модель. Это упрощает мониторинг и управление, а также добавляет наблюдаемость на уровне токенов, которую Strands Agents не предоставляет по умолчанию. Для полного понимания процесса AWS приводит код и архитектурную диаграмму, а также ссылку на GitHub-репозиторий с исходным кодом.
Этот подход отражает общий тренд в индустрии: компании стремятся комбинировать управляемые модели с собственными, чтобы балансировать между стоимостью, производительностью и требованиями к данным. Возможность использовать OpenAI-совместимые API на SageMaker ИИ упрощает миграцию существующих приложений, написанных для OpenAI, на инфраструктуру AWS. Однако стоит учитывать, что доступность моделей Bedrock варьируется по регионам, что может потребовать дополнительной настройки.
Для читателей, которые впервые сталкиваются с агентными пайплайнами, важно понимать: агентные системы — это не просто вызовы LLM, а оркестрация нескольких моделей, каждая из которых выполняет свою подзадачу. Такая архитектура позволяет достичь лучших результатов по сравнению с использованием одной универсальной модели, но требует продуманного проектирования и управления инфраструктурой. Пример AWS — практическое руководство, которое можно адаптировать под свои задачи.


