AWS опубликовала референсную архитектуру, которая подключает OpenAI Codex к Amazon Bedrock через LiteLLM-шлюз, развернутый на Amazon ECS. Материал появился в официальном блоге AWS Machine Learning Blog и описывает, как компании могут получить централизованный контроль над ИИ-агентами для написания кода. Codex — это агент от OpenAI, который помогает разработчикам понимать репозитории, писать код, запускать тесты и выполнять многошаговые инженерные задачи. Он работает локально на рабочей станции разработчика, но запросы к модели можно направлять через инфраструктуру в AWS-аккаунте клиента.

Предложенная схема размещает LiteLLM между Codex и Amazon Bedrock. LiteLLM становится общей точкой контроля для аутентификации моделей, маршрутизации, бюджетов, лимитов и телеметрии. Codex сохраняет за собой локальный цикл выполнения задач и инструментов. Запрос проходит пять шагов: Codex отправляет контекст и определения инструментов на endpoint /v1/responses; Application Load Balancer и AWS WAF применяют сетевые и веб-фильтры; LiteLLM аутентифицирует вызывающего, проверяет политику потребления и через ECS task role вызывает модель в Amazon Bedrock; Bedrock возвращает текст или вызов функции; если модель запрашивает инструмент, Codex выполняет его локально в песочнице и отправляет результат обратно через LiteLLM. Цикл повторяется.

КомпонентРоль
LiteLLMШлюз для маршрутизации, аутентификации, бюджетов и лимитов
Amazon ECSПлатформа для запуска контейнера LiteLLM
Amazon BedrockИсточник моделей OpenAI
Amazon RDSХранение состояния и данных об использовании LiteLLM
AWS Secrets ManagerХранение ключей и секретов

Вспомогательные сервисы включают Amazon RDS для PostgreSQL для хранения состояния, использования и бюджетных данных LiteLLM, AWS Secrets Manager и AWS KMS для хранения ключей, CloudWatch для логов и мониторинга, а также Amazon ECR для образа шлюза. Важно, что шлюз не получает доступ к shell в AWS-аккаунте и не заменяет локальные проверки Codex — он управляет каждым обращением к модели.

Архитектура включает пять шагов: от запроса Codex к /v1/responses через балансировщик и WAF до вызова модели в Bedrock.

Codex request flow through LiteLLM on AWS
Codex request flow through LiteLLM on AWS · Источник: AWS Machine Learning Blog

LiteLLM — это open-source ИИ-шлюз, который предоставляет маршрутизацию моделей, виртуальные ключи, бюджеты, лимиты и телеметрию через API-совместимые endpoints. В этом паттерне клиент управляет LiteLLM и всей инфраструктурой в своем AWS-аккаунте. Прямой доступ к Amazon Bedrock — самый простой вариант, если нативные AWS-инструменты идентификации, IAM-политики и CloudTrail-логи удовлетворяют требованиям. Шлюз становится полезным, когда команде нужны дополнительные контроли, единые для всех разработчиков, команд или провайдеров моделей.

LiteLLM оправдан, если требуется разрешать только одобренные алиасы моделей, выдавать ключи уровня пользователя или команды, применять жесткие бюджеты и лимиты запросов в минуту или токенов в минуту, централизовать маршрутизацию и политику фолбэка, а также сохранять identity на уровне шлюза, когда модель использует общую ECS task role. Основной компромисс — операционная ответственность: команда владеет доступностью шлюза, жизненным циклом базы данных, обновлениями версий, реагированием на инциденты и планированием емкости.

AWS также отмечает, что в некоторых случаях лучше подходит прямой доступ через AWS IAM Identity Center или управляемый шлюз, такой как Portkey. Полная реализация доступна в репозитории guidance-codex, а для основного пути рекомендуется использовать LiteLLM on AWS quickstart. Это решение особенно актуально для организаций, которые переходят от индивидуальных экспериментов к управляемому внедрению ИИ-агентов и нуждаются в консистентном способе контроля доступа и учета потребления.