AWS представила HyperPod InstantStart — открытый control plane для SageMaker HyperPod, который автоматизирует рутинные операции по созданию и управлению кластерами для обучения и инференса фундаментальных моделей. Решение описано в блоге AWS Machine Learning Blog и доступно как open source.

SageMaker HyperPod — это управляемый сервис AWS для выполнения ресурсоёмких задач ИИ. Он берёт на себя мониторинг здоровья узлов, автоматическое восстановление после сбоев, масштабирование и другие операции. Однако пользовательский контроль остаётся за Amazon EKS — оркестратором Kubernetes, который команда настраивает самостоятельно. Это даёт прямой доступ к Kubernetes, но требует от команды умения собирать воедино ресурсы AWS, аддоны, рабочие нагрузки и операции второго дня.

LayerInstantStart contributionManaged foundation
InfrastructureStaged EKS creation or import, dependency reconciliation, network layout, multi-cluster stateAWS CloudFormation and Amazon EKS
Capacity and resilienceInstance-group workflows, capacity-type choices, managed-feature configurationHyperPod health monitoring, automatic node recovery, continuous provisioning, managed Karpenter
Workloads and dataTraining recipes, two inference paths, model download and storage workflows, MLflow integrationHyperPod training and inference operators, Amazon S3, FSx for Lustre, managed MLflow
InterfacesWeb UI with live state, REST APIs, MCP tools, and agent skillsAWS and Kubernetes APIs remain directly inspectable

HyperPod InstantStart решает проблему композиции этих элементов. Он предоставляет два способа управления: через веб-интерфейс, где создание кластера с установленными зависимостями и смонтированным хранилищем — это форма и кнопка обновления, и через терминал, где достаточно одной фразы: «[hypd-inst-agent] > Help me create a new HyperPod cluster». ИИ-агент планирует многоэтапный рабочий процесс, запускает каждый этап и опрашивает асинхронные операции AWS до их завершения. Он останавливается только для решений, которые принадлежат пользователю: выбор зоны доступности, типа инстанса и типа ёмкости.

ИИ-агент планирует и запускает многоэтапные рабочие процессы, опрашивая асинхронные операции AWS до завершения.

HyperPod InstantStart: управление кластерами SageMaker через ИИ-агента
· Источник: AWS Machine Learning Blog

Архитектура InstantStart построена вокруг единого контейнера управления, работающего вне полосы пропускания данных. Он вызывает API AWS и Kubernetes, но не участвует в передаче данных обучения или инференса. Все создаваемые ресурсы — стандартные для AWS или Kubernetes, их можно проверять через AWS CLI и kubectl. Веб-интерфейс, REST API и инструменты Model Context Protocol (MCP) — это три интерфейса одного и того же контейнера, поэтому они используют одни и те же бэкенд-API, проходят одинаковые проверки и читают одно и то же состояние операций. Ни один из интерфейсов не имеет скрытой логики.

Ключевая особенность InstantStart — разделение ответственности между AWS и пользователем. HyperPod управляет инфраструктурой: мониторинг здоровья, глубокие проверки, автоматическое восстановление узлов, непрерывное provisioning, масштабирование через Karpenter, восстановление на уровне процессов и многоуровневые чекпоинты. EKS остаётся под управлением пользователя и содержит операторы HyperPod для обучения и инференса. Это разделение важно понимать при диагностике: если проблема в инфраструктуре — её решает AWS, если в Kubernetes — пользователь.

InstantStart организует окружение в четыре слоя, каждый из которых добавляет свою ценность. Первый слой — управляемая инфраструктура: поэтапное создание или импорт EKS, согласование зависимостей, сетевая топология, мультикластерное состояние. Второй — ёмкость и устойчивость: рабочие процессы групп инстансов, выбор типа ёмкости. Третий — обучение: операторы PyTorchJob и InferenceEndpointConfig. Четвёртый — хранение и наблюдаемость: интеграции с S3, FSx for Lustre, ECR, Prometheus, Grafana и MLflow.

Кодирование операционных правил в API control plane вместо передачи агенту сырого CLI делает управление инфраструктурой надёжным. Агент не имеет доступа к произвольным командам — он работает через API, которые проверяют каждое действие. Это снижает риск ошибок и делает систему предсказуемой.

Adding a HyperPod instance group
Adding a HyperPod instance group · Источник: AWS Machine Learning Blog

HyperPod InstantStart — шаг к автоматизации сложных операций с ИИ-инфраструктурой. Он не заменяет инженеров, но берёт на себя рутину, позволяя сосредоточиться на важных решениях.