Инференс генеративных моделей устроен сложнее, чем кажется со стороны. Веса моделей занимают десятки и сотни гигабайт, задержка измеряется в токенах в секунду, холодный старт может растягиваться на минуты из-за загрузки контейнеров и весов, а GPU-ёмкость ограничена. Традиционные инструменты мониторинга не показывают сигналы на уровне токенов, которые важны в продакшене. Amazon SageMaker ИИ предлагает два пути развёртывания: управляемые endpoints, где AWS берёт на себя инфраструктуру и операции, и Amazon SageMaker HyperPod Inference для команд, которым нужен Kubernetes-нативный контроль над выделенными GPU-кластерами. За 2026 год компания выпустила 13 новых возможностей этих двух направлений.

Endpoints — более быстрый путь. Клиент приносит модель и определяет цель по производительности: стоимость, задержку или пропускную способность. AWS обеспечивает провижининг GPU, масштабирование и операционный мониторинг. Семь запусков этого года охватывают развёртывание, ёмкость, интеграцию, масштабирование, наблюдаемость и упрощение асинхронных сценариев.

ПараметрEndpointsHyperPod Inference
ИнфраструктураПолностью управляется AWSУправляемый Kubernetes-стек
Цель развёртыванияКонсоль, SDK, CLIkubectl, Terraform, консоль, CLI, SDK
МасштабированиеУправляемое авто-масштабирование с CloudWatchАвто-масштабирование с Karpenter, KEDA, CloudWatch
КастомизацияНа уровне контейнера и моделиДоступ на уровне нод, фреймворки и AMI
API-протоколOpenAI-совместимый с SageMaker endpointHTTP, gRPC и кастомный балансировщик
Для когоБыстрое развёртывание с минимальными операционными затратамиKubernetes-ориентированные train-to-serve сценарии в мульти- и гибридных облаках

Inference recommendations, вышедшие в апреле 2026 года, автоматизируют подбор типа инстанса, сервинг-контейнера и настроек оптимизации. Раньше это занимало две-три недели ручного бенчмаркинга по более чем 1000 комбинациям и требовало экспертизы, которой у большинства команд нет. Теперь клиент указывает модель и цель, а SageMaker выполняет три шага: сужает пространство типов инстансов по архитектуре, размеру и требованиям к памяти; применяет техники под цель — EAGLE 3.0 speculative decoding для пропускной способности, тюнинг ядер для задержки, tensor parallelism по размеру модели; запускает NVIDIA AIPerf на реальной GPU-инфраструктуре со статистически строгой отчётностью по нескольким прогонам. На выходе — SageMaker Model Package с готовыми конфигурациями и метриками: time to first token (TTFT), inter-token latency (ITL), перцентили P50/P90/P99, пропускная способность и прогноз стоимости. В демонстрационном примере оптимизация пропускной способности на GPT-OSS-20B дала 2x токенов в секунду при той же задержке запроса. Генерация рекомендаций не тарифицируется дополнительно; клиенты с ML Reservations могут бенчмаркать на зарезервированной ёмкости без доплаты.

Two SageMaker AI inference deployment paths delivered in 2026: managed endpoints and HyperPod Inference
Two SageMaker AI inference deployment paths delivered in 2026: managed endpoints and HyperPod Inference · Источник: AWS Machine Learning Blog

Capacity-aware instance pools, появившиеся в мае 2026 года, решают проблему единственной точки отказа. Раньше endpoint требовал один тип инстанса, и нехватка ёмкости означала отказ до первого запроса. Теперь клиент задаёт приоритизированный список до пяти типов инстансов. SageMaker проходит по нему при создании endpoint, при масштабировании вверх и вниз. При создании пробует первый тип и сразу переключается при недоступности. При scale-out следующий доступный тип поглощает нагрузку. При scale-in фолбэк-инстансы удаляются первыми, чтобы флот возвращался к предпочтительному железу по мере освобождения ёмкости. Метрики CloudWatch с разбивкой по типу инстанса позволяют строить взвешенные политики масштабирования для разнородных флотов. Каждая запись пула может ссылаться на отдельную оптимизированную конфигурацию модели.

HyperPod Inference — второй путь, для команд с Kubernetes-нативными требованиями. Он даёт доступ на уровне нод, выбор фреймворков и AMI, поддерживает HTTP, gRPC и кастомные балансировщики. Среди обновлений этого года — упрощённый оператор, tiered KV cache, disaggregated prefill и decode, а также кэширование моделей. Эти функции снижают задержки и упрощают управление кластерами для train-to-serve сценариев в мульти- и гибридных облаках.

Оба пути поддерживают OpenAI-совместимый API, что упрощает миграцию существующих приложений. Для endpoints доступны также асинхронный инференс с inline payloads, префикс-маршрутизация, кэширование контейнеров и наблюдаемость. В совокупности эти 13 функций закрывают разрыв между исследовательским прототипом и продакшен-нагрузкой: автоматизация подбора конфигураций, устойчивость к дефициту GPU и гибкость развёртывания становятся базовыми ожиданиями от платформы, а не отдельными проектами внутри команды.