AWS представила новые возможности Ray на платформе SageMaker HyperPod, которые интегрируют популярный open-source фреймворк для распределенных вычислений с инфраструктурой, предназначенной для обучения и обслуживания больших моделей. Теперь специалисты по данным могут создавать Ray-кластеры, открывать Ray Dashboard и дашборды Amazon Managed Grafana, подключать JupyterLab или Code Editor, отправлять распределенные задачи и настраивать обнаружение зависших задач — все это из интерфейса SageMaker Studio, без необходимости писать YAML-манифесты или использовать kubectl.
Ray — это open-source фреймворк, который позволяет масштабировать распределенные Python-нагрузки на кластерах GPU, включая обучение с помощью Ray Train и обслуживание моделей через Ray Serve. На Kubernetes Ray-кластеры управляются оператором KubeRay, который автоматизирует жизненный цикл кластеров через кастомные ресурсы. SageMaker HyperPod, в свою очередь, предоставляет специализированную инфраструктуру для машинного обучения на Amazon EKS с мониторингом здоровья узлов и автоматическим восстановлением. Ранее запуск Ray на Kubernetes требовал от специалистов ручного написания конфигураций, пересборки Docker-образов при каждом изменении зависимостей, настройки port-forwarding для доступа к дашборду и ручной конфигурации Prometheus и Grafana.
Новые возможности устраняют эти барьеры. В SageMaker Studio появилась консоль для управления Ray-кластерами: можно выбрать тип задачи RayCluster, указать типы инстансов для головного и рабочих узлов, количество воркеров и контейнерный образ. По умолчанию используется образ SageMaker Distribution с предустановленным Ray, который AWS поддерживает и обновляет. Для продвинутых пользователей доступен встроенный YAML-редактор, позволяющий редактировать манифест Kubernetes. KubeRay-оператор также интегрируется с управлением задачами HyperPod, что позволяет администраторам устанавливать квоты на вычисления и приоритеты планирования для Ray-нагрузок.
Доступ к Ray Dashboard и Grafana теперь осуществляется через аутентифицированные URL без kubectl.

На уровне приложений Ray-задачи получают автоматическую отказоустойчивость благодаря мониторингу здоровья узлов и восстановлению HyperPod, а также многоуровневое чекпойнтинг для быстрого возобновления обучения через распределенное хранилище HyperPod. Интеграция с SageMaker JumpStart позволяет загружать веса моделей непосредственно в Ray Serve, с выгрузкой KV-кэша в tiered storage для обслуживания запросов с длинным контекстом. Все это работает с open-source KubeRay и стандартными Ray API, поэтому существующие скрипты и рабочие процессы не требуют изменений.
Для доступа к Ray Dashboard и Grafana теперь генерируются короткоживущие URL с IAM-аутентификацией, привязанные к создателю кластера, что обеспечивает безопасный удаленный доступ без kubectl port-forwarding. Это значительное упрощение для команд, работающих с распределенными нагрузками, и шаг к снижению порога входа в использование Ray на управляемой инфраструктуре AWS.
Запуск этих возможностей отражает тенденцию к упрощению работы с распределенными вычислениями для ИИ-нагрузок. Ранее подобные интеграции требовали значительных усилий по настройке, что сдерживало adoption Ray в корпоративной среде. Теперь AWS предлагает более интегрированный опыт, что может повысить привлекательность SageMaker HyperPod для организаций, использующих Ray в своих пайплайнах.
Однако стоит отметить, что новые возможности доступны только для кластеров HyperPod с оркестрацией Amazon EKS, и для их использования требуется установка дополнительных компонентов, таких как SageMaker Spaces EKS add-on, HyperPod Observability EKS add-on и KubeRay operator. Это может потребовать первоначальной настройки, но после этого процесс управления кластерами становится значительно проще.


