AWS представила Ray Serve Deep Learning Containers (DLC) — набор предварительно настроенных Docker-образов для запуска моделей инференса. Релиз приурочен к официальному прекращению поддержки TorchServe, популярного сервера инференса от PyTorch. Теперь команды, использующие TorchServe, остались без обновлений и патчей безопасности, что вынуждает их самостоятельно поддерживать всю цепочку зависимостей.

TorchServe, разработанный совместно AWS и Meta, долгое время был стандартным решением для развертывания моделей PyTorch. Однако в официальном уведомлении проекта сказано, что больше не будет плановых обновлений, исправлений ошибок, новых функций или патчей безопасности. Это означает, что уязвимости могут оставаться неисправленными, а совместимость с новыми версиями PyTorch и CUDA не гарантируется. Инженерам приходится вручную подбирать версии библиотек, патчить уязвимости в каждом слое и отлаживать сбои при рассинхронизации компонентов. Такая работа не добавляет ценности конечному продукту, но замедляет вывод моделей в продакшн.

КомпонентTorchServeRay Serve DLC
ПоддержкаПрекращенаАктивная поддержка AWS
Обновления безопасностиНетПатчи на этапе сборки
Структура кодаHandler, model-archiver, config.propertiesPython-класс с @serve.deployment
Готовность к использованиюТребуется сборка образаГотовый Docker-образ

Ray Serve DLC призван решить эту проблему, перенося подход AWS Deep Learning Containers, ранее применявшийся для обучения, на инференс. DLC — это оптимизированные Docker-образы, которые объединяют фреймворк, зависимости и GPU-стек в протестированную комбинацию. Образы Ray Serve DLC включают PyTorch, Ray Serve с FastAPI и Uvicorn, а также утилиты для работы с видео и аудио, например FFmpeg с аппаратным ускорением NVIDIA. Все компоненты проверяются и тестируются вместе перед каждым релизом, что исключает рассинхронизацию версий. Патчи безопасности применяются на этапе сборки.

AWS Ray Serve DLC — готовые Docker-образы для инференса, включающие PyTorch, Ray Serve и CUDA.

Architecture diagram of an Amazon EKS cluster with a single GPU node running one pod that serves the model over HTTP on port 8000
Architecture diagram of an Amazon EKS cluster with a single GPU node running one pod that serves the model over HTTP on port 8000 · Источник: AWS Machine Learning Blog

Образы выпущены отдельно для Amazon EKS, Amazon EC2 и Amazon SageMaker, с собственными entrypoint, адаптированными под контракты каждой среды. Это позволяет использовать один и тот же стек в разных сервисах AWS. Для многих моделей, включая Qwen3-VL, не требуется создавать пользовательский образ — достаточно использовать готовый DLC. Если модель требует дополнительных библиотек, их можно добавить поверх проверенной базы.

В статье AWS демонстрируется развертывание vision-language модели Qwen3-VL-2B на одном GPU-узле g5.xlarge в Amazon EKS. Приложение на Ray Serve описывается как Python-класс с декоратором @serve.deployment, что заменяет сложную структуру TorchServe: не нужно создавать handler, использовать torch-model-archiver или файл config.properties. Код приложения внедряется через ConfigMap, что позволяет менять логику без пересборки образа.

Этот шаг AWS отражает тенденцию к упрощению MLOps: компании все чаще отказываются от самостоятельной поддержки инфраструктуры в пользу управляемых решений. Ray Serve, как часть экосистемы Ray, предлагает масштабирование и гибкость, а DLC избавляет от ручной настройки GPU-стека. Для команд, мигрирующих с TorchServe, это снижает операционную нагрузку и ускоряет вывод моделей.

Однако стоит учитывать, что Ray Serve DLC — это новый продукт, и его экосистема еще развивается. Тем не менее, учитывая опыт AWS в поддержке DLC для обучения, можно ожидать, что образы для инференса будут получать регулярные обновления и патчи, что критически важно для безопасности в продакшене.