AWS представила Ray Serve Deep Learning Containers (DLC) — набор предварительно настроенных Docker-образов для запуска моделей инференса. Релиз приурочен к официальному прекращению поддержки TorchServe, популярного сервера инференса от PyTorch. Теперь команды, использующие TorchServe, остались без обновлений и патчей безопасности, что вынуждает их самостоятельно поддерживать всю цепочку зависимостей.
TorchServe, разработанный совместно AWS и Meta, долгое время был стандартным решением для развертывания моделей PyTorch. Однако в официальном уведомлении проекта сказано, что больше не будет плановых обновлений, исправлений ошибок, новых функций или патчей безопасности. Это означает, что уязвимости могут оставаться неисправленными, а совместимость с новыми версиями PyTorch и CUDA не гарантируется. Инженерам приходится вручную подбирать версии библиотек, патчить уязвимости в каждом слое и отлаживать сбои при рассинхронизации компонентов. Такая работа не добавляет ценности конечному продукту, но замедляет вывод моделей в продакшн.
| Компонент | TorchServe | Ray Serve DLC |
|---|---|---|
| Поддержка | Прекращена | Активная поддержка AWS |
| Обновления безопасности | Нет | Патчи на этапе сборки |
| Структура кода | Handler, model-archiver, config.properties | Python-класс с @serve.deployment |
| Готовность к использованию | Требуется сборка образа | Готовый Docker-образ |
Ray Serve DLC призван решить эту проблему, перенося подход AWS Deep Learning Containers, ранее применявшийся для обучения, на инференс. DLC — это оптимизированные Docker-образы, которые объединяют фреймворк, зависимости и GPU-стек в протестированную комбинацию. Образы Ray Serve DLC включают PyTorch, Ray Serve с FastAPI и Uvicorn, а также утилиты для работы с видео и аудио, например FFmpeg с аппаратным ускорением NVIDIA. Все компоненты проверяются и тестируются вместе перед каждым релизом, что исключает рассинхронизацию версий. Патчи безопасности применяются на этапе сборки.
AWS Ray Serve DLC — готовые Docker-образы для инференса, включающие PyTorch, Ray Serve и CUDA.

Образы выпущены отдельно для Amazon EKS, Amazon EC2 и Amazon SageMaker, с собственными entrypoint, адаптированными под контракты каждой среды. Это позволяет использовать один и тот же стек в разных сервисах AWS. Для многих моделей, включая Qwen3-VL, не требуется создавать пользовательский образ — достаточно использовать готовый DLC. Если модель требует дополнительных библиотек, их можно добавить поверх проверенной базы.
В статье AWS демонстрируется развертывание vision-language модели Qwen3-VL-2B на одном GPU-узле g5.xlarge в Amazon EKS. Приложение на Ray Serve описывается как Python-класс с декоратором @serve.deployment, что заменяет сложную структуру TorchServe: не нужно создавать handler, использовать torch-model-archiver или файл config.properties. Код приложения внедряется через ConfigMap, что позволяет менять логику без пересборки образа.
Этот шаг AWS отражает тенденцию к упрощению MLOps: компании все чаще отказываются от самостоятельной поддержки инфраструктуры в пользу управляемых решений. Ray Serve, как часть экосистемы Ray, предлагает масштабирование и гибкость, а DLC избавляет от ручной настройки GPU-стека. Для команд, мигрирующих с TorchServe, это снижает операционную нагрузку и ускоряет вывод моделей.
Однако стоит учитывать, что Ray Serve DLC — это новый продукт, и его экосистема еще развивается. Тем не менее, учитывая опыт AWS в поддержке DLC для обучения, можно ожидать, что образы для инференса будут получать регулярные обновления и патчи, что критически важно для безопасности в продакшене.



