Выбор GPU-инстанса для инференса больших языковых моделей (LLM) напрямую влияет на задержку, пропускную способность и стоимость каждого токена. AWS опубликовала бенчмарк, в котором сравнила новые инстансы G7 на базе NVIDIA Blackwell с предыдущими поколениями G5 и G6. Тесты проводились на Amazon SageMaker ИИ с использованием двух 30B-моделей архитектуры Mixture-of-Experts (MoE): Qwen3-Coder-30B для задач кодинга и NVIDIA Nemotron-3-Nano-30B для корпоративных ассистентов.
Инстансы семейства G7 оснащены GPU RTX PRO 4500 Blackwell и поддерживают низкоточные форматы FP8 и NVFP4. В конфигурации ml.g7.12xlarge используется два GPU с суммарной памятью 64 ГБ, тогда как ml.g5.12xlarge и ml.g6.12xlarge — четыре GPU с 96 ГБ. Несмотря на меньшее число ускорителей и объём памяти, G7 показал более высокую производительность в тестах. Это объясняется тем, что MoE-модели при генерации токенов упираются в пропускную способность памяти: каждый токен активирует лишь небольшую часть экспертов, поэтому высокая пропускная способность памяти напрямую снижает задержку между токенами.
| Инстанс | GPU | Число GPU | Память |
|---|---|---|---|
| ml.g5.12xlarge | A10G | 4 | 96 ГБ |
| ml.g6.12xlarge | L4 | 4 | 96 ГБ |
| ml.g7.12xlarge | RTX PRO 4500 Blackwell | 2 | 64 ГБ |
В первом сценарии Qwen3-Coder-30B разворачивали на инстансах G5, G6 и G7 с использованием контейнера DJL LMI. Бенчмарк показал, что G7 обеспечивает лучшую цену за токен и меньшую задержку при выполнении задач генерации кода, отладки и рефакторинга. Во втором сценарии Nemotron-3-Nano-30B тестировали с помощью функции Generative ИИ Inference Recommendations, которая автоматически подбирает конфигурацию под заданную нагрузку. Сравнивались G6 (L4), G6e (L40S) и G7; рекомендации выявили оптимальный вариант по стоимости и производительности.
G7 с двумя GPU RTX PRO 4500 Blackwell обходит G5/G6 с четырьмя GPU по пропускной способности и задержке.

AWS подчёркивает, что выигрыш от перехода на новое поколение GPU зависит от архитектуры модели, формата квантования и характера нагрузки. Для MoE-моделей критична поддержка NVFP4 — 4-битного формата с плавающей точкой, который удваивает эффективную пропускную способность памяти по сравнению с FP8. Это позволяет размещать большие модели на меньшем числе GPU и снижать стоимость инференса.
Результаты бенчмарка полезны для команд, которые выбирают инфраструктуру для продакшн-нагрузок. SageMaker ИИ предоставляет два пути: прямое бенчмаркирование уже развёрнутых эндпоинтов или автоматизированные рекомендации по конфигурации. Второй подход экономит время: сервис сам перебирает кандидатов и возвращает ранжированный список с метриками стоимости, задержки и пропускной способности.
Хотя G7 показывает преимущества, миграция требует пересборки образов и проверки совместимости с используемым стеком, например vLLM. Для моделей, которые не используют MoE или не поддерживают низкоточные форматы, выигрыш может быть меньше. Тем не менее, тренд очевиден: новые GPU Blackwell смещают баланс в сторону меньшего числа ускорителей с большей памятью и поддержкой эффективных форматов.



