Платформа NVIDIA Vera Rubin NVL72 впервые участвовала в бенчмарке MLPerf Inference v6.1 в статусе preview и сразу показала кратный отрыв от предыдущего поколения. На модели Qwen3-VL система выдала до 3,7 раза большую пропускную способность, чем GB300 NVL72, в сценариях offline, server и interactive. На DeepSeek-R1 с библиотекой NVIDIA TensorRT-LLM преимущество составило до 2,5 раза. Замеры проводились с использованием vLLM и открытого фреймворка NVIDIA Dynamo.

MLPerf Inference — отраслевой набор тестов, который измеряет, сколько запросов в секунду способна обработать система на разных моделях и в разных режимах нагрузки. Результаты публикует консорциум MLCommons; вендоры используют их для сравнения платформ. Для организаций, выбирающих инфраструктуру под ИИ, важны три параметра: производительность, эффективность масштабирования и скорость обновления ПО. Чем выше пропускная способность, тем больше токенов генерирует система и тем выше выручка на стойку. Чем лучше масштабирование, тем меньше ресурсов нужно на обслуживание пользователей при росте нагрузки. Чем быстрее выходят оптимизации, тем дольше живут уже купленные ускорители.

ПлатформаБенчмаркПреимущество над GB300 NVL72
Vera Rubin NVL72Qwen3-VLдо 3,7 раза выше пропускная способность
Vera Rubin NVL72DeepSeek-R1до 2,5 раза выше пропускная способность
Vera Rubin NVL72SemiAnalysis AgentXв 30 раз выше производительность

Масштабирование — отдельная метрика в этом релизе. NVIDIA подала конфигурацию из 288 GPU на четырёх стойках GB300 NVL72 и получила 99% эффективности в offline-сценарии на DeepSeek-R1: пропускная способность росла почти линейно относительно одной стойки на 72 GPU. Такой результат достигается за счёт высокоскоростных соединений внутри стойки, сетевого взаимодействия между стойками и оркестрации запросов между узлами. В основе — NVLink шестого поколения и NVLink Switch: по данным NVIDIA, они дают в 10 раз более высокую скорость обработки пакетов и в 3 раза меньшую задержку, чем стандартный Ethernet.

На Qwen3-VL пропускная способность до 3,7 раза выше, чем у GB300 NVL72, на DeepSeek-R1 — до 2,5 раза.

Программная часть вклада не менее важна. Оптимизации в заявках v6.1 обеспечили до 1,6 раза больше производительности по сравнению с v6.0, и работа продолжалась после отправки результатов. Это отражает подход NVIDIA к полностековой совместной разработке: улучшения на уровне железа и софта накапливаются между релизами. В Vera Rubin задействованы усовершенствованные Tensor Cores и Transformer Engine, ускоряющие стадии prefill и decode, а точность NVFP4 снижает объём памяти под веса модели, внимание и KV-кэш — пропускная способность растёт при минимальной потере качества вывода. В заявках активно применялось disaggregated serving с разделением prefill и decode и крупномасштабный expert parallelism для mixture-of-experts слоёв, на которых построены DeepSeek-R1 и Qwen3-VL.

Отдельный сигнал — смещение фокуса на агентные нагрузки. ИИ-агенты, которые рассуждают, планируют и действуют в несколько шагов, меняют то, как измеряют производительность инференса. В тесте SemiAnalysis AgentX Vera Rubin NVL72 показала в 30 раз лучший результат, чем GB300 NVL72, в preview-режиме. Готовящийся бенчмарк MLPerf Endpoints должен принести стандартизированные измерения для агентных рабочих нагрузок — за пределами того, что фиксируют традиционные тесты пропускной способности. Партнёры также подключились к заявкам: Nebius подала preview-результаты Vera Rubin NVL72 и продемонстрировала высокую производительность.

Практический вывод для заказчиков инфраструктуры: разрыв между поколениями измеряется не только в ускорителях, но и в эффективности масштабирования и темпе обновления ПО. Стойка Vera Rubin NVL72, по данным NVIDIA, генерирует больше токенов, обслуживает больше пользователей и приносит больше выручки, чем стойка GB300 NVL72, снижая стоимость токена. Официальные результаты заявок 6.1-0106 и 6.1-0074 доступны на сайте MLCommons.