Платформа NVIDIA Vera Rubin NVL72 впервые участвовала в бенчмарке MLPerf Inference v6.1 в статусе preview и сразу показала кратный отрыв от предыдущего поколения. На модели Qwen3-VL система выдала до 3,7 раза большую пропускную способность, чем GB300 NVL72, в сценариях offline, server и interactive. На DeepSeek-R1 с библиотекой NVIDIA TensorRT-LLM преимущество составило до 2,5 раза. Замеры проводились с использованием vLLM и открытого фреймворка NVIDIA Dynamo.
MLPerf Inference — отраслевой набор тестов, который измеряет, сколько запросов в секунду способна обработать система на разных моделях и в разных режимах нагрузки. Результаты публикует консорциум MLCommons; вендоры используют их для сравнения платформ. Для организаций, выбирающих инфраструктуру под ИИ, важны три параметра: производительность, эффективность масштабирования и скорость обновления ПО. Чем выше пропускная способность, тем больше токенов генерирует система и тем выше выручка на стойку. Чем лучше масштабирование, тем меньше ресурсов нужно на обслуживание пользователей при росте нагрузки. Чем быстрее выходят оптимизации, тем дольше живут уже купленные ускорители.
| Платформа | Бенчмарк | Преимущество над GB300 NVL72 |
|---|---|---|
| Vera Rubin NVL72 | Qwen3-VL | до 3,7 раза выше пропускная способность |
| Vera Rubin NVL72 | DeepSeek-R1 | до 2,5 раза выше пропускная способность |
| Vera Rubin NVL72 | SemiAnalysis AgentX | в 30 раз выше производительность |
Масштабирование — отдельная метрика в этом релизе. NVIDIA подала конфигурацию из 288 GPU на четырёх стойках GB300 NVL72 и получила 99% эффективности в offline-сценарии на DeepSeek-R1: пропускная способность росла почти линейно относительно одной стойки на 72 GPU. Такой результат достигается за счёт высокоскоростных соединений внутри стойки, сетевого взаимодействия между стойками и оркестрации запросов между узлами. В основе — NVLink шестого поколения и NVLink Switch: по данным NVIDIA, они дают в 10 раз более высокую скорость обработки пакетов и в 3 раза меньшую задержку, чем стандартный Ethernet.
На Qwen3-VL пропускная способность до 3,7 раза выше, чем у GB300 NVL72, на DeepSeek-R1 — до 2,5 раза.
Программная часть вклада не менее важна. Оптимизации в заявках v6.1 обеспечили до 1,6 раза больше производительности по сравнению с v6.0, и работа продолжалась после отправки результатов. Это отражает подход NVIDIA к полностековой совместной разработке: улучшения на уровне железа и софта накапливаются между релизами. В Vera Rubin задействованы усовершенствованные Tensor Cores и Transformer Engine, ускоряющие стадии prefill и decode, а точность NVFP4 снижает объём памяти под веса модели, внимание и KV-кэш — пропускная способность растёт при минимальной потере качества вывода. В заявках активно применялось disaggregated serving с разделением prefill и decode и крупномасштабный expert parallelism для mixture-of-experts слоёв, на которых построены DeepSeek-R1 и Qwen3-VL.
Отдельный сигнал — смещение фокуса на агентные нагрузки. ИИ-агенты, которые рассуждают, планируют и действуют в несколько шагов, меняют то, как измеряют производительность инференса. В тесте SemiAnalysis AgentX Vera Rubin NVL72 показала в 30 раз лучший результат, чем GB300 NVL72, в preview-режиме. Готовящийся бенчмарк MLPerf Endpoints должен принести стандартизированные измерения для агентных рабочих нагрузок — за пределами того, что фиксируют традиционные тесты пропускной способности. Партнёры также подключились к заявкам: Nebius подала preview-результаты Vera Rubin NVL72 и продемонстрировала высокую производительность.
Практический вывод для заказчиков инфраструктуры: разрыв между поколениями измеряется не только в ускорителях, но и в эффективности масштабирования и темпе обновления ПО. Стойка Vera Rubin NVL72, по данным NVIDIA, генерирует больше токенов, обслуживает больше пользователей и приносит больше выручки, чем стойка GB300 NVL72, снижая стоимость токена. Официальные результаты заявок 6.1-0106 и 6.1-0074 доступны на сайте MLCommons.



