По данным OpenRouter, агентные ИИ-нагрузки потребляют в 15 раз больше токенов, чем простой чат-запрос. Это связано с тем, что агент, например, исследующий компанию для инвестиционного решения, последовательно обращается к финансовым базам, ищет новости и отчеты, запускает субагентов для сравнения с аналогами и оценки, а затем синтезирует рекомендацию. Каждый шаг добавляет токены, и накопленный контекст становится входом для следующего шага, что делает обработку длинного контекста ключевым фактором производительности агентного ИИ.
NVIDIA представила новые измеренные данные, показывающие, что система Vera Rubin NVL72 обеспечивает до 30 раз более высокую пропускную способность на мегаватт по сравнению с GB300 NVL72 на агентных рабочих нагрузках. Измерения проводились с использованием SemiAnalysis AgentX — набора записанных реальных сессий агентного кодинга с сохранением роста контекста, вызовов инструментов и порождения субагентов. Для энергоограниченных ИИ-фабрик это означает до 30 раз больше агентной работы при том же энергопотреблении.
| Показатель | Vera Rubin NVL72 vs GB300 NVL72 |
|---|---|
| Пропускная способность на мегаватт | до 30x выше |
| Стоимость за миллион токенов | до 35x ниже |
| Дополнительные GPU в рамках бюджета | до 40% больше |
Агентные рабочие нагрузки принципиально отличаются от чата или суммаризации документов, где длина последовательностей обычно составляет от 1K до 8K токенов. В агентных сессиях контекст накапливается и может достигать сотен тысяч входных токенов с большой вариативностью длин входов и выходов. Поэтому измерение производительности должно учитывать весь агентный процесс, а не отдельный запрос. В тестах SemiAnalysis AgentX платформа NVIDIA Blackwell показывает лидирующую производительность на нескольких агентных моделях, включая Kimi K3, MiniMax M3, GLM5.3, Qwen3.5 и DeepSeek V4 Pro. Например, GB300 NVL72 обеспечивает до 15 раз лучшую пропускную способность на мегаватт, чем архитектура NVIDIA Hopper на модели
Стоимость за миллион токенов на Vera Rubin NVL72 до 35 раз ниже, чем на GB300 NVL72.
Vera Rubin расширяет это преимущество, поднимая производительность по всей кривой Парето и достигая до 30 раз более высокой пропускной способности на мегаватт, чем GB300 NVL72 на DeepSeek V4 Pro. Эти ранние результаты, измеренные с помощью SemiAnalysis AgentX и ожидающие проверки SemiAnalysis, пока не учитывают производительность Vera CPU для вызова инструментов. Технология NVIDIA DSX MaxLPS управляет питанием на уровне GPU, стойки и рабочей нагрузки, позволяя разместить до 40% больше GPU того же мегаваттного бюджета.
Пропускная способность на мегаватт напрямую влияет на стоимость каждого токена. При стоимости до 35 раз ниже за миллион токенов, чем у GB300 NVL72, Vera Rubin NVL72 позволяет запускать агентов непрерывно и в масштабе. Для энергоограниченных ИИ-фабрик пропускная способность на мегаватт определяет выручку, а стоимость за миллион токенов — маржу прибыли.
Современная оптимизация инференса включает ряд техник, критичных для агентного ИИ. Vera Rubin NVL72 поддерживает их все благодаря экстремальному codesign на каждом уровне платформы. Раздельное обслуживание (disaggregated serving) разделяет обработку контекста (prefill) и генерацию ответа (decode), позволяя им масштабироваться независимо. Rate matching синхронизирует скорости генерации токенов prefill и decode GPU. Крупномасштабный экспертный параллелизм распределяет экспертные подсети в моделях mixture-of-experts по scale-up домену GPU. Распределенное KV-кэширование расширяет память, а KV-cache offloading выгружает менее активный контекст на хост и хранилище. KV-aware routing направляет запросы на GPU, уже содержащие релевантный кэш. Fused CUDA-ядра, такие как MegaMoE, объединяют множество операций в один проход, поддерживая GPU активными.
Эти результаты демонстрируют ускоренный темп инноваций NVIDIA. С постоянными оптимизациями программного обеспечения производительность как Vera Rubin NVL72, так и GB300 NVL72 будет продолжать улучшаться. Для читателей, впервые сталкивающихся с темой, важно понимать: агентный ИИ — это системы, которые автономно выполняют многошаговые задачи, и их эффективность напрямую зависит от инфраструктуры, способной обрабатывать длинные контексты и высокие токенные нагрузки.


