На конференции Hot Chips, проходящей на этой неделе в Пало-Альто, NVIDIA объявила о начале полномасштабного производства системы Groq 3 LPX — нового ускорителя инференса, предназначенного для агентных ИИ-систем. В тесте Artificial Analysis с открытой моделью Gemma 4 31B система показала 3400 выходных токенов в секунду при контексте в 100 000 токенов, что в четыре раза быстрее ближайшей альтернативной платформы. Это первый коммерческий продукт, который напрямую адресует проблему задержки декодирования, возникающую при генерации ответов по одному токену за раз.
Groq 3 LPX — это не отдельный чип, а часть более широкой платформы Vera Rubin NVL72, которую NVIDIA позиционирует как «самую универсальную платформу для ИИ-фабрик». Архитектура объединяет вычисления, сеть и ускорение инференса в единую систему, что позволяет оптимизировать весь конвейер: от обработки контекста до генерации токенов. Такой подход, названный «экстремальным кодайном», предполагает, что производительность достигается не за счет оптимизации отдельных компонентов, а за счет их совместного проектирования. Для агентных систем, которые генерируют все больше токенов и работают с длинными контекстами, это критически важно: даже небольшие задержки при генерации каждого токена могут накапливаться и замедлять выполнение сложных цепочек действий.
| Показатель | Значение |
|---|---|
| Скорость генерации | 3400 выходных токенов в секунду |
| Контекст | 100 000 токенов |
| Модель | Gemma 4 31B |
| Сравнение с ближайшей альтернативой | в 4 раза быстрее |
Партнеры NVIDIA уже начинают внедрять платформу Vera Rubin. Nebius, один из ведущих ИИ-облаков, стал первым, кто принял Groq 3 LPX в свою инфраструктуру Token Factory. Это позволит разработчикам создавать высокоинтерактивных агентов и системы кодинга с минимальной задержкой. CoreWeave развернула в продакшене сеть Spectrum-X Multiplane, которая соединяет стойки Vera Rubin с помощью нескольких параллельных коммутаторов, обеспечивая высокую пропускную способность и отсутствие потерь. SpaceXAI, в свою очередь, планирует использовать NVIDIA Vera CPUs для ускорения CPU-интенсивных задач, таких как оркестрация, использование инструментов, выполнение кода и обработка данных, — как в наземных центрах обработки данных, так и на орбитальных спутниках.
Nebius стала первым ИИ-облаком, внедрившим Groq 3 LPX в свою инфраструктуру Token Factory.
Переход от обучения к инференсу и агентным сценариям меняет требования к инфраструктуре. Агентные ИИ-системы не только генерируют больше токенов, но и обрабатывают значительно большие контекстные окна, а также взаимодействуют друг с другом. Это требует нового класса инфраструктуры, оптимизированной не только для пиковой производительности, но и для пропускной способности, отзывчивости и экономической эффективности. По данным NVIDIA, платформа Vera Rubin обеспечивает высокую производительность на ядро, исключительную пропускную способность памяти и предсказуемую производительность под нагрузкой, что помогает агентам быстрее выполнять задачи и держать GPU-инфраструктуру полностью загруженной.
Хотя NVIDIA не раскрывает полные спецификации Groq 3 LPX, результаты теста Artificial Analysis с Gemma 4 31B дают представление о возможностях системы. Gemma 4 31B — это открытая модель, оптимизированная для агентных сценариев, и ее выбор для бенчмарка показателен: NVIDIA стремится продемонстрировать, что ее платформа эффективна не только с проприетарными моделями, но и с открытыми. Это важно для предприятий, которые хотят сохранить контроль над своими данными и моделями.
На фоне растущей конкуренции в области инференса — например, с решениями от AMD и Intel — NVIDIA делает ставку на интеграцию. Groq 3 LPX — это ответ на вызовы, которые ставит агентный ИИ, и его успех будет зависеть от того, насколько быстро партнеры, такие как Nebius и CoreWeave, смогут масштабировать эту технологию. Пока же NVIDIA демонстрирует, что будущее ИИ-инфраструктуры — не в отдельных чипах, а в слаженной работе всех уровней «фабрики ИИ».


