На конференции Hot Chips 2026 компания Nvidia объявила о переводе в полномасштабное производство своего специализированного инференс-ускорителя Groq 3 LPX. Чип, который Nvidia называет «интерактивным ИИ-ускорителем инференса», расширяет платформу Vera Rubin и предназначен для сверхбыстрой генерации токенов в агентных ИИ-системах. Коммерческий запуск запланирован на конец года.

Groq 3 LPX основан на архитектуре, которую Nvidia получила в декабре прошлого года, заплатив около $20 млрд за лицензию Groq и пригласив в команду основателя Джонатана Росса и президента Санни Мадру. Groq изначально проектировала процессоры, оптимизированные для инференса, а не для обучения ИИ. Скорость генерации токенов критична для агентных приложений: агенты расходуют огромное количество токенов на сотни и тысячи шагов рассуждений. Чем быстрее система генерирует токены, тем больше шагов рассуждений и вызовов инструментов укладывается в приемлемое время ожидания. По словам Nvidia, это сокращает задачи кодирования с часов до минут.

ПоказательGroq 3 LPXCerebras
Скорость генерации (Gemma 4 31B)3400 токенов/с882 токенов/с
Количество чипов для моделиминимум 641-2
Память на чип500 МБне указано

Независимый бенчмарк от Artificial Analysis показал, что на открытой модели Gemma 4 31B с контекстным окном 100 000 токенов стойка LPX достигает 3400 токенов в секунду, измеренных на 50 последовательных запросах. Производительность оставалась стабильной при длине входных данных от 10 000 до 100 000 токенов. Это самый высокий показатель, когда-либо зафиксированный для этой модели. Nvidia утверждает, что это делает ускоритель в четыре раза быстрее ближайшего конкурента — чипа Cerebras, который показывает 882 токена в секунду.

Независимый бенчмарк Artificial Analysis показал 3400 токенов в секунду на Gemma 4 31B — рекорд для этой модели.

Однако эксперты The Register указывают, что сравнение не учитывает ряд важных факторов. Groq 3 LPX использует архитектуру с интенсивным использованием SRAM, но каждый LPU имеет всего 500 МБ памяти — в 576 раз меньше, чем у GPU Rubin с 288 ГБ. Поэтому модели приходится разделять между несколькими ускорителями, соединенными через Ethernet, при этом одна стойка может содержать до 256 LPU. В гибридной конфигурации GPU обрабатывают ресурсоемкую фазу prefill, а LPU — фазу декодирования, требующую высокой пропускной способности.

В такой конфигурации Gemma 4 31B является наилучшим сценарием: это плотная модель, которая целиком помещается в одну стойку. Как архитектура масштабируется на более крупные модели с экспертным смешиванием, остается открытым вопросом. Например, DeepSeek V3 потребовал бы 1342 ускорителя, то есть чуть более пяти стоек. Кроме того, сравнение с Cerebras не учитывает количество чипов: Cerebras требует один или два ускорителя для модели, тогда как Nvidia — как минимум 64. Также не учитывается новейшее поколение Cerebras CS-4.

Nebius планирует стать первым облачным провайдером, предлагающим Groq 3 LPX через свой сервис Token Factory, а сама Groq входит в число первых пользователей. Таким образом, хотя рекордные показатели впечатляют, реальная производительность в продакшене будет зависеть от масштабируемости и эффективности использования ресурсов.