На конференции Hot Chips компания OpenAI впервые обнародовала результаты тестирования собственного чипа для инференса под названием Jalapeño. По заявлению компании, чип превосходит Nvidia Blackwell и Rubin по производительности на ватт и задержке токенов. В тестах, проведённых с использованием открытого бенчмарка InferenceX от SemiAnalysis, Jalapeño показал в 1,5–1,9 раза больше операций ИИ на ватт при пиковой пропускной способности и в 1,7–3,6 раза меньшую сквозную задержку по сравнению с лучшими коммерческими системами. Для интерактивных нагрузок преимущество достигает 2,1–4,1 раза.
Jalapeño — это специализированный ускоритель для инференса больших языковых моделей. Он не предназначен для обучения, но, в отличие от многих чипов, не оптимизирован под конкретные модели OpenAI. Это универсальный ускоритель для LLM, что делает его пригодным для широкого круга задач. В тестах использовались три модели: GPT-OSS 120B, Deepseek R1 670B и Kimi K2.5 1T. На GPT-OSS Jalapeño достиг примерно 1400 токенов в секунду на пользователя, на Deepseek R1 — более 700 токенов в секунду при одном запросе. При сопоставимой скорости декодирования чип обеспечивает в 54–104 раза большую пропускную способность на киловатт по сравнению с лучшими доступными ускорителями.
| Модель | Скорость (токенов/с) |
|---|---|
| GPT-OSS 120B | ~1400 на пользователя |
| Deepseek R1 670B | >700 на один запрос |
что результаты Jalapeño получены без использования таких оптимизаций, как multi-token prediction или speculative decoding, тогда как некоторые сравниваемые системы применяли эти методы. Это означает, что у OpenAI есть потенциал для дальнейшего улучшения показателей. SemiAnalysis, проводивший верификацию части тестов в лаборатории, пишет, что «Jalapeño превосходит все остальные чипы» по производительности на ватт. Генеральный директор SemiAnalysis Дилан Пател отметил: «Обычно чипы первого поколения неконкурентоспособны, но OpenAI превосходит Nvidia Blackwell и даже Rubin». Аналитики также указывают, что более корректное сравнение — с платформой Nvidia Vera Rubin, поскольку обе используют память HBM4. Даже в этом сравнении Jalapeño выдаёт больше токенов на мегаватт, хотя Nvidia применяет multi-token prediction, который Jalapeño пока не использует. По совокупной стоимости владения на токен показатели примерно равны.
По данным OpenAI, чип обеспечивает 1,5–1,9x больше работы на ватт и 1,7–3,6x меньшую задержку, чем Nvidia Blackwell и Rubin.

Есть и ограничения. Nvidia и AMD уже опубликовали результаты на более крупных моделях, таких как Deepseek V4 Pro и Kimi K3, которые на Jalapeño не тестировались. Кроме того, системы Rubin уже поставляются заказчикам, тогда как Jalapeño, по данным источников, находится на стадии инженерных образцов. OpenAI разрабатывала чип совместно с Broadcom. Проектирование началось в середине 2024 года, а финальный дизайн был отправлен в производство в ноябре 2025 года. Полный цикл занял около 16 месяцев, но от первого чипа до готового чертежа прошло всего девять месяцев. При разработке OpenAI использовала собственные ИИ-модели: старшие поколения помогали в проектировании чипа, более новые ускоряли программирование и оптимизацию.
SemiAnalysis видит в этом признак того, что «CUDA-ров» Nvidia может перестать быть препятствием для конкурентов. «CUDA-ров потенциально мёртв, учитывая, как быстро OpenAI может адаптировать новые модели на своём кремнии», — говорится в отчёте. Финансовый директор OpenAI Сара Фрир заявила, что чип вписывается в более широкую стратегию вычислений, где центры обработки данных, чипы, модели, платформа разработчика, продукты и устройства работают как единая интегрированная система. Она подчеркнула, что Jalapeño дополняет, а не заменяет партнёрства OpenAI с Nvidia, AMD, AWS, Cerebras, CoreWeave и другими. Эти компании одновременно являются инвесторами и конкурентами: Nvidia, AMD и AWS — крупные инвесторы и партнёры по вычислениям, и каждая из них разрабатывает собственные ИИ-чипы. Тем не менее все они утверждают, что вычислительных мощностей никогда не бывает достаточно, что удобно поддерживает их бизнес-модели.



