На конференции Hot Chips, прошедшей во вторник, OpenAI представила более подробную информацию о своем чипе Jalapeño, включая первые результаты бенчмарков. Тестирование на платформе InferenceX от SemiAnalysis показало, что Jalapeño превосходит текущие процессоры для инференса как по количеству токенов на пользователя, так и по пропускной способности на киловатт. Ричард Хо, глава аппаратного подразделения OpenAI, в ходе пресс-колла заявил: «Результаты демонстрируют очень значительный прирост производительности по сравнению с современным уровнем. Jalapeño может обслуживать больше ИИ-задач на единицу мощности, одновременно обеспечивая более быстрые ответы. Это очень эффективно для обслуживания большого числа клиентов, но также обеспечивает низкую задержку».
Сравнение проводилось с системой Nvidia Blackwell, однако к моменту полного развертывания Jalapeño конкуренты могут существенно продвинуться. Хо оценил, что Jalapeño начнет развертываться в конце 2026 года «в очень малых объемах», а более значительное развертывание ожидается в 2027 году. Впервые анонсированный в октябре прошлого года, Jalapeño разрабатывался OpenAI в тесном сотрудничестве с Broadcom, при этом собственные модели OpenAI помогали в процессе разработки. Компания планирует сделать Jalapeño мультигенерационной платформой, что позволит разрабатывать ИИ-продукты, модели, чипы и память согласованно.
Благодаря такому комплексному подходу OpenAI удалось решить проблемы на конкретных этапах инференса, которые часто вызывают задержки. В частности, Jalapeño спроектирован так, чтобы минимизировать задержки на этапах prefill и коммуникации, которые, по словам OpenAI, часто являются узкими местами. «Мы разработали Jalapeño, чтобы минимизировать перемещение данных и задержки связи, — говорится в блоге компании. — Это означает, что состояние модели, включая KV-кэш, используемый при генерации ответа, может быть явно размещено и оставаться локальным, пока система активирует правильную комбинацию вычислений, памяти и сети для каждого этапа инференса».
Чип разработан совместно с Broadcom, развертывание начнется в конце 2026 года в малых объемах.

Для читателя, не знакомого с темой, стоит пояснить: инференс — это этап, когда обученная модель ИИ обрабатывает запросы пользователей. Узкие места на этапах prefill (обработка входного запроса) и коммуникации (обмен данными между компонентами) могут замедлять ответы и увеличивать затраты. Оптимизация этих этапов позволяет снизить задержки и повысить эффективность, что особенно важно для массового обслуживания пользователей. Показатели Jalapeño на бенчмарке InferenceX, который оценивает реальную производительность инференса, указывают на то, что OpenAI удалось добиться существенного прогресса в этой области.
Однако важно учитывать, что результаты получены на раннем этапе, и к моменту выхода Jalapeño на рынок конкуренция может измениться. Тем не менее, мультигенерационный подход и тесная интеграция с Broadcom дают OpenAI возможность быстро адаптироваться к новым требованиям. Для отрасли это сигнал, что специализированные чипы для инференса становятся все более важным направлением, и OpenAI намерена играть в этой сфере значительную роль.

