pimenov.ai

Jalapeño: как устроен первый чип OpenAI для языковых моделей

Как Jalapeño ускоряет обработку промпта и генерацию токенов, удерживает KV-кеш рядом с вычислениями и сокращает задержку по данным OpenAI.

Обзор

OpenAI показала первые измерения Jalapeño — чипа для инференса, то есть запуска обученных языковых моделей. Его центральная идея: тратить меньше времени и энергии на перемещение данных между вычислительными блоками, памятью и соседними чипами.

Две фазы ответа нагружают железо по-разному

Сначала модель обрабатывает весь промпт. Эта фаза называется prefill и требует много вычислений. Затем начинается decode: модель выдаёт токены один за другим, и узким местом становится пропускная способность памяти.

Jalapeño проектировали под обе фазы. Он меняет сочетание вычислений, памяти и сети по ходу запроса. Для агентов это ценно: задержка на каждом последовательном шаге складывается.

Главная ставка — держать состояние модели рядом

Архитектура позволяет явно размещать состояние модели, включая KV-кеш — память о ранее обработанных токенах, и сохранять его локально. Сеть встроена в чиповую систему, а крупный связанный вычислительный домен сокращает ненужные передачи данных.

Программная модель построена на локальных тензорах, явном обмене данными и предсказуемой синхронизации. ИИ оптимизирует размещение, расписание и распределение вычислений. Codex с GPT-Astra помог за два месяца адаптировать три открытые модели, которых не было в исходном плане чипа.

OpenAI разработала архитектуру и софт. Broadcom отвечала за реализацию кремния и сеть, Celestica — за платы, стойки и системную интеграцию. До передачи дизайна в производство команда дошла за девять месяцев. Подробнее об устройстве платформы.

Что показали тесты

В тесте InferenceX чип проверили на GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. По данным OpenAI, Jalapeño обеспечил в 1,5–1,9 раза больше работы на ватт и в 1,7–3,6 раза меньшую сквозную задержку, чем системы на NVIDIA GB200 и GB300. При номинале 700 Вт устойчивое потребление не превышало 550 Вт. Методика и результаты OpenAI.

Это данные самой OpenAI, нормализованные по заявленной мощности ускорителей. Независимого воспроизведения в публикации нет. Компания не раскрыла техпроцесс, число транзисторов и ядер, объём и пропускную способность памяти. Полной аппаратной схемы пока нет.

Развёртывание планируется начать до конца 2026 года. Второе поколение уже в разработке, третье формируется. NVIDIA останется частью вычислительного парка OpenAI.

Следующий шаг

GPT-5.6 Sol разогнали до 750 токенов в секунду

Связанные материалы

Для команд, которые строят агентные продукты, полезно смотреть на Jalapeño как на пример совместного проектирования модели, софта и инфраструктуры.

Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov