Jalapeño: как устроен первый чип OpenAI для языковых моделей
Как Jalapeño ускоряет обработку промпта и генерацию токенов, удерживает KV-кеш рядом с вычислениями и сокращает задержку по данным OpenAI.
СейчасДве фазы ответа нагружают железо по-разному
OpenAI показала первые измерения Jalapeño — чипа для инференса, то есть запуска обученных языковых моделей. Его центральная идея: тратить меньше времени и энергии на перемещение данных между вычислительными блоками, памятью и соседними чипами.
Две фазы ответа нагружают железо по-разному
Сначала модель обрабатывает весь промпт. Эта фаза называется prefill и требует много вычислений. Затем начинается decode: модель выдаёт токены один за другим, и узким местом становится пропускная способность памяти.
Jalapeño проектировали под обе фазы. Он меняет сочетание вычислений, памяти и сети по ходу запроса. Для агентов это ценно: задержка на каждом последовательном шаге складывается.
Главная ставка — держать состояние модели рядом
Архитектура позволяет явно размещать состояние модели, включая KV-кеш — память о ранее обработанных токенах, и сохранять его локально. Сеть встроена в чиповую систему, а крупный связанный вычислительный домен сокращает ненужные передачи данных.
Программная модель построена на локальных тензорах, явном обмене данными и предсказуемой синхронизации. ИИ оптимизирует размещение, расписание и распределение вычислений. Codex с GPT-Astra помог за два месяца адаптировать три открытые модели, которых не было в исходном плане чипа.
OpenAI разработала архитектуру и софт. Broadcom отвечала за реализацию кремния и сеть, Celestica — за платы, стойки и системную интеграцию. До передачи дизайна в производство команда дошла за девять месяцев. Подробнее об устройстве платформы.
Что показали тесты
В тесте InferenceX чип проверили на GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. По данным OpenAI, Jalapeño обеспечил в 1,5–1,9 раза больше работы на ватт и в 1,7–3,6 раза меньшую сквозную задержку, чем системы на NVIDIA GB200 и GB300. При номинале 700 Вт устойчивое потребление не превышало 550 Вт. Методика и результаты OpenAI.
Это данные самой OpenAI, нормализованные по заявленной мощности ускорителей. Независимого воспроизведения в публикации нет. Компания не раскрыла техпроцесс, число транзисторов и ядер, объём и пропускную способность памяти. Полной аппаратной схемы пока нет.
Развёртывание планируется начать до конца 2026 года. Второе поколение уже в разработке, третье формируется. NVIDIA останется частью вычислительного парка OpenAI.
Следующий шаг
GPT-5.6 Sol разогнали до 750 токенов в секунду
Связанные материалы
- Статья: Первое большое интервью Тибо Соттио из OpenAI: саммари и полный перевод
- Блог: GPT-5.6 Sol подешевел: $4 за вход и $20 за выход
- База знаний: OpenAI — линейка моделей GPT, Realtime и Images
Для команд, которые строят агентные продукты, полезно смотреть на Jalapeño как на пример совместного проектирования модели, софта и инфраструктуры.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov
Если хотите разобрать свою задачу — напишите мне Если хотите разобрать свою задачу — напишите мне.
Можно прийти с идеей, черновым контекстом или уже живой задачей. Помогу быстро понять, где реальный следующий шаг, а где лишний шум.
Обычно хватает 2–3 сообщений, чтобы понять, могу ли я здесь реально помочь и в каком формате лучше двигаться дальше.
Дальше по теме
Верхний 1% компаний тратит на ИИ более чем в 600 раз больше медианной компании. Что этот разрыв говорит о реальном внедрении технологий.