Мой блог
Первые результаты чипа Jalapeño от OpenAI показали высокую скорость ИИ-инференса

С момента анонса первого специализированного чипа компании под названием чип Jalapeño от OpenAI специалисты активно тестировали как сам полупроводник, так и всю окружающую его системную инфраструктуру. Полученные данные демонстрируют серьезный технологический скачок: разработка способна выполнять больший объем задач искусственного интеллекта на единицу потребляемой энергии, одновременно ускоряя генерацию ответов. Инновационная архитектура обеспечивает одновременно высокую пропускную способность и минимальные задержки, тогда как традиционные аппаратные платформы обычно вынуждают разработчиков выбирать что-то одно. Для пользователей это означает сокращение времени ожидания, повышение отзывчивости интеллектуальных агентов и стабильный доступ к сервисам в условиях растущих нагрузок. Главная цель проекта заключается в том, чтобы технологии общего искусственного интеллекта приносили пользу всему человечеству, а подобное железо делает передовые модели более доступными.

Сами модели OpenAI также сыграли ключевую роль в создании нового оборудования. Ранние версии нейросетей помогали инженерам проектировать и запускать чип, а новейшие итерации сейчас ускоряют процессы его программирования и оптимизации. Универсальность архитектуры подтверждается тестами на таких моделях, как GPT‑OSS 120B, DeepSeek R1 и Kimi K2.5 1T, что доказывает эффективность решения как для собственных разработок компании, так и для внешних архитектур. На всех трех моделях чип продемонстрировал в 1.5–1.9 раза больше полезной работы на ватт при пиковой нагрузке и снизил сквозную задержку в 1.7–3.6 раза по сравнению с конкурирующими системами. В сценариях с высокой степенью интерактивности прирост производительности составил от 2.1 до 4.1 раза.
Методология оценки эффективности
Появление этого процессора подчеркивает преимущества комплексного подхода, охватывающего весь технологический стек целиком. Специалисты могут одновременно проектировать программное обеспечение, модели, продукты, полупроводники, подсистемы памяти и сетевые интерфейсы, используя обратную связь от реальных нагрузок для совершенствования каждого уровня. Новинка представляет собой реально работающий кремний с зафиксированными на практике характеристиками, который закладывает фундамент для целого семейства будущих поколений платформ. В ближайшие месяцы компания намерена масштабировать внедрение технологии, чтобы предлагать клиентам более быстрые и экономичные решения.
Оценка производительности проводилась в условиях одинакового пользовательского опыта. Исследователи измеряли объем полезной работы на единицу энергии при строгом соблюдении требований к задержкам, необходимых конечным пользователям и интерактивным агентам. Это критически важно для автономных агентов, выполняющих множество последовательных шагов, поскольку любые задержки на каждом этапе имеют свойство накапливаться. Для проверки характеристик в реальных условиях применялся публичный бенчмарк InferenceX от агентства SemiAnalysis, измеряющий полный цикл обработки запроса к искусственному интеллекту.
Результаты комплексного тестирования
Новую разработку сопоставили с ведущими коммерчески доступными системами в широком диапазоне сценариев — от высокопроизводительной пакетной обработки до интерактивных задач с низким уровнем задержек. Устройство обеспечивало оптимальный баланс пропускной способности, энергоэффективности и скорости отклика. Хотя параметры часто принято измерять в расчете на отдельный чип, авторы исследования считают более объективным стандартом оценку на единицу потребляемой мощности. По этому показателю новинка заняла лидирующие позиции на границе эффективности Парето для всех трех протестированных открытых моделей.

Для корректного сопоставления показателей специалисты нормализовали результаты с учетом официальных номинальных характеристик каждого ускорителя. Паспортная мощность Jalapeño составляет 700 ватт, однако в ходе реальных испытаний под нагрузкой уровень энергопотребления не превышал 550 ватт. Процессор показал отличные результаты на архитектурах GPT‑OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. На модели Kimi, являющейся крупнейшей из публично тестируемых, устройство выдало примерно в 1.5 раза большую пиковую производительность на ватт и сократило сквозную задержку в 3.4 раза относительно стандартных систем. Внутренние испытания показали, что на флагманских моделях OpenAI преимущество становится еще более заметным, что указывает на масштабируемость архитектуры по мере роста сложности задач. Изначально аппаратное решение проектировалось с расчетом на работу с современными и будущими языковыми моделями, ориентированными на интерактивных агентов.
Архитектура скорости и эффективности на одном чипе
Преимущества инновационного решения достигаются за счет комплексного проектирования чипа, памяти, сети, программного обеспечения и стоечной системы под реальные рабочие нагрузки языковых моделей. Инференс языковых моделей проходит через несколько четких этапов с разными узкими местами. Фаза префилла, когда система обрабатывает подсказку, требует больших вычислительных ресурсов, в то время как декодирование, когда система генерирует ответ токен за токеном, сильнее ограничено пропускной способностью памяти. Связь также может увеличивать задержки, если данные перемещаются между ядрами и кристаллами, из-за чего некоторые вычислительные блоки простаивают в ожидании. Система, превосходно справляющаяся с одной фазой, может потерять это преимущество в ожидании данных или при перемещении состояния модели между различными ресурсами. Новая архитектура спроектирована так, чтобы минимизировать перемещение данных и задержки связи. Это означает, что состояние модели, включая KV-кэш, используемый при генерации ответа, может явно размещаться и удерживаться локально, пока система активирует правильную комбинацию вычислений, памяти и сетевых возможностей для каждой фазы инференса.
Сеть играет неотъемлемую роль в общей архитектуре. Ее обширный домен позволяет всей рабочей нагрузке оставаться внутри единой связанной системы, минимизируя перемещение данных и помогая всему запросу выполняться быстро и эффективно от начала и до конца. Результатом стал сбалансированный и универсальный ускоритель, способный поддерживать меняющиеся архитектуры моделей, превосходно справляться как с префиллом, так и с декодированием, а также адаптироваться по мере изменения баланса между ними, что является определяющей характеристикой агентских рабочих нагрузок.
Искусственный интеллект в разработке и программировании чипа
Искусственный интеллект сыграл непосредственную роль в создании процессора, позволив команде перейти от первоначального проектирования до отправки макета на фабрику всего за девять месяцев. Это стало возможным благодаря изучению вариантов реализации, сокращению циклов проектирования, измерений и верификации, а также непрерывной итерации рабочих нагрузок моделей. Искусственный интеллект также помог оптимизировать арифметические схемы чипа, позволив инженерам вовремя разместить на кристалле больше вычислительной производительности. Чип создавался как понятная и предсказуемая цель программирования как для людей, так и для искусственного интеллекта. Инженеры могут описывать работу с помощью локальных тензоров, явной связи и предсказуемой синхронизации. В свою очередь, искусственный интеллект может оптимизировать то, как эта работа отображается, размещается, планируется и координируется по всей системе. Такая четкая и предсказуемая структура дает искусственному интеллекту управляемый способ решения традиционно сложной проблемы параллельного программирования.
Поддержка каждого нового семейства моделей по-прежнему требует новых ядер и специфичных для моделей оптимизаций. Используя систему Codex с GPT-Astra, команда вывела на высокий уровень производительности за два месяца три модели с открытыми весами, которые не входили в первоначальный производственный план. Это продемонстрировало как гибкость архитектуры, так и скорость, с которой искусственный интеллект помогает ее программировать. Для выбранных блоков внимания GPT-OSS и экспертных смесей сгенерированные искусственным интеллектом реализации работали в 1,5–1,8 раза быстрее, чем существующие варианты, написанные экспертами-людьми. Эти показатели относятся к конкретным выбранным блокам, а не ко всей модели в целом, но они указывают на мощный новый цикл разработки.

ИИ-инфраструктура ценна благодаря полезной реальной работе, которую она делает возможной. Производя больше полезной работы при тех же затратах энергии и аппаратного обеспечения, процессор помогает удовлетворять растущий спрос и снижать стоимость доставки успешного результата. Для компании это может улучшить операционный рычаг, позволяя полезной работе и выручке расти быстрее, чем затраты на обслуживание. Это также способно поддержать более широкое внедрение и постоянные инвестиции в создание лучших моделей, продуктов и инфраструктуры. Более быстрый инференс открывает путь к ускоренным итерациям и появлению новых сценариев использования.
Планы внедрения и масштабирования
Новая архитектура раздвигает границы эффективности инференса. Теперь ультрабыстрый режим работает с эффективностью прежнего быстрого, быстрый режим сравнялся с пакетным, а энергоэффективность самого пакетного режима заметно выросла. Новый процессор планируют внедрить в вычислительную инфраструктуру компании уже к концу этого года.
Разработка открывает долгосрочную дорожную карту: второе поколение чипа активно проектируется, а третье обретает форму. OpenAI продолжит использовать ускорители NVIDIA и других партнеров для обучения и инференса, стремясь к созданию AGI на благо человечества. Сейчас идет подготовка к масштабированию, доработка ПО и тестирование чипа на различных моделях.
Сравнительные показатели эффективности
Тестирование в различных режимах подтверждает превосходство архитектуры по ключевым метрикам производительности.

Первая группа тестов
- Пиковый показатель mixed TPS/kW вырос в ≈1,9 раза (85 448 против 44 960 mixed/kW).
- Сквозная задержка снизилась в ≈1,7 раза (1,03 с против 1,80 с).
- Минимальный TBT сократился в ≈2,7 раза (0,69 против 1,87 мс, или 1459 против 535 токенов/с на пользователя).
- Пропускная способность при прежнем TBT увеличилась в ≈53,7 раза (22 935 против 427 mixed/kW при 535,28 токена/с на пользователя).
Вторая группа тестов
- Пиковый mixed TPS/kW вырос в ≈1,7 раза (19 641 против 11 781 mixed/kW).
- Сквозная задержка сократилась в ≈3,6 раза (1,65 с против 5,99 с).
- Минимальный TBT снизился в ≈4,1 раза (1,43 против 5,90 мс, или 700 против 169 токенов/с на пользователя).
- Пропускная способность при прежнем TBT выросла в ≈104,3 раза (12 258 против 118 mixed/kW при 169,41 токена/с на пользователя).
Третья группа тестов
- Пиковый mixed TPS/kW увеличился в ≈1,5 раза (18 195 против 11 862 mixed/kW).
- Сквозная задержка снизилась в ≈3,4 раза (1,56 с против 5,31 с).
- Минимальный TBT сократился в ≈3,8 раза (1,44 против 5,48 мс, или 694 против 182 токенов/с на пользователя).
- Пропускная способность при прежнем TBT выросла в ≈56,1 раза (6 744 против 120 mixed/kW при 182,46 токена/с на пользователя).
Источник: openai.com

