OpenAI показала первые результаты собственного чипа Jalapeño
OpenAI опубликовала первые измерения Jalapeño - собственного чипа для выполнения уже обученных ИИ-моделей. На публичном тесте InferenceX система показала одновременно более высокую производительность на ватт и меньшую задержку, чем коммерческие решения в сравнении. Результаты получены на GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. Компания планирует постепенно увеличивать выпуск чипов и использовать их вместе с инфраструктурой внешних партнеров, а не объявляет немедленную замену всех ускорителей.
Что изменилось
Jalapeño создан специально для инференса
Чип предназначен не для обучения модели с нуля, а для обработки пользовательских запросов и последовательного выпуска токенов. OpenAI проектировала вместе вычислительные блоки, память, сеть, программное обеспечение и стойку, учитывая разные фазы языковой модели. Обработка входного промпта сильнее зависит от вычислений, генерация следующего токена - от пропускной способности памяти, а обмен между чипами способен добавить ожидание.
Измерения охватили три открытые модели
Компания запускала GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. Это позволяет показать, что архитектура не привязана только к закрытой модели OpenAI. Тест InferenceX рассматривает полный процесс обслуживания запроса и сравнивает режимы от высокой общей пропускной способности до интерактивной выдачи с низкой задержкой. Такой подход ближе к реальному сервису, чем одна теоретическая цифра на чип.
Заявлен рост работы на ватт в 1,5-1,9 раза
По данным OpenAI, на трех моделях Jalapeño обеспечил в 1,5-1,9 раза больше работы на ватт в точке максимальной пропускной способности. Сквозная задержка была в 1,7-3,6 раза ниже, а на наиболее интерактивных режимах производительность оказалась в 2,1-4,1 раза выше сравнительных систем. Это диапазоны из тестов компании, а не обещание одинакового ускорения каждого ответа ChatGPT.
Номинальная мощность отличается от измеренной
Jalapeño имеет паспортное значение 700 ватт, которое OpenAI использовала при нормализации сравнения с опубликованной мощностью других ускорителей. На испытанных нагрузках измеренное устойчивое потребление не превышало 550 ватт. Для Kimi K2.5 1T компания отдельно указывает примерно полуторакратное преимущество по пиковой производительности на ватт и в 3,4 раза меньшую сквозную задержку.
ИИ применялся и при разработке самого чипа
Предыдущие модели OpenAI помогали проектировать и запускать аппаратную часть, а новые используются для оптимизации и программирования системы. Компания рассматривает это как цикл: реальные нагрузки подсказывают изменения в железе и ПО, после чего более эффективная инфраструктура позволяет обслуживать новые модели. Конкретная доля проектных решений, сделанных моделями, в публикации не раскрывается.
Собственный кремний дополняет партнерские мощности
OpenAI продолжает перечислять Microsoft, NVIDIA, AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle и других поставщиков в своей вычислительной стратегии. Jalapeño дает дополнительный первый путь и больше контроля над стоимостью инференса, но не отменяет разные требования обучения, массовой выдачи и низкой задержки. Будущие поколения чипа уже разрабатываются, а текущий выпуск только начинает наращиваться.
Что это дает пользователю
Для обычного пользователя возможный эффект выражается не в покупке Jalapeño, а в скорости и доступности сервисов OpenAI. Последовательный агент выполняет много запросов, поэтому уменьшение задержки каждого шага может заметно сократить весь процесс. Сроки появления конкретного улучшения в ChatGPT или API компания пока не приводит.
Разработчику не следует заранее менять архитектуру приложения под новый чип. Полезнее продолжать измерять фактическую задержку выбранной модели, стабильность потока, лимиты и цену на рабочем endpoint. Внутренняя замена оборудования может произойти без отдельного model ID и не гарантирует одинаковый результат во всех регионах.
Для инфраструктурного рынка результаты показывают усиление вертикальной интеграции: крупный разработчик моделей получает возможность проектировать ускоритель под собственный профиль запросов. Это может улучшить экономику массового инференса, но сравнивать нужно целую систему, программный стек и энергопотребление, а не только число чипов.
Публичные испытания на сторонних открытых моделях делают заявление проверяемее, чем результат только на закрытой системе. Однако воспроизведение требует доступа к Jalapeño, точным конфигурациям сравнительных стендов и режимам обслуживания, которых у внешнего разработчика сейчас нет.
Что нужно учитывать
Все приведенные показатели опубликованы OpenAI. СравнAI не запускал модели на Jalapeño и не подтверждает диапазоны независимым измерением.
Тестовые преимущества зависят от модели, размера пакета, длины контекста, требуемой задержки и конфигурации системы. Их нельзя переносить на любой запрос как фиксированное ускорение.
Анонс не сообщает цену чипа, объем выпуска, долю текущего трафика OpenAI или дату широкого развертывания в каждом продукте.
Энергоэффективность ускорителя не равна полной эффективности дата-центра. Питание, охлаждение, сеть, загрузка оборудования и источник электроэнергии также влияют на итог.
Коротко
Jalapeño важен как доказательство того, что OpenAI получила работающий собственный ускоритель, а не только объявила проект. Первые цифры выглядят сильными сразу по двум осям - энергии и задержке - и подтверждены на трех открытых моделях. Но пользовательский вывод пока скромнее рекламного: нельзя обещать четырехкратное ускорение ChatGPT или снижение цены API. Реальное значение станет понятнее после масштабирования, независимых сравнений и наблюдаемого изменения тарифов или задержки. Сейчас это прежде всего стратегический шаг OpenAI к контролю над стоимостью массового инференса.
