AI Radar
OpenAI раскрыла первые показатели собственного ускорителя инференса Jalapeño на трёх крупных открытых моделях. Компания сообщает о росте производительности на ватт и снижении задержки, но опубликованных данных пока недостаточно для прямого и окончательного сравнения с NVIDIA Rubin.
Jalapeño тестировали на GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. По данным OpenAI, в точке максимальной пропускной способности ускоритель выполнял в 1,5–1,9 раза больше ИИ-работы на ватт, а сквозная задержка уменьшалась в 1,7–3,6 раза; в режимах с более жёсткими требованиями к интерактивной скорости выигрыш достигал 2,1–4,1 раза. Номинальный теплопакет чипа составляет 700 Вт, тогда как устойчивое потребление в этих нагрузках не превышало 550 Вт. Это относительные показатели из тестов самой компании, и без полной конфигурации платформы их нельзя превращать в универсальный рейтинг ускорителей.
Архитектура нацелена на различие между двумя фазами инференса Transformer. Во время prefill модель обрабатывает весь входной запрос большими параллельными матрицами: одна загрузка весов обслуживает много токенов, поэтому эффективнее используются вычислительные блоки. Во время decode новые токены появляются последовательно, параллелизм снижается, но чипу всё равно приходится читать веса и обращаться к KV-кешу. В таком режиме предел чаще задают пропускная способность памяти и перемещение данных, а не теоретическое число операций матричного умножения.
Поэтому OpenAI подчёркивает в Jalapeño размещение состояния модели и KV-кеша, локальность данных и согласованную работу вычислений, памяти и межсоединений. При этом компания не стала окончательно разделять prefill и decode на разные типы ускорителей: один Jalapeño должен справляться с обеими фазами, позволяя оператору гибче распределять меняющуюся нагрузку. Это отличается от более специализированного подхода, где крупные параллельные этапы остаются на GPU, а последовательная генерация передаётся отдельному процессору с очень быстрой локальной памятью.
Такой баланс особенно важен для интерактивных сервисов и агентов. Большой batch улучшает общую пропускную способность и повторное использование весов, но заставляет отдельный запрос ждать формирования пакета; малый batch уменьшает пользовательскую задержку ценой худшей утилизации оборудования. В агентной цепочке задержка накапливается: модель принимает решение, вызывает инструмент, читает результат и снова запускает генерацию. Длинный контекст дополнительно раздувает KV-кеш, а перенос этого состояния между машинами способен съесть часть выигрыша от раздельной обработки фаз.
После публикации Jalapeño стали сопоставлять с NVIDIA Rubin, однако условия пока не выровнены. В обсуждениях указывается, что ускоритель OpenAI приблизился к Rubin по отдельным метрикам стоимости или эффективности токена и получил результаты без speculative decoding. Возражения касаются различий в программном стеке, характера нагрузок и зрелости платформ: Jalapeño ещё проходит производственную квалификацию, а открытых тестов на сложных агентных задачах с длинным контекстом мало. Кроме того, актуальным конкурентом может быть уже не один GPU Rubin, а гетерогенная система NVIDIA, где низколатентный decode частично берут на себя Groq LPU.
Собственный ускоритель может снизить для OpenAI стоимость генерации токенов, энергопотребление и задержку в ChatGPT и агентных сервисах, одновременно уменьшая зависимость от внешних поставщиков GPU. Для отрасли важен сам выбор метрик: реальная конкуренция смещается от пиковой вычислительной мощности к токенам на ватт и задержке на пользователя. Но оценивать преимущество Jalapeño можно будет только после независимых тестов, раскрытия серверной конфигурации и появления данных о масштабном производственном развёртывании.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.