AI Radar
OpenAI показала устройство и первые результаты Jalapeño — собственного ASIC для инференса, разработанного вместе с Broadcom. В тестах компании система одновременно обошла решения Nvidia Blackwell по энергоэффективности и задержке, но массовое внедрение начнётся не раньше 2027 года.
Jalapeño рассчитан не на обучение моделей, а на их эксплуатацию: генерацию ответов, выполнение агентных задач и обслуживание большого числа пользователей. Здесь важны не только общая пропускная способность, но и задержка для отдельного запроса — обычно оптимизация одной метрики ухудшает другую. OpenAI утверждает, что специализированная архитектура позволила сократить этот компромисс и обслуживать больше запросов на единицу энергии, не заставляя пользователя дольше ждать ответа.
Одна из ключевых идей — уменьшение перемещений данных между вычислительными блоками и памятью. Состояние модели, включая KV-кеш с данными о уже обработанных токенах, можно явно разместить и удерживать локально, а для разных фаз инференса подключать нужную комбинацию вычислений, памяти и сети. Такая организация должна снимать узкие места на этапе prefill, когда модель обрабатывает входной контекст, и при обмене данными между ускорителями.
Для проверки использовался бенчмарк SemiAnalysis InferenceX с моделями GPT-OSS 120B, DeepSeek R1 и Kimi K2.5 1T. По данным OpenAI, Jalapeño обеспечил в 1,5–1,9 раза больше «AI-работы» на ватт и в 1,7–3,6 раза меньшую сквозную задержку, чем лучшие зафиксированные результаты систем с Nvidia GB200 или GB300. В наиболее интерактивных режимах преимущество по производительности доходило до 4,1 раза; заявленная скорость составила до 1459 токенов в секунду на пользователя для GPT-OSS 120B и до 700 токенов в секунду для DeepSeek R1. При TDP 700 Вт фактическое потребление в этих тестах не превышало 550 Вт.
Сравнение требует осторожности. Результаты предоставила сама OpenAI, а The Register характеризует прогон InferenceX как предположительно неофициальный. Кроме того, к моменту заметного развёртывания Jalapeño на рынке появятся Nvidia Rubin и AMD MI455X. Это более универсальные ускорители, оптимизированные и для обучения, и для инференса, тогда как ASIC OpenAI может сосредоточиться на одной задаче и собственном программно-аппаратном стеке.
Первые чипы OpenAI собирается установить до конца 2026 года лишь в небольшом объёме, а наращивать парк — в 2027-м; точное количество не раскрывается. Jalapeño при этом не должен заменить Nvidia и AMD: программируемые GPU останутся нужны для обучения и для раннего запуска новых моделей, после чего стабильные нагрузки можно переносить на внутренний ASIC. Компания уже разрабатывает второе поколение и формирует третье, превращая проект в многолетнюю платформу, где модели, память, чипы и продукты проектируются совместно.
Собственный ASIC позволяет OpenAI снижать стоимость обслуживания моделей и точнее настраивать инфраструктуру под агентные нагрузки, где одновременно критичны задержка и расход энергии. Для разработчиков это потенциально означает более быстрые ответы и меньше ограничений в периоды высокого спроса. Однако заявленное преимущество ещё предстоит подтвердить в промышленной эксплуатации и сравнить с поколением ускорителей 2027 года.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.