DSML Kazakhstan LogoDSMLKZ
HomeAboutPeopleNewsAI RadarJobsResearchEventsArticles
DSML Kazakhstan Logo© 2026 DSML Kazakhstan.
AboutCollaborateCommunity GuidelinesTelegramAI Radar RSSYouTubeLinkedInInstagram
    AI RadarAugust 28, 2026

    AI Radar

    OpenAI раскрыла первые результаты чипа Jalapeño для инференса моделей

    OpenAI раскрыла первые показатели собственного ускорителя инференса Jalapeño на трёх крупных открытых моделях. Компания сообщает о росте производительности на ватт и снижении задержки, но опубликованных данных пока недостаточно для прямого и окончательного сравнения с NVIDIA Rubin.

    August 28, 2026·3 min read·Источник: 雷峰网 · 人工智能
    00

    Что изменилось

    Jalapeño тестировали на GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. По данным OpenAI, в точке максимальной пропускной способности ускоритель выполнял в 1,5–1,9 раза больше ИИ-работы на ватт, а сквозная задержка уменьшалась в 1,7–3,6 раза; в режимах с более жёсткими требованиями к интерактивной скорости выигрыш достигал 2,1–4,1 раза. Номинальный теплопакет чипа составляет 700 Вт, тогда как устойчивое потребление в этих нагрузках не превышало 550 Вт. Это относительные показатели из тестов самой компании, и без полной конфигурации платформы их нельзя превращать в универсальный рейтинг ускорителей.

    Архитектура нацелена на различие между двумя фазами инференса Transformer. Во время prefill модель обрабатывает весь входной запрос большими параллельными матрицами: одна загрузка весов обслуживает много токенов, поэтому эффективнее используются вычислительные блоки. Во время decode новые токены появляются последовательно, параллелизм снижается, но чипу всё равно приходится читать веса и обращаться к KV-кешу. В таком режиме предел чаще задают пропускная способность памяти и перемещение данных, а не теоретическое число операций матричного умножения.

    Поэтому OpenAI подчёркивает в Jalapeño размещение состояния модели и KV-кеша, локальность данных и согласованную работу вычислений, памяти и межсоединений. При этом компания не стала окончательно разделять prefill и decode на разные типы ускорителей: один Jalapeño должен справляться с обеими фазами, позволяя оператору гибче распределять меняющуюся нагрузку. Это отличается от более специализированного подхода, где крупные параллельные этапы остаются на GPU, а последовательная генерация передаётся отдельному процессору с очень быстрой локальной памятью.

    Такой баланс особенно важен для интерактивных сервисов и агентов. Большой batch улучшает общую пропускную способность и повторное использование весов, но заставляет отдельный запрос ждать формирования пакета; малый batch уменьшает пользовательскую задержку ценой худшей утилизации оборудования. В агентной цепочке задержка накапливается: модель принимает решение, вызывает инструмент, читает результат и снова запускает генерацию. Длинный контекст дополнительно раздувает KV-кеш, а перенос этого состояния между машинами способен съесть часть выигрыша от раздельной обработки фаз.

    После публикации Jalapeño стали сопоставлять с NVIDIA Rubin, однако условия пока не выровнены. В обсуждениях указывается, что ускоритель OpenAI приблизился к Rubin по отдельным метрикам стоимости или эффективности токена и получил результаты без speculative decoding. Возражения касаются различий в программном стеке, характера нагрузок и зрелости платформ: Jalapeño ещё проходит производственную квалификацию, а открытых тестов на сложных агентных задачах с длинным контекстом мало. Кроме того, актуальным конкурентом может быть уже не один GPU Rubin, а гетерогенная система NVIDIA, где низколатентный decode частично берут на себя Groq LPU.

    Почему это важно

    Собственный ускоритель может снизить для OpenAI стоимость генерации токенов, энергопотребление и задержку в ChatGPT и агентных сервисах, одновременно уменьшая зависимость от внешних поставщиков GPU. Для отрасли важен сам выбор метрик: реальная конкуренция смещается от пиковой вычислительной мощности к токенам на ватт и задержке на пользователя. Но оценивать преимущество Jalapeño можно будет только после независимых тестов, раскрытия серверной конфигурации и появления данных о масштабном производственном развёртывании.

    Primary and supporting sources

    • Jalapeño 跑分炸场,GPU 推理路线开始分裂?Opens in a new tab

    DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.

    More from this edition

    August 28, 2026
    1. 01Tencent открыла Hy4-preview на 770 млрд параметров и с контекстом в миллион токенов
    2. 02Anthropic предложила стандарт MHS для управления лабораторным и промышленным оборудованием
    3. 03Скрытые рассуждения GPT, Claude и Gemini удалось прочитать через совместимые модели
    4. 04Meta открыла мультимодального агента Muse Glimmer для локального запуска на 24 ГБ VRAM
    Back to AI Radar