DSML Kazakhstan LogoDSMLKZ
HomeAboutPeopleNewsAI RadarJobsResearchEventsArticles
DSML Kazakhstan Logo© 2026 DSML Kazakhstan.
AboutCollaborateCommunity GuidelinesTelegramAI Radar RSSYouTubeLinkedInInstagram
    AI RadarAugust 25, 2026

    AI Radar

    OpenAI показала архитектуру и первые тесты inference-чипа Jalapeño

    OpenAI показала устройство и первые результаты Jalapeño — собственного ASIC для инференса, разработанного вместе с Broadcom. В тестах компании система одновременно обошла решения Nvidia Blackwell по энергоэффективности и задержке, но массовое внедрение начнётся не раньше 2027 года.

    August 25, 2026·3 min read·Источник: The Verge · TechCrunch +3
    05

    Что изменилось

    Jalapeño рассчитан не на обучение моделей, а на их эксплуатацию: генерацию ответов, выполнение агентных задач и обслуживание большого числа пользователей. Здесь важны не только общая пропускная способность, но и задержка для отдельного запроса — обычно оптимизация одной метрики ухудшает другую. OpenAI утверждает, что специализированная архитектура позволила сократить этот компромисс и обслуживать больше запросов на единицу энергии, не заставляя пользователя дольше ждать ответа.

    Одна из ключевых идей — уменьшение перемещений данных между вычислительными блоками и памятью. Состояние модели, включая KV-кеш с данными о уже обработанных токенах, можно явно разместить и удерживать локально, а для разных фаз инференса подключать нужную комбинацию вычислений, памяти и сети. Такая организация должна снимать узкие места на этапе prefill, когда модель обрабатывает входной контекст, и при обмене данными между ускорителями.

    Для проверки использовался бенчмарк SemiAnalysis InferenceX с моделями GPT-OSS 120B, DeepSeek R1 и Kimi K2.5 1T. По данным OpenAI, Jalapeño обеспечил в 1,5–1,9 раза больше «AI-работы» на ватт и в 1,7–3,6 раза меньшую сквозную задержку, чем лучшие зафиксированные результаты систем с Nvidia GB200 или GB300. В наиболее интерактивных режимах преимущество по производительности доходило до 4,1 раза; заявленная скорость составила до 1459 токенов в секунду на пользователя для GPT-OSS 120B и до 700 токенов в секунду для DeepSeek R1. При TDP 700 Вт фактическое потребление в этих тестах не превышало 550 Вт.

    Сравнение требует осторожности. Результаты предоставила сама OpenAI, а The Register характеризует прогон InferenceX как предположительно неофициальный. Кроме того, к моменту заметного развёртывания Jalapeño на рынке появятся Nvidia Rubin и AMD MI455X. Это более универсальные ускорители, оптимизированные и для обучения, и для инференса, тогда как ASIC OpenAI может сосредоточиться на одной задаче и собственном программно-аппаратном стеке.

    Первые чипы OpenAI собирается установить до конца 2026 года лишь в небольшом объёме, а наращивать парк — в 2027-м; точное количество не раскрывается. Jalapeño при этом не должен заменить Nvidia и AMD: программируемые GPU останутся нужны для обучения и для раннего запуска новых моделей, после чего стабильные нагрузки можно переносить на внутренний ASIC. Компания уже разрабатывает второе поколение и формирует третье, превращая проект в многолетнюю платформу, где модели, память, чипы и продукты проектируются совместно.

    Почему это важно

    Собственный ASIC позволяет OpenAI снижать стоимость обслуживания моделей и точнее настраивать инфраструктуру под агентные нагрузки, где одновременно критичны задержка и расход энергии. Для разработчиков это потенциально означает более быстрые ответы и меньше ограничений в периоды высокого спроса. Однако заявленное преимущество ещё предстоит подтвердить в промышленной эксплуатации и сравнить с поколением ускорителей 2027 года.

    Primary and supporting sources

    • OpenAI says its Jalapeño chip can power faster AI responses than the competitionOpens in a new tab
    • OpenAI's Jalapeño chip is built for fast inference at scale, benchmarks showOpens in a new tab
    • OpenAI's upcoming Jalapeño chip looks like it'll be an inference beastOpens in a new tab

    DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.

    More from this edition

    August 25, 2026
    1. 01Apple выпустила M6, M5 Ultra и новые Mac с прицелом на локальный ИИ
    2. 02Perplexity и Nvidia перенесли агента Computer на локальные GPU
    3. 03Китайские open-weight-модели захватили большинство токенов Vercel AI Gateway
    4. 04Darkbloom начала платить владельцам Mac за распределённый AI-инференс
    Back to AI Radar