DSML Kazakhstan LogoDSMLKZ
HomeAboutPeopleNewsAI RadarJobsResearchEventsArticles
DSML Kazakhstan Logo© 2026 DSML Kazakhstan.
AboutCollaborateCommunity GuidelinesTelegramAI Radar RSSYouTubeLinkedInInstagram
    AI RadarAugust 25, 2026

    AI Radar

    Apple объединила языковую модель и нормализующие потоки в STARFlow2

    Apple представила STARFlow2 — архитектуру для единой генерации последовательностей, в которых чередуются текст и изображения. Ее ключевая идея состоит в том, чтобы сблизить языковую модель и авторегрессионный нормализующий поток на уровне общей Transformer-структуры.

    August 25, 2026·2 min read·Источник: Apple Machine Learning Research
    01

    Что изменилось

    Существующие мультимодальные генераторы обычно идут на один из трех компромиссов. Дискретизация изображений может снижать визуальное качество; сочетание причинной генерации текста с итеративным диффузионным шумоподавлением создает архитектурную асимметрию; а дообучение готовой vision-language-модели для генерации способно ухудшить уже приобретенные способности к пониманию. STARFlow2 нацелена именно на этот структурный разрыв, а не просто на добавление еще одного визуального декодера к LLM.

    Apple исходит из наблюдения, что авторегрессионные нормализующие потоки сами могут быть реализованы как авторегрессионные Transformers. Они используют такую же причинную маску, последовательную обработку слева направо и механизм KV-кэша, как языковые модели. Это дает общий архитектурный язык для текста и непрерывных визуальных представлений и потенциально позволяет генерировать смешанные текстово-графические последовательности без обязательного сведения изображения к дискретным токенам или подключения отдельного итеративного диффузионного контура.

    Почему это важно

    Единая причинная архитектура может упростить обучение и обслуживание моделей, которые одновременно рассуждают по тексту и создают изображения. Совместимость с KV-кэшем особенно важна для стоимости и задержки последовательной генерации. Однако доступное описание пока не дает достаточно данных, чтобы сравнить визуальное качество, скорость и сохранность исходных способностей понимания с диффузионными подходами.

    Primary and supporting sources

    • STARFlow2: Bridging Language Models and Normalizing Flows for Unified Multimodal GenerationOpens in a new tab

    DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.

    More from this edition

    August 25, 2026
    1. 01OpenAI показала архитектуру и первые тесты inference-чипа Jalapeño
    2. 02Apple выпустила M6, M5 Ultra и новые Mac с прицелом на локальный ИИ
    3. 03Perplexity и Nvidia перенесли агента Computer на локальные GPU
    4. 04Китайские open-weight-модели захватили большинство токенов Vercel AI Gateway
    Back to AI Radar