AI Radar

Apple объединила языковую модель и нормализующие потоки в STARFlow2

Apple представила STARFlow2 — архитектуру для единой генерации последовательностей, в которых чередуются текст и изображения. Ее ключевая идея состоит в том, чтобы сблизить языковую модель и авторегрессионный нормализующий поток на уровне общей Transformer-структуры.

25 августа 2026 г.2 мин чтенияИсточник: Apple Machine Learning Research
06

Что изменилось

Существующие мультимодальные генераторы обычно идут на один из трех компромиссов. Дискретизация изображений может снижать визуальное качество; сочетание причинной генерации текста с итеративным диффузионным шумоподавлением создает архитектурную асимметрию; а дообучение готовой vision-language-модели для генерации способно ухудшить уже приобретенные способности к пониманию. STARFlow2 нацелена именно на этот структурный разрыв, а не просто на добавление еще одного визуального декодера к LLM.

Apple исходит из наблюдения, что авторегрессионные нормализующие потоки сами могут быть реализованы как авторегрессионные Transformers. Они используют такую же причинную маску, последовательную обработку слева направо и механизм KV-кэша, как языковые модели. Это дает общий архитектурный язык для текста и непрерывных визуальных представлений и потенциально позволяет генерировать смешанные текстово-графические последовательности без обязательного сведения изображения к дискретным токенам или подключения отдельного итеративного диффузионного контура.

Почему это важно

Единая причинная архитектура может упростить обучение и обслуживание моделей, которые одновременно рассуждают по тексту и создают изображения. Совместимость с KV-кэшем особенно важна для стоимости и задержки последовательной генерации. Однако доступное описание пока не дает достаточно данных, чтобы сравнить визуальное качество, скорость и сохранность исходных способностей понимания с диффузионными подходами.

Первоисточники и подтверждения

Подборку проверяет редакция DSML. AI помогает дедуплицировать сигналы и готовить текст, но опубликованный выпуск остаётся редакционным продуктом, а не лентой отдельных каналов.

25 августа 2026 г.
  1. 01OpenAI показала архитектуру и первые тесты inference-чипа Jalapeño
  2. 02Apple выпустила M6, M5 Ultra и новые Mac с прицелом на локальный ИИ
  3. 03Perplexity и Nvidia перенесли агента Computer на локальные GPU
  4. 04Китайские open-weight-модели захватили большинство токенов Vercel AI Gateway