AI Radar
Apple объединила языковую модель и нормализующие потоки в STARFlow2
Apple представила STARFlow2 — архитектуру для единой генерации последовательностей, в которых чередуются текст и изображения. Ее ключевая идея состоит в том, чтобы сблизить языковую модель и авторегрессионный нормализующий поток на уровне общей Transformer-структуры.
Что изменилось
Существующие мультимодальные генераторы обычно идут на один из трех компромиссов. Дискретизация изображений может снижать визуальное качество; сочетание причинной генерации текста с итеративным диффузионным шумоподавлением создает архитектурную асимметрию; а дообучение готовой vision-language-модели для генерации способно ухудшить уже приобретенные способности к пониманию. STARFlow2 нацелена именно на этот структурный разрыв, а не просто на добавление еще одного визуального декодера к LLM.
Apple исходит из наблюдения, что авторегрессионные нормализующие потоки сами могут быть реализованы как авторегрессионные Transformers. Они используют такую же причинную маску, последовательную обработку слева направо и механизм KV-кэша, как языковые модели. Это дает общий архитектурный язык для текста и непрерывных визуальных представлений и потенциально позволяет генерировать смешанные текстово-графические последовательности без обязательного сведения изображения к дискретным токенам или подключения отдельного итеративного диффузионного контура.
Почему это важно
Единая причинная архитектура может упростить обучение и обслуживание моделей, которые одновременно рассуждают по тексту и создают изображения. Совместимость с KV-кэшем особенно важна для стоимости и задержки последовательной генерации. Однако доступное описание пока не дает достаточно данных, чтобы сравнить визуальное качество, скорость и сохранность исходных способностей понимания с диффузионными подходами.
Первоисточники и подтверждения
Подборку проверяет редакция DSML. AI помогает дедуплицировать сигналы и готовить текст, но опубликованный выпуск остаётся редакционным продуктом, а не лентой отдельных каналов.