AI Radar
Apple представила STARFlow2 — архитектуру для единой генерации последовательностей, в которых чередуются текст и изображения. Ее ключевая идея состоит в том, чтобы сблизить языковую модель и авторегрессионный нормализующий поток на уровне общей Transformer-структуры.
Существующие мультимодальные генераторы обычно идут на один из трех компромиссов. Дискретизация изображений может снижать визуальное качество; сочетание причинной генерации текста с итеративным диффузионным шумоподавлением создает архитектурную асимметрию; а дообучение готовой vision-language-модели для генерации способно ухудшить уже приобретенные способности к пониманию. STARFlow2 нацелена именно на этот структурный разрыв, а не просто на добавление еще одного визуального декодера к LLM.
Apple исходит из наблюдения, что авторегрессионные нормализующие потоки сами могут быть реализованы как авторегрессионные Transformers. Они используют такую же причинную маску, последовательную обработку слева направо и механизм KV-кэша, как языковые модели. Это дает общий архитектурный язык для текста и непрерывных визуальных представлений и потенциально позволяет генерировать смешанные текстово-графические последовательности без обязательного сведения изображения к дискретным токенам или подключения отдельного итеративного диффузионного контура.
Единая причинная архитектура может упростить обучение и обслуживание моделей, которые одновременно рассуждают по тексту и создают изображения. Совместимость с KV-кэшем особенно важна для стоимости и задержки последовательной генерации. Однако доступное описание пока не дает достаточно данных, чтобы сравнить визуальное качество, скорость и сохранность исходных способностей понимания с диффузионными подходами.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.