AI Radar
Black Forest Labs запустила ранний доступ к FLUX 3 Video — первой доступной части модели, совместно обученной на изображениях, видео и аудио. Она создаёт ролики с нативным звуком продолжительностью до 20 секунд.
Модель принимает текст, изображения, ключевые кадры и референсные клипы, умеет продолжать видео со звуком и переносить персонажей между сценами. Заявлены многоязычные диалоги и сборка длинных последовательностей из нескольких клипов.
Предварительные тесты компании проводились на десятисекундных роликах в разрешении 720p, однако модель и система оценки ещё дорабатываются. В дальнейшем запланированы API, закрытые веса и открытая базовая модель FLUX 3 Dev для изображений, видео, аудио и прогнозирования действий.
Почему важно: совместное обучение на изображениях, движении и звуке сокращает разрыв между отдельными генеративными конвейерами. Обещанный открытый backbone также может сделать архитектуру полезной для исследований мультимодальности и робототехники.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.