AI Radar
Imagine Video 1.5 теперь генерирует ролики напрямую из текста, принимает изображения и голосовые образцы в качестве референсов и выводит видео в нативном 1080p. Новые средства управления помогают переносить одного персонажа, предмет или локацию из кадра в кадр без повторного описания всех деталей.
Главное дополнение — режим Multi-Reference, в котором одной генерации можно передать до семи изображений с разными ролями. Например, первый референс фиксирует лицо героя, второй — внешний вид продукта, а третий — локацию. После этого пользователь может менять действие, сохраняя персонажа и сцену, переносить того же героя в новое окружение или заменять героя, не перестраивая остальную композицию. Это более точный способ управления результатом, чем длинный промпт, где все визуальные признаки приходится описывать словами.
Отдельный голосовой референс отвечает за акустическую непрерывность. Если одновременно загрузить изображение персонажа и образец голоса, xAI обещает удерживать и лицо, и звучание в нескольких сценах. Функция рассчитана на производство последовательности связанных кадров: автору не нужно заново собирать идентичность героя для каждого фрагмента, хотя доступные сведения пока не содержат независимых тестов стабильности на длинных сериях или сложных ракурсах.
Модель также перестала быть только инструментом для оживления исходной картинки: ролик можно начать с одного текстового описания. Нативное разрешение 1080p работает и для text-to-video, и для image-to-video. Обе возможности уже доступны в Grok Imagine через веб, iOS и Android, тогда как изображения и голоса в роли референсов запускаются поэтапно: сначала в США для подписчиков SuperGrok Heavy и SuperGrok Plus на сайте Imagine и в приложении для iOS, затем — для остальных тарифов в течение нескольких дней.
Разработчикам xAI предлагает те же базовые возможности через API модели grok-imagine-video-1.5: там доступны генерация из текста, референсные изображения и 1080p. В запрос можно передать промпт, URL изображения, длительность, соотношение сторон и разрешение. Голосовые референсы не открыты в API автоматически — для их подключения требуется отдельный запрос к xAI, поэтому программный доступ пока не полностью совпадает с пользовательским продуктом.
Imagine Video 1.5 вышла месяцем ранее как обновление движения, физики и звука. Нынешний релиз смещает акцент с общей реалистичности на управляемость: один и тот же набор визуальных и голосовых опор можно использовать при смене действия или окружения. Именно сохранение идентичности между отдельными генерациями необходимо для сторибордов, рекламных вариантов и коротких сюжетов, где красивого, но каждый раз нового персонажа недостаточно.
Референсы сокращают число повторных генераций при создании серии кадров с одним героем, продуктом или местом, а 1080p уменьшает зависимость от последующего апскейлинга. Для автоматизированных пайплайнов особенно важен API, но командам, которым нужна голосовая идентичность, пока придётся отдельно согласовывать доступ и проверять стабильность на собственных материалах.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.