AI Radar
MiniMax представила полимодальную H3, которая принимает сочетания текста, изображений, видео и аудио, а затем создаёт до 15 секунд видео в разрешении 2K с нативным стереозвуком. Вместо отдельных режимов для генерации и редактирования модель связывает материалы и инструкции естественным языком.
Пользователь может одновременно передать H3 референс движения камеры, изображение нужного персонажа, образец голоса и текстовое описание итоговой сцены. Модель должна раздельно извлечь из материалов движение, идентичность и звуковые характеристики, а затем собрать их в новый ролик. На выходе она совместно генерирует изображение, речь, музыку и звуковые эффекты; звук по умолчанию стереофонический, максимальная длительность составляет 15 секунд, а разрешение — 2K. MiniMax ориентирует систему на рекламу, электронную коммерцию, дизайн продуктов, UI/UX и игры.
Ключевое отличие H3 от обычного набора генераторов — отказ от жёсткого деления на «текст в видео», перенос движения, референс персонажа, замену голоса и другие отдельные функции. Во время предобучения MiniMax смешивала задачи генерации изображений, видео и аудио с разными вариантами редактирования и переноса признаков. Аудио при этом не разделялось на речь, эффекты и музыку, а видео обучалось как с совместным звуком, так и с несколькими планами. Какие элементы исходников нужно сохранить, заменить или переосмыслить, пользователь описывает обычным языком, а не выбирает фиксированный режим продукта.
Чтобы столь разные входы поместились в единый контекст, MiniMax разработала Contextual Omni Representation — представление, которое словесно кодирует целевой ролик, референсы и отношения между ними. Исходная обработка одного набора материалов могла требовать около 100 тыс. токенов, после чего конвейер сжимает представление в среднем примерно до 4 тыс. токенов. Ещё один компонент, H3-VAE, повышает степень сжатия визуальной информации и, по данным компании, в четыре раза сокращает эффективную длину последовательности. Это уменьшает стоимость обучения и инференса и помогает работать с 2K.
Основой стала новая архитектура H3-Omni Transformer, а не схема предыдущей Hailuo-02. Из-за втрое выросшего разброса длин последовательностей и разных вычислительных профилей понимания и генерации разработчики применили гетерогенную тренировочную инфраструктуру и балансировку нагрузки между примерами. Заявленный прирост сквозной пропускной способности обучения составил почти 30%. Для 2K модель не использует отдельный апскейлер: механизм In-context Regeneration повторно генерирует изображение в высоком разрешении с учётом исходного полимодального контекста, чтобы лучше сохранять мелкий текст и локальные детали.
На момент анонса H3 заняла второе место в рейтинге Artificial Analysis для генерации видео со звуком: 1242 Elo против 1245 у Google Gemini Omni Flash. MiniMax заявляет, что секунда 2K-видео будет стоить менее трети цены распространённых конкурентов, а при 768p — менее половины, но точные тарифы ещё не опубликованы. Компания также признаёт ограничения в сложном полимодальном понимании, масштабе модели и детализации отдельных сцен. Веса обещано открыть в ближайшие дни с учётом юридических требований, в том числе для развития сторонней экосистемы и адаптации под китайские ускорители.
H3 позволяет собирать сложный видеобриф из разнородных референсов без ручной цепочки отдельных моделей для движения, голоса, монтажа и повышения разрешения. Для студий решающими станут стабильность следования многосоставным инструкциям, качество синхронизации звука и реальная цена генерации — эти параметры ещё требуют независимой проверки.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.