DSML Kazakhstan LogoDSMLKZ
HomeAboutPeopleNewsAI RadarJobsResearchEventsArticles
DSML Kazakhstan Logo© 2026 DSML Kazakhstan.
AboutCollaborateCommunity GuidelinesPrivacyTelegramAI Radar RSSYouTubeLinkedInInstagram
    AI RadarJuly 31, 2026

    AI Radar

    MiniMax H3 объединила текст, изображения, видео и звук в одном генераторе роликов

    MiniMax представила полимодальную H3, которая принимает сочетания текста, изображений, видео и аудио, а затем создаёт до 15 секунд видео в разрешении 2K с нативным стереозвуком. Вместо отдельных режимов для генерации и редактирования модель связывает материалы и инструкции естественным языком.

    July 31, 2026·3 min read·Источник: 智东西
    04

    Что изменилось

    Пользователь может одновременно передать H3 референс движения камеры, изображение нужного персонажа, образец голоса и текстовое описание итоговой сцены. Модель должна раздельно извлечь из материалов движение, идентичность и звуковые характеристики, а затем собрать их в новый ролик. На выходе она совместно генерирует изображение, речь, музыку и звуковые эффекты; звук по умолчанию стереофонический, максимальная длительность составляет 15 секунд, а разрешение — 2K. MiniMax ориентирует систему на рекламу, электронную коммерцию, дизайн продуктов, UI/UX и игры.

    Ключевое отличие H3 от обычного набора генераторов — отказ от жёсткого деления на «текст в видео», перенос движения, референс персонажа, замену голоса и другие отдельные функции. Во время предобучения MiniMax смешивала задачи генерации изображений, видео и аудио с разными вариантами редактирования и переноса признаков. Аудио при этом не разделялось на речь, эффекты и музыку, а видео обучалось как с совместным звуком, так и с несколькими планами. Какие элементы исходников нужно сохранить, заменить или переосмыслить, пользователь описывает обычным языком, а не выбирает фиксированный режим продукта.

    Чтобы столь разные входы поместились в единый контекст, MiniMax разработала Contextual Omni Representation — представление, которое словесно кодирует целевой ролик, референсы и отношения между ними. Исходная обработка одного набора материалов могла требовать около 100 тыс. токенов, после чего конвейер сжимает представление в среднем примерно до 4 тыс. токенов. Ещё один компонент, H3-VAE, повышает степень сжатия визуальной информации и, по данным компании, в четыре раза сокращает эффективную длину последовательности. Это уменьшает стоимость обучения и инференса и помогает работать с 2K.

    Основой стала новая архитектура H3-Omni Transformer, а не схема предыдущей Hailuo-02. Из-за втрое выросшего разброса длин последовательностей и разных вычислительных профилей понимания и генерации разработчики применили гетерогенную тренировочную инфраструктуру и балансировку нагрузки между примерами. Заявленный прирост сквозной пропускной способности обучения составил почти 30%. Для 2K модель не использует отдельный апскейлер: механизм In-context Regeneration повторно генерирует изображение в высоком разрешении с учётом исходного полимодального контекста, чтобы лучше сохранять мелкий текст и локальные детали.

    На момент анонса H3 заняла второе место в рейтинге Artificial Analysis для генерации видео со звуком: 1242 Elo против 1245 у Google Gemini Omni Flash. MiniMax заявляет, что секунда 2K-видео будет стоить менее трети цены распространённых конкурентов, а при 768p — менее половины, но точные тарифы ещё не опубликованы. Компания также признаёт ограничения в сложном полимодальном понимании, масштабе модели и детализации отдельных сцен. Веса обещано открыть в ближайшие дни с учётом юридических требований, в том числе для развития сторонней экосистемы и адаптации под китайские ускорители.

    Почему это важно

    H3 позволяет собирать сложный видеобриф из разнородных референсов без ручной цепочки отдельных моделей для движения, голоса, монтажа и повышения разрешения. Для студий решающими станут стабильность следования многосоставным инструкциям, качество синхронизации звука и реальная цена генерации — эти параметры ещё требуют независимой проверки.

    Primary and supporting sources

    • 2K画质,三成价格!钱包友好型国产视频模型来了Opens in a new tab

    DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.

    More from this edition

    July 31, 2026
    1. 01DeepSeek усилила V4-Flash постобучением и подготовила модель к работе с Codex
    2. 02Агент Tencent Hyra помог найти конструкцию для 50-летней задачи аддитивной комбинаторики
    3. 03OpenAI снизила цену GPT-5.6 Luna на 80% и ускорила флагманский Sol
    4. 04Thinking Machines открыла веса мультимодальной Inkling-Small с 12 млрд активных параметров
    Back to AI Radar