AI Radar
Sand.ai выпустила в открытом доступе MAGI-2 Preview — MoE-модель на 114 млрд параметров, которая генерирует изображение и звук в едином потоке. При каждом прямом проходе она активирует около 6 млрд параметров, сочетая большую ёмкость с разреженными вычислениями.
MAGI-2 Preview переносит подход Mixture of Experts в масштаб крупной видеомодели: вместо одновременного использования всех 114 млрд параметров маршрутизатор выбирает нужные экспертные блоки, оставляя активными примерно 6 млрд. Такая схема особенно важна для видео, где несколько секунд материала превращаются в сотни тысяч или миллионы визуальных токенов, к которым добавляются текстовое условие и аудио. Простое увеличение плотной модели сделало бы каждый запуск заметно дороже и не гарантировало бы пропорционального улучшения качества.
Текст, видео и аудио в MAGI-2 проходят через один Transformer и взаимодействуют на каждом слое self-attention. Это отличается от каскадных систем, которые сначала создают картинку, затем звук и отдельно синхронизируют их, а также от многопоточных архитектур с разными ветвями и модулями cross-attention. Единый контекст позволяет с начала генерации совместно учитывать реплики, движение губ, выражение лица, действия, фоновые звуки и ритм монтажа. Внутри предусмотрены как общие эксперты для совместных признаков, так и специализированные эксперты отдельных модальностей.
Ключевая техническая особенность — Multi-Head MoE. Скрытое представление токена размерностью 3072 разбивается на 12 подпространств по 256 измерений, и каждое маршрутизируется независимо. Это даёт разным экспертам возможность обрабатывать, например, семантику, движение, внешний вид и звук, не поручая все аспекты одной небольшой группе. В 36-слойной основной сети этот механизм дополнен Head Parallel: данные распределяются между устройствами по головам до маршрутизации, поэтому основной объём обмена определяется входным представлением, а не меняющимся числом токенов у удалённых экспертов.
Для обучения тысяч мелких экспертов Sand.ai разработала собственный инфраструктурный слой. Библиотека MagiMoE объединяет маршрутизацию, сортировку и экспертные вычисления, сокращая промежуточные операции и перемещения данных в памяти; в Preview используется проверанный в крупном обучении путь Triton/BF16. Распределённый оптимизатор MagiMuon сочетает Muon для основных матричных параметров с AdamW для параметров, которым лучше подходят обычные обновления, и адаптирует их организацию к большому числу экспертов.
Разработчики также связывают масштабирование с разнообразием обучающих данных, а не только с числом параметров. Предобучение должно охватывать сложные движения, редкие объекты, необычные ракурсы и нетипичный звук, тогда как последующее обучение отвечает за предпочтения, управляемость и продуктовую адаптацию. Для организации такого корпуса нужны подробные подписи, связывающие персонажей, действия, сцену, последовательность кадров, аудио и текст; чрезмерная фильтрация могла бы лишить крупный экспертный пул материала для специализации.
В рейтинге Artificial Analysis Image to Video модель заняла шестое место и вошла в мировую десятку. Этот результат даёт ориентир качества, но не заменяет независимой проверки стоимости, скорости, стабильности звука и поведения на разных типах запросов. Открытая публикация модели и связанного подхода позволяет исследователям воспроизводить эксперименты, изучать маршрутизацию экспертов и пробовать увеличивать длительность генерации без самостоятельного построения всей системы с нуля.
MAGI-2 Preview предлагает практическую архитектуру для увеличения ёмкости аудиовидеомоделей без активации всех параметров на каждом шаге. Открытый выпуск особенно полезен командам, исследующим синхронизацию речи и изображения, MoE-маршрутизацию и распределённое обучение. При выборе для продукта всё равно потребуются собственные замеры задержки, требований к памяти и качества на целевых данных.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.