AI Radar
Meta выпустила Muse Glimmer — мультимодальную агентную модель примерно на 30 млрд параметров с контекстом 128 тысяч токенов и вариантами для локального запуска на видеокартах с 24 ГБ памяти. Вместе с открытыми весами под Apache 2.0 доступны 4-битные квантизации, визуальный энкодер и компонент ускорения генерации DFlash.
Muse Glimmer рассчитана не только на диалог: модель умеет работать с изображениями и содержимым экрана, вызывать инструменты, выполнять код и продолжать многошаговые задачи. Для локального развёртывания заявлена поддержка llama.cpp, MLX и ExecuTorch. Основная инженерная сложность здесь возникает из сочетания функций: агенту нужно одновременно хранить длинную историю команд и результатов, регулярно обрабатывать новые скриншоты и достаточно быстро генерировать reasoning-токены, не выходя за пределы памяти одной потребительской видеокарты.
В основе модели — плотный Transformer из 52 слоёв со скрытой размерностью 6656, 32 query-head и только двумя KV-head. Слои внимания чередуются по схеме: три локальных с окном 2048 токенов, затем один глобальный. Grouped-query attention сокращает объём Key и Value, который нужно сохранять для каждого токена, а локальные слои не держат весь контекст. По теоретической оценке на основе опубликованной архитектуры BF16 KV-кеш для 128 тысяч токенов может занимать около 1,7 ГиБ вместо примерно 6,5 ГиБ, если бы все 52 слоя были глобальными; это расчёт, а не измеренное Meta потребление памяти.
Остальное пространство высвобождается квантизацией весов. Версия K Quant 17GB занимает около 16,8 ГБ, визуальная часть — примерно 1,4 ГБ, DFlash — ещё около 1,6 ГБ, поэтому вся сборка приближается к 20 ГБ и оставляет некоторый запас на карте с 24 ГБ. Более крупная Dynamic K Quant рассчитана на 32 ГБ. По 15 бенчмаркам Meta оценивает среднюю потерю качества примерно в 1% для 17-гигабайтного варианта и в 0,2% для Dynamic K Quant, то есть минимальный размер достигается ценой немного более заметной деградации.
Визуальный вход обрабатывает отдельный Perception Encoder класса ViT-G/14 примерно на 1,8 млрд параметров; одна картинка может превращаться максимум в 4096 визуальных токенов. Это позволяет агенту читать документы, графики, веб-страницы и интерфейсы, но быстро расходует даже 128-тысячный контекст. В OSWorld Verified разработчики не сохраняли неограниченную историю экрана, а оставляли только часть последних снимков. Старые скриншоты не просто занимают место: они могут описывать уже изменившийся интерфейс и конфликтовать с текущим состоянием, поэтому большое окно не отменяет необходимость отдельного менеджера памяти.
Glimmer дистиллирована из более крупной Muse Spark в несколько этапов. На ранней стадии студент перенимал полное распределение вероятностей teacher-модели, а не только выбранные ответы; затем в обучение добавили длинный контекст, reasoning-траектории и агентные данные. На заключительном этапе использовались SFT, reinforcement learning и on-policy distillation: модель сначала сама проходила задачу и попадала в характерные для неё ошибочные состояния, после чего получала подсказки более сильной модели именно из этих точек. Такой подход должен улучшать восстановление после неверного вызова инструмента, ошибки кода или неудачного действия в интерфейсе.
Компромиссы архитектуры сохраняются. В 39 локальных слоях токен напрямую видит лишь ближайшее окно, а дальние связи проходят через 13 глобальных слоёв, поэтому формальная поддержка 128K не означает одинаково надёжное использование любой детали истории. Квантизация также снижает качество, а фактическая доступная длина будет зависеть от реализации runtime, числа изображений и служебных буферов. Локальному приложению всё равно понадобятся стратегии удаления устаревших наблюдений, краткого пересказа результатов и вынесения постоянных фактов во внешнюю память.
Muse Glimmer позволяет собирать локальных агентов, которые видят экран, запускают код и вызывают инструменты без обязательной передачи рабочих данных облачному API. Это особенно полезно для приватных документов, автоматизации рабочего места и устройств с ограниченным подключением. При этом конфигурация на 24 ГБ остаётся плотно упакованной: реальную длину контекста, скорость и устойчивость после квантизации стоит проверять на целевом runtime и собственных многошаговых сценариях.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.