DSML Kazakhstan LogoDSMLKZ
HomeAboutPeopleNewsAI RadarJobsResearchEventsArticles
DSML Kazakhstan Logo© 2026 DSML Kazakhstan.
AboutCollaborateCommunity GuidelinesTelegramAI Radar RSSYouTubeLinkedInInstagram
    AI RadarAugust 28, 2026

    AI Radar

    Meta открыла мультимодального агента Muse Glimmer для локального запуска на 24 ГБ VRAM

    Meta выпустила Muse Glimmer — мультимодальную агентную модель примерно на 30 млрд параметров с контекстом 128 тысяч токенов и вариантами для локального запуска на видеокартах с 24 ГБ памяти. Вместе с открытыми весами под Apache 2.0 доступны 4-битные квантизации, визуальный энкодер и компонент ускорения генерации DFlash.

    August 28, 2026·4 min read·Источник: 雷峰网 · 人工智能
    00

    Что изменилось

    Muse Glimmer рассчитана не только на диалог: модель умеет работать с изображениями и содержимым экрана, вызывать инструменты, выполнять код и продолжать многошаговые задачи. Для локального развёртывания заявлена поддержка llama.cpp, MLX и ExecuTorch. Основная инженерная сложность здесь возникает из сочетания функций: агенту нужно одновременно хранить длинную историю команд и результатов, регулярно обрабатывать новые скриншоты и достаточно быстро генерировать reasoning-токены, не выходя за пределы памяти одной потребительской видеокарты.

    В основе модели — плотный Transformer из 52 слоёв со скрытой размерностью 6656, 32 query-head и только двумя KV-head. Слои внимания чередуются по схеме: три локальных с окном 2048 токенов, затем один глобальный. Grouped-query attention сокращает объём Key и Value, который нужно сохранять для каждого токена, а локальные слои не держат весь контекст. По теоретической оценке на основе опубликованной архитектуры BF16 KV-кеш для 128 тысяч токенов может занимать около 1,7 ГиБ вместо примерно 6,5 ГиБ, если бы все 52 слоя были глобальными; это расчёт, а не измеренное Meta потребление памяти.

    Остальное пространство высвобождается квантизацией весов. Версия K Quant 17GB занимает около 16,8 ГБ, визуальная часть — примерно 1,4 ГБ, DFlash — ещё около 1,6 ГБ, поэтому вся сборка приближается к 20 ГБ и оставляет некоторый запас на карте с 24 ГБ. Более крупная Dynamic K Quant рассчитана на 32 ГБ. По 15 бенчмаркам Meta оценивает среднюю потерю качества примерно в 1% для 17-гигабайтного варианта и в 0,2% для Dynamic K Quant, то есть минимальный размер достигается ценой немного более заметной деградации.

    Визуальный вход обрабатывает отдельный Perception Encoder класса ViT-G/14 примерно на 1,8 млрд параметров; одна картинка может превращаться максимум в 4096 визуальных токенов. Это позволяет агенту читать документы, графики, веб-страницы и интерфейсы, но быстро расходует даже 128-тысячный контекст. В OSWorld Verified разработчики не сохраняли неограниченную историю экрана, а оставляли только часть последних снимков. Старые скриншоты не просто занимают место: они могут описывать уже изменившийся интерфейс и конфликтовать с текущим состоянием, поэтому большое окно не отменяет необходимость отдельного менеджера памяти.

    Glimmer дистиллирована из более крупной Muse Spark в несколько этапов. На ранней стадии студент перенимал полное распределение вероятностей teacher-модели, а не только выбранные ответы; затем в обучение добавили длинный контекст, reasoning-траектории и агентные данные. На заключительном этапе использовались SFT, reinforcement learning и on-policy distillation: модель сначала сама проходила задачу и попадала в характерные для неё ошибочные состояния, после чего получала подсказки более сильной модели именно из этих точек. Такой подход должен улучшать восстановление после неверного вызова инструмента, ошибки кода или неудачного действия в интерфейсе.

    Компромиссы архитектуры сохраняются. В 39 локальных слоях токен напрямую видит лишь ближайшее окно, а дальние связи проходят через 13 глобальных слоёв, поэтому формальная поддержка 128K не означает одинаково надёжное использование любой детали истории. Квантизация также снижает качество, а фактическая доступная длина будет зависеть от реализации runtime, числа изображений и служебных буферов. Локальному приложению всё равно понадобятся стратегии удаления устаревших наблюдений, краткого пересказа результатов и вынесения постоянных фактов во внешнюю память.

    Почему это важно

    Muse Glimmer позволяет собирать локальных агентов, которые видят экран, запускают код и вызывают инструменты без обязательной передачи рабочих данных облачному API. Это особенно полезно для приватных документов, автоматизации рабочего места и устройств с ограниченным подключением. При этом конфигурация на 24 ГБ остаётся плотно упакованной: реальную длину контекста, скорость и устойчивость после квантизации стоит проверять на целевом runtime и собственных многошаговых сценариях.

    Primary and supporting sources

    • 深度拆解 Muse Glimmer,24GB 显存跑 30B Agent,Meta 到底做了什么?Opens in a new tab

    DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.

    More from this edition

    August 28, 2026
    1. 01Tencent открыла Hy4-preview на 770 млрд параметров и с контекстом в миллион токенов
    2. 02Anthropic предложила стандарт MHS для управления лабораторным и промышленным оборудованием
    3. 03Скрытые рассуждения GPT, Claude и Gemini удалось прочитать через совместимые модели
    4. 04OpenAI раскрыла первые результаты чипа Jalapeño для инференса моделей
    Back to AI Radar