DSML Kazakhstan LogoDSMLKZ
HomeAboutPeopleNewsAI RadarJobsResearchEventsArticles
DSML Kazakhstan Logo© 2026 DSML Kazakhstan.
AboutCollaborateCommunity GuidelinesPrivacyTelegramAI Radar RSSYouTubeLinkedInInstagram
    AI RadarAugust 5, 2026

    AI Radar

    Mistral выпустила компактный мультимодальный модератор Shieldstral

    Mistral открыла веса Shieldstral — модели на 3 млрд параметров, которая проверяет текст, изображения и их сочетания на соответствие заданной политике. Классификатор распространяется по Apache 2.0 и помещается на одной NVIDIA GPU с 16 ГБ памяти.

    August 5, 2026·2 min read·Источник: TestingCatalog
    01

    Что изменилось

    Shieldstral предназначена для команд, которым недостаточно единого универсального фильтра безопасности. Вместо жестко зашитого перечня нарушений разработчик передает модели контекст проверки, сформулированный обычным языком вопрос с ответом «да» или «нет» и сам материал. Это может быть пользовательский запрос, ответ модели, вся пара «запрос — ответ» либо изображение с сопроводительным текстом.

    На инференсе Shieldstral считывает логиты вариантов yes и no и преобразует их в непрерывную оценку безопасности. Приложение может самостоятельно выбрать порог блокировки, отправлять пограничные случаи человеку или ранжировать результаты по уверенности. Поскольку правила остаются частью промпта, один и тот же чекпойнт можно перенастраивать под аудиторию, продукт или предметную область без отдельного дообучения.

    Единый интерфейс охватывает несколько типовых задач: классификацию входящих промптов, модерацию ответов, поиск токсичности и проверку корректности отказа модели. Mistral утверждает, что Shieldstral соответствует или превосходит открытые guard-модели вплоть до семикратно большего размера в текстовой безопасности, распознавании отказов, адаптации к политикам и мультимодальной модерации. Все образцы заявленных оценочных наборов, по данным компании, были исключены из обучения, но независимая проверка этих результатов еще потребуется.

    Обучающие данные из реальных и синтетических источников имели разные таксономии, поэтому их привели к общей структуре «инструкция — запрос — документ». Контрастные примеры помогали различать близкие политики, а нехватку визуальных материалов по безопасности компенсировали обычными наборами изображений, использованными как отрицательные примеры. Пары изображений и запросов дополнительно фильтровались vision-language-реранкером.

    Финальная модель объединяет несколько специализаций. Mistral использовала LoRA-дообучение, а затем SLERP для слияния чекпойнтов, отвечавших за калибровку на открытых данных, различение тонких политик и следование инструкциям базовой модели. Shieldstral построена на платформе Forge, веса опубликованы в репозитории Mistral на Hugging Face; среди следующих направлений названы расширение языкового покрытия, работа с длинными документами и более широкий набор мультимодальных рисков.

    Почему это важно

    Небольшой открытый классификатор можно развернуть локально и не отправлять чувствительный контент внешнему API. Политики в промпте упрощают адаптацию модерации, но одновременно требуют собственной калибровки порогов и тестирования на данных конкретного продукта.

    Primary and supporting sources

    • Mistral releases Shieldstral for multimodal moderationOpens in a new tab

    DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.

    More from this edition

    August 5, 2026
    1. 01Anthropic собирает команду для разработки собственных ИИ-ускорителей
    2. 02Sand.ai открыла 114-миллиардную MAGI-2 Preview для совместной генерации видео и звука
    3. 03Microsoft начала развёртывать 3-нм ускоритель Maia 200 для инференса ИИ
    4. 04Alibaba представила Qwen3.8-Max на 2,4 трлн параметров и пообещала открыть веса
    Back to AI Radar