AI Radar
Mistral открыла веса Shieldstral — модели на 3 млрд параметров, которая проверяет текст, изображения и их сочетания на соответствие заданной политике. Классификатор распространяется по Apache 2.0 и помещается на одной NVIDIA GPU с 16 ГБ памяти.
Shieldstral предназначена для команд, которым недостаточно единого универсального фильтра безопасности. Вместо жестко зашитого перечня нарушений разработчик передает модели контекст проверки, сформулированный обычным языком вопрос с ответом «да» или «нет» и сам материал. Это может быть пользовательский запрос, ответ модели, вся пара «запрос — ответ» либо изображение с сопроводительным текстом.
На инференсе Shieldstral считывает логиты вариантов yes и no и преобразует их в непрерывную оценку безопасности. Приложение может самостоятельно выбрать порог блокировки, отправлять пограничные случаи человеку или ранжировать результаты по уверенности. Поскольку правила остаются частью промпта, один и тот же чекпойнт можно перенастраивать под аудиторию, продукт или предметную область без отдельного дообучения.
Единый интерфейс охватывает несколько типовых задач: классификацию входящих промптов, модерацию ответов, поиск токсичности и проверку корректности отказа модели. Mistral утверждает, что Shieldstral соответствует или превосходит открытые guard-модели вплоть до семикратно большего размера в текстовой безопасности, распознавании отказов, адаптации к политикам и мультимодальной модерации. Все образцы заявленных оценочных наборов, по данным компании, были исключены из обучения, но независимая проверка этих результатов еще потребуется.
Обучающие данные из реальных и синтетических источников имели разные таксономии, поэтому их привели к общей структуре «инструкция — запрос — документ». Контрастные примеры помогали различать близкие политики, а нехватку визуальных материалов по безопасности компенсировали обычными наборами изображений, использованными как отрицательные примеры. Пары изображений и запросов дополнительно фильтровались vision-language-реранкером.
Финальная модель объединяет несколько специализаций. Mistral использовала LoRA-дообучение, а затем SLERP для слияния чекпойнтов, отвечавших за калибровку на открытых данных, различение тонких политик и следование инструкциям базовой модели. Shieldstral построена на платформе Forge, веса опубликованы в репозитории Mistral на Hugging Face; среди следующих направлений названы расширение языкового покрытия, работа с длинными документами и более широкий набор мультимодальных рисков.
Небольшой открытый классификатор можно развернуть локально и не отправлять чувствительный контент внешнему API. Политики в промпте упрощают адаптацию модерации, но одновременно требуют собственной калибровки порогов и тестирования на данных конкретного продукта.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.