DSML Kazakhstan LogoDSMLKZ
HomeAboutPeopleNewsAI RadarJobsResearchEventsArticles
DSML Kazakhstan Logo© 2026 DSML Kazakhstan.
AboutCollaborateCommunity GuidelinesPrivacyTelegramAI Radar RSSYouTubeLinkedInInstagram
    AI RadarJuly 30, 2026

    AI Radar

    FAR.AI автоматизировала сотни джейлбрейков Grok и Gemini

    Инструмент FAR.AI нашел 448 вариантов обхода защитных ограничений Grok и 249 — Gemini, автоматически перебирая более тысячи модификаций вредоносных запросов. Расчетная стоимость успешной атаки составила всего $58 для Grok и $278 для Gemini.

    July 30, 2026·3 min read·Источник: Wired
    05

    Что изменилось

    Некоммерческая лаборатория FAR.AI проверила модели четырех американских разработчиков: Claude Opus 4.8 и Fable 5 от Anthropic, GPT-5.5 и GPT-5.6 от OpenAI, Gemini 3.1 Pro от Google и Grok 4.3 и 4.5 от объединенной SpaceXAI. Система брала набор потенциально опасных заданий и создавала свыше тысячи переформулировок, пытаясь заставить модели выдать запрещенную информацию — например, инструкции по эксплуатации программных уязвимостей или разработке химического и биологического оружия.

    Механизм атаки не предполагал, что модель подчинится с первой попытки. Большинство формулировок она могла отклонить, но автоматизация позволяла дешево и последовательно перебирать десятки вариантов до обнаружения работающего. В демонстрации одна из моделей, в частности, составила подробный план кибератаки на вымышленную гидроэлектростанцию. Такой подход превращает джейлбрейк из ручного поиска удачной фразы в масштабируемое тестирование пространства промптов.

    На этом наборе испытаний наиболее уязвимым оказался Grok: исследователи зафиксировали 448 успешных джейлбрейков. У Gemini их было 249, тогда как протестированные Claude, Fable и GPT не поддались этим атакам. Цена автоматического поиска также оказалась невысокой: около $58 для обхода ограничений Grok и $278 для Gemini — небольшие суммы по сравнению с потенциальным ущербом от массового извлечения опасных инструкций.

    Нулевой результат для моделей Anthropic и OpenAI нельзя читать как доказательство полной неуязвимости. FAR.AI проверяла определенный класс автоматически сгенерированных запросов, а более сложные атаки могут включать длинный диалог, адаптацию к ответам модели или другие техники. Представитель Google DeepMind Рохин Шах также предупредил, что найденные джейлбрейки различаются по тяжести, поэтому тест не является исчерпывающей оценкой безопасности Gemini. Google сообщила о многоуровневой защите и регулярном red teaming; Anthropic и OpenAI тоже заявили, что продолжают обновлять защитные механизмы.

    Результат одновременно показывает слабость конкретных моделей и практичность воспроизводимого внешнего аудита. Руководитель FAR.AI Адам Глив считает добровольного саморегулирования недостаточным, хотя сами испытания демонстрируют, что защиту можно измерять систематически. В США уже появились отдельные требования на уровне штатов: Калифорния и Нью-Йорк обязали разработчиков передовых моделей публиковать отчеты о безопасности, а в Иллинойсе должен заработать аудит практик третьими сторонами; единых специальных федеральных норм пока нет.

    Почему это важно

    Организациям недостаточно однажды проверить, что модель отказывает на очевидно вредоносный запрос: автоматический перебор формулировок способен найти дешевые обходы. Командам, внедряющим Grok или Gemini, нужны собственные фильтры, лимиты, мониторинг и оценка тяжести каждого успешного джейлбрейка. Метод FAR.AI также дает аудиторам воспроизводимый способ сравнивать защиту моделей, не полагаясь только на заявления разработчиков.

    Primary and supporting sources

    • It's Frighteningly Easy to Jailbreak Some Frontier AI ModelsOpens in a new tab

    DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.

    More from this edition

    July 30, 2026
    1. 01GPT‑5.6 Sol сократила стоимость инференса на 20%, а новый harness утроил результат на ARC‑AGI‑3
    2. 02Gemini Robotics 2 научилась управлять всем телом робота и координировать несколько машин
    3. 03Dream‑Cubed генерирует редактируемые Minecraft-миры с точностью до отдельного блока
    4. 04Grok Voice Think Fast 2.0 отвечает голосом за 0,7 секунды и запускает инструменты во время речи
    Back to AI Radar