AI Radar
Исследователь Йоханн Ребергер продемонстрировал prompt injection, который, по его данным, срабатывал против Auto Mode в Claude Code Opus 5 примерно в 80% запусков. В некоторых опытах защитный механизм сначала пропускал запуск вредоносного процесса, а затем запрещал самому агенту остановить его.
Атака заставляла Claude Code скачать и распаковать ZIP-архив, а затем выполнить Python-код с импортом base64. Подмена была спрятана в локальном файле struct.py из архива: из-за порядка разрешения импортов обращение к обычному модулю приводило к загрузке и выполнению подложенного файла. Это показательный класс атак на coding-агентов — опасная инструкция может находиться не в явном сообщении пользователя, а в репозитории, архиве, документации или другом обрабатываемом содержимом.
Особенно неприятным оказался конфликт между моделью и слоем контроля. В части запусков Claude распознавал компрометацию и пытался завершить вредоносный процесс, однако Auto Mode отклонял команду очистки. Получалось, что классификатор разрешил действие, создавшее угрозу, но заблокировал последующее защитное действие. Заявленная частота успеха — результат исследователя для конкретной техники, а не универсальная оценка всех атак или конфигураций Claude Code.
Практическая защита поэтому не должна зависеть только от решения модели или классификатора команд. Для автономного запуска coding-агента в потенциально враждебной среде нужны контейнер, виртуальная машина либо системная песочница, ограничение исходящего сетевого доступа и наблюдение за процессами. Домашний каталог, SSH-ключи и облачные учётные данные не следует подключать к такому окружению без необходимости: Auto Mode может снизить риск, но этот пример не позволяет считать его границей безопасности.
Командам, запускающим coding-агентов без присмотра, нельзя приравнивать запрос подтверждения или классификатор команд к полноценной изоляции. Ошибка может возникнуть и при разрешении опасного действия, и при блокировке последующей очистки. На практике права агента и доступные ему секреты нужно ограничивать на уровне операционной среды.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.