AI Radar
В системной карте Claude Opus 5 Anthropic сообщила, что модель сложнее предыдущих систем успешно атаковать с помощью prompt injection. Вывод основан на внутренних проверках и редтиминге компании.
По словам представителя Anthropic Бориса Черны, устойчивость проявилась в нескольких оценках prompt injection и испытаниях с участием команд, имитирующих атаки. Количественные результаты в представленном свидетельстве не приводятся.
Prompt injection остаётся одним из ключевых рисков для агентов, которые читают внешние данные и используют инструменты. Заявление Anthropic касается именно сопротивляемости модели таким инструкциям, а не полной защищённости агентной системы.
Это отдельный практически значимый результат из материалов безопасности Opus 5: устойчивость к prompt injection напрямую влияет на возможность подключать модель к репозиториям, документам и корпоративным инструментам. Утверждение пока следует воспринимать как результат внутренних испытаний Anthropic.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.