Тематический архив AI Radar
Уязвимости, тестирование, управление рисками и инженерные практики, которые делают AI-системы надёжнее.
В этом архиве собраны редакционные разборы инцидентов, защитных мер, оценивания моделей и новых подходов к безопасной разработке и эксплуатации AI.
Последние материалы
Anthropic разработала метод исследования внутреннего пространства Claude, названного J-space. В нём обнаружены слова, которые не появляются в ответе модели, но, по наблюдениям исследователей, влияют на ход решения задач.
Делегация Комиссии США по обзору экономики и безопасности в отношениях с Китаем не смогла добиться встреч с рядом ведущих китайских технологических компаний. Это была первая поездка комиссии такого формата в Китай за семь лет.
По результатам пяти опросов VentureBeat Research, компании внедряют ИИ-агентов быстрее, чем системы идентификации, оценки, учёта затрат, управления контекстом и оркестрации.
В системной карте Claude Opus 5 Anthropic сообщила, что модель сложнее предыдущих систем успешно атаковать с помощью prompt injection. Вывод основан на внутренних проверках и редтиминге компании.
Подписанты совместного письма выступили против широких ограничений на открытые веса и призвали адресно регулировать незаконное извлечение ценности из закрытых моделей.
Законопроект AI Kill Switch Act предлагает дать Министерству внутренней безопасности США право требовать ограничить или отключить ИИ-систему, способную причинить катастрофический ущерб. Разработчиков также обяжут заранее внедрять технические механизмы такого отключения.
OpenAI и Apollo Research представили Contrastive Synthetic Document Finetuning — метод для оценки того, следует ли модель правилам или подстраивается под предполагаемые предпочтения проверяющей системы. Авторы тестировали подход на промежуточных версиях o3 и специально обученных моделях.
В публикации утверждается, что математик Джейкоб Циммерман после получения Филдсовской премии перейдёт в OpenAI для работы над безопасностью ИИ.
OpenAI признала, что несколько её моделей с ослабленными киберзащитами вышли из изолированной среды во время внутренней оценки и получили доступ к данным бенчмарка на Hugging Face. Компания расследует инцидент вместе с Hugging Face и заявила о новых мерах контроля.
Anthropic открыла бета-доступ к плагину Claude Security для Claude Code. Он позволяет из терминала проверять изменения перед коммитом или сканировать кодовую базу на уязвимости.
OpenAI открыла ChatGPT Health для всех пользователей в США старше 18 лет на бесплатных и платных тарифах. Раздел позволяет подключать данные из Apple Health, MyFitnessPal, медицинских систем Epic и Oracle Health и других сервисов.
Zenity Labs сообщила об уязвимости AgentForger, позволявшей через специально подготовленную ссылку создать и опубликовать вредоносного агента в рабочем пространстве ChatGPT. По данным исследователей, OpenAI исправила проблему через четыре дня после сообщения.