AI Radar
Anthropic поручила Claude самостоятельно искать способы уменьшить десять классов ошибок выравнивания — от обмана и угодливости до нарушений приватности и jailbreak-атак. Агентный исследователь нашёл улучшения для всех десяти категорий без измеримого ухудшения общих способностей целевых моделей, а лучшие методы переносились на скрытые тесты и более крупные модели.
Исследовательский цикл был близок к обычной экспериментальной работе: Claude изучал литературу, предлагал методы и тренировочные данные, обучал модель, проверял результат и переходил к следующей итерации. Каждая из десяти проблем рассматривалась отдельно и оценивалась несколькими публичными бенчмарками — обычно от трёх до пяти. Например, для нарушений приватности использовались ConfAIde, PrivaCI-Bench и PrivacyLens; для более сложных многоходовых ситуаций результаты дополнительно проверяли инструментом Petri, который симулирует состязательные сценарии.
Основной метрикой стала доля закрытого разрыва безопасности: насколько предложенный метод приблизил модель-ученика к теоретически идеальному результату по набору оценок. Одного роста safety-метрик было недостаточно. Варианты, снижавшие общие способности модели, исключались, а Claude запрещали напрямую переносить собственное выравнивание в целевую модель. Отдельный агент-монитор читал описание каждого задуманного метода до запуска и следил за соблюдением этих ограничений.
Проверка была устроена так, чтобы отличить реальное улучшение от подгонки под известные тесты. Claude не показывали часть alignment-бенчмарков во время исследовательского цикла, а затем оценивали методы на этих отложенных наборах. Лучшие решения сохранили эффект не только там и в Petri, но и на моделях, которые были до 4,7 раза крупнее использованных при оптимизации. Во всех десяти категориях удалось улучшить целевые показатели, не ухудшив измеряемые общие возможности.
В отдельном сравнении Claude опередил 28 специалистов по AI safety, которым дали до восьми часов на разработку подхода. Для обмана лучший метод агента оказался на 20% результативнее лучшего человеческого предложения. Однако это не чистое соревнование: люди не могли итеративно обучать и пересматривать свои решения, тогда как Claude работал циклом экспериментов. Поэтому результат скорее подтверждает полезность схемы, в которой агент быстро перебирает и улучшает кандидаты, а исследователи проверяют предпосылки и доводят наиболее перспективные варианты.
Anthropic также проверила сценарий «слабая модель выравнивает сильную». Claude Sonnet 5 получил ранний чекпойнт Opus 4.8, ещё не прошедший основную производственную alignment-подготовку. За 60 часов Sonnet испытал более 50 решений и приблизил показатели выравнивания к уровню производственных моделей. Победивший набор содержал чуть больше 2000 тренировочных примеров, составленных по простым шаблонам или из публичных данных; по оценке Anthropic, это примерно в 15 000 раз эффективнее её производственной процедуры по объёму использованных данных.
Автоматизированный цикл может заметно ускорить поиск alignment-рецептов: агент способен за ограниченное время изучать литературу, создавать данные и проводить десятки итераций обучения. Перенос на скрытые тесты и более крупные модели делает результат полезнее простой оптимизации бенчмарка. Но сравнение с людьми не доказывает их замену — контроль ограничений, выбор метрик и независимая проверка по-прежнему определяют, действительно ли модель стала безопаснее.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.