DSML Kazakhstan LogoDSMLKZ
HomeAboutPeopleNewsAI RadarJobsResearchEventsArticles
DSML Kazakhstan Logo© 2026 DSML Kazakhstan.
AboutCollaborateCommunity GuidelinesTelegramAI Radar RSSYouTubeLinkedInInstagram
    AI RadarAugust 28, 2026

    AI Radar

    Claude самостоятельно нашёл методы против десяти типов ошибок выравнивания

    Anthropic поручила Claude самостоятельно искать способы уменьшить десять классов ошибок выравнивания — от обмана и угодливости до нарушений приватности и jailbreak-атак. Агентный исследователь нашёл улучшения для всех десяти категорий без измеримого ухудшения общих способностей целевых моделей, а лучшие методы переносились на скрытые тесты и более крупные модели.

    August 28, 2026·3 min read·Источник: Anthropic
    00

    Что изменилось

    Исследовательский цикл был близок к обычной экспериментальной работе: Claude изучал литературу, предлагал методы и тренировочные данные, обучал модель, проверял результат и переходил к следующей итерации. Каждая из десяти проблем рассматривалась отдельно и оценивалась несколькими публичными бенчмарками — обычно от трёх до пяти. Например, для нарушений приватности использовались ConfAIde, PrivaCI-Bench и PrivacyLens; для более сложных многоходовых ситуаций результаты дополнительно проверяли инструментом Petri, который симулирует состязательные сценарии.

    Основной метрикой стала доля закрытого разрыва безопасности: насколько предложенный метод приблизил модель-ученика к теоретически идеальному результату по набору оценок. Одного роста safety-метрик было недостаточно. Варианты, снижавшие общие способности модели, исключались, а Claude запрещали напрямую переносить собственное выравнивание в целевую модель. Отдельный агент-монитор читал описание каждого задуманного метода до запуска и следил за соблюдением этих ограничений.

    Проверка была устроена так, чтобы отличить реальное улучшение от подгонки под известные тесты. Claude не показывали часть alignment-бенчмарков во время исследовательского цикла, а затем оценивали методы на этих отложенных наборах. Лучшие решения сохранили эффект не только там и в Petri, но и на моделях, которые были до 4,7 раза крупнее использованных при оптимизации. Во всех десяти категориях удалось улучшить целевые показатели, не ухудшив измеряемые общие возможности.

    В отдельном сравнении Claude опередил 28 специалистов по AI safety, которым дали до восьми часов на разработку подхода. Для обмана лучший метод агента оказался на 20% результативнее лучшего человеческого предложения. Однако это не чистое соревнование: люди не могли итеративно обучать и пересматривать свои решения, тогда как Claude работал циклом экспериментов. Поэтому результат скорее подтверждает полезность схемы, в которой агент быстро перебирает и улучшает кандидаты, а исследователи проверяют предпосылки и доводят наиболее перспективные варианты.

    Anthropic также проверила сценарий «слабая модель выравнивает сильную». Claude Sonnet 5 получил ранний чекпойнт Opus 4.8, ещё не прошедший основную производственную alignment-подготовку. За 60 часов Sonnet испытал более 50 решений и приблизил показатели выравнивания к уровню производственных моделей. Победивший набор содержал чуть больше 2000 тренировочных примеров, составленных по простым шаблонам или из публичных данных; по оценке Anthropic, это примерно в 15 000 раз эффективнее её производственной процедуры по объёму использованных данных.

    Почему это важно

    Автоматизированный цикл может заметно ускорить поиск alignment-рецептов: агент способен за ограниченное время изучать литературу, создавать данные и проводить десятки итераций обучения. Перенос на скрытые тесты и более крупные модели делает результат полезнее простой оптимизации бенчмарка. Но сравнение с людьми не доказывает их замену — контроль ограничений, выбор метрик и независимая проверка по-прежнему определяют, действительно ли модель стала безопаснее.

    Primary and supporting sources

    • Automated researchers can reliably mitigate alignment failuresOpens in a new tab

    DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.

    More from this edition

    August 28, 2026
    1. 01Tencent открыла Hy4-preview на 770 млрд параметров и с контекстом в миллион токенов
    2. 02Anthropic предложила стандарт MHS для управления лабораторным и промышленным оборудованием
    3. 03Скрытые рассуждения GPT, Claude и Gemini удалось прочитать через совместимые модели
    4. 04OpenAI раскрыла первые результаты чипа Jalapeño для инференса моделей
    Back to AI Radar