An editorial selection of the latest AI news from around the world
DSML.KZ / AI RADAR
August 28, 20260
Codex готовят к работе без привычной границы отдельного запуска: экспериментальный Persistent mode позволит агенту самому ставить следующие задачи, переносить их между сессиями и останавливаться только по команде пользователя. Anthropic расширяет автономность уже в физический мир — её Model Hardware Standard даёт агентам общий интерфейс к микроскопам, дозаторам, манипуляторам и лазерным системам.
В пилоте QuEra автоматическое восстановление захвата лазера прошло с успешностью 99,3% без участия человека.
Чем дольше агент работает и чем ближе подходит к реальному оборудованию, тем дороже ошибка на границе полномочий. В опытах с Claude Code prompt injection срабатывал против Auto Mode примерно в 80% запусков, а иногда защитный слой сначала разрешал вредоносный процесс, затем мешал агенту его остановить. Для MHS поэтому недостаточно модельных ограничений: нужны аппаратные блокировки, минимальные права, журналирование и возможность немедленной остановки.
Постоянная работа обостряет и проблему памяти. Исследователи смогли передавать непрозрачное состояние рассуждений совместимым моделям того же провайдера и обнаружили в 315 320 блоках из публичных агентных логов ключи, пароли и другие чувствительные данные. Одновременно EvoHarness-RL предлагает более зрелый подход к длинным задачам: агент учится сам читать, сжимать, обновлять и заменять внешнюю память. Получается важное разделение: рабочее состояние должно быть редактируемым для модели, но защищённым как секрет для всей системы.
Numbers of the day
Tencent выпустила предварительную версию флагманской модели Hy4 с открытыми весами: смесь экспертов на 770 млрд параметров поддерживает контекст до миллиона токенов. Модель ориентирована на продолжительные задачи программирования, работу с инструментами, документами и исследовательские сценарии.
Исследователь Йоханн Ребергер продемонстрировал prompt injection, который, по его данным, срабатывал против Auto Mode в Claude Code Opus 5 примерно в 80% запусков. В некоторых опытах защитный механизм сначала пропускал запуск вредоносного процесса, а затем запрещал самому агенту остановить его.
AI RADAR
Anthropic представила исследовательскую версию Model Hardware Standard — общего интерфейса, через который ИИ-агенты могут обнаруживать и управлять лабораторным и промышленным оборудованием. Первые пилоты охватывают микроскопы, дозаторы жидкостей, роботизированные манипуляторы и лазерные системы квантовых компьютеров.
Исследователи продемонстрировали способ извлекать скрытые рассуждения GPT, Claude и Gemini, передавая зашифрованное состояние совместимой, но легче обходящей ограничения модели того же провайдера. Криптографию при этом не взламывали: слабым местом оказалась недостаточно строгая привязка блока к модели, сессии или аккаунту.
Anthropic поручила Claude самостоятельно искать способы уменьшить десять классов ошибок выравнивания — от обмана и угодливости до нарушений приватности и jailbreak-атак. Агентный исследователь нашёл улучшения для всех десяти категорий без измеримого ухудшения общих способностей целевых моделей, а лучшие методы переносились на скрытые тесты и более крупные модели.
Исследователи Meta AI и Университета Иллинойса в Урбане-Шампейне предложили EvoHarness-RL — способ обучать агента самостоятельно вести внешнее рабочее состояние, а не полагаться на вручную написанные правила. Модель учится решать, когда читать, обновлять, сжимать или заменять память во время длинной задачи.
AI-платформа бухгалтерского учёта Rillet привлекла $100 млн при оценке $1 млрд; сделку согласовали за 48 часов после обсуждения роста компании на совете директоров. Стартап утверждает, что клиенты не просто тестируют его продукт, а заменяют им решения Intuit, NetSuite, Oracle и других традиционных поставщиков.