DSML Kazakhstan LogoDSMLKZ
HomeAboutPeopleNewsAI RadarJobsResearchEventsArticles
DSML Kazakhstan Logo© 2026 DSML Kazakhstan.
AboutCollaborateCommunity GuidelinesTelegramAI Radar RSSYouTubeLinkedInInstagram
    AI RadarAugust 28, 2026

    AI Radar

    EvoHarness-RL учит агентов самостоятельно управлять памятью и ходом задачи

    Исследователи Meta AI и Университета Иллинойса в Урбане-Шампейне предложили EvoHarness-RL — способ обучать агента самостоятельно вести внешнее рабочее состояние, а не полагаться на вручную написанные правила. Модель учится решать, когда читать, обновлять, сжимать или заменять память во время длинной задачи.

    August 28, 2026·3 min read·Источник: VentureBeat
    00

    Что изменилось

    Для многочасового процесса одного контекстного окна недостаточно. Агенту приходится учитывать ответы API и журналы выполнения, помнить завершённые и ожидающие подзадачи, восстанавливаться после ошибок и не повторять уже обработанные элементы. Эту поддержку обеспечивает harness — исполнительная обвязка вокруг модели, включающая инструменты, состояние и логику управления. В типичной системе разработчики заранее прописывают, когда искать информацию, что сохранять и в какой последовательности вызывать инструменты.

    Ручная настройка делает поведение предсказуемее, но плохо переносится между моделями. Для новой модели могут потребоваться другие промпты, структура памяти, разрешения или конфигурация песочницы, после чего команде снова приходится проходить цикл настройки и отладки. Жёсткий сценарий также не учит агента оценивать пользу и стоимость очередного обращения к памяти или инструменту: он лишь заставляет выполнять установленное человеком правило.

    Предыдущие саморазвивающиеся обвязки, включая Harness-1, уже умели собирать траектории прошлых запусков и превращать их в процедурную память — переиспользуемые навыки, рабочие процессы или библиотеки кода. Но долговременное накопление опыта обычно оставалось отделено от отслеживания текущего эпизода. В результате система могла знать общий способ решения задачи, но хуже понимать, какой шаг уже выполнен, какое предположение устарело и после какой ошибки нужно перестроить текущий план.

    Простая append-only память проблему не решает: чем дольше работает агент, тем больше в ней неактуальных выводов, неудачных попыток и конфликтующих сведений. Дополнительный контекст в таком случае способен ухудшить рассуждение и подтолкнуть модель к повторению старой ошибки. Для длинного горизонта память должна быть редактируемой: существенные факты нужно сохранять, промежуточные наблюдения — сжимать, а опровергнутые выводы — обновлять или заменять.

    EvoHarness-RL объединяет поддержку агента в интерфейсе BPE — Belief, Progress and Experience. Эти области соответствуют представлению о текущей среде, состоянию продвижения по активной задаче и накопленному опыту. Обучение с подкреплением направлено не только на выбор прикладного действия, но и на управление этой внешней рабочей областью: модель учится извлекать из неструктурированных данных выполнения полезное состояние и обращаться к нему тогда, когда это помогает результату, вместо слепого следования заранее зашитой политике.

    Почему это важно

    Для корпоративных агентов качество обвязки часто не менее важно, чем возможности базовой модели: именно она удерживает состояние длинного процесса и помогает восстановиться после сбоя. Обучаемое управление памятью может сократить объём ручной логики, которую приходится переписывать при смене модели. Особенно полезна способность удалять устаревшее, поскольку бесконечное накопление контекста не только повышает стоимость, но и ухудшает решения.

    Primary and supporting sources

    • Meta researchers taught an 8B AI model to match Claude Opus 4.5 — without the frontier price tagOpens in a new tab

    DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.

    More from this edition

    August 28, 2026
    1. 01Tencent открыла Hy4-preview на 770 млрд параметров и с контекстом в миллион токенов
    2. 02Anthropic предложила стандарт MHS для управления лабораторным и промышленным оборудованием
    3. 03Скрытые рассуждения GPT, Claude и Gemini удалось прочитать через совместимые модели
    4. 04OpenAI раскрыла первые результаты чипа Jalapeño для инференса моделей
    Back to AI Radar