AI Radar
Исследователи Meta AI и Университета Иллинойса в Урбане-Шампейне предложили EvoHarness-RL — способ обучать агента самостоятельно вести внешнее рабочее состояние, а не полагаться на вручную написанные правила. Модель учится решать, когда читать, обновлять, сжимать или заменять память во время длинной задачи.
Для многочасового процесса одного контекстного окна недостаточно. Агенту приходится учитывать ответы API и журналы выполнения, помнить завершённые и ожидающие подзадачи, восстанавливаться после ошибок и не повторять уже обработанные элементы. Эту поддержку обеспечивает harness — исполнительная обвязка вокруг модели, включающая инструменты, состояние и логику управления. В типичной системе разработчики заранее прописывают, когда искать информацию, что сохранять и в какой последовательности вызывать инструменты.
Ручная настройка делает поведение предсказуемее, но плохо переносится между моделями. Для новой модели могут потребоваться другие промпты, структура памяти, разрешения или конфигурация песочницы, после чего команде снова приходится проходить цикл настройки и отладки. Жёсткий сценарий также не учит агента оценивать пользу и стоимость очередного обращения к памяти или инструменту: он лишь заставляет выполнять установленное человеком правило.
Предыдущие саморазвивающиеся обвязки, включая Harness-1, уже умели собирать траектории прошлых запусков и превращать их в процедурную память — переиспользуемые навыки, рабочие процессы или библиотеки кода. Но долговременное накопление опыта обычно оставалось отделено от отслеживания текущего эпизода. В результате система могла знать общий способ решения задачи, но хуже понимать, какой шаг уже выполнен, какое предположение устарело и после какой ошибки нужно перестроить текущий план.
Простая append-only память проблему не решает: чем дольше работает агент, тем больше в ней неактуальных выводов, неудачных попыток и конфликтующих сведений. Дополнительный контекст в таком случае способен ухудшить рассуждение и подтолкнуть модель к повторению старой ошибки. Для длинного горизонта память должна быть редактируемой: существенные факты нужно сохранять, промежуточные наблюдения — сжимать, а опровергнутые выводы — обновлять или заменять.
EvoHarness-RL объединяет поддержку агента в интерфейсе BPE — Belief, Progress and Experience. Эти области соответствуют представлению о текущей среде, состоянию продвижения по активной задаче и накопленному опыту. Обучение с подкреплением направлено не только на выбор прикладного действия, но и на управление этой внешней рабочей областью: модель учится извлекать из неструктурированных данных выполнения полезное состояние и обращаться к нему тогда, когда это помогает результату, вместо слепого следования заранее зашитой политике.
Для корпоративных агентов качество обвязки часто не менее важно, чем возможности базовой модели: именно она удерживает состояние длинного процесса и помогает восстановиться после сбоя. Обучаемое управление памятью может сократить объём ручной логики, которую приходится переписывать при смене модели. Особенно полезна способность удалять устаревшее, поскольку бесконечное накопление контекста не только повышает стоимость, но и ухудшает решения.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.