AI Radar

Hugging Face показала RL-подход, делающий кодовых агентов устойчивее к разным харнессам

Hugging Face предложила обучать кодовых агентов сразу в нескольких рабочих оболочках, а не оптимизировать модель под один конкретный CLI. В эксперименте такой multi-harness RL улучшил качество и одновременно сократил число вызовов инструментов.

4 октября 2026 г.2 мин чтенияИсточник: AI, Machine Learning, Big Data
00

Что изменилось

Проблема в том, что итоговая оценка агента сильно зависит не только от базовой модели, но и от «харнесса» — среды, которая формирует запросы, запускает инструменты и ведёт диалог. Для одной и той же модели разрыв может быть радикальным: 62% в одной агентной оболочке против 33% в другой. Подход Hugging Face не требует переписывать сами Claude Code, Codex или OpenCode: между агентом и моделью ставится прокси, понимающий API OpenAI Chat Completions и Responses, Anthropic Messages и Gemini. Он фиксирует token IDs и logprobs, с которыми vLLM действительно сэмплировал ответ, — эти данные затем используются для RL-обучения.

На LFM2.5-2.6B от Liquid AI обучение сразу в четырёх харнессах подняло точность с 42% до 54%. Дополнительная небольшая награда за более короткое решение уменьшила число обращений к инструментам на 31% — важный показатель для агентных систем, где задержка и стоимость часто определяются не одной генерацией, а длинной цепочкой действий. Обучение только в OpenCode дало особенно заметный локальный прирост — с 34% до 58%, однако multi-harness вариант, по приведённым результатам, улучшался во всех средах, а не в одной выбранной.

Авторы также сравнили RL с более привычной имитацией успешных решений: SFT на 3 189 траекториях, собранных Qwen3.8-27B, достигло 47,5%. Это ниже обоих RL-запусков в описанном сравнении. Практический смысл в том, что агенту недостаточно воспроизвести ответы сильной модели: ему приходится адаптироваться к последствиям собственных вызовов инструментов и к различиям интерфейсов среды. В открытый доступ выложены прокси и интеграция с OpenEnv, async GRPO-тренер в TRL, задачи, SFT-данные, код и семь обученных моделей.

Почему это важно

Для команд, которые запускают одну модель через несколько агентных интерфейсов, переносимость поведения важнее рекорда в единственном бенчмарке. Multi-harness RL может уменьшить зависимость качества от конкретного CLI и сократить стоимость выполнения задач за счёт меньшего числа tool calls. Открытые компоненты позволяют воспроизвести схему на собственных средах и моделях.

Первоисточники и подтверждения

Telegram

Подборку проверяет редакция DSML. AI помогает дедуплицировать сигналы и готовить текст, но опубликованный выпуск остаётся редакционным продуктом, а не лентой отдельных каналов.

4 октября 2026 г.
  1. 01OpenAI остановила обучение мощных моделей после выходов агентов из песочницы
  2. 02Ai2 открыла AstaBrief 8B — быструю модель для научных отчётов с цитатами
  3. 03Aleph Alpha открыла MoE-модель Kolibri с контекстом до миллиона токенов
  4. 04DeepSeek открыла DeepGEMM для матричных вычислений на Hopper и Blackwell