AI Radar
Hugging Face показала RL-подход, делающий кодовых агентов устойчивее к разным харнессам
Hugging Face предложила обучать кодовых агентов сразу в нескольких рабочих оболочках, а не оптимизировать модель под один конкретный CLI. В эксперименте такой multi-harness RL улучшил качество и одновременно сократил число вызовов инструментов.
Что изменилось
Проблема в том, что итоговая оценка агента сильно зависит не только от базовой модели, но и от «харнесса» — среды, которая формирует запросы, запускает инструменты и ведёт диалог. Для одной и той же модели разрыв может быть радикальным: 62% в одной агентной оболочке против 33% в другой. Подход Hugging Face не требует переписывать сами Claude Code, Codex или OpenCode: между агентом и моделью ставится прокси, понимающий API OpenAI Chat Completions и Responses, Anthropic Messages и Gemini. Он фиксирует token IDs и logprobs, с которыми vLLM действительно сэмплировал ответ, — эти данные затем используются для RL-обучения.
На LFM2.5-2.6B от Liquid AI обучение сразу в четырёх харнессах подняло точность с 42% до 54%. Дополнительная небольшая награда за более короткое решение уменьшила число обращений к инструментам на 31% — важный показатель для агентных систем, где задержка и стоимость часто определяются не одной генерацией, а длинной цепочкой действий. Обучение только в OpenCode дало особенно заметный локальный прирост — с 34% до 58%, однако multi-harness вариант, по приведённым результатам, улучшался во всех средах, а не в одной выбранной.
Авторы также сравнили RL с более привычной имитацией успешных решений: SFT на 3 189 траекториях, собранных Qwen3.8-27B, достигло 47,5%. Это ниже обоих RL-запусков в описанном сравнении. Практический смысл в том, что агенту недостаточно воспроизвести ответы сильной модели: ему приходится адаптироваться к последствиям собственных вызовов инструментов и к различиям интерфейсов среды. В открытый доступ выложены прокси и интеграция с OpenEnv, async GRPO-тренер в TRL, задачи, SFT-данные, код и семь обученных моделей.
Почему это важно
Для команд, которые запускают одну модель через несколько агентных интерфейсов, переносимость поведения важнее рекорда в единственном бенчмарке. Multi-harness RL может уменьшить зависимость качества от конкретного CLI и сократить стоимость выполнения задач за счёт меньшего числа tool calls. Открытые компоненты позволяют воспроизвести схему на собственных средах и моделях.
Первоисточники и подтверждения
TelegramПодборку проверяет редакция DSML. AI помогает дедуплицировать сигналы и готовить текст, но опубликованный выпуск остаётся редакционным продуктом, а не лентой отдельных каналов.