AI Radar

TRACE ускоряет генерацию ответов при RL-обучении MoE-моделей с помощью FP4

Исследователи представили TRACE — метод FP4-квантизации для обучения MoE-моделей с подкреплением. Он согласует вычисления при генерации ответов и обновлении модели; в экспериментах генерация ускорилась до 5,4 раза при качестве RL, сопоставимом с BF16.

8 октября 2026 г.2 мин чтенияИсточник: Hugging Face Daily Papers
00

Что изменилось

После основного обучения языковые модели нередко дообучают с подкреплением: модель генерирует ответы, получает оценку и на её основе обновляет параметры. Генерация этих ответов, или rollout, требует много памяти и вычислений. TRACE предлагает выполнять её в формате FP4 — с четырёхбитным представлением чисел, — но не рассматривать ускорение отдельно от качества последующего обучения.

Проблема в том, что генерация ответов и обновление модели могут идти по двум по-разному квантованным вычислительным путям. Авторы TRACE используют результаты квантования на стороне rollout, чтобы направлять решения об округлении при обучении и уменьшать расхождение между путями. Метод рассчитан на MoE-модели, где при обработке запроса задействуется часть специализированных компонентов — «экспертов».

Чтобы такая подсказка не съела выигрыш в ресурсах, TRACE выборочно сохраняет сведения о мантиссе и масштабе из более глубоких слоёв. На четырёх крупных MoE-моделях в задачах рассуждения, программирования и длительного RL-обучения авторы получили ускорение генерации до 5,4 раза. При совместном использовании FP4 для весов, активаций и KV-кеша качество RL было сопоставимо с генерацией в BF16; это результаты описанных экспериментов, а не гарантия такого ускорения для любой модели и нагрузки.

Почему это важно

Если результат воспроизведётся на нужной модели и нагрузке, FP4 может заметно сократить затраты на генерацию ответов при дообучении с подкреплением. При этом проверять нужно не только скорость, но и качество модели после обучения.

Мнение редакции

TRACE — исследовательская работа на стыке двух направлений: обучения моделей с подкреплением и снижения стоимости вычислений. Разработчики уже применяют низкую точность, чтобы ускорять большие модели, но при обучении важно согласовать то, как модель выдаёт ответы, с тем, как затем обновляются её параметры. Здесь эту связь сделали центральной задачей метода; результаты пока относятся к изученным MoE-моделям.

Первоисточники и подтверждения

Подборку проверяет редакция DSML. AI помогает дедуплицировать сигналы и готовить текст, но опубликованный выпуск остаётся редакционным продуктом, а не лентой отдельных каналов.

8 октября 2026 г.
  1. 01Microsoft выпустила Agent Lightning 1.0 для обучения уже работающих AI-агентов
  2. 02Google и Кембридж открыли VeriHarness для проверки результатов AI-агентов
  3. 03Claude Haiku 5.5 стала дешевле и получила настройку глубины рассуждений
  4. 04В ChatGPT приходят GPT-6 и ответы с интерактивными интерфейсами