AI Radar
TRACE ускоряет генерацию ответов при RL-обучении MoE-моделей с помощью FP4
Исследователи представили TRACE — метод FP4-квантизации для обучения MoE-моделей с подкреплением. Он согласует вычисления при генерации ответов и обновлении модели; в экспериментах генерация ускорилась до 5,4 раза при качестве RL, сопоставимом с BF16.
Что изменилось
После основного обучения языковые модели нередко дообучают с подкреплением: модель генерирует ответы, получает оценку и на её основе обновляет параметры. Генерация этих ответов, или rollout, требует много памяти и вычислений. TRACE предлагает выполнять её в формате FP4 — с четырёхбитным представлением чисел, — но не рассматривать ускорение отдельно от качества последующего обучения.
Проблема в том, что генерация ответов и обновление модели могут идти по двум по-разному квантованным вычислительным путям. Авторы TRACE используют результаты квантования на стороне rollout, чтобы направлять решения об округлении при обучении и уменьшать расхождение между путями. Метод рассчитан на MoE-модели, где при обработке запроса задействуется часть специализированных компонентов — «экспертов».
Чтобы такая подсказка не съела выигрыш в ресурсах, TRACE выборочно сохраняет сведения о мантиссе и масштабе из более глубоких слоёв. На четырёх крупных MoE-моделях в задачах рассуждения, программирования и длительного RL-обучения авторы получили ускорение генерации до 5,4 раза. При совместном использовании FP4 для весов, активаций и KV-кеша качество RL было сопоставимо с генерацией в BF16; это результаты описанных экспериментов, а не гарантия такого ускорения для любой модели и нагрузки.
Почему это важно
Если результат воспроизведётся на нужной модели и нагрузке, FP4 может заметно сократить затраты на генерацию ответов при дообучении с подкреплением. При этом проверять нужно не только скорость, но и качество модели после обучения.
Мнение редакции
TRACE — исследовательская работа на стыке двух направлений: обучения моделей с подкреплением и снижения стоимости вычислений. Разработчики уже применяют низкую точность, чтобы ускорять большие модели, но при обучении важно согласовать то, как модель выдаёт ответы, с тем, как затем обновляются её параметры. Здесь эту связь сделали центральной задачей метода; результаты пока относятся к изученным MoE-моделям.
Первоисточники и подтверждения
Подборку проверяет редакция DSML. AI помогает дедуплицировать сигналы и готовить текст, но опубликованный выпуск остаётся редакционным продуктом, а не лентой отдельных каналов.