AI Radar
DeepSeek открыла DeepGEMM для матричных вычислений на Hopper и Blackwell
DeepSeek открыла DeepGEMM — библиотеку для ускорения матричных операций на GPU NVIDIA Hopper и Blackwell. Она нацелена в том числе на вычислительные паттерны Mixture-of-Experts-моделей и поддерживает форматы FP8, FP4 и BF16.
Что изменилось
GEMM — базовая операция умножения матриц, на которой держится значительная часть обучения и инференса трансформеров. DeepGEMM предлагает оптимизированные ядра для Hopper и Blackwell, включая низкоточные FP8 и FP4 и BF16. По заявлению DeepSeek, на части размеров матриц библиотека достигает производительности специализированных решений, вручную оптимизированных экспертами, либо превосходит их.
Для MoE-нагрузок важны не только сами матричные вычисления, но и обмен данными между GPU при маршрутизации токенов к экспертам. В DeepGEMM предусмотрено перекрытие коммуникаций и вычислений. Ядра также компилируются во время выполнения, поэтому отдельная сборка CUDA при установке не требуется. Это может упростить экспериментирование с низкоуровневой оптимизацией, но заявленную скорость стоит перепроверять на собственных формах матриц, числе GPU и реальных MoE-конфигурациях.
Почему это важно
Эффективность GEMM напрямую влияет на стоимость и задержку LLM-инференса и обучения. Поддержка FP4/FP8 и перекрытие обмена с вычислениями особенно актуальны для крупных MoE-моделей на нескольких GPU. Проект может стать полезной альтернативой для команд, готовых профилировать низкоуровневый стек под своё железо.
Первоисточники и подтверждения
TelegramПодборку проверяет редакция DSML. AI помогает дедуплицировать сигналы и готовить текст, но опубликованный выпуск остаётся редакционным продуктом, а не лентой отдельных каналов.