AI Radar

DeepSeek открыла DeepGEMM для матричных вычислений на Hopper и Blackwell

DeepSeek открыла DeepGEMM — библиотеку для ускорения матричных операций на GPU NVIDIA Hopper и Blackwell. Она нацелена в том числе на вычислительные паттерны Mixture-of-Experts-моделей и поддерживает форматы FP8, FP4 и BF16.

4 октября 2026 г.1 мин чтенияИсточник: Vibe Coding
00

Что изменилось

GEMM — базовая операция умножения матриц, на которой держится значительная часть обучения и инференса трансформеров. DeepGEMM предлагает оптимизированные ядра для Hopper и Blackwell, включая низкоточные FP8 и FP4 и BF16. По заявлению DeepSeek, на части размеров матриц библиотека достигает производительности специализированных решений, вручную оптимизированных экспертами, либо превосходит их.

Для MoE-нагрузок важны не только сами матричные вычисления, но и обмен данными между GPU при маршрутизации токенов к экспертам. В DeepGEMM предусмотрено перекрытие коммуникаций и вычислений. Ядра также компилируются во время выполнения, поэтому отдельная сборка CUDA при установке не требуется. Это может упростить экспериментирование с низкоуровневой оптимизацией, но заявленную скорость стоит перепроверять на собственных формах матриц, числе GPU и реальных MoE-конфигурациях.

Почему это важно

Эффективность GEMM напрямую влияет на стоимость и задержку LLM-инференса и обучения. Поддержка FP4/FP8 и перекрытие обмена с вычислениями особенно актуальны для крупных MoE-моделей на нескольких GPU. Проект может стать полезной альтернативой для команд, готовых профилировать низкоуровневый стек под своё железо.

Первоисточники и подтверждения

Telegram

Подборку проверяет редакция DSML. AI помогает дедуплицировать сигналы и готовить текст, но опубликованный выпуск остаётся редакционным продуктом, а не лентой отдельных каналов.

4 октября 2026 г.
  1. 01OpenAI остановила обучение мощных моделей после выходов агентов из песочницы
  2. 02Ai2 открыла AstaBrief 8B — быструю модель для научных отчётов с цитатами
  3. 03Aleph Alpha открыла MoE-модель Kolibri с контекстом до миллиона токенов
  4. 04Cloudflare открыла Clef и Clef-flash — модели для классификации и маршрутизации