AI Radar
Huawei опубликовала веса, базовый код инференса и технический отчёт openPangu 2.0 Pro — MoE-модели с 505 млрд общих и 18 млрд активных параметров. Модель поддерживает контекст до 512 тысяч токенов и целиком ориентирована на обучение и запуск в инфраструктуре Ascend.
openPangu 2.0 Pro стала старшей открытой моделью семейства, в которое также входит выпущенная в июне openPangu 2.0 Flash с 9,2 млрд общих и 600 млн активных параметров. Для Pro заявлены 505 млрд общих параметров, из которых на один проход активируются 18 млрд, а объём предобучающей выборки составляет около 34 трлн токенов. Веса размещены на Hugging Face и AtomGit вместе с базовой реализацией инференса и техническим отчётом.
Архитектура рассчитана прежде всего на длинные агентные траектории. В ней локальное sliding-window attention сочетается с разреженным глобальным вниманием DSA в соотношении слоёв 2:1: первое обрабатывает ближайший контекст, второе извлекает информацию на большой дистанции. Такая схема должна снижать вычислительные расходы и потребление памяти на длинных последовательностях. Обычные остаточные связи заменены четырёхпоточной mHC-конструкцией, а трёхголовый модуль multi-token prediction дополнительно предсказывает сразу три токена для ускорения генерации.
Предобучение разделили на три этапа: примерно 25 трлн токенов общих данных, 8 трлн для развития рассуждений и программирования и ещё 1,4 трлн на завершающее «отжигающее» обучение с длинными документами и сложными агентными траекториями. После общего supervised fine-tuning отдельные RL-эксперты специализировались на рассуждении, вопросах и ответах, агентном взаимодействии и генерации кода. Затем их навыки объединили с помощью онлайн-дистилляции политик, чтобы уменьшить взаимное влияние разнородных задач во время обучения с подкреплением.
Модель обучали на NPU Ascend с глубокой совместной оптимизацией программной и аппаратной частей. Huawei использовала CloudMatrix 384, топологически осведомлённое планирование, собственные ядра на Ascend C, гибридное пересчитывание активаций и перекрытие вычислений с коммуникациями для оптимизатора Muon. Для инференса компания также подготовила Ascend-нативный стек с управлением KV-кешем, контекстным параллелизмом и специализированным квантованием. На контексте 128K для Pro заявлены минимальный TPOT 9,55 мс и генерация 1326 токенов в секунду на одну NPU при TPOT 20 мс, однако это показатели собственного аппаратно-программного контура.
Оценивать конкурентоспособность релиза пока следует осторожно. В техническом отчёте нет прямых результатов сопоставления openPangu 2.0 с моделями сторонних разработчиков. Huawei сообщает о сильных общих, логических и агентных способностях, но одновременно признаёт заметное отставание от лучших систем на сложных задачах реальной разработки ПО. Поэтому масштаб в 505 млрд параметров сам по себе не подтверждает лидерство, тем более что благодаря MoE при генерации используется лишь небольшая часть весов.
openPangu 2.0 Pro даёт разработчикам крупную открытую MoE-модель, специально спроектированную для длинного контекста и агентных сценариев, а также редкий пример полного цикла обучения на ускорителях, альтернативных Nvidia. Практическое развёртывание сильнее всего заинтересует пользователей Ascend, поскольку заявленная производительность опирается на собственные ядра и тесную интеграцию с этим оборудованием. Перед выбором модели для кодинга и агентов потребуются независимые тесты качества, совместимости и реальной стоимости инференса.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.