AI Radar
Alibaba впервые открыла веса флагманской модели Max-класса: Qwen3.8-2.4T-A95B насчитывает 2,4 трлн параметров и получила поддержку девяти семейств ускорителей в день выпуска. Веса доступны большинству разработчиков, но крупным поставщикам MaaS и AI-ассистентов с выручкой свыше $50 млн потребуется отдельная коммерческая лицензия.
Qwen3.8-2.4T-A95B построена как разреженная Mixture-of-Experts-модель: из 2,4 трлн параметров при обработке каждого токена активируются 95 млрд. Она поддерживает контекст 262 144 токена с расширением примерно до 1,01 млн и распространяется с весами BF16 и FP8. Для развертывания заявлена совместимость с vLLM, SGLang и TokenSpeed, но требуется свежая конфигурация Qwen3.8 и подходящая стратегия параллелизма под точность весов, тип и число ускорителей. Открытая версия является чисто текстовой и всегда работает в режиме рассуждения; закрыть thinking нельзя. Коммерческий Qwen3.8-Max дополнительно предлагает зрение, режим без рассуждения, миллионный контекст по умолчанию и встроенные инструменты.
Одновременно со стартом сообщество FlagOS проверило модель на ускорителях T-Head, Nvidia, Moore Threads, Huawei Ascend, MetaX, Kunlunxin, Hygon, TsingMicro и Enflame. Для разных платформ подготовлены варианты BF16, FP8 и INT8, проведены развертывание и выравнивание точности. Масштаб стал главным инженерным препятствием: новая модель примерно в шесть раз крупнее Qwen3.5-397B. FlagOS добавила унифицированную W8A8-квантизацию весов и активаций из BF16/FP8 в INT8, чтобы задействовать оборудование, не умеющее FP8; по данным проекта, отклонения качества от исходной CUDA/FP8-реализации остались в допустимом диапазоне.
Day-0 здесь означает не просто заявление о совместимости, а подготовку проверенных сборок менее чем за 24 часа после релиза. За полгода FlagOS провела такую адаптацию более чем для десяти моделей, а общий охват проекта достиг 12 открытых моделей от семи команд и до десяти типов чипов. Готовые образы уже появляются в каталогах Tencent Cloud HAI и китайской сети суперкомпьютеров. При этом INT8 и системные оптимизации не делают старые ускорители равными новому поколению: их задача — снизить требования к памяти и обмену данными и дать существующим кластерам экономически оправданный вариант запуска при проверяемых качестве и скорости.
Сами веса можно скачивать, изменять и распространять, однако лицензия не полностью разрешительная. Если пользователь или связанные с ним компании предоставляют «модель как услугу» либо AI-ассистента для работы и получили более $50 млн совокупной выручки за любые последовательные 12 месяцев, для коммерческого применения Qwen3.8-Max или производных нужна отдельная лицензия Qwen. Внутреннее использование освобождено от этого требования, пока ПО, результаты или возможности модели не предоставляются третьим лицам. Такой порог продолжает тенденцию к условно открытым весам: у выпущенной ранее Kimi K3 отдельная договоренность требовалась MaaS-компаниям уже при годовой выручке свыше $20 млн.
Альтернатива самостоятельному размещению — платный API. В Китае он стоит 12 юаней за миллион входных и 36 юаней за миллион выходных токенов, а международные тарифы составляют соответственно $2 и $6; попадание в скрытый кэш обходится в 1,5 юаня или $0,25. Самостоятельный хостинг снимает потарифную оплату Alibaba, но не стоимость оборудования: исходные веса занимают около 4,9 ТБ. Экспериментальная динамическая однобитная квантизация Unsloth сократила объем до 397 ГБ, или на 91%, однако даже этому варианту нужно свыше 410 ГБ совокупной оперативной и видеопамяти.
В опубликованных тестах Qwen3.8-Max набрала 93,0 на PaperBench, 86,1 на OSWorld-Verified и 91,5 на параметрическом CAD-бенчмарке. Результаты неоднородны: на TerminalBench 2.1 модель получила 86,6 против 88,8 у GPT-5.6 Sol, а на SWE-bench Pro — 67,7, уступив Fable 5 с 80,0 и Claude Opus 4.8 с 69,2. Alibaba делает особый акцент на длительной автономной работе: в одном испытании агент около 16 дней развивал собственный программный harness, создав 265 коммитов, 127 pull request и 151 issue. Эти демонстрации указывают на целевой сценарий, но не заменяют оценку надежности на конкретном коде, инструментах и инфраструктуре пользователя.
Разработчики получают флагманскую модель с возможностью локальной настройки и размещения не только на Nvidia, а владельцы существующих кластеров — шанс дольше использовать уже купленное оборудование. Но «открытые веса» не означают бесплатную эксплуатацию: модель остается чрезвычайно ресурсоемкой, а крупным коммерческим сервисам необходимо отдельно согласовывать лицензию.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.