AI Radar
Alibaba выпустила Qwen3.8-Max в QwenCloud и планирует опубликовать её веса на Hugging Face и ModelScope на следующей неделе. MoE-модель насчитывает 2,4 трлн параметров, из которых при работе активны 95 млрд, и ориентирована на длительные агентные задачи, код, исследования и мультимодальные сценарии.
Qwen3.8-Max построена на архитектуре Qwen3.5 и названа самой мощной моделью семейства Qwen. Это первая модель класса Max, для которой Alibaba обещает открытые веса; одновременно компания собирается открыть Qwen3.8-27B. До публикации файлов доступ предоставляется через QwenCloud, поэтому возможность локального запуска, реальные требования к инфраструктуре и полноту комплекта для самостоятельного развёртывания можно будет оценить только после релиза.
Основной акцент сделан на автономной работе в течение дней, а не на одиночных ответах. Во внутреннем испытании Qwen3.8-Max около 16 дней развивала и сопровождала проект oh-my-cli, последовательно принимая задачи, реализуя изменения, тестируя и исправляя результат. За этот период агент создал 265 коммитов, 127 pull request и 151 issue. Масштаб показывает способность поддерживать длинный рабочий цикл, но это тест самой компании, а количество изменений само по себе не измеряет качество кода или долю вмешательства человека.
В исследовательском эксперименте модель воспроизвела вычислительный pipeline, провела 33 раунда обучения на GPU и разработала метод, который, по данным Qwen, превзошёл подход из исходной работы на 2,7 пункта в AIME24. В задаче аппаратного проектирования она за примерно 500 итераций сократила криптографический ускоритель с 8298 до 678 логических вентилей и после физической компоновки достигла замыкания временных ограничений на частоте 500 МГц. Эти примеры проверяют не только генерацию текста, но и использование инструментов с обратной связью от внешней среды.
Ещё один тест имитировал год работы в электронной коммерции и занял более 2000 раундов. Qwen3.8-Max завершила симуляцию с результатом ¥416 252, что соответствует доходности 4,16 раза и на 38% превышает показатель участника на втором месте. Такой сценарий интересен как проверка долгосрочного планирования, однако его нельзя напрямую приравнивать к ведению реального бизнеса: результат зависит от правил симулятора, доступных инструментов и заложенных рыночных условий.
Мультимодальная часть рассчитана на документы объёмом свыше 200 страниц и видео продолжительностью более 100 часов. Модель должна превращать их содержимое в структуры с отслеживаемыми связями и визуально проверять собственный результат для исправления ошибок. Дополнение Qwen-MM-Plugins расширяет агентный контур мультимодальной памятью и визуальным управлением инструментами для видеомонтажа, Blender и CAD, а RecreationBench оценивает восстановление закрытых приложений для настольных, мобильных и веб-платформ через сочетание кода и действий в интерфейсе.
Облачный API поддерживает совместимые с OpenAI Chat Completions и Responses интерфейсы, а также интерфейс в стиле Anthropic, что упрощает подключение существующих агентных фреймворков и помощников для программирования. Пользователь может выбирать высокий, средний или низкий объём рассуждений, причём режим размышления включён по умолчанию. После обещанной публикации весов разработчики впервые смогут перенести Qwen уровня Max в собственную инфраструктуру и отдельно проверить заявленные агентные результаты.
Открытые веса модели такого масштаба дадут крупным компаниям и исследовательским центрам больше контроля над развёртыванием, настройкой и данными, чем облачный API. Особенно интересна ориентация Qwen3.8-Max на процессы длиной в сотни и тысячи шагов. Однако эксплуатация 2,4-триллионной MoE-модели потребует серьёзной инфраструктуры, а впечатляющие внутренние испытания нуждаются в независимом воспроизведении.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.