AI Radar
Команда Qwen открыла веса своей крупнейшей модели семейства Qwen 3.8. Архитектура насчитывает 2,4 трлн параметров, но благодаря разреженной схеме активирует около 95 млрд при обработке каждого токена.
Qwen3.8-2.4T-A95B использует 512 экспертов и поддерживает контекстное окно до одного миллиона токенов. Сочетание огромного общего числа параметров с 95 млрд активных позволяет распределить знания и специализации между экспертами, не задействуя всю модель для каждого вычисления. При этом открытые веса не делают развёртывание простым: для хранения, распределённого инференса и обслуживания такого масштаба всё равно потребуется серьёзная инфраструктура.
По собственным оценкам команды старшая Qwen3.8-Max набирает 86,6 балла в TerminalBench 2.1 и 93,0 в PaperBench, приближаясь по этим тестам к закрытым frontier-моделям. Эти показатели относятся к опубликованной оценке команды и не дают полной картины качества именно открытой конфигурации 2.4T-A95B, её скорости и требований к памяти, поэтому сравнивать варианты следует в одинаковом режиме запуска.
Открытие весов даёт исследовательским и инфраструктурным командам доступ к разреженной модели предельного масштаба и возможность адаптировать её без зависимости от закрытого API. Практическая ценность будет зависеть от доступности вычислений, качества реализаций распределённого инференса и того, насколько миллионный контекст сохраняет точность на реальных документах.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.