AI Radar
Z.ai выпустила открытые веса GLM-5.3-Flash — нативно мультимодальной MoE-модели с контекстом до 1 млн токенов. Система имеет 320 млрд параметров, активирует 18 млрд на запрос и, по данным компании, обслуживала глобальную тестовую нагрузку на кластере из 100 тысяч китайских ускорителей.
До официального релиза модель неделю работала под псевдонимом Ox Alpha на OpenRouter и в агентной среде OpenCode. За время скрытого теста она обработала 62 трлн токенов, причем более 11 трлн пришлись на первые три дня — это стало крупнейшим запуском в истории OpenRouter. В недельной статистике кодинговых моделей Ox Alpha заняла первое место с 10,3 трлн токенов, или почти 31% соответствующего трафика платформы.
GLM-5.3-Flash принимает текст, изображения, видео и файлы, а миллионное контекстное окно рассчитано на крупные репозитории, длинные документы и мультимодальные агентные задачи. Чтобы не платить полную цену обычного attention на такой длине, Z.ai совместила линейное и разреженное внимание. Дополнительный механизм IndexPool сжимает четыре вектора кэша индексатора в один. По внутренним измерениям, относительно GLM-5.3 объем вычислений attention снизился в 3,01 раза, а KV-кэш — в 4,44 раза, хотя по последнему показателю модель пока уступает Kimi-K3 и DeepSeek-V4-Flash.
Модель построена как mixture of experts: из 320 млрд параметров для каждого запроса используются 18 млрд, а число слоев сократилось с 92 у сопоставимой предшествующей архитектуры до 45. На Artificial Analysis Intelligence Index система получила 57 баллов: десятое место в общем зачете и третье среди моделей с открытыми весами после Kimi K3 и Qwen3.8 2.4T A95B. Заявления Z.ai о паритете с Claude Opus 4.8 в отдельных задачах следует воспринимать осторожно: независимые оценки также фиксируют скорость генерации ниже средней по индустрии.
Отдельная часть запуска — демонстрация крупномасштабного инференса без Nvidia. Z.ai утверждает, что кластер из 100 тысяч неназванных китайских чипов полностью обслуживал скрытый тест. Для компенсации меньшей емкости памяти и пропускной способности отдельных ускорителей компания разделила стадии инференса на независимо управляемые вычислительные пулы; это якобы утроило сквозную производительность и приблизило стоимость токена к системам Nvidia. Эти цифры пока не проверены независимо. Cambricon и Moore Threads объявили о поддержке модели с первого дня, а ранее Zhipu также сотрудничала с Huawei.
Z.ai делает ставку на низкую стоимость: заявлены 0,8 юаня за миллион входных токенов, 2,8 юаня за миллион выходных и 0,23 юаня при попадании в кэш. Это около одной десятой стандартной цены GLM-5.3, а во время акции — одной двадцатой; сравнение с Opus 4.8 дает заявленную разницу примерно в 40 раз. Веса доступны глобально, модель подключена к API, ZCode и GLM Coding Plan.
Практические испытания показывают широкий, но не безупречный диапазон задач. Модель извлекла ключевые фрагменты из 48-минутного выступления, смонтировала 17 эпизодов с субтитрами, суммировала 58-страничную диссертацию за пять с половиной минут и создавала игровые прототипы по видео. В то же время пользователи сообщали о галлюцинациях, пропущенных шагах и медленной генерации; в одном общественном тесте модель решила лишь 28% из 175 задач LiveCodeBench.
GLM-5.3-Flash подходит для экспериментов с длинными документами, большими кодовыми базами и агентами, которым одновременно нужны текст и визуальные данные. Открытые веса и агрессивная цена снижают порог развертывания, а работа на китайских ускорителях показывает альтернативу инфраструктуре Nvidia. Перед производственным внедрением стоит отдельно измерить реальную скорость, качество на длинном контексте и частоту незавершенных задач.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.