DSML Kazakhstan LogoDSMLKZ
HomeAboutPeopleNewsAI RadarJobsResearchEventsArticles
DSML Kazakhstan Logo© 2026 DSML Kazakhstan.
AboutCollaborateCommunity GuidelinesTelegramAI Radar RSSYouTubeLinkedInInstagram
    AI RadarAugust 27, 2026

    AI Radar

    Z.ai открыла GLM-5.3-Flash с мультимодальностью и контекстом в миллион токенов

    Z.ai выпустила открытые веса GLM-5.3-Flash — нативно мультимодальной MoE-модели с контекстом до 1 млн токенов. Система имеет 320 млрд параметров, активирует 18 млрд на запрос и, по данным компании, обслуживала глобальную тестовую нагрузку на кластере из 100 тысяч китайских ускорителей.

    August 27, 2026·3 min read·Источник: 智东西 · South China Morning Post
    00

    Что изменилось

    До официального релиза модель неделю работала под псевдонимом Ox Alpha на OpenRouter и в агентной среде OpenCode. За время скрытого теста она обработала 62 трлн токенов, причем более 11 трлн пришлись на первые три дня — это стало крупнейшим запуском в истории OpenRouter. В недельной статистике кодинговых моделей Ox Alpha заняла первое место с 10,3 трлн токенов, или почти 31% соответствующего трафика платформы.

    GLM-5.3-Flash принимает текст, изображения, видео и файлы, а миллионное контекстное окно рассчитано на крупные репозитории, длинные документы и мультимодальные агентные задачи. Чтобы не платить полную цену обычного attention на такой длине, Z.ai совместила линейное и разреженное внимание. Дополнительный механизм IndexPool сжимает четыре вектора кэша индексатора в один. По внутренним измерениям, относительно GLM-5.3 объем вычислений attention снизился в 3,01 раза, а KV-кэш — в 4,44 раза, хотя по последнему показателю модель пока уступает Kimi-K3 и DeepSeek-V4-Flash.

    Модель построена как mixture of experts: из 320 млрд параметров для каждого запроса используются 18 млрд, а число слоев сократилось с 92 у сопоставимой предшествующей архитектуры до 45. На Artificial Analysis Intelligence Index система получила 57 баллов: десятое место в общем зачете и третье среди моделей с открытыми весами после Kimi K3 и Qwen3.8 2.4T A95B. Заявления Z.ai о паритете с Claude Opus 4.8 в отдельных задачах следует воспринимать осторожно: независимые оценки также фиксируют скорость генерации ниже средней по индустрии.

    Отдельная часть запуска — демонстрация крупномасштабного инференса без Nvidia. Z.ai утверждает, что кластер из 100 тысяч неназванных китайских чипов полностью обслуживал скрытый тест. Для компенсации меньшей емкости памяти и пропускной способности отдельных ускорителей компания разделила стадии инференса на независимо управляемые вычислительные пулы; это якобы утроило сквозную производительность и приблизило стоимость токена к системам Nvidia. Эти цифры пока не проверены независимо. Cambricon и Moore Threads объявили о поддержке модели с первого дня, а ранее Zhipu также сотрудничала с Huawei.

    Z.ai делает ставку на низкую стоимость: заявлены 0,8 юаня за миллион входных токенов, 2,8 юаня за миллион выходных и 0,23 юаня при попадании в кэш. Это около одной десятой стандартной цены GLM-5.3, а во время акции — одной двадцатой; сравнение с Opus 4.8 дает заявленную разницу примерно в 40 раз. Веса доступны глобально, модель подключена к API, ZCode и GLM Coding Plan.

    Практические испытания показывают широкий, но не безупречный диапазон задач. Модель извлекла ключевые фрагменты из 48-минутного выступления, смонтировала 17 эпизодов с субтитрами, суммировала 58-страничную диссертацию за пять с половиной минут и создавала игровые прототипы по видео. В то же время пользователи сообщали о галлюцинациях, пропущенных шагах и медленной генерации; в одном общественном тесте модель решила лишь 28% из 175 задач LiveCodeBench.

    Почему это важно

    GLM-5.3-Flash подходит для экспериментов с длинными документами, большими кодовыми базами и агентами, которым одновременно нужны текст и визуальные данные. Открытые веса и агрессивная цена снижают порог развертывания, а работа на китайских ускорителях показывает альтернативу инфраструктуре Nvidia. Перед производственным внедрением стоит отдельно измерить реальную скорость, качество на длинном контексте и частоту незавершенных задач.

    Primary and supporting sources

    • 连夜实测智谱GLM-5.3-Flash:剪视频、复刻《深海迷航》,价格降低97.5%Opens in a new tab
    • Zhipu AI shares jump as viral Ox Alpha model revealed as GLM-5.3-Flash on Chinese chipsOpens in a new tab

    DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.

    More from this edition

    August 27, 2026
    1. 01Nvidia договорилась купить Hugging Face за $12,9 млрд
    2. 02Tencent открыла мультимодальные эмбеддинги WeMM для поиска и рекомендаций
    3. 03Nvidia и крупнейшие инвестфонды хотят превратить AI-вычисления в класс активов
    4. 04Meta представила MTIA 400 для обучения LLM и рекламного инференса
    Back to AI Radar