AI Radar
Подразделение Bailing компании Ant Group представило Ling 3.0 Flash, ориентированную на программирование, вызов инструментов и длинные агентные задачи. При общем размере 124 млрд параметров MoE-архитектура активирует для каждого токена только 5,1 млрд и поддерживает контекст до 256 тысяч токенов.
Ling 3.0 Flash доступна через OpenRouter и платформу Bailing: бесплатный период API заявлен до 3 августа, после чего команда планирует открыть веса модели. За первые пять дней после релиза она поднялась с девятого на шестое место в рейтинге вызовов токенов, а 29 июля уступала DeepSeek V4 Pro по объёму только 0,5%. Позиционирование модели подчёркнуто прикладное: не заменить самые крупные рассуждающие системы во всех задачах, а быстро и экономно выполнять действия в коде, браузере и подключённых бизнес-приложениях.
В основе модели лежит гибридное внимание: слои линейного Kimi Delta Attention и Multi-head Latent Attention чередуются в пропорции 5:1. KDA использует диагональное управление обновлением состояния, позволяя отдельным каналам по-разному сохранять, ослаблять и записывать информацию; MLA сжимает KV-кэш через низкоранговое представление и уменьшает расход памяти при инференсе. MoE-маршрутизация активирует примерно 1/64 экспертов — 5,1 млрд параметров из 124 млрд для одного токена, — направляя вычисления только в небольшую релевантную часть сети.
Системная оптимизация продолжается за пределами самой нейросети. Ling 3.0 Flash интегрирована с SGLang HiCache и Mooncake, где KV-кэш распределяется между памятью GPU, оперативной памятью хоста и общим хранилищем кластера как уровни L1, L2 и L3. Повторное использование уже рассчитанного кэша в длинных диалогах, по данным команды, снижает время до первого токена на длинном вводе на 60–80% и более. Для сложных процессов предусмотрена Ling Multi-Agent — схема с несколькими ролями, разделением работы и взаимной проверкой результатов.
В опубликованном наборе оценок Ling 3.0 Flash превзошла более крупную Ring 2.6 1T в 11 из 12 тестов и получила 15 первых и 19 вторых мест по 34 измерениям. Для агентных сценариев заявлены 73,0% в BFCL-v4, где проверяется вызов функций, и 1107 баллов в GDPVal v2-AA; в банковской среде Tau3-banking-AA результат составил 28,0%, уступив Claude Sonnet 4.6. В поисковом WideSearch модель набрала 73,6%, а в многoагентном BrowseComp — 82,0% против 82,1% у Claude Sonnet 4.6.
На задачах разработки указаны 56,6% в SWE-Bench Pro, 77,0% в ArtifactsBench и 25,3% в MiniAppBench. Поддержка длинного контекста проявилась в 81,1% на MRCR_256K и 87,7% на Multi-IF; в LIFEBench, проверяющем сохранение инструкций через несколько реплик, модель получила 77,3%. Среди демонстраций — последовательная доработка 3D-симулятора бильярда, многоагентный исследовательский процесс и управление Excel и Word через Office MCP и API вместо имитации кликов в интерфейсе. Все эти цифры и сравнения представлены в материалах о запуске, поэтому перед выбором модели их стоит сверять с независимыми прогонами, условиями оценки и реальной стоимостью инференса.
Разреженная активация делает Ling 3.0 Flash интересной для сервисов, где агент выполняет много последовательных вызовов и цена каждого токена быстро накапливается. Открытие весов даст разработчикам возможность развернуть модель локально, проверить заявленные результаты и адаптировать её к собственным инструментам. Особенно важны будут не пиковые баллы, а стабильность длинных процессов, точность вызова API и фактические требования к памяти.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.