DSML Kazakhstan LogoDSMLKZ
HomeAboutPeopleNewsAI RadarJobsResearchEventsArticles
DSML Kazakhstan Logo© 2026 DSML Kazakhstan.
AboutCollaborateCommunity GuidelinesPrivacyTelegramAI Radar RSSYouTubeLinkedInInstagram
    AI RadarJuly 28, 2026

    AI Radar

    Moonshot раскрыла архитектуру Kimi K3: миллионный контекст и оптимизация для долгих агентных задач

    Moonshot AI выпустила открытые веса Kimi K3 и 47-страничный технический отчёт о модели с 2,8 трлн параметров, миллионным окном контекста и 104 млрд активных параметров на токен. В основе релиза — попытка сделать длинные агентные траектории дешевле не за счёт одного лишь масштаба GPU, а через переработку памяти, глубины сети и MoE-маршрутизации.

    July 28, 2026·4 min read·Источник: 雷峰网 · 人工智能 · AI, Machine Learning, Big Data +1
    29

    Что изменилось

    Kimi K3 заметно отличается от K2 не только размером. В модели 93 слоя: блоки из трёх слоёв Kimi Delta Attention (KDA) чередуются со слоем глобального MLA-внимания. Заявленные 2,8 трлн общих параметров не означают, что весь объём участвует в каждом вычислении: на один токен активируются около 104,2 млрд параметров. Такой разреженный MoE-подход позволяет наращивать ёмкость модели, не превращая стоимость каждого запроса в стоимость полного плотного запуска.

    Главная проблема длинного контекста у обычных трансформеров — растущий KV-кэш: для каждого нового токена нужно хранить ключи и значения предыдущих позиций. KDA заменяет постоянно расширяющееся хранилище фиксированным рекуррентным состоянием, которое обновляется по мере чтения последовательности. Но Moonshot не отказалась от полновесного доступа к контексту полностью: KDA сжимает долгую историю, а Gated MLA и глобальные слои внимания периодически позволяют заново обратиться к полной последовательности. Поэтому окно в 1 млн токенов следует понимать как техническую возможность обработать такой ввод, а не как гарантию безошибочного извлечения каждой детали на любой позиции. Для обучения длинному контексту компания использовала ступени от 8K до 64K, 256K и 1M токенов и данные, где важная информация распределена по всему документу.

    Отдельно переработана «глубина» сети. Attention Residuals позволяют последующим слоям выбирать представления из более ранних блоков, вместо того чтобы получать только одну накопленную сумму через стандартные residual-связи. Все 93 слоя сгруппированы примерно в восемь блоков: это даёт модели возможность повторно использовать информацию с разных этапов обработки, но без хранения выходов каждого слоя по отдельности. Решение выглядит практичным компромиссом между доступом к ранним признакам и затратами на память и межустройственную передачу, хотя отчёт не отделяет его вклад от эффектов остальных архитектурных и тренировочных изменений.

    Ширину модели обслуживает Stable LatentMoE. В каждом слое есть 896 маршрутизируемых экспертов, из которых токен выбирает 16; для сравнения, у K2 было 384 эксперта и восемь активных. Перед вычислением экспертами скрытое состояние сжимается с 7168 до 3584 измерений, а затем возвращается в основное пространство, сокращая объём коммуникаций. Moonshot также использует Quantile Balancing для выравнивания нагрузки между экспертами и MoonEP с динамическими копиями популярных экспертов на уровне исполнения. Это важно, потому что реальная скорость большой MoE-модели часто определяется перегруженным устройством, а не средней арифметической нагрузкой.

    Архитектура дополняется подготовкой к агентным сценариям, где задача состоит из длинной цепочки действий, вызовов инструментов и ожиданий результатов. По данным Moonshot, три специализации — общие задачи, агенты и код — обучали отдельно на трёх режимах рассуждений, после чего девять вариантов объединили; отдельные эпизоды доходили до тысяч tool calls. Открытые веса делают K3 доступной для самостоятельного развёртывания, а низкоточные форматы MXFP4 для весов и MXFP8 для активаций вместе с малой долей активных параметров должны снижать требования к памяти. Сравнения стоимости, впрочем, нужно читать осторожно: Moonshot приводит собственные внутренние оценки против публичных тарифов конкурентов, хотя заявляет $3 за миллион входных токенов и до $0,30 при высоком попадании в кэш для задач кодинга.

    Почему это важно

    Kimi K3 показывает, что практическая гонка за агентными моделями всё сильнее упирается в управление состоянием и стоимость инференса, а не только в число параметров. Для команд, запускающих модели локально, открытые веса и разреженная архитектура расширяют выбор, но миллионный контекст не отменяет необходимости проверять качество поиска и рассуждений на собственных длинных данных. Особенно полезны здесь не только заявленные бенчмарки, но и конкретные инженерные решения для кэша, маршрутизации экспертов и длительных траекторий.

    Primary and supporting sources

    • Kimi K3 发布 47 页技术报告,最有价值的创新点是这些Opens in a new tab
    • Moonshot AI releases weights for Kimi-K3, firing a shot across the bow of OpenAI and Anthropic — open-weight model performs almost as well as frontier models while being 2-3x easier to runOpens in a new tab

    DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.

    More from this edition

    July 28, 2026
    1. 01OpenAI: 43,5% запросов к ChatGPT относятся к задачам вне профессии пользователя
    2. 02Microsoft представила модель MAI-Cyber-1-Flash и агентную платформу Perception для киберзащиты
    3. 03После атаки агентов OpenAI Hugging Face пересобрала около трети инфраструктуры
    4. 04Fish Audio привлекла $52 млн на голосовые ИИ-модели и ускоряет защиту прав на голос
    Back to AI Radar