AI Radar
Moonshot AI выпустила открытые веса Kimi K3 и 47-страничный технический отчёт о модели с 2,8 трлн параметров, миллионным окном контекста и 104 млрд активных параметров на токен. В основе релиза — попытка сделать длинные агентные траектории дешевле не за счёт одного лишь масштаба GPU, а через переработку памяти, глубины сети и MoE-маршрутизации.
Kimi K3 заметно отличается от K2 не только размером. В модели 93 слоя: блоки из трёх слоёв Kimi Delta Attention (KDA) чередуются со слоем глобального MLA-внимания. Заявленные 2,8 трлн общих параметров не означают, что весь объём участвует в каждом вычислении: на один токен активируются около 104,2 млрд параметров. Такой разреженный MoE-подход позволяет наращивать ёмкость модели, не превращая стоимость каждого запроса в стоимость полного плотного запуска.
Главная проблема длинного контекста у обычных трансформеров — растущий KV-кэш: для каждого нового токена нужно хранить ключи и значения предыдущих позиций. KDA заменяет постоянно расширяющееся хранилище фиксированным рекуррентным состоянием, которое обновляется по мере чтения последовательности. Но Moonshot не отказалась от полновесного доступа к контексту полностью: KDA сжимает долгую историю, а Gated MLA и глобальные слои внимания периодически позволяют заново обратиться к полной последовательности. Поэтому окно в 1 млн токенов следует понимать как техническую возможность обработать такой ввод, а не как гарантию безошибочного извлечения каждой детали на любой позиции. Для обучения длинному контексту компания использовала ступени от 8K до 64K, 256K и 1M токенов и данные, где важная информация распределена по всему документу.
Отдельно переработана «глубина» сети. Attention Residuals позволяют последующим слоям выбирать представления из более ранних блоков, вместо того чтобы получать только одну накопленную сумму через стандартные residual-связи. Все 93 слоя сгруппированы примерно в восемь блоков: это даёт модели возможность повторно использовать информацию с разных этапов обработки, но без хранения выходов каждого слоя по отдельности. Решение выглядит практичным компромиссом между доступом к ранним признакам и затратами на память и межустройственную передачу, хотя отчёт не отделяет его вклад от эффектов остальных архитектурных и тренировочных изменений.
Ширину модели обслуживает Stable LatentMoE. В каждом слое есть 896 маршрутизируемых экспертов, из которых токен выбирает 16; для сравнения, у K2 было 384 эксперта и восемь активных. Перед вычислением экспертами скрытое состояние сжимается с 7168 до 3584 измерений, а затем возвращается в основное пространство, сокращая объём коммуникаций. Moonshot также использует Quantile Balancing для выравнивания нагрузки между экспертами и MoonEP с динамическими копиями популярных экспертов на уровне исполнения. Это важно, потому что реальная скорость большой MoE-модели часто определяется перегруженным устройством, а не средней арифметической нагрузкой.
Архитектура дополняется подготовкой к агентным сценариям, где задача состоит из длинной цепочки действий, вызовов инструментов и ожиданий результатов. По данным Moonshot, три специализации — общие задачи, агенты и код — обучали отдельно на трёх режимах рассуждений, после чего девять вариантов объединили; отдельные эпизоды доходили до тысяч tool calls. Открытые веса делают K3 доступной для самостоятельного развёртывания, а низкоточные форматы MXFP4 для весов и MXFP8 для активаций вместе с малой долей активных параметров должны снижать требования к памяти. Сравнения стоимости, впрочем, нужно читать осторожно: Moonshot приводит собственные внутренние оценки против публичных тарифов конкурентов, хотя заявляет $3 за миллион входных токенов и до $0,30 при высоком попадании в кэш для задач кодинга.
Kimi K3 показывает, что практическая гонка за агентными моделями всё сильнее упирается в управление состоянием и стоимость инференса, а не только в число параметров. Для команд, запускающих модели локально, открытые веса и разреженная архитектура расширяют выбор, но миллионный контекст не отменяет необходимости проверять качество поиска и рассуждений на собственных длинных данных. Особенно полезны здесь не только заявленные бенчмарки, но и конкретные инженерные решения для кэша, маршрутизации экспертов и длительных траекторий.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.