AI Radar
Mistral представила Large 4: триллионную мультимодальную MoE-модель с 49 млрд активных параметров
Mistral открыла публичный превью-доступ к Large 4 — нативно мультимодальной MoE-модели на 1 трлн параметров, из которых во время инференса активны 49 млрд. Веса компания обещает выпустить к концу октября, а пока модель доступна через API Mistral Studio.
Что изменилось
Large 4, неофициально прозванная Le Chonk, стала крупнейшей моделью Mistral. Формулировка «триллион параметров» здесь требует важного уточнения: это mixture-of-experts-архитектура, в которой на конкретный запрос задействуется лишь часть сети — 49 млрд параметров. Такой подход позволяет наращивать общую ёмкость модели, не превращая стоимость каждого ответа в стоимость работы плотной триллионной модели. Large 4 изначально умеет работать не только с текстом: Mistral относит к её ключевым сценариям мультимодальное понимание, рассуждения, программирование и агентные задачи. В превью API предусмотрены два режима рассуждений — без него и с высоким уровнем reasoning. [ev_f85ccc34, ev_eda9aeb0]
Обучение прошло на собственной европейской инфраструктуре Mistral: компания использовала около 3 800 GPU NVIDIA Grace Blackwell. Модель обучали на корпусе более чем из 160 языков; продолжающееся RL-дообучение означает, что характеристики превью ещё могут меняться до релиза весов. Для развёртывания это всё равно очень крупный артефакт: независимый обзор The Register предполагает, что модель может разумно работать на восьми-GPU системах уровня NVIDIA HGX B300 или AMD MI355X, однако сама Mistral требований к железу в анонсе не указала. То есть открытые веса не стоит автоматически приравнивать к доступности на обычной локальной машине. [ev_04cfabe1, ev_d0c261c3]
В собственных оценках Mistral называет Large 4 сильнейшей по сводным бенчмаркам среди моделей с открытыми весами, разработанных в США и Европе, и заявляет лидерство среди открытых моделей в киберзащите, финансах и правовых задачах. Среди опубликованных чисел — 61,7% на DeepSWE v1.1 для задач программной инженерии, 59,9% на AutomationBench, 82% в тесте Artificial Analysis Cyber Index на воспроизведение и исправление уязвимостей и 93% на Cybench. Компания также сообщает 42% на Dense 200 visual grounding — немного выше приведённого для GPT-6 Astra результата в 41%. Эти сравнения полезны как ориентир, но часть результатов основана на тестах и интерпретации самой Mistral, поэтому окончательные выводы лучше делать после независимых прогонов и появления весов. [ev_f85ccc34, ev_b38cd4d8]
Практический фокус заметно шире чат-бота: модель заявлена для работы с таблицами, документами, графиками, техническими чертежами, PDF и большими геопространственными изображениями. Это делает visual grounding — поиск объекта или области изображения по текстовому описанию — особенно важной функцией для промышленной и документной автоматизации. Но непосредственно сейчас разработчикам доступен только облачный preview: открытые веса планируются на конец месяца, а до того Mistral проводит red-teaming с партнёрами из кибербезопасности, проверенными организациями и государственными структурами. Цена API, по данным профильного канала, составляет $1,36 за миллион входных и $4,18 за миллион выходных токенов; первые две недели действует скидка 50%. [ev_f85ccc34, ev_b38cd4d8, ev_d0c261c3]
Почему это важно
Large 4 показывает, что европейские разработчики продолжают выводить в открытый доступ модели фронтирного масштаба, хотя на первом этапе доступ ограничен API. MoE-схема особенно важна для команд, которым нужны сложные мультимодальные и агентные задачи без стоимости плотной модели на триллион параметров. Однако реальная применимость будет зависеть от лицензии, качества открытой версии, требований к инфраструктуре и независимого подтверждения бенчмарков.
Первоисточники и подтверждения
Подборку проверяет редакция DSML. AI помогает дедуплицировать сигналы и готовить текст, но опубликованный выпуск остаётся редакционным продуктом, а не лентой отдельных каналов.