AI Radar
Thinking Machines выпустила под лицензией Apache 2.0 разреженную модель Inkling-Small с 276 млрд параметров, из которых на каждый токен работают около 12 млрд. Она почти сравнялась с гораздо более крупной Inkling по совокупному индексу и в нескольких тестах даже превзошла её.
Inkling-Small принимает текст, изображения и аудио, выдаёт текст и поддерживает контекст до 1 млн токенов. Полные веса размещены на Hugging Face, а дообучение доступно через API платформы Tinker. Это мультимодальная reasoning-модель, а не компактная локальная LLM: общий объём в 276 млрд параметров всё ещё слишком велик для обычного ноутбука или рабочей станции. Однако её вычислительный профиль заметно легче, чем у исходной Inkling с 975 млрд общих и 41 млрд активных параметров.
Экономия достигается за счёт архитектуры Mixture-of-Experts. В 42-слойном декодере каждый токен направляется к шести из 256 специализированных экспертов, а ещё два общих эксперта работают постоянно. Поэтому модель хранит большой набор выученных специализаций, но для конкретного токена использует лишь небольшую часть сети — около 12 млрд активных параметров. Это не делает файл весов двенадцатимиллиардным, зато уменьшает вычисления при инференсе и облегчает развёртывание на серверной GPU-инфраструктуре по сравнению с флагманом.
В Artificial Analysis Intelligence Index модель получила 40 баллов против 41 у большой Inkling; по данным оценки, среди открытых моделей такого размера или меньше более высокого результата не было. В отдельных инженерных тестах младшая версия вышла вперёд: 80,2% на SWE-bench Verified против 77,6% у Inkling и 64,7% на Terminal Bench 2.1 против 63,8%. Она также показала лучшие результаты на SciCode, Humanity’s Last Exam, GPQA Diamond и CritPt. Это означает, что сокращение активной части сети не привело к равномерной потере способностей и в кодовых задачах могло сопровождаться улучшением.
Компромиссы заметны в знаниях и некоторых агентных сценариях. На τ³-Banking Inkling-Small набрала 15,5% против 23,7% у старшей модели, а показатель AA Omniscience оказался отрицательным, что указывает на более слабое покрытие фактических знаний, несмотря на немного меньшую заявленную частоту галлюцинаций. Поэтому модель выглядит убедительно для кодовых помощников, анализа документов, RAG, вызова инструментов и мультимодальных процессов, но в задачах с высокой ценой фактической ошибки ей по-прежнему потребуются внешние источники, автоматические проверки и человеческий контроль.
Thinking Machines также предлагает модель через API. На старте действует временная скидка 50%: для стандартного варианта с контекстом 64 тыс. токенов миллион входных токенов стоит $0,58, выходных — $1,44, токенов обучения — $1,73, а кешированный вход — $0,116. Есть и более дорогой вариант с контекстом 256 тыс. токенов, тогда как полный предел контекста модели заявлен на уровне миллиона. Открытая лицензия позволяет разворачивать и модифицировать веса самостоятельно, но фактическая экономия будет зависеть от эффективности MoE-рантайма, доступной памяти и загрузки оборудования.
Inkling-Small даёт организациям возможность получить близкие к флагману способности при существенно меньшем объёме активных вычислений и без привязки только к закрытому API. При выборе инфраструктуры важно не путать 12 млрд активных с 12 млрд общих параметров: хранить и обслуживать всё равно нужно крупную 276-миллиардную MoE-модель.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.