AI Radar
NVIDIA выпустила открытую MoE-модель Nemotron 3.5 Lightning для частых операций внутри постоянно работающих агентов и библиотеку NeMo Switchyard для распределения этапов между разными LLM. Компания делает ставку не на одну универсальную модель, а на сочетание дешёвого исполнителя с более сильными моделями для сложного планирования.
Nemotron 3.5 Lightning содержит 30 млрд параметров, но при обработке токена активирует около 3 млрд благодаря архитектуре mixture of experts. NVIDIA позиционирует её как рабочую модель для инструментальных вызовов, проверки результатов, форматирования и выполнения команд — операций, которые многократно повторяются в длинном агентном сценарии. Заявленная пиковая скорость генерации достигает четырёхкратного преимущества над моделями сопоставимого размера, хотя этот показатель зависит от конкретной конфигурации и не означает превосходства по общему интеллекту.
В PinchBench модель выполнила 10 тысяч агентных задач с точностью 86%. При сопоставимой точности она завершала задания примерно на 30–35% быстрее Qwen 3.6 35B. Независимый рейтинг Artificial Analysis поставил Lightning 24 балла среди открытых моделей до 40 млрд параметров и измерил генерацию примерно в 670 токенов в секунду; в этом сравнении модель оказалась на границе компромисса между качеством и скоростью, где ни один другой участник одновременно не превосходил её по обоим показателям.
Для ускорения используются предсказание нескольких токенов, speculative decoding и низкая точность. Вместе с основной моделью доступны черновые модели DSpark и DFlash, а варианты весов включают BF16 и NVFP4. NVIDIA заявляет поддержку диапазона от Jetson и GeForce RTX 5090 до DGX Spark, рабочих станций, дата-центров и облака. Веса опубликованы на Hugging Face и ModelScope, вызовы доступны через OpenRouter и платформу NVIDIA; также открыты данные, рецепты обучения и датасет Nemotron-RL Agentic Terminal Pivot для программирующих агентов.
NeMo Switchyard решает соседнюю задачу: выбирает модель с учётом запроса, контекста, текущего этапа агента, качества, задержки и цены. Классификационный маршрутизатор распределяет запросы по областям, фазовый учитывает этап выполнения и работу с инструментами, а эскалационный сначала пробует дешёвую модель и обращается к более сильной, если уверенного результата нет. Библиотека не ограничена моделями NVIDIA и может объединять открытые и закрытые LLM.
Во внутреннем тесте NVIDIA маршрутизация сохранила качество, близкое к Claude Opus 4.8, при стоимости около трети от сценария, где Opus использовался на каждом шаге. В 145 многоходовых задачах LangChain только 7% запросов ушли в Opus 4.8: стоимость снизилась на 74%, но точность — примерно на шесть процентных пунктов. У Cognition фазовая маршрутизация в Devin Desktop сократила среднюю стоимость на 28%, а Ramp Labs сообщила о снижении тестовых затрат на 58% и времени выполнения на 33%. Эти цифры получены в разных сценариях и не гарантируют такого же выигрыша в произвольном рабочем процессе.
В агентных системах большая часть бюджета расходуется не на редкое сложное планирование, а на многочисленные рутинные вызовы. Lightning даёт локально разворачиваемого исполнителя для этих шагов, а Switchyard позволяет оставить дорогую модель только там, где её способности действительно нужны. Практический выигрыш придётся проверять на собственных задачах: агрессивная маршрутизация снижает цену, но может одновременно ухудшать точность.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.