AI Radar
IBM выпустила открытое семейство языковых моделей Granite 4.2 для агентных и корпоративных задач, а также две потоковые модели распознавания английской речи Granite Speech 5.0. Заявленные размеры LLM — 3, 8 и 30 млрд параметров; все релизы распространяются по Apache 2.0, кроме отдельно обозначенной некоммерческой речевой версии.
Granite 4.2 получила dense-архитектуру, базовое контекстное окно 128 тысяч токенов и поддержку длинных контекстов до 512 тысяч. Все три модели прошли RL-этап для математики, науки, кода, рассуждений и использования инструментов: формально проверяемые ответы оценивались напрямую, остальные — отдельной моделью-судьей. Версии на 8 и 30 млрд параметров дополнительно обучали агентным корпоративным сценариям, включая разработку ПО, терминал и поиск. Для навыков программирования и рассуждений IBM использовала триллион токенов синтетического кода из конвейера CodeAlchemy.
В семейство также встроен слой спекулятивного декодирования: система заранее предлагает продолжение и проверяет траекторию генерации, чтобы повысить скорость вывода и пропускную способность серверов. Модели заявлены для запуска в облаке, локальной инфраструктуре и на периферийных устройствах; получить их можно через Hugging Face, Ollama, CoreWeave и другие площадки.
Granite Speech 5.0 Turbo CTC и версия с индексом NC состоят из 470 млн параметров и не содержат отдельной языковой модели. Они используют CTC — способ сопоставления аудио с текстом, подходящий для потокового распознавания. В собственных тестах IBM на одной Nvidia H200 заявлена пропускная способность около 12 600 RTFx против примерно 6000 у лидеров публичного Open ASR; снижение частоты дискретизации, по данным компании, позволяет расшифровывать три часа записи за считаные секунды. Сравнение пока требует независимой проверки при одинаковом качестве, формате аудио и настройках оборудования.
Granite 4.2 предлагает организациям модели нескольких размеров для локальных агентов, работы с инструментами и длинными корпоративными документами. Компактная CTC-модель может быть интересна сервисам массовой транскрибации и потокового ASR, где стоимость и задержка важнее возможностей встроенной языковой модели. Заявленную производительность речи следует оценивать вместе с точностью на нужных акцентах, шуме и отраслевой лексике.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.