AI Radar

Microsoft выпустила Decision-1 для быстрых решений внутри AI-процессов

Microsoft открыла в Foundry доступ к Decision-1: модель получает фиксированный набор вариантов и выдаёт структурированную вероятность для каждого. Компания предлагает использовать её там, где программе нужно быстро выбрать следующий шаг, классифицировать запрос или проверить действие агента.

10 октября 2026 г.3 мин чтенияИсточник: TestingCatalog · TG · AI/ML/Big Data
агентымоделиинструменты
00

Что изменилось

Microsoft-Decision-1 предназначена для задач с заранее заданными вариантами ответа. Разработчик передаёт запрос и допустимые варианты, а модель возвращает для каждого вероятность в структурированном вызове API. Это позволяет программе сразу использовать оценку в логике маршрутизации: принять действие, повторить шаг, передать задачу другому инструменту или человеку. «Калиброванная» вероятность означает попытку сделать числовую уверенность полезной для выбора порогов, но нужный порог для конкретного процесса всё равно придётся проверять на своих данных.

Модель принимает задачи да/нет, выбор из нескольких пунктов и шкалы оценок. Ею также предлагают проверять ответы AI и действия агентов по рубрике, то есть по заранее описанным критериям. В числе заявленных применений – классификация, приоритизация, поиск, проверка безопасности и управление рабочими процессами. В отличие от обычного запроса к LLM, где решение приходится извлекать из свободного текста, здесь выход заранее приспособлен для программной обработки.

По данным Microsoft, Decision-1 получила постобучением на базе Qwen3.5-9B способность оценивать варианты за один проход; в дальнейшем компания планирует использовать для этой системы и другие базовые модели. В её собственной оценке из 36 бенчмарков и почти 150 тысяч вопросов, не использованных при обучении, модель показала наивысшую точность среди сравниваемых систем. Microsoft также сообщает о задержке на медиане запросов в 4,5 раза ниже, чем у Quyet-1.0-Large, и в 35 раз ниже, чем у GPT-6 Sol. Это результаты заявленного компанией сравнения, а не гарантия такой же разницы в любом приложении.

Для слоя управления важна не только скорость, но и устойчивость выбора к форме запроса. Microsoft проверяла эквивалентные формулировки восьмью способами и сообщает, что в среднем решение менялось в 1,3% случаев; при перефразировании описаний вариантов, изменении их порядка и обращении порядка вариантов смены решения в этих тестах не было. Компания отдельно указывает на проверку безопасности по 5250 запросам из 11 наборов, включая вредоносный контент, попытки обойти ограничения и prompt injection – инструкции, внедрённые в данные, которые читает модель.

Microsoft приводит и внутренние применения: Xbox Research размечала более 10 тысяч отзывов, а команда Copilot использовала модель для оценки ответов агентов. По данным компании, в этих сценариях она обеспечивала сопоставимое качество при заметно меньшей задержке; Xbox Research также сообщала о существенно меньшей стоимости. Decision-1 уже доступна в Microsoft Foundry, выход на OpenRouter ожидается позже. Заявленная начальная цена составляет $0,042 за миллион входных токенов, выходные токены бесплатны. Для разработчика это делает модель кандидатом на частые промежуточные проверки, а не обязательно заменой модели, выполняющей основную задачу.

Почему это важно

В агентном процессе отдельная модель может оценивать следующий шаг без генерации длинного ответа. Для внедрения стоит проверить на своих данных калибровку вероятностей, пороги передачи человеку и задержку всей цепочки, а не только одного вызова.

Мнение редакции

Microsoft давно встраивает AI в инструменты разработчиков и рабочие процессы Copilot. Decision-1 выделяет из большой модели узкую роль: выбирать действие, а не писать развёрнутый ответ. Похожую идею вероятностных решений продвигают и специализированные модели; новое здесь – ставка Microsoft на отдельный слой управления агентами в Foundry.

Первоисточники и подтверждения

Подборку проверяет редакция DSML. AI помогает дедуплицировать сигналы и готовить текст, но опубликованный выпуск остаётся редакционным продуктом, а не лентой отдельных каналов.

10 октября 2026 г.
  1. 01Anthropic отключила живой интернет для внутренних тестов агентов после неожиданных действий на сайтах
  2. 02Исследование: кодовые агенты увеличили объём кода, но не число закрытых задач
  3. 03Anthropic запустила OSS Scanner для поиска уязвимостей в открытых проектах
  4. 04Разработчик модели решений Jev привлёк $870 млн