AI Radar
Microsoft выпустила потоковое распознавание и две голосовые модели для разговорных агентов
Microsoft представила потоковую модель распознавания MAI-Transcribe-2-Streaming и две модели синтеза речи — MAI-Voice-2.1 и её ускоренную версию Flash. Линейка рассчитана на голосовых агентов, которым нужно слушать, отвечать и вызывать инструменты без заметных пауз.
Что изменилось
В голосовом агенте недостаточно просто получить точную финальную расшифровку: системе нужно начинать понимать речь, пока человек ещё говорит. MAI-Transcribe-2-Streaming выдаёт первые частичные гипотезы немногим более чем через 100 мс после поступления аудио, пересматривает их по мере появления контекста и быстро фиксирует стабильный текст. Это позволяет заранее запустить рассуждение или подготовить вызов инструмента, а в субтитрах — показывать текст непосредственно во время речи. Модель работает с 60 языками и непрерывно определяет текущий язык автоматически.
Microsoft заявляет первое место MAI-Transcribe-2-Streaming в рейтинге Artificial Analysis по точности как окончательных, так и промежуточных транскриптов; такие внешние метрики полезнее отдельных демонстраций, но их стоит читать как срез конкретной методики рейтинга. Во внутренних тестах компании слова появлялись вдвое быстрее, чем у ближайшего конкурента для диктовки и субтитров. До конца года действует стартовая цена 0,54 доллара за час аудио. Для продуктовой команды это делает потоковый режим не только UX-функцией, но и измеряемой частью бюджета голосового сервиса.
MAI-Voice-2.1 отвечает за обратную сторону диалога — преобразование текста в речь. Она поддерживает 23 языка и 26 локалей: одна голосовая идентичность может переключаться между языками, сохраняя узнаваемое звучание, но используя местный акцент и формулировки. Основная версия стоит 22 доллара за миллион символов. Microsoft приводит сценарии, где это позволяет, например, учебному приложению менять язык объяснения без смены «преподавателя» или ассистенту отвечать на языке, который он только что распознал.
Версия MAI-Voice-2.1-Flash ориентирована на большие объёмы и чувствительные к задержке сценарии. Компания заявляет генерацию 45 секунд аудио с end-to-end задержкой 150 мс, на 55% более быстрое выполнение модели и примерно на 60% меньшую цену относительно сопоставимых решений; её тариф — 15 долларов за миллион символов. Обе TTS-модели умеют клонировать голос по нескольким секундам референсного аудио и снабжены механизмами согласия для снижения риска злоупотреблений, хотя конкретные детали этих ограничений в анонсе не раскрыты.
Все три модели доступны через Microsoft Foundry, MAI Playground, Vercel и Azure Voice Live; голосовые модели также размещены в OpenRouter. Интеграция с LiveKit заявлена на ближайшее время. В MAI Playground Microsoft показала Chatter — демонстрацию полного контура, в котором агент распознаёт речь, обрабатывает запрос и отвечает голосом. Такой комплект важен именно как связка: выигрыш от быстрых частичных транскриптов теряется, если синтезированный ответ появляется с длинной паузой.
Почему это важно
Потоковое распознавание с ранними частичными результатами помогает убрать главную шероховатость голосовых интерфейсов — ожидание между репликами. Единый голос на разных языках упрощает создание многоязычных ассистентов и контактных сценариев. При этом клонирование голоса требует от внедряющих команд отдельно проверять согласие пользователей, политику доступа и локальные требования к биометрическим данным.
Первоисточники и подтверждения
Подборку проверяет редакция DSML. AI помогает дедуплицировать сигналы и готовить текст, но опубликованный выпуск остаётся редакционным продуктом, а не лентой отдельных каналов.