AI Radar
Alibaba представила Qwen-Audio-3.0-TTS в версиях Flash для низкой задержки и Plus с упором на естественность голоса. Модель поддерживает 16 языков, включая русский, и текстовое управление стилем речи.
В модель добавлены 86 тегов для эмоций, темпа и неречевых звуков, включая смех, шёпот и вздохи. Также заявлены клонирование голоса по шумной записи и генерация до трёх минут аудио за один проход.
Версия Plus, согласно публикации, занимает первое место в Artificial Analysis TTS Arena. Описанные возможности актуальны для голосовых интерфейсов, локализации контента и прототипирования аудиопродуктов.
Перед внедрением клонирования голоса командам следует отдельно проверить требования к согласию, правам на голос и локальному регулированию.
Крупное обновление TTS-линейки с русским языком, управляемой экспрессией и раздельными профилями для real-time и качества.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.