AI Radar
Apple описала систему, которая превращает семантические аудиотокены фундаментальной модели в высококачественную речь Siri Expressive Voices прямо на устройстве. Архитектура рассчитана на жёсткие ограничения памяти и вычислений мобильного железа.
Siri Expressive Voices синтезирует на устройстве выразительную, настраиваемую речь в реальном времени и использует AFM 3 Core Advanced — наиболее мощную локальную фундаментальную модель Apple. Однако модель выдаёт не готовую звуковую волну, а семантические аудиотокены. Чтобы превратить их в слышимую речь, требуется отдельный detokenizer, который должен уложиться в ограниченный бюджет памяти и вычислений Apple Matrix Coprocessor (AMX).
Для этой части конвейера Apple предлагает memory-efficient-архитектуру Decoupled Temporal Depth Diffusion Transformers. Она преобразует семантические токены в представление residual vector quantization (RVQ), использует трёхкомпонентную конструкцию и потоковый подход к генерации аудио. Цель состоит не только в качестве голоса: эффективное декодирование позволяет сохранить синтез локальным, не превращая голосовой интерфейс в сервис, постоянно зависящий от отправки аудиоданных в облако.
Локальный синтез речи важен для задержки, приватности и работы голосового интерфейса при нестабильном подключении. Работа Apple показывает, что для on-device-голоса узким местом становится не только генерация токенов, но и эффективное восстановление аудиосигнала. Потоковый detokenizer может быть полезной схемой и для других мобильных или встроенных голосовых систем.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.