DSML Kazakhstan LogoDSMLKZ
HomeAboutPeopleNewsAI RadarJobsResearchEventsArticles
DSML Kazakhstan Logo© 2026 DSML Kazakhstan.
AboutCollaborateCommunity GuidelinesPrivacyTelegramAI Radar RSSYouTubeLinkedInInstagram
    AI RadarJuly 28, 2026

    AI Radar

    Apple раскрыла архитектуру локального синтеза выразительной речи Siri

    Apple описала систему, которая превращает семантические аудиотокены фундаментальной модели в высококачественную речь Siri Expressive Voices прямо на устройстве. Архитектура рассчитана на жёсткие ограничения памяти и вычислений мобильного железа.

    July 28, 2026·2 min read·Источник: Apple Machine Learning Research
    01

    Что изменилось

    Siri Expressive Voices синтезирует на устройстве выразительную, настраиваемую речь в реальном времени и использует AFM 3 Core Advanced — наиболее мощную локальную фундаментальную модель Apple. Однако модель выдаёт не готовую звуковую волну, а семантические аудиотокены. Чтобы превратить их в слышимую речь, требуется отдельный detokenizer, который должен уложиться в ограниченный бюджет памяти и вычислений Apple Matrix Coprocessor (AMX).

    Для этой части конвейера Apple предлагает memory-efficient-архитектуру Decoupled Temporal Depth Diffusion Transformers. Она преобразует семантические токены в представление residual vector quantization (RVQ), использует трёхкомпонентную конструкцию и потоковый подход к генерации аудио. Цель состоит не только в качестве голоса: эффективное декодирование позволяет сохранить синтез локальным, не превращая голосовой интерфейс в сервис, постоянно зависящий от отправки аудиоданных в облако.

    Почему это важно

    Локальный синтез речи важен для задержки, приватности и работы голосового интерфейса при нестабильном подключении. Работа Apple показывает, что для on-device-голоса узким местом становится не только генерация токенов, но и эффективное восстановление аудиосигнала. Потоковый detokenizer может быть полезной схемой и для других мобильных или встроенных голосовых систем.

    Primary and supporting sources

    • Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion TransformersOpens in a new tab

    DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.

    More from this edition

    July 28, 2026
    1. 01Moonshot раскрыла архитектуру Kimi K3: миллионный контекст и оптимизация для долгих агентных задач
    2. 02OpenAI: 43,5% запросов к ChatGPT относятся к задачам вне профессии пользователя
    3. 03Microsoft представила модель MAI-Cyber-1-Flash и агентную платформу Perception для киберзащиты
    4. 04После атаки агентов OpenAI Hugging Face пересобрала около трети инфраструктуры
    Back to AI Radar