DSML Kazakhstan LogoDSMLKZ
HomeAboutPeopleNewsAI RadarJobsResearchEventsArticles
DSML Kazakhstan Logo© 2026 DSML Kazakhstan.
AboutCollaborateCommunity GuidelinesPrivacyTelegramAI Radar RSSYouTubeLinkedInInstagram
    AI RadarAugust 5, 2026

    AI Radar

    ByteDance представила SeedRealtime для непрерывного аудиовизуального общения с AI

    SeedRealtime одновременно обрабатывает потоковые видео, звук и текст, самостоятельно выбирая момент для ответа. ByteDance рассчитывает заменить единой моделью каскад из распознавания речи, визуального анализа, языковой модели и синтеза голоса.

    August 5, 2026·3 min read·Источник: TestingCatalog
    010

    Что изменилось

    SeedRealtime разработана как нативная полнодуплексная модель: она может продолжать смотреть и слушать, пока говорит сама, а процессы восприятия, понимания, принятия решения и формирования ответа выполняются параллельно. В традиционной голосовой системе данные последовательно проходят через несколько компонентов — например, распознавание речи, визуально-языковую модель и синтез голоса. На стыках возникают задержки и теряется часть контекста. ByteDance объединила аудио, видео и текст в одной архитектуре, чтобы вести разговор поверх непрерывных мультимодальных потоков без таких передач между модулями.

    Важная часть подхода — управление очередностью реплик внутри самой модели, а не при помощи внешнего детектора голосовой активности и жёстких правил. SeedRealtime отслеживает паузы, говорящих, происходящее в кадре и посторонние разговоры, после чего решает, когда следует ответить, перебить или промолчать. Изображение помогает различать созвучные слова и понимать указательные выражения вроде «вот это», связывая их с жестом либо более ранним действием. Модель также сохраняет сведения об объектах, уже исчезнувших из кадра, то есть её контекст не ограничен текущим видеокадром.

    ByteDance показала работу системы в открытых и шумных ситуациях. За групповым ужином она сопоставляла имена, лица и голоса, а в ресторане учитывала одновременно блюда и разговор. В музее модель напомнила пользователю о нужном объекте, когда тот появился в поле зрения, без дополнительной команды. Среди других демонстраций — обнаружение ошибки при приготовлении эспрессо, поиск нужного фрагмента в перелистываемой статье, игнорирование посторонней речи в аэропорту и реакция на жест ребёнка во время урока английского. В аэропортовом сценарии система также вышла в интернет, чтобы уточнить номер багажной ленты.

    По результатам сквозной оценки с участием людей SeedRealtime вдвое сократила число проблем с темпом аудиовизуального разговора по сравнению с каскадными решениями. Испытатели реже сталкивались с обрывами реплик, запоздалыми ответами после пауз и ложными срабатываниями на окружающую речь; доля успешно завершённых диалогов, по заявлению ByteDance, также выросла. Однако оценить масштаб преимущества независимо пока трудно: компания не раскрыла размер выборки, таблицу бенчмарков и точное значение прироста завершённых разговоров.

    Seed заявляет, что модель полностью развёрнута, но практические условия доступа остаются неясными: не названы API или пользовательский продукт, поддерживаемые страны, цена и требования к подключению. В дальнейших планах — уменьшение задержки, более точная работа с перебиваниями и короткими подтверждающими репликами, улучшенное различение участников группового разговора, проактивные решения и подключение инструментов для поиска информации или бронирования. Поэтому нынешний запуск прежде всего демонстрирует архитектуру и сценарии, а не готовый публичный сервис с понятной моделью использования.

    Почему это важно

    Полнодуплексная модель делает голосового ассистента ближе к участнику живого разговора: ему не нужно ждать отдельной команды, а визуальный контекст помогает правильно понимать жесты и неоднозначные фразы. Это полезно для обучения, навигации, удалённой поддержки и ассистивных приложений, где обстановка непрерывно меняется. Но разработчикам ещё нужны сведения о доступе, стоимости, задержке и качестве на воспроизводимых тестах, прежде чем SeedRealtime можно будет закладывать в продукты.

    Primary and supporting sources

    • ByteDance launches SeedRealtime full-duplex AI modelOpens in a new tab

    DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.

    More from this edition

    August 5, 2026
    1. 01Anthropic собирает команду для разработки собственных ИИ-ускорителей
    2. 02Sand.ai открыла 114-миллиардную MAGI-2 Preview для совместной генерации видео и звука
    3. 03Microsoft начала развёртывать 3-нм ускоритель Maia 200 для инференса ИИ
    4. 04Alibaba представила Qwen3.8-Max на 2,4 трлн параметров и пообещала открыть веса
    Back to AI Radar