AI Radar
iFlytek обновила линейку цифровых людей, заменив заранее подготовленные фрагменты видео сквозной генерацией во время общения. Система связывает смысл реплики с голосом, выражением лица и движениями, а создавать базового персонажа можно по одной фотографии.
Традиционные цифровые ведущие часто собирают эфир из заранее сгенерированных фрагментов, а в реальном времени лишь выбирают подходящую реплику и синхронизируют губы. Такой конвейер плохо реагирует на неожиданные вопросы и может выдавать заметные переходы, рассинхронизацию звука, смещение черт лица или механические жесты. В новой системе iFlytek весь контур — от семантического ответа до мимики, позы и видеопотока — работает в режиме генерации. Персонаж способен реагировать на сообщения аудитории, менять тему, благодарить за виртуальные подарки и поддерживать активность трансляции без переключения между заготовленными роликами.
Стабильность длительного эфира обеспечивает видеогенерация с двухуровневой временной памятью. Краткосрочная память удерживает непрерывность выражений, движений и текстур между соседними кадрами, а долгосрочная фиксирует внешность персонажа, стиль и основу сцены. Динамическое сжатие состояния, возврат к ключевым признакам и ограничения согласованности между фрагментами должны подавлять накопление ошибок, из-за которого лицо или одежда постепенно меняются. Это особенно важно для круглосуточного стрима, где короткий удачный ролик еще ничего не говорит о поведении системы через несколько часов.
Чтобы совместить качество с низкой задержкой, iFlytek применила малошаговую потоковую дистилляцию видеодиффузионной модели. Учитель оценивает результаты ученика на реальных видеопримерах, а дополнительные временные ограничения помогают избежать мерцания, деформаций и застывших движений. Инференс организован как гетерогенный конвейер: система сначала отдает первый кадр, а следующие генерирует, декодирует, кодирует и отправляет асинхронно во время воспроизведения. Повторное использование истории видео уменьшает объем вычислений, не разрывая визуальную последовательность.
Связь поведения персонажа со смыслом обучали через мультимодальную систему оценки и reinforcement learning. Она учитывает текст, речь, изображение, видео и сигналы движений, проверяя соответствие жестов реплике, естественность изображения и звука, выполнение команды, сохранение личности, временную связность и корректность взаимодействия с предметами. Оценки превращаются в награду в цикле «качественные данные — SFT — мультимодальная проверка — RL-оптимизация — возврат результатов в обучение». Это должно позволить цифровому ведущему не просто шевелить губами, а, например, правильно указать на товар или изменить позу в подходящий момент.
Голосовой компонент поддерживает более 70 языков и моделирует не только тембр, но также паузы, ударения, интонацию и эмоциональную окраску с учетом смысла. Для обучения используются речь, текст и эмоциональная разметка, а отдельная адаптация выравнивает голосовые признаки с выбранным персонажем. На уровне продукта эти возможности вошли в AI Virtual Human Interaction Platform, которая объединяет распознавание и синтез речи, перевод, семантическое понимание и модель Spark. По заявлению iFlytek, разговорное приложение можно собрать конфигурацией на платформе примерно за час, без программирования сложных интеграций.
Обновилась и SaaS-платформа iFlytek Zhizuo: в ней доступны готовые образы и голоса, создание цифрового двойника по фотографии и клонирование голоса по короткому образцу. Маркетинговый агент генерирует ролик из диалога с пользователем, а видеоагент последовательно готовит идею, структуру, текст, раскадровку, материалы и озвучивание. Компания показывает решения для прямых продаж, обучения, клиентского обслуживания и навигации; мобильная версия цифрового человека дополнена автоматическим следованием, обходом препятствий, поиском источника звука и мультимодальными сенсорами. Однако реальные затраты на длительную генерацию, оборудование и сопровождение в опубликованных данных не раскрываются.
Сквозная генерация позволяет цифровому сотруднику отвечать на непредсказуемые вопросы и синхронно менять голос, лицо и жесты, а не воспроизводить набор роликов. Для бизнеса это расширяет сценарии интерактивного обслуживания и круглосуточных трансляций, но экономический эффект будет зависеть от стабильности многочасовой работы, вычислительной стоимости и качества реакции на реальные действия пользователей.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.