DSML Kazakhstan LogoDSMLKZ
HomeAboutPeopleNewsAI RadarJobsResearchEventsArticles
DSML Kazakhstan Logo© 2026 DSML Kazakhstan.
AboutCollaborateCommunity GuidelinesPrivacyTelegramAI Radar RSSYouTubeLinkedInInstagram
    AI RadarAugust 13, 2026

    AI Radar

    Google превратила жестовый язык в способ ввода текста на Pixel 11

    Google DeepMind выпустила многоязычную модель перевода жестовой речи в текст SL2T и впервые встроила такую технологию в массовые продукты — Gboard и Live Transcribe на Pixel 11. На старте доступен перевод американского жестового языка на английский, несмотря на обучение на данных более чем 50 жестовых языков.

    August 13, 2026·4 min read·Источник: 智东西
    05

    Что изменилось

    В Gboard пользователь может показать фразу камере вместо голосового или клавиатурного ввода, а полученный текст отправить в сообщение, документ или поисковый запрос — либо использовать как команду для Gemini. В Live Transcribe жестовая речь становится способом ответить собеседнику без постоянного переключения на ручной набор. На складном Pixel 11 Pro Fold перевод можно вывести на внешний экран, чтобы человек напротив сразу видел текст; поддерживаются жесты одной и двумя руками. Участники тестов из сообщества глухих называли ввод на американском жестовом языке более быстрым и естественным, чем набор английского текста.

    Технически задача сложнее обычного распознавания речи. Жестовый язык обладает собственной грамматикой и лексикой и не сводится к последовательной замене движений рук английскими словами. Значение одновременно кодируют кисти, руки, корпус, положение головы и мимика, поэтому модели нужны и высокочастотное визуальное отслеживание, и полноценный машинный перевод. Именно поэтому ранние решения вроде сенсорных перчаток охватывали лишь часть языка: они плохо передавали выражение лица, пространственные отношения и согласованные движения всего тела.

    Google обучила SL2T более чем на 100 тыс. часов данных по свыше чем 50 жестовым языкам; примерно четверть набора приходится на американский жестовый язык. Совместное обучение на разных языках, диалектах и манерах пользователей, по результатам экспериментов компании, оказалось эффективнее отдельной одноязычной модели: система смогла извлечь общие структурные закономерности. На тесте FLEURS-ASL для перевода с американского жестового языка на английский модель получила нулевой BLEURT 70, что Google называет лучшим опубликованным результатом для этой задачи.

    Для защиты изображения обработка разделена между телефоном и сервером. Локальная MediaPipe Holistic извлекает из видеопотока геометрические координаты ключевых точек тела, после чего исходные кадры можно удалить; на сервер отправляется последовательность координат, а не видео. SL2T переводит ее сразу в текст, минуя традиционный промежуточный словарь размеченных жестов. Такой подход уменьшает передачу биометрически чувствительного материала и не ограничивает модель заранее составленной лексикой, хотя координаты движений сами по себе тоже требуют аккуратного обращения как с чувствительными данными.

    Разработчики отдельно оптимизировали потоковую задержку, ложные срабатывания при отсутствии жестовой речи, работу с левшами и одноручными жестами. Тем не менее SL2T 1.0 может ошибаться на редких жестах, быстром дактильном алфавите, пассивных конструкциях, пространственных описаниях и временах, когда контекста недостаточно. Еще одно важное ограничение — языковой охват продукта: обучение было многоязычным, но первая пользовательская версия переводит только американский жестовый язык в английский. Поддержка остальных жестовых языков не следует автоматически из общего тренировочного корпуса.

    Проект разрабатывался с участием сообщества глухих — от замысла и сбора данных до тестирования и оценки последствий. Google также создала консультативный совет AISLAC с организациями глухих и профильными экспертами и опубликовала отчет о влиянии версии 1.0. Аппаратной основой запуска стал Pixel 11 с Tensor G6: его TPU на 50% производительнее предшественника, а задачи локального AI с Gemini Nano выполняются, по оценке Google, до 3,5 раза быстрее и с энергопотреблением вплоть до одной трети прежнего уровня. Однако сам перевод остается гибридным: ключевые точки извлекаются на устройстве, а текст формируется серверной моделью.

    Почему это важно

    SL2T позволяет использовать жестовую речь в тех же цифровых сценариях, что голос и клавиатуру: для переписки, поиска, документов и управления AI-ассистентом. Практическая доступность пока ограничена одной языковой парой и неизбежными ошибками перевода, поэтому в медицинских, юридических и других критичных разговорах технология не заменяет профессионального переводчика.

    Primary and supporting sources

    • 谷歌Pixel 11全系涨价!搭2nm芯片,存储翻倍,AI跨40多款应用干活Opens in a new tab
    • 谷歌最强手语翻译模型来了!能搜索发消息,已接入手机Opens in a new tab

    DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.

    More from this edition

    August 13, 2026
    1. 01Google выпустила Gemini 3.7 Flash для кодинга и агентов и временно вдвое снизила цену
    2. 02DeepSeek открыла модульный Harness для агентов и выпустила финальную V4 Pro
    3. 03Unsloth выпустила настольное приложение для локального запуска и дообучения моделей
    4. 04Twitch разрешила запретить обучение моделей Amazon на стримах, но оставила его включенным по умолчанию
    Back to AI Radar