AI Radar
Google DeepMind выпустила многоязычную модель перевода жестовой речи в текст SL2T и впервые встроила такую технологию в массовые продукты — Gboard и Live Transcribe на Pixel 11. На старте доступен перевод американского жестового языка на английский, несмотря на обучение на данных более чем 50 жестовых языков.
В Gboard пользователь может показать фразу камере вместо голосового или клавиатурного ввода, а полученный текст отправить в сообщение, документ или поисковый запрос — либо использовать как команду для Gemini. В Live Transcribe жестовая речь становится способом ответить собеседнику без постоянного переключения на ручной набор. На складном Pixel 11 Pro Fold перевод можно вывести на внешний экран, чтобы человек напротив сразу видел текст; поддерживаются жесты одной и двумя руками. Участники тестов из сообщества глухих называли ввод на американском жестовом языке более быстрым и естественным, чем набор английского текста.
Технически задача сложнее обычного распознавания речи. Жестовый язык обладает собственной грамматикой и лексикой и не сводится к последовательной замене движений рук английскими словами. Значение одновременно кодируют кисти, руки, корпус, положение головы и мимика, поэтому модели нужны и высокочастотное визуальное отслеживание, и полноценный машинный перевод. Именно поэтому ранние решения вроде сенсорных перчаток охватывали лишь часть языка: они плохо передавали выражение лица, пространственные отношения и согласованные движения всего тела.
Google обучила SL2T более чем на 100 тыс. часов данных по свыше чем 50 жестовым языкам; примерно четверть набора приходится на американский жестовый язык. Совместное обучение на разных языках, диалектах и манерах пользователей, по результатам экспериментов компании, оказалось эффективнее отдельной одноязычной модели: система смогла извлечь общие структурные закономерности. На тесте FLEURS-ASL для перевода с американского жестового языка на английский модель получила нулевой BLEURT 70, что Google называет лучшим опубликованным результатом для этой задачи.
Для защиты изображения обработка разделена между телефоном и сервером. Локальная MediaPipe Holistic извлекает из видеопотока геометрические координаты ключевых точек тела, после чего исходные кадры можно удалить; на сервер отправляется последовательность координат, а не видео. SL2T переводит ее сразу в текст, минуя традиционный промежуточный словарь размеченных жестов. Такой подход уменьшает передачу биометрически чувствительного материала и не ограничивает модель заранее составленной лексикой, хотя координаты движений сами по себе тоже требуют аккуратного обращения как с чувствительными данными.
Разработчики отдельно оптимизировали потоковую задержку, ложные срабатывания при отсутствии жестовой речи, работу с левшами и одноручными жестами. Тем не менее SL2T 1.0 может ошибаться на редких жестах, быстром дактильном алфавите, пассивных конструкциях, пространственных описаниях и временах, когда контекста недостаточно. Еще одно важное ограничение — языковой охват продукта: обучение было многоязычным, но первая пользовательская версия переводит только американский жестовый язык в английский. Поддержка остальных жестовых языков не следует автоматически из общего тренировочного корпуса.
Проект разрабатывался с участием сообщества глухих — от замысла и сбора данных до тестирования и оценки последствий. Google также создала консультативный совет AISLAC с организациями глухих и профильными экспертами и опубликовала отчет о влиянии версии 1.0. Аппаратной основой запуска стал Pixel 11 с Tensor G6: его TPU на 50% производительнее предшественника, а задачи локального AI с Gemini Nano выполняются, по оценке Google, до 3,5 раза быстрее и с энергопотреблением вплоть до одной трети прежнего уровня. Однако сам перевод остается гибридным: ключевые точки извлекаются на устройстве, а текст формируется серверной моделью.
SL2T позволяет использовать жестовую речь в тех же цифровых сценариях, что голос и клавиатуру: для переписки, поиска, документов и управления AI-ассистентом. Практическая доступность пока ограничена одной языковой парой и неизбежными ошибками перевода, поэтому в медицинских, юридических и других критичных разговорах технология не заменяет профессионального переводчика.
DSML editors review the selection. AI helps deduplicate signals and draft the text; the published edition remains an editorial product, not a feed of individual channels.