Google DeepMind внедрила распознавание жестового языка в клавиатуру Gboard
По данным Хабра, Google DeepMind выпустила модель SL2T — первый инструмент, который переводит американский жестовый язык (ASL) в английский текст прямо в Gboard и Live Transcribe на Pixel 11.
Фаина Королёва·обновлено 13 августа 2026 г.

Для пользователей с нарушениями слуха это меняет привычный флоу: вместо клавиатуры — жесты перед фронтальной камерой, на выходе — готовый текст в любом приложении. Сценарий приближен к голосовой диктовке и встраивается в ОС, а не в отдельный сервис.
Как устроен ввод
Жест работает по модели голосового ввода: направил камеру на себя, показал фразу — получил текст. Его можно отправлять в мессенджеры, набирать документы, формировать поисковые запросы или ставить задачи Gemini. В Live Transcribe появилась ответная механика: жестикулировать можно в ответ собеседнику во время видеозвонка, не выходя из разговора.
Модель берёт не видеопоток, а 130 координатных точек лица, тела и рук, поэтому смысл считывается не только с ладоней, но и с мимики, наклонов головы и корпуса — это типичная грамматика ASL. Обработка идёт локально, ролик удаляется сразу после анализа, на сервер уходят только координаты. Заявленный плюс — приватность и снижение требований к каналу передачи данных.
Цифры и ограничения
SL2T обучена на 100+ тыс. часов записей по 50+ жестовым языкам, около четверти датасета приходится на ASL. На тесте FLEURS-ASL модель набирает 70 баллов в режиме zero-shot и 74 балла в одно-ручном режиме. Точность распознавания по FSboard — 64%.
На старте рамки прописаны жёстко:
- фрагмент не длиннее 60 секунд, история реплик не хранится;
- не учитывается приложение, в котором идёт ввод;
- нет пользовательского словаря и команд «удалить», «новая строка», «отправить»;
- модель не видит язык, окружение и глубину сцены;
- остаются галлюцинации — в ранних версиях телефонный код «207» распознавался как «2007».
Google отдельно отмечает риски: хуже распознаются региональные варианты жестов, сложная грамматика, мимические смыслы, а модель может генерировать текст, когда пользователь вовсе не жестикулирует.
Что это значит для продукта
Для рынка мобильных приложений SL2T — сигнал, что камера окончательно становится полноценным интерфейсом ввода. Сценарий «диктовка → камера → текст» снимает барьер у пользователей, которые раньше выпадали из цифровых сервисов: на Pixel 11 жестовый ввод идёт как системная функция, а не как отдельное приложение, и разработчикам сторонних сервисов не нужно проектировать его самостоятельно.
Стоит следить за двумя вещами. Первая — расширение языков: пока поддерживается только ASL с выходом на английский, мультиязычность обещана. Вторая — появление открытого API или координатной модели для разработчиков. Если Google откроет этот слой, жестовый ввод быстро появится в нишевых сценариях — от видеозвонков и мессенджеров до медтех-сервисов и образовательных платформ.