Gboard навчиться розпізнавати мову жестів за допомогою камери телефону

Google планує значне вдосконалення для своєї клавіатури Gboard, яке може стати ключовим досягненням у сфері доступності. Компанія працює над функцією Sign-to-Text, що дозволить перетворювати рухи рук, зафіксовані камерою смартфона, безпосередньо в текст.
Про це інформує видання Android Authority.
Штучний інтелект в дії
Фахівці Google DeepMind тривалий час працювали над розробкою інструментів штучного інтелекту для інтерпретації жестової мови, і ці напрацювання тепер інтегровані в останню бета-версію Gboard.
Нова система побудована на базі передової моделі SignGemma, представленої минулого року. Вона поєднує можливості машинного зору та потужність нейронних мереж для розпізнавання складних жестів у реальному часі.
Конфіденційність та технічні аспекти
Google застосувала гібридну схему функціонування для забезпечення захисту персональних даних користувачів:
- обробка відео здійснюється безпосередньо на смартфоні, виділяючи лише ключові дані про рухи та жести;
- після цього координати надсилаються до хмарного сервісу Google для остаточного аналізу та розпізнавання слів.
Такий підхід гарантує, що відеозаписи обличчя та навколишнього середовища користувача не зберігаються на пристрої, що значно підвищує рівень конфіденційності.
Аналіз програмного коду дозволив виявити системні підказки, які допомагатимуть оптимізувати процес: «відійдіть трохи далі», «перемістіться у світліше місце» або «тримайте руки в кадрі для кращої видимості».
Залишається відкритим питання щодо підтримки різних мовних варіантів жестової мови, оскільки, наприклад, американська мова жестів (ASL) істотно відрізняється від української, британської чи інших світових діалектів.
Незважаючи на те, що функція ще знаходиться на етапі розробки, вона має потенціал стати найважливішим інструментом доступності в історії Gboard, відкриваючи нові можливості для вільного спілкування мільйонів людей.
За матеріалами: Телеканал 24
# Google# Технології
Місце для вашої реклами
<span
