Ученые крупнейшего банка представили модели искусственного интеллекта, способные распознавать русский жестовый язык

Ученые разработали модели ИИ, способные распознавать русский язык жестов

icon 23/11/2023
icon 19:41
Ученые крупнейшего банка представили модели искусственного интеллекта, способные распознавать русский жестовый язык

Автор: Freepik Company S.L., источник фото.

Freepik Company S.L.

На базе одной из моделей были обучены нейросети для распознавания американского жестового языка, которые заняли первую строчку в публичном рейтинге WLASL-2000. Нейросетевые модели, позволяющие распознавать русский жестовый язык, представил Сбер.

Команда Vision RnD (из Управления экспериментальных систем машинного обучения) в SberDevices, разрабатывающая одно из таких решений, первой в мире представила прототип общения с генеративной языковой моделью при помощи жестового языка в открытом доступе. Это стало возможно благодаря использованию GigaChat API, программного интерфейса доступа к сервису GigaChat. Генеративная модель GigaChat сама, без дополнительных преобразований, понимает контекст распознанных жестов. Например, распознанные отдельные слова: «Я Идти Улица Гулять» сервис сам преобразовывает в корректную фразу: «Я пошел гулять на улицу», сохраняя контекст передачи информации.

Текущая версия модели позволяет распознавать более 2500 жестов, включая понимание дактиля (произношение слов по буквам) и возможность распознавать составные жесты. Кроме того, модель понимает терминологию по темам банковской сферы, транспорта, животных, и даже несколько слов из сферы медицины и образования. Этот объем покрывает существенную часть словаря русского жестового языка, позволяя создавать сервисы с нужным прикладным применением.

На базе этой модели были обучены нейросети для распознавания американского жестового языка, которые заняли первую строчку в публичном рейтинге WLASL-2000. Достичь такого результата позволило использование самого разнообразного и большого в мире датасета для распознавания русского жестового языка — Slovo. Датасет и обученная на нем модель выложены в открытый доступ. 

Другая команда исследователей, из подразделения Sber AI во благо общества, разработала и опубликовала в открытом доступе легкую модель распознавания жестового языка, не требовательную к вычислительным ресурсам. Модель работает на CPU, что снижает себестоимость решений, создаваемых на ее основе. Это дает возможность широкому кругу разработчиков проектировать инклюзивное программное обеспечение, например, продукты и сервисы для коммуникации или инструменты для изучения жестового языка. На сегодняшний день алгоритм распознает 1600 жестов и преобразовывает в слова до трёх жестов в секунду на стандартных персональных компьютерах. В 2024 году планируется тестирование и внедрение модели распознавания русского жестового языка и решений на ее основе в ряде регионов России.