Inteligência artificial para reconhecimento de língua de sinais

Letícia Maria Gonçalves de Morais

Universidade Federal Rural do Semi-Árido

Welizangela Moreira Almeida

Universidade Estadual do Rio Grande do Norte

Náthalee Cavalcanti de Almeida Lima

Universidade Federal Rural do Semi-Árido

Rosana Cibely Batista Rego

Universidade Federal Rural do Semi-Árido

https://orcid.org/0000-0001-5997-1221

Palavras-chave: Inteligência Artificial, Visão Computacional, Aprendizado de Máquina, Libras, Tradução


Resumo

A Língua Brasileira de Sinais (Libras) é reconhecida como a primeira língua da comunidade surda brasileira e considerada uma língua nacional pelo Estado brasileiro. Entretanto, a baixa difusão entre pessoas ouvintes acarreta dificuldades no processo de inclusão das pessoas surdas na sociedade, inserindo-as em um grupo linguístico-cultural minoritário. O principal objetivo deste trabalho foi reduzir a barreira de comunicação entre pessoas surdas e ouvintes por meio da criação de um algoritmo de detecção e tradução da Libras para a Língua Portuguesa de baixo custo computacional, visando promover ambientes mais inclusivos e possibilitar o acesso a direitos fundamentais para indivíduos com algum nível de surdez. Foram aplicadas técnicas de aprendizado de máquina para a detecção e tradução automática da Libras, utilizando os frameworks scikit-learn, MediaPipe e a linguagem de programação Python 3. Buscando um algoritmo de baixo custo computacional, empregou-se o MediaPipe para a detecção e extração de pontos de referência tridimensionais do corpo do sinalizador a partir de imagens bidimensionais. Para determinar o melhor desempenho, compararam-se modelos de aprendizado de máquina treinados sob duas abordagens: a primeira utilizando apenas pontos de referência das mãos, e a segunda considerando também os pontos de referência da face e do corpo. Os pontos foram extraídos de três conjuntos de dados, totalizando 44 classes distintas. Entre os modelos testados, aqueles treinados com a segunda abordagem apresentaram melhores métricas de desempenho, destacando-se o modelo Random Forest, que obteve acurácia, precisão, recall e F1-score de 99,56%. Os resultados indicam que a inclusão de pontos de referência do corpo e da face melhora significativamente o desempenho dos modelos em comparação ao uso exclusivo das mãos. Além disso, demonstram que tecnologias de baixo custo computacional são eficazes no reconhecimento automático de sinais da Libras, representando um avanço promissor na acessibilidade e inclusão social de pessoas surdas.