SignSpeak: Proyecto basado en LENSEGUA

SignSpeak es un proyecto desarrollado a partir de LENSEGUA (Lengua de Señas de Guatemala), orientado a facilitar la comunicación entre personas sordas y oyentes mediante el reconocimiento de señas y su traducción a texto y voz.

Características

LENSEGUA: Base del sistema.

Señas manuales: Detecta señas realizadas con una o dos manos.

Reconocimiento de gestos: Identifica las señas mediante visión por computadora.

IA: Clasifica las señas utilizando un modelo de Random Forest.

TTS: Convierte el texto generado en voz.

Interfaz gráfica: Muestra la seña detectada, el nivel de confianza y el estado del sistema.

Controles: Permite pausar la reproducción, activar o desactivar la voz, limpiar el texto, eliminar caracteres y salir del programa mediante el teclado.

Cómo funciona

1. La cámara captura la imagen en tiempo real.

2. MediaPipe detecta la mano y extrae sus puntos clave.

3. Los datos son procesados por el modelo de inteligencia artificial.

4. El sistema identifica la seña y muestra su nivel de confianza.

5. La seña reconocida se agrega a una cadena de texto.

6. El texto puede reproducirse mediante TTS y controlarse utilizando los controles del sistema.

Pipeline del sistema

Pipeline actualizado del sistema SignSpeak

Demo del Sistema

En el siguiente video se muestra el funcionamiento del sistema SignSpeak, donde se realiza el reconocimiento de señas en tiempo real para su debida traducción.

Tecnología

MediaPipe, OpenCV, Random Forest, Inteligencia Artificial, Programación Orientada a Objetos (POO), Dataset, Cámara web y TTS (Text To Speech).

Avances del Proyecto

Durante el desarrollo del proyecto se reestructuró completamente la arquitectura del sistema mediante la implementación de programación orientada a objetos, organizando el código en módulos, clases y métodos para mejorar su mantenimiento y escalabilidad. Se desarrollaron los módulos AppController, encargado de controlar el funcionamiento general del programa, App, responsable de la interfaz gráfica, y Main, encargado de integrar todos los módulos del sistema. Asimismo, se implementó la conversión de texto a voz (TTS), se optimizó el reconocimiento de señas incrementando la precisión del modelo y se mejoró la interfaz gráfica incorporando la visualización de la seña detectada, el nivel de confianza y el estado del programa. Finalmente, se añadieron controles mediante teclado para pausar la reproducción de voz, activar o desactivar el TTS, limpiar el texto, eliminar caracteres y finalizar la aplicación.

Resultados

Accuracy del modelo

0.9619

Muestras evaluadas

5960

Señas reconocidas

23

Clases detectadas:

A, B, C, D, E, G, H, I, K, L, M, N, O, P, Q, R, T, U, V, W, X, Y, Ñ

Equipo

Danna

Danna

Karen

Karen

Eduardo

Eduardo

Japhet

Japhet

Alejandra

Alejandra

Meredith

Meredith

Allan

Allan

Yefry

Yefry

Brandon

Brandon

Airverson

Airverson

Gloria

Gloria

Alisson

Alisson

Cristian

Cristian

Sylvia

Sylvia

Frederick

Frederick

Cesar

Cesar

Anderson

Anderson

Nathalia

Nathalia

Samuel

Samuel

Jaime

Jaime