Imperdibles

BUAP crea repositorio de voz para preservar lengua Yuhmu

¿Qué es el proyecto Zetzoho-Yuhmu Speech Dataset?

Por Jazmín Ramos
20 julio, 2026 9:30 pm

Arturo Olvera López e Iván Olmos Pineda, catedráticos e investigadores de la Facultad de Ciencias de la Computación (FCC) de la BUAP, desarrollan el proyecto Zetzoho-Yuhmu Speech Dataset, un repositorio de acceso libre orientado al estudio de lenguas con pocos recursos y en riesgo de desaparecer, como el Yuhmu, variante de la lengua Otomí.

El conjunto de datos está diseñado para apoyar la investigación en reconocimiento automático del habla (ASR, por sus siglas en inglés) y el análisis de la pronunciación en escenarios donde los datos lingüísticos disponibles son limitados.

De acuerdo con los investigadores, el repositorio también sienta una base para el desarrollo de sistemas de retroalimentación de pronunciación aplicables a procesos de aprendizaje de idiomas, además de fortalecer los esfuerzos de preservación y documentación de las lenguas indígenas en México.

En el proyecto colaboran también Eric Ramos-Aguilar, Ricardo Ramos-Aguilar y Daniel Sánchez-Ruiz, adscritos a la Unidad Profesional Interdisciplinaria de Ingeniería del Instituto Politécnico Nacional, campus Tlaxcala (UPIIT-IPN).

“El repositorio es de libre acceso y puede ser de mucha utilidad para la comunidad que hace investigación relacionada al procesamiento del lenguaje natural, considerando lenguas indígenas en México que actualmente están poco representadas respecto a la cantidad de personas hablantes de la lengua”, señaló Arturo Olvera López.

El conjunto de datos de voz de Zetzoho-Yuhmu puede consultarse de manera pública en el repositorio alojado en GitHub.

Artículos Relacionados

Back to top button