Debido a labores de actualización y migración del repositorio a una versión más reciente, el sistema permanecerá disponible únicamente para consulta hasta nuevo aviso. Agradecemos su comprensión.
Compartir
Título
Análisis comparativo de modelos de reconocimiento de sonido para la clasificación de llantos de bebés:aplicaciones en el monitoreo y diagnóstico infantil
Autor(es)
Director(es)
Palabras clave
Llanto infantil
Aprendizaje automático
Clasificación automática
Transformer
Baby crying
Deep learning
Automatic classification
Clasificación UNESCO
1203.10 Enseñanza Con Ayuda de Ordenador
1203.17 Informática
3201.05 Psicología Clínica
Fecha de publicación
2025-07
Resumen
[ES]El llanto infantil es clave para la monitorización del estado de salud de los bebés. La clasificación automática del llanto puede
ayudar en la detección temprana de patologías y en la toma de decisiones clínicas, especialmente en entornos como las
Unidades de Cuidados Intensivos Neonatales (UCIN). Este trabajo presenta un análisis comparativo de cinco modelos de
clasificación (Máquina de vectores de soporte (SVM), Random Forest, redes neuronales convolucionales, redes neuronales
recurrentes bidireccionales y Transformer) entrenados sobre espectrogramas de Mel para la categorización de cinco tipos de
llanto (Hambre, Dolor, Asfixia, Normal y Sordo). Los resultados muestran que Transformer y SVM ofrecen las mejores
prestaciones, con balanced accuracy superiores al 88%, seguidos de Random Forest. El estudio confirma la eficacia de las
representaciones espectrales densas y destaca la necesidad de avanzar hacia sistemas robustos y explicables para su
integración en entornos clínicos y domésticos. [EN]Infant crying is key to monitoring the health status of infants. Automatic classification of crying can help in the early detection of
pathologies and in clinical decision making, especially in settings such as Neonatal Intensive Care Units (NICU). This paper
presents a comparative analysis of five classification models (Support Vector Machine (SVM), Random Forest, Convolutional
Neural Networks, Bidirectional Recurrent Neural Networks and Transformer) trained on Mel spectrograms for the
categorization of five types of cry (Hungry, Pain, Choking, Normal and Deaf). The results show that Transformer and SVM offer
the best performance, with balanced accuracies above 88%, followed by Random Forest. The study confirms the effectiveness of
dense spectral representations and highlights the need to move towards robust and explainable systems for integration in
clinical and home environments.
Descripción
Trabajo Fin de Máster. Máster Universitario en Sistemas Inteligentes
URI
Aparece en las colecciones













