scieee AI-readable full text Open interactive document viewer

Reconocimiento de emociones mediante el análisis de señales de voz

Berdugo Rodríguez, Elena

Abstract

La comunicación humana está profundamente condicionada por las emociones, que desempeñan un papel fundamental a la hora de determinar cómo se transmiten y perciben los mensajes. El habla, junto con otros elementos como las expresiones faciales o el lenguaje corporal, juegan un papel fundamental en la expresión emocional. En los últimos años, el reconocimiento automático de las emociones en el habla (SER, por sus siglas en inglés “Speech Emotion Recognition”) se ha convertido en un campo de investigación crucial para mejorar la interacción humano-computadora, permitiendo intercambios más naturales e intuitivos entre personas y máquinas. En este estudio se presenta el diseño y desarrollo desde cero de un sistema de reconocimiento de emociones por voz. Se empieza por un enfoque teórico, describiendo todas y cada una de las fases que interfieren en este proceso y ofreciendo una revisión crítica del estado del arte con el fin de identificar los desafíos actuales y abrir camino a futuras vías de investigación. Posteriormente, se realiza la conformación técnica del sistema, siguiendo un anásis experimental para construir un modelo capaz de alcanzar resultados competitivos. Un aspecto central de este apartado ha sido la elección y exploración de las bases de datos, así como la selección de las características a identificar. Se han valorado factores como la calidad, variedad, equilibrio y condiciones de grabación. Estos elementos han determinado la forma de extraer y adaptar posteriormente los rasgos, lo que ha permitido captar matices emocionales adaptados a dicha base de datos (RAVDESS). Desde el punto de vista experimental, el trabajo explora una variabilidad de escenarios en base a distintas técnicas y herramientas, con el fin de establecer un camino hacia un modelo óptimo. Se han realizado análisis en el número de características extraídas, las emociones detectadas, los clasificadores utilizados, etc. El desarrollo de arquitecturas basadas en redes neuronales profundas, junto al uso de modelos preentrenados, han marcado un punto de inflexión en esta área. Por ello, también se ha incluido su estudio y análisis, con el objetivo de establecer una comparación de rendimientos que permita ubicar nuestro sistema dentro del contexto actual. Con vistas a investigaciones futuras, los esfuerzos podrían centrarse en ampliar esta investigación a bases de datos con emociones más naturales y espontáneas, abriendo la puerta a aplicaciones que funcionen de forma fiable en entornos cotidianos.

Full text

Equation Chapter 1 Section 1 Trabajo Fin de Grado Grado en Ingeniería de las Tecnologías de Telecomunicación Reconocimiento de emociones mediante el análisis de señales de voz Autor: Elena Berdugo Rodríguez Tutor: María Auxiliadora Sarmiento Vega Dpto. Teoría de la Señal y Comunicaciones Escuela Técnica Superior de Ingeniería Universidad de Sevilla Sevilla, 2025 iii Trabajo Fin de Grado Grado en Ingeniería de las Tecnologías de Telecomunicación Reconocimiento de emociones mediante el análisis de señales de voz Autor: Elena Berdugo Rodríguez Tutor: María Auxiliadora Sarmiento Vega Profesor titular Dpto. de Teoría de la Señal y Comunicaciones Escuela Técnica Superior de Ingeniería Universidad de Sevilla Sevilla, 2025 v Trabajo Fin de Grado: Reconocimiento de emociones mediante el análisis de señales de voz Autor: Elena Berdugo Rodríguez Tutor: María Auxiliadora Sarmiento Vega El tribunal nombrado para juzgar el Proyecto arriba indicado, compuesto por los siguientes miembros: Presidente: Vocales: Secretario: Acuerdan otorgarle la calificación de: Sevilla, 2025 El Secretario del Tribunal vii A mis maestros A mi familia ix Agradecimientos A todas las personas que han influido en mi enseñanza, forjando en mí un espíritu perseverante y trabajador. A todos los compañeros que han amenizado el camino hasta aquí y que llevaré perdurablemente conmigo. A mis padres, por conformar el pilar que me sostiene en la sombra y el origen de mi fe. A mi hermano, por mantener una luz incansable de amor e inspiración. A mi abuela, por ser el lujo que sigo abrazando cada día. Y a mí misma, por demostrarme tantas veces durante estos años que sí, que siempre se puede. Elena Berdugo Rodríguez Sevilla, 2025 5.2.3 Energía 25 5.2.4 Distribuiciones y correlaciones 26 5.2.5 Embeddings 27 5.3 Selección y clasificación de características 29 6 Entrenamiento y validación del modelo 31 6.1 Tipos de validación 32 6.2 Clasificadores 33 6.3 Resultados experimentales y evaluación del rendimiento 38 6.3.1 Conformación Sistema Base 39 6.3.2 Variación del número de emociones clasificadas 43 6.3.3 Uso de embeddings 47 7 Conclusiones y discusión final del sistema 51 7.1 Líneas futuras 53 Referencias 55 xvii ÍNDICE DE TABLAS Tabla 1. Comparación de bases de datos del habla emocional 9 Tabla 2. Esquema representativo de la iteración de Cross-Validation para 5 folds 32 Tabla 3. Características de los clasificadores de Redes Neuronales disponibles en Classification Learner de Matlab 37 Tabla 4. Matriz de confusión estándar para problema de clasificación binario 38 Tabla 5. Rendimiento del sistema en función al nº de MFCCs 39 Tabla 6. Precisión del sistema para validación cruzada 8 emociones 40 Tabla 7. Precisión del sistema para validación manual 8 emociones 41 Tabla 8. Rendimiento del sistema para 6 emociones 44 Tabla 9. Clasificación de las 8 emociones de RAVDESS en función a su valencia y activación 45 Tabla 10. Rendimiento del sistema para 4 emociones 45 Tabla 11. Rendimiento del sistema para 2 emociones 46 Tabla 12. Rendimiento del sistema VGGish para 8 emociones 48 Tabla 13. Rendimiento del sistema OpenL3 para 8 emociones 49 Tabla 14. Rendimiento del sistema OpenL3 para 2 emociones 50 Tabla 15. Comparación de rendimientos entre sistema propio y redes neuronales preentrenadas 52 xix ÍNDICE DE ILUSTRACIONES Ilustración 1. Distribución de las emociones básicas en las dimensiones excitación-valencia [7] 4 Ilustración 2. Categorías de características extraídas del habla que se utilizan en el reconocimiento de emociones. 11 Ilustración 3. Categorías de características acústicas y no acústicas para el análisis 13 Ilustración 4. Categorías de modelos de clasificación usados en SER. 14 Ilustración 5. Ejemplo de grabaciones de las emociones en audio [48] 13 Ilustración 6. Descomposición de una señal mediante la Transformada de Fourier [52] 18 Ilustración 7. Espectrograma de Mel correspondiente a una señal de audio [53] 19 Ilustración 8. Proceso extracción MFCCs 19 Ilustración 9. Señal de voz antes y después de pre-énfasis [54] 20 Ilustración 10. Framing en MFCC [55] 20 Ilustración 11. Hamming Windowing [53] 21 Ilustración 12. Banco de filtros de Mel 22 Ilustración 13. Fase FFT y filtros de Mel del proceso MFCC [56] 22 Ilustración 14. Fase Log del proceso MFCC [56] 22 Ilustración 15. Distribución del tono en las muestras de datos de RAVDESS 25 Ilustración 16. Distribución de la energía en escala logarítmica 26 Ilustración 17. Relación de energía y tono para la base de datos RAVDESS 27 Ilustración 18. Representación de las características obtenidas mediante VGGish a lo largo del tiempo [58] 28 Ilustración 19. Representación de las características obtenidas mediante OpenL3 a lo largo del tiempo [59] 29 Ilustración 20. Pantalla inicio de sesión Classification Learner de Matlab 32 Ilustración 21. Precisión alcanzada por distintos clasificadores aplicados al conjunto de datos de emociones utilizando como características MFCC, energía y tono. 34 Ilustración 22. Precisión alcanzada por distintos clasificadores aplicados al conjunto de datos de emociones utilizando como características MFCC, energía y tono. 34 Ilustración 23. Esquema de funcionamiento Support Vector Machine 35 Ilustración 24. Esquema de decisión del algoritmo KNN 36 Ilustración 25. Esquema estructural capas de las redes neuronales 36 Ilustración 26. Esquema sistema de clasificación para árboles de deción 38 Ilustración 27. Rendimiento del sistema en función del nº MFCCs con Fine KNN 40 Ilustración 28. Matriz de confusión para el clasificador Fine KNN en validación cruzada de 8 emociones 41 Ilustración 29. Matriz de confusión para el clasificador Fine KNN en validación manual de 8 emociones 42 Ilustración 30. Matriz de confusión para el clasificador Bagged Trees con n propiedades estadísticas de MFCCs 43 Ilustración 31. Matriz de confusión para el clasificador Fine KNN en validación manual de 6 emociones 44 Ilustración 32. Representación de las agrupaciones emocionales en función de su valencia y su activación 45 Ilustración 33. Matriz de confusión para el clasificador Fine KNN en validación manual de 4 emociones 46 Ilustración 34. Matriz de confusión para el clasificador Fine KNN en validación manual de 2 emociones 47 Ilustración 35. Matriz de confusión para el clasificador Cubic SVM en validación manual de 8 emociones usando embeddings VGGish 48 Ilustración 36. Matriz de confusión para el clasificador Fine KNN en validación manual de 8 emociones usando embeddings OpenL3 49 Ilustración 37. Matriz de confusión para el clasificador Fine KNN en validación manual de 2 emociones usando embeddings OpenL3 50 1 1 INTRODUCCIÓN Y OBJETIVO a comunicación entre personas en el mundo real está claramente definida por las emociones humanas. Según la RAE, una emoción es “una alteración del ánimo intensa y pasajera, agradable o penosa, que va acompañada de cierta conmoción somática”. Las emociones se expresan mediante numerosas vías tales como las expresiones faciales, el lenguaje corporal, el comportamiento social y el habla. Es esta última la que muestra con mayor claridad las emociones humanas, según Sliwa (2017) [1]. Esto ha motivado el desarrollo de sistemas capaces de reconocer emociones en el habla, una rama del procesamiento del lenguaje natural conocida como Speech Emotion Recognition (SER). El reconocimiento de emociones en el habla resulta una cuestión bastante significativa para la mejora de la comunicación humano-computadora. La búsqueda de una conexión más natural e intuitiva en estas relaciones incita a la optimización de los componentes que la conforman, así como la importancia en el desarrollo de algoritmos y sistemas de aprendizaje máquina, que buscan un mayor acercamiento al comportamiento de la mente humana. El reciente aumento de estudios al respecto se ve motivado por la aplicabilidad de este conocimiento en una amplia variedad de campos: desde sistemas de asistencia virtual, servicios de atención al cliente y robótica social hasta entornos tan sensibles como la educación emocional, la salud mental o el acompañamiento de personas mayores, donde la detección precisa de emociones puede ser crucial [2]. Este proyecto busca contribuir a esta línea de investigación mediante el desarrollo experimental de un sistema SER desde cero, analizando las distintas fases involucradas, las decisiones de diseño y la evolución de los resultados obtenidos. L La voz humana es el instrumento más perfecto de todos. - Arvo Pärt - Introducción y objetivo 2 Al analizar las señales de voz, siguiendo la metodología SER, nos centraremos exclusivamente en cómo se expresa el mensaje, es decir, en los aspectos acústicos y prosódicos que permiten determinar el estado emocional del hablante sin la necesidad de interpretar el significado de sus palabras ni su identidad. Este enfoque resulta realmente útil en contextos donde el contenido semántico no es relevante o no muestra la verdadera emoción del hablante. Del mismo modo, no generaremos distinción entre sexos, centrándonos únicamente en las características deducidas a partir del sonido de la voz. La presente memoria se organiza en varios capítulos, que se detallan a continuación. En primer lugar, se realiza una contextualización teórica, estableciendo una base sólida sobre la que asentar los conocimientos necesarios para la posterior aplicación práctica. En el estado del arte se describen en detalle todas las fases que intervienen en los sistemas de reconocimiento de emociones en el habla (SER), además de la clasificación de los distintos tipos de bases de datos disponibles para este tipo de investigaciones. Posteriormente, se expone la justificación teórica de la base de datos seleccionada para el sistema. En el apartado de algoritmo y metodología, nos centramos en los procesos que conforman cada fase del sistema, pero abordados desde una perspectiva aplicada, a diferencia del enfoque más conceptual de los capítulos anteriores. Se comienza a enfocar la memoria hacia la construcción de nuestro propio sistema SER, explicando las características acústicas que serán evaluadas, las posibles modificaciones en la práctica y las técnicas de preprocesamiento aplicadas a los datos antes de ser procesados por los modelos. En el apartado experimental, se presenta la investigación empírica llevada a cabo mediante el uso de MATLAB y la herramienta Classification Learner. Se describen los procedimientos de entrenamiento y evaluación realizados para diseñar un sistema con resultados competitivos, incluyendo una comparación con modelos más avanzados como los basados en redes neuronales. De este modo, se posiciona nuestro sistema dentro del marco actual de rendimiento y se establece una valoración crítica y fundamentada de los resultados obtenidos. Finalmente, se proponen posibles líneas futuras de investigación que podrían reforzar y ampliar el alcance del presente estudio, abordando casuísticas que aportarían robustez al sistema creado. 3 2 LAS EMOCIONES xisten más de una definición de emociones, pero los modelos más utilizados para representar las emociones humanas para SER (Speech Emotion Recognition) son las emociones dimensionales y las categóricas, como se recoge en Grandjean (2008) [3]. Como se indica en Ekman (2013) [4], los psicólogos establecen seis categorías básicas de emociones: tristeza, felicidad, miedo, ira, disgusto y sorpresa. Otro tipo de emociones surgirían de las iniciales. La idea de emoción dimensional establece valores para cada una de ellas, es decir, todas las emociones existentes tienen cabida en un espacio y son ubicadas con coordenadas en el mismo. Pueden disponerse dos o tres dimensiones, excitaciónvalencia (2D) (Ilust. 1) o excitación-valencia-dominancia (3D) [5]. El eje de valencia indica el grado de la emoción, siendo positivo el más alto y descendiendo hasta llegar a negativo. El eje de excitación refleja el nivel de agitación de las emociones. El tercer eje, de dominancia, muestra el alto o bajo poder emocional [6]. E Cualquier emoción, si es sincera, es involuntaria. - Mark Twain - Las emociones 4 Ilustración 1. Distribución de las emociones básicas en las dimensiones excitación-valencia [7] Los componentes principales para el reconocimiento de emociones en el habla son el procesamiento de la señal acústica proporcionado por un conjunto de datos, la extracción de características y la selección y clasificación de las mismas. En un inicio, la mayor complejidad en la construcción de los modelos computacionales del SER residía en la extracción de características relevantes de las señales de voz [8] y el diseño de clasificadores apropiado [9]. La mayoría de estudios al respecto discutían estos cuatro elementos clave en algoritmos de reconocimiento de emociones. El estudio de Ayadi [9] cubrió las características y los clasificadores del SER, haciendo especial hincapié en las bases de datos. Koolagudi y Rao [10] realizaron también investigaciones sobre dichos elementos, donde agruparon las bases de datos en tres categorías (actuadas, provocadas y naturales). Sin embargo, el curso de las investigaciones en este ámbito ha evolucionado gracias al desarrollo de redes neuronales profundas, que permiten trabajar directamente con las señales de audio, capaces de aprender automáticamente información relevante sin necesidad de definirlas previamente[11]. Las arquitecturas más usadas actualmente son las redes convolucionales, que detectan patrones espaciales en los espectrogramas, las redes recurrentes como LSTM o GRU, que permiten capturar la información temporal, y las combinaciones de ambas, que aprovechan las ventajas de cada una [12] En los últimos años ha crecido el uso de los modelos basados en transformers, ya que son capaces de modelar relaciones de largo alcance y han demostrado muy buenos resultados en tareas relacionadas con el procesamiento del habla [13]. Por otro lado, cada vez es más común el uso de modelos preentrenados como wav2vec 2.0 [14], HuBERT [15] o Whisper [16]. Estos modelos se han entrenado con grandes cantidades de datos y es posteriormente cuando se ajustan a tareas específicas, como el SER. Resulta especialmente útil porque las bases de datos de emociones suelen ser pequeñas, es decir, no se dispone de una gran cantidad ni variedad de datos para entrenar modelos desde cero. Por tanto, gracias al transfer learning, se puede aprovechar ese entrenamiento previo y obtener buenos resultados incluso con conjuntos de datos más pequeños [17]. En definitiva, los modelos actuales para el reconocimiento de emociones en señales de voz se basan sobre todo en un enfoque end-to-end, donde la red neuronal se encarga de todo el proceso, desde la señal de entrada hasta la clasificación final. Esto ha permitido mejorar mucho el rendimiento respecto a los enfoques tradicionales. 5 3 ESTADO DEL ARTE l reconocimiento de emociones en el habla (SER) es un campo de estudio que ha experimentado una notable evolución en los últimos años gracias a los avances en inteligencia artificial y procesamiento de señales. Para entender su progreso, resulta fundamental revisar las investigaciones previas, comparar distintos enfoques y analizar cómo han ido mejorando los resultados con el tiempo. En este apartado se explorarán diversas publicaciones, estudios e investigaciones que han abordado el problema del SER desde diferentes perspectivas. Se analizarán puntos clave como el uso de bases de datos, los métodos de extracción de características y los algoritmos de clasificación. Además, se estudiará cómo la aplicación de redes neuronales profundas, en particular arquitecturas convolucionales y recurrentes, ha permitido mejorar la precisión de estos sistemas. Se realizará una comparación de los artículos más importantes al respecto, identificando los avances que han tenido lugar y las diferencias que han propiciado distintos resultados. También se tratarán de describir los desafíos actuales y explorar posibles líneas de investigación futuras. A través de la comparación de distintos estudios, se busca obtener una visión clara del panorama actual del SER y su evolución en los últimos años. 3.1 Base de datos La base principal para construir y testear un modelo es un conjunto de datos que ofrezca las diferentes emociones que se desean entrenar. Para conseguir un estudio más amplio y con una mayor fiabilidad no basta con un solo individuo, sino que se necesitan datos de numerosos hablantes, con diferentes voces y estilos de expresión. La recopilación de todas estas muestras conforma lo que conocemos como base de datos. Resulta de vital importancia seleccionar bases de datos adecuadas para el reconocimiento de emociones en el habla (SER), E La razón y la emoción no son enemigas, sino aliadas. - Antonio Damasio - Estado del arte 12 En el pasado, el enfoque común se centraba en características prosódicas, más específicamente en tono, duración e intensidad, y con menos frecuencia en características de calidad vocal como la relación armónico-ruido (HNR), jitter o shimmer. Hace unos años, se solía emplear un conjunto de características comparativamente pequeño (unas pocas decenas). Sin embargo, actualmente el gran número de LLD y funcionales ha promovido recientemente la extracción de vectores de características muy grandes, hasta miles de características obtenidas, ya sea por generación analítica de características [22] o, en algunos estudios, por generación evolutiva. Los algoritmos evolutivos son técnicas de optimización inspiradas en los principios de la evolución natural, que consiguen iterativamente crear, evaluar y seleccionar características que mejoran el rendimiento de modelos de aprendizaje automático. Este proceso puede descubrir nuevas características o combinaciones de características que no serían evidentes a través de métodos tradicionales. Realizando una investigación entre los artículos más relevantes, se puede obtener una clasificación en función de las características usadas para cada estudio realizado. En el artículo Schuller et al. (2011) [22], se describe el Desafío de Emociones INTERSPEECH 2009, organizado por Schuller et al., y celebrado junto con INTERSPEECH 2009 en Brighton, Reino Unido. Este desafío fue la primera evaluación pública abierta de sistemas de reconocimiento de emociones basados en el habla con una comparabilidad estricta en la que todos los participantes usaban el mismo corpus y configuraciones idénticas. En este artículo se mencionan características principales como el tono, la frecuencia fundamental y su variación temporal, la intensidad, la amplitud del sonido y su percepción auditiva, la duración del mensaje de voz, la calidad vocal que mide propiedades del tracto vocal como suavidad o aspereza, el espectro que refleja los formantes modelando el contenido de audio, y vocalizaciones no lingüísticas. Estas características son coherentes con las mencionadas en el artículo Jahangir et al. (2021) [20], que también destaca las características cualitativas (estructura temporal, tono, intensidad y nivel de voz) y continuas (energía, tono, formantes y tasa de cruces por cero). Además, ambos estudios Jahangir et al. (2021) [20] y Lieskovská et al. (2021) [21] enfatizan la importancia de las características espectrales, como los coeficientes cepstrales de frecuencia Mel (MFCC), coeficientes predictivos lineales (LPC) y predicción lineal perceptual (PLP), y mencionan la relevancia de características basadas en el operador de energía de Teager, que detectan cambios en la energía subyacente en la señal de habla y pueden capturar la variabilidad emocional debido a su capacidad para detectar cambios en la energía asociados con diferentes estados emocionales. El artículo Lieskovská et al. (2021) [21] detalla que las características para el reconocimiento de emociones incluyen descriptores acústicos divididos en descriptores de bajo nivel (LLDs) y características derivadas, como MFCCs y descriptores prosódicos (tono, intensidad, ritmo y duración), alineándose con el estudio recogido en Fahad (2021) [23], que también menciona estas características junto con las basadas en wavelet, calidad vocal, no lineales y aprendizaje profundo. Fahad (2021) [23] proporciona una clasificación detallada, destacando cómo las características prosódicas capturan duración, intensidad y contorno de frecuencia fundamental (F0), útiles para distinguir entre emociones de alta y baja activación, similar a lo mencionado en Schuller et al. (2011) [22]. Además, Fahad (2021) [23] profundiza en las características espectrales que extraen contenido de energía de diferentes bandas de frecuencia, utilizando técnicas como MFCC, LPCC y PLP, lo que también se menciona en Lieskovská et al. (2021) [21]. Ambas fuentes resaltan la importancia de características de calidad vocal, que miden atributos relacionados con las cuerdas vocales, como la vibración y la fluctuación de la voz, y características no lineales que capturan la complejidad de las señales de habla usando análisis dinámico no lineal. Estas incluyen dimensión de correlación, mayor exponente de Lyapunov, exponente de Hurst, complejidad de Lempel-Ziv y medidas de entropía. 13 Reconocimiento de emociones mediante el análisis de señales de voz En los últimos años han cobrado mucha relevancia las características basadas en aprendizaje profundo, conocidas como embeddings, discutidas también en Fahad (2021) [23], donde se menciona el uso de redes neuronales convolucionales (CNN) y redes neuronales de memoria a largo plazo (LSTM) para extraer características jerárquicas de nivel superior. Estas representaciones se obtienen a partir de modelos preentrenados que han aprendido a extraer información de alto nivel directamente de la señal de audio o de su representación espectral. En lugar de definir manualmente qué características son importantes, estos modelos generan automáticamente vectores numéricos que resumen la información relevante para tareas como la clasificación emocional. Algunos ejemplos de embeddings muy utilizados son VGGish, un modelo basado en VGG entrenado con grandes cantidades de datos de audio, y OpenL3, que genera representaciones de audio a partir de redes entrenadas con objetivos multimodales. Ambos están disponibles en Matlab, lo que nos permitirá usarlos durante este estudio. Las investigaciones de Fahad (2021) [23] y Jahangir et al. (2021) [20] también coinciden en la relevancia de las vocalizaciones no lingüísticas (como la risa y el llanto) para el reconocimiento de emociones. Ilustración 3. Categorías de características acústicas y no acústicas para el análisis En cuanto a las características no acústicas, el artículo Fahad (2021) [23] menciona características lingüísticas extraídas del texto asociado con el habla, como la transcripción del discurso u otros textos relacionados, incluyendo bolsa de palabras (BOW), frecuencia de términos (TF), frecuencia de términos inversa de documento (TF-IDF), información auto-referencial (SRI) y embebido de palabras. También se mencionan características de discurso que determinan el involucramiento del hablante en conversaciones, incluyendo actos de habla como repetición, reformulación y rechazo de la enunciación. Además, se destacan las características visuales de vídeo, rostro y gestos, utilizando redes neuronales convolucionales (CNN) para extraer características discriminativas de estos datos visuales, combinándolas con características acústicas para mejorar el rendimiento del reconocimiento de emociones. 3.3 Selección de características La cantidad de características que actualmente se puede extraer de las señales de voz hace que no existan unas preestablecidas que reflejen una emoción. Es por ello necesario un algoritmo de selección que optimice las características extraídas. Se eliminan propiedades que no tienen relación con las emociones e incluso se descartan aquellas que puedan resultar redundantes. De este modo se disminuyen las complejidades computacionales futuras y se mejora la precisión. Se pueden aplicar multitud de técnicas de clasificación, las cuales se suelen distinguir en supervisadas o no supervisadas. Los métodos categorizados como supervisados utilizan datos etiquetados para guiar el proceso de aprendizaje. La evaluación y selección se basan en la Estado del arte 14 capacidad de predecir correctamente las etiquetas conocidas. Los métodos no supervisados no utilizan etiquetas. Buscan patrones, estructuras o relaciones en los datos basándose únicamente en las características intrínsecas de los datos. Destacaremos las siguientes técnicas de selección de características: • Métodos de filtrado, como algoritmos de correlación, [33]. Estos no incluyen el aprendizaje, es decir, son no supervisados. • Métodos contenedores como selección hacia delante y hacia atrás, [34]. Emplean ML para evaluar la calidad de los subconjuntos de características, son supervisados. • Métodos integrados, [35]. No separan la selección de características del proceso de aprendizaje, son supervisados. 3.4 Clasificación de características Una vez seleccionadas las características, se deben clasificar los datos en base a ellas. En un inicio, las técnicas tradicionales utilizadas para clasificar incluían Redes Bayesianas (BN) o Principio de Máxima Verosimilitud (MLP) y Máquinas de Vectores de Soporte (SVM), [36]. Sin embargo, la señal de voz no es estacionaria. Por lo tanto, algunos estudios consideran que la mejor opción son los clasificadores no lineales como el Modelo de Mezcla Gaussiana (GMM) y el Modelo Oculto de Markov (HMM), [37]. De este modo, podemos decir que los numerosos métodos y algoritmos que se han utilizado en las investigaciones para resolver esta cuestión pueden organizarse en clasificadores aprendizaje tradicional y clasificadores de aprendizaje profundo. Algunos estudios usaron un método híbrido basado en la mezcla de los clasificadores tradicionales con los profundos, como es el ejemplo de Singkul y Woraratpanya (2022) [38]. Podemos observar en el siguiente esquema los diferentes métodos dentro de cada clasificador. Ilustración 4. Categorías de modelos de clasificación usados en SER. No obstante, no existe hasta la fecha un modelo específico que ofrezca un rendimiento superior en todas las condiciones. Cabe destacar que la mayoría de los estudios y artículos hacen uso del clasificador SVM. 15 Reconocimiento de emociones mediante el análisis de señales de voz 3.5 Evaluación de los resultados El último paso del estudio es la evaluación del rendimiento del modelo. Multitud de investigaciones previas determinaban la precisión para medir dicho rendimiento, Pandey (2019) [39], Huang (2019) [40], Hsu (2021) [41]. Sin embargo, esta precisión es óptima cuando los datos están equilibrados, cuestión que resulta un dilema en los sistemas SER. Por lo tanto, no es posible utilizar únicamente la precisión ponderada (WA, Weighted Accuracy), sino que debemos tener en cuenta la precisión no ponderada (UA, Unweighted Accuracy) también. La precisión ponderada (WA) se calcula como la media ponderada de las precisiones de cada clase, teniendo en cuenta el número de muestras de cada clase. Se define como: 𝑊𝐴= ∑𝑛𝑖∙𝑎𝑐𝑐𝑖 𝐶 𝑖=1 ∑𝑛𝑖 𝐶 𝑖=1 donde: - 𝐶 es el número total de clases - 𝑛𝑖 es el número de muestras de la clase 𝑖 - 𝑎𝑐𝑐𝑖 es la precisión obtenida en la clase 𝑖 Por otro lado, la precisión no ponderada (UA) se calcula como la media aritmética de las precisiones por clase, asignando el mismo peso a todas las clases, independientemente del número de muestras. Se expresa mediante: 𝑈𝐴= 1 𝐶∑𝑎𝑐𝑐𝑖 𝐶 𝑖=1 Ejemplos de este criterio de evaluación se observan en estudios como los de Zou (2022) [42], Seehapoch y Wongthanavasu (2013) [43]. La precisión ponderada asigna peso a cada clase en función de su número de muestra. Por el contrario, la precisión no ponderada asigna el mismo peso a todas las clases, independientemente del número de muestras. 3.6 Comparación de líneas de investigación Para poseer una visión más concreta de los estudios realizados en este campo, he seleccionado cuatro de los artículos más relevantes en la materia. Todos ellos han sido mencionados con anterioridad para los diferentes pasos descritos; selección de bases de datos, extracción de características, etc. A continuación, expondré el aprendizaje que se obtuvo de cada uno de ellos, así como los nexos que los relacionan entre ellos mismos. El primer artículo relevante resulta ser Schuller et al. (2011) [22], que analiza el INTERSPEECH 2009 Emotion Challenge, un evento significativo en el campo de reconocimiento de emociones en el habla. Este acontecimiento planteó tres subdesafíos principales: • Audio-only Sub-Challenge: este subdesafío se centraba en la clasificación de emociones utilizando solo características acústicas. Los participantes debían identificar y clasificar las emociones sin hacer uso de ningún otro tipo de información adicional. Esto permitió evaluar el rendimiento de los sistemas basados exclusivamente en el análisis del habla, sin influencias externas. • Transcript Sub-Challenge: a diferencia del primero, este subdesafío se enfocaba en la clasificación de emociones utilizando solo la transcripción textual. El propósito era analizar el contenido verbal, ignorando las características acústicas, y determinar las emociones basándose en el contenido lingüístico de las transcripciones. Este desafío era más complejo, pues las emociones a menudo no se reflejan explícitamente en las palabras, sino en la entonación y la forma del habla. • Audio-Transcript Sub-Challenge: por último, este subdesafío combinaba los dos anteriores, permitiendo el uso tanto de las características acústicas como del contenido textual. Estado del arte 16 La base de datos utilizada fue el FAU Aibo Emotion Corpus, un conjunto de datos compuesto por grabaciones de niños interactuando con un perro robot Aibo. Esta base de datos se seleccionó por su naturaleza multimodal y por la capacidad de capturar interacciones naturales en un entorno controlado, lo que proporcionaba una buena representación de cómo las emociones se manifiestan en el habla en situaciones reales. El evento atrajo a 17 grupos de investigación y resultó en la aceptación de 10 trabajos en la conferencia. A pesar de los límites de tiempo impuestos, reveló varias lecciones importantes. Los grupos interesados pudieron configurar y optimizar sus sistemas rápidamente, aunque muchos solo participaron en uno de los tres subdesafíos. La mayoría de los participantes provenían del campo del reconocimiento de voz, y trabajaron principalmente con características acústicas estándar como los coeficientes cepstrales en las frecuencias de Mel (MFCC). Además, el desafío también demostró el potencial de incorporar diferentes tipos de datos para mejorar el rendimiento del sistema de clasificación emocional. La naturaleza interdisciplinaria del reconocimiento de emociones también destacó la exclusión de investigadores de otras disciplinas, como psicólogos, que no pudieron adaptar rápidamente sus sistemas existentes a las nuevas tareas del desafío. Esto subrayó la necesidad de integrar conocimientos de diversas disciplinas en eventos como este, sugiriendo iniciativas de cooperación en lugar de competencia. La colaboración final entre los participantes demostró ser más efectiva que los esfuerzos individuales, logrando mejoras significativas mediante la votación mayoritaria simple. Además, se resaltó la dificultad de lidiar con escenarios de reconocimiento de emociones no prototípicos en la vida real, indicando que este desafío sigue siendo relevante y complejo. Como resultado del evento, se lanzó el Corpus de Emociones FAU Aibo, proporcionando archivos de audio, transcripciones y etiquetas originales de emociones, lo que ofrece valiosos recursos para la investigación futura en este campo. En términos de métricas de calidad, los sistemas presentados en el INTERSPEECH 2009 Emotion Challenge lograron tasas de acierto de hasta un 65% en la clasificación de las cinco emociones (felicidad, tristeza, ira, miedo y neutralidad). En cambio, el artículo Jahangir et al. (2021) [20] recoge un estudio protagonizado por un notable aumento en el uso de técnicas de aprendizaje profundo (DL) para el reconocimiento de emociones en el habla (SER). Este aumento se debe a las limitaciones del aprendizaje automático tradicional para manejar grandes bases de datos emocionales y al avance en la tecnología de computación. El estudio revisa tanto el procesamiento del habla como las características acústicas convencionales diseñadas a mano, además de explorar las técnicas de aprendizaje profundo para la extracción automática de características en SER. La importancia del pre y post-procesamiento de señales de habla para desarrollar sistemas SER eficientes y robustos es enfatizada. Se identifican necesidades específicas, como el uso de características TEO (Teager Energy Operator) para identificar el estrés en la voz o características acústicas continuas para clasificar la emoción de excitación. Varias técnicas de aprendizaje profundo, incluyendo CNN, RNN, RBM y autoencoders profundos, son discutidas en términos de sus características, fortalezas y limitaciones. Se sugiere que la fusión de características espectrales y continuas puede mejorar la precisión de la clasificación. El estudio también resalta el desarrollo de marcos de software y tecnologías de hardware, como las GPU, para implementar técnicas de aprendizaje profundo en SER, mencionando algunos marcos de software recientemente lanzados como proyectos de código abierto para la comunidad de investigación. Además, se abordan enfoques de entrenamiento, clasificación y evaluación del rendimiento de las técnicas de aprendizaje profundo para SER, discutiendo métodos para evitar el sobreajuste del modelo. Finalmente, se sugieren posibles direcciones para futuras investigaciones, como la integración de sistemas SER con aplicaciones inteligentes de IoT utilizando aprendizaje profundo, el papel del contexto en la investigación de emociones del habla y la fusión del reconocimiento automático de locutores y sistemas SER. Las observaciones presentadas en este estudio podrían ser útiles para el desarrollo arquitectónico futuro en el campo del aprendizaje profundo y los sistemas SER. Los modelos de aprendizaje profundo propuestos por Jahangir et al. (2021) [20] lograron tasas de acierto superiores al 80% en la clasificación de las siete emociones (felicidad, tristeza, sorpresa, disgusto, miedo, ira y neutralidad), utilizando la base de datos Emo-DB (German Emotional Database), demostrando la efectividad de estas técnicas avanzadas en comparación con los métodos tradicionales. 17 Reconocimiento de emociones mediante el análisis de señales de voz El tercer artículo, Lieskovská et al. (2021) [21], muestra que hay una tendencia creciente hacia el uso de arquitecturas de redes neuronales profundas, especialmente convolucionales (CNN), en el reconocimiento de emociones en el habla. Estas arquitecturas pueden aprender a partir de espectrogramas, que son representaciones visuales de los sonidos del habla. Junto con las redes recurrentes, estas arquitecturas forman una base sólida para los sistemas de reconocimiento de emociones en el habla (SER). Con el tiempo, se han desarrollado sistemas SER cada vez más complejos, centrados en identificar tanto contextos emocionales locales (dentro de una frase) como globales (a lo largo de una conversación). Además, se ha comprobado que la inclusión de mecanismos de atención mejora la capacidad de las redes para enfocarse en eventos de audio específicos, lo que aumenta la precisión en la clasificación y localización de emociones en las grabaciones. Aunque el mecanismo de atención puede mejorar el rendimiento de los sistemas SER, su beneficio no siempre es evidente. Los módulos de atención se han convertido en una parte natural de los sistemas SER de hoy en día, aunque no son elementos indispensables para lograr alta precisión o incluso resultados de vanguardia. En este estudio se reportan tasas de acierto cercanas al 75% al clasificar las seis emociones ya descritas (felicidad, tristeza, sorpresa, disgusto, miedo e ira), dando clara evidencia del potencial de las arquitecturas de convoluciones profundas y redes recurrentes para mejorar la precisión del reconocimiento de emociones, evaluados utilizando la base de datos IEMOCAP. Por último, la investigación recogida en Fahad (2021) [23] proporciona una categorización exhaustiva de características tanto acústicas como no acústicas para el reconocimiento de emociones en entornos naturales. Discute la utilidad de diferentes tipos de características para el reconocimiento de emociones y la selección adecuada de características para SER. Se describen nuevas bases de datos desafiantes y sus problemas específicos, y se evalúa el uso de marcos de trabajo de aprendizaje profundo que han demostrado superar la precisión de los métodos convencionales. El estudio también discute los problemas y soluciones relacionados con el aprendizaje profundo en entornos naturales, evaluando la robustez de ciertas características y métodos como características RSS, TEO adaptativo, espectrograma glotal, y métodos de transformación como el whitening transform para el reconocimiento de emociones independiente del texto. También se investigan técnicas para abordar desafíos específicos en entornos no controlados, como la presencia de ruido de fondo, efectos de codecs y distancia del micrófono. Se evalúan técnicas de mejora del habla y características robustas que reducen la degradación de la precisión de reconocimiento en entornos ruidosos. Además, la investigación se centra en la selección de características para reducir el efecto del códec y mejorar la precisión del reconocimiento en entornos de distancia. Finalmente, se explora el área emergente de SER continua, que presenta oportunidades futuras para la investigación. Los enfoques tratados en este estudio lograron tasas de acierto de hasta un 85% en la clasificación de las ocho emociones (felicidad, tristeza, sorpresa, disgusto, miedo, ira, aburrimiento y neutralidad). Comparando estos cuatro artículos, se puede observar una evolución en el enfoque del reconocimiento de emociones en el habla. Mientras que el evento INTERSPEECH 2009 Emotion Challenge (Schuller et al. (2011) [22]) demostró la efectividad de la colaboración y subrayó la necesidad de enfoques interdisciplinarios, los estudios posteriores (Jahangir et al. (2021) [20], Lieskovská et al. (2021) [21] y Fahad (2021) [23]) muestran un claro desplazamiento hacia el uso de técnicas avanzadas de aprendizaje profundo y arquitecturas complejas. Estos estudios destacan la importancia de la selección y fusión de características acústicas y no acústicas, el uso de tecnologías avanzadas de hardware y software, y la necesidad de abordar los desafíos presentados por los entornos naturales no controlados. La integración de diversas disciplinas y la adaptación a contextos reales sigue siendo una prioridad, con un enfoque cada vez mayor en mejorar la robustez y precisión de los sistemas SER a través de técnicas de aprendizaje profundo y procesamiento de señales avanzadas. Estado del arte 18 3.7 Aplicaciones prácticas La aplicación de esta herramienta favorece a numerosos ámbitos. Como he mencionado anteriormente, puede generar una mejora en la relación humano-computadora de futuros dispositivos, consiguiendo una mayor comprensión del usuario. Estudios como el realizado por Madanian (2022) [44] han explorado la posibilidad de reconocer las emociones de pacientes en el ámbito psicológico-terapéutico, donde se puede obtener valiosa información para diseñar estrategias de atención afectivas. En el entorno educativo, Abdelhamid (2023) [45] destaca la capacidad de detectar estados emocionales en el alumnado, así como los niveles de participación y la concentración durante las clases online. También es destacable la inmersión de esta tecnología en el sector comercial, dado el interés de las empresas por conocer el feedback de los clientes y recomendar en función a ello según qué productos. Bongirwar y Potnurwar (2022) [46] desarrollaron un sistema de recomendación de canciones en función del estado emocional del usuario, su algoritmo estaba basado en el reconocimiento de emociones. Otro de los ámbitos donde se ha aplicado esta ciencia es en la seguridad de los conductores. Requardt y cols (2020) [47] investigaron el reconocimiento de emociones para identificar el estado de los conductores al volante, y de esta manera estudiar la relación de los estados emocionales con la seguridad vial, pudiendo así detectar las situaciones más vulnerables. 3.8 Líneas futuras Este desarrollo se puede llevar a cabo para cualquier tipo de base de datos especificada, aunque los estudios en cuanto al uso de datos naturales se siguen considerando un gran desafío para los investigadores. Fahad (2021) [23] recoge en su investigación los problemas relacionados con este entorno natural y cómo se pueden mejorar. Entre dichos problemas se encuentran la falta de datos naturales, el desequilibrio de los datos y las diferentes longitudes de las expresiones. 11 4 BASE DE DATOS USADA La palabra es mitad de quien la pronuncia y mitad de quien la escucha. - Michel de Montaigne - ara llevar a cabo un análisis riguroso en el reconocimiento de emociones en el habla, es esencial contar con una base de datos adecuada que garantice diversidad y calidad en los registros de voz. La selección de la base de datos no solo influye en la precisión del modelo, sino que también interviene en los resultados obtenidos. En este apartado, se describe la base de datos usada en el trabajo, detallando sus características y justificando los criterios que han motivado su elección en lugar de generar un conjunto de datos propio. Se han tenido en cuenta diversos factores como la calidad de la grabación, la variedad de hablantes y la fidelidad en la representación de las emociones. 4.1 Descripción y justificación Con la finalidad de obtener los mejores resultados posibles y minimizar los riesgos durante el desarrollo de esta investigación, es fundamental usar una base de datos sólida y robusta. Como he comentado anteriormente, los datos utilizados para este estudio provendrán de grabaciones de voz realizadas por diferentes locutores, en las que se expresan distintas emociones a través de frases específicas. Es crucial que el conjunto de datos cuente con una diversidad representativa, conformando así una base que recoja grabaciones de distintos géneros, timbres de voz, rangos de edad, acentos, y características del habla natural para mejorar la generalización de los resultados obtenidos. Además de esta diversidad de muestras, los datos obtenidos deben cumplir ciertos criterios de calidad para que, durante su tratamiento, se reduzcan las posibilidades de error debido a factores externos que puedan introducir ruido o distorsión en el análisis. P Base de datos usada 12 12 Entre estos criterios, destacan los siguientes: • Entorno de captación: la sala donde se realicen las grabaciones debe cumplir unos mínimos niveles de acondicionamiento acústico, a fin de reducir los efectos adversos en los registros, tales como la reflexión y la reverberación. Estos fenómenos pueden introducir eco o distorsiones en la señal de audio, afectando a la precisión del análisis de características. Un entorno controlado y bien acondicionado garantiza que las grabaciones reflejen con fidelidad la calidad de la voz del locutor. • Material de grabación: es importante tener en cuenta la calidad del material que se usará durante la grabación. Aunque parezca evidente, es fundamental destacar que el uso de equipos de alta calidad permite capturar las voces con mayor fidelidad y precisión, lo cual contribuye de manera decisiva a la construcción de una base de datos sólida y confiable. Este equipamiento incluye el tipo de micrófono, las tarjetas de conversión analógico-digital (A/D), el ordenador, y el software de edición y captura de sonido. Un equipo de grabación profesional contribuye a la construcción de una base de datos sólida y confiable, que facilita la extracción de características relevantes para el reconocimiento de emociones en voz. • Muestreo y cuantificación de la señal: Para capturar correctamente una señal de voz, es necesaria una frecuencia de muestreo que sea, como mínimo, el doble del ancho de banda de la señal, conforme al criterio de Nyquist. Dado que la amplitud del espectro de la voz humana disminuye considerablemente a partir de los 8-10 kHz, esta frecuencia de muestreo permite representar la amplitud de la señal en distintos niveles, preservando así un adecuado margen dinámico. • Fidelidad emocional: La opción ideal es disponer de registros en los que las emociones se expresen en situaciones auténticas, no actuadas, ya que ello aporta una mayor naturalidad y precisión en la manifestación emocional. Sin embargo, obtener grabaciones de este tipo conlleva un coste elevado y presenta desafíos técnicos significativos, dado que, al tratarse de contextos espontáneos, la captación del sonido puede verse comprometida por la falta de control sobre factores como la acústica o la coherencia en el discurso de los participantes. Por estas razones, la mayoría de los estudios recurren a bases de datos con emociones interpretadas por actores, donde es posible estandarizar tanto la calidad de la grabación como la consistencia de las expresiones emocionales. Para el uso de una base de datos en un estudio como este, se pueden tomar dos vías: producir la base de datos desde cero o utilizar una ya creada. Teniendo en cuenta todos los procedimientos ya mencionados que se deben realizar para la creación de una base de datos, he optado por utilizar una de las descritas, concretamente la base de datos RAVDESS (Ryerson Audio-Visual Database of Emotional Speech and Song, Livingstone & Russo 2018). Creada por SMARTLAB, posee la licencia Creative Commons de uso no comercial. La base de datos RAVDESS contiene grabaciones de audio y video pertenecientes a 24 actores profesionales (12 hombres y 12 mujeres). El idioma utilizado es inglés norteamericano, garantizando una pronunciación clara y neutra por parte de los hablantes. Se representan ocho emociones diferentes: calma, neutral, felicidad, tristeza, enfado, miedo, disgusto y sorpresa. Cada emoción se grabó en dos niveles de intensidad: normal y alta intensidad (excepto la emoción neutral, que no tiene diferencia de intensidad). Se recogen grabaciones tanto de habla como de canto, así como modalidades de audio y vídeo. La variedad de actores ofrece variabilidad en las voces utilizadas, permitiendo una mayor generalización del modelo entrenado. La recopilación contiene un total de 1440 archivos, con un muestreo de 48kHz y 16 bits de cuantificación. La extensión de los audios es .WAV y tienen una duración aproximada de 3 segundos. 13 Reconocimiento de emociones mediante el análisis de señales de voz Ilustración 5. Ejemplo de grabaciones de las emociones en audio [48] A continuación, se enumeran las especificaciones: • Número de actores: 12 • Género: 2; masculino y femenino. • Emoción: 8; neutral, calma, felicidad, tristeza, enfado, miedo, disgusto, sorpresa. • Intensidad emocional: 2; normal y fuerte. • Oraciones: 2; “Kids are talking by the door” y “Dogs are sitting by the door”. • Número de repeticiones: 2. Para este estudio, como el objetivo es reconocer emociones por medio de voz, únicamente se han utilizado los registros hablados en formato de audio. Algoritmo y metodología 20 20 En el siguiente estracto de una señal de voz podemos observar la diferencia visual que genera la fase de pre-énfasis. Ilustración 9. Señal de voz antes y después de pre-énfasis [54] Se aprecia como los componentes de alta frecuencia aumentan mientras que los de baja frecuencia se atenúan. 2. Segmentación mediante Ventana de Análisis: se trata de dividir la señal en segmentos o ventanas, generalmente de 20-40 ms de duración, con un solapamiento del 40-60% entre ventanas para mantener continuidad. Este proceso ayuda a capturar la evolución temporal de las características acústicas. El contenido de cada frame se resume en N puntos de muestras. Teniendo esto en cuenta, se deben crear frames con una longitud suficiente para poder tratarlo y realizar estimaciones espectrales fiables. Del mismo modo, la longitud tampoco debe ser excesiva. Se trata de asegurar que en ese segmento la señal es cuasiestacionaria. En la siguiente captura se observa una señal de voz dividida en frames. Algunos de ellos se superponen entre sí, destacados con una llave. Ilustración 10. Framing en MFCC [55] Al realizarse una superposición de frames, se genera cierto desajuste en los frames superpuestos. Por tanto, suele ser necesario suavizar la transición para mantener la continuidad entre frames. Para conseguir el suavizado, cada frame es multiplicado por una función de Hamming Windowing, de manera que se 21 Reconocimiento de emociones mediante el análisis de señales de voz consigue reducir la señal tanto al principio como al final de cada frame multiplicado. La multiplicación se recoge en la siguiente expresión: 𝑌(𝑛)=𝑋(𝑛)∙𝑊(𝑛) Siendo Y(n) la señal de salida, X(n) la señal de entrada de cada frame y W(n) la función de Hamming Windowing: 𝑊[𝑛]= {0.54−0.46cos(2𝜋𝑛 𝑁−1) 𝑑𝑜𝑛𝑑𝑒 0≤𝑛≤𝑁− 1 0 𝑜𝑡𝑟𝑜 𝑐𝑎𝑠𝑜 Siendo W(n) = Hamming Windowing y N = número de muestras en cada frame. Se observa en la siguiente imagen el esquema de multiplicado. Ilustración 11. Hamming Windowing [53] 3. Transformada de Fourier (FFT): cada ventana de tiempo se transforma al dominio de la frecuencia usando la FFT, convirtiendo la señal de tiempo en una representación frecuencial. Se realiza de nuevo para cada frame, obteniéndose X[k], un número complejo que representa la frecuencia en términos de magnitud y fase. 𝑋[𝑘]= ∑ 𝑥[𝑛]𝑒−2𝜋 𝑁𝑘𝑛 𝑘=0,1,…,𝑁− 1 𝑁−1 0 Donde x[n] = señal de Hamming Windowing 4. Aplicación de una Banca de Filtros Mel: los resultados de la FFT se pasan por un banco de filtros en la escala Mel, que modela la sensibilidad del oído humano a diferentes frecuencias. El ser humano tiene mayor sensibilidad en las frecuencias bajas y por consiguiente es menos discriminativo en las frecuencias altas. Se distinguen entonces dos tipos de filtros de Mel, unos que están espaciados linealmente por debajo de los 1000 Hz y otros espaciados logarítmicamente por encima de 1000Hz. Es por esto que las regiones de bajas frecuencias poseen un mayor número de filtros en comparación con las de altas frecuencias. Algoritmo y metodología 22 22 Ilustración 12. Banco de filtros de Mel El objetivo de esta fase es multiplicar la magnitud de frecuencia con un conjunto de 20-40 filtros de Mel. Cada señal de salida del filtro es la suma de todos los componentes filtrados. Se aprecia mejor el concepto en el siguiente esquema: Ilustración 13. Fase FFT y filtros de Mel del proceso MFCC [56] Para transformar la frecuencia (f) a las frecuencias en la escala de Mel se usa la expresión: 𝑚=2595 ∙ log10(1+ 𝑓 700) Por último, en esta fase se calcula el logaritmo de la magnitud de frecuencia en la escala de mel elevada al cuadrado. Esto se realiza para que las estimaciones de frecuencia sean más robustas ante las variaciones de señal. Entre estas variaciones se puede destacar la variación en la potencia de las grabaciones debido a la distancia entre el locutor y el dispositivo de recepción de audio. Ilustración 14. Fase Log del proceso MFCC [56] 23 Reconocimiento de emociones mediante el análisis de señales de voz 5. Transformada Discreta del Coseno (DCT): finalmente, se aplica la Transformada Discreta del Coseno para obtener los coeficientes cepstrales, que representan la envolvente espectral. La señal pasa del dominio de la frecuencia al dominio de tiempo. Se obtiene un conjunto de coeficientes MFCC, mayormente conocido como vector acústico. La ecuación empleada para la transformación es la siguiente: 𝑦𝑡[𝑘]= ∑log(|𝑌𝑡(𝑚)|2)cos[𝑘∙(𝑚−0.5)∙𝜋 𝑀] 𝑀 𝑚−1 𝑘=1,2,…,𝐽 Donde M= número de filtros de Mel y J = número de MFCC. En este proyecto, se extrajeron en un principio 13 coeficientes MFCC por ventana, una elección común que ofrece un buen equilibrio entre precisión y simplicidad. Sin embargo, y como se detallará más adelante, se realizaron numerosas pruebas modificando el número de coeficientes obtenidos. La media de estos coeficientes se calculó en cada grabación para generar una representación compacta y consistente de las emociones en el audio. El uso de MFCCs mejora significativamente la precisión de los modelos de reconocimiento de emociones, ya que captura las características espectrales que varían entre diferentes estados emocionales. Por ejemplo, emociones como la ira o la alegría tienden a producir un patrón tonal más agudo en comparación con emociones como la tristeza, lo que se refleja en los coeficientes cepstrales. Código utilizado: mfccCoeffs = mfcc(segment,fs,'NumCoeffs',numCoefficients,'LogEnergy', 'Ignore') mfcc_all = [mfcc_all; mean(coeffs,1)]; % apilar verticalmente meanMfcc = mean(mfcc_all, 1); mfcc_features = [mfcc_features; meanMfcc]; Además de la media, se exploraron otras propiedades estadísticas de segundo y tercer orden aplicadas a los coeficientes con el objetivo de capturar patrones más complejos dentro de la variabilidad acústica. Entre ellos encontramos: - La desviación típica (std): mide la dispersión o la variabilidad de los coeficientes respecto a su media. Una mayor desviación puede indicar una mayor modulación de la voz, característica muy representativa y discriminante en estados emocionales como la ira o la sorpresa. - Asimetría (skewness): describe la simetría de la distribución de los coeficientes. En función de esta distribución se puede detectar la energía entre bandas frecuenciales, relacionando estas características con ciertas emociones. - Curtosis (kurtosis): mide el grado de “concentración” de los datos en torno a la media. Por ejemplo, un grado de concentración elevado sugiere la presencia de valores extremos en la voz, como vocales destacadas o énfasis repentinos. Estas propiedades fueron calculadas para cada grabación sobre cada uno de los coeficientes MFCCs, generando así un conjunto extendido de características estadísticas. % Cálculo de propiedades estadísticas mfcc_std = std(mfcc_all, 0, 1); mfcc_skew = skewness(mfcc_all, 0, 1); mfcc_kurt = kurtosis(mfcc_all, 0, 1); % Concatenación de medias y estadísticas mfcc_features = [meanMfcc, mfcc_std, mfcc_skew, mfcc_kurt]; Algoritmo y metodología 24 24 Finalmente, y como se mencionará detalladamente más adelante, este análisis no mejoró el rendimiento del sistema. Aún así, su inclusión en el proceso de investigación resulta necesaria para comprender las fases de estudio y el camino tomado en cada caso. Además de los MFCCs, se añadieron dos características adicionales: tono y energía. Estas características son cruciales, ya que el tono (frecuencia fundamental) puede variar considerablemente entre emociones (por ejemplo, la ira tiene un tono más alto que la tristeza), mientras que la energía refleja la intensidad de la voz. 5.2.2 Tono El tono es una característica prosódica crucial para el análisis del habla. Se define como la frecuencia a la que vibran las cuerdas vocales durante la fonación. Se genera gracias a las vibraciones de los pliegues vocales que tienen lugar en la glotis, debido al flujo de aire durante la producción de la voz. Generalmente el tono en los seres humanos oscila entre los 80 Hz y los 300Hz, aunque pueden existir variaciones según las características de cada individuo. El efecto de las emociones sobre el órgano fonador provoca modificaciones en las características acústicas de la voz, y el tono es una de las características más sensibles a estas variaciones. Diferentes estados emocionales afectan directamente al tono: emociones como la alegría o la ira suelen asociarse a un tono más alto, mientras que la tristeza presenta tonos más graves. En este estudio, el tono fue extraído utilizando el método de autocorrelación, una técnica robusta y ampliamente empleada en análisis de señales de voz, ya que permite estimar con precisión la frecuencia fundamental en señales periódicas. Para este proyecto, hemos realizado la estimación del tono haciendo uso de la función pitch de Matlab. Esta aplica métodos robustos para calcular la frecuencia fundamental. De esta manera, se obtiene un vector con los valores de tono a lo largo de toda la señal de audio. Con el objetivo de reducir las variaciones y producir un resultado representativo, se realiza el promedio de los datos obtenidos en cada grabación. A continuación, se muestra un extracto del código implementado: % === Calcular el Pitch (Tono) === % Usamos la función pitch para obtener la frecuencia fundamental [pitch_vals, ~] = pitch(segment, fs); pitch_all = [pitch_all; mean(pitch_vals)]; meanPitch = mean(pitch_all); % Promedio del tono pitch_features = [pitch_features; meanPitch]; % Almacenar el pitch En este proceso, se ha utilizado una frecuencia de muestreo de 16 kHz, establecida como objetivo en el preprocesamiento de las señales que se efectuó con anterioridad. Esto se puede observar en el código completo recogido en el punto 6. Al hacer uso de la función pitch de MATLAB, otros parámetros como la duración de la ventana o el porcentaje de solapamiento mantienen los que el programa ofrece por defecto. A continuación, se muestra la distribución de la frecuencia fundamental (tono) en los audios de la base de datos RAVDESS. 25 Reconocimiento de emociones mediante el análisis de señales de voz Ilustración 15. Distribución del tono en las muestras de datos de RAVDESS Se observa que la mayoría de los valores de tono se encuentran en el rango de 200 a 400 Hz, lo cual es consistente con las voces humanas, donde las voces masculinas suelen situarse en un rango de 85 a 180 Hz y las voces femeninas entre 165 y 255 Hz. Sin embargo, debido a la variabilidad emocional en los datos, algunas voces pueden alcanzar frecuencias más altas. 5.2.3 Energía La energía de una señal de audio mide la intensidad de la misma. Se calcula como la suma de los cuadrados de las amplitudes a lo largo del tiempo y está íntimamente relacionada con la percepción del volumen. Se trata de una característica importante en el ámbito del reconocimiento de emociones, y usada en la mayoría de estudios. El nivel de energía varía en función de los diferentes estados emocionales, lo que proporciona una distinción notable y contribuye a la categorización de emociones. Emociones como la ira o la alegría suelen estar asociadas con niveles de energía más altos debido a la mayor fuerza en la producción vocal, mientras que emociones como la tristeza presentan niveles de energía reducidos. En este proyecto, la energía se calculó como la suma de los cuadrados de las amplitudes de la señal en el dominio del tiempo, una métrica sencilla pero efectiva para capturar la intensidad global de la grabación. En este caso, la energía usada se encuentra en escala logarítmica (E), y se calcula a partir de las muestras de la señal (w[n]) siguiendo la siguiente expresión: 𝐸= log(∑𝑤[𝑛]2 𝑁 𝑛=1 ) Donde: • w[n] representa las muestras de la señal segmentada enventanada. • N es el número de muestras en cada segmento. Esta operación logarítmica permite una mejor representación en escala de los valores de energía y reduce el impacto de los valores extremos (tanto mínimos como máximos). Para el cálculo de la energía en este estudio, hemos realizado el promedio de los valores al cuadrado de señal de audio dividido por el número total de muestras. Los valores resultantes de energía se almacenan en el vector energy_features para ser utilizados posteriormente en la clasificación. Todo este proceso se recoge en el siguiente fragmento de código: Algoritmo y metodología 26 26 % Calcular la Energía % La energía es el promedio de los cuadrados de los valores de la señal energies = sum(segment.^2) / length(segment); energy_all = [energy_all, energies]; % horizontal, para mantener formato energy = mean(energy_all); energy_features = [energy_features; energy]; % Almacenar la energía La energía obtenida permite obtener una valoración aproximada de la intensidad del habla, lo cual es un indicador importante en el análisis emocional. Por ejemplo, un tono elevado o gritos (característicos de la emoción "enfado") representarán mayores niveles de energía, mientras que emociones como "tristeza" estarán asociadas con niveles de energía más bajos. Del mismo modo que con el tono, se ha obtenido la representación de la distribución de la energía en escala logarítmica. Ilustración 16. Distribución de la energía en escala logarítmica Se observa una forma de distribución aproximadamente normal, con un pico entre los (-20, -15)dB. Este resultado corrobora el hecho de que la base de datos RAVDESS se encuentra normalizada en cuanto a volumen, lo que garantiza que los niveles de intensidad sean similares. 5.2.4 Distribuiciones y correlaciones De manera similar al análisis del tono (pitch), también es posible calcular la derivada temporal de la energía para analizar cómo varía su intensidad a lo largo del tiempo. Esto permite identificar patrones relacionados con cambios de emoción en el discurso. Debido a la base de datos usada, donde cada muestra corresponde con una única emoción, no hemos profundizado en este campo. Sin embargo, resulta un campo de estudio muy interesante para proyectos donde se analicen señales de voz con mayor información y variabilidad emocional. Código utilizado: [pitch, ~] = pitch(audioSignal, Fs); energy = sum(audioSignal.^2); 27 Reconocimiento de emociones mediante el análisis de señales de voz A modo de estudio, también se ha representado mediante un gráfico de dispersión la relación entre el tono fundamental y la energía logarítmica. Ilustración 17. Relación de energía y tono para la base de datos RAVDESS Cada punto en la gráfica representa una muestra de audio de la base de datos RAVDESS. Se observa una alta densidad de puntos en la parte central, lo que indica que la mayoría de los valores de tono y energía están concentrados en un rango específico. La mayoría de los tonos están entre 200 y 400 Hz, lo que coincide con los valores típicos de voces humanas en diferentes emociones. La energía logarítmica se distribuye principalmente entre -10 dB y -25 dB, con algunas variaciones fuera de este rango. Si la relación existente entre ambas variables fuera fuerte, se esperaría una tendencia clara en la nube de puntos (por ejemplo, una línea creciente o decreciente). En este caso, los puntos aparecen distribuidos de manera dispersa y sin una tendencia clara, lo que indica que el tono y la energía no están fuertemente correlacionados de manera lineal. Esto indica que no hay una correlación fuerte entre tono y energía, aunque a modo de conclusión se puede definir que la dispersión de la energía en tonos bajos es mayor, lo que significa que las voces graves pueden tener mayor variabilidad en intensidad, dependiendo del contexto emocional. Los tonos altos parecen tener menor variabilidad energética, lo que podría deberse a que, en emociones como la sorpresa o la felicidad, la voz tiende a mantenerse en registros más estables. 5.2.5 Embeddings De manera análoga a las características acústicas tradicionales que se han descrito, como MFCC, tono o energía, en este trabajo también se han contemplado el uso de embeddings. Los embeddings acústicos son representaciones numéricas de las señales de audio. Estas representaciones se obtienen mediante modelos de redes neuronales profundas previamente entrenados con grandes cantidades de datos. A diferencia de las características tradicionales, estos no se centran en extraer manualmente parámetros acústicos específicos de las señales. En su lugar, permiten que la red neuronal aprenda automáticamente y descubra qué patrones son útiles para procesar todos esos datos de voz a la vez. El tipo de información que suelen capturar puede basarse en fonética, prosodia (entonación, ritmo, pausas) o semántica. Se ha incluido este apartado en el trabajo para aportar dos enfoques distintos ante una misma base de datos. El objetivo de esta dualidad es evaluar los resultados de ambos métodos y comparar, especialmente en términos de rendimiento, su funcionamiento. Para obtener los embeddings se han valorado dos modelos, OpenL3 y VGGish. Ambos son ofrecidos por Matlab Algoritmo y metodología 28 28 y se han desarrollado para tareas de procesamiento de audio. Estos sistemas toman como entrada la señal de audio y devuelven una secuencia de vectores de alta dimensión que resumen la información del habla. VGGish es un modelo de red neuronal profunda preentrenado por Google, proviene de la arquitectura VGG (Visual Geometry Group) desarrollada par la visión por ordenador, pero en este caso adaptado al dominio del audio. Está diseñado para generar representaciones discriminativas del contenido acústico en señales de audio, facilitando tareas como la clasificación, la detección o el análisis emocional. La entrada del sistema es un espectrograma log-mel del audio (96 bandas mel, 64 cuadros de tiempo). Cada embedding se extrae de un segmento de aproximadamente 0.96 segundos de audio, y condensa información de alta dimensión sobre el contenido espectral-temporal de la señal. Este procesamiento genera un vextor de salida de 128 dimensiones, que recoge variaciones de energía, timbre, textura y entonación. El modelo ha sido entrenado sobre AudioSet de Google, una gran base de datos que abarca miles de clases de sonidos (voz, risa, instrumentos, ruido ambiente…). [57] La función vggishEmbeddings(audioIn, fs) de Matlab permite obtener a partir de una base de datos el vector de características mencionado, siendo audioIn la entrada de audio y fs la frecuencia de muestreo (por defecto 16kHz). Se pueden también especificar otros parámetros para el estudio, definiéndolos como argumentos nombre=valor, entre ellos la aplicación de PCAs o el porcentaje de superpoción de los segmentos de audio. [58] La siguiente representación muestra como varían los embeddings VGGish a lo largo del tiempo para una grabación de voz. Ilustración 18. Representación de las características obtenidas mediante VGGish a lo largo del tiempo [58] OpenL3 otro un modelo de red neuronal profunda preentrenado. Está desarrollado desde el enfoque “Look, Listen and Learn” y entrenado sobre tareas multimodales, es decir, pares de audio-vídeo. Esto permite aprender representaciones densas y semánticamente útiles a partir de grandes colecciones de datos, superando generalmente en rendimiento a modelos previos como VGGish. Matlab ofrece esta función, openL3Embeddings, que consiste en una arquitectura de unas 30 capas CNN que reciben espectogramas (Mel o lineales) y producen como salidas vectores de características (embeddings) de 512 o 6144 dimensiones extraídas a lo largo del tiempo. A continuación, se muestra una representación tridimensional de estas características, donde se puede observar su variación en relación con las distintas ventanas temporales del audio. 29 Reconocimiento de emociones mediante el análisis de señales de voz Ilustración 19. Representación de las características obtenidas mediante OpenL3 a lo largo del tiempo [59] La función openl3Embeddings(audioIn, fs) procesa el audio en ventanas con solapamiento (90% por defecto), generando un array de dimensión [N_frames x 512 x canales], donde cada vector por frame integra características aprendidas sobre frecuencias y patrones temporales [59]. N_frames depende de la duración y el solapamiento, normalmente 10 frames/segundo. Esta función también ofrece aspectos configurables mediante la adición de pares de argumentos NameN=ValueN. embeddings = openl3Embeddings(audioIn,fs,Name1,Value1…NameN, ValueN) Entre estos encontramos el porcentaje de superposición entre espectrogramas consecutivos, como se ha comentado por defecto es 90 pero se puede escalar en el rango [0, 100]. El tipo de contenido de audio (musical o ambiente), la frecuencia de muestreo y la duración de análisis de cada ventana temporal (512 o 6144). Cada embeddings captura información acústica de orden superior: timbre, ritmo, textura y dinámica, combinada en vectores abstractos útiles en tareas como clasificación del sonido o reconocimiento de emociones, como es nuestro objeto de estudio. Para este caso se ha utilizado el modelo de audio no musical (ContentType = ‘env’), con una frecuencia de muestreo de 16 kH, que es la misma frecuencia objetivo que se usa en las etapas previas de preprocesamiento. 5.3 Selección y clasificación de características Aunque los Coeficientes Cepstrales de Frecuencia Mel (MFCCs), el tono y la energía son características bien clásicas y ampliamente establecidas en el análisis de señales de voz, en este estudio se ha considerado relevante evaluar diferentes combinaciones y configuraciones de dichas características con el fin de encontrar un resultado óptimo del sistema. En un principio, se han seleccionado directamente las 13 características MFCC, junto con el tono y la energía, como descriptores para el modelo. Sin embargo, posteriormente se llevaron a cabo experimentos sistemáticos en los que se modificó el número de coeficientes extraídos, así como la inclusión o exclusión de las propiedades estadísticas también descritas (media, desviación típica, curtosis), conformándose así un conjunto de casuísticas de rendimiento evaluables. Posteriormente, en el apartado de resultados y evaluación del rendimiento, se especificarán los diferentes procedimientos que se han seguido en la elección de características para obtener distintos niveles de precisión en los entrenamientos. A veces, demasiadas características pueden introducir ruido (overfitting o ruido irrelevante), por lo que en función de los resultados que se obtengan se debe jugar con la elección de Entrenamiento y validación del modelo 36 36 más cercanos (kNN) permite encontrar los k puntos más cercanos en X a un punto de consulta o conjunto de puntos. Suelen tener buena precisión predictiva en dimensiones pequeñas, pero podrían no serlo en dimensiones grandes. Consumen mucha memoria y son difíciles de interpretar. Su rendimiento depende de la elección de k, donde valores pequeños pueden llevar a sobreajuste y valores grandes pueden perder precisión en los límites de decisión. Ilustración 24. Esquema de decisión del algoritmo KNN Se puede permitir que la aplicación elija los parámetros del modelo automáticamente mediante la optimización de hiperparámetros o configurarlos de manera manual (número de vecinos, distancia, estandarización de datos). Se ofrecen distintas configuraciones en el entrenamiento: • Fine KNN: con un valor pequeño de k, lo que permite decisiones más detalladas, pero puede ser sensible al ruido. • Medium y Coarse KNN: con valores mayores de k, lo que suaviza las decisiones y reduce la variabilidad. • KNN ponderado: donde los vecinos más cercanos tienen más peso en la clasificación. Redes Neuronales Artificiales (ANN - Artificial Neural Networks) Las Redes Neuronales Artificiales están inspiradas en el funcionamiento del cerebro humano y se componen de múltiples capas de neuronas interconectadas. La flexibilidad del modelo aumenta con el tamaño y la cantidad de capas completamente conectadas en la red neuronal. Ilustración 25. Esquema estructural capas de las redes neuronales La primera capa tiene una conexión con la entrada de la red (datos predictores), y cada capa subsiguiente tiene una conexión con la capa anterior. Cada capa multiplica la entrada por una matriz de ponderaciones y luego 37 Reconocimiento de emociones mediante el análisis de señales de voz añade un vector de sesgo, generando una función de activación. La capa final completamente conectada y la función de activación generan la salida de la red, es decir, las puntuaciones de clasificación (probabilidades posteriores) y las predicciones. Estos modelos suelen tener una buena precisión predictiva, sin embargo, no son fáciles de interpretar. Entre los hiperparámetros configurables se encuentran el número de capas conectadas, el tamaño de las capas, el límite de iteración, la fuerza de regularización (Lambda), etc. La aplicación usada de Matlab, Classification Learner, proporciona distintas variantes de redes neuronales, descritas a continuación. Tabla 3. Características de los clasificadores de Redes Neuronales disponibles en Classification Learner de Matlab Tipo de Clasificador Interpretabilidad Flexibilidad del Modelo Red Neuronal Estrecha (Narrow) Baja Media — aumenta según el valor del parámetro Tamaño de la primera capa Red Neuronal Media (Medium) Baja Media — aumenta según el valor del parámetro Tamaño de la primera capa Red Neuronal Ancha (Wide) Baja Media — aumenta según el valor del parámetro Tamaño de la primera capa Red Neuronal de Dos Capas (Bilayered) Baja Alta — aumenta según el tamaño de la primera y segunda capa Red Neuronal de Tres Capas (Trilayered) Baja Alta — aumenta según el tamaño de la primera, segunda y tercera capa Entre ellas, la destacada en nuestro análisis es la Red Neuronal Ancha (Wide Neural Network), que utiliza una única capa oculta amplia con muchos nodos, lo que permite capturar patrones complejos con una arquitectura más simple. Árboles de decisión Aunque los clasificadores basados en árboles de decisión no han ofrecido los mejores resultados en la precisión previamente analizada, han sido incluidos ya que representan una base comparativa fundamental. Son unos de los clasificadores más simples y permite establecer un punto de partida frente a modelos más complejos. Están basados en la división recursiva del espacio de características mediante condiciones en los atributos. Cada nodo representa una condición, y las ramas conducen a posibles clasificaciones. Para predecir una respuesta, se siguen las decisiones del árbol desde el nodo raíz (inicio) hasta un nodo hoja. Este nodo contiene la respuesta. Cada paso de una predicción implica comprobar el valor de un predictor (variable). Son fáciles de interpretar, rápidos para el ajuste y la predicción, y consumen poca memoria, pero pueden tener baja precisión predictiva. Intente crear árboles más simples para evitar el sobreajuste. A continuación, se muestra un árbol de clasificación simple: Entrenamiento y validación del modelo 38 38 Ilustración 26. Esquema sistema de clasificación para árboles de deción Este árbol predice clasificaciones basadas en dos predictores, x1 y x2. Para predecir se comienza en el nodo superior y en cada decisión se verifican los valores de los predictores para decidir qué rama seguir. Para los parámetros de configuración, se puede permitir que la aplicación elija automáticamente mediante la optimización de hiperparámetros o configurarlos manualmente (número máximo de divisiones, criterio de división, etc) 6.3 Resultados experimentales y evaluación del rendimiento En esta sección se presentan los diferentes experimentos realizados para evaluar el sistema. Las pruebas se han centrado inicialmente en la clasificación de las 8 emociones disponibles en la base de datos RAVDESS, partiendo de un sistema base y explorando posteriormente diversas variaciones para mejorar su rendimiento. Para cada experimento se ha generado una matriz de confusión, una de las herramientas más utilizadas para evaluar el rendimiento de los modelos. Esta representación permite visualizar cuántas predicciones fueron correctas y cuántas erróneas para cada emoción, comparándose así las etiquetas reales con las predicciones realizadas. En dicha matriz, las filas representan las emociones reales y las columnas muestran las predicciones del modelo. El color de cada celda indica la frecuencia de aciertos y errores. Los valores en la diagonal principal representan los casos correctamente clasificados mientras que los valores fuera de la diagonal indican errores de clasificación. Tabla 4. Matriz de confusión estándar para problema de clasificación binario Predicción Positiva Predicción Negativa Real Positivo Verdadero Positivo (VP) Falso Negativo (FN) Real Negativo Falso Positivo (FP) Verdadero Negativo (VN) De tal manera, la ecuación mediante la que se obtiene el rendimiento viene dada por: 𝑅= 𝑉𝑃+𝑉𝑁 𝑉𝑃+𝑉𝑁+𝐹𝑃+𝐹𝑁 Más allá de la precisión global del modelo, la matriz de confusión permite detectar sesgos en la clasificación. Esto quiere decir si el modelo tiene una tendencia a confundir ciertas emociones con otras. Por ejemplo, si una emoción como "tristeza" es sistemáticamente clasificada como "neutral", podría indicar que las características extraídas en el sistema no son suficientemente discriminantes como para diferenciar entre ambas opciones. 39 Reconocimiento de emociones mediante el análisis de señales de voz 6.3.1 Conformación Sistema Base En este apartado se recogerá la evaluación del rendimiento del sistema al clasificar las 8 emociones originales de la base de datos, utilizando inicialmente la configuración base de características (coeficientes MFCC, tono y energía). Posteriormente se exploran otras configuraciones para determinar si es posible mejorar el rendimiento. 6.3.1.1 Estudio número de coeficientes MFCC El número de coeficientes cepstrales (MFCC) extraídos de cada archivo de audio tiene un impacto directo en el rendimiento del sistema de clasificacion. La elección de 13 MFCCs proviene de una práctica comúnmente aceptada en el procesamiento de voz, ya que este número proporciona una representación acústica de la señal lo suficientemente rica como para no incurrir en una complejidad computacional elevada. Además, este valor ha demostrado históricamente ser eficaz en tareas de reconocimiento del habla, sirviendo como punto de partida fiable para el diseño de nuestro sistema. Sin embargo, a pesar de ser un uso habitual en aplicaciones en procesos similares, no existe un número óptimo establecido, ya que su eficacia puede depender del conjunto de datos y del objeto de estudio en específico. Con el objetivo de obtener el valor que genere un mayor rendimiento en nuestro sistema, se ha realizado un estudio progresivo variando el número de coeficientes MFCC extraídos. En concreto, se han evaluado configuraciones con 10, 14, 15, 16, 17, 18, 19, 20 y hasta 40 coeficientes. Para cada caso, se ha mantenido constante el uso del tono y la energía como características adicionales, y se han evaluado los resultados considerando las 8 emociones presentes en el conjunto de datos RAVDESS. Los experimentos se han realizado utilizando validación cruzada, y se presenta a continuación la precisión obtenida en cada caso según los clasificadores más adecuados para nuestro estudio. Tabla 5. Rendimiento del sistema en función al nº de MFCCs Los resultados obtenidos tras el estudio muestran cómo el rendimiento del sistema varía en función del número de coeficientes MFCC empleados. Se destacan en color verde los diez mejores resultados. A rasgos generales, se observa que el clasificador Fine KNN es el que mantiene un rendimiento más alto y consistente en casi todas las configuraciones, alcanzando dos picos en 13-14 y 19 MFCCs (70.3% y 70.1%). Cubic SVM también muestra ofrece una buena respuesta, destacando los 16 y 20 MFCCs, alcanzando valores de hasta 68.3%. Se muestra a continuación un esquema con los valores generados mediante el clasificador Fine KNN, el de mejor rendimiento, y la tendencia del sistema en función de estas variaciones. 10 mffc 13 mfcc 14 mfcc 15 mfcc 16 mfcc 17 mfcc 18 mfcc 19 mfcc 20 mfcc 23 mfcc 25 mfcc 40 mfcc Fine Tree 39,8 39,8 40,3 39,9 40,3 40,1 40,4 40,8 40,6 40,5 40,7 39,1 Cubic SVM 59,9 63,3 63,9 66,5 68,3 67,1 67,4 68 68,3 66,9 65,3 59,8 Fine KNN 66,4 70,3 70,1 69,5 69,4 69,9 70,1 69,6 61,9 66,9 64,8 53,7 Weighted KNN 63 63,8 64,7 63,2 34,6 63,2 61,7 61,6 61,9 60,6 58,5 50,1 Wide Neural Network 55,6 59,2 59 59,4 59,6 59,6 61,3 61 60,6 61,3 59 54,9 Entrenamiento y validación del modelo 40 40 Ilustración 27. Rendimiento del sistema en función del nº MFCCs con Fine KNN Podemos deducir de este análisis que incrementar el número de MFCCs no siempre mejora el rendimiento. De hecho, más allá de cierto valor (en nuestro caso 25 MFCCs), algunos clasificadores tienden a degradar su precisión, lo que puede deberse a sobreajuste o a la inclusión de coeficientes menos relevantes. Los 13 MFCCs resultan ser entonces una elección adecuada no solo por su uso estándar, sino por la adecuación a nuestro conjunto de datos y sistema. 6.3.1.2 Configuración Base Inicial (13 MFCC + Pitch + Energy) Aquí se muestran los resultados obtenidos utilizando la configuración original del sistema, con 13 coeficientes MFCC junto con el tono (pitch) y la energía de la señal como características. Se presenta la matriz de confusión correspondiente y la precisión alcanzada con los clasificadores seleccionados. Tabla 6. Precisión del sistema para validación cruzada 8 emociones Precisión (%) Fine Tree 39,8 Cubic SVM 63,3 Fine KNN 70,3 Weighted KNN 63,8 Wide Neural Network 59,2 Se ha comenzado evaluando el sistema con la configuración base de 13 coeficientes MFCC, acompañados de las características de tono y energía. Como se ha podido observar en el apartado anterior referente a los clasificadores, el mejor clasificador para nuestro sistema resultó ser Fine KNN, que a su vez coincide con el mejor clasificador para esta casuística descrita. A continuación, se muestra la matriz de confusión que ofrece el entrenamiento: 55 57 59 61 63 65 67 69 71 73 10 mffc 13 mfcc 14 mfcc 15 mfcc 16 mfcc 17 mfcc 18 mfcc 19 mfcc 20 mfcc 23 mfcc 25 mfcc 40 mfcc PORCENTAJE DE RENDIMIENTO (%) NÚMERO DE MFCCS Rendimiento del sistema en función de los MFCCs para el clasificador Fine KNN 41 Reconocimiento de emociones mediante el análisis de señales de voz Ilustración 28. Matriz de confusión para el clasificador Fine KNN en validación cruzada de 8 emociones La precisión global alcanzada en este experimento fue del 70,3%. Las emociones como enfado, calma y sorpresa son las que presentaron mayores niveles de acierto, superando los 140 aciertos en cada una de ellas. Sin embargo, neutral y tristeza fueron las más difíciles de clasificar correctamente, como refleja la dispersión en sus predicciones, siendo confundidas en varias ocasiones con otras emociones de expresión similar (calma-neutral, tristeza-calma o tristeza-miedo). Esto sugiere que estas emociones poseen mucha similitud en las características evaluadas, información que nos ayudará más adelante para la reducción del número de emociones reconocidas, identificando aquellas que pueden conformar un grupo. Con el objetivo de comprobar la robustez del sistema y evitar posibles sesgos derivados del uso exclusivo de validación cruzada, se ha llevado a cabo también una validación manual mediante la separación del conjunto de datos en entrenamiento (80%) y test (20%) haciendo uso de la función cvpartition ofrecida por Matlab. Esta metodología permite evaluar el modelo final sobre un subconjunto de datos completamente independiente, proporcionando una estimación más realista del rendimiento del sistema en un entorno externo. A continuación, se presenta la matriz de confusión obtenida para el clasificador Fine KNN, que previamente ha demostrado ser el más adecuado en la validación cruzada, y que también ha sido el de mayor precisión para la validación manual, así como se muestra también en la tabla de resultados. Tabla 7. Precisión del sistema para validación manual 8 emociones Precisión (%) Fine Tree 44,4 Cubic SVM 65,4 Fine KNN 71,2 Weighted KNN 66,7 Wide Neural Network 58,3 Entrenamiento y validación del modelo 42 42 Ilustración 29. Matriz de confusión para el clasificador Fine KNN en validación manual de 8 emociones En este caso, la precisión global obtenida sobre el conjunto de prueba fue del 71,2%, un valor superior al alcanzado durante la validación cruzada (70,3%). Esta consistencia entre ambas validaciones refuerza la fiabilidad del modelo y su capacidad generalizadora. Respecto al comportamiento por emoción, enfado, calma y miedo fueron las que obtuvieron mejor clasificación, superando los 28 aciertos cada una. Por otro lado, la emoción neutral fue la que mayor dispersión presentó, siendo confundida en mayor parte con calma. Esto confirma lo observado en la validación cruzada, donde dicha emoción también se mostraba como una de las más ambiguas, y refuerza la hipótesis de que estas clases pueden ser agrupadas en un siguiente apartado. 6.3.1.3 Inclusión de estadísticas adicionales (Kurtosis, Skewness, etc) Se ha realizado una prueba adicional incorporando nuevas características estadísticas como la curtosis, la asimetría (skewness), la media o la desviación típica, tratando de añadir robustez al sistema para obtener una precisión más alta. Se muestra a continuación la matriz de confusión obtenida. 43 Reconocimiento de emociones mediante el análisis de señales de voz Ilustración 30. Matriz de confusión para el clasificador Bagged Trees con n propiedades estadísticas de MFCCs La mejor precisión obtenida fue de 56,7% con el clasificador “Bagged Trees” pero, como es notable, no se observa una mejora en los resultados. Por esta razón se ha descartado la inclusión de estas características estadísticas de los MFCCs en el estudio. Indiferentenmente, se incluyen los resultados para documentar el proceso exploratorio. 6.3.2 Variación del número de emociones clasificadas Una vez identificada la configuración óptima en cuanto al número de coeficientes MFCC, se ha analizado el rendimiento del sistema al reducir el número de emociones a clasificar. Esta estrategia permite evaluar la capacidad discriminativa del modelo bajo diferentes niveles de complejidad emocional. Para los casos que se mostrarán a continuación se ha usado siempre la validación manual ya descrita, dejando un 20% del conjunto de datos para el test de validación final. Ha quedado justificado que esta opción mejora levemente los resultados, lo que contrubuye a la optimización de nuestro sistema. Por ello, vamos a evitar la descripción del proceso de validación cruzada que, aunque se haya evaluado a efectos prácticos, resulta redundante su inclusión en este apartado. 6.3.2.1 Reducción a seis emociones (enfado, calma/neutral, asco, miedo, felicidad/sorpresa y tristeza) Para esta fase del experimento, se ha reducido el número de emociones a reconocer de ocho a seis. Las emociones seleccionadas han sido: enfado, calma/neutral, asco, miedo, felicidad/sorpresa y tristeza. Esta elección se basa en estudios previos que sugieren que algunas emociones presentan alta similitud acústica y baja precisión en sistemas automáticos, como es el caso de neutral y sorpresa, las cuales se han agrupado con calma y felicidad respectivamente para mejorar el rendimiento global del modelo [60]. Entrenamiento y validación del modelo 44 44 El objetivo de esta simplificación es mantener una representación emocional significativa y balanceada entre emociones positivas y negativas, sin sacrificar la capacidad de reconocimiento. Esta reducción permite también minimizar la ambigüedad entre clases y mejorar la robustez del sistema en escenarios reales. Tabla 8. Rendimiento del sistema para 6 emociones Precisión (%) Fine Tree 51,4 Cubic SVM 70,1 Fine KNN 77,4 Weighted KNN 72,6 Wide Neural Network 68,4 Ilustración 31. Matriz de confusión para el clasificador Fine KNN en validación manual de 6 emociones Los resultados obtenidos con un rendimiento notablemente superior confirman la eficacia de esta simplificación, alcanzando una precisión máxima de 77,4% con el clasificador Fine KNN, nuevamente el mejor entre los evaluados. Destacan los aciertos en las agrupaciones realizadas, que poseen el doble de muestras que cualquier otra emoción. Sin embargo, emociones como el miedo o tristeza siguen presentando confusión con otras clases. También la agrupación calma/neutral ofrece una notable confusión con la emoción tristeza. Tendremos en cuenta estas valoraciones en la continuación de este apartado. 6.3.2.2 Reducción a cuatro emociones (enfado/asco/miedo, calma/neutral, felicidad/sorpresa y tristeza) Para esta nueva configuración, se ha reducido el número de clases emocionales a cuatro, con el fin de simplificar aún más la tarea de clasificación. La selección de estas cuatro emociones se alinea con el modelo de Circunflejo de Russell (1980) y se ha utilizado en estudios de procesamiento afectivo como el de Schuller et al., 2011 [60], donde las emociones se agrupan en función de su nivel de activación y valencia para mejorar la precisión del sistema. Es decir, se trata de agrupar las 8 emociones originales en 4 clases más amplias 45 Reconocimiento de emociones mediante el análisis de señales de voz en función de valencia (positiva/negativa) y activación (activa/pasiva) o según su similitud acústica y expresiva. Utilizaremos una de las formas más conmunmente utilizadas para realizar la agrupación, teniendo en cuenta su valencia y su activación. Se muestra a continuación el esquema: Tabla 9. Clasificación de las 8 emociones de RAVDESS en función a su valencia y activación Emociones originales Valencia y activación Justificación Felicidad y sorpresa Positiva activa Alta valencia y activación (emociones positivas y energéticas). Enfado, disgusto y miedo Negativa activa Emociones negativas con alta activación. Tristeza Negativa pasiva Emoción negativa con baja activación. Calma y neutral Positiva pasiva Baja activación, valencia más neutra o ligeramente positiva. Ilustración 32. Representación de las agrupaciones emocionales en función de su valencia y su activación Además, este tipo de agrupación favorece una futura implementación en entornos con recursos limitados o donde la velocidad de respuesta sea crucial. Tabla 10. Rendimiento del sistema para 4 emociones Precisión (%) Fine Tree 52,4 Cubic SVM 71,9 Fine KNN 78,5 Weighted KNN 75,3 Wide Neural Network 71,2 Conclusiones y discusión final del sistema 52 52 Por otro lado, se evaluó la reducción del número de emociones clasificadas en el sistema con el fin de demostrar la robustez y alcanzar el rendimiento máximo del modelo. Se hizo una reducción gradual del número de emociones, basándonos en agrupaciones realizadas en estudios previos, conformándose varias pruebas con 8, 6, 4 y 2 emociones. De manera esperable, el rendimiento del sistema fue aumentando conforme se reducían las emociones clasificadas. Esto se debe a la simplificación de las características evaluadas, ya que la discriminación entre menos clases presenta menor solapamiento en las características evaluadas y por consiguiente, menos ambigüedad para el clasificador. Finalmente, se analizó el rendimiento alcanzado por embeddings preentrenados, como VGGish y OpenL3. Es evidente que estos representan un estándar de referencia en sistemas de reconocimiento, alcanzando rendimientos superiores en la mayoría de los casos (en especial OpenL3, que alcanzó alrededor del 80 % para la clasificación de 8 emociones). Pese a que los sistemas embebidos ofrecen multitud de ventajes, esas ventajas vienen acompañadas de una mayor dependencia de modelos preentrenados de gran tamaño y una necesidad de recursos computacionales superiores, aspectos que limitan su aplicación en escenarios de baja latencia o dispositivos con recursos restringidos. Sin embargo, su inclusión en el estudio no tenía otro fin que establecer un límite comparativo para nuestro sistema base. Se ofrece a continuación una tabla comparativa de los resultados obtenidos mediante nuestro modelo y el modelo generado con los embeddings. Tabla 15. Comparación de rendimientos entre sistema propio y redes neuronales preentrenadas 8 emociones 2 emociones Sistema propio Embedding OpenL3 Sistema propio Embedding OpenL3 Fine Tree 44,4 37,5 71,2 57,3 Cubic SVM 65,4 74 76 85,8 Fine KNN 71,2 79,5 85,1 88,9 Weighted KNN 66,7 66,7 81,2 83,3 Wide Neural Network 58,3 70,5 70,8 79,5 En este contexto, el sistema basado en MFCCs ofrece un balance favorable entre rendimiento, eficiencia y robustez computacional. Aunque no alcanza las cifras máximas de OpenL3, sus resultados se acercan en gran manera, lo que resulta algo totalmente positivo dado que se está asemejando a un sistema de redes neuronales. Supone así una alternativa viable para entornos donde la disponibilidad de recursos es limitada. Por tanto, este sistema no solo sigue siendo competitivo, sino que aporta una ventaja práctica al adaptarse a contextos de menor complejidad técnica. En definitiva, mediante este estudio se ha realizado una investigación profunda del reconocimiento de emociones en señales de voz. Empezando por un enfoque histórico-teórico, comprendiendo cada una de las fases necesarias para conformar un sistema de reconocimiento y haciendo referencia a estudios ya realizados en este mismo ámbito. Posteriormente, se ha creado desde cero un modelo propio, siguiendo cada uno de los pasos estandarizados, seleccionando una base de datos, unas características a evaluar y analizando multitud de casuísticas posibles con el fin de encaminarlo hacia el modelo de mejor rendimiento, basando cada paso en pruebas y resultados. El sistema finalmente obtenido presenta una precisión del 71,2% para el reconocimiento de 8 emociones y 85,1% para dos grupos emocionales (positivo y negativo), haciendo uso de la base de datos RAVDESS y empleando como características a evaluar 13 MFCCs, el tono y la energía de las muestras de voz. Estos resultados demuestran que un sistema basado en descriptores clásicos sigue siendo altamente eficaz para el reconocimiento de emociones en señales de voz, alcanzando resultados de rendimiento realmente competitivos. Las evaluaciones realizadas refuerzan la aplicabilidad del modelo para futuras investigaciones y desarrollos en análisis de señales de voz, especialmente en escenarios donde la simplicidad, la eficiencia y la adaptabilidad técnica sean criterios prioritarios. 53 Reconocimiento de emociones mediante el análisis de señales de voz 7.1 Líneas futuras Teniendo en cuenta los resultados obtenidos en nuestro análisis, que continúan el camino de investigaciones similares pertenecientes al mismo ámbito, existen varios enfoques de mejora. En un primer lugar, la elección de la base de datos. Con el fin de acercar el sistema al mundo real y poder ofrecer un sistema robusto ante situaciones cotidianas, se podría estudiar la inclusión de muestras de voz pertenecientes a situaciones reales. Estos datos ya se recogen hoy en día en las bases de datos naturales, mencionadas en la investigación. En este caso entrarían en juego otros aspectos del ámbito acústico tales como la reducción de ruido externo. Por otro lado, se podrían explorar otros aspectos de la expresión emocional humana, tales como los gestos faciales, la respuesta cerebral o las variaciones fisiológicas, integrándolos dentro del sistema base para conseguir una detección más precisa y completa de las emociones. La combinación de diferentes fuentes de información podría mejorar significativamente la robustez y exactitud del sistema, especialmente en situaciones donde las muestras de voz no ofrezcan suficiente información. También resulta llamativo y novedoso las recientes arquitecturas de redes neuronales profundas, especialmente aquellas que incorporan mecanismos de atención o modelos multimodales (para gestionar otro tipo de datos como los mencionados; expresiones faciales, texto, etc). Del mismo modo, investigar técnicas avanzadas de preprocesado y extracción de características que permitan captar mejor las sutilezas emocionales de la voz, así como la aplicación de algoritmos de aprendizaje continuo que permitan al modelo adaptarse progresivamente a nuevos datos y variaciones en el habla. Sería especialmente interesante realizar pruebas en tiempo real para evaluar la viabilidad del sistema en aplicaciones prácticas, como asistentes virtuales, sistemas de atención al cliente o dispositivos médicos, garantizando su eficacia y robustez ante condiciones acústicas cambiantes. En conclusión, cabe destacar que el reconocimiento de emociones a partir de señales de voz es un campo de investigación importante y en expansión, con importantes aplicaciones prácticas. A pesar de los retos que plantean la complejidad emocional y la variabilidad acústica, el trabajo futuro debe centrarse en desarrollar sistemas más robustos y adaptables a la realidad, que capten mejor los matices de la comunicación emocional humana con el fin de facilitar su aplicación en la vida cotidiana. Conclusiones y discusión final del sistema 54 54 55 Reconocimiento de emociones mediante el análisis de señales de voz REFERENCIAS [1] «Supplemental Material for Voice-Only Communication Enhances Empathic Accuracy», American Psychologist, 2017, doi: 10.1037/amp0000147.supp. [2] M. Naeem, S. A. Fawzi, H. Anwar, y A. S. Malek, «Wearable ECG systems for accurate mental stress detection: a scoping review», 1 de junio de 2023, Institute for Ionics. doi: 10.1007/s10389-023-020996. [3] D. Grandjean, D. Sander, y K. R. Scherer, «Conscious emotional experience emerges as a function of multilevel, appraisal-driven response synchronization», Conscious Cogn, vol. 17, n.o 2, pp. 484-495, jun. 2008, doi: 10.1016/j.concog.2008.03.019. [4] Paul Ekman y Wallace V. Friesen, Emotion in the Human Face: Guidelines for Research and an Integration of Findings, 0080214975 ed. Pergamon Press, 1978. [5] J. A. Russell y A. Mehrabian, «Evidence for a Three-Factor Theory of Emotions», 1977. [6] J. Broekens, «Modeling the Experience of Emotion», International Journal of Synthetic Emotions, vol. 1, n.o 1, pp. 1-17, ene. 2010, doi: 10.4018/jse.2010101601. [7] A. Hashem, M. Arif, y M. Alghamdi, «Speech emotion recognition approaches: A systematic review», Speech Commun, vol. 154, p. 102974, oct. 2023, doi: 10.1016/J.SPECOM.2023.102974. [8] B. and S. D. and S. S. and D. L. and V. L. and V. T. and A. V. and A. N. Batliner Anton and Schuller, «The Automatic Recognition of Emotions in Speech», en Emotion-Oriented Systems: The Humaine Handbook, C. and P. P. Cowie Roddy and Pelachaud, Ed., Berlin, Heidelberg: Springer Berlin Heidelberg, 2011, pp. 71-99. doi: 10.1007/978-3-642-15184-2_6. [9] M. El Ayadi, M. S. Kamel, y F. Karray, «Survey on speech emotion recognition: Features, classification schemes, and databases», Pattern Recognit, vol. 44, n.o 3, pp. 572-587, mar. 2011, doi: 10.1016/J.PATCOG.2010.09.020. [10] S. G. Koolagudi y K. S. Rao, «Emotion recognition from speech: a review», Int J Speech Technol, vol. 15, n.o 2, pp. 99-117, 2012, doi: 10.1007/s10772-011-9125-1. [11] G. Trigeorgis et al., «Adieu features? End-to-end speech emotion recognition using a deep convolutional recurrent network», en ICASSP, IEEE International Conference on Acoustics, Speech and Signal Processing - Proceedings, Institute of Electrical and Electronics Engineers Inc., may 2016, pp. 52005204. doi: 10.1109/ICASSP.2016.7472669. [12] S. Tanberk y D. B. Tükel, «Ensemble Learning with CNN–LSTM Combination for Speech Emotion Recognition», en Proceedings of International Conference on Computing and Communication Networks, A. K. Bashir, G. Fortino, A. Khanna, y D. Gupta, Eds., Singapore: Springer Nature Singapore, 2022, pp. 39-47. [13] Z. Li, X. Xing, Y. Fang, W. Zhang, H. Fan, y X. Xu, «Multi-Scale Temporal Transformer For Speech Emotion Recognition», oct. 2024, [En línea]. Disponible en: http://arxiv.org/abs/2410.00390 Referencias 56 56 [14] A. Baevski, H. Zhou, A. Mohamed, y M. Auli, «wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations», oct. 2020, [En línea]. Disponible en: http://arxiv.org/abs/2006.11477 [15] W.-N. Hsu, B. Bolte, Y.-H. H. Tsai, K. Lakhotia, R. Salakhutdinov, y A. Mohamed, «HuBERT: SelfSupervised Speech Representation Learning by Masked Prediction of Hidden Units», jun. 2021, [En línea]. Disponible en: http://arxiv.org/abs/2106.07447 [16] A. Radford, J. W. Kim, T. Xu, G. Brockman, C. McLeavey, y I. Sutskever, «Robust Speech Recognition via Large-Scale Weak Supervision», dic. 2022, [En línea]. Disponible en: http://arxiv.org/abs/2212.04356 [17] R. Gretter, M. Matassoni, D. Falavigna, K. Evanini, y C. W. Leong, «Overview of the interspeech TLT2020 shared task on ASR for non-native children’s speech», en Proceedings of the Annual Conference of the International Speech Communication Association, INTERSPEECH, International Speech Communication Association, 2020, pp. 245-249. doi: 10.21437/Interspeech.2020-2133. [18] B. J. Abbaschian, D. Sierra-Sosa, y A. Elmaghraby, «Deep learning techniques for speech emotion recognition, from databases to models», 2 de febrero de 2021, MDPI AG. doi: 10.3390/s21041249. [19] C. E. Williams y K. N. Stevens, «Emotions and Speech: Some Acoustical Correlates», J Acoust Soc Am, vol. 52, n.o 4B, pp. 1238-1250, oct. 1972, doi: 10.1121/1.1913238. [20] R. Jahangir, Y. W. Teh, F. Hanif, y G. Mujtaba, «Deep learning approaches for speech emotion recognition: state of the art and research challenges», Multimed Tools Appl, vol. 80, n.o 16, pp. 2374523812, 2021, doi: 10.1007/s11042-020-09874-7. [21] E. Lieskovská, M. Jakubec, R. Jarina, y M. Chmulík, «A review on speech emotion recognition using deep learning and attention mechanism», 2 de mayo de 2021, MDPI AG. doi: 10.3390/electronics10101163. [22] B. Schuller, A. Batliner, S. Steidl, y D. Seppi, «Recognising realistic emotions and affect in speech: State of the art and lessons learnt from the first challenge», Speech Commun, vol. 53, n.o 9-10, pp. 1062-1087, nov. 2011, doi: 10.1016/J.SPECOM.2011.01.011. [23] Md. Shah Fahad, A. Ranjan, J. Yadav, y A. Deepak, «A survey of speech emotion recognition in natural environment», Digit Signal Process, vol. 110, p. 102951, 2021, doi: https://doi.org/10.1016/j.dsp.2020.102951. [24] A. Tawari y M. M. Trivedi, «Speech emotion analysis: Exploring the role of context», IEEE Trans Multimedia, vol. 12, n.o 6, pp. 502-509, 2010, doi: 10.1109/TMM.2010.2058095. [25] W. Wahlster, Verbmobil: Foundations of Speech-to-Speech Translation. 2000. doi: 10.1007/978-3-66204230-4. [26] C. Busso et al., «IEMOCAP: interactive emotional dyadic motion capture database», Lang Resour Eval, vol. 42, n.o 4, pp. 335-359, 2008, doi: 10.1007/s10579-008-9076-6. [27] S. Poria, D. Hazarika, N. Majumder, G. Naik, E. Cambria, y R. Mihalcea, «MELD: A Multimodal MultiParty Dataset for Emotion Recognition in Conversations», jun. 2019, [En línea]. Disponible en: http://arxiv.org/abs/1810.02508 [28] R. Subramanian, J. Wache, M. K. Abadi, R. L. Vieriu, S. Winkler, y N. Sebe, «ASCERTAIN: Emotion and Personality Recognition Using Commercial Sensors», IEEE Trans Affect Comput, vol. 9, n.o 2, pp. 147-160, 2018, doi: 10.1109/TAFFC.2016.2625250. [29] M. Grimm, K. Kroschel, y S. Narayanan, «The Vera am Mittag German audio-visual emotional speech database», en 2008 IEEE International Conference on Multimedia and Expo, 2008, pp. 865-868. doi: 10.1109/ICME.2008.4607572. [30] Éric Hanigan, Arielle Bonneville-Roussy, Gilles Dupuis, y Christophe Fortin, «Validation of the Measure of Emotions by Music (MEM)», Psychol Music, vol. 51, n.o 4, pp. 1379-1396, feb. 2023, doi: 10.1177/03057356221146811. 57 Reconocimiento de emociones mediante el análisis de señales de voz [31] K. R. Scherer, «What are emotions? And how can they be measured?», Social Science Information, vol. 44, n.o 4, pp. 695-729, 2005, doi: 10.1177/0539018405058216. [32] P. Mairano, E. Zovato, y V. Quinci, «Do sentiment analysis scores correlate with acoustic features of emotional speech?» [33] R. Elbarougy, «Extracting A Discriminative Acoustic Features from Voiced Segments for Improving Speech Emotion Recognition Accuracy», International Journal of Advanced Research in Computer Science and Electronics Engineering, vol. 8, n.o 9, 2019. [34] S. Maldonado y R. Weber, «A wrapper method for feature selection using Support Vector Machines», Inf Sci (N Y), vol. 179, n.o 13, pp. 2208-2217, 2009, doi: https://doi.org/10.1016/j.ins.2009.02.014. [35] T. N. Lal, O. Chapelle, J. Weston, y A. Elisseeff, «Embedded Methods», en Feature Extraction: Foundations and Applications, I. Guyon, M. Nikravesh, S. Gunn, y L. A. Zadeh, Eds., Berlin, Heidelberg: Springer Berlin Heidelberg, 2006, pp. 137-165. doi: 10.1007/978-3-540-35488-8_6. [36] M. Jain et al., Speech Emotion Recognition using Support Vector Machine. 2020. doi: 10.48550/arXiv.2002.07590. [37] T. L. Nwe, S. W. Foo, y L. C. De Silva, «Speech emotion recognition using hidden Markov models», Speech Commun, vol. 41, n.o 4, pp. 603-623, 2003, doi: https://doi.org/10.1016/S0167-6393(03)000992. [38] S. Singkul y K. Woraratpanya, «Vector learning representation for generalized speech emotion recognition», Heliyon, vol. 8, n.o 3, p. e09196, mar. 2022, doi: 10.1016/J.HELIYON.2022.E09196. [39] S. K. Pandey, H. S. Shekhawat, y S. R. M. Prasanna, «Deep Learning Techniques for Speech Emotion Recognition: A Review», en 2019 29th International Conference Radioelektronika (RADIOELEKTRONIKA), 2019, pp. 1-6. doi: 10.1109/RADIOELEK.2019.8733432. [40] K.-Y. Huang, C.-H. Wu, Q.-B. Hong, M.-H. Su, y Y.-H. Chen, «Speech Emotion Recognition Using Deep Neural Network Considering Verbal and Nonverbal Speech Sounds», en ICASSP 2019 - 2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2019, pp. 58665870. doi: 10.1109/ICASSP.2019.8682283. [41] J.-H. Hsu, M.-H. Su, C.-H. Wu, y Y.-H. Chen, «Speech Emotion Recognition Considering Nonverbal Vocalization in Affective Conversations», IEEE/ACM Trans Audio Speech Lang Process, vol. 29, pp. 1675-1686, 2021, doi: 10.1109/TASLP.2021.3076364. [42] H. Zou, Y. Si, C. Chen, D. Rajan, y E. S. Chng, «Speech Emotion Recognition with Co-Attention Based Multi-Level Acoustic Information», en ICASSP 2022 - 2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2022, pp. 7367-7371. doi: 10.1109/ICASSP43922.2022.9747095. [43] T. Seehapoch y S. Wongthanavasu, «Speech emotion recognition using support vector machines», en Proceedings of the 2013 5th International Conference on Knowledge and Smart Technology Kst 2013, 2013, pp. 86-91. doi: 10.1109/KST.2013.6512793. [44] S. Madanian et al., «Automatic Speech Emotion Recognition Using Machine Learning Automatic Speech Emotion Recognition Using Machine Learning: Mental Health Use Case», 2022. [45] A. A. Abdelhamid, «Speech Emotions Recognition for Online Education», Fusion: Practice and Applications, vol. 10, n.o 1, pp. 78-87, 2023, doi: 10.54216/FPA.100104. [46] V. K. Bongirwar y A. Potnurwar, «Song recommendation using speech emotion recognition», Int J Health Sci (Qassim), pp. 10428-10434, may 2022, doi: 10.53730/ijhs.v6ns1.7498. [47] A. F. Requardt, K. Ihme, M. Wilbrink, y A. Wendemuth, «Towards affect-aware vehicles for increasing safety and comfort: recognising driver emotions from audio recordings in a realistic driving study», IET Intelligent Transport Systems, vol. 14, n.o 10, pp. 1265-1277, oct. 2020, doi: https://doi.org/10.1049/ietits.2019.0732. [48] S. R. Livingstone y F. A. Russo, «The Ryerson Audio-Visual Database of Emotional Speech and Song (RAVDESS): A dynamic, multimodal set of facial and vocal expressions in North American English», Referencias 58 58 PLoS One, vol. 13, n.o 5, p. e0196391, may 2018, doi: 10.1371/journal.pone.0196391. [49] H. Purwins, B. Li, T. Virtanen, J. Schlüter, S.-Y. Chang, y T. Sainath, «Deep Learning for Audio Signal Processing», IEEE J Sel Top Signal Process, vol. 13, n.o 2, pp. 206-219, 2019, doi: 10.1109/JSTSP.2019.2908700. [50] S. O. Sadjadi y J. H. L. Hansen, «Unsupervised Speech Activity Detection Using Voicing Measures and Perceptual Spectral Flux», IEEE Signal Process Lett, vol. 20, n.o 3, pp. 197-200, 2013, doi: 10.1109/LSP.2013.2237903. [51] Y. Wang y W. Hu, «Speech Emotion Recognition Based on Improved MFCC», en Proceedings of the 2nd International Conference on Computer Science and Application Engineering, en CSAE ’18. New York, NY, USA: Association for Computing Machinery, 2018. doi: 10.1145/3207677.3278037. [52] Universidad de Salamanca, «Recursos docentes en Electrónica, Dispositivos - Distorsión». Accedido: 5 de julio de 2025. [En línea]. Disponible en: https://electronica.usal.es/Distorsion.html [53] S. Farsiani, H. Izadkhah, y S. Lotfi, «An optimum end-to-end text-independent speaker identification system using convolutional neural network», Computers and Electrical Engineering, vol. 100, may 2022, doi: 10.1016/j.compeleceng.2022.107882. [54] C. He et al., «A Novel Snore Detection and Suppression Method for a Flexible Patch With MEMS Microphone and Accelerometer», IEEE Internet Things J, vol. 9, n.o 24, pp. 25791-25804, 2022, doi: 10.1109/JIOT.2022.3199085. [55] J. Filos, «Time-Domain Alignment of Non-Stationary Signals», England, 2007. [En línea]. Disponible en: https://www.researchgate.net/publication/267779604 [56] A. Maas, «CS 224S / LINGUIST 285 Spoken Language Processing Lecture 5: GMM Acoustic Modeling and Feature Extraction Original slides by Dan Jurafsky», 2017. [57] J. , E. D. P. W. , F. D. , J. A. , L. R. , M. R. C. , P. M. , & R. M. Gemmeke, «Audio Set: An ontology and human-labeled dataset for audio events». Accedido: 22 de junio de 2025. [En línea]. Disponible en: https://research.google.com/audioset/ [58] MathWorks, «VGGish Embeddings - MATLAB Documentation», https://es.mathworks.com/help/audio/ref/vggishembeddings.html. [59] MathWorks, «OpenL3 Features - MATLAB Documentation», https://es.mathworks.com/help/audio/ref/openl3features.html. [60] B. Schuller, A. Batliner, S. Steidl, y D. Seppi, «Recognising Realistic Emotions and Affect in Speech: State of the Art and Lessons Learnt from the First Challenge». 59 Reconocimiento de emociones mediante el análisis de señales de voz