scieee AI-readable full text Open interactive document viewer

Repositorio Institucional de Documentos

Abstract

En el presente Trabajo Fin de Máster se ha llevado a cabo la implementación y evaluación de un algoritmo de fusión multimodal para detección de emociones propuesto anteriormente. Ello ha implicado la realización de las siguientes tareas: La mejora del módulo de detección facial previo, permitiendo la detección de expresiones faciales de forma automática y posibilitando el procesado de largas secuencias de vídeo. El desarrollo de un módulo de detección de emociones en texto, basado en el diccionario de Whissell, capaz de proporcionar una salida emocional en el espacio continuo. El desarrollo de una aplicación, en forma de mensajería instantánea, que permite a dos usuario interactuar emocionalmente por medio de expresiones faciales (vídeo), texto y emoticonos y que recoge todos los datos necesarios para el posterior cálculo de las salidas emocionales de cada uno de los módulos estudiados. La implementación del algoritmo de fusión y la prueba de su funcionamiento gracias a los módulos faciales, de texto y a los emoticonos. El diseño de un método de evaluación para sistemas de detección de emociones continuas y el desarrollo de todas las herramientas necesarias para su aplicación. Dicho método ha sido empleado para estudiar el efecto de la fusión multimodal en las tasas de acierto. El análisis de los resultados obtenidos, identificando las virtudes y los defectos tanto del algoritmo de fusión como del módulo de detección facial. Ballano Pablo, Sergio; Baldassarri Santa Lucía, Sandra; Cerezo Bagdasari, Eva

Full text

Máster en Ingeniería de Sistemas e Informática Programa Oficial de Posgrado en Ingeniería Informática Evaluación de un Sistema Multimodal de Reconocimiento de Emociones Autor: Sergio Ballano Pablo Directoras: Dra. Sandra Baldassarri Dra. Eva Cerezo Curso 2010/2011 Zaragoza, Septiembre 2011 A Laude y Aniceto, mis padres Agradecimientos Quiero agradecer a todas las personas que me han apoyado, de una forma u otra, en la elaboración de este trabajo. Al Instituto Tecnológico de Aragón que me ha permitido compatibilizar mi desarrollo profesional con la realización del máster. A mis tutoras Eva y Sandra, que me han orientado en el desarrollo del Trabajo Fin de Máster y a Isabelle, por mostrarme la computación afectiva y sus posibilidades. A todas las personas que han participado mediante la grabación de datos para este trabajo o la realización de los test de anotación. También quiero dar las gracias a mi familia y amigos, que me han apoyado, comprendido y aconsejado sin pedir nada a cambio. Evaluación de un Sistema Multimodal de Reconocimiento de Emociones Resumen En el presente Trabajo Fin de Máster se ha llevado a cabo la implementación y evaluación de un algoritmo de fusión multimodal para detección de emociones propuesto anteriormente. Ello ha implicado la realización de las siguientes tareas: La mejora del módulo de detección facial previo, permitiendo la detección de expresiones faciales de forma automática y posibilitando el procesado de largas secuencias de vídeo. El desarrollo de un módulo de detección de emociones en texto, basado en el diccionario de Whissell, capaz de proporcionar una salida emocional en el espacio continuo. El desarrollo de una aplicación, en forma de mensajería instantánea, que permite a dos usuario interactuar emocionalmente por medio de expresiones faciales (vídeo), texto y emoticonos y que recoge todos los datos necesarios para el posterior cálculo de las salidas emocionales de cada uno de los módulos estudiados. La implementación del algoritmo de fusión y la prueba de su funcionamiento gracias a los módulos faciales, de texto y a los emoticonos. El diseño de un método de evaluación para sistemas de detección de emociones continuas y el desarrollo de todas las herramientas necesarias para su aplicación. Dicho método ha sido empleado para estudiar el efecto de la fusión multimodal en las tasas de acierto. El análisis de los resultados obtenidos, identificando las virtudes y los defectos tanto del algoritmo de fusión como del módulo de detección facial. Publicaciones Relacionadas TÍTULO: «Scalable multimodal fusion for continuous affect sensing» AUTORES: Isabelle Hupont, Sergio Ballano, Sandra Baldassarri, Eva Cerezo TIPO DE PARTICIPACIÓN: Presentación oral en conferencia internacional CONFERENCIA: Symposium Series on Computational Intelligence PUBLICACIÓN: IEEE Workshop on Affective Computational Intelligence (WACI) ISBN: 978-1-61284-083-3 LUGAR: Paris (Francia) FECHA: 11-15 Abril 2011 ESTADO: Presentado y publicado TÍTULO: «Continuous Facial Affect Recognition from Videos» AUTORES: Sergio Ballano, Isabelle Hupont, Eva Cerezo, Sandra Baldassarri TIPO DE PARTICIPACIÓN: Presentación oral en conferencia internacional CONFERENCIA: XII Congreso de Interacción Persona-Ordenador (Interacción 2011) LUGAR: Lisboa (Portugal) FECHA: 2-5 Septiembre 2011 ESTADO: Presentado TÍTULO: «Recognizing Emotions from Video in a Continuous 2D Space» AUTORES: Sergio Ballano, Isabelle Hupont, Eva Cerezo, Sandra Baldassarri TIPO DE PARTICIPACIÓN: Póster CONFERENCIA: 13th IFIP TC13 Conference on Human-Computer Interaction (Interact 2011) LUGAR: Lisboa (Portugal) FECHA: 5-9 Septiembre 2011 ESTADO: Presentado TÍTULO: «Emotional Facial Sensing and Multimodal Fusion in a Continuous 2D Affective Space» AUTORES: Eva Cerezo, Isabelle Hupont, Sandra Baldassarri, Sergio Ballano TIPO DE PARTICIPACIÓN: Artículo en revista REVISTA: Journal of Ambient Intelligence and Humanized Computing ESTADO: Aceptado FECHA DE ACEPTACIÓN: 29 de Agosto de 2011 V TÍTULO: «From A Discrete Perspective Of Emotions To Continuous, Dynamic And Multimodal Affect Sensing» AUTORES: Isabelle Hupont, Sergio Ballano, Eva Cerezo, Sandra Baldassarri TIPO DE PARTICIPACIÓN: Capítulo de libro «Advances in Emotion Recognition» EDITORIAL: Wiley-Blackwell FECHA DE ENTREGA: 23 de Junio de 2011 ESTADO: En revisión Índice general 1. Introducción 1 1.1. Contexto.................................. 1 1.2. Objetivos ................................. 3 2. Estado del Arte 4 2.1. Detección de Emociones . . . . . . . . . . . . . . . . . . . . . . . . . 4 2.2. FusiónMultimodal ............................ 5 2.3. Métodos de Anotación y Evaluación . . . . . . . . . . . . . . . . . . . 6 3. Sistema de Fusión Multimodal 8 3.1. Descripción del Sistema . . . . . . . . . . . . . . . . . . . . . . . . . 8 3.1.1. Mapeo Emocional a un Espacio 2D Continuo . . . . . . . . . . 8 3.1.2. Fusión Temporal de Diferentes Módulos . . . . . . . . . . . . . 9 3.1.3. Cinética Emocional . . . . . . . . . . . . . . . . . . . . . . . . 11 3.2. CasodeEstudio.............................. 13 3.2.1. MóduloFacial .......................... 14 3.2.2. MódulodeTexto......................... 16 3.2.3. Módulo de Emoticonos . . . . . . . . . . . . . . . . . . . . . . 17 4. Herramientas Desarrolladas 19 4.1. Herramienta de Mensajería Instantánea . . . . . . . . . . . . . . . . . . 19 4.2. Herramienta de Selección de Puntos Clave . . . . . . . . . . . . . . . . 20 4.3. Herramienta de Anotación de Puntos Clave . . . . . . . . . . . . . . . 21 5. Evaluación del Sistema Multimodal 23 Índice general VII 5.1. Sesiones de Recogida de Datos . . . . . . . . . . . . . . . . . . . . . . 23 5.2. Selección de Puntos Clave . . . . . . . . . . . . . . . . . . . . . . . . 23 5.3. Anotación de Puntos Clave . . . . . . . . . . . . . . . . . . . . . . . . 24 5.4. Análisis de los Datos Anotados . . . . . . . . . . . . . . . . . . . . . . 24 5.5. Resultados de la Evaluación . . . . . . . . . . . . . . . . . . . . . . . 27 5.6. Análisis de Resultados . . . . . . . . . . . . . . . . . . . . . . . . . . 28 5.6.1. Resultados del Nuevo Método Facial . . . . . . . . . . . . . . 28 5.6.2. Resultados del Algoritmo de Fusión . . . . . . . . . . . . . . . 29 6. Conclusiones y Trabajo Futuro 32 A. Publicaciones Relacionadas 39 CAPÍTULO 1 Introducción La computación afectiva busca mejorar la tradicional forma de interacción personaordenador permitiendo conocer el estado emocional del usuario. Esto abre posibilidades como ofrecer diferentes respuestas acordes al estado de ánimo del usuario o conocer las reacciones del usuario ante ciertos estímulos o situaciones. La comunicación de emociones entre personas se realiza de forma natural a través de diversos canales (tono de voz, expresiones faciales, etc). En este sentido, los esfuerzos actuales por mejorar la fiabilidad de los sistemas de detección de emociones se encaminan hacia la multimodalidad, es decir; emplear simultáneamente información procedente de diversas fuentes para obtener una mejor comprensión del estado emocional del usuario. Actualmente la detección multimodal es un campo abierto de investigación que presenta varios retos siendo el más apreciable la fusión de información procedente de medios muy diversos, como señales fisiológicas (conductividad de la piel, ritmo cardiaco, etc) con imágenes de vídeo (gestos faciales, movimientos de cabeza y expresiones corporales), audio, texto escrito, etc. Otros problemas son la carencia de bases de datos multimodales anotadas y la complejidad de evaluar los resultados obtenidos. 1.1. Contexto Siguiendo la línea de investigación abierta por Hupont [1] se pretende obtener un sistema fiable de detección de emociones, mejorando las tasas de acierto de sistemas anteriores. Para ello se desarrollará y evaluará un sistema multimodal cuyo esquema se muestra en la figura 1.1. El sistema parte de la información recogida a través de varios canales (o modalidades), esta información se procesa mediante una serie de módulos emocionales, que pueden haber sido desarrollados de forma independiente. En el caso concreto de este CAPÍTULO 3 Sistema de Fusión Multimodal El sistema que se presenta en este capítulo se ha implementado en base al algoritmo de fusión planteado por Hupont [1]. Este algoritmo pretende ser flexible, permitiendo el empleo de múltiples módulos emocionales de distinta naturaleza, proporcionando un resultado coherente y cuya tasa de acierto sea superior a cada uno de los módulos por separado. La ventaja de este método de fusión es que permite la fusión de módulos tan distintos como los que emplean señales fisiológicas con los que procesan texto introducido por el usuario y que hayan sido desarrollados de forma independiente, sin estar diseñados para trabajar junto con otros módulos. Esto es posible gracias a emplear la fusión a nivel de decisión, es decir, cada módulo procesa la información de los canales que emplea y proporciona una salida emocional; posteriormente las distintas salidas son fusionadas en el espacio continuo proporcionando un único resultado. 3.1. Descripción del Sistema A continuación se describen las tres partes de las que consta el sistema de fusión multimodal que se pretende evaluar: mapeo emocional, fusión temporal y «cinética emocional». 3.1.1. Mapeo Emocional a un Espacio 2D Continuo El primer paso en el algoritmo de fusión consiste en tener los resultados de cada uno de los módulos expresados en los mismos términos, en este caso, en el espacio Whissell [9]. En el caso de que un módulo proporcione como salida una única categoría discreta, su paso al espacio continuo es directo, al estar todas las categorías representadas como puntos en el espacio Whissell 2D (ver figura 2.1). Otra posibilidad, como por ejemplo la mostrada en la figura 3.1 y que corresponde con el módulo facial desarrollado por 3.1. Descripción del Sistema 9 Hupont et al [29], es que el módulo proporcione no una única categoría, sino una mezcla de ellas, con un peso asociado a cada una. En este caso, conociendo las posiciones 2D de las categorías y los pesos, se puede calcular la suma ponderada de todas las categorías, obteniendo un único punto en el espacio. Por último, en caso de que el módulo proporcione una salida bidimensional, como es el caso concreto del módulo de texto, desarrollado en este trabajo, no es necesario realizar ninguna conversión. Figura 3.1: Mapeo de la salida del módulo facial al espacio Whissell 3.1.2. Fusión Temporal de Diferentes Módulos Las emociones humanas se presentan inherentemente siguiendo un patrón temporal continuo [11]. Partiendo de esta base y gracias al empleo del espacio bidimensional evaluación-activación, el progreso emocional de un usuario puede ser representado como un punto (correspondiente a la posición de un estado afectivo concreto en el momento t) moviéndose por este espacio a lo largo del tiempo. El segundo paso de la metodología de fusión busca calcular el recorrido emocional mediante la fusión de 3.1. Descripción del Sistema 10 diferentes puntos pi(t0i)obtenidos por los distintos módulos a lo largo del tiempo. La dificultad principal para conseguir la fusión multimodal se da por el hecho de que el momento exacto en el que se obtendrá una nueva entrada temporal (t0i) para cada módulo puede ser conocido o no y el tiempo entre entradas puede ser muy diferente para cada módulo. Para solucionar este problema se propone la siguiente ecuación que calcula el estado afectivo global p(t) = [x(t); y(t)] en un momento de tiempo arbitrario t: p(t) = N X i=1 αi(t)pi(t0i) N X i=1 αi(t) (3.1) donde Nes el número de modalidades fusionadas, t0iel momento en el que se produce el último estímulo detectado por el módulo iyαi(t)es la confianza entre 0 y 1 asignados a cada modalidad ien cada momento t. De esta forma, la respuesta afectiva completa es la suma de la contribución de cada una de las modalidades pi(t0i)ponderada por el coeficiente αi(t)a lo largo del tiempo. La definición de αi(t)es especialmente importante dado que gobierna la respuesta temporal de la fusión. Tal y como propone Picard [30], la respuesta afectiva humana es análoga a los sistemas con respuesta aditiva que decaen con el tiempo, y en ausencia de una entrada, la respuesta regresa a un estado neutro. Siguiendo esta analogía, el valor de αi(t)se define como: αi(t) = (bici(t0i)e−di(t−t0)if t > ε 0elsewhere (3.2) donde: bies la confianza global que posee cada módulo i, habitualmente la tasa de acierto del mismo. ci(t0i)es la confianza temporal de cada módulo ipara un instante concreto debido a factores externos (no debidos a la propia clasificación). Esto permite tener en cuenta, por ejemplo, un error temporal en el sensor en caso de señales fisiológicas 3.1. Descripción del Sistema 11 o una pérdida de las características faciales en caso de un módulo de expresiones faciales (debido a oclusiones, mala iluminación, etc). dies la tasa de decaimiento (en s−1) e indica cómo de rápido desaparece un estímulo con el tiempo para el módulo i. εes el umbral por debajo del cual se desprecia la contribución de un módulo. Esto es necesario dado que las funciones exponenciales tienden a cero en el infinito pero sin llegar a anularse completamente; cualquier αi(t)por debajo de εserá despreciado. Estableciendo los parámetros antes mencionados para cada módulo iy aplicando las ecuaciones (3.1) y (3.2) se puede calcular el recorrido emocional que caracteriza el progreso afectivo del usuario p(t)a lo largo del tiempo. En otras palabras, el recorrido emocional se construye añadiendo progresivamente muestras a la trayectoria p(tk), siendo tk=k∆t(con kentero) y ∆tel intervalo temporal entre muestras. 3.1.3. Cinética Emocional En el cálculo de la trayectoria emocional aparecen dos grandes problemas: 1. Si la contribución de cada módulo fusionado es nula en un instante determinado, es decir, todos los αi(t)son nulos, el denominador de (3.1) es cero y la trayectoria no puede ser calculada. Ejemplos de situaciones en las que la contribución de un módulo es nula son un fallo de un sensor en el caso de módulos fisiológicos, oclusiones en el caso de sistemas por visión o, sencillamente, cuando no se produce ninguna entrada durante un tiempo y αi(t)decae por completo. 2. Si aparecen conflictos entre distintos módulos, o en caso de que un módulo produzca gran cantidad de ruido, pueden producirse grandes «saltos emocionales» en el espacio de Whissell. Ambos problemas pueden ser resueltos aplicando un filtrado de Kalman a la trayectoria emocional resultante de la fusión. Por definición, el filtro de Kalman estima el estado de un sistema combinando una predicción inexacta con una observación inexacta de ese estado, de forma que el término con menor incertidumbre recibe el mayor peso 3.1. Descripción del Sistema 12 en cada instante t. De esta forma, por un lado, el filtro de Kalman alisa la trayectoria emocional previniendo los «saltos emocionales» que erróneamente pueden aparecer debido al ruido que presentan ciertos módulos. Por otro lado, se evitan situaciones en las que la suma de todos los αi(t)resulte nula, empleando la predicción del Kalman en lugar del cálculo de la ecuación (3.1) para esas muestras. De forma análoga a la mecánica clásica, en la «cinética emocional» se tiene un punto 2D moviéndose por el espacio de Whissell: la posición y velocidad son modelados como el estado del sistema Xken el filtro de Kalman. Así Xk= [x, y, vx, vy]T k representa la posición y velocidad XY en el instante tk. Las sucesivas muestras p(tk) de la trayectoria emocional son consideradas observaciones del estado del sistema. Las dos ecuaciones implicadas en el filtrado de Kalman son la Ecuación de Proceso y la Ecuación de Medida. 3.1.3.1. Ecuación de Proceso Xk+1 =Fk+1;kXk+wk     x y vx vy    k+1 =    1 0 1 0 0 1 0 1 0 0 1 0 0 0 0 1         x y vx vy    k +wk donde Fk+1;kes la matriz de transferencia lleva el estado Xkdel instante kal instante k+1 (de una muestra de la trayectoria emocional a la siguiente). Se asume que el ruido de proceso wkes aditivo, blanco y gausiano con media cero. Tal y como se sugiere en la literatura [31] su matriz de covarianza Qkse define como: Qk=σ2    1 301 20 01 301 2 1 2010 01 20 1     donde σ2es la intensidad del ruido blanco gausiano que modela la aceleración del punto 2D, ya que ésta no ha sido tenida en cuenta en la ecuación de estado del sistema. 3.2. Caso de Estudio 13 3.1.3.2. Ecuación de Medida Yk=HkXk+zk xm ymk =1 0 0 0 0 1 0 0 k     x y vx vy    k +zk donde Ykes la medida en el instante kyHkes la matriz de medida. El ruido de medida zkse asume aditivo, blanco, gausiano, con media nula y no correlacionado con el ruido del proceso wk. Su matriz de covarianza Rkes la matriz identidad: Rk=λ0 0λ esto es asumiendo que las medidas en xeycontienen errores independientes con varianza λ unidades2. Una vez que las ecuaciones de proceso y medida están definidas es posible aplicar la estimación iterativa de Kalman a la trayectoria emocional, de forma que cada iteración corresponda a una nueva muestra. 3.2. Caso de Estudio A fin de demostrar la eficacia del algoritmo de fusión planteado este será probado gracias a tres módulos: un módulo facial, un módulo de texto y un módulo de emoticonos. Los datos que analizarán dichos módulos se obtendrán mediante una herramienta de mensajería instantánea desarrollada para tal efecto y que será explicada en la Sección 4.1. Los usuarios que empleen esta herramienta podrán comunicarse mediante vídeo, texto escrito y emoticonos; así pues la herramienta es capaz de proporcionar una entrada de vídeo para el módulo facial y entradas de texto y emoticonos para sus respectivos módulos. Los tres módulos presentan salidas muy diferentes: mientras que el facial proporcionará una respuesta para cada frame de vídeo y a intervalos de tiempo conocidos a 3.2. Caso de Estudio 14 priori, el módulo de texto únicamente proporcionará una respuesta por cada frase con contenido emocional que el usuario escriba y el módulo de emoticonos proporcionará un menor número de respuestas pero con una gran confianza en las mismas. Fusionando tres canales tan diferentes se pretende demostrar la flexibilidad del algoritmo de fusión. Si bien los resultados proporcionados por el módulo de texto y emoticonos serán relativamente esporádicos, se pretende que estos ayuden a resolver situaciones en las que el módulo facial falla debido a una baja tasa de detección de ciertas emociones (como la distinción entre triste y neutro) o a fallos en la detección de los puntos característicos. 3.2.1. Módulo Facial El módulo facial de detección de emociones consta de dos partes; detección de distancias faciales y clasificación de las mismas. Este módulo se basa en el algoritmo desarrollado por Hupont [32], con la diferencia de que en este trabajo fin de máster se realiza la detección de distancias faciales de forma automática en lugar de manual. Para ello se ha empleado la librería faceAPI [33] que proporciona los puntos faciales mostrados en la Figura 3.2. Esto permite el procesamiento de vídeos de larga duración, no limitando las entradas a imágenes estáticas o secuencias cortas. 4.6 4.4 4.2 4.1 4.3 4.5 3.1 3.2 3.4 3.9 3.5 3.7 3.11 3.8 3.6 3.12 8.1 8.3 8.2 8.4 D4 D3 ESo D6 D5 D1 D2 A1 A2 A3 A4 (a) (b) (c) D3 D2 D5 A1 A2 D4 A3 A4 D1 Figura 3.2: Puntos faciales representativos (a), distancias faciales calcuadas por el método manual (b) y distancias faciales calculadas por el método automático (c) Mediante la posición de estos puntos, se calcula una serie de distancias y ángulos relativos entre puntos y se normalizan con respecto a la cara neutra. Sin embargo, a lo largo del desarrollo del Trabajo Fin de Máster, se observó que los puntos faciales correspondientes a los ojos proporcionados por faceAPI (marcados en azul en la imagen 3.2. Caso de Estudio 15 3.2a) están erróneamente posicionados (faceAPI únicamente ubica estos puntos en base al resto), lo cual imposibilita el uso de los mismos durante la fases posteriores del algoritmo. A fin de mitigar en lo posible los efectos negativos de la pérdida de la información de estas características faciales, se seleccionaron una serie de distancias faciales alternativas, aprovechando las características disponibles. A pesar de esto, como se comenta en la sección 5.5, la tasa de detección del módulo facial ha disminuido notablemente con respecto a la selección manual de características. Una vez obtenidas las distancias relativas a la cara neutra estas se clasifican empleando la colección de algoritmos de machine learning Weka [34]. En concreto se una combinación de los clasificadores RIPPER,Multilayer Perceptron,SVM,Naive Bayes yC4.5. El resultado de la combinación de los clasificadores anteriores reduce el riesgo global de fallo, si bien cada clasificador puede tener un mejor funcionamiento para una clase individual [29]. A fin de entrenar los clasificadores mencionados en el párrafo anterior han sido empleadas dos bases de datos de expresiones faciales, la «MMI Facial Expression Database» [35] y la «MUG Facial Expression Database» [36]. Estas bases de datos permiten conseguir una muestra de imágenes anotadas lo suficientemente extensa y universal. De esta forma se facilita que el reconocimiento de expresiones faciales funcione bien en personas de ambos sexos y diferentes rasgos faciales. Un ejemplo de imágenes procedentes de estas bases de datos puede observarse en la Imagen 3.3. Figura 3.3: Ejemplos de imágenes procedentes de las bases de datos 3.2. Caso de Estudio 16 Con las distancias faciales obtenidas a partir de estas imágenes se entrena el modelo empleado para clasificar las distancias faciales de cada uno de los frames de un vídeo. El módulo facial proporciona como salida para cada frame, el peso asociado a cada una de las emociones de Ekman más el estado neutro (Imagen 3.4). Esta salida constituye la entrada proporcionada al algoritmo de fusión, junto con una estimación de la precisión de detección de los puntos faciales que será empleada como valor ci(t0i)en el algoritmo de fusión. Figura 3.4: Ejemplo de salida emocional proporcionada por el módulo facial 3.2.2. Módulo de Texto El módulo de texto analiza el texto tecleado por el usuario y sido desarrollado íntegramente en este trabajo fin de máster. El módulo proporciona como resultado un punto en el espacio bidimensional por cada frase con carga emocional. En función de la conversación entre los usuarios el número de este tipo de frases puede ser muy alto o relativamente bajo, pero puede ser de gran ayuda en la detección de emociones que mediante el módulo facial resultan complicadas de distinguir. Texto introducido por el usuario Resultado Forma Morfológica Flores Flor Comiendo Comer 1 Eliminación de "stop words" a al algo algunas algunos ante antes como 2 Negaciones no guapo feo 3 Ponderación x N 5 Figura 3.5: Esquema de funcionamiento del módulo de texto 3.2. Caso de Estudio 17 El proceso de cálculo del estado emocional a partir de texto se observa en la figura 3.5 y consta de cinco fases: 1. La frase es descompuesta y convertida a su forma más simple; los sustantivos pasan a singular masculino, los verbos a infinitivo, etc. Para esta tarea se emplea la librería de análisis de texto FreeLing [37] capaz de trabajar en varios idiomas. 2. Se eliminan las llamadas «stop-words» que no aportan información a la frase a fin de simplificarla (por ejemplo «algo», «desde», «esa», «esto», etc). 3. Se detecta la presencia de negadores, que modificarán el valor de las palabras a las que precedan. 4. Se buscan las palabras restantes en el diccionario Whissell, de forma que se les asigne un valor emocional. 5. Se pondera el valor emocional de todas las palabras de la misma frase, proporcionando el resultado final. El valor emocional de cada frase f(k)queda definido según la ecuación 3.3, donde p(i)es la posición en el espacio Whissell de cada palabra y η(i)tomará el valor de −1 en caso de existir un negador o 1en caso contrario y siendo Nel número de palabras con valor emocional. f(k) = N X i=1 η(i)p(i) N(3.3) 3.2.3. Módulo de Emoticonos Por último, el módulo de emoticonos permite que el usuario reporte directamente su estado emocional durante una conversación. La frecuencia que puede esperarse de este módulo es pequeña, pero de gran importancia por tres motivos; la tasa de acierto de este módulo es del 100% (a no ser por error o engaño por parte del usuario), permite la entrada de estados emocionales en el algoritmo de fusión que el módulo facial no es capaz de detectar, como el aburrimiento, la calma o la satisfacción y el usuario suele emplearlo en momentos clave de mayor intensidad emocional. 5.3. Anotación de Puntos Clave 24 las emociones presentadas en ellos. En la imagen 5.1 puede observarse una trayectoria emocional y un ejemplo de puntos clave seleccionados sobre la misma. De estos instantes clave se extraen las imágenes que serán mostradas a los anotadores (empleando la herramienta descrita en la Sección 4.2) junto con las dos últimas frases intercambiadas antes de cada instante de tiempo de forma que los anotadores tengan mayor conocimiento del contexto. Figura 5.1: Trayectoria emocional y puntos clave seleccionados 5.3. Anotación de Puntos Clave Los puntos clave fueron anotados en el espacio Whissell gracias a la participación de 18 voluntarios. Los anotadores disponen para cada instante a anotar de la imagen capturada por la cámara, las dos últimas frases escritas por los usuarios del chat así como los emoticonos que puedan estar incluidos dentro de estas frases (Imagen 5.2). De esta forma los anotadores disponen de la mayor información disponible para determinar el estado emocional del sujeto. 5.4. Análisis de los Datos Anotados Los datos de las evaluaciones recogidas han sido empleados para definir una región en el espacio 2D donde el resultado emocional se considera correctamente localizado. El algoritmo que calcula la forma de la región está basado en el Minimum Volume Ellipsoid (MVE) empleando el método descrito por Kumar y Yildrim [39]. El algorimo 5.4. Análisis de los Datos Anotados 25 Figura 5.2: Herramienta de anotación e información mostrada al anotador MVE busca el elipsoide de menor volumen capaz de incluir todo el conjunto de puntos, excluyendo espurios en caso de existir. Figura 5.3: Método del Elipsoide de Mínimo Volumen sobre el espacio Whissell En la imagen 5.3 se observa la representación del Método del Elipsoide del Mínimo Volumen sobre el espacio Whissell. Las marcas representadas mediante «+» son los puntos seleccionados por los anotadores, «+» marca del elipsoide del mismo y el símbolo «*» representa la salida emocional del módulo evaluado o del algoritmo de fusión según sea el caso. Los MVEs calculados son empleados para evaluar los resultados a cuatro niveles diferentes: 1. Criterio de la elipse. Si el punto detectado por el sistema se encuentra dentro de la elipse es considerado acierto (Imagen 5.3a), en caso contrario fracaso (Imagen 5.3b). 5.4. Análisis de los Datos Anotados 26 2. Criterio del cuadrante. La salida del sistema es considerada correcta en caso de que se encuentre dentro del mismo cuadrante del espacio Whissell que el centro de la elipse calculada. En la Imagen 5.3a el criterio sería fracaso, mientras que en 5.3b sería acierto. 3. Criterio del eje de evaluación. La salida del sistema se considera correcta si está situada en el mismo semi-eje (positivo o negativo) del eje de evaluación que el centro de la elipse. Esta información es especialmente útil para determinar si una emoción es positiva o negativa. En ambos casos de la imagen 5.3 sería acierto. 4. Criterio del eje de activación. Es el criterio anterior aplicado al eje de activación. Esta información es relevante para conocer si un usuario está más dispuesto a realizar alguna acción bajo el estado emocional.En la Imagen 5.3a el criterio sería fracaso, mientras que en 5.3b sería acierto. Uno de los problemas que surgen a la hora de comparar tasas de acierto entre métodos desarrollados por distintos autores resulta del hecho de que los datos empleados por unos pueden consistir en sujetos que expresan una emoción de forma actuada [35] (con mayor o menor grado de exageración), otros pueden consistir en emociones provocadas deliberadamente mediante un estímulo externo [40] y en un tercer grupo las emociones aparecen de forma natural [5], resultando mucho más difíciles de detectar. Una posible solución a este problema es el uso del método de las elipses tal como se ha planteado aquí. La ventaja de emplear el método de las elipses consiste en que la distancia máxima permitida para que un punto sea considerado acierto varía en cada caso. Si una expresión resulta muy exagerada los puntos seleccionados por los anotadores se concentran en una región pequeña del espacio, resultando más estricta la aceptación del resultado del sistema como válido. Un ejemplo de esta situación puede observarse en la imagen 5.4. Sin embargo, en el caso de expresiones no actuadas, o expresiones poco claras y que admiten más de una interpretación nos encontramos con que el área marcada por el conjunto de anotadores resulta mucho más extensa, siendo más flexible a la hora de aceptar un resultado del sistema de detección estudiado (imagen 5.5). De esta forma se obtiene un resultado dependiente del grado de consenso entre anotadores. 5.5. Resultados de la Evaluación 27 Figura 5.4: Expresión característica en la que todos los anotadores coinciden Figura 5.5: Expresión poco clara en la que hay gran dispersión entre anotadores 5.5. Resultados de la Evaluación Los resultados obtenidos mediante las diferentes estrategias de evaluación se muestran en la Tabla 5.1. Se presentan los resultados de los algoritmos faciales, del de texto y del módulo de fusión multimodal. En este último caso, como puede observarse, la tasa de acierto es del 68,75 % en el caso más restrictivo (el criterio de la elipse) y se sitúa en 94,79% cuando se considera el criterio de activación. Es importante destacar que, de acuerdo a Bassili [41], un observador entrenado puede clasificar correctamente una media del 87 % de las expresiones faciales. Tal y como se ha comentado en el apartado anterior, debido a la gran diversidad de métodos de clasificación (discretos y continuos) y de evaluación empleados por los distintos autores, resulta complicado comparar objetivamente los resultados obtenidos por distintos autores. A modo de ejemplo, Busso et al [42] muestra un sistema bimodal (facial + audio), con emociones actuadas y reconocimiento facial basado en marcadores 5.6. Análisis de Resultados 28 Elipse Cuadrante Evaluación Activación Facial (manual [1]) 73,73 % 87,45 % 94,12 % 92,94 % Facial (automático) 59,38 % 75,00 % 82,29 % 94,79 % Texto 69,56 % 73,91 % 79,16 % 78,26 % Fusion 68,75 % 77,08 % 83,33 % 94,79 % Cuadro 5.1: Tasas de acierto de los algoritmos facial y de fusión colocados sobre la piel del sujeto a estudiar. La clasificación se realiza únicamente en base a cuatro categorías (enfado, tristeza, alegría y neutra). La tasa de acierto del módulo de audio es del 70,9 %, la tasa del módulo de facial es del 85% resultando una tasa de acierto combinada del 89,1 %. Por otro lado Kim [19] evalúa un sistema de fusión bimodal (audio + señales fisiológicas), los resultados son proporcionados en el espacio continuo, sin embargo su criterio de evaluación se limita a observar el cuadrante en el que se encuentra el resultado. Se obtienen tasas de acierto de un 51% para el módulo fisiológico, un 54 % para el módulo de audio y un 55 % para el sistema combinado. No obstante sus resultados parecen muy dependientes del sujeto estudiado, llegando en un caso a obtener una tasa del 92 %. 5.6. Análisis de Resultados A continuación se presenta el análisis de los resultados obtenidos gracias a las evaluaciones realizadas y a la observación de las trayectorias emocionales del módulo facial y el algoritmo de fusión multimodal. 5.6.1. Resultados del Nuevo Método Facial Como puede observarse en la tabla 5.1, el módulo facial ha sufrido un descenso importante en la tasa de acierto, esto es debido a dos factores fundamentales: 1. La precisión de detección de características faciales obtenidas mediante faceAPI es mucho menor que las obtenidas mediante una selección manual. No obstante, una característica favorable de faceAPI es que proporciona una medida de la precisión, mediante un factor entre 0 y 1, que puede ser empleado como valor ci(t0i) 5.6. Análisis de Resultados 29 en la ecuación 3.2. Gracias a ello, este efecto puede quedar mitigado siempre y cuando se disponga de entradas emocionales procedentes de otros módulos. 2. FaceAPI no detecta las características correspondientes al contorno de los ojos lo que provoca que ciertas distancias faciales no puedan ser calculadas. Esto resulta especialmente importante dado que muchas expresiones faciales, como la sorpresa o la ira, modifican el contorno de los ojos y esta información deja de estar disponible para los algoritmos de clasificación. 5.6.2. Resultados del Algoritmo de Fusión Gracias al empleo de la multimodalidad se aprecian tres grandes mejoras: incremento en la tasa de acierto, ampliación del área emocional detectada y mejora de la trayectoria emocional. 5.6.2.1. Mejora de las Tasas de Acierto En el caso estudiado se observa un incremento de la tasa de detección emocional del algoritmo de fusión con respecto al módulo facial automático, pasando de 59,38% a 68,75 %. Este incremento resulta especialmente significativo teniendo en cuenta que las entradas emocionales producidas por los módulos de texto y emoticonos resultan mucho más dispersas que las del módulo facial. Conviene aclarar que, a pesar de que las tasas de acierto de los módulos de texto y emoticonos sean superiores a la tasa global del algoritmo facial, no sería posible construir la trayectoria emocional sin el empleo del módulo facial, puesto que se producirían grandes discontinuidades temporales debido a la falta de datos. 5.6.2.2. Ampliación del Área de Detección Emocional Uno de los problemas intrínsecos del módulo facial que se solventa mediante la fusión multimodal es la limitación del área de detección del mismo. Dado que el resultado proporcionado por el módulo facial es una media ponderada de los puntos definidos por las emociones de Ekman, cualquier emoción que se encuentre fuera del polígono definido por ellas resulta inalcanzable. En la imagen 5.6 observamos sombreada el área en la que trabaja el módulo facial 5.6. Análisis de Resultados 30 Figura 5.6: Ejemplo de resultado fuera del rango del módulo facial, que sin embargo es alcanzable gracias a la fusión. y cómo emociones tales como decepción, irritación o desesperación quedan fuera de esta zona. Situaciones como la mostrada siempre resultarán en fallo para el módulo facial puesto que todos los anotadores coinciden en señalar una zona emocional que no intersecta con la alcanzable por el módulo facial. Sin embargo, gracias al empleo de módulos complementarios o con área más extensa es posible alcanzar estas zonas. Esto abre el camino al desarrollo de módulos específicos que mejoren la tasa de aciertos en zonas en las que otros módulos tienen una tasa de aciertos menor. 5.6.2.3. Mejora de la Trayectoria Emocional El filtrado de Kalman aplicado en la fusión multimodal ha resultado muy eficiente a la hora de suavizar oscilaciones provocadas por el funcionamiento deficitario de la detección facial (figura 5.7), además de permitir obtener una salida emocional coherente incluso en periodos de oclusión facial y ausencia de otras entradas emocionales. La figura 5.7 muestra la evolución temporal de la respuesta del algoritmo de fusión multimodal sin filtrar (Evaluación vs Tiempo en 5.7a y Activación vs Tiempo en 5.7b) en la que se observa una gran cantidad de ruido, con picos debidos a una detección deficiente de características faciales por parte del módulo facial y que no constituyen una variación emocional real. Estas variaciones desaparecen en la respuesta filtrada mediante Kalman (Evaluación vs Tiempo en 5.7c y Activación vs Tiempo en 5.7d). 5.6. Análisis de Resultados 31 0 20 40 60 80 100 120 140 160 180 −3 −2 −1 0 1 2 3 Evaluation Axis − Kalman Evaluation time [tk] 0 20 40 60 80 100 120 140 160 180 −3 −2 −1 0 1 2 3 Activation Axis − Kalman time [tk] Activation 0 50 100 150 200 250 −3 −2 −1 0 1 2 3 Evaluation Axis − video Evaluation time [frames] Occluded period 0 50 100 150 200 250 −3 −2 −1 0 1 2 3 Activation Axis − Video Activation time [frames] Occluded period (a) (b) (c) (d) Figura 5.7: Efecto del filtrado de Kalman ante una oclusión Asimismo se observa que, durante el periodo de oclusión facial dado que no existían otras entradas emocionales procedentes de otros módulos en ese instante, el algoritmo sin filtrar no es capaz de proporcionar una respuesta, mientras que gracias al filtrado de Kalman la respuesta emocional mantiene una trayectoria coherente hasta que se dispone de una nueva entrada emocional. CAPÍTULO 6 Conclusiones y Trabajo Futuro En este trabajo fin de máster se ha llevado a cabo la implementación y evaluación de un método de fusión multimodal planteado previamente. Ello ha implicado la realización de las siguientes tareas: Se ha mejorado el módulo de detección facial, permitiendo la detección de expresiones faciales de forma automática y posibilitando el procesado de largas secuencias de vídeo. Si bien se ha producido un descenso en la tasa de detección del módulo no ha constituido un problema para el desarrollo del trabajo y la tasa sigue siendo aceptable. Se ha desarrollado un módulo de detección de emociones en texto, basado en el diccionario de Whissell, capaz de proporcionar una salida emocional continua. Se ha desarrollado una aplicación, en forma de mensajería instantánea, que permite a dos usuario interactuar emocionalmente por medio de expresiones faciales (vídeo), texto y emoticonos y que recoge todos los datos necesarios para el posterior cálculo de las salidas emocionales de cada uno de los módulos estudiados. Se ha implementado el algoritmo de fusión y probado su funcionamiento gracias a los módulos faciales, de texto y emoticonos. Dicha implementación se ha realizado de forma flexible, posibilitando el empleo de futuros módulos sin necesidad de modificar el código de la aplicación. Se ha propuesto un método de evaluación para sistemas de detección de emociones continuas y se han desarrollado todas las herramientas necesarias para su aplicación. Dicho método ha sido empleado para estudiar el efecto de la fusión multimodal y el empleo de información procedente de distintos canales en la tasa de acierto. 33 Se ha realizado un análisis de los resultados obtenidos, identificando las virtudes y los defectos tanto del algoritmo de fusión como del nuevo modelo facial implementado. En cuanto a las posibles mejoras que pueden llevarse a cabo en futuros trabajos, ha quedado patente durante las pruebas realizadas la existencia de grandes deficiencias en la librería de detección facial faceAPI, resultando en una gran caída de la tasa de acierto individual del módulo facial con respecto a la selección manual de puntos y por consiguiente afectando negativamente al resultado global del algoritmo de fusión. Resultaría por tanto conveniente disponer de un módulo de detección de características faciales alternativo, si bien ninguno de los evaluados hasta la fecha ha proporcionado resultados satisfactorios. Con respecto al módulo de texto, una posible mejora sería realizar una corrección ortográfica de la frase introducida por el usuario previamente a su reducción a la forma morfológica por FreeLing. Otra mejora pasaría por tener en cuenta los signos de puntuación, especialmente las exclamaciones como «potenciadores del eje de activación», por ejemplo, multiplicando por un factor el valor emocional de activación en una frase. En caso de ser necesario el módulo de texto podría ser empleado en lengua inglesa puesto que se dispone del diccionario Whissell en su lengua original. En cuanto al sistema multimodal, en el futuro se espera poder evaluarlo empleando módulos de señales fisiológicas (ritmo cardiaco, conductividad de la piel, etc) y módulos de análisis de la voz. Incluso, sería posible combinar un software de dictado a fin de emplear el módulo de texto para detección de conversaciones habladas.