Full text
I Resumen Las emociones en el habla son parte fundamental de cualquier diálogo natural. En la vida diaria, la interacción vocal con las personas a menudo implica emociones como parte intrínseca de la conversación en mayor o menor medida. Consecuentemente, la inclusión de emociones en sistemas de diálogo hombre-máquina es crucial para alcanzar un grado aceptable de naturalidad en la comunicación. Este proyecto se centra en la conversión automática de emociones en el habla , una técnica cuyo objetivo es transformar la voz producida en estilo emocional neutro para producir la sensación de que se ha producido con otro estilo emocional, con la meta adicional de realizarlo en un contexto independiente del locutor. La conversión de emociones representa un reto ya que éstas afectan de forma signicativa a todas las partes del sistema de producción humana de voz, y en el proceso de conversión toda la casuística debe ser considerada. Los métodos usados en la literatura se basan en una técnica conocida como conversión de voz , cuyo objetivo es transformar la identidad de un determinado hablante, con modicaciones menores que permitan crear la sensación de emoción. En este proyecto se toma la idea principal de la conversión de voz, pero el proceso habitual de regresión para transformar el espectro del habla se divide en dos subprocesos para proporcionar una normalización de identidad adicional, eliminando la dependencia intrínseca del locutor que presentan estos sistemas, aplicando un procedimiento conocido como normalización de la longitud del tracto vocal como técnica de preproceso. Adicionalmente, se propone un método para transformar la curva de entonación de la frase y las duraciones de los diferentes sonidos usando un método que toma en consideración información contextual.
II Prefacio Este proyecto ha sido desarrollado en el Audio Research Team del Departament of Signal Processing, en Tampere University of Technology, Finlandia. Me gustaría expresar mi gratitud hacía mis instructores, Jani Nurminen y Hanna Silen, por su inestimable dirección y continuo afán por ayudar, lo que ha hecho el desarrollo de este proyecto un proceso interesante y satisfactorio. Me gustaría agradecer también a Moncef Gabbouj por la oportunidad de trabajar en su grupo. También quiero extender mi agradecimiento a Alfonso Ortega, mi ponente en la Universidad de Zaragoza, cuyo apoyo ha sido gratamente apreciado durante todo el proceso. Adicionalmente, me gustaría agradecer a todos los miembros del Audio Research Team por su actitud amable y cercana. Quisiera agradecer especialmente a Toni Heittola por su ayuda con el test de escucha y los métodos de test estadístico, y a Tuomas Virtanen por acogerme en el equipo y ayudarme a encontrar a mis instructores. A nivel personal, quiero agradecer profundamente a mi compañero de laboratorio Gerard Sanchez, que estuvo trabajando conmigo durante las primeras etapas de este trabajo, por su continua ayuda, apoyo y consejo durante estos seis meses. Por otra parte, me gustaría dar las gracias también a toda la gente maravillosa que he conocido durante mi periodo de intercambio en Tampere, porque han hecho que mi estancia aquí sea un proceso agradable y llevadero. Además, quisiera expresar mi aprecio hacia mi familia y amigos en España, en especial a mis padres, que han estado siempre ahí para mi en los buenos y en los malos momentos. Tampere, 12.03.2014 Samuel Navarro
III Tabla de contenidos 1..Introducción................................... 1 1.1. Conversión de emociones: Problemática . . . . . . . . . . . . . . . . . 2 1.2. Objetivos y principales resultados . . . . . . . . . . . . . . . . . . . . 3 1.3. Organización de la memoria . . . . . . . . . . . . . . . . . . . . . . . 4 2..Laseñaldevoz................................. 5 2.1. El modelo digital de la voz . . . . . . . . . . . . . . . . . . . . . . . . 5 2.2. Cepstrum ................................. 6 2.3. Representación Mel-Cepstral . . . . . . . . . . . . . . . . . . . . . . . 8 3..Emocionesenelhabla ............................. 9 3.1. Percepción de emociones . . . . . . . . . . . . . . . . . . . . . . . . . 9 3.2. Bases de datos de habla emocional . . . . . . . . . . . . . . . . . . . 10 3.2.1. Emociones actuadas . . . . . . . . . . . . . . . . . . . . . . . . . 10 3.2.2. Emociones estimuladas . . . . . . . . . . . . . . . . . . . . . . . 11 3.2.3. Emociones reales . . . . . . . . . . . . . . . . . . . . . . . . . . . 11 4..Conversióndevoz................................ 12 4.1. Alineamiento de frases: Dynamic Time Warping . . . . . . . . . . . . 12 4.2. Modelado del espectro . . . . . . . . . . . . . . . . . . . . . . . . . . 14 4.3. Modelado de prosodia . . . . . . . . . . . . . . . . . . . . . . . . . . 15 4.4. Emociones en sistemas de conversión de voz . . . . . . . . . . . . . . 16 4.4.1. Transformación espectral . . . . . . . . . . . . . . . . . . . . . . 17 4.4.2. Transformación prosódica . . . . . . . . . . . . . . . . . . . . . . 18 5.. Métodología propuesta . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 19 5.1. Arquitectura del sistema . . . . . . . . . . . . . . . . . . . . . . . . . 19 5.2. Extracción de parámetros . . . . . . . . . . . . . . . . . . . . . . . . 20 5.3. Conversión espectral . . . . . . . . . . . . . . . . . . . . . . . . . . . 22 5.3.1. Normalización de Longitud del Tracto Vocal . . . . . . . . . . . . 22 5.3.2. Entrenamiento del sistema . . . . . . . . . . . . . . . . . . . . . . 25 5.4. Conversión prosódica . . . . . . . . . . . . . . . . . . . . . . . . . . . 27 5.4.1. Entrenamiento de los CARTs . . . . . . . . . . . . . . . . . . . . 27 5.4.2. Conversión de parámetros . . . . . . . . . . . . . . . . . . . . . . 31 6.. Evaluación y discusión . . . . . . . . . . . . . . . . . . . . . . . . . . . . . 34 6.1. Bases de datos utilizadas . . . . . . . . . . . . . . . . . . . . . . . . . 34 6.1.1. Base de datos en alemán . . . . . . . . . . . . . . . . . . . . . . . 34 6.1.2. Base de datos en español . . . . . . . . . . . . . . . . . . . . . . 35 6.2. Resultados objetivos: Distorsión Mel-Cepstral . . . . . . . . . . . . . 37 6.3. Resultados subjetivos: Test de escucha . . . . . . . . . . . . . . . . . 38 6.3.1. Resultados con la base de datos de habla alemana . . . . . . . . 40
IV 6.3.2. Resultados con la base de datos de habla española . . . . . . . . 43 6.4. Discusión ................................. 47 7.. Conclusiones y trabajo futuro . . . . . . . . . . . . . . . . . . . . . . . . . 48 Referencias 50 Anexos 57 A..Spectral mapping methods for voice conversion . . . . . . . . . . . . . . . 57 A.1.GMM-basedmapping........................... 57 A.1.1.SourceGMM............................. 57 A.1.2. Joint density GMM . . . . . . . . . . . . . . . . . . . . . . . . . 58 A.1.3. Problems with the GMM-based mapping . . . . . . . . . . . . . . 58 A.2. Nonlinear mapping: Dynamic Kernel Partial Least Squares Regression 59 A.2.1. Kernel transformation . . . . . . . . . . . . . . . . . . . . . . . . 60 A.2.2. Dynamic Modeling . . . . . . . . . . . . . . . . . . . . . . . . . . 61 A.2.3. Kernel Partial Least Squares . . . . . . . . . . . . . . . . . . . . 61 B.. Mean-scale transformation as a PDF equalization . . . . . . . . . . . . . . 63 C..STRAIGHTFramework ............................ 64 D..Classication and Regression Trees . . . . . . . . . . . . . . . . . . . . . . 67 E.. Example of listening test query . . . . . . . . . . . . . . . . . . . . . . . . 69
V Términos y definiciones AR Auto-Regresivo ANN Articial Neural Network BAP Band Aperiodicities CART Classication And Regression Tree DKPLS Dynamic Kernel Partial Least Squares DTW Dynamic Time Warping F0 Frecuencia Fundamental GMM Gaussian Mixture Model HMM Hidden Markov Model KPLS Kernel Partial Least Squares LP Linear Predicton LPC Linear Predictive Coding LSF Line Spectral Frequencies MCC Mel-Cepstral Coecients MCD Mel-Cepstral Distortion MFCC Mel-Frequency Cepstral Coecients ML Maximum Likelihood MLSA Mel-Log Scale Approximation Filter MMSE Minimum Mean Squared Error MSE Mean Squared Error PCA Principal Component Analysis PDF Probability Density Function PLS Partial Least Squares SPTK Speech Signal Processing Toolkit
VI STRAIGHT Speech Transformation and Representation using Adaptive Interpolation of weiGHT spectrum (vocoder) TD-PSOLA Time Domain-Pitch Synchronous OverLap-Add TTS Text-to-Speech VAD Voice Activity Detector VC Voice Conversion VTLN Vocal Tract Length Normalization
1 1. Introducción La generación automática de habla expresiva en múltiples estilos emocionales ha ido creciendo en popularidad conforme los sistemas de diálogo hombre-máquina avanzan de forma continua, y su objetivo es alcanzar cada vez mayor naturalidad. La razón para ello son las múltiples aplicaciones potenciales que están surgiendo, como en la industria del ocio, donde la creación de avatares con inteligencia articial fuertemente denida se está volviendo cada vez más importante. Adicionalmente, hay aplicaciones en la industria para crear sistemas de diálogo que causen empatía en los clientes, lo que presumiblemente incrementaría la felicidad del cliente con la empresa. La generación de habla emocionada aún representa un reto en el área de procesado de la señal de voz, aunque se han obtenido ya algunos resultados satisfactorios [Hof04]. Para lograr este objetivo se puede usar una gran variedad de técnicas, desde métodos de conversión texto a habla (TTS) hasta conversión de voz (VC). El primer tipo de métodos genera el habla partiendo sólo de texto, mientras que el último parte de una voz existente y usa métodos de regresión para transformar los parámetros y crear la sensación de que la frase fue producida con un cierto estado emocional. Cuando se habla de aplicaciones TTS, las técnicas clásicas para sintetizar la voz de salida requieren bases de datos muy extensas que capturen cada posible fenómeno en el proceso de generación del habla. En una hipotética situación en la que se necesite construir un sistema TTS que sea capaz de cambiar el estado emocional del habla en función del texto o de la interacción actual con el usuario. Esta aplicación requeriría bases de datos enormes para cada emoción que el sistema tuviera que emular con la restricción adicional de proceder del mismo locutor, lo que es absolutamente inviable cuando el número de emociones es relativamente elevado. En este punto, los sistemas de conversión de voz presentan una gran ventaja, ya que esta clase de técnicas modelan el habla usando técnicas de regresión estadística para imitar la identidad de un cierto hablante objetivo aprendiendo una función de transformación desde un hablante origen usando una cantidad de datos reducida. En la práctica, las emociones pueden considerarse como voces producidas por un hablante diferente, debido a que causan cambios signicativos en el aparato de producción de voz humana.
1. Introducción 2 1.1. Conversión de emociones: Problemática En el campo de generación de habla emocional, las técnicas de VC representan una gran mejora respecto a otros métodos dada la reducida cantidad de datos que necesitan, lo que es ventajoso cuando hay una cantidad relativamente grande de emociones para generar, como por ejemplo en el estándar MPEG-4 [Ost02], que usa seis categorías emocionales en procesos de animación facial, lo que requeriría seis extensas bases de datos adicionales para generar cada posible estado emocional si no se usasen métodos VC. Sin embargo, los métodos actuales de VC tienen un inconveniente: presentan una fuerte dependencia del locutor, o bien requieren varias bases de datos con diversos locutores, lo que para varias emociones supone incrementar mucho el número de grabaciones. La dependencia del locutor no resulta problemático en sistemas comunes de conversión de voz, ya que su objetivo es transformar la identidad de un determinado hablante en la del hablante objetivo. Sin embargo, en el proceso de conversión de emociones, el objetivo es imitar una emoción, y tener una restricción de este tipo hace el sistema poco versátil. Por otra parte, el modelado de la prosodia (i.e. patrones de estrés y entonación en la voz) es una cuestión muy importante en un sistema de conversión de emociones, ya que como es ampliamente conocido, una gran variedad de emociones se expresan principalmente a través de la prosodia, tal como el aburrimiento, la tristeza, o la sorpresa. El modelado de prosodia no suele tomarse en cuenta en sistemas de VC clásicos debido a que habitualmente no representa un factor crítico en el reconocimiento de identidad, pero juega un rol importante cuando hay emociones presentes. Las características prosódicas que deben tenerse especialmente en cuenta son el ritmo del habla y las variaciones locales de la entonación. De este modo, el modelo menos complejo capaz de modelar emociones debería ser capaz de escalar la duración media y generar una nueva curva de entonación de acuerdo a la emoción. Sin embargo, un modelado adecuado debería ser capaz de capturar las variaciones intra-frase de la duración y de la entonación, lo que puede abordarse por medio de métodos de regresión que tengan en cuenta o bien información contextual explícita, como en este proyecto, o bien modelos que gestionen esta información implícitamente, por ejemplo usando wavelets [San14].
9 3. Emociones en el habla Las emociones son fenómenos complejos, y la forma en que afectan al sistema de producción de voz aún es un problema incierto. Sin embargo, varios autores han intentado desarrollar las bases de una teoría consistente que soporte la expresión vocal de emociones, tal como en [Sch03; Cor00]. En este capítulo se ilustra como se presentan las emociones en la señal de voz, y muestra los fenómenos asociados al reconocimiento de emociones en humanos a través de expresión vocal de las mismas. Para entender como afectan las emociones a la voz, el estudio de [Ban96] es bastante representativo. En él se analizan la características acústicas del habla emocional, y se muestra que las emociones afectan a la distribución energética del espectro, y la posición de los formantes cambia. Se calculó además una regresión lineal para los parámetros prosódicos, usando como variables independientes todas las que pudiesen afectar al valor del parámetro: la identidad del locutor, su género, el contenido lingüístico, el entorno, y por supuesto la emoción. En sus resultados se muestra que la emoción explica el 55% de la variación media en la intensidad, y el 50% de la variación media en F0 . Hay varios estudios llevados a cabo por fonetistas que conrman el resultado, en [Eri05] se presenta una recopilación de los hallazgos más importantes de estos estudios. 3.1. Percepción de emociones Aunque hay una evidencia clara de que las emociones afectan al estilo del habla, la identicación de emociones a través de la voz no resulta una tarea trivial para los humanos. En [Sch01] se reporta que la expresión vocal de afecto puede estar motivada en parte por mecanismos universales psicobiológicos, y en parte por los aspectos segmentales (i.e. referidos a un único fonema) y supra-segmentales (i.e. referidos a la forma de hablar a largo plazo) del idioma en particular. En este trabajo, se recogen resultados de un estudio llevado a cabo en nueve países en Europa, Estados Unidos y Asia, sobre reconocimiento de emociones en la voz de enfado, tristeza, miedo, alegría, y voz neutral, producidas por actores alemanes. Los datos muestran una tasa global de identicación de 66%. Sin embargo, hubo diferencias que variaron entre 74% en Alemania hasta 52% en Indonesia. Los patrones de confusión fueron muy similares para todas las culturas, aunque la tasa de reconocimiento más alta viene de los hablantes nativos del idioma que se usó.
3. Emociones en el habla 10 Los resultados de este estudio muestran que si bien los humanos son capaces de inferir el estado emocional de un hablante desconocido, la tasa de identicación muestra que hay confusión entre las emociones. Por ejemplo, la alegría es la emoción con la tasa de reconocimiento más baja, con tan solo 48% entre los oyentes de habla alemana, mientras que el estilo neutro es el mejor reconocido con una tasa del 88%. De todos modos, hay una clara sobreestimación del estilo neutro, siendo confundido hasta un 34% de las veces cuando la emoción pretendida era alegría. 3.2. Bases de datos de habla emocional Para analizar el efecto de las emociones en la voz se necesitan bases de datos de habla emocional. La obtención de datos de voz emocionada adecuados aún resulta un gran desafío. Lo ideal es conseguir una base de datos muy controlada con habla espontánea. Este ideal es imposible de lograr, ya que no se puede conseguir habla espontánea bajo condiciones controladas, por tanto, los investigadores han desarrolado diversas técnicas para obtener voces razonablemente naturales y espontáneas. 3.2.1. Emociones actuadas La técnica mas simple consiste en habla actuada producida por actores profesionales ngiendo una cierta emoción. Este tipo de grabaciones se pueden hacer en una sala acondicionada, donde las condiciones de grabación y el contenido lingüístico estén bajo absoluto control. Por otra parte, no proporciona completa naturalidad en las emociones seleccionadas, generalmente debido a la sobreactuación. Debido a que el locutor no tiene ningún medio aparte de su voz para expresar la emoción, hay cierta tendencia a sobreactuar para tener la emoción claramente representada [Bat00] Este método se utiliza generalmente para grabar bases de datos orientadas a desarrollar sistemas TTS, o manipulación de voz, donde la calidad de la grabación juega un rol importante. Además, debido a la sobreactuación, las emociones en estas bases de datos son muy reconocibles, lo que es adecuado para sintetizar voz emocionada, ya que lo importante es que el oyente nal identique la emoción. También es una técnica muy usada para analizar la señal de voz emocionada comparándola con otras emociones. Debido a que el método permite un control total sobre el texto leido, es posible grabar el mismo texto en varias emociones.
3. Emociones en el habla 11 3.2.2. Emociones estimuladas Este método consiste en hacer leer frases emocionalmente ricas a actores no profesionales, lo que pretende evocar emociones genuinas. Se espera que el texto altamente emotivo provoque que las emociones surjan de manera natural sin necesidad de sobreactuar. Usando este enfoque, las voces todavía se pueden grabar en entornos muy controlados, pero la posibilidad de disponer de frases con contenido paralelo se desvanece, lo que causa que estas bases de datos sean menos apropiadas para transformación de voz. 3.2.3. Emociones reales Las bases de datos de emociones reales se obtienen habitualmente de programas de TV con alto contenido emocional (e.g. debates), de entrevistas, o mediante técnicas Mago de Oz 1 . Las emociones representadas en estas bases de datos son totalmente naturales, pero se pierde el control sobre el entorno y el contenido. Este tipo de bases de datos es adecuada para testar sistemas de reconocimiento automático de emociones, donde se requiere alta capacidad de generalización. 1 Un experimento Mago de Oz (WOZ) es un experimento en el que los sujetos interaccionan con un sistema informático que los sujetos creen autónomo, pero que en realidad está siendo operado por una persona oculta
12 4. Conversión de voz En este capítulo, en primer lugar, se revisan las técnicas utilizadas para tareas de conversión de voz (VC) y se denen sus bloques constitutivos. En segundo lugar, se describe como se gestionan las emociones en sistemas de VC en detalle, analizando los componentes que resultan cruciales para llevar a cabo la tarea satisfactoriamente. El término conversión de voz se reere al área de procesado de la señal de voz que tiene que ver con la transformación de la voz producida por un hablante ( hablante origen ) para crear la impresión de que fue producida por otro locutor diferente ( hablante objetivo ). Los sistemas de VC convencionales constan de dos pasos: Entrenamiento y conversión. En la fase de entrenamiento, se crea una función de transformación basada en la voz de ambos hablantes para convertir los parámetros del hablante origen a los del hablante objetivo. En conversión, la función de transformación se aplica a una señal de voz desconocida del hablante origen para sintetizar voz que parezca que fue producida por el hablante objetivo. La nalidad de un sistema de VC es alcanzar la máxima calidad posible con un conjunto de entrenamiento relativamente pequeño. El esquema más común de este tipo de sistemas se representa en el diagrama de bloques de la gura 4.1 La gran mayoría de sistemas de VC existentes se centran en convertir los parámetros espectrales, dejando los parámetros prosódicos en segundo plano o realizando modicaciones simples de los mismos. En un sistema conversor de emociones esto es inaceptable, ya que una gran cantidad de emociones se expresan principalmente mediante prosodia. 4.1. Alineamiento de frases: Dynamic Time Warping Una misma frase producida en instantes diferentes raramente tiene el mismo ritmo del habla en ambos casos. Las frases deben ser por tanto alineadas en tiempo para alinear la función de transformación segmento a segmento.
4. Conversión de voz 13 Figura 4.1: Diagrama de bloques de un sistema de conversión de voz. El enfoque más popular para alinear es el Dynamic Time Warping (DTW), introducido originalmente en [Sak78] para reconocimiento de palabras. El objetivo del DTW es encontrar una correspondencia temporal óptima entre dos secuencias de parámetros A={a1, . . . , aN} y B={b1, . . . , bM} en términos de una función distancia. El algoritmo asume que el primer y último vector están alineados, y las secuencias no van hacia atrás en el tiempo. Una elección habitual es distancia eculidea con MFCCs para reconocimiento o MCCs para conversión, ya que proporcionan una medida razonable de la distancia acústica [Nur12]. Primero, se construye una matriz de costes locales D= (dij) , donde dij contiene la distancia entre el vector i de la secuencia A y el vector j de la secuencia B : D∈RNxM :dij =||ai−bj|| i∈[1 : N], j ∈[1 : M] (4.1) Una vez construida, el algoritmo encuentra el camino óptimo, que transcurre por el recorrido de mínima distancia acumulada, que puede ser calculada deniendo una función de coste para cada punto de la cuadrícula: Φ(i, j) = dij + m´ın[Φ(i−1, j −1),Φ(i−1, j),Φ(i, j −1)] (4.2)
4. Conversión de voz 14 Donde Φ(i, j) es la distancia acumulada en el punto (i, j) . La distancia mínima entre secuencias es Φ(N, M) , y el recorrido optimo se puede encontrar por backtracking desde el punto (N, M) al punto (1,1) . 4.2. Modelado del espectro El espectro de la voz contiene las pistas más importantes sobre la identidad del locutor, y debe ser convertido lo más exactamente posible manteniendo alta calidad en la voz sintetizada. Debido a la cantidad limitada de datos, la mayor parte de sistemas de VC aprenden funciones de transformación estadísticas de un conjunto de parámetros alineados a nivel segmental. La función de transformación realiza una regresión de un vector xn , de tamaño (Dx1) , a otro yn , del mismo tamaño, para cada segmento de voz n . En la mayor parte de los estudios sobre VC, el objetivo es encontrar una función F(·) que minimice el error de predicción sobre un conjunto de entrenamiento de N segmentos: = N X n=1 ||yn−F(xn)||2 En la literatura se ha desarrollado diversos métodos que realizan esta tarea, imponiendo restricciones sobre la función de transformación F , estando los más habituales entre los siguientes: Regresión basada en diccionario [Abe88]: La regresión se realiza usando un diccionario de pares de segmentos alineados de origen y objetivo, y el segmento de salida se selecciona encontrando el vector origen del diccionario que tiene menor distancia euclídea al de entrada. Regresión basada en GMM [Sty98; Kai98; Tod07]: Asume que la densidad de probabilidad (PDF) de los vectores origen y objetivo se puede modelar con una mezcla de gaussianas (GMM), pudiendo calcular el vector transformado como la esperanza de la distribución condicionada de el vector objetivo dado el origen: ˆyn=E{y|xn} . Regresión por deformación del eje de frecuencia [Sun03]: En este tipo de técnicas, se calcula una función de transformación que deforma el eje frecuencial del espectro de origen, reposicionando los formantes de manera que se minimice la distancia entre origen y objetivo. Se pueden implementar usando funciones paramétricas, lo que presenta la ventaja de solo necesitar entrenamiento para el hablante objetivo, siendo independiente del hablante origen.
4. Conversión de voz 15 Regresión no lineal [Hel12b; Nar95; Des10; Son11]: La función de regresión se aprende usando métodos que capturan relaciones no lineales, como redes neuronales articiales (ANN), regresión con transformación kernel (KPLS), o regresión de soporte vectorial. Los métodos basados en GMM se han impuesto tradicionalmente a los demás por su sencillez y efectividad. Sin embargo, los métodos de regresión no lineal, pese a requerir en su mayoría un ajuste de parámetros que los hace difíciles de manejar e imprecisos, dan mejor resultado si están ajustados apropiadamente. Los métodos basados en GMM se describen en detalle en el anexo A, así como el método no lineal basado en regresión kernel con modelado dinámico (DKPLS) [Hel12b], utilizado en este proyecto para el modelado espectral de emociones. 4.3. Modelado de prosodia La prosodia se reere a la estructura supra-segmental de la entonación, energía y ritmo del habla. La estructura prosódica viene denida parcialmente por el contenido semántico de la frase, perceptible en la acentuación, patrones entonativos, o pausas prosódicas para claricar el mensaje (que en lenguaje escrito se traduce en comas o puntos). Sin embargo, la prosodia se utiliza también frecuentemente para transmitir información no verbal, tal como emociones. Aunque la gran mayoría de la literatura sobre VC se centra en la transformación espectral, se ha demostrado que la prosodia proporciona pistas importantes de la identidad del locutor, y también resultan muy importantes cuando hay emociones involucradas [Ban96]. En lo referente a transformaciones prosódicas, la literatura se centra en transformaciones sobre F0 . La transformación más común para la prosodia es el escalado en media y varianza, que se basa en un simple escalado lineal para cada muestra: F0t(n) = µt+σt σs [F0s(n)−µs] Donde F0t(n) representa la muestra convertida, µt y µs son la media del F0 objetivo y del F0 origen respectivamente, y σt y σs representan las desviaciones típicas del F0 objetivo y fuente respectivamente. Este modelado es equivalente a asumir que F0 es un proceso gaussiano blanco de media µs y varianza σs2 , y la conversión resulta en una transformación de la densidad de probabilidad (PDF), tal como se muestra en el anexo B. Este enfoque es obviamente impreciso, pero para conversión de identidad funciona relativamente bien, ya que la mayoría de la información se encuentra en el espectro, y la prosodia juega un rol activo esencialmente cuando el hablante es conocido para el oyente [Hel07a]
4. Conversión de voz 16 No obstante, si se desea una descripción precisa, el método descrito anteriormente no funciona adecuadamente. Éste puede ser el caso de transformar a un determinado estilo de habla, o el caso de imitar una emoción, que es el propósito de este proyecto. Hay varias formas más elaboradas de transformar F0 que usan técnicas de regresión más sosticadas [Ina03]. La mayor parte de estos métodos ignoran la correlación temporal de las muestras de F0 , y realizan la transformación muestra a muestra, con funciones más complejas, tal como un polinomio de orden N , o una regresión tipo GMM como se suele hacer con el espectro (ver anexo A.1) Existen también otras técnicas que tratan de modelar F0 a un nivel más alto que el de muestra, como es el caso de regresión basada en diccionario, que construye el F0 transformado concatenando segmentos seleccionados de un diccionario [Ina03; Hel07b]. Una desventaja de este método es que requiere la elaboración de un diccionario extenso para construir una curva de salida adecuada, lo que entra en conicto con el principio de VC de usar una base de datos lo más reducida posible. Por otra parte, hay métodos que expresan la curva de F0 como resultado de un modelo matemático [Xu01; Fuj05; Kor03]. Estos modelos son especialmente populares en la manipulación de habla china, donde F0 tiene formas conocidas restringidas a los 5 tonos básicos del lenguaje para cada sílaba [Kan06]. Más recientemente, un modelo de F0 basado en descomposición wavelet ha sido propuesto en [Sun13] para aplicaciones TTS, y sus aplicaciones a sistemas de VC se discute en [San14]. El estudio de [Sun13] sugiere que la descomposición wavelet de F0 puede dar información sobre las diferentes unidades fonéticas en cada nivel wavelet, si las escalas se escogen adecuadamente, lo que se ejemplica extensamente en [San14]. 4.4. Emociones en sistemas de conversión de voz Cuando el objetivo es emular una emoción, un sistema convencional de VC no es suciente. Las emociones exhiben patrones prosódicos complejos y afectan al sistema de producción de voz humano. Para lidiar con todos estos factores, los sistemas de VC aplicados a emociones incorporan habitualmente elementos adicionales que intentan capturar todas las posibles contingencias.
4. Conversión de voz 17 Es comúnmente aceptado que las emociones son esencialmente un fenómeno prosódico, pero de acuerdo con [Bar07], las emociones pueden clasicarse en el rango de esencialmente prosódicas a esencialmente segmentales . Esto signica que ciertas emociones se expresan usando casi únicamente el estilo del habla o prosodia, tales como sorpresa o tristeza; otras se expresan modulando el espectro (es decir, produciendo cambios en el tracto vocal), tal como el enfado; y nalmente hay ciertas emociones que muestran patrones de expresión complejos, como la alegría o la felicidad. Por otro lado, las emociones también afectan a la calidad del habla, pudiendo hacerla más chirriante o más apagada dependiendo del caso. Por tanto, para capturar todos estos efectos, el sistema de conversión debe tener en cuenta cada elemento de la cadena de producción de voz. El problema de generación de voz expresiva partiendo de voz neutra ha sido abordado por diversos autores con resultados similares. La mayor parte de los trabajos tienen un modelo espectral para transformar el timbre y un modelo prosódico para la entonación y las duraciones. 4.4.1. Transformación espectral Se ha mostrado que las emociones afectan al tracto vocal, debido a la tensión o relajación asociada con ciertas emociones, y por tanto un modelado espectral adecuado es necesario. Las emociones que involucran tensión en el tracto vocal, como el enfado, muestran tendencia a incrementar la energía en la parte alta del espectro, y las posiciones de los formantes se mueven, lo que crea el efecto de voz rota [Sch03]. Por otra parte, las emociones que relajan el sistema de producción de voz resultan en un incremento de la energía en las bajas frecuencias y ensanchamiento de los formantes. En [Sal10] se realiza un análisis de la variación de la distribución de energía debido a las emociones, mostrando que el ltro medio que redistribuye la energía desde el estilo neutro a un cierto estilo emocional es muy similar para cada fonema. La conversión espectral ha sido estudiada en profundidad en el campo de VC. El modelo espectral puede ser una regresión GMM estándar, descrita en el anexo A.1, tal y como se hace en diversos trabajos donde el enfoque se realiza en el modelo espectral [Ina07; Cen10]. Sin embargo, las emociones son fenómenos donde la información dinámica es importante, y algunos autores centran su trabajo en desarrollar un método de regresión que capture esta dinámica, como en [Wu06], donde los parámetros origen y objetivo se modelan usando modelos ocultos de Markov (HMMs), y la función de transformación es una regresión tipo GMM dependiente del estado de los llamados Bi-HMMs . Adicionalmente, este trabajo modica la duración de los estados de los HMMs de manera que sigan una distribución gamma, lo que se asemeja más a la duración de los fonemas en el habla humana.
4. Conversión de voz 18 4.4.2. Transformación prosódica Resulta claro que la clásica transformación de media y varianza para F0 resulta inadecuada para el propósito de transformar emociones. Un modelo adecuado debería tener en cuenta toda la información contextual y semántica que afecta al estilo del haba. Los modelos prosódicos trabajan normalmente transformando F0 y la duración de la frase, y deja la transformación de la energía al modelo espectral. Un enfoque habitual consiste en generar un F0 completamente nuevo usando técnicas similares a las que los sintetizadores de voz utilizan para generar las muestras espectrales, usando por ejemplo HMMs sensibles al contexto [Ina07]. No obstante, este método requiere una base de datos de entrenamiento grande, lo que se contrapone con el objetivo principal de VC. También se usan descripciones paramétricas de F0 para transformar la prosodia [Kan06], debido a que así la función de transformación sólo tiene que manejar un conjunto de parámetros reducido, y puede ser transformado usando cualquier método de regresión conocido, como los basados en GMM. La duración de los fonemas o las sílabas juega un rol importante a tener en cuenta, ya que proporciona pistas del estado de relajación o tensión del hablante [Ban96]. La duración se puede modicar simplemente escalando la duración media de los fonemas o sílabas, lo que proporciona un resultado razonablemente aceptable [Cen10], o puede ser modicada a nivel de fonema o sílaba individualmente [Ina07], lo que ofrece un resultado más preciso en emociones altamente prosódicas, como el aburrimiento. En este sentido, se necesita un método de regresión para predecir las duraciones, tal como la regresión basada en arboles de decisión (CART), que además permite utilizar predictores categóricos (i.e. que tienen dominio discreto), útiles para representar información lingüística.
5. Métodología propuesta 25 En este proyecto la distribución estadística de los parámetros del hablante de referencia se modela usando una GMM de 256 componentes gaussianos, ya que ha demostrado ser efectiva en modelado e identicación de locutor [Jou13]. La búsqueda del parámetro de deformación esta acotada, siendo forzado a satisfacer |αV|<0.2 para prevenir desvíos muy grandes de la transformación identidad (se asume que las variaciones debidas al tracto vocal son sutiles). La búsqueda ML se realiza usando el método de Brent [Bre73], un algoritmo de minimización para funciones unidimensionales sin derivadas, que ha probado dar buenos resultados en la estimación del parámetro de deformación [Mcd98], y satisface el criterio de acotación. El método de Brent El criterio ML requiere encontrar el máximo de la función de verosimilitud, que depende del parámetro de deformación α . En lugar de buscar el máximo de forma directa, se dene la función de log-verosimilitud negativa como función unidimensional ˜ L(α) = −L(xα|Θ) , y se aplica el método de Brent para encontrar el mínimo, usando la implementación de [Bur]. El método de minimización de Brent combina el método de bisección con interpolación cuadrática inversa en un intervalo acotado sobre una función f [Bre73] para encontrar su mínimo. El método comienza con un trío de valores (a, b, c) , tal que f(b)> f(a) y f(b)< f(c) , e iterativamente colapsa los límites del intervalo hasta que la se alcanza la solución nal. En cada iteración se obtiene una estimación del mínimo x0 usando interpolación cuadrática inversa o bisección, y los límites del intervalo se actualizan según: (ak+1, bk+1, ck+1) = (x0, bk, ck) si x0< bk∧f(x0)> f(bk) (ak, x0, ck) si f(x0)< f(bk) (ak, bk, x0) si x0> bk∧f(x0)> f(bk) El algoritmo usa interpolación cuadrática inversa mientras sea posible, y si los límites no estan colapsando sucientemente rápido, se aplica un paso de bisección. Esto garantiza que la convergencia es en el peor caso lineal, siendo en general superlineal. 5.3.2. Entrenamiento del sistema El subsistema de transformación espectral requiere ejemplos de frases en estilo neutral y frases en el estilo emocional a emular. La función de regresión se entrena usando el algoritmo DKPLS sobre frases con contenido paralelo producidas en ambos estilos emocionales, cuya misión es capturar el máximo detalle de los efectos causados por las emociones.
5. Métodología propuesta 26 Figura 5.5: Block diagram of the spectral subsystem training El sistema de entrenamiento está diseñado para ser capaz de aceptar diversos locutores usando VTLN para eliminar la variabilidad debida a la identidad, aunque no es estrictamente necesario si se dispone de sucientes ejemplos de la emoción objetivo con un único locutor. Es más, se aconseja fuertemente entrenar el sistema con un único locutor siempre que sea posible, ya que el VTLN no elimina de forma perfecta la variabilidad debido a la identidad, y cada hablante expresa emociones de forma diferente en sentido espectral, lo que puede introducir cierta confusión en la función si se usan muchos hablantes. Sin embargo, en este proyecto se ha construido un modelo con varios locutores (dependiente del género) con resultados satisfactorios (ver capítulo 6), lo que permite disponer de más ejemplos por emoción si la base de datos de emociones comprende muchas emociones con relativamente pocos ejemplos. El sistema completo se ilustra en la gura 5.5. Como puede verse en la gura, el sistema requiere entrenamiento con frases paralelas parametrizadas con MCCs y BAPs. Los parámetros primero atraviesan un detector de actividad de voz (VAD) que elimina los segmentos de silencio basado en un umbral para la energía localizada, ya que apenas contienen información y con toda probabilidad introducirían confusión en la función nal. En la práctica se puede implementar umbralizando sobre el valor del primer MCC, que está directamente relacionado con la potencia en el segmento, aunque en este contexto se calcula la potencia real, computada previamente. Una vez eliminados los segmentos de silencio, se aplica VTLN a los MCC, pero el parámetro de deformación se estima usando únicamente los MCC de estilo neutro para el calculo de la verosimilitud. Esto viene de la asunción de que VTLN elimina el efecto de la identidad, y ésta es la misma para ambas frases. Además, si se estimaran dos parámetros por separado, el VTLN eliminaría parcialmente el efecto de la emoción, ya que su misión es hacer que los parámetros transformados sean lo más parecidos posibles al modelo de referencia, construido con frases neutrales.
5. Métodología propuesta 27 Finalmente, los parámetros normalizados se alinean usando DTW, y el resultado de la alineación es introducido en el esquema de entrenamiento DKPLS. El primer MCC no se incluye en el proceso de entrenamiento y es copiado de la fuente en el proceso de conversión. Esto se debe a que el primer MCC describe la energía del segmento y su valor es habitualmente diferente en escala y rango al resto de coecientes, y si se introdujese en el sistema es probable que dominase la formación de kernels (ver anexo A.2), lo que empeoraría el resultado nal. El sistema DKPLS es capaz de gestionar datos de entrada altamente multicolineales, y por tanto los regresores usados pueden ser parcialmente linealmente dependientes. Por esta razón, tanto los MCCs como las BAPs se usan simultáneamente como regresores para predecir los MCC o BAP del objetivo, ya que presentan cierta correlación y se puede extraer información útil de ambos conjuntos de parámetros [Sil11]. 5.4. Conversión prosódica En el contexto de este proyecto, el subsistema de conversión prosódica crea una curva de F0 que intenta emular el estilo emocional deseado, y modica la duración de la frase para ajustar el ritmo del habla al emocionado. La unidad básica usada para la conversión de prosodia es la sílaba, y se asume que los efectos observables debidos a las emociones se producen esencialmente a este nivel. El modelado de prosodia a nivel silábico es relativamente común en sistemas de VC, y se ha usado previamente para transformación de prosodia basada en diccionarios [Hel07b]. Para obtener los parámetros transformados a nivel de sílaba se usa regresión basada en CART (ver anexo D para una descripción en detalle del método de regresión basado en árboles de decisión). Los parámetros predichos por el sistema son la media de F0 , la duración de la parte sonora de la sílaba, y la duración de la parte sorda de la sílaba. El sistema produce una escala para cada uno de los parámetros a predecir, y utiliza CARTs diferentes para calcular cada una de ellas. 5.4.1. Entrenamiento de los CARTs Un factor clave en un problema de regresión es una adecuada descripción del comportamiento de la variable independiente por parte de las variables predictoras. En este caso, se requiere una descripción en detalle de F0 y de la duración de las sílabas para imitar la emoción deseada adecuadamente, y para este propósito se debe incluir información contextual en los predictores.
5. Métodología propuesta 28 El método de regresión usado para lograr este objetivo es el CART debido a su capacidad para manejar tanto parámetros categóricos como no categóricos simultáneamente, ya que la información semántica puede ser representada de forma sencilla con variables categóricas. Adicionalmente, no todas las emociones se representan óptimamente con el mismo conjunto de parámetros, ya que afectan al aparato fonador de forma diferente, lo que implica que debe realizarse una selección de parámetros previa al entrenamiento del modelo. El esquema de entrenamiento se muestra en la gura 5.6. Figura 5.6: Diagrama de bloques del sistema de entrenamiento para la conversión prosódica La selección de parámetros se realiza siguiendo un criterio de mínimo error cuadrático medio (MMSE). Para lograr eso, se evalúa el MSE usando validación cruzada de dos bloques. Primero, se entrenan árboles de profundidad óptima con cada posible combinación de parámetros utilizando un subconjunto aleatorio de la base de datos de entrenamiento. En segundo lugar, el error de predicción se computa como el promedio de los MSE para cada frase del subconjunto restante (conjunto de test). El CART nal se entrena usando la combinación de parámetros que resultó en el mínimo MSE. Previo al proceso de entrenamiento se realiza una eliminación de posibles outliers mediante la eliminación del 1% de los datos de las colas de la distribución, para evitar que los posibles errores de cálculo afecten a la regresión nal. Cómputo de predictores El conjunto total de predictores previo al proceso de selección es una colección de 11 parámetros diferentes relacionados con el contenido lingüístico y semántico de la frase, así como a la prosodia en si misma, tal y como se describe en la tabla 5.1. Los predictores de entrada al sistema están normalizados en los casos necesarios para eliminar posibles variaciones debidas al hablante. El cómputo de este conjunto de parámetros requiere la disponibilidad de varias etiquetas contextuales que deben ser obtenidas previamente.
5. Métodología propuesta 29 Nombre Descripción Categórico isMonosyllabic La palabra a la que pertenece la sílaba es monosílaba (si/no) SI partOfSpeech Categoría gramatical de la palabra a la que la sílaba pertenece (9 categorías) SI isTonical Acento léxico de la sílaba (acentuada/no acentuada) SI posInWord Posición de la sílaba en la palabra (0-1) NO posInSentence Posición de la palabra en la frase (inicial, inicial-medio, medio, medio-nal, nal) SI durSyllRatio Relación de la duración de la sílaba a la duración media NO vuvRatio Relación de la parte sonora de la sílaba a la duración total NO prevSyllDurRatio Relación de la duración de la sílaba a la duración de la sílaba anterior NO meanF0Ratio Relación del F0 medio en la sílaba a la media global de F0 NO isLast La sílaba es la última de la frase (si/no) SI isPrevLast La sílaba es la penúltima (si/no) SI Tabla 5.1: Descripción de los diferentes predictores usados en el entrenamiento de los CARTs Las etiquetas requeridas son los límites temporales de las sílabas y las palabras, el estrés léxico de las sílabas y la categoría gramatical de cada palabra. En el contexto de este proyecto se usan bases de datos anotadas, en las que cada frase tiene un chero de etiquetas con los límites temporales fonéticos, así como el contenido de la frase. Las categorías gramaticales se obtienen automáticamente usando el software TreeTagger [Sch95] en el contenido de la frase, y las éstas son posteriormente expresadas como las 9 básicas: Pronombres, adjetivos, verbos, preposiciones, adverbios, sustantivos, interjecciones, conjunciones y determinantes. CARTs de duración Dado que se predicen escalas para la parte sonora y la parte sorda de la sílaba, se entrenan dos árboles de regresión distintos para obtener las escalas de las duraciones.
5. Métodología propuesta 30 En la fase de entrenamiento, las escalas de duración se normalizan por el ritmo medio de cada frase (como se indica en la ecuación 5.3), para evitar que el CART tenga que predecir esta escala aproximadamente constante entre frases. El cociente promedio de ritmos medios se guarda adicionalmente para el proceso de conversión. dScij = emotionalDurationij emotionalRatej neutralDurationij neutralRatej =emotionalDurationij neutralDurationij neutralRatej emotionalRatej (5.3) rateQuotient =1 M M X j=1 emotionalRatej neutralRatej (5.4) Donde j representa el índice de la frase de entrenamiento, i representa el índice de la sílaba en la frase j , M es el número de sílabas en la frase j , y dScij representa la escala de entrenamiento de la sílaba i en la frase j . CART de F 0 Para el CART de F0 se realiza un proceso análogo al usado en los CARTs de duración. El árbol se entrena usando la relación del F0 promedio en la frase emocionada al F0 promedio en la frase neutral, calculados sílaba a sílaba. La relación se normaliza usando la relación entre las medias globales de F0 en ambas frases, análogamente a los CARTs de duración, como se indica en la siguiente ecuación: f0Scij =emotionalF0ij neutralF0ij neutralMeanj emotionalMeanj (5.5) Donde neutralMeanj y emotionalMeanj representan las medias globales de F0 en las frases neutral y emocionada respectivamente, promediando sólo sobre los segmentos sonoros. De forma análoga al procedimiento de las escalas de duración, la relación promedio de las medias de F0 se almacena para su uso en conversión. Adicionalmente, ya que F0 se actualiza cada 5 ms, cualquier sílaba cuya parte sonora dure menos de 50 ms se descarta del entrenamiento para evitar que posibles variaciones locales de corta duración afecten al resultado nal.
5. Métodología propuesta 31 5.4.2. Conversión de parámetros Los CARTs proporcionan un conjunto de escalas signicativas a nivel silábico, pero para poder sintetizar voz se necesita una descripción a nivel segmental. Para obtener una representación de F0 válida para síntesis, se crea un contorno suave para el escalado interpolando con splines las medias de F0 reales y predichas. Posteriormente, el F0 escalado se divide en sílabas y se aplica un proceso de cambio de frecuencia de muestreo localmente para que la duración se ajuste a la predicha por el sistema. Escalado de contorno La transformación de F0 se realiza mediante un escalado local. La escala es función del tiempo, debido a que los patrones entonativos debidos a la emoción cambian con el tiempo y el contenido lingüístico. Para lograr este objetivo, se obtienen escalas a nivel silábico con el CART, que deben ser transformadas a nivel segmental para realizar el escalado muestra a muestra. El enfoque más sencillo sería simplemente escalar cada muestra de F0 en la sílaba con la escala predicha para la misma, pero esto generaría saltos indeseados en la curva de F0 . Para solventar este problema, el contorno de F0 se describe usando una curva suave extraída de los promedios de F0 a nivel silábico. La conversión se realiza con un proceso de cinco pasos: 1. Obtener un vector S que contenga las medias de F0 a nivel silábico. 2. Crear un vector de escalas con las escalas normalizadas obtenidas del CART multiplicadas por la relación media entre las medias de F0 emocionado y neutral que había sido almacenada con el modelo. 3. Escalar el vector S con el vector de escalas, generando el vector escalado Ssc 4. Generar curvas suaves interpoladas Si(n) y Si sc(n) usando interpolación con splines cúbicos sobre S y Ssc respectivamente, asumiendo que los elementos de los vectores S y Ssc están localizados temporalmente en el centro de sus respectivas sílabas. 5. Obtener la secuencia de frecuencia fundamental escalada ˆ F0 multiplicando el F0 original por la relación de los contornos suaves generados: ˆ F0(n) = Si sc(n) Si(n)F0(n)
5. Métodología propuesta 32 El proceso se ilustra en la gura 5.7. El patrón representado en la gura corresponde a aburrimiento, en el que es característico comenzar con un nivel de F0 elevado y caer con el tiempo a un nivel bajo. Como puede apreciarse, el proceso de escalado es capaz de capturar la tendencia emocional a la vez que se preserva en su mayoría los fenómenos microprosódicos. Figura 5.7: Proceso de escalado para la frecuencia fundamental, convirtiendo de estilo neutral a aburrimiento Ajuste de duraciones Para lograr imitar el ritmo del habla correspondiente, la tendencia duracional debe ser modicada. La duración se representa como función de la sílaba, aunque se realiza distinción entre la parte sonora y la parte sorda de la misma. De este modo, se asume que los sonidos sonoros y los sonidos sordos dentro de la unidad silábica pueden variar su duración de forma distinta en función de la emoción. Para ajustar los parámetros a las duraciones predichas, se realiza un cambio de frecuencia de muestreo localmente. El proceso requiere separar las secuencias intrasilábicas en sus partes sonoras y sordas, y cada una de estas partes es transformada de acuerdo a su escala correspondiente. El procedimiento se puede explicar en cinco pasos: 1. Producir vectores de escalas con las escalas normalizadas obtenidas del CART de duración, multiplicadas por las relaciones medias de los promedios de duración entre emociones (para parte sonora y sorda). 2. Para cada segmento silábico, usar las decisiones de sonoridad proporcionadas por STRAIGHT en F0 para separar las partes sonoras y sordas en las secuencias de F0 , MCCs y BAPs.
5. Métodología propuesta 33 3. Para cada subsegmento resultado de la separación, sustraer el promedio del primer y el último elemento en el subsegmento para incrementar la precisión en el cambio de frecuencia de muestreo (ya que asume que la señal es nula en los valores no conocidos). 4. Cambiar la frecuencia de muestreo de los subsegmentos usando interpolación lineal para ajustar la duración predicha. 5. Concatenar todos los subsegmentos en el orden adecuado para crear la nueva secuencia escalada. Este proceso preserva la sincronía entre F0 y la representación espectral, lo que resulta esencial en el proceso de re-síntesis, sin aplicar manipulaciones sobre la forma de onda (como el algoritmo TD-PSOLA).
34 6. Evaluación y discusión Este capítulo describe los detalles de los procedimientos usados para evaluar la efectividad de los métodos propuestos. En primer lugar, se describen las bases de datos usadas para la validación, incluyendo las condiciones de grabación y requerimientos especiales que cumplen. A continuación, se presentan los sistemas de medición usados y los resultados obtenidos bajo esas condiciones. Finalmente, se muestra una discusión sobre el rendimiento del sistema basada en los resultados obtenidos. 6.1. Bases de datos utilizadas Para evaluar el funcionamiento del sistema, se usaron dos bases de datos diferentes en diferentes lenguas. Los idiomas utilizados son español y alemán, y en ambas bases de datos las grabaciones se realizaron bajo condiciones muy estrictas. 6.1.1. Base de datos en alemán La base de datos de habla alemana se llama Berlin Database of Emotional Speech [Bur05], la cual contiene 535 grabaciones de diez locutores, cinco hombres y cinco mujeres, simulando seis estados emocionales diferentes más un estilo neutro. La base de datos es por lo tanto una base de datos de emociones actuadas . Las emociones representadas en ella son enfado, aburrimiento, asco, miedo, alegría, y tristeza; y el corpus está compuesto de diez frases de contenido semántico neutro. Todas las grabaciones están disponibles con un muestreo de 16 kHz y 16 bits por muestra. Los autores de esta base de datos pusieron un gran esfuerzo para lograr alta naturalidad en las emociones recogidas. Alrededor de 40 locutores pasaron un proceso de selección en el que tuvieron que grabar una frase en cada uno de los estados emocionales en un PC de ocina. Posteriormente, tres expertos evaluaron la naturalizad y la facilidad de reconocimiento de la actuación, y seleccionaron los diez actores que participaron en el experimento.
6. Evaluación y discusión 41 Emoción: Miedo Figura 6.3: Diagrama de caja de la distribución de puntuaciones para Miedo en idioma alemán pC−N= 5.716 ·10−5pC−O= 6.842 ·10−6 Emoción: Asco Figura 6.4: Diagrama de caja de la distribución de puntuaciones para Asco en idioma alemán pC−N= 6.625 ·10−7pC−O= 0.011
6. Evaluación y discusión 42 Emoción: Alegría Figura 6.5: Diagrama de caja de la distribución de puntuaciones para Alegría en idioma alemán pC−N= 2.729 ·10−4pC−O= 4.701 ·10−5 Emoción: Tristeza Figura 6.6: Diagrama de caja de la distribución de puntuaciones para Tristeza en idioma alemán pC−N= 2.531 ·10−4pC−O= 0.937
6. Evaluación y discusión 43 Emoción: Enfado Figura 6.7: Diagrama de caja de la distribución de puntuaciones para Enfado en idioma alemán pC−N= 1.1068 ·10−3pC−O= 1.632 ·10−5 6.3.2. Resultados con la base de datos de habla española Los resultados presentados en esta sección corresponden al test de escucha en idioma español. El número de oyentes fue 18, de los cuales 13 eran hispanohablantes. El número medio de ejemplos es de 120 por categoría emocional, con una media de 48 ejemplos de frases convertidas y 36 ejemplos de estilo neutro y frases originales respectivamente.
6. Evaluación y discusión 44 Emoción: Sorpresa Figura 6.8: Diagrama de caja de la distribución de puntuaciones para Sorpresa en idioma español pC−N= 2.74 ·10−11 pC−O= 2.842 ·10−8 Emoción: Miedo Figura 6.9: Diagrama de caja de la distribución de puntuaciones para Miedo en idioma español pC−N= 8.571 ·10−9pC−O= 8.427 ·10−3
6. Evaluación y discusión 45 Emoción: Asco Figura 6.10: Diagrama de caja de la distribución de puntuaciones para Asco en idioma español pC−N= 0.012 pC−O= 0.684 Emoción: Alegría Figura 6.11: Diagrama de caja de la distribución de puntuaciones para Alegría en idioma español pC−N= 6.602 ·10−4pC−O= 1.381 ·10−9
6. Evaluación y discusión 46 Emoción: Tristeza Figura 6.12: Diagrama de caja de la distribución de puntuaciones para Tristeza en idioma español pC−N= 1.396 ·10−8pC−O= 9.921 ·10−5 Emoción: Enfado Figura 6.13: Diagrama de caja de la distribución de puntuaciones para Enfado en idioma español pC−N= 6.547 ·10−9pC−O= 2.665 ·10−5
6. Evaluación y discusión 47 6.4. Discusión El método desarrollado en este proyecto ha demostrado poder transformar de forma efectiva una señal de voz en estilo emocional neutro a otro estilo emocional. El test de escucha muestra que las emociones mejor representadas son las que son expresadas principalmente de forma prosódica (e.g. tristeza, aburrimiento o sorpresa) en ambos idiomas. Por otra parte emociones que muestran interacciones complejas entre fenómenos espectrales y prosódicos muestran puntuaciones ligeramente inferiores (e.g. enfado o alegría), lo cual puede estar causado por la propia interacción entre estos patrones, que no son modelados simultáneamente. Resulta especialmente prominente el caso de la alegría en ambos idiomas, cuyo resultado es el más cercano al neutral de todas las emociones en ambos idiomas. La mejora que el sistema proporciona para esta emoción es reducida comparada a otras emociones, aunque en ningún caso hay evidencia de que el sistema no presente mejora (dado por los t-tests). La alegría es una emoción especial dado que no se expresa de forma uniforme a lo largo de la frase, y se hace mas notoria al nal de la frase que al principio. Por lo tanto, aunque el modelo prosódico puede capturar este efecto debido a la inclusión de información contextual, el modelo espectral no es capaz de modelar este efecto, y los cambios con el tiempo introducen confusión en la función de regresión, lo que produce una voz difícil de identicar. Este hecho puede verse en la distorsión mel-cepstral, ilustrada en la tabla 6.2, que muestra que para esta emoción en concreto, la distorsión se incrementa incluso con modelos dependientes del locutor, al contrario que en el resto de los casos.
48 7. Conclusiones y trabajo futuro En este trabajo se han estudiado los sistemas de conversión de voz y su aplicación a tareas de generación de habla expresiva, y se ha propuesto un sistema de conversión. El sistema propuesto ha probado ser capaz de convertir frases producidas en estilo neutro a estilo emocionado de forma independiente del locutor, usando una conversión de dos pasos, explotando la técnica de normalización de longitud del tracto vocal como paso de normalización de identidad, y posteriormente aplicando una técnica de regresión compleja no paramétrica capaz de capturar los efectos causados por las emociones en un hablante de referencia. El modelo prosódico se ha desarrollado de forma dependiente del contexto, para modelar ecazmente la curva de entonación y el ritmo del habla de forma que se ajusten a la correspondiente emoción. Para lograr esto, la regresión se ha llevado a cabo a nivel silábico usando conversión guiada por parámetros, y estos se usan para transformar la curva de F0 del estilo neutral. El sistema propuesto se ha evaluado en dos idiomas por medio de un test de escucha, probando ser capaz de generar habla emocionada satisfactoriamente a partir de habla neutra. Adicionalmente, se han obtenido medidas objetivas para probar que la independencia del hablante no incrementa la distorsión de la conversión de forma signicativa. Los resultados objetivos sugieren construir al menos dos modelos, uno para cada género, debido a las diferencias importantes en longitud del tracto vocal entre géneros que el sistema debe modelar en la normalización de identidad. Como sugerencia para investigación futura, el algoritmo VTLN basado en transformación bilineal puede ser sustituido por uno más complejo que reduzca la distorsión de forma más efectiva, como el propuesto en [Sun03], lo que probablemente produciría mejoras en la normalización de identidad. Adicionalmente, los resultados de la emoción alegría sugieren que los resultados podrían mejorar signicativamente si hiciera una clasicación de fonemas ( clustering ) previa al entrenamiento de la función de regresión, para paliar la variación temporal. Por otra parte, el modelo de prosodia propuesto se basa en descripción a nivel silábico, pero quizá una descripción a diferentes niveles (i.e. fonema o palabra) podría ser más adecuada, lo cual podría ser investigado en futuros trabajos.
7. Conclusiones y trabajo futuro 49 Otra posible área de investigación es la posible sustitución del modelo de prosodia por otro que sea capaz de manejar la información contextual implícitamente de algún modo, como el que se sugiere en [San14]. Siguiendo esta línea, la información prosódica (e.g. basada en wavelets) podría ser incluida como regresores en la función de transformación espectral, lo que quizá mejorase el resultado en emociones con correlación espectral y prosódica.
50 Referencias [Abe88] M. Abe, S. Nakamura, K. Shikano, and H. Kuwabara. Voice conversion through vector quantization. In: Proc. of the ICASSP , pp. 655658, 1988. [Ace93] A. Acero. Acoustical and environmental robustness in automatic speech recognition . Springer, 1993. [Amb00] D. C. Ambrus. Collecting and Recording of an Emotional Speech Database. Tech. Rep., Faculty of Engineering and Computer Science, Institute of Electronics, University of Maribor, 2000. [Ban96] R. Banse and K. Scherer. Acoustic Proles in Vocal Emotion Expression. Journal of Personality and Social Psychology , Vol. 70, No. 3, pp. 614636, 1996. [Bar07] R. Barra, J. M. Montero, J. Macias-Guarasa, J. Gutierrez-Arriola, J. Ferreiros, and J. M. Pardo. On the limitations of voice conversion techniques in emotion identication tasks. In: Proc. of Interspeech 2007 , 2007. [Bat00] A. Batliner, K. Fischer, R. Huber, J. Spilker, and E. Nöth. Desperately Seeking Emotions Or: Actors, Wizards, And Human Beings. In: ICSA workshop on speech and emotion , pp. 195200, 2000. [Ben03] K. P. Bennett and M. J. Embrechts. An Optimization Perspective on Kernel Partial Least Squares Regression. In: Advances in learning theory: methods, models, and applications; Proceedings of the NATO Advanced Study Institute on Learning Theory and Practice , pp. 227250, IOS Press, Louvain, Belgium, 2003. [Bre73] R. Brent. Algorithms for Minimization Without Derivatives , Chap. 4. Prentice-Hall, 1973. [Bre84] L. Breiman, J. Friedman, C. J. Stone, and R. Olshen. Classication and Regression Trees . Wadsworth Inc., 1984. [Bru93] F. Brugnara, D. Falavigna, and M. Omologo. Automatic segmentation and labeling of speech based on Hidden Markov Models. Speech Communication , pp. 357370, 1993. [Bur] J. Burdkart. BRENT. Algorithms for Minimization Without Derivatives. http://people.sc.fsu.edu/~jburkardt/m_src/brent/brent. html . Last accessed on 16.01.2014.