scieee AI-readable full text Open interactive document viewer

Aprendizaje online de los pesos del modelo log-lineal en traducción automática interactiva

López Salcedo, Francisco Javier

Abstract

[ES] En este trabajo se ha analizado la conveniencia de tres estrategias para adaptar los pesos del modelo log-lineal dentro de un escenario de traducción automática interactiva. La primera estrategia se basa en la actual definición de regresión de arista discriminativa. La siguiente estrategia aborda un cambio de perspectiva y ha sido llamada Primera aproximación. La última estrategia realiza una nueva definición de regresión de arista discriminativa para traducción automática interactiva logrando resultados alentadores.

Full text

Departamento de Sistemas Inform´aticos y Computaci´on Grupo de Reconocimiento de Formas y Tecnolog´ıas del Lenguaje Humano TRABAJO FIN DE M´ ASTER IARFID: Aprendizaje online de los pesos del modelo log-lineal en traducci´on autom´atica interactiva Autor: Francisco Javier L´opez Salcedo Revisores: Germ´an Sanchis-Trilles Francisco Casacuberta 7 de septiembre de 2012 ´ Indice general 1. Introducci´on 1 1.1. Traducci´on autom´atica . . . . . . . . . . . . . . . . . . . . . . . . . . . . 1 1.2. Traducci´on autom´atica estad´ıstica . . . . . . . . . . . . . . . . . . . . . 3 1.3. Traducci´on autom´atica estad´ıstica basada en secuencias de palabras . . 6 1.3.1. Elmodelo............................... 6 1.3.2. Entrenamiento del modelo basado en secuencias de palabras . . . 7 1.3.3. Ajuste de los modelos log-lineales . . . . . . . . . . . . . . . . . . 8 1.3.4. Traducci´on empleando los modelos basados en secuencias de palabras ................................. 9 1.4. Traducci´on Asistida por Ordenador . . . . . . . . . . . . . . . . . . . . . 10 1.5. Traducci´on Autom´atica Interactiva . . . . . . . . . . . . . . . . . . . . . 12 1.5.1. Traducci´on Autom´atica Estad´ıstica Interactiva . . . . . . . . . . 13 1.5.2. IMT basada en segmentos . . . . . . . . . . . . . . . . . . . . . . 14 1.5.3. IMT usando grafos de palabras . . . . . . . . . . . . . . . . . . . 14 1.6. Adaptaci´on .................................. 17 1.7. Conclusiones ................................. 20 2. Aprendizaje online en IMT 21 2.1. Aproximaci´on................................. 23 2.1.1. Adaptaci´on de los pesos del modelo log-lineal . . . . . . . . . . . 24 2.2. Algoritmos de aprendizaje online . . . . . . . . . . . . . . . . . . . . . . 24 2.2.1. Discriminative ridge regression . . . . . . . . . . . . . . . . . . . 25 2.2.1.1. Adaptaci´on de los factores de escalado mediante DRR enpost-edici´on....................... 25 2.2.1.2. Adaptaci´on de los factores de escalado mediante DRR enIMT........................... 26 2.2.2. Primera aproximaci´on . . . . . . . . . . . . . . . . . . . . . . . . 28 2.3. Conclusiones ................................. 28 i ´ Indice general 3. Experimentos 31 3.1. Corpus..................................... 31 3.1.1. Europarl................................ 31 3.1.2. News Commentary . . . . . . . . . . . . . . . . . . . . . . . . . . 32 3.2. Configuraci´on inicial del sistema . . . . . . . . . . . . . . . . . . . . . . 33 3.3. Evaluaci´on del sistema IMT . . . . . . . . . . . . . . . . . . . . . . . . . 35 3.4. Resultados experimentales . . . . . . . . . . . . . . . . . . . . . . . . . . 37 3.4.1. Minimizando el WSR mediante el algoritmo DRR definido para post-edici´on.............................. 38 3.4.1.1. Resultados con el sistema inicial: empleando 8 caracter´ısticas .......................... 38 3.4.1.2. Resultados con el sistema final: empleando 14 caracter´ısticas .......................... 40 3.4.2. Minimizando el WSR mediante la estrategia Primera aproximaci´on 47 3.4.3. Minimizando el WSR mediante el algoritmo DRR definido para IMT.................................. 52 3.4.4. Correlaci´on WSR, TER y BLEU . . . . . . . . . . . . . . . . . . 57 3.5. Conclusiones ................................. 59 4. Conclusiones y trabajo futuro 61 ii Agradecimientos Me gustar´ıa agradecer la ayuda de todas aquellas personas que han hecho posible realizar este trabajo fin de m´aster. Para empezar querr´ıa agradecer al doctor Francisco Casacuberta la oportunidad que me ha dado de colaborar con el grupo de investigaci´on PRHLT, as´ı como la confianza depositada en mi para realizar este trabajo en un ´area de tanto inter´es como es la traducci´on autom´atica estad´ıstica. Tambi´en me gustar´ıa agradecer la ayuda y el apoyo recibido por parte de todo el laboratorio 1L05, especialmente a Guillem Gasc´o, Mauricio Maca, Martha Alicia Rocha y sobretodo al doctor Germ´an Sanchis con los cuales he tenido la oportunidad de compartir el d´ıa a d´ıa. Germ´an ha sido para mi una persona imprescindible, siendo mi gu´ıa y mi mentor a largo de todo el proceso de investigaci´on. De ´el he aprendido algo cada d´ıa, desde las distintas herramientas disponibles para llevar a cabo los diversos experimentos hasta los conocimientos necesarios para saber como utilizarlas. Adem´as, gracias a ´el he aprendido infinidad de conceptos sobre traducci´on autom´atica estad´ıstica que me han ayudado a familiarizarme e interesarme m´as en este campo del ´area de reconocimiento de formas. Germ´an tambi´en me ha ense˜nado a superar las dificultades intr´ınsecas de la investigaci´on, anim´andome a perseverar en el trabajo y a no rendirme ante un experimento fallido. A ´el, tampoco puedo dejar de agradecerle la paciencia y comprensi´on que ha tenido conmigo durante el desarrollo de todo este trabajo. Para concluir, quisiera darle las gracias a Irene por haber confiado en mi desde el principio, as´ı como tambi´en por su paciencia, por su apoyo y por su cari˜no en los momentos m´as dif´ıciles. iii Resumen En muchas ocasiones las traducciones que un sistema de traducci´on autom´atica genera no tienen la calidad deseada, por lo que es necesaria la intervenci´on de expertos traductores humanos para corregir los posibles errores que estas puedan albergar, mejorando de esta forma la calidad de las mismas. Esta metodolog´ıa, conocida como Post-Edici´on (PE), est´a siendo cada vez m´as utilizada por traductores humanos y est´a considerada como parte del estado del arte. Debido al coste que supone aplicar dicha metodolog´ıa, en este trabajo fin de m´aster (TFM) se plantea un esquema alternativo, denominado traducci´on autom´atica interactiva (IMT, de sus siglas en ingl´es, Interactive Machine Translation), capaz de reducir el esfuerzo necesario por parte de un humano en el proceso de correcci´on. Siguiendo este nuevo esquema, en combinaci´on con una aproximaci´on encargada de adecuar los pesos del modelo log-lineal a cada una de las traducciones propuestas mediante un algoritmo de aprendizaje online, se consigue que el sistema aprenda de los errores que el traductor humano ya ha corregido, favoreciendo a su vez la correcci´on de los pr´oximos errores. Para abordar esta problem´atica se han empleado tres estrategias diferentes. En primer lugar se plantea el uso del algoritmo de aprendizaje online denominado Regresi´on de Arista Discriminativa ya utilizado en post-edici´on con buenos resultados. Posteriormente se han utilizado dos estrategias m´as avanzadas, una en la que se realiza una primera y sencilla aproximaci´on para adaptar λdentro de un escenario IMT y por ´ultimo una nueva formulaci´on del algoritmo DRR exclusiva para trabajar con IMT. Como se puede observar a lo largo de este TFM, esta nueva metodolog´ıa genera diversos resultados con ´exitos dispares, en donde el uso de la nueva formulaci´on del algoritmo DRR ofrece resultados alentadores, abriendo un nuevo camino a explorar con la esperanza de obtener la mayor calidad posible en las traducciones mediante el menor esfuerzo por parte del traductor humano. v Descripci´on Este trabajo fin de m´aster est´a estructurado en cuatro cap´ıtulos, los cuales relatan los aspectos m´as importantes de este trabajo. El primer cap´ıtulo es una introducci´on a la traducci´on autom´atica y al estado del arte de esta, m´as concretamente a la traducci´on autom´atica estad´ıstica y a su vertiente traducci´on autom´atica estad´ıstica interactiva (com´unmente denominada IMT por sus siglas en ingl´es, Interactive Machine Translation), la cual es la base de este trabajo. Por contra, en los tres siguientes cap´ıtulos se explican los experimentos realizados y las conclusiones obtenidas. En primer lugar se describen las estrategias seguidas para intentar mejorar el estado del arte actual a trav´es de la adaptaci´on de los pesos del modelo log-lineal mediante tres algoritmos. En segundo lugar los resultados obtenidos mediante estas tres estrategias de adaptaci´on online. Por ´ultimo, en el cuarto capitulo, se detallan las conclusiones obtenidas una vez evaluados los resultados de los experimentos y las futuras posibles mejoras y ampliaciones del trabajo realizado. vii 1 Introducci´on 1.3. Traducci´on autom´atica estad´ıstica basada en secuencias de palabras A pesar de que los modelos de traducci´on palabra por palabra parecen razonables, estos modelos no tienen en cuenta el contexto de las palabras a traducir. Por ello, con el objetivo de obtener la informaci´on del contexto, se introdujeron los modelos basados en segmentos o secuencias de palabras [Tom´as and Casacuberta, 2001, Marcu and Wong, 2002, Zens et al., 2002, Zens and Ney, 2004, Koehn et al., 2003], com´unmente denominados phrase-based (PB) models, mejorando el rendimiento de los modelos basados en una palabra. Actualmente los modelos PB forman parte del estado del arte [Koehn and Monz, 2006, Callison-Burch et al., 2007, Fordyce, 2007] de la traducci´on autom´atica y por tanto han sido empleados en este trabajo fin de m´aster. A diferencia de los modelos basados en palabras, que emplean como unidad b´asica en la traducci´on una ´unica palabra, los modelos basados en secuencias de palabras segmentan la oraci´on de entrada xen bloques de secuencias de palabras, com´unmente llamados segmentos o phrases, lo que facilita la inclusi´on de informaci´on de contexto de una forma natural. Estos modelos aprenden la probabilidad de que una secuencia contigua de palabras de entrada, ˜xk∈x, se traduzca por otra secuencia de palabras de salida ˜yk∈yde forma que el ´ultimo paso sea reordenar estos segmentos de salida para obtener la oraci´on ycomo traducci´on a la frase de entrada dada. Por tanto, en este caso los diccionarios estad´ısticos de pares de palabra se substituyen por diccionarios estad´ısticos de pares de segmentos biling¨ues. Al incluir el modelo basado en segmentos en el modelo log-lineal se mejora claramente la calidad de un SMT. 1.3.1. El modelo La derivaci´on de los modelos PB proviene del concepto de segmentaci´on biling¨ue, es decir, segmentar las oraciones de origen y destino en secuencias de palabras. En esta derivaci´on s´olo se consideran segmentos de palabras contiguas y no puede haber solapamiento entre ellos. Por tanto, el n´umero de segmentos de la oraci´on origen y el de la oraci´on destino deben ser iguales, llamado K, y cada segmento de origen se alinea ´unicamente con un segmento de destino y viceversa. Siendo JeIlas longitudes de xeyrespectivamente, definiremos la segmentaci´on de la oraci´on origen: γ:{1, . . . , K}→{1, . . . , J}:γk⩾γk−11< k ⩽K&γk=J(γ0= 0), y la segmentaci´on de la oraci´on destino: µ:{1, . . . , K}→{1, . . . , I}:µk⩾µk−11< k ⩽K&µk=I(µ0= 0). Por tanto, la alineaci´on de los segmentos de la oraci´on xey, quedar´ıa definida como: α:{1, . . . , K}→{1, . . . , K}:α(k) = α(k0)si k =k0. 6 1.3 Traducci´on autom´atica estad´ıstica basada en secuencias de palabras Asumiendo que todas las posibles segmentaciones de xen Ksegmentos y todas las posibles segmentaciones de yen Ksegmentos tienen la misma probabilidad independiente de K, podemos definir p(x|y) como: p(x|y) = p(J|I)·X K X µK 1 X γK 1 X αK 1 K Y k=1 p(αk|αk−1)·p(xγαk γαk−1+1|yµk µk−1+1),(1.9) donde normalmente se asume que el modelo de distorsi´on p(αk|αk−1) (la probabilidad de que un segmento destino ksea alinee con un segmento origen αk) ´unicamente depende del alineamiento anterior αk−1(modelo de primer orden). 1.3.2. Entrenamiento del modelo basado en secuencias de palabras Finalmente, cuando aprendemos un modelo PB, el objetivo es calcular la tabla de traducci´on de segmentos (phrase translation table), con la forma {(xj. . . xj0),(yi. . . yi0), p(xj. . . xj0|yi. . . yi0)}, en donde (xj. . . xj0) representa un segmento en el idioma origen, (yi. . . yi0) un segmento en la idioma destino y p(xj. . . xj0|yi. . . yi0) la probabilidad asignada al modelo dado un par biling¨ue de segmentos. Durante la ´ultima d´ecada se han explorado e implementado una amplia variedad de t´ecnicas para producir modelos PB [Koehn et al., 2003]. En primer lugar se propuso el aprendizaje directo de los par´ametros de la ecuaci´on p(˜x|˜y) [Tom´as and Casacuberta, 2001, Marcu and Wong, 2002]. Otros enfoques sugeridos fueron explorar t´ecnicas con mayor motivaci´on ling¨u´ıstica [S´anchez and Bened´ı, 2006, Watanabe et al., 2003]. A pesar de esto, la t´ecnica que ha sido ampliamente adoptada es la desarrollada por [Zens et al., 2002], en donde todos los pares de segmentos coherentes con un alineamiento de palabras dado son extra´ıdos, en la mayor´ıa de casos empleando uno de los alineamientos de IBM descritos en la secci´on 1.2. Ya que estos alineamientos son muy restrictivos debido a que cada palabra destino se asigna ´unicamente a cero o a una palabra origen se combinan heur´ısticamente los alineamientos origen-a-destino y destino-a-origen. Este procedimiento suele denominarse simetrizaci´on. Una vez hecho esto, el conjunto de segmentos consistentes con los alineamientos de palabras simetrizados se extraen para cada par de oraciones del conjunto de entrenamiento. Se puede ver un ejemplo de este procedimiento en la figura 1.1. Concretamente, las caracter´ısticas diferentes que se incluyen en el modelo de traducci´on son: Probabilidades de traducci´on inversa, dadas por la f´ormula p(˜x|˜y) = C(˜x, ˜y) C(˜x),(1.10) donde C(˜x, ˜y) representa el n´umero de veces que los segmentos ˜xe ˜yse extraen a lo largo de todo el corpus, y C(˜x) es el n´umero de veces que aparece ˜x. 7 1 Introducci´on Figura 1.1: Ejemplo de la extracci´on de segmentos consistentes con el alineamiento de palabras. Probabilidad de traducci´on directa, p(˜y|˜x), que se obtiene an´alogamente. Caracter´ısticas lexicalizadas directa e inversa, las cuales intentan explicar la solidez l´exica de cada par de segmentos, estimando cuan bien cada palabra en un idioma se traduce por otra palabra en distinto idioma. Estas caracter´ısticas lexicalizadas fueron definidas en [Zens et al., 2002]. Una caracter´ıstica constante, o penalizaci´on del segmento, llamada habitualmente phrase penalty, cuyo prop´osito es evitar el uso de muchos segmentos cortos durante la traducci´on, en favor del uso de segmentos m´as largos. 1.3.3. Ajuste de los modelos log-lineales Los modelos log-lineales normalmente consisten en una combinaci´on lineal de modelos logar´ıtmicos, los cuales pueden no estar definidos en el mismo rango por lo que tambi´en son conocidos como feature functions. La puntuaci´on que reciben las hip´otesis cuando se presenta una oraci´on de entrada en el sistema es la combinaci´on de las puntuaciones asignados por cada uno de los modelos. Hay que tener en cuenta que no todos los modelos tienen la misma importancia en la decisi´on global, lo que hace que se deba ajustar su influencia. Por esta raz´on, mediante los factores de escalado se ajusta el poder discriminativo de cada modelo que participa en la combinaci´on log-lineal. Estos factores de escalado 8 1.3 Traducci´on autom´atica estad´ıstica basada en secuencias de palabras se ajustan t´ıpicamente a trav´es de una peque˜na cantidad de oraciones biling¨ues, el conjunto de desarrollo, debido a que la cantidad de par´ametros cuyos valores necesitan ser aprendidos es peque˜na, t´ıpicamente 14. El prop´osito es seleccionar la mejor configuraci´on para estos pesos de forma que el error, dada una m´etrica de calidad, sea m´ınimo al utilizar el conjunto de desarrollo, empleando para ello la t´ecnica llamada minimum error rate training (MERT) [Och, 2003a]. Aunque MERT est´a ideado para optimizar cualquier m´etrica de calidad, la m´as com´unmente empleada es el BLEU. El paso de tuning o ajuste m´as com´un a la hora de establecer un sistema SMT consiste en traducir las oraciones del idioma origen del conjunto de desarrollo y producir un conjunto de las Nmejores hip´otesis (llamadas com´unmente N-best) para la traducci´on de cada oraci´on. Posteriormente, usando un algoritmo de optimizaci´on como el algoritmo propuesto por Powell [Powell, 1964], los valores para los factores de escalado son estimados de forma que las hip´otesis con mayor puntuaci´on dentro de la lista de N-best son empujadas hacia arriba de la lista. Inmediatamente despu´es, se traduce de nuevo el conjunto de desarrollo empleando los nuevos factores de escalado, y por tanto, produciendo una nueva lista de N-best. Posteriormente esta nueva lista de N-best se combina con la anterior. Este proceso se repite de forma iterativa hasta que la lista de N-best no var´ıe de una iteraci´on a otra, y por tanto el algoritmo converja, logrando de esta forma obtener todas las traducciones posibles para las oraciones del conjunto de desarrollo. 1.3.4. Traducci´on empleando los modelos basados en secuencias de palabras Una vez que un sistema SMT ha sido entrenado es el momento de iniciar el proceso de traducci´on, mediante el cual las oraciones en un idioma origen se traducir´an a un idioma destino. A este proceso se le denomina decoding y requiere el uso de un algoritmo para este fin. Se han sugerido diferentes estrategias de b´usqueda para definir la forma en la que se organiza el espacio de b´usqueda. En [Ortiz et al., 2003] se ha propuesto el uso del algoritmo A?, el cual adopta una estrategia el primero mejor (best-first) empleando colas de prioridad con el objetivo de organizar el espacio de b´usqueda, siendo esta la estrategia m´as utilizada. Por otra parte tambi´en se ha sugerido la estrategia de b´usqueda en profundidad (depth-first) en [Berger et al., 1996], la cual utiliza un conjunto de pilas para realizar la b´usqueda. 9 1 Introducci´on 1.4. Traducci´on Asistida por Ordenador A d´ıa de hoy, las traducciones proporcionadas por los sistemas SMT del estado del arte a´un siguen lejos de ser fiables. A pesar de ello, los sistemas actuales, en dominios generales, proporcionan traducciones con la calidad suficiente para hacernos una idea global del contenido de un texto. Por contra, sigue habiendo muchas otras tareas en las que estas traducciones no poseen la calidad necesaria y necesitan la colaboraci´on de un traductor humano para garantizar resultados de calidad. Actualmente, los traductores humanos emplean los ordenadores como una herramienta b´asica de trabajo, por lo que la interacci´on hombre-maquina es cada vez m´as necesaria, provocando que los diferentes casos de interacci´on hayan dado lugar a diferentes m´etodos en el marco de la traducci´on asistida por ordenador (com´unmente denominada Computer-Assisted Translation o CAT). Los diccionarios digitales fueron uno de los primeros y m´as rudimentarios elementos de la traducci´on asistida por ordenador, siendo las memorias de traducci´on (conocidas como Translation Memory, TM) la extensi´on natural de estos. Las memorias de traducci´on son bases de datos que almacenan pares de segmentos biling¨ues previamente traducidos para su uso posterior en caso de que estos vuelvan a aparecer. Las memorias de traducci´on colaborativas son un tipo de TM, en donde varios usuarios pueden agregar sus pares de segmentos biling¨ues. Debido a esta ventaja, las memorias de traducci´on colaborativas son uno de los recursos CAT m´as apreciados. Por tanto, la comunidad cient´ıfica cree que para aumentar la productividad en el proceso de traducci´on, las ordenadores deben tener un papel muy importante. Una forma sencilla de hacer que una m´aquina participe de forma activa en el proceso de traducci´on, es introducirla al comienzo de un proceso secuencial [Callison-Burch et al., 2004], de forma que el sistema SMT genere una traducci´on temporal que el experto traductor humano se encarga de aceptar, rechazar o corregir. Figura 1.2: Esquema del paradigma de post-edici´on en la cual el traductor humano puede modificar la traducci´on dada por el sistema SMT La aceptaci´on del paradigma de post-edici´on por parte de los traductores humanos profesionales depende en gran medida de la calidad de las traducciones del sistema SMT. Si el sistema ofrece hip´otesis de mala calidad el traductor requerir´a de m´as tiempo para corregir la hip´otesis dada del que necesitar´ıa para traducir la oraci´on desde cero y por tanto su productividad se ver´a reducida considerablemente. Por contra, si el sistema ofrece traducciones de calidad el usuario necesitar´a realizar pocos cambios en la hip´otesis y ver´a aumentada su productividad, lo que ayudar´a a la aceptaci´on del paradigma por parte del usuario. 10 1.4 Traducci´on Asistida por Ordenador Una mejora en el sistema de post-edici´on consiste en medir el grado de confianza que el sistema tiene en la hip´otesis proporcionada de forma que s´olo en el caso de que este supere cierto umbral se le proporcione al traductor la hip´otesis para corregirla. Adem´as del paradigma de post-edici´on existen otras formas m´as sofisticadas de introducir una m´aquina en el proceso de traducci´on, siendo el paradigma de traducci´on autom´atica interactiva [Barrachina et al., 2009, Casacuberta et al., 2009] una de ellas. Debido a que en las lenguas europeas la lectura se produce de izquierda a derecha, en el paradigma IMT el usuario acepta un prefijo (secuencia de palabras) de la hip´otesis propuesta por el sistema como correcto, indicando que posteriormente a este segmento aparece un error. En funci´on de este prefijo, en la siguiente iteraci´on el sistema propondr´a un sufijo para completar la traducci´on. Este procedimiento se repite hasta que el usuario acepte la totalidad de la oraci´on. 11 1 Introducci´on 1.5. Traducci´on Autom´atica Interactiva Debido a los grandes avances en las tecnolog´ıas de la informaci´on, en la actualidad se ha comenzado a necesitar m´etodos de traducci´on m´as eficientes y menos costosos. A pesar de ello, los actuales sistemas de MT no son capaces de producir traducciones con la suficiente calidad como para poder usarse directamente [Kay, 1997, Hutchins, 1999, Arnold., 2003] sin necesidad de ser previamente revisadas. Adem´as los sistemas de MT habitualmente se encuentran limitados por la sem´antica espec´ıfica del dominio y las traducciones que proporcionan, en la mayor´ıa de casos, requieren de post-edici´on por parte de un humano para lograr obtener traducciones con una alta calidad. Una forma de mejorar los sistemas de MT actuales es combin´andolos con el conocimiento de un traductor humano experto, constituyendo el paradigma llamado Computer-Assisted Translation (CAT). CAT ofrece diferentes aproximaciones con el objetivo de beneficiarse de la sinergia entre los humanos y los sistemas de MT. Una importante contribuci´on a la tecnolog´ıa CAT fue llevada a cabo dentro del proyecto TransType (TT) [Langlais et al., 2004, Foster et al., 2002, Foster, 2002, Och et al., 2003]. Este proyecto implic´o un interesante cambio de enfoque, en el cual la interacci´on estuvo directamente dirigida a traducir texto, en lugar de a la desambiguaci´on del texto a traducir como ocurr´ıa en los antiguos sistemas interactivos. La idea que el proyecto TT propuso fue integrar las t´ecnicas de MT basadas en datos dentro de un entorno de traducci´on interactivo, con la esperanza de combinar lo mejor de los paradigmas CAT, en el cual el humano asegura una traducci´on de calidad, y MT, en donde la m´aquina asegura una ganancia significante en la productividad. Continuando con las ideas del proyecto TT, en [Barrachina et al., 2009] se propone el uso de sistemas de traducci´on autom´atica estad´ıstica completos para producir hip´otesis de traducci´on completas, o porciones de estas, las cuales pueden ser aceptadas y modificadas por un traductor humano. Cada porci´on de texto, aceptada como correcta por el usuario, es usada por el sistema SMT como informaci´on adicional para generar el resto de la traducci´on, as´ı como para mejorar la calidad de las futuras sugerencias. Concretamente, en cada iteraci´on el prefijo de la oraci´on traducida es de alguna manera fijado por el traductor humano y en la siguiente iteraci´on el sistema predice el mejor o los mejores sufijos para completar dicho prefijo. Este proceso es com´unmente conocido como traducci´on autom´atica interactiva o IMT por sus siglas en ingl´es, interactive-predictive machine translation. El paradigma IMT se ajusta bien dentro del marco de Reconocimiento de formas interactivo introducido en [Vidal et al., 2007]. En la figura 1.3 podemos ver un ejemplo del paradigma IMT. Inicialmente el usuario da una oraci´on de entrada xpara ser traducida. La referencia yproporcionada es la traducci´on que el usuario quiere lograr al final del proceso de IMT. En la iteraci´on 0, el usuario no suministra ning´un prefijo del texto al sistema, por este motivo pno contiene nada. Por tanto el sistema IMT tiene que proporcionar la traducci´on completa como sufijo sh, tal como si este fuera un sistema convencional de SMT. En la siguiente iteraci´on el usuario valida el prefijo pcomo correcto posicionando el cursor en la posici´on en la que comienza la primera palabra err´onea, que en este caso se corresponde con el final del segmento “gracias a la encuesta , esto”. Por otra parte impl´ıcitamente se est´a marcando el resto de la oraci´on, es decir, el sufijo sl(“cambie .”) como incorrecto. 12 1.5 Traducci´on Autom´atica Interactiva ENTRADA (x):thanks to the poll , this will change . REFERENCIA (y):gracias a la encuesta , esto ha cambiado . ITER-0 (p) ( ) (ˆ sh)gracias a la encuesta , esto cambie . ITER-1 (p) gracias a la encuesta , esto (sl)cambie . (k) ha (ˆ sh)a cambiar . ITER-2 (p) gracias a la encuesta , esto ha (sl)a cambiar . (k) cambiado (ˆ sh). ITER-3 (p) gracias a la encuesta , esto ha cambiado . (sl) ( ) (k) (#) (ˆ sh) ( ) FINAL (p≡y) gracias a la encuesta , esto ha cambiado . Figura 1.3: Ejemplo de funcionamiento del proceso IMT para traducir del ingl´es al espa˜nol una oraci´on Las hip´otesis no aceptadas se muestran en cursiva mientras que los prefijos aceptados se muestran utilizando la fuente por defecto. Posteriormente el usuario introducir´a una nueva palabra ka continuaci´on del prefijo aceptado, la cual se asume que es diferente de la primera palabra sl1en el sufijo slla cual no fue validada, k6=sl1. A continuaci´on el proceso anterior se repite, el sistema sugiere una nueva hip´otesis como sufijo ˆ sh, sujeto a ˆsh1=k, y el usuario valida el nuevo prefijo, proporciona una nueva palabra y as´ı sucesivamente. Este proceso terminar´a en el momento en el que toda la oraci´on haya sido validada como correcta y se introduzca la palabra especial “#”. Como se puede observar en el ejemplo anterior, a pesar de que un sistema IMT puede cometer errores en la predicci´on de los sufijos, ayuda a reducir el esfuerzo e incrementa la productividad de los traductores generando traducciones de alta calidad. Para el caso descrito, en la figura 1.3 ´unicamente ha sido necesario realizar cinco interacciones para obtener la traducci´on de referencia, las cuales constan de dos clicks de rat´on y la introducci´on de 3 palabras. Por contra, sin emplear IMT el traductor habr´ıa tenido que introducir ocho palabras y siete caracteres de espacios. 1.5.1. Traducci´on Autom´atica Estad´ıstica Interactiva La traducci´on autom´atica estad´ıstica interactiva se base en la formulaci´on de SMT. Para establecer la ecuaci´on fundamental para IMT es necesario modificar la Ecuaci´on 1.1 de acuerdo al escenario IMT con el objetivo de tener en cuenta la parte de la oraci´on destino que ya esta traducida, que es pyk: 13 1 Introducci´on ˆ sh= argmax sh Pr(sh|x,p, k) (1.11) donde el problema de maximizaci´on se define sobre el sufijo sh, permiti´endonos reescribir la Ecuaci´on 1.11 descomponiendo apropiadamente la parte derecha y eliminando los t´erminos constantes, logrando el criterio equivalente ˆ sh= argmax sh Pr(p, k, sh|x).(1.12) Un ejemplo de la utilidad de estas variables puede verse en la Figura 1.3. Hay que tener en cuenta que debido a que pksh=y, la Ecuaci´on 1.12 es muy parecida a la Ecuaci´on 1.1. La principal diferencia entre ellas reside en la b´usqueda del argmax, ya que ahora se realizar´a sobre el conjunto de sufijos shque completen pken lugar de la oraci´on completa ycomo ocurre en la Ecuaci´on 1.1. Esto hace que podamos usar los mismos modelos siempre y cuando el procedimiento de b´usqueda se modifique correctamente [Barrachina et al., 2009]. 1.5.2. IMT basada en segmentos La aproximaci´on basada en segmentos de palabra o phrases presentada anteriormente se puede adaptar f´acilmente para ser usada en escenarios IMT. La modificaci´on mas importante a realizar consiste en emplear grafos de palabras, los cuales representan las posibles traducciones para una oraci´on. En [Barrachina et al., 2009] se estudi´o el uso de los grafos de palabras en IMT en combinaci´on con dos t´ecnicas de traducci´on, denominadas, plantillas de alineamientos conocidas en MT como Alignment Templates [Och et al., 1999, Och and Ney, 2004] y Transductores de Estados Finitos, conocidos como Stochastic Finite State Transducers [Casacuberta and Vidal, 2007]. 1.5.3. IMT usando grafos de palabras Un grafo de palabras, conocidos habitualmente en ingl´es como word graph, es un grafo dirigido, ac´ıclico y ponderado, en el cual cada nodo representa una hip´otesis de traducci´on parcial y cada arista etiquetada con una palabra de la oraci´on destino est´a ponderada de acuerdo a la puntuaci´on dada por el modelo SMT, lo cual puede verse con m´as detalle en [Ueffing et al., 2002]. En [Och, 2003a] se propone el uso de grafos de palabras como una interfaz entre los modelos de SMT basados en plantillas de alineamientos y el motor IMT. En este trabajo de maneara an´aloga usaremos el grafo de palabras construido durante el procedimiento de b´usqueda realizado en el modelo de SMT basado en segmentos. Ya que este modelo podr´ıa generar un grafo de segmentos ophrase-graph, en lugar de un grafo de palabras, es necesario convertir este a un grafo de palabras. Sin embargo este procedimiento es bastante simple y se logra a˜nadiendo nodos y aristas artificiales entre cada uno de las palabras que constituyen los segmentos y asignando la puntuaci´on del segmento a la arista final. En la figura 1.4 podemos ver un ejemplo de este procedimiento. Debemos tener en cuenta en el proceso de conversi´on del grafo de segmentos 14 1.5 Traducci´on Autom´atica Interactiva a grafo de palabras que las puntuaciones de las aristas no son probabilidades sino logaritmos de probabilidades ya que la maximizaci´on de la ecuaci´on 1.5 se realiza sin normalizaci´on. Las puntuaciones de las aristas de los grafos depende de dos factores, en primer lugar de la funci´on de caracter´ısticas asociada a la oraci´on que representa el grafo, y en segundo lugar a los pesos del modelo log-lineal asociados a esta funci´on. Por ello, la puntuaci´on de transici´on entre los nodos de un grafo dependen de ambos conjuntos de par´ametros. Puesto que en este TFM ´unicamente pretendemos optimizar el valor de los pesos del modelo log-lineal para una oraci´on dada x, diremos que el grafo de palabras depender´a del conjunto de pesos λny no de la funci´on de caracter´ısticas, denot´andolo como Wλn(x). Durante el proceso de IMT para una oraci´on dada, el sistema hace uso del grafo de palabras generado para la oraci´on con el fin de completar el prefijo aceptado por el traductor humano. Espec´ıficamente el sistema encuentra el mejor camino en el grafo de palabras asociado con el prefijo dado, de forma que permita completar la traducci´on, siendo capaz de proporcionar muchas sugerencias de terminaci´on para cada prefijo. Cuando el usuario define un prefijo que no aparece en el grafo de palabras, el sistema no puede encontrar el camino a trav´es del grafo que proporcione un sufijo adecuado, dando lugar a uno de los problemas mas comunes en IMT. Para solucionar este problema se realiza una b´usqueda tolerante en el grafo de palabras, la cual, como puede verse en [Och, 2003a], emplea la conocida distancia de Levenshtein para obtener el segmento m´as parecido al prefijo dado. 15 2 Aprendizaje online en IMT Figura 2.1: Esquema del paradigma de aprendizaje online dentro del marco de la traducci´on autom´atica interactiva-predictiva (IMT) en donde la interacci´on del humano proporciona la realimentaci´on de forma online. En la figura 2.1 se muestra un esquema del paradigma de aprendizaje online, en donde se incorpora la realimentaci´on del usuario dentro del m´odulo estimador λy la interacci´on del usuario con el sistema IMT en cada interacci´on k. El objetivo del m´odulo estimador λes generar el conjunto de pesos que se utilizara en la creaci´on del grafo de palabras. En un primer momento, el sistema SMT recibe una primera oraci´on xen un idioma origen y genera un grafo de palabras o word-graph a partir de la misma. A continuaci´on, el grafo de palabras generado sirve como entrada al sistema IMT, de forma que el sistema genere el mejor sufijo posible a partir de ´el, es decir, devuelva al usuario el mejor camino del grafo. Una vez el sistema genera la traducci´on, como puede verse en la figura 1.3, el traductor humano deber´a aceptar la totalidad de la traducci´on o un prefijo de la misma en cada una de las interacciones con el sistema. Este proceso finalizar´a cuando el usuario acepte totalmente la traducci´on propuesta por el sistema, convirti´endose esta en la traducci´on de referencia yτ. Esta oraci´on puede ser usada como realimentaci´on para el sistema IMT de forma que el algoritmo de aprendizaje online modifique el valor de λcon el objetivo de mejorar la calidad de las futuras traducciones. A partir de la segunda oraci´on que recibe el sistema SMT, durante la generaci´on del grafo de palabras, se modificara el valor de los pesos de los modelos por los del conjunto de pesos que el m´odulo estimador λoptimiz´o a partir de todas las interacciones anteriores del usuario con el sistema. Como consecuencia de esta modificaci´on, la puntuaci´on de las diferentes aristas del grafo de palabras tambi´en ser´an modificadas. Puesto que nuestro objetivo es aprender de cada interacci´on, la ecuaci´on 1.7 se redefine como: yt= argmax y M X m=1 λt mhm(xt,y),(2.1) transformada en forma vectorial como: 22 2.1 Aproximaci´on ˆ yt= argmax y λth(xt,y),(2.2) en donde los pesos del modelo log-lineal λtvar´ıan de acuerdo a las muestras (x1,yτ 1),. . . ,(xt−1,yτ t−1) vistas antes del momento t. Con el fin de simplificar la notaci´on, y siguiendo la notaci´on descrita en [Mart´ınez-G´omez et al., 2012], trabajo previo sobre el que se sustenta este trabajo fin de m´aster, a partir de ahora omitiremos el sub´ındice tpara la oraci´on de entrada x, aunque dicho sub´ındice lo asumiremos siempre. Nuestro objetivo es obtener traducciones con la mayor calidad posible, es decir que se asemejen lo m´aximo posible a la traducciones de referencia. A´un as´ı, es frecuente que la hip´otesis ˆ yque maximiza la verosimilitud no tiene por qu´e ser la hip´otesis de mayor calidad, es decir, la mejor seg´un la perspectiva de un traductor humano o para una medida de calidad dada. Por tanto, es posible que la hip´otesis con mayor calidad y∗no coincida con la hip´otesis con mayor verosimilitud. Hay que tener en cuenta que y∗puede no coincidir con yτ, la oraci´on de referencia, debido a eventuales problemas de cobertura. Como ya se realiz´o en [Mart´ınez-G´omez et al., 2012], se propone adaptar los par´ametros del modelo de forma que y∗obtenga la mayor puntuaci´on de acuerdo a la ecuaci´on 1.7. Con este fin se define la diferencia entre la calidad de la hip´otesis propuesta por el sistema ˆ yy la mejor hip´otesis y∗en funci´on de la medida de calidad µ(·): l(ˆ y) = |µ(ˆ y)−µ(y∗)|(2.3) Debido a que los SMT pueden emplear diferentes medidas de calidad para evaluar su sistema, es decir, TER [Snover et al., 2006] representa el ratio de error (mejor cuanto m´as bajo), mientras que BLEU [Papineni et al., 2002] representa una medida de precisi´on (mejor cuanto m´as alto), se incluy´o el valor absoluto en la ecuaci´on 2.3 para preservar la generalidad. Adem´as, la diferencia entre los scores de ˆ yey∗ha sido definida como φ(ˆ y) = g(x,y∗)−g(x,ˆ y) (2.4) Tanto en la ecuaci´on 2.3 como en la ecuaci´on 2.4, para simplificar la notaci´on, se omitieron las dependencias de la oraci´on de entrada x, la mejor hip´otesis del sistema y∗y la traducci´on de referencia proporcionada por el usuario yτ. La intenci´on es correlacionar l(·) y φ(·) de forma que las diferencias de una se correspondan con las de la otra. Por lo tanto, si la hip´otesis candidata ytiene una calidad de traducci´on µ(y) muy similar a la calidad de la traducci´on proporcionada por µ(y∗), esperamos que g(x,y) sea muy similar a g(x,y∗). 2.1. Aproximaci´on En [Mart´ınez-G´omez et al., 2012] se proponen dos aproximaciones, adaptar htoλt, es decir, adaptar en el instante de tiempo tla funci´on de caracter´ısticas o los pesos 23 2 Aprendizaje online en IMT del modelo log-lineal, respectivamente. En este trabajo ´unicamente nos centraremos en la adaptaci´on de los pesos del modelo log-lineal, ya que esta aproximaci´on ofrece mejores resultados, debido probablemente a que ´unicamente deben adaptarse el mismo n´umero de par´ametros que modelos intervienen en la combinaci´on log-lineal, es decir, normalmente alrededor de 14 par´ametros, frente a los cerca de tres millones en el caso de adaptar ht. 2.1.1. Adaptaci´on de los pesos del modelo log-lineal En el presente trabajo vamos a emplear una t´ecnica para adaptar los pesos del modelo log-lineal λ, tambi´en llamados factores de escalado, para abordar el problema del aprendizaje online en IMT. Una vez el sistema haya recibido la oraci´on de entrada xty su correspondiente oraci´on de referencia yτ tse procede a calcular el mejor conjunto de pesos ˆ λtpara el par de oraciones observado en el instante t, (xt,yτ t) el cual se utilizar´a para calcular el t´ermino de actualizaci´on ˇ λt. Una vez se ha calculado ˇ λtpodemos actualizar λde la siguiente forma: λt= (1 −α)λt−1+αˇ λt,(2.5) empleando un ratio de aprendizaje α. Como puede observarse, para calcular λtpreviamente es necesario emplear el vector de pesos calculado para el par de oraciones observadas en el instante t−1, λt−1mediante la ecuaci´on 2.5. El objetivo es ajustar el poder discriminativo de cada modelo de forma que la puntuaci´on resultante de la combinaci´on log-lineal [Stauffer and Grimson, 2000] de estos sea mayor para la hip´otesis m´as similar a la oraci´on de referencia dada yτ t, es decir, y∗ t, que la puntuaci´on de cualquier otra hip´otesis. El proceso del c´alculo de λtpuede entenderse como una correcci´on de la estimaci´on del λt−1anterior. A pesar de que la informaci´on empleada al calcular ˇ λtes general e imprecisa, la variaci´on en el score de la ecuaci´on 1.8 puede ser alto ya que se est´an modificando los factores de escalado del modelo log-lineal. De esta forma, se permite adaptar el sistema a una nueva tarea ajustando la importancia que tiene cada uno de los modelos de forma online. 2.2. Algoritmos de aprendizaje online Dada un oraci´on xen un idioma origen, un sistema IMT generar´a un grafo de palabras que contendr´a todas las posibles traducciones para la oraci´on de entrada xen un idioma destino. De entre todas las hip´otesis contenidas en el grafo de palabras, el sistema escoger´a como traducci´on la “mejor” hip´otesis, aquella cuyo camino en el grafo obtenga mayor puntuaci´on. Dada la medida de calidad planteada en la ecuaci´on 2.3 podemos comprobar que la hip´otesis dada como traducci´on del sistema baseline, sistema del estado del arte que se utiliza como referencia y que emplea siempre el conjunto de 24 2.2 Algoritmos de aprendizaje online pesos obtenidos inicialmente, no tiene por qu´e ser la hip´otesis con mayor calidad. Pretendemos que el sistema IMT genere las traducciones con la m´axima calidad posible. Por ello emplearemos diversos algoritmos de aprendizaje online para intentar ajustar los pesos del modelo log-lineal de forma online con el objetivo de que la hip´otesis del grafo con mayor puntuaci´on sea adem´as la hip´otesis con m´as calidad. En esta secci´on veremos como calcular ˇ λtpara, mediante la ecuaci´on 2.5, obtener ˆ λtempleando el algoritmo DRR con dos formulaciones, una ya conocida basada en post-edici´on y otra planteada en ese TFM basada en IMT. Para cada uno de los algoritmos de aprendizaje online, en primer lugar daremos una breve descripci´on para posteriormente detallar su aplicaci´on para adaptar los pesos del modelo log-lineal. Cabe destacar que por simplicidad, siguiendo con la nomenclatura presentada en [Mart´ınez-G´omez et al., 2012], se omitir´an los sub´ındices y super´ındices ten caso de que no se requiera de una clara distinci´on temporal. Por coherencia, se describir´an ambas definiciones del algoritmo DRR de forma continuada, aunque la estrategia Primera aproximaci´on fue planteada antes de crear la nueva definici´on para el algoritmo DRR. 2.2.1. Discriminative ridge regression A diferencia de otros algoritmos como Passive-Agressive [Crammer et al., 2006] y Percentron Like [Espa˜na-Bonet and Marquez, 2010], empleados con ´exito en un escenario de post-edici´on, y que intentan encontrar el conjunto de pesos tal que las “buenas” hip´otesis dentro de la lista de N-best tengan una puntuaci´on alta, el algoritmo DRR [Mart´ınez-G´omez et al., 2012] adem´as fuerza a que las “malas” hip´otesis tengan una puntuaci´on baja. El algoritmo DRR emplea t´ecnicas de regresi´on de arista1para desarrollar un algoritmo de adaptaci´on online discriminativo. 2.2.1.1. Adaptaci´on de los factores de escalado mediante DRR en post-edici´on El algoritmo DRR emplea una lista de N-best en orden decreciente de verosimilitud calculada a partir de los diferentes modelos dada una oraci´on de entrada x. El primer paso para adaptar λconsiste en definir una matriz NxM, Hx, en donde Mes el n´umero de caracter´ısticas que contiene las funciones de caracter´ısticas hpara cada hip´otesis en la ecuaci´on 1.7: Hx= [h(x,y1), ..., h(x,yN)]0.(2.6) Consecuentemente, definimos H∗ xcomo una matriz de la siguiente forma: H∗ x= [h(x,y∗), ..., h(x,y∗)]0,(2.7) la cual contendr´a todas sus filas id´enticas e iguales al vector de caracter´ısticas de la mejor hip´otesis y∗de la lista de N-best. A continuaci´on definiremos Rxcomo: 1Tambi´en conocida como regularizaci´on de Tikhonov. 25 2 Aprendizaje online en IMT Rx= H∗ x−Hx.(2.8) El objetivo de DRR es encontrar el vector ˇ λtque refleje las diferencias en scores como diferencias en la calidad de las hip´otesis, es decir Rx·ˇ λt∝lx,(2.9) siendo lxun vector columna de Nfilas representado como lx= [l(y1),...,l(yi),...,l(yN)]0,∀yi∈nbest(x).(2.10) Por lo tanto definimos el vector ˇ λta buscar como: ˇ λt= argmin λ |Rx·λ−lx|(2.11) = argmin λ ||Rx·λ−lx||2,(2.12) en donde || · ||2representa la norma Eucl´ıdea. A pesar de que las ecuaciones 2.11 y 2.12 son equivalentes, la ecuaci´on 2.12, gracias a la regresi´on de arista, ˇ λtpuede resolverse como la soluci´on al sistema sobredeterminado Rx·ˇ λt=lxdada de la siguiente forma: ˇ λt= (R0 x·Rx+βI)−1R0 x·lx,(2.13) donde un valor peque˜no de βrepresenta el termino de regularizaci´on para estabilizar el producto R0 x·Rxy asegurar que este sea invertible. 2.2.1.2. Adaptaci´on de los factores de escalado mediante DRR en IMT Al aplicar el algoritmo DRR en un escenario IMT, la m´etrica de calidad que empleamos no es inherente a una sola hip´otesis sino a todo un grafo de palabras. Es bastante com´un evaluar la calidad de un sistema IMT calculando el n´umero de interacciones que un usuario necesita para modificar la hip´otesis hasta que se obtenga la oraci´on de referencia y para medir esto utilizamos el WSR [Toselli et al., 2011], una m´etrica empleada para medir la calidad de un sistema IMT. Cuando se introduce una palabra el sistema IMT modifica el sufijo, provocando que el n´umero de interacciones no se pueda calcular en funci´on de la hip´otesis y por tanto se debe calcular simulando el procedimiento de interacci´on con la ayuda de un grafo de palabras. Esto hace que el DRR tal cual se ha descrito en la secci´on 2.2.1.1, no se pueda aplicar directamente dentro de un marco IMT. Es posible pensar que al optimizar cierta m´etrica de calidad tambi´en se optimizar´ıa el n´umero de interacciones necesarias para conseguir obtener la oraci´on de referencia. A pesar de ello, los experimentos descritos en la secci´on 3.4.1 demuestran que esto no es completamente cierto. Por lo tanto, puesto que la m´etrica que optimizamos mediante aprendizaje online no depende ´unicamente de la mejor hip´otesis, es necesario modificar la formulaci´on del algoritmo DRR descrita en la secci´on 2.2.1.1. 26 2.2 Algoritmos de aprendizaje online En primer lugar ser´ıa razonable considerar una lista de N-best grafos de palabras en lugar de una lista de N-best. No obstante el concepto de N-best grafos de palabras es un poco confuso, ya que no hay una forma clara de medir la calidad de un grafo de palabras. Esto provoca que en lugar de calcular una verdadera lista de N-best grafos de palabras calcularemos el grafo de palabras Wλn(x) asociado a cada oraci´on de entrada xa partir de uno de los conjuntos de pesos λn, de entre los obtenidos previamente de forma semi-aleatoria Λ={λ1,...,λn,...,λN}. Puesto que los pesos se han obtenido de forma semi-aleatoria, los grafos de palabras generados no constituyen una verdadera lista de los N-best grafos de palabras, sino una aproximaci´on de esta, la cual mejorar´ıa con cuantos mas conjuntos de pesos se hayan generado. Ya que el objetivo del algoritmo DRR es premiar en este caso a un grafo de palabras (realmente premiamos un conjunto λn) con una buena puntuaci´on y penalizar aquellos con una puntuaci´on baja lo que es realmente importante es tener grafos de palabras (Wλn(x)) con ambos tipos de puntuaciones. De esta forma propondremos el vector columna lycuyas Nfilas son ly= [l(Wλ1(x)) . . . l(Wλn(x)) . . . l(WλN(x))].(2.14) Otro aspecto a considerar de la formulaci´on original del DRR dentro un escenario IMT es la matriz Hx, la cual debe ser redefinida debido a que las caracter´ısticas a considerar ya no se corresponden a las hip´otesis de la lista de N-best, sino con los grafos de palabras creados empleando Λ. Puesto que un grafo de palabras Wλn(x) no tiene un ´unico conjunto de caracter´ısticas sino m´as bien un vector de caracter´ısticas para cada uno de los caminos del grafo de palabras, empleamos el vector de caracter´ısticas h del mejor camino en Wλn(x), es decir, el vector de caracter´ısticas de la mejor hip´otesis de Wλn(x), para definir Hx. Manteniendo la notaci´on, nombraremos a este vector de caracter´ısticas hλny definiremos por tanto Hxpara IMT de la forma Hx= [hλ1,...,hλN]0.(2.15) Del mismo modo definiremos H∗ xcomo Hx∗= [hλ∗,...,hλ∗]0,(2.16) en donde hλ∗es el vector de caracter´ısticas perteneciente a la mejor hip´otesis del grafo de palabras Wλ∗(x) y Wλ∗(x) es el grafo de palabras con mayor calidad de entre los calculados empleando los diferentes λdel s´uper conjunto Λ, de acuerdo a la m´etrica empleada correspondiente a IMT, en este trabajo el WSR. Los conjuntos de pesos semi-aleatorios han sido generados mediante una distribuci´on gaussiana, cuya media se corresponde con el conjunto de pesos obtenido en la etapa de tuning mediante la t´ecnica MERT (Minimum Error Rate Training). El conjunto de pesos empleado en la creaci´on del grafo de palabras tiene una influencia muy importante en la obtenci´on del mejor camino del mismo, es decir, en la obtenci´on de la traducci´on de la oraci´on a partir de la cual se cre´o el grafo de palabras. Debido a esto, partimos del conjunto de pesos baseline, el calculado por MERT, para 27 2 Aprendizaje online en IMT generar un n´umero finito de nuevos conjuntos de pesos similares al de MERT. De esta forma evitamos emplear conjuntos de pesos aleatorios que con certeza nos dar´ıan en su gran mayor´ıa grafos de palabras con una calidad muy baja e intentamos obtener conjuntos de pesos que nos ofrezcan grafos de palabras de mayor calidad que los dados por el sistema baseline. El uso de la distribuci´on gaussiana se basa en la posibilidad de que el conjunto de pesos generado mediante MERT no sea el mejor posible para el dominio de las oraciones a traducir debido a que el conjunto de desarrollo empleado para ajustar los pesos mediante MERT pertenece a un dominio diferente. Por otra parte, todos los grafos de palabras pertenecientes a una misma oraci´on han sido generados a partir de un grafo de palabras creado mediante un software empleando el conjunto de pesos dado por MERT a partir de dicha oraci´on. 2.2.2. Primera aproximaci´on Esta estrategia, a la que hemos denominado Primera aproximaci´on por ser la primera estrategia definida para un escenario IMT, es la m´as sencilla de todas. En esta aproximaci´on, el t´ermino de actualizaci´on ˇ λtpara la oraci´on procesada x en el instante de tiempo tse corresponder´a con el conjunto de pesos λ∗al grafo de palabras Wλ∗(x). Wλ∗(x) es el grafo de palabras con mayor calidad, de acuerdo a la m´etrica de calidad WSR, de entre todos los creados para la oraci´on x Los grafos de palabras son creados empleando para cada uno de ellos un λdistinto dado un s´uper conjunto Λ={λ1,...,λn,...,λN}. Cada uno de los conjuntos de pesos pertenecientes a Λhan sido generados de forma semi-aleatoria mediante una distribuci´on gaussiana, cuya media se corresponde con el conjunto de pesos obtenido en la etapa de tuning mediante la t´ecnica MERT. Generar los pesos de forma semialeatoria permite que los pesos empleados en la generaci´on de los grafos tenga en su promedio una calidad aceptable y permitan, en teor´ıa, mejorar la calidad de las traducciones dadas por el sistema baseline. 2.3. Conclusiones Aunque existen varias aproximaciones para llevar a cabo el proceso de adaptaci´on online, una de las que mejor rendimiento ha dado consiste en adaptar los pesos del modelo log-lineal. Por este motivo, ha sido la aproximaci´on escogida en este trabajo fin de m´aster. Existen muchos algoritmos de aprendizaje online, Passiveagressive [Crammer et al., 2006], Perceptron like [Espa˜na-Bonet and Marquez, 2010], Discriminative ridge regression [Mart´ınez-G´omez et al., 2012], Bayesian predictive adaptation [Sanchis-Trilles and Casacuberta, 2010], etc. De entre todos ellos, como se puede ver en [Mart´ınez-G´omez et al., 2012], el algoritmo DRR ha sido el que mejores resultados ha dado en un problema de adaptaci´on, por lo que ha sido el algoritmo de aprendizaje online escogido para llevar el problema de adaptaci´on online a un escenario IMT. 28 2.3 Conclusiones Puesto que el algoritmo DRR descrito en la secci´on 2.2.1.1 utiliza un sistema de reranking para premiar a hip´otesis con buena calidad y penalizar a las que tengan mala calidad, necesita de una lista de N-best junto con el WSR asociado de cada una de las hip´otesis para poder realizar el reordenamiento. Por tanto, asumiendo una fuerte correlaci´on entre el TER (o cualquier otra m´etrica de calidad) de una hip´otesis y el WSR con el que se medir´ıa la calidad de un grafo de palabras, se describe el uso del algoritmo DRR seg´un se plante´o en un escenario de post-edici´on, cuyos resultados pueden verse en 3.4. Del mismo modo la estrategia Primera aproximaci´on vista en la secci´on 2.2.2 se plantea como una alternativa sencilla al algoritmo DRR definido para un escenario de post-edici´on, en donde esta vez se aborda el problema de adaptaci´on directamente desde una perspectiva de IMT, en donde los resultados pueden verse en la secci´on 3.4.2. Por terminar, la ´ultima de las estrategias intenta abordar el problema de adaptaci´on online combinando lo mejor de las dos anteriores estrategias. De esta forma se combina el rendimiento del algoritmo DRR y el planteamiento directo para IMT de la estrategia Primera aproximaci´on. Para ello en la secci´on 2.2.1.2 se ha creado una nueva definici´on del algoritmo DRR cuyos resultados pueden verse en la secci´on 3.4. Dentro de un escenario IMT la lista de N-best es sustituida por una lista de N-best grafos de palabras y, puesto que reordenar los grafos de palabras como se har´ıa con una lista de N-best es un concepto un tanto confuso se utiliza como representaci´on del grafo de palabras el mejor camino de este, es decir, la traducci´on que dar´ıa el grafo de palabras para la oraci´on de entrada mediante la cual fue generado. A´un con todo esto, estamos asumiendo que la mejor hip´otesis de un grafo de palabras es capaz de representar correctamente la calidad de un grafo de palabras, algo que a priori puede no ser completamente cierto, tal como que podremos ver en la secci´on 3.4. 29 Cap ´ ıtulo 3 Experimentos Este cap´ıtulo del trabajo fin de m´aster detallara los aspectos m´as relevantes de los experimentos realizados. En primer lugar se describir´an los diferentes corpus empleados. En segundo lugar se detallar´a la configuraci´on del sistema empleada para realizar los diferentes experimentos. En tercer lugar se definir´an las principales m´etricas de calidad empleadas a lo largo de los experimentos. En cuarto lugar se mostraran los resultados experimentales. Por ´ultimo se extraer´an las principales conclusiones de los experimentos realizados. 3.1. Corpus En esta secci´on van a definirse los corpus empleados en los experimentos junto con sus principales caracter´ısticas, las cuales podr´an visualizarse en forma de tabla. 3.1.1. Europarl El corpus Europarl [Koehn, 2005] ha sido construido a partir de documentos del Parlamento Europeo e incluye versiones en 11 lenguas europeas: rom´anicas (franc´es, italiano, espa˜nol, portugu´es), germ´anicas (ingl´es, holand´es, alem´an, dan´es, sueco), griego y finland´es. El objetivo de la creaci´on de este corpus fue generar un texto de oraciones alineadas para sistemas de traducci´on autom´atica estad´ıstica. Hoy en d´ıa, Europarl es un corpus de referencia en SMT y ha sido usado en muchos proyectos de traducci´on autom´atica. Por este motivo, el corpus Europarl ha sido utilizado para entrenar nuestro sistema. Las principales caracter´ısticas del corpus Europal pueden verse en el cuadro 3.1. 31 3 Experimentos secci´on en cuatro partes, las tres primeras dedicadas a cada una de las tres estrategias propuestas: adaptaci´on mediante el algoritmo DRR visto en la secci´on 2.2.1.1 y definido para un escenario CAT no interactivo, la estrategia Primera aproximaci´on definida en la secci´on 2.2.2 y la nueva formulaci´on del algoritmo DRR definida en la secci´on 2.2.1.2 para un escenario interactivo. El ´ultimo punto tratar´a la correlaci´on de cada una de las tres m´etricas de calidad m´as utilizadas en este trabajo fin de m´aster: TER, BLEU y WSR. Antes de mostrar los resultados de las distintas estrategias hay que destacar la importancia del par´ametro αen cada una de ellas. El valor de αo ratio de aprendizaje puede verse como el encargado de controlar el tama˜no del paso de actualizaci´on al procesar una muestra. Este tama˜no puede verse como la influencia que tiene la muestra procesada en el valor de los par´ametros a predecir. Peque˜nos valores del ratio de aprendizaje no permiten que valores at´ıpicos, es decir que muestras no representativas, influyan negativamente en el valor de los par´ametros, pero provocan que el proceso de adaptaci´on sea m´as lento. Por contra, valores altos del ratio de aprendizaje permiten que la adaptaci´on se realice a mayor velocidad, pero causa que el algoritmo se vuelva m´as sensible a las muestras no representativas. Puesto que seleccionar correctamente el valor adecuado para el ratio de aprendizaje no es una tarea sencilla, esto debe realizarse de forma emp´ırica. 3.4.1. Minimizando el WSR mediante el algoritmo DRR definido para post-edici´on En esta secci´on se presentan dos grupos de experimentos en funci´on del tama˜no del vector h. En primer lugar se mostraran los resultados realizados con un sistema IMT inicial que no emplea modelo de reordenamiento. Por contra, en segundo lugar se presentaran resultados de la misma estrategia pero esta vez obtenidos mediante un sistema IMT con modelo de reordenamiento. Estos nuevos experimentos se realizaron con el objetivo de obtener mayores mejoras que las reportadas con el sistema inicial y tener una referencia para comparar los resultados de las posteriores estrategias de adaptaci´on. 3.4.1.1. Resultados con el sistema inicial: empleando 8 caracter´ısticas Esta estrategia se basa en la hip´otesis de que existe una gran correlaci´on entre alguna de las m´etricas conocidas, o bien en alguna combinaci´on de estas, y el WSR, concretamente entre TER y WSR. Por ello el objetivo es minimizar el WSR mediante la minimizaci´on por parte del algoritmo DRR descrito en la secci´on 2.2.1.1 de alguna m´etrica de calidad diferente. En un primer momento, para probar el funcionamiento del algoritmo DRR definido para post-edici´on, se cre´o un sistema SMT b´asico entrenado sin el modelo de reordenamiento. De este modo, de una forma r´apida y sencilla era posible analizar los resultados al emplear las diferentes m´etricas como t´ermino de minimizaci´on dentro del funcionamiento del algoritmo DRR tal como se describe en 2.2.1.1. Adem´as as´ı tambi´en era posible ver su variaci´on en funci´on del tama˜no de la lista de N-best. Asumiendo que los resultados de optimizar una m´etrica mediante el algoritmo 38 3.4 Resultados experimentales DRR en este sistema tiene un comportamiento similar en un sistema del estado del arte, te´oricamente permite comprobar la m´etrica que dar´ıa mejores resultados respecto al WSR al intentar optimizarla mediante el algoritmo DRR en un sistema del estado del arte, evitando de esta forma un alto coste computacional y temporal. Del mismo modo, ser´ıa posible averiguar el tama˜no m´as apropiado de la lista de N-best a emplear en el algoritmo DRR. Por este motivo, en la primera columna del cuadro 3.3 se pueden ver distintas m´etricas de calidad, las cuales ser´an las diversas m´etricas que el algoritmo DRR intenta minimizar para consecuentemente optimizar el WSR y hallar el mejor conjunto de pesos para la oraci´on dada. En la segunda columna del cuadro 3.3 pueden verse los distintos tama˜nos de lista de N-best empleados. La elecci´on de estos tama˜nos se basa en los resultados previamente obtenidos al realizar diferentes experimentos con un subconjunto del mismo corpus de prueba de 1.000 oraciones y distintas m´etricas de calidad como medida a minimizar mediante el algoritmo DRR. En los resultados empleando dicho subconjunto, los cuales pueden verse en el ap´endice 4 de este TFM, se puede observa que pasar de un valor de N= 5.000 a N= 10.000 no permiten mejorar el WSR del sistema de referencia, por lo que se fija como cantidad recomendada para realizar los experimentos empleando la totalidad del conjunto de prueba un valor de N= 5.000, evitando de esta forma un alto coste computacional y temporal. A pesar de ello, al realizar los experimentos empleando todo el conjunto de prueba se intento verificar que 5.000 era tambi´en el tama˜no adecuado para mejorar el WSR. Por ello, en el la segunda columna del cuadro 3.3 se pueden ver otros tama˜nos de lista de N-best diferentes a este, en donde se observa que pasar de N= 500 a N= 5.000 s´ı mejora notablemente los resultados y que un valor de N= 10.000 sigue sin mejorar el WSR del sistema de referencia. A continuaci´on, en el cuadro43.3, pueden verse los resultados m´as relevantes del sistema entrenado sin modelo de reordenamiento y empleando la totalidad del conjunto de prueba. Cuadro 3.3: Resultados del sistema SMT inicial para el algoritmo DRR definido bajo un escenario de post-edici´on utilizando diversas m´etricas para las 3.003 oraciones del conjunto de prueba del corpus News Comentary 2011. k indica miles de elementos. N-best indica el tama˜no de la lista de N-best empleada y BP indica la brevity-penalty. M´etrica N´um. N-best TER WSR BLEU BP baseline - 57.36 59.36 25.34 0.9974 TER 10K 56.37 61.27 20.60 0.82 TER 500 58.57 63.10 17.5311 0.7928 TER BP 10K 55.5209 60.1352 23.2713 0.9040 TER BP −BLEU 5K 57.5024 61.4409 21.5282 0.9987 WER BP 5K 57.3418 59.3647 25.3651 0.9980 4Pueden verse m´as resultados en forma de tabla en el ap´endice de este trabajo fin de m´aster 39 3 Experimentos Los anteriores experimentos, realizados empleando el sistema SMT inicial y utilizando la totalidad del conjunto de prueba, originalmente intentaban minimizar el WSR a partir del TER. Como se puede observar en el cuadro 3.3, los resultados dependen del tama˜no de la lista de N-best, pero a´un con un gran valor de Nel WSR sigue sin mejorar los resultados del sistema de referencia. A pesar de ello, puede verse como los valores de TER mejoran notablemente los resultados ofrecidos por el sistema de referencia. Por tanto, asumir una fuerte correlaci´on entre WSR y TER, premisa de esta estrategia de adaptaci´on online, no parece del todo correcto. Debido a ello se probaron m´ultiples combinaciones de m´etricas para intentar identificar una correlaci´on entre alguna de ellas y el WSR mostrando aqu´ı las mas relevantes. A´un as´ı, no se ha encontrado ninguna combinaci´on de m´etricas cuya correlaci´on sea lo suficientemente fuerte como para mejorar el WSR a partir de la optimizaci´on de esta mediante la estrategia de adaptaci´on utilizada. Como se puede observar, empleando el sistema preliminar ninguna de las m´etricas ni combinaci´on de estas ha obtenido mejores resultados que los generados por el sistema de referencia. A pesar de ello, se intento verificar que estos resultados tambi´en eran validos en un sistema del estado del arte, ya que se pod´ıan reportar m´as mejoras utilizando un sistema con modelo de reordenamiento. Adem´as, de esta forma tambi´en se tendr´ıa una referencia solida para comparar los resultados de otras estrategias. 3.4.1.2. Resultados con el sistema final: empleando 14 caracter´ısticas A pesar de que los resultados observados en la secci´on 3.4.1.1 no consiguieran mejorar los resultados del sistema de referencia, se intent´o asegurar que estos resultados no se ver´ıan modificados por un sistema IMT del estado del arte, el cual cuenta con un modelo de reordenamiento y por tanto con un vector de 14 caracter´ısticas como h. Por otra parte tambi´en se pens´o que para poder valorar correctamente las mejoras de posibles futuras estrategias era necesario disponer de resultados de un sistema IMT del estado del arte. Para ello, esta vez, viendo que ninguna de las m´etricas empleadas en la secci´on 3.4.1.1 lograban el objetivo propuesto, se intento optimizar el valor de λ a trav´es de la optimizaci´on de la m´etrica de calidad TER mediante el algoritmo DRR definido en la secci´on 2.2.1.1, intentando consecuentemente acabara minimiz´andose el WSR tal como se hab´ıa propuesto originalmente. Como puede verse en la figura 3.1, el WSR se comporta mejor aumentando el tama˜no de la lista de N-best como ya pasaba con los experimentos vistos en el cuadro 3.3, pero no mejoran el resultados del sistema de referencia, ya que ´unicamente se solapa con ´el cuando el valor de α, el cual representa el ratio de aprendizaje, es muy peque˜no, es decir, cuando la adaptaci´on online esta pr´acticamente desactivada. Respecto al BLEU, los resultados tampoco muestran mejoras sobre el sistema de referencia independientemente del tama˜no de la lista de N-best empleado, aunque s´ı que se puede observar que el BLEU se comporta mejor cuanto m´as grande es el valor de N. El hecho de que el BLEU no mejore respecto al sistema de referencia quiz´as pueda deberse a que BLEU no es la m´etrica que el algoritmo DRR est´a utilizando para medir la calidad de las distintas hip´otesis, sino TER cuyos resultados se pueden ver en la figura 3.2, y por tanto no es la m´etrica que el algoritmo est´a minimizando. Adem´as, puede ser que el 40 3.4 Resultados experimentales 60 62 64 66 68 1e−05 0.0001 0.001 0.01 0.1 WSR Ratio de aprendizaje Adaptación de los pesos del modelo log−lineal referencia 200−best 500−best 1000−best 2000−best 5000−best 10000−best 14 16 18 20 22 24 26 1e−05 0.0001 0.001 0.01 0.1 BLEU Ratio de aprendizaje Adaptación de los pesos del modelo log−lineal referencia 200−best 500−best 1000−best 2000−best 5000−best 10000−best Figura 3.1: Influencia de αen el rendimiento del algoritmo para el conjunto de prueba NC11 en funci´on del tama˜no de la lista de N-best para WSR y BLEU. TER y BLEU no est´en fuertemente correlacionados para este experimento. Por otra parte, en la figura 3.2 pueden verse tres gr´aficas que muestran resultados de TER. Aqu´ı, conviene destacar varios aspectos clave. En esta estrategia de adaptaci´on online la lista de N-best tiene dos posibles funcionalidades. En primer lugar, mediante estas hip´otesis el algoritmo DRR es capaz de optimizar el valor de λ. En segundo lugar, la hip´otesis y∗es posible calcularla de dos formas, seleccionando la mejor hip´otesis de la lista de de N-best o escogiendo el camino m´as probable de un grafo de palabras creado a partir de los λcalculados por el DRR y la oraci´on xa traducir. Por este motivo es posible calcular el TER a partir de dos conjuntos de hip´otesis propuestas como traducci´on, las obtenidas seleccionando la mejor hip´otesis de la lista de N-best para cada una de las oraciones del conjunto de prueba y las obtenidas a partir del mejor caminos de cada uno de los grafos de palabras. Puesto que intentamos adaptar los pesos del modelo log-lineal en un sistema IMT asumiremos que todos los resultados son calculados a partir de las traducciones generadas a partir de los grafos de palabras si expl´ıcitamente no se especifica lo contrario. Por tanto, en al figura 3.2, la gr´afica superior izquierda muestra resultados en funci´on de la calidad de las mejores hip´otesis de la lista de N-best que el algoritmo DRR ha seleccionado al optimizar λpara cada una de las oraciones del conjunto de prueba. Por otra parte, la gr´afica superior derecha muestra los resultados obtenidos al emplear las hip´otesis extra´ıdas a partir de los grafos de palabras, los cuales han sido generados utilizando los λoptimizados por el algoritmo DRR para cada una de las oraciones. Los resultados de TER que pueden verse en ambas gr´aficas de la figura 3.2, como ya ocurr´ıan en la secci´on 3.4.1.1, presentan bastante mejor comportamiento, llegando a mejorar 1.1 puntos el sistema de referencia. Como puede verse, al medir la calidad empleando TER, de nuevo hay una gran influencia por parte del tama˜no de la lista de N-best en el rendimiento del algoritmo DRR, comport´andose nuevamente mejor la m´etrica empleada para medir la calidad, en este caso TER, cuanto mayor es el valor de N. Adem´as pueden verse notables diferencias entre los valores de TER calculados a 41 3 Experimentos 54 54.5 55 55.5 1e−05 0.0001 0.001 0.01 0.1 TER Ratio de aprendizaje Adaptación de los pesos del modelo log−lineal referencia 200−best 500−best 1000−best 2000−best 5000−best 10000−best 54 56 58 60 62 1e−05 0.0001 0.001 0.01 0.1 TER Ratio de aprendizaje Adaptación de los pesos del modelo log−lineal referencia 200−best 500−best 1000−best 2000−best 5000−best 10000−best 0 2 4 6 8 10 1e−05 0.0001 0.001 0.01 0.1 Diferencia de TER Ratio de aprendizaje Adaptación de los pesos del modelo log−lineal referencia 200−best 500−best 1000−best 2000−best 5000−best 10000−best Figura 3.2: Influencia de αen el rendimiento del algoritmo para el conjunto de prueba NC11 en funci´on del tama˜no de la lista de N-best para TER. La gr´afica superior izquierda muestra resultados de calcular el TER sobre las mejores hip´otesis de la lista de N-best, mientras que la gr´afica superior derecha muestra resultados de calcular el TER de las mejores hip´otesis extra´ıdas a partir de los grafos de palabras. La gr´afica inferior muestra la diferencia de TER entre las dos gr´aficas superiores, es decir, entre el TER de la lista de N-best y de los grafos de palabras en funci´on de alfa y del valor de N. partir de la lista de N-best y el calculado a partir de los grafos de palabras. En primer lugar puede verse en la gr´afica superior izquierda que los resultados de TER para todos los valores de αsiempre mejora el obtenido mediante el sistema de referencia, a excepci´on de cuando el valor de αes muy peque˜no y la adaptaci´on online esta pr´acticamente desactivada. Por contra, los resultados de la gr´afica superior derecha muestran que el ratio de aprendizaje si tiene un valor determinante para poder mejorar los resultados del sistema de referencia, ya que a diferencia de la gr´afica superior izquierda, aqu´ı el TER no se comporta bien para valores de αgrandes. Estas diferencias de TER entre los dos sistemas, las cuales pueden verse en la gr´afica inferior de la figura 3.2, se deben principalmente a que mientras que en la gr´afica superior izquierda 42 3.4 Resultados experimentales el TER depende ´unicamente de las traducciones, en la gr´afica superior derecha el TER depender´a de los grafos de palabras y no ´unicamente de la traducci´on extra´ıda de cada uno de estos, es decir, su camino m´as probable. Como puede observarse en la figura 3.2, esto provoca diferencias de TER de hasta 9 puntos cuando el ratio de aprendizaje es grande, siendo este un buen valor para mejorar el TER calculado a partir de la las mejores hip´otesis de la lista de N-best, pero no para mejorarlo mediante las traducciones generadas a partir de los grafos de palabras, lo cual no es en ninguno de los dos casos el objetivo de este trabajo. 60 65 70 75 0 500 1000 1500 2000 2500 3000 WSR Oraciones Evolución del WSR referencia DRR 55 60 65 70 0 500 1000 1500 2000 2500 3000 TER Oraciones Evolución del TER referencia DRR 10 15 20 25 0 500 1000 1500 2000 2500 3000 BLEU Oraciones Evolución del BLEU referencia DRR Figura 3.3: Evoluci´on del WSR, TER y BLEU cuando adaptamos λdentro del conjunto de prueba NC11. Solamente se han dibujado 1 de cada 15 puntos para facilitar la visualizaci´on de las gr´aficas. El valor de αempleado ha sido de 0.001. Los resultados han sido generados empleando un sistema IMT. En las gr´aficas de la figura 3.3 puede verse la evoluci´on de la calidad de un sistema IMT medido en WSR, TER y BLEU durante el procesado de cada una de las oraciones del conjunto de prueba. Estas gr´aficas muestran el valor medio acumulado de cada una de estas m´etricas para el subconjunto de oraciones procesadas hasta el momento. Para estas tres gr´aficas, el valor de αempleado ha sido de 0.001, es decir, el valor con el cual se han obtenido los mejores resultados de WSR. Como puedo observarse, las curvas de 43 3 Experimentos evoluci´on del sistema propuesto y el sistema de referencia tienen un comportamiento muy similar, aunque poseen ciertas diferencias. En cuento a la evoluci´on del WSR, puede verse que en ambos sistemas el comportamiento es muy similar hasta procesar la oraci´on 1.250 en donde las diferencias comienzan a ser visibles. A partir de dicha oraci´on, el sistema IMT ligeramente empeora los resultados. Sin embargo, en la gr´afica de evoluci´on del TER, los resultados de los dos sistemas empiezan a diferenciarse a partir de la oraci´on procesada n´umero 300, y en este caso el sistema IMT paulatinamente va mejorando su comportamiento superando en todo momento al sistema de referencia. En cuanto a la gr´afica de BLEU, se puede apreciar que las diferencias comienzan aproximadamente a partir de la oraci´on 400, en donde el sistema IMT va empeorando ligeramente. -0.3 -0.2 -0.1 0 0.1 0 500 1000 1500 2000 2500 3000 Diferencias de WSR Oraciones Curvas de aprendizaje referencia DRR 0 0.4 0.8 1.2 0 500 1000 1500 2000 2500 3000 Diferencias de TER Oraciones Curvas de aprendizaje referencia DRR -0.75 -0.5 -0.25 0 0 500 1000 1500 2000 2500 3000 Diferencias de BLEU Oraciones Curvas de aprendizaje referencia DRR Figura 3.4: Curvas de aprendizaje cuando adaptamos λdentro del conjunto de prueba NC11. Solamente se han dibujado 1 de cada 15 puntos para facilitar la visualizaci´on de las gr´aficas.El valor de αempleado ha sido de 0.001. Los resultados han sido generados empleando un sistema IMT. La figura 3.4 muestra tres gr´aficas con las curvas de aprendizaje del sistema IMT propuesto, en donde los valores positivos representan mejoras del sistema IMT respecto al sistema de referencia y valores negativos representan perdidas de calidad del 44 3.4 Resultados experimentales sistema IMT respecto al de referencia. Tanto las mejoras como las perdidas logradas hasta una oraci´on determinada representan una media de las mejoras o perdidas hasta dicha oraci´on inclusive. Como puede verse en la gr´afica superior izquierda, el WSR en el sistema IMT obtiene mejoras despreciables en el intervalo de oraciones aproximado [400,1.250]. Posteriormente a este intervalo, el sistema IMT comienza a generar traducciones ligeramente de menor calidad que el sistema de referencia. En la gr´afica que muestra las mejoras de calidad en t´erminos de TER, se puede ver como el comportamiento de este es bueno, por lo que el sistema IMT ha ido aprendiendo al procesar cada una de las oraciones, mejorando casi desde el principio la calidad dada por el sistema de referencia. La gr´afica inferior de la figura 3.4, la cual mide la calidad del sistema en BLEU, presenta una situaci´on casi opuesta a la gr´afica que muestra la curva de aprendizaje evaluada mediante TER, ya que en este caso el sistema no aprende al procesar cada una de las oraciones del conjunto de prueba, sino que ligeramente va empeorando. Como ya se ha comentado, esto posiblemente se debe a que el sistema IMT esta optimizando TER y en este caso, este parece no estar bien correlacionado con el BLEU. Por otra parte, en el cuadro 3.4 pueden verse los resultados m´as significativos en t´erminos de la calidad medida empleando WSR, TER y BLEU. Estos resultados se corresponden con los experimentos realizados empleando el valor de αque mejores resultados dio respecto a la calidad evaluada mediante WSR, el cual fue de 0.001. Cuadro 3.4: Efecto de variar α, medido mediante el WSR, TER y BLEU, en el esfuerzo de un traductor humano para generar una traducci´on de calidad en IMT. Los resultados han sido obtenidos mediante el algoritmo DRR definido bajo un paradigma de post-edici´on. TER NB indica el valor de TER medido a partir de las traducciones extra´ıdas de la lista de N-best, mientras que TER GP indica el valor de TER calculado sobre las traducciones extra´ıdas a partir de los grafos de palabras. αindica el ratio de aprendizaje. El tama˜no de la lista de N-best utilizada en los resultados mostrados es de 10.000. M´etodo de optimizaci´on αWSR TER NB TER GP BLEU baseline - 60.2 55.5 55.5 26 DRR (secci´on 2.2.1.1) 0.001 60.4 54.4 54.4 25.3 En el cuadro 3.5 se muestra dos ejemplos de traducciones propuestas tanto por el sistema IMT como por el de referencia. En ellos se puede ver como, concretamente para estas dos oraciones, el esfuerzo por parte del corrector humano disminuye al emplear la estrategia de adaptaci´on propuesta. De esta forma se puede observar que el n´umero de ediciones necesarias para convertir las traducciones propuestas por el sistema en las traducciones de referencia, es de 7 y 5 para el primer y segundo ejemplo respectivamente. De esta forma las ediciones se ven reducidas en 2 y 4 respectivamente para ambos ejemplos respecto al sistema de referencia. 45 3 Experimentos Cuadro 3.5: Comparaci´on de dos traducciones generadas por el sistema SMT de referencia y el sistema IMT que integra el algoritmo DRR definido para un escenario de post-edici´on. “In.” indica el n´umero de interacciones necesarias para convertir la oraci´on dada por el sistema en la oraci´on de referencia en un sistema IMT, “Oraci´on” es la oraci´on de entrada del sistema x, “Referencia” se corresponde con yτ, “baseline” es la oraci´on ydel sistema de referencia, “DRR” es la oraci´on yobtenida mediante la t´ecnica de adaptaci´on de λvista en 2.2.1.1. Tanto en DRR como en baseline s´olo se muestra la primera hip´otesis de un proceso de IMT. M´etodos Oraciones In. Oraci´on they also plan to co-finance two movies based on “ the hobbit , ” along with warner bros . Referencia tambi´en planean cofinanciar dos pel´ıculas basadas en “ el hobbit ” , junto con warner bros . baseline son tambi´en dos pel´ıculas plan basado en la cofinanciaci´on de la hobbit ”, ”junto con bros warner . 9 DRR tambi´en previsto cofinanciar dos pel´ıculas hobbit basado en “ la ” , junto con bros warner . 7 Oraci´on “ finally , ordinary criminals and corrupt inspectors are at the lowest level . ” Referencia “ finalmente , los criminales comunes y los inspectores corruptos est´an en el nivel m´as bajo ” . baseline por ´ultimo , los delincuentes y “ inspectores corruptos se encuentran en el nivel m´as bajo . ” 9 DRR “ finalmente , los delincuentes y los inspectores corruptos se al m´ınimo nivel . ” 5 46 3.4 Resultados experimentales 3.4.2. Minimizando el WSR mediante la estrategia Primera aproximaci´on 60.2 60.4 60.6 60.8 61 61.2 1e−05 0.0001 0.001 0.01 0.1 WSR Ratio de aprendizaje Adaptación de los pesos del modelo log−lineal referencia WSR 54.8 55 55.2 55.4 55.6 1e−05 0.0001 0.001 0.01 0.1 TER Ratio de aprendizaje Adaptación de los pesos del modelo log−lineal referencia TER 24 24.5 25 25.5 26 1e−05 0.0001 0.001 0.01 0.1 BLEU Ratio de aprendizaje Adaptación de los pesos del modelo log−lineal referencia BLEU Figura 3.5: Influencia de αen el rendimiento del algoritmo para el conjunto de prueba NC11. La cantidad de conjuntos de pesos semi-aleatorios utilizados fue de 501, incluyendo el conjunto de pesos dados por MERT. Una vez analizados los experimentos realizados empleando la estrategia de adaptaci´on basada en el algoritmo DRR descrita en la secci´on 2.2.1.1, se vio que quiz´as el enfoque era err´oneo, ya que si el objetivo era minimizar el WSR, esta era la m´etrica que directamente se deber´ıa intentar minimizar. Para realizar una primera aproximaci´on a esta nueva asunci´on, en la secci´on 2.2.2 se defini´o esta nueva estrategia. Como puede verse a continuaci´on en la figura 3.5 que muestra la influencia del ratio de aprendizaje en esta estrategia, los resultados no fueron los esperados. La gr´afica superior izquierda muestra la calidad del sistema IMT medida en WSR. Aqu´ı se puede ver como a medida que se decrementa el valor de αel WSR mejora su comportamiento, llegando a mejorar, aunque de una forma despreciable, el WSR del sistema de referencia con un α= 0.0001, es decir, cuando la actualizaci´on de los λes sumamente peque˜na en cada actualizaci´on. Por otra parte el valor de TER del sistema IMT s´ı que mejora 47 3 Experimentos obtenido los mejores resultados de WSR. El la gr´afica que representa la evoluci´on del WSR puede verse que hasta la oraci´on 250 aproximadamente, el comportamiento del WSR en el sistema IMT definido y el de referencia es pr´acticamente id´entico. Por el contrario, conforme se procesan m´as oraciones del conjunto de prueba, las diferencias entre los dos sistemas se acent´uan hasta llegar a las 3 d´ecimas al procesar el conjunto de prueba en su totalidad. De forma similar ocurre en la gr´afica de TER, en donde los resultados de ambos sistemas parecen solaparse hasta la oraci´on 250 en donde comienzan a hacerse visibles las diferencias, llegando a empeorar el sistema IMT en 7 d´ecimas aproximadamente respecto al sistema de referencia. En la gr´afica que muestra la evoluci´on del BLEU puede verse como las diferencias entre el comportamiento del BLEU entre los dos sistemas empieza a distinguirse a partir de la oraci´on 250 aproximadamente, y como a partir de este valor, del mismo modo que ocurre en las otras dos gr´aficas, comienza a mejorar su comportamiento. Adem´as, al procesar la totalidad del conjunto de prueba, el BLEU obtenido por el sistema IMT puede verse que mejora en 6 d´ecimas aproximadamente el generado por el sistema de referencia. La figura 3.10 muestra la curva de aprendizaje del sistema IMT y del sistema de referencia, en donde en cada una de las tres gr´aficas se puede ver el rendimiento de cada uno de ellos en funci´on de una m´etrica de calidad distinta, WSR, TER y BLEU. Para estas tres gr´aficas, el valor de αempleado ha sido de nuevo de 0.01 ya que es el valor con el cual se han obtenido los mejores resultados de WSR. En la primera de las gr´aficas se puede ver como con un peque˜no n´umero de oraciones procesadas del conjunto de prueba el sistema IMT mejora respecto al baseline, y que al acabar de procesar todo el conjunto de prueba, la mejora lograda es de aproximadamente 3 d´ecimas. La gr´afica que muestra la curva de aprendizaje de TER presenta como a partir de la oraci´on procesada n´umero 1.000 la diferencia entre los dos sistemas empieza a acortarse. La curva de aprendizaje de la gr´afica que muestra el BLEU, a pesar de las irregularidades que muestra, parece indicar que el sistema IMT mejora notablemente en funci´on del n´umero de oraciones procesadas, alcanzando aproximadamente las 6 d´ecimas de mejora una vez procesado todo el corpus. Por ´ultimo, en el cuadro 3.8 pueden verse los resultados m´as significativos en t´erminos de la calidad medida empleando WSR, TER y BLEU. Los resultados de este cuadro han sido obtenidos empleando el valor de αque mejores resultados dio en t´erminos de calidad medida mediante WSR, que en este caso fue 0.01. El cuadro 3.9 muestra dos ejemplos de los resultados obtenidos empleando la estrategia de adaptaci´on que implementa el algoritmo DRR definido en la secci´on 2.2.1.2. Aqu´ı se puede apreciar como el sistema IMT ofrece notables mejoras en dos oraciones de prueba, minimizando de esta forma el esfuerzo de un humano para corregir la traducci´on que originalmente proporciona el sistema de forma notable. 54 3.4 Resultados experimentales -0.4 -0.2 0 0.2 0.4 0 500 1000 1500 2000 2500 3000 Diferencia de WSR Oraciones Curvas de aprendizaje referencia DRR -1.6 -1.2 -0.8 -0.4 0 0 500 1000 1500 2000 2500 3000 Diferencia de TER Oraciones Curvas de aprendizaje referencia DRR -0.2 0 0.2 0.4 0.6 0 500 1000 1500 2000 2500 3000 Diferencia de BLEU Oraciones Curvas de aprendizaje referencia DRR Figura 3.10: Curvas de aprendizaje cuando adaptamos λdentro del conjunto de prueba NC11. Solamente se han dibujado 1 de cada 15 puntos para facilitar la visualizaci´on de las gr´aficas. La cantidad de conjuntos de pesos semialeatorios utilizados fue de 501, incluyendo el conjunto de pesos dado por MERT. Cuadro 3.8: Efecto de variar α, medido mediante el WSR, TER y BLEU, en el esfuerzo de un traductor humano para generar una traducci´on de calidad en IMT. Los resultados han sido obtenidos mediante el algoritmo DRR definido bajo un paradigma de IMT. αindica el ratio de aprendizaje. La cantidad de conjuntos de pesos semi-aleatorios utilizados fue de 501, incluyendo el conjunto de pesos dado por MERT. M´etodo de optimizaci´on αWSR TER BLEU baseline - 60.2 55.5 26.0 DRR (secci´on 2.2.1.2) 0.01 59.9 56.2 26.6 55 3 Experimentos Cuadro 3.9: Comparaci´on de dos traducciones generadas por el sistema SMT baseline y el sistema IMT que integra el algoritmo DRR definido para un escenario IMT. “In.” indica el n´umero de interacciones necesarias para convertir la oraci´on dada por el sistema en la oraci´on de referencia en un sistema IMT, “Oraci´on” es la oraci´on de entrada del sistema x, “Referencia” se corresponde con yτ, “baseline” es la oraci´on ydel sistema baseline, “DRR” es la oraci´on yobtenida mediante la t´ecnica de adaptaci´on de λvista en 2.2.1.2. M´etodos Oraciones In. Oraci´on they also plan to co-finance two movies based on “ the hobbit , ” along with warner bros . Referencia tambi´en planean cofinanciar dos pel´ıculas basadas en “ el hobbit ” , junto con warner bros . baseline son tambi´en dos pel´ıculas plan basado en la cofinanciaci´on de la hobbit ”, ”junto con bros warner . 9 DRR tambi´en se plan para cofinanciar dos pel´ıculas basado en “ la hobbit ” , junto con bros warner . 5 Oraci´on “ finally , ordinary criminals and corrupt inspectors are at the lowest level . ” Referencia “ finalmente , los criminales comunes y los inspectores corruptos est´an en el nivel m´as bajo ” . baseline por ´ultimo , los delincuentes y “ inspectores corruptos se encuentran en el nivel m´as bajo . ” 9 DRR “ , por ´ultimo , los delincuentes y los inspectores corruptos se encuentran en el nivel m´as bajo ” . 5 56 3.4 Resultados experimentales 3.4.4. Correlaci´on WSR, TER y BLEU Una de las estrategias de adaptaci´on seguidas en este trabajo final de m´aster se basa en la adaptaci´on de los pesos del modelo log-lineal mediante el algoritmo de aprendizaje online DRR definido para un escenario de post-edici´on en la secci´on 2.2.1.1. Esta estrategia se basa en la correlaci´on entre las diferentes m´etricas m´as usadas o combinaciones de estas y el WSR para intentar minimizar este ´ultimo. Como se ha podido observar en la secci´on 3.4.1, no siempre hay una fuerte correlaci´on entre las diferentes medidas de calidad, por lo que optimizar una de ellas no implica siempre la optimizaci´on de cualquier otra. Este fen´omeno ha sido estudiado en m´ultiples ocasiones por la comunidad cient´ıfica de traducci´on autom´atica, existiendo varios documentos sobre la correlaci´on de diversas m´etricas de calidad y el criterio de un humano [Denkowski and Lavie, 2010, Paula Estrella et al., 2004]. En este apartado vamos a analizar la correlaci´on entre las m´etricas de calidad WSR, TER y BLEU dentro de un entorno no adaptativo, es decir, empleando el mismo λ para traducir todo el conjunto de prueba NC11 ingl´es→espa˜nol. Para obtener estos valores se han utilizado las traducciones extra´ıdas a partir de los grafos de palabras generados al realizar las experimentaciones definidas en las secciones 2.2.1.2 y 2.2.2. Estos grafos de palabras han sido creados a partir de 501 λdistintos, los cuales fueron generados de forma semi-aleatoria como ya se vio en la secci´on 2.2.1.2. Para medir la correlaci´on entre las distintas m´etricas usaremos el coeficiente de correlaci´on de Pearson, el cual se define de la siguiente forma: ρC1,C2=cov(C1, C2) σC1σC2 ,(3.1) en donde C1yC2representan las dos m´etricas de calidad de las cuales se desea calcular el coeficiente de correlaci´on. Cuadro 3.10: Coeficiente de correlaci´on de Pearson para las medidas de calidad WSR, TER y BLEU obtenidos al traducir el conjunto de prueba NC11 utilizando 501 conjuntos de pesos semi-aleatorios λ, incluyendo el conjunto de pesos dados por MERT. Se utilizan las iniciales Wpara indicar WSR, Tpara TER y Bpara BLEU. ρW,T ρW,B ρT,B 0.8719285 -0.9424423 -0.8183807 Los resultados que pueden verse en el cuadro 3.10 indican una gran correlaci´on entre WSR, TER y BLEU. Esta correlaci´on significar´ıa que mediante la optimizaci´on de cualquiera de las tres m´etricas ser´ıa posible optimizar cualquiera de las otras, pero como hemos visto en la secci´on 3.4.1 esto no es del todo cierto en experimentaciones reales en donde se lleva a cabo adaptaci´on online. 57 3 Experimentos Esta fuerte correlaci´on puede deberse en parte a la forma en la que los λhan sido extra´ıdos, ya que estos no son conjuntos de pesos generados de forma aleatoria, sino que han sido extra´ıdos mediante un criterio de selecci´on semi-aleatorio acotando el espacio de b´usqueda de estos y seleccionando conjuntos de pesos de cierta calidad. Otra de las posibles causas de esta alta correlaci´on puede deberse a la escasa cantidad de valores empleados en el calculo del coeficiente de Pearson, ya que 501 conjuntos de pesos es una muestra poco significativa. Como se aprecia en las gr´aficas de la figura 3.11 que muestran la correlaci´on de TER-BLEU y WSR-TER, en estas aparece una nube de puntos fuera de la linea de mayor densidad para valores altos de WSR ,TER y bajos de BLEU que podr´ıa aumentar al incrementar el n´umero de λy por tanto hacer disminuir el valor del coeficiente de Pearson. 50 60 70 80 90 100 110 60 65 70 75 80 85 TER WSR Correlación de WSR y TER 0 5 10 15 20 25 30 60 65 70 75 80 85 BLEU WSR Correlación de WSR y BLEU 0 5 10 15 20 25 30 50 60 70 80 90 100 110 BLEU TER Correlación de TER y BLEU Figura 3.11: Correlaci´on de los valores de WSR, TER y BLEU obtenidos al traducir el conjunto de prueba NC11 utilizando 501 conjuntos de pesos semialeatorios λ, incluyendo el conjunto de pesos dado por MERT. 58 3.5 Conclusiones 3.5. Conclusiones En este cap´ıtulo se han podido ver los resultados de las tres estrategias de adaptaci´on online planteadas, as´ı como los valores de correlaci´on para las m´etricas de calidad WSR, TER y BLEU en un entorno no adaptativo. La primera de las estrategias emplea el algoritmo DRR definido para un escenario de post-edici´on para intentar minimizar la m´etrica de calidad TER e indirectamente optimizar el WSR. Para ello se asume que el WSR est´a fuertemente correlacionado con el TER. Para validar tal asunci´on se emple´o un sistema b´asico de IMT entrenado sin modelo de reordenamiento. Puesto que esta aproximaci´on ´unicamente logr´o minimizar el TER no se obtuvo los resultados esperados. Por lo tanto se intentaron optimizar otras m´etricas de calidad mediante el algoritmo DRR, de forma que la correlaci´on de estas con el WSR fuera mayor y por tanto se obtuvieran mejores resultados de WSR. A pesar de no conseguir lograr el objetivo, se pudo comprobar el funcionamiento de la estrategia de una forma sencilla y analizar los resultados en funci´on del valor de los par´ametros utilizados, como es el caso del tama˜no de la lista de N-best. Gracias a ello se pudo comprobar mediante esta serie de experimentos iniciales, los cuales emplean un vector de caracter´ısticas de 8 componentes, que el tama˜no m´as apropiado para la lista de N-best era de 5.000 hip´otesis por oraci´on, ya que m´as all´a de este valor los resultados mejoraban s´olo ligeramente a costa de un mayor coste computacional y temporal. Para intentar mejorar los resultados mediante esta estrategia de adaptaci´on, se entreno un sistema esta vez con modelo de reordenamiento. Para estos experimentos se emple´o como m´etrica a optimizar por el algoritmo DRR el TER como originalmente se hab´ıa intentado, ya que con ninguna de las anteriores se hab´ıa logrado mejorar el WSR. De nuevo, a pesar de no lograrse mejorar el WSR con ´exito, se consigui´o mejorar el TER. Adem´as, se realiz´o el mismo experimento pero esta vez para calcular el TER a partir de las mejores hip´otesis que el algoritmo DRR ha dado a partir de la lista de N-best y no a partir de las mejores hip´otesis extra´ıdas de los grafos de palabras como se realiza en el resto de experimentos. A pesar de que se logr´o como mejor resultado el mismo valor en ambos sistemas, el valor de TER al calcularlo sobre las mejores hip´otesis de la lista de N-best siempre mejoraba al del sistema de referencia independientemente del valor del par´ametro α, mientras que al calcularlo a partir de los grafos de palabras, las mejoras en TER dependen completamente del valor de α. Esto se debe a que el TER en un grafo de palabras no depende exclusivamente del mejor camino de cada uno de los grafos, es decir, de las mejores hip´otesis sino que depende de todo el grafo de palabras. Por contra, el calculo del TER sobre las hip´otesis de la lista de N-best depende ´unicamente de dichas hip´otesis. Vistos los resultados de la estrategia anterior se plante´o esta vez la posibilidad de minimizar de forma directa el WSR en lugar de hacerlo indirectamente a partir de la minimizaci´on de otra m´etrica como se hab´ıa realizado anteriormente. Para ello se defini´o la estrategia a la que denominamos Primera aproximaci´on, de modo que se pudiera realizar un primer acercamiento a este cambio de paradigma. Esta estrategia ´unicamente mejor´o de forma despreciable el WSR dado por el sistema de referencia para un valor de αmuy peque˜no, en donde la adaptaci´on online estaba pr´acticamente desac59 3 Experimentos tivada. Esto puede deberse principalmente a la simplicidad del paso de actualizaci´on de los par´ametros del modelo log-lineal que plantea esta estrategia. Por ello, se intent´o combinar lo mejor de las dos estrategias anteriores, es decir, abordar el problema de minimizar el WSR mediante una minimizaci´on directa de este y emplear un algoritmo de optimizaci´on de λm´as potente que el definido en la estrategia Primera aproximaci´on, esperando mejorar de esta forma los resultados. Por lo tanto se defini´o una nueva estrategia de adaptaci´on online, la cual se basa en una reformulaci´on del algoritmo DRR, esta vez definido para IMT. Mediante esta estrategia se consigui´o mejorar aproximadamente 3 d´ecimas el WSR del sistema de referencia. Estos resultados pueden considerarse muy alentadores, ya que a pesar de no ser una mejora muy notable s´ı abre un nuevo frente de investigaci´on en el campo de la IMT. Por otra parte, se muestra los valores de correlaci´on de WSR y TER, WSR y BLEU, y por ´ultimo TER y BLEU para un sistema IMT en el que no se emplea adaptaci´on online. Aqu´ı, se puede ver que estos resultados muestran una correlaci´on alta entre dichas m´etrica. A pesar de ello, hay que tener en cuenta, que estos resultados han sido obtenidos empleando 501 λseleccionados de forma semi-aleatoria en un espacio de b´usqueda restringido. Por ello, es posible que aunque estos experimentos muestren una fuerte correlaci´on entre las m´etricas de calidad, los resultados en donde se emplea adaptaci´on online, y el espacio de b´usqueda no esta restringido demuestren que en determinados problemas reales de adaptaci´on online esta fuerte correlaci´on no tiene por qu´e existir. 60 Cap ´ ıtulo 4 Conclusiones y trabajo futuro En este trabajo fin de m´aster se ha analizado la aplicabilidad de los algoritmos Driscriminative Ridge Regression (DRR) vistos en la secci´on 2.2.1 y la estrategia de adaptaci´on a la cual hemos denominado Primera aproximaci´on dentro de un entorno IMT simulado para actualizar los pesos del modelo log-lineal de un sistema de traducci´on autom´atica estad´ıstica dentro del estado del arte. Este sistema SMT es el encargado de generar las distintas traducciones que propondr´a el sistema IMT una vez este haya adaptado los pesos del modelo log-lineal. En los experimentos reportados se utiliz´o la versi´on ya conocida del algoritmo DRR definido para un escenario de post-edici´on que tan buenos resultados dio en ´el. A pesar de esto, esta definici´on falla dentro de un escenario IMT no ofreciendo resultados esperados a´un con los m´ultiples intentos por encontrar una m´etrica de calidad que albergara una fuerte correlaci´on con la empleada en IMT, el WSR. Debido a esto, se plantea una nueva definici´on del algoritmo DRR para un escenario IMT, en donde esta vez el m´etodo de reranking no reordena las diferentes hip´otesis para una oraci´on de entrada x, sino que intentar´a reordenar los distintos grafos de palabras pertenecientes a una misma oraci´on. Esta reordenaci´on se realiza empleando como representaci´on de la calidad de cada uno de los grafos de palabras su mejor camino, ya que para la estrategia definida los grafos de palabras son la base del sistema IMT. Bajo esta novedosa definici´on, el algoritmo DRR ofrece resultados muy alentadores, a pesar de no llegar a mostrar mejoras tan notables como las vistas en un escenario de postedici´on en [Mart´ınez-G´omez et al., 2012] bajo su definici´on original, s´ı abre el camino a futuras investigaciones bajo esta linea. Por otra parte, los resultados experimentales realizados mediante la estrategia Primera aproximaci´on no son tan favorables como los de la estrategia anterior, ya que quiz´as se trate de un algoritmo demasiado sencillo para abordar un problema tan complejo como adaptar los pesos del modelo log-lineal en un escenario IMT. Como trabajo futuro, nos gustar´ıa estudiar el uso de la nueva definici´on del algoritmo DRR empleando un Λm´as grande, es decir, con mayor n´umero de conjuntos de pesos, y que a su vez estos fueran extra´ıdos de forma semi-aleatoria a partir de 61 4 Conclusiones y trabajo futuro t´ecnicas de muestreo mas complejas. Una posibilidad de inter´es ser´ıa generar Λmediante Markov chain Monte Carlo [Bishop, 2007] o a trav´es del algoritmo Downhill simplex [Nelder and Mead, 1965]. Adem´as bajo un mayor n´umero de conjuntos de pesos creados mediante alguna de estas t´ecnicas es posible obtener grafos de palabras de mayor calidad que los obtenidos hasta el momento, lo que podr´ıa provocar que los resultados de el algoritmo DRR mejoraran notablemente debido a encontrar conjuntos de pesos que se ajustasen mejor a un conjunto de test espec´ıfico. Para concluir, cabe destacar que este trabajo fin de m´aster ha dado lugar a una publicaci´on en una conferencia internacional [L´opez-Salcedo et al., 2012]. 62 Ap´endice En este ap´endice puede verse el cuadro 4.1 con los resultados obtenido al emplear la estrategia de adaptaci´on online descrita en la secci´on 2.2.1.1 mediante un sistema IMT preliminar entrenado sin modelo de reordenamiento. En ´el se pueden ver las distintas m´etricas empleadas para intentar minimizar el WSR de forma indirecta asumiendo una gran correlaci´on de este con ellas. Cuadro 4.1: Resultados del sistema SMT inicial para algoritmo DRR definido bajo un escenario de post-edici´on utilizando diversas m´etricas para 1.000 frases del conjunto de test del corpus News Comentary 2011. k indica miles de elementos. N-best indica el tama˜no de la lista de N-best empleada y BP indica la brevity-penalty. M´etrica N´um. N-best TER WSR BLEU BP referencia - 68.7828 73.1460 15.0902 0.9928 TER 5k 66.1873 74.1791 12.8300 0.8282 TER BP 5k 67.7835 73.4043 14.6796 0.9643 TER BP 10k 67.4408 73.3824 14.7419 0.9580 TER BP −BLEU 5k 69.0546 73.4130 14.8098 0.9897 TER-BLEU 5k 66.3790 74.4243 12.5417 0.8253 WER-BLEU 5k 66.9693 74.9059 11.5550 0.7893 WER BP −BLEU 5k 68.4936 73.3692 14.6957 0.9816 WER+TER BP −BLEU 5k 70.3730 73.5225 14.5545 1 WER 5k 66.5805 74.5950 12.0398 0.7998 WER BP 5k 68.5455 73.2817 14.8703 0.9835 WER + TER BP 5k 66.0746 73.7063 13.8931 0.8850 WER + TER BP −BLEU 5k 66.3707 73.8377 13.5659 0.8824 WER+TER BP 5k 69.9087 73.3892 14.9372 0.9976 63 ´ Indice de cuadros 3.4. Efecto de variar α, medido mediante el WSR, TER y BLEU, en el esfuerzo de un traductor humano para generar una traducci´on de calidad en IMT. Los resultados han sido obtenidos mediante el algoritmo DRR definido bajo un paradigma de post-edici´on. TER NB indica el valor de TER medido a partir de las traducciones extra´ıdas de la lista de N-best, mientras que TER GP indica el valor de TER calculado sobre las traducciones extra´ıdas a partir de los grafos de palabras. αindica el ratio de aprendizaje. El tama˜no de la lista de N-best utilizada en los resultados mostrados es de 10.000. . . . . . . . . . . . . . . . . . . . . . 45 3.5. Comparaci´on de dos traducciones generadas por el sistema SMT de referencia y el sistema IMT que integra el algoritmo DRR definido para un escenario de post-edici´on. “In.” indica el n´umero de interacciones necesarias para convertir la oraci´on dada por el sistema en la oraci´on de referencia en un sistema IMT, “Oraci´on” es la oraci´on de entrada del sistema x, “Referencia” se corresponde con yτ, “baseline” es la oraci´on ydel sistema de referencia, “DRR” es la oraci´on yobtenida mediante la t´ecnica de adaptaci´on de λvista en 2.2.1.1. Tanto en DRR como en baseline s´olo se muestra la primera hip´otesis de un proceso de IMT. . . 46 3.6. Efecto de variar α, medido mediante el WSR, TER y BLEU, en el esfuerzo de un traductor humano para generar una traducci´on de calidad en IMT. Los resultados han sido obtenidos mediante la estrategia Primera aproximaci´on.αindica el ratio de aprendizaje y PA las siglas de Primera aproximaci´on. La cantidad de conjuntos de pesos semi-aleatorios utilizados fue de 501, incluyendo el conjunto de pesos dado por MERT. Tanto en PA como en baseline s´olo se muestra la primera hip´otesis de unprocesodeIMT. ............................. 49 3.7. Comparaci´on de dos traducciones generadas por el sistema SMT de referencia y el sistema IMT creado siguiendo la estrategia Primera aproximaci´on. “In.” indica el n´umero de interacciones necesarias para convertir la oraci´on dada por el sistema en la oraci´on de referencia en un sistema IMT, “Oraci´on” es la oraci´on de entrada del sistema x, “Referencia” se corresponde con yτ, “baseline” es la oraci´on ydel sistema de referencia, “PA” es la oraci´on yobtenida mediante la t´ecnica de adaptaci´on de λvista en la secci´on 2.2.2. . . . . . . . . . . . . . . . . . 51 3.8. Efecto de variar α, medido mediante el WSR, TER y BLEU, en el esfuerzo de un traductor humano para generar una traducci´on de calidad en IMT. Los resultados han sido obtenidos mediante el algoritmo DRR definido bajo un paradigma de IMT. αindica el ratio de aprendizaje. La cantidad de conjuntos de pesos semi-aleatorios utilizados fue de 501, incluyendo el conjunto de pesos dado por MERT. . . . . . . . . . . . . . 55 70 ´ Indice de cuadros 3.9. Comparaci´on de dos traducciones generadas por el sistema SMT baseline y el sistema IMT que integra el algoritmo DRR definido para un escenario IMT. “In.” indica el n´umero de interacciones necesarias para convertir la oraci´on dada por el sistema en la oraci´on de referencia en un sistema IMT, “Oraci´on” es la oraci´on de entrada del sistema x, “Referencia” se corresponde con yτ, “baseline” es la oraci´on ydel sistema baseline, “DRR” es la oraci´on yobtenida mediante la t´ecnica de adaptaci´on de λvistaen2.2.1.2. ...................... 56 3.10. Coeficiente de correlaci´on de Pearson para las medidas de calidad WSR, TER y BLEU obtenidos al traducir el conjunto de prueba NC11 utilizando 501 conjuntos de pesos semi-aleatorios λ, incluyendo el conjunto de pesos dados por MERT. Se utilizan las iniciales Wpara indicar WSR, Tpara TER y BparaBLEU......................... 57 4.1. Resultados del sistema SMT inicial para algoritmo DRR definido bajo un escenario de post-edici´on utilizando diversas m´etricas para 1.000 frases del conjunto de test del corpus News Comentary 2011. k indica miles de elementos. N-best indica el tama˜no de la lista de N-best empleada y BP indica la brevity-penalty. . . . . . . . . . . . . . . . . . . . . . . . 63 71 Bibliograf´ıa [Arnold., 2003] Arnold., D. (2003). Computers and translation: A translator’s guide. pages 119–142. [Barrachina et al., 2009] Barrachina, S., Bender, O., Casacuberta, F., Civera, J., Cubel, E., Khadivi, S., Lagarda, A., Ney, H., Tom´as, J., Vidal, E., and Vilar, J.-M. (2009). Statistical approaches to computer-assisted translation. Computational Linguistics, 35(1):3–28. [Berger et al., 1996] Berger, A., Brown, P. F., Pietra, S. A., Pietra, V. J., Kehler, A. S., and Mercer, R. L. (1996). Language translation apparatus and method of using Context-Based translation models. United States Patent, Patent Number 5,510,981. [Bertoldi and Federico, 2009] Bertoldi, N. and Federico, M. (2009). Domain adaptation for statistical machine translation with monolingual resources. In Proceedings of the 4th EACL Workshop on Statistical Machine Translation. [Bishop, 2007] Bishop, C. M. (2007). Pattern Recognition and Machine Learning (Information Science and Statistics). Springer, 1 edition. [Brown et al., 1993] Brown, P. F., Pietra, V. J. D., Pietra, S. A. D., and Mercer, R. L. (1993). The mathematics of statistical machine translation: parameter estimation. Computational Linguistics, 19(2):263–311. [Callison-Burch et al., 2004] Callison-Burch, C., Bannard, C., and Schroeder, J. (2004). Improved statistical translation through editing. In European Association for Machine Translation. [Callison-Burch et al., 2007] Callison-Burch, C., Fordyce, C., Koehn, P., Monz, C., and Schroeder, J. (2007). (meta-) evaluation of machine translation. In Proceedings of the Second Workshop on Statistical Machine Translation, pages 136–158, Prague, Czech Republic. Association for Computational Linguistics. 73 Bibliograf´ıa [Callison-Burch et al., 2011] Callison-Burch, C., Koehn, P., Monz, C., and Zaidan, O. F., editors (2011). Proceedings of the Sixth Workshop on Statistical Machine Translation. Association for Computational Linguistics, Edinburgh, Scotland. [Casacuberta et al., 2009] Casacuberta, F., Civera, J., Cubel, E., Lagarda, A. L., Lapalme, G., Macklovitch, E., and Vidal, E. (2009). Human interaction for high-quality machine translation. Commun. ACM, 52(10):135–138. [Casacuberta and Vidal, 2007] Casacuberta, F. and Vidal, E. (2007). Learning finitestate models for machine translation. Machine Learning, 66:69–91. 10.1007/s10994006-9612-9. [Chomsky, 1956] Chomsky, N. (1956). Three models for the description of language. IRI Transactions on Information Theory, 2(3):113–124. [Civera and Juan, 2007] Civera, J. and Juan, A. (2007). Domain adaptation in statistical machine translation with mixture modelling. In Proceedings of the Second Workshop on Statistical Machine Translation, StatMT ’07, pages 177–180, Stroudsburg, PA, USA. Association for Computational Linguistics. [Clarkson and Robinson, 1997] Clarkson, P. and Robinson, A. J. (1997). Language model adaptation using mixtures and an exponentially decaying cache. In Proceedings of ICASSP-97, pages 799–802. [Crammer et al., 2006] Crammer, K., Dekel, O., Keshet, J., Shalev-Shwartz, S., and Singer, Y. (2006). Online passive-aggressive algorithms. Journal of Machine Learning Research, 7:551–585. [Denkowski and Lavie, 2010] Denkowski, M. and Lavie, A. (2010). Choosing the right evaluation for machine translation: an examination of annotator and automatic metric performance on human judgment tasks. In Proccedings in the 9th Conference of the Association for Machine Translation in the Americas. [Espa˜na-Bonet and Marquez, 2010] Espa˜na-Bonet, C. and Marquez, L. (2010). Robust estimation of feature weights in statistical machine translation. In 14th Annual Conference of the European Association for Machine Translation. EAMT. [Fordyce, 2007] Fordyce, C. S. (2007). Overview of the IWSLT 2007 Evaluation Campaign, volume 11, pages 1–12. [Foster, 2002] Foster, G. (2002). Prediction for Translators. PhD thesis, Universit´e de Montr´eal. [Foster et al., 2002] Foster, G., Langlais, P., and Lapalme, G. (2002). User-friendly text prediction for translators. In Proceedings of the ACL-02 conference on Empirical methods in natural language processing - Volume 10, EMNLP ’02, pages 148–155, Stroudsburg, PA, USA. Association for Computational Linguistics. 74 Bibliograf´ıa [Gabriel Reverberi, ] Gabriel Reverberi, Sandor Szedmak, N. C.-B. Deliverable of package 4: Online learning algorithms for computer-assisted translation. [Gasc´o et al., 2012] Gasc´o, G., Rocha, M.-A., Sanchis-Trilles, G., Andr´es-Ferrer, J., and Casacuberta, F. (2012). Does more data always yield better translations? In Proceedings of the 13th Conference of the European Chapter of the Association for Computational Linguistics, pages 152–161, Avignon, France. Association for Computational Linguistics. [Hutchins, 1999] Hutchins, J. (1999). Retrospect and prospect in computer-based translation. In Proceedings of MT Summit VII MT in the great translation era, pages 30–44. [K. Papineni and Zhu, 2002] K. Papineni, S. Roukos, T. W. and Zhu, W. (2002). Bleu: A method for automaticevaluation of machine translation. In Association for Computational Linguistics. [Kay, 1997] Kay, M. (1997). It’s still the proper place. Machine Translation, 12(1/2):35–38. [Kneser and Ney, 1995] Kneser, R. and Ney, H. (1995). Improved backing-off for mgram language modeling. In IEEE Int. Conf. on Acoustics, Speech and Signal Processing, pages 181–184. [Koehn, 2004] Koehn, P. (2004). Statistical significance tests for machine translation evaluation. In Proceedings of EMNLP’04, pages 388–395. [Koehn, 2005] Koehn, P. (2005). Europarl: A parallel corpus for statistical machine translation. In Proceedings of the 10th Machine Translation Summit, 2005, pages 79–86. [Koehn et al., 2005] Koehn, P., Axelrod, A., Mayne, A. B., Callison-Burch, C., Osborne, M., and Talbot, D. (2005). Edinburgh System Description for the 2005 IWSLT Speech Translation Evaluation. In Proceedings of the international workshop on Spoken Language Translation, 2005. [Koehn and Monz, 2006] Koehn, P. and Monz, C. (2006). Manual and automatic evaluation of machine translation between european languages. In Proceedings of the Workshop on Statistical Machine Translation, StatMT ’06, pages 102–121, Stroudsburg, PA, USA. Association for Computational Linguistics. [Koehn et al., 2003] Koehn, P., Och, F. J., and Marcu, D. (2003). Statistical phrasebased translation. In Proceedings of the 2003 Conference of the North American Chapter of the Association for Computational Linguistics on Human Language Technology - Volume 1, NAACL ’03, pages 48–54, Stroudsburg, PA, USA. Association for Computational Linguistics. 75 Bibliograf´ıa [Koehn and Schroeder, 2007] Koehn, P. and Schroeder, J. (2007). Experiments in domain adaptation for statistical machine translation. In Proceedings of the Second Workshop on Statistical Machine Translation, StatMT ’07, pages 224–227, Stroudsburg, PA, USA. Association for Computational Linguistics. [Koehn et al., 2007] Koehn et al., P. (2007). Moses: Open source toolkit for statistical machine translation. In Proceedings of the ACL Demo and Poster Sessions, 2007, pages 177–180. [Kuhn and De Mori, 1990] Kuhn, R. and De Mori, R. (1990). A cache-based natural language model for speech recognition. IEEE Trans. Pattern Anal. Mach. Intell., 12(6):570–583. [Langlais et al., 2004] Langlais, P., Lapalme, G., and Loranger, M. (2004). Transtype: Development-evaluation cycles to boost translator’s productivity. Machine Translation (Special Issue on Embedded Machine Translation Systems, 17(17):77–98. [Lewis, 2009] Lewis, M. P., editor (2009). Ethnologue: Languages of the World. [L´opez-Salcedo et al., 2012] L´opez-Salcedo, F. J., Sanchis-Trilles, G., and Casacuberta, F. (2012). Online learning of log-linear weights in interactive machine translation. In Proceeding of iberSPEECH, 2012. [Marcu and Wong, 2002] Marcu, D. and Wong, W. (2002). A phrase-based, joint probability model for statistical machine translation. In Proceedings of EMNLP, pages 133–139. [Mart´ınez-G´omez et al., 2012] Mart´ınez-G´omez, P., Sanchis-Trilles, G., and Casacuberta, F. (2012). Online adaptation strategies for statistical machine translation in post-editing scenarios. Pattern Recognition, page In press. [Mart´ınez-Gomez, 2010] Mart´ınez-Gomez, P. (2010). Online learning via dynamic reranking for computer assisted translation. Master’s thesis, Universidad Polit´ecnica de Valencia, Valencia, Spain. [Moore and Lewis, 2010] Moore, R. C. and Lewis, W. (2010). Intelligent selection of language model training data. In Proceedings of the ACL 2010 Conference Short Papers, ACLShort ’10, pages 220–224, Stroudsburg, PA, USA. Association for Computational Linguistics. [Nagao, 1984] Nagao, M. (1984). A framework of a mechanical translation between japanese and english by analogy principle. In Proceedings of the international NATO symposium on Artificial and human intelligence, pages 173–180, New York, NY, USA. Elsevier North-Holland, Inc. [Nelder and Mead, 1965] Nelder, J. A. and Mead, R. (1965). A simplex method for function minimization. Computer Journal, 7:308–313. 76 Bibliograf´ıa [Nepveu et al., 2004] Nepveu, L., Lapalme, G., Qu´ebec, M., and Foster, G. (2004). Adaptive language and translation models for interactive machine translation. In Proceedings of the Conference on Empirical Methods in Natural Language Processing. [Och, 2003] Och, F. J. (2003). Minimum error rate training in statistical machine translation. In Proceedings of the 41st Annual Meeting on Association for Computational Linguistics - Volume 1, ACL ’03, pages 160–167, Stroudsburg, PA, USA. Association for Computational Linguistics. [Och and Ney, 2002] Och, F. J. and Ney, H. (2002). Discriminative training and maximum entropy models for statistical machine translation. In Proceedings of the 40th Annual Meeting on Association for Computational Linguistics, ACL ’02, pages 295–302, Stroudsburg, PA, USA. Association for Computational Linguistics. [Och and Ney, 2004] Och, F. J. and Ney, H. (2004). The alignment template approach to statistical machine translation. Computational Linguistics, 30(4):417–449. [Och et al., 1999] Och, F. J., Tillmann, C., Ney, H., and Informatik, L. F. (1999). Improved alignment models for statistical machine translation. In University of Maryland, College Park, MD, pages 20–28. [Och et al., 2003] Och, F. J., Zens, R., and Ney, H. (2003). Efficient search for interactive statistical machine translation. In In EACL ’03: Proceedings of the tenth conference on European chapter of the Association for Computational Linguistics, pages 387–393. [Ortiz et al., 2003] Ortiz, D., Varea, I., and Casacuberta, F. (2003). An empirical comparison of stack-based decoding algorithms for statistical machine translation. In Perales, F., Campilho, A., de la Blanca, N., and Sanfeliu, A., editors, Pattern Recognition and Image Analysis, volume 2652 of Lecture Notes in Computer Science, pages 654–663. Springer Berlin / Heidelberg. 10.1007/978-3-540-44871-6 76. [Ortiz-Mart´ınez et al., 2010] Ortiz-Mart´ınez, D., Garc´ıa-Varea, I., and Casacuberta, F. (2010). Online learning for interactive statistical machine translation. In Human Language Technologies: The 2010 Annual Conference of the North American Chapter of the Association for Computational Linguistics, HLT ’10, pages 546–554, Stroudsburg, PA, USA. Association for Computational Linguistics. [Papineni et al., 2002] Papineni, K., Roukos, S., Ward, T., and Zhu, W.-J. (2002). Bleu: A method for automatic evaluation of machine translation. In Proceedings of the 40th annual conference of the Association for Computational Linguistics, 2002, pages 311–318. [Papineni et al., 1998] Papineni, K. A., Roukos, S., and Ward, R. T. (1998). Maximum likelihood and discriminative training of direct translation models. In Int. Conf. on Acoustics, Speech, and Signal Processing (ICASSP), pages 189–192, Seattle, Washington, USA. 77 Bibliograf´ıa [Paula Estrella et al., 2004] Paula Estrella, A. P.-B., , and King, M. (2004). A new method for the study of correlations between mt evaluation metrics and some surprising results. In In 11th International Conference on Theoretical and Methodological Issues in Machine Translation,2004. [Powell, 1964] Powell, M. J. D. (1964). An efficient method for finding the minimum of a function of several variables without calculating derivatives. The Computer Journal, 7(2):155–162. [Pym, 1990] Pym, P. J. (1990). Pre-editing and the use of simplified writing for mt: an engineer[U+02BC]s experience of operating an mt system. Translating and the Computer, 10(November 1988):80–96. [S´anchez and Bened´ı, 2006] S´anchez, J. A. and Bened´ı, J. M. (2006). Stochastic inversion transduction grammars for obtaining word phrases for phrase-based statistical machine translation. In Proceedings of the Workshop on Statistical Machine Translation, StatMT ’06, pages 130–133, Stroudsburg, PA, USA. Association for Computational Linguistics. [Sanchis-Trilles and Casacuberta, 2010] Sanchis-Trilles, G. and Casacuberta, F. (2010). Log-linear weight optimisation via bayesian adaptation in statistical machine translation. In Proceedings of the 23rd International Conference on Computational Linguistics: Posters, COLING ’10, pages 1077–1085, Stroudsburg, PA, USA. Association for Computational Linguistics. [Sanchis-Trilles et al., 2009] Sanchis-Trilles, G., Cettolo, M., Bertoldi, N., and Federico, M. (2009). Online language model adaptation for spoken dialog translation. In International Workshop on Spoken Language Translation, pages 160–167. [Schwenk and Senellart, 2009] Schwenk, H. and Senellart, J. (2009). Translation model adaptation for an arabic/french news translation system by lightly-supervised training. In MT Summit. [Shah et al., 2010] Shah, K., Barrault, L., and Schwenk, H. (2010). Translation model adaptation by resampling. In Proceedings of the Joint Fifth Workshop on Statistical Machine Translation and MetricsMATR, WMT ’10, pages 392–399, Stroudsburg, PA, USA. Association for Computational Linguistics. [Shannon, 1948] Shannon, C. E. (1948). A mathematical theory of communication. Bell Sys. Tech. J., 27:379–423, 623–656. [Snover et al., 2006] Snover, M., Dorr, B., Schwartz, R., Micciulla, L., and Makhoul, J. (2006). A study of translation edit rate with targeted human annotation. In Proc. of the 7th biennial conference of the Association for Machine Translation in the Americas, 2006, pages 223–231. [Stauffer and Grimson, 2000] Stauffer, C. and Grimson, W. E. L. (2000). Learning patterns of activity using real-time tracking. IEEE Transactions on Pattern Analysis and Machine Intelligence, 22:747–757. 78 Bibliograf´ıa [Stolcke, 2002] Stolcke, A. (2002). SRILM – an extensible language modeling toolkit. In Proc. of the 7th international conference on Spoken Language Processing, 2002, pages 901–904. [Tiedemann, 2010] Tiedemann, J. (2010). To cache or not to cache?: experiments with adaptive models in statistical machine translation. In Proceedings of the Joint Fifth Workshop on Statistical Machine Translation and MetricsMATR, WMT ’10, pages 189–194, Stroudsburg, PA, USA. Association for Computational Linguistics. [Tom´as and Casacuberta, 2001] Tom´as, J. and Casacuberta, F. (2001). Monotone statistical translation using word groups. [Toselli et al., 2011] Toselli, A. H., Vidal, E., and Casacuberta, F., editors (2011). Multimodal Interactive Pattern Recognition and Applications. Springer, 1st edition edition. http://www.springer.com/computer/hci/book/978-0-85729-478-4. [Ueffing et al., 2002] Ueffing, N., Och, F. J., and Ney, H. (2002). Generation of word graphs in statistical machine translation. In Proceedings of the ACL-02 conference on Empirical methods in natural language processing - Volume 10, EMNLP ’02, pages 156–163, Stroudsburg, PA, USA. Association for Computational Linguistics. [Vauquois, 1968] Vauquois, B. (1968). A survey of formal grammars and algorithms for recognition and transformation in mechanical translation. In IFIP Congress (2)’68, pages 1114–1122. [Vidal et al., 2007] Vidal, E., Rodr´ıguez, L., Casacuberta, F., and Garc´ıa-Varea, I. (2007). Interactive pattern recognition. In MLMI, pages 60–71. [Watanabe et al., 2003] Watanabe, T., Sumita, E., and Okuno, H. G. (2003). Chunkbased statistical translation. In Proceedings of the 41st Annual Meeting on Association for Computational Linguistics - Volume 1, ACL ’03, pages 303–310, Stroudsburg, PA, USA. Association for Computational Linguistics. [Weaver, 1955] Weaver, W. (1949/1955). Translation. In Locke, W. N. and Boothe, A. D., editors, Machine Translation of Languages, pages 15–23. MIT Press, Cambridge, MA. Reprinted from a memorandum written by Weaver in 1949. [Zens and Ney, 2004] Zens, R. and Ney, H. (2004). Improvements in phrase-based statistical machine translation. In Human Language Technology Conf. / North American Chapter of the Assoc. for Computational Linguistics Annual Meeting, pages 257–264, Boston, MA. [Zens et al., 2002] Zens, R., Och, F. J., and Ney, H. (2002). Phrase-based statistical machine translation. In German Conf. on Artificial Intelligence, pages 18–32, Aachen, Germany. [Zhao et al., 2004] Zhao, B., Eck, M., and Vogel, S. (2004). Language model adaptation for statistical machine translation with structured query models. In Proceedings of the 20th international conference on Computational Linguistics, COLING ’04, Stroudsburg, PA, USA. Association for Computational Linguistics. 79