scieee AI-readable full text Open interactive document viewer

Una aproximación al uso de word embeddings en una tarea de similitud de textos en español

López Solaz, Tomás; Troyano Jiménez, José Antonio; Ortega Rodríguez, Francisco Javier; Enríquez de Salamanca Ros, Fernando

Abstract

En este trabajo mostramos cómo una representación vectorial de palabras basada en word embeddings puede ayudar a mejorar los resultados en una tarea de similitud semántica de textos. Para ello hemos experimentado con dos métodos que se apoyan en la representación vectorial de palabras para calcular el grado de similitud de dos textos, uno basado en la agregación de vectores y otro basado en el cálculo de alineamientos. El método de alineamiento se apoya en la similitud de vectores de palabras para determinar la vinculación entre las mismas. El método de agregación nos permite construir representaciones vectoriales de los textos a partir de los vectores individuales de palabras. Estas representaciones son comparadas mediante dos distancias clásicas como son la euclídea y la del coseno. Hemos evaluado nuestros sistemas con el corpus basado en Wikipedia distribuido en la competición de similitud de textos en español de SemEval-2015. Nuestros experimentos muestran que el método basado en alineamiento se comporta mucho mejor, obteniendo resultados muy cercanos al mejor sistema de SemEval. El método basado en agregación de vectores se comporta sensiblemente peor. No obstante, esta segunda aproximación parece capturar aspectos de similitud no recogidos por la primera, ya que cuando se combinan las salidas de ambos sistemas se mejoran los resultados del método de alineamiento, superando incluso los resultados del mejor sistema de SemEval.

Full text

Una aproximaci´on al uso de word embeddings en una tarea de similitud de textos en espa˜nol An approach to the use of word embeddings in a textual similarity task for Spanish texts Tom´as L´opez-Solaz Universidad de Sevilla tlop[email protected] Jos´e A. Troyano Universidad de Sevilla troy[email protected] F. Javier Ortega Universidad de Sevilla ja[email protected] Fernando Enr´ıquez Universidad de Sevilla [email protected] Resumen: En este trabajo mostramos c´omo una representaci´on vectorial de palabras basada en word embeddings puede ayudar a mejorar los resultados en una tarea de similitud sem´antica de textos. Para ello hemos experimentado con dos m´etodos que se apoyan en la representaci´on vectorial de palabras para calcular el grado de similitud de dos textos, uno basado en la agregaci´on de vectores y otro basado en el c´alculo de alineamientos. El m´etodo de alineamiento se apoya en la similitud de vectores de palabras para determinar la vinculaci´on entre las mismas. El m´etodo de agregaci´on nos permite construir representaciones vectoriales de los textos a partir de los vectores individuales de palabras. Estas representaciones son comparadas mediante dos distancias cl´asicas como son la eucl´ıdea y la del coseno. Hemos evaluado nuestros sistemas con el corpus basado en Wikipedia distribuido en la competici´on de similitud de textos en espa˜nol de SemEval-2015. Nuestros experimentos muestran que el m´etodo basado en alineamiento se comporta mucho mejor, obteniendo resultados muy cercanos al mejor sistema de SemEval. El m´etodo basado en agregaci´on de vectores se comporta sensiblemente peor. No obstante, esta segunda aproximaci´on parece capturar aspectos de similitud no recogidos por la primera, ya que cuando se combinan las salidas de ambos sistemas se mejoran los resultados del m´etodo de alineamiento, superando incluso los resultados del mejor sistema de SemEval. Palabras clave: Similitud sem´antica, word embedding, alineamiento de textos Abstract: In this paper we show how a vector representation of words based on word embeddings can help to improve the results in tasks focused on the semantic similarity of texts. Thus we have experimented with two methods that rely on the vector representation of words to calculate the degree of similarity of two texts, one based on the aggregation of vectors and the other one based on the calculation of alignments. The alignment method relies on the similarity of word vectors to determine the semantic link between them. The aggregation method allows us to construct vector representations of the texts from the individual vectors of each word. These representations are compared by means of two classic distance measures: Euclidean distance and cosine similarity. We have evaluated our systems with the corpus based on Wikipedia distributed in the competition of similarity of texts in Spanish of SemEval-2015. Our experiments show that the method based on the alignment of words performs much better, obtaining results that are very close to the best system at SemEval. The method based on vector representations of texts behaves substantially worse. However, this second approach seems to capture aspects of similarity not detected by the first one, as when the outputs of both systems are combined the results of the alignment method are surpassed, even exceeding the results of the best system at SemEval. Keywords: Semantic similarity, word embedding, text alignment 1 Introducci´on La medici´on fiable de la similitud de textos es una aplicaci´on de gran ayuda para distintas tareas relacionadas con el procesamiento de textos en lenguaje natural. S´olo por citar algunos ejemplos, los sistemas de clasificaci´on de documentos, de res´umenes de textos, o de traducci´on autom´atica, pueden beneficiarse de un m´odulo de similitud que establezca el grado de parecido entre dos unidades textuales. En general, podemos distinguir entre dos tipos de similitud: a nivel de palabras y a nivel de textos. Las distintas aproximaciones de similitud a nivel de palabras se agrupan en dos categor´ıas: similitud l´exica de palabras y similitud sem´antica de palabras. Dos palabras son similares a nivel l´exico si est´an compuestas por secuencias parecidas de caracteres. Para determinar la similitud l´exica de palabras se suelen utilizar distintas m´etricas basadas en comparaci´on de cadenas de caracteres. La similitud sem´antica de palabras, por su parte, nos permite medir si dos palabras tienen significados parecidos o se usan en contextos parecidos. Hay dos grandes grupos de t´ecnicas para calcular la similitud sem´antica de palabras: t´ecnicas basadas en conocimiento y t´ecnicas basadas en corpus. Las t´ecnicas de similitud de palabras basadas en conocimiento miden el grado de parecido entre palabras apoy´andose en alg´un tipo de recurso ling¨u´ıstico que proporcione informaci´on sobre el significado de las palabras. El recurso por excelencia es WordNet (Miller, 1995), una base de datos l´exica organizada en torno a varias relaciones entre palabras. La relaci´on de sinonimia es la m´as importante y en ella se apoya el concepto de synset (grupo de sin´onimos) que permite definir de forma impl´ıcita el significado de las palabras a trav´es del conjunto de synsets en los que aparece. En funci´on de las relaciones entre palabras, se han definido varias m´etricas de similitud entre las que destacan las de Resnik (Resnik, 1995), Lin (Lin, 1998) y Jian & Conrath (Jiang y Conrath, 1997). Las t´ecnicas de similitud de palabras basadas en corpus determinan el parecido sem´antico de dos palabras en funci´on de los usos de esas palabras en una gran colecci´on de textos. Por lo general, estas t´ecnicas se basan en alg´un tipo de representaci´on vectorial de las palabras en funci´on de los distintos contextos en los que dichas palabras aparecen. Dentro de las t´ecnicas basadas en corpus destacan las de latent semantic analysis (LSA) y las de word embedding. LSA analiza las relaciones entre un conjunto de documentos y los t´erminos que contienen, estableciendo que dos palabras son similares si ocurren en fragmentos similares de textos. LSA parte de una matriz de palabras frente a documentos y aplica una t´ecnica matem´atica denominada singular value decomposition que permite reducir el n´umero de filas (documentos) preservando la similitud entre columnas (palabras). Por su parte, las t´ecnicas de word embedding parten de representaciones BOW (bag of words) de los distintos contextos de las palabras para obtener representaciones vectoriales de las palabras de dimensiones mucho m´as reducidas que capturan el significado y las relaciones entre palabras. Hay diversas t´ecnicas para calcular estas representaciones, una de las m´as empleadas se basa en redes neuronales de una sola capa oculta que predicen la palabra dado el contexto o viceversa, adaptando as´ı una de las piezas b´asicas de los modelos de aprendizaje profundo, los autocodificadores. Las t´ecnicas de word embedding han demostrado ser muy ´utiles en m´ultiples tareas del Procesamiento del Lenguaje Natural aparte de la similitud de textos (Collobert et al., 2011), (Zou et al., 2013), y en la actualidad gozan de gran popularidad. Esto se debe en gran medida a la existencia de herramientas como Word2vec (Mikolov et al., 2013) o GloVe (Pennington, Socher, y Manning, 2014) que han facilitado mucho el acceso a este tipo de t´ecnicas a la comunidad investigadora. Las t´ecnicas de similitud a nivel de palabras proporcionan una informaci´on b´asica para afrontar la tarea de similitud a nivel de textos. Muchas de las aproximaciones de similitud de textos se basan en la idea de alineamiento, que b´asicamente consiste en un emparejamiento entre palabras de los dos textos a comparar. El alineamiento entre dos textos proporciona un marco sobre el que se pueden evaluar distintas heur´ısticas para determinar el grado de similitud entre los textos. Por ejemplo, usando las conexiones propuestas en el alineamiento para calcular m´etricas de similitud sem´antica entre las palabras emparejadas y agregando estas m´etricas individuales para obtener una m´etrica de similitud global entre los dos textos. En este trabajo estamos interesados en analizar v´ıas que permitan integrar el conocimiento obtenido mediante word embeddings a la hora de determinar el grado de similitud de dos textos. El uso de word embeddings no es nuevo en sistemas de similitud de textos, pero siempre como complemento a otras t´ecnicas o recursos. Nuestra intenci´on es evaluar el comportamiento de un sistema que se base exclusivamente en el conocimiento proporcionado por un modelo de word embedding. Hemos identificado dos maneras en las que la representaci´on de palabras en el espacio continuo puede ser de utilidad para esta tarea: con un m´etodo de alineamiento basado exclusivamente en embeddings y con una representaci´on vectorial de textos basada en los vectores de palabras. El m´etodo de alineamiento propuesto usa el grado de similitud de palabras como mecanismo para identificar posibles emparejamientos de palabras, construy´endose alineamientos bidireccionales en los que las palabras son emparejadas parcialmente en funci´on de su similitud. La segunda aproximaci´on consiste en el uso de los vectores de palabras para construir representaciones vectoriales de los textos. Estas representaciones son comparadas mediante dos distancias cl´asicas como son la eucl´ıdea y la del coseno para obtener as´ı un grado de similitud entre dos textos. Hemos evaluado nuestros sistemas con el corpus basado en wikipedia distribuido en la competici´on de similitud de textos en espa˜nol de SemEval-2015. De nuestras dos aproximaciones, la que mejor se comporta es la del m´etodo de alineamiento, para la que se obtienen resultados muy cercanos al mejor sistema de SemEval. La idea de usar los vectores de palabras para construir vectores para los textos se comporta sensiblemente peor. No obstante esta segunda aproximaci´on parece capturar aspectos de similitud no recogidos por la primera, ya que cuando se combinan las salidas de ambos sistemas se mejoran los resultados del m´etodo de alineamiento, superando incluso los resultados del mejor sistema de SemEval. El resto del art´ıculo se organiza de la siguiente forma: la secci´on 2 describe brevemente algunos trabajos relacionados, la secci´on 3 describe tanto el m´etodo basado en representaci´on vectorial de textos como el basado en alineamiento, as´ı como el m´etodo de combinaci´on aplicado, la secci´on 4 incluye los resultados experimentales y, por ´ultimo, la secci´on 5 incluye las conclusiones y plantea algunas l´ıneas de trabajo futuro. 2 Trabajos relacionados La mayor´ıa de las contribuciones recientes en el ´ambito de la similitud sem´antica de textos provienen de los participantes en las tareas que se proponen anualmente en SemEval1. De estas participaciones han surgido muchas t´ecnicas, ideas, e incluso frameworks que ofrecen componentes que pueden ser utilizados para desarrollar sistemas de similitud de textos, como por ejemplo DKPro (B¨ar, Zesch, y Gurevych, 2013). Aparte de los trabajos presentados en SemEval, otro referente cl´asico en este campo es el trabajo de (Mihalcea, Corley, y Strapparava, 2006) centrado en el c´alculo de similitud sem´antica para textos cortos, y en el que se resumen las m´etricas de similitud m´as importantes que posteriormente se han venido utilizando como parte de la mayor´ıa de los sistemas de similitud de textos. Las distintas propuestas que han participado en las ediciones recientes de las tareas de similitud de SemEval son combinaciones de m´etricas cl´asicas con ideas originales. En muchos casos, los participantes van mejorando sus sistemas a˜no a a˜no para incorporar nuevas ideas o para adaptarse a los distintos cambios en la definici´on de las tareas por parte de los organizadores. A modo de muestra del tipo de t´ecnicas usadas en estos sistemas, resumimos a continuaci´on las caracter´ısticas m´as significativas de los tres mejores sistemas en la tarea en espa˜nol de la competici´on de SemEval de 2015 (Agirre et al., 2015), cuyo corpus hemos usado en nuestros experimentos. El mejor grupo fue (H¨anig, Remus, y Puente, 2015), su soluci´on integra tres t´ecnicas: representaci´on vectorial de textos (BOW y distancia del coseno), alineamiento mediante m´etricas de similitud y uso de machine learning para la combinaci´on de las distintas m´etricas calculadas. Usa un alineamiento secuencial y emplea Word2vec en una ´ultima fase para intentar emparejar palabras residuales que no han sido emparejadas por su t´ecnica de alineamiento. El segundo grupo de la competici´on (Ka1https://en.wikipedia.org/wiki/SemEval rumuri, Vuggumudi, y Chitirala, 2015) se apoya en un sistema previo para ingl´es y utiliza el traductor de Google para adaptar las entradas al espa˜nol a su sistema. Integra un sistema de alineamiento con distintas m´etricas basadas en proporcionalidad, n´umero de sustantivos, n´umero de adjetivos, tama˜no de los textos, etc. El tercer grupo de la competici´on (Bi¸cici, 2015) present´o un sistema basado en m´aquinas de traducci´on referencial. La idea principal es comparar c´omo se parecen los textos originales cuando son traducidos a otros idiomas. 3 M´etodo propuesto El m´etodo propuesto para el c´alculo de la similitud entre textos se basa en la combinaci´on de diversos indicadores en los que el factor com´un es el uso de word embeddings para representar las palabras. 3.1 Agregando word embeddings La primera aproximaci´on que forma parte de nuestro sistema consiste en la aplicaci´on de alguna medida de similitud entre los vectores que proporciona la representaci´on de word embeddings. Dado que estos vectores est´an asociados a palabras individuales, para cada texto es necesario aplicar alg´un m´etodo que unifique los vectores de cada palabra generando un ´unico vector. Tras probar distintas funciones de agregaci´on, se eligi´o como representaci´on la media aritm´etica de los vectores, obtenida sumando todos los vectores de palabras y dividiendo entre el n´umero de palabras que componen el texto (ecuaci´on 1). ~ Vd=Pn i=0 ~vi n(1) Una vez obtenido el vector agregado para cada texto se aplican medidas de similitud ‘tradicionales’, como son la distancia eucl´ıdea y la similitud del coseno. 3.2 Alineamiento Otro indicador que obtenemos sobre el grado de similitud entre los textos se basa en la idea general del alineamiento de palabras. En este caso se lleva a cabo el emparejamiento de las palabras que, perteneciendo cada una a un texto distinto, guardan alguna relaci´on sem´antica entre ellas. Una vez completada la fase de alineamiento de palabras se utiliza la distancia entre los word embeddings de cada palabra para finalmente aplicar una funci´on de agregaci´on que nos proporcione el grado de similitud global entre los textos. El alineamiento se realiza habitualmente en un ´unico sentido, buscando para cada palabra de la oraci´on de menor tama˜no aquella que debe formar pareja con ella de entre todas las que forman la oraci´on m´as larga. Sin embargo, en nuestro m´etodo realizamos un alineamiento bidireccional, tras el cual se descartan los pares de palabras repetidos antes de tomar la decisi´on final. De este modo contamos con un mayor n´umero de medidas parciales mejorando los resultados finales. El proceso comienza con la construcci´on de un vector en el que existe una posici´on asociada a cada palabra del conjunto formado por la uni´on de los dos textos a analizar. Para cada palabra del primer texto se buscar´a una palabra del segundo texto con la que alinearla. Si la misma palabra existe en los dos textos se alinear´a consigo misma, y en caso contrario se calcular´a la distancia entre las representaciones vectoriales de la palabra de referencia del primer texto y todas las del segundo, con el fin de buscar la m´as cercana. El valor a introducir en la posici´on del vector asociada a la palabra de referencia ser´a un 1 en el primer caso, y 1 menos la distancia en el segundo. Si el alineamiento no se puede llevar a cabo se introducir´a un 0. Esto puede suceder si la palabra no est´a presente en el vocabulario del modelo de word embeddings utilizado. El vector resultante representa indicadores individuales de similitud para las palabras que aparecen en los textos, por lo que es necesario aplicar una funci´on de agregaci´on. En el algoritmo 1 se describe el proceso de forma m´as detallada, siendo posible aplicar distintas configuraciones para obtener las selected words que se utilizan para generar el valor agregado de similitud (n´umero total de palabras, palabras con valor distinto de cero, etc.). En la figura 1 se muestra un ejemplo de alineamiento entre dos textos, incluyendo los valores de similitud obtenidos para cada par de palabras. El vector resultante tendr´a once posiciones (el n´umero de palabras distintas presentes en ambos textos) y el grado de similitud se calcula en este caso con las posiciones cuyo valor es distinto de cero, siendo el resultado 0,718 sobre 1. La figura refleja la capa- 4Dos oraciones son completamente equivalentes al significar la misma cosa. 3Dos oraciones son pr´acticamente equivalentes pero algunos detalles difieren. 2Dos oraciones son aproximadamente equivalentes pero alguna informaci´on importante difiere o no est´a. 1Dos oraciones no son equivalentes pero son del mismo tema. 0Dos oraciones son de diferentes temas. Tabla 1: Descripci´on de los niveles de similitud para la tarea de SemEval 2015 Algoritmo 1 Alineamiento en pseudoc´odigo Require: t1, t2sets de tokens, m = modelo Word2Vec Ensure: sim = similitud m´etrica 1: vocab =t1+t2 2: bow = [0] ∗vocab.size() 3: for all win t1do 4: if win t2then 5: bow[w] = 1 6: else if win mthen 7: bow[w] = max(m.similarity(w, t2)) 8: else 9: continue 10: end if 11: end for 12: for all win t2do 13: if win mthen 14: bow[w] = max(m.similarity(w, t1)) 15: else 16: continue 17: end if 18: end for 19: values = (w for w in selected words) 20: sim =sum(values)/values.size() 21: return sim Figura 1: Ejemplo de alineamiento cidad de establecer relaciones sem´anticas entre palabras distintas a trav´es del modelo de word embedding (‘trabajadores’-‘empleados’) y la posibilidad de tener una palabra alineada con m´as de una palabra distinta (‘de’). 3.3 Combinaci´on Con el objetivo de aprovechar los diferentes enfoques aportados por las soluciones propuestas en las secciones anteriores, hemos experimentado con un m´etodo de combinaci´on basado en un algoritmo de aprendizaje autom´atico supervisado para regresi´on. En este caso se construye un conjunto de datos de entrenamiento formado por los valores devueltos por los sistemas anteriormente descritos, generando un nuevo modelo que se pueda aplicar a nuevos pares de textos que se deseen analizar. 4 Experimentaci´on Como marco de referencia para evaluar el rendimiento de nuestra propuesta se recurri´o a la ´ultima edici´on de la conferencia internacional SemEval, celebrada en 2015 (Agirre et al., 2015). Entre los diferentes retos que se presentaron en este evento, hemos seleccionado la tarea para el espa˜nol que consiste en, dadas dos oraciones, devolver un valor de similitud continuo entre 0 y 4. Para entender la diferencia de matices que hay entre los distintos valores, mostramos en la tabla 1 una peque˜na descripci´on de cada uno de los cinco niveles en que se ha dividido el grado de similitud a obtener. Teniendo en cuenta el alto poder de convocatoria de este evento y el nivel de los participantes, consideramos la tabla de resultados de esta tarea el mejor marco de referencia posible para validar nuestra propuesta. En la tabla 2 se muestran ´unicamente los mejores resultados de SemEval 2015. Sistema Pearson ∆ Baseline-tokencos 0,529 0,0 % RTM-DCU 0,582 5,4 % UMDuluth 0,594 6,5 % ExBThemis 0,706 17,7 % Tabla 2: Resultados SemEval 2015 Valor Frases 4 El esp´ecimen es excepcional por las partes conservadas: un cr´aneo y mand´ıbula y un molde interno de la caja craneal. El esp´ecimen comprende la mayor parte de la cara y mand´ıbula con los dientes y un molde interno de la caja craneal. 3“Time 100” es una lista de las 100 personas m´as influyentes seg´un la revista Time. La primera lista fue publicada en 1999 con las 100 personas m´as influyentes del siglo 20. 2La “marinera” es un baile de pareja suelto, el m´as conocido de la costa del Per´u. La marinera es el baile nacional del Per´u, y su ejecuci´on busca hacerse con derroche de gracia, picard´ıa y destreza. 1La “cripta de Santa Leocadia” est´a situada en el interior de la catedral de Oviedo, Asturias. Esteban B´athory fue sepultado en la cripta de la catedral de Wawel en Cracovia. 0El r´ıo atraviesa la importante ciudad de Puebla de Zaragoza, la cuarta m´as poblada del pa´ıs. El “Grˆemio Esportivo Bag´e” es un club de f´utbol brasile˜no, de la ciudad de Bag´e en el estado de Rio Grande do Sul. Tabla 3: Ejemplos de pares de frases para cada nivel de similitud 4.1 Conjunto de datos El conjunto de datos contiene pares de oraciones extra´ıdas de los art´ıculos de la Wikipedia y consta como es habitual de dos partes, una de train y otra de test. Cada parte tiene 324 y 251 pares de oraciones respectivamente. En la tabla 3 se muestra un ejemplo extra´ıdo del conjunto de datos para cada uno de los niveles de similitud establecidos para la tarea. Los valores de similitud de las oraciones fueron asignados calculando la media de las asignaciones manuales realizadas por cinco jueces humanos. Las oraciones en general est´an bien construidas y usan un lenguaje formal. Se realiz´o un peque˜no pre-procesado que consisti´o ´unicamente en eliminar los signos de puntuaci´on. Aunque es una pr´actica com´un, la eliminaci´on de palabras huecas o stop words no se llev´o a cabo al considerarse que aportaban informaci´on relevante al proceso de alineamiento. 4.2 Modelos Word2Vec El sistema de word embedding que hemos empleado en esta propuesta para obtener la representaci´on vectorial de las palabras est´a basado en la implementaci´on de Word2Vec (Mikolov et al., 2013) que encontramos en la herramienta Gensim (ˇ Reh˚uˇrek y Sojka, 2010). A trav´es de ella hemos generado un primer modelo (Modelo-1) con textos en espa˜nol provenientes de art´ıculos de la Wikipedia2, manteniendo as´ı el mismo dominio que encontramos en los datos de la tarea de SemEval que 2https://dumps.wikimedia.org/eswiki/latest/ nos sirve de referencia. Este modelo se cre´o con vectores de 300 dimensiones, haciendo uso de la opci´on negative sample para eliminar palabras de ruido y ejecutando un total de 20 iteraciones para reforzar el entrenamiento y mejorar los resultados, siendo cada vez m´as estricto el factor de aprendizaje en cada una de estas etapas. Adem´as de generar este nuevo modelo tambi´en se han llevado a cabo experimentos utilizando un modelo extendido (Cardellino, 2016) (Modelo-2). Para su construcci´on se utilizaron, adem´as de textos de la Wikipedia, otras fuentes de datos como el corpus AnCora-ES 3o Europarl 4. La experimentaci´on con este modelo extendido nos permitir´a comprobar los efectos de introducir en el modelo palabras extra´ıdas de otros tipos de documentos con sus respectivos contextos, lo cual afectar´a a las distintas m´etricas aqu´ı expuestas que hacen uso de dicho modelo. 4.3 Resultados A la hora de evaluar los resultados, se ha utilizado la medida estad´ıstica que se aplic´o en la tarea original del SemEval, el coeficiente de correlaci´on de Pearson. En las tablas 4 y 5 se muestran los resultados obtenidos por los m´etodos aqu´ı propuestos, as´ı como el mejor resultado registrado en la tarea de SemEval 2015 (ExBThemis). Aparecen tanto los m´etodos individuales como el resultado de combinar dichos m´etodos junto a la diferencia del resultado respecto al 3http://clic.ub.edu/corpus/ 4http://www.statmt.org/europarl/ sistema ExBThemis. En la tabla 4 vemos los resultados obtenidos con el modelo de word embeddings creado exclusivamente con datos de la Wikipedia (Modelo-1), mientras que en la tabla 5 vemos los resultados obtenidos utilizando el modelo extendido con datos adicionales que no provienen de la Wikipedia (Modelo-2). Sistema Pearson ∆ ExBThemis 0,706 - Euclidea (E) 0,509 -19,7 % Coseno (C) 0,467 -23,9 % Alineamiento (A) 0,692 -1,4 % Combinado (E+C+A) 0,713 0,7 % Tabla 4: Resultados con el Modelo-1 Sistema Pearson ∆ ExBThemis 0,706 - Euclidea (E) 0,642 -6,4 % Coseno (C) 0,646 -5,9 % Alineamiento (A) 0,687 -1,8 % Combinado (E+C+A) 0,723 1,8 % Tabla 5: Resultados con el Modelo-2 En ambos casos las m´etricas empleadas de forma individual no son capaces de obtener resultados que superen los obtenidos por el sistema ExBThemis, aunque el m´etodo de alineamiento aqu´ı planteado se queda a menos de dos puntos porcentuales. Teniendo en cuenta que nos comparamos con el mejor sistema de entre todos los que se presentaron para resolver esta tarea en la edici´on 2015 de SemEval, dicho resultado puede considerarse relevante por s´ı mismo. Sin embargo, es la combinaci´on de las diferentes m´etricas la que arroja las mejores cifras superando significativamente nuestra referencia, especialmente en el caso de utilizar el Modelo-2. Precisamente en el mejor de los casos, utilizando el Modelo-2, la inserci´on de textos de diferentes dominios a la hora de generar el modelo de word embedding afecta negativamente al m´etodo de alineamiento, quiz´as por las diferencias en cuanto a las relaciones sem´anticas entre palabras que son aprendidas partiendo de dichos textos. Sin embargo, ese enriquecimiento del vocabulario favorece enormemente a las m´etricas m´as tradicionales, que consiguen resultados considerablemente mejores beneficiando con ello a la combinaci´on, que compensa as´ı la ligera p´erdida sufrida por el alineamiento. 5 Conclusiones y trabajo futuro En este trabajo hemos explorado la forma de aprovechar un modelo de word embedding para mejorar los resultados en una tarea de similitud sem´antica de textos. Nuestro principal objetivo era evaluar la mejora que se puede obtener en esta tarea sin hacer uso de otros recursos que no sean la representaci´on vectorial en el espacio continuo. Para ello hemos definido dos maneras de calcular la similitud sem´antica de textos. Por un lado, mediante un alineamiento entre textos bidireccional y ponderado en funci´on del parecido de las palabras emparejadas. La otra t´ecnica se apoya en los vectores de palabras para construir representaciones vectoriales de los textos que son comparadas para determinar el grado de similitud entre ellos. Los experimentos sobre un corpus de la competici´on SemEval de 2015 para espa˜nol muestran que el m´etodo de alineamiento se comporta de manera muy satisfactoria, quedando muy cerca del mejor sistema de la competici´on. En el caso de la t´ecnica basada en la representaci´on vectorial de textos, los resultados son peores pero aportan conocimiento complementario. Esto se demuestra con el hecho de que cuando se combinan las salidas de ambas t´ecnicas se consiguen mejorar ambos resultados, superando incluso al mejor de los sistemas de la competici´on. Tambi´en hemos experimentado con dos modelos distintos de word embedding, uno de ellos entrenado exclusivamente con textos de Wikipedia y otro, m´as extenso, tambi´en con textos de la Wikipedia m´as textos de otras fuentes. Dado que el corpus de SemEval est´a creado con textos de Wikipedia, este experimento nos ha permitido evaluar la sensibilidad de las t´ecnicas a los textos usados para el entrenamiento de los modelos. Los experimentos han mostrado que la t´ecnica basada en la representaci´on vectorial de textos se beneficia de un modelo de word embedding m´as extenso aunque entrenado con textos de un dominio diferente. Por su parte, la t´ecnica de alineamiento es penalizada levemente por el cambio de dominio aunque sus resultados siguen siendo mejores que los de la t´ecnica de representaci´on vectorial. En cualquier caso, la combinaci´on sigue mejorando los resultados de ambas t´ecnicas, quedando tambi´en por encima del mejor sistema de la competici´on. Como trabajo futuro estamos especialmente interesados en analizar el comportamiento de nuestros sistemas en un con- texto multiling¨ue. El buen comportamiento de las t´ecnicas de word embedding a la hora de comparar palabras de distintos idiomas (Mikolov, Le, y Sutskever, 2013) y el hecho de que nuestra aproximaci´on s´olo se base en la informaci´on de los modelos de word embedding nos hace pensar que puede comportarse bien para calcular la similitud de textos en distintos idiomas. Agradecimientos Este trabajo ha sido financiado a trav´es del proyecto de investigaci´on AORESCU (P11TIC-7684 MO). Bibliograf´ıa Agirre, E., C. Banea, C. Cardie, D. Cer, M. Diab, A. Gonzalez-Agirre, W. Guo, I. Lopez-Gazpio, M. Maritxalar, y R. Mihalcea. 2015. Semeval-2015 task 2: Semantic textual similarity, english, spanish and pilot on interpretability. En Proceedings of the 9th international workshop on semantic evaluation (SemEval 2015), p´aginas 252–263. B¨ar, D., T. Zesch, y I. Gurevych. 2013. Dkpro similarity: An open source framework for text similarity. En ACL (Conference System Demonstrations), p´aginas 121– 126. Bi¸cici, E. 2015. Rtm-dcu: Predicting semantic similarity with referential translation machines. SemEval-2015. Cardellino, C. 2016. Spanish Billion Words Corpus and Embeddings, March. Collobert, R., J. Weston, L. Bottou, M. Karlen, K. Kavukcuoglu, y P. Kuksa. 2011. Natural language processing (almost) from scratch. J. Mach. Learn. Res., 12:2493–2537, Noviembre. H¨anig, C., R. Remus, y X. D. L. Puente. 2015. Exb themis: Extensive feature extraction from word alignments for semantic textual similarity. SemEval-2015, p´agina 264. Jiang, J. y D. Conrath. 1997. Semantic similarity based on corpus statistics and lexical taxonomy. arXiv preprint cmplg/9709008. Karumuri, S., V. Vuggumudi, y S. Chitirala. 2015. Umduluth-blueteam: Svcsts-a multilingual and chunk level semantic similarity system. SemEval-2015, p´agina 107. Lin, D. 1998. Extracting collocations from text corpora. En First workshop on computational terminology, p´aginas 57– 63. Citeseer. Mihalcea, R., C. Corley, y C. Strapparava. 2006. Corpus-based and knowledge-based measures of text semantic similarity. En AAAI, volumen 6, p´aginas 775–780. Mikolov, T., Q. Le, y I. Sutskever. 2013. Exploiting similarities among languages for machine translation. arXiv preprint arXiv:1309.4168. Mikolov, T., I. Sutskever, K. Chen, G. Corrado, y J. Dean. 2013. Distributed representations of words and phrases and their compositionality. En Advances in neural information processing systems, p´aginas 3111–3119. Miller, G. 1995. Wordnet: a lexical database for english. Communications of the ACM, 38(11):39–41. Pennington, J., R. Socher, y C. Manning. 2014. Glove: Global vectors for word representation. En EMNLP, volumen 14, p´aginas 1532–1543. ˇ Reh˚uˇrek, R. y P. Sojka. 2010. Software Framework for Topic Modelling with Large Corpora. En Proceedings of the LREC 2010 Workshop on New Challenges for NLP Frameworks, p´aginas 45–50, Valletta, Malta, Mayo. ELRA. http:// is.muni.cz/publication/884893/en. Resnik, P. 1995. Using information content to evaluate semantic similarity in a taxonomy. arXiv preprint cmp-lg/9511007. Zou, W., R. Socher, D. Cer, y C. Manning. 2013. Bilingual word embeddings for phrase-based machine translation. En EMNLP, p´aginas 1393–1398.