El proyecto Gari-Coter en el seno del proyecto RICOTERM2
Abstract
Descripción del proyecto Gari-Coter para la elaboración de los recursos lingüı́sticos en gallego necesarios para un re-elaborador de consultas multilingüe.
Full text
El proyecto Gari-Coter∗en el seno del proyecto RICOTERM2∗∗ Fco. Mario Barcala Rodr´ıguez yEva M.aDom´ınguez Noya Centro Ram´on Pi˜neiro para a Investigaci´on en Humanidades {fbarcala,edomin}@cirp.es Pablo Gamallo Otero yMarisol L´opez Mart´ınez yEduardo Miguel Moscoso Mato y Guillermo Rojo yMar´ıa Paula Santalla del R´ıo ySusana Sotelo Doc´ıo Universidade de Santiago de Compostela {pablogam, fgmarsol, fgmato, guillermo.rojo, fesdocio}@usc.es Resumen: Descripci´on del proyecto Gari-Coter para la elaboraci´on de los recursos ling¨u´ısticos en gallego necesarios para un re-elaborador de consultas multiling¨ue. Palabras clave: expansi´on de consultas, corpus, base de datos terminol´ogica, extracci´on autom´atica de t´erminos Abstract: Description of the Gari-Coter project for the development of the necessary linguistic resources in Galician for a multilingual query re-elaborator. Keywords: query expansion, corpus, terminological database, automatic terminology extraction 1. Situaci´on actual Como se ha indicado en la nota de agradecimiento adjunta al acr´onimo del proyecto incluido en el t´ıtulo, ´este se ha venido desarrollando desde 2004, y su cierre est´a previsto para finales de 2007. Dos a˜nos y medio, por tanto, lleva el proyecto en curso, por lo cual lo que incluimos aqu´ı es una presentaci´on esquem´atica de lo que se propon´ıa, as´ı como de algunos de sus, ahora ya, resultados de hecho, a falta de un sexto de tiempo de desarrollo del proyecto. Lo que queda del mismo, por otra parte, es previsible que se dedique a la integraci´on de los recursos y herramientas generados en el seno de cada uno de los subproyectos que integran el proyecto coordinado RICOTERM2, el propio Gari-Coter, y el subproyecto, del mismo nombre que el coordinado, RICOTERM21. ∗Creaci´on e integraci´on multiling¨ue de recursos terminol´ogicos en gallego para Recuperaci´on de Informaci´on mediante estrategias de control terminol´ogico y discursivo en ´ambitos comunicativos especializados. Subproyecto financiado, bajo la direcci´on de M.aPaula Santalla, por el Ministerio de Educaci´on y Ciencia entre 2004 y 2007 (HUM2004-05658-C02-02/FILO). ∗∗ Control terminol´ogico y discursivo para la recuperaci´on de informaci´on en ´ambitos comunicativos especializados, mediante recursos ling¨u´ısticos espec´ıficos y un reelaborador de consultas. Proyecto coordinado financiado, bajo la direcci´on de Merc`e Lorente Casafont, por el Ministerio de Educaci´on y Ciencia entre 2004 y 2007 (HUM2004-05658-C02-00/FILO). 2. El subproyecto Gari-Coter en el seno del proyecto coordinado RICOTERM2 El proyecto coordinado RICOTERM2 tiene como objetivo principal el desarrollo de un prototipo para un sistemamultiling¨ue de reformulaci´on de consultas planteadas por usuarios de Internet interesados en la b´usqueda de informaci´on acerca de un ´ambito comunicativo especializado, en nuestro caso, econom´ıa. El sistema se integrar´a, como se describe en (Lorente, 2005), en una aplicaci´on que consistir´a en una interfaz, ubicada en un portal web especializado en econom´ıa, para la transformaci´on de consultas simples en consultas multiling¨ues expandidas ling¨u´ıstica y conceptualmente. Actualmente las lenguas de trabajo son el catal´an, el castellano, el gallego, el ingl´es y el vasco. El dise˜no general del prototipo est´a tambi´en descrito en (Lorente, 2005): baste aqu´ı, para que puedan ser cabalmente entendidos los objetivos espec´ıficos del subproyecto Gari-Coter, indicar que, con el prop´osito de mejorar los resultados de las aplicaciones implicadas de Recuperaci´on de Informaci´on mediante t´ecnicas de expansi´on de consultas, el proyecto utiliza m´etodos tanto de expansi´on ´unicamente por t´erminos (only-term expansion) como de expansi´on de texto completo (full-text expansion). Para lo primero, se har´a uso de una ontolog´ıa del dominio. Para lo segundo, de un corpus espec´ıfico de econom´ıa, estructural y ling¨u´ısticamenProcesamiento del Lenguaje Natural, nº39 (2007), pp. 295-296 recibido 06-06-2007; aceptado 22-06-2007 ISSN: 1135-5948 © 2007 Sociedad Española para el Procesamiento del Lenguaje Natural
te anotado, el cual habr´a de servir para, mediante el recurso a herramientas como extractores autom´aticos de terminolog´ıa y similares, detectar colocaciones o fraseolog´ıa propia de los t´erminos introducidos por el propio usuario, u obtenidos tras la consulta a la ontolog´ıa. Dentro de este planteamiento general, el proyecto Gari-Coter (aparte de objetivos compartidos, relacionados, como puede suponerse, con el dise˜no y la integraci´on de todo lo producido en una aplicaci´on web) tiene como objetivos propios la constituci´on de los recursos para el gallego: un corpus de econom´ıa, adecuadamente codificado y anotado, adaptando para ello herramientas de procesamiento existentes para el gallego, y un banco de datos terminol´ogicos, obtenido a partir de recursos previos y de la explotaci´on del propio corpus constituido. A falta de algo m´as de seis meses para la finalizaci´on del proyecto, estos recursos han podido ser elaborados en la forma y dimensi´on que someramente describimos a continuaci´on. 2.1. El corpus Como para todas las lenguas implicadas en el proyecto RICOTERM2, no uno sino, en realidad, dos subcorpus de dominio han sido desarrollados para el gallego: un subcorpus gen´erico y uno espec´ıfico. El primero integrado por 609 noticias de peri´odico que suman 206510 palabras distribuidas en 7892 oraciones. El segundo integrado por 14 libros y dos revistas especializadas que entre todos suman 801702 palabras distribuidas en 34588 oraciones. Ambos corpus est´an codificados utilizando el est´andar XML. Cada documento consta de una cabecera con informaci´on bibliogr´afica y de contenido, seguida ´esta del documento mismo, estructurado hasta el nivel de la oraci´on. Ambos corpus, asimismo, han sido anotados morfosint´acticamente con informaci´on acerca de clase de palabras y categor´ıas flexivas consideradas relevantes. En l´ınea con los planteamientos generales del proyecto coordinado (b´usqueda y aprovechamiento de recursos preexistentes), para la constituci´on de ambos corpus llegamos a un acuerdo con el Centro Ram´on Pi˜neiro para a Investigaci´on en Humanidades2, que nos cedi´o los textos procedentes del corpus CORGA, Corpus de Referencia del Gallego Actual, procesados ling¨u´ısticamente con su propio sistema de etiquetaci´on. Toda la anotaci´on del corpus gen´erico fue corregida manualmente. 2.2. El banco de datos terminol´ogico El banco de datos terminol´ogico se ha elaborado a partir, por un lado, de recursos previos que constitu´ıan fuentes considerablemente heterog´eneas3en cuanto a calidad, dimensi´on y fiabilidad: dos diccionarios, dos glosarios electr´onicos y la secci´on de econom´ıa de una base de datos terminol´ogica, ´esta ´ultima la m´as rica y rigurosa sin duda. Actualmente, el banco de datos consta de 6046 t´erminos del dominio econ´omico obtenidos por esta v´ıa, la mayor´ıa de ellos asociados a informaci´on exhaustiva acerca del lema, la clase de palabras y la definici´on, as´ı como, en la mayor´ıa de los casos, equivalentes en otras lenguas e informaci´on sobre sin´onimos e hiper´onimos. El conjunto de t´erminos descrito, asi como el corpus, se han utilizado adem´as para, mediante t´ecnicas de extracci´on autom´atica de t´erminos multipalabra basadas en medidas de similitud contextual, ampliar el banco de datos terminol´ogico. En la ´ultima de las experiencias llevadas a cabo 740 t´erminos multipalabra pudieron obtenerse, pero los resultados de precisi´on asociados, debidos sin duda al reducido tama˜no del corpus, aconsejan, cuanto menos, una revisi´on manual de los mismos. Notas 1Con el mismo acr´onimo y nombre que el proyecto coordinado, financiado por el Ministerio de Educaci´on y Ciencia entre 2004 y 2007, y dirigido por Merc`e Lorente (HUM2004-05658-C02-01/FILO). 2http://www.cirp.es. [Consultado: 6, junio, 2007]. 3Eiras: Eiras Rey, A.: Dicionario de econom´ıa, no publicado. Formoso: Formoso Gosende, V. (coord.) (1997): Diccionario de termos econ´omicos e empresariais galego-castel´an-ingl´es. Santiago de Compostela: Confederaci´on de Empresarios de Galicia. Panlatin Electronic Commerce Glossary: http://fon.gs/panlatino. Glossary about commerce from galego.org: http://galego.org/vocabularios/ccomercial.html. SNL: http://www.usc.es/en/servizos/portadas/snl.jsp. Bibliograf´ıa Lorente, M. 2005. Ontolog´ıa sobre econom´ıa y recuperaci´on de informaci´on [en l´ınea]. Hipertext.net, (3). http://www.hipertext.net. [Consultado: 30, enero, 2007]. Fco. Mario Barcala, Eva Domínguez, Pablo Gamallo, Marisol López, Eduardo Miguel Moscoso, Guillermo Rojo et al. 296