scieee.
DE original EN LT FR IT ES PT PL HU RO UK TR RU NL CS SV EL AR
Machine-translated document

This is a machine-generated translation of the original document and may contain errors, omissions, or changes in meaning. Do not rely on this translation for quotations, citations, or authoritative references. Please consult and cite the original document.

Preparing document pages…

DAIVA ŠVEIKAUSKIENĖ

Instituto de la Lengua Lituana

ARŪNAS RIBIKAUSKAS

Universidad Técnica Gediminas de Vilna

VYTAUTAS ŠVEIKAUSKAS

Instituto de la Lengua Lituana

Líneas de investigación científica: gramática, lingüística computacional.

UN SITIO WEB MULTILINGÜE SOBRE LA GRAMÁTICA DE LA LENGUA LITUANA

Sistema informativo multilingüe en línea sobre la gramática de la lengua lituana

ANOTACIÓN

Hace un año se empezó a trabajar en un proyecto en el Instituto de la Lengua Lituana cuyo objetivo es poner gratuitamente a disposición del usuario en Internet la presentación de datos detallados sobre las propiedades gramaticales de las palabras lituanas. En marzo de 2017 se preparó una versión de prueba que comprende únicamente palabras con la raíz «bėg» (cf. el verbo «bėgti/correr»). La base de datos consta de unos 25.000 registros. El proyecto se propone evitar las deficiencias de los trabajos ya existentes en el campo de la lingüística computacional. Esto concierne al alcance de las palabras, la diversidad de los datos gramaticales y la claridad y comprensibilidad de la presentación de los datos, entre otros aspectos. La información gramatical sobre la palabra introducida por el usuario se presenta en tres áreas: estructura de la palabra, datos morfológicos y datos morfémicos. Este es el primer sitio web de Lituania que ofrece al usuario información sobre los tipos de morfemas. Para cada palabra incluida en la base de datos se puede obtener una tabla de flexión. Para algunas palabras también se proporcionan ejemplos de uso. El sitio web está disponible en siete idiomas: lituano, inglés, alemán, francés, italiano, ruso y japonés, para que puedan utilizarlo los extranjeros interesados en la lengua lituana.

144

Acta Linguistica Lituanica LXXVII

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

PALABRAS CLAVE: gramática, morfología, morfema, sistema de información, lingüística computacional.

ANOTACIÓN

The project was started in the Institute of Lithuanian language in 2016. It aims at presenting detailed data about the grammatical features of Lithuanian words. The goal is to make those data freely accessible to any user on the Internet. The preliminary version covering the words with the root “bėg/run” was published in March 2017. The database contains around 25,000 entries. We are trying to avoid drawbacks that are specific to the words done in the field of computational linguistics. It includes word coverage, grammatical data comprehensiveness, clarity and clearness of presented information etc. Grammatical information about the word in question is presented from three aspects: word structure, morphological data, and morphemic data. It is the first website in Lithuania providing morphemic types. One can get an inflection table for each word the database contains. Usage examples are given for some words. The information on the website is available in seven languages – Lithuanian, English, German, French, Italian, Russian, and Japanese – so foreigners interested in Lithuanian language can use it as well.

PALABRAS CLAVE: gramática, morfología, morfémico, sistema de información, lingüística computacional.

1. INTRODUCCIÓN: LINGÜÍSTICA COMPUTACIONAL

Hasta mediados del siglo XX, todas las gramáticas se imprimían en papel. Tras la llegada de los ordenadores (en 1942 se construyó en la Universidad de Harvard el primer ordenador del mundo, MARK I (Schwanke 1991: 69)), estos comenzaron a introducirse en todos los ámbitos de la vida. Las lenguas no fueron una excepción: pronto quedó claro que los ordenadores podían procesar no solo números, sino también símbolos arbitrarios. Por consiguiente, también pueden procesar lenguas. Varios lingüistas comenzaron a elaborar descripciones formales de las lenguas para que las capacidades de los ordenadores pudieran aplicarse también a ellas (Winograd 1983: 23). En el campo de la inteligencia artificial, el procesamiento del lenguaje se convirtió en una de las áreas de aplicación más importantes (Charis 1989: 71). Desde 1968 hasta 1978, el análisis gramatical de las lenguas fue el tema más importante para los investigadores de inteligencia artificial (Nirenburg 1987: 26). Sin embargo, las lenguas, que se someten tan fácilmente a los seres humanos, resultaron ser un hueso duro de roer para los ordenadores (Jensen, Heidorn,

Straipsniai / Articles

145

DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS

Richardson 1993: 2). Deshalb konnten bislang keine guten Ergebnisse auf dem Gebiet der Sprachverarbeitung mit Hilfe von Computern erreicht werden.

1.1. MÉTODOS ESTADÍSTICOS

Los métodos estadísticos tienen una gran importancia en el procesamiento del lenguaje. Las primeras propuestas para utilizarlos se formularon poco después de la aparición de los ordenadores. Esto se aplica especialmente a la lengua inglesa. David W. Reed abordó el análisis lingüístico cuantitativo (Reed 1949: 236). Waren Weaver fue el primero en expresar la idea de utilizar ordenadores para las traducciones. En 1949 propuso emplear métodos estadísticos para ello. Sin embargo, los científicos de la época los descartaron al cabo de poco tiempo, probablemente debido a la insuficiente cantidad de textos legibles electrónicamente y a la limitada capacidad de los ordenadores de entonces. Unas décadas más tarde, cuando ya se habían recopilado corpus textuales y la aplicación de métodos estadísticos en el reconocimiento del habla había dado buenos resultados, se volvió a recurrir a los métodos estadísticos para la traducción (Brown at al. 1990: 79). En Canadá existían condiciones especialmente favorables para ello, ya que allí se conserva en dos lenguas (inglés y francés) todo el material parlamentario debido a que el país tiene dos idiomas oficiales. Por eso fue posible reunir muy rápidamente una cantidad suficiente de textos paralelos (Al-Onaizan, Curin, Jahr 1999: 1). La estructura de ambas lenguas, es decir, del inglés y del francés, es muy similar: el orden de las palabras es estricto (en primer lugar aparece el sujeto y en segundo lugar, el predicado). Las semejanzas estructurales de las lenguas permitieron obtener buenos resultados en la traducción mediante métodos estadísticos. Pero no ocurre lo mismo con la lengua lituana. Hasta ahora, las traducciones de Google, que utilizan el método estadístico, no ofrecen buenas traducciones al lituano. Según los datos de 2017, los resultados de la traducción tanto del inglés al lituano como del lituano al inglés son peores que los de las traducciones del inglés al letón, del letón al inglés, del inglés al estonio y del estonio al inglés (Skadinš 2017: 22).

Los métodos estadísticos también se extendieron a otras áreas de la lingüística. Los primeros trabajos se ocuparon de la fonética (Zipf 1929). En 1944 se realizaron estudios estadísticos del léxico literario, es decir, se investigó cuántas palabras se habían utilizado una vez, cuántas dos veces, tres veces, etc. (Yule 194: 9).

146

Acta Linguistica Lithuanica LXXVI

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

Desde 1973 se utiliza la denominación dialectometría para designar el área de la lingüística que se ocupa de la investigación cuantitativa de las lenguas y los dialectos (Köhler, Altmann, Piotrowski 2005: 498).

También se aplicaron métodos estadísticos en el ámbito de la morfología. Goldsmith describe así el algoritmo para identificar los morfemas de una palabra: «algorithm that takes as input a list of words and provides as output a segmentation of the words into morphemes» (Goldsmith 2010: 36).

A finales del siglo pasado, la bibliografía rusa describió intentos de realizar un análisis sintáctico automático de oraciones mediante cálculos estadísticos. Los científicos rusos propusieron determinar la estructura sintáctica de las oraciones no basándose en el análisis lingüístico, sino utilizando el procesamiento estadístico de los textos. Sostienen que cada unidad lingüística (palabra, categoría sintáctica de la palabra, construcción sintáctica) aparece en el texto con cierta frecuencia. Por ejemplo, según los datos del diccionario de frecuencias de valencias del inglés, existen 195 patrones distintos de relaciones sintácticas propios del verbo. Sin embargo, los diez patrones más frecuentes por sí solos representan el 86% de todos los casos utilizados en los textos. También se emplean regularidades estadísticas para la estructura lineal de la oración. Cada clase de palabra tiene una frecuencia con la que puede aparecer a cierta distancia del punto de partida. El verbo inglés puede aparecer, con una probabilidad de 0,7, entre la segunda y la quinta posición desde el inicio de la oración. Y con una probabilidad de 0,95 aparece entre la segunda y la décima posición (Церкас 1979: 124).

Más adelante se utilizaron datos de un corpus textual para el análisis sintáctico (Köhler 2012: 31).

Sin embargo, por el momento solo se han obtenido buenos resultados en el procesamiento de la lengua inglesa. Vidas Daudaravičius, que trabaja en el ámbito de la informatización de la sintaxis lituana, afirma: «Naivų manyti, kad metodai, kurie sėkmingai taikomi anglų kalbai, tinka ir kitoms kalboms.»1 (Daudaravičius 2012: 3).

Con ayuda de los métodos estadísticos se pueden crear rápidamente sistemas de funcionamiento ágil, pero bajo una condición: hay que tolerar cierto número de errores (Link 1). Por eso, en el Instituto de la Lengua Lituana se decidió recurrir lo menos posible a la estadística, pues se aspira a lograr la máxima precisión y fiabilidad de los datos.

1 «Es ingenuo pensar que los métodos que se utilizan con éxito para la lengua inglesa también son adecuados para las demás lenguas.»

Straipsniai / Articles

147

DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAUSKAS

1.2. LA SITUACIÓN EN LITUANIA

Ya se han llevado a cabo muchos trabajos en el campo de la informatización de la gramática lituana. La mayoría de ellos solo son comprensibles para especialistas en lingüística computacional. Algunos también están destinados al público general. Sin embargo, solo reflejan propiedades y características aisladas de las palabras y de la gramática. Por ejemplo, en Kaunas, en la Universidad Vytautas Magnus, se creó una base de datos de morfémica a partir de un corpus textual. Allí faltan muchas formas de palabras y se utilizan numerosas abreviaturas que no son comprensibles para todos. Los morfemas se separan con guiones y no se indican datos sobre el tipo de morfema. En el Instituto de Matemáticas e Informática de Vilna se creó una base de datos sobre derivación y morfémica. Allí se indica el tipo de morfema, así como las palabras base y las palabras determinantes (Murmulaitytė 2012: 96). Lamentablemente, la base de datos no es de libre acceso. Por ello, se decidió crear un sistema de información integral, destinado al público general y capaz de ofrecer al usuario datos detallados.

En Internet se pueden observar dos extremos en la presentación de la información gramatical lituana. Son la ausencia incluso de las formas de palabras habituales y la presentación de palabras superfluas, incomprensibles incluso para los hablantes nativos. El sistema de información sobre la gramática lituana procura evitar ambos extremos. Todas las formas de palabras se generan automáticamente mediante un ordenador a partir del lema de la palabra, de modo que se obtiene el conjunto completo de formas flexivas. Todas las derivaciones y composiciones posibles se incorporan a la base de datos. Así, ya no faltan formas de palabras. Después, todas las palabras y formas de palabras generadas por el ordenador se revisan manualmente y se eliminan las variantes inexistentes. De este modo se evita la inclusión de palabras superfluas.

2. LOS TRABAJOS DE LINGÜÍSTICA COMPUTACIONAL EN LITUANIA

En Lituania se pueden distinguir dos métodos de procesamiento computacional de la lengua. En Kaunas, en el Centro de Lingüística Computacional, los trabajos se llevan a cabo a partir de un corpus textual. En Vilna, en la universidad y en el Instituto de la Lengua Lituana, se parte más bien de las propiedades de la propia lengua lituana. Ambos métodos tienen ventajas y desventajas. A continuación, se mostrará esto con algunos ejemplos.

148

Acta Linguistica Lithuanica LXXVI

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

2.1. TRABAJOS BASADOS EN CORPUS TEXTUALES

En la Universidad Vytautas Magnus de Kaunas se creó un corpus textual de la lengua lituana contemporánea. Se utiliza para distintos tipos de procesamiento lingüístico. En el ámbito de la gramática, se elaboró un diccionario de morfemas (Rimkutė, Kazlauskienė, Rąkinis 2011) y, algunos años después, también una base de datos. Se ofrecen al usuario tanto datos morfémicos como morfológicos. Esta es la primera fuente de libre acceso en la que la palabra se divide en sus morfemas. Lamentablemente, no se indica el tipo de morfema, lo que a veces da lugar a una representación confusa de la estructura morfémica de la palabra. Esto ocurre cuando palabras de estructura diferente se representan de la misma manera. La figura 1 muestra un ejemplo. Las palabras «per-ei-ti» (pasar) y «per-ė-ti» (incubar) apenas se diferencian en su forma externa. En la base de datos de morfemas, las estructuras morfémicas de ambas palabras aparecen iguales. Sin embargo, en la primera palabra, el morfema «per» es el prefijo, mientras que en la segunda, ese mismo primer morfema «per» es la raíz.

FIGURA 1. Las palabras con estructuras morfémicas diferentes aparecen representadas de la misma manera (Rimkutė, Kazlauskienė, Rąkinis 2011: 8, 35)

Como segundo inconveniente, cabe mencionar la ausencia incluso de formas de palabras habituales. En lituano, los participios tienen seis casos. La tabla 1 muestra la presencia de las formas de palabra (singular, masculino) del participio «bėgantis / que corre, que fluye» en la base de datos de morfemas.

Se observa que falta incluso el lema (nominativo, singular) de esta palabra. Tampoco puede considerarse que las otras formas ausentes, por ejemplo, el locativo (bėgančiame vandenyje / en el agua corriente), sean raras o inusuales. Así pues, solo están presentes 2 formas de palabra de los 6 casos.

Los científicos que estudian la segunda lengua báltica, el letón, también señalan que el corpus textual contiene un número insuficiente de formas de palabras (Paikens, Rituma, Pretkalniņa 2013: 272).

Straipsniai / Articles

149

DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBIKAS, VYTAUTAS ŠVEIKAUSKAS

TABLA 1.

La presencia en la base de datos (enlace 2) de las formas del participio bēgantis / corriendo, fluyendo en singular, masculino

Caso

Palabra

Base de datos

Nominativo

bēgantis

falta

Genitivo

bēgančio

presente

Dativo

bēgančiam

falta

Acusativo

bēgantį

presente

Instrumental

bēgančiu

falta

Locativo

bēgančiame

falta

En total:

6

2

2.2. PUNTO DE PARTIDA – LA LENGUA LITUANA

En la Universidad de Vilna se parte de las propiedades de la lengua lituana. El sitio web Morfologija.lt (enlace 3) incluso presenta las tablas de flexión de la palabra. Lamentablemente, hay muchos espacios vacíos, a veces para todo el paradigma. A veces aparecen también palabras desconocidas e incomprensibles para un lituano, por ejemplo, «sutikimoji» (enlace 4) y otras similares. En el Instituto de Matemáticas e Informática de Vilna se creó una base de datos sobre formación de palabras y morfémica (Murmulaitytė 2012). Contiene información muy valiosa (el tipo de morfema, la palabra base, el elemento determinante, entre otros), pero lamentablemente los datos no son de libre acceso.

3. EL SISTEMA DE INFORMACIÓN PARA LA GRAMÁTICA LITUANA

La lengua lituana pertenece al grupo de las lenguas menos informatizadas de Europa (Vaišnienė, Zabarskaitė 2012: 35). Por eso se decidió crear un sistema de información que contuviera datos detallados sobre las propiedades gramaticales de las palabras lituanas. Los científicos que estudian las lenguas bálticas suelen subrayar la necesidad de crear más software para un amplio grupo de usuarios. En las instrucciones de las conferencias BSNLP (Balto-Slavic Natural Language Processing) de 2015 y 2017 se lee: «se recomienda encarecidamente la presentación de sistemas que se pongan a disposición del público general»

150

Acta Linguistica Lithuanica LXXVI

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

que describan sistemas puestos a disposición del público general / se fomentará especialmente a las instituciones que describan sistemas disponibles para el público general» (enlace 5).

Por ello se concibió la idea de diseñar el sistema de información para la gramática lituana para un amplio grupo de usuarios y presentar los datos de la forma más sencilla y comprensible posible.

En consecuencia, se optó por un diseño web adaptable (RW) para responder lo mejor posible a las necesidades de los usuarios. Así, la información gramatical sobre la palabra se presenta en mosaicos (en inglés, tiles) (enlace 6). Por eso también se puede acceder al sitio web desde un teléfono móvil.

3.1. MÉTODO DE CREACIÓN DE LA BASE DE DATOS

El objetivo de informatizar la gramática es disponer en formato electrónico de toda la información gramatical sobre cada palabra y todas sus formas. Hay dos maneras de lograrlo. La primera consiste en crear una descripción formal de las reglas gramaticales (lo que sería una especie de herramienta) y, después, hacer que el ordenador genere los datos necesarios. La segunda consiste en almacenar en el ordenador toda la información gramatical sobre todas las formas de todas las palabras y recuperarla cuando sea necesario. Aún está por discutirse cuál de los dos procedimientos requiere más trabajo. En el Instituto de Matemáticas e Informática se desarrolló un software para el análisis morfológico de la lengua lituana (Zinkevičius 2000), para el que se había utilizado el primer método. Sin embargo, no se logró alcanzar una precisión del 100%: hay datos erróneos y algunas palabras lituanas no se reconocen.

Durante el desarrollo del sistema de información para la gramática lituana se descartó este método por la siguiente razón: para que el ordenador pueda procesar las palabras por sí mismo, hay que indicarle con mucha precisión qué operaciones debe realizar con cada palabra. Por tanto, primero hay que dividir todas las palabras en grupos de tal manera que se apliquen las mismas regularidades a todos los miembros de un grupo, es decir, que pueda utilizarse el mismo método de procesamiento. Para asignar una palabra a uno u otro grupo, hay que determinar muchos rasgos en función de los cuales se agruparán las palabras. Por ejemplo, en el análisis sintáctico de la lengua lituana se utiliza el rasgo semántico [tiempo] para determinar la función sintáctica del acusativo de los sustantivos. En la oración «Visą naktį ji

Straipsniai / Articles

151

DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS

«skaitė šią knygą / Leyó este libro toda la noche» y «Visą knygą ji perskaitė šią naktį / Leyó el libro entero esa noche». Las dos palabras knygą/libro y naktį/noche no difieren en cuanto a las categorías morfológicas: ambas son femeninas, singulares y acusativas; solo el rasgo semántico [tiempo], que posee la palabra naktis/noche y no la palabra knyga/libro, permite que el ordenador considere correctamente la palabra naktį/noche como complemento de tiempo y la palabra knygą/libro como objeto de la oración. Hay que hacer algo parecido también para la morfología. Uno de los errores del software ya creado para el análisis morfológico de la lengua lituana consiste en considerar el morfema -ėj- como sufijo en raíces con las que no puede combinarse. Hay que determinar rasgos de las palabras que permitan al ordenador decidir con qué raíces puede combinarse este sufijo -ėj-. Pero hacerlo es muy complicado. ¿Qué rasgo tienen en común, por ejemplo, las palabras geroė/Bienestar, žinovas/experto y daržovė/verdura? Que todas tienen el sufijo -ov-. ¿Y qué las distingue de todas las demás palabras a cuyas raíces no puede añadirse este sufijo (no se puede decir *kėdovė, derivación con el sufijo -ov- de la palabra kėdė/silla)? ¿Y qué rasgo lo indica?

Así pues, para desarrollar el sistema de información de la gramática lituana se eligió la segunda vía; es decir, se preparó una base de datos que contiene información gramatical detallada sobre todas las formas de todas las palabras de la lengua lituana. Aquí no es necesario partir de las categorías gramaticales (como ocurre en todas las gramáticas impresas en papel), sino de la palabra misma: para cada palabra se debe ofrecer al usuario toda la información relacionada con ella.

Se decidió tomar una raíz como punto de partida y desarrollar un software que reflejara toda la estructura de la gramática lituana. Como primera prueba se eligió la raíz bėg (del verbo bėgti/correr). A continuación, se generaron con el ordenador todas las derivaciones posibles y después se eliminaron a mano todas las palabras que no existen en la lengua lituana. En total, la base de datos contiene alrededor de 25.000 entradas.

3.2. PARTICULARIDADES DE «LIGIS»

El sistema de información de la gramática de la lengua lituana (Lietuvių kalbos gramatikos informacinė sistema – LIGIS) (enlace 7) tiene dos características esenciales. En primer lugar, ofrece al usuario información más detallada sobre una palabra concreta que las gramáticas impresas en papel. Y

152

Acta Linguistica Lithuanica LXXVI

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

en segundo lugar, incluye más palabras que los diccionarios. En las gramáticas se presentan las reglas aplicables a un grupo determinado de palabras. Pero no se mencionan allí todas las palabras a las que se aplica cada regla. LIGIS reúne toda la información relacionada con la palabra introducida por el usuario y la presenta en un sitio web. Los diccionarios no contienen todas las palabras de la lengua lituana; en ellos faltan muchas derivaciones y palabras compuestas. LIGIS incluye todas las derivaciones posibles. Puede darse un ejemplo para comparar. La base de datos de Morphem contiene alrededor de 75.000 entradas, pero estas corresponden a distintas palabras lituanas. Actualmente, la base de datos de LIGIS consta de 25.000 entradas e incluye únicamente palabras de una misma raíz: beg-. En la base de datos de Morphem hay 118 palabras con esta raíz.

3.3. ESTRUCTURA DE LA PALABRA

Tras introducir la palabra, se explica al usuario su estructura: se indican el lema y la palabra base, así como el determinante en las derivaciones y composiciones. Si la palabra es gramaticalmente ambigua, cada uno de sus significados recibe un número de lema. Después se muestran bajo ese número los datos morfológicos y morfémicos. En el anexo A se ofrece un ejemplo de una palabra ambigua.

Formas restantes. Así se llama el botón (en inglés, button) situado en el recuadro de la estructura de la palabra. El sitio web de análisis morfológico de la lengua rusa (enlace 8) muestra cada vez todas las formas de la palabra introducida. En el sistema de información de la gramática lituana se decidió incorporar un botón y permitir que el usuario consulte las formas restantes mediante un enlace, porque no necesita ver cada vez todas las formas de una palabra.

3.4. DATOS MORFOLÓGICOS

La información morfológica comprende la denominación de la categoría gramatical y las categorías gramaticales: caso, género y número para los sustantivos; persona, tiempo y modo para los verbos, etc. Las palabras ambiguas reciben una numeración cuando, por ejemplo, un sustantivo tiene varias formas de caso homónimas.

En la base de datos de morfemas (enlace 2) también hay datos morfológicos sobre la palabra. Sin embargo, la información se presenta exclusivamente en abreviaturas

Straipsniai / Articles

153

DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS

y abreviaturas. Un ejemplo de este tipo se muestra en la Figura 2. Para los no especialistas, tantas abreviaturas pueden resultar a menudo incomprensibles. En particular, la información presentada de esta manera puede resultar a veces poco clara para los extranjeros que estudian o aprenden lituano.

FIGURA 2. Datos sobre la palabra begčio, presentados exclusivamente mediante abreviaturas (enlace 2)

En el sistema de información de la gramática lituana no se utilizan abreviaturas. Todos los datos se escriben completos (Anexo A).

3.5. DATOS MORFÉMICOS

La diferencia más importante con respecto a las bases de datos a las que ya se puede acceder hoy1 consiste en indicar el tipo de cada morfema. Solo así se logra la claridad en la representación de los morfemas de una palabra. De lo contrario, por ejemplo, no se puede distinguir la segunda raíz de una palabra compuesta del sufijo, como ocurre en la base de datos de morfémica.

La primera característica decisiva fue representar los morfemas con distintos colores. Se asignó un color a cada tipo de morfema (raíz, prefijo, sufijo, terminación). Los prefijos se escriben en azul. Para la raíz se utilizó el rojo. Los sufijos se representan en verde y para la terminación se eligió el negro.

Además, la palabra descompuesta en morfemas se dispone en vertical y, junto a ella, no solo se escribe la denominación del tipo de cada morfema de la palabra, sino que también se indican sus propiedades, si las tiene; por ejemplo, para un sufijo: derivativo o flexivo; para las terminaciones: abreviada, pronominalizada, etc. En el caso de las terminaciones abreviadas, muy extendidas en la lengua hablada, también se muestra al lado la terminación completa. Como ejemplo, pueden citarse las palabras de la lengua hablada: šnekamoje kalboje: terminaciones completas; šnekamoj kalboj: terminaciones abreviadas. Si la palabra tiene la terminación completa, no se indica ninguna característica de longitud, porque la mayoría de las palabras tienen terminaciones completas y esa información sería superflua. Si

154

Acta Linguistica Lithuanica LXXVI

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

Si la terminación no está pronominalizada, tampoco se indica la información al respecto.

Los cambios fonéticos se consideran una propiedad de la raíz. Pueden ser tanto cambios consonánticos como vocálicos. En la lengua lituana puede observarse otro tipo de cambio fonético: la desaparición de consonantes en el imperativo. Los infijos también forman parte de los cambios fonéticos de la raíz de una palabra. Se considera que una propiedad del prefijo es su origen: preposicional, derivado de una partícula o internacional.

En caso de ambigüedad gramatical de las palabras, se examinan las estructuras morfémicas. Si son iguales, se describe una sola estructura. Sin embargo, si difieren, se indican las estructuras morfémicas para cada significado de la palabra (Anexo A).

3.6. TODAS LAS FORMAS DE LA PALABRA

Para cada palabra incluida en la base de datos, se puede consultar la tabla de flexión haciendo clic en el botón «Otras formas». Allí se muestran todos los datos de la ficha morfológica. En la parte superior de la tabla se indican las categorías que no aparecen en la tabla de flexión; por ejemplo, los sustantivos de la lengua lituana no se flexionan según el género, por lo que este se indica en la parte superior de la tabla, junto con el lema y la categoría gramatical. Los adjetivos y los participios tienen tres géneros, y una particularidad de la lengua lituana es que solo dos de ellos (masculino y femenino) tienen los seis casos. El tercer género tiene una sola forma, por lo que se indica sin especificar el caso (Anexo B). Para los verbos se muestran todas las formas temporales en todos los modos (Anexo D).

De este modo, las clases de conjugación y de declinación resultan innecesarias, por lo que no se indican datos al respecto.

Para algunas palabras también se incluyen ejemplos de uso en la tabla de flexión. Para ello se utiliza la información emergente (en inglés tooltip). En el Anexo C se ofrece como ejemplo la palabra «bėgis» (acusativo, singular del sustantivo bėgis / riel, carrera).

3.7. LA BASE DE DATOS

Al desarrollar la base de datos, se procuró alcanzar la mayor calidad y fiabilidad posibles. Por ello, una gran parte del trabajo se realizó a mano

Straipsniai / Articles

155

DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAUSKAS

hecho, porque solo con la ayuda del ser humano se puede obtener una información de máxima fiabilidad (Sulger 2013: 53).

En el Instituto de la Lengua Lituana se llevaron a cabo investigaciones sobre los prefijos lituanos. Se constató que en la lengua lituana hay alrededor de 600 combinaciones de prefijos (Šveikauskienė 2015: 195). Por «combinaciones» se entienden diferentes conjuntos de prefijos que pueden aparecer delante de la raíz, por ejemplo, at-bėgi, nu-bėgi, ne-be-at-bėgti, ne-nu-bėgti, te-be-bė-ti, etc. Se observó que solo 220 de estas combinaciones se usan con las raíces de los verbos; las demás, por ejemplo, nuo-, se usan con sustantivos: nuo-monė /la opinión. El software se diseñó de modo que conectara automáticamente la raíz con todas las combinaciones posibles de prefijos. Después, las personas comprueban los resultados proporcionados por el ordenador e incorporan a la base de datos las palabras que realmente existen en la lengua lituana. De este modo se logran evitar dos extremos: tanto el número excesivo de formas generadas por el ordenador como una cobertura insuficiente de las palabras.

Todos los lemas y la información gramatical correspondiente se introducen manualmente en la base de datos. Como el software creado en el Instituto de Matemáticas e Informática no comete errores al generar las formas de las palabras a partir del lema dado, se confió al ordenador la tarea de crear automáticamente las entradas de las demás formas de las palabras.

Cabe destacar que en LIGIS también se procesan las palabras con terminaciones truncadas. Estas palabras aparecen con mucha frecuencia en la lengua hablada, y ninguna de las bases de datos existentes procesa estas formas de palabras. Además, hay que subrayar que LIGIS también contiene derivados que faltan incluso en el diccionario de la lengua lituana en 20 volúmenes, así como en su versión electrónica (enlace 9), por ejemplo, neužbėgti/no volver a correr hacia arriba.

En la base de datos, la información se almacena en un formato compatible con los ordenadores, es decir, se utiliza la codificación en Prage Markup Language (Hana, Štepánek 2012). Esta forma de los datos no se presenta en Internet, ya que sería superflua para quienes no son especialistas en lingüística computacional.

El hecho de que toda la información se almacene en una base de datos también convierte a LIGIS en una herramienta útil para los lingüistas que investigan la lengua lituana. Se pueden obtener diversos tipos de información; por ejemplo, se pueden buscar palabras con una combinación determinada de prefijos y sufijos, entre otras cosas.

156

Acta Linguistica Lithuanica LXXVI

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

3.8. MULTILINGÜISMO DEL SITIO WEB

El sitio web está disponible en siete idiomas: lituano, inglés, alemán, francés, italiano, ruso y japonés. La necesidad de disponer de un sitio web multilingüe surgió debido a la insatisfactoria traducción de Google del lituano. La traducción automática de la lengua lituana no es fiable. Por eso se decidió hacer multilingüe el sitio web sobre la gramática lituana y utilizar únicamente textos traducidos por personas. La situación de los demás idiomas no es evidentemente mucho mejor. Así lo atestigua la carta de Lingvist del 8 de junio de 2017, en la que se solicita que la denominación LINGUIST sea traducida por hablantes nativos y que no se recurra en ningún caso a una traducción automática (LinguiList 2017: 28.252).

Al decidir crear un sitio web multilingüe, nuestra idea era la siguiente: si un extranjero, por ejemplo un noruego, aprende o estudia la lengua lituana y algunas palabras lituanas le resultan conocidas, pero otras todavía no, puede elegir un idioma que domine mejor que el lituano, por ejemplo, el alemán, y así comprenderá todas las palabras lituanas que desconoce. Para ello, se previó incluso conservar la palabra introducida por el usuario al cambiar de idioma. Es decir, cuando un usuario elige otro idioma, no tiene que volver a introducir la palabra.

4. PLANES PARA EL FUTURO

En la Universidad de Vilna hay muchos diccionarios bilingües digitalizados. En el Instituto de la Lengua Lituana se digitalizó el gran diccionario en 20 volúmenes, así como los demás diccionarios monolingües: de sinónimos, antónimos, fraseologismos, entre otros. Está previsto conectar ambos tipos de diccionarios con el sistema de información de la gramática lituana y crear un equivalente de la página web alemana CANOONET (enlace 10).

Como el sistema de información de la gramática de la lengua lituana contiene datos sobre los morfemas, es posible buscar palabras basándose en el modelo morfémico. Y precisamente esto es lo que está previsto para el futuro.

Una pestaña (en inglés, tab) está destinada a la teoría en la página web LIGIS y actualmente se encuentra en preparación. Allí se ofrecerán conocimientos académicos más profundos sobre la gramática lituana.

Straipsniai / Articles

157

DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAUSKAS, VYTAUTAS ŠVEIKAUSKAS

En la primera etapa se trabaja en la morfología. En la segunda fase también se introducirán datos sintácticos.

5. Conclusiones

1. Este enfoque también puede ser útil y adecuado para otras lenguas con una flexión rica.

2. El sistema de información de la gramática lituana puede ser de gran utilidad para escolares, estudiantes y extranjeros que aprenden lituano, así como para lingüistas que investigan la lengua lituana.

3. Los datos recopilados también pueden servir como documentación de la lengua lituana.

Literaturverzeichnis

Al – Onaizan Yaser, Curin Jan, Jahr Michael, Knight Kevin, Lafferty John, Melamed Dan, Och Franz – Josef, Purdy David, Smith Noah A., Yarowsky David 1999: Statistical Machine Translation. – Final Report JHU Workshop. http://mt-archive.info/JHU-1999-AlOnaizan.pdf (Zugriff am 21.11. 2017).

Brown Peter F., Cocke John, Della Pietra Stephen A., Della Pietra Vincent J., Jelinek Frederick, Lafferty John D., Mercer Robert L., Roossin Paul S. 1990: A Statistical Approach to Machine Translation. – Computational Linguistics Volume 16, Number 2, June, 79–85. http://www.aclweb.org/anthology/J90-2002 (Zugriff am 21.11. 2017).

Charniak Christopher E. 1989: Artificial Intelligence & Turbo C. Homewood: Dow Jones-Irwin.

Daudaravičius Vidas 2012: Teksto skaidymas pastoviųjų junginių segmentais. Daktaro disertacijos santrauka. Kaunas: Vytauto Didžiojo universitetas.

Goldsmith John A. 2010: Segmentation and Morphology. The Handbook of Computational Linguistics and Natural Language Processing. Wiley-Blackwell, 364–393.

Han Jirka, Štěpánek Jan 2012: Prague Markup Language Framework. Procedings of the 6th Linguistic Annotation Workshop. Jeju, Republic of Korea, 12–13 July, 12–21.

Jensen Karen, Heidorn George Emil, Richardson Stephen D. 1993: Natural language processing: The PLNLP Approach. Boston / London: Kluwer Academic Publishers.

158

Acta Linguistica Lithuanica XXVII

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

Köhler Reinhard 2012: Quantitative Syntax Analysis. De Gruyter Mouton.

Köhler Reinhard, Altmann Gabriel, Piotrowski Rajmund G. 2005: Quantitative Linguistik. Berlin / New York: Walter de Gruyter.

Linguist List 2017: 28.254, Qs: How do you say the LINGUIST List in your language? 08 Jun 2017. [email protected].

Murmulaitytė Daiva 2012: Lietuvių kalbos morfemikos ir žodžių darybos tyrimų perspektyvos. – Žmogus ir žodis 1(14), 96–102.

Nirenburg Sergei 1987: Machine Translation: Theoretical and Methodological Issues. London: Cambridge University Press.

Paikens Pēteris, Rūma Laura, Pretkalniņa Lauma 2013: Morphological Analysis with limited resources: Latvian example. Proceedings of the 19th Nordic Conference of Computational Linguistics. (NODALIDA 2013); Linköping Electronic Conference Proceedings #85, 267–277.

Reed David W. 1949: A Statistical Approach to Quantitative Linguistic Analysis, WORD, 5:3, 235–247, DOI: 10.1080/00437956.1949.11659355.

Rimkutė Erika, Kazlauskienė Asta, Raškinis Gailius 2011: Dažnis lietuvių kalbos žodyne. Kaunas: VDU.

Schwanke Martina 1991: Maschinelle Übersetzung: Ein Überblick über Theorie und Praxis. Berlin: Springer-Verlag.

Skadiņš Raivis 2017: Neural MT and other Language Technologies at TILDE. http://school.gramaticframework.org/2017/slides/Ravis-Neural_MT_at_Tilde.pdf (zugegriffen 2017.11.21).

Sulger Sebastian, Butt Miriam, King Tracy Holloway, Meurer Paul 2013: ParGramBank: The ParGram Parallel Treebank. – Proceedings of the 51st Annual Meeting of the Association for Computational Linguistics, Sofia, Bulgaria, 550–560. http://aclweb.org/anthology/P/P13/P13-1054.pdf (zugegriffen 2017.11.21).

Šveikauskienė Daiva 2015: Morphemic structure of the Lithuanian prefixes. – Language: Meaning and Form 6. – Language System and Language Use. Rīga: Latvijas universitāte, 189–197.

Vaišnienė Daiva, Zabarskaitė Jolanta 2012: The Lithuanian Language in the Digital Age. – G. Rehm, H. Uszkoreit White Paper Series. Heidelberg / New York / Dordrecht / London: Springer.

Winograd Terry 1983: Language as a Cognitive Process 1. Syntax. London: Addison-Wesley Publishing Company.

Straipsniai / Articles

159

DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAS

Yule George Udny 1944: The Statistical Study of Literary Vocabulary. Cambridge MA, Cambridge university press.

Zinkevičius Vytautas 2000: Lemoklis – morfologinė analizė. – Darbai ir dienos 24, 245–273.

Zipf George Kingsley 1929: Relative frequency as a Determinant of Phonetic Change. – Harvard studies in classical philology 40, 1–95.

Сердюков Пётр Иванович 1979: Оптимизация алгоритма поиска синтаксических связей. – Международный семинар по машинному переводу. Москва: ВЦП, 123–125.

LINKS

Link 1: http://www.digitalgrammars.com/ (Zugriff am 21.11. 2017)

Link 2: http://tekstynas.vdu.lt/page.xhtml?id=morfema-db (Zugriff am 21.11. 2017)

Link 3: http://morfologija.lt/ (Zugriff am 21.11. 2017)

Link 4: http://morfologija.lt/zodzio-formos/sutikimas (Zugriff am 21.11. 2017)

Link 5: http://bsnlp-2017.cs.helsinki.fi/cfp.html (Zugriff am 21.11. 2017)

Link 6: https://de.wikipedia.org/wiki/Microsoft_Windows_8#Oberfl.C3.A4che (Zugriff am 21.11. 2017)

Link 7: http://ligis.lki.lt/ (Zugriff am 21.11. 2017)

Link 8: http://goldlit.ru/component/slog (Zugriff am 21.11. 2017)

Link 9: http://www.lkz.lt/Visas.asp?zodis (Zugriff am 21.11. 2017)

Link 10: http://www.canoo.net/ (Zugriff am 21.11. 2017)

160

Acta Linguistica Lithuanica LXXVI

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

ANHANG A. GRAMMATISCHE INFORMATION.

Beispiel des grammatisch mehrdeutigen Wortes nubəɡti / hinlaufen-hingelaufen.

Die grammatische Information wird in der Website in Kacheln ausgelegt.

Diese Darstellungsweise ist günstig für responsives Webdesign – RWD.

Bemerkung: Die Farben sind im Bild entfernt.

Straipsniai / Articles

161

DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS

ANHANG B. FORMENtABELLE FÜR DEKLINATION.

Als Beispiel wird die Flexion des Partizips nubėtas / hingelaufene in allen drei Genera und allen Kasus angeführt.

NUBĖTASPARTIZIP II, PASSIV, PRÄTERITUMMännlichSingularPluralNominativnubėtasnubėtiGenitivnubėtonubėtųDativnubėtamnubėtiemsAkkusativnubėtąnubėtusInstrumentalnubėtunubėtaisLokativnubė tamenubėtuoseWeiblichSingularPluralNominativnubėtanubėtosGenitivnubėtosnubėtųDativnubėtainubė tomsAkkusativnubėtąnubėtasInstrumentalnubėtanubėtomisLokativnubėtojenubėtoseNeutrumnubėta

162

Acta Linguistica Lithuanica LXXVI

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

ANHANG C. TOOLTIP FÜR VERWENDUNGSBEISPIELE.

Als Beispiel wird die Schnellinfo für die Akkusativ-Singular-Form bėgį des Substantivs bėgis / Lauf, Getriebe, Eisenbahnschiene angeführt.

Straipsniai / Articles

163

DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAS

ANANG D. FORMENTABELLE FÜR KONJUGATION.

Als Beispiel wird die Flexion des Verbs bėgti / laufen in allen Tempusformen und Modi angeführt.

164

Acta Linguistica Lithuanica LXXVII

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

Daugakalbė lietuvių kalbos gramatikos informacinė sistema internete

SANTRAUKA

Lietuvių kalbos kompiuterizavimo darbuose galima pastebėti du pagrindinius trūkumus: trūksta kartais net ir dažnai vartojamų formų ir pateikiami pertekliniai, lietuvių kalboje neegzistuojantys žodžiai. Kuriant Lietuvių kalbos gramatikos informacinę sistemą (LIGIS) stengiamasi išvengti jų abiejų. Visos formos generuojamos kompiuteriu automatiškai ir vėliau gauti rezultatai peržiūrimi žmogaus, kad būtų atmesti lietuvių nesuprantami žodžiai.

Lietuvių kalbos gramatikos informacinė sistema apima visus darinius. Šiuo metu duomenų bazę sudaro tik šakn inės beg-žodžiai. Jų yra apie 25 000. Palyginimui galima pateikti tokius duomenis: morfemos duomenų bazę sudaro yra apie 75 000 įrašų, bet jie surinkti iš visos lietuvių kalbos leksikos. Su šaknimi beg- ten yra 118 žodžių.

Kuriant Lietuvių kalbos gramatikos informacinę sistemą pagrindinis tikslas buvo pateikti išsamią gramatinę informaciją plačiajai visuomenei. Todėl buvo stengiamasi duomenis atvaizduoti kuo aiškiau ir suprantamiau. Svetainė pritaikyta naudotis ir mobiliuosiuose telefonuose.

Vartotojas, pateikęs žodį, gauna trijų tipų informaciją apie jį: žodžio struktūrą (pradinę formą bei pamatinį žodį dariniams), morfologinę informaciją (kalbos dalis bei jos morfologinės kategorijos – linksnis, giminė, skaičius, laikas, laipsnis ir t. t.) ir morfeminiai duomenys – žodis išskaidytas morfemomis, nurodant morfemos tipą bei požymius, jei morfema jų turi, pavyzdžiui, priesaga – darybinė / kaitybinė, galūnė – įvardžiuotinė, sutrumpėjusi ir kt. Kiekviena morfema žymima vis kita spalva. Reikia pabrėžti, kad Lietuvių kalbos gramatikos informacinė sistema yra pirmasis tinklapis Lietuvoje, kur vartotojui pateikiama informacija apie morfemos tipą. Be to, apdorojami ir žodžiai su sutrumpėjusiomis galūnėmis, kurios labai paplitusios, ypač šnekamojoje kalboje.

Kiekvienam duomenų bazėje esančiam žodžiui vartotojas gali gauti visą kaitybinę lentelę. Kai kuriems žodžiams pateikiama vartojimo pavyzdžių.

Kuriant Lietuvių kalbos gramatikos informacinę sistemą siekiama kuo didesnio tikslumo ir patikimumo. Todėl visos temos (žodžių pradinės formos – vardininkas, bendratis) suvedamos į duomenų bazę rankomis. Kaitybines formas sugeneruoti patikėta kompiuteriui, nes šiame jo darbe nebuvo pastebėta klaidų.

Svetainė pateikiama septyniomis kalbomis: lietuvių, anglų, vokiečių, prancūzų, italų, rusų ir japonų.

Ateityje planuojama Lietuvių kalbos gramatikos informacinę sistemą jungti su skaitmenintais žodynais ir sukurti vokiečių tinklapio CANOONET analogą.

Straipsniai / Articles

165

DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAUSKAS, VYTAUTAS ŠVEIKAUSKAS

Įteikta 2017 m. rugsėjo 5 d.

DAIVA ŠVEIKAUSKIENĖ

Petro Vileišio g. 5, LT-10308 Vilnius, Lietuva [email protected]

ARŪNAS RIBAUSKAS

Saulėtekio al. 11, LT-10221 Vilnius, Lietuva [email protected]

VYTAUTAS ŠVEIKAUSKAS

Petro Vileišio g. 5, LT-10308 Vilnius, Lietuva [email protected]

166

Acta Linguistica Lithuanica LXVII