scieee.
DE original EN LT FR IT ES PT PL HU RO UK TR RU NL CS SV EL AR
Machine-translated document

This is a machine-generated translation of the original document and may contain errors, omissions, or changes in meaning. Do not rely on this translation for quotations, citations, or authoritative references. Please consult and cite the original document.

Preparing document pages…

DAIVA ŠVEIKAUSKIENĖ

Institut de langue lituanienne

ARŪNAS RIBIKAUSKAS

Université technique Gediminas de Vilnius

VYTAUTAS ŠVEIKAUSKAS

Institut de langue lituanienne

Domaines de recherche scientifique: grammaire, linguistique informatique.

UN SITE WEB MULTILINGUE SUR LA GRAMMAIRE DE LA LANGUE LITUANIENNE

Système d’information multilingue en ligne sur la grammaire de la langue lituanienne

ANNOTATION

Il y a un an, l’Institut de la langue lituanienne a commencé à travailler sur un projet visant à mettre gratuitement à la disposition des utilisateurs, sur Internet, une présentation détaillée des données relatives aux propriétés grammaticales des mots lituaniens. En mars 2017, une version d’essai a été préparée, qui ne comprend que les mots ayant la racine « bėg » (cf. le verbe « bėgti/courir »). La base de données se compose d’environ 25 000 entrées. Le projet s’efforce d’éviter les lacunes des travaux déjà réalisés dans le domaine de la linguistique informatique. Cela concerne l’étendue du vocabulaire, la diversité des données grammaticales, la clarté et l’intelligibilité de la présentation des données, entre autres. Les informations grammaticales relatives au mot saisi par l’utilisateur sont présentées dans trois sections: la structure du mot, les données morphologiques et les données morphémiques. Il s’agit du premier site Web en Lituanie où des informations sur les types de morphèmes sont fournies à l’utilisateur. Pour chaque mot figurant dans la base de données, on peut obtenir un tableau de flexion. Des exemples d’emploi sont également indiqués pour certains mots. Le site Web est disponible en sept langues: lituanien, anglais, allemand, français, italien, russe et japonais, afin que les étrangers qui s’intéressent à la langue lituanienne puissent l’utiliser.

144

Acta Linguistica Lituanica LXXVII

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

MOTS-CLÉS: grammaire, morphologie, morphème, système d’information, linguistique informatique.

ANNOTATION

The project was started in the Institute of Lithuanian language in 2016. It aims at presenting detailed data about the grammatical features of Lithuanian words. The goal is to make those data freely accessible to any user on the Internet. The preliminary version covering the words with the root “bėg/run” was published in March 2017. The database contains around 25,000 entries. We are trying to avoid drawbacks that are specific to the words done in the field of computational linguistics. It includes word coverage, grammatical data comprehensiveness, clarity and clearness of presented information etc. Grammatical information about the word in question is presented from three aspects: word structure, morphological data, and morphemic data. It is the first website in Lithuania providing morphemic types. One can get an inflection table for each word the database contains. Usage examples are given for some words. The information on the website is available in seven languages – Lithuanian, English, German, French, Italian, Russian, and Japanese – so foreigners interested in Lithuanian language can use it as well.

MOTS-CLÉS: grammaire, morphologie, morphémique, système d’information, linguistique informatique.

1. INTRODUCTION: LINGUISTIQUE INFORMATIQUE

Jusqu’au milieu du XXe siècle, toutes les grammaires étaient imprimées sur papier. Après l’apparition des ordinateurs (en 1942, le premier ordinateur au monde, MARK I, fut construit à l’université Harvard (Schwanke 1991: 69)), ceux-ci commencèrent à pénétrer dans tous les domaines de la vie. Les langues ne firent pas exception: il devint bientôt évident que les ordinateurs pouvaient traiter non seulement des nombres, mais aussi des symboles quelconques. Par conséquent, ils peuvent également traiter les langues. Plusieurs linguistes entreprirent d’élaborer des descriptions formelles des langues afin que les capacités des ordinateurs puissent également être appliquées aux langues (Winograd 1983: 23). Dans le domaine de l’intelligence artificielle, le traitement du langage devint l’un des principaux champs d’application (Charis 1989: 71). De 1968 à 1978, l’analyse grammaticale des langues fut le sujet de recherche le plus important pour les chercheurs en intelligence artificielle (Nirenburg 1987: 26). Cependant, les langues, qui se laissent si facilement apprivoiser par les humains, se révélèrent être un véritable casse-tête pour les ordinateurs (Jensen, Heidorn,

Straipsniai / Articles

145

DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS

Richardson 1993: 2). Deshalb konnten bislang keine guten Ergebnisse auf dem Gebiet der Sprachverarbeitung mit Hilfe von Computern erreicht werden.

1.1. MÉTHODES STATISTIQUES

Les méthodes statistiques revêtent une très grande importance dans le traitement des langues. Les premières propositions visant à les utiliser furent formulées peu après l’apparition des ordinateurs. Cela vaut particulièrement pour la langue anglaise. David W. Reed a examiné l’analyse linguistique quantitative (Reed 1949: 236). Waren Weaver fut le premier à évoquer l’idée d’utiliser des ordinateurs pour la traduction. En 1949, il proposa d’employer à cette fin des méthodes statistiques. Mais les scientifiques de l’époque y renoncèrent peu de temps après, probablement en raison du nombre insuffisant de textes lisibles par ordinateur et des capacités relativement limitées des ordinateurs de l’époque. Quelques décennies plus tard, après la constitution de corpus textuels et lorsque l’application de méthodes statistiques à la reconnaissance des langues produisit de bons résultats, on revint aux méthodes statistiques en traduction (Brown at al. 1990: 79). Au Canada, les conditions étaient particulièrement favorables, car, en raison du bilinguisme officiel, l’ensemble des documents parlementaires y est conservé dans deux langues (anglais et français). Il fut donc possible de réunir très rapidement une quantité suffisante de textes parallèles (Al-Onaizan, Curin, Jahr 1999: 1). La structure des deux langues, à savoir l’anglais et le français, est très similaire: l’ordre des mots est strict (le sujet occupe la première position et le prédicat la deuxième). Les similitudes entre les structures de ces langues ont permis d’obtenir de bons résultats en traduction au moyen de méthodes statistiques. Mais ce n’est pas le cas du lituanien. Jusqu’à présent, les traductions de Google, qui utilisent la méthode statistique, ne produisent pas de bonnes traductions vers le lituanien. Selon les données de 2017, les résultats de la traduction anglais-lituanien comme de la traduction lituanien-anglais sont moins bons que ceux des traductions anglais-letton, letton-anglais, anglais-estonien et estonien-anglais (Skadinš 2017: 22).

Les méthodes statistiques ont également pénétré d’autres domaines de la linguistique. Les premiers travaux portaient sur la phonétique (Zipf 1929). En 1944, des études statistiques du lexique littéraire furent réalisées, c’est-à-dire qu’on détermina combien de mots avaient été employés une fois, combien deux fois, trois fois, etc. (Yule 194: 9).

146

Acta Linguistica Lithuanica LXXVI

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

Depuis 1973, le terme dialectométrie est employé pour désigner le domaine de la linguistique consacré à l’étude quantitative des langues et des dialectes (Köhler, Altmann, Piotrowski 2005: 498).

Les méthodes statistiques ont également été appliquées dans le domaine de la morphologie. Goldsmith décrit ainsi l’algorithme permettant d’identifier les morphèmes dans un mot: « algorithm that takes as input a list of words and provides as output a segmentation of the words into morphemes » (Goldsmith 2010: 36).

À la fin du siècle dernier, des tentatives visant à effectuer une analyse syntaxique automatique des phrases à l’aide de calculs statistiques sont décrites dans la littérature russe. Les scientifiques russes ont proposé de déterminer la structure syntaxique des phrases non pas à partir de l’analyse linguistique, mais en recourant à un traitement statistique des textes. Ils affirment que chaque unité linguistique (mot, catégorie syntaxique du mot, construction syntaxique) apparaît dans le texte avec une certaine fréquence. Par exemple, selon les données du dictionnaire anglais des fréquences de valence, 195 schémas différents de relations syntaxiques sont propres au verbe. Pourtant, les dix schémas les plus fréquents représentent à eux seuls 86% de tous les cas relevés dans les textes. Les régularités statistiques servent également à décrire la structure linéaire de la phrase. Chaque classe de mots a une fréquence déterminant à quelle distance du début de la phrase elle peut se trouver. Le verbe anglais peut se trouver entre la deuxième et la cinquième position depuis le début de la phrase avec une probabilité de 0,7. Il apparaît entre la deuxième et la dixième position avec une probabilité de 0,95 (Церкас 1979: 124).

Plus tard, des données provenant d’un corpus textuel ont été utilisées pour l’analyse syntaxique (Köhler 2012: 31).

Cependant, jusqu’à présent, de bons résultats n’ont été obtenus que pour le traitement de l’anglais. Vidas Daudaravičius, qui travaille dans le domaine de l’informatisation de la syntaxe lituanienne, affirme: « Naivų manyti, kad metodai, kurie sėkmingai taikomi anglų kalbai, tinka ir kitoms kalboms. »1 (Daudaravičius 2012: 3).

Les méthodes statistiques permettent de créer rapidement des systèmes performants, mais à une condition: il faut tolérer un certain nombre d’erreurs (Link 1). C’est pourquoi l’Institut de la langue lituanienne a décidé de s’appuyer le moins possible sur les statistiques, car il vise à garantir la plus grande exactitude et la plus grande fiabilité des données.

1 « Il est naïf de penser que les méthodes utilisées avec succès pour l’anglais conviennent tout autant aux autres langues. »

Straipsniai / Articles

147

DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAUSKAS

1.2. LA SITUATION EN LITUANIE

De nombreux travaux ont déjà été réalisés dans le domaine de l’informatisation de la grammaire lituanienne. La plupart d’entre eux ne sont compréhensibles que par les spécialistes de la linguistique informatique. Certains s’adressent également au grand public. Toutefois, ils ne reflètent que des propriétés et des caractéristiques isolées des mots et de la grammaire. Par exemple, une base de données de morphémique a été créée à l’université Vytautas Magnus de Kaunas à partir d’un corpus de textes. De nombreuses formes de mots y manquent et l’on utilise beaucoup d’abréviations qui ne sont pas compréhensibles par tous. Les morphèmes sont séparés par un trait d’union et aucune donnée n’est indiquée sur leur type. À l’Institut de mathématiques et d’informatique de Vilnius, une base de données sur la dérivation et la morphémique a été créée. Le type du morphème y est indiqué, ainsi que les mots de base et les déterminants (Murmulaitytė 2012: 96). Malheureusement, la base de données n’est pas librement accessible. Il a donc été décidé de créer un système d’information complet, destiné au grand public et capable de fournir à l’utilisateur des données détaillées.

On peut observer sur Internet deux extrêmes dans la présentation des informations grammaticales sur le lituanien: l’absence même de formes de mots courantes et la présentation de mots superflus, incompréhensibles même pour un locuteur natif. Le système d’information sur la grammaire lituanienne vise à éviter ces deux extrêmes. Toutes les formes de mots sont générées automatiquement par ordinateur à partir du lemme du mot, ce qui permet d’obtenir l’ensemble complet des formes fléchies. Toutes les dérivations et compositions possibles sont inscrites dans la base de données. Ainsi, les formes de mots ne font plus défaut. Ensuite, tous les mots et toutes les formes de mots générés par ordinateur sont vérifiés à la main et les variantes inexistantes sont supprimées. On évite ainsi les mots superflus.

2. LES TRAVAUX DE LINGUISTIQUE INFORMATIQUE EN LITUANIE

En Lituanie, on peut distinguer deux méthodes de traitement informatique de la langue. À Kaunas, le Centre de linguistique informatique mène des travaux à partir d’un corpus de textes. À Vilnius, à l’université et à l’Institut de langue lituanienne, on part davantage des propriétés de la langue lituanienne elle-même. Les deux méthodes présentent des avantages et des inconvénients. La suite en montrera quelques exemples.

148

Acta Linguistica Lithuanica LXXVI

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

2.1. TRAVAUX FONDÉS SUR UN CORPUS DE TEXTES

Un corpus de textes en lituanien contemporain a été créé à l’université Vytautas Magnus de Kaunas. Il est utilisé pour différents types de traitement de la langue. Dans le domaine de la grammaire, un dictionnaire des morphèmes (Rimkutė, Kazlauskienė, Rąkinis 2011) a été élaboré, puis, quelques années plus tard, une base de données a également été créée. L’utilisateur dispose de données à la fois morphémiques et morphologiques. Il s’agit de la première ressource librement accessible dans laquelle le mot est segmenté en morphèmes. Le type du morphème n’est malheureusement pas précisé, ce qui conduit parfois à une présentation déroutante de la structure morphémique du mot. C’est le cas lorsque des mots de structure différente sont représentés de la même manière. La figure 1 en donne un exemple. Les mots « per-ei-ti » (passer) et « per-ė-ti » (couver) ne diffèrent guère à première vue. Dans la base de données des morphèmes, les structures morphémiques des deux mots sont identiques. Pourtant, dans le premier mot, le morphème « per » est le préfixe, tandis que dans le second, ce même premier morphème « per » est la racine.

FIGURE 1. Des mots de structure morphémique différente sont représentés de la même manière (Rimkutė, Kazlauskienė, Rąkinis 2011: 8, 35)

On peut citer comme deuxième lacune l’absence même de formes de mots courantes. En lituanien, les participes ont six cas. Le tableau 1 présente la présence des formes de mots (singulier, masculin) du participe « bėgantis / courant, coulant » dans la base de données des morphèmes.

Il apparaît que même le lemme (nominatif, singulier) de ce mot est absent. On ne peut pas non plus considérer les autres formes manquantes, par exemple le locatif (bėgančiame vandenyje / dans l’eau courante), comme rares ou inhabituelles. Ainsi, seules 2 formes de mots sur les 6 cas sont présentes.

Les chercheurs qui étudient la seconde langue balte, le letton, signalent eux aussi un nombre insuffisant de formes de mots dans le corpus de textes (Paikens, Rituma, Pretkalniņa 2013: 272).

Straipsniai / Articles

149

DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBIKAS, VYTAUTAS ŠVEIKAUSKAS

TABLEAU 1.

Présence dans la base de données (lien 2) des formes du participe bēgantis / courant, s’écoulant au singulier masculin

Cas

Mot

Base de données

Nominatif

bēgantis

absent

Génitif

bēgančio

présent

Datif

bēgančiam

absent

Accusatif

bēgantį

présent

Instrumental

bēgančiu

absent

Locatif

bēgančiame

absent

Au total:

6

2

2.2. POINT DE DÉPART – LA LANGUE LITUANIENNE

À l’Université de Vilnius, on part des caractéristiques de la langue lituanienne. Le site Web Morfologija.lt (lien 3) présente même les tableaux de flexion du mot. Malheureusement, de nombreux emplacements sont vides, parfois pour tout le paradigme. On y trouve aussi parfois des mots inconnus et incompréhensibles pour un Lituanien, par exemple « sutikimoji » (lien 4) et d’autres mots similaires. À l’Institut de mathématiques et d’informatique de Vilnius, une base de données sur la formation des mots et la morphématique a été créée (Murmulaitytė 2012). Elle contient des informations très précieuses (le type de morphème, le mot de base, le déterminant, entre autres), mais ces données ne sont malheureusement pas librement accessibles.

3. LE SYSTÈME D’INFORMATION POUR LA GRAMMAIRE LITUANIENNE

La langue lituanienne fait partie du groupe des langues les moins informatisées d’Europe (Vaišnienė, Zabarskaitė 2012: 35). C’est pourquoi il a été décidé de créer un système d’information contenant des données détaillées sur les caractéristiques grammaticales des mots lituaniens. Les scientifiques qui s’intéressent aux langues baltes soulignent souvent la nécessité de créer davantage de logiciels destinés à un large public d’utilisateurs. Dans les consignes des conférences BSNLP (Balto-Slavic Natural Language Processing) de 2015 et de 2017, on peut lire: « submissions

150

Acta Linguistica Lithuanica LXXVI

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

décrivant des systèmes mis à la disposition du grand public seraient vivement encouragées / les contributions décrivant des systèmes mis à la disposition du grand public seraient particulièrement encouragées » (lien 5).

On a donc eu l’idée de concevoir le système d’information pour la grammaire lituanienne à l’intention d’un large public d’utilisateurs et de présenter les données de la manière la plus simple et la plus compréhensible possible.

En conséquence, une conception Web adaptative (RW) a été choisie afin de répondre au mieux aux besoins des utilisateurs. Les informations grammaticales sur le mot sont ainsi présentées sous forme de tuiles (en anglais, tiles) (lien 6). Le site Web est donc également accessible depuis un téléphone mobile.

3.1. MÉTHODE DE CRÉATION DE LA BASE DE DONNÉES

L’objectif de l’informatisation de la grammaire est de disposer sous forme électronique de toutes les informations grammaticales sur chaque mot et sur toutes ses formes. Il existe deux façons d’y parvenir. La première consiste à élaborer une description formelle des règles grammaticales (il s’agirait d’un type d’outil), puis à laisser l’ordinateur générer les informations nécessaires. La seconde consiste à stocker dans l’ordinateur toutes les informations grammaticales sur toutes les formes de tous les mots, puis à les consulter au besoin. La question de savoir quelle approche demande le plus de travail reste à débattre. À l’Institut de mathématiques et d’informatique, un logiciel d’analyse morphologique de la langue lituanienne a été développé (Zinkevičius 2000) en utilisant la première méthode. Toutefois, il n’a pas été possible d’atteindre une précision de 100%: certaines informations sont erronées et certains mots lituaniens ne sont pas reconnus.

Lors de la mise au point du système d’information pour la grammaire lituanienne, cette approche a été écartée pour la raison suivante: pour que l’ordinateur puisse traiter lui-même les mots, il faut lui indiquer très précisément quelles opérations effectuer sur chaque mot. Il faut donc d’abord répartir tous les mots en groupes de telle sorte que les mêmes régularités s’appliquent à tous les membres d’un groupe, c’est-à-dire que la même méthode de traitement puisse être utilisée. Pour classer un mot dans un groupe ou dans un autre, il faut déterminer de nombreuses caractéristiques sur la base desquelles les mots seront regroupés. Par exemple, dans l’analyse syntaxique de la langue lituanienne, on utilise le trait sémantique [temps] pour déterminer la fonction syntaxique de l’accusatif des substantifs. Dans la phrase « Visą naktį ji

Straipsniai / Articles

151

DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS

skaitė šią knygą / Elle a lu ce livre toute la nuit. » et « Visą knygą ji perskaitė šią naktį / Elle a lu le livre entier cette nuit. » Les deux mots knygą/livre et naktį/nuit ne se distinguent pas du point de vue des catégories morphologiques: tous deux sont féminins, au singulier et à l’accusatif. Seul le trait sémantique [temps], que possède le mot naktis/nuit mais pas le mot knyga/livre, permet à l’ordinateur de considérer correctement le mot naktį/nuit comme un complément de temps et le mot knygą/livre comme un objet dans la phrase. Il faut faire quelque chose de similaire pour la morphologie. L’une des erreurs du logiciel déjà créé pour l’analyse morphologique du lituanien est que le morphème -ėj- est considéré comme un suffixe avec des racines avec lesquelles il ne peut pas se combiner. Il faut définir les traits des mots qui permettent à l’ordinateur de déterminer avec quelles racines ce suffixe -ėj- peut se combiner. Mais c’est très compliqué. Quel trait, par exemple, les mots geroė/Wohlhaben, žinovas/Kenner(Expert) et daržovė/Obst ont-ils en commun? Ils ont tous le suffixe -ov-. Et qu’est-ce qui les distingue de tous les autres mots auxquels ce suffixe ne peut pas s’ajouter (on ne peut pas dire *kėdovė, dérivé avec le suffixe -ov- du mot kėdė/chaise)? Et quel trait le montre?

Lors de la création du système d’information pour la grammaire du lituanien, la deuxième voie a donc été choisie: une base de données a été préparée, contenant des informations grammaticales détaillées sur toutes les formes de tous les mots de la langue lituanienne. Il ne faut pas partir ici des catégories grammaticales (comme c’est le cas dans toutes les grammaires imprimées sur papier), mais du mot lui-même: pour chaque mot, toutes les informations qui lui sont associées doivent être mises à la disposition de l’utilisateur.

Il a été décidé de prendre une racine comme point de départ et de développer un logiciel destiné à refléter toute la structure de la grammaire lituanienne. La racine bėg (du verbe bėgti/courir) a été choisie pour premier essai. Toutes les dérivations possibles ont ensuite été générées par ordinateur, puis tous les mots inexistants en lituanien ont été supprimés à la main. La base de données contient au total environ 25 000 entrées.

3.2. PARTICULARITÉS DE « LIGIS »

Le système d’information pour la grammaire de la langue lituanienne (Lietuvių kalbos gramatikos informacinė sistema – LIGIS) (lien 7) présente deux caractéristiques essentielles. Premièrement, il fournit à l’utilisateur des informations plus détaillées sur un mot donné que les grammaires imprimées sur papier. Et

152

Acta Linguistica Lithuanica LXXVI

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

deuxièmement, il comprend davantage de mots que les dictionnaires. Les grammaires indiquent les règles qui s’appliquent à un groupe donné de mots. Mais elles ne mentionnent pas tous les mots auxquels ces règles s’appliquent. LIGIS rassemble toutes les informations liées au mot saisi par l’utilisateur et les présente sur un site Web. Les dictionnaires ne répertorient pas tous les mots de la langue lituanienne: de nombreuses dérivations et de nombreux mots composés en sont absents. LIGIS comprend toutes les dérivations possibles. On peut donner un exemple à titre de comparaison. La base de données des morphèmes compte environ 75 000 entrées. Mais celles-ci décrivent différents mots lituaniens. La base de données LIGIS compte actuellement 25 000 entrées et ne comprend que les mots issus d’une seule racine: beg-. La base de données des morphèmes contient 118 mots ayant cette racine.

3.3. STRUCTURE DU MOT

Après la saisie du mot, la structure du mot est expliquée à l’utilisateur: le lemme et le mot de base, ainsi que le déterminant des dérivés et des mots composés, sont indiqués. Si le mot est grammaticalement ambigu, chacune de ses significations reçoit un numéro de lemme. Les données morphologiques et morphémiques sont ensuite affichées sous ce numéro. Un exemple de mot ambigu figure à l’annexe A.

Autres formes. C’est le nom du bouton (en anglais button) qui se trouve dans la vignette de la structure du mot. Le site Web d’analyse morphologique de la langue russe (lien 8) affiche à chaque fois toutes les formes du mot saisi. Dans le système d’information pour la grammaire lituanienne, il a été décidé d’introduire un bouton et de permettre à l’utilisateur d’obtenir les autres formes via un lien, car il n’a pas besoin de toutes les formes d’un mot à chaque fois.

3.4. DONNÉES MORPHOLOGIQUES

L’information morphologique comprend la désignation de la catégorie grammaticale et les catégories grammaticales: cas, genre et nombre pour les noms; personne, temps et mode pour les verbes, etc. Les mots ambigus sont numérotés lorsque, par exemple, un nom possède plusieurs formes casuelles homonymes.

Dans la base de données des morphèmes (lien 2), on trouve également des données morphologiques sur le mot. Mais l’information est présentée uniquement sous forme d’abréviations

Straipsniai / Articles

153

DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS

abrégées. Un tel exemple est présenté dans la figure 2. Pour les non-spécialistes, un si grand nombre d’abréviations est souvent incompréhensible. Les informations présentées de cette manière peuvent parfois manquer de clarté, en particulier pour les étrangers qui étudient ou apprennent le lituanien.

FIGURE 2. Données sur le mot begčio, présentées uniquement sous forme d’abréviations (lien 2)

Le système d’information sur la grammaire lituanienne n’utilise pas d’abréviations. Toutes les informations sont données en toutes lettres (annexe A).

3.5. DONNÉES MORPHÉMIQUES

La principale différence par rapport aux bases de données auxquelles on peut déjà accéder aujourd’hui1 réside dans l’indication du type de chaque morphème. C’est la seule façon d’assurer une représentation univoque des morphèmes d’un mot. Sinon, on ne peut pas distinguer, par exemple, la deuxième racine d’un mot composé d’un suffixe, comme c’est le cas dans la base de données morphémique.

La première caractéristique déterminante était la représentation des morphèmes en différentes couleurs. Une couleur a été attribuée à chaque type de morphème (racine, préfixe, suffixe, terminaison). Les préfixes sont écrits en bleu. Le rouge a été utilisé pour la racine. Les suffixes sont représentés en vert et le noir a été choisi pour la terminaison.

En outre, le mot décomposé en morphèmes est disposé verticalement; à côté, on indique non seulement la désignation du type de chaque morphème du mot, mais aussi ses propriétés, le cas échéant, par exemple, pour un suffixe: dérivationnel ou flexionnel; pour les terminaisons: abrégées, pronominales, etc. Dans le cas des terminaisons abrégées, très répandues dans la langue parlée, la terminaison complète est également indiquée à côté. On peut citer comme exemple les mots de la langue parlée: šnekamoje kalboje – terminaisons complètes, šnekamoj kalboj – terminaisons abrégées. Si le mot a une terminaison complète, aucune indication de longueur n’est donnée, car la plupart des mots ont des terminaisons complètes et cette information serait superflue. Si

154

Acta Linguistica Lithuanica LXXVI

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

si la terminaison n’est pas pronominalisée, l’information à ce sujet n’est pas non plus indiquée.

Les changements phonétiques sont considérés comme une propriété de la racine. Il peut s’agir aussi bien de changements consonantiques que vocaliques. On peut également observer un autre type de changement phonétique en lituanien: la chute de consonnes à l’impératif. Les infixes font eux aussi partie des changements phonétiques dans la racine d’un mot. L’origine du préfixe est considérée comme une de ses propriétés: origine prépositionnelle, formation à partir d’une particule ou origine internationale.

En cas d’ambiguïté grammaticale des mots, les structures morphémiques sont examinées. Si elles sont identiques, une seule structure est décrite. En revanche, si elles diffèrent, les structures morphémiques sont indiquées pour chaque sens du mot (annexe A).

3.6. TOUTES LES FORMES DU MOT

Pour chaque mot contenu dans la base de données, on peut consulter le tableau de flexion en cliquant sur le bouton « Autres formes ». Toutes les données de la vignette morphologique y sont reprises. En haut du tableau figurent les catégories que le tableau de flexion ne contient pas. Par exemple, en lituanien, les substantifs ne se déclinent pas selon le genre; celui-ci est donc indiqué en haut du tableau, avec le lemme et la partie du discours. Les adjectifs et les participes ont trois genres, et une particularité du lituanien est que seuls deux d’entre eux (le masculin et le féminin) possèdent les six cas. Le troisième genre n’a qu’une seule forme; celle-ci est donc indiquée sans désignation de cas (annexe B). Pour les verbes, toutes les formes temporelles sont présentées à tous les modes (annexe D).

Les classes de conjugaison et de déclinaison deviennent ainsi superflues; aucune donnée à leur sujet n’est donc fournie.

Pour certains mots, des exemples d’emploi sont également insérés dans le tableau de flexion. À cette fin, une info-bulle (en anglais tooltip) est utilisée. À l’annexe C, l’exemple présenté pour le mot « bėgis » (accusatif singulier du substantif bėgis / Eisenbahnschiene, Lauf) est donné.

3.7. LA BASE DE DONNÉES

Lors de la conception de la base de données, on a cherché à atteindre la meilleure qualité et la plus grande fiabilité possible. C’est pourquoi une grande partie du travail a été effectuée à la main

Straipsniai / Articles

155

DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAUSKAS

effectuée, car seule l’aide humaine permet d’obtenir une information d’une fiabilité maximale (Sulger 2013: 53).

Des recherches sur les préfixes lituaniens ont été menées à l’Institut de langue lituanienne. Il a été établi qu’il existe environ 600 combinaisons de préfixes en lituanien (Šveikauskienė 2015: 195). On entend par « combinaisons » différents ensembles de préfixes susceptibles d’apparaître devant la racine, par exemple at-bėgi, nu-bėgi, ne-be-at-bėgti, ne-nu-bėgti, te-be-bė-ti, etc. Il est apparu que seules 220 de ces combinaisons s’emploient avec les racines des verbes; les autres, par exemple nuo-, s’emploient avec des substantifs: nuo-monė /die Meinung. Le logiciel a été conçu de manière à relier automatiquement la racine à toutes les combinaisons de préfixes possibles. Ensuite, les résultats fournis par l’ordinateur sont vérifiés par des personnes, qui inscrivent dans la base de données les mots effectivement présents en lituanien. On évite ainsi deux extrêmes: le nombre excessif de formes générées par l’ordinateur, ainsi qu’une couverture lexicale insuffisante.

Tous les lemmes et les informations grammaticales qui s’y rapportent sont saisis manuellement dans la base de données. Comme le logiciel créé à l’Institut de mathématiques et d’informatique ne commet aucune erreur lorsqu’il génère les formes d’un lemme donné, on a estimé que l’ordinateur pouvait générer automatiquement les entrées correspondant aux autres formes du mot.

Il convient de noter que LIGIS traite également les mots dont les terminaisons sont abrégées. Ces mots sont très fréquents dans la langue parlée, et aucune des bases de données existantes ne traite ces formes de mots. Il faut également souligner que LIGIS comprend des dérivés qui ne figurent même pas dans le dictionnaire de la langue lituanienne en 20 volumes ni dans sa version électronique (Link 9), par exemple neužbėgti/nicht mehr hinauflaufen.

Dans la base de données, les informations sont conservées sous une forme adaptée à l’informatique; autrement dit, on utilise l’encodage en Prage Markup Language (Hana, Štepánek 2012). Cette forme des données n’est pas présentée sur Internet, car elle serait superflue pour les non-spécialistes en linguistique informatique.

Le fait que toutes les informations soient conservées dans une base de données fait également de LIGIS un outil utile aux linguistes qui étudient la langue lituanienne. On peut obtenir des renseignements de toutes sortes, par exemple rechercher des mots comportant une combinaison donnée de préfixes et de suffixes, entre autres.

156

Acta Linguistica Lithuanica LXXVI

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

3.8. MULTILINGUISME DU SITE WEB

Le site web est proposé en sept langues: lituanien, anglais, allemand, français, italien, russe et japonais. La nécessité de disposer d’un site web multilingue est née de l’insuffisance des traductions du lituanien par Google. La traduction automatique du lituanien n’est pas fiable. Il a donc été décidé de rendre le site consacré à la grammaire lituanienne multilingue et de n’utiliser que des textes traduits par des humains. La situation n’est manifestement pas beaucoup meilleure pour les autres langues. En témoigne la lettre de Lingvist du 8 juin 2017, où il est demandé que la traduction de l’appellation LINGUIST soit confiée à des locuteurs natifs et qu’elle ne soit en aucun cas effectuée par une machine (LinguiList 2017: 28.252).

Lorsqu’a été prise la décision de rendre le site web multilingue, notre idée était la suivante: si un étranger, par exemple un Norvégien, apprend ou étudie le lituanien et connaît certains mots lituaniens, mais pas encore d’autres, il peut choisir une langue qu’il maîtrise mieux que le lituanien, par exemple l’allemand, et tous les mots lituaniens qui lui sont inconnus lui deviennent compréhensibles. À cette fin, il a même été prévu de conserver le mot saisi par l’utilisateur lors du changement de langue. Ainsi, lorsqu’un utilisateur choisit une autre langue, il n’a pas à saisir de nouveau le mot.

4. PROJETS POUR L’AVENIR

À l’université de Vilnius, de nombreux dictionnaires bilingues sont disponibles sous forme numérique. À l’Institut de langue lituanienne, le grand dictionnaire en 20 volumes a été numérisé, ainsi que les autres dictionnaires monolingues: dictionnaires de synonymes, d’antonymes, de phraséologie, etc. Il est prévu de relier les deux types de dictionnaires au système d’information de la grammaire lituanienne et de créer un équivalent du site web allemand CANOONET (lien 10).

Comme le système d’information de la grammaire de la langue lituanienne contient des données sur les morphèmes, il est possible d’effectuer une recherche de mots à partir d’un modèle morphémique. C’est précisément ce qui est prévu pour l’avenir.

Un onglet (en anglais, tab) du site web LIGIS est consacré à la théorie et est actuellement en cours d’élaboration. Il devrait présenter des connaissances approfondies et académiques sur la grammaire lituanienne.

Straipsniai / Articles

157

DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAUSKAS, VYTAUTAS ŠVEIKAUSKAS

La première étape porte sur la morphologie. À la deuxième étape, des données syntaxiques devraient également être saisies.

5. Conclusions

1. Cette approche peut également être utile et pertinente pour d’autres langues fortement flexionnelles.

2. Le système d’information de la grammaire lituanienne peut être très utile aux élèves, aux étudiants, aux étrangers qui apprennent le lituanien, ainsi qu’aux linguistes qui étudient la langue lituanienne.

3. Les données recueillies peuvent également servir de documentation sur la langue lituanienne.

Literaturverzeichnis

Al – Onaizan Yaser, Curin Jan, Jahr Michael, Knight Kevin, Lafferty John, Melamed Dan, Och Franz – Josef, Purdy David, Smith Noah A., Yarowsky David 1999: Statistical Machine Translation. – Final Report JHU Workshop. http://mt-archive.info/JHU-1999-AlOnaizan.pdf (Zugriff am 21.11. 2017).

Brown Peter F., Cocke John, Della Pietra Stephen A., Della Pietra Vincent J., Jelinek Frederick, Lafferty John D., Mercer Robert L., Roossin Paul S. 1990: A Statistical Approach to Machine Translation. – Computational Linguistics Volume 16, Number 2, June, 79–85. http://www.aclweb.org/anthology/J90-2002 (Zugriff am 21.11. 2017).

Charniak Christopher E. 1989: Artificial Intelligence & Turbo C. Homewood: Dow Jones-Irwin.

Daudaravičius Vidas 2012: Teksto skaidymas pastoviųjų junginių segmentais. Daktaro disertacijos santrauka. Kaunas: Vytauto Didžiojo universitetas.

Goldsmith John A. 2010: Segmentation and Morphology. The Handbook of Computational Linguistics and Natural Language Processing. Wiley-Blackwell, 364–393.

Han Jirka, Štěpánek Jan 2012: Prague Markup Language Framework. Procedings of the 6th Linguistic Annotation Workshop. Jeju, Republic of Korea, 12–13 July, 12–21.

Jensen Karen, Heidorn George Emil, Richardson Stephen D. 1993: Natural language processing: The PLNLP Approach. Boston / London: Kluwer Academic Publishers.

158

Acta Linguistica Lithuanica XXVII

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

Köhler Reinhard 2012: Quantitative Syntax Analysis. De Gruyter Mouton.

Köhler Reinhard, Altmann Gabriel, Piotrowski Rajmund G. 2005: Quantitative Linguistik. Berlin / New York: Walter de Gruyter.

Linguist List 2017: 28.254, Qs: How do you say the LINGUIST List in your language? 08 Jun 2017. [email protected].

Murmulaitytė Daiva 2012: Lietuvių kalbos morfemikos ir žodžių darybos tyrimų perspektyvos. – Žmogus ir žodis 1(14), 96–102.

Nirenburg Sergei 1987: Machine Translation: Theoretical and Methodological Issues. London: Cambridge University Press.

Paikens Pēteris, Rūma Laura, Pretkalniņa Lauma 2013: Morphological Analysis with limited resources: Latvian example. Proceedings of the 19th Nordic Conference of Computational Linguistics. (NODALIDA 2013); Linköping Electronic Conference Proceedings #85, 267–277.

Reed David W. 1949: A Statistical Approach to Quantitative Linguistic Analysis, WORD, 5:3, 235–247, DOI: 10.1080/00437956.1949.11659355.

Rimkutė Erika, Kazlauskienė Asta, Raškinis Gailius 2011: Dažnis lietuvių kalbos žodyne. Kaunas: VDU.

Schwanke Martina 1991: Maschinelle Übersetzung: Ein Überblick über Theorie und Praxis. Berlin: Springer-Verlag.

Skadiņš Raivis 2017: Neural MT and other Language Technologies at TILDE. http://school.gramaticframework.org/2017/slides/Ravis-Neural_MT_at_Tilde.pdf (zugegriffen 2017.11.21).

Sulger Sebastian, Butt Miriam, King Tracy Holloway, Meurer Paul 2013: ParGramBank: The ParGram Parallel Treebank. – Proceedings of the 51st Annual Meeting of the Association for Computational Linguistics, Sofia, Bulgaria, 550–560. http://aclweb.org/anthology/P/P13/P13-1054.pdf (zugegriffen 2017.11.21).

Šveikauskienė Daiva 2015: Morphemic structure of the Lithuanian prefixes. – Language: Meaning and Form 6. – Language System and Language Use. Rīga: Latvijas universitāte, 189–197.

Vaišnienė Daiva, Zabarskaitė Jolanta 2012: The Lithuanian Language in the Digital Age. – G. Rehm, H. Uszkoreit White Paper Series. Heidelberg / New York / Dordrecht / London: Springer.

Winograd Terry 1983: Language as a Cognitive Process 1. Syntax. London: Addison-Wesley Publishing Company.

Straipsniai / Articles

159

DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAS

Yule George Udny 1944: The Statistical Study of Literary Vocabulary. Cambridge MA, Cambridge university press.

Zinkevičius Vytautas 2000: Lemoklis – morfologinė analizė. – Darbai ir dienos 24, 245–273.

Zipf George Kingsley 1929: Relative frequency as a Determinant of Phonetic Change. – Harvard studies in classical philology 40, 1–95.

Сердюков Пётр Иванович 1979: Оптимизация алгоритма поиска синтаксических связей. – Международный семинар по машинному переводу. Москва: ВЦП, 123–125.

LINKS

Link 1: http://www.digitalgrammars.com/ (Zugriff am 21.11. 2017)

Link 2: http://tekstynas.vdu.lt/page.xhtml?id=morfema-db (Zugriff am 21.11. 2017)

Link 3: http://morfologija.lt/ (Zugriff am 21.11. 2017)

Link 4: http://morfologija.lt/zodzio-formos/sutikimas (Zugriff am 21.11. 2017)

Link 5: http://bsnlp-2017.cs.helsinki.fi/cfp.html (Zugriff am 21.11. 2017)

Link 6: https://de.wikipedia.org/wiki/Microsoft_Windows_8#Oberfl.C3.A4che (Zugriff am 21.11. 2017)

Link 7: http://ligis.lki.lt/ (Zugriff am 21.11. 2017)

Link 8: http://goldlit.ru/component/slog (Zugriff am 21.11. 2017)

Link 9: http://www.lkz.lt/Visas.asp?zodis (Zugriff am 21.11. 2017)

Link 10: http://www.canoo.net/ (Zugriff am 21.11. 2017)

160

Acta Linguistica Lithuanica LXXVI

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

ANHANG A. GRAMMATISCHE INFORMATION.

Beispiel des grammatisch mehrdeutigen Wortes nubəɡti / hinlaufen-hingelaufen.

Die grammatische Information wird in der Website in Kacheln ausgelegt.

Diese Darstellungsweise ist günstig für responsives Webdesign – RWD.

Bemerkung: Die Farben sind im Bild entfernt.

Straipsniai / Articles

161

DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS

ANHANG B. FORMENtABELLE FÜR DEKLINATION.

Als Beispiel wird die Flexion des Partizips nubėtas / hingelaufene in allen drei Genera und allen Kasus angeführt.

NUBĖTASPARTIZIP II, PASSIV, PRÄTERITUMMännlichSingularPluralNominativnubėtasnubėtiGenitivnubėtonubėtųDativnubėtamnubėtiemsAkkusativnubėtąnubėtusInstrumentalnubėtunubėtaisLokativnubė tamenubėtuoseWeiblichSingularPluralNominativnubėtanubėtosGenitivnubėtosnubėtųDativnubėtainubė tomsAkkusativnubėtąnubėtasInstrumentalnubėtanubėtomisLokativnubėtojenubėtoseNeutrumnubėta

162

Acta Linguistica Lithuanica LXXVI

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

ANHANG C. TOOLTIP FÜR VERWENDUNGSBEISPIELE.

Als Beispiel wird die Schnellinfo für die Akkusativ-Singular-Form bėgį des Substantivs bėgis / Lauf, Getriebe, Eisenbahnschiene angeführt.

Straipsniai / Articles

163

DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAS

ANANG D. FORMENTABELLE FÜR KONJUGATION.

Als Beispiel wird die Flexion des Verbs bėgti / laufen in allen Tempusformen und Modi angeführt.

164

Acta Linguistica Lithuanica LXXVII

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

Daugakalbė lietuvių kalbos gramatikos informacinė sistema internete

SANTRAUKA

Lietuvių kalbos kompiuterizavimo darbuose galima pastebėti du pagrindinius trūkumus: trūksta kartais net ir dažnai vartojamų formų ir pateikiami pertekliniai, lietuvių kalboje neegzistuojantys žodžiai. Kuriant Lietuvių kalbos gramatikos informacinę sistemą (LIGIS) stengiamasi išvengti jų abiejų. Visos formos generuojamos kompiuteriu automatiškai ir vėliau gauti rezultatai peržiūrimi žmogaus, kad būtų atmesti lietuvių nesuprantami žodžiai.

Lietuvių kalbos gramatikos informacinė sistema apima visus darinius. Šiuo metu duomenų bazę sudaro tik šakn inės beg-žodžiai. Jų yra apie 25 000. Palyginimui galima pateikti tokius duomenis: morfemos duomenų bazę sudaro yra apie 75 000 įrašų, bet jie surinkti iš visos lietuvių kalbos leksikos. Su šaknimi beg- ten yra 118 žodžių.

Kuriant Lietuvių kalbos gramatikos informacinę sistemą pagrindinis tikslas buvo pateikti išsamią gramatinę informaciją plačiajai visuomenei. Todėl buvo stengiamasi duomenis atvaizduoti kuo aiškiau ir suprantamiau. Svetainė pritaikyta naudotis ir mobiliuosiuose telefonuose.

Vartotojas, pateikęs žodį, gauna trijų tipų informaciją apie jį: žodžio struktūrą (pradinę formą bei pamatinį žodį dariniams), morfologinę informaciją (kalbos dalis bei jos morfologinės kategorijos – linksnis, giminė, skaičius, laikas, laipsnis ir t. t.) ir morfeminiai duomenys – žodis išskaidytas morfemomis, nurodant morfemos tipą bei požymius, jei morfema jų turi, pavyzdžiui, priesaga – darybinė / kaitybinė, galūnė – įvardžiuotinė, sutrumpėjusi ir kt. Kiekviena morfema žymima vis kita spalva. Reikia pabrėžti, kad Lietuvių kalbos gramatikos informacinė sistema yra pirmasis tinklapis Lietuvoje, kur vartotojui pateikiama informacija apie morfemos tipą. Be to, apdorojami ir žodžiai su sutrumpėjusiomis galūnėmis, kurios labai paplitusios, ypač šnekamojoje kalboje.

Kiekvienam duomenų bazėje esančiam žodžiui vartotojas gali gauti visą kaitybinę lentelę. Kai kuriems žodžiams pateikiama vartojimo pavyzdžių.

Kuriant Lietuvių kalbos gramatikos informacinę sistemą siekiama kuo didesnio tikslumo ir patikimumo. Todėl visos temos (žodžių pradinės formos – vardininkas, bendratis) suvedamos į duomenų bazę rankomis. Kaitybines formas sugeneruoti patikėta kompiuteriui, nes šiame jo darbe nebuvo pastebėta klaidų.

Svetainė pateikiama septyniomis kalbomis: lietuvių, anglų, vokiečių, prancūzų, italų, rusų ir japonų.

Ateityje planuojama Lietuvių kalbos gramatikos informacinę sistemą jungti su skaitmenintais žodynais ir sukurti vokiečių tinklapio CANOONET analogą.

Straipsniai / Articles

165

DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAUSKAS, VYTAUTAS ŠVEIKAUSKAS

Įteikta 2017 m. rugsėjo 5 d.

DAIVA ŠVEIKAUSKIENĖ

Petro Vileišio g. 5, LT-10308 Vilnius, Lietuva [email protected]

ARŪNAS RIBAUSKAS

Saulėtekio al. 11, LT-10221 Vilnius, Lietuva [email protected]

VYTAUTAS ŠVEIKAUSKAS

Petro Vileišio g. 5, LT-10308 Vilnius, Lietuva [email protected]

166

Acta Linguistica Lithuanica LXVII