scieee AI-readable full text Open interactive document viewer

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

Daiva Šveikauskienė; Arūnas Ribikauskas; Vytautas Šveikauskas

Full text

DAIVA ŠVEIKAUSKIENĖ Instituut voor de Litouwse taal ARŪNAS RIBIKAUSKAS Technische Universiteit Gediminas Vilnius VYTAUTAS ŠVEIKAUSKAS Instituut voor de Litouwse taal Onderzoeksgebieden: grammatica, computationele taalkunde. EEN MEERTALIGE WEBSITE OVER DE GRAMMATICA VAN DE LITOUWSE TAAL Meertalige informatiesysteem voor de grammatica van de Litouwse taal op internet ANNOTATIE Een jaar geleden begon men aan het Instituut voor de Litouwse taal aan een project te werken dat tot doel heeft de presentatie van uitgebreide gegevens over de grammaticale eigenschappen van Litouwse woorden vrij toegankelijk te maken voor gebruikers op internet. In maart 2017 werd een proefversie voorbereid, die alleen woorden met de wortel „bėg“ (vgl. het werkwoord „bėgti/lopen“) omvat. De database bestaat uit ongeveer 25.000 gegevensrecords. Het project streeft ernaar de tekortkomingen van reeds bestaande werken op het gebied van de computerlinguïstiek te vermijden. Het gaat daarbij onder meer om de omvang van de woorden, de veelzijdigheid van grammaticale gegevens en de helderheid en begrijpelijkheid van de presentatie van de gegevens. De grammaticale informatie over het door de gebruiker ingevoerde woord wordt op drie gebieden weergegeven: woordstructuur, morfologische gegevens en morfeemgegevens. Dit is de eerste website in Litouwen waarop informatie over soorten morfemen aan de gebruiker wordt verstrekt. Voor elk woord in de database kan men een verbuigingstabel opvragen. Bij sommige woorden worden ook gebruiksvoorbeelden gegeven. De website is beschikbaar in zeven talen: Litouws, Engels, Duits, Frans, Italiaans, Russisch en Japans, zodat buitenlanders die geïnteresseerd zijn in de Litouwse taal er gebruik van kunnen maken. 144 Acta Linguistica Lituanica LXXVII Eine mehrsprachige Website zur Grammatik der litauischen Sprache TREFWOORDEN: grammatica, morfologie, morfeem, informatiesysteem, computerlinguïstiek. ANNOTATIE The project was started in the Institute of Lithuanian language in 2016. It aims at presenting detailed data about the grammatical features of Lithuanian words. The goal is to make those data freely accessible to any user on the Internet. The preliminary version covering the words with the root “bėg/run” was published in March 2017. The database contains around 25,000 entries. We are trying to avoid drawbacks that are specific to the words done in the field of computational linguistics. It includes word coverage, grammatical data comprehensiveness, clarity and clearness of presented information etc. Grammatical information about the word in question is presented from three aspects: word structure, morphological data, and morphemic data. It is the first website in Lithuania providing morphemic types. One can get an inflection table for each word the database contains. Usage examples are given for some words. The information on the website is available in seven languages – Lithuanian, English, German, French, Italian, Russian, and Japanese – so foreigners interested in Lithuanian language can use it as well. TREFWOORDEN: grammatica, morfologie, morfeem, informatiesysteem, computationele linguïstiek. 1. INLEIDING: COMPUTATIONELE LINGUÏSTIEK Tot het midden van de twintigste eeuw werden alle grammatica’s op papier gedrukt. Na de komst van computers (in 1942 werd ’s werelds eerste computer, MARK I, gebouwd aan de Harvard-universiteit (Schwanke 1991: 69)) begonnen ze tot in alle levensgebieden door te dringen. Talen vormden daarop geen uitzondering: al snel werd duidelijk dat computers niet alleen getallen, maar ook willekeurige symbolen kunnen verwerken. Bijgevolg kunnen ze ook talen verwerken. Verschillende taalkundigen begonnen formele beschrijvingen van talen te ontwikkelen, zodat de mogelijkheden van computers ook op talen konden worden toegepast (Winograd 1983: 23). Op het gebied van kunstmatige intelligentie werd taalverwerking een van de belangrijkste toepassingsgebieden (Charis 1989: 71). Van 1968 tot 1978 was de grammaticale analyse van talen het belangrijkste onderwerp voor onderzoekers op het gebied van kunstmatige intelligentie (Nirenburg 1987: 26). De talen echter, die zich zo gemakkelijk naar mensen voegen, bleken voor computers een harde noot om te kraken (Jensen, Heidorn, Straipsniai / Articles 145 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS Richardson 1993: 2). Deshalb konnten bislang keine guten Ergebnisse auf dem Gebiet der Sprachverarbeitung mit Hilfe von Computern erreicht werden. 1.1. STATISTISCHE METHODEN Statistische methoden zijn van groot belang bij taalverwerking. De eerste voorstellen om ze te gebruiken werden kort na de opkomst van computers gedaan. Dat geldt in het bijzonder voor de Engelse taal. David W. Reed besprak de kwantitatieve linguïstische analyse (Reed 1949: 236). Waren Weaver was de eerste die het idee opperde om computers voor vertalingen te gebruiken. In 1949 stelde hij voor daarvoor statistische methoden te gebruiken. De wetenschappers van die tijd wezen dit echter na korte tijd af, waarschijnlijk vanwege de ontoereikende hoeveelheid elektronisch leesbare teksten en de beperkte rekenkracht van de computers uit die tijd. Enkele decennia later, toen tekstcorpora waren verzameld en de toepassing van statistische methoden bij spraakherkenning goede resultaten opleverde, keerde men terug naar statistische methoden voor vertaling (Brown at al. 1990: 79). In Canada waren de omstandigheden hiervoor bijzonder gunstig, omdat al het materiaal van het parlement daar vanwege de twee officiële talen in twee talen (Engels en Frans) wordt opgeslagen. Daardoor kon snel een voldoende hoeveelheid parallelle teksten worden verzameld (Al-Onaizan, Curin, Jahr 1999: 1). De structuur van beide talen, dat wil zeggen het Engels en het Frans, is zeer vergelijkbaar: de woordvolgorde ligt vast (op de eerste plaats staat het onderwerp, op de tweede plaats het gezegde). De overeenkomsten in de structuur van de talen maakten goede vertaalresultaten met statistische methoden mogelijk. Maar dat geldt niet voor het Litouws. De Google-vertalingen, die de statistische methode gebruiken, leveren tot nu toe geen goede vertalingen naar het Litouws op. Volgens de gegevens uit 2017 zijn de resultaten van zowel de vertaling Engels-Litouws als Litouws-Engels slechter dan die van Engels-Lets, Lets-Engels, Engels-Ests en Ests-Engels (Skadinš 2017: 22). De statistische methoden drongen ook door tot andere gebieden van de taalkunde. De eerste studies hadden betrekking op de fonetiek (Zipf 1929). In 1944 werden statistische onderzoeken naar de lexiconfrequentie uitgevoerd, dat wil zeggen: hoeveel woorden één keer werden gebruikt, hoeveel woorden twee keer, drie keer enzovoort (Yule 194: 9). 146 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache Sinds 1973 wordt de benaming dialectometrie gebruikt voor het aanduiden van het gebied van de taalkunde dat zich bezighoudt met het kwantitatieve onderzoek van talen en dialecten (Köhler, Altmann, Piotrowski 2005: 498). Ook werden statistische methoden toegepast op het gebied van de morfologie. Goldsmith beschrijft het algoritme voor het vaststellen van morfemen in een woord als volgt: „algorithm that takes as input a list of words and provides as output a segmentation of the words into morphemes“ (Goldsmith 2010: 36). Aan het einde van de vorige eeuw werden in de Russische literatuur pogingen beschreven om met behulp van statistische berekeningen een automatische syntactische analyse van zinnen uit te voeren. Wetenschappers in Rusland stelden voor de syntactische structuur van zinnen niet op basis van een linguïstische analyse vast te stellen, maar statistische tekstverwerking te gebruiken. Zij stellen dat elke taaleenheid (woord, syntactische categorie van een woord, syntactische constructie) met een bepaalde frequentie in de tekst voorkomt. Zo zijn volgens de gegevens van het Engelse frequentiewoordenboek van valentie 195 verschillende patronen van syntactische relaties kenmerkend voor het werkwoord. Maar alleen de tien meest voorkomende patronen vormen 86% van alle gevallen die in teksten worden gebruikt. Statistische regelmatigheden worden ook gebruikt voor de lineaire structuur van de zin. Elke woordklasse heeft een frequentie waarmee zij op een bepaalde afstand van het beginpunt kan staan. Het Engelse werkwoord kan met een waarschijnlijkheid van 0,7 op de tweede tot en met de vijfde positie vanaf het begin van de zin staan. En met een waarschijnlijkheid van 0,95 komt het op de tweede tot en met de tiende positie voor (Церкас 1979: 124). Later werden gegevens uit een tekstcorpus gebruikt voor de syntactische analyse (Köhler 2012: 31). Goede resultaten zijn tot dusver echter alleen behaald bij de verwerking van het Engels. Vidas Daudaravičius, die werkt aan de automatisering van de Litouwse syntaxis, stelt: „Naivų manyti, kad metodai, kurie sėkmingai taikomi anglų kalbai, tinka ir kitoms kalboms.“1 (Daudaravičius 2012: 3). Met behulp van statistische methoden kan men snel systemen bouwen die snel werken, maar alleen onder één voorwaarde: men moet een bepaald aantal fouten tolereren (Link 1). Daarom werd bij het Instituut voor de Litouwse taal besloten zo min mogelijk op statistiek te vertrouwen, omdat men streeft naar de grootst mogelijke nauwkeurigheid en betrouwbaarheid van de gegevens. 1 „Het is naïef te denken dat de methoden die met succes voor het Engels worden gebruikt, ook even goed geschikt zijn voor de andere talen.“ Straipsniai / Articles 147 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAUSKAS 1.2. DE SITUATIE IN LITOUWEN Er zijn al veel werkzaamheden verricht op het gebied van de automatisering van de Litouwse grammatica. De meeste daarvan zijn alleen begrijpelijk voor deskundigen op het gebied van de computerlinguïstiek. Sommige zijn ook bedoeld voor het brede publiek. Ze weerspiegelen echter slechts afzonderlijke eigenschappen en kenmerken van woorden en van de grammatica. Zo werd in Kaunas aan de Vytautas Magnus Universiteit een databank van de morfemiek samengesteld op basis van een tekstcorpus. Daarin ontbreken veel woordvormen en worden veel afkortingen gebruikt die niet voor iedereen begrijpelijk zijn. De morfemen worden met een koppelteken gescheiden en er worden geen gegevens over het type morfeem vermeld. Aan het Instituut voor Wiskunde en Informatica in Vilnius werd een databank voor derivatie en morfemiek opgezet. Daarin wordt het type morfeem vermeld, evenals de grondwoorden en bepalende woorden (Murmulaitytė 2012: 96). Helaas is de databank niet vrij toegankelijk. Daarom werd besloten een uitgebreid informatiesysteem te creëren dat bedoeld is voor het brede publiek en de gebruiker uitvoerige gegevens moet kunnen bieden. Op internet zijn twee uitersten waar te nemen in de weergave van Litouwse grammaticale informatie. Dat zijn: het ontbreken van zelfs gangbare woordvormen en de weergave van overbodige woorden die zelfs voor moedertaalsprekers onbegrijpelijk zijn. In het informatiesysteem voor de Litouwse grammatica probeert men deze beide uitersten te vermijden. Alle woordvormen worden automatisch met de computer gegenereerd op basis van het lemma van het woord; zo verkrijgt men de volledige reeks verbuigingsvormen. Alle mogelijke afleidingen en samenstellingen worden in de databank opgenomen. Zo ontbreken er geen woordvormen meer. Vervolgens worden alle door de computer gevormde woorden en woordvormen handmatig gecontroleerd en worden niet-bestaande varianten geschrapt. Zo worden overbodige woorden uitgesloten. 2. WERKZAAMHEDEN OP HET GEBIED VAN DE COMPUTERLINGUÏSTIEK IN LITOUWEN In Litouwen zijn twee methoden voor computerverwerking van taal te onderscheiden. In Kaunas wordt bij het Centrum voor Computerlinguïstiek onderzoek uitgevoerd op basis van een tekstcorpus. In Vilnius, aan de universiteit en bij het Instituut voor de Litouwse taal, gaat men meer uit van de eigenschappen van de Litouwse taal zelf. Beide methoden hebben zowel voor- als nadelen. Hieronder wordt dit aan de hand van enkele voorbeelden getoond. 148 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache 2.1. TEKSTCORPUSGEBASEERD ONDERZOEK Aan de Vytautas Magnus Universiteit in Kaunas werd een tekstcorpus van het hedendaagse Litouws samengesteld. Het wordt gebruikt voor verschillende soorten taalverwerking. Op het gebied van de grammatica werden een morfeemwoordenboek (Rimkutė, Kazlauskienė, Rąkinis 2011) en enkele jaren later ook een databank ontwikkeld. De gebruiker krijgt zowel morfemische als morfologische gegevens aangeboden. Dit is de eerste vrij toegankelijke bron waarin het woord in morfemen wordt opgesplitst. Helaas wordt het type morfeem niet vermeld, wat soms leidt tot een verwarrende weergave van de morfemische structuur van het woord. Dat gebeurt wanneer woorden met een verschillende structuur op dezelfde manier worden weergegeven. Een voorbeeld hiervan is te zien in afbeelding 1. De woorden „per-ei-ti“ (overgaan) en „per-ė-ti“ (broeden) verschillen uiterlijk nauwelijks. De morfemische structuren van beide woorden zien er in de morfeemdatabank hetzelfde uit. In het eerste woord is het morfeem „per“ echter het voorvoegsel, terwijl hetzelfde eerste morfeem „per“ in het tweede woord de wortel is. AFBEELDING 1. Woorden met een verschillende morfemische structuur worden op dezelfde manier weergegeven (Rimkutė, Kazlauskienė, Rąkinis 2011: 8, 35) Als tweede tekortkoming kan het ontbreken van zelfs gangbare woordvormen worden genoemd. Deelwoorden hebben in het Litouws zes naamvallen. Tabel 1 toont welke woordvormen (enkelvoud, mannelijk) van het deelwoord „bėgantis / lopend, stromend“ in de morfeemdatabank voorkomen. Het blijkt dat zelfs het lemma (nominatief, enkelvoud) van dit woord ontbreekt. Ook de andere ontbrekende vormen, bijvoorbeeld de locatief (bėgančiame vandenyje / in stromend water), kunnen niet als zeldzaam of ongebruikelijk worden beschouwd. Er zijn dus slechts 2 woordvormen van de 6 naamvallen aanwezig. Ook de wetenschappers die de tweede Baltische taal, het Lets, bestuderen, spreken van een ontoereikend aantal woordvormen in het tekstcorpus (Paikens, Rituma, Pretkalniņa 2013: 272). Straipsniai / Articles 149 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBIKAS, VYTAUTAS ŠVEIKAUSKAS TABEL 1. Het voorkomen in de database (link 2) van de woordvormen van het participium bēgantis / lopend, stromend in het enkelvoud, mannelijk Naamval Woord Database Nominatief bēgantis ontbreekt Genitief bēgančio aanwezig Datief bēgančiam ontbreekt Accusatief bēgantį aanwezig Instrumentalis bēgančiu ontbreekt Locatief bēgančiame ontbreekt Totaal: 6 2 2.2. UITGANGSPUNT – DE LITOUWSE TAAL Aan de Universiteit van Vilnius gaat men uit van de eigenschappen van de Litouwse taal. De website Morfologija.lt (Link 3) toont zelfs de verbuigingstabellen van het woord. Helaas zijn er veel lege plekken, soms voor het hele paradigma. Soms komen ook onbekende en voor een Litouwer onbegrijpelijke woorden voor, bijvoorbeeld „sutikimoji“ (Link 4) en dergelijke. Bij het Instituut voor Wiskunde en Informatica in Vilnius werd een database voor woordvorming en morfemiek opgezet (Murmulaitytė 2012). Deze bevat zeer waardevolle informatie (het type morfeem, grondwoord, bepalend woord e.a.), maar de gegevens zijn helaas niet vrij toegankelijk. 3. HET INFORMATIESYSTEEM VOOR DE LITOUWSE GRAMMATICA De Litouwse taal behoort tot de minst gecomputeriseerde talen van Europa (Vaišnienė, Zabarskaitė 2012: 35). Daarom werd besloten een informatiesysteem te creëren dat uitgebreide gegevens bevat over de grammaticale eigenschappen van Litouwse woorden. De noodzaak om meer software te ontwikkelen voor een brede gebruikersgroep wordt vaak benadrukt door wetenschappers die zich bezighouden met de Baltische talen. In de richtlijnen van de conferentie BSNLP (Balto-Slavic Natural Language Processing) van zowel 2015 als 2017 staat: „submissions 150 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache waarin systemen worden beschreven die beschikbaar worden gesteld aan het brede publiek, worden sterk aangemoedigd / met name worden instellingen aangemoedigd die systemen beschrijven die aan het brede publiek ter beschikking worden gesteld“ (Link 5). Daarom kwam men op het idee het informatiesysteem voor de Litouwse grammatica te ontwerpen voor een brede gebruikersgroep en de gegevens zo eenvoudig en begrijpelijk mogelijk weer te geven. Dienovereenkomstig werd gekozen voor responsief webdesign (RW), om zo goed mogelijk aan de behoeften van de gebruikers tegemoet te komen. De grammaticale informatie over het woord wordt daarom weergegeven in tegels (Engels: tiles) (Link 6). Daardoor is de website ook via een mobiele telefoon toegankelijk. 3.1. METHODE VOOR HET OPZETTEN VAN DE DATABASE Het doel van de computerisering van de grammatica is om alle grammaticale informatie over elk woord en al zijn vormen in elektronische vorm beschikbaar te hebben. Er zijn twee manieren om dit te bereiken. De eerste manier is een formele beschrijving van de grammaticale regels op te stellen (dat zou een soort hulpmiddel zijn) en vervolgens de computer de benodigde gegevens te laten genereren. De tweede manier is om alle grammaticale informatie over alle vormen van alle woorden in de computer op te slaan en deze desgewenst uit te lezen. Welke aanpak meer werk vergt, moet nog worden besproken. Bij het Instituut voor Wiskunde en Informatica is software ontwikkeld voor een morfologische analyse van de Litouwse taal (Zinkevičius 2000), waarbij de eerste methode werd gebruikt. Het lukte echter niet om 100% nauwkeurigheid te bereiken: er zijn onjuiste gegevens en sommige Litouwse woorden worden niet herkend. Bij de ontwikkeling van het informatiesysteem voor de Litouwse grammatica werd om de volgende reden van deze aanpak afgezien: om de computer de woorden zelfstandig te laten verwerken, moet men hem zeer precies aangeven welke handelingen hij met welk woord moet uitvoeren. Alle woorden moeten dus eerst op zo'n manier in groepen worden ingedeeld dat voor alle leden van een groep dezelfde regelmatigheden gelden, zodat dezelfde verwerkingsmethode kan worden gebruikt. Om een woord in de ene of de andere groep onder te brengen, moeten veel kenmerken worden vastgesteld op grond waarvan de woorden moeten worden gegroepeerd. Zo gebruikt men bij de syntactische analyse van de Litouwse taal het semantische kenmerk [tijd] om de syntactische functie van de accusatief van zelfstandige naamwoorden te bepalen. In de zin „Visą naktį ji Straipsniai / Articles 151 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS skaitė šią knygą / De hele nacht heeft zij dit boek gelezen.“ en „Visą knygą ji perskaitė šią naktį / Het hele boek heeft zij in die nacht gelezen.“ De twee woorden knygą/boek en naktį/nacht verschillen niet wat betreft morfologische categorieën – beide zijn vrouwelijk, enkelvoud en accusatief; alleen het semantische kenmerk [tijd] van het woord naktis/nacht, dat het woord knyga/boek niet heeft, stelt de computer in staat het woord naktį/nacht correct als tijdsbepaling en het woord knygą/boek als object in de zin te beschouwen. Iets soortgelijks moet ook voor de morfologie worden gedaan. Een van de fouten in de reeds ontwikkelde software voor de morfologische analyse van het Litouws is dat het morfeem -ėj- als suffix wordt beschouwd bij zulke stammen waarmee het geen verbinding mag aangaan. Men moet kenmerken bepalen voor woorden waarmee de computer kan beslissen met welke stammen dit suffix -ėj- een verbinding mag aangaan. Maar dat is zeer ingewikkeld. Welk kenmerk hebben bijvoorbeeld de woorden geroė/Wohlhaben, žinovas/Kenner(Expert) en daržovė/Obst gemeen? Dat ze allemaal het suffix -ov- hebben. En wat onderscheidt ze van alle overige woorden waarbij dit suffix niet aan de stam kan worden toegevoegd (men kan niet zeggen *kėdovė – de afleiding met het suffix -ov- van het woord kėdė/stoel)? En welk kenmerk geeft dat aan? Daarom werd bij de ontwikkeling van het informatiesysteem voor de Litouwse grammatica voor de tweede aanpak gekozen: er werd een database samengesteld met gedetailleerde grammaticale informatie over alle vormen van alle woorden in het Litouws. Hierbij hoeft men niet uit te gaan van de grammaticale categorieën (zoals in alle op papier gedrukte grammatica’s), maar van het woord zelf: voor elk woord moet de volledige ermee samenhangende informatie aan de gebruiker beschikbaar worden gesteld. Er werd besloten om als uitgangspunt een stam te nemen en software te ontwikkelen die de volledige structuur van de Litouwse grammatica moest weerspiegelen. Als eerste proef werd de stam bėg (van het werkwoord bėgti/lopen) gekozen. Vervolgens werden alle mogelijke afleidingen met de computer gegenereerd en werden alle woorden die niet in het Litouws bestaan later met de hand geschrapt. De database bevat in totaal ongeveer 25.000 vermeldingen. 3.2. BIJZONDERHEDEN VAN „LIGIS“ Het informatiesysteem voor de grammatica van het Litouws (Lietuvių kalbos gramatikos informacinė sistema – LIGIS) (Link 7) heeft twee belangrijke kenmerken. Ten eerste geeft het de gebruiker meer gedetailleerde informatie over een bepaald woord dan de op papier gedrukte grammatica’s. En 152 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache ten tweede omvat het meer woorden dan woordenboeken. In grammatica’s worden de regels vermeld die gelden voor een bepaalde groep woorden. Maar daar worden niet alle woorden genoemd waarop die regel van toepassing is. LIGIS verzamelt alle informatie die verband houdt met het door de gebruiker ingevoerde woord en geeft die weer op een website. In woordenboeken zijn niet alle woorden van het Litouws opgenomen; veel afleidingen en samenstellingen ontbreken. LIGIS omvat alle mogelijke afleidingen. Ter vergelijking kan een voorbeeld worden gegeven. De database voor morfemen bevat ongeveer 75.000 vermeldingen. Die beschrijven echter verschillende Litouwse woorden. De LIGIS-database bestaat momenteel uit 25.000 vermeldingen en omvat alleen woorden die van één enkele stam zijn afgeleid: beg-. In de database voor morfemen staan 118 woorden met deze stam. 3.3. WOORDSTRUCTUUR Na invoer van het woord wordt de woordstructuur aan de gebruiker toegelicht: het lemma en het grondwoord worden vermeld, evenals het bepalende woord bij afleidingen en samenstellingen. Als een woord grammaticaal meerduidig is, krijgt elk van de betekenissen al een eigen nummer bij het lemma. Vervolgens worden de morfologische en morfemische gegevens onder dat nummer weergegeven. Een voorbeeld van een meerduidig woord is opgenomen in bijlage A. Overige vormen. Zo heet de knop (Engels button) in het vak voor de woordstructuur. De website voor de morfologische analyse van het Russisch (Link 8) toont telkens alle woordvormen van het ingevoerde woord. In het informatiesysteem voor de Litouwse grammatica werd besloten een knop toe te voegen, zodat de gebruiker via een link de overige vormen kan opvragen, omdat de gebruiker niet telkens alle vormen van een woord nodig heeft. 3.4. MORFOLOGISCHE GEGEVENS De morfologische informatie omvat de benaming van de woordsoort en de grammaticale categorieën: naamval, genus en getal voor zelfstandige naamwoorden; persoon, tijd en wijs voor werkwoorden, enz. Meerduidige woorden krijgen een nummer wanneer bijvoorbeeld een zelfstandig naamwoord enkele homonieme naamvalsvormen heeft. In de database voor morfemen (link 2) staan ook morfologische gegevens over het woord. De informatie wordt echter uitsluitend in afkortingen Straipsniai / Articles 153 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS weergegeven. Een dergelijk voorbeeld is te zien in afbeelding 2. Voor niet-specialisten kunnen zoveel afkortingen vaak onbegrijpelijk zijn. Vooral voor buitenlanders die de Litouwse taal bestuderen of leren, kan de informatie die op deze manier wordt weergegeven soms onduidelijk zijn. AFBEELDING 2. Gegevens over het woord begčio, uitsluitend weergegeven in afkortingen (link 2) In het informatiesysteem voor de Litouwse grammatica worden geen afkortingen gebruikt. Alle gegevens worden voluit geschreven (bijlage A). 3.5. MORFEMATISCHE GEGEVENS Het belangrijkste verschil met de databases die al toegankelijk zijn,1 is dat het type van elk morfeem wordt vermeld. Alleen zo kan een eenduidige weergave van de morfemen van een woord worden bereikt. Anders kan men bijvoorbeeld de tweede wortel in een samengesteld woord niet van het suffix onderscheiden, zoals het geval is in de morfeemdatabase. Het eerste en doorslaggevende kenmerk was de weergave van morfemen in verschillende kleuren. Voor elk morfeemtype (wortel, prefix, suffix, uitgang) werd een kleur bepaald. Prefixen worden blauw weergegeven. Voor de wortel werd rood gebruikt. Suffixen worden groen weergegeven en voor de uitgang werd zwart gekozen. Daarnaast wordt het in morfemen opgesplitste woord verticaal weergegeven. Ernaast wordt niet alleen de benaming van het type van elk morfeem van het woord vermeld, maar worden ook de eigenschappen van het morfeem aangegeven, indien het die heeft, bijvoorbeeld bij een suffix: woordvormend of vormvormend; bij uitgangen: verkort, gepronominaliseerd en dergelijke. Bij verkorte uitgangen, die in de gesproken taal zeer gangbaar zijn, wordt daarnaast ook de volledige uitgang weergegeven. Als voorbeeld kunnen de woorden in de gesproken taal worden genoemd: šnekamoje kalboje – volledige uitgangen, šnekamoj kalboj – verkorte uitgangen. Heeft het woord de volledige uitgang, dan wordt geen kenmerk voor de lengte vermeld, omdat de meeste woorden volledige uitgangen hebben en zulke informatie overbodig zou zijn. Wanneer 154 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache Als de uitgang niet gepronominaliseerd is, wordt daarover ook geen informatie verstrekt. Klankveranderingen worden beschouwd als een eigenschap van de wortel. Het kan zowel om consonant- als klinkerverandering gaan. Nog een ander type klankverandering dat in de Litouwse taal voorkomt, is de wegval van consonanten in de imperatief. Ook infixen behoren tot de klankveranderingen in de wortel van een woord. Als eigenschap van het prefix wordt de herkomst ervan beschouwd: van voorzetseloorsprong, ontstaan uit een partikel of van internationale oorsprong. Bij grammaticale meerduidigheid van woorden worden de morfemische structuren onderzocht. Als ze gelijk zijn, wordt slechts één structuur beschreven. Verschillen ze echter, dan worden de morfemische structuren voor elke betekenis van het woord vermeld (Anhang A). 3.6. ALLE WOORDVORMEN Voor elk woord in de database kan de verbuigingstabel worden opgevraagd door op de knop „Overige vormen“ te klikken. Daarin zijn alle gegevens uit het morfologische venster weergegeven. Bovenaan de tabel worden de categorieën vermeld die niet in de verbuigingstabel zijn opgenomen. Zo worden zelfstandige naamwoorden in het Litouws bijvoorbeeld niet naar genus verbogen; daarom wordt het genus bovenaan de tabel vermeld, evenals het lemma en de woordsoort. Bijvoeglijke naamwoorden en deelwoorden hebben drie genera, maar een bijzonderheid van het Litouws is dat slechts twee daarvan (mannelijk en vrouwelijk) alle zes naamvallen hebben. Het derde genus heeft slechts één vorm; daarom wordt die zonder vermelding van de naamval weergegeven (Anhang B). Voor werkwoorden worden alle tempusvormen in alle modi weergegeven (Anhang D). De vervoegingsklassen en verbuigingsklassen zijn hierdoor overbodig; daarom worden er geen gegevens over verstrekt. Bij sommige woorden zijn ook gebruiksvoorbeelden in de verbuigingstabel opgenomen. Hiervoor wordt snelinfo (Engels tooltip) gebruikt. In Anhang C wordt als voorbeeld het woord „bėgis“ (accusatief, enkelvoud van het zelfstandig naamwoord bėgis / Eisenbahnschiene, Lauf) aangehaald. 3.7. DE DATABASE Bij de ontwikkeling van de database streefde men naar een zo hoog mogelijke kwaliteit en betrouwbaarheid. Daarom werd een groot deel van het werk met de hand Straipsniai / Articles 155 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAUSKAS bereikt, omdat alleen met behulp van de mens een maximaal betrouwbare informatie kan worden verkregen (Sulger 2013: 53). Aan het Instituut voor de Litouwse Taal werd onderzoek naar Litouwse prefixen uitgevoerd. Er werd vastgesteld dat er in de Litouwse taal ongeveer 600 combinaties van prefixen zijn (Šveikauskienė 2015: 195). Onder ‘combinaties’ worden verschillende reeksen prefixen verstaan die vóór de wortel kunnen verschijnen, bijvoorbeeld at-bėgi, nu-bėgi, ne-be-at-bėgti, ne-nu-bėgti, te-be-bė-ti enz. Het bleek dat slechts 220 van deze combinaties met werkwoordswortels worden gebruikt; de overige, bijvoorbeeld nuo-, worden met zelfstandige naamwoorden gebruikt: nuo-monė /de mening. De software is zo ontworpen dat zij de wortel automatisch met alle mogelijke combinaties van prefixen verbindt. Daarna worden de door de computer geleverde resultaten door mensen gecontroleerd en worden de woorden die daadwerkelijk in de Litouwse taal voorkomen in de database ingevoerd. Zo kunnen twee uitersten worden vermeden: zowel het buitensporig grote aantal door de computer gegenereerde vormen als een ontoereikende omvang van de woordenschat. Alle lemma’s en de grammaticale informatie die daarop betrekking heeft, worden handmatig in de database ingevoerd. Omdat de aan het Instituut voor Wiskunde en Informatica ontwikkelde software bij het genereren van woordvormen voor het gegeven lemma geen fouten maakt, werd de computer toevertrouwd de vermeldingen van de overige woordvormen automatisch aan te maken. Opmerkelijk is dat in LIGIS ook woorden met verkorte uitgangen worden verwerkt. Zulke woorden komen zeer vaak voor in de gesproken taal en geen van de reeds bestaande databases verwerkt deze woordvormen. Daarbij moet worden benadrukt dat LIGIS ook afleidingen bevat die zelfs ontbreken in het Litouwse woordenboek in 20 delen en in de elektronische versie daarvan (Link 9), bijvoorbeeld neužbėgti/niet meer omhoogrennen. In de database wordt informatie opgeslagen in een computerleesbare vorm, d.w.z. er wordt gebruikgemaakt van de codering in Prage Markup Language (Hana, Štepánek 2012). Deze gegevensvorm wordt niet op internet gepresenteerd, omdat zij overbodig zou zijn voor niet-specialisten in de computerlinguïstiek. Doordat alle informatie in een database wordt opgeslagen, is LIGIS ook een nuttig hulpmiddel voor taalkundigen die de Litouwse taal bestuderen. Men kan allerlei soorten informatie opvragen, bijvoorbeeld zoeken naar woorden met een bepaalde combinatie van prefixen en suffixen, enz. 156 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache 3.8. MEERTALIGHEID VAN DE WEBSITE De website is beschikbaar in zeven talen: Litouws, Engels, Duits, Frans, Italiaans, Russisch en Japans. De noodzaak van een meertalige website kwam voort uit de onbevredigende Litouwse vertalingen van Google. De automatische vertaling van het Litouws is onbetrouwbaar. Daarom werd besloten de website over de Litouwse grammatica meertalig te maken en uitsluitend door mensen vertaalde teksten te gebruiken. Voor andere talen is de situatie duidelijk niet veel beter. Daarvan getuigt de brief van Lingvist van 8 juni 2017, waarin wordt verzocht de vertaling van de benaming LINGUIST door moedertaalsprekers te laten verzorgen en in geen geval een automatische vertaling te gebruiken (LinguiList 2017: 28.252). Bij de beslissing om de website meertalig te maken, was ons idee als volgt: als een buitenlander, bijvoorbeeld een Noor, de Litouwse taal leert of bestudeert en sommige Litouwse woorden voor hem bekend zijn, maar andere nog niet, kan hij een taal kiezen die hij beter beheerst dan het Litouws, bijvoorbeeld Duits, zodat alle Litouwse woorden die hij niet kent voor hem begrijpelijk worden. Daartoe werd zelfs voorzien in de opslag van het door de gebruiker ingevoerde woord bij het wisselen van taal. Dus wanneer een gebruiker een andere taal kiest, hoeft hij het woord niet opnieuw in te voeren. 4. PLANNEN VOOR DE TOEKOMST Aan de Universiteit van Vilnius zijn veel tweetalige woordenboeken gedigitaliseerd beschikbaar. Aan het Instituut voor de Litouwse taal is het grote woordenboek in 20 delen gedigitaliseerd, evenals de andere eentalige woordenboeken: synoniemen-, antoniemen- en fraseologismenwoordenboeken, enz. Het is de bedoeling beide soorten woordenboeken te verbinden met het informatiesysteem voor de Litouwse grammatica en zo een equivalent te creëren van de Duitse website CANOONET (link 10). Aangezien het informatiesysteem voor de grammatica van de Litouwse taal gegevens over morfemen bevat, is het mogelijk te zoeken naar woorden op basis van het morfeemmodel. En juist dat is voor de toekomst voorzien. Een tabblad (Engels: tab) op de website LIGIS is bestemd voor theorie en wordt momenteel uitgewerkt. Daar zullen diepgaande academische kennis over de Litouwse grammatica worden opgenomen. Straipsniai / Articles 157 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAUSKAS, VYTAUTAS ŠVEIKAUSKAS In de eerste fase houdt men zich bezig met morfologie. In de tweede fase zullen ook syntactische gegevens worden ingevoerd. 5. Conclusies 1. Deze benadering kan ook nuttig en zinvol zijn voor andere sterk verbogen talen. 2. Het informatiesysteem voor de Litouwse grammatica kan van groot nut zijn voor scholieren, studenten en buitenlanders die Litouws leren, evenals voor taalkundigen die de Litouwse taal onderzoeken. 3. De verzamelde gegevens kunnen ook dienen als documentatie van de Litouwse taal. Literaturverzeichnis Al – Onaizan Yaser, Curin Jan, Jahr Michael, Knight Kevin, Lafferty John, Melamed Dan, Och Franz – Josef, Purdy David, Smith Noah A., Yarowsky David 1999: Statistical Machine Translation. – Final Report JHU Workshop. http://mt-archive.info/JHU-1999-AlOnaizan.pdf (Zugriff am 21.11. 2017). Brown Peter F., Cocke John, Della Pietra Stephen A., Della Pietra Vincent J., Jelinek Frederick, Lafferty John D., Mercer Robert L., Roossin Paul S. 1990: A Statistical Approach to Machine Translation. – Computational Linguistics Volume 16, Number 2, June, 79–85. http://www.aclweb.org/anthology/J90-2002 (Zugriff am 21.11. 2017). Charniak Christopher E. 1989: Artificial Intelligence & Turbo C. Homewood: Dow Jones-Irwin. Daudaravičius Vidas 2012: Teksto skaidymas pastoviųjų junginių segmentais. Daktaro disertacijos santrauka. Kaunas: Vytauto Didžiojo universitetas. Goldsmith John A. 2010: Segmentation and Morphology. The Handbook of Computational Linguistics and Natural Language Processing. Wiley-Blackwell, 364–393. Han Jirka, Štěpánek Jan 2012: Prague Markup Language Framework. Procedings of the 6th Linguistic Annotation Workshop. Jeju, Republic of Korea, 12–13 July, 12–21. Jensen Karen, Heidorn George Emil, Richardson Stephen D. 1993: Natural language processing: The PLNLP Approach. Boston / London: Kluwer Academic Publishers. 158 Acta Linguistica Lithuanica XXVII Eine mehrsprachige Website zur Grammatik der litauischen Sprache Köhler Reinhard 2012: Quantitative Syntax Analysis. De Gruyter Mouton. Köhler Reinhard, Altmann Gabriel, Piotrowski Rajmund G. 2005: Quantitative Linguistik. Berlin / New York: Walter de Gruyter. Linguist List 2017: 28.254, Qs: How do you say the LINGUIST List in your language? 08 Jun 2017. [email protected]. Murmulaitytė Daiva 2012: Lietuvių kalbos morfemikos ir žodžių darybos tyrimų perspektyvos. – Žmogus ir žodis 1(14), 96–102. Nirenburg Sergei 1987: Machine Translation: Theoretical and Methodological Issues. London: Cambridge University Press. Paikens Pēteris, Rūma Laura, Pretkalniņa Lauma 2013: Morphological Analysis with limited resources: Latvian example. Proceedings of the 19th Nordic Conference of Computational Linguistics. (NODALIDA 2013); Linköping Electronic Conference Proceedings #85, 267–277. Reed David W. 1949: A Statistical Approach to Quantitative Linguistic Analysis, WORD, 5:3, 235–247, DOI: 10.1080/00437956.1949.11659355. Rimkutė Erika, Kazlauskienė Asta, Raškinis Gailius 2011: Dažnis lietuvių kalbos žodyne. Kaunas: VDU. Schwanke Martina 1991: Maschinelle Übersetzung: Ein Überblick über Theorie und Praxis. Berlin: Springer-Verlag. Skadiņš Raivis 2017: Neural MT and other Language Technologies at TILDE. http://school.gramaticframework.org/2017/slides/Ravis-Neural_MT_at_Tilde.pdf (zugegriffen 2017.11.21). Sulger Sebastian, Butt Miriam, King Tracy Holloway, Meurer Paul 2013: ParGramBank: The ParGram Parallel Treebank. – Proceedings of the 51st Annual Meeting of the Association for Computational Linguistics, Sofia, Bulgaria, 550–560. http://aclweb.org/anthology/P/P13/P13-1054.pdf (zugegriffen 2017.11.21). Šveikauskienė Daiva 2015: Morphemic structure of the Lithuanian prefixes. – Language: Meaning and Form 6. – Language System and Language Use. Rīga: Latvijas universitāte, 189–197. Vaišnienė Daiva, Zabarskaitė Jolanta 2012: The Lithuanian Language in the Digital Age. – G. Rehm, H. Uszkoreit White Paper Series. Heidelberg / New York / Dordrecht / London: Springer. Winograd Terry 1983: Language as a Cognitive Process 1. Syntax. London: Addison-Wesley Publishing Company. Straipsniai / Articles 159 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAS Yule George Udny 1944: The Statistical Study of Literary Vocabulary. Cambridge MA, Cambridge university press. Zinkevičius Vytautas 2000: Lemoklis – morfologinė analizė. – Darbai ir dienos 24, 245–273. Zipf George Kingsley 1929: Relative frequency as a Determinant of Phonetic Change. – Harvard studies in classical philology 40, 1–95. Сердюков Пётр Иванович 1979: Оптимизация алгоритма поиска синтаксических связей. – Международный семинар по машинному переводу. Москва: ВЦП, 123–125. LINKS Link 1: http://www.digitalgrammars.com/ (Zugriff am 21.11. 2017) Link 2: http://tekstynas.vdu.lt/page.xhtml?id=morfema-db (Zugriff am 21.11. 2017) Link 3: http://morfologija.lt/ (Zugriff am 21.11. 2017) Link 4: http://morfologija.lt/zodzio-formos/sutikimas (Zugriff am 21.11. 2017) Link 5: http://bsnlp-2017.cs.helsinki.fi/cfp.html (Zugriff am 21.11. 2017) Link 6: https://de.wikipedia.org/wiki/Microsoft_Windows_8#Oberfl.C3.A4che (Zugriff am 21.11. 2017) Link 7: http://ligis.lki.lt/ (Zugriff am 21.11. 2017) Link 8: http://goldlit.ru/component/slog (Zugriff am 21.11. 2017) Link 9: http://www.lkz.lt/Visas.asp?zodis (Zugriff am 21.11. 2017) Link 10: http://www.canoo.net/ (Zugriff am 21.11. 2017) 160 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache ANHANG A. GRAMMATISCHE INFORMATION. Beispiel des grammatisch mehrdeutigen Wortes nubəɡti / hinlaufen-hingelaufen. Die grammatische Information wird in der Website in Kacheln ausgelegt. Diese Darstellungsweise ist günstig für responsives Webdesign – RWD. Bemerkung: Die Farben sind im Bild entfernt. Straipsniai / Articles 161 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS ANHANG B. FORMENtABELLE FÜR DEKLINATION. Als Beispiel wird die Flexion des Partizips nubėtas / hingelaufene in allen drei Genera und allen Kasus angeführt. NUBĖTASPARTIZIP II, PASSIV, PRÄTERITUMMännlichSingularPluralNominativnubėtasnubėtiGenitivnubėtonubėtųDativnubėtamnubėtiemsAkkusativnubėtąnubėtusInstrumentalnubėtunubėtaisLokativnubė tamenubėtuoseWeiblichSingularPluralNominativnubėtanubėtosGenitivnubėtosnubėtųDativnubėtainubė tomsAkkusativnubėtąnubėtasInstrumentalnubėtanubėtomisLokativnubėtojenubėtoseNeutrumnubėta 162 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache ANHANG C. TOOLTIP FÜR VERWENDUNGSBEISPIELE. Als Beispiel wird die Schnellinfo für die Akkusativ-Singular-Form bėgį des Substantivs bėgis / Lauf, Getriebe, Eisenbahnschiene angeführt. Straipsniai / Articles 163 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAS ANANG D. FORMENTABELLE FÜR KONJUGATION. Als Beispiel wird die Flexion des Verbs bėgti / laufen in allen Tempusformen und Modi angeführt. 164 Acta Linguistica Lithuanica LXXVII Eine mehrsprachige Website zur Grammatik der litauischen Sprache Daugakalbė lietuvių kalbos gramatikos informacinė sistema internete SANTRAUKA Lietuvių kalbos kompiuterizavimo darbuose galima pastebėti du pagrindinius trūkumus: trūksta kartais net ir dažnai vartojamų formų ir pateikiami pertekliniai, lietuvių kalboje neegzistuojantys žodžiai. Kuriant Lietuvių kalbos gramatikos informacinę sistemą (LIGIS) stengiamasi išvengti jų abiejų. Visos formos generuojamos kompiuteriu automatiškai ir vėliau gauti rezultatai peržiūrimi žmogaus, kad būtų atmesti lietuvių nesuprantami žodžiai. Lietuvių kalbos gramatikos informacinė sistema apima visus darinius. Šiuo metu duomenų bazę sudaro tik šakn inės beg-žodžiai. Jų yra apie 25 000. Palyginimui galima pateikti tokius duomenis: morfemos duomenų bazę sudaro yra apie 75 000 įrašų, bet jie surinkti iš visos lietuvių kalbos leksikos. Su šaknimi beg- ten yra 118 žodžių. Kuriant Lietuvių kalbos gramatikos informacinę sistemą pagrindinis tikslas buvo pateikti išsamią gramatinę informaciją plačiajai visuomenei. Todėl buvo stengiamasi duomenis atvaizduoti kuo aiškiau ir suprantamiau. Svetainė pritaikyta naudotis ir mobiliuosiuose telefonuose. Vartotojas, pateikęs žodį, gauna trijų tipų informaciją apie jį: žodžio struktūrą (pradinę formą bei pamatinį žodį dariniams), morfologinę informaciją (kalbos dalis bei jos morfologinės kategorijos – linksnis, giminė, skaičius, laikas, laipsnis ir t. t.) ir morfeminiai duomenys – žodis išskaidytas morfemomis, nurodant morfemos tipą bei požymius, jei morfema jų turi, pavyzdžiui, priesaga – darybinė / kaitybinė, galūnė – įvardžiuotinė, sutrumpėjusi ir kt. Kiekviena morfema žymima vis kita spalva. Reikia pabrėžti, kad Lietuvių kalbos gramatikos informacinė sistema yra pirmasis tinklapis Lietuvoje, kur vartotojui pateikiama informacija apie morfemos tipą. Be to, apdorojami ir žodžiai su sutrumpėjusiomis galūnėmis, kurios labai paplitusios, ypač šnekamojoje kalboje. Kiekvienam duomenų bazėje esančiam žodžiui vartotojas gali gauti visą kaitybinę lentelę. Kai kuriems žodžiams pateikiama vartojimo pavyzdžių. Kuriant Lietuvių kalbos gramatikos informacinę sistemą siekiama kuo didesnio tikslumo ir patikimumo. Todėl visos temos (žodžių pradinės formos – vardininkas, bendratis) suvedamos į duomenų bazę rankomis. Kaitybines formas sugeneruoti patikėta kompiuteriui, nes šiame jo darbe nebuvo pastebėta klaidų. Svetainė pateikiama septyniomis kalbomis: lietuvių, anglų, vokiečių, prancūzų, italų, rusų ir japonų. Ateityje planuojama Lietuvių kalbos gramatikos informacinę sistemą jungti su skaitmenintais žodynais ir sukurti vokiečių tinklapio CANOONET analogą. Straipsniai / Articles 165 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAUSKAS, VYTAUTAS ŠVEIKAUSKAS Įteikta 2017 m. rugsėjo 5 d. DAIVA ŠVEIKAUSKIENĖ Petro Vileišio g. 5, LT-10308 Vilnius, Lietuva [email protected] ARŪNAS RIBAUSKAS Saulėtekio al. 11, LT-10221 Vilnius, Lietuva [email protected] VYTAUTAS ŠVEIKAUSKAS Petro Vileišio g. 5, LT-10308 Vilnius, Lietuva [email protected] 166 Acta Linguistica Lithuanica LXVII