Eine mehrsprachige Website zur Grammatik der litauischen Sprache
Full text
DAIVA ŠVEIKAUSKIENĖ
Institutet för litauiska språket
ARŪNAS RIBIKAUSKAS
Gediminas tekniska universitet i Vilnius
VYTAUTAS ŠVEIKAUSKAS
Institutet för litauiska språket
Vetenskapliga forskningsområden: grammatik, datorlingvistik.
EN FLERSPRÅKIG WEBBPLATS OM LITAUISKANS GRAMMATIK
Ett flerspråkigt informationssystem på internet för litauisk grammatik
ANNOTATION
För ett år sedan började man vid Institutet för litauiska språket arbeta med ett projekt vars mål är att göra en presentation av utförliga data om litauiska ords grammatiska egenskaper fritt tillgänglig för användaren på internet. I mars 2017 förbereddes en provversion, som endast omfattar ord med roten ”bėg” (jfr verbet ”bėgti/springa”). Databasen består av cirka 25 000 poster. Projektet strävar efter att undvika bristerna i redan befintliga arbeten inom datorlingvistik. Det gäller ordomfånget, de grammatiska uppgifternas mångsidighet samt tydligheten och begripligheten i presentationen av uppgifterna m.m. Den grammatiska informationen om det ord som användaren matat in presenteras inom tre områden: ordets struktur, morfologiska data och morfemiska data. Detta är den första webbplatsen i Litauen där information om morfemtyper presenteras för användaren. För varje ord som ingår i databasen kan man få en böjningstabell. För vissa ord ges även användningsexempel. Webbplatsen finns på sju språk: litauiska, engelska, tyska, franska, italienska, ryska och japanska, så att utlänningar som är intresserade av det litauiska språket kan använda den.
144
Acta Linguistica Lituanica LXXVII
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
NYCKELORD: grammatik, morfologi, morfem, informationssystem, datorlingvistik.
ANNOTATION
The project was started in the Institute of Lithuanian language in 2016. It aims at presenting detailed data about the grammatical features of Lithuanian words. The goal is to make those data freely accessible to any user on the Internet. The preliminary version covering the words with the root “bėg/run” was published in March 2017. The database contains around 25,000 entries. We are trying to avoid drawbacks that are specific to the words done in the field of computational linguistics. It includes word coverage, grammatical data comprehensiveness, clarity and clearness of presented information etc. Grammatical information about the word in question is presented from three aspects: word structure, morphological data, and morphemic data. It is the first website in Lithuania providing morphemic types. One can get an inflection table for each word the database contains. Usage examples are given for some words. The information on the website is available in seven languages – Lithuanian, English, German, French, Italian, Russian, and Japanese – so foreigners interested in Lithuanian language can use it as well.
NYCKELORD: grammatik, morfologi, morfemisk, informationssystem, datorlingvistik.
1. INLEDNING: DATORLINGVISTIK
Fram till mitten av 1900-talet trycktes alla grammatikor på papper. Efter datorernas intåg (år 1942 byggdes världens första dator, MARK I, vid Harvard University (Schwanke 1991: 69)) började de tränga in i alla livets områden. Språken utgjorde inget undantag: det stod snart klart att datorer kan bearbeta inte bara siffror utan också godtyckliga symboler. Följaktligen kan de också bearbeta språk. Flera lingvister började utveckla formella beskrivningar av språk, så att datorernas förmågor också kunde tillämpas på språk (Winograd 1983: 23). Inom artificiell intelligens blev språkbehandling ett av de viktigaste tillämpningsområdena (Charis 1989: 71). Från 1968 till 1978 var den grammatiska analysen av språk det viktigaste ämnet för forskare inom artificiell intelligens (Nirenburg 1987: 26). Men de språk som så lätt låter sig behärskas av människor visade sig vara en svår nöt för datorerna (Jensen, Heidorn,
Straipsniai / Articles
145
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
Richardson 1993: 2). Deshalb konnten bislang keine guten Ergebnisse auf dem Gebiet der Sprachverarbeitung mit Hilfe von Computern erreicht werden.
1.1. STATISTISKA METODER
Statistiska metoder har mycket stor betydelse inom språkbehandling. De första förslagen om att använda dem framfördes kort efter datorernas tillkomst. Detta gäller särskilt det engelska språket. David W. Reed diskuterade kvantitativ lingvistisk analys (Reed 1949: 236). Waren Weaver var den förste som uttryckte tanken att använda datorer för översättning. År 1949 föreslog han att statistiska metoder skulle användas för detta. Men dåtidens forskare övergav snart denna idé, förmodligen på grund av den begränsade mängden elektroniskt läsbara texter och dåtidens datorers relativt låga kapacitet. Efter några årtionden, när textkorpusar hade samlats in och tillämpningen av statistiska metoder inom taligenkänning hade gett goda resultat, återvände man till statistiska metoder för översättning (Brown at al. 1990: 79). I Kanada var förutsättningarna särskilt gynnsamma, eftersom hela parlamentets material lagras på två språk (engelska och franska) på grund av landets två officiella språk. Därför kunde en tillräcklig mängd parallelltexter samlas in mycket snabbt (Al-Onaizan, Curin, år 1999: 1). De båda språkens, det vill säga engelskans och franskans, struktur är mycket likartad: ordföljden är strikt (subjektet står först och predikatet på andra plats). Likheterna mellan språkens strukturer gjorde det möjligt att uppnå goda översättningsresultat med statistiska metoder. Men så är det inte med litauiska. Googles översättningar, som använder statistisk metod, ger hittills inga bra översättningar till litauiska. Enligt uppgifter från 2017 är resultaten för såväl översättning från engelska till litauiska som från litauiska till engelska sämre än resultaten för engelska-lettiska, lettiska-engelska, engelska-estniska och estniska-engelska (Skadinš 2017: 22).
Statistiska metoder trängde också in på andra områden inom lingvistiken. De första arbetena behandlade fonetik (Zipf 1929). År 1944 genomfördes statistiska undersökningar av litterär text, det vill säga hur många ord som användes en gång, hur många ord två gånger, tre gånger och så vidare (Yule 194: 9).
146
Acta Linguistica Lithuanica LXXVI
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
Sedan 1973 används benämningen dialektometri för det lingvistiska område som ägnar sig åt kvantitativ forskning om språk och dialekter (Köhler, Altmann, Piotrowski 2005: 498).
Statistiska metoder har också tillämpats inom morfologin. Goldsmith beskriver algoritmen för att fastställa morfem i ord så här: „algorithm that takes as input a list of words and provides as output a segmentation of the words into morphemes“ (Goldsmith 2010: 36).
I slutet av förra seklet beskrevs i den ryska litteraturen försök att genomföra automatisk syntaktisk analys av meningar med hjälp av statistiska beräkningar. Forskare i Ryssland har föreslagit att meningars syntaktiska struktur inte ska fastställas på grundval av lingvistisk analys, utan genom statistisk bearbetning av texter. De hävdar att varje språklig enhet (ord, syntaktisk kategori hos ordet, syntaktisk konstruktion) förekommer i texten med en viss frekvens. Enligt uppgifter från den engelska frekvensordboken över valens har verbet till exempel 195 olika mönster för syntaktiska relationer. Men de tio vanligaste mönstren utgör ensamma 86% av alla fall som används i texter. Statistiska regelbundenheter används också för meningens linjära struktur. Varje ordklass har en frekvens för hur långt från utgångspunkten den kan stå. Det engelska verbet kan med sannolikheten 0,7 stå på andra till femte plats från meningens början. Med sannolikheten 0,95 förekommer det på andra till tionde plats (Церкас 1979: 124).
Senare användes data från en textkorpus för syntaktisk analys (Köhler 2012: 31).
Hittills har dock goda resultat endast uppnåtts vid bearbetning av engelska. Vidas Daudaravičius, som arbetar med datorisering av litauisk syntax, hävdar: „Naivų manyti, kad metodai, kurie sėkmingai taikomi anglų kalbai, tinka ir kitoms kalboms.“1 (Daudaravičius 2012: 3).
Med hjälp av statistiska metoder kan man snabbt skapa system som arbetar snabbt, men under ett villkor: man måste tolerera ett visst antal fel (Link 1). Därför beslutade man vid Institutet för litauiska språket att i så liten utsträckning som möjligt förlita sig på statistik, eftersom man strävar efter största möjliga noggrannhet och tillförlitlighet i uppgifterna.
1 „Det är naivt att tro att metoder som framgångsrikt används för engelska också passar lika bra för andra språk.“
Straipsniai / Articles
147
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAUSKAS
1.2. SITUATIONEN I LITAUEN
Många arbeten inom datoriseringen av litauisk grammatik har redan genomförts. De flesta av dem är begripliga endast för specialister på datorlingvistik. Vissa är också avsedda för allmänheten. De återspeglar dock bara enskilda egenskaper och kännetecken hos ord och grammatik. Till exempel skapades en morfemdatabas vid Vytautas den stores universitet i Kaunas på grundval av en textkorpus. Där saknas många ordformer, och man använder mycket många förkortningar som inte är begripliga för alla. Morfemen skiljs åt med bindestreck, och inga uppgifter om morfemtypen anges. Vid Institutet för matematik och informatik i Vilnius skapades en databas för avledning och morfemik. Där anges morfemtypen samt grundorden och bestämningsorden (Murmulaitytė 2012: 96). Tyvärr är databasen inte fritt tillgänglig. Därför beslutade man att skapa ett omfattande informationssystem, avsett för allmänheten och tänkt att kunna erbjuda användaren utförliga data.
Man kan observera två ytterligheter i framställningen av litauisk grammatisk information på internet. Dessa är: att till och med vanliga ordformer saknas och att överflödiga ord, obegripliga även för en modersmålstalare, framställs. I informationssystemet för litauisk grammatik strävar man efter att undvika båda dessa ytterligheter. Alla ordformer genereras automatiskt med hjälp av datorn utifrån ordets lemma, så att hela uppsättningen böjningsformer erhålls. Alla möjliga avledningar och sammansättningar förs in i databasen. Därmed saknas inte längre några ordformer. Därefter granskas alla datorgenererade ord och ordformer för hand, och former som inte existerar stryks. På så sätt kan man utesluta överflödiga ord.
2. ARBETEN INOM DATORLINGVISTIK I LITAUEN
I Litauen kan man urskilja två metoder för datorbaserad språkbehandling. I Kaunas bedrivs arbetet vid Centrum för datorlingvistik på grundval av en textkorpus. I Vilnius, vid universitetet och Litauiska språkinstitutet, utgår man i högre grad från det litauiska språkets egna egenskaper. Båda metoderna har såväl fördelar som nackdelar. I det följande visas detta med några exempel.
148
Acta Linguistica Lithuanica LXXVI
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
2.1. TEXTKORPUSBASERADE ARBETEN
Vid Vytautas den stores universitet i Kaunas skapades en textkorpus för det moderna litauiska språket. Den används för olika typer av språkbehandling. Inom grammatiken skapades en morfemordbok (Rimkutė, Kazlauskienė, Rąkinis 2011) och några år senare även en databas. Användaren får tillgång till både morfemiska och morfologiska data. Detta är den första fritt tillgängliga källan där ordet delas upp i sina morfem. Morfemtypen anges tyvärr inte, och ibland leder det till en förvirrande framställning av ordets morfemiska struktur. Så är fallet när ord med olika struktur återges på samma sätt. Ett exempel på detta visas i bild 1. Orden ”per-ei-ti” (gå över) och ”per-ė-ti” (ruva) skiljer sig knappast åt till det yttre. De båda ordens morfemiska strukturer ser likadana ut i morfemdatabasen. I det första ordet är morfemet ”per” emellertid ett prefix, medan samma första morfem ”per” i det andra ordet är roten.
BILD 1. Ord med olika morfemisk struktur återges på samma sätt (Rimkutė, Kazlauskienė, Rąkinis 2011: 8, 35)
Som en andra brist kan man nämna att även vanliga ordformer saknas. Particip har sex kasus i litauiska. I tabell 1 visas förekomsten i morfemdatabasen av ordformerna (singular, maskulinum) för participet ”bėgantis / löpande, strömmande”.
Det visar sig att till och med detta ords lemma (nominativ, singular) saknas. Inte heller de andra former som saknas, till exempel lokativ (bėgančiame vandenyje / i det strömmande vattnet), kan betraktas som sällsynta eller ovanliga. Således finns endast 2 ordformer av 6 kasus.
Forskare som arbetar med det andra baltiska språket, lettiska, talar också om ett otillräckligt antal ordformer i textkorpusen (Paikens, Rituma, Pretkalniņa 2013: 272).
Straipsniai / Articles
149
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBIKAS, VYTAUTAS ŠVEIKAUSKAS
TABELL 1.
Förekomsten i databasen (länk 2) av participets ordformer bēgantis / löpande, flytande i singular, maskulinum
Kasus
Ord
Databas
Nominativ
bēgantis
saknas
Genitiv
bēgančio
finns
Dativ
bēgančiam
saknas
Ackusativ
bēgantį
finns
Instrumentalis
bēgančiu
saknas
Lokativ
bēgančiame
saknas
Totalt:
6
2
2.2. UTGÅNGSPUNKT – DET LITAUISKA SPRÅKET
Vid Vilnius universitet utgår man från det litauiska språkets egenskaper. Webbplatsen Morfologija.lt (länk 3) visar till och med ordets böjningstabeller. Tyvärr finns det många tomma fält, ibland för hela paradigmet. Okända och för en litauer obegripliga ord förekommer också ibland, till exempel ”sutikimoji” (länk 4) och liknande. Vid Institutet för matematik och informatik i Vilnius skapades en databas för ordbildning och morfemik (Murmulaitytė 2012). Den innehåller mycket värdefull information (morfemtyp, grundord, bestämningsled med mera), men uppgifterna är tyvärr inte fritt tillgängliga.
3. INFORMATIONSSYSTEMET FÖR LITAUISK GRAMMATIK
Det litauiska språket hör till de minst datoriserade språken i Europa (Vaišnienė, Zabarskaitė 2012: 35). Därför beslutade man att skapa ett informationssystem som innehåller utförliga uppgifter om litauiska ords grammatiska egenskaper. Forskare som ägnar sig åt de baltiska språken betonar ofta behovet av att skapa mer programvara för en bred användarkrets. I anvisningarna till konferensen BSNLP (Balto-Slavic Natural Language Processing) 2015 och 2017 står det: ”bidrag
150
Acta Linguistica Lithuanica LXXVI
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
som beskriver system som görs tillgängliga för en bredare allmänhet skulle starkt uppmuntras / särskilt uppmuntras de institutioner som beskriver system som gjorts tillgängliga för allmänheten” (länk 5).
Därför kom man på idén att utforma informationssystemet för litauisk grammatik för en bred användarkrets och att presentera uppgifterna så enkelt och begripligt som möjligt.
Följaktligen valdes responsiv webbdesign (RW) för att så väl som möjligt kunna tillgodose användarnas behov. Den grammatiska informationen om ordet presenteras därför i rutor (engelska tiles) (länk 6). Därför går det också att komma åt webbplatsen via mobiltelefon.
3.1. METOD FÖR ATT SKAPA DATABASEN
Målet med datoriseringen av grammatiken är att ha all grammatisk information om varje ord och alla dess former i elektronisk form. Det finns två sätt att uppnå detta. Det första är att skapa en formell beskrivning av de grammatiska reglerna (det skulle vara ett slags hjälpmedel) och därefter låta datorn generera de nödvändiga uppgifterna. Det andra sättet är att lagra all grammatisk information om alla former av alla ord i datorn och läsa ut den vid behov. Det återstår att diskutera vilket tillvägagångssätt som kräver mer arbete. Vid Institutet för matematik och informatik har programvara för morfologisk analys av det litauiska språket utvecklats (Zinkevičius 2000) med den första metoden. Det gick dock inte att uppnå 100-procentig noggrannhet: uppgifterna innehåller fel och vissa litauiska ord känns inte igen.
Vid utvecklingen av informationssystemet för litauisk grammatik avstod man från denna metod av följande skäl: För att datorn själv ska kunna bearbeta orden måste man mycket noggrant ange vilka åtgärder den ska utföra med vilket ord. Därför måste alla ord först delas in i grupper på ett sådant sätt att samma regelbundenheter gäller för alla medlemmar i en grupp, det vill säga så att samma bearbetningsmetod kan användas. För att placera ett ord i den ena eller andra gruppen måste man fastställa många egenskaper som ligger till grund för grupperingen av orden. Till exempel använder man i den syntaktiska analysen av litauiska det semantiska särdraget [tid] för att fastställa den syntaktiska funktionen hos substantivens ackusativ. I meningen ”Visą naktį ji
Straipsniai / Articles
151
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
skaitė šią knygą / Hon läste den här boken hela natten.“ och „Visą knygą ji perskaitė šią naktį / Hon läste ut hela boken under den här natten.“ De båda orden knygą/bok och naktį/natt skiljer sig inte åt vad gäller de morfologiska kategorierna – båda är femininum, singular och ackusativ. Endast det semantiska draget [tid], som ordet naktis/natt har och ordet knyga/bok saknar, gör att datorn korrekt kan betrakta ordet naktį/natt som ett tidsadverbial och ordet knygą/bok som objekt i satsen. Något liknande måste man göra även för morfologin. Ett av felen i den redan utvecklade programvaran för morfologisk analys av det litauiska språket är att morfemet -ėj- betraktas som ett suffix vid sådana rötter som det inte får kombineras med. Man måste fastställa egenskaper hos ord som låter datorn avgöra med vilka rötter suffixet -ėj- får kombineras. Men det är mycket komplicerat att göra detta. Vilken egenskap har till exempel orden geroė/Välstånd, žinovas/Kännare(expert) och daržovė/Grönsak gemensamt? De har alla suffixet -ov-. Och vad skiljer dem från alla övriga ord vars rötter inte kan ta detta suffix (man kan inte säga *kėdovė – en avledning med suffixet -ov- från ordet kėdė/stol)? Och vilken egenskap visar detta?
Vid utvecklingen av informationssystemet för litauisk grammatik valdes alltså den andra vägen, det vill säga en databas förbereddes med utförlig grammatisk information om alla former av alla ord i det litauiska språket. Här behöver man inte utgå från de grammatiska kategorierna (som i alla grammatikböcker i tryckt form), utan från själva ordet: all information som hör ihop med varje ord ska göras tillgänglig för användaren.
Det beslutades att utgå från en rot och utveckla programvara som skulle återspegla hela strukturen i den litauiska grammatiken. Som första försök valdes roten bėg (från verbet bėgti/springa). Därefter genererades alla möjliga avledningar med datorn, och senare ströks alla ord som inte finns i det litauiska språket för hand. Databasen innehåller totalt cirka 25 000 poster.
3.2. SÄRDRAG HOS ”LIGIS”
Informationssystemet för litauisk grammatik (Lietuvių kalbos gramatikos informacinė sistema – LIGIS) (länk 7) har två viktiga egenskaper. För det första ger det användaren mer utförlig information om ett visst ord än grammatiker i tryckt form. Och
152
Acta Linguistica Lithuanica LXXVI
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
för det andra omfattar det fler ord än ordböckerna. I grammatiker anges regler som passar för en viss grupp ord. Men där nämns inte alla ord som omfattas av regeln. LIGIS samlar all information som hör ihop med det ord användaren har skrivit in och tillhandahåller den på en webbplats. I ordböcker finns inte alla ord i det litauiska språket; många avledningar och sammansättningar saknas. LIGIS omfattar alla möjliga avledningar. Som jämförelse kan ett exempel ges. Morfemdatabasen innehåller cirka 75 000 poster. Men dessa motsvarar olika litauiska ord. LIGIS-databasen består för närvarande av 25 000 poster och omfattar endast ord som bildats från en enda rot: beg-. I morfemdatabasen finns 118 ord med denna rot.
3.3. ORDETS STRUKTUR
När ordet har skrivits in förklaras dess struktur för användaren: lemma och grundord anges, liksom bestämningsordet i avledningar och sammansättningar. Om ordet är grammatiskt tvetydigt får varje betydelse ett eget nummer för lemmat. Därefter visas de morfologiska och morfemiska uppgifterna under detta nummer. Ett exempel på ett tvetydigt ord finns i bilaga A.
Övriga former. Så heter knappen (på engelska button) som finns i rutan för ordets struktur. Webbplatsen för morfologisk analys av ryska (länk 8) visar varje gång alla ordformer för det inmatade ordet. I informationssystemet för litauisk grammatik beslutade man att införa en knapp och låta användaren hämta övriga former via länken, eftersom användaren inte behöver alla former av ett ord varje gång.
3.4. MORFOLOGISKA DATA
Den morfologiska informationen omfattar ordklassbeteckning och grammatiska kategorier: kasus, genus och numerus för substantiv; person, tempus och modus för verb osv. Tvetydiga ord numreras när exempelvis ett substantiv har flera homonyma kasusformer.
I databasen för morfem (länk 2) finns också morfologiska data om ordet. Men informationen anges enbart med förkortningar
Straipsniai / Articles
153
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
med förkortningar. Ett sådant exempel visas i bild 2. För icke-specialister kan så många förkortningar ofta vara obegripliga. Särskilt för utlänningar som studerar eller lär sig litauiska kan information som presenteras på detta sätt ibland vara oklar.
BILD 2. Data om ordet begčio, presenterade enbart med förkortningar (länk 2)
I informationssystemet för litauisk grammatik används inga förkortningar. Alla uppgifter skrivs ut i sin helhet (bilaga A).
3.5. MORFEMISKA DATA
Den viktigaste skillnaden jämfört med de databaser som redan går att använda i dag1 är att typen anges för varje morfem. Endast på detta sätt kan man entydigt återge morfemen i ett ord. Annars kan man till exempel inte skilja den andra roten i ett sammansatt ord från suffixet, vilket är fallet i morfemdatabasen.
Den första och avgörande egenskapen var att morfemen återgavs i olika färger. En färg bestämdes för varje morfemtyp (rot, prefix, suffix, ändelse). Prefix skrivs med blått. Rött användes för roten. Suffix återges med grönt och svart valdes för ändelsen.
Dessutom visas det ord som delats upp i morfem i vertikal riktning, och bredvid anges inte bara typen för varje morfem i ordet, utan också morfemets egenskaper, om det har några, till exempel för ett suffix: avlednings- eller böjningsbildande; för ändelser: förkortade, pronominaliserade och liknande. När det gäller förkortade ändelser, som är mycket vanliga i talspråket, visas också den fullständiga ändelsen bredvid. Som exempel kan man ange orden i talspråket: šnekamoje kalboje – fullständiga ändelser, šnekamoj kalboj – förkortade ändelser. Om ordet har en fullständig ändelse anges ingen längdegenskap, eftersom de flesta ord har fullständiga ändelser och sådan information skulle vara överflödig. Om
154
Acta Linguistica Lithuanica LXXVI
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
Om ändelsen inte är pronominaliserad anges inte heller någon information om detta.
Ljudförändringar betraktas som en egenskap hos roten. De kan vara såväl konsonantförändringar som vokalförändringar. Ytterligare en typ av ljudförändring som man kan lägga märke till i det litauiska språket är bortfall av konsonanter i imperativ. Även infix hör till ljudförändringarna i ett ords rot. Som en egenskap hos prefixet betraktas dess ursprung: prepositionellt ursprung, bildat av en partikel eller internationellt ursprung.
Vid grammatisk tvetydighet hos ord undersöks de morfemiska strukturerna. Om de är identiska återges endast en struktur. Om de däremot skiljer sig åt anges de morfemiska strukturerna för varje betydelse av ordet (bilaga A).
3.6. ALLA ORDFORMER
För varje ord som finns i databasen kan man öppna böjningstabellen genom att klicka på knappen ”Övriga former”. Där återges alla uppgifter från den morfologiska rutan. Överst i tabellen anges de kategorier som inte ingår i böjningstabellen. Substantiv i det litauiska språket böjs till exempel inte efter genus, och därför anges genus överst i tabellen, liksom lemma och ordklass. Adjektiv och particip har tre genus, och ett särdrag hos det litauiska språket är att endast två av dem (maskulinum och femininum) har alla sex kasus. Det tredje genuset har bara en form, varför den anges utan kasusbenämning (bilaga B). För verb visas alla tempusformer i alla modus (bilaga D).
Konjugationsklasserna och deklinationsklasserna blir på så sätt överflödiga, och därför anges inga uppgifter om dem.
För vissa ord finns även användningsexempel i böjningstabellen. För detta används snabbinfo (på engelska tooltip). I bilaga C ges ordet ”bėgis” som exempel (ackusativ singular av substantivet bėgis / järnvägsräls, löpning).
3.7. DATABASEN
Vid utvecklingen av databasen strävade man efter så hög kvalitet och tillförlitlighet som möjligt. Därför utfördes en stor del av arbetet för hand
Straipsniai / Articles
155
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAUSKAS
skapats, eftersom information med maximal tillförlitlighet endast kan uppnås med människans hjälp (Sulger 2013: 53).
Vid Institutet för litauiska språket genomfördes forskning om litauiska prefix. Man konstaterade att det finns omkring 600 kombinationer av prefix i litauiskan (Šveikauskienė 2015: 195). Med ”kombinationer” avses olika prefixsekvenser som kan förekomma före roten, till exempel at-bėgi, nu-bėgi, ne-be-at-bėgti, ne-nu-bėgti, te-be-bė-ti och så vidare. Det visade sig att endast 220 av dessa kombinationer används med verbrotter; de övriga, till exempel nuo-, används med substantiv: nuo-monė /åsikt. Programvaran utformades så att den automatiskt kopplar roten till alla möjliga kombinationer av prefix. Därefter granskar människor resultaten från datorn, och de ord som faktiskt förekommer i litauiskan förs in i databasen. På så sätt undviks två ytterligheter: både det alltför stora antalet former som genereras av datorn och en otillräcklig omfattning av ordförrådet.
Alla lemman och den grammatiska information som hör till dem förs in i databasen för hand. Eftersom programvaran som utvecklats vid Institutet för matematik och informatik inte gör några fel när den genererar ordformer utifrån det givna lemmat, ansåg man att datorn kunde skapa posterna för de återstående ordformerna automatiskt.
Det är anmärkningsvärt att LIGIS också behandlar ord med förkortade ändelser. Sådana ord är mycket vanliga i talspråket, och ingen av de befintliga databaserna behandlar dessa ordformer. Det bör också betonas att LIGIS innehåller avledningar som saknas till och med i Litauiska språkets ordbok i 20 band och dess elektroniska version (länk 9), till exempel neužbėgti/inte längre springa uppför.
I databasen lagras informationen i ett datorvänligt format, det vill säga kodningen i Prage Markup Language (Hana, Štepánek 2012) används. Detta dataformat presenteras inte på internet, eftersom det vore överflödigt för personer som inte är specialister på datorlingvistik.
Att all information lagras i en databas gör också LIGIS till ett användbart verktyg för språkvetare som forskar om litauiskan. Man kan få information av många olika slag, till exempel söka efter ord med en viss kombination av prefix och suffix med mera.
156
Acta Linguistica Lithuanica LXXVI
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
3.8. WEBBPLATSENS FLERSPRÅKIGHET
Webbplatsen finns på sju språk: litauiska, engelska, tyska, franska, italienska, ryska och japanska. Behovet av en flerspråkig webbplats uppstod på grund av de otillfredsställande litauiska översättningarna i Google. Maskinöversättning från litauiska är opålitlig. Därför beslutade man att göra webbplatsen om litauisk grammatik flerspråkig och endast använda texter som översatts av människor. Läget för andra språk är uppenbarligen inte mycket bättre. Detta framgår av ett brev från Lingvist daterat den 8 juni 2017, där man ber att översättningen av benämningen LINGUIST ska göras av modersmålstalare och under inga omständigheter med maskinöversättning (LinguiList 2017: 28.252).
Vår tanke bakom beslutet att göra webbplatsen flerspråkig var följande: Om en utlänning, till exempel en norrman, lär sig eller studerar litauiska och känner till vissa litauiska ord men ännu inte andra, kan han välja ett språk som han behärskar bättre än litauiska, till exempel tyska, så blir alla litauiska ord som han inte känner till begripliga för honom. Därför såg man till och med till att det ord som användaren matat in sparas när språk byts. Om en användare väljer ett annat språk behöver han alltså inte skriva in ordet på nytt.
4. FRAMTIDSPLANER
Vid Vilnius universitet finns många tvåspråkiga ordböcker i digitaliserad form. Vid Institutet för litauiska språket har den stora ordboken i 20 band digitaliserats, liksom de andra enspråkiga ordböckerna: synonym-, antonym- och fraseologiska ordböcker m.fl. Planen är att koppla samman de båda typerna av ordböcker med informationssystemet för litauisk grammatik och skapa en motsvarighet till den tyska webbplatsen CANOONET (länk 10).
Eftersom informationssystemet för litauisk grammatik innehåller uppgifter om morfem är det möjligt att söka efter ord utifrån morfemmodellen. Och just detta är planerat för framtiden.
En flik (engelska tab) på webbplatsen LIGIS är avsedd för teori och håller för närvarande på att utarbetas. Där ska fördjupade akademiska kunskaper om litauisk grammatik finnas.
Straipsniai / Articles
157
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAUSKAS, VYTAUTAS ŠVEIKAUSKAS
I det första skedet arbetar man med morfologi. På den andra nivån ska även syntaktiska data läggas in.
5. Slutsatser
1. Detta tillvägagångssätt kan också vara nyttigt och meningsfullt för andra språk med rik böjning.
2. Informationssystemet för litauisk grammatik kan vara till stor nytta för skolelever, studenter och utlänningar som lär sig litauiska, liksom för språkvetare som forskar om det litauiska språket.
3. De insamlade uppgifterna kan också fungera som dokumentation av det litauiska språket.
Literaturverzeichnis
Al – Onaizan Yaser, Curin Jan, Jahr Michael, Knight Kevin, Lafferty John, Melamed Dan, Och Franz – Josef, Purdy David, Smith Noah A., Yarowsky David 1999: Statistical Machine Translation. – Final Report JHU Workshop. http://mt-archive.info/JHU-1999-AlOnaizan.pdf (Zugriff am 21.11. 2017).
Brown Peter F., Cocke John, Della Pietra Stephen A., Della Pietra Vincent J., Jelinek Frederick, Lafferty John D., Mercer Robert L., Roossin Paul S. 1990: A Statistical Approach to Machine Translation. – Computational Linguistics Volume 16, Number 2, June, 79–85. http://www.aclweb.org/anthology/J90-2002 (Zugriff am 21.11. 2017).
Charniak Christopher E. 1989: Artificial Intelligence & Turbo C. Homewood: Dow Jones-Irwin.
Daudaravičius Vidas 2012: Teksto skaidymas pastoviųjų junginių segmentais. Daktaro disertacijos santrauka. Kaunas: Vytauto Didžiojo universitetas.
Goldsmith John A. 2010: Segmentation and Morphology. The Handbook of Computational Linguistics and Natural Language Processing. Wiley-Blackwell, 364–393.
Han Jirka, Štěpánek Jan 2012: Prague Markup Language Framework. Procedings of the 6th Linguistic Annotation Workshop. Jeju, Republic of Korea, 12–13 July, 12–21.
Jensen Karen, Heidorn George Emil, Richardson Stephen D. 1993: Natural language processing: The PLNLP Approach. Boston / London: Kluwer Academic Publishers.
158
Acta Linguistica Lithuanica XXVII
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
Köhler Reinhard 2012: Quantitative Syntax Analysis. De Gruyter Mouton.
Köhler Reinhard, Altmann Gabriel, Piotrowski Rajmund G. 2005: Quantitative Linguistik. Berlin / New York: Walter de Gruyter.
Linguist List 2017: 28.254, Qs: How do you say the LINGUIST List in your language? 08 Jun 2017. [email protected].
Murmulaitytė Daiva 2012: Lietuvių kalbos morfemikos ir žodžių darybos tyrimų perspektyvos. – Žmogus ir žodis 1(14), 96–102.
Nirenburg Sergei 1987: Machine Translation: Theoretical and Methodological Issues. London: Cambridge University Press.
Paikens Pēteris, Rūma Laura, Pretkalniņa Lauma 2013: Morphological Analysis with limited resources: Latvian example. Proceedings of the 19th Nordic Conference of Computational Linguistics. (NODALIDA 2013); Linköping Electronic Conference Proceedings #85, 267–277.
Reed David W. 1949: A Statistical Approach to Quantitative Linguistic Analysis, WORD, 5:3, 235–247, DOI: 10.1080/00437956.1949.11659355.
Rimkutė Erika, Kazlauskienė Asta, Raškinis Gailius 2011: Dažnis lietuvių kalbos žodyne. Kaunas: VDU.
Schwanke Martina 1991: Maschinelle Übersetzung: Ein Überblick über Theorie und Praxis. Berlin: Springer-Verlag.
Skadiņš Raivis 2017: Neural MT and other Language Technologies at TILDE. http://school.gramaticframework.org/2017/slides/Ravis-Neural_MT_at_Tilde.pdf (zugegriffen 2017.11.21).
Sulger Sebastian, Butt Miriam, King Tracy Holloway, Meurer Paul 2013: ParGramBank: The ParGram Parallel Treebank. – Proceedings of the 51st Annual Meeting of the Association for Computational Linguistics, Sofia, Bulgaria, 550–560. http://aclweb.org/anthology/P/P13/P13-1054.pdf (zugegriffen 2017.11.21).
Šveikauskienė Daiva 2015: Morphemic structure of the Lithuanian prefixes. – Language: Meaning and Form 6. – Language System and Language Use. Rīga: Latvijas universitāte, 189–197.
Vaišnienė Daiva, Zabarskaitė Jolanta 2012: The Lithuanian Language in the Digital Age. – G. Rehm, H. Uszkoreit White Paper Series. Heidelberg / New York / Dordrecht / London: Springer.
Winograd Terry 1983: Language as a Cognitive Process 1. Syntax. London: Addison-Wesley Publishing Company.
Straipsniai / Articles
159
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAS
Yule George Udny 1944: The Statistical Study of Literary Vocabulary. Cambridge MA, Cambridge university press.
Zinkevičius Vytautas 2000: Lemoklis – morfologinė analizė. – Darbai ir dienos 24, 245–273.
Zipf George Kingsley 1929: Relative frequency as a Determinant of Phonetic Change. – Harvard studies in classical philology 40, 1–95.
Сердюков Пётр Иванович 1979: Оптимизация алгоритма поиска синтаксических связей. – Международный семинар по машинному переводу. Москва: ВЦП, 123–125.
LINKS
Link 1: http://www.digitalgrammars.com/ (Zugriff am 21.11. 2017)
Link 2: http://tekstynas.vdu.lt/page.xhtml?id=morfema-db (Zugriff am 21.11. 2017)
Link 3: http://morfologija.lt/ (Zugriff am 21.11. 2017)
Link 4: http://morfologija.lt/zodzio-formos/sutikimas (Zugriff am 21.11. 2017)
Link 5: http://bsnlp-2017.cs.helsinki.fi/cfp.html (Zugriff am 21.11. 2017)
Link 6: https://de.wikipedia.org/wiki/Microsoft_Windows_8#Oberfl.C3.A4che (Zugriff am 21.11. 2017)
Link 7: http://ligis.lki.lt/ (Zugriff am 21.11. 2017)
Link 8: http://goldlit.ru/component/slog (Zugriff am 21.11. 2017)
Link 9: http://www.lkz.lt/Visas.asp?zodis (Zugriff am 21.11. 2017)
Link 10: http://www.canoo.net/ (Zugriff am 21.11. 2017)
160
Acta Linguistica Lithuanica LXXVI
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
ANHANG A. GRAMMATISCHE INFORMATION.
Beispiel des grammatisch mehrdeutigen Wortes nubəɡti / hinlaufen-hingelaufen.
Die grammatische Information wird in der Website in Kacheln ausgelegt.
Diese Darstellungsweise ist günstig für responsives Webdesign – RWD.
Bemerkung: Die Farben sind im Bild entfernt.
Straipsniai / Articles
161
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
ANHANG B. FORMENtABELLE FÜR DEKLINATION.
Als Beispiel wird die Flexion des Partizips nubėtas / hingelaufene in allen drei Genera und allen Kasus angeführt.
NUBĖTASPARTIZIP II, PASSIV, PRÄTERITUMMännlichSingularPluralNominativnubėtasnubėtiGenitivnubėtonubėtųDativnubėtamnubėtiemsAkkusativnubėtąnubėtusInstrumentalnubėtunubėtaisLokativnubė tamenubėtuoseWeiblichSingularPluralNominativnubėtanubėtosGenitivnubėtosnubėtųDativnubėtainubė tomsAkkusativnubėtąnubėtasInstrumentalnubėtanubėtomisLokativnubėtojenubėtoseNeutrumnubėta
162
Acta Linguistica Lithuanica LXXVI
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
ANHANG C. TOOLTIP FÜR VERWENDUNGSBEISPIELE.
Als Beispiel wird die Schnellinfo für die Akkusativ-Singular-Form bėgį des Substantivs bėgis / Lauf, Getriebe, Eisenbahnschiene angeführt.
Straipsniai / Articles
163
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAS
ANANG D. FORMENTABELLE FÜR KONJUGATION.
Als Beispiel wird die Flexion des Verbs bėgti / laufen in allen Tempusformen und Modi angeführt.
164
Acta Linguistica Lithuanica LXXVII
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
Daugakalbė lietuvių kalbos gramatikos informacinė sistema internete
SANTRAUKA
Lietuvių kalbos kompiuterizavimo darbuose galima pastebėti du pagrindinius trūkumus: trūksta kartais net ir dažnai vartojamų formų ir pateikiami pertekliniai, lietuvių kalboje neegzistuojantys žodžiai. Kuriant Lietuvių kalbos gramatikos informacinę sistemą (LIGIS) stengiamasi išvengti jų abiejų. Visos formos generuojamos kompiuteriu automatiškai ir vėliau gauti rezultatai peržiūrimi žmogaus, kad būtų atmesti lietuvių nesuprantami žodžiai.
Lietuvių kalbos gramatikos informacinė sistema apima visus darinius. Šiuo metu duomenų bazę sudaro tik šakn inės beg-žodžiai. Jų yra apie 25 000. Palyginimui galima pateikti tokius duomenis: morfemos duomenų bazę sudaro yra apie 75 000 įrašų, bet jie surinkti iš visos lietuvių kalbos leksikos. Su šaknimi beg- ten yra 118 žodžių.
Kuriant Lietuvių kalbos gramatikos informacinę sistemą pagrindinis tikslas buvo pateikti išsamią gramatinę informaciją plačiajai visuomenei. Todėl buvo stengiamasi duomenis atvaizduoti kuo aiškiau ir suprantamiau. Svetainė pritaikyta naudotis ir mobiliuosiuose telefonuose.
Vartotojas, pateikęs žodį, gauna trijų tipų informaciją apie jį: žodžio struktūrą (pradinę formą bei pamatinį žodį dariniams), morfologinę informaciją (kalbos dalis bei jos morfologinės kategorijos – linksnis, giminė, skaičius, laikas, laipsnis ir t. t.) ir morfeminiai duomenys – žodis išskaidytas morfemomis, nurodant morfemos tipą bei požymius, jei morfema jų turi, pavyzdžiui, priesaga – darybinė / kaitybinė, galūnė – įvardžiuotinė, sutrumpėjusi ir kt. Kiekviena morfema žymima vis kita spalva. Reikia pabrėžti, kad Lietuvių kalbos gramatikos informacinė sistema yra pirmasis tinklapis Lietuvoje, kur vartotojui pateikiama informacija apie morfemos tipą. Be to, apdorojami ir žodžiai su sutrumpėjusiomis galūnėmis, kurios labai paplitusios, ypač šnekamojoje kalboje.
Kiekvienam duomenų bazėje esančiam žodžiui vartotojas gali gauti visą kaitybinę lentelę. Kai kuriems žodžiams pateikiama vartojimo pavyzdžių.
Kuriant Lietuvių kalbos gramatikos informacinę sistemą siekiama kuo didesnio tikslumo ir patikimumo. Todėl visos temos (žodžių pradinės formos – vardininkas, bendratis) suvedamos į duomenų bazę rankomis. Kaitybines formas sugeneruoti patikėta kompiuteriui, nes šiame jo darbe nebuvo pastebėta klaidų.
Svetainė pateikiama septyniomis kalbomis: lietuvių, anglų, vokiečių, prancūzų, italų, rusų ir japonų.
Ateityje planuojama Lietuvių kalbos gramatikos informacinę sistemą jungti su skaitmenintais žodynais ir sukurti vokiečių tinklapio CANOONET analogą.
Straipsniai / Articles
165
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAUSKAS, VYTAUTAS ŠVEIKAUSKAS
Įteikta 2017 m. rugsėjo 5 d.
DAIVA ŠVEIKAUSKIENĖ
Petro Vileišio g. 5, LT-10308 Vilnius, Lietuva [email protected]
ARŪNAS RIBAUSKAS
Saulėtekio al. 11, LT-10221 Vilnius, Lietuva [email protected]
VYTAUTAS ŠVEIKAUSKAS
Petro Vileišio g. 5, LT-10308 Vilnius, Lietuva [email protected]
166
Acta Linguistica Lithuanica LXVII