scieee AI-readable full text Open interactive document viewer

Eine mehrsprachige Website zur Grammatik der litauischen Sprache

Daiva Šveikauskienė; Arūnas Ribikauskas; Vytautas Šveikauskas

Full text

DAIVA ŠVEIKAUSKIENĖ Lietuvių kalbos institutas ARŪNAS RIBIKAUSKAS Vilniaus Gedimino technikos universitetas VYTAUTAS ŠVEIKAUSKAS Lietuvių kalbos institutas Mokslinių tyrimų kryptys: gramatika, kompiuterinė lingvistika. DAUGIAKALBĖ LIETUVIŲ KALBOS GRAMATIKOS SVETAINĖ Daugakalbė lietuvių kalbos gramatikos informacinė sistema internete ANOTACIJA Prieš metus Lietuvių kalbos institute pradėtas projektas, kurio tikslas – laisvai prieinamame internete pateikti naudotojams išsamesnius duomenis apie lietuvių kalbos žodžių gramatines ypatybes. 2017 m. kovą parengta bandomoji versija, apimanti tik žodžius su šaknimi „bėg“ (plg. veiksmažodį „bėgti“). Duomenų bazę sudaro apie 25 000 įrašų. Projektu siekiama išvengti jau esamų kompiuterinės lingvistikos darbų trūkumų. Tai susiję su žodžių aprėptimi, gramatinių duomenų įvairiapusiškumu, duomenų pateikimo aiškumu ir suprantamumu ir kt. Naudotojo įvesto žodžio gramatinė informacija pateikiama trijose srityse: žodžio struktūra, morfologiniai duomenys ir morfeminiai duomenys. Tai pirmoji svetainė Lietuvoje, kurioje naudotojui pateikiama informacija apie morfemų tipus. Kiekvienam duomenų bazėje esančiam žodžiui galima gauti kaitymo lentelę. Kai kuriems žodžiams pateikiami ir vartojimo pavyzdžiai. Svetainė veikia septyniomis kalbomis: lietuvių, anglų, vokiečių, prancūzų, italų, rusų ir japonų, kad ja galėtų naudotis užsieniečiai, besidomintys lietuvių kalba. 144 Acta Linguistica Lituanica LXXVII Eine mehrsprachige Website zur Grammatik der litauischen Sprache RAKTAŽODŽIAI: gramatika, morfologija, morfema, informacinė sistema, kompiuterinė lingvistika. ANOTACIJA The project was started in the Institute of Lithuanian language in 2016. It aims at presenting detailed data about the grammatical features of Lithuanian words. The goal is to make those data freely accessible to any user on the Internet. The preliminary version covering the words with the root “bėg/run” was published in March 2017. The database contains around 25,000 entries. We are trying to avoid drawbacks that are specific to the words done in the field of computational linguistics. It includes word coverage, grammatical data comprehensiveness, clarity and clearness of presented information etc. Grammatical information about the word in question is presented from three aspects: word structure, morphological data, and morphemic data. It is the first website in Lithuania providing morphemic types. One can get an inflection table for each word the database contains. Usage examples are given for some words. The information on the website is available in seven languages – Lithuanian, English, German, French, Italian, Russian, and Japanese – so foreigners interested in Lithuanian language can use it as well. RAKTAŽODŽIAI: gramatika, morfologija, morfemika, informacinė sistema, kompiuterinė lingvistika. 1. ĮVADAS: KOMPIUTERINĖ LINGVISTIKA Iki XX a. vidurio visos gramatikos buvo spausdinamos popieriuje. Atsiradus kompiuteriams (1942 m. Harvardo universitete buvo sukurtas pirmasis pasaulyje kompiuteris MARK I (Schwanke 1991: 69)), jie ėmė skverbtis į visas gyvenimo sritis. Kalbos nebuvo išimtis: netrukus paaiškėjo, kad kompiuteriai gali apdoroti ne tik skaičius, bet ir įvairiausius simbolius. Vadinasi, jie gali apdoroti ir kalbas. Keli lingvistai pradėjo kurti formalias kalbų aprašymo sistemas, kad kompiuterių galimybes būtų galima pritaikyti ir kalboms (Winograd 1983: 23). Dirbtinio intelekto srityje kalbos apdorojimas tapo viena svarbiausių taikymo sričių (Charis 1989: 71). 1968–1978 m. svarbiausia dirbtinio intelekto tyrėjų tema buvo kalbų gramatinė analizė (Nirenburg 1987: 26). Tačiau kalbos, kurias žmonės taip lengvai įvaldo, kompiuteriams pasirodė esanti kietas riešutėlis (Jensen, Heidorn, Straipsniai / Articles 145 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS Richardson 1993: 2). Deshalb konnten bislang keine guten Ergebnisse auf dem Gebiet der Sprachverarbeitung mit Hilfe von Computern erreicht werden. 1.1. STATISTINIAI METODAI Statistiniai metodai kalbos apdorojime yra labai svarbūs. Pirmieji pasiūlymai juos taikyti buvo pateikti netrukus po kompiuterių atsiradimo. Tai ypač pasakytina apie anglų kalbą. David W. Reed aptarė kiekybinę lingvistinę analizę (Reed 1949: 236). Warenas Weaveris pirmasis iškėlė mintį naudoti kompiuterius vertimui. 1949 m. jis pasiūlė šiam tikslui taikyti statistinius metodus. Tačiau to meto mokslininkai netrukus šios minties atsisakė, tikriausiai dėl nepakankamo elektroniniu būdu skaitomų tekstų kiekio ir ne itin didelio tuometinių kompiuterių našumo. Po kelių dešimtmečių, sukaupus tekstynus ir statistinių metodų taikymui kalbos atpažinimo srityje davus gerų rezultatų, prie statistinių metodų vertimui vėl sugrįžta (Brown at al. 1990: 79). Kanadoje tam buvo ypač palankios sąlygos, nes dėl dviejų valstybinių kalbų visa Parlamento medžiaga saugoma dviem kalbomis (anglų ir prancūzų). Todėl pakankamą lygiagrečiųjų tekstų kiekį buvo galima sukaupti labai greitai (Al-Onaizan, Curin, Jahr 1999: 1). Abiejų kalbų, t. y. anglų ir prancūzų, struktūra labai panaši: žodžių tvarka griežta (pirmoje vietoje eina veiksnys, antroje – tarinys). Kalbų struktūros panašumai leido pasiekti gerų statistiniais metodais pagrįsto vertimo rezultatų. Tačiau lietuvių kalbai tai netinka. „Google“ vertimai, kuriuose naudojamas statistinis metodas, iki šiol nepateikia gerų vertimų į lietuvių kalbą. 2017 m. duomenimis, tiek vertimo iš anglų į lietuvių kalbą, tiek vertimo iš lietuvių į anglų kalbą rezultatai yra prastesni už vertimo iš anglų į latvių kalbą, iš latvių į anglų kalbą, iš anglų į estų kalbą ir iš estų į anglų kalbą rezultatus (Skadinš 2017: 22). Statistiniai metodai prasiskverbė ir į kitas lingvistikos sritis. Pirmieji darbai buvo susiję su fonetika (Zipf 1929). 1944 m. atlikti statistiniai literatūros žodyno tyrimai, t. y. tirta, kiek žodžių pavartota vieną kartą, kiek – du, tris kartus ir t. t. (Yule 194: 9). 146 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache Nuo 1973 m. lingvistikos sričiai, kurioje kiekybiškai tiriamos kalbos ir tarmės, įvardyti vartojamas pavadinimas Dialektometrie (Köhler, Altmann, Piotrowski 2005: 498). Statistiniai metodai taip pat buvo taikomi morfologijos srityje. Goldsmithas algoritmą, skirtą morfemoms žodyje nustatyti, apibūdina taip: „algorithm that takes as input a list of words and provides as output a segmentation of the words into morphemes“ (Goldsmith 2010: 36). Praėjusio amžiaus pabaigoje rusų literatūroje aprašomi bandymai statistiniais skaičiavimais atlikti automatinę sakinių sintaksinę analizę. Rusijos mokslininkai pasiūlė sakinių sintaksinę struktūrą nustatyti ne remiantis lingvistine analize, o taikant statistinį tekstų apdorojimą. Jie teigia, kad kiekvienas kalbos vienetas (žodis, žodžio sintaksinė kategorija, sintaksinė konstrukcija) tekste pasitaiko tam tikru dažnumu. Pavyzdžiui, remiantis anglų kalbos valentingumo dažnumų žodyno duomenimis, veiksmažodžiui būdingi 195 skirtingi sintaksinių ryšių modeliai. Tačiau vien dešimt dažniausiai pasitaikančių modelių sudaro 86% visų tekstuose vartojamų atvejų. Statistiniai dėsningumai taikomi ir sakinio linijinei struktūrai. Kiekviena žodžių klasė turi dažnumą, apibūdinantį, kokiu atstumu nuo pradžios ji gali būti. Anglų kalbos veiksmažodis su 0,7 tikimybe gali būti nuo antros iki penktos pozicijos nuo sakinio pradžios. O su 0,95 tikimybe jis pasitaiko nuo antros iki dešimtos pozicijos (Церкас 1979: 124). Vėliau sintaksinei analizei buvo naudojami tekstyno duomenys (Köhler 2012: 31). Tačiau kol kas gerų rezultatų pasiekta tik apdorojant anglų kalbą. Lietuvos sintaksės kompiuterizavimo srityje dirbantis Vidas Daudaravičius teigia: „Naivų manyti, kad metodai, kurie sėkmingai taikomi anglų kalbai, tinka ir kitoms kalboms.“1 (Daudaravičius 2012: 3). Taikant statistinius metodus galima greitai sukurti sparčiai veikiančias sistemas, tačiau su viena sąlyga: reikia toleruoti tam tikrą klaidų skaičių (Link 1). Todėl Lietuvių kalbos institute nuspręsta kuo mažiau remtis statistika, nes siekiama kuo didesnio duomenų tikslumo ir patikimumo. 1 „Naivu manyti, kad metodai, kurie sėkmingai taikomi anglų kalbai, tinka ir kitoms kalboms.“ Straipsniai / Articles 147 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAUSKAS 1.2. PADĖTIS LIETUVOJE Lietuvių kalbos gramatikos kompiuterizavimo srityje jau atlikta daug darbų. Dauguma jų suprantami tik kompiuterinės lingvistikos specialistams. Kai kurie skirti ir plačiajai visuomenei. Tačiau juose atspindimos tik atskiros žodžių ir gramatikos savybės bei ypatybės. Pavyzdžiui, Kaune, Vytauto Didžiojo universitete, tekstyno pagrindu sukurta morfemikos duomenų bazė. Joje trūksta daugelio žodžių formų, vartojama daug ne visiems suprantamų santrumpų. Morfemos atskirtos brūkšneliu, o duomenų apie morfemos tipą nepateikiama. Vilniaus Matematikos ir informatikos institute sukurta darybos ir morfemikos duomenų bazė. Joje nurodomas morfemos tipas, taip pat pamatiniai žodžiai ir dariniai (Murmulaitytė 2012: 96). Deja, duomenų bazė laisvai neprieinama. Todėl nuspręsta sukurti išsamią informacinę sistemą, skirtą plačiajai visuomenei ir galinčią pateikti naudotojui išsamius duomenis. Internete galima pastebėti du kraštutinumus, kaip pateikiama lietuvių kalbos gramatinė informacija. Tai net įprastų žodžių formų nebuvimas ir perteklinių, net gimtakalbiui nesuprantamų žodžių pateikimas. Lietuvių kalbos gramatikos informacinėje sistemoje siekiama išvengti šių abiejų kraštutinumų. Visos žodžių formos automatiškai, kompiuteriu generuojamos iš žodžio antraštinės formos, taip gaunamas visas kaitybinių formų rinkinys. Visos galimos vedinių ir dūrinių formos įtraukiamos į duomenų bazę. Taigi žodžių formų trūkumo nebelieka. Tuomet visus kompiuterio sudarytus žodžius ir jų formas rankiniu būdu patikrina žmogus, o neegzistuojantys variantai pašalinami. Taip išvengiama perteklinių žodžių. 2. KOMPIUTERINĖS LINGVISTIKOS DARBAI LIETUVOJE Lietuvoje galima išskirti du kompiuterinio kalbos apdorojimo metodus. Kaune, Kompiuterinės lingvistikos centre, darbai atliekami remiantis tekstynu. Vilniuje, universitete ir Lietuvių kalbos institute, daugiau dėmesio skiriama pačios lietuvių kalbos savybėms. Abu metodai turi ir privalumų, ir trūkumų. Toliau tai parodoma keliais pavyzdžiais. 148 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache 2.1. TEKSTYNU GRĮSTI DARBAI Vytauto Didžiojo universitete Kaune buvo sukurtas dabartinės lietuvių kalbos tekstynas. Jis naudojamas įvairių rūšių kalbos apdorojimui. Gramatikos srityje buvo parengtas morfemų žodynas (Rimkutė, Kazlauskienė, Rąkinis 2011), o po kelerių metų sukurta ir duomenų bazė. Naudotojui pateikiami ir morfeminiai, ir morfologiniai duomenys. Tai pirmasis laisvai prieinamas šaltinis, kuriame žodis skaidomas į morfemas. Deja, morfemos tipas nenurodomas, todėl kartais pateikiamas klaidinantis žodžio morfeminės sandaros vaizdas. Taip nutinka, kai skirtingos sandaros žodžiai pavaizduojami vienodai. Vienas toks pavyzdys parodytas 1 paveiksle. Žodžiai „per-ei-ti“ (pereiti) ir „per-ė-ti“ (perėti) išoriškai beveik nesiskiria. Duomenų bazėje abiejų žodžių morfeminė sandara atrodo vienoda. Tačiau pirmajame žodyje morfema „per“ yra priešdėlis, o antrajame ta pati pirmoji morfema „per“ yra šaknis. 1 PAVEIKSLAS. Skirtingos morfeminės sandaros žodžiai pavaizduoti vienodai (Rimkutė, Kazlauskienė, Rąkinis 2011: 8, 35) Kaip antrą trūkumą galima paminėti net ir dažnai vartojamų žodžio formų trūkumą. Lietuvių kalboje dalyviai turi šešis linksnius. 1 lentelėje parodyta dalyvio „bėgantis“ (vienaskaitos vyriškosios giminės) žodžio formų pasitaikymo dažnumas morfemų duomenų bazėje. Paaiškėja, kad trūksta net šio žodžio lema (vardininko vienaskaita). Negalima laikyti retai vartojamomis ar neįprastomis ir kitų trūkstamų formų, pavyzdžiui, vietininko (bėgančiame vandenyje / im fließenden Wasser). Taigi iš šešių linksnių pateiktos tik dvi žodžio formos. Antrosios baltų kalbos – latvių – mokslininkai taip pat kalba apie nepakankamą žodžio formų skaičių tekstyne (Paikens, Rituma, Pretkalniņa 2013: 272). Straipsniai / Articles 149 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBIKAS, VYTAUTAS ŠVEIKAUSKAS 1 LENTELĖ. Duomenų bazėje (nuoroda 2) esančios dalyvio bēgantis / laufender, fließender žodžių formos vienaskaitos vyriškojoje giminėje Linksnis Žodis Duomenų bazė Vardininkas bēgantis nėra Kilmininkas bēgančio yra Naudininkas bēgančiam nėra Galininkas bēgantį yra įnagininkas bēgančiu nėra vietininkas bēgančiame nėra iš viso: 6 2 2.2. IŠEITIES TAŠKAS – LIETUVIŲ KALBA Vilniaus universitete remiamasi lietuvių kalbos ypatybėmis. Svetainėje Morfologija.lt (3 nuoroda) pateikiamos net žodžių kaitybos lentelės. Deja, jose daug tuščių vietų, kartais trūksta visos paradigmos. Kartais pasitaiko ir nežinomų, lietuviui nesuprantamų žodžių, pavyzdžiui, „sutikimoji“ (4 nuoroda) ir panašių. Vilniaus matematikos ir informatikos institute sukurta žodžių darybos ir morfemikos duomenų bazė (Murmulaitytė 2012). Joje pateikiama labai vertingos informacijos (morfemos tipas, pamatinis žodis, apibrėžiamasis žodis ir kt.), tačiau duomenys, deja, nėra laisvai prieinami. 3. LIETUVIŲ KALBOS INFORMACINĖ SISTEMA Lietuvių kalba priklauso prie mažiausiai kompiuterizuotų Europos kalbų (Vaišnienė, Zabarskaitė 2012: 35). Todėl nuspręsta sukurti informacinę sistemą, kurioje būtų išsamių duomenų apie lietuvių kalbos žodžių gramatines ypatybes. Baltų kalbomis besidomintys mokslininkai dažnai pabrėžia, kad reikia kurti daugiau programinės įrangos, skirtos plačiam naudotojų ratui. 2015 ir 2017 m. konferencijos BSNLP (Balto-Slavic Natural Language Processing) gairėse rašoma: „pateikimai 150 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache aprašantys sistemas, kurios prieinamos plačiajai visuomenei, būtų ypač skatinami / ypač skatinamos įstaigos, aprašančios plačiajai visuomenei prieinamas sistemas“ (5 nuoroda). Todėl kilo mintis lietuvių kalbos informacinę sistemą kurti plačiam naudotojų ratui, o duomenis pateikti kuo paprasčiau ir suprantamiau. Atitinkamai pasirinktas prisitaikantis interneto svetainės dizainas (RW), kad būtų kuo geriau atsižvelgta į naudotojų poreikius. Todėl gramatinė informacija apie žodį pateikiama plytelėmis (angl. tiles) (6 nuoroda). Dėl to svetaine galima naudotis ir mobiliuoju telefonu. 3.1. DUOMENŲ BAZĖS KŪRIMO METODAS Gramatikos kompiuterizavimo tikslas – elektroniniu formatu turėti visą gramatinę informaciją apie kiekvieną žodį ir visas jo formas. Tai galima pasiekti dviem būdais. Pirmasis – sukurti formalų gramatinių taisyklių aprašą (tai būtų tam tikra pagalbinė priemonė), o tada leisti kompiuteriui sugeneruoti reikiamus duomenis. Antrasis – kompiuteryje saugoti visą gramatinę informaciją apie visų žodžių formas ir prireikus ją nuskaityti. Dar reikia aptarti, kuriam būdui reikia daugiau darbo. Matematikos ir informatikos institute sukurta lietuvių kalbos morfologinės analizės programinė įranga (Zinkevičius 2000), kuriai buvo taikytas pirmasis metodas. Tačiau nepavyko pasiekti 100 proc. tikslumo: esama klaidingų duomenų, kai kurie lietuvių kalbos žodžiai neatpažįstami. Kuriant lietuvių kalbos informacinę sistemą, šio būdo atsisakyta dėl šios priežasties: kad kompiuteris galėtų pats apdoroti žodžius, jam reikia labai tiksliai nurodyti, kokius veiksmus atlikti su kokiu žodžiu. Vadinasi, pirmiausia visus žodžius reikia suskirstyti į grupes taip, kad visiems vienos grupės nariams galiotų tie patys dėsningumai, t. y. būtų galima taikyti tą patį apdorojimo metodą. Norint priskirti žodį vienai ar kitai grupei, reikia nustatyti daug požymių, kuriais remiantis žodžiai būtų grupuojami. Pavyzdžiui, atliekant lietuvių kalbos sintaksinę analizę, daiktavardžių galininko sintaksinei funkcijai nustatyti vartojamas semantinis požymis [laikas]. Sakinyje „Visą naktį ji Straipsniai / Articles 151 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS skaitė šią knygą / Visą naktį ji skaitė šią knygą.“ ir „Visą knygą ji perskaitė šią naktį / Visą knygą ji perskaitė šią naktį.“ Du žodžiai knygą/Buch ir naktį/Nacht morfologinių kategorijų požiūriu nesiskiria – abu yra moteriškosios giminės, vienaskaitos, galininko formos; tik semantinis požymis [laikas], būdingas žodžiui naktis/Nacht, bet nebūdingas žodžiui knyga/Buch, leidžia kompiuteriui teisingai laikyti žodį naktį/Nacht laiko aplinkybe, o žodį knygą/Buch – sakinio objektu. Panašiai reikia pasielgti ir su morfologija. Viena iš jau sukurtos lietuvių kalbos morfologinės analizės programinės įrangos klaidų yra ta, kad morfema -ėj- laikoma priesaga ir jungiama prie tokių šaknų, prie kurių ji negali būti prijungta. Reikia nustatyti žodžių požymius, kurie leistų kompiuteriui nuspręsti, su kuriomis šaknimis ši priesaga -ėj- gali būti jungiama. Tačiau tai padaryti labai sudėtinga. Koks požymis, pavyzdžiui, bendras žodžiams geroė/Wohlhaben, žinovas/Kenner(Expert) ir daržovė/Obst? Visi jie turi priesagą -ov-. O kuo jie skiriasi nuo visų kitų žodžių, prie kurių šaknies ši priesaga negali būti jungiama (negalima sakyti *kėdovė – iš žodžio kėdė/Stuhl sudarytas vedinys su priesaga -ov-)? Ir koks požymis tai parodo? Todėl kuriant lietuvių kalbos gramatikos informacinę sistemą buvo pasirinktas antrasis kelias, t. y. parengta duomenų bazė, kurioje pateikiama išsami gramatinė informacija apie visas lietuvių kalbos žodžių formas. Čia reikia pradėti ne nuo gramatinių kategorijų (kaip daroma visose spausdintinėse gramatikose), o nuo paties žodžio: naudotojui turi būti pateikta visa su kiekvienu žodžiu susijusi informacija. Buvo nuspręsta pradėti nuo šaknies ir sukurti programinę įrangą, kuri atspindėtų visą lietuvių kalbos gramatikos struktūrą. Pirmuoju bandymu pasirinkta šaknis bėg (iš veiksmažodžio bėgti/bėgti). Tada kompiuteriu buvo sugeneruoti visi galimi vediniai, o vėliau rankiniu būdu išbraukti visi lietuvių kalboje neegzistuojantys žodžiai. Iš viso duomenų bazėje yra apie 25 000 įrašų. 3.2. „LIGIS“ YPATUMAI Lietuvių kalbos gramatikos informacinė sistema (Lietuvių kalbos gramatikos informacinė sistema – LIGIS) (7 nuoroda) turi du esminius ypatumus. Pirma, ji pateikia naudotojui išsamesnę informaciją apie konkretų žodį nei spausdintinės gramatikos. Ir 152 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache antra, joje aprėpiama daugiau žodžių nei žodynuose. Gramatikose pateikiamos taisyklės, taikomos tam tikrai žodžių grupei. Tačiau jose nepaminimi visi žodžiai, kuriems taikoma ši taisyklė. LIGIS surenka visą su naudotojo įvestu žodžiu susijusią informaciją ir pateikia ją interneto svetainėje. Į žodynus įtraukti ne visi lietuvių kalbos žodžiai, juose trūksta daugelio vedinių ir dūrinių. LIGIS apima visus galimus vedinius. Palyginimui galima pateikti pavyzdį. Morfemų duomenų bazėje yra apie 75 000 įrašų. Tačiau juose aprašomi skirtingi lietuviški žodžiai. Šiuo metu LIGIS duomenų bazę sudaro 25 000 įrašų, apimančių tik vienos šaknies žodžius: beg-. Morfemų duomenų bazėje yra 118 žodžių su šia šaknimi. 3.3. ŽODŽIO STRUKTŪRA Įvedus žodį, naudotojui paaiškinama žodžio struktūra: nurodomas lemą ir pamatinis žodis, taip pat vedinių ir dūrinių dėmenys. Jei žodis gramatiškai dviprasmis, kiekviena reikšmė lemų sąraše gauna atskirą numerį. Vėliau morfologiniai ir morfeminiai duomenys pateikiami prie šio numerio. Dviprasmio žodžio pavyzdys pateiktas A priede. Kitos formos. Taip vadinamas mygtukas (angl. button), esantis žodžio struktūros kortelėje. Rusų kalbos morfologinės analizės svetainėje (8 nuoroda) kiekvieną kartą pateikiamos visos įvesto žodžio formos. Lietuvių kalbos gramatikos informacinėje sistemoje nuspręsta įdiegti mygtuką, kad naudotojas galėtų per nuorodą peržiūrėti kitas formas, nes naudotojui ne kiekvieną kartą reikia visų žodžio formų. 3.4. MORFOLOGINIAI DUOMENYS Morfologinė informacija apima kalbos dalies įvardijimą ir gramatines kategorijas: daiktavardžių – linksnį, giminę, skaičių; veiksmažodžių – asmenį, laiką, nuosaką ir kt. Daugiareikšmiai žodžiai numeruojami, jei, pavyzdžiui, daiktavardis turi kelias homonimines linksnių formas. Morfemų duomenų bazėje (2 nuoroda) taip pat pateikiami morfologiniai duomenys apie žodį. Tačiau informacija pateikiama vien sutrumpinimais Straipsniai / Articles 153 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS Vienas toks pavyzdys pateiktas 2 paveiksle. Ne specialistams tiek daug sutrumpinimų dažnai gali būti nesuprantami. Ypač užsieniečiams, kurie studijuoja arba mokosi lietuvių kalbos, taip pateikta informacija kartais gali būti neaiški. 2 PAVEIKSLAS. Žodžio begčio duomenys, pateikti vien sutrumpinimais (2 nuoroda) Lietuvių kalbos gramatikos informacinėje sistemoje sutrumpinimai nevartojami. Visi duomenys pateikiami išsamiai (A priedas). 3.5. MORFEMINIAI DUOMENYS Svarbiausias skirtumas nuo duomenų bazių, kuriomis jau galima naudotis,1 yra kiekvienos morfemos tipo nurodymas. Tik taip galima vienareikšmiškai pateikti žodžio morfemas. Priešingu atveju, pavyzdžiui, neįmanoma atskirti antrosios sudurtinio žodžio šaknies nuo priesagos, kaip yra morfemikos duomenų bazėje. Pirmasis ir lemiamas požymis buvo skirtingomis spalvomis pateikiamos morfemos. Kiekvienam morfemos tipui (šakniai, priešdėliui, priesagai, galūnei) buvo priskirta spalva. Priešdėliai rašomi mėlynai. Šakniai pavaizduoti pasirinkta raudona spalva. Priesagos pateikiamos žaliai, o galūnei parinkta juoda spalva. Be to, į morfemas suskaidytas žodis išdėstomas vertikaliai, o šalia nurodomas ne tik kiekvienos žodžio morfemos tipo pavadinimas, bet ir morfemos ypatybės, jei ji jų turi, pavyzdžiui, priesagos atveju – žodžių darybos arba formų darybos; galūnių atveju – sutrumpinta, įvardžiuotinė ir pan. Prie sutrumpintų galūnių, kurios šnekamojoje kalboje labai paplitusios, taip pat nurodoma visa galūnė. Pavyzdžiui, galima pateikti žodžius iš šnekamosios kalbos: šnekamoje kalboje – visos galūnės, šnekamoj kalboj – sutrumpintos galūnės. Jei žodis turi visą galūnę, ilgumo požymis nenurodomas, nes dauguma žodžių turi visas galūnes, tad tokia informacija būtų perteklinė. Jei 154 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache Jei galūnė nepronominalizuota, informacija apie tai taip pat nepateikiama. Garso pokyčiai laikomi šaknies ypatybe. Tai gali būti ir priebalsių, ir balsių kaita. Lietuvių kalboje galima atkreipti dėmesį ir į dar vieną garso pokyčių rūšį – priebalsių iškritimą liepiamojoje nuosakoje. Infixai taip pat priskiriami prie žodžio šaknies garso pokyčių. Priešdėlio ypatybe laikoma jo kilmė: jis gali būti kilęs iš prielinksnio, atsiradęs iš dalelytės arba būti tarptautinės kilmės. Esant žodžių gramatiniam daugiareikšmiškumui, nagrinėjamos morfeminės struktūros. Jei jos sutampa, aprašoma tik viena struktūra. Tačiau jei jos skiriasi, morfeminės struktūros pateikiamos kiekvienai žodžio reikšmei (A priedas). 3.6. VISOS ŽODŽIO FORMOS Kiekvieno duomenų bazėje esančio žodžio asmenuotės ar linksniuotės lentelę galima atverti spustelėjus mygtuką „Kitos formos“. Joje pateikiami visi morfologinio langelio duomenys. Lentelės viršuje nurodomos kategorijos, kurių nėra asmenuotės ar linksniuotės lentelėje, pavyzdžiui, lietuvių kalboje daiktavardžiai nekaitomi giminėmis, todėl lentelės viršuje nurodoma giminė, taip pat lema ir kalbos dalis. Būdvardžiai ir dalyviai turi tris gimines, o lietuvių kalbos ypatybė ta, kad tik dvi iš jų (vyriškoji ir moteriškoji) turi visus šešis linksnius. Trečioji giminė turi tik vieną formą, todėl ji pateikiama nenurodant linksnio (B priedas). Veiksmažodžiams pateikiamos visų laikų formos visomis nuosakomis (D priedas). Asmenavimo ir linksniavimo klasės tampa nebereikalingos, todėl apie jas duomenų nepateikiama. Kai kuriems žodžiams asmenuotės ar linksniuotės lentelėje pateikiami ir vartojimo pavyzdžiai. Tam naudojami greitieji patarimai (angl. tooltip). C priede kaip žodžio „bėgis“ (daiktavardžio bėgis / geležinkelio bėgis, bėgimas vienaskaitos galininkas) pavyzdys pateikiamas. 3.7. DUOMENŲ BAZĖ Kuriant duomenų bazę buvo siekiama kuo aukštesnės kokybės ir patikimumo. Todėl didelė darbo dalis buvo atliekama rankomis Straipsniai / Articles 155 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAUSKAS nes tik padedant žmogui galima gauti maksimaliai patikimą informaciją (Sulger 2013: 53). Lietuvių kalbos institute buvo atlikti lietuvių kalbos priešdėlių tyrimai. Nustatyta, kad lietuvių kalboje yra apie 600 priešdėlių junginių (Šveikauskienė 2015: 195). „Junginiais“ vadinamos įvairios priešdėlių sekos, galinčios eiti prieš šaknį, pvz., at-bėgi, nu-bėgi, ne-be-at-bėgti, ne-nu-bėgti, te-be-bė-ti ir kt. Paaiškėjo, kad su veiksmažodžių šaknimis vartojama tik 220 šių junginių; kiti, pvz., nuo-, vartojami su daiktavardžiais: nuo-monė /die Meinung. Programinė įranga sukurta taip, kad automatiškai jungtų šaknį su visais galimais priešdėlių junginiais. Paskui kompiuterio pateiktus rezultatus patikrina žmonės ir į duomenų bazę įrašo iš tikrųjų lietuvių kalboje vartojamus žodžius. Taip pavyksta išvengti dviejų kraštutinumų: ir pernelyg didelio kompiuterio sugeneruotų formų skaičiaus, ir nepakankamos žodžių apimties. Visos lemos ir su jomis susijusi gramatinė informacija į duomenų bazę įrašomos rankiniu būdu. Kadangi Matematikos ir informatikos institute sukurta programinė įranga, generuodama duotai lemmai priklausančias žodžių formas, neklysta, patikėta kompiuteriui automatiškai sudaryti likusių žodžių formų įrašus. Pažymėtina, kad LIGIS apdorojami ir žodžiai su sutrumpėjusiomis galūnėmis. Tokių žodžių šnekamojoje kalboje pasitaiko labai dažnai, tačiau nė viena iš jau veikiančių duomenų bazių šių žodžių formų neapdoroja. Taip pat būtina pabrėžti, kad LIGIS pateikia ir tokių vedinių, kurių nėra netgi 20 tomų Lietuvių kalbos žodyne ir jo elektroninėje versijoje (Link 9), pvz., neužbėgti/nicht mehr hinauflaufen. Duomenų bazėje informacija saugoma kompiuteriams patogia forma, t. y. naudojamas „Prage Markup Language“ kodavimas (Hana, Štepánek 2012). Ši duomenų forma internete nepateikiama, nes kompiuterinės lingvistikos neprofesionalams ji būtų perteklinė. Tai, kad visa informacija saugoma duomenų bazėje, daro LIGIS naudingu įrankiu ir lietuvių kalbą tiriantiems kalbininkams. Galima gauti įvairiausios informacijos, pavyzdžiui, ieškoti žodžių su tam tikru priešdėlių ir priesagų deriniu ir pan. 156 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache 3.8. SVETAINĖS DAUGIAKALBIŠKUMAS Svetainė veikia septyniomis kalbomis: lietuvių, anglų, vokiečių, prancūzų, italų, rusų ir japonų. Poreikį turėti daugiakalbę svetainę lėmė nepatenkinama lietuviškų vertimų kokybė „Google“ vertėjuje. Automatinis vertimas iš lietuvių kalbos yra nepatikimas. Todėl nuspręsta lietuvių kalbos gramatikai skirtą svetainę padaryti daugiakalbę ir naudoti tik žmonių išverstus tekstus. Kitų kalbų padėtis, regis, nėra daug geresnė. Tai liudija 2017 m. birželio 8 d. Lingvist laiškas, kuriame prašoma, kad pavadinimą LINGUIST verstų gimtakalbiai, o jokiu būdu ne automatinis vertimas (LinguiList 2017: 28.252). Priimant sprendimą svetainę padaryti daugiakalbę, vadovautasi tokia idėja: jei užsienietis, pavyzdžiui, norvegas, mokosi lietuvių kalbos ir kai kuriuos lietuviškus žodžius jau žino, o kai kurių dar ne, jis gali pasirinkti kalbą, kurią moka geriau negu lietuvių, pavyzdžiui, vokiečių, ir visi jam nežinomi lietuviški žodžiai taps suprantami. Šiuo tikslu buvo numatyta, kad keičiant kalbą išsaugomas naudotojo įvestas žodis. Taigi, pasirinkus kitą kalbą, naudotojui nereikia žodžio įvesti iš naujo. 4. ATEITIES PLANAI Vilniaus universitete suskaitmeninta daug dvikalbių žodynų. Lietuvių kalbos institute suskaitmenintas didysis 20 tomų žodynas ir kiti vienakalbiai žodynai: sinonimų, antonimų, frazeologizmų žodynai ir kt. Planuojama abiejų rūšių žodynus susieti su lietuvių kalbos gramatikos informacine sistema ir sukurti vokiškos svetainės CANOONET analogą (10 nuoroda). Kadangi lietuvių kalbos gramatikos informacinėje sistemoje pateikiami duomenys apie morfemas, galima ieškoti žodžių pagal morfemų modelį. Būtent tai ir numatyta ateityje. Svetainėje LIGIS yra skirtukas (angl. tab), skirtas teorijai; šiuo metu jis rengiamas. Jame turėtų būti pateikiamos išsamios akademinės žinios apie lietuvių kalbos gramatiką. Straipsniai / Articles 157 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAUSKAS, VYTAUTAS ŠVEIKAUSKAS Pirmajame etape nagrinėjama morfologija. Antrajame etape numatoma įvesti ir sintaksinius duomenis. 5. Išvados 1. Šis požiūris gali būti naudingas ir prasmingas kitoms labai fleksinėms kalboms. 2. Lietuvių kalbos gramatikos informacinė sistema gali būti labai naudinga mokiniams, studentams, lietuvių kalbos besimokantiems užsieniečiams, taip pat kalbininkams, tyrinėjantiems lietuvių kalbą. 3. Sukaupti duomenys taip pat gali būti naudojami lietuvių kalbos dokumentavimui. Literaturverzeichnis Al – Onaizan Yaser, Curin Jan, Jahr Michael, Knight Kevin, Lafferty John, Melamed Dan, Och Franz – Josef, Purdy David, Smith Noah A., Yarowsky David 1999: Statistical Machine Translation. – Final Report JHU Workshop. http://mt-archive.info/JHU-1999-AlOnaizan.pdf (Zugriff am 21.11. 2017). Brown Peter F., Cocke John, Della Pietra Stephen A., Della Pietra Vincent J., Jelinek Frederick, Lafferty John D., Mercer Robert L., Roossin Paul S. 1990: A Statistical Approach to Machine Translation. – Computational Linguistics Volume 16, Number 2, June, 79–85. http://www.aclweb.org/anthology/J90-2002 (Zugriff am 21.11. 2017). Charniak Christopher E. 1989: Artificial Intelligence & Turbo C. Homewood: Dow Jones-Irwin. Daudaravičius Vidas 2012: Teksto skaidymas pastoviųjų junginių segmentais. Daktaro disertacijos santrauka. Kaunas: Vytauto Didžiojo universitetas. Goldsmith John A. 2010: Segmentation and Morphology. The Handbook of Computational Linguistics and Natural Language Processing. Wiley-Blackwell, 364–393. Han Jirka, Štěpánek Jan 2012: Prague Markup Language Framework. Procedings of the 6th Linguistic Annotation Workshop. Jeju, Republic of Korea, 12–13 July, 12–21. Jensen Karen, Heidorn George Emil, Richardson Stephen D. 1993: Natural language processing: The PLNLP Approach. Boston / London: Kluwer Academic Publishers. 158 Acta Linguistica Lithuanica XXVII Eine mehrsprachige Website zur Grammatik der litauischen Sprache Köhler Reinhard 2012: Quantitative Syntax Analysis. De Gruyter Mouton. Köhler Reinhard, Altmann Gabriel, Piotrowski Rajmund G. 2005: Quantitative Linguistik. Berlin / New York: Walter de Gruyter. Linguist List 2017: 28.254, Qs: How do you say the LINGUIST List in your language? 08 Jun 2017. [email protected]. Murmulaitytė Daiva 2012: Lietuvių kalbos morfemikos ir žodžių darybos tyrimų perspektyvos. – Žmogus ir žodis 1(14), 96–102. Nirenburg Sergei 1987: Machine Translation: Theoretical and Methodological Issues. London: Cambridge University Press. Paikens Pēteris, Rūma Laura, Pretkalniņa Lauma 2013: Morphological Analysis with limited resources: Latvian example. Proceedings of the 19th Nordic Conference of Computational Linguistics. (NODALIDA 2013); Linköping Electronic Conference Proceedings #85, 267–277. Reed David W. 1949: A Statistical Approach to Quantitative Linguistic Analysis, WORD, 5:3, 235–247, DOI: 10.1080/00437956.1949.11659355. Rimkutė Erika, Kazlauskienė Asta, Raškinis Gailius 2011: Dažnis lietuvių kalbos žodyne. Kaunas: VDU. Schwanke Martina 1991: Maschinelle Übersetzung: Ein Überblick über Theorie und Praxis. Berlin: Springer-Verlag. Skadiņš Raivis 2017: Neural MT and other Language Technologies at TILDE. http://school.gramaticframework.org/2017/slides/Ravis-Neural_MT_at_Tilde.pdf (zugegriffen 2017.11.21). Sulger Sebastian, Butt Miriam, King Tracy Holloway, Meurer Paul 2013: ParGramBank: The ParGram Parallel Treebank. – Proceedings of the 51st Annual Meeting of the Association for Computational Linguistics, Sofia, Bulgaria, 550–560. http://aclweb.org/anthology/P/P13/P13-1054.pdf (zugegriffen 2017.11.21). Šveikauskienė Daiva 2015: Morphemic structure of the Lithuanian prefixes. – Language: Meaning and Form 6. – Language System and Language Use. Rīga: Latvijas universitāte, 189–197. Vaišnienė Daiva, Zabarskaitė Jolanta 2012: The Lithuanian Language in the Digital Age. – G. Rehm, H. Uszkoreit White Paper Series. Heidelberg / New York / Dordrecht / London: Springer. Winograd Terry 1983: Language as a Cognitive Process 1. Syntax. London: Addison-Wesley Publishing Company. Straipsniai / Articles 159 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAS Yule George Udny 1944: The Statistical Study of Literary Vocabulary. Cambridge MA, Cambridge university press. Zinkevičius Vytautas 2000: Lemoklis – morfologinė analizė. – Darbai ir dienos 24, 245–273. Zipf George Kingsley 1929: Relative frequency as a Determinant of Phonetic Change. – Harvard studies in classical philology 40, 1–95. Сердюков Пётр Иванович 1979: Оптимизация алгоритма поиска синтаксических связей. – Международный семинар по машинному переводу. Москва: ВЦП, 123–125. LINKS Link 1: http://www.digitalgrammars.com/ (Zugriff am 21.11. 2017) Link 2: http://tekstynas.vdu.lt/page.xhtml?id=morfema-db (Zugriff am 21.11. 2017) Link 3: http://morfologija.lt/ (Zugriff am 21.11. 2017) Link 4: http://morfologija.lt/zodzio-formos/sutikimas (Zugriff am 21.11. 2017) Link 5: http://bsnlp-2017.cs.helsinki.fi/cfp.html (Zugriff am 21.11. 2017) Link 6: https://de.wikipedia.org/wiki/Microsoft_Windows_8#Oberfl.C3.A4che (Zugriff am 21.11. 2017) Link 7: http://ligis.lki.lt/ (Zugriff am 21.11. 2017) Link 8: http://goldlit.ru/component/slog (Zugriff am 21.11. 2017) Link 9: http://www.lkz.lt/Visas.asp?zodis (Zugriff am 21.11. 2017) Link 10: http://www.canoo.net/ (Zugriff am 21.11. 2017) 160 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache ANHANG A. GRAMMATISCHE INFORMATION. Beispiel des grammatisch mehrdeutigen Wortes nubəɡti / hinlaufen-hingelaufen. Die grammatische Information wird in der Website in Kacheln ausgelegt. Diese Darstellungsweise ist günstig für responsives Webdesign – RWD. Bemerkung: Die Farben sind im Bild entfernt. Straipsniai / Articles 161 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS ANHANG B. FORMENtABELLE FÜR DEKLINATION. Als Beispiel wird die Flexion des Partizips nubėtas / hingelaufene in allen drei Genera und allen Kasus angeführt. NUBĖTASPARTIZIP II, PASSIV, PRÄTERITUMMännlichSingularPluralNominativnubėtasnubėtiGenitivnubėtonubėtųDativnubėtamnubėtiemsAkkusativnubėtąnubėtusInstrumentalnubėtunubėtaisLokativnubė tamenubėtuoseWeiblichSingularPluralNominativnubėtanubėtosGenitivnubėtosnubėtųDativnubėtainubė tomsAkkusativnubėtąnubėtasInstrumentalnubėtanubėtomisLokativnubėtojenubėtoseNeutrumnubėta 162 Acta Linguistica Lithuanica LXXVI Eine mehrsprachige Website zur Grammatik der litauischen Sprache ANHANG C. TOOLTIP FÜR VERWENDUNGSBEISPIELE. Als Beispiel wird die Schnellinfo für die Akkusativ-Singular-Form bėgį des Substantivs bėgis / Lauf, Getriebe, Eisenbahnschiene angeführt. Straipsniai / Articles 163 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAS ANANG D. FORMENTABELLE FÜR KONJUGATION. Als Beispiel wird die Flexion des Verbs bėgti / laufen in allen Tempusformen und Modi angeführt. 164 Acta Linguistica Lithuanica LXXVII Eine mehrsprachige Website zur Grammatik der litauischen Sprache Daugakalbė lietuvių kalbos gramatikos informacinė sistema internete SANTRAUKA Lietuvių kalbos kompiuterizavimo darbuose galima pastebėti du pagrindinius trūkumus: trūksta kartais net ir dažnai vartojamų formų ir pateikiami pertekliniai, lietuvių kalboje neegzistuojantys žodžiai. Kuriant Lietuvių kalbos gramatikos informacinę sistemą (LIGIS) stengiamasi išvengti jų abiejų. Visos formos generuojamos kompiuteriu automatiškai ir vėliau gauti rezultatai peržiūrimi žmogaus, kad būtų atmesti lietuvių nesuprantami žodžiai. Lietuvių kalbos gramatikos informacinė sistema apima visus darinius. Šiuo metu duomenų bazę sudaro tik šakn inės beg-žodžiai. Jų yra apie 25 000. Palyginimui galima pateikti tokius duomenis: morfemos duomenų bazę sudaro yra apie 75 000 įrašų, bet jie surinkti iš visos lietuvių kalbos leksikos. Su šaknimi beg- ten yra 118 žodžių. Kuriant Lietuvių kalbos gramatikos informacinę sistemą pagrindinis tikslas buvo pateikti išsamią gramatinę informaciją plačiajai visuomenei. Todėl buvo stengiamasi duomenis atvaizduoti kuo aiškiau ir suprantamiau. Svetainė pritaikyta naudotis ir mobiliuosiuose telefonuose. Vartotojas, pateikęs žodį, gauna trijų tipų informaciją apie jį: žodžio struktūrą (pradinę formą bei pamatinį žodį dariniams), morfologinę informaciją (kalbos dalis bei jos morfologinės kategorijos – linksnis, giminė, skaičius, laikas, laipsnis ir t. t.) ir morfeminiai duomenys – žodis išskaidytas morfemomis, nurodant morfemos tipą bei požymius, jei morfema jų turi, pavyzdžiui, priesaga – darybinė / kaitybinė, galūnė – įvardžiuotinė, sutrumpėjusi ir kt. Kiekviena morfema žymima vis kita spalva. Reikia pabrėžti, kad Lietuvių kalbos gramatikos informacinė sistema yra pirmasis tinklapis Lietuvoje, kur vartotojui pateikiama informacija apie morfemos tipą. Be to, apdorojami ir žodžiai su sutrumpėjusiomis galūnėmis, kurios labai paplitusios, ypač šnekamojoje kalboje. Kiekvienam duomenų bazėje esančiam žodžiui vartotojas gali gauti visą kaitybinę lentelę. Kai kuriems žodžiams pateikiama vartojimo pavyzdžių. Kuriant Lietuvių kalbos gramatikos informacinę sistemą siekiama kuo didesnio tikslumo ir patikimumo. Todėl visos temos (žodžių pradinės formos – vardininkas, bendratis) suvedamos į duomenų bazę rankomis. Kaitybines formas sugeneruoti patikėta kompiuteriui, nes šiame jo darbe nebuvo pastebėta klaidų. Svetainė pateikiama septyniomis kalbomis: lietuvių, anglų, vokiečių, prancūzų, italų, rusų ir japonų. Ateityje planuojama Lietuvių kalbos gramatikos informacinę sistemą jungti su skaitmenintais žodynais ir sukurti vokiečių tinklapio CANOONET analogą. Straipsniai / Articles 165 DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAUSKAS, VYTAUTAS ŠVEIKAUSKAS Įteikta 2017 m. rugsėjo 5 d. DAIVA ŠVEIKAUSKIENĖ Petro Vileišio g. 5, LT-10308 Vilnius, Lietuva [email protected] ARŪNAS RIBAUSKAS Saulėtekio al. 11, LT-10221 Vilnius, Lietuva [email protected] VYTAUTAS ŠVEIKAUSKAS Petro Vileišio g. 5, LT-10308 Vilnius, Lietuva [email protected] 166 Acta Linguistica Lithuanica LXVII