This is a machine-generated translation of the original document and may contain errors, omissions, or changes in meaning. Do not rely on this translation for quotations, citations, or authoritative references. Please consult and cite the original document.
Preparing document pages…
Page 1
DAIVA ŠVEIKAUSKIENĖ
Institut pro litevský jazyk
ARŪNAS RIBIKAUSKAS
Technická univerzita Gediminas ve Vilniusu
VYTAUTAS ŠVEIKAUSKAS
Institut pro litevský jazyk
Vědecké výzkumné oblasti: gramatika, počítačová lingvistika.
VÍCEJAZYČNÝ WEB O GRAMATICE LITEVSKÉHO JAZYKA
Vícejazyčný informační systém gramatiky litevského jazyka na internetu
ANOTACE
Před rokem se na Institutu litevského jazyka začalo pracovat na projektu, jehož cílem je bezplatně zpřístupnit uživatelům na internetu prezentaci podrobných údajů o gramatických vlastnostech litevských slov. V březnu 2017 byla připravena zkušební verze, která zahrnuje pouze slova s kořenem „bėg“ (srov. sloveso „bėgti/běžet“). Databáze obsahuje přibližně 25 000 záznamů. Cílem projektu je vyhnout se nedostatkům již existujících prací v oblasti počítačové lingvistiky. Týká se to rozsahu slovní zásoby, rozmanitosti gramatických údajů, přehlednosti a srozumitelnosti jejich prezentace aj. Gramatické informace o slově zadaném uživatelem se zobrazují ve třech oblastech: struktura slova, morfologické údaje a údaje o morfémech. Jde o první webové stránky v Litvě, na nichž jsou uživateli poskytovány informace o typech morfémů. Ke každému slovu obsaženému v databázi lze zobrazit tabulku skloňování. U některých slov jsou uvedeny také příklady užití. Webové stránky jsou k dispozici v sedmi jazycích: litevštině, angličtině, němčině, francouzštině, italštině, ruštině a japonštině, aby je mohli využívat cizinci, kteří se zajímají o litevský jazyk.
144
Acta Linguistica Lituanica LXXVII
Page 2
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
KLÍČOVÁ SLOVA: gramatika, morfologie, morfém, informační systém, počítačová lingvistika.
ANOTACE
The project was started in the Institute of Lithuanian language in 2016. It aims at presenting detailed data about the grammatical features of Lithuanian words. The goal is to make those data freely accessible to any user on the Internet. The preliminary version covering the words with the root “bėg/run” was published in March 2017. The database contains around 25,000 entries. We are trying to avoid drawbacks that are specific to the words done in the field of computational linguistics. It includes word coverage, grammatical data comprehensiveness, clarity and clearness of presented information etc. Grammatical information about the word in question is presented from three aspects: word structure, morphological data, and morphemic data. It is the first website in Lithuania providing morphemic types. One can get an inflection table for each word the database contains. Usage examples are given for some words. The information on the website is available in seven languages – Lithuanian, English, German, French, Italian, Russian, and Japanese – so foreigners interested in Lithuanian language can use it as well.
KLÍČOVÁ SLOVA: gramatika, morfologie, morfematika, informační systém, počítačová lingvistika.
1. ÚVOD: POČÍTAČOVÁ LINGVISTIKA
Až do poloviny 20. století se všechny gramatiky tiskly na papír. Po nástupu počítačů (v roce 1942 byl na Harvardově univerzitě sestrojen první počítač na světě MARK I (Schwanke 1991: 69)) začaly pronikat do všech oblastí života. Jazyky nebyly výjimkou: brzy bylo jasné, že počítače dokážou zpracovávat nejen čísla, ale také libovolné symboly. Mohou tedy zpracovávat i jazyky. Několik lingvistů začalo vytvářet formální popisy jazyků, aby bylo možné využít schopnosti počítačů také při zpracování jazyků (Winograd 1983: 23). V oblasti umělé inteligence se zpracování jazyka stalo jednou z nejdůležitějších oblastí využití (Charis 1989: 71). V letech 1968 až 1978 byla gramatická analýza jazyků hlavním tématem výzkumníků v oblasti umělé inteligence (Nirenburg 1987: 26). Jazyky, které se lidem tak snadno podřizují, však byly pro počítače tvrdým oříškem (Jensen, Heidorn,
Straipsniai / Articles
145
Page 3
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
Richardson 1993: 2). Deshalb konnten bislang keine guten Ergebnisse auf dem Gebiet der Sprachverarbeitung mit Hilfe von Computern erreicht werden.
1.1. STATISTICKÉ METODY
Statistické metody mají při zpracování jazyka mimořádný význam. První návrhy na jejich využití byly předloženy krátce po nástupu počítačů. To platí zejména pro anglický jazyk. David W. Reed pojednal o kvantitativní lingvistické analýze (Reed 1949: 236). Waren Weaver byl první, kdo vyslovil myšlenku využít počítače k překladu. V roce 1949 navrhl, aby se k tomu používaly statistické metody. Tehdejší vědci je však zakrátko odmítli, pravděpodobně kvůli nedostatečnému množství elektronicky čitelných textů a nepříliš vysokému výkonu tehdejších počítačů. O několik desetiletí později, když byly shromážděny textové korpusy a používání statistických metod při rozpoznávání jazyků začalo přinášet dobré výsledky, se ke statistickým metodám v překladu znovu vrátili (Brown at al. 1990: 79). V Kanadě k tomu byly zvláště příznivé podmínky, protože se tam kvůli dvěma úředním jazykům ukládaly veškeré parlamentní materiály ve dvou jazycích (angličtině a francouzštině). Proto bylo možné velmi rychle shromáždit dostatečné množství paralelních textů (Al-Onaizan, Curin, Jahr 1999: 1). Struktura obou jazyků, tj. angličtiny a francouzštiny, je velmi podobná: slovosled je pevný (na prvním místě stojí podmět, na druhém přísudek). Podobnosti ve struktuře těchto jazyků umožnily dosahovat dobrých výsledků při překladu statistickými metodami. U litevštiny tomu tak ale není. Překlady Google, které využívají statistickou metodu, dosud neposkytují kvalitní překlady do litevštiny. Podle údajů z roku 2017 jsou výsledky překladů z angličtiny do litevštiny i z litevštiny do angličtiny horší než výsledky překladů z angličtiny do lotyštiny, z lotyštiny do angličtiny, z angličtiny do estonštiny a z estonštiny do angličtiny (Skadinš 2017: 22).
Statistické metody pronikly i do dalších oblastí lingvistiky. První práce se týkaly fonetiky (Zipf 1929). V roce 1944 byly provedeny statistické výzkumy lexika literárních textů, tj. kolik slov bylo použito jednou, kolik slov dvakrát, třikrát atd. (Yule 194: 9).
146
Acta Linguistica Lithuanica LXXVI
Page 4
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
Od roku 1973 se označení dialektometrie používá pro oblast lingvistiky zabývající se kvantitativním výzkumem jazyků a nářečí (Köhler, Altmann, Piotrowski 2005: 498).
Statistické metody se uplatňovaly také v oblasti morfologie. Goldsmith popisuje algoritmus pro určování morfémů ve slově takto: „algorithm that takes as input a list of words and provides as output a segmentation of the words into morphemes“ (Goldsmith 2010: 36).
Koncem minulého století se v ruské literatuře popisují pokusy provádět automatickou syntaktickou analýzu vět pomocí statistických výpočtů. Vědci v Rusku navrhli, aby se syntaktická struktura vět neurčovala na základě lingvistické analýzy, nýbrž pomocí statistického zpracování textů. Tvrdí, že každá jazyková jednotka (slovo, syntaktická kategorie slova, syntaktická konstrukce) se v textu vyskytuje s určitou frekvencí. Například podle údajů anglického frekvenčního slovníku valence existuje 195 různých vzorců syntaktických vztahů vlastních slovesu. Pouhých deset nejčastějších vzorců však tvoří 86% všech případů použitých v textech. Statistické zákonitosti se uplatňují také při zkoumání lineární struktury věty. Každá slovní třída má svou frekvenci, s níž se může vyskytovat v určité vzdálenosti od počátku věty. Anglické sloveso se s pravděpodobností 0,7 může nacházet na druhé až páté pozici od začátku věty. S pravděpodobností 0,95 se pak vyskytuje na druhé až desáté pozici (Церкас 1979: 124).
Později se pro syntaktickou analýzu využívala data z textového korpusu (Köhler 2012: 31).
Dobré výsledky se však prozatím podařilo dosáhnout pouze při zpracování anglického jazyka. Vidas Daudaravičius, který se zabývá počítačovým zpracováním litevské syntaxe, tvrdí: „Naivų manyti, kad metodai, kurie sėkmingai taikomi anglų kalbai, tinka ir kitoms kalboms.“1 (Daudaravičius 2012: 3).
Pomocí statistických metod lze rychle vytvořit systémy s rychlým provozem, ale za jedné podmínky: je třeba tolerovat určitý počet chyb (Link 1). Proto bylo na Institutu litevského jazyka rozhodnuto spoléhat se na statistiku co nejméně, protože cílem je dosáhnout co nejvyšší přesnosti a spolehlivosti údajů.
1 „Je naivní myslet si, že metody úspěšně používané pro anglický jazyk se stejně dobře hodí i pro ostatní jazyky.“
Straipsniai / Articles
147
Page 5
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAUSKAS
1.2. SITUACE V LITVĚ
V oblasti počítačového zpracování litevské gramatiky již bylo vykonáno mnoho práce. Většině z nich rozumějí pouze odborníci na počítačovou lingvistiku. Některé jsou určeny také široké veřejnosti. Odrážejí však pouze jednotlivé vlastnosti a rysy slov a gramatiky. Například na Univerzitě Vytautase Velikého v Kaunasu byla vytvořena databáze morfematiky založená na textovém korpusu. Chybí v ní mnoho slovních tvarů a používá se v ní velmi mnoho zkratek, které nejsou srozumitelné všem. Morfémy jsou odděleny spojovníkem a nejsou uvedeny žádné údaje o typu morfému. V Institutu matematiky a informatiky ve Vilniusu byla vytvořena databáze derivace a morfematiky. Je v ní uveden typ morfému, základní slova a určující slova (Murmulaitytė 2012: 96). Databáze bohužel není volně přístupná. Proto bylo rozhodnuto vytvořit komplexní informační systém určený široké veřejnosti, který by uživatelům poskytoval podrobné údaje.
V internetové prezentaci litevských gramatických informací lze pozorovat dva extrémy. Jsou to: chybění i běžných slovních tvarů a zobrazování nadbytečných slov, kterým nerozumějí ani rodilí mluvčí. Informační systém pro litevskou gramatiku se snaží těmto dvěma extrémům vyhnout. Všechny slovní tvary jsou generovány automaticky počítačem na základě lemmatu slova, takže se získá celá sada flektivních tvarů. Všechny možné derivace a složeniny se zapisují do databáze. Slovní tvary tedy již nechybějí. Poté se všechna slova a slovní tvary vytvořené počítačem ručně kontrolují a neexistující varianty se vyřazují. Tím se dosahuje odstranění nadbytečných slov.
2. PRÁCE V OBLASTI POČÍTAČOVÉ LINGVISTIKY V LITVĚ
V Litvě lze rozlišit dvě metody počítačového zpracování jazyka. V Kaunasu se v Centru počítačové lingvistiky provádějí práce založené na textovém korpusu. Ve Vilniusu, na univerzitě a v Institutu litevského jazyka, se vychází spíše z vlastností samotného litevského jazyka. Obě metody mají výhody i nevýhody. Dále to bude ukázáno na několika příkladech.
148
Acta Linguistica Lithuanica LXXVI
Page 6
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
2.1. PRÁCE ZALOŽENÉ NA TEXTOVÉM KORPUSU
Na Univerzitě Vytautase Velikého v Kaunasu byl vytvořen textový korpus současné litevštiny. Používá se pro různé druhy jazykového zpracování. V oblasti gramatiky byl vytvořen slovník morfémů (Rimkutė, Kazlauskienė, Rąkinis 2011) a o několik let později také databáze. Uživatelům jsou poskytovány morfematické i morfologické údaje. Jde o první volně přístupný zdroj, v němž je slovo rozčleněno na morfémy. Typ morfému bohužel není uveden, což někdy vede k matoucímu zobrazení morfematické struktury slova. K tomu dochází, když jsou slova s odlišnou strukturou zobrazena stejně. Příklad je uveden na obrázku 1. Slova „per-ei-ti“ (přejít) a „per-ė-ti“ (líhnout se) se navenek téměř neliší. Morfematické struktury obou slov vypadají v databázi morfémů stejně. V prvním slově je však morfém „per“ předponou, zatímco ve druhém slově je tentýž první morfém „per“ kořenem.
OBRÁZEK 1. Slova s odlišnou morfematickou strukturou jsou zobrazena stejně (Rimkutė, Kazlauskienė, Rąkinis 2011: 8, 35)
Jako druhý nedostatek lze uvést chybění i běžných slovních tvarů. Příčestí mají v litevštině šest pádů. Tabulka 1 ukazuje výskyt slovních tvarů (jednotné číslo, mužský rod) příčestí „bėgantis / běžící, tekoucí“ v databázi morfémů.
Ukazuje se, že chybí dokonce i lemma tohoto slova (nominativ, jednotné číslo). Ani ostatní chybějící tvary, například lokál (bėgančiame vandenyje / ve vodě tekoucí), nelze považovat za zřídka se vyskytující či neobvyklé. K dispozici jsou tedy pouze 2 slovní tvary ze 6 pádů.
Vědci zabývající se druhým baltským jazykem, lotyštinou, také upozorňují na nedostatečný počet slovních tvarů v textovém korpusu (Paikens, Rituma, Pretkalniņa 2013: 272).
Straipsniai / Articles
149
Page 7
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBIKAS, VYTAUTAS ŠVEIKAUSKAS
TABULKA 1.
Výskyt slovních tvarů příčestí bēgantis / běžící, tekoucí v jednotném čísle, mužském rodě v databázi (odkaz 2)
Pád
Slovo
Databáze
Nominativ
bēgantis
chybí
Genitiv
bēgančio
k dispozici
Dativ
bēgančiam
chybí
Akuzativ
bēgantį
je přítomen
instrumentál
bēgančiu
chybí
lokál
bēgančiame
chybí
Celkem:
6
2
2.2. VÝCHOZÍ BOD – LITEVŠTINA
Na Vilniuské univerzitě se vychází z vlastností litevštiny. Webová stránka Morfologija.lt (odkaz 3) zobrazuje dokonce i skloňovací tabulky slova. Bohužel je v nich mnoho prázdných míst, někdy i pro celé paradigma. Objevují se také neznámá a pro Litevce nesrozumitelná slova, např. „sutikimoji“ (odkaz 4) a podobná. Na Institutu matematiky a informatiky ve Vilniusu byla vytvořena databáze slovotvorby a morfemiky (Murmulaitytė 2012). Obsahuje velmi cenné informace (typ morfému, základové slovo, určující slovo aj.), ale data bohužel nejsou volně přístupná.
3. INFORMAČNÍ SYSTÉM PRO LITEVSKOU GRAMATIKU
Litevština patří ke skupině nejméně počítačově zpracovaných jazyků v Evropě (Vaišnienė, Zabarskaitė 2012: 35). Proto bylo rozhodnuto vytvořit informační systém obsahující podrobné údaje o gramatických vlastnostech litevských slov. Vědci zabývající se baltskými jazyky často zdůrazňují potřebu vytvářet více softwaru pro široký okruh uživatelů. V pokynech konference BSNLP (Balto-Slavic Natural Language Processing) z let 2015 a 2017 se píše: „příspěvky
150
Acta Linguistica Lithuanica LXXVI
Page 8
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
popisující systémy, které jsou zpřístupněny širší veřejnosti, budou důrazně podporovány / zvláště podporována budou zařízení, která popisují systémy zpřístupněné široké veřejnosti“ (odkaz 5).
Proto vznikl nápad koncipovat informační systém pro litevskou gramatiku pro široký okruh uživatelů a zobrazovat data co nejjednodušeji a nejsrozumitelněji.
Proto byl zvolen responzivní webdesign (RW), aby bylo možné co nejlépe vyhovět potřebám uživatelů. Gramatické informace o slově se proto zobrazují v dlaždicích (anglicky tiles) (odkaz 6). Webovou stránku je tedy možné navštívit i z mobilního telefonu.
3.1. METODA VYTVÁŘENÍ DATABÁZE
Cílem počítačového zpracování gramatiky je mít v elektronické podobě veškeré gramatické informace o každém slově a všech jeho tvarech. Existují dva způsoby, jak toho dosáhnout. Prvním je vytvořit formální popis gramatických pravidel (šlo by o jakousi pomůcku) a poté nechat počítač generovat potřebné údaje. Druhým způsobem je uložit do počítače všechny gramatické informace o všech tvarech všech slov a podle potřeby je vyhledávat. O tom, který postup vyžaduje více práce, je třeba ještě diskutovat. Na Institutu matematiky a informatiky byl vyvinut software pro morfologickou analýzu litevštiny (Zinkevičius 2000), při němž byla použita první metoda. Nepodařilo se však dosáhnout 100% přesnosti: údaje obsahují chyby a některá litevská slova nejsou rozpoznána.
Při vývoji informačního systému pro litevskou gramatiku se od tohoto postupu upustilo z následujícího důvodu: aby počítač mohl slova zpracovávat sám, je nutné mu velmi přesně ukázat, jaké operace má s kterým slovem provádět. Nejprve je tedy třeba rozdělit všechna slova do skupin tak, aby pro všechny členy dané skupiny platily stejné zákonitosti, tj. aby bylo možné použít stejnou metodu zpracování. Aby bylo možné slovo zařadit do jedné či druhé skupiny, je nutné určit mnoho vlastností, na jejichž základě se mají slova seskupovat. Např. v syntaktické analýze litevštiny se sémantický rys [čas] používá k určení syntaktické funkce akuzativu podstatných jmen. Ve větě „Visą naktį ji
Straipsniai / Articles
151
Page 9
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
skaitė šią knygą / Celou noc četla tuto knihu.“ a „Visą knygą ji perskaitė šią naktį / Celou knihu přečetla této noci.“ Dvě slova knygą/kniha a naktį/noc se z hlediska morfologických kategorií neliší – obě jsou ženského rodu, jednotného čísla a v akuzativu; pouze sémantický rys [čas], který má slovo naktis/noc, ale slovo knyga/kniha nikoli, umožňuje počítači správně považovat slovo naktį/noc za časové určení a slovo knygą/kniha za předmět ve větě. Něco podobného je třeba udělat i pro morfologii. Jednou z chyb již vytvořeného softwaru pro morfologickou analýzu litevského jazyka je, že morfém -ėj- je považován za sufix i u takových kořenů, s nimiž se nemůže pojit. Je třeba stanovit rysy slov, které počítači umožní určit, s kterými kořeny se tento sufix -ėj- může pojit. To je však velmi složité. Jaký rys mají například společný slova geroė/Wohlhaben, žinovas/Kenner(Expert) a daržovė/Obst? Všechna mají sufix -ov-. A čím se liší od všech ostatních slov, k jejichž kořeni se tento sufix připojit nemůže (nelze říci *kėdovė – odvozeninu se sufixem -ov- od slova kėdė/židle)? A který rys to ukazuje?
Při vývoji informačního systému pro litevskou gramatiku byla tedy zvolena druhá cesta, tj. byla připravena databáze s podrobnými gramatickými informacemi o všech tvarech všech slov litevského jazyka. Zde není třeba vycházet z gramatických kategorií (jak je tomu ve všech tištěných gramatikách), nýbrž přímo ze slova: uživateli je třeba poskytnout veškeré informace související s každým slovem.
Bylo rozhodnuto zvolit jako východisko kořen a vytvořit software, který by měl odrážet celou strukturu litevské gramatiky. Jako první pokus byl zvolen kořen bėg (od slovesa bėgti/běžet). Poté počítač vytvořil všechny možné odvozeniny a následně byly ručně vyškrtnuty všechny výrazy, které v litevském jazyce neexistují. Databáze obsahuje celkem přibližně 25 000 položek.
3.2. ZVLÁŠTNOSTI „LIGIS“
Informační systém pro gramatiku litevského jazyka (Lietuvių kalbos gramatikos informacinė sistema – LIGIS) (odkaz 7) má dvě důležité vlastnosti. Zaprvé poskytuje uživateli podrobnější informace o konkrétním slově než tištěné gramatiky. A
152
Acta Linguistica Lithuanica LXXVI
Page 10
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
zadruhé zahrnuje více slov než slovníky. Gramatiky uvádějí pravidla, která platí pro určitou skupinu slov. Neuvádějí však všechna slova, na něž se dané pravidlo vztahuje. LIGIS shromažďuje veškeré informace související se slovem zadaným uživatelem a zpřístupňuje je na webové stránce. Ve slovnících nejsou zapsána všechna slova litevského jazyka; chybí v nich mnoho odvozenin a složenin. LIGIS zahrnuje všechny možné odvozeniny. Pro srovnání uveďme příklad. Databáze morfémů obsahuje přibližně 75 000 položek. Ty však popisují různá litevská slova. Databáze LIGIS v současnosti sestává z 25 000 položek a zahrnuje pouze slova odvozená od jediného kořene: beg-. V databázi morfémů je 118 slov s tímto kořenem.
3.3. STRUKTURA SLOVA
Po zadání slova se uživateli zobrazí jeho struktura: uvede se lemma a základové slovo, stejně jako určující složka u odvozenin a složenin. Je-li slovo gramaticky nejednoznačné, každému z jeho významů se přiřadí vlastní číslo lemmatu. Morfologické a morfémické údaje se pak zobrazí pod tímto číslem. Příklad nejednoznačného slova je uveden v příloze A.
Ostatní tvary. Tak se nazývá tlačítko (anglicky button), které se nachází v dlaždici se strukturou slova. Webová stránka pro morfologickou analýzu ruského jazyka (odkaz 8) pokaždé zobrazí všechny tvary zadaného slova. V informačním systému pro litevskou gramatiku bylo rozhodnuto zavést tlačítko, jehož prostřednictvím si uživatel může zobrazit ostatní tvary, protože uživatel nepotřebuje pokaždé všechny tvary slova.
3.4. MORFOLOGICKÉ ÚDAJE
Morfologická informace zahrnuje označení slovního druhu a gramatické kategorie: pád, rod a číslo u podstatných jmen; osobu, čas a způsob u sloves atd. Víceznačná slova se číslují, pokud má například podstatné jméno několik homonymních pádových tvarů.
V databázi morfémů (odkaz 2) jsou také morfologické údaje o slově. Informace se však uvádějí výhradně ve zkratkách
Straipsniai / Articles
153
Page 11
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
Následující příklad je uveden na obrázku 2. Pro laiky může být takové množství zkratek často nesrozumitelné. Zejména pro cizince, kteří studují nebo se učí litevštinu, mohou být takto zobrazené informace někdy nejasné.
OBRÁZEK 2. Údaje o slově begčio, zobrazené výhradně ve zkratkách (odkaz 2)
V informačním systému litevské gramatiky se zkratky nepoužívají. Všechny údaje se vypisují v plném znění (příloha A).
3.5. MORFEMICKÉ ÚDAJE
Nejdůležitější rozdíl oproti databázím, k nimž je již dnes možné získat přístup,1 spočívá v uvedení typu každého morfému. Pouze tak lze dosáhnout jednoznačnosti při zobrazování morfémů ve slově. Jinak nelze například odlišit druhý kořen ve složeném slově od přípony, jak je tomu v databázi morfemiky.
Prvním a rozhodujícím rysem bylo zobrazení morfémů různými barvami. Každému typu morfému (kořen, předpona, přípona, koncovka) byla určena barva. Předpony se zapisují modře. Pro kořen se používá červená barva. Přípony se zobrazují zeleně a pro koncovku byla zvolena černá.
Slovo rozdělené na morfémy se navíc znázorňuje ve svislém směru a vedle něj se zapisuje nejen označení typu každého morfému ve slově, ale uvádějí se také vlastnosti morfému, pokud nějaké má, například u přípony: slovotvorná nebo tvarotvorná; u koncovek: zkrácená, pronominalizovaná apod. U zkrácených koncovek, které jsou v mluveném jazyce velmi rozšířené, se vedle uvádí také plná koncovka. Jako příklad lze uvést slova z mluveného jazyka: šnekamoje kalboje – plné koncovky, šnekamoj kalboj – zkrácené koncovky. Má-li slovo plnou koncovku, neuvádí se její délka, protože většina slov má plné koncovky a taková informace by byla nadbytečná. Pokud
154
Acta Linguistica Lithuanica LXXVI
Page 12
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
Pokud koncovka není pronominalizována, informace o tom se také neuvádí.
Hláskové změny se považují za vlastnost kořene. Může jít o změny souhlásek i samohlásek. V litevštině lze zaznamenat ještě další druh hláskových změn: úbytek souhlásek v rozkazovacím způsobu. K hláskovým změnám v kořeni slova patří také infixy. Za vlastnost předpony se považuje její původ: může být předložkového původu, vzniklá z částice nebo mezinárodního původu.
V případě gramatické víceznačnosti slov se zkoumají morfémové struktury. Jsou-li stejné, popisuje se pouze jedna struktura. Pokud se však liší, uvádějí se morfémové struktury pro každý význam slova (příloha A).
3.6. VŠECHNY TVARY SLOVA
U každého slova obsaženého v databázi lze kliknutím na tlačítko „Ostatní tvary“ zobrazit tabulku skloňování či časování. Jsou v ní uvedena všechna data z morfologické dlaždice. V horní části tabulky jsou uvedeny kategorie, které tabulka skloňování či časování neobsahuje; například podstatná jména se v litevštině neskloňují podle rodu, proto je rod uveden v horní části tabulky, stejně jako lemma a slovní druh. Přídavná jména a příčestí mají tři rody a zvláštností litevštiny je, že pouze dva z nich (mužský a ženský) mají všech šest pádů. Třetí rod má pouze jeden tvar, proto se uvádí bez označení pádu (příloha B). U sloves jsou zobrazeny všechny časové tvary ve všech způsobech (příloha D).
Třídy časování i skloňování se tak stávají nadbytečnými, proto se k nim neuvádějí žádné údaje.
U některých slov jsou do tabulky skloňování či časování zařazeny také příklady použití. K tomu se používá rychlá nápověda (anglicky tooltip). V příloze C je jako příklad uvedeno slovo „bėgis“ (akuzativ, jednotné číslo podstatného jména bėgis / železniční kolej, běh).
3.7. DATABÁZE
Při vývoji databáze se usilovalo o co nejvyšší kvalitu a spolehlivost. Proto byla velká část práce provedena ručně
Straipsniai / Articles
155
Page 13
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAUSKAS
provedeno, protože maximálně spolehlivé informace lze dosáhnout pouze s pomocí člověka (Sulger 2013: 53).
Na Institutu litevského jazyka byl proveden výzkum litevských předpon. Bylo zjištěno, že v litevštině existuje přibližně 600 kombinací předpon (Šveikauskienė 2015: 195). „Kombinacemi“ se rozumějí různé sady předpon, které se mohou objevit před kořenem, např. at-bėgi, nu-bėgi, ne-be-at-bėgti, ne-nu-bėgti, te-be-bė-ti atd. Ukázalo se, že s kořeny sloves se používá pouze 220 z těchto kombinací; ostatní, např. nuo-, se používají s podstatnými jmény: nuo-monė /názor. Software byl navržen tak, aby automaticky spojoval kořen se všemi možnými kombinacemi předpon. Poté lidé zkontrolují výsledky vytvořené počítačem a do databáze se zapíší slova, která se v litevštině skutečně vyskytují. Tím se daří vyhnout dvěma extrémům: nadměrnému počtu tvarů generovaných počítačem i nedostatečnému rozsahu slov.
Všechna lemmata a gramatické informace, které se jich týkají, se do databáze zapisují ručně. Protože software vytvořený na Institutu matematiky a informatiky při generování tvarů daného lemmatu nedělá chyby, byla počítači svěřena automatická tvorba záznamů ostatních tvarů slova.
Pozoruhodné je, že v LIGIS se zpracovávají také slova se zkrácenými koncovkami. Taková slova se v mluveném jazyce vyskytují velmi často a žádná z již existujících databází tyto slovní tvary nezpracovává. Je třeba zdůraznit, že LIGIS obsahuje také taková odvozená slova, která chybějí dokonce i ve dvacetisvazkovém Slovníku litevského jazyka a v jeho elektronické verzi (odkaz 9), např. neužbėgti/už dál neběhat nahoru.
V databázi jsou informace uchovávány v počítačově přívětivé podobě, tj. používá se kódování v Prage Markup Language (Hana, Štepánek 2012). Tato podoba dat se na internetu nezobrazuje, protože by byla pro neodborníky na počítačovou lingvistiku nadbytečná.
Uchovávání všech informací v databázi činí z LIGIS užitečný nástroj také pro lingvisty, kteří zkoumají litevský jazyk. Lze získat nejrůznější informace, např. hledat slova s určitou kombinací předpon a přípon a podobně.
156
Acta Linguistica Lithuanica LXXVI
Page 14
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
3.8. VÍCEJAZYČNOST WEBOVÝCH STRÁNEK
Webové stránky jsou dostupné v sedmi jazycích: litevštině, angličtině, němčině, francouzštině, italštině, ruštině a japonštině. Potřeba vytvořit vícejazyčné webové stránky vyvstala v důsledku neuspokojivých překladů z litevštiny od Googlu. Strojový překlad litevštiny je nespolehlivý. Proto bylo rozhodnuto, že webové stránky o litevské gramatice budou vícejazyčné a budou obsahovat pouze texty přeložené lidmi. Situace u ostatních jazyků zjevně není o mnoho lepší. Svědčí o tom dopis Lingvistu z 8. června 2017, v němž se žádá, aby označení LINGUIST přeložili rodilí mluvčí, a v žádném případě aby nebyl použit strojový překlad (LinguiList 2017: 28.252).
Při rozhodování o vytvoření vícejazyčných webových stránek jsme vycházeli z této myšlenky: pokud se cizinec, například Nor, učí nebo studuje litevštinu a některá litevská slova jsou mu známá, zatímco jiná ještě ne, může si zvolit jazyk, který ovládá lépe než litevštinu, například němčinu, a všechna neznámá litevská slova mu budou srozumitelná. Za tímto účelem bylo dokonce zajištěno uchování slova zadaného uživatelem při přepnutí jazyka. Pokud tedy uživatel zvolí jiný jazyk, nemusí slovo zadávat znovu.
4. PLÁNY DO BUDOUCNA
Na Vilniuské univerzitě je digitalizováno mnoho dvojjazyčných slovníků. Na Institutu litevského jazyka byl digitalizován velký slovník o 20 svazcích a také další jednojazyčné slovníky: synonymické, antonymické, frazeologické aj. Plánuje se propojit oba typy slovníků s informačním systémem litevské gramatiky a vytvořit obdobu německé webové stránky CANOONET (odkaz 10).
Protože informační systém pro gramatiku litevského jazyka obsahuje údaje o morfémech, je možné vyhledávat slova na základě morfémového modelu. A právě to se plánuje do budoucna.
Záložka (anglicky tab) je na webové stránce LIGIS určena pro teorii a v současné době se na ní pracuje. Mají zde být uvedeny podrobné akademické poznatky o litevské gramatice.
Straipsniai / Articles
157
Page 15
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAUSKAS, VYTAUTAS ŠVEIKAUSKAS
V první etapě se pracuje na morfologii. Ve druhé fázi mají být vloženy také syntaktické údaje.
5. Závěry
1. Tento přístup může být užitečný a smysluplný také pro jiné jazyky s bohatým flektivním systémem.
2. Informační systém litevské gramatiky může být velmi užitečný pro žáky, studenty, cizince, kteří se učí litevsky, a také pro jazykovědce, kteří zkoumají litevský jazyk.
3. Shromážděné údaje mohou sloužit také jako dokumentace litevského jazyka.
Literaturverzeichnis
Al – Onaizan Yaser, Curin Jan, Jahr Michael, Knight Kevin, Lafferty John, Melamed Dan, Och Franz – Josef, Purdy David, Smith Noah A., Yarowsky David 1999: Statistical Machine Translation. – Final Report JHU Workshop. http://mt-archive.info/JHU-1999-AlOnaizan.pdf (Zugriff am 21.11. 2017).
Brown Peter F., Cocke John, Della Pietra Stephen A., Della Pietra Vincent J., Jelinek Frederick, Lafferty John D., Mercer Robert L., Roossin Paul S. 1990: A Statistical Approach to Machine Translation. – Computational Linguistics Volume 16, Number 2, June, 79–85. http://www.aclweb.org/anthology/J90-2002 (Zugriff am 21.11. 2017).
Charniak Christopher E. 1989: Artificial Intelligence & Turbo C. Homewood: Dow Jones-Irwin.
Daudaravičius Vidas 2012: Teksto skaidymas pastoviųjų junginių segmentais. Daktaro disertacijos santrauka. Kaunas: Vytauto Didžiojo universitetas.
Goldsmith John A. 2010: Segmentation and Morphology. The Handbook of Computational Linguistics and Natural Language Processing. Wiley-Blackwell, 364–393.
Han Jirka, Štěpánek Jan 2012: Prague Markup Language Framework. Procedings of the 6th Linguistic Annotation Workshop. Jeju, Republic of Korea, 12–13 July, 12–21.
Jensen Karen, Heidorn George Emil, Richardson Stephen D. 1993: Natural language processing: The PLNLP Approach. Boston / London: Kluwer Academic Publishers.
158
Acta Linguistica Lithuanica XXVII
Page 16
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
Köhler Reinhard 2012: Quantitative Syntax Analysis. De Gruyter Mouton.
Köhler Reinhard, Altmann Gabriel, Piotrowski Rajmund G. 2005: Quantitative Linguistik. Berlin / New York: Walter de Gruyter.
Linguist List 2017: 28.254, Qs: How do you say the LINGUIST List in your language? 08 Jun 2017. [email protected].
Murmulaitytė Daiva 2012: Lietuvių kalbos morfemikos ir žodžių darybos tyrimų perspektyvos. – Žmogus ir žodis 1(14), 96–102.
Nirenburg Sergei 1987: Machine Translation: Theoretical and Methodological Issues. London: Cambridge University Press.
Paikens Pēteris, Rūma Laura, Pretkalniņa Lauma 2013: Morphological Analysis with limited resources: Latvian example. Proceedings of the 19th Nordic Conference of Computational Linguistics. (NODALIDA 2013); Linköping Electronic Conference Proceedings #85, 267–277.
Reed David W. 1949: A Statistical Approach to Quantitative Linguistic Analysis, WORD, 5:3, 235–247, DOI: 10.1080/00437956.1949.11659355.
Rimkutė Erika, Kazlauskienė Asta, Raškinis Gailius 2011: Dažnis lietuvių kalbos žodyne. Kaunas: VDU.
Schwanke Martina 1991: Maschinelle Übersetzung: Ein Überblick über Theorie und Praxis. Berlin: Springer-Verlag.
Skadiņš Raivis 2017: Neural MT and other Language Technologies at TILDE. http://school.gramaticframework.org/2017/slides/Ravis-Neural_MT_at_Tilde.pdf (zugegriffen 2017.11.21).
Sulger Sebastian, Butt Miriam, King Tracy Holloway, Meurer Paul 2013: ParGramBank: The ParGram Parallel Treebank. – Proceedings of the 51st Annual Meeting of the Association for Computational Linguistics, Sofia, Bulgaria, 550–560. http://aclweb.org/anthology/P/P13/P13-1054.pdf (zugegriffen 2017.11.21).
Šveikauskienė Daiva 2015: Morphemic structure of the Lithuanian prefixes. – Language: Meaning and Form 6. – Language System and Language Use. Rīga: Latvijas universitāte, 189–197.
Vaišnienė Daiva, Zabarskaitė Jolanta 2012: The Lithuanian Language in the Digital Age. – G. Rehm, H. Uszkoreit White Paper Series. Heidelberg / New York / Dordrecht / London: Springer.
Winograd Terry 1983: Language as a Cognitive Process 1. Syntax. London: Addison-Wesley Publishing Company.
Straipsniai / Articles
159
Page 17
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAS
Yule George Udny 1944: The Statistical Study of Literary Vocabulary. Cambridge MA, Cambridge university press.
Zinkevičius Vytautas 2000: Lemoklis – morfologinė analizė. – Darbai ir dienos 24, 245–273.
Zipf George Kingsley 1929: Relative frequency as a Determinant of Phonetic Change. – Harvard studies in classical philology 40, 1–95.
Сердюков Пётр Иванович 1979: Оптимизация алгоритма поиска синтаксических связей. – Международный семинар по машинному переводу. Москва: ВЦП, 123–125.
LINKS
Link 1: http://www.digitalgrammars.com/ (Zugriff am 21.11. 2017)
Link 2: http://tekstynas.vdu.lt/page.xhtml?id=morfema-db (Zugriff am 21.11. 2017)
Link 3: http://morfologija.lt/ (Zugriff am 21.11. 2017)
Link 4: http://morfologija.lt/zodzio-formos/sutikimas (Zugriff am 21.11. 2017)
Link 5: http://bsnlp-2017.cs.helsinki.fi/cfp.html (Zugriff am 21.11. 2017)
Link 6: https://de.wikipedia.org/wiki/Microsoft_Windows_8#Oberfl.C3.A4che (Zugriff am 21.11. 2017)
Link 7: http://ligis.lki.lt/ (Zugriff am 21.11. 2017)
Link 8: http://goldlit.ru/component/slog (Zugriff am 21.11. 2017)
Link 9: http://www.lkz.lt/Visas.asp?zodis (Zugriff am 21.11. 2017)
Link 10: http://www.canoo.net/ (Zugriff am 21.11. 2017)
160
Acta Linguistica Lithuanica LXXVI
Page 18
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
ANHANG A. GRAMMATISCHE INFORMATION.
Beispiel des grammatisch mehrdeutigen Wortes nubəɡti / hinlaufen-hingelaufen.
Die grammatische Information wird in der Website in Kacheln ausgelegt.
Diese Darstellungsweise ist günstig für responsives Webdesign – RWD.
Bemerkung: Die Farben sind im Bild entfernt.
Straipsniai / Articles
161
Page 19
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBOKAS, VYTAUTAS ŠVEIKAUSKAS
ANHANG B. FORMENtABELLE FÜR DEKLINATION.
Als Beispiel wird die Flexion des Partizips nubėtas / hingelaufene in allen drei Genera und allen Kasus angeführt.
NUBĖTASPARTIZIP II, PASSIV, PRÄTERITUMMännlichSingularPluralNominativnubėtasnubėtiGenitivnubėtonubėtųDativnubėtamnubėtiemsAkkusativnubėtąnubėtusInstrumentalnubėtunubėtaisLokativnubė tamenubėtuoseWeiblichSingularPluralNominativnubėtanubėtosGenitivnubėtosnubėtųDativnubėtainubė tomsAkkusativnubėtąnubėtasInstrumentalnubėtanubėtomisLokativnubėtojenubėtoseNeutrumnubėta
162
Acta Linguistica Lithuanica LXXVI
Page 20
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
ANHANG C. TOOLTIP FÜR VERWENDUNGSBEISPIELE.
Als Beispiel wird die Schnellinfo für die Akkusativ-Singular-Form bėgį des Substantivs bėgis / Lauf, Getriebe, Eisenbahnschiene angeführt.
Straipsniai / Articles
163
Page 21
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAKAS, VYTAUTAS ŠVEIKAS
ANANG D. FORMENTABELLE FÜR KONJUGATION.
Als Beispiel wird die Flexion des Verbs bėgti / laufen in allen Tempusformen und Modi angeführt.
164
Acta Linguistica Lithuanica LXXVII
Page 22
Eine mehrsprachige Website zur Grammatik der litauischen Sprache
Daugakalbė lietuvių kalbos gramatikos informacinė sistema internete
SANTRAUKA
Lietuvių kalbos kompiuterizavimo darbuose galima pastebėti du pagrindinius trūkumus: trūksta kartais net ir dažnai vartojamų formų ir pateikiami pertekliniai, lietuvių kalboje neegzistuojantys žodžiai. Kuriant Lietuvių kalbos gramatikos informacinę sistemą (LIGIS) stengiamasi išvengti jų abiejų. Visos formos generuojamos kompiuteriu automatiškai ir vėliau gauti rezultatai peržiūrimi žmogaus, kad būtų atmesti lietuvių nesuprantami žodžiai.
Lietuvių kalbos gramatikos informacinė sistema apima visus darinius. Šiuo metu duomenų bazę sudaro tik šakn inės beg-žodžiai. Jų yra apie 25 000. Palyginimui galima pateikti tokius duomenis: morfemos duomenų bazę sudaro yra apie 75 000 įrašų, bet jie surinkti iš visos lietuvių kalbos leksikos. Su šaknimi beg- ten yra 118 žodžių.
Kuriant Lietuvių kalbos gramatikos informacinę sistemą pagrindinis tikslas buvo pateikti išsamią gramatinę informaciją plačiajai visuomenei. Todėl buvo stengiamasi duomenis atvaizduoti kuo aiškiau ir suprantamiau. Svetainė pritaikyta naudotis ir mobiliuosiuose telefonuose.
Vartotojas, pateikęs žodį, gauna trijų tipų informaciją apie jį: žodžio struktūrą (pradinę formą bei pamatinį žodį dariniams), morfologinę informaciją (kalbos dalis bei jos morfologinės kategorijos – linksnis, giminė, skaičius, laikas, laipsnis ir t. t.) ir morfeminiai duomenys – žodis išskaidytas morfemomis, nurodant morfemos tipą bei požymius, jei morfema jų turi, pavyzdžiui, priesaga – darybinė / kaitybinė, galūnė – įvardžiuotinė, sutrumpėjusi ir kt. Kiekviena morfema žymima vis kita spalva. Reikia pabrėžti, kad Lietuvių kalbos gramatikos informacinė sistema yra pirmasis tinklapis Lietuvoje, kur vartotojui pateikiama informacija apie morfemos tipą. Be to, apdorojami ir žodžiai su sutrumpėjusiomis galūnėmis, kurios labai paplitusios, ypač šnekamojoje kalboje.
Kiekvienam duomenų bazėje esančiam žodžiui vartotojas gali gauti visą kaitybinę lentelę. Kai kuriems žodžiams pateikiama vartojimo pavyzdžių.
Kuriant Lietuvių kalbos gramatikos informacinę sistemą siekiama kuo didesnio tikslumo ir patikimumo. Todėl visos temos (žodžių pradinės formos – vardininkas, bendratis) suvedamos į duomenų bazę rankomis. Kaitybines formas sugeneruoti patikėta kompiuteriui, nes šiame jo darbe nebuvo pastebėta klaidų.
Svetainė pateikiama septyniomis kalbomis: lietuvių, anglų, vokiečių, prancūzų, italų, rusų ir japonų.
Ateityje planuojama Lietuvių kalbos gramatikos informacinę sistemą jungti su skaitmenintais žodynais ir sukurti vokiečių tinklapio CANOONET analogą.
Straipsniai / Articles
165
Page 23
DAIVA ŠVEIKAUSKIENĖ, ARŪNAS RIBAUSKAS, VYTAUTAS ŠVEIKAUSKAS