scieee AI-readable full text Open interactive document viewer

Nástroj na tvaroslovnou analýzu staré angličtiny

Tichý, Ondřej

Abstract

40

Full text

ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 1, S. 40–54 Nástroj na tvaroslovnou analýzu staré angličtiny Ondřej Tichý (Praha) MORPHOLOGICAL ANALYSER OF OLD ENGLISH The paper describes the construction and testing of an electronic application for semi-automatic morphological analysis of Old English. It introduces the state of the art in the field of electronic analysis of Old English, provides abrief overview of Old English morphology and discusses the reasoning behind our theoretical framework. An account of the chosen methodology is offered and aspecific description of its implementation is provided: from the acquisition and preparation of the lexical input data, through the programming of the forms generator to the testing of the results by analysing Old English text. The resulting recall of 95% is asuccess; however, the paper also hints at how it may be improved. It also discusses further use and development of the analyser, especially the disambiguation of its results. The paper makes afuture semi-automatic morphological tagging of Old English texts areal possibility. KEYWORDS Old English, historical linguistics, computational linguistics, automatic morphological analysis, morphology, forms generator KLÍČOVÁ SLOVA stará angličtina, historická lingvistika, komputační lingvistika, automatická morfologická analýza, morfologie, generátor tvarů 1. ÚVOD1 Současný diachronní výzkum jazyka se stále častěji jako kzásadnímu zdroji nových poznatků ipro ověření poznatků starších obrací kjazykovým korpusům. Práce skorpusy staršího jazyka má však svá významná specifika aúskalí. Diachronní korpusy jsou zpohledu synchronního výzkumu stále málo rozsáhlé (běžné jsou korpusy do několika milionů pozic/tokenů) apředevším bývají jen velmi spoře označkovány. Usynchronních korpusů (obzvláště moderní angličtiny, ale ičeštiny) dnes běžně očekáváme např. lemmatizaci nebo přímo morfologické asyntaktické značkování. Udiachronních korpusů se sním setkáme zřídka. To však zásadně komplikuje využití korpusů pro analýzu historického jazyka, neboť např. bez lemmatizace je prakticky nemožné provádět kolokační analýzu avětšina frekvenčních analýz (základní metoda korpusové analýzy) je na nelemmatizovaném materiálu mnohem náročnější. 1 Článek je shrnutím nepublikované stejnojmenné disertační práce obhájené vroce 2014 na FF UK. OPEN ACCESS ONDřEJ TICHý 41 Jednou zhlavních příčin tohoto stavu je, že značkování (alemmatizaci budeme pro tyto účely pokládat za druh morfologického značkování) historického jazyka je výrazně obtížnější než značkování jazyka současného. To souvisí především smožnostmi automatizace značkovacího procesu. Pro moderní angličtinu již existují poměrně spolehlivé nástroje pro morfologické isyntaktické značkování, nakonec lemmatizovat moderní anglický text je např. zpohledu moderní češtiny sjistou nadsázkou téměř banální. Ovšem ipro nesporně komplexnější českou gramatickou morfologii existují kvalitní nástroje automatické analýzy. Problém však nespočívá jen vmorfologické komplexitě, ale především ve standardizaci. Každému, kdo kdy pracoval shistorickým jazykem či snestandardizovanou jazykovou varietou je jasné, že pravopis, formy apravidla zpříruček často přesně neodpovídají jazyku dokladů. Jako jsou jazykové příručky moderních standardních variet (např. spisovné češtiny) abstrakcí nad komplexnější jazykovou realitou (langue/parole), jsou příručky týkající se historických variet jazyka ještě navíc abstrakcí nad komplexitou nářečí, písařských tradic aidiosynkrasií případně diachronních rozdílů vrámci popisovaných období. Motivací kvytvoření nástroje na automatickou tvaroslovnou analýzu staré angličtiny je tedy především usnadnit či vněkterých případech vůbec umožnit korpusový výzkum tohoto období anglického jazyka, přičemž jak zvýše uvedeného vyplývá, tento nástroj si musí umět poradit jak smorfologickou komplexitou staré angličtiny, tak snízkou standardizací jejích dokladů. 2. TEORETICKÝ RÁMEC Při bližším zkoumání dosavadních výsledků na poli automatického zpracování staroanglické morfologie se ukázalo, že se nejedná oproblém zcela nový, byť jde bezesporu oproblém zatím uspokojivě nevyřešený. Část dosavadních pokusů oautomatizaci tvaroslovné analýzy se omezovala jen na část jazykové struktury. Např. Verbix (Lindberg, 1995), The Nerthus Project (Martín Arista, 2004) nebo Morphological Analyzer for Old English Verbs (Adams, 2007) se zaměřily pouze na slovesnou morfologii. Část se zase zabývala pouze úzkým výběrem materiálu určeného kanalýze— např. Morphological Analyser of Old English Texts (Calle Martín et al., 1997–2001). Dva dosud nedokončené projekty pak přímo navazují na naši datovou základnu (resp. stejný zdroj lexikálních dat): jedná se olemmatizaci staroanglické básně Daniel (Kleinman, 2012) alemmatizační projekt korpusu YCOE.2 Společným rysem všech těchto projektů je teoretický rámec, který určuje jako základ nástroje různým způsobem generovaný slovník, se kterým jsou následně porovnávány doklady, tedy samotné formy vyskytující se ve staroanglických textech. Způsob porovnávání anásledné analýzy se však liší. Vnejjednodušším případě (Kleinman) jde opouhé porovnávání řetězců znaků svyužitím tzv. Levenštejnovy vzdálenosti (míra podobnosti textových řetězců), vrafinovanějších nástrojích se položky 2 The York‐Toronto‐Helsinki Parsed Corpus of Old English Prose. Informace oprojektu Ans Van Kemenade aErwina Komena byly získány vroce 2013 soukromou korespondencí. OPEN ACCESS 42 ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 1 slovníku (lemmata) upravují na základě morfologických pravidel apak se teprve porovnávají sdoklady. Podobným způsobem jsme se rozhodli postupovat ivnašem případě, jelikož však jsou výše uvedené nástroje, resp. jejich popis, buď nedostupné, nebo neúplné, rozhodli jsme se vobecných rysech inspirovat implementačně ověřeným řešením morfologické analýzy moderní češtiny (Osolsobě, 1996; Sedláček, 1999; Sedláček— Smrž, 2001). Takto stanovený teoretický rámec předpokládá tři základní fáze řešení: 1. Přípravu dat, která budou tvořit základní slovník nástroje. Základní slovník by měl být co do pokrytí staroanglického lexika pokud možno vyčerpávající, měl by kromě samotného lexika obsahovat izákladní morfologické informace ojednotlivých položkách. 2. Tvorbu generátoru, který zpoložek základního slovníku na základě morfologických pravidel vygeneruje všechny gramatické formy staroanglických slov ake každé formě přiřadí ipříslušné morfologické kategorie, tedy slovník forem. 3. Vytvoření aplikace, která bude srovnávat doklady staroanglického textu spoložkami slovníku forem, tedy samotného analyzátoru vužším slova smyslu. Vpřípadě shody bude doklad označen jak odkazem na příslušnou položku základního slovníku (lemmatizace), tak na morfologické kategorie patřící kshodné položce slovníku forem (morfologická analýza). Kvýsledné lemmatizaci amorfologickému značkování využitelné badateli však bude třeba výsledky automatické analýzy ještě disambiguovat (ať již ručně, nebo zčásti strojově), jelikož nelze předpokládat, že by si nástroj pouze na základě morfologie poradil např. svýběrem zhomonymních tvarů. Proces disambiguace však již není součástí tohoto nástroje na tvaroslovnou analýzu. Jak bylo předesláno vúvodu, konkrétní implementace všech tří fází nutně vychází ze specifik staroanglického tvarosloví amusí zároveň odpovídat skutečnému stavu analyzovaných dokladů. 3. MORFOLOGIE STARÉ ANGLIČTINY Stará angličtina, tedy angličtina přibližně zlet 700–1100, je na rozdíl od angličtiny moderní ztypologického hlediska jazyk ještě převážně flektivní, byť sflexí, oproti některým indoevropským jazykům, jakým je třeba čeština, značně omezenou. Ve staré angličtině se tak setkáme spodobnou deklinací podstatných jmen, přídavných jmen azájmen, jakou známe např. zmoderní němčiny astejně jako vmoderní němčině je ve staré angličtině zvláště rozvinutá slovesná konjugace. Rámec tohoto článku neumožňuje podrobný popis staroanglického tvarosloví, omezíme se jen na několik obecných poznámek vztahujících se konkrétně knašemu nástroji. Základní rozdíl mezi tradičními filologickými popisy staroanglického tvarosloví (např. Wright— Wright, 1914), případně moderními popisy určenými studentům (např. Baker, 2012) apopisem, který je výsledkem analýzy staroanglického tvarosloví OPEN ACCESS ONDřEJ TICHý 43 za účelem strojového zpracování, je především vúrovni detailu, který je věnován různým jazykovým strukturám. Tradiční popisy staroanglické morfologie sledují kromě popisu samotného idalší cíle, např. důraz na historickou kontinuitu struktur ajevů, aněkdy tak vpopisu rozlišují istruktury, které se již vdaném období formálně neliší (např. paradigmata navazující na paradigmata původně odlišná ve své rekonstruované podobě, ve staroanglickém materiálu však již formálně nerozlišená). Náš popis byl vtomto ohledu naopak veskrze pragmatický, atedy např. nerozlišoval ani takové struktury, jejichž formální odlišnost dle tradičního popisu byla nižší než faktické formální kolísání těchto struktur vtextu, ať již jde okolísání písařské, nářeční nebo diachronní.3 Náš popis je však vněkterých ohledech naopak detailnější, ato jak vzhledem kvýrazně okleštěným popisům moderním určeným studentům, tak často ivzhledem ktradičnímu popisu— musí totiž postihnout všechny struktury, které obvyklé popisy zahrnují pod výjimky, či vzhledem kjejich okrajovosti zanedbávají. Oproti tradičním sedmi silným, třem slabým aněkolika málo préteritoprézentním anepravidelným slovesným paradigmatům zavádí náš popis pro účely strojového zpracování 132 slovesných tříd. Dalším rozdílem, který odlišuje náš popis od tradičních, je naše orientace na slovník, atedy na lemma jakožto základní tvar flektovaných tvarů ivpřípadech, kdy tradiční afilologicky smysluplnější analýza vychází např. zkmene či kořene. Důvod je opět pragmatický— připravit základní slovník lemmat je výrazně jednodušší než připravit slovník kořenů či tvarotvorných kmenů. Zásadou našeho popisu tedy je, že pomocí námi stanovených morfologických pravidel musí být možné zjakéhokoliv lemmatu odvodit všechny flektované formy daného slova. Udeklinačních typů lze zpravidla všechny flektované tvary vytvořit skutečně jen na základě lemmatu akoncovek, uslovesných konjugací je situace složitější abude popsána níže včásti týkající se implementace. Je však nutné zdůraznit, že vjádru náš popis vychází zpopisů tradičních, apokud ktomu není dobrý důvod, snaží se jich držet. Předpokládáme, že idíky tomu bude výsledná morfologická analýza pro uživatele seznámené stradičními popisy dobře srozumitelná aprůhledná. 4. IMPLEMENTACE Jak jsme naznačili včásti popisující teoretický rámec našeho řešení, implementace je rozdělena na tři základní fáze. 4.1 PřÍPRAvA DAT Na základě vyčerpávajícího přehledu lexikografických zdrojů mapujících staroanglický materiál (Tichý, 2007) jsme se rozhodli použít jako zdroj lemmat pro základní 3 Jde tedy vpodstatě opoměr signálu ašumu. Pokud např. tradiční popis rozlišuje struktury na základě formálního rozdílu -on vs. -an, avšak skutečný výskyt těchto forem je vzhledem ktradičně popsaným strukturám statisticky nahodilý, vnašem popisu tento rozdíl zanedbáváme. OPEN ACCESS 44 ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 1 slovník An Anglo-Saxon Dictionary (Bosworth— Toller, 1921, dále jen BT). Jeho hlavní výhodou je šíře pokrytí, neb se jedná odosud jediný slovník alespoň teoreticky pokrývající celou šíři staroanglického lexika. Při přípravě dat bylo navíc možné vyjít zpředchozího digitalizačního projektu (Tichý, 2007), přesto však bylo nutné velektronické verzi slovníku provést celou řadu úprav (značkování morfologických informací, opravy vmakrostruktuře slovníku atp.), než bylo možné exportovat seznam lemmat se základními morfologickými informacemi aidentifikátory umožňujícími odkazovat zpět na původní slovníková hesla. Data základního slovníku jsou dále obohacena informacemi zOld English Grammar (Wright— Wright, 1914), resp. obohacena omorfologické informace jsou lemmata, která se vyskytují vobou zdrojích (viz tabulka 1). Mluvnice manželů Wrightových (dále jen mluvnice) byla využita jednak kvůli své struktuře— všechna příkladová slova jsou obsažena vindexu ve formě lemmat ajasně odkazují na příslušné morfologické informace, jednak proto, že jde opodrobnou, tradiční adosud hojně využívanou gramatiku. Oproti podrobnější amodernější mluvnici Campbelově (1983) je navíc licenčně nezatížená avytěžené informace tak bylo možné využít ive volně přístupné online verzi Anglosaského slovníku (viz bosworthtoller.com). Nakonec byl základní slovník obohacen oručně sestavená morfologická data týkající se příkladových slovesných paradigmat, která generátoru popsanému vdalší fázi umožňují zohledňovat ve flektovaných tvarech iinfixaci (viz tabulka 2). 4.2 GENERáTOR Generátor forem nejprve načítá data základního slovníku aprovádí jejich základní standardizaci. Jedná se ostandardizaci, která buď nemá dopad na samotnou analýzu ani její výsledky (např. sjednocení alografů thorn aedh) nebo dává vzniknout alternativním formám lemmat, která budou hrát vdalším procesu různou úlohu (např. značení délky samohlásek).4 Generátor při načítání dat také automaticky dopočítává některé informace ojednotlivých položkách, které se následně využívají pro generování apřiřazování forem (např. počet slabik, rozlišení délky kmene atp.). Následují dvě etapy, vnichž generátor nejprve přiřazuje položkám základního slovníku vzorová paradigmata5 anásledně na základě paradigmatu akonkrétní položky generuje jednotlivé flektované slovní tvary. Přiřazování paradigmat probíhá dle následujícího algoritmu: 1. Nejprve jsou jakožto textové řetězce porovnány položky základního slovníku slemmaty vzorových paradigmat, přičemž se bere ohled ina doplňkové mor4 Značení délky sice odráží reálný fonologický rozdíl vkvantitě, vpůvodních textech se ale nevyskytuje aje až příspěvkem moderních editorů (např. autorů BT či gramatiky). Generátor ianalyzátor jej tedy zanedbávají, ale alternativní forma lemmatu sdiakritikou převzatou způvodních zdrojů základního slovníku je uchována aje tedy kdispozici uživatelům, kteří si např. přejí analyzovat neautentický moderně editovaný text, případně kteří chtějí využít generovaný materiál kvýuce aupřednostňují tak text sdiakritikou. 5 Vzorová paradigmata jsou odvozena zmluvnice. OPEN ACCESS ONDřEJ TICHý 45 fologické informace (slovní druh, typ slovesa, rod substantiva atp.), aby se předešlo chybnému přiřazení homonym. Bere se také ohled na slovotvornou strukturu lemmat— pokud je na začátku lemmatu nalezena některá zpředpon, které jsou obsaženy vBT, hledá se nejprve shoda spředponou, poté ibez předpony. Vpřípadě dosud nepřiřazených položek se generátor pokusí nalézt shodu alespoň sčástí lemmatu již přiřazených položek, čímž dojde kpřiřazení řady kompozit, která se zpravidla skloňují podobně jako jejich řídící člen. 2. Dosud nepřiřazené položky jsou následně přiřazeny na základě odkazů kvzorovým paradigmatům vmluvnici. Jelikož tím se okruh přiřazených položek zvýší, opakuje se přiřazování dosud nepřiřazených ktěmto již nově přiřazeným položkám pomocí porovnávání textových řetězců dle prvního kroku. tabulka 1.Ukázka dat základního slovníku ID verb ID type class subdiv subc. § W variant paraID prefix PreV V PoV bnd dent end 2 sníðan s 1 0 c 491 0 Inf sn í 0 ð an 2 sníðan s 1 0 c 491 0 PaInSg1 sn á 0 ð 0 2 sníðan s 1 0 c 491 0 PaInPl sn i 0 d on 2 sníðan s 1 0 c 491 0 Pp sn i 0 d en 74 fremman w 1 A b 526 0 Inf fr e mm an 74 fremman w 1 A b 526 0 PsInSg2 fr e m est 74 fremman w 1 A b 526 0 PaInSg1 fr e m ed e 74 fremman w 1 A b 526 0 PaInSg1 fr e m od e 74 fremman w 1 A b 526 1 Inf fr e m an 74 fremman w 1 A b 526 2 Inf fr e m i an tabulka 2.Ukázka struktury slovesných paradigmat (sloves sníðan afremman) OPEN ACCESS 46 ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 1 3. Následuje morfonologická analýza6 dosud nepřiřazených položek ajejich přiřazení paradigmatům na jejím základě. Tímto způsobem lze přiřadit všechna dosud nepřiřazená adjektiva. 4. Zbývající nepřiřazené položky jsou přiřazeny na základě pravděpodobnosti, tedy knejobvyklejším paradigmatům odpovídajícím jejich morfologii. a. Všechna silná slovesa jsou přiřazena ke vzoru helpan, všechna ostatní ktypu déman. b. Všechna maskulina asubstantiva nejistého rodu jsou přiřazena ke vzoru stán, všechna feminina ktypu ár, všechna neutra sdlouhým kmenem ktypu word avšechna neutra skrátkým kmenem ktypu hof. Generování flektovaných forem probíhá postupně po jednotlivých slovních druzích, přičemž se využívá shod ve flexi mezi slovními druhy, takže např. flektovaná slovesná participia jsou nejprve vygenerována se slovesy vzákladním tvaru apoté skloňována sadjektivy. Až na slovesa jde většinou opouhé odstranění případné koncovky lemmatu, změnu na morfematickém švu apřipojení koncovky dle daného paradigmatu. Usloves je navíc využita informace ozměně samohlásky vkořenové slabice (infix), proto je nejprve analyzována struktura lemmatu, nalezena kořenová samohláska anahrazena buď samohláskou odpovídající paradigmatu (ablautové samohlásky), nebo samohláskou přehláskovou, která je odvozena dle přehláskových pravidel ze samohlásky původní. Při generování jsou některé formy vytvářeny ve více alternativách ať už vzhledem kdubletám daným morfologickými či fonologickými pravidly nebo kčastým případům pravopisného, nářečního či diachronního kolísání forem. Kvýsledným formám jsou přiřazeny iinformace zdůvodňující vygenerování alternativní formy, ve výsledku lze tedy např. odlišit formy různých nářečí či písařských tradic. Každá vygenerovaná forma je také obohacena oinformace ovšech příslušných morfologických kategoriích, ovzorovém paradigmatu azákladní morfonologické struktuře, na jejímž základě byla složena. Zájmena aněkteré nepravidelné tvary sloves by bylo natolik neefektivní generovat (jejich počet je malý aformální souvislost se základním tvarem příliš malá), že jsou pro účely nástroje flektovány ručně atakto vloženy do slovníku forem. Analyzátor vužším slova smyslu je již vlastně jen aplikace, která srovnává doklady staroanglického textu vložené uživatelem sformami vyprodukovanými generátorem azobrazující informace otěchto formách, které knim generátor přiřadil. Zásadní komplikaci při přiřazování dokladů však způsobuje již zmíněné kolísání forem. To je zčásti řešeno výše popsaným zavedením alternativních forem při generování, není tak ale vyřešeno zcela, jelikož řada případů kolísání je ve fázi generování obtížně předvídatelná apředevším, pokud by se mělo se všemi možnostmi kolísání počítat již při generování, počet vygenerovaných forem by neúnosně narostl (viz níže). Proto analyzátor pracuje stzv. variačními filtry, které umožňují přiřadit idoklady, které bez nich nedopovídají žádné položce slovníku forem. Tyto filtry jsou 6 Počet slabik, jejich délka atp. OPEN ACCESS ONDřEJ TICHý 47 paradigma sloves paradigma slov. paradigma slov. paradigma slov. paradigma slov. sealfian 2342 hyngrian 23 hycgan 10 spanan 6 pǽcan 3 déman 1758 sníþan 22 hebban 9 þerscan 6 streccan 3 nerian 387 bregdan 21 rǽdan 9 witan 6 unnan 3 bídan 226 dón 20 rísan 9 béatan 5 ágan 2 bindan 200 sléan 20 sécan 9 lácan 5 bréoþan 2 fremman 176 gangan 19 wríþan 9 munan 5 cunnan 2 drencan 123 cuman 18 libban 8 tellan 5 dreccan 2 faran 115 cweþan 18 scéadan 8 þeccan 5 dugan 2 béodan 112 twéogan 18 wegan 8 wesan 5 durran 2 helpan 108 hléapan 15 willan 8 gilpan 4 dwellan 2 metan 95 wyrcan 15 brengan 7 hnígan 4 fricgan 2 weorpan 81 gierwan 14 reccan 7 rǽcan 4 frignan 2 beran 73 hátan 14 séoþan 7 slǽpan 4 gellan 2 weorþan 57 lǽtan 14 stellan 7 smúgan 4 mígan 2 fealdan 55 giefan 13 stígan 7 tǽcan 4 mótan 2 brúcan 53 gieldan 13 stregdan 7 þyncan 4 nugan 2 téon 52 þencan 13 þryccan 7 wǽcan 4 sceþþan 2 blótan 46 búgan 12 béon 6 weccan 4 scippan 2 bláwan 40 niman 12 bycgan 6 blandan 3 stæppan 2 settan 39 swerian 12 féolan 6 cweccan 3 þurfan 2 gán 30 berstan 11 findan 6 cwellan 3 wleccan 2 céosan 28 gitan 11 ícan 6 drǽdan 3 birnan 1 séon 27 habban 11 leccan 6 hlehhan 3 magan 1 lǽcan 26 licgan 11 sellan 6 míþan 3 nágan 1 biddan 23 secgan 11 sícan 6 murnan 3 nyllan 1 fón 23 bannan 10 sígan 6 nytan 3 sculan 1 spornan 1 tabulka 3.Počty sloves přiřazených jednotlivým paradigmatickým vzorům založeny na více zdrojích (předně Baker, 2012, aWright— Wright, 1914) ajde vnich jak ojednoduché nahrazování znaků (např. záměnnost uav), tak okomplikované nahrazování pomocí regulárních výrazů (např. kolísání zadních vokálů před nasálami). Výhodou práce sfiltry až vtéto fáze je ijejich volitelnost zpozice uživatele— ten se např. může rozhodnout, že vzhledem ke stáří anářečí textu chce využít jen některé, nebo žádné. OPEN ACCESS 48 ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 1 ID form_i BT lemma stem form formParts var prob. function wright pEx pID wclass c1 c2 c3 240508 ætswummon 1014 æt-swymman swymman ætswummon 0-æt-sw-u-mm-0-on 0 painpl Null bindan 10 verb s 3 a 240509 ætswumon 1014 æt-swymman swymman ætswummon 0-æt-sw-u-mm-0-on 0 1 painpl null bindan 10 verb s 3 a 240510 ætswumme 1014 æt-swymman swymman ætswumme æt-sw-u-mm-0-e 0 PaInSg2 null bindan 10 verb s 3 a 240511 ætswume 1014 æt-swymman swymman ætswumme æt-sw-u-mm-0-e 0 1 PaInSg2 null bindan 10 verb s 3 a 240512 ætswumme 1014 æt-swymman swymman ætswumme æt-sw-u-mm-0-e 0 PaSuSg null bindan 10 verb s 3 a 240513 ætswume 1014 æt-swymman swymman ætswumme æt-sw-u-mm-0-e 0 1 PaSuSg null bindan 10 verb s 3 a 240514 ætswummen 1014 æt-swymman swymman ætswummen æt-sw-u-mm-0-en 0 PaSuPl null bindan 10 verb s 3 a 240515 ætswumen 1014 æt-swymman swymman ætswummen æt-sw-u-mm-0-en 0 1 PaSuPl null bindan 10 verb s 3 a 240516 ætswamm 1014 æt-swymman swymman ætswamm 0-æt-sw-a-mm-0-0 0 painsg1 null bindan 10 verb s 3 a 240517 ætswam 1014 æt-swymman swymman ætswamm 0-æt-sw-a-mm-0-0 0 1 painsg1 null bindan 10 verb s 3 a 240518 ætswamm 1014 æt-swymman swymman ætswamm æt-sw-a-mm-0-0 0 PaInSg3 null bindan 10 verb s 3 a 240519 ætswam 1014 æt-swymman swymman ætswamm æt-sw-a-mm-0-0 0 1 PaInSg3 null bindan 10 verb s 3 a 240520 ætswummen 1014 æt-swymman swymman ætswummen 0-æt-sw-u-mm-0-en 0 papt null bindan 10 verb s 3 a 240521 ætswumen 1014 æt-swymman swymman ætswummen 0-æt-sw-u-mm-0-en 0 1 papt null bindan 10 verb s 3 a 240522 ætswimman 1014 æt-swymman swymman ætswimman 0-æt-sw-i-mm-0-an 0 if null bindan 10 verb s 3 a 240523 ætswiman 1014 æt-swymman swymman ætswimman 0-æt-sw-i-mm-0-an 0 1 if null bindan 10 verb s 3 a tabulka 4.Ukázka generovaných forem slovesa æt-swymman Výsledná analýza dokladu andswarodon pak vypadá např. takto: ANDSWARODON ● and-swarian (infl. like sealfian) ○ verb, Pl. Ind. Pret. (w, 2, a, and-sw-a-r-0-od-on)7 4.3 výSLEDKY Výsledky nástroje byly testovány na úryvcích deseti staroanglických textů vcelkové délce přibližně 2 500 slov. Jednotlivé úryvky byly vybrány tak, aby bylo zaručeno pokrytí různých nářečí, žánrů, míst aobdobí vzniku (viz tabulka 5). Jak jsme již uvedli včásti popisující teoretický rámec, účelem nástroje je pouze samotná analýza, nikoliv disambiguace výsledků analýzy. Měřítkem úspěšnosti nástroje je pro nás tedy především pokrytí (recall) spíše než přesnost (precision). Pokrytí ukazuje, jaké části slov/dokladů zanalyzovaného textu byly analýzou přiřazeny správné morfologické informace. Neukazuje však, kolik alternativních avšak chybných řešení kjednotlivým dokladům analýza dále přiřadila. Ač přesnost bude zásadní pro případnou disambiguaci, ane přímo pro náš nástroj, čím méně alternativních analýz náš nástroj nabídne při zachování správné analýzy, oto bude následná disambiguace snazší. 7 Jde tedy oindikativ plurálu préterita slabého slovesa 2. třídy podtypu a, vzákladním slovníkovém tvaru and-swarian, časovaného dle vzoru slovesa sealfian. OPEN ACCESS