Nástroj na tvaroslovnou analýzu staré angličtiny
Abstract
40
Full text
ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 1, S. 40–54 Nástroj na tvaroslovnou analýzu staré angličtiny Ondřej Tichý (Praha) MORPHOLOGICAL ANALYSER OF OLD ENGLISH The paper describes the construction and testing of an electronic application for semi-automatic morphological analysis of Old English. It introduces the state of the art in the field of electronic analysis of Old English, provides abrief overview of Old English morphology and discusses the reasoning behind our theoretical framework. An account of the chosen methodology is offered and aspecific description of its implementation is provided: from the acquisition and preparation of the lexical input data, through the programming of the forms generator to the testing of the results by analysing Old English text. The resulting recall of 95% is asuccess; however, the paper also hints at how it may be improved. It also discusses further use and development of the analyser, especially the disambiguation of its results. The paper makes afuture semi-automatic morphological tagging of Old English texts areal possibility. KEYWORDS Old English, historical linguistics, computational linguistics, automatic morphological analysis, morphology, forms generator KLÍČOVÁ SLOVA stará angličtina, historická lingvistika, komputační lingvistika, automatická morfologická analýza, morfologie, generátor tvarů 1. ÚVOD1 Současný diachronní výzkum jazyka se stále častěji jako kzásadnímu zdroji nových poznatků ipro ověření poznatků starších obrací kjazykovým korpusům. Práce skorpusy staršího jazyka má však svá významná specifika aúskalí. Diachronní korpusy jsou zpohledu synchronního výzkumu stále málo rozsáhlé (běžné jsou korpusy do několika milionů pozic/tokenů) apředevším bývají jen velmi spoře označkovány. Usynchronních korpusů (obzvláště moderní angličtiny, ale ičeštiny) dnes běžně očekáváme např. lemmatizaci nebo přímo morfologické asyntaktické značkování. Udiachronních korpusů se sním setkáme zřídka. To však zásadně komplikuje využití korpusů pro analýzu historického jazyka, neboť např. bez lemmatizace je prakticky nemožné provádět kolokační analýzu avětšina frekvenčních analýz (základní metoda korpusové analýzy) je na nelemmatizovaném materiálu mnohem náročnější. 1 Článek je shrnutím nepublikované stejnojmenné disertační práce obhájené vroce 2014 na FF UK. OPEN ACCESS
ONDřEJ TICHý 41 Jednou zhlavních příčin tohoto stavu je, že značkování (alemmatizaci budeme pro tyto účely pokládat za druh morfologického značkování) historického jazyka je výrazně obtížnější než značkování jazyka současného. To souvisí především smožnostmi automatizace značkovacího procesu. Pro moderní angličtinu již existují poměrně spolehlivé nástroje pro morfologické isyntaktické značkování, nakonec lemmatizovat moderní anglický text je např. zpohledu moderní češtiny sjistou nadsázkou téměř banální. Ovšem ipro nesporně komplexnější českou gramatickou morfologii existují kvalitní nástroje automatické analýzy. Problém však nespočívá jen vmorfologické komplexitě, ale především ve standardizaci. Každému, kdo kdy pracoval shistorickým jazykem či snestandardizovanou jazykovou varietou je jasné, že pravopis, formy apravidla zpříruček často přesně neodpovídají jazyku dokladů. Jako jsou jazykové příručky moderních standardních variet (např. spisovné češtiny) abstrakcí nad komplexnější jazykovou realitou (langue/parole), jsou příručky týkající se historických variet jazyka ještě navíc abstrakcí nad komplexitou nářečí, písařských tradic aidiosynkrasií případně diachronních rozdílů vrámci popisovaných období. Motivací kvytvoření nástroje na automatickou tvaroslovnou analýzu staré angličtiny je tedy především usnadnit či vněkterých případech vůbec umožnit korpusový výzkum tohoto období anglického jazyka, přičemž jak zvýše uvedeného vyplývá, tento nástroj si musí umět poradit jak smorfologickou komplexitou staré angličtiny, tak snízkou standardizací jejích dokladů. 2. TEORETICKÝ RÁMEC Při bližším zkoumání dosavadních výsledků na poli automatického zpracování staroanglické morfologie se ukázalo, že se nejedná oproblém zcela nový, byť jde bezesporu oproblém zatím uspokojivě nevyřešený. Část dosavadních pokusů oautomatizaci tvaroslovné analýzy se omezovala jen na část jazykové struktury. Např. Verbix (Lindberg, 1995), The Nerthus Project (Martín Arista, 2004) nebo Morphological Analyzer for Old English Verbs (Adams, 2007) se zaměřily pouze na slovesnou morfologii. Část se zase zabývala pouze úzkým výběrem materiálu určeného kanalýze— např. Morphological Analyser of Old English Texts (Calle Martín et al., 1997–2001). Dva dosud nedokončené projekty pak přímo navazují na naši datovou základnu (resp. stejný zdroj lexikálních dat): jedná se olemmatizaci staroanglické básně Daniel (Kleinman, 2012) alemmatizační projekt korpusu YCOE.2 Společným rysem všech těchto projektů je teoretický rámec, který určuje jako základ nástroje různým způsobem generovaný slovník, se kterým jsou následně porovnávány doklady, tedy samotné formy vyskytující se ve staroanglických textech. Způsob porovnávání anásledné analýzy se však liší. Vnejjednodušším případě (Kleinman) jde opouhé porovnávání řetězců znaků svyužitím tzv. Levenštejnovy vzdálenosti (míra podobnosti textových řetězců), vrafinovanějších nástrojích se položky 2 The York‐Toronto‐Helsinki Parsed Corpus of Old English Prose. Informace oprojektu Ans Van Kemenade aErwina Komena byly získány vroce 2013 soukromou korespondencí. OPEN ACCESS
42 ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 1 slovníku (lemmata) upravují na základě morfologických pravidel apak se teprve porovnávají sdoklady. Podobným způsobem jsme se rozhodli postupovat ivnašem případě, jelikož však jsou výše uvedené nástroje, resp. jejich popis, buď nedostupné, nebo neúplné, rozhodli jsme se vobecných rysech inspirovat implementačně ověřeným řešením morfologické analýzy moderní češtiny (Osolsobě, 1996; Sedláček, 1999; Sedláček— Smrž, 2001). Takto stanovený teoretický rámec předpokládá tři základní fáze řešení: 1. Přípravu dat, která budou tvořit základní slovník nástroje. Základní slovník by měl být co do pokrytí staroanglického lexika pokud možno vyčerpávající, měl by kromě samotného lexika obsahovat izákladní morfologické informace ojednotlivých položkách. 2. Tvorbu generátoru, který zpoložek základního slovníku na základě morfologických pravidel vygeneruje všechny gramatické formy staroanglických slov ake každé formě přiřadí ipříslušné morfologické kategorie, tedy slovník forem. 3. Vytvoření aplikace, která bude srovnávat doklady staroanglického textu spoložkami slovníku forem, tedy samotného analyzátoru vužším slova smyslu. Vpřípadě shody bude doklad označen jak odkazem na příslušnou položku základního slovníku (lemmatizace), tak na morfologické kategorie patřící kshodné položce slovníku forem (morfologická analýza). Kvýsledné lemmatizaci amorfologickému značkování využitelné badateli však bude třeba výsledky automatické analýzy ještě disambiguovat (ať již ručně, nebo zčásti strojově), jelikož nelze předpokládat, že by si nástroj pouze na základě morfologie poradil např. svýběrem zhomonymních tvarů. Proces disambiguace však již není součástí tohoto nástroje na tvaroslovnou analýzu. Jak bylo předesláno vúvodu, konkrétní implementace všech tří fází nutně vychází ze specifik staroanglického tvarosloví amusí zároveň odpovídat skutečnému stavu analyzovaných dokladů. 3. MORFOLOGIE STARÉ ANGLIČTINY Stará angličtina, tedy angličtina přibližně zlet 700–1100, je na rozdíl od angličtiny moderní ztypologického hlediska jazyk ještě převážně flektivní, byť sflexí, oproti některým indoevropským jazykům, jakým je třeba čeština, značně omezenou. Ve staré angličtině se tak setkáme spodobnou deklinací podstatných jmen, přídavných jmen azájmen, jakou známe např. zmoderní němčiny astejně jako vmoderní němčině je ve staré angličtině zvláště rozvinutá slovesná konjugace. Rámec tohoto článku neumožňuje podrobný popis staroanglického tvarosloví, omezíme se jen na několik obecných poznámek vztahujících se konkrétně knašemu nástroji. Základní rozdíl mezi tradičními filologickými popisy staroanglického tvarosloví (např. Wright— Wright, 1914), případně moderními popisy určenými studentům (např. Baker, 2012) apopisem, který je výsledkem analýzy staroanglického tvarosloví OPEN ACCESS
ONDřEJ TICHý 43 za účelem strojového zpracování, je především vúrovni detailu, který je věnován různým jazykovým strukturám. Tradiční popisy staroanglické morfologie sledují kromě popisu samotného idalší cíle, např. důraz na historickou kontinuitu struktur ajevů, aněkdy tak vpopisu rozlišují istruktury, které se již vdaném období formálně neliší (např. paradigmata navazující na paradigmata původně odlišná ve své rekonstruované podobě, ve staroanglickém materiálu však již formálně nerozlišená). Náš popis byl vtomto ohledu naopak veskrze pragmatický, atedy např. nerozlišoval ani takové struktury, jejichž formální odlišnost dle tradičního popisu byla nižší než faktické formální kolísání těchto struktur vtextu, ať již jde okolísání písařské, nářeční nebo diachronní.3 Náš popis je však vněkterých ohledech naopak detailnější, ato jak vzhledem kvýrazně okleštěným popisům moderním určeným studentům, tak často ivzhledem ktradičnímu popisu— musí totiž postihnout všechny struktury, které obvyklé popisy zahrnují pod výjimky, či vzhledem kjejich okrajovosti zanedbávají. Oproti tradičním sedmi silným, třem slabým aněkolika málo préteritoprézentním anepravidelným slovesným paradigmatům zavádí náš popis pro účely strojového zpracování 132 slovesných tříd. Dalším rozdílem, který odlišuje náš popis od tradičních, je naše orientace na slovník, atedy na lemma jakožto základní tvar flektovaných tvarů ivpřípadech, kdy tradiční afilologicky smysluplnější analýza vychází např. zkmene či kořene. Důvod je opět pragmatický— připravit základní slovník lemmat je výrazně jednodušší než připravit slovník kořenů či tvarotvorných kmenů. Zásadou našeho popisu tedy je, že pomocí námi stanovených morfologických pravidel musí být možné zjakéhokoliv lemmatu odvodit všechny flektované formy daného slova. Udeklinačních typů lze zpravidla všechny flektované tvary vytvořit skutečně jen na základě lemmatu akoncovek, uslovesných konjugací je situace složitější abude popsána níže včásti týkající se implementace. Je však nutné zdůraznit, že vjádru náš popis vychází zpopisů tradičních, apokud ktomu není dobrý důvod, snaží se jich držet. Předpokládáme, že idíky tomu bude výsledná morfologická analýza pro uživatele seznámené stradičními popisy dobře srozumitelná aprůhledná. 4. IMPLEMENTACE Jak jsme naznačili včásti popisující teoretický rámec našeho řešení, implementace je rozdělena na tři základní fáze. 4.1 PřÍPRAvA DAT Na základě vyčerpávajícího přehledu lexikografických zdrojů mapujících staroanglický materiál (Tichý, 2007) jsme se rozhodli použít jako zdroj lemmat pro základní 3 Jde tedy vpodstatě opoměr signálu ašumu. Pokud např. tradiční popis rozlišuje struktury na základě formálního rozdílu -on vs. -an, avšak skutečný výskyt těchto forem je vzhledem ktradičně popsaným strukturám statisticky nahodilý, vnašem popisu tento rozdíl zanedbáváme. OPEN ACCESS
44 ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 1 slovník An Anglo-Saxon Dictionary (Bosworth— Toller, 1921, dále jen BT). Jeho hlavní výhodou je šíře pokrytí, neb se jedná odosud jediný slovník alespoň teoreticky pokrývající celou šíři staroanglického lexika. Při přípravě dat bylo navíc možné vyjít zpředchozího digitalizačního projektu (Tichý, 2007), přesto však bylo nutné velektronické verzi slovníku provést celou řadu úprav (značkování morfologických informací, opravy vmakrostruktuře slovníku atp.), než bylo možné exportovat seznam lemmat se základními morfologickými informacemi aidentifikátory umožňujícími odkazovat zpět na původní slovníková hesla. Data základního slovníku jsou dále obohacena informacemi zOld English Grammar (Wright— Wright, 1914), resp. obohacena omorfologické informace jsou lemmata, která se vyskytují vobou zdrojích (viz tabulka 1). Mluvnice manželů Wrightových (dále jen mluvnice) byla využita jednak kvůli své struktuře— všechna příkladová slova jsou obsažena vindexu ve formě lemmat ajasně odkazují na příslušné morfologické informace, jednak proto, že jde opodrobnou, tradiční adosud hojně využívanou gramatiku. Oproti podrobnější amodernější mluvnici Campbelově (1983) je navíc licenčně nezatížená avytěžené informace tak bylo možné využít ive volně přístupné online verzi Anglosaského slovníku (viz bosworthtoller.com). Nakonec byl základní slovník obohacen oručně sestavená morfologická data týkající se příkladových slovesných paradigmat, která generátoru popsanému vdalší fázi umožňují zohledňovat ve flektovaných tvarech iinfixaci (viz tabulka 2). 4.2 GENERáTOR Generátor forem nejprve načítá data základního slovníku aprovádí jejich základní standardizaci. Jedná se ostandardizaci, která buď nemá dopad na samotnou analýzu ani její výsledky (např. sjednocení alografů thorn aedh) nebo dává vzniknout alternativním formám lemmat, která budou hrát vdalším procesu různou úlohu (např. značení délky samohlásek).4 Generátor při načítání dat také automaticky dopočítává některé informace ojednotlivých položkách, které se následně využívají pro generování apřiřazování forem (např. počet slabik, rozlišení délky kmene atp.). Následují dvě etapy, vnichž generátor nejprve přiřazuje položkám základního slovníku vzorová paradigmata5 anásledně na základě paradigmatu akonkrétní položky generuje jednotlivé flektované slovní tvary. Přiřazování paradigmat probíhá dle následujícího algoritmu: 1. Nejprve jsou jakožto textové řetězce porovnány položky základního slovníku slemmaty vzorových paradigmat, přičemž se bere ohled ina doplňkové mor4 Značení délky sice odráží reálný fonologický rozdíl vkvantitě, vpůvodních textech se ale nevyskytuje aje až příspěvkem moderních editorů (např. autorů BT či gramatiky). Generátor ianalyzátor jej tedy zanedbávají, ale alternativní forma lemmatu sdiakritikou převzatou způvodních zdrojů základního slovníku je uchována aje tedy kdispozici uživatelům, kteří si např. přejí analyzovat neautentický moderně editovaný text, případně kteří chtějí využít generovaný materiál kvýuce aupřednostňují tak text sdiakritikou. 5 Vzorová paradigmata jsou odvozena zmluvnice. OPEN ACCESS
ONDřEJ TICHý 45 fologické informace (slovní druh, typ slovesa, rod substantiva atp.), aby se předešlo chybnému přiřazení homonym. Bere se také ohled na slovotvornou strukturu lemmat— pokud je na začátku lemmatu nalezena některá zpředpon, které jsou obsaženy vBT, hledá se nejprve shoda spředponou, poté ibez předpony. Vpřípadě dosud nepřiřazených položek se generátor pokusí nalézt shodu alespoň sčástí lemmatu již přiřazených položek, čímž dojde kpřiřazení řady kompozit, která se zpravidla skloňují podobně jako jejich řídící člen. 2. Dosud nepřiřazené položky jsou následně přiřazeny na základě odkazů kvzorovým paradigmatům vmluvnici. Jelikož tím se okruh přiřazených položek zvýší, opakuje se přiřazování dosud nepřiřazených ktěmto již nově přiřazeným položkám pomocí porovnávání textových řetězců dle prvního kroku. tabulka 1.Ukázka dat základního slovníku ID verb ID type class subdiv subc. § W variant paraID prefix PreV V PoV bnd dent end 2 sníðan s 1 0 c 491 0 Inf sn í 0 ð an 2 sníðan s 1 0 c 491 0 PaInSg1 sn á 0 ð 0 2 sníðan s 1 0 c 491 0 PaInPl sn i 0 d on 2 sníðan s 1 0 c 491 0 Pp sn i 0 d en 74 fremman w 1 A b 526 0 Inf fr e mm an 74 fremman w 1 A b 526 0 PsInSg2 fr e m est 74 fremman w 1 A b 526 0 PaInSg1 fr e m ed e 74 fremman w 1 A b 526 0 PaInSg1 fr e m od e 74 fremman w 1 A b 526 1 Inf fr e m an 74 fremman w 1 A b 526 2 Inf fr e m i an tabulka 2.Ukázka struktury slovesných paradigmat (sloves sníðan afremman) OPEN ACCESS
46 ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 1 3. Následuje morfonologická analýza6 dosud nepřiřazených položek ajejich přiřazení paradigmatům na jejím základě. Tímto způsobem lze přiřadit všechna dosud nepřiřazená adjektiva. 4. Zbývající nepřiřazené položky jsou přiřazeny na základě pravděpodobnosti, tedy knejobvyklejším paradigmatům odpovídajícím jejich morfologii. a. Všechna silná slovesa jsou přiřazena ke vzoru helpan, všechna ostatní ktypu déman. b. Všechna maskulina asubstantiva nejistého rodu jsou přiřazena ke vzoru stán, všechna feminina ktypu ár, všechna neutra sdlouhým kmenem ktypu word avšechna neutra skrátkým kmenem ktypu hof. Generování flektovaných forem probíhá postupně po jednotlivých slovních druzích, přičemž se využívá shod ve flexi mezi slovními druhy, takže např. flektovaná slovesná participia jsou nejprve vygenerována se slovesy vzákladním tvaru apoté skloňována sadjektivy. Až na slovesa jde většinou opouhé odstranění případné koncovky lemmatu, změnu na morfematickém švu apřipojení koncovky dle daného paradigmatu. Usloves je navíc využita informace ozměně samohlásky vkořenové slabice (infix), proto je nejprve analyzována struktura lemmatu, nalezena kořenová samohláska anahrazena buď samohláskou odpovídající paradigmatu (ablautové samohlásky), nebo samohláskou přehláskovou, která je odvozena dle přehláskových pravidel ze samohlásky původní. Při generování jsou některé formy vytvářeny ve více alternativách ať už vzhledem kdubletám daným morfologickými či fonologickými pravidly nebo kčastým případům pravopisného, nářečního či diachronního kolísání forem. Kvýsledným formám jsou přiřazeny iinformace zdůvodňující vygenerování alternativní formy, ve výsledku lze tedy např. odlišit formy různých nářečí či písařských tradic. Každá vygenerovaná forma je také obohacena oinformace ovšech příslušných morfologických kategoriích, ovzorovém paradigmatu azákladní morfonologické struktuře, na jejímž základě byla složena. Zájmena aněkteré nepravidelné tvary sloves by bylo natolik neefektivní generovat (jejich počet je malý aformální souvislost se základním tvarem příliš malá), že jsou pro účely nástroje flektovány ručně atakto vloženy do slovníku forem. Analyzátor vužším slova smyslu je již vlastně jen aplikace, která srovnává doklady staroanglického textu vložené uživatelem sformami vyprodukovanými generátorem azobrazující informace otěchto formách, které knim generátor přiřadil. Zásadní komplikaci při přiřazování dokladů však způsobuje již zmíněné kolísání forem. To je zčásti řešeno výše popsaným zavedením alternativních forem při generování, není tak ale vyřešeno zcela, jelikož řada případů kolísání je ve fázi generování obtížně předvídatelná apředevším, pokud by se mělo se všemi možnostmi kolísání počítat již při generování, počet vygenerovaných forem by neúnosně narostl (viz níže). Proto analyzátor pracuje stzv. variačními filtry, které umožňují přiřadit idoklady, které bez nich nedopovídají žádné položce slovníku forem. Tyto filtry jsou 6 Počet slabik, jejich délka atp. OPEN ACCESS
ONDřEJ TICHý 47 paradigma sloves paradigma slov. paradigma slov. paradigma slov. paradigma slov. sealfian 2342 hyngrian 23 hycgan 10 spanan 6 pǽcan 3 déman 1758 sníþan 22 hebban 9 þerscan 6 streccan 3 nerian 387 bregdan 21 rǽdan 9 witan 6 unnan 3 bídan 226 dón 20 rísan 9 béatan 5 ágan 2 bindan 200 sléan 20 sécan 9 lácan 5 bréoþan 2 fremman 176 gangan 19 wríþan 9 munan 5 cunnan 2 drencan 123 cuman 18 libban 8 tellan 5 dreccan 2 faran 115 cweþan 18 scéadan 8 þeccan 5 dugan 2 béodan 112 twéogan 18 wegan 8 wesan 5 durran 2 helpan 108 hléapan 15 willan 8 gilpan 4 dwellan 2 metan 95 wyrcan 15 brengan 7 hnígan 4 fricgan 2 weorpan 81 gierwan 14 reccan 7 rǽcan 4 frignan 2 beran 73 hátan 14 séoþan 7 slǽpan 4 gellan 2 weorþan 57 lǽtan 14 stellan 7 smúgan 4 mígan 2 fealdan 55 giefan 13 stígan 7 tǽcan 4 mótan 2 brúcan 53 gieldan 13 stregdan 7 þyncan 4 nugan 2 téon 52 þencan 13 þryccan 7 wǽcan 4 sceþþan 2 blótan 46 búgan 12 béon 6 weccan 4 scippan 2 bláwan 40 niman 12 bycgan 6 blandan 3 stæppan 2 settan 39 swerian 12 féolan 6 cweccan 3 þurfan 2 gán 30 berstan 11 findan 6 cwellan 3 wleccan 2 céosan 28 gitan 11 ícan 6 drǽdan 3 birnan 1 séon 27 habban 11 leccan 6 hlehhan 3 magan 1 lǽcan 26 licgan 11 sellan 6 míþan 3 nágan 1 biddan 23 secgan 11 sícan 6 murnan 3 nyllan 1 fón 23 bannan 10 sígan 6 nytan 3 sculan 1 spornan 1 tabulka 3.Počty sloves přiřazených jednotlivým paradigmatickým vzorům založeny na více zdrojích (předně Baker, 2012, aWright— Wright, 1914) ajde vnich jak ojednoduché nahrazování znaků (např. záměnnost uav), tak okomplikované nahrazování pomocí regulárních výrazů (např. kolísání zadních vokálů před nasálami). Výhodou práce sfiltry až vtéto fáze je ijejich volitelnost zpozice uživatele— ten se např. může rozhodnout, že vzhledem ke stáří anářečí textu chce využít jen některé, nebo žádné. OPEN ACCESS
48 ČASOPIS PRO MODERNÍ FILOLOGII 99, 2017, Č. 1 ID form_i BT lemma stem form formParts var prob. function wright pEx pID wclass c1 c2 c3 240508 ætswummon 1014 æt-swymman swymman ætswummon 0-æt-sw-u-mm-0-on 0 painpl Null bindan 10 verb s 3 a 240509 ætswumon 1014 æt-swymman swymman ætswummon 0-æt-sw-u-mm-0-on 0 1 painpl null bindan 10 verb s 3 a 240510 ætswumme 1014 æt-swymman swymman ætswumme æt-sw-u-mm-0-e 0 PaInSg2 null bindan 10 verb s 3 a 240511 ætswume 1014 æt-swymman swymman ætswumme æt-sw-u-mm-0-e 0 1 PaInSg2 null bindan 10 verb s 3 a 240512 ætswumme 1014 æt-swymman swymman ætswumme æt-sw-u-mm-0-e 0 PaSuSg null bindan 10 verb s 3 a 240513 ætswume 1014 æt-swymman swymman ætswumme æt-sw-u-mm-0-e 0 1 PaSuSg null bindan 10 verb s 3 a 240514 ætswummen 1014 æt-swymman swymman ætswummen æt-sw-u-mm-0-en 0 PaSuPl null bindan 10 verb s 3 a 240515 ætswumen 1014 æt-swymman swymman ætswummen æt-sw-u-mm-0-en 0 1 PaSuPl null bindan 10 verb s 3 a 240516 ætswamm 1014 æt-swymman swymman ætswamm 0-æt-sw-a-mm-0-0 0 painsg1 null bindan 10 verb s 3 a 240517 ætswam 1014 æt-swymman swymman ætswamm 0-æt-sw-a-mm-0-0 0 1 painsg1 null bindan 10 verb s 3 a 240518 ætswamm 1014 æt-swymman swymman ætswamm æt-sw-a-mm-0-0 0 PaInSg3 null bindan 10 verb s 3 a 240519 ætswam 1014 æt-swymman swymman ætswamm æt-sw-a-mm-0-0 0 1 PaInSg3 null bindan 10 verb s 3 a 240520 ætswummen 1014 æt-swymman swymman ætswummen 0-æt-sw-u-mm-0-en 0 papt null bindan 10 verb s 3 a 240521 ætswumen 1014 æt-swymman swymman ætswummen 0-æt-sw-u-mm-0-en 0 1 papt null bindan 10 verb s 3 a 240522 ætswimman 1014 æt-swymman swymman ætswimman 0-æt-sw-i-mm-0-an 0 if null bindan 10 verb s 3 a 240523 ætswiman 1014 æt-swymman swymman ætswimman 0-æt-sw-i-mm-0-an 0 1 if null bindan 10 verb s 3 a tabulka 4.Ukázka generovaných forem slovesa æt-swymman Výsledná analýza dokladu andswarodon pak vypadá např. takto: ANDSWARODON ● and-swarian (infl. like sealfian) ○ verb, Pl. Ind. Pret. (w, 2, a, and-sw-a-r-0-od-on)7 4.3 výSLEDKY Výsledky nástroje byly testovány na úryvcích deseti staroanglických textů vcelkové délce přibližně 2 500 slov. Jednotlivé úryvky byly vybrány tak, aby bylo zaručeno pokrytí různých nářečí, žánrů, míst aobdobí vzniku (viz tabulka 5). Jak jsme již uvedli včásti popisující teoretický rámec, účelem nástroje je pouze samotná analýza, nikoliv disambiguace výsledků analýzy. Měřítkem úspěšnosti nástroje je pro nás tedy především pokrytí (recall) spíše než přesnost (precision). Pokrytí ukazuje, jaké části slov/dokladů zanalyzovaného textu byly analýzou přiřazeny správné morfologické informace. Neukazuje však, kolik alternativních avšak chybných řešení kjednotlivým dokladům analýza dále přiřadila. Ač přesnost bude zásadní pro případnou disambiguaci, ane přímo pro náš nástroj, čím méně alternativních analýz náš nástroj nabídne při zachování správné analýzy, oto bude následná disambiguace snazší. 7 Jde tedy oindikativ plurálu préterita slabého slovesa 2. třídy podtypu a, vzákladním slovníkovém tvaru and-swarian, časovaného dle vzoru slovesa sealfian. OPEN ACCESS