Kvantitativní analýza ortografické variability v Korpusu rané anglické korespondence
Abstract
27
Full text
Kvantitativní analýza ortografické variability vKorpusu rané anglické korespondence1 Ondřej Tichý ABSTRACT: Aquantitative analysis of spelling variation in the Corpus of Early English Correspondence (CEEC). The paper explores trends in spelling variation as reflected in Early English correspondence (15th–17th c.) on the material of the Corpus of Early English Correspondence (CEEC). Overall change in spelling variation has so far been commented on only in relatively general terms and never on quantitative grounds. There is, of course, no doubt about the general direction of the change (towards greater standardization, though not in astraightforward manner) and its basic characteristics, such as its slower pace in private documents compared to the spelling of professional publications, but the data to support the assertions as well as precise definitions of spelling variation or regularisation have not yet been, to our knowledge, provided. This paper introduces anovel methodology for the quantification of spelling variation and regularity, which allows amore objective assessment of its change and which also makes use of the metadata provided by the CEEC: such as gender, letter authenticity or relationship/kinship between the author and the recipient. The paper explores interactions of such variables from the diachronic perspective using quantified levels of spelling regularity. The measure introduced for this purpose is based on weighted information (Shannon) entropy, as ameasure of predictability of spellings of individual functionally defined types, and its calculation is partly based on the morphological tagging of the parsed version of the Corpus. KLÍČOVÁ SLOVA / KEY WORDS: korespondence, korpus, entropie, variace, ortografie correspondence, corpus, entropy, variation, spelling ÚVOD Dějiny anglické ortografie jsou popsány především jako dějiny utváření standardů adějiny postupné standardizace. Dosavadní práce se soustředily především na proces utváření: zjakých zdrojů čerpal, kdo byli jeho nositelé, jakým způsobem se rozšiřoval, na jeho systémový popis ana popis změn tohoto systému. Není přitom vzásadě sporu otom, že proces standardizace ortografie vede ke snižování ortografické variability aže vdějinách angličtiny, alespoň od pozdní střední angličtiny, se rozvíjející se standard postupně šíří, akolísavost anglického pravopisu tedy ipostupně klesá. Zřejmě proto, že tento trend je celkem očividný, dočkal se vodborné literatuře zatím spíše obecných komentářů, např.: 1 Tato práce vznikla za podpory projektu Kreativita aadaptabilita jako předpoklad úspěchu Evropy vpropojeném světě, reg. č.: CZ.02.1.01/0.0/0.0/16_019/0000734, financovaného zEvropského fondu pro regionální rozvoj. OPEN ACCESS
28 STUDIE ZAPLIKOVANÉ LINGVISTIKY „as the fifteenth century progressed so auniversal stabilised orthography … was increasingly widely used” (Scragg, 46), „after 1550 we find a… greater stability and regularity of spelling in private documents”, “up to the final fixing of spelling circa 1650” (ibid., 68), případně „the 15th century saw asteady movement towards afixed spelling that very much resembles the spelling of Modern English” (Upward & Davidson, 2011, s.174). Stávající práce si klade za cíl formulovat metodologii pro kvantifikaci ortografické variability atradičně obecně popsaný trend potvrdit, respektive konfrontovat skorpusovými daty na úžeji vymezeném vzorku textů dopisů zlet 1410–1680. Jak jsme uvedli výše, byť trend samotný je zpochybnitelný jen stěží, kvantitativní metodologie umožní přesněji sledovat jeho výkyvy, porovnávat jeho vývoj mezi různými jazykovými varietami (privátní/neprivátní texty, nářečí, žánry) avneposlední řadě pomůže lépe definovat, co se konkrétně ortografickou variabilitou myslí. METODOLOGIE Vymezení variability může být jednoduché: Kvariabilitě dochází vždy, když „[existuje] více forem pro jeden význam, n. více významů pro jednu formu“ (Cvrček, 2017), oortografické variabilitě pak mluvíme, když pro jednu funkci užíváme více než jednu grafickou formu.2 Tuto definici je však třeba dále upřesnit: především které funkce máme na mysli? Za funkční budeme pro účely této práce považovat jen rozlišení vrámci jedné variety, ane rozdíly např.mezi dialekty. Jinými slovy, varietní tvary (ať již odrážející různou výslovnost, nebo různé pravopisné standardy) stejného slova považujeme za funkčně nerozlišené, atedy variantní. Např.(britské) <colour> a(americké) <color> považujeme za kolísání pravopisu, protože vrámci jedné variety nejde ofunkční rozlišení. Nezohledňujeme také ortografické rozlišení vyšších funkčních rovin, např.pragmatické nebo stylové. Takové rozlišení je vangličtině vrámci lexikálně-gramatických jednotek řídké, apokud se vyskytuje, jde především orozlišení pomocí archaických morfologických tvarů (např.kontrast slovesných tvarů 2.os. př. času <sayest> a<say>). Vpřípadě změn funkčních kategorií vprůběhu zkoumaného období, které vedly ke vzniku archaických tvarů (např.zde zmíněné formální ztrátě druhé osoby j. č. upřítomných slovesných tvarů), pak předpokládáme funkční rozlišení na úrovni flektivní gramatické morfologie vcelém sledovaném období. Naopak formy rozlišující funkce sémantické nebo gramatické za funkčně odlišné považujeme.3 2 Psanou formu jazyka považujeme vtomto smyslu za nezávislou na formě mluvené anedefinujeme tak variabilitu ortografie vzávislosti na mluvených formách. Vzhledem kpoužitému materiálu (ohledně spolehlivosti materiálu viz níže) také nerozlišujeme variabilitu grafickou agrafémickou, byť nám jde především otu druhou. 3 Jde nám přitom ale pouze orovinu konkrétních slov, výskytů, např.kolísání forem <dared> a<durst>, nikoliv orovinu systémovou, nezabýváme se tedy obecně např.variaOPEN ACCESS
ONDŘEj TIchÝ 29 Takto vymezenou variabilitu můžeme kvantifikovat, např.velmi jednoduše vydělením počtu distinktních grafických tvarů (dále formy) počtem lexikálně-gramatických jednotek (dále typy4), tedy jako vliteratuře populární „counting of spellings“ (např.Crystal, s.394). Vkorpusové lingvistice ale takový postup těžko obstojí, mimo jiné zcela opomíjí četnost jednotlivých forem (dále tokeny). Jiným způsobem, jak na základě těchto veličin míru variability typů kvantifikovat, je kalkulovat podíl počtu forem na počet jejich výskytů (dále tokeny), takže čím více forem na počet tokenů by se vtextu objevilo, tím vyšší míru variability by text vykazoval. Pokud ale blíže prozkoumáme konkrétní data, zjistíme, že takto jednoduše pojatá kvantifikace často neodpovídá tomu, jak míru variability intuitivně chápeme. Jako příklad uveďme formy slova OTHER aminulého času slovesa SHOULD spolu spočty tokenů těchto forem ve dvou po sobě jdoucích dekádách (viz tabulku 1). Vpřípadě slova OTHER poměr mezi první adruhou dekádou šestnáctého století výrazně klesá z0,093 na 0,067, intuitivně bychom ale variabilitu druhé dekády označili zřejmě za vyšší. Naopak vpřípadě minulých tvarů slovesa SHOULD poměr mezi padesátými ašedesátými lety stejného století výrazně stoupá, intuitivně však formální kolísání spíše klesá. Tento způsob kvantifikace totiž pomíjí rozložení tokenů aforem. Jak ho zohlednit? OTHER 1500–09 1510–19 SHOULD-pret 1550–59 1560–69 nodder 1 — shold 8 7 nother 1 6 sholde 1 4 oder — 3 should 5 1 odyr — 2 shoulde — 1 other 39 57 shuld 10 1 othre 2 6 shulde 5 — celk. tokenů 43 74 29 14 forem/tokenů 0,093 0,067 0,172 0,357 Tabulka 1:Formy atokeny slova OTHER aminulého času slovesa SHOULD. Domníváme se, že intuitivně by míra variability nebo kolísání měla být tím vyšší, čím menší šanci máme, že odhadneme formu výskytu konkrétního typu vtextu— neboli je tím vyšší, sčím nižší pravděpodobností ji budeme schopni určit/odhadnout. Tato definice sice může naznačovat, že podíl forem ajejich tokenů je správnou mírou variability, protože jde ovyjádření pravděpodobnosti, nám však nejde opravděpodobnost výskytu jedné konkrétní formy, ale orozložení pravděpodobností (resp.omíru nejistoty ohledně) forem konkrétních typů vtextu. Míru nejistoty systému je možné vyjádřit tzv.informační nebo také Shannonovou entropií, přičemž entropii jednoho konkrétního typu definujeme jako „kde n je bilitou nesamostatných morfémů typu variantních koncovek préterita <-ed> vs. <-t(e)> apod. 4 Jak zuvedeného vyplývá, zde užívané lexikálně-gramatické jednotky zcela neodpovídají vkorpusové lingvistice běžně užívanému termínu typ, viz seznam užitých typů vpříloze 1. OPEN ACCESS
30 STUDIE ZAPLIKOVANÉ LINGVISTIKY počet forem daného typu, f je frekvence formy (počet tokenů formy) at frekvence typu (počet tokenů všech forem daného typu)“. Ve výše zmíněných příkladech budou hodnoty entropie pro OTHER 0,176 (první dekáda) a0,363 (druhá dekáda), zatímco pro SHOULD 0,627 (padesátá léta) a0,552 (šedesátá léta). Tato čísla ukazují opačný aintuitivnější trend než prostý poměr forem atypů. Pokud chceme použít entropii jako míru variability vtextu, vněmž se vyskytuje více typů, znichž každý vykazuje vlastní míru entropie, nemůžeme entropie jednotlivých typů pouze jednoduše sčítat. Jednotlivé typy jsou vtextu zpravidla zastoupeny různě často, měly by tak kmíře variability přispívat různou měrou (např.entropie 0,58 za 213 tokenů 11 forem spojky IF by neměla mít stejnou váhu vcelkové entropii textu jako entropie 0,93 minulého času slovesa SHALL s5582 tokeny celkem v61 formách). Lze namítat, že počet tokenů je již započítán ventropii daného typu. To je sice pravda, představme si ale text (viz tabulku 2), který je tvořen 100 tokeny pouze dvou typů— jeden znich má pouze jednu formu, atedy nulovou entropii, vyskytuje se však vtextu v98 tokenech, druhý má dvě formy, znichž každá je vtextu reprezentována jedním tokenem, avykazuje tedy entropii zhruba 0,3. Pokud entropie pouze sečteme, bude výsledná entropie textu opět zhruba 0,3. Snížíme-li však vtextu počet tokenů prvního typu na 50 azároveň zvýšíme počet tokenů obou forem druhého typu na 25 za každou, získáme intuitivně podstatně variabilnější text, který by ale po prostém sečtení entropií obou typů vykazoval entropii stále shodnou— zhruba 0,3. Ztohoto důvodu nejprve entropie jednotlivých typů násobíme jejich relativní frekvencí aaž následně sčítáme, tím vuvedeném případě získáme váženou entropii prvního textu zhruba 0,006, zatímco vážená entropie druhého textu bude řádově vyšší, přibližně 0,15. tokenů formy entropie typu tokenů formy entropie typu text 1 text 1 text 2 text 2 typ 1 forma 1.1 98 0 50 0 typ 2 forma 2.1 1 0,3 25 0,3 forma 2.2 1 25 součet entropie 0,3 0,3 vážená entropie 0,006 0,15 Tabulka 2:Rozdílná agregace entropie. Míru variability textu tedy počítáme jako relativní frekvencí vážený součet entropií jednotlivých typů. Ktakto navržené míře se sluší dodat dvě důležité charakteristiky. Zaprvé platí to, že čím vyšší je její index, tím vyšší je měřená variabilita, přičemž hodnota 0 znamená nulovou variabilitu. Zadruhé kvůli vážení dílčích entropií jednotlivých typů jejich relativní frekvencí není výsledná míra vpravém smyslu mírou entropie, ale považujeme ji prostě za míru variability. OPEN ACCESS
ONDŘEj TIchÝ 31 KORPUS AZPRACOVÁNÍ DAT Problém svyhledáváním variantních tvarů dle navržené metodologie vhistorických korpusech spočívá obvykle především vchybějícím značkování. Dostupné historické korpusy angličtiny nejsou lemmatizovány, natož aby měly značkované jednotlivé morfologické kategorie arozlišovaly tak lexikálně-gramatické jednotky definované výše. Jak tedy vkorpusu takové jednotky identifikovat avyhledat zároveň všechny jejich tvary? Ruční vyhledávání, případně značkování celého korpusu nebo jedné dostatečně velké části by vyžadovalo značnou časovou investici, rozhodli jsme se proto pracovat somezeným, ale specifickým vzorkem dat. Řada helsinských historických korpusů (Rissanen et al.) existuje vsyntakticky amorfologicky značkovaných verzích, které sice nejsou lemmatizovány ani nemají komplexně značkovány morfologické kategorie, mají ale značkovány alespoň slovní druhy. Výhodou použitého morfologického značkování této řady korpusů je, že ač jde primárně označkování slovních druhů (POS tagging), některé lexikální jednotky (především jde oslova gramatická nebo oslova zuzavřených slovních druhů, např.OTHER jako zájmeno či spojka) jsou značeny samostatně, avněkterých případech jsou dokonce značkovány jejich vybrané gramatické kategorie (např.pro sloveso DO je značeno zvlášť přítomné participium, pasivní participium, infinitiv, minulé tvary, imperativ, minulé participium aprézentní tvary, pro ostatní jednotky je ale morfologické značkování mnohem méně důkladné). Pragmaticky jsme tedy vybrali vzorek dat omezený na nejdetailněji značkované slovní druhy, resp.lexikální jednotky— konkrétně na slovesa BE, DO, HAVE, modální slovesa, předložku/ spojku FOR, existenciální THERE, spojky WHETHER aIF apříslovce OTHER aSUCH. Všechny výskyty odpovídající těmto značkám jsme ze značkované verze korpusu CEEC (PCEEC) spolu se všemi metadaty vyexportovali pomocí online korpusového manažeru ČNK Kontext. Celkem jsme tímto způsobem získali 238 659 tokenů v930 formách spolu spříslušnými metainformacemi. Ty bylo třeba ručně roztřídit do výše definovaných funkčních typů, resp.je dodatečně roztřídit vpřípadech, kdy značkování samotného korpusu nezachycuje celou morfologickou pestrost angličtiny 15.–17.století. Celkem jsme všechny výskyty roztřídili do 79 typů, např.modální slovesa, značkovaná všechna dohromady jako „MD“, jsme ručně dodatečně roztřídili na 26 typů, konkrétně na přítomné tvary, přítomné tvary 2.a3. os. sg., tvary préterita, tvary 2.os. sg. prét. sloves CAN, DARE, MAY, MUST, NEED, OWE, SHALL aWILL (ne všechny typy byly využity pro všechna slovesa).5 Jak jsme uvedli výše, korpus CEEC sestává zdopisů adíky tomu je také doplněn metadaty, která ke každému textu vkorpusu (dopisu) doplňují řadu sociolingvistických proměnných. Pro následující analýzu jsme se kromě doby sepsání dopisu rozhodli využít také metadat opohlaví autora, autenticitě dopisu (autograf, zapsaný jinou osobou) apříbuzenském vztahu autora apříjemce dopisu. Pro účely našeho výzkumu jsme kategorie metadat zjednodušili způsobem naznačeným vtabulce 3. 5 Přehled všech typů je uveden vpříloze 1. OPEN ACCESS
32 STUDIE ZAPLIKOVANÉ LINGVISTIKY kód původní kategorie naše kategorie A (A/C) autograf autograf (autograph) Bautograf málo známé osoby C (C/A) kopie nebo dopis psaný písařem písařský (secretarial) D (D/A) autenticita neznámá neznámá (unknown) FN nejužší rodina rodina (family) FO širší rodina FS rodinný sloužící TC přátelé ostatní (others) T ostatní Tabulka 3:Zjednodušení kategorií metadat CEEC. Ne všechny kategorie jsou vkorpusu pochopitelně zastoupeny stejnou měrou. Pro naši analýzu je však důležité vzít rozdílné zastoupení metadat naznačené vnásledujících grafech vúvahu. Graf 1:Rozložení tokenů excerpovaných zdopisů psaných ženami (female) amuži (male). Jak je patrné zgrafu 1, zastoupení tokenů zdopisů psaných ženami, zjednodušeně řečeno zastoupení žen, je poměrně nízké, ato především vprvním, ale ivněkolika prostředních obdobích. Izdůvodu takového rozložení jsme se rozhodli data analyzovat nikoliv po obvyklejších dekádách, kde by rozsah dat zvláště vsociolingvisticky úzce definovaných kategoriích byl příliš malý, ani po Helsinským korpusem zavedených obdobích, která by data rozdělovala jen na čtyři neúplná období, ale kompromisně po třicetiletých úsecích, které mohou odpovídat např.generačním cyklům. 1410– 1439 1440– 1469 1470– 1499 1500– 1529 1530– 1559 1560– 1589 1590– 1619 1620– 1649 1650– 1679 MALE 1430 15239 15584 8615 21580 31730 26536 36325 36743 FEMALE 56 5418 1982 827 1022 1735 6326 9726 14980 0 10000 20000 30000 40000 50000 60000 tokeny FEMALE MALE 1410– 1439 1440– 1469 1470– 1499 1500– 1529 1530– 1559 1560– 1589 1590– 1619 1620– 1649 1650– 1679 others 1439 7011 4139 7045 19063 23633 22801 13458 25258 family 47 13646 13427 2397 3539 9832 10061 32593 26465 0 10000 20000 30000 40000 50000 60000 tokeny family others 1410– 1439 1440– 1469 1470– 1499 1500– 1529 1530– 1559 1560– 1589 1590– 1619 1620– 1649 1650– 1679 unknonw 79 600 646 725 592 1091 1306 3418 5881 secretarial 1110 8218 4070 2033 7080 11108 8279 5241 5478 autograph 297 11839 12850 6684 14930 21266 23277 37392 40364 0 10000 20000 30000 40000 50000 60000 tokeny autograph secretarial unknonw OPEN ACCESS
ONDŘEj TIchÝ 33 Jak je patrné zgrafů 2 a3, vprůběhu času se zvyšuje zastoupení autografů na úkor dopisů psaných písaři, zatímco zastoupení rodinných příslušníků mezi adresáty kolísá. Samotný výpočet variability za jednotlivé časové úseky asociolingvistické kategorie byl proveden vjazyce R.Jelikož rozsah zpracovaných dat se mezi časovými úseky výrazně odlišoval (zvlášť sohledem na některé sociolingvistické kategorie ajejich kombinace), přistoupili jsme vzájmu vyšší výpovědní hodnoty našich výsledků ke Graf 2:Rozložení tokenů vdopisech psaných samotnými autory (autograph) nebo písaři (secretarial). Graf 3:Rozložení tokenů vdopisech příbuzným (family) aostatním adresátům (others). 1410– 1439 1440– 1469 1470– 1499 1500– 1529 1530– 1559 1560– 1589 1590– 1619 1620– 1649 1650– 1679 MALE 1430 15239 15584 8615 21580 31730 26536 36325 36743 FEMALE 56 5418 1982 827 1022 1735 6326 9726 14980 0 10000 20000 30000 40000 50000 60000 tokeny FEMALE MALE 1410– 1439 1440– 1469 1470– 1499 1500– 1529 1530– 1559 1560– 1589 1590– 1619 1620– 1649 1650– 1679 others 1439 7011 4139 7045 19063 23633 22801 13458 25258 family 47 13646 13427 2397 3539 9832 10061 32593 26465 0 10000 20000 30000 40000 50000 60000 tokeny family others 1410– 1439 1440– 1469 1470– 1499 1500– 1529 1530– 1559 1560– 1589 1590– 1619 1620– 1649 1650– 1679 unknonw 79 600 646 725 592 1091 1306 3418 5881 secretarial 1110 8218 4070 2033 7080 11108 8279 5241 5478 autograph 297 11839 12850 6684 14930 21266 23277 37392 40364 0 10000 20000 30000 40000 50000 60000 tokeny autograph secretarial unknonw 1410– 1439 1440– 1469 1470– 1499 1500– 1529 1530– 1559 1560– 1589 1590– 1619 1620– 1649 1650– 1679 MALE 1430 15239 15584 8615 21580 31730 26536 36325 36743 FEMALE 56 5418 1982 827 1022 1735 6326 9726 14980 0 10000 20000 30000 40000 50000 60000 tokeny FEMALE MALE 1410– 1439 1440– 1469 1470– 1499 1500– 1529 1530– 1559 1560– 1589 1590– 1619 1620– 1649 1650– 1679 others 1439 7011 4139 7045 19063 23633 22801 13458 25258 family 47 13646 13427 2397 3539 9832 10061 32593 26465 0 10000 20000 30000 40000 50000 60000 tokeny family others 1410– 1439 1440– 1469 1470– 1499 1500– 1529 1530– 1559 1560– 1589 1590– 1619 1620– 1649 1650– 1679 unknonw 79 600 646 725 592 1091 1306 3418 5881 secretarial 1110 8218 4070 2033 7080 11108 8279 5241 5478 autograph 297 11839 12850 6684 14930 21266 23277 37392 40364 0 10000 20000 30000 40000 50000 60000 tokeny autograph secretarial unknonw OPEN ACCESS
34 STUDIE ZAPLIKOVANÉ LINGVISTIKY značení konfidenčních intervalů6 založených na statistické metodě bootstrapping. Tato metoda umožňuje odhadnout přesnost pozorování pomocí opakovaného náhodného vzorkování dat. Konkrétně jsme kvýpočtům konfidenčních intervalů využili balíček boot (funkce boot aboot.ci) parametrizovaný na tisíc náhodných vzorků, metodu basic arozsah intervalu 95 % (viz Canty, 2017; Davison, 1997). Včásti věnované materiálu je třeba zmínit také problematičnost využití některých vkorpusu obsažených dat pro analýzu ortografie. Zcela odhlédnuto od problému autorství, respektive písařského autorství, je nutné vzít vpotaz ispolehlivost moderního přepisu, který nejprve proběhl zrukopisu do edic apoté zedic do korpusu. Autoři korpusu se pokusili zajistit co největší autentičnost textů, připouštějí ale, že vněkterých případech čerpali iznespolehlivých moderních edic (Nevala & Nurmi, sek. 2.3, 2.4). Spolehlivost edic tedy bude při dalším výzkumu ještě třeba dále prověřit. ANALÝZA Prvním krokem analýzy bylo srovnání výše navržené míry variability založené na vážené entropii typů smírou založenou na poměru forem atypů. Jak je patrné zgrafu4, obě míry ukazují klesající trend, respektive navzdory kolísání (vpřípadě entropie) potvrzují vyšší variabilitu na počátku sledovaného období než na jeho konci. Jak již bylo řečeno, opostupném prosazování standardizace pravopisu v15.–17.století nemůže být pochyb. Zajímavý je ale rozdíl vývoje především vprvních obdobích 1410–1469. Vyplývá zněj jednak to, že poměr forem atypů je výrazně závislý na velikosti vzorku— malé vzorky dat budou snadno tíhnout kvysoké variabilitě, což je další důvod, proč tuto míru nepoužívat. Vpřípadě míry založené na vážené entropii je nízká variabilita, respektive její nárůst, vysvětlitelná obtížněji, svou roli bude ale zřejmě hrát kromě malého vzorku dat (viz značný rozsah konfidenčních intervalů anásledující diskuse) isložení vzorku vtomto období (viz grafy 1–3): minimální zastoupení ženských autorů (4 %), převaha dopisů psaných písaři (75 %) aminimální zastoupení dopisů psaných vrámci rodiny (3 %). Jak ale vyplývá zdalší analýzy těchto proměnných, nelze těmito faktory vysvětlit překvapivě nízkou hodnotu vprvním období beze zbytku. Další analýzou bylo srovnání míry variability podle pohlaví autorů zachycené grafem 5. Zněj vyplývá, že zhruba vprvní polovině celého sledovaného období (tedy do roku 1530) kolísá pravopis žen méně než pravopis mužů, ve druhé polovině je srovnatelný. Vprvní polovině je ale zároveň zcela minimální zastoupení dopisů psaných přímo autorkami, neboť prakticky všechny dopisy žen jsou zapsány písaři (pravděpodobně tedy muži); viz ktomuto igraf 6 anásledná diskuse. Následně jsme srovnali variabilitu vzávislosti na tom, kdo dopis skutečně zapsal (graf 6). Podle očekávání kolísal— kromě prvních dvou období— pravopis samotných autorů dopisů více než pravopis písařů. 6 Jedná se oodhady přesnosti výsledků, které jsou statisticky odvozené zdat pozorování. Vgrafech níže jsou značeny vertikálními úsečkami nad apod datovými body. OPEN ACCESS
ONDŘEj TIchÝ 35 Jako třetí proměnnou jsme srovnali variabilitu vdopisech členům rodiny aostatním (graf 7). Až na první období, kde šíře konfi denčních intervalů naznačuje minimální vzorek dat, ana jeden výkyv vletech 1500–1529 byl pravopis vdopisech psaných rodinným příslušníkům stejný nebo uvolněnější než vdopisech ostatním adresátům. Vposledních dvou částech analýzy jsme srovnávali souhru dvou proměnných. Graf 8 ilustruje zároveň vliv pohlaví avliv autenticity na vývoj variability. Ukazuje, že rozdělení na malé kategorie přináší riziko malých vzorků dat. Nejenže zvlášť vraných obdobích jsou konfi denční intervaly velmi široké, ale vprvním období jsou také všechny kategorie autorek na nulové hodnotě, což se zdá odporovat grafu 5, kde je sice variabilita ortografi e autorek vprvním období nízká, ale nenulová. Tímto proGraf 4:Variabilita ortografi e vyjádřená váženou entropií (total) apoměrem forem atypů (rel_total). Graf 5:Variabilita ortografi e dle pohlaví autorů. 0,4 total rel_total variabilita čas 0,3 0,2 0,1 0,0 1410–1439 1440–1469 1470–1499 1500–1529 1530–1559 1560–1589 1590–1619 1620–1649 1650–1679 f total m autograph unknown secretarial čas 0,4 variabilita 0,3 0,2 0,1 0,4 variabilita 0,3 0,2 0,1 1410–1439 1440–1469 1470–1499 1500–1529 1530–1559 1560–1589 1590–1619 1620–1649 1650–1679 čas 1410–1439 1440–1469 1470–1499 1500–1529 1530–1559 1560–1589 1590–1619 1620–1649 1650–1679 family others 0,4 variabilita 0,3 0,2 0,1 čas 1410–1439 1440–1469 1470–1499 1500–1529 1530–1559 1560–1589 1590–1619 1620–1649 1650–1679 OPEN ACCESS