Morfologická produktivita v diachronní perspektivě: příklad sufixů -mento/-zione ve staré italštině od 13. do 16. století
Abstract
13
Full text
Morfologická produktivita vdiachronní perspektivě: příklad sufixů -mento/-zione ve staré italštině od 13.do 16.století Pavel Štichauer ABSTRACT: Morphological productivity in the diachronic perspective: the case of suffixes -mento/-zione in Old Italian from the 13th to the 16th century. This paper deals with morphological productivity in diachrony, in particular it addresses the issue of the quantitative evaluation of productivity within agiven time span. Adopting Baayen’s (1992; 2001; 2008) corpus-based quantitative approach which considers productivity as the probability of encountering anew type when sampling alarge corpus, the paper shows the evolution of two competing suffixes -mento/-zione in Old Italian from the 13th to the 16th Centuries. On the basis of four separate corpora drawn from LIZ 4.0 (Letteratura Italiana Zanichelli), it is demonstrated how the productivity of the suffix -mento, within the time span of four centuries, remains constant, while the suffix -zione displays diachronic variability. Apart from diachronic considerations regarding this situation, the paper also highlights some technical aspects, such as the use of LNRE models (implemented in the package zipfR, atool for lexical statistics in R, cf. Baroni— Evert, 2006; Evert— Baroni, 2007; Baayen, 2008), as well as some well-known limitations and constraints inherent in quantitative analyses of diachronic corpora. KLÍČOVÁ SLOVA / KEY WORDS: diachronní korpusy, lexikální statistika, produktivita, sufixy -mento/-zione, stará italština 13.– 16.století, program zipfR diachronic corpora, lexical statistics, productivity, suffixes -mento/-zione, Old Italian 13th–16th Cent., package zipfR 1. ÚVOD Cílem tohoto článku1 je ukázat možnosti ameze diachronní aplikace kvantitativního pojetí morfologické produktivity, které vychází zejména zprací R.Haralda Baayena (1992, 2001, 2008, 2009). Jak bude patrné zdalšího výkladu, Baayen pojímá produktivitu vkvantitativním slova smyslu jako míru pravděpodobnosti, sníž budeme vdostatečně velkém korpusu nacházet nová slova, která bychom mohli považovat za neologismy, svědčící právě oproduktivním slovotvorném prostředku. Určení takové pravděpodobnosti azejména její srovnání napříč různými korpusy— obsahujícími texty pocházející zrůzných časových intervalů— je bezpochyby zajímavý úkol. 1 Tento článek vznikl za podpory projektu Univerzity Karlovy Progres 4, Q10, Jazyk vproměnách času, místa, kultury. Rád bych vyjádřil svůj dík Ondřeji Tichému za pročtení první verze textu. Děkuji rovněž dvěma anonymním recenzentům za mnoho zásadních připomínek, které jsem se ve finální verzi pokusil co nejvíce zohlednit. OPEN ACCESS
14 STUDIE ZAPLIKOVANÉ LINGVISTIKY Vtomto textu se pokusím takové srovnání nabídnout pro dvojici italských deverbálních sufixů -mento/-zione, ato napříč čtyřmi (sub)korpusy pokrývajícími čtyři tradičně definovaná století (13., 14., 15.a16.století). Volbu sufixů ičasového intervalu se teď pokusím stručně zdůvodnit. Sufixy -mento/-zione patří vsoučasné italštině mezi základní přípony, jimiž se derivují nomina actionis (např.rimodernare— rimodernamento „modernizovat— modernizace“, banalizzare— banalizzazione „banalizovat— banalizace“), avněkterých případech představují konkurenční prostředky bez zjevného významového rozdílu (např.congelazione— congelamento „zmražení, zamražení“). Oba sufixy patří rovněž mezi určité diachronní konstanty, lišící se právě jen proměnlivou produktivitou mezi starou asoučasnou italštinou; zároveň nejsou přímo závislé na určitém žánru, na rozdíl např.od sufixu -anza, který lze vhojném množství nalézt vbásnickém jazyce 13.století (srov.Coletti, 1993, s.7; Castellani, 2000, s.503). Hovoříme-li o„staré italštině“, je potřeba upozornit na určitou pojmovou neustálenost: lze takto označovat pouze florentštinu velkých trecentistů (Dante, Boccaccio, Petrarca), popř. šířeji koncipovanou literární „toskánštinu“, již počátkem 16.století kodifikoval Pietro Bembo jako ideální literární jazyk ajejíž textový kánon poměrně přesně vymezil. Vzhledem kchronologickému intervalu, který nás zde bude zajímat, budu pochopitelně pojímat starou italštinu jako literární jazyk, který kromě zmíněných velikánů italské literatury bude obsahovat rovněž další texty 13.století (jako je např.Novellino) ataké texty, které nepatří jen do umělecké prózy či poezie, ale také do odborných žánrů (historické spisy, filosofické traktáty apod.). Tam, kde to bude pro otázky produktivity zásadní, upozorním na možné dopady, které zařazení či naopak vyřazení některých textů mohou provázet. 2. DEFINICE PRODUKTIVITY Pojem produktivita patří bezesporu ktomu, co lze sG.Dalovou (2003, s.3) nazvat „společnou terminologickou výbavou“ každého lingvisty. Aby však bylo zřejmé, vjakém smyslu zde budu tohoto pojmu používat, lze vyjít zdefinice, sníž přišla D.Corbinová (1987, s.177): „... produktivita ve skutečnosti označuje zároveň pravidelnost výsledných formací, dostupnost daného afixu, tzn.možnost tvoření nedoložených slov amožnost vyplňovat mezery doloženého lexika, avýnosnost, tj.aplikovatelnost na velký počet bází a/nebo produkce velkého počtu doložených formací.“2 Pojmy dostupnosti avýnosnosti, vanglické terminologii availability aprofitability, které pro francouzské disponibilité arentabilité navrhl Carstairs-McCarthy (1992, s.37) apře2 „… la productivité désigne en fait à la fois la régularité des produits de la règle, la disponibilité de l’affixe, c’est-à-dire précisément la possibilité de construire des dérivés non attestés, de combler les lacunes du lexique attesté, et la rentabilité, c’est-à-dire la possibilité de s’appliquer à un grand nombre de bases et/ou de produire un grand nombre de dérivés attestés.“ OPEN ACCESS
PAVEL ŠTIchAUEr 15 vzal pak Bauer (2001, s.205–209; 2008, s.322), užitečně zachycují dva klíčové aspekty běžně chápané produktivity, totiž aspekt ryze kvalitativní, kdy hovoříme ostrukturní přítomnosti či nepřítomnosti určitého slovotvorného prostředku, aaspekt kvantitativní, kdy již dostupný prostředek zkoumáme zhlediska počtu výsledných formací, které díky němu vznikají. Oba tyto aspekty jsou samozřejmě do určité míry neoddělitelné, neboť „výnosný“ prostředek bude nutně „dostupný“, různá míra výnosnosti pak může signalizovat některá podstatná omezení, kterými je takto dostupný prostředek vázán. Kvalitativní studium produktivity je tedy především výzkumem celé řady restrikcí (fonologických, morfologických, syntaktických či sémantických), zatímco cílem kvantitativního výzkumu bude stanovit počet výsledných formací, popř. právě stanovit míru pravděpodobnosti, sníž ke vzniku nových slov bude docházet. 3. KVANTITATIVNÍ POJETÍ PRODUKTIVITY: DICTIONARY-BASED ACORPUS-BASED Ponecháme-li kvalitativní výzkum stranou, neboť není předmětem tohoto článku, lze odlišit dva základní postupy kvantitativně pojaté analýzy: na straně jedné tzv.dictionary-based, na straně druhé corpus-based. Ve slovníkově založeném výzkumu jsme omezeni na výzkum jediné veličiny, totiž na počet lemmat (či typů).3 Přesto lze ivtomto případě diachronní aspekt produktivity zachytit, máme-li kdispozici dataci prvního doložení daného slova.4 Tento přístup tedy měří type frequency, tj.počet lemmat. Naproti tomu korpusově založený výzkum pracuje nejen stype frequency (V), ale také spočtem výskytů/tokenů (N), ato vzhledem kvelikosti korpusu (F). Právě vztah mezi (V) a(N) stojí vzákladu Baayenova pojetí. 4. BAAYENOVA KONCEPCE: PRODUKTIVITA JAKO PRAVDĚPODOBNOST Baayenovo pojetí je vzásadě velmi prosté. Vztah mezi token frequency (N) atype frequency (V) může být nahlédnut jako funkce V(N): počet Vje funkcí N, tj.se vzrůstající hodnotou N poroste ihodnota V; N je dáno velikostí korpusu.5 Tento vztah lze zachytit pomocí „křivky nárůstu slovníku“ (vocabulary growth curve). Jako příklad můžeme použít již zpracovanou sadu dat, italská slovesa siterativním prefixem ri-, na které Baroni & Evert (2006) ukazují možnosti lexikální sta3 Mezi termíny lemma/type zde nebudu činit žádný rozdíl abudu pracovat sběžnou distinkcí type/token (srov.např.Baroni, 2009), popř. lemma/výskyt. 4 Např.Plag (1999) používá OED kvýzkumu sloves tvořených sufixy -ize a-ify, omezuje se přitom na 20.stol. Bauer (2001) ukazuje diachronní aspekt substantiv derivovaných pomocí přípon -ation a-ment, ato ve větším časovém úseku (od 16.do 20.stol.). Oba lingvisté zároveň dobře popisují výhody inevýhody slovníkově založeného výzkumu (srov.zejména Plag, 1999, s.96–100; též Bauer, 2001, s.156–161). 5 Později pak bude nutné odlišit (N) jako počet tokenů omezený na daný vzorek relevantních slov ajiž zavedený (F), tj.velikost korpusu. OPEN ACCESS
16 STUDIE ZAPLIKOVANÉ LINGVISTIKY tistiky vprogramu R (aza použití balíčku zipfR, který sami vytvořili).6 Zpracovaný frekvenční seznam těchto prefigovaných sloves pochází zkorpusu La Repubblica (F = 330 mil. tokenů) aobsahuje 1098 lemmat scelkovou frekvencí 1 399 898 tokenů (tj.celková frekvence všech těchto sloves sprefixem ri-). Postupnou excerpci, při níž si pro stanovený interval (např.každých 200 tis. tokenů) zapíšeme hodnoty (V) a(V1), tj.počet všech lemmat apočet všech lemmat, která se vkorpusu vyskytla zatím jen jednou (hapax legomena), zachycuje tabulka č.1, empirickou7 křivku nárůstu slovníku pak obrázek č.1 N V V1 200 000 583 176 400 000 707 213 600 000 810 259 800 000 881 274 1 000 000 969 306 1 200 000 1029 314 Tabulka 1:Počet lemmat (V) ahapax legomena (V1) sloves sprefixem rina základě dat zkorpusu La Repubblica (Baroni & Evert, 2006). Obrázek 1:Empirická křivka nárůstu italských sloves sprefixem rina základě dat zkorpusu La Repubblica (Baroni & Evert, 2006). Baayen zároveň definuje itempo, jakým slovník narůstá (vocabulary growth rate). Rychlost nárůstu lze určit ze sklonu křivky vdaném bodě, který se vyjádří poměrem 6 Viz níže, kde je zipfR blíže představen. Všechny grafy jsou vytvořeny vprogramu R ( https:// www.r-project.org/), R Core Team (2017), sinstalovaným balíčkem zipfR. 7 Jak uvidíme později, empirická křivka (na rozdíl od interpolované/extrapolované) zachycuje reálně naměřené hodnoty. OPEN ACCESS
PAVEL ŠTIchAUEr 17 všech hapax legomena, tj.lemmat, která se objevují vkorpusu jen jednou, acelkovým počtem jejich výskytů, tedy P = V1 / N (viz tabulka č.2). slovotvorný prostředek počet lemmat (V) výskyty (N) počet hapax legomena (V1) P (V1/N) ri + sloveso 1098 1 399 898 346 0,00024 Tabulka 2:Hodnoty V, V1, N amíry pravděpodobnosti P(V1/N) sloves sprefixem rizkorpusu La Repubblica (Baroni & Evert, 2006). Hodnota P zde vyjadřuje pravděpodobnost nalezení nového lemmatu uvnitř korpusu; počet typů, které se vyskytují jen jednou, je vydělen celkovým počtem všech ostatních výskytů sledovaných typů sprefixem ri-: „The growth rate is aprobability, the probability that, after having read N tokens, the next token sampled represents an unseen type, aword type that did not occur among the preceding N tokens.“ (Baayen, 2008, s.223). Baayen tedy navrhuje vidět produktivitu— ve smyslu oné výnosnosti— jako pravděpodobnost, že narazíme na nové slovo, když budeme postupně procházet daný korpus (popř. to lze interpretovat jako nějakou časovou dimenzi). Srovnání hodnot P pro určité slovotvorné procesy ssebou nese také určité obtíže, zejména nutnost disponovat srovnatelnými korpusy a zajistit vzorky ostejných velikostech N (viz ktomu Gaeta & Ricca, 2002, 2003, 2006; Štichauer 2009b, s.34–51, 2009c). Tyto obtíže lze do určité míry překonat použitím teoretických modelů, které vzápětí uvedu. Dříve než se dostanu kdiachronním aplikacím, je třeba poukázat na celou řadu studií, které tuto metodu aplikují na synchronní data, např.Baayen & Renouf, 1996; Gaeta & Ricca, 2002, 2003, 2006; Baroni, 2007; Dal, 2003; Dal et al., 2007. 5. DIACHRONNÍ APLIKACE Diachronní aplikace tohoto postupu, ačkoli ji komplikují určité problémy, okterých budu vzávěru hovořit, spočívá vporovnání hodnot P (nebo vprostém vizuálním porovnání růstových křivek) vdaných časových intervalech t1, t2, ... tn (srov.např.Dalton-Puffer & Cowie, 2002; Lüdeling & Evert, 2005; Scherer, 2007; Säily & Suomela, 2009; Štichauer, 2009a, b; 2015a, b; Rácz, Papp & Hay, 2016, Sect. 6). Klíčovou otázku, jak jednotlivé časové úseky stanovit či vybrat, zde musím jen stručně nastínit. Na jedné straně je možné převzít tradiční periodizaci (např.na století) adále ji členit podle určitých kritérií (např.interval jedné generace, půlstoletí apod.); na straně druhé je možné (ametodologicky zajímavější) periodizaci „nechat vyčíst“ přímo zdat na základě kvantitativně signifikantních rozdílů; vtakovém případě získáme periodizaci, vníž jsou patrné body zlomu, tj.etapy, ve kterých došlo kvýrazné kvalitativní změně. Takové etapy pak mohou být časově velmi různorodé (od několika století po desetiletí) (srov.ktomu zejména Gries & Hilpert, 2008, 2012; Hilpert & Gries, 2009). Vnásledující aplikaci se však přidržím tradiční periodizace do století, která odpovídá běžně vymezeným obdobím italského jazyka ajako celek (od 13.do 16.století) OPEN ACCESS
18 STUDIE ZAPLIKOVANÉ LINGVISTIKY pak vytváří určitou homogenní periodu, kterou Tesi (2001, s.5–9) charakterizuje jako období psané italštiny simplicitní normou založenou na kanonických textech (více kvolbě této periodizace srov.Štichauer 2009b, s.70–71). 5.1. chArAKTErISTIKA KOrPUSŮ Data, snimiž budu pracovat, pocházejí zCD-ROMu textů italské literatury LIZ 4.0 (2001). Jde okolekci textů, jež sice nesplňuje charakteristiky vyváženého diachronního korpusu, ale která může dobře posloužit kvytvoření takových korpusů. LIZ 4.0 obsahuje 1000 textů italské literatury od 13.do počátku 20.století azahrnuje téměř všechna zásadní díla nejen literárního jazyka, ale icelou řadu významných regionálních tradic. CD-ROM ovšem umožňuje selekce textů podle různých kritérií, např.období, žánru, autora apod. Periodizace je již pevně nastavena, takže je možné vytvářet subkorpusy pouze vřádech století (Duecento, Trecento...), popř. vytvářet subkorpusy na základě selekce jednotlivých textů/autorů. Pro účely tohoto výzkumu jsem takto vytvořil čtyři subkorpusy odpovídající zmíněným čtyřem stoletím. Po eliminaci textů, které rozhodně do kánonu „staré italštiny“ zařadit nelze,8 vykazují subkorpusy charakteristiky shrnuté vtabulce č.3. Období / subkorpus Velikost v tokenech Počet textů 13. století 732114 40 14. století 3565818 55 15. století 2675016 46 16. století 10604452 231 Tabulka 3:Základní parametry subkorpusů 13.–16.století vytvořených zLIZ 4.0. Jak je patrné, jde osubkorpusy, které jsou nesrovnatelné nejen kvantitativně, ale rovněž kvalitativně, neboť každé období obsahuje různé procento zastoupených žánrů; někde je tato situace nutně dána skladbou dochovaných textů (např.pro 13.století), někde je naopak dána tím, které texty LIZ 4.0 obsahuje (např.pro 16.století by bylo možné nejen některé texty eliminovat, ale naopak iněkteré přidat, ne všechny jsou vLIZ 4.0 zastoupeny) (kproblematické povaze historických korpusů srov.např.Claridge, 2008). Přesto je tento vzorek se všemi omezeními, která zněho plynou, určitým východiskem pro alespoň hrubé odhady vývoje produktivity, okteré nám půjde. 5.2. frEKVENČNÍ SEZNAmY AjEjIch ZPrAcOVÁNÍ Pro každé století (=subkorpus) je východiskem frekvenční seznam všech lemmat zakončených na sufix -mento a-zione. Abych získal co nejúplnější seznam— byť po8 Pro 13.století je to např.Bonvesin de la Riva, jehož texty jsou psány ve staré milánštině (popř. vtom, co bude později označováno jako lombardská koiné); pro 15.století je to např.extravagantní text Hypnerotomachia Poliphili Francesca Colonny (viz níže). OPEN ACCESS
PAVEL ŠTIchAUEr 19 chopitelně velmi hrubý, obsahující mnoho „extrakčního šumu“—, pracoval jsem vprvní fázi sprostým regulárním výrazem .*ment/o/i, respektive .*zion/e/i, který se ihned kvůli ortografickému rozptylu ukázal jako nedostatečný; grafické varianty se týkají zejména sufixu -zione, který vdoložených textech vzávislosti na kritické edici může vystupovat vpodobě -sione, -tione, -ttzione atd., proto jsem postupně dotaz rozšiřoval. Ve druhé fázi jsem přistoupil ke zcela manuální lemmatizaci; tato fáze představovala náročný krok, neboť shrnutí některých variant pod jedno lemma nebylo vždy jednoznačné. Např.udvojice acendimento— accendimento („rozsvícení“) je zcela zřejmé, že jde ojedno lemma lišící se pouze ortograficky, ale udvojice adimandamento— domandamento („otázka, dotaz, dotazování“) už zdaleka tak jasno není. Základním kritériem— zejména proto, že jde ostudium produktivity, tedy oanalýzu vztahu mezi bázovým slovesem ajeho derivátem— byla právě vazba na sloveso. Vtomto případě máme tedy dvě lemmata, neboť vtextech je doložena dvojice adimandare— adimanda mento, stejně tak jako domandare— domandamento („ptát se“— „otázka“). Ve třetí fázi bylo nutné ztakto lemmatizovaných seznamů odstranit všechna slova, která nelze označit za deriváty sdanými sufixy. Gaeta aRicca (2002, 2003, 2006) navrhli— pro synchronní účely— sérii pěti kritérií, která lze (surčitými modifikacemi) aplikovat ina diachronní data, jak lze na základě následujících příkladů dobře vidět. 1) Silná „neprůhlednost“, slabý derivační vztah kbázovému slovesu— např.impressione / imprimere („dojem“ vs. „vtisknout“).9 2) Tzv.baseless formations, formace bez jakékoli verbální báze, většinou zřejmé latinismy— např.accezione (vs. accettazione od accettare „přijmout“), zlat. acceptio. 3) Nominální báze— např.vasellamento („nádobí“), obvykle jde oformace skolektivním významem. 4) Tzv.inner derivational cycles, tj.případy, kdy sufix -mento/-zione není tím posledním připojeným; derivát je bází kdalší derivaci, jako např.indeterminazione— *indeterminare (ale determinazione— indeterminazione). 5) Výpůjčky— např.entergezione (lat. interiectio), saramento (fr. serment). Je samozřejmě možné uvažovat ourčité redukci těchto skupin, např.formace bez jakékoli slovesné báze by mohly figurovat ve skupině č.5 jako výpůjčky, ale pro praktické účely— mj.proto, aby byla povaha každé formace správně adetailně posouzena— je daleko výhodnější pracovat stouto sérií mírně se překrývajících kritérií (např.proto, že tak lze odlišit reálné výpůjčky vdaném diachronním okamžiku, jako např.saramento zfr. serment, od nespočtu formací, které přecházejí přímo zlatiny bez 9 Zde je dobře vidět, že manuální lemmatizace je nutná, neboť jen na základě kontextu lze odlišit, kdy je impressione již lexikalizovaným substantivem ve významu „dojem“ akdy je naopak přímočarým derivátem, který zachovává význam bázového slovesa, tj.imprimere— impressione „tisknout— tištění“. OPEN ACCESS
20 STUDIE ZAPLIKOVANÉ LINGVISTIKY svého bázového slovesa akteré by jako „výpůjčky“ pak představovaly dobrou třetinu či polovinu všech formací se sufixem -zione).10 Zvýsledných frekvenčních seznamů pak extrahujeme pouze seznam frekvencí, který pak vprostém formátu txt (kde je na prvním řádku f apak již konkrétní frekvence) zpracuje zipfR vprogramu R.11 5.3. PŘEhLED ZPrAcOVANÝch DAT Výše uvedené „pročišťovací“ kroky nám pak nabízejí následující definitivní data pro jednotlivé subkorpusy, jak je shrnuje tabulka č.4. Období / subkorpus Sufix V V1N 13. století -mento 280 137 2093 -zione 143 47 1653 14. století -mento 455 206 6475 -zione 398 119 7717 15. století -mento 351 172 3457 -zione 548 177 6679 16. století -mento 583 281 14026 -zione 722 194 32031 Tabulka 4:Počty lemmat (V), hapax legomena (V1), tokenů (N) pro sufixy –mento/-zione od 13.po 16.století. Jak je patrné ztéto tabulky, jednotlivé soubory jsou do veliké míry nesrovnatelné. Mezi 13.stoletím, tj.nejmenším subkorpusem, a16.stoletím je velký rozptyl. Přesto lze alespoň částečně vysledovat určité tendence. 13.a14.století je charakteristické tím, že stále dominuje sufix -mento; formace se sufixem -zione však představují slova, jejichž token frequency postupně rychle narůstá, zatímco zhlediska počtu typů nedosahují úrovně konkurenčního sufixu -mento. Situace se začíná proměňovat od 15.století, tj.svýrazným vlivem humanistické latiny, avrcholí pak v16.století. Přesto nelze jednoznačně říci, jak vzápětí uvidíme, že by od 16.století začal sufix -zione nabývat na produktivitě. Jak je ztabulky patrné, počty hapax legomena jsou daleko nižší, narůstá naopak token frequency (adosahuje dvojnásobku N konkurenčního -mento). Abychom 10 Slova se sufixem -zione jsou vtomto ohledu velmi problematická. Situace do 16.století se výrazně odlišuje od následného vývoje, kdy tento sufix nabývá nezpochybnitelnou autonomii, zatímco ještě do 16.století bychom mohli vzásadě hovořit omasivním procesu slovotvorné výpůjčky (srov.Štichauer 2015a, 2015b). 11 Do příkazového řádku vR pak píšeme název.tfl <- read.tfl(„název.txt“); po zadání summary (název.tfl) získáme zipfR object for frequency spectrum, snímž pak pracujeme při tvorbě teoretických modelů (viz níže). Na oficiálních stránkách programu zipfR (http://zipfr.r- -forge.r-project.org/) je kdispozici ke stažení nejen celý balíček, ale irůzné pomocné skripty, jakož iukázkové datové sady. OPEN ACCESS
PAVEL ŠTIchAUEr 21 mohli všechny čtyři vzorky porovnat, nezbývá než vytvořit teoretické modely se srovnatelnými parametry, tj.zejména sidentickým počtem N. 6. TEORETICKÉ MODELY AJEJICH INTERPRETACE Takové srovnatelné modely lze vytvořit na základě rozdělení frekvencí slov známého jako LNRE (Large Numbers of Rare Events) (srov.Baayen 2001; 2008, s.222–236, kap.6.5. Models for lexical richness). Balíček zipfR obsahuje tři dosud dostupné modely, GIGP (Generalized Inverse Gauss-Poisson; srov.Baayen, 2001, s.89–93), ZM afZM (Zipf-Mandelbrot / finite Zipf-Mandelbrot; srov.Evert, 2004).12 Aby mohl program zipfR tyto modely vytvořit, vychází zfrekvenčního spektra, jež získá na základě již zmíněného frekvenčního seznamu. Frekvenční spektrum (srov.Baroni, 2009) zobrazuje počty typů Vsdanou frekvencí V(m) od m = 1 (hapax legomena), m = 2, m = 3 až po m = nejvyšší frekvence doloženého typu. Toto spektrum pak slouží jako vstupní data pro zmíněné tři modely, které produkují teoretické hodnoty (expected values) E(V), E(V1) pro jakoukoli hodnotu N.Buď lze pracovat sempirickou hodnotou N daného vzorku (tedy např.pro 13.století usufixu -mento sN = 2093) anepřekračovat ji (tím získáme prostřednictvím binomické interpolace predikované hodnoty pro jakoukoli hodnotu N až do N = 2093), anebo lze tuto hranici překročit apoužít extrapolaci, při níž získáváme predikované hodnoty pro vyšší N, než je reálná velikost vzorku.13 Vzhledem ktomu, že mezi našimi čtyřmi korpusy je obrovský rozptyl (nejmenší N = 1653, největší N = 32031), je třeba najít nějakou společnou hodnotu N, při níž jednotlivé sady můžeme koherentně porovnat. Jako příklad volíme (víceméně extrémní) hodnotu N = 20000 amodel ZM, který se po sérii testů extrapolační kvality ukázal jako nejspolehlivější.14 Predikované hodnoty E(V), E(V1), tj.hodnoty, které produkuje teoretický model ZM pro danou velikost vzorku N = 20 000, včetně P = V1 / N zachycuje tabulka č.5.15 Jak je patrné nejen zpredikovaných hodnot, ale izprostého náhledu nárůstových křivek (kde je na ose y zobrazena predikovaná hodnota Vvzávislosti na N, tj.E[V(N)]), zůstává sufix -mento naprosto konstantní ve své produktivitě zejména 12 Kmatematickým aspektům všech tří modelů, ke kterým zde nemohu kompetentně poskytnout dostatečné résumé, srov.Baayen 2001, 2008. Vynikající popis všech vlastností LNRE modelů ajejich východisek lze také nalézt vprezentacích zkurzu Stefana Everta aMarca Baroniho zr. 2006 (dostupné zWWW: http://zipfr.r-forge.r-project.org/ esslli2006.html). Konkrétní výsledky jednotlivých modelů na zde uváděných diachronních datech srov.Štichauer, 2009b, s.74–78. 13 Kinterpolaci aextrapolaci srov.Baayen, 2001, s.63–76; 2008, s.232–236 . 14 Kotázce této spolehlivosti, zejména ke goodness-of-fit akintervalům spolehlivosti srov.Evert & Baroni, 2005; Baayen, 2008, s.233–234; Štichauer, 2009a. Ke konkrétním výsledkům na zkoumaných diachronních datech srov.Štichauer, 2009b, s. 46–50, 74–78. 15 Hodnoty jsou zaokrouhleny. OPEN ACCESS