Diachronní korpusová lingvistika a španělština: současný stav a problémy
Abstract
60
Full text
ČASOPIS PRO MODERNÍ FILOLOGII 100, 2018, Č.1, S. 60–79 Diachronní korpusová lingvistika ašpanělština: současný stav aproblémy* Zuzana Krinková (Praha) HISTORICAL CORPUS LINGUISTICS AND SPANISH: THE STATE OF THE ART AND CURRENT PROBLEMS The first aim of the article is to address major problems of current historical corpus linguistics such as representativeness in genre, place and time, transcription of historical texts, etc. The second goal is to introduce the reader to traditional and innovative historical corpora of Spanish, focusing on their characteristics, advantages and limitations. KEYWORDS Spanish, corpus linguistics, historical corpora, diachrony KLÍČOVÁ SLOVA španělština, korpusová lingvistika, diachronní korpusy, diachronie 1. ÚVOD Korpusová lingvistika bývá považována za disciplínu stále ještě relativně mladou, zato však velmi rychle adynamicky se rozvíjející. Její vznik arozmach je úzce provázán srozvojem moderních počítačových adigitálních technologií ainternetu1, díky nimž lze vsoučasné době vkteroukoli dobu azjakéhokoli počítače konzultovat na korpusech obrovské množství dat2, vmnoha případech navíc ilemmatizovaných * Tento článek vznikl za podpory projektu Univerzity Karlovy Progres č.4, Jazyk vproměnách času, místa, kultury. 1 Vznik korpusů první generace se datuje sice již do šedesátých let 20.století, nicméně hlavní rozmach korpusové lingvistiky je svázán srozšířením počítačů v90. letech. Do tohoto období spadá vznik korpusů druhé generace, oproti první generaci podstatně rozsáhlejších, knimž se řadí išpanělský referenční korpus CREA (Corpus de referencia del español actual) adiachronní korpus CORDE (Corpus diacrónico del español). Třetí generace korpusů (po roce 2000) je spjata zejména srozšířením internetu adigitalizace avyužívá mj.itexty dostupné na webu. Typově sem spadá např.synchronní korpus španělštiny CORPES XXI (Corpus del Español del Siglo XXI) čerpající mj.izblogů na webu. Podrobněji ohistorii španělské korpusové lingvistiky pojednává Rojo (2016). 2 Bez ohledu na možnosti digitálního zpracování dat vuplynulých dvou či třech desetiletích je však třeba připomenout, že empirické jazykové bádání založené na studiu konkrétních textů má mnohem delší tradici. Konkrétní areálné textové (nebo též— ve strukturalistickém pojetí— parolové) vzorky se tradičně využívaly ivminulosti zejména vlexikografii, vurčité míře ivgramatickém popisu jazyka. Vsoučasné době je využití korpusů při tvorbě slovníků agramatik současného jazyka takřka obligátní. OPEN ACCESS
ZUZANA KRINKOVÁ 61 aanotovaných na morfologické isyntaktické úrovni. Zároveň došlo vuplynulých letech ike značné diverzifikaci korpusů avedle rozličných korpusů současného jazyka vznikla iřada korpusů zachycujících jeho minulá stádia3. Dá se říci, že vsoučasné korpusové lingvistice, ať už synchronního či diachronního zaměření, rozeznáváme několik relativně nezávislých subdisciplín, které zdůvodu odlišného zaměření sledují různé cíle apotýkají se sodlišnými problémy4. První takovouto subdisciplínou je samotná výstavba korpusu, která se zabývá všemi kroky vedoucími od prvotního výběru azískávání primárních textů až ke konečné prezentaci daného prohlížeče, který uživateli umožňuje korpusová data konzultovat. Články astudie vznikající na toto téma jsou relativně četné, často psané samotnými autory korpusů či jejich úzkými spolupracovníky. Jejich cílem je především nový či teprve vznikající korpus podrobně představit avneposlední řadě ivyzdvihnout jeho přednosti (zejména oproti jiným korpusům). Druhá subdisciplína je spjata na jedné straně sinformatikou (zabývá se např.automatickým rozpoznáváním textu, značkováním apod.), na straně druhé pak smatematickým astatistickým zpracováním konkrétních dat. Ityto studie jsou četné apro ostatní uživatele korpusu mnohdy užitečné, neboť poskytují návod, jak získaná data správně vyhodnocovat. Vmnoha případech se jedná ostudie kritické, upozorňující na úskalí konkrétních korpusů achyby vjiných studiích zpohledu statistického vyhodnocování dat. Třetí subdisciplína spadající do korpusové lingvistiky má nejblíže ksamotnému jazyku jako předmětu svého hlavního zájmu. Autoři těchto ryze lingvistických studií zkoumají rozličné konkrétní jazykové jevy, přičemž své poznatky primárně zakládají 3 Vdiachronní rovině bylo tradiční filologické bádání ze své podstaty vždy založeno na zkoumání písemných památek. Filologické zkoumání jednoho konkrétního dokumentu se však od korpusového zkoumání metodologicky liší. Hlavní rozdíl spočívá vtom, že na korpusu se nezkoumají celé texty, nýbrž pouze úryvky textů. To na jedné straně přináší výhodu zkoumat velké množství dat najednou (anahlédnout tak uceleněji do langue), na druhou bývají korpusová data vytržena zširšího kontextu, následkem čehož může dojít kjejich zkreslené interpretaci. Nelze tedy říci, že by korpusová lingvistika zcela nahradila tradiční filologické metody, spíše je doplňuje. Vhistorické lingvistice zároveň existuje imetoda, která nestaví výhradně na dochovaných textech: vjazykové rekonstrukci totiž naopak doložené, písemně zaznamenané tvary často chybějí (vpřípadě španělštiny se jedná zejm. onedoložené tvary vulgární latiny či nejstarších fází iberské románštiny). 4 Příkladem— srov.Kabatek (2016, s.3)— může být na jedné straně přání uživatele korpusu pracovat sco největším množstvím volně dostupných dat, perfektně zpracovaných po lingvistické stránce, což znamená nejen lemmatizaci aanotaci, které udiachronních korpusů vykazují specifické problémy, ale ifilologicky věrohodný přepis starých textů. Na straně druhé se tvůrce korpusu potýká slimity po stránce technické, časovými, personálními afinančními možnostmi, je omezován autorskými právy apod. Toto ovšem neznamená, že dané subdisciplíny nejsou provázané. Tvůrce korpusu se přirozeně snaží co nejvíce naplnit očekávání uživatelů, ve většině případů se navíc tvůrce sám často ocitá ivroli uživatele apublikuje lingvistické studie založené na svém korpusu. OPEN ACCESS
62 ČASOPIS PRO MODERNÍ FILOLOGII 100, 2018, Č.1 na datech získaných zkorpusů. Kvalita studií tohoto typu, které jsou zastoupeny asi vnejhojnějším počtu, je značně různorodá5. Diskusní platformu pro výše zmíněnou problematiku tvoří samozřejmě zejména prestižní mezinárodní časopisy věnované buď přímo korpusové lingvistice, např.Corpora, Journal of Corpus Linguistics, případně problematice související obecně sdigitalizací dat (např.Digital Humanities) azpracováním dat (např.španělský časopis Procesamiento del lenguaje natural). Četné články zabývající se španělskou či latinskoamerickou korpusovou problematikou lze najít též např.vchilském časopise Revista de lingüística teórica y aplicada avdalších lingvisticky či filologicky orientovaných časopisech španělské ijiné provenience. Diachronně zaměřený je španělský časopis Scriptum Digital, který se zabývá teoretickými ametodologickými aspekty digitalizace avšemi výše zmíněnými subdisciplínami vdiachronní perspektivě. Okorpusové lingvistice vsouvislosti se španělštinou se pojednává též na četných konferencích akolokviích. Ztěch zaměřených na diachronii jmenujme alespoň jedno kolokvium pořádané již tradičně na španělských ijiných evropských univerzitách: Congreso Internacional de Corpus Diacrónicos en Lenguas Iberorrománicas (Palma de Mallorca 2007, Barcelona 2011, Curych 2014, Alcalá 2016)6. Zoblasti korpusové lingvistiky vyšlo vuplynulých letech také množství knižních publikací, nejčastěji (avšak nejen) sborníkového charakteru, znichž řada příspěvků se věnuje ikorpusům španělštiny adiachronii7. Skorpusy vdrtivé většině případů pracují iautoři nově vznikajících gramatik současného jazyka8 aslovníků9. Souhrnná historická mluvnice založená na diachronním korpusu však dosud nevznikla10. Tento článek si klade dva hlavní cíle. Vprvní části vytýčíme určitý teoretický rámec, do nějž zasadíme možnosti alimity korpusové lingvistiky obecně azejména 5 Vnašem příspěvku se budeme zdůvodu omezeného rozsahu zabývat především první výše zmíněnou subdisciplínou korpusové lingvistiky, neboť výstavbu korpusu (zejména co se týče výběru textů) považujeme za zcela zásadní. Odruhém atřetím okruhu, zejména ostatistickém zpracovávání dat zhistorických korpusů amožnostech alimitech diachronních korpusových studií, pojednáme vjiném článku. 6 Ztřetí konference vzešla publikace Lingüística de Corpus y Lingüística Histórica Iberorrománica, ed. J.Kabatek (2016). 7 Za všechny uveďme alespoň ryze diachronně orientovanou publikaci New Methods in Historical Corpora (P. Bennett — M.Durrell akol., 2013), jejíž příspěvky pocházejí ze stejnojmenné konference pořádané vManchesteru vr. 2011, adále kolektivní publikaci zaměřenou na jazykovou variantnost španělštiny Working with Spanish Corpora (Parodi, 2007). 8 Jako příklad uveďme alespoň dvě gramatiky využívající kromě jiných zdrojů išpanělský referenční korpus CREA. První je rozsáhlá Nueva gramática de la lengua española (2009–11) vydaná Španělskou královskou akademií (RAE). Druhým apro českého čtenáře užitečným příkladem je Mluvnice současné španělštiny (Zavadil— Čermák, 2010). 9 Na tomto místě se nabízí jako příklad zejména zcela recentní Nuevo diccionario histórico del español (NDHE), online slovník diachronního zaměření využívající mj.ikorpusy CORDE aCREA, který je možné konzultovat na stránkách RAE (http://www.rae.es/recursos/diccionarios/nuevo-diccionario-historico). Slovník není v současnosti kompletní. 10 Podrobněji oproblematice historické lingvistiky založené na korpusu pojednává Kabatek (2013). OPEN ACCESS
ZUZANA KRINKOVÁ 63 pak korpusové lingvistiky diachronní. Ta se totiž potýká sněkolika specifickými problémy, jež nejsou vlastní korpusové lingvistice synchronní (zaměřené na současný jazyk). Druhá část článku si klade za cíl poskytnout čtenáři aktuální přehled astručnou charakteristiku jednotlivých diachronních korpusů španělštiny, které jsou vsoučasnosti volně dostupné na Internetu, aupozornit na jejich klady anedostatky11. 2. OBECNÉ PROBLÉMY DIACHRONNÍ KORPUSOVÉ LINGVISTIKY 2.1 VYVÁŽENOSt AREPREZENtAtIVNOSt KORPUSU Asi nejvíce diskutovaným tématem voblasti diachronní korpusové lingvistiky posledních let je reprezentativnost dat vkorpusu aotázka vztahu mezi korpusovými daty avývojem jazyka12. Reprezentativnost korpusu je však obecným problémem, který řeší isynchronní korpusová lingvistika, neboť korpus je vždy jen soubor vybraných vyprodukovaných textů, tedy soubor jazykových vzorků, nikoli jazyk jako takový vjeho celistvosti13. Ve srovnání sdiachronními korpusy jsou však synchronní korpusy současného jazyka vurčité výhodě: oproti minulým staletím vzniká vsoučasnosti celkově více psaných textů (nabízí se tedy mnohem širší výběr „reprezentativních“ textů), navíc je možné díky moderním technologiím zachytit také orální jazyk14. 11 Naším původním záměrem bylo demonstrovat výhody aomezení jednotlivých korpusů též na příkladech konkrétních jazykových studií. Zdůvodu omezeného rozsahu článku však uvedeme jen velmi základní údaje. Podrobněji se jednotlivými typy studií, které lze světším či menším úspěchem realizovat na korpusech, akonkrétními příklady budeme zabývat vjiném článku. 12 Srov.též Kabatek (2016, s.3). 13 Vtéto souvislosti je třeba si mj.uvědomit, že drtivá většina všech vyprodukovaných textů/ promluv každého jazyka je orálního charakteru, zatímco psaný jazyk tvoří ivsoučasnosti menšinu. Orální jazyk je zároveň nejčastějším nositelem jazykových inovací, jeho význam je tudíž vjazykovém popisu zcela nesporný. Ipřes tuto skutečnost je orální složka zastoupena vkorpusech vpoměrově mnohem menší míře vzhledem ke skutečnosti (např.ve španělském referenčním korpusu CREA tvoří orální složka pouhých 10 %). Vdiachronních korpusech orální produkce samozřejmě zcela chybí. 14 Většina orální složky zastoupené vkorpusech je nicméně formálního či poloformálního charakteru (televizní debaty, rozhovory, přednášky apod.). Nejběžnější neformální promluvy mezi rodinnými příslušníky či přáteli jsou stále zastoupeny zcela minimálně. Na druhou stranu však orální složka může být nepřímo obsažena, jak je všeobecně známo, vbeletrii či divadelních hrách vpodobě promluv jednotlivých postav (což je jistě dobrá zpráva ipro diachronní korpusovou lingvistiku) adále také do určité míry ive spontánním psaném projevu. Vtomto kontextu je využití internetových blogů, diskuzí apod. jistě velmi žádoucí. Vdiachronních korpusech může obdobnou úlohu plnit např.soukromá korespondence. OPEN ACCESS
64 ČASOPIS PRO MODERNÍ FILOLOGII 100, 2018, Č.1 Enrique-Arias (2012, s.96) uvádí zásadní tezi týkající se zdánlivého paradoxu výstavby velkých „reprezentativních“ diachronních korpusů: diachronní korpus by měl být na jedné straně heterogenní (tj.obsahovat texty různých autorů, žánrů, stylů, dialektů), na druhé straně by však měl být homogenní vtom smyslu, že jednotlivá chronologická období by měla být mezi sebou srovnatelná (videálním případě vpočtu tokenů ivpoměrovém zastoupení různých typů textů)15. Splnění tohoto nároku kladeného na diachronní korpus se pojí scelou řadou problémů, onichž stručně pojednáme níže. 2.1.1 ROZDĚLENÍ tEXtŮ PODLE ŽÁNRU Synchronní idiachronní korpusy zpravidla pracují srozdělením textů podle žánrů. Objemy textů daných žánrů jsou vůči sobě obvykle určitým způsobem poměrově zastoupeny. Rozdělení na žánry může samo osobě představovat problém (některé texty mohou být obtížně zařaditelné, jedná se ožánry na pomezí apod.), bylo by však jistě na druhou stranu nežádoucí (právě ikvůli již zmíněnému relativně vyváženému poměrovému zastoupení, onějž se tvůrci korpusu snaží), aby klasifikace textů byla vkorpusu příliš podrobná, nepřehledná či roztříštěná. Různé žánry se od sebe mohou lišit svým stylem, neboť vycházejí zrůzných textových tradic16. Vsynchronních adiachronních korpusech se žánrové zastoupení textů či alespoň jejich poměr většinou liší. Např.poezie, která je jazykově specifická (četné metafory, neobvyklá slovní spojení, netypický slovosled, fonetické odchylky zdůvodu zachování rýmu apod.) bývá vsynchronních korpusech zastoupena ve velmi malé míře či vůbec17. Odlišná je však situace vdiachronních korpusech, neboť ibeletrie adalší narativní žánry byly ve středověku často veršované amnohdy je právě tato literatura vdiachronních korpusech relativně četně zastoupena. Diachronní korpusová lingvistika se navíc potýká sproblémem srovnatelnosti aproměnou jednotlivých žánrů včase. Jak poznamenává Enrique-Arias (2012:96), je otázkou, do jaké míry je metodologicky správné srovnávat např.jazyková data ze středověkých kronik sromány 19.století, byť se vobou případech jedná onarativní žánry. 15 Většina diachronních korpusů obsahuje různě velké vzorky dat, ať už je proměnnou čas, žánr či jiná veličina. Stouto skutečností si zpravidla poradí příslušné použité statistické metody. Problémem však zůstává, že vmnohých korpusech nenajdeme přesné informace ovelikosti dat. 16 Podrobněji oproblematice rozdělení textů na žánry aod nich se odvíjejících textových tradicích viz Kabatek (2013, s.16–19). 17 Toto ovšem neznamená, že by korpusový výzkum jazyka poezie byl zlingvistického hlediska nezajímavý či irelevantní. Svědčí otom např.irecentní projekt Korpus českého verše (http://versologie.cz/v2/web_content/corpus.php?lang=cz) realizovaný versologickým týmem na Ústavu pro českou literaturu AV ČR. Pro výzkum literárního jazyka, ať už poezie nebo prózy, je korpus nástrojem přirozeně nejvhodnějším. Ztohoto pohledu se tedy může nízké poměrové zastoupení poezie ve velkých referenčních synchronních korpusech jevit jako poněkud nešťastné. Nicméně je třeba dodat, že existují či vsoučasnosti vznikají (včeském išpanělském prostředí) specializované autorské korpusy. Při současném boomu vzniku rozličných specializovaných korpusů lze dle našeho názoru předpokládat, že vdohledné budoucnosti jistě vznikne ikorpus zaměřený na španělskou poezii. OPEN ACCESS
ZUZANA KRINKOVÁ 65 2.1.2 DIAStRAtICKÁ ADIAtOPICKÁ VARIANtNOSt Videálním případě by měl být každý korpus aspirující na reprezentativnost jazyka vurčitém období či napříč časem vyvážený také zpohledu diastratického adiatopického. Tato podmínka však bývá splněna jen velmi vzácně aúdaje ogeografickém či sociálním původu (ijakékoli další sociolingvistické parametry) omluvčích či autorech textů se vkorpusu obvykle nevyskytují či jsou velmi obecné18. Nabízí se otázka, do jaké míry jsou takové údaje pro korpusovou lingvistiku vůbec relevantní. Obecně lze říci, že zatímco některé jazykové jevy (zejména zpohledu synchronního zkoumání) jsou na diatopické adiastratické proměnlivosti nezávislé, jiné jevy naopak vtomto směru vykazují variantnost. Synchronní lingvistika je vtomto ohledu opět vnemalé výhodě, neboť vpřípadě potřeby může vazbu určitého jevu na diatopické či diastratické parametry ověřit jinými metodami (terénním výzkumem mezi mluvčími apod.). Zároveň mohou relativně snadno vznikat imenší korpusy různých současných sociolektů či lokálních mluv orálního charakteru19. Také lze konstatovat, že např.současná psaná španělština, která tvoří podstatnou část velkých korpusů, je do značné míry standardizována azpohledu diatopického vykazuje relativně malou variantnost. Poněkud odlišná situace je vdiachronní lingvistice, která je metodologicky odkázána pouze na zkoumání psaných textů. Zejména ve vzdálenější minulosti zaznamenáváme oproti dnešku mnohem větší jazykovou variantnost, která je ve většině případů vázána právě na geografický původ pisatele textu. Během jazykového vývoje obvykle se stává, že některé zjazykových fenoménů vykazujících variantnost začínají postupem času převažovat aposléze se prosadí na úkor ostatních, které vyjdou zužívání. Úkolem diachronní lingvistiky by mělo být nejen konstatovat, ve kterém časovém období kurčité jazykové změně došlo, ale pokud možno též odhalit ipříčinu dané jazykové změny. Ta sice někdy tkví vsamotném jazykovém systému, velmi často však souvisí svnějšími okolnostmi jazykového vývoje, např.historickými událostmi (obecným příkladem prosazení určitých lokálních variant na úkor jiných může být změna hlavního města apod.20). Diatopický parametr ajeho vyváženost vdiachronním korpusu je proto znašeho pohledu velice podstatný21. 18 Synchronní korpus CREA ani diachronní korpus CORDE např.neuvádějí jiný geografický údaj než zemi, kde text vznikl. 19 Některé takové orální korpusy (COVJA, ACUAH aj.) jsou zahrnuty do CREA. Zdalších španělských specializovaných korpusů různých sociolektů jmenujme např.COLA (Corpus oral de lenguaje adolescente), ALCORE (Corpus para el estudio del lenguaje juvenil), COJEM (Corpus Oral Juvenil del Español de Mallorca), Val.Es.Co (Valencia— Español Coloquial). Korpusy současných sociolektů alokálních mluv přesahují téma tohoto článku, zájemce nalezne více informací např.vRojo (2016). 20 Vpřípadě španělštiny je asi nejznámějším anejtypičtějším příkladem vnější příčiny jazykových změn reconquista (zpětné vytlačování Maurů zPyrenejského poloostrova), která začala na severu Pyrenejského poloostrova apostupovala směrem na jih. Reconquista má za následek prosazení kastilštiny voblastech původně nekastilských anarušení jazykového kontinua na Pyrenejském poloostrově. fake footn OPEN ACCESS
66 ČASOPIS PRO MODERNÍ FILOLOGII 100, 2018, Č.1 Problémem21 mnohých starých textů obsažených vkorpusech je, že jejich autorství je sporné, některé texty byly opisovány postupně ivíce autory ageografický původ textů tak lze určit právě jen na základě jazykových rysů daného dokumentu. Je však velmi pozitivní, že vposledních letech vznikají ve španělském jazykovém prostředí idiachronně zaměřené korpusy, které diatopický adiastratický faktor neopomíjejí22. 2.1.3 ČASOVÁ ROVINA Diachronní korpus by měl videálním případě poskytnout vyvážený obraz jazyka napříč časem. Jako relativně triviální, vpraxi však bohužel často zanedbaný, se proto jeví požadavek na podobný počet tokenů vjednotlivých časově vymezených obdobích. Vmnohých diachronních korpusech se kvantita textů vrůzných obdobích značně liší. Statistické metody si srozdílnou velikostí vzorků dat sice zpravidla snadno poradí, nemohou však řešit nulový výskyt hledaného jevu, který je důsledkem nedostatečně zastoupeného období. Mnohé korpusy navíc neposkytují údaje opočtech tokenů vjednotlivých časových obdobích. 2.2 PŘEPIS StARÝCH tEXtŮ Diachronní korpusová lingvistika se musí vypořádat idvěma dalšími problémy zásadního rázu, které nejsou přítomné ulingvistiky synchronní. Jedná se opřepis adataci starých textů. Při přepisu starých textů (zejména středověkých manuskriptů) se objevují specifické obtíže: texty např.obsahují značné množství rozličných ligatur azkratek, pravopis se může ivrámci jednoho díla lišit, často chybí interpunkce, některé skupiny slov mohou být psány dohromady atd. Texty navíc mohou být místy poškozené, neúplné či nečitelné. Všechny tyto aspekty mohou následně vést kpřípadným chybám vtransliteraci23. Vdokumentu se také mohou objevit chyby písařů či kopistů24. Vranější fázi moderní korpusové lingvistiky se pro diachronní korpusy nejčastěji využívala buď literární díla, onichž se předpokládalo, že jsou pro vývoj jazyka stěžejní (ve španělštině např.Cid, El conde Lucanor, La Celestina, Quijote), nebo vydané texty ne21 Diatopická nevyváženost korpusu může zkreslit výsledky diachronního výzkumu jazykových změn izhlediska časového. 22 Takovým je např.korpus CODEA amnohé jiné, menší specializované korpusy. Pojednáme onich ve třetím oddílu. 23 Vtomto článku chápeme termín transliterace jako přepis psacích písmen manuskriptu do písma tiskacího. Příkladem takového chybného přepisu (cf. Kabatek, 2016, s.6) je dle údajů vCORDE časný italianismus mafia (objevuje se již v16.století), který je však ve skutečnosti chybným přepisem slova maña. Přestože se již jedná oznámý případ, vCORDE ivkorpusu Marka Daviese (Corpus del español) je tento tvar stále přítomný. Vrecentním slovníku Nuevo Diccionario Histórico, který zahrnuje itexty zCORDE, je uvedený příklad již opraven. 24 Chyby, jichž se dopouštěli písaři při opisu děl, jsou jiného rázu než chyby vtransliteraci, obvykle jsou relativně snadno rozpoznatelné anijak neodrážejí stav jazyka dané epochy. Naproti tomu fenomény jako anakoluty, které se rovněž mohou vyskytnout vmanuskriptech, mohou mít lingvisticky vypovídající hodnotu. Podrobněji otomto problému viz Kabatek (2013, s.10–12). footn 21 OPEN ACCESS
ZUZANA KRINKOVÁ 67 literární, které byly již kdispozici. Tento přístup ssebou přinášel mnohé problémy: slavné literární texty nemusejí být po jazykové stránce typickými představiteli své doby, vněkterém období bylo kdispozici hodně materiálu jen jednoho určitého typu (zákoníky), což mělo za následek žánrovou nevyrovnanost. Ve všech případech se jednalo okritická vydání děl, tj.texty byly již určitým způsobem přepsány aupraveny25. Korpusy tak ztohoto hlediska obsahovaly texty různorodé povahy, neboť jednotlivá kritická vydání starých textů se mohla iznačně lišit po stránce editorských úprav. Vsoučasnosti se vmnoha případech však dokumenty vybírají apřipravují již přímo za účelem jejich zahrnutí do korpusu. Důležitou roli tu sehrává postupující digitalizace archivů, jež umožňuje snadný přístup krozličným starým textům. Dá se říci, že dnešní iberorománská diachronní korpusová lingvistika se čím dál tím více přiklání kedičním kritériím proklamovaným sítí CHARTA26, podle nichž se korpus již neomezuje na jediné vydání starého textu, nýbrž nabízí vedle kritického vydání (upraveného na základě jednotných kritérií) ipaleografickou verzi stransliterací manuskriptu adále též fotografický náhled originálního dokumentu, který umožňuje badateli ověřit správnost přepisu. 2.3 DAtACE StARÝCH tEXtŮ Závažný problém, snímž se potýkají zejména dva velké diachronní korpusy CORDE aCorpus del Español27, představuje datace starých textů. Mnohdy se zaměňuje datum vzniku existujícího či domnělého originálu sdatem vzniku manuskriptu či datem knižního vydání textu. Mnohá stará díla jsou navíc zachována jen vpozdějších opisech28. Nejasná kritéria pro dataci textů mohou být posléze příčinou chybných závěrů řady studií azavést diachronní bádání do slepé uličky. 3. PŘEHLED ACHARAKTERISTIKA DOSTUPNÝCH DIACHRONNÍCH KORPUSŮ ŠPANĚLŠTINY29 Vsoučasné době existuje celá řada diachronních korpusů zaměřených na evropskou či mimoevropskou španělštinu. Pro větší přehlednost je zde rozdělíme do pěti skupin. 25 Vybrané kritické edice starých děl byly následně skenovány aručně upravovány. Kvůli zachování koherence textu byl např.vypuštěn poznámkový aparát. 26 Red Internacional CHARTA (Corpus Hispánico y Americano en la Red: Textos Antiguos), podrobná kritéria se nacházejí zde: http://files.redcharta1.webnode.es/200000023- -de670df5d6/Criterios%20CHARTA%2011abr2013.pdf 27 Kvalitativně ještě závažnější je ztohoto pohledu datace děl vrozsáhlém diachronním korpusu GoogleBooks. 28 Za všechny uveďme dva příklady: Cid vCORDE nese dataci pol. 12.století, byť originál ztéto doby není zachován. Stejně tak Calila e Dimna se datuje do 13.století, ikdyž oba dochované opisy pocházejí z15.století. 29 Odiachronních korpusech dalších jazyků Pyrenejského poloostrova vtomto článku nepojednáváme, zájemce odkazujeme na následující webové stránky: CICA (Corpus InformatiOPEN ACCESS
68 ČASOPIS PRO MODERNÍ FILOLOGII 100, 2018, Č.1 První skupinu tvoří dnes již tradiční CORDE aCorpus del Español. Jedná se onejvětší diachronní korpusy španělštiny, které lze vjistém smyslu považovat za referenční. Svou výstavbou spadají ještě mezi korpusy starší generace. Do druhé skupiny jsme zařadili korpusy paralelní. Třetí ačtvrtá skupina korpusů (nejčastěji velmi recentních) využívá všeobecného rozmachu digitalizace archivních dokumentů, které jsou za účelem začlenění do korpusu pečlivě vybírány adále zpracovávány podle jednotných kritérií. Poslední pátou skupinu pak tvoří (rovněž recentní) korpusy využívající texty zwebu (mezi ně patří irozsáhlé korpusy Google Books). 3.1 VELKÉ REFERENČNÍ KORPUSY 3.1.1 CORDE (CORPUS DIACRÓNICO DEL ESPAÑOL)30 Asi nejznámějším azároveň největším anejstarším diachronním korpusem je CORDE vytvořený Španělskou královskou akademií (RAE) již koncem 90. let. Korpus CORDE, vsoučasnosti již uzavřený, obsahuje texty rozličných žánrů atémat datované od 8.století do roku 1975 (celkem zhruba 250 milionů tokenů31). Texty pocházejí zrůzných oblastí, kde se vsoučasnosti hovoří či vminulosti hovořilo španělsky. Geografická provenience textů je omezena na údaj o(současném) státu. Dle údajů na stránkách korpusu pochází 74 % textů ze Španělska. Zhlediska časového je korpus rozložen nerovnoměrně vtomto poměru: 21 %32 pochází zobdobí do r. 1492 (Edad Media), dále 28 % je věnováno Zlatému věku (Siglos de Oro, zde konkrétně 1493–1713), 51 % je zmoderního období (Época contemporánea, zde 1714–1975). Podrobnější údaje opočtu tokenů nejsou kdispozici. Jak již bylo uvedeno výše, isamotná datace jednotlivých textů je místy problematická. Problematický je také různorodý přepis jednotlivých textů. Cenná je vtomto směru zcela recentní rozsáhlá studie od Rodrígueze Moliny aOctavia de Toledo y Huerta (2017), vníž autoři hodnotí dokumenty obsažené vCORDE zpohledu jejich datace, kvality avěrohodnosti. Korpus CORDE není lemmatizovaný ani anotovaný, což značně komplikuje studium morfologie asyntaxe. Kromě konkrétních slovních tvarů (ajednoduchých logických kombinací) lze hledat ičásti slov doplněné hvězdičkou, nicméně vtomto posledním případě, pokud je počet nalezených konkordancí příliš velký, se nezobrazí výsledek. Hledání je možné filtrovat podle zemí, žánrů, chronologie (podle letopočtů), zároveň je možné omezit hledání jen na jednoho konkrétního autora či dílo. tzat del Català Antic), URL: http://www.cica.cat/, COTAGAL (Corpus de Textos Antiguos de Galicia), který je součástí sítě CHARTA, URL: http://ilg.usc.es/es/proxectos/corpus-de-textos-antiguos-de-galicia-cotagal, UNESP (Córpus Diacrônico do Português), URL: http:// www.cdp.ibilce.unesp.br/, Corpus do Português, URL: http://www.corpusdoportugues. org/. 30 URL: http://corpus.rae.es/cordenet.html 31 Na stránkách korpusu (http://corpus.rae.es/ayuda_c.htm) je uveden iúdaj 125 milionů slov (tokenů), tento údaj je však nejspíše zastaralý. 32 Není uvedeno, zda se daný poměr vztahuje kpočtu tokenů či textů, pravděpodobnější se však jeví první možnost. OPEN ACCESS
ZUZANA KRINKOVÁ 75 3.4.3 CORLEXIN (CORPUS LÉXICO DE INVENTARIOS)57 Korpus obsahuje rozličné nevydané notářské dokumenty zarchivů španělských aněkolika latinskoamerických (mexických, kolumbijských, bolivijských auruguayských), zejména inventáře, ocenění asoupisy majetku, závěti apod., které byly přepsány za účelem jejich shromáždění vkorpusu. Způsob přepisu není na stránkách korpusu definován, zdá se však, že texty jsou do určité míry upravené (např.segmentace slov, zkratky). Celkově se jedná omenší korpus (cca 1 milion tokenů), který je primárně zaměřen na lexikum běžného života období Zlatého věku (17.století). Lexikum tohoto typu často není dokumentováno ve velkých korpusech typu CORDE58, někdy dokonce ani ve slovnících. Vkorpusu lze hledat celá slova, víceslovná spojení isegmenty písmen (např.slabiky či kořeny doplněné hvězdičkou), kzobrazení jsou však kdispozici pouze celé texty (přičemž hledaný segment není zvýrazněn). Každý text obsahuje informaci onázvu dokumentu, dataci ageografické lokaci. Celkově lze konstatovat, že korpus CorLexIn představuje potenciál zejména pro výzkum lexika auplatní se zejména vhistorické lexikografii. Cenné poznatky může poskytnout izpohledu historické dialektologie, případně též jazykového kontaktu na úrovni lexikálních výpůjček.59 3.5 DIACHRONNÍ KORPUSY GOOGLE BOOKS Vposledních letech vznikají ikorpusy využívající jako zdroj dat web. Tyto korpusy bývají velmi rozsáhlé (čítají několik miliard až desítek miliard tokenů) ajsou zpochopitelných důvodů zaměřeny na současný jazyk. Takto rozsáhlé diachronní korpusy až na výjimky vsoučasnosti neexistují. Speciální nástroj vyhledávače Google Books60 fungující na bázi n-gramů však nabízí možnost hledání jednotlivých slov či kolokací zdiachronní perspektivy61. Každé hledané slovo či kolokace se však musí vknihách Google Books vyskytovat alespoň 40×, vopačném případě je pro vyhledávač „neviditelné“62. Nástroj se jeví nejvhodnější 57 Korpus začal vznikat vr. 2006. Participují na něm tři španělské univerzity (León, Burgos, Oviedo) ve spolupráci sInstitutem Rafaela Lapesy aRAE. Projekt řídí José R.Morala Rodríguez zLeónské univerzity. URL: http://web.frl.es/CORLEXIN.html 58 Cf. Morala Rodríguez (2014). 59 Morala Rodríguez (2014, s.23–25) uvádí pro ilustraci několik vzorových studií, pro které lze súspěchem využít tento korpus. Studie mají různé zaměření (slova dosud nezdokumentovaná, formální nebo diatopická variantnost, lexikální inovace, lexikální morfologie). 60 URL: https://books.google.com/ngrams/. Vyhledávač n-gramů Google Books funguje vsoučasnosti v8 jazycích, kromě angličtiny ašpanělštiny též včínštině, francouzštině, němčině, hebrejštině, italštině aruštině. Španělská verze je zroku 2009. 61 Kromě celých slov lze již vsoučasnosti použít ipokročilejší hledání. Více informací zde: https://books.google.com/ngrams/info. 62 Výsledky nástroje Google Books N-gram viewer tak nejsou totožné sprostým prohledáváním vGoogle Books. OPEN ACCESS
76 ČASOPIS PRO MODERNÍ FILOLOGII 100, 2018, Č.1 pro porovnávání frekvence výskytu dvou či více výrazů vurčitém časovém období. Výsledek je zobrazen formou grafu. Propracovanější verzi korpusu využívající části dat zkorpusu Google Books afungující na stejném principu n-gramů vytvořil Mark Davies pro britskou aamerickou angličtinu apro španělštinu. Španělská část jeho Google Books Corpora63 obsahuje 45miliard slov. Jedná se tak obezkonkurenčně nejrozsáhlejší diachronní korpus vpravém slova smyslu. Korpus nabízí více možností hledání oproti vyhledávači Google Books, chronologické zobrazení výsledků je možné po jednotlivých letech či dekádách (vobdobí od r. 1500 do prvního desetiletí 21.století včetně). Konkrétní konkordance sice nelze zobrazit, lze však snadno kliknutím přejít na konkrétní knihu vGoogle Books. Ipro tento korpus platí omezení, že hledaný výraz se musí vkorpusu vyskytovat minimálně 40x. Korpus tedy na jedné straně nabízí ke konzultaci obrovské množství dat64, na straně druhé toto omezení může mít za následek, že některé okrajové výrazy, které se nevyskytují vmenších korpusech, zůstanou itak skryty65. Toto však bohužel není zdaleka jediná nevýhoda tohoto korpusu. Pomineme-li skutečnost, že knihy vtomto korpusu nejsou dále nijak tříděny podle žánru, tématu či místa vydání (které samozřejmě není často totožné spůvodem autora), adále též nevyváženost počtu tokenů zhlediska časového, největší problém znašeho pohledu představuje datace jednotlivých knih. Týká se to nejen knih, které vyšly ve 20. či 21.století opakovaně (vnezměněné formě) vrůzných vydáních svíceletým odstupem (vGoogle Books se často neobjevuje jejich původní, první vydání). Zpohledu diachronního jazykového výzkumu závažnější (abohužel poměrně četné) jsou však případy, kdy kniha stará evidentně několik set let je automaticky časově zařazena do 21.století, neboť se jedná např.orecentní faksimilní reedici. Diachronní bádání založené na tomto korpusu tedy nejen nemůže dle našeho názoru odhalit příčinu jazykových změn avariantnosti, ale může být navíc velmi zkreslené izpohledu čistě chronologického. 63 URL: https://googlebooks.byu.edu/x.asp. Jak je patrné, Google Books Corpora Marka Daviese není totožný svyhledávacím nástrojem Google Books firmy Google, nýbrž se jedná ojeden zkorpusů vytvořený na Brigham Young University podobně jako Corpus del Español. 64 Ipřes omezení minimálního počtu výskytů jsou vtakto velkém korpusu dohledatelné např.ipřeklepy uběžnějších výrazů (amgo místo amigo), 65 Konkrétním příkladem takového okrajového výrazu je dialektální arabismus alfira „oleandr“, který se ve španělštině běžněji nazývá adelfa. Zatímco běžnější název je na Google Books Corpora ivnástroji Google Books N-gram viewer doložen od 18.století (vmnohem menším diachronním korpusu CORDE je však doložen již od 13.století, přičemž je dokumentován iv16. a17.století, tedy vobdobí, které je pokryto vGoogle Books Corpora), název alfira není doložen ani vjednom korpusu Google Books (ani vCORDE). Vprostém vyhledávání vGoogle Books se však výraz alfira vtomto významu vyskytuje. OPEN ACCESS
ZUZANA KRINKOVÁ 77 4. ZÁVĚR Korpusová lingvistika se vuplynulých letech stala nepochybně jednou ze stěžejních lingvistických disciplín. Dá se říci, že vsoučasnosti zažívá opravdový rozkvět aminimálně synchronní jazykové bádání je bez korpusu již často nemyslitelné (byť lingvistika disponuje ijinými výzkumnými metodami). Důvodem velké obliby korpusové metody je jednak snadná dostupnost velkého množství korpusových dat amožnost jejich kvantifikace, jednak relativně vysoká kvalita areprezentativnost současných korpusů. Jak je patrné ztohoto článku, velkou odezvu nachází korpusová lingvistika ivdiachronním výzkumu španělštiny. Svědčí otom nejen řada nově vznikajících diachronních korpusů evropské ilatinskoamerické španělštiny, ale istále četnější diachronní studie podložené korpusovými daty. Diachronní korpusová lingvistika se potýká sněkolika specifickými problémy (mj.jednotný přepis adatace textů, absence orálních dat, vyváženost korpusu zpohledu chronologického, případně ižánrového, diatopického, diastratického atd.), které je nezbytné následně zohledňovat ipři interpretaci korpusových dat vkonkrétních studiích. Kromě toho je třeba mít neustále na mysli skutečnost, že ani ten největší anejreprezentativnější korpus nikdy nemůže obsahovat veškeré jazykové jevy, které se mohou vyskytnout vjednotlivých jazykových plánech. Toto však neznamená, že diachronní lingvistika by se měla kvůli výše uvedeným těžkostem korpusů vzdát, nebo se problémy vůbec nezabývat, nýbrž by je měla pojmout jako výzvy, jimž je třeba vrámci možností co nejlépe čelit. Diachronně zaměřený lingvista zabývající se španělštinou má vsoučasnosti kdispozici relativně velké množství korpusů různé velikosti azaměření, snimiž může vpřípadě potřeby súspěchem pracovat. Stále však zatím platí, že korpusy vyhovující nejnovějším standardům jsou vsoučasnosti poměrně malé, anaopak největší korpusy mají značné nedostatky po stránce technického či filologického zpracování. Protože mnoho korpusů se však nadále vyvíjí, rozšiřuje azkvalitňuje, zdá se, že idiachronní badatelé budou moci do budoucna počítat spříslibem nových objevů učiněných na základě korpusového bádání, ato nejen zoblasti lexika, ale iostatních jazykových plánů. LITERATURA Almeida, B. (2015): Un corpus documental del siglo XIX: CODOXIX. Études Romanes de Brno, 36, 1, s.11–20. Bennett, P.— Durrell, M.— Scheible,S.— Whitt, R.J. (ed.) (2013): New Methods in Historical Corpora. Tübingen: Gunter Narr Verlag. Bertolotti, V.— Company Company, C. (2014): El corpus diacrónico y diatópico del Español de América (CORDIAM). Propuesta de tipología textual. Cuadernos de la ALFAL, 6, s.130–148. Calderón Campos, M. (2015), El español del reino de Granada en sus documentos (1492–1833). Oralidad y escritura. Bern: Peter Lang, s.139–273. Christodouloupoulos, Ch.— Steedman, M. (2015): Amassively parallel corpus: the OPEN ACCESS
78 ČASOPIS PRO MODERNÍ FILOLOGII 100, 2018, Č.1 Bible in 100 languages. Language Resources and Evaluation, 49, s.375–395. Contreras Seitz, M. (2017): Lo que cuentan los documentos: para una historia del español de Chile en el período colonial. Atenea, 515, s.173–188. Davies, M. (2002): Un corpus anotado de 100.000.000 palabras del español histórico ymoderno. Procesamiento del Lenguaje Natural, 29, s.21–27. Davies, M. (2010): Creating useful historical corpora: Acomparison of CORDE, the Corpus del Español, and the Corpus do Português. In: A.Enrique Arias, Diacronía de las lenguas iberorromances: nuevas perspectivas desde la lingüística de corpus. Frankfurt/Madrid: Vervuert/Iberoamericana, s.137–166. Eide, K.G. (2014): Studying word order differences in ahistorical parallel corpus. An example from Old Spanish and Old Portuguese. In: S.O.Ebeling— A.Grønn— K.R.Hauge— D.Santos (ed.): Corpus-based Studies in Contrastive Linguistics. Oslo Studies in Language 6, 1, s.181–199. Enrique Arias, A. (2012): Dos problemas en el uso de corpus diacrónicos del español: perspektiva y comparabilidad. Scriptum Digital, 1, s.82–106. Kabatek, J. (2013): ¿Es posible una lingüística histórica basada en un corpus representativo? Ibero, 77, s.8–28. Kabatek, J. (ed.) (2016): Lingüística de corpus y lingüística histórica iberrorománica. Berlin/ Boston: Walter de Gruyter. Martínez Magaz, J. (2005): Traducción, dialecto y alejamiento cronológico. El corpus TRADI IMTti. In: M.L.Romana García (ed.), II AIETI. Actas del II Congreso Internacional de la Asociación Ibérica de Estudios de Traducción eInterpretación. Madrid: AIETI, s.602–609. Morala Rodríguez, J.R. (2014): El CorLexIn, un corpus para el estudio del léxico histórico y dialectal del Siglo de Oro. Scriptum Digital, 3, s.5–28. Parodi, G. (ed.) (2007): Working with Spanish Corpora. London/New York: Continuum. Real Academia Española (2009–2011): Nueva gramática de la lengua española. Resnik, P.— Olsen, M.B.— Diab, M. (1999): The Bible as aParallel Corpus: Annotating the “Book of 2000 Tongues”. Computers and the Humanities, 33, s.129–153. Rodríguez Molina, J.— Octavio de Toledo y Huerta, Á. (2017): La imprescindible distinción entre texto y testimonio: el CORDE y los criterios de fiabilidad lingüística. Scriptum Digital, 6, s.5–68. Rojo, G. (2016): Los corpus textuales del español. In: J.Gutirrez-Rexach, (ed.): Enciclopedia lingüística hispánica. Oxon: Routledge, s.285–296. Vaamonde, G. (2014): Limitaciones en el uso de corpus diacrónicos del español. Nuevas aportaciones desde el proyecto de investigación Post Scriptum. In: XXXII Congreso Internacional de la Asociación Española de Lingüística Aplicada (AESLA), Universidad Pablo de Olavid, Sevilla. KORPUSY AKORPUSOVÉ SLOVNÍKY [ALDICAM-CM] GITHE (koord. P.Sánchez Prieto-Borja): Atlas Lingüístico Diacrónico eInteractivo de la Comunidad de Madrid. <http://textoshispanicos.es/index. php?title=P%C3%A1gina_principal> [Biblia Medieval] Universitat de les Illes Balears (koord. A.Enrique-Arias): Biblia Medieval. <http://www.bibliamedieval.es> [CdE] BYU (koord. M.Davies): Corpus del Español. <https://www.corpusdelespanol.org/> [CdP] BYU (koord. M.Davies): Corpus do Português. <http://www.corpusdoportugues. org/> [CDP] UNESP (koord. S.R.Longhin-Thomazi): Córpus Diacrônico do Português. <http://www. cdp.ibilce.unesp.br/> OPEN ACCESS
ZUZANA KRINKOVÁ 79 [CHARTA] (koord. P.Sánchez-Prieto Borja): Corpus Hispánico y Americano en la Red: Textos Antiguos. <http://www.redcharta.es/> [CICA] ICREA/UAB, UV-IEC, UA-IEC (koord. Torruella, J., Pérez Saldanya, M., Martines J.): Corpus Informatitzat del Català Antic, <http:// www.cica.cat/> [CODEA] GITHE: Corpus de Documentos Españoles Anteriores a1800. <http://corpuscodea.es/> [CODEMA] ARINTA (koord. Carrasco Cantos,I., Carrasco Cantos P.): Corpus Diacrónico de Documentación Malagueña. <http://www. arinta.uma.es/> [CORDIAM] Academia Mexicana de la Lengua (koord. V.Bertolotti— C.Company Company): Corpus Diacrónico y Diatópico del Español de América. <www.cordiam.org> [CORDE] Real Academia Española: Corpus diacrónico del español. <http://www.rae.es> [CORDEREGRA] GIHLD (koord. M.Calderón Campos, Mª. T.García-Godoy): Corpus diacrónico del español del reino de Granada. 1492–1833.URL: <http://www.corderegra.es> [COREECOM] GEECOM (koord. B.Arias Álvarez): Corpus Electrónico del Español Colonial Mexicano. IIFL-UNAM <http:// www.iifilologicas.unam.mx/coreecom/ presentacion.html> [CORHEN] GHEN (koord. M.J.Torrens Álvares): Corpus Histórico del Español Norteño. <http:// corhen.es> [CorLexIn] Universidad de León (koord. J.R.Morala Rodríguez): Corpus Léxico de Inventarios, <http://web.frl.es/CORLEXIN. html> [CORPES XXI] Real Academia Española: Corpus del Español del Siglo XXI (CORPES). <http:// www.rae.es> [CREA] Real Academia Española: Corpus de referencia del español actual. <http://www.rae. es> [COTAGAL] USC, Instituto da Lingua Galega (koord. R.Pichel Gotérrez): Corpus de Textos Antiguos de Galicia. <http://ilg.usc.es/es/ proxectos/corpus-de-textos-antiguos-degalicia-cotagal> [DITECA] ARINTA (koord. Carrasco Cantos, I., Carrasco Cantos P.): Diccionario de Textos Concejiles de Andalucía. <http://www.arinta. uma.es/> [Google Books Corpora] BYU (koord. M.Davies): Google Books Corpora. <https://googlebooks. byu.edu/x.asp> [NDHE] Real Academia Española: Nuevo diccionario histórico del español. <http:// www.rae.es/recursos/diccionarios/nuevodiccionario-historico> [P.S.] CLUL: P.S. Post Scriptum. Arquivo Digital de Escrita Quotidiana em Portugal e Espanha na Época Moderna. <http://ps.clul.ul.pt> Zuzana Krinková | Ústav románských studií, Filozofická fakulta Univerzity Karlovy | nám. Jana Palacha 2, 116 38 Praha 1 ORCID ID: 0000-0001-5000-9204 [email protected] OPEN ACCESS