Korpus českého jazyka 2. poloviny 19. století
Abstract
92
Full text
ČASOPIS PRO MODERNÍ FILOLOGII 101, 2019, Č.1, S. 92–98 Korpus českého jazyka 2.poloviny 19.století1 Karel Kučera (Praha)— Kateřina Najbrtová (Praha)— Klára Pivoňková (Praha)— Anna Řehořková (Praha)— Martin Stluka (Praha) K. Kučera— K. Najbrtová— K. Pivoňková — A. Řehořková— M. Stluka CORPUS OF THE CZECH LANGUAGE OF THE 2ND HALF OF THE 19TH CENTURY The paper describes the principles and structure of the one-million-word DIA1900 Corpus built at the Institute of the Czech National Corpus (CNC) in Prague, focused on the language of Czech texts published in the years 1851 to 1900. The DIA1900, planned for publication by June 2020 and to be followed by the DIA1850 (acorpus built around the same principles, with the focus on the first half of the 19th century), observes both the balanced representation of the three major text types (belles lettres— journalistic texts— technical/scientific texts) and the system of morphological tagging implemented in the synchronic corpora included in the CNC project, thus facilitating the diachronic comparison of two stages in the development of Czech. Abrief description is given of the structure of the morphological terminology used in the lemmatisation and tagging of the corpus, and of two tools designed to help search the 19th century texts with their fluctuating orthographic consistency combined with phonological and morphological variation characteristics of the language of the period: (1) amultiple select/suggest feature (reminding the user of the existence of non-standard orthographic and phonological variants of the lemma found in the corpus before the lemma search is started) and (2) the position attribute (informing the user of the ambiguous status of aword in the text, resulting from amisprint or misspelling, damaged page etc.). KEYWORDS diachronic corpus, lemmatisation, morphological tagging, post-national revival Czech, 19th century Czech, phonological variability, orthographic variability, morphological variability KLÍČOVÁ SLOVA diachronní korpus, lemmatizace, morfologické značkování, poobrozenská čeština, čeština 19.století, hlásková variabilita, pravopisná variabilita, morfologická variabilita DOI https://doi.org/10.14712/23366591.2019.1.6 1. CHARAKTERISTIKA KORPUSU AJEHO KONCEPCE Korpus DIA1900, který je vÚstavu Českého národního korpusu (ČNK) Filozofické fakulty UK vPraze připravován ke zpřístupnění vprvní polovině roku 2020, je prv1 Tento článek vznikl při realizaci projektu Český národní korpus (LM2015044) financovaného Ministerstvem školství, mládeže atělovýchovy vrámci aktivity Projekty velkých infrastruktur pro VaVaI. autoři záhlaví OPEN ACCESS
K. KuČERA— K. NAJBRtOVÁ— K. PIVOňKOVÁ — A. ŘEHOŘKOVÁ— M. StLuKA 93 ním ze dvou historických korpusů českého jazyka kladoucích si za cíl svým složením ijednotnou koncepcí anotace umožnit co nejvšestrannější srovnání češtiny 19.století sčeštinou současnou, tak jak je zachycena vkorpusech řady SYN. Ve vztahu ktomuto obecnému cíli budou jak vrozpracovaném korpusu DIA1900, zaměřeném na jazyk 2.poloviny 19.století, tak vplánovaném korpusu DIA1850, orientovaném na češtinu 1.poloviny 19.století, dodržovány tři základní principy odpovídající principům uplatňovaným vkorpusech synchronních, konkrétně (1) jednotný rozsah korpusů (vpřípadě korpusů DIA milion slovních tvarů), (2) vyvážené zastoupení tří textových typů (publicistika, odborné texty abeletrie), (3) budování korpusu zcelých textů. Vbudoucnu, po vybudování obou korpusů, bude možno uvažovat iodalších korpusech, které by stejně jako DIA1900 aDIA1850 mapovaly jednotlivé stavy češtiny ajejí vývoj vpůlstoletých obdobích směrem do vzdálenější minulosti. Vzhledem knevyřešené legislativě týkající se copyrightu auvolňování novějších publikovaných textů pro využití kvědeckým účelům by vsoučasné době bylo předčasné zvažovat rozšíření záběru korpusů DIA ivopačném směru, tj.na první polovinu 20.století. Korpus DIA1900 je složen ztextů různého rozsahu (2 200–29 300 slovních tvarů) publikovaných vletech 1851–1900, ato ve výše zmíněném vyváženém zastoupení publicistiky, odborných textů abeletrie, které je dodržováno nejen vrámci celého korpusu, ale ina úrovni jednotlivých desetiletí. Data pro korpus byla vybrána ztextů, které byly digitalizovány metodou OCR ajsou volně přístupné vdigitální knihovně Kramerius 3 Národní knihovny ČR (viz http://kramerius.nkp.cz/kramerius/Welcome.do). Vzhledem krůzné kvalitě OCR, závislé na vlastnostech předlohy ipoužitého softwaru, byly všechny texty porovnány se svými digitálními předlohami, manuálně opraveny anásledně upraveny tak, aby svým členěním ametajazykovými daty odpovídaly formátu závaznému pro texty zařazované do korpusů ČNK. Konkrétní jazykové zásady uplatňované při přípravě textů kvyužití vkorpusu DIA1900 vyplývaly primárně zcharakteristických rysů jazyka 2.poloviny 19.století aze specifik jeho úzu. Čeština tohoto období se vrámci periodizace vývoje českého jazyka označuje jako poobrozenská čeština 19.století (srov.Kosek, 2017) achápe se jako jedno ze čtyř vývojových období nové češtiny (obrozenská čeština— poobrozenská čeština 19.století— čeština 1.poloviny 20.století— čeština 2.poloviny 20.století), jejíž počátek se klade do poslední čtvrtiny 18.století. Toto zařazení by nemělo vyvolat dojem, že při tvorbě korpusů zcelého novočeského období, tedy iz19.století, by bylo možno beze změn nebo jen sdrobnými modifikacemi využít propracovaných postupů obvyklých při výstavbě korpusů synchronních. Jak shrnujeme dále, korpus DIA1900 měl vtomto směru četná specifika jak voblasti editace textů, respektive jejich celkové přípravy pro zařazení do korpusu, tak voblasti jejich značkování, aspecifické problémy bylo třeba řešit ipři tvorbě morfologického slovníku určeného klemmatizaci amorfologickému značkování jednotlivých slovních tvarů. Základní diferenční jazykové rysy poobrozenských textů souvisejí se společenským akulturním vývojem včeských zemích v2.polovině 19.století, který ve srovnání spředchozími obdobími jednak vedl ke stále širšímu růstu uplatnění českého OPEN ACCESS
94 ČASOPIS PRO MODERNÍ FILOLOGII 101, 2019, Č.1 jazyka vliteratuře, kultuře, školství, publicistice, naučné ivědecké literatuře ana nižších rovinách administrativy, jednak směřoval— mimo jiné vsouvislosti srostoucím počtem aktivních uživatelů češtiny— ke zživotnění jazyka projevujícímu se odklonem od archaizující kodifikace kulturního jazyka předchozího obrozenského období, vněmž se jako vzor primárně uplatňovala čeština humanistická.2 Tyto zživotňující tendence ve skutečnosti měly hlubší historické kořeny. Jak konstatoval Alexandr Stich (Stich, 1991, s.59 a60) vsouvislosti sbarokem, „některé vývojové tendence měly svůj počátek právě vněm apřežily pak do obrozenského období, kde se rozvinuly plněji. […] Kromě toho barokní spisovný úzus těmto tendencím napomáhal tím, že se neuzavíral před systémovými inovačními procesy, které tehdy probíhaly vběžně mluveném jazyce. […] Všechny barokní inovace jsou motivovány snahou přiblížit spisovnou normu běžně mluvenému jazyku, ato té jeho podobě, která se neopírá ožádný přísně krajově vymezený nářeční základ (ale spíše oto, co se později pro většinu stalo obecnou češtinou).“ 2. VARIABILITA ČEŠTINY 19.STOLETÍ AJEJÍ REFLEXE VKORPUSU Paralelní existenci zmíněných tří vývojových procesů (pozvolný ústup „vyšší“ humanistické normy, zživotňování češtiny ajejí šíření do „vyšší“ kulturní, odborné iadministrativní sféry) lze označit za hlavní faktor, který v2.polovině 19.století vedl krozsáhlé variabilitě na různých rovinách jazykové stavby ina různých úrovních výstavby textu, scentrem vrovině hláskové, pravopisné amorfologické. Podstatně méně častá byla dobová variabilita lexikální, resp.slovotvorná, jako např.znalec/znatel, všecek/ všecken/všechen, výhradní/výhradný, ryzí (ryzího, ryzímu…)/ryzý (ryzého, ryzému…), ďábelný/ďábelský, stěží/stíží/stěžkem, křestný/křestní ap., ařídké, ikdyž zdnešního hlediska někdy velmi nápadné byly také varianty, respektive nově se vyhraňující preference voblasti syntaxe (srov.např.korpusové doklady nezvládnutých konstrukcí vznikajících zjevně ze snahy opreferované „úřední“ neosobní vyjadřování pomocí pasiva: má plný nárok na takovouto podporu aochranu státem, neboť itomuto musí na tom záleženo býti, aby rolnictvo neklesalo; Místo však co by se mu byli měli dát napiti, zacpáno mu ještě ijediný otvor, kudy mu zvenčí do vězení čerstvý vzduch docházel, aby mimojdoucí jeho nářek neslyšeli). Zhlediska výstavby korpusu DIA1900, který má pouze morfologické, nikoli syntaktické asémantické značkování, nevyžadovaly dva posledně jmenované druhy variant žádný zvláštní přístup: syntaktické varianty apreference nebyly vkorpusu nijak označovány ani dále zpracovávány; výše zmíněné lexikální varianty (znalec/znatel, všecek/všecken/všechen atd.) byly zařazeny do morfologického slovníku jako samostatné lexémy, apokud patřily kohebným slovním druhům, byla pro ně vygenerována odpovídající paradigmata. Jako příklady pravopisných variant vdobových textech— asoučasně jako příklady odlišnosti silně rozkolísaného pravopisného úzu poobrozenské češtiny od značně unifikovaného pravopisného úzu češtiny dnešní— lze uvést podoby způsob/ spůsob, dvadcet/dvatcet/dvacet, denník/deník, předce/přece, zrcádko/zrcátko, zýtra/zítra 2 Srov.Šlosar (2017). OPEN ACCESS
K. KuČERA— K. NAJBRtOVÁ— K. PIVOňKOVÁ — A. ŘEHOŘKOVÁ— M. StLuKA 95 aj. Značná část pravopisných rozdílů vyplývala také ze souběžného užívání přejatých, respektive vdané době přejímaných anejednotně pravopisně počešťovaných cizích výrazů, jako například effektný/efektný, grammatika/gramatika, klassický/klasický, mythologie/mytologie, praecisní/precisní, klarinet/klarynet aj. Hláskovou variantnost vdobových textech by bylo možno exemplifikovat především značnou rozkolísaností kvantity samohlásek (miska/míska, kniha/kníha, jmeno/ jméno, bájka/bajka, namáhavý/namahavý, obleknouti/obléknouti aj.), ale podobné případy většinou nelze spolehlivě rozlišit od rozkolísaného, respektive nesoustavného označování kvantity, tedy od jevu pravopisného. Početné případy variantnosti na rovině hláskosloví lze však uvést iodjinud, zejména zoblasti zjednodušování souhláskových skupin (prázný/prázdný, zkřiknout/vzkřiknout, cnost/ctnost, třevo/střevo ap.), užívání podob sprovedenými ineprovedenými hláskovými změnami (vorati/orati, oučel/účel, outok/útok aj.) nebo podob, vnichž se vyskytovalo několik druhů hláskových rozdílů současně (srov.případy jako osýpati/osejpati/vosejpati nebo ouředník/ouředlník/úřadník/ouřadník). Četné morfologické varianty týkající se jednotlivých tvarů, nikoli celých paradigmat3 (srov.např.nominativ plurálu Španělé/Španělové, koně/koňové, lokál plurálu maskulin vrcholech/vrcholích, chlévech/chlévích, genitiv plurálu maskulin spisův/spisů, kořínkův/kořínků, variantní slovesné tvary chtí/chtějí, jezdí/jezdějí, bere/béře, dýchá/ dýše, dadí/dají, přednešen/přednesen, slyšán/slyšen aj.) byly do poobrozenské češtiny téměř vesměs přejaty ze starších vývojových fází jazyka, anejsou tedy jejím výhradním specifikem. Varianty tohoto typu byly začleněny do skriptů určených ke generování příslušných paradigmat amorfologických tagů. Výsledně tak ani zhlediska příslušnosti kodpovídajícím lemmatům, ani zhlediska gramatické interpretace nepředstavují pro uživatele korpusu žádné problémy, anevyžadují proto nadstavbu ani rozšíření funkcionality současných korpusových nástrojů. Vpřípadě výše komentovaných pravopisných ahláskových variant je situace výrazně odlišná: variabilita je tu podstatně častější než uvariant morfologických, je zvelké části nepravidelná, obtížně předpověditelná, pro běžného, do starší češtiny nezasvěceného uživatele využívajícího současné korpusové nástroje je na základě intuice jen stěží vyhledatelná, atedy ve výsledku itěžko uchopitelná. Ztohoto důvodu— scílem zachytit pravopisnou, hláskovou azčásti imorfologickou variabilitu sco nejmenším zkreslením, bez apriorních kritérií asoučasně tak, aby představovala co nejmenší překážku pro uživatele— budou do vyhledávání vkorpusech DIA1900 aDIA1850 postupně implementovány následující dva doplňky:4 1. našeptávač— program, který při zadání dotazu ve formě lemmatu upozorňuje uživatele především na pravopisné nebo hláskové varianty zadávaného lemmatu (např.při dotazu na lemma osídlovat, kost, okno, ústa nebo loňský upozorní na existenci 3 Jak bylo uvedeno výše, varianty, které se uplatňovaly vcelých paradigmatech, byly do morfologického slovníku zařazovány jako samostatná lemmata. 4 Postupná implementace je vtomto případě nevyhnutelná vzhledem ktomu, že tyto doplňky vyžadují množství časově mimořádně náročné manuální práce, zjejíchž výsledků bude teprve vycházet výsledné softwarové řešení. OPEN ACCESS
96 ČASOPIS PRO MODERNÍ FILOLOGII 101, 2019, Č.1 variant osidlovat, kosť, vokno, ousta, lonský); zpraktických důvodů bude program upozorňovat ina časté formálně blízké auživatelům často zcela neznámé varianty slovotvorné povahy, kjakým patří například rozsáhlá dobová koexistence adjektiv měkkého atvrdého sklonění (severní/severný, vzorní/vzorný, absolutní/absolutný, ryzí/ryzý), nebo na oddělené psaní součástí dnešních spřežek typu docela, neboli (do cela, nebo-li). Našeptávač nabízí možnost výběru mezi vyhledáváním omezeným na jednotlivé varianty, které uživatel sám označí, avyhledáváním všech nabízených variant. 2. poziční atribut— informace připojená ke konkrétnímu výskytu slovního tvaru vtextu, která podobně jako poznámky vkritických edicích starších písemných památek upozorňuje na neobvyklost, resp.nejasnost tohoto tvaru, zejména je-li tato neobvyklost či nejasnost spojena smožnou nespolehlivostí jeho interpretace. Konkrétně může jít například oto, že psaná nebo tištěná podoba příslušného tvaru vtextu se výrazně liší od běžných pravopisných zvyklostí (např.sv.mikulášský ‚svatomikulášský‘, sv.-Petrský ‚svatopetrský‘), že vtextu je zřejmá tisková chyba (např.slnnce místo slunce) nebo že část tvaru je nečitelná, anení tedy možné rozhodnout, zda vtextu byla užita například podoba knihkupectví nebo kněhkupectví. 3. LEMMATIZACE AMORFOLOGICKÉ ZNAČKOVÁNÍ TEXTŮ Jak bylo řečeno vúvodu tohoto příspěvku, koncepce diachronního korpusu DIA1900 počítá slemmatizací amorfologickým značkováním. Morfologický slovník, který byl ktomuto cíli vytvořen, vznikl běžnou metodou, jejíž užití pro obrozenskou apoobrozenskou češtinu bylo testováno vletech 2008–2011 vevropském projektu IMPACT5 ajejíž aplikace je plánována nebo realizována vněkolika historicky orientovaných lingvistických projektech (srov.např.Synková, 2017; Tichý, 2017). Zmíněná metoda spočívá ve vytvoření hesláře slovních tvarů zdobových textů,6 následné lemmatizaci získaných slovních tvarů agenerování jejich kompletních paradigmat. Vpřípadě korpusu DIA1900 vznikl výchozí heslář slovních tvarů zJungmannova Slovníku česko- -německého, Příručního slovníku jazyka českého (PSJČ) azhistoricky příznakových hesel avariant hesel Slovníku spisovného jazyka českého (SSJČ) označených křížkem (svýznamem ‚zastaralý výraz‘) nebo zkratkami zast. (rovněž svýznamem ‚zastaralý výraz‘), dř. (‚dříve‘), dř. ps. (‚dříve psáno‘) anář. ‚nářeční výraz, tvar‘.7 Tento slovníkový základ 5 Viz http://www.impact-Project.eu/uploads/media/IMPACT_DEE3.13_Czech_Lexicon_ Documentation.pdf. 6 Ktvorbě hesláře lze svýhodou využít isoudobých slovníků, pokud existují, ale je třeba je doplnit ojazyková data získaná zautentických dobových textů, neboť při tvorbě slovníkových děl byly zpuristických či jiných pohnutek často vypouštěny ivýrazy, které byly součástí běžného úzu. Včeštině 19.století jde například očetná slovesa zakončená vinfinitivu na -írovat/-ýrovat, která do češtiny pronikala zněmčiny. 7 PSJČ aSSJČ byly za základ hesláře zvoleny především se zřetelem krozsáhlé excerpci literárních avědeckých textů 19.století, pořízené pro vydání těchto slovníků. Hesla avarianty hesel označované vSSJČ zkratkou nář. byly do hesláře zařazeny vzhledem OPEN ACCESS
K. KuČERA— K. NAJBRtOVÁ— K. PIVOňKOVÁ — A. ŘEHOŘKOVÁ— M. StLuKA 97 byl doplněn onejčastější lemmata získaná poloautomatickým výběrem ze souboru dostupných elektronických textů publikovaných v19.století. Lemmata zastoupená vtakto rozšířeném hesláři byla následně rozčleněna podle slovních druhů avpřípadě lexémů patřících kohebným slovním druhům byla dále přiřazena buď kněkterému zdeklinačních či konjugačních typů, anebo začleněna do souboru lexémů snepravidelnou flexí (osobní zájmena, slovesa jako být, mít ap.), jejichž paradigmata byla vytvářena ručně.8 Paradigmata klemmatům spravidelnou deklinací nebo konjugací byla generována souborem skriptů, které každému generovanému tvaru současně přiřazují lemma amorfologickou interpretaci ve formě šestnáctimístného tagu užívaného vkorpusech řady SYN. Morfologický slovník bude poprvé využit klemmatizaci amorfologickému označkování výběru zkorpusových textů ocelkovém rozsahu půl milionu slovních tvarů, který po ruční desambiguaci bude sloužit jako trénovací datový soubor pro morfologický tagger MorphoDiTa.9 Před samotnou lemmatizací amorfologickým značkováním celého korpusu byl vdobě vzniku tohoto příspěvku (duben 2019) morfologický slovník stále ještě doplňován odalší apelativní lexémy ztextů 2.poloviny 19.století, zejména ovýrazy zdobových novin ačasopisů, které do značné míry stály na okraji pozornosti obrozenských ipozdějších lexikografů. Současně byl průběžně rozšiřován isamostatný slovníkový modul dobových proprií. LITERATURA AINTERNETOVÉ ZDROJE ktomu, že až na novější výjimky jde ovýrazy excerpované zklasických děl české literatury 19.století. 8 Analogický postup (včetně ručního vytváření nepravidelných paradigmat) je užíván při tvorbě podobných heslářů nejen pro češtinu, ale ipro další jazyky; srov.Tichý (2017), s.46. 9 Pro podrobnější informace otomto taggeru viz stránky Ústavu formální aaplikované lingvistiky Matematicko-fyzikální fakulty UK (http://ufal.mff.cuni.cz/morphodita). Bláha, O. (2016): Poznámky kmorfologickému vývoji češtiny. Olomouc: Univerzita Palackého vOlomouci, 2016. Kosek, P. (2017): Periodizace vývoje češtiny. In: P.Karlík— M.Nekula— J.Pleskalová (eds.), CzechEncy— Nový encyklopedický slovník češtiny. URL: https://www.czechency.org/ slovnik/PERIODIZACE VÝVOJE ČEŠTINY. Stich, A. (1991): Opočátcích moderní spisovné češtiny. Naše řeč, 74, s.57–62. Synková, P. (2017): Popis staročeské apelativní deklinace (se zřetelem kautomatické morfologické analýze textů Staročeské textové banky). Praha: Filozofická fakulta UK, 2017. Šlosar, D. (2017): Poobrozenská čeština 19.stol. In: P.Karlík— M.Nekula— J.Pleskalová (eds.), CzechEncy— Nový encyklopedický slovník češtiny. URL: https://www.czechency. org/slovnik/POOBROZENSKÁ ČEŠTINA 19.STOL. Tichý, O. (2017): Nástroj na tvaroslovnou analýzu staré angličtiny. Časopis pro moderní filologii, 99, 1, s.40–54. OPEN ACCESS
98 ČASOPIS PRO MODERNÍ FILOLOGII 101, 2019, Č.1 Karel Kučera | Ústav Českého národního korpusu, Filozofická fakulta Univerzity Karlovy | Panská890/7, 110 00 Praha 1 ORCID ID: 0000-0002-0762-5682 [email protected] Kateřina Najbrtová | Ústav Českého národního korpusu, Filozofická fakulta Univerzity Karlovy | Panská 890/7, 110 00 Praha 1 [email protected] Klára Pivoňková | Ústav Českého národního korpusu, Filozofická fakulta Univerzity Karlovy | Panská 890/7, 110 00 Praha 1 [email protected] Anna Řehořková | Ústav Českého národního korpusu, Filozofická fakulta Univerzity Karlovy | Panská 890/7, 110 00 Praha 1 ORCID ID: 0000-0002-6676-317X [email protected] Martin Stluka | Ústav Českého národního korpusu, Filozofická fakulta Univerzity Karlovy | Panská890/7, 110 00 Praha 1 ORCID ID: 0000-0003-3294-3583 [email protected] OPEN ACCESS