Koditex — korpus diverzifikovaných textů
Abstract
127
Full text
KODITEX— KORPUS DIVERZIFIKOVANÝCH TEXTŮ Vlistopadu 2018 vyšel zdílny Českého národního korpusu (ČNK; https://korpus.cz/) nový korpus češtiny— Koditex (Zasina, Lukeš, Komrsková, Poukarová & Řehořková, 2018). Jedná se osynchronní, reprezentativní areferenční korpus, který obsahuje 10,9 mil. pozic, což po odečtení interpunkce činí přibližně 9 mil. slov. Korpus byl vytvořen za účelem provedení multidimenzionální analýzy češtiny (Cvrček et al., 2018a, 2018b), proto se vmnoha ohledech od ostatních korpusů ČNK liší. Název korpusu je zkratkovým slovem pro korpus diverzifikovaných textů asoučasně odkazuje kosobě Viléma Kodýtka, který se jako první pokusil aplikovat multidimenzionální analýzu na češtinu (Kodýtek, nepubl.). Při sestavování korpusu byl kladen důraz na co nejpestřejší složení, které by odráželo variabilitu současné1 češtiny ve třech komunikačních módech: psaný, mluvený, internetový.2 Snažili jsme se tedy vybrat co nejširší spektrum textů všech tří módů od co největšího počtu autorů/mluvčích. Právě sohledem na zvýšení pestrosti vstupoval do korpusu každý text vpodobě vzorku (chunk),3 na rozdíl od ostatních synchronních korpusů ČNK (např.SYN2015), ve kterých jsou obsaženy celé texty. Celkově je Koditex tvořen 3 428 textovými vzorky, které zahrnují přes 719 tis. vět; obsahuje 506 764 slovních tvarů a205 592 tisíc lemmat. Koditex je strukturován hierarchicky (viz tab. 1). Nejvyšší úroveň tvoří komunikační módy (mode): psaný jazyk (wri), mluvený jazyk (spo) ainternetová komunikace (web). Každý mód se dále dělí do dvou avíce divizí (division). Divize jsou rozděleny do tříd (class), jejichž cílová velikost činí přibližně 200 000 slov na třídu. Psaný mód vyžadoval zavedení mezistupně, tzv.nadtřídy (superclass), seskupující některé třídy. Jak struktura, tak hierarchická klasifikace textů do tříd vychází zdřívějších zkušeností svýstavbou korpusů ČNK (srov.Cvrček, Čermáková & Křen, 2016). Zdroje dat pro jednotlivé textové třídy se liší. Většina textů pochází zvlastních zdrojů ČNK. Texty, jimiž ČNK nedisponoval, byly poskytnuty jinými vědecko-výzkumnými pracovišti (viz dále). Textové vzorky vpsaném módu pocházejí převážně zkorpusu SYN2015 (Křen et al., 2015), pouze vněkterých případech bylo knaplnění třídy nutno využít ijiné korpusy řady SYN. Pro třídu soukromé korespondence (class: pri) jsme využili Korpus soukromé korespondence (Hladká, 2006). Vmluveném módu jsou použity pro každou třídu jiné zdroje: neformální komunikace (class: inf) pochází zkorpusu ORAL2013 (Benešová, Křen & Waclawičová, 2013), elicitovaná komunikace 1 Korpus obsahuje texty, jež vznikly po roce 1990; většina znich pochází zlet 2007–2015. 2 Vydělení internetové komunikace do samostatného módu (podobně iHerringová, 2001) bylo motivováno především dosud chybějícím uspokojivým popisem textové složky českého internetu (srov.Biber & Egbert, 2016) avětší selekcí těchto dat při vytváření korpusu (při výběru byly uvažovány např.pouze psané texty, ačkoli lze uvažovat ořadě mluvených žánrů specifických pouze pro internet, pouze texty sdiakritikou apod.). Internetové texty se od textů ve zbylých dvou módech navíc odlišují metadaty, mezi kterými dominují (spíše) technické údaje vztahující se ktextu (např.denní doba, ve které byl text zveřejněn) oproti jedinému údaji oautorovi— jeho jménu, resp.přezdívce. 3 Vzávorkách uvádíme výraz vpodobě, vjaké se objevuje při práci skorpusem. OPEN ACCESS
128 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2019 Adrian Jan Zasina — Zuzana Komrsková MÓD (mode) DIVIZE (division) NADTŘÍDA (superclass) TŘÍDA (class) Slova Textové vzorky spo (mluvená komunikace) int (interaktivní) bru (nepřipravené veřejné/vysílané rozhovory) 221812 90 eli (formální rozhovor) 201690 82 inf (neformální rozhovor) 208565 86 nin (neinteraktivní) wbs (připravený/čtený projev) 213201 71 web (internetová komunikace) mul (mnohosměrná komunikace) dis (internetové diskuse) 197948 87 fcb (facebookové statusy) 199418 91 for (webová fóra) 200104 85 uni (jednosměrná komunikace) blo (blogy) 204356 74 wik (wikipedie) 201691 84 wri (psaná komunikace) fic (beletrie) nov (romány) crm (detektivky) 190026 68 fan (fantasy) 189432 69 gen (bez bližšího určení) 193667 67 lov (milostné) 189893 70 scf (sci-fi) 188703 68 col (povídky) 195595 70 scr (scénáře adramata) 182689 76 ver (poezie apísně) 205837 76 nfc (oborová literatura) pop (populárně naučná) fts (formální atechnické vědy) 207607 68 hum (humanitní vědy) 204837 74 nat (přírodní vědy) 204751 71 ssc (společenské vědy) 203698 68 pro (profesní literatura) fts (formální atechnické vědy) 210010 71 hum (humanitní vědy) 207916 69 nat (přírodní vědy) 209580 70 ssc (společenské vědy) 209385 72 sci (vědecká literatura) fts (formální atechnické vědy) 202932 67 hum (humanitní vědy) 204300 71 nat (přírodní vědy) 206716 72 ssc (společenské vědy) 205358 67 adm (administrativa) 207748 90 enc (encyklopedie) 203957 73 mem (auto-/biografie) 203390 71 OPEN ACCESS
ADRIAN JAN ZASINA — ZUZANA KOMRSKOVá 129 (class: eli) zformální části korpusů PMK (Čermák, Adamovičová & Pešička, 2001) aBMK (Hladká, 2002), mediální komunikace (class: bru) zkorpusu DIALOG4 (http:// ujc.dialogy.cz/),5 připravené apřevážně čtené projevy (class: wbs) zkorpusu SPEECHES (Cvrček, Truneček & Horký, 2015) azčeské části zápisů vkorpusu EUROPARL (http://www.statmt.org/europarl/). Texty vmódu internetové komunikace jsme také vybírali zněkolika zdrojů: vzorky zinternetové encyklopedie Wikipedie (class: wik) zKorpusu české Wikipedie, sestaveného Centrem zpracování přirozeného jazyka vBrně,6 blogy (class: blo) zkorpusu Araneum Bohemicum Maius (Benko, 2015) adata pro kategorie příspěvků zdiskusních fór (class: for), internetových diskusí (class: dis) aveřejných statusů ze sociální sítě Facebook (class: fac) poskytl Josef Šlerka aspolečnost Socialinsider. Většina textů (spokrytím 76 % všech tokenů) zahrnutých vkorpusu představuje české originály (tedy nikoliv překlady zjiných jazyků). Jedinou výjimkou jsou textové třídy, ukterých je včeštině výskyt přeložených materiálů zcela běžný. Ve třídách lov, crm, gen, fan, scf, mem tvoří podíl překladů více než 70 %, ve třídách hum, nat, enc, ssc, 4 Texty původně zařazené do korpusu bylo vněkterých případech třeba zanalýzy registrové variability vyloučit. Vtakovém případě mají vmetadatech příznak include=“no“. Tato tabulka ukazuje složení celého korpusu Koditex. 5 Za poskytnutá data děkujeme Martinu Proškovi aPetru Kaderkovi zÚstavu pro jazyk český AV ČR. 6 Za poskytnutí dat děkujeme Karlu Palovi aVítu Baisovi zCentra zpracování přirozeného jazyka na Masarykově univerzitě. footn 4 MÓD (mode) DIVIZE (division) NADTŘÍDA (superclass) TŘÍDA (class) Slova Textové vzorky wri (psaná komunikace) nmg (noviny ačasopisy) lei (volnočasová publicistika) hou (bydlení, zahrada, hobby) 207499 68 int (zajímavosti ze světa) 209232 69 lif (životní styl) 203124 72 mix (víkendové přílohy) 205310 75 sct (bulvár) 201417 73 spo (sport) 199238 70 new (tradiční publicistika) com (komentáře) 205372 68 cul (kultura) 205690 68 eco (ekonomika) 211481 70 fre (volnočasové aktivity) 208532 71 pol (politika) 206893 70 rep (reportáže) 206377 70 pri (soukromá komunikace) cor (dopisy) 195321 196 Celkem 9142298 3428 tabulka 1:Složení korpusu Koditex.4 OPEN ACCESS
130 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2019 fts, ver, wik tvoří překlady 20–45 %. Vostatních třídách jsou zahrnuty české originály ze 100 %. Vprocesu vytváření korpusu Koditex jsme vprvní fázi— vzorkování textů— stanovili délku textového vzorku na 2000 až 5000 slov se zachováním hranic vět. Texty delší než 5000 slov tedy bylo nutno rozdělit na menší části (znichž do korpusu vstoupila většinou pouze jedna). Naopak některé textové třídy ukázaly, že obsahují texty zpravidla kratší než 2000 slov. Takové případy jsme řešili následovně: ve třídách administrativa asoukromá korespondence jsme snížili limit na 1000 slov ave třídách obsahujících krátké příspěvky zwebu, tj.třídy for, dis, fac, jsme spojili texty od téhož autora do jednoho vzorku ovelikosti 2000–5000 slov. Utranskriptů mluveného jazyka jsme analogicky spojovali repliky od téhož mluvčího hovořícího vrámci jedné nahrávky do jednoho celku, takže souhrny replik od jednotlivých komunikačních partnerů vstupovaly do korpusu jako samostatné komunikáty.7 Pro některé třídy jsme měli kdispozici více vzorků, než bylo potřeba, proto jsme stanovenou kvótu 200 000 slov naplňovali na základě algoritmu vytvářejícího co nejpestřejší směs textů.8 Algoritmus vrámci jedné třídy nejdříve vybral náhodně první vzorek anásledně se snažil najít další vzorek, který se od předchozího lišil vco největším počtu relevantních metainformací.9 Takový vzorek byl přidán kvýběru aalgoritmus pokračoval vhledání až do naplnění požadované velikosti. Korpus Koditex je anotován na několika úrovních. Kromě standardní anotace (lem - matizace, morfologické značkování10) obsahuje anotaci frazémů pomocí systému FRANTA (Hnátková, 2002) atzv.pojmenovaných entit (named entities) nástrojem NameTag (http://ufal.mff.cuni.cz/nametag; Straková, Straka & Hajič, 2013). Korpus Koditex představuje specializovaný typ jazykového korpusu, který je vrámci korpusů ČNK unikátní. Jeho specifičnost tkví především vúčelu, za jakým byl vytvořen, od něhož se odvíjela ijeho neobvyklá struktura amnohovrstevnatá anotace. Provedení multidimenzionální analýzy registrové variability češtiny, jíž sloužil jako datová základna, však neznamená vyčerpání všech možností jeho využití. Domníváme se, že nové možnosti naopak otevírá. Jednotné zpracování dat ze psané, mluvené ainternetové komunikace včetně zpřístupnění nových žánrů, např.příspěvků zinternetových diskusí, umožňuje jejich srovnání na různých rovinách jazykového popisu. Doufáme, že korpus Koditex bude nejen inspirací ke vzniku nových studií. 7 Podrobný popis je uveden vCvrček et. al. (2018a, s.3–7). 8 Za koncepci aimplementaci tohoto algoritmu vděčíme Jiřímu Václavíkovi. 9 Vjednotlivých textových třídách se inventář dostupných metainformací lišil (např.informace ovzdělání autora byla kdispozici pouze učásti mluvených dat). Obecně však algoritmus přihlížel ke všem charakteristikám textu či jeho autora, unichž lze předpokládat vliv na jazykovou variabilitu (vyloučen tak byl např.údaj ISBN, který žádnou relevantní charakteristiku textu neodráží). 10 Morfologické značkování bylo provedeno dvěma systémy: stochastickým taggerem MorphoDiTa (http://ufal.mff.cuni.cz/morphodita; Straková, Straka & Hajič, 2014) ahybridním taggerem spoužitím stochastické apravidlové desambiguace (Spoustová, Hajič, Votrubec, Krbec & Květoň, 2007; Jelínek, 2008; Petkevič, 2014). OPEN ACCESS
ADRIAN JAN ZASINA — ZUZANA KOMRSKOVá 131 LITERATURA Benešová, L., Křen, M., & Waclawičová, M. (2013). ORAL2013: reprezentativní korpus neformální mluvené češtiny. Praha: Ústav Českého národního korpusu FF UK. Dostupné zhttp://www.korpus.cz. Benko, V. (2015). Araneum Bohemicum Maius, verze 15.04. Praha: Ústav Českého národního korpusu FF UK. Dostupné zhttp://www. korpus.cz. Biber, D., & Egbert, J. (2016). Register Variation on the Searchable Web: AMulti-Dimensional Analysis. Journal of English Linguistics, 44(2), 95–137. Cvrček, V., Truneček, P., & Horký, V. (2015). Korpus prezidentských projevů Speeches. Praha: Ústav Českého národního korpusu FF UK. Dostupné zhttp://www.korpus.cz. Cvrček, V., Čermáková, A., & Křen, M. (2016). Nová koncepce synchronních korpusů psané češtiny. Slovo aslovesnost, 77(2), 83–101. Cvrček, V., Komrsková, Z., Lukeš, D., Poukarová, P., Řehořková, A., & Zasina, A.J. (2018a): From extrato intratextual characteristics: Charting the space of variation in Czech through MDA. Corpus Linguistics and Linguistic Theory. Dostupné zhttps://www.degruyter.com/ view/j/cllt.ahead-of-print/cllt-2018-0020/ cllt-2018-0020.xml. Cvrček, V., Komrsková, Z., Lukeš, D., Poukarová, P., Řehořková, A., & Zasina, A.J. (2018b). Variabilita češtiny: multidimenzionální analýza. Slovo aslovesnost, 79(4), 293–321. Čermák, F., Adamovičová, A. & Pešička, J. (2001). PMK (Pražský mluvený korpus): přepisy nahrávek pražské mluvy z90.let 20.století. Praha: Ústav Českého národního korpusu FF UK. Dostupné zhttp://www.korpus.cz. Herring, S.C. (2001). Computer Mediated Discourse. In D.Schiffrin, D.Tannen & H.Hamilton (Eds.), The Handbook of Discourse Analysis (s.612–634). London, UK: Blackwell. Hladká, Z. (2002). BMK (Brněnský mluvený korpus): přepisy nahrávek brněnské mluvy z90.let 20.století. Praha: Ústav Českého národního korpusu FF UK. Dostupné zhttp:// www.korpus.cz. Hladká, Z. (2006). KSK-dopisy (Korpus soukromé korespondence): přepisy ručně psaných dopisů zlet 1990–2004. Praha: Ústav Českého národního korpusu FF UK. Dostupné zhttp:// www.korpus.cz. Hnátková, M. (2002). Značkování frazémů aidiomů vČeském národním korpusu spomocí Slovníku české frazeologie aidiomatiky. Slovo aslovesnost, 63(2). 117–126. Jelínek, T. (2008). Nové značkování vČeském národním korpusu. Naše řeč, 91(1). 13–20. Kodýtek, V. (nepublikováno). Atranslation of Biber’s three-dimensional model of English into Czech. Dostupné zhttps://www.korpus. cz/biblio/2722. Korpus DIALOG 1.1 (2012). Praha: Ústav pro jazyk český, AV ČR. Dostupné zhttp://ujc.dialogy.cz. Křen, M., Cvrček, V., Čapka, T., Čermáková, A., Hnátková, M., Chlumská, L., Jelínek, T., Kováříková, D., Petkevič, V., Procházka, P., Skoumalová, H., Škrabal, M., Truneček, P., Vondřička, P. & Zasina, A. (2015). SYN2015: reprezentativní korpus psané češtiny. Praha: Ústav Českého národního korpusu FF UK. Dostupné zhttp://www.korpus.cz. Petkevič, V. (2014). Problémy automatické morfologické disambiguace češtiny. Naše řeč, 97(4), 194–207. Spoustová, D., Hajič, J., Votrubec, J., Krbec, P. & Květoň, P. (2007). The Best of Two Worlds: Cooperation of Statistical and RuleBased Taggers for Czech. In J.Piskorski, B.Pouliquen, R.Steinberger & H.Tanev (Eds.), Proceedings of the Workshop on Balto-Slavonic Natural Language Processing: Information Extraction and Enabling Technologies (s.67–74). Praha: Association for Computational Linguistics. Straková, J., Straka, M. & Hajič, J. (2013). ANew State-of-The-Art Czech Named Entity Recognizer. In I.Habernal & V.Matoušek (Eds.), Text, Speech and Dialogue (s.68–75). Berlin, Heidelberg: Springer Verlag. Straková, J., Straka, M. & Hajič, J. (2014). OpenSource Tools for Morphology, Lemmatization, POS Tagging and Named Entity Recognition. OPEN ACCESS
132 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2019 In K.Bontcheva & Z.Jingbo (Eds.), Proceedings of 52nd Annual Meeting of the Association for Computational Linguistics: System Demonstrations (s.13–18). Baltimore, MD: Association for Computational Linguistics. Zasina, A.J., Lukeš, D., Komrsková, Z., Poukarová, P. & Řehořková, A. (2018). Koditex: korpus diverzifikovaných textů. Praha: Ústav Českého národního korpusu FF UK. Dostupné zhttp://www.korpus.cz. Adrian Jan Zasina Zuzana Komrsková OPEN ACCESS