Anatol Stefanowitsch: Corpus Linguistics. A Guide to the Methodology
Abstract
287
Full text
issn 0008-7386 © filozofická fakulta, univerzita karlova vpraze ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.2, S. 287–305 ANATOL STEFANOWITSCH: CORPUS LINGUISTICS. AGUIDE TO THE METHODOLOGY Language Science Press, 2020, 490 stran ISBN: 978-3-96110-224-2 Jazykové korpusy asnimi neoddělitelně spjatá korpusová lingvistika už nějakou dobu patří mezi základní pilíře jazykovědného bádání, které si klade za cíl popisovat reálný jazyk aodhalovat jeho rysy azákonitosti. Vprůběhu let byla okorpusovou lingvistiku ajejí status svedena nejedna argumentační bitva, fundamentálními námitkami generativistů počínaje adílčími výtkami kreprezentativnosti korpusů konče. Není proto divu, že vznikla celá řada publikací, které se snažily korpusovou lingvistiku souhrnně představit acharakterizovat iscelou její historií ateorií: zposledních let zmiňme například Hardie— McEnery (2011) nebo Biber— Reppen (2015). Kniha německého lingvisty Anatola Stefanowitsche Corpus linguistics. AGuide to the Methodology, která vyšla vloňském roce, je však vmnoha ohledech ojedinělá. Hned na první pohled zaujme apotěší, že publikace vyšla vrežimu open access, tedy zdarma dostupná pro každého ke stažení, ajak sám autor nabádá, ikpřípadnému doplnění či přizpůsobení potřebám každého zájemce. Už jen to, že autor nepovažuje svou knihu za neměnné akanonické dílo, anaopak je otevřený případným doplněním ze strany svých čtenářů, je vrámci odborné literatury velmi osvěžující přístup. Stefanowitsch, který zastává profesorský post na Freie Universität Berlin, chtěl podle vlastních slov vytvořit praktickou metodologickou příručku, jakou by on sám jako student býval ocenil, ale na trhu žádná nebyla. Stím nelze než souhlasit: podíváme-li se na repertoár korpusové literatury, najdeme buď obecné úvodní učebnice, které věnují převážnou část teorii ahistorii korpusů ainformace vnich se často překrývají (např.Biber— Conrad— Reppen, 1998; Kennedy, 1998, nebo již zmíněný Hardie— McEnery, 2011), nebo naopak specializované publikace věnující se více či méně přístupně hlavně statistickým otázkám (např.Březina, 2018), často vkombinaci skonkrétními nástroji (např.Gries, 2009; Levshina, 2015; Winter, 2019, všechny věnované statistice sR). Příručka korpusové metodologie, která by postupovala od základů apečlivě se na příkladech věnovala metodologii apraktické práci skorpusy asjejich daty, včetně možných úskalí, tu chyběla. Tato učebnice, jak oní sám Stefanowitsch důsledně mluví, je rozdělena na dvě pomyslné části. Vprvních kapitolách se autor věnuje základním metodologickým konceptům, jako je formulování výzkumné otázky, operacionalizace, odvozování kvantitativních predikcí, extrakce dat ajejich příprava/úprava, statistické vyhodnocení výsledků ajejich interpretace. Ve druhé části, od kapitoly 7 dál, pak rozebírá případové studie zvybraných okruhů lingvistiky (kolokace, morfologie, text, metafora adalší), jež byly publikovány vposledních třiceti letech alze na nich dobře ukázat popisovaný metodologický postup. Knihu doplňuje množství online materiálů, které jsou kdispozici na autorových stránkách nebo vrepozitáři na platformě GitHub. Kdo by se domníval, že už není třeba obhajovat důvody používání korpusových dat, tak by se mýlil— iStefanowitsch jim věnuje úvodní kapitolu Need for corpus data apregnantně vní shrnuje hlavní výtky aargumenty proti, protože podle něj mohou Lucie Lukešová OPEN ACCESSOPEN ACCESS
288 ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.2 dobře poukázat na ty aspekty korpusového výzkumu, které je třeba si pohlídat. Srozumitelně se vypořádává snámitkami typu, že korpusová data jsou jen úzus, že jsou neúplná, že zahrnují jen formu, anikoli význam atd. Jasně vyvrací teze považující za lepší zdroj dat intuici, ale zároveň ji ve výzkumu nezatracuje, pouze jí vymezuje patřičný prostor adůrazně doporučuje nezaměňovat ji sdaty. Vše doplňuje srozumitelnými příklady, takže ilingvistickou historií nepolíbený čtenář získá solidní přehled odůležitých protiargumentech korpusového výzkumu. Podobně není očividně možné se obejít bez definice korpusové lingvistiky, hlavně sohledem na to, že názory na její status se imezi lingvisty stále různí (velmi zjednodušeně bychom asi mohli definovat dva hlavní tábory: jeden se domnívá, že korpusová lingvistika je samostatná disciplína svlastní agendou, druhý ji považuje spíše za funkční metodologii použitelnou vmnoha lingvistických disciplínách). Stefanowitsch provádí čtenáře poctivě celým procesem hledání vlastní definice, přičemž vychází ztoho, že korpusová lingvistika je vědecká metoda, která zkoumá jazyk na základě korpusu. Na tomto místě pak zdůrazňuje základní vlastnosti korpusu (ovšem opět jen stručně ado té míry, aby mohl pokračovat ve výkladu), jako je autenticita, reprezentativnost vůči zvolené výzkumné otázce či velikost dat. Kposlední jmenované uvádí velmi trefně, že jedinou správnou odpovědí na věčnou otázku, jak velký by měl korpus být, je „To není možné říct“. Kobřím webovým korpusům, jejichž jedinou devizou je právě jejich velikost, se tak autor staví velmi rezervovaně. Čtenář vtéto kapitole ocení idoplňující avelmi jasné vymezení pojmů žánr, registr, styl či téma (s.28–29), které mohou být pro mnohé matoucí. Stefanowitsch se ke své definici korpusové lingvistiky dostává asi na pátý pokus ajedna zfinálních verzí, která mně osobně přijde nejpřístupnější, zní: Corpus linguistics is the investigation of linguistic research questions based on the complete and systematic analysis of the distribution of linguistic phenomena in alinguistic corpus (tj.korpusová lingvistika spočívá ve zkoumání lingvistických výzkumných otázek na základě kompletní asystematické analýzy distribuce lingvistických jevů vjazykovém korpusu). Vymezením korpusové lingvistiky jako vědecké metody se Stefanowitsch dostává knezbytnému prvnímu kroku: postulování vědecké hypotézy pomocí dedukce. Vysvětluje postup při formulování hypotézy azdůrazňuje, že kjejímu zamítnutí nestačí najít pár protipříkladů, ale badatel musí pracovat spravděpodobností (jak dokládá vnásledujících kapitolách). Pojmem, který si zaslouží samostatný odstavec, protože včeských vědeckých publikacích mu mnohdy nebývá věnována zasloužená pozornost, je operacionalizace. Tím se myslí postup, při němž se snažíme definovat si zkoumané konstrukty tak, aby bylo možné je najít aověřit vreálném světě (datech), což je pro empirickou práci naprosto klíčové. Stefanowitsch opět uvádí dostatek příkladů, za všechny např.různě definované slovní druhy nebo délku slova, která může vzávislosti na operacionalizaci odpovídat počtu písmen, počtu fonémů nebo třeba počtu slabik. Bez operacionalizace nelze postoupit kdalším bodům solidního korpusového výzkumu, kterými jsou extrakce dat, kvantifikace výzkumné otázky astatistické vyhodnocení dat, jimž autor věnuje následující kapitoly. Hned vúvodu knihy Stefanowitsch vysvětluje, že zpraktických důvodů vučebnici nepoužívá jeden vybraný software, ať už komerční či nekomerční. Vpodobném OPEN ACCESS
LUCIE LUKEšOVÁ 289 duchu se nese ikapitola oextrakci dat, kde autor zmiňuje různé možnosti azpůsoby, včetně programovacích jazyků jako Perl, Python nebo R.Krátce popisuje jen regulární výrazy coby univerzální prostředek, použitelný takřka všude, auvádí ičasto používaný jazyk CQL (Corpus Query Language), který je dobře znám iuživatelům Českého národního korpusu. Pozornost věnuje iužitečným pojmům precision (přesnost) arecall (pokrytí), které srozumitelně vysvětluje na příkladech hned na několika stranách (s.111–116). Vkapitole oanotaci považuji za klíčové, že se autor více než rozebírání jednotlivých typů anotačních schémat, jak bývá obvyklé, věnuje jejich spolehlivosti avůbec samotné podstatě anotace. Doslova oní mluví jako ointerpretaci dat, což je zcela zásadní, leč vpraxi často opomíjený fakt. Názorně ukazuje, jak různě mohou dva hodnotitelé posoudit tentýž lingvistický jev (s.132–133) ajak snadno se dá spočítat mezihodnotitelská shoda či reliabilita (inter-rater reliability). Následující dvě kapitoly se věnují tématům, která se mezi mnohými lingvisty netěší přílišné oblibě: kvantifikaci dat ajejich statistickému vyhodnocení. Popravdě není divu, pro humanitně orientované badatele mohou běžné statistické příručky astyl jejich psaní představovat nepřekonatelnou bariéru na cestě ke kvantitativnímu výzkumu (výjimkou jsou uživatelsky přívětivější publikace typu Volín, 2007). UStefanowitsche ale není třeba se bát, kautorovým přednostem patří srozumitelnost, systematičnost aschopnost nezahltit čtenáře zbytnými detaily apřemírou matematických vzorečků. Základní pojmy jako nominální nebo ordinální data tak díky tomu přestávají být pouhou vzdálenou teorií, ale mění se vkonkrétní lingvistické příklady, včetně přehledu vhodných způsobů jejich kvantifikace (např.relativní frekvence, naměřené v. očekávané hodnoty, medián, frekvenční seznam či průměr). Statistická kapitola je rovněž textem, který bych doporučila kpřečtení každému, koho např.termín statistická signifikance děsí (anebo jej naopak zná apředstavuje vrchol jeho statistického snažení). Stefanowitsch pro každou ze tří kategorií dat, které představil vpředchozí kapitole, uvádí jeden vhodný statistický test, který je dle jeho slov natolik jednoduchý, že se dá spočítat stužkou apapírem nebo kalkulačkou vruce, azároveň natolik robustní, aby nenapáchal příliš škody ve chvíli, kdy ho badatel použije špatně (což se, přiznejme si, stává). Jedná se ochí-kvadrát pro nominální data, Man-Whitney Utest pro ordinální data aWelchův t-test pro kardinální data. Je jasné, že na mnoho výzkumných otázek se tento výběr hodit nebude, ale jako seznámení smožnostmi statistického vyhodnocení poslouží dobře. Pro ty zkušenější pak autor uvádí ipříklady složitějšího výzkumu, vněmž figurují proměnné svíce než dvěma hodnotami nebo více než dvě proměnné. Ve zbývajících kapitolách už přicházejí na řadu případové studie zjednotlivých oblastí lingvistického výzkumu, počínaje vkorpusové lingvistice oblíbenými kolokacemi. Stefanowitsch neztrácí čas přílišnou teorií, ale důležitým charakteristikám se věnuje pečlivě (včetně přehledu aporovnání nejčastějších asociačních měr— mimochodem, ve svých analýzách vknize pak volí log-likelihood). Vrámci tématu se vždy snaží vybrat klíčové azajímavé studie aukázat na nich, jak zapadají do metodologického rámce popsaného vprvní části knihy nebo jak by šlo kproblému přistoupit jinak. Příkladem budiž známá studie M.Stubbse zroku 1995 osémantické prozódii slovesa cause (provedená ručně na datech zkorpusu LOB), jež Stefanowitschovi slouží OPEN ACCESS
290 ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.2 jako východisko kvlastní, jasně popsané analýze na datech zBNC, včetně srovnání tří různých kauzativ astatistického vyhodnocení kolokací pomocí vybrané asociační míry. Stefanowitsch nevěnuje všem zvoleným oblastem stejnou pozornost, je pochopitelné, že sním některá témata rezonují víc než jiná. Jen pro představu, zoblasti kolokací amorfologie uvádí vobou případech 6 případových studií, kdežto umetafory atextu jich nabízí 9, respektive 10, arekordmanem je gramatika, které věnuje hned 13 případových studií srůznými tématy. Zpředchozího popisu je jistě zřejmé, že tuto metodologickou příručku považuji za ojedinělý avelmi zdařilý příspěvek do pomyslné korpusové knihovny. Troufám si tvrdit, že se autorovi povedlo to, co si předsevzal— vytvořit učebnici, která na trhu chyběla. Je nabitá informacemi, apřesto si čtenář nepřijde ztracen nebo zahlcen. Iproto ji sradostí doporučuji nejen všem svým studentům, nýbrž ikolegům, kteří stejně jako já někdy potřebují spolehlivý maják (aobčas izáchranné lano) vbouřlivých vodách korpusových dat. LITERATURA Biber, D.— Reppen, R. (eds.) (2015): The Cambridge Handbook of English Corpus Linguistics. John Benjamins. Biber, D.— Conrad, S.— Reppen, R. (1998): Corpus Linguistics: Investigating Language Structure and Use. New York: Cambridge University Press. Březina, V. (2018): Statistics in Corpus Linguistics: APractical Guide. Cambridge University Press. Gries, S. (2009): Statistics for Linguistics with R: APractical Introduction. De Gruyter Mouton. Kennedy, G. (1998): An Introduction to Corpus Linguistics. Routledge. Levshina, N. (2015): How to do Linguistics with R.Data exploration and statistical analysis. John Benjamins. McEnery, T.— Hardie, A. (2011): Corpus Linguistics: Method, Theory and Practice. Cambridge: Cambridge University Press. Stubbs, M. (1995): Collocations and cultural connotations of common words. Linguistics and Education, 7, 4. 379–390. Volín, J. (2007). Statistické metody ve fonetickém výzkumu. Praha: Epocha. Winter, B. (2019). Statistics for Linguists: An Introduction using R.New York and London: Routledge. Lucie Lukešová | Ústav Českého národního korpusu, Filozofická fakulta Univerzity Karlovy | Panská 7, 110 00 Praha 1 ORCID ID: 0000-0003-1855-7141 [email protected] OPEN ACCESS