Víceslovné jednotky typické pro české akademické texty
Abstract
228
Full text
ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.2, S. 228–243 Víceslovné jednotky typické pro české akademické texty1 Dominika Kováříková (Praha)— Oleg Kovářík (Praha)— Lucie Lukešová (Praha) Dominika Kováříková— Oleg Kovářík— Lucie Lukešová MULTI-WORD UNITS IN CZECH ACADEMIC TEXTS This paper introduces Akalex, anew online tool created to support vocabulary research into Czech academic texts. The Akalex database includes close on 60 000 n-grams— candidates for typical academic words or multiword units— and it can be readily searched and filtered according to several criteria. The n-grams were extracted from the SYN2015 corpus of written contemporary Czech, based on their prominent frequency in academic texts and shared occurrence in many different academic disciplines, distinguishing them from general vocabulary on one hand and specialized terminology on the other. Each n-gram in the database is also furnished with additional information, such as part-of-speech, distribution by disciplines, frequency etc., making it possible to search for e.g. collocations with aspecific lexeme (such as adjectives combined with the word výzkum ‘research’ or verbs with acertain preposition). The features of Akalex were put to the test in our case study covering 2-grams to 6-grams used in all 24 academic disciplines included in the SYN2015 corpus. Of nearly 900 candidates, 236 were manually chosen by two annotators as typical for academic texts. These were then further analysed and split into groups based on their semantic, functional and formal features. Among the most frequent were lexical bundles, collocations with content words and combinations of two verbs pointing to afrequent use of passives in academic texts etc. KEYWORDS academic texts, academic vocabulary, multi-word units, corpus research KLÍČOVÁ SLOVA akademické texty, akademická slovní zásoba, víceslovné jednotky, korpusový výzkum DOI https://doi.org/10.14712/23366591.2021.2.4 1. ÚVOD Akademické texty slouží ke komunikaci mezi odborníky vrámci akademických disciplín, ato jak vodborných monografiích nebo ve vědeckých článcích, tak ve vysokoškolských učebnicích, ve výuce ive studentských kvalifikačních pracích. Nagy 1 Tento článek vznikl vrámci programu Progres Q08 Český národní korpus uskutečňovaného na Filozofické fakultě Univerzity Karlovy. Zároveň byl podpořen také vrámci projektu Kreativita aadaptabilita jako předpoklad úspěchu Evropy vpropojeném světě reg.č.: CZ.02.1.01/ 0.0/0.0/16_019/0000734 financovaného zEvropského fondu pro regionální rozvoj. autor fake OPEN ACCESS
DOMINIKA KOVÁŘÍKOVÁ— OLEG KOVÁŘÍK— LUCIE LUKEšOVÁ 229 aTownsend (2012) přiléhavě popisují jazyk akademických textů jako psaný (nebo imluvený) jazyk, který umožňuje komunikaci auvažování otématech konkrétního vědeckého oboru. Studenti vědeckých oborů se vrámci přípravy na akademickou dráhu musí učit pracovat spoměrně pevnou strukturou celého textu (zvláště ve vědeckých článcích), sneobvyklou podobou vět, vkterých jsou např.bohatě rozvíjeny nominální složky textu, ale také se specifickou slovní zásobou oborovou (termíny) islovní zásobou společnou většině oborů— tedy sjednoslovnými avíceslovnými jednotkami typickými pro akademické texty. Vposledních dvaceti letech projevují badatelé velký zájem právě oslovní zásobu společnou velkému množství akademických textů zrůzných oborů. Vroce 2000 byl publikován Academic Word List (Coxhead, 2000), seznam 570 akademických slov (substantiv, sloves aadjektiv), který vyvolal mnoho reakcí. Ty kritické seznamu vytýkaly mimo jiné fakt, že obsahuje pouze jednoslovné jednotky (Simpson-Vlach— Ellis, 2010; Gardner— Davies, 2014; Granger, 2017). Další výzkum se tedy začal zaměřovat ina tzv.akademické fráze nebo víceslovné jednotky, avznikly tak seznamy akademických víceslovných jednotek nebo kombinované seznamy jednoslovných ivíceslovných jednotek, např.ANew Academic Vocabulary List (Gardner— Davies, 2014), Academic Keyword List (Paquot, 2010) aAcademic Phrasebank (http://www.phrasebank. manchester.ac.uk/). Seznamy akademických slov afrází se většinou soustřeďují na angličtinu jakožto současný univerzální jazyk vědy aobvykle jsou určeny pro studenty ivýzkumníky zcelého světa, pro něž angličtina není mateřským jazykem. Stejně tak ale mohou podobné seznamy sloužit irodilým mluvčím, zvláště vysokoškolským studentům azačínajícím badatelům.2 Právě to nás vedlo ksestavení takového seznamu ipro češtinu. Seznam akademických slov afrází může napomoci plynulému vyjadřování jak vkvalifikačních studentských pracích (Chen— Baker, 2010), tak ive vysoce odborných textech, jako jsou vědecké články nebo monografie (Hyland, 2012).3 Jedním zhlavních problémů výzkumu akademického jazyka je variabilita vyhledávaných víceslovných jednotek: jejich délka může být vrozsahu dvou až šesti slov4 (výjimečně snad ivíce), může jít otzv.lexical bundles5 (Biber— Barbieri, 2007), otermíny, které se soslabenou terminologickou platností rozšířily do velkého množ2 Nutnost naučit se akademickému jazyku jakožto nesamozřejmé dovednosti vyjadřuje citát, který je často zmiňován vkontextu kurzů zaměřených na akademickou angličtinu (EAP): „Academic language is […] no one’s mother tongue.“ (Bourdieu et al., 1994, s.8). 3 Včeštině je situace velmi odlišná od angličtiny, kníž se vyjadřuje Hyland (2012); anglické seznamy akademické slovní zásoby slouží především velkému množství nerodilých mluvčích. Český seznam by však mohl sloužit jako pomůcka irodilým mluvčím při psaní odborných textů nejvyšší úrovně, pokud by obsahoval vrámci každého hesla idalší informace, například seznamy typických kolokací nebo seznamy synonym. 4 Nelze vyloučit, že existují idelší víceslovné jednotky (typické pro akademické texty), šlo by však ozcela výjimečné případy. 5 Lexical bundles jsou často opakované (velmi běžné) neidiomatické sekvence slov, které nejsou strukturně ucelené (Biber— Barbieri, 2007); jde např.ospojení to be able to, at the end of the. OPEN ACCESS
230 ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.2 ství akademických disciplín, očasté kolokace typických akademických slov, ofrekventované spojení akademického slova spředložkou nebo spojkou apod. Pro výzkum českých akademických frází jsme vytvořili aplikaci Akalex (www. korpus.cz/akalex, Kováříková— Kovářík, 2021). Tuto aplikaci lze použít při výzkumu akademické slovní zásoby, ať už se jedná ojednotky jednoslovné, nebo víceslovné. Je kdispozici iostatním badatelům, kteří se věnují problematice typické slovní zásoby akademických textů. Akalex má složku databázovou, která obsahuje snadno prohledávatelné seznamy n-gramů (slov jdoucích za sebou vrůzném počtu n) splňujících určité podmínky— zjednodušeně lze říct, že jde on-gramy, které se vyskytují častěji vakademických textech než vreferenčním korpusu. Ktěmto n-gramům jsou přiřazeny hodnoty rozličných kvantifikovatelných vlastností: jde ofrekvenční adistribuční rysy aasociační míry. Druhou složkou aplikace Akalex je seznam typických akademických slov afrází vzniklý na základě dalšího výzkumu materiálu vdatabázové složce. 2. DATA AMETODOLOGIE Vytvoření databázové součásti aplikace Akalex probíhalo vněkolika krocích. Prvním krokem bylo vytvoření vhodných subkorpusů zaktuálního reprezentativního korpusu češtiny SYN2015: subkorpusu akademických textů areferenčního subkorpusu složeného ztextů beletristických apublicistických. Druhým krokem bylo sestavení kompletního seznamu n-gramů požadovaného rozsahu (šlo o1až 6-gramy). Vdalší fázi byly všem n-gramům přiřazeny rysy, pomocí nichž lze automaticky odlišit kandidáty na typické jednoslovné nebo víceslovné jednotky. Mezi tyto rysy patří především charakteristiky založené na frekvenci n-gramů ana jejich distribuci vkorpusu (více vkap. 2.3). Výsledkem je databáze, která obsahuje jak samotné n-gramy, tak různé charakteristiky, pomocí nichž lze data prohledávat. Funkčnost databáze Akalex byla ověřena případovou studií (viz kap. 4) zaměřenou na víceslovné jednotky, ve které jsme podrobně zkoumali všechny 2až 6-gramy splňující dvě hlavní podmínky: 1.jejich frekvence je alespoň dvakrát vyšší vakademických textech než vreferenčním korpusu a2.vyskytly se ve všech 24 disciplínách rozlišovaných vkorpusu SYN2015. 2.1 DATA ZKORPUSU SYN2015 Veškerý materiál pro výzkum je čerpán zaktuálního reprezentativního korpusu psaných textů SYN2015; vjeho rámci byly vytvořeny dva subkorpusy. Subkorpus nazvaný SCI je složen zakademických textů, které jsou vkorpusu SYN2015 označeny zkratkou SCI (pro textový typ) apopiskem „odborná literatura“. Referenční subkorpus nazvaný REF obsahuje všechny beletristické apublicistické texty zkorpusu SYN2015, to jest takové, které jsou vrámci skupin textových typů označeny zkratkami FIC („beletrie“) aNMG („publicistika“). Subkorpus SCI obsahuje 13 milionů tokenů areferenční subkorpus REF má rozsah 81 milionů tokenů (vč. interpunkce). OPEN ACCESS
DOMINIKA KOVÁŘÍKOVÁ— OLEG KOVÁŘÍK— LUCIE LUKEšOVÁ 231 Vsubkorpusu SCI se rozlišuje 24 akademických disciplín, ve shodě sklasifikací oborů používanou Národní knihovnou ČR. Zařazení jednotlivých textů do oborů hraje zásadní roli ve vyhledávání jednoslovných ivíceslovných jednotek typických pro akademické texty— informace otom, vkolika akademických disciplínách se zkoumaný n-gram vyskytuje (tj.jaká je jeho distribuce voborech), je rozhodující jak pro zařazení do databáze, tak pro další výzkum. Vtabulce 1 jsou uvedeny počty tokenů vjednotlivých oborech vsubkorpusu SCI, které lze najít pomocí strukturního atributu genre „žánr/oblast“. obor počet tokenů obor počet tokenů AGR: zemědělství, chovatelství 171 227 LAN: filologie 622 298 ANT: antropologie, etnografie 425 223 LAW: právo 563 209 ART: umění, architektura 489 628 MED: lékařství 708 980 BIO: biologie 1 133 593 MUS: hudba 676 962 CHE: chemie 278 837 PHI: filozofie, náboženství 689 801 ECO: ekonomie, obchod, logistika 212 669 PHY: fyzika 627 385 EDU: pedagogika 674 414 POL: politika, vojenství 729 145 GEO: geografie, geologie 685 251 PSY: psychologie 468 837 HIS: historie, biografie 691 094 REC: sport, rekreace, hobby 382 963 ICT: výpočetní technika 136 026 SOC: sociologie 790 198 INF: knihovnictví, informatika 490 324 TEC: technika 362 925 ITD: interdisciplinární 246 295 THE: divadlo, film, tanec 679 426 TABULKA 1.Počet tokenů vjednotlivých oborech vsubkorpusu SCI (zdroj: SYN2015) 2.2 N-GRAMY PRO AKALEX Na základě zjištění předchozích výzkumů není vhodné za lexikální jednotky typické pro akademické texty považovat pouze samostatná slova, nýbrž je třeba zahrnout ivíceslovné jednotky různého typu (ať už víceslovné lexémy, typické kolokace, nebo např.spojení stypickou předložkou). Proto jsme pro databázi brali vúvahu kromě jednotlivých slov (unigramy) in-gramy odvou avíce slovech. Při práci sn-gramy jakéhokoli typu je vždy třeba učinit některá rozhodnutí, která ssebou nesou jak výhody, tak inevýhody. Především je třeba zvolit, zda pro n-gramy používat lemmata coby základní slovníkové tvary, nebo konkrétní slovní tvary, azda brát vúvahu interpunkci. Vrámci databázové části Akalexu jsme se rozhodli používat lemmata, anikoli slovní tvary. Výhodou tohoto přístupu především uvysoce flektivní češtiny je, že n-gram získá spojením několika podob na frekvenci avyjeví se tak lépe jeho typičnost. Nevýhodná je naopak nutnost používat předpřipravenou lingvistickou interpretaci OPEN ACCESS
232 ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.2 vpodobě lemmatizace, která může být nespolehlivá nebo zavádějící. Dalším úskalím je poněkud složitější interpretace konkrétních n-gramů, jejichž typické tvary často nemůžeme odhadnout intuitivně— tuto nevýhodu jsme ale částečně eliminovali doplněním nejčastějšího tvaru příslušného n-gramu do databázového záznamu. Vyhledané n-gramy nepřekračují hranici věty, ale samotná interpunkční znaménka označující konec věty (zvl. tečka) nejsou do n-gramů zahrnována. N-gramy neobsahují ani neukončující interpunkční znaménka. Týká se to zvláště čárek, jejichž odstraněním můžeme získat spojení se spojkami, např.(vyplývat) že nebo (otázka) zda. Zvlášť vjazycích, jako je čeština, je také třeba mít na paměti, že volný slovosled může ztížit interpretaci výsledků založených na n-gramech. Tuto otázku jsme se však rozhodli při vytváření této databáze zanedbat. Po přidělení hodnot vybraných rysů jednotlivým n-gramům (viz dále) jsme původní velice rozsáhlý seznam n-gramů dramaticky zkrátili— vdatabázi Akalex jsou obsaženy pouze takové n-gramy, které splňují dvě základní podmínky: vyšší frekvence oproti textům vreferenčním korpusu arelativně vysoká distribuce voborech (více vkap. 2.4). 2.3 POUŽITÉ RYSY Na základě předchozích výzkumů slov avíceslovných jednotek vakademických textech (jak akademických frází, tak terminologie) jsme identifikovali několik rysů, které se osvědčily při automatické identifikaci těchto jednotek (Kováříková, 2017; Kováříková— Kovářík, 2019). Jde především ovlastnosti frekvenční adistribuční, vpřípadě víceslovných jednotek (bigramů atrigramů) jsou kdispozici iasociační míry sloužící kidentifikaci kolokací. Kromě toho jsme do databázové části zařadili iinformaci oslovním druhu jednotlivých členů n-gramů aonejfrekventovanějším tvaru daného n-gramu. Poslední dva údaje jsme využili především při lingvistické interpretaci vpřípadové studii (kap. 4). Přehled rysů využívaných vdatabázi Akalex: Poměr frekvencí. Poměr frekvence vsubkorpusu akademických textů SCI avreferenčním subkorpusu beletristických apublicistických textů ukazuje, kolikrát častější je daný n-gram vakademických textech oproti textům jiného typu. Pokud je tedy hodnota tohoto rysu např.10, znamená to, že n-gram je 10x častější vakademických textech, je pro ně tedy typický (Kováříková, 2017, s.38). Distribuce je údaj otom, vkolika z24 oborů, které jsou kdispozici vsubkorpusu SCI, se n-gram vyskytuje. Čím je distribuce vyšší, tím šířeji je n-gram používaný, atím vyšší je pravděpodobnost, že se může jednat oakademickou frázi. Naopak nízká hodnota tohoto rysu ukazuje spíše na to, že se jedná on-gram terminologický, tedy specifický pro určitou disciplínu nebo malé množství příbuzných disciplín— do seznamu obecných akademických frází bychom ho tedy primárně neřadili (tamtéž). OPEN ACCESS
DOMINIKA KOVÁŘÍKOVÁ— OLEG KOVÁŘÍK— LUCIE LUKEšOVÁ 233 Disperze coby další distribuční charakteristika ukazuje, jak rovnoměrně je zkoumaný n-gram rozložený vjednotlivých oborech, které jsou kdispozici vsubkorpusu SCI. Čím nižší je hodnota disperze, tím rovnoměrněji je n-gram rozložen vdisciplínách, atím vyšší je tedy pravděpodobnost, že jde oakademickou frázi. Disperze vhodně doplňuje údaj odistribuci. Může se totiž stát, že nějaký n-gram se vyskytne ve vysokém počtu disciplín, ovšem svelmi rozdílnou frekvencí— takový bigram bude sice mít vysokou distribuci, ale na druhou stranu ivysokou hodnotu disperze. Nás zajímají především n-gramy svysokou distribucí anízkou disperzí, tedy takové, které se vyskytují vmnoha oborech aobjevují se vnich spodobnou frekvencí. Asociační míra PMI (pointwise mutual information; kdispozici pouze pro bigramy atrigramy). Asociační míry jsou matematické postupy pro vyhledávání kolokací vkorpusech— zjišťují, která slova se spolu vyskytují častěji, než odpovídá náhodnému souvýskytu (Church— Hanks, 1990). Nejčastější tvar (vAkalexu pouze zkráceně „tvar“) je slovní tvar daného n-gramu vyskytující se vakademických textech snejvyšší frekvencí. Tento údaj je velmi užitečný především při interpretaci výsledků. Vněkterých případech nám nejčastější tvar může napovědět, že daný n-gram je ve skutečnosti součástí delšího n-gramu (např.bigram následující kapitola má nejčastější tvar následující kapitole, je totiž součástí frekventovaného trigramu vnásledující kapitole), jindy je nejčastější tvar klíčem kporozumění n-gramu (např.bigramy být vyjádřit, na příklad nebo vrámec mají nejčastější tvary je vyjádřen, na příkladu avrámci). POS, slovní druh jednotlivých členů n-gramu. Určení slovního druhu všech součástí zkoumaných n-gramů může velmi dobře posloužit při vyhledávání vdatabázi. Můžeme například vyhledat všechna spojení slovesa stypickou předložkou nebo spojení substantiva stypickým přívlastkem (tj.předcházejícím adjektivem). Při analýze dat můžou být označené slovní druhy jedním zkritérií třídění (viz případovou studii vkap. 4). 2.4 KRITÉRIA PRO ZAHRNUTÍ N-GRAMŮ DO DATABÁZOVÉ SOUČÁSTI AKALEXU Do databáze byly zahrnuty pouze takové n-gramy, které splňují dvě základní podmínky: 1. hodnota poměru frekvencí je alespoň 2, n-gram je tedy alespoň dvakrát častější vakademických textech než vreferenčním korpusu beletristických apublicistických textů; 2. hodnota distribuce je alespoň 8, to znamená, že se n-gram vyskytuje minimálně ve třetině oborů rozeznávaných vsubkorpusu SCI. Tyto minimální hodnoty zajistí, že zobrovského počtu n-gramů, které lze extrahovat ze subkorpusu SCI, bude do databáze zahrnuto pouze zpracovatelné množství OPEN ACCESS
234 ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.2 n-gramů, unichž je navíc vyšší pravděpodobnost, že nejde ani oobecně rozšířená slova nebo kombinace, ani otermíny (ty se vyskytují spíše vmalém množství oborů). 3. DATABÁZOVÁ SOUČÁST AKALEXU: ZDROJ PRO ZKOUMÁNÍ AKADEMICKÝCH LEXIKÁLNÍCH JEDNOTEK Databáze Akalex je určena ktomu, aby sloužila kvýzkumu akademické slovní zásoby češtiny, ato jak jednotek jednoslovných, tak víceslovných, ale ikzachycení dalších jevů, jako je například typická valence nebo běžné kolokáty vakademické češtině. Obsahuje 1až 6-gramy, které jsou alespoň dvakrát častější vakademických textech než vtextech jiného typu akteré se vyskytují alespoň vosmi akademických oborech. Tím je zajištěno, že databáze obsahuje zpracovatelné množství n-gramů, unichž už existuje předpoklad, že by se mohlo jednat oakademickou lexikální jednotku nebo frázi. Vdatabázi je kdispozici celkem zhruba 57 tisíc n-gramů. Největší část, téměř dvě třetiny celého materiálu, tvoří bigramy. Počet různých typů n-gramů je uveden vtabulce 3. 3.1 INFORMACE OBSAŽENÉ VDATABÁZOVÉ ČÁSTI AKALEXU Kromě samotných n-gramů jsou vdatabázi kdispozici informace on-gramech, které mohou sloužit kvyhledávání, třídění nebo vytváření seznamů podle zadaných podmínek. Mezi tyto informace patří nejčastější tvar celého n-gramu, slovní druh jednotlivých členů n-gramu, poměry frekvencí, distribuce voborech, disperze voborech aasociační míra PMI (pro bigramy atrigramy). Jednotlivé položky jsou podrobněji popsány vkap. 2.3. Jejich přehled je kdispozici vtabulce 2. Rys nebo informace (pořadí dle databáze) Popis Tvar nejčastější tvar n-gramu vakademických textech POS1, 2, … slovní druh první, druhé (popř. další) složky n-gramu Poměr frekvencí kolikrát je n-gram častější vakademických textech než vjiných typech textů (beletrie, publicistika) Distribuce vkolika oborech se n-gram vyskytl alespoň jednou Disperze jak rovnoměrně je n-gram rozložený voborech PMI jak silná je kolokace (jen pro bigramy atrigramy) TABULKA 2.Informace on-gramech dostupné vdatabázi Akalex 3.2 NASTAVENÍ PRAHOVÝCH HODNOT Problémem při automatickém vyhledávání akademických lexikálních jednotek (aobecně při automatickém vyhledávání na základě nějakých vybraných rysů) je naOPEN ACCESS
DOMINIKA KOVÁŘÍKOVÁ— OLEG KOVÁŘÍK— LUCIE LUKEšOVÁ 235 stavení prahových hodnot.6 Není jednoduché posoudit, zda by mezi akademické lexikální jednotky měly být zahrnuty pouze n-gramy snejvyšší možnou distribucí (24), nebo n-gramy vyskytující se alespoň ve dvou třetinách oborů (16), případně vpolovině oborů (12) atd. Podobně nelze jednoduše rozhodnout, zda lexikální jednotky typické pro akademické texty budou imezi n-gramy dvakrát, nebo až třikrát či víckrát frekventovanější vakademických textech než vtextech jiného typu. Vpodstatě jde vždy orozhodnutí, zda chceme najít velké množství akademických lexikálních jednotek, aspolu snimi ivelké množství šumu (zaměřujeme se na pokrytí— recall7), nebo jestli budeme vzadávání prahových hodnot přísnější, protože chceme výsledky bez šumu, tj.označené n-gramy budou skutečně akademické lexikální jednotky, ovšem stím, že jich objevíme jen menší množství, mnohé zůstanou nerozpoznány (zaměření na přesnost— precision). Pokud se např.rozhodneme, že nastavíme poměrně přísné podmínky, tedy že nás zajímají všechny n-gramy, které se vyskytují minimálně ve 20 oborech, spoměrem frekvencí alespoň 6 asdisperzí ohodnotě menší než 1, pak se vyhledá jen menší množství n-gramů, znichž ale vysoké procento skutečně budou akademické lexikální jednotky. Ivpřípadě poměrně přísného nastavení je ale nutná ruční kontrola, jak je to uautomatického vyhledávání obvyklé. Pokud ale snížíme požadavky, např.vezmeme vúvahu in-gramy spoměrem frekvencí alespoň 2, které se vyskytují v16 oborech, výsledky sice bude náročnější zpracovat, protože budou obsahovat větší množství n-gramů, které je nutno zkontrolovat, ale na druhou stranu získáme některé platné akademické lexikální jednotky, které by nám jinak zůstaly skryty. Rozhodnutí, jestli se soustředit na vyšší precision, nebo recall, záleží mimo jiné na výzkumném úkolu. Chceme-li vytvořit stručný seznam velmi rozšířených aspolehlivých akademických lexikálních jednotek, budeme nastavovat přísnější podmínky (precision). Pokud je naším záměrem vytvořit obsáhlý seznam jakožto základ slovníku akademických lexikálních jednotek, tedy budeme požadovat spíše stovky až tisíce jednotek (recall), můžeme snížit prahy jednotlivých charakteristik, ovšem čeká nás větší množství ruční práce, aby byl seznam spolehlivý. Databáze Akalexu je vytvořena tak, aby si každý badatel mohl prahové hodnoty nastavit podle vlastních představ akonkrétního výzkumného úkolu. 3.3 VYHLEDÁVÁNÍ PODLE LEMMATU NEBO SLOVNÍHO DRUHU Vdatabázi lze vyhledávat ikonkrétní lemmata nebo části lemmat. Tímto způsobem můžeme vyhledávat především typické kolokáty určitého slova, které jsou specifické pro akademické texty. 6 Jednou zmožností, jak najít vhodné nastavení prahových hodnot, je zjišťování prostřednictvím strojového učení nebo data miningu, jaké kombinace hodnot různých rysů přinášejí nejlepší výsledky (více vKováříková, 2017, aKováříková— Kovářík, 2019). 7 Precision arecall jsou standardní evaluační statistické míry (viz např.Manning— Schütze, 2000). OPEN ACCESS
236 ČASOPIS PRO MODERNÍ FILOLOGII 103, 2021, Č.2 Příkladem může být vyhledání slov pojících se se slovem odvodit. Vzáložce 2-gramy zadáme do rámečku pod nadpisem LEMMA1 sloveso odvodit. Výsledkem jsou čtyři bigramy stěmito nejčastějšími tvary: odvodit z, odvozen od, odvodit že, odvodit i. Vtomto případě nás budou zajímat první tři bigramy, protože obsahují typickou předložku nebo typickou spojku. Čtvrtý bigram není zhlediska zkoumání akademických lexikálních jednotek zajímavý, což lze ověřit ivyhledáním tohoto bigramu vkorpusu, např.vSYN2015. Pokud sloveso zadáme do rámečku pod nadpisem LEMMA2, budou výsledkem další čtyři bigramy: je odvozen, lze odvodit, (je) možné odvodit, můžeme odvodit. Vtomto případě nás zajímají všechny čtyři bigramy. První napovídá, že sloveso odvodit se vakademických textech často vyskytuje vtrpném rodě, další tři zase ukazují na modalitu, která je se slovesem vmnoha případech spojená. Další možností je vyhledávat určité slovní druhy, například spojení slovesa se spojkou. Do rámečku pod nadpisem POS1 zadáme V, pod POS2 zadáme J (značky slovních druhů se shodují se značkami vkorpusech řady SYN). Výsledků je vtomto případě pochopitelně daleko větší množství, zhruba 600 řádků. Prvních 8 položek vtomto seznamu má tyto nejčastější tvary: definována jako, označuje jako, charakterizovat jako, chápat jako, jeví jako, je tudíž, vyplývá že, (se)8 ukazuje že. Sedm ztěchto položek je pro nás zajímavých, jde oslovesa, která se pojí stypickou spojkou, vtomto případě jako nebo že. Položka je tudíž je pak pouhým spojením obecně vysoce frekventovaného slova (být) aspojky velmi frekventované vakademických textech (tudíž). Obojí typ vyhledávání lze ještě zkombinovat například tak, že vyhledáme typická adjektiva (přívlastky) pro vybrané substantivum. Pro substantivum analýza tak získáme 6 předcházejících adjektiv, která se vyskytují alespoň vdeseti disciplínách: podrobná, detailní, kritická, další, hlubší, následná analýza. 3.4 EXPORT DAT Kompletní seznamy n-gramů obsažených vdatabázi společně sdoplňujícími informacemi onejčastějším tvaru, slovních druzích afrekvenčních adistribučních charakteristikách lze pomocí jediného tlačítka exportovat do formátu .csv, zkterého se snadno vytvoří např.excelová tabulka. Stejně tak je možné exportovat pouze části seznamů, nějakým způsobem tříděné nebo omezené: například všechna adverbia následovaná slovesy, nebo všechny 4-gramy vyskytující se alespoň ve dvaceti oborech, nebo všechny adjektivní 1-gramy alespoň desetkrát častější vakademických textech než vjiných typech textů. 3.5 PROPOJENÍ SKORPUSEM SYN2015 Jednotlivé n-gramy vdatabázi Akalex jsou propojeny skorpusem SYN2015— pokud tedy uživatel chce ověřit kontext, vjakém se daný n-gram skutečně používá vakademických textech, může tak učinit jediným klikem (tlačítko Zobrazit výskyty). 8 Vpřípadě, že se sloveso obvykle vyskytuje sreflexivním zájmenem se (ať už jde oreflexivní sloveso, nebo opasivní tvar), přidáváme vtéto práci po ověření ve vyšších n-gramech vdatabázi Akalex zájmeno se do závorky při uvádění příkladů. OPEN ACCESS
DOMINIKA KOVÁŘÍKOVÁ— OLEG KOVÁŘÍK— LUCIE LUKEšOVÁ 243 Oleg Kovářík | Datamole, s. r. o. | Banskobystrická 11, 160 00, Praha 6 [email protected] Lucie Lukešová | Ústav Českého národního korpusu, Filozofická fakulta Univerzity Karlovy | Panská 7, 110 00 Praha 1 ORCID ID: 0000-0003-1855-7141 [email protected] OPEN ACCESS