Uwe Quasthoff, Sabine Fiedler, Erla Hallsteinsdóttir (eds.): Frequency Dictionary Czech. Frekvenční slovník češtiny
Abstract
271
Full text
issn 0008-7386 © filozofická fakulta, univerzita karlova vpraze ČASOPIS PRO MODERNÍ FILOLOGII 100, 2018, Č.2, S. 271–276 UWE QUASTHOFF, SABINE FIEDLER, ERLA HALLSTEINSDÓTTIR (EDS.): FREQUENCY DICTIONARY CZECH. FREKVENČNÍ SLOVNÍK ČEŠTINY Leipzig: Leipziger universitätsverlag GmbH, 2017, 109 stran ISBN 978-3-96023-157-8 Vediční řadě Frequency Dictionaries Series nakladatelství Lipské univerzity vyšel loni již 11. svazek těchto slovníků, Frequency Dictionary Czech / Frekvenční slovník češtiny. Je dílem stejné autorsko-editorské skupiny (NLP Group) amá stejný formát jako předchozích 10 svazků, které byly publikovány vtomto pořadí: němčina (GER sv. 1), angličtina (ENG sv. 2), islandština (ISLK sv. 3). francouzština (FRA sv. 4), maďarština (HUN sv. 5), esperanto (EPO sv. 6), indonéština (IND sv. 7), ukrajinština (UKR sv. 8), ruština (RUS sv. 9) avietnamština (VIE sv. 10). Cílem série je postupně vytvořit frekvenční slovníky pro velký počet různých jazyků na základě srovnatelných frekvenčních dat. Pro mnoho ztěchto jazyků je to první ačasto jediná příležitost, jak získat frekvenční popis jejich lexika. Každý svazek se skládá ze dvou částí, tištěné brožurky avloženého CD-ROM. Brožurka obsahuje stručný popis frekvenčních dat, strukturu hesel akoncepci slovníku slovních tvarů. Dále je velmi zběžně popsán použitý korpus vzniklý zinternetových materiálů, doba sběru akroky při zpracování dat. Pro češtinu obsahuje korpus novinové texty, texty zčeské Wikipedie anejvětší počet tvoří náhodně vybrané internetové texty (podobné složení má nepochybně ivětšina ostatních jazyků). Webové rozhraní ke korpusům lze nalézt na adrese http://corpora.informatik.uni-leipzig.de. Toto korpusové rozhraní je možná zajímavější než brožurka. Ačkoli jsou možnosti vyhledávání omezené, korpusy jsou dost velké azobrazují se kolokace slovních tvarů (igraficky!). Kromě toho lze vyhledávat nejfrekventovanější prefixy asufixy— ovšem automaticky generované. Český korpus podle autorů obsahuje 198 milionů vět, všechny údaje jsou ovšem velmi přibližné (ca 18 milionů různých slovních tvarů; slovní tvar byl do slovníku zařazen, pokud se ve zdrojích vyskytl alespoň 33×). Následuje popis statistických dat získaných zvytvořených seznamů slov (včetně statistických údajů osouhláskách, samohláskách aslabikách, počtu písmenných bigramů, trigramů atd.). Tři čtvrtiny brožurky pak zabírají (a) seznam 1 000 nejčastějších slovních tvarů od nejfrekventovanějšího (tj.tvarů „ordered by rank“ 1–1000 suvedením frekvence v‰ ajejich frekvenční třídy), (b) seznam 10 000 nejfrekventovanějších slovních tvarů seřazených abecedně (suvedením frekvenční třídy; autoři pracují s22 frekvenčním třídami vymezenými na základě frekvence daného slova ve vztahu kfrekvenci nejfrekventovanějšího slova vkorpusu— spojky a; první třída 0 obsahuje 2 slova, poslední třída 21 zahrnuje 259 289 slov). CD-ROM tvořící dodatek kbrožurce obsahuje seznam slov vrozsahu 1 000 000 slovních tvarů. Pro češtinu najdeme na CD-ROMu tyto soubory: seznam 1000 000 tvarů seřazených podle frekvence ve formátu pdf (ve třech dílech) apak tentýž soubor 1 000 000 tvarů vpodobě tří seznamů ve formátu prostý text seřazených (a) podle frekvence, (b) podle abecedy a(c) podle abecedy pozpátku (atergo). Editory seznamů na CD-ROM byli František Čermák (který přispěl ipopisem existujících frekvenčních seznamů aslovníků včeštině vtištěné brožuře), Dirk Goldhahn, Uwe Quasthoff aMaciej Sumalvico. OPEN ACCESSOPEN ACCESS
272 ČASOPIS PRO MODERNÍ FILOLOGII 100, 2018, Č.2 Je třeba říci, že lipské Frequency Dictionaries, které jsou zpracovávány téměř výhradně automaticky, pracují pouze se slovními tvary aneprovádí se lemmatizace. Znamená to, že jedno atotéž slovo-lemma se vtomtéž seznamu objevuje vrůzných tvarech azvlášť smalým avelkým písmenem na začátku— pro představu, česká spojka imá ve frekvenčním seznamu pořadí (rank) 14, ale psána svelkým písmenem Ise vseznamu objevuje znovu, ale na 189 místě vpořadí. Jinak řečeno, zuváděných frekvenčních seznamů slovních tvarů se frekvence apočet lemmat dá jen těžko odhadnout. Zhlediska využití frekvenčních seznamů to samozřejmě může přinášet jistá omezení anevýhody (např.chceme-li pracovat se slovní zásobou vurčitém rozsahu ve výuce nebo sestavovat slovníkový heslář). Vpřípadě malých nebo ivětších jazyků, kde chybí know-how či peníze na vytvoření korpusu akde nejsou kdispozici jakékoli frekvenční údaje (tím spíše údaje založené na tak rozsáhlém arecentním materiálu), představují lipské frekvenční slovníky itak velký přínos. Ujazyků, jako je angličtina nebo čeština, pro které jsou již sofistikované frekvenční korpusové údaje kdispozici, budou hrát lipské frekvenční slovníky spíše jen doplňující roli. Přesto podaří-li se sestavit frekvenční slovníky standardizovanou metodou na srovnatelném materiálu pro opravdu velký okruh jazyků, může to být do budoucna podnětem pro zajímavý srovnávací výzkum. Markéta Malá | Ústav anglického jazyka adidaktiky, Filozofická fakulta Univerzity Karlovy | nám.Jana Palacha 2, 116 38 Praha 1 ORCID ID: 0000-0003-3611-8433 [email protected] OPEN ACCESS