Partikule vPražském mluveném korpusu Ana Adamovičová ABSTRACT: Particles in Prague Spoken Corpus. The article deals with particles, usually considered to be aresidual part of speech, and strives to come to some general conclusions on occurrence and frequency of particles as well as their function in common spoken language. The basic source is the reference Prague Spoken Corpus (PSC) which is apart of the Czech National Corpus. The fact that particles are after verbs and pronouns the third most frequent word in spoken Czech appears for the first time in the Frequency Dictionary of Spoken Czech based on the PSC. This finding demands new tasks on linguists, especially more detailed description of this so frequently used part of speech, which hasn’t been so far thoroughly analyzed on the basis of true authentic data. PSC provides the unique possibility to describe functions and the meaning of particles in the direct authentic context and usage, where they naturally appear. Large contextual scope is the decisive criterion for their identification. Description of particles requires apractical approach and by analyzing their real occurrence and co-occurrence one can prove, deny or change all theoretical premises. What we haven’t found in the corpus is also apositive knowledge— the prove that in the corpus with asize of almost three quarter million tokens aparticular word didn’t appear. The article presents all types of particles which appear in the corpus and provides both its quantitative analyses dealing with original particles as well as with those homonymous with other parts of speech. It also deals with the existing processing of particles in various linguistic manuals. KLÍČOVÁ SLOVA / KEY WORDS: částice, frekvence slov, homonymní slova, korpusová lingvistika, kvantitativní analýza, mluvený jazyk, partikule, slovní druhy corpus linguistics, frequency of words, homonymous words, particles, parts of speech, quantitative analysis, spoken language 0 ÚVOD Článek pojednává opartikulích, tradičně zbytkovém slovním druhu, apokouší se dobrat některých obecnějších závěrů ojejich výskytu afrekvenci vběžně mluveném jazyce. Vprvní části článku se stručně poohlédneme za zpracováním partikulí vněkterých vybraných příručkách. Vdalší části představíme Pražský mluvený korpus (PMK) akonečně vtřetí části se zaměříme na popis druhů partikulí vyskytujících se vPMK. 1 SLOVNÍ DRUH PARTIKULE Opartikulích jako oslovním druhu se začalo uvažovat poměrně pozdě: např.první řecké gramatiky, které převzali staří Římané, uváděly jen osm slovních druhů, mezi OPEN ACCESS
ANA ADAMOVIčOVá 89 nimiž se partikule ještě nevyskytovaly.1 Ve 4. století byl člen, původní slovní druh vyskytující se vstarořeckých gramatikách, nahrazen interjekcemi. První zmínka opartikulích se objevuje vČíně, ato dost pozdě, až ve 14. století. Nicméně právě čínský spis opartikulích se považuje za první, alespoň částečný pokus osepsání první čínské gramatiky— do té doby se čínští jazykovědci věnovali hlavně zvukové stránce jazyka, popisu tónů aintonace. Musíme však mít na zřeteli, že partikule včínštině nebo vjaponštině nelze srovnávat spojetím partikulí, které je rozšířeno vEvropě. Do evropské lingvistiky se úvahy opartikulích dostávají až začátkem 20. století, ato spíše okrajově. Většinou se za ně označuje jen několik málo slovních tvarů, sjejichž popisem či zařazením do jazykového systému si jazykovědci nevěděli rady. 1.1 NĚKOLIK POZNáMEK KSOUčASNÉMU STAVU BáDáNí Během posledních čtyřiceti let přístup kpartikulím, slovnímu druhu postiženému syndromem „odpadkového koše“ (Čermák, 2008, s.63), bezesporu zaznamenal pozoruhodný vývoj, který však zatím ještě nebyl zcela systematicky zpracován. Průlom vnahlížení na partikule přináší až orientace lingvistiky kpragmatice aběžně mluvenému jazyku. Genezi tohoto přístupu ke zkoumání jazykových dat ajejich funkcí ve větě lze patrně hledat vjiž poměrně dávné minulosti, asice včasovém horizontu zhruba první poloviny azačátku druhé poloviny 20. století. Vtěchto souvislostech je jistě třeba zmínit de Saussura aWittgensteina— vzpomeňme jejich známé výroky „vmluvě se nalézá zárodek všech změn“, které se postupně dostávají „do obecného úzu“ (de Saussure, 1996, s.125), a„význam slov je vjejich užití“ (Wittgenstein, 1993, s.34–43)— anebo Austina aSearla sjejich teorií mluvních aktů zasazených do kontextu promluvy. Při postupném odklonu lingvistiky od gramatiky (morfologie či syntaxe) azvýšené orientaci na sémantiku, pragmatiku atextovou lingvistiku se začalo uvažovat o komunikačních funkcích jazyka, na jejichž realizaci se ve velké míře podílejí též partikule. Začátkem sedmdesátých let minulého století si ve světle nových teorií ičeští lingvisté uvědomili, že modální adverbia mají ve větě především funkci postojovou, atak se znich staly modální partikule (Bauer— Grepl, 1972). Vosmdesátých letech vychází 2. díl tzv.akademické Mluvnice češtiny (MČ2), vněmž se řady partikulí rozšířily odalší desítky příkladů (Uličný, 1986). Grepl (2011) vdevadesátých letech vydává sérii přednášek Co děláme, když mluvíme, vnichž také pojednává omluvních aktech apartikulích. Vpolovině devadesátých let azačátkem nového tisíciletí vycházejí další práce— Příruční mluvnice češtiny (PMČ), partikulím se zde věnuje Nekula, aEncyklopedický slovník češtiny (ESČ), kde hesla opartikulích zpracovávají Grepl aNekula. Takto mohutný vývoj se koncem sedmdesátých let do jisté míry odrazil ivlexikografické rovině: vSSČ (1978) se řada adverbií přehodnocuje na partikule. Partikule jsou však vrůzných příručkách definovány často nejednotně aněkdy inahodile. ESČ (2002, s.62) to přímo připouští, když je označuje za „jeden ze slov1 Ačkoli se nevyskytovaly vgramatikách, dnes už máme důkazy, že se onich vědělo, srov.např.Wiktionary, seznam Ancient Greek Particles, vněmž se uvádí, že je jich alespoň20, apětisvazkový sborník Particles in Ancient Greek Discourse (Bonifazi— Drummen— de Kreij, 2016). OPEN ACCESS
90 STUDIE ZAPLIKOVANÉ LINGVISTIKY ních druhů, který je vymezován velmi různě“. PMČ (1995, s.358) uvádí, že částice jsou „slova se synsémantickým významem nezahrnující předložky aspojky“. Tato poslední definice jednak obsahuje jistý protimluv, asice „synsémantický význam“, jednak vyznívá tak, že se, na rozdíl od předložek aspojek, okterých nejspíš víme, jaký mají význam afunkci, opartikulích totéž říci nedá. Dalším problémem při určování partikulí je splývavá, nejasná hranice mezi partikulemi adalším „zbytkovým“ slovním druhem, interjekcemi, na což trefně ve své studii upozornil M.Vondráček (1998). Kromě nejednotného přístupu je mnohem vážnějším problémem skutečnost, že příklady uváděné pro ilustraci jednotlivých tezí vycházejí zteorie, která však nebyla empiricky ověřena vúzu, ovšem také skutečnost, že se kpragmatice přistupuje zrůzných východisek. Zlom, který do lingvistiky vneslo korpusové zpracování jazykových dat, je tak obrovský, že právem lze mluvit omezníku rozdělujícím lingvistická bádání na éru před vznikem korpusové lingvistiky ana éru zahájenou po jejím vzniku. Korpusový materiál je také nepřeberným zdrojem dat poskytujícím cenné informace právě při studiu partikulí. 1.2 VYMEZENí PArTIKULí Klíčem klepší či přehlednější strukturaci partikulí je hledisko, vněmž se prolíná funkčně-formální přístup: funkce vpromluvě je prezentována jistou formou. Máme-li už zjištěnou formu avyjdeme-li zní, dostaneme se znovu kfunkci ozřejmené ozpůsob užití, kontext, význam, valenci azačlenění do textu/promluvy. Tam se ukáže ionen sémantický posun, ke kterému dochází při slovnědruhové transpozici, která vznik partikulí často provází. Jde především odva procesy: procesy lexikalizace gramatických slov (co když, jen aby, ještě že, už aby apod.) aprocesy delexikalizace (pragmatizace) autosémantik (čistě, prostě, klidně, pomalu, rozhodně apod.). Partikule jsou jistými pragmatickými komentáři, referujícími formálně isémanticky krozličným aspektům promluvy/textu, kpostojům mluvčího, často však ikširší mimojazykové situaci (Čermák, 2008, s.66). Obecně vzato by se dalo říct, že je partikule specifickým „kořením“ jazyka amá, na rozdíl od adverbia, především komunikační význam, který se realizuje vkontextu. Zároveň je třeba zdůraznit, že se partikule, na rozdíl od interjekce, nikdy nevyskytuje samostatně, nýbrž vkombinaci sdalším slovem (adlexémové partikule) či větou (adpropoziční partikule) apřitom může stát na různých místech vpromluvě. 2 PRAŽSKÝ MLUVENÝ KORPUS Pražský mluvený korpus (PMK), který začal vznikat koncem 80. let minulého století, je prvním korpusem mluvené češtiny zachycujícím autentický aspontánní mluvený jazyk. Budování PMK začalo na popud F.Čermáka, který již delší dobu pociťoval potřebu systematicky, důsledně ataxativně popsat mluvený jazyk jakožto „primární zdroj komunikace azdroj jazykových změn zakládajících jeho vývoj“ (Adamovičová— Čermák— Pešička, 2008, s.7). OPEN ACCESS
ANA ADAMOVIčOVá 91 2.1 PrVNí FáZE PrOJEKTU Na začátku projektu bylo pořízeno 304 nahrávek2 obsahujících přes 15 015 promluv, čímž vzniklo 7600 minut nahraných monologů adialogů, tj.316 hodin mluveného projevu. Při nahrávkách byly pořízeny jak formální rozhovory čili řízené podle předem připraveného scénáře (193 nahrávek), tak rozhovory neformální čili neřízené, spontánní (103 nahrávek). Formální nahrávky neboli monology vycházely zdotazníku zaměřeného na zachycení názorů respondentů na otázky týkající se běžného života: škola, vzdělávání, práce, postavení žen na pracovišti, manželství, rodina, výchova dětí, mezilidské vztahy, život ve městě vs. život na venkově, šťastný aúspěšný život apod., vdruhé vlně nahrávání po změně politického klimatu vr. 1989 přibyly otázky opodnikání acestovním ruchu. Neformální nahrávky neboli dialogy jsou volným rozhovorem dvou respondentů, kteří se dobře znají, na jakékoli téma. Jde tedy oprototypickou mluvní situaci— neformální, nepřipravenou adialogickou. Respondentům (vúhrnu jich bylo 504: 287 žen a217 mužů) byla zaručena anonymita anebyl jim předem sdělen účel (tj.ryze jazykový výzkum), za jakým se nahrávky pořizují. Mnozí se tak domnívali, že jde ojakési sociologické či sociolingvistické šetření zaměřené na názor dotazovaných na běžná témata zosobního, pracovního aspolečenského života. Přestože se většina mluvčích dokázala uvolnit arozpovídat, přítomnost nahrávacího zařízení pro některé zrespondentů byla nicméně stresujícím faktorem, mnohem častěji však vzačátcích natáčení, kdy roli hrála ivšeobecně panující nedůvěra (před rokem 1989), což se nejednou odrazilo vtom, že respondenti mluvili více spisovně astrojeně, více se hlídali, uněkterých byl dokonce patrný istrach mluvit otevřeně. Vdruhé vlně nahrávání vpolovině devadesátých let se tyto obavy respondentů celkem rozplynuly, atak nahrávky působí poněkud přirozeněji. Pro úplnost je ještě potřeba dodat, že se při kombinaci dalších sociolingvistických parametrů, jako jsou věk avzdělání respondentů, včetně typu promluvy, dbalo ojejich maximální vyváženost. 2.2 DrUHá FáZE PrOJEKTU Ve druhé fázi projektu byly všechny pořízené nahrávky přepsány do počítače maximálně věrně, což bylo časově velmi náročné. Při přepisu se hlavně dbalo na to, přenést do psané podoby každý zvuk, včetně hezitačních, různé odchylky ve výslovnosti, delší či kratší odmlky mluvčího, zánik kvantity apod. Rozhodující slovo však měl přepisovač, atak to, zda polodélku zachytil jako délku, či nikoli, záleželo pouze na jeho posouzení. Asimilace souhlásek se však nezaznamenávala (mělo se zapisovat výlučně např.radši; vkorpusu se však ojediněle vyskytují itvary rači). Počítačový přepis má tedy spíše fonologicko-morfologický charakter, aje tudíž snadno čitelný ipro méně zasvěceného uživatele. Hlavním důvodem takto zvolené přepisovací strategie bylo výhledové zařazení PMK do databáze Českého národního korpusu (okterém se vté 2 Původně bylo nahrávek mnohem více, avšak řada znich musela být zdalší fáze zpracovávání materiálu vyřazena pro špatnou kvalitu zvuku způsobenou nedokonalým nahrávacím zařízením. OPEN ACCESS
92 STUDIE ZAPLIKOVANÉ LINGVISTIKY době teprve uvažovalo). Přepis je takto kompatibilní spsanými korpusy, na druhou stranu však obsahuje méně informací suprasegmentálního charakteru, než je pro některé, především novější mluvené korpusy běžné. Takto vlastně vznikl Pražský mluvený korpus, který můžeme označit za referenční, tj.stálý, uzavřený aneměnící se (detailněji viz FSMČ, 2007, s.11–35). 2.3 TřETí FáZE PrOJEKTU Ve třetí fázi projektu se přistoupilo kanotaci takto získaného materiálu na základě kódovníku, který pro tyto účely sestavil F.Čermák. Šlo oruční označení každého slova až jedenáctimístnými kódy poskytujícími především úplnou morfologickou informaci, včetně široce pojaté valence afunkce, částečně také syntaktickou informaci3 aúdaj ostylové charakteristice promluvy. Celý materiál obsahuje více než 7 milionů indexů. Pražský mluvený korpus je tedy první český korpus, který nabízí plné, systematické apečlivě ověřované tagování všech svých forem. Pro časovou náročnost celé práce byla část korpusu okódována jen redukovaně, tj.označena jen tříaž čtyřmístnými kódy. Vedle deseti slovních druhů byly také označeny ablíže zařazeny icitátové výrazy jednoslovné ivíceslovné (CV), neslovní zkratky (ZKRAT), propria (PROP) afrazémy (IF). Byly také poprvé označeny všechny víceslovné analytické gramatické formy (abych šel, kdyby pršelo atd.), jakož idalší víceslovné výrazy včetně partikulí (PAR), víceslovných spojek (CONJ) afrazémů. Identifikace aoznačení frazémů vycházejí ze zpracování frazeologie ve Slovníku české frazeologie aidiomatiky. Velmi pracná ruční anotace oproti mnohem běžnějšímu automatickému tagování má bezesporu výhody právě vpřípadě zkoumání partikulí: vzhledem kvysokému procentu homonymních tvarů řady partikulí sdalšími slovními druhy je jejich automatická identifikace jinde dosti nepřesná. Autoři modifikovaného analyzátoru Ajka pro anotaci mluvených korpusů (Hlaváčková— Osolsobě, 2008, s.111) uvádějí, že např.kslovnímu tvaru tak analyzátor přiřadí až čtyři možné interpretace— adverbium, spojka, citoslovce nebo částice— [tag="k6"] [tag="k8"][ tag="k9"][ tag="k0"], což bez časově náročné kontextové amanuální analýzy nelze úspěšně disambiguovat, tj.zjednoznačnit. Otázkou zůstává, zda vůbec, anebo do jaké míry, lze pro trénovací korpus jednoznačně postihnout všechny kontextové výskyty řady partikulí, což by 3 Ksyntaktické informaci nutno podotknout, že ačkoli se sjejí analýzou při sestavování kódovníku původně počítalo, vpraxi se od toho zvětší části upustilo, neboť se rozdíly vsyntaxi mluveného apsaného jazyka ukázaly být tak velké, že se syntax psaného jazyka, obzvlášť na úrovni větněčlenské kategorizace, pro analýzu jazyka mluveného stala jen stěží použitelnou. Vznikaly mj. různé problémy související nejen soznačením hranice věty vsouvislém proudu vyprávění, ale také sjejím vnitřním členěním aodlišnou větnou perspektivou mající často eliptický ráz. Není to nic překvapivého: každý korpus, obzvlášť však mluvený, je vzásadě pestřejší abohatší než sebelépe navržený systém značek. Proto také uřady kategorií přibyly značky— jiné, příp. jiné/nejasné, nebo nelze určit, které byly poměrně často obsazovány, ačkoli se ještě, pokud je nám známo, nikdo popisu těchto problémových kategorií nevěnoval. OPEN ACCESS
ANA ADAMOVIčOVá 93 mohlo značně zvýšit úspěšnost automatické disambiguace. Při další analýze materiálu bychom se však měli dobrat některých konkrétních návrhů na zlepšení automatického rozpoznání partikulí. PMK se stal podkladem pro vytvoření Frekvenčního slovníku mluvené češtiny (FSMČ), vydaného nakladatelstvím Karolinum vroce 2007. Slovník obsahuje 780 322 pozic včetně interpunkcí, po jejichž odečtení máme přesně 644 909, respektive 548 091 slov (první číslo udává počet všech tvarů včetně tvarů vázaných ve víceslovných spojeních; komponenty vázané na výskyt ve víceslovných jednotkách mají 96 818 výskytů). VPMK najdeme 46 798 různých slov, tj.lemmat, respektive 30 570 slov (opět po odečtení vázaných slov). Cílem projektu PMK–FSMČ bylo vůbec poprvé souvisle avyčerpávajícím způsobem zmapovat autentickou mluvenou češtinu anezkresleně představit její jádro— obecnou češtinu. Korpus má přídomek „pražský“, protože se vycházelo zpředstavy, že Praha, vzhledem ke svému centrálnímu postavení, svým způsobem reprezentuje běžnou českou mluvu vČechách azčásti ina Moravě, mj. ivzhledem kmnožství původem mimopražských Pražanů. PMK díky této strategii— systematickému pokrytí jazykové oblasti obohacenému ointenzivní anotaci— skýtá zcela ojedinělý obraz české mluvené situace zkonce 20. století, přičemž odráží jak jazyk předchozího společenského uspořádání, tak začátek nového. Přestože lze namítat, že je daný rozsah pokrytí omezený, slovník představuje cennou materiálovou bázi pro studium běžně mluvené češtiny. Pokud jde olexikon, je zde ale nutno poznamenat, že četnost výskytů některých slov, obzvlášť substantiv aněkterých frází, může být poněkud zkreslena, neboť respondenti automaticky opakovali slova obsažená votázkách dotazníku anavíc se vyjadřovali kpředem určeným tématům. Týká se to hlavně slov aobratů jako škola, učitelka, rodiče, děti, trestat, vzít pásek, postavení žen na pracovišti, zaměstnání, doplňovat si kvalifikaci, život ve městě vs. život na venkově, vidět si do talíře, šťastný aúspěšný život atp. Výskyt partikulí, na rozdíl od zmíněných autosémantik aněkterých frazémů, není však ovlivněn žádnými vnějšími faktory, ajejich frekvenci lze tudíž považovat za plně vypovídající anosnou. FSMČ poprvé uveřejnil údaj, že jsou partikule třetím nejfrekventovanějším slovním druhem vmluvené češtině, jinými slovy— vprůměru každým osmým slovem vpromluvě bude partikule. 3 PARTIKULE VPRAŽSKÉM MLUVENÉM KORPUSU Podívejme se nyní blíže na posledně zmíněný údaj ofrekvenci partikulí, ovšem také dalších slovních druhů vběžně mluveném projevu, který znázorňuje graf 1. Frekvenční pořadí slovních druhů vpsaném korpusu je pochopitelně značně jiné. Uveďme pro srovnání, že distribuce slovních druhů vžánrově vyváženém stomilionovém korpusu SYN2000, vněmž převažují texty zlet 1990–1999, tedy zpodobného období jako nahrávky tvořící PMK, vypadá takto: 1. substantiva (tvoří zhruba třetinu velikosti korpusu), 2. slovesa (jejich výskyt je však na první pohled překvapivě opolovinu nižší), 3. adjektiva (12,5 mil.), 4. předložky, 5. zájmena, 6. spojky, 7. adverbia, 8.číslovky, 9. partikule ana posledním, 10. místě citoslovce. Je zajímavé, že stejné OPEN ACCESS
94 STUDIE ZAPLIKOVANÉ LINGVISTIKY frek venční pořadí, pokud jde oprvní tři nejfrekventovanější slovní druhy (S, VaADJ), uvádí iprvní česká publikace věnovaná frekvenci slov (Jelínek— Bečka— Těšitelová, 1961). Jejich korpus tvoří 1 623 527 slov, je převážně sestaven zbeletrie, literatury pro děti amládež adramat (cca 57 % hesel), odborné avědecké literatury (cca 25 % hesel) avposlední necelé čtvrtině se převážně vyskytuje žurnalistika, okrajově poezie amluvený projev (nutno podotknout, že většinou šlo oprojevy čelných komunistických představitelů té doby). Pro nás je obzvlášť cenný poznatek, že se vroce 1961 partikule jako slovní druh vůbec neuvažovala. Vporovnání smluveným korpusem vpsaném korpusu nejvýraznější propad zaznamenaly právě partikule (z3. na 9. místo), ovšem také zájmena (z2. na 5. místo), přičemž jsou slovesa procentuálně mnohem méně zastoupena vpsaném než vmluveném korpusu, na rozdíl od substantiv, která jsou výrazně víc zastoupena vkorpusu psaném. Tyto výsledky nejsou však nikterak překvapivé. Partikule (jak už jsme na to upozornili) jsou při automatické anotaci těžko rozpoznatelné (vautomaticky tagovaném korpusu je rozlišení partikulí značně problematické vzhledem kvysoké míře homonymie, kterou partikule vykazují sdalšími slovními druhy: řada partikulí vtakovém, především psaném korpusu zůstává proto skryta zejména za adverbii, spojkami, tvary sloves, citoslovci apod.), deiktika se vmluvených projevech vyskytují mnohem více. Pokud jde onízký procentní podíl sloves oproti substantivům, zde se nabízí vysvětlení, že vpsaném projevu tíhnoucím ke kondenzaci mají nominální konstrukce jednoznačnou převahu. Stím přímo souvisí ivysoká zastoupenost předložek Graf 1:Frekvence slovních druhů, IF, proprií, citátových výrazů azkratek vPMK. OPEN ACCESS
ANA ADAMOVIčOVá 95 vpsaném korpusu (vmluveném korpusu je najdeme na 7. místě, vpsaném na 4.). Na velkém zastoupení předložek vpsaném korpusu se podílejí především víceslovné předložky vyskytující se hojně právě vnominálních konstrukcích, které nejsou charakteristické pro mluvený projev. Překvapivě vysoko se však vporovnání smluveným korpusem umístila adjektiva (vmluveném korpusu jsou na 8. místě, vpsaném na 3.). Vsouvislosti stímto zjištěním se nutně nabízí možné vysvětlení: vpsaném jazyce se často při popisu uchylujeme kmetaforickému vyjadřování, pro něž jsou právě charakteristické synonymické řady adjektiv. Při redakční práci text dále tříbíme, obohacujeme ho odalší řady synonym. Při mluveném projevu na to není čas. Stačí se podívat na nejfrekventovanější adjektiva vpsaném amluveném korpusu. Vprvní stovce nejfrekventovanějších autosémantik se vmluveném korpusu vyskytlo pouze 8 adjektiv: dobrej (36), jinej (37), velkej (41), mladej (57), malej (74), celej (78), stejnej (96), špatnej (100). M.Kopřivová (2006, s.17) ve své práci uvádí seznam 100 nejfrekventovanějších adjektivních lemmat vkorpusu SYN2000. Stejné, anebo podobné frekvenční pořadí se vyskytlo pouze uslov, která můžeme označit za jakési neutrální konstanty popisování kvality, případně relací. Partikule jsou oproti adjektivům univerzálnějšími komentátory promluvy, jejichž význam se konkretizuje až vkontextu— podstatné je, že se na rozdíl od adjektiv často vztahují kcelé promluvě ajsou jednoznačnější zhlediska postojů mluvčího. Podíváme-li se ovšem na zastoupení slovních druhů vPMK zhlediska počtu lemmat ve FSMČ znázorněného vgrafu 2, situace se jeví značně jinak. Zde dle očekávání uvrchu tabulky najdeme slovesa, substantiva, po nich frazémy, adjektiva, propria aadverbia. Utěchto slovních druhů se vyskytlo nejvíce různých slov, respektive jejich repertoár je nejpestřejší. Počet různých lemmat upartikulí je 400, atakto se partikule umístily vdolní části tabulky mezi číslovkami (NUM) acitoslovci (INT), předčí však zájmena (PRON; 249 lemmat) nebo předložky (PREP; 199lemmat) ahodně zaostávají za adverbii, unichž najdeme až 1324 různých lemmat. Těchto 400 různých lemmat partikulí představuje jen 1,32 % slovníku. Tato slova však, jak už víme, vykazují tak vysokou frekvenci, že partikule jsou celkově třetím nejfrekventovanějším slovním druhem vmluveném jazyce, respektive každým 8. slovem vpromluvě (13,51 % slovníku). Porovnáme-li partikule zobou zmíněných hledisek— frekvence tvarů afrekvence lemmat— například sčíslovkami, zjistíme, že 480 lemmat číslovek předstaGraf 2:Frekvence lemmat vPMK. OPEN ACCESS
96 STUDIE ZAPLIKOVANÉ LINGVISTIKY vuje 1,57 % slovníku, zhlediska frekvence jejich výskytu je však zastoupení číslovek podobné (1,42 %), ajde tedy na rozdíl od partikulí oslovní druh spoměrně dosti nízkou frekvencí. Porovnejme ještě ztohoto hlediska adverbia apartikule: 1324 všech lemmat adverbií tvoří 4,33 % slovníku (je jich tedy 3× více než partikulí), frekvence jejich tvarů je pak 8,47 % (více než otřetinu nižší než upartikulí). Uveďme nyní ještě prvních 20 nejfrekventovanějších slov / stylových lemmat doložených vPMK. 1. ten 40 271 11. tak 6 224 2. bejt 20 255 12. ale 6 022 3. a 19 590 13. tam 5 704 4. že 13 542 14. teda 4 276 5. já 8 743 15. prostě 3 924 6. mít 7 871 16. myslet si 3 263 7. no 7 785 17. nebo 3 262 8. v 7 716 18. třeba 3 186 9. na 7 067 19. s 3 151 10. jako 6717 20. protože 3 086 Tabulka 1:20 nejfrekventovanějších slov vPMK. Zautosémantik na seznamu najdeme pouze tři verba (bejt, mít amyslet si) ajedno adverbium (tam). Zjednoznačných synsémantik se zde nejvíce vyskytují partikule, asice čtyři (no, teda, třeba4 aprostě), dále tři prepozice (v, na as), dvě zájmena (ten ajá) advě spojky (nebo aprotože). Na frekvenci všech dalších pěti slov (a, že, jako, tak, ale) se však vrůzné, někdy ive větší míře (např.ujako), podílejí též partikule. Je třeba si uvědomit, že tato čísla jsou ve skutečnosti ještě vyšší, neboť se do nich promítají jen počty všech tvarů těchto slov izolovaně čili slovníkové lemma, ne však další kombinace lemmat. Atak např.sloveso bejt nezahrnuje celou řadu propozičních frazémů typu to je bezvadný, to je blbost, to je dobrý aspousty dalších, do frekvence spojky apartikule ase též nepromítají propoziční frazémy adost, ahotovo, aje to, atak dále, ašmytec atp. či víceslovné spojky aproto, apřitom, atak, do frekvence spojky apartikule že nejsou zahrnuty výrazy že jo, že ano, že ne, do počtu výskytů zájmena já se nepromítají propoziční frazémy já ne/vím, (co všechno) atp., partikule ainterjekce no nezahrnuje propoziční víceslovné partikule či frazémy no tak, no jo, no vidíš, no nazdar apod., sloveso mít je též základním komponentem spousty frazémů, např.mít ambice, mít co dělat, mít chuť, mít logiku, mít rád atd., prepozice vje součástí řady frazémů či víceslovných prepozic, např.vkaždým případě, vpodstatě, vpohodě, vprůměru, vtomhle směru, vzásadě, vžádným případě či vdůsledku, vporovnání s, vprůběhu, vpřípadě, stejně jako prepozice ainterjekce na, např.na co, na druhou stranu, na druhý straně, na první pohled, na úrovni či na konci, na počátku, na základě, partikule aspojka jako je též součástí víceslovných spojek jako dyby, jako když či frazému jako takovej, 4 Výraz třeba byl jen 58× anotován jako adverbium. OPEN ACCESS
ANA ADAMOVIčOVá 103 3.3.1 LEMMATIZAcE SLOVNícH TVArŮ Při značkování korpusu anotátoři používali značkovací program EDITIN (Savický, 1994), který při lemmatizaci korpusu nabízel tři kroky: 1. upravený textový tvar umožňoval opravit případné evidentní překlepy, 2. zavést stylové lemma, což je pak převedení tvaru na základní, standardizovanou normu (infinitiv uslovesa, 1. pád ujmen, pozitiv uadjektiv aadverbií, nevokalizovaný tvar upředložek), a3. dodat pro srovnání spisovné lemma, které reprezentuje základní tvar ve spisovné podobě, což je důležité zvláště jako společný jmenovatel umožňující souhrnné statistiky všech stylů dohromady. Vpřípadě partikulí se spisovná podoba uváděla jen uněkterých variant (např.obzvlášť, tedy, teď apod.). Některé tvary jako například furt spisovnou podobu nemají (spisovná synonyma se zásadně nepoužívala), atak se jako spisovné lemma uvádí tento tvar. 1. upravený textový tvar předevšim furt tedy tea řikali bysme abysme 2. stylové lemma předevšim furt tedy teda řikat abysme 3. spisovné lemma především furt tedy tedy říkat abychom Tabulka 6:Příklady lemmatizace tvarů. Slovníkové lemma představuje pak souhrn více frekventovaných tvarů lemmat. Například tvar bez kvantity předevšim se vyskytuje stejně často jako především, avšak po zohlednění 6. pozice kódovníku— stylová charakteristika slova (viz níže), která se vposlední fázi určování výsledné podoby lemmatu stala rozhodujícím třídicím kritériem odrážejícím celkový styl promluvy, se varianta bez kvantity stala slovníkovým lemmatem. Uřady dalších tvarů byla situace mnohem jednodušší: teda se vyskytuje 10× častěji než tedy, prej 26× častěji než prý, atak se jako slovníkové lemma— standardní tvar mluveného jazyka— vtěchto adalších podobných případech uvádějí lemmata předevšim, teda, prej. 3.4 PArTIKULE PODLE KÓDOVNíKU PMK Kódovník, na jehož základě proběhla ruční anotace celého materiálu, pro slovní druh částice obsahuje 6 pozic: na 1. pozici se značí slovní druh, tedy partikule, na 2. pozici druh partikulí (bližší určení jejich původu), na 3. pozici třída (informace ojejich funkcích, případně jejich sémantických vlastnostech), na 4. pozici valence (respektive místo výskytu částice vpromluvě), na 5. pozici modus věty (oznamovací, tázací, zvolací), vníž se partikule objevuje, ana 6. pozici stylová charakteristika partikulí (odráží stylovou charakteristiku toho kterého slova spřihlédnutím kcelkovému vyznění promluvy). První ašestá pozice jsou pro všechny slovní druhy stejné. Nyní se ještě blíže podíváme na druhou pozici vkódovníku. OPEN ACCESS
104 STUDIE ZAPLIKOVANÉ LINGVISTIKY 3.4.1 DrUH PArTIKULí Na druhé pozici, jak je patrno zníže uvedeného seznamu, rozlišujeme 5 podtříd: 1.vlastní, nehomonymní partikule: ať, asi, prej, 2. partikule homonymní sadverbiem: jistě, klidně, stejně, dovopravdy, zvlášť, jen, 3. partikule homonymní se spojkou: však, tedy, 4. jiné partikule, ato a) homonymní se substantivem nebo jeho předložkovým pádem: fakt, celkem, například, dokonce, b) homonymní se zájmenem nebo jeho předložkovým pádem: což, copak, vono (von, voni), to, ovšem, c) homonymní se slovesným tvarem: myslím, prosím, d) mající formu adverbia, ale nehomonymní sadverbiem užívaným jako deadjektivní adverbiale: hlavně, vlastně, e) homonymní scitoslovcem nebo citoslovečným frazémem: vid’, víš, bohužel, f) jinojazyčného původu: holt, kór, 5.partikule víceslovné: že jo, dejme tomu, no tak, nějak tak, (k)dyž tak, když už, přece jenom, hlavně že. Vyjdeme-li ztohoto popisu, zcelkového počtu 269 stylových lemmat se vyskytlo jen 20 vlastních partikulí (např.asi, taky, vůbec, spíš, právě, snad, dyť, aspoň, totiž, přece, prej, teprve), což je jen oněco málo přes 7 % zkoumaného materiálu. Uplatníme- -li však kontextové kritérium, nehomonymních jednoslovných partikulí se vyskytlo mnohem více— 85. Všech dalších 65 lemmat partikulí, které jsou svým původem sice obecně homonymní sdalšími slovními druhy, se však vkontextu pořízených promluv vyskytlo pouze ve funkci partikule, atudíž vnašem materiálu nejsou homonymní co do své funkce sdalšími slovními druhy, atak bychom zhlediska úzu, okterý nám hlavně jde, na ně měli nazírat jako na partikule vlastní. Jsou to např.partikule bohužel, bohudík, celkem, dokonce, dovopravdy, hlavně, jakoby, jaksi, každopádně, koneckonců, kór, kupodivu, mimochodem, obzvlášť, popřípadě adalší. Vtomto bodě se tedy rozcházíme skódovníkem. Do této klasifikace se promítá hned několik rovin: sémantika, etymologie, forma, funkce aúzus (pragmatika), přičemž se vněkterých bodech některé roviny prolínají. Funkčně-sémantické hledisko se vztahuje kbodu 2, funkční kbodu 3, bod 4 je ztohoto hlediska nejpestřejší: na spřežky zbodů a) ab) se uplatňuje hledisko etymologické, vbodě d) dominuje formální hledisko, vbodě e) zase funkční, zatímco vbodě f) etymologie. Pragmatika se samozřejmě týká všech bodů aje rozhodujícím kritériem, na jehož základě můžeme sjistotou určit, zda se jedná opartikuli, anebo oněkterý zdalších homonymních slovních druhů. Pro naši analýzu je právě toto hledisko klíčové. Kpřeřazení zhruba dalších dvou třetin partikulí do kategorie „vlastní“ nás tedy vede skutečnost, že vycházíme pouze zfunkcí aužití partikulí skutečně doložených vPMK (např.bohužel se ve funkci interjekce vůbec nevyskytuje). Dále se domníváme, že ze synchronního hlediska homonymie některých zvýše zmíněných slov má ryze formální charakter (např.homonymie se substantivy udokonce, naštěstí, například), atudíž není pro naše účely prvoplánová. Tímto synchronním přístupem oproštěným od etymologického anebo diachronního hlediska značně rozšiřujeme seznam vlastních partikulí. Tento posun, který především závisí na kontextu apragmatice, je bezesporu důkazem toho, že se třída partikulí pozvolna rozrůstá. Dalo by se zde právem namítnout, že „nehomonymnost“ některých zvýše zmíněných partikulí „platí“ jen pro materiál doložený vPMK. Ano, lze připustit, že je to pravda. Budeme-li se však držet materiálu, musíme zároveň uznat, že jde ovelmi výraznou tendenci, kterou je OPEN ACCESS
ANA ADAMOVIčOVá 105 třeba jasně pojmenovat. Kontextové hledisko je rozhodující amělo by mít poslední slovo. Zastáváme-li toto hledisko, pak mezi nehomonymní partikule musíme zařadit ještě dalších 9 hapaxů: bohudíky, cožpak, div, neřkuli, pranic, přinejlepšim, vopravdicky, zaboha azhola aněkolik dalších víceslovných hapaxů zmíněných výše. Dále bych se ještě chtěla zastavit utermínu „vlastní“ ve smyslu „původní“, který zde asociuje, či spíše přímo koresponduje stermínem vlastní předložky, tedy předložky původní. Pokud jsme třídu vlastních partikulí rozšířili ořadu příkladů doložených materiálem, vtomto rozšířeném přístupu ktéto třídě bych pro ni spíše navrhla termín primární, tj.partikule nehomonymní zhlediska užití. Pak se přímo nabízí itermín sekundární, tj.partikule homonymní sdalšími slovními druhy. Mezi vlastními (či primárními) partikulemi najdeme tedy ipartikule bohužel, dovopravdy, naštěstí, dokonce, ovšem, vlastně, halt, kór, teda/tedy, však apod. Grafy 5 a6 znázorňují frekvenci lemmat atvarů partikulí vkontextu promluvy. Zhruba polovina lemmat a dvě třetiny tvarů partikulí doložených vPMK jsou homonymní slemmaty atvary dalších slovních druhů. Graf 5:Frekvence lemmat vlastních ahomonymních partikulí. Graf 6:Frekvence tvarů vlastních ahomonymních partikulí. OPEN ACCESS
106 STUDIE ZAPLIKOVANÉ LINGVISTIKY Dále jsme zkoumali podíl partikulí homonymních sdalšími slovními druhy. Ze všech typů partikulí homonymních sdalšími slovními druhy jsou na prvním místě partikule homonymní sadverbii.8 Je to zároveň po vlastních jednoslovných partikulích druhá nejpočetnější skupina, vyjdeme-li zcelého materiálu (23 %). 8 Ktomu detailněji Adamovičová (2014). Graf 7:Frekvence lemmat partikulí homonymních sdalšími slovními druhy. Graf 8:Frekvence tvarů jednotlivých druhů partikulí. OPEN ACCESS
ANA ADAMOVIčOVá 107 Na závěr se ještě podíváme na frekvenci tvarů jednotlivých druhů partikulí. Izde se vpromluvě nejčastěji vyskytují vlastní jednoslovné partikule. Zpartikulí homonymních sdalšími slovními druhy jsou nejvíce zastoupeny partikule homonymní sadverbii, spojkami acitoslovci. Součet tvarů těchto čtyř skupin dohromady představuje 86,5 % výskytu všech typů partikulí vpromluvě. Za výraznější skupinu lze ještě považovat vlastní víceslovné partikule (6,16 %), zatímco poslední čtyři typy— partikule homonymní zároveň svíce slovními druhy, dále se zájmeny, verby afrazémy, představují co do frekvence svých tvarů spíše marginální skupinu. 4 ZÁVĚR Ztohoto krátkého nástinu výskytu partikulí vPMK plyne hned několik závěrů. Partikule jsou nesmírně frekventovaným slovním druhem, kterému doposud nebyla věnována patřičná asystematická pozornost ve světle nových možností, jež poskytuje korpusové zpracování dat. Nyní se poprvé na partikule můžeme dívat vautentickém kontextu, tam, kde se přirozeně vyskytují akde často ivznikají. Detailní popis výskytu asouvýskytu partikulí, jejich funkce apozice vpromluvě pomůže však při jejich lepší klasifikaci, která by se měla odrazit jak vlépe propracovaných trénovacích souborech pro automatickou anotaci, tak ivlexikografické praxi avneposlední řadě také při výuce češtiny jako cizího jazyka. Všechny tyto tři oblasti jsou mimořádně důležité. Automatická anotace partikulí má zatím velmi nízkou úspěšnost, zpracování tohoto slovního druhu vpříručkách aslovnících je doposud nedostačující, sčímž přímo souvisí ijeho nedostatečné anesystematické zapojování do učebnic češtiny pro nerodilé mluvčí aobecně zřejmě ido výukového procesu. Nemám přitom na mysli jen jazyk mluvený, nýbrž ijazyk psaný. Vyčerpávající popis kontextového výskytu partikulí ajejich klasifikace by měly zaplnit všechny výše uvedené mezery. LITERATURA: Adamovičová, Ana— Čermák, František— Pešička, Jiří (2008): Čítanka mluvené češtiny. Praha: Karolinum. Adamovičová, Ana (2014): Partikule vs. adverbia— rozpoznání slovního druhu. In: Vladimír Petkevič— Ana Adamovičová— Václav Cvrček (eds.), Radost zjazyků: Sborník příspěvků k75. narozeninám prof. Františka Čermáka. Praha: Nakladatelství Lidové noviny, s.188–200. Bauer, Jaroslav— Grepl, Miroslav (1972): Skladba spisovné češtiny. Praha: Státní pedagogické nakladatelství. Bonifazi, Anna— Drummen, Annemieke— de Kreij, Mark (2016): Particles in Ancient Greek Discourse [online]. Boston, MA: Center for Hellenic Studies, Harvard University. Cit.12.6.2017. Dostupné zWWW: <https:// kleos.chs.harvard.edu/?p=5982>. Čermák, František (2008): Partikule, jejich syntagmatika akumulace vmluvené češtině. In: Marie Kopřivová— Martina Waclawičová (eds.), Čeština vmluveném korpusu. Praha: Nakladatelství Lidové noviny, s.63–74. Čermák, František (2011): Jazyk ajazykověda: Přehled aslovníky. Praha: Karolinum. OPEN ACCESS
108 STUDIE ZAPLIKOVANÉ LINGVISTIKY de Saussure, Ferdinand (1996): Kurs obecné lingvistiky. Praha: Academia. ESČ: Karlík, Petr— Nekula, Marek— Pleskalová, Jana (eds.) (2002): Encyklopedický slovník češtiny. Praha: Nakladatelství Lidové noviny. FSMČ: Čermák, František et al. (2007): Frekvenční slovník mluvené češtiny. Praha: Karolinum. Grepl, Miroslav (2011): Co děláme, když mluvíme. In: Miroslav Grepl, Jak dál vsyntaxi. Brno: Host, s.61–106. Hlaváčková, Dana— Osolsobě, Klára (2008): Morfologické značkování mluvených korpusů, zkušenosti aotevřené otázky. In: Marie Kopřivová— Martina Waclawičová (eds.), Čeština vmluveném korpusu. Praha: Nakladatelství Lidové noviny, s.105–114. Jelínek, Jaroslav— Bečka, Josef Václav— Těšitelová, Marie (1961): Frekvence slov, slovních druhů atvarů včeském jazyce. Praha: Státní pedagogické nakladatelství. Kopřivová, Marie (2006): Valence českých adjektiv. Praha: Nakladatelství Lidové noviny. MČ2: Komárek, Miroslav— Kořenský, Jan— Petr, Jan— Veselková, Jarmila (eds.) (1986): Mluvnice češtiny: 2, Tvarosloví. Praha: Academia. PMČ: Karlík, Petr— Nekula, Marek— Rusínová, Zdenka (eds.) (1995): Příruční mluvnice češtiny. Praha: Nakladatelství Lidové noviny. Uličný, Oldřich (1986): Částice. In: Miroslav Komárek— Jan Kořenský— Jan Petr— Jarmila Veselková (eds.), Mluvnice češtiny: 2, Tvarosloví. Praha: Academia, s.228–238. Vondráček, Miloslav (1998): Citoslovce ačástice— hranice slovního druhu. Naše řeč, 81(1), s.29–37. Wittgenstein, Ludwig (1993): Filosofická zkoumání. Praha: Filosofia. Ana Adamovičová | Ústav bohemistických studií FF UK <
[email protected]> OPEN ACCESS