Full text
Tomáš Gráf Věra Hejhalová Barbora Baštová Karel Šebesta Kateřina Šormová ISBN 978–80–7308–932–0 KORPUSY V JAZYKOVÉM VYUČOVÁNÍ / K. Šormová, K. Šebesta a kol. KORPUSY V JAZYKOVÉM VYUČOVÁNÍ II. Kateřina Šormová, Karel Šebesta a kol. práce filozofické fakulty univerzity karlovy Publikace Korpusy vjazykovém vyučování je určena učitelům, studentům učitelství i dalším zájemcům ovyučování jazyka. V první části se čtenář seznámí steoriemi osvojování jazyka ajazykovým výzkumem, jsou mu představeny nejznámější anejvětší korpusy angličtiny, češtiny avýběrově idalších jazyků sdůrazem na korpusy akviziční, zejména na projekt AKCES. Pozornost je zaměřena také na typy korpusů ajejich parametry, tedy velikost, vyváženost, autentičnost, strukturní apoziční atributy. Vdruhé části publikace je představena práce skorpusy Českého národního korpusu, vyhledávání pomocí rozhraní KonText apomocí aplikací SyD, Morfi o, KWords, Treq aukázka zapojení frekvenční analýzy do jazykového vyučování. Poslední část publikace tvoří pracovní listy věnované využití korpusových dat v jazykovém vyučování. Součástí pracovních listů je ipodrobný popis metodického postupu ařešení zadaných cvičení.
Tomáš Gráf Věra Hejhalová Barbora Baštová Karel Šebesta Kateřina Šormová ISBN 978–80–7308–932–0 KORPUSY V JAZYKOVÉM VYUČOVÁNÍ / K. Šormová, K. Šebesta a kol. KORPUSY V JAZYKOVÉM VYUČOVÁNÍ II. Kateřina Šormová, Karel Šebesta a kol. práce filozofické fakulty univerzity karlovy Publikace Korpusy vjazykovém vyučování je určena učitelům, studentům učitelství i dalším zájemcům ovyučování jazyka. Vprvní části se čtenář seznámí steoriemi osvojování jazyka ajazykovým výzkumem, jsou mu představeny nejznámější anejvětší korpusy angličtiny, češtiny avýběrově idalších jazyků sdůrazem na korpusy akviziční, zejména na projekt AKCES. Pozornost je zaměřena také na typy korpusů ajejich parametry, tedy velikost, vyváženost, autentičnost, strukturní apoziční atributy. Vdruhé části publikace je představena práce skorpusy Českého národního korpusu, vyhledávání pomocí rozhraní KonText apomocí aplikací SyD, Morfi o, KWords, Treq aukázka zapojení frekvenční analýzy do jazykového vyučování. Poslední část publikace tvoří pracovní listy věnované využití korpusových dat v jazykovém vyučování. Součástí pracovních listů je ipodrobný popis metodického postupu ařešení zadaných cvičení.
Ediční řada Varia
filozofická fakulta univerzity karlovy, 2019 KORPUSY V JAZYKOVÉM VYUČOVÁNÍ II. Kateřina Šormová, Karel Šebesta a kol.
Kniha vznikla díky podpoře projektu Zvýšení kvality vzdělávání a začleňování žáků s OMJ spojené s jeho radikální inovací (CZ.07.4.68/0.0/0.0/16_037/0000299) a Kreativita a adaptabilita jako předpoklad úspěchu Evropy v propojeném světě (CZ.02.1.01/0.0/0.0/16_019/0000734). Tato publikace vznikla za podpory projektu Univerzity Karlovy Progres Q10, Jazyk v proměnách času, místa, kultury. Recenzovali Mgr. Svatava Škodová, Ph.D. doc. PhDr. Milan Hrdlička, CSc. Mgr. Jarmila Valková, Ph.D. © Tomáš Gráf, Věra Hejhalová, Barbora Baštová, Karel Šebesta, Kateřina Šormová, 2019 ©Univerzita Karlova, Filozofi cká fakulta, 2019 Za obsah a jazykovou správnost odpovídají autoři Všechna práva vyhrazena ISBN 978-80-7308-931-3 (print) ISBN 978-80-7308-932-0 (online : pdf) KATALOGIZACE VKNIZE– NÁRODNÍ KNIHOVNA ČR Šormová, Kateřina, 1980Korpusy v jazykovém vyučování II. / Kateřina Šormová, Karel Šebesta a kol.. – Vydání první. – Praha : Filozofi cká fakulta Univerzity Karlovy, 2019. – 1 online zdroj. – (Varia ; 78. svazek) Anglické resumé Obsahuje bibliografi i a bibliografi cké odkazy ISBN 978-80-7308-932-0 (online ; pdf) * 81'322.2 * 81'232 * 81'24 * 811.162.3 * 811.162.3'243 * (048.8:082) – jazykové korpusy – jazyková akvizice – jazyková výuka – čeština – čeština jako cizí jazyk – kolektivní monografi e 81 – Lingvistika. Jazyky [11]
Obsah Úvod 7 Seznámení s korpusy a korpusovou lingvistikou 1. Korpusy, jejich typy; korpusy češtiny (Karel Šebesta) 11 2. Teorie osvojování jazyka a korpusový výzkum (Tomáš Gráf) 16 2.1. Korpus a jazykové testování 17 2.2. Žákovský korpus a jazyk pro specifi cké účely 19 2.3. Analýza žákovského jazyka 21 2.3.1. Gramatika 22 2.3.2. Slovní zásoba 24 2.3.3. Frazeologie 27 2.3.4. Diskurz 29 2.3.5. Pragmatika 31 2.3.6. Plynulost 32 3. Významné parametry korpusů (Karel Šebesta) 34 3.1. Velikost 34 3.2. Vyváženost 37 3.3. Autentičnost jazyka 40 3.4. Strukturní atributy 43 3.5. Poziční atributy – lingvistická (a chybová) anotace 44 4. Práce s korpusem (Věra Hejhalová) 47 4.1. Český národní korpus (ČNK) 47 4.1.1. Materiál/Obsah 47 4.1.2. Vyhledávač neboli korpusový manažer 47 4.1.3. Vyhledávání 48 4.1.4. Volba korpusu 49 4.1.5. Typ dotazu 49 4.1.6. Zadání dotazu 51 4.1.7. Specifi kace kontextu 52 4.1.8. Omezení hledání 53 4.1.9. Výsledky hledání 54
4.2. Korpusové aplikace 60 4.2.1. Aplikace SyD 61 4.2.2. Aplikace Morfi o 65 4.2.3. Aplikace KWords 67 4.2.4. Aplikace Treq 70 Využití korpusů ve výuce 5. Náměty pro strategie vyučování a pro tvorbu pracovních listů 75 5.1. Frekvenční analýza (Kateřina Šormová) 75 5.2. Pracovní listy (Barbora Baštová) 78 5.2.1. Prostředí KonText 79 5.2.2. SyD 120 5.2.3. Morfi o 137 5.2.4. KWords 158 Použitá literatura 171 Seznam citovaných korpusů 173 Profi ly autorů 183 Rejstřík 185 Resumé / Summary 187
7 Úvod Milí čtenáři, právě jste otevřeli rozšířené adoplněné druhé vydání publikace Korpusy vjazykovém vyučování. Je určena učitelům, studentům fi lologických oborů, jazykovým lektorům ivšem dalším zájemcům ojazyk ajeho vyučování. Při přípravě této příručky jsme měli na mysli dva cíle. Prvním bylo představení jazykového korpusu jako nástroje, jehož prostřednictvím můžeme zajímavým způsobem zkoumat jazyk, pohlížet na něj zrůzných úhlů pohledu avurčitém smyslu si sním ihrát. Zejména se zaměřujeme na korpusy akviziční, obsahující jazyková data zprojevů mluvčích, kteří se jazyk teprve učí. Druhým cílem bylo poskytnout Vám inspiraci vtom, jak můžeme jazykový korpus využít při výuce češtiny jako cizího/druhého jazyka. Ztoho důvodu tvoří poslední kapitolu příručky sada dvaceti dvou pracovních listů, které by Vám měly posloužit jako návodná ukázka aktivit, které lze na základě práce skorpusem do vyučování přinést. Budeme rádi, pokud Vás přivedou ktvorbě Vašich vlastních aktivit apracovních listů založených na korpusových datech. Přejeme Vám příjemné čtení aradost zpráce sjazykem. Autoři
14 korpusy v jazykovém vyučování ii. To platí ipro korpusy češtiny, také česká korpusová lingvistika navazuje na dlouhou abohatou tradici jinak než elektronicky zpracovávaných sběrů. První snahy ovytvoření centrální národní instituce, která by koncentrovaně rozvíjela korpusové aktivity pro češtinu, se objevují přibližně od druhé poloviny 80. let. Vr.1994 vznikl na FF UK pod vedením F. Čermáka Ústav Českého národního korpusu, který budování korpusů českého jazyka, obecných ispeciálních, zaštiťuje. Vsoučasné době nabízí: – synchronní korpusy psaného jazyka řady SYN , – specializované korpusy psaného jazyka různého zaměření, včetně akvizičních (vizdále), – synchronní korpusy mluveného jazyka řady ORAL anový korpus ORTOFON, – specializované korpusy mluveného jazyka různého zaměření, včetně akvizičních (vizdále), – diachronní korpus DIAKORP , – paralelní korpus InterCorp , – srovnatelné korpusy Aranea, psané jednojazyčné webové aspeciální korpusy jiných jazyků, než je čeština. Pro učitele češtiny jako cizího jazyka mají význam vedle korpusů akvizičních primárně obecné korpusy češtiny, tedy korpusy řady SYN aORAL, resp. ORTOFON, pro vyšší anejvyšší úrovně apro některé speciální účely je využitelný korpus paralelní– InterCorp. Vedle korpusů Českého národního korpusu je pro učitele významný rovněž Pražský závislostní korpus , budovaný Ústavem formální aaplikované lingvistiky MFF UK; zněj vycházejí iněkteré didaktické pomůcky zaměřené na výuku syntaxe. Korpusy akviziční navazují na neméně dlouhou tradici systematického sběru jazykových dat pro účely studia osvojování apozdějšího vývoje jazyka dětí předškolního iškolního věku, studia jazyka mládeže jako specifi cké jazykové variety, jazyka nerodilých mluvčích, jazyka mluvčích postižených jazykovou poruchouapod.4 Vroce 2005 byl pod vedením K. Šebesty zahájen projekt AKCES (Akviziční korpusy češtiny ) při Ústavu českého jazyka ateorie komunikace FF UK, na jeho vytváření se však významně podílejí idalší pracoviště.5 4 Ktéto akviziční tradici sběrů vmezinárodním idomácím výzkumu ake vzniku prvních akvizičních korpusů počítačových podrobněji vizŠebesta, 2010. 5 Ústav teoretické akomputační lingvistiky, Ústav formální aaplikované lingvistiky MFF UK, Ústav Českého národního korpusu, Ústav jazykové aodborné přípravy UK adalší.
seznámení skorpusy akorpusovou lingvistikou 15 Projekt AKCES je pojat poměrně široce:6 zahrnuje postupné vytváření databází anávazně budování korpusů psaných imluvených zaměřených na: a. jazyk dětí předškolního věku , b. jazyk dětí amládeže od 5 do 24let , c. jazyk nerodilých mluvčích češtiny , d. jazyk sociokulturně znevýhodněných skupin , e. jazyk krajanských komunit , f. jazyk ve vzdělávacím kontextu . g. Poskytuje podporu rovněž korpusům terapeutickým. Jednotlivé korpusy jsou zveřejňovány zčásti vrámci Českého národního korpusu, zčásti vrámci Centra jazykové výzkumné infrastruktury LINDAT/ CLARIN 7 Ústavu formální aaplikované lingvistiky MFF UK anově též na stránkách Ústavu formální a aplikované lingvistiky FF UK. Pro výuku nerodilých mluvčích jsou relevantní zejména: – korpusy žákovské (jazyka nerodilých mluvčích); znich byly dosud vrámci Českého národního korpusu8 zveřejněny korpusy řady CZESL (polovina korpusu CZESL -PLAIN , korpusy CZESL -SGT aCZESL -MAN – druhý znich není dosud veřejně přístupný), vrámci Centra LINDAT/ CLARIN pak korpus AKCES 5 adalší korpusy zřady CZESL derivované, např. CZESL-UD ; volně se knim řadí ičeská část korpusu MERLIN , zpracovaná vrámci samostatně fi nancovaného německo -italsko -českého projektu;9 – korpusy jazyka žáků ze sociokulturně znevýhodňujícího prostředí– zkorpusů zveřejněných vrámci Českého národního korpusu sem patří ccačtvrtina korpusu CZESL -PLAIN, připravuje se kzveřejnění srovnávací korpus SKRIPT2015, jehož polovinu tvoří data mluvčích ze sociokulturně znevýhodněných komunit; zkorpusů zveřejněných vrámci LINDATu jsou to korpusy AKCES 4 amluvený korpus ROMi_1.0 ; – korpusy písemných imluvených projevů českých žáků– vrámci Českého národního korpusu byl zveřejněn korpus písemných prací žáků SKRIPT2012; jejich mluvené projevy jsou zachyceny zčásti ve školníchdialozích přepsaných azveřejněných vkorpusech SCHOLA 2010 (na stránkách ČNK) aAKCES 2 ver 2. 6 Podrobnější informace ocelém projektu jsou na stránkách h\ p://akces.ff .cuni.cz/. 7 h\ ps://lindat.mff .cuni.cz/cs/ 8 h\ ps://kontext.korpus.cz/fi rst_form 9 h\ ps://merlin -platform.eu/
16 korpusy v jazykovém vyučování ii. 2. Teorie osvojování jazyka akorpusový výzkum Nauka ojazykové akvizici se zabývá zkoumáním procesů osvojování mateřského či cizího jazyka. Jakkoliv doklady ospekulacích opodstatě tohoto procesu nacházíme již ve starověku, jako vědní obor asoučást aplikované lingvistiky se ustavuje až vpolovině 20. století, kdy nachází své místo vuniverzitních studijních programech. Jako každý vědecký obor pracuje inauka ojazykové akvizici skonkrétními daty aod 80. let 20. století tato data stále častěji pocházejí ztzv.akvizičních korpusů. Jde ospeciální typ jazykových korpusů, které si nejlépe představíme jako počítačově zpracované aprohledávatelné sbírky textů, jejichž původci jsou ti, kdo si jazyk osvojují: děti osvojující si mateřštinu nebo studenti (ať už vdětském, či dospělém věku) osvojující si další, zpravidla cizí, jazyk. Existují přitom různé typy těchto korpusů vzávislosti na médiu (psaný či mluvený korpus), typu jazyka (mateřský či cizí) či charakteristice mluvčího (dítě, dospělý, mluvčí sřečovou poruchou, rodilý či nerodilý mluvčí, mluvčí ze sociokulturně či jinak znevýhodněné komunityaj.). Společné pak mají tyto korpusy to, že zachycují tzv.mezijazyk , tedy jazyk ve vývojové fázi , která ještě nedosahuje úrovně obvyklé pro dospělého rodilého mluvčího. Akviziční korpusy jsou tak sbírkou dokladů otom, jak osvojování probíhá ajaké jsou typické rysy osvojovaného jazyka. Umožňují tak hledat odpověď na řadu klíčových otázek, kterými se nauka oakvizici zabývá, jako jsou například role jazykového transferu (tj.vlivu mateřštiny na osvojování cizího jazyka) aodlišnosti mezi mezijazykem ajazykem rodilého mluvčího, jakož iodlišnosti ve vyjadřování různých mluvčích. Je tak možné srovnávat jazykový projev studentů srůznou mateřštinou, kteří si ale osvojují stejný cizí jazyk (např.angličtinu). Tradiční výzkum voblasti jazykové akvizice často pracoval somezenými vzorky dat anezřídka isintuicí badatelů aučitelů cizích jazyků. Často tak byly výsledky výzkumu přijímány svýhradou, že se zjištěné skutečnosti mohou týkat právě jen onoho omezeného vzorku mluvčích anedají se zobecnit. Akviziční korpusy naproti tomu poskytují velké množství dat sesbírané od desítek, stovek či tisíců mluvčích aposkytuje tak rozsáhlou bázi pro empirické ověřování hypotéz svelkou možností zobecnění závěrů. Specifi ckým azřejmě inejběžnějším typem akvizičních korpusů jsou korpusy žákovské (angl. learner corpora ). Jsou vystavěny ztextů nerodi-
seznámení skorpusy akorpusovou lingvistikou 17 lých mluvčích, kteří se učí cizí jazyk. Jazyk, který vyprodukují, pak označujeme jako jazyk žákovský (jakkoliv nezáleží na věku studenta; žákem je označován každý, kdo se učí). Zdrojem textů mohou být psané školní práce, materiály zjazykových zkoušek, přepsané nahrávky mluveného projevu či záznamy řečových úloh sestavených za účelem vytvoření samotného korpusu. Vkvětnu 2018 čítal seznam Learner corpora around the world10 167 žákovských korpusů. Další korpusy budou jistě inadále vznikat. Dalším typem akvizičních korpusů jsou korpusy osvojování mateřštiny . Nejznámější znich, korpus CHILDES 11 (Child Language Data Exchange System), začal vznikat již vr.1984 ashromažďuje data ze 130 specializovaných korpusů dětské řeči v26 jazycích. Korpus se posléze připojil kprojektu TalkBank , který obsahuje korpusy akvizice mluvčích sporuchami řeči (afázie), korpusy osvojování cizích jazyků, korpusy jazyka ve školních třídách akorpusy pro konverzační analýzu. Akviziční korpusy se vybavují různými systémy anotace . Ty přejímají buď zobecné korpusové lingvistiky (např.anotace slovnědruhová ), nebo vytvářejí vlastní anotační systémy zachycující specifi cké rysy akvizice (např.jazykové odchylky, chyby či jiná specifi ka). Takto vybavené korpusy pak umožňují sofi stikované metody vyhledávání ana nich založené analytické postupy, které dokážou odkrýt charakteristické rysy vyvíjejícího se jazyka, na jejichž základě je nezřídka možné formulovat ipedagogické závěry. 2.1. Korpus ajazykové testování Využití korpusů pro účely jazykového testování je jedním znejnovějších příkladů aplikace jazykových korpusů aje to bezesporu oblast, kde se do budoucna očekává velká aktivita, ato především voblasti defi nování apopisování úrovní pokročilosti. Současný stav výzkumu vtéto oblasti vychází především zmožností sběru dat při jazykových zkouškách. Takto získané vzorky žákovského jazyka, unichž je školenými examinátory stanovena jazyková úroveň např.dle Společného evropského referenčního rámce (SERR ), se analyzují například zhlediska četnosti určitých jevů ana základě těchto analýz je pak možné popsat, které jazykové prostředky jsou charakteristické pro danou úroveň pokročilosti. Lingvistům se tak daří reagovat na časté kritické hlasy, které si všímají, že Společný evropský referenční rámec není dostatečně specifi cký avrámci popisu dovedností na jednotlivých 10 Centre for English Corpus Linguistics (date of access): Learner Corpora around the World. Louvain -la -Neuve: Université catholique de Louvain, h\ ps://uclouvain.be/en/research- -institutes/ilc/cecl/learner -corpora -around -the -world.html. 11 h\ ps://childes.talkbank.org
18 korpusy v jazykovém vyučování ii. úrovních užívá příliš obecný jazyk. Výsledky tohoto výzkumu mají potenciál přispět klepší srovnatelnosti. Zatím nejvýznamnějším anejrozsáhlejším počinem vtéto oblasti je projekt English Profi le 12 (organizovaný University of Cambridge, Cambridge University Press aCambridge English Language Assessment apodpořený Evropskou komisí). Zdat zjazykových zkoušek na všech úrovních angličtiny dle SERR byl sestaven korpus ana jeho základě pak seznamy slovní zásoby (English Vocabulary Profi le) agramatiky (English Grammar Profi le) typické pro jednotlivé úrovně SERR. Tuto bezplatnou databázi mohou využívat učitelé, studenti či autoři jazykových materiálů aověřit si, jaký konkrétní jazyk mluvčí různých úrovní angličtiny dokážou používat. Očekává se, že tento výzkum se zpětně promítne ido vývoje dokonalejších, empiricky založených technik zjišťování jazykové pokročilosti. Největším žákovským korpusem, který vznikl na základě sběru materiálů ztestů, je Cambridge Learner Corpus , který obsahuje vsoučasnosti přes 57 milionů slov psaného žákovského jazyka od více než čtvrt milionu mluvčích. Korpus je přitom inadále rozšiřován. Dalším významným projektem je e Longman Learners‘ Corpus, který poskytl podklady pro sestavení jazykových doporučení vžákovském slovníku Longman Active Study Dictionary. Mnoho nových výzkumných projektů nyní vzniká na základě mluveného korpusu žákovské angličtiny Trinity -Lancaster Corpus, který je sestaven znahrávek apřepisů ústních zkoušek zangličtiny při zkouškách Graded Examinations in Spoken English organizovaných Trinity College vLondýně. Zatím zde však jde pouze oúrovně B1–C1. Pro účely vývoje jazykových testů se však využívají ikorpusy jazyka rodilých mluvčích. Například T2K -SWAL Corpus je souborem akademických textů, které se analyzují zpohledu analýzy diskurzu ažánrů. Výsledek tohoto výzkumu vedl ksestavení Test of English as aForeign Language, TOEFL iBT. Největší výhodou využití korpusové lingvistiky voblasti jazykového testování je bezesporu to, že jazykové korpusy (ať už žákovského jazyka, nebo jazyka rodilých mluvčích) umožňují empiricky ověřit intuici tvůrců testových materiálů apřipravit tak testy, které ověřují odpovídající jazykovou úroveň. To se může dít nejen na základě výzkumu toho, co mluvčí skutečně vjazyce dokážou, ale itoho, kde se odchylují od běžných norem (např.je možné zkoumat, jaké chyby jsou typické pro různé úrovně pokročilosti). Tvůrci jazykových testů se přitom mohou opřít oseznamy slov ajazykových struktur vygenerovaných zžákovských korpusů pro jednotlivé úrovně pokročilosti amohou na datech zkorpusu rovněž zkoumat, jak různé typy úloh ovlivňují výkon vtestu ajak se určité gramatické či lexikální jevy 12 h\ p://www.englishprofi le.org
seznámení skorpusy akorpusovou lingvistikou 19 vsouvislosti srostoucí pokročilostí proměňují. Cílem tohoto výzkumu je přispět ke zlepšování podoby avlastností jazykových testů. Pro účely jazykového testování se však dají využít ikorpusy běžné (pro angličtinu např.korpusy British National Corpus či Corpus of Contemporary American English), ato jako zdroj textů, které si mohou učitelé dle zadaných kritérií vyhledat avytvořit si tak testy na slovní zásobu či gramatiku. Takto získaná korpusová data jsou autentická ajazykově obvykle isprávná (co je vkorpusu vdaném registru či žánru frekventované, to zpravidla odpovídá zavedenému úzu/normě, atudíž odráží kodifi kaci). 2.2. Žákovský korpus ajazyk pro specifi cké účely Jazykem pro specifi cké účely označujeme jazyk, který je užíván například vpracovním či akademickém prostředí akterý se řídí určitými pravidly příslušného funkčního stylu (např.styl odborný, publicistický aadministrativní), nezřídka je charakterizován ispecifi ckou slovní zásobou. Jeho znalost umožňuje uživatelům začlenit se do skupiny lidí, odborníků či profesionálů, kteří takový jazyk typicky používají akteří mají specifi cké komunikační potřeby azvyklosti. Jazyk pro specifi cké účely je od 60. let 20. století intenzivně zkoumán, což má mj.dopad ina jazykové vyučování, ato obzvláště pro angličtinu, která plní roli jazyka mezinárodní komunikace právě vprofesní oblasti. Je také vtomto ohledu nejlépe popsána. Existují tak četné učebnice odborného jazyka, slovníky, aplikace aspecializované jazykové kurzy. Rozlišuje se přitom mezi angličtinou pro pracovní účely (English for Occupational Purposes ) aangličtinou pro účely akademické (English for Academic Purposes ). Angličtina pro pracovní účely se nezaměřuje pouze na specifi ckou slovní zásobu (např.terminologii), ale především na to, jakým způsobem se vtěchto oblastech lidské činnosti komunikuje, aby komunikace byla efektivní apro dané účely vyhovující. To se týká jak jazyka psaného (např.obchodní korespondence, instruktážní texty), tak mluveného (např.komunikace lékařů spacienty, komunikace vleteckém provozu). Výzkum angličtiny pro akademické účely se zabývá celou škálou užití angličtiny vakademickém prostředí od interakcí mluvených (např.prezentace na konferencích) až po psaní akademických textů. Tato oblast je natolik široká, že se dále rozlišuje mezi angličtinou pro obecné apro specifi cky oborové akademické účely. Do této oblasti se nezřídka zahrnují ispecifi cké jazykové astudijní dovednosti anávyky (např.pořizování poznámek, práce sliteraturou, organizace textu), ale například iprezentační, rétorické techniky. Pedagogické úsilí vtéto nesmírně stratifi kované oblasti pak směřuje především ktomu, aby byly naplněny potřeby studentů auživatelů jazyka vté které specializaci.
20 korpusy v jazykovém vyučování ii. Korpusová lingvistika hraje vpopisu jazyka pro specifi cké účely nezastupitelnou roli. Disponuje totiž technikami, jak shromáždit dostatečně velké vzorky reprezentativních ukázek odborného jazyka, na jejichž základě je možné popsat jeho typické rysy. To je důležité jak pro tvorbu pedagogických materiálů, tak pro zkoumání projevu těch, kdo si tento jazyk osvojují vrámci jiného jazyka, než je jejich mateřština. Zkoumají se např.frekvenční vzorce vjednotlivých stylech aje tak možné velmi přesně určit, která specifi cká slovní zásoba je pro daný styl charakteristická. Na základě korpusu e Academic Corpus13 tak například vznikl seznam akademické slovní zásoby pro angličtinu (Academic Word List14), který je pro mezinárodní studenty neocenitelnou pomůckou při studiu akademické angličtiny apři psaní akademických textů. Využití pak samozřejmě nachází ipři výuce asestavování jazykových testů. Vedle textů napsaných rodilými mluvčími se však analyzují iakademické texty nerodilých mluvčích. Vznikají tak speciální žákovské korpusy akademického žákovského jazyka. Izde zcela převládají korpusy angličtiny. Jde obvykle odatabáze psaných úloh (esejů, písemných zkoušekatp.) vzniklých na univerzitách. Jazyk, který vdaném kontextu studenti používají, je charakteristický jak užitím terminologie, tak užitím specifi ckých typů argumentace apostupů při výkladu. Jedním zprvních takových korpusů je International Corpus of Learner English (ICLE), který začal vznikat vBelgii, na Université catholique de Louvain, v80. letech 20. st. Práce na něm stále pokračuje, ač korpus vsoučasné době obsahuje eseje vrozsahu 3,7 milionu slov od pokročilých studentů angličtiny z16 různých zemí, respektive s16 rozdílnými mateřskými jazyky. Na stejném pracovišti se nyní rodí nový korpus akademické angličtiny snázvem Varieties of English for Academic Purposes (VESPA). Korpus je tvořen národními subkorpusy mluvčích srozdílnou mateřštinou. Je tak možné nejen zkoumat specifi ka vyvíjejícího se akademického jazyka ustudentů, ale zároveň srovnávat, do jaké míry může být jeho podoba ovlivněna mateřštinou. Dalšími významnými korpusy vtéto oblasti jsou British Academic Wri en English (BAWE) aamerický Michigan Corpus of Upper -level Student Papers (MICUSP) ajejich mluvené protějšky British Academic Spoken English (BASE) aMichigan Corpus of Academic Spoken English (MICASE). Tyto čtyři korpusy jsou přitom ze zhruba 80% tvořeny psaným projevem rodilých mluvčích, což umožňuje srovnávat jazyk cizojazyčných studentů sjazykem rodilých mluvčích. To je vžákovské korpusové lingvistice běžný přístup anezřídka jsou žákovské korpusy doplňovány okontrolní korpusy textů rodilých mluvčích, které jsou koncipovány tak, aby měly stejnou strukturu 13 h\ ps://www.victoria.ac.nz/lals/resources/academicwordlist/information/corpus 14 Pro češtinu je dostupný nástroj Akalex, vizwww.korpus.cz/akalex.
seznámení skorpusy akorpusovou lingvistikou 21 apodobaly se kvůli srovnatelnosti vco největší možné míře. Korpus ICLE je takto doplněn oLouvain Corpus of Native English Essays (LOCNESS), tedy korpus stejně zadaných esejů psaných rodilými mluvčími. Takový přístup však skrývá ijedno zásadní úskalí, atím je implicitní předpoklad, že text rodilého mluvčího je zpodstaty věci dokonalejší. Stranou přitom zůstává, zda jsou vybraní autoři zřad rodilých mluvčích kvalitními autory. 2.3. Analýza žákovského jazyka V50. letech 20. století se někteří lingvisté15 zabývali výzkumem jazyka za účelem zdokonalení metod jeho výuky. Vycházeli přitom zpředpokladu, že je snazší naučit se jazyk, který je podobnější žákově mateřštině, aže podrobný popis podobností arozdílů mezi mateřským jazykem ajazykem cizím je užitečnou pomůckou pro výuku apro tvorbu jazykových učebnic. Předpokládali, že žáci budou chybovat vtěch aspektech, které jsou rozdílné, anaopak snazší pro ně budou ty rysy, které jsou si mezi jazyky podobné. Domnívali se, že když se výuka bude zaměřovat především na tyto odlišnosti, žáci vnich nebudou chybovat. Skutečnost se ukázala být složitější apostupným výzkumem se ukázalo, že výuka vycházející ze srovnávání jazyků není zárukou bezchybného projevu žáků. Toto období bylo rovněž počátkem zájmu ožákovský jazyk, ato především ochyby, kterých se žáci dopouštějí při psaní či mluvení. Chyby byly analyzovány ze všech stran alingvisté se je pokoušeli pochopit vnaději, že objeví důvod, proč žáci chybují, abudou tak moci vyvinout dokonalejší výukové metody, které žákům umožní nechybovat. Stále více lingvistů však upozorňovalo, že chyby jsou nedílnou součástí učení aže představují doklad ovývoji pokročilosti aotom, že učení se cizímu jazyku je systematický proces. Tuto teorii završil vroce 1972 americký lingvista Larry Selinker formulací teorie tzv.mezijazyka. Selinkerův mezijazyk je dynamický, proměnlivý systém, který se vžákově mysli formuje na základě jeho zkušeností sjazykem akterý mu umožňuje cizí jazyk používat. To je možné díky pravidlům, která si vytváří sám žák, ato na základě výuky, učení se, kontaktu sosvojovaným jazykem adalších faktorů. Existence mezijazyka je základním principem, zněhož vychází výzkum jazykové akvizice. Data pro tento výzkum pak pocházejí stále častěji zžákovských korpusů. Ty umožňují analyzovat osvojování gramatiky, slovní zásoby, frazeologie, diskurzu, stylistiky, pragmatiky asnástupem videokorpusů vbudoucnosti ivýzkum nonverbální komunikace. 15 Např.Robert Lado, Charles Fries, Pi\ Corder.
22 korpusy v jazykovém vyučování ii. 2.3.1. Gramatika Vcentru zájmu při zkoumání žákovského jazyka stojí gramatika aslovní zásoba, které jsou vnímány jako dva základní komponenty znalosti cizího jazyka. Cílem žákovské korpusové lingvistiky vtéto oblasti je popsat, jakým způsobem studenti používají gramatiku cizího jazyka, který se učí, astanovit příslušné pedagogické postupy, které ztěchto informací vyplývají. Žákovská korpusová lingvistika má tedy velmi blízko kpedagogice adidaktice apřispívá kvytváření tzv.pedagogických gramatik, tzn.popisů cizojazyčných gramatických systémů při současném zohlednění možných postupů při jejich výuce. Ktomu, aby mohla být zkoumána gramatika vžákovském jazyce za použití žákovských korpusů, musí být tyto korpusy doplněny oanotace. Anotace jsou značky, které lingvisté doplňují do korpusu proto, aby se vněm dal vyhledávat nejen konkrétní řetězec znaků (např.slovo), ale ispecifi cká jazyková informace např.oslovním druhu či přítomnosti chyby. Rozlišujeme tak především značkování morfologické achybové. Zatímco morfologické značkování je možné provést víceméně automaticky svyužitím počítačových programů, značkování chybové se provádí ručně aje značně náročné na čas. Při morfologickém značkování je každému slovu přiřazena informace oslovním druhu apříslušném jazykovém tvaru. Díky tomu můžeme při vyhledávání vkorpusu zadat např.české slovo bez astanovit přitom, chceme -li, aby výsledky vyhledávání zahrnuly slovo bez jako podstatné jméno, či jako předložku. Pro žákovské korpusy jsou pak typické značky chybové, které se přiřazují všem výskytům chyb vjazykovém projevu, ať už jsou na úrovni gramatické, pravopisné, lexikální, či jiné. Chybová anotace se často vkládá přímo do textu. Označuje se přitom chybný tvar ačasto se doplňuje isprávná varianta (tzv.emendace ). Jako příklad uveďme systém užívaný pro chybové značkování korpusu ICLE (vizvýše). Tento systém využívá značky složené zpísmen. Ty se vkládají před chybně užitý tvar. Na prvním místě bývá označení typu chyby (tj.jde- -li opravopis, gramatiku, slovní zásobu, lexikálně -gramatický jev či slovosled). Ve větě označené Příklad 1 je ukázáno, jakým způsobem je možné označkovat chybné užití gramatického času vanglické větě. Student ve větě chybně užil přítomný čas, proto je před chybným tvarem slovesa live vložena značka (GVT). Ta označuje, že jde ogramatickou chybu (G) týkající se třídy sloves (V, anglicky verb) akategorie času (T, anglicky tense). Po slovesu je vložena emendace, tedy návrh anotátora na to, jak by mohla znít správná věta. Vtomto případě anotátor navrhuje, aby místo tvaru přítomného času slovesa live bylo užito předpřítomného průběhového času.
seznámení skorpusy akorpusovou lingvistikou 23 původní věta: Ilive in Prague for ten years anotovaná věta: I(GVT) live $have been living$ in Prague for ten years Příklad 1: Ukázka chybové anotace anglické věty– gramatika Vtakto označkovaném korpusu je pak možné jednotlivé chybové značky vyhledávat anechat si zobrazit třeba právě všechny věty schybou vpoužití časů. Ty se pak dají dále analyzovat, případně je možné jich využít pro tvorbu cvičení pro výuku. Specifi cké uplatnění tyto postupy nacházejí při tzv.kontrastivní analýze mezijazyka, při níž se porovnává psaný nebo mluvený projev žáků sodlišnými mateřskými jazyky (např.angličtina Čechů aŠpanělů). Dají se tak odhalit podobnosti či rozdíly azkoumat, zčeho tyto rozdíly pramení. Častým zdrojem chyb přitom bývá tzv.jazykový transfer, kdy si žák přenáší do svého cizojazyčného projevu prvky ze své mateřštiny. Jako ukázka nám znovu může posloužit Příklad 1, uněhož se můžeme domnívat, že chybné užití přítomného času vangličtině pramení ztoho, že je vodpovídající větě včeštině používán právě přítomný čas (Bydlím vPraze už deset let.). Je -li označkován celý korpus, je možno přistoupit kanalýze chyb. Chyby se vyhledají aroztřídí do kategorií podle různých kritérií. Spoužitím statistických nástrojů je pak možné ověřovat hypotézy osouvislosti mezi chybovostí anejrůznějšími žákovskými proměnnými, jako jsou např.jazyková úroveň, věk, mateřský jazyk, délka studia nebo pobyt vzahraničí. Na základě chybové analýzy je pak možné sestavit katalogy chyb, které mohou být návodné pro výuku nebo se dají využít při psaní výukových materiálů. Jazykové učebnice aslovníky určené pro žáky angličtiny tak dnes nezřídka obsahují informace očastých chybách. Jsou návod né nejen pro žáky, ale ipro učitele. Existuje dokonce islovník chyb vangličtině,16 který obsahuje více než 2500 příkladů běžných chyb, vysvětlení daných jevů aukázky správného užití zBritish National Corpus. Zkoumat se ale nemusí pouze chyby. Srovnáváním jazyka rodilých mluvčích sjazykem žákovským je možné zjistit, co je pro žákovský jazyk charakteristické například frekvenčně, tj.které jevy se objevují častěji akteré méně často. Mluví se pak onadužívání či naopak menší míře používání určitých gramatických jevů. Takové analýzy jsou pak užitečné například pro výuku jazyka pro specifi cké účely (např.akademická angličtina, vizvýše). Jedním znejzajímavějších apro učitele angličtiny zřejmě inejužitečnějších využití žákovských korpusů voblasti gramatiky je projekt English 16 Turton, N.D. and J.B. Heaton (1996). Longman Dictionary of Common Errors. Harwich: Longman.
30 korpusy v jazykovém vyučování ii. Ukázkovým příkladem využití korpusu vtomto směru je významná gramatika anglického jazyka Longman Grammar of Spoken and Wri en English .21 Vychází zkorpusu Longman Spoken and Wri en Corpus, který obsahuje 40 milionů slov z37 244 textů čtyř základních typů: konverzace, beletrie, žurnalistika aakademický text. Na jeho základě byl velmi přesně popsán například jazyk konverzace: bylo shledáno, že je bohatý na nevětné struktury, neúplné věty (vynechávají se například slova snízkou informační hodnotou) austálená víceslovná spojení, která plní různé funkce (např.mluvčí indikuje, že bude pokračovat vpromluvě, že se vrací kpůvodnímu tématuatp.). Obsahuje zároveň itzv.prostředky řečového managementu, které mluvčímu umožňují hovořit plynule. Sem patří např.výplňková slova avýplňkové pauzy, jejichž funkcí může být získání času pro plánování další promluvy nebo indikace, že mluvčí ještě současnou promluvu nedokončil. Tento výzkum inspiroval didaktiku cizích jazyků ktomu, aby se zaměřila nejen na tradiční výuku gramatiky založenou na psaném jazyce, ale ina jazykové prostředky charakteristické právě pro jazyk mluvený. Žákovská korpusová lingvistika pak vtéto oblasti zkoumá, do jaké míry tyto prostředky žáci využívají ajaké prostředky se naopak vjejich projevech vyskytují omezeně. Dalším zústředních témat je výzkum textové koherence. Jako koherenci označujeme sémantické, obsahové vztahy uvnitř diskurzu, které zajišťují jeho soudržnost, smysluplnost aplynulost. Mezi jednotlivými částmi koherentního textu totiž musí být patrná souvislost. Toho je možné dosáhnout používáním kohezních prvků, které explicitně naznačují, jak jsou jednotlivé úseky textu propojeny. Mezi tyto prvky patří například reference (odkazování na to, co již bylo řečeno, nebo na to, co bude vtextu následovat), konektory (spojovací výrazy vyjadřující logický vztah mezi jednotlivými částmi), substituce (použití jiného slova, které jasně odkazuje na to, co již bylo vyřčeno) atematicko -rematická struktura textu (tzv.aktuální členění větné). Výzkum koherence za použití korpusů je komplikovaný, neboť korpus neumožňuje zobrazit dlouhé úseky textu. Nejčastěji se proto pracuje právě sexplicitními kohezními prvky (obzvláště konektory), které je možno vkorpusu vyhledávat. Vžákovském jazyce se pak často zjišťuje, jak žáci tyto prostředky dokážou využít avjakých funkcích ajak jejich prostřednictvím vytvářejí strukturu textu. To má význam především při studiu avýuce akademického psaní. Ivtéto oblasti se využívají kontrastivní studie, které srovnávají texty žákovské stexty rodilých mluvčích. Pro vědecký text je též typické využívání rétorických prostředků pro zeslabování jistoty tvrzení (tzv.hedge) nebo jeho zesilování (tzv.booster). Ty se realizují použitím různých prostředků, např.modálních sloves (např.vý21 Biber, D., Stigg, J., Leech, G., Conrad, C. aE. Finegan. (1999) Longman Grammar of Spoken and Wri\ en English. Harlow: Pearson Education Limited.
seznámení skorpusy akorpusovou lingvistikou 31 sledky mohou naznačovat, že…), adverbií (např.tento výsledek nejspíš vypovídá o…)aj. Itoto je oblast, kterou si nerodilý mluvčí píšící vědecký text vcizím jazyce musí osvojit. Vžákovských korpusech akademického jazyka pak můžeme zkoumat, do jaké míry se to daří avčem spočívají odlišnosti od textů rodilých mluvčích či kompetentnějších autorů. Častým zjištěním je, že méně zkušení autoři nadužívají určitých prostředků modalizace vědeckého textu anevyužívají dostatečně jiných možností. Vneposlední řadě lze žákovský text korpusově analyzovat izpohledu zastoupení osobních zájmen ačinného či trpného rodu azjistit tak, do jaké míry dokáže žák prezentovat objektivní, neosobní vědecký text ajaké prostředky dokáže využít, když jako autor do textu potřebuje vstoupit například prezentováním svého postoje. 2.3.5. Pragmatika Pragmatika studuje jazyk zpohledu mluvčího apříjemce ataké to, jakým způsobem tito uživatelé jazyka dosahují svých komunikačních záměrů. Zkoumá tedy, jaký záměr má mluvčí, když něco sděluje, ajak je jeho sdělení interpretováno příjemcem. To závisí na takových faktorech, jako je například kontext promluvy či vztah mezi mluvčím apříjemcem, roli hraje ipříslušná jazyková kultura. Tyto faktory pak spolu svýznamem slov ovlivňují význam adopad celého sdělení. Podle teorie řečových aktů, která stojí vcentru pozornosti pragmatiky, je možné promluvou nejen něco prostě sdělit, ale iněco chtít, kněčemu se zavázat, kněčemu vyjádřit svůj postoj, případně vyřčením způsobit nějakou změnu. Vžákovském jazyce je pak možné tyto řečové akty identifi kovat azjistit, jaké prostředky pro jejich vyjádření mluvčí používá. Izde je výhoda korpusů především ve zpřístupnění velkého objemu dat kvýzkumu, který může být navíc prohledáván automatickými algoritmy za účelem identifi kovat vzorce, které se vtextu objevují. Kdiskurzní apragmatické analýze korpusů musejí být korpusy anotovány. To je však značně časově náročný ane vždy příliš snadný úkol, především vzhledem knutnosti správně vystihnout ainterpretovat původní záměr mluvčího.22 Zkoumají se tak například funkce tzv.diskurzních částic, což jsou prostředky, které umožňují vrozhovoru udržovat kontakt mezi mluvčími (např.angl. you know nebo české víte) ajsou vkorpusech snadno vyhledatelné. Výzkum též dokládá, že užívání diskurzních částic přispívá ke zvýšení plynulosti mluveného projevu azvyšuje jeho přirozenost. Zhlediska funkčního se značkují například korpusy zabývající se výzkumem specifi ckých textových žánrů aútvarů. Existují např.korpusy 22 Jeden zpříkladů pragmatické anotace korpusu je nástroj DART, více viz např. Weisser, M. (2018) How to Do Corpus Pragmatics on Pragmatically Annotated Data Speech acts and beyond. Studies in Corpus Linguistics: John Benjamins.
32 korpusy v jazykovém vyučování ii. abstraktů (tj.krátkých shrnutí akademického textu). Vnich jsou identifi - kovány aoznačkovány příslušné rétorické kroky (např.zasazení tématu do kontextu, stanovení cíle studieatp.), následně pak mohou být tyto rétorické postupy zkorpusu extrahovány aje možné zkoumat, jakými jazykovými prostředky jsou realizovány. Žákovský jazyk se zde znovu obvykle srovnává sjazykem rodilých mluvčích, ale provádějí se isrovnání mezi různými vědeckými obory ve snaze zefektivnit tento typ psané komunikace. Studium pragmatiky ukazuje, že žák cizího jazyka musí kromě gramatiky aslovní zásoby ovládnout ipravidla komunikace, která jsou běžná pro sociokulturní prostředí, vněmž se tento jazyk používá. Nejde jen oto, aby žák dosáhl svého komunikačního cíle, ale také aby svým jazykovým projevem neporušoval běžné (např.zdvořilostní) normy adokázal pro svá sdělení volit prostředky, které odpovídají konkrétní situaci, vníž se komunikace odehrává. Jakkoliv je tato oblast důležitá pro výzkum ivýuku, korpusové studie vtéto oblasti jsou zatím omezené. 2.3.6. Plynulost Snástupem korpusů zachycujících mluvený jazyk, jež jsou sohledem na nutnost nahrát apřepsat texty náročnější na sestavení než korpusy psané, se korpusově začínají zkoumat icharakteristiky řeči. Jednou ztakových oblastí je výzkum plynulosti. Plynulost je obtížně defi novatelný pojem, pod kterým si však nejsnáze představíme produkci řeči vdostatečném tempu abez velkého množství prvků, které bezprostředně nesouvisejí svýznamem sdělení, jako jsou např.různé projevy váhání. Tempo mluvy lze vkorpusech měřit pouze tehdy, pokud jsou dostupné ipůvodní nahrávky. Uvádí se obvykle ve slovech za minutu či slabikách za vteřinu. Upokročilých studentů angličtiny zjišťujeme průměrné tempo mluvy asi 150 slov za minutu, urodilých mluvčích pak více než 180 slov za minutu. Mezi jevy, které tzv.narušují plynulost projevu, se řadí kupříkladu vyplněné anevyplněné (tiché) pauzy (např.byl jsem eh unavený), opakované segmenty (např.nevím co se co se přesně stalo), nedokončené segmenty (např.byl jsem šel jsem tam pěšky), opravy (např.vzala mě nás na výlet), fragmentovaná slova (např.to nemu nemuselo být) aprodlužování slabik (např.řekl mi žeee). Také tyto jevy se vkorpusech značkují. Pak je možné zjistit nejen jejich frekvenci, ale ito, na jakém místě se vpromluvě vyskytují. Jedním zrozdílů mezi žákovským jazykem ajazykem rodilého mluvčího je to, že žáci častěji umísťují tyto prvky mezi jednotlivé části frází, které rodilí mluvčí zpravidla vyřknou najednou (např.velký eh význam má). Vypovídá to zřejmě otom, že rodilí mluvčí jsou schopni rychleji plánovat promluvu aprodukují tak delší celky azároveň váhají spíše na jejich začátcích než vjejich průběhu.
seznámení skorpusy akorpusovou lingvistikou 33 Všechny tyto prvky lze srovnávat na různých úrovních pokročilosti ataké mezi žáky arodilými mluvčími. Zkoumat lze ito, jaký efekt má na plynulost ajejí součásti typ úlohy, který žáci řešili (např.šlo -li omonolog, dialog, projev spředchozí přípravou, popis obrázkuatp.). Tento výzkum pak krom studia pokročilosti arozdílů mezi žákovským arodilým jazykem přispívá ikpoznání, jakým způsobem je produkována řeč. Vdidaktice má tento výzkum význam především pro oblast testování, neboť poskytuje popis ukazatelů charakteristických pro plynulost projevu, což se uústních jazykových zkoušek nezřídka hodnotí azároveň je ijedním zparametrů popisovaných Společným evropským referenčním rámcem. Vtéto kapitole jsme se pokusili nastínit, co jsou akviziční korpusy ajak se využívají při výzkumu žákovského jazyka za účelem jeho poznání anavržení možných didaktických postupů. Akviziční korpusy umožňují zkoumat žákovský jazyk zrůzných pohledů, srovnávat, jak se mění na jednotlivých úrovních pokročilosti ajaké jazykové prostředky aprojevy tyto úrovně charakterizují. Dále umožňují srovnávání sjazykem rodilých mluvčích jako přirozeným cílem velké části žáků cizích jazyků avneposlední řadě poskytují iempiricky ověřená zjištění využitelná při tvorbě jazykových materiálů (učebnic, slovníků, aplikací), jazykových testů adidaktických postupů. Jakkoliv je žákovská korpusová lingvistika oborem mladým, přinesl již výzkum ve všech těchto oblastech cenné výsledky apředevším prokazuje, že akviziční korpusy mají velký výzkumný ipedagogický potenciál, zněhož mohou čerpat nejen badatelé, ale iučitelé, studenti atvůrci jazykových testů asylabů.
34 korpusy v jazykovém vyučování ii. 3. Významné parametry korpusů Ukorpusů obecných se předpokládá, že směřují knaplnění určitých závazných parametrů. Jde zejména ovelikost avyváženost korpusu aoautentičnost jazykových dat, která korpus zahrnuje. Uvedené tři parametry zajišťují jeho reprezentativnost ve vztahu knormálnímu, obvyklému jazykovému úzu. Dalším důležitým parametrem je soustavné zaznamenávání informací opůvodu jednotlivých složek (textů), které jsou vněm zařazeny, ojejich autorech, žánru adalších údajů relevantních pro práci skorpusem. Tyto metatextové informace jsou přiřazeny všem strukturním jednotkám korpusu formou strukturních atributů . Kuvedeným parametrům přistupuje lingvistické značkování (lingvistická anotace ), tj.připojování lingvistické interpretace kjednotlivým tokenům (výskytům, textovým pozicím) formou pozičních značek. Každé slovo tedy mívá přidělený základní slovníkový tvar adále značku, obvykle smorfologickými či méně často se syntaktickými informacemi. Korpusy speciální se vyznačují tím, že některý či některé ztěchto parametrů porušují, nenaplňují, případně ve snaze ojejich naplnění postupují specifi ckým způsobem, některé parametry rozšiřují (strukturní atributy, lingvistické značkování)apod.23 3.1. Velikost Obecné korpusy usilují omaximální možnou velikost . Čím větší objem jazykového materiálu zahrnují, tím větší je pravděpodobnost, že odrážejí reálný jazykový úzus aže budou využitelné iujevů méně frekventovaných. Větší velikost rovněž umožňuje, aby byly vkorpusu zahrnuty všechny relevantní variety daného jazyka vodpovídajících proporcích, tedy aby byl vyvážený aaby bylo možné považovat ho za reprezentativní vůči normálnímu, ob23 Ktematice obecných korpusů akorpusové lingvistiky podrobněji např.Mc Enery - Hardie (2012), kakvizičním korpusům, zvl. pro češtinu, Šebesta (2010), Šebesta - Škodová (2012), Štindlová (2011), kaktuálním datům onabídce korpusů pro češtinu akorpusů žákovských h\ ps://wiki.korpus.cz/doku.php/cnk:uvod, resp. Learner corpora around the world; ztěchto zdrojů tato iprvní kapitola převážně čerpají.
seznámení skorpusy akorpusovou lingvistikou 35 vyklému užívání jazyka. Díky tomu mohou tyto korpusy dobře sloužit pro tvorbu slovníků, gramatik, thesaurů adalších referenčních knih. Velikost synchronních korpusů vposledních desetiletích rychle roste. Zatímco vpočátcích korpusové lingvistiky, v60. a70. letech minulého století, se velikost korpusů uváděla vmilionech tokenů (konkrétní výskyt každého slovního tvaru vtextu),24 udnešních korpusů se uvádí vmiliardách. Např.Český národní korpus jako zastřešující projekt zajišťující budování korpusů českého jazyka na Univerzitě Karlově zahrnuje kdatu vzniku tohoto textu relativně nově český synchronní korpus SYN verze 6 ovelikosti cca4 miliardy slov, patří tedy mezi tzv.korpusy velké (pohybující se vřádu stovek milionů až vmiliardách textových slov). Vedle toho rozlišujeme dnes ještě korpusy střední (obsahující řádově desítky milionů textových slov) akorpusy malé (pohybující se vřádu stovek tisíc textových slov). Isebevětší korpus je ovšem menší než web– největší existující avolně dostupný soubor textů. Iweb lze využívat jako korpus; byla vyvinuta rozhraní, která kvyužití webu jako korpusu slouží– např.WebCorp . 25 Web jako korpus má některá specifi ka, která se mohou jevit jako výhody, nebo nevýhody, vzávislosti na cíli, který při vyhledávání sledujeme. Většinou je nepochybnou výhodou webu jako korpusu jeho velikost. Některé výrazy či kolokace, které jsou málo frekventované, mohou vobyčejném korpusu úplně chybět nebo mít jen mizivé zastoupení, totéž platí ioněkterých druzích málo frekventovaných pravopisných či jiných formálních odchylek či variant, málo frekventovaných typů užitíapod., které na webu– vzhledem kjeho velikosti– můžeme najít svyšší úspěšností než vkorpusu. Hlavním problémem webu jako korpusu je skutečnost, že nám podává jazykový materiál vnerozlišené směsi textů různých typů, není tedy možné posoudit ani jeho skladbu, ani kontext užití hledaných jevů. To se může jevit jako značná potíž např.vpřípadech, kdy hledáme velmi frekventované jazykové jevy apotřebujeme počet nalezených řádků redukovat podle nějakých lingvisticky relevantních kritérií. Dalším problémem je nestálost webu– web se neustále aprůběžně mění, výzkum, který na něm byl založen, tedy není možné replikovat nebo jen velmi obtížně. Výhodou standardního obecného korpusu ve srovnání swebem je tedy jeho promyšlené složení zrůzných typů textů vnáležitých proporcích, větší nebo menší míra jeho vyváženosti, jeho relativní ustálenost azaznamenávání metatextových informací. Žákovské korpusy se co do velikosti od korpusů obecných výrazně liší, přesněji řečeno, jsou vtomto ohledu podstatně pestřejší. Žákovské korpusy 24 Už zmiňovaný Brown Corpus obsahoval jeden milion slov, stejnou velikost měl irovněž zmiňovaný korpus britské angličtiny LOB corpus. 25 h\ p://www.webcorp.org.uk/live/
36 korpusy v jazykovém vyučování ii. sobjemem několika (desítek) milionů textových slov najdeme vsoučasnosti pouze uangličtiny jako cizího jazyka. Dosud největší známý korpus je Chungdahm Corpus , tvořený eseji, které napsali korejští studenti angličtiny na Chungdahm institutu, národním řetězci škol anglického jazyka, achybově anotovaný tutory. Eseje jsou uloženy jako stále doplňovaná databáze, nikoli korpus; ztéto databáze byl vyčleněn pro výzkumné účely velký objem dat jako Chungdahm Corpus ovelikosti přibližně 131 milionů slov (přesněji 130 754 tisíc slov) ve více než 860 esejích oprůměrné délce 152 slov (Han et al. 2010). Korpus této velikosti je však iuangličtiny spíše výjimkou. Co do velikosti následují e Cambridge Learner Corpus obsahující cca50 milionů textových slov (také ten je založen na esejích napsaných vrámci zkoušek angličtiny) aHKUST ( e Hong Kong University of Science & Technology Learner Corpus) ovelikosti cca25 milionů slov. Ostatní korpusy angličtiny ikorpusy dalších jazyků se pohybují vpodstatně nižších hodnotách– jen výjimečně dosahují hodnoty 2 milionů slov nebo ji překračují. Mezi velikostně nejmenšími uváděnými korpusy jsou např. e Pilot Arabic Learner Corpus, korpus arabštiny užívané mluvčími angličtiny jako prvního jazyka, obsahující psané vyprávěcí texty mírně pokročilých apokročilých studentů arabštiny ocelkovém rozsahu 9 000 slov, nebo ~ e PIKUST, korpus slovinštiny jako cizího jazyka, který obsahuje texty psané mluvčími 18 různých prvních jazyků, většinou chorvatštiny, srbštiny aruštiny, ocelkovém rozsahu 35 tisíc textových slov. Velikost žákovských korpusů sice postupně roste, podobně jako velikost korpusů obecných, ale podstatně nižším tempem. Menší objem žákovských korpusů je dán obtížností sběru dat afi nanční ičasovou náročností jejich přepisu adalšího zpracování. První problém je spojen se skutečností, že je objem řečové produkce nerodilých mluvčích neporovnatelně menší než objem dat produkovaných mluvčími rodilými. Navíc se jedná oprodukci obtížně dostupnou– pokud jde např.opísemné práce psané pro školu, disponuje jimi škola anemusí je pro potřeby korpusu zpřístupnit. Umluvených projevů se sběry setkávají spodobnými problémy jako sběry pro mluvené korpusy jazyka rodilých mluvčích, jen stím rozdílem, že projev nerodilého mluvčího bývá mnohonásobně kratší než projev rodilého mluvčího acelkový objem mluvených projevů nerodilých mluvčích je rovněž neporovnatelně menší. Kobtížnostem sběru přistupuje fakt, že projevy nerodilých mluvčích se sbírají vpodobě nahrávek mluvených projevů nebo vpodobě rukopisů, vobou případech se tedy musí texty přepisovat. Zatímco umluvených projevů lze dnes, jde -li okvalitní nahrávky standardní mluvy, využít automatického přepisu, unerodilých mluvčích jde většinou onestandardní jazyková data, která automatické zpracování vdobré kvalitě neumožňují, přepisuje se tedy manuálně, příp.se automatický přepis následně upravuje.
seznámení skorpusy akorpusovou lingvistikou 37 Je příznačné, že větších velikostí dosahují ty žákovské korpusy, které se mohou opřít ospolupráci se školami nebo které jsou přímo sjejich činností spojeny– srov. výše uvedený Chungdahm Corpus, zpracovávající produkci žáků řetězce škol Chungdahm, Cambridge Learner Corpus, rovněž obsahující produkci žáků při zkouškách, nebo HKUST, obsahující písemné práce vzniklé vrámci maturitních zkoušek zangličtiny. Totéž platí iovětších žákovských korpusech mluvených, jako je např.mluvená složka korpusu BICCEL (Bilingual Corpus of Chinese English Learners ), která vychází znahrávek při národním testu mluvené angličtiny, korpus NICT JLE (Japanese Learner English), také čerpající ztestů mluvené angličtiny, nebo korpus SWECCL (Spoken and Wri en English Corpus of Chinese Learners).26 České žákovské korpusy řady CZESL patří svou velikostí vporovnání sjinými jazyky kromě angličtiny, která má vtomto ohledu mimořádné postavení, ke korpusům standardním, či spíše větším. Pro badatelské ipedagogické účely se zkorpusů této řady nejspíše nabízí automaticky emendovaný, anotovaný (také chybově) alemmatizovaný korpus CZESL -SGT . Zahrnuje 8617 textů od 1965 různých autorů (to znamená, že od jednoho autora jsou vkorpusu zařazeny vprůměru zhruba čtyři texty). Objem jazykových dat činí 1148 tisíc tokenů (pozic), ztoho 958 tisíc slov a111 tisíc vět. Druhým korpusem téže řady sprovedenou emendací, anotací alemmatizací je CZESL -MAN ; od CZESL -SGT se liší tím, že byl emendován manuálně achybová anotace byla provedena poloautomaticky svysokým podílem manuálního zpracování. Manuální emendace aanotace je spolehlivější než emendace aanotace automatická, ale také je časově výrazně náročnější. CZESL -MAN je proto zatím podstatně menší než korpus CZSL -SGT (obsahuje cca124 tisíc slov) anení volně přístupný. 3.2. Vyváženost Vyváženost obecných korpusů je vlastnost, oniž se tvůrci korpusů vnějaké míře snaží, míra jejího dosažení záleží ale na tom, jaká kritéria zvolí ajak se vyrovnají sobtížemi, které jsou stím spojeny. Vzhledem kvelmi variabilním možnostem využití korpusů není možné vyváženost korpusu opírat ovnitřní, lingvistická hlediska, ale okritéria vnější. Obecné korpusy vČeském národním korpusu se opíraly zpočátku ozřetel krecepci– ty typy textů, které byly častěji čteny větším počtem mluvčích daného jazyka, byly vkorpusu zastoupeny ve větší proporci než typy textů, které se četly méně. Struktura typů textů aproporce jejich zastou26 Kmluveným korpusům angličtiny jako L2 viz např. Kolesnikova, O. – González-González, O.-A., 2016.
38 korpusy v jazykovém vyučování ii. pení vsynchronních korpusech současné psané češtiny byly tedy zpočátku stanoveny na základě výzkumů čtenářské recepce. Vprvním korpusu řady SYN, SYN2000, tvořila většinu (dvě třetiny) textů publicistika, přibližně čtvrtinu texty odborné, zbytek texty imaginativní (beletrie, především próza). Vkorpusu SYN2005 se tyto proporce na základě nových výzkumů recepce změnily– publicistika představovala pouze 1/3 velikosti korpusu, odborná literatura 27%, podíl beletrie vzrostl na 40%; podobné proporce byly zvoleny pro korpus SYN2010. Korpus SYN2015 toto rozdělení opustil, tři textové makrotypy (publicistika, odborná literatura abeletrie) jsou vněm zastoupeny rovným dílem. Všechny uvedené korpusy (včetně korpusu SYN2015) se pokládají za reprezentativní vtom smyslu, že zahrnují co nejširší spektrum různých typů veřejných psaných (tištěných) komunikátů, které jako celek reprezentují současnou psanou češtinu, nezachycují ji však vproporcích odpovídajících přesně jazykové populaci.27 Vřadě SYN byly kromě toho zveřejněny rovněž korpusy české publicistiky (SYN2006PUB, SYN2009PUB, SYN2013PUB), které reprezentativní ve vztahu kobecnému jazykovému úzu nejsou (zahrnují pouze texty zoblasti publicistiky). Zatím poslední korpus SYN verze 6 zahrnuje všechny starší synchronní psané korpusy řady SYN včetně korpusů české publicistiky ataké nový publicistický materiál, vzhledem kvelké převaze publicistické složky ho tedy rovněž nelze označit za vyvážený areprezentativní. Vyváženost (ataké velikost) asnimi spojená reprezentativnost se řeší samostatně adosahuje jiných hodnot ukorpusů psaného akorpusů mluveného jazyka. Materiál pro psané korpusy se snáze získává (pro korpusy řady SYN získává tvůrce naprostou většinu materiálu, přibližně 90%, přímo velektronické podobě od nakladatelů avydavatelů na základě smluv), zatímco získat materiál pro mluvené korpusy je obtížnější (data se sbírají formou audio či videonahrávek; větší podíl má běžná mluva) anáročné je ijeho další zpracování, především přepis. Proto se umluvených korpusů pohybujeme vobjemech podstatně nižších. Pro češtinu je zatím největším mluveným korpusem ORAL, zahrnující dřívější korpusy řady ORAL (ORAL2006, ORAL2008, ORAL2013) apřepisy nových nahrávek (ORAL -Z). Přepisy nahrávek převážně neformálních rozhovorů, které ho tvoří, mají celkový objem 5,4 milionu textových slov, vporovnání se stamilionovými objemy psaných korpusů tedy podstatně menší. Korpus také není vyvážený zteritoriálního hlediska (podíl rozhovorů zČech je vyšší). Vyvážený co do relevantních sociologických kritérií (pohlaví, věk, vzdělání, oblast pobytu vdětství) aztohoto hlediska reprezentativní je nejnovější mluvený korpus češtiny ORTOFON oobjemu 1 milion textových slov. 27 h\ p://wiki.korpus.cz/doku.php/cnk:syn2015
seznámení skorpusy akorpusovou lingvistikou 39 Svyvážeností volně souvisí ivolba komponent, znichž se korpus skládá; někdejší Brown Corpus adalší korpusy jím vtomto ohledu inspirované (Lancaster -Oslo -Bergen Corpus, British National Corpus) se skládaly ze vzorků textů ostandardním rozsahu (Brown Corpus např.obsahoval 500 vzorků textů o2000 slovech). Soudobé korpusy, včetně obecných korpusů ČNK, se skládají zcelých textů. Lze říci, že reprezentativnost korpusu ve vztahu kběžnému, normálnímu jazykovému úzu je hodnota, kníž obecné korpusy snahou ovelikost avyváženost směřují, ikdyž jí nikdy plně nedosahují. Při práci skorpusem ovšem sledujeme často jen určitou specifi ckou oblast jazyka ajeho užívání, posuzujeme tedy přirozeně ireprezentativnost příslušného korpusu zhlediska jeho výzkumného cíle apodle populace textů, na niž je náš výzkum zaměřen. Užákovských korpusů ovyváženost ve smyslu úplného aproporcionálního zastoupení jednotlivých variet jazyka nerodilých mluvčích neusilujeme. Je to dáno tím, že ucizího jazyka, jeho osvojování aužívání se setkáváme sneporovnatelně vyšší variabilitou než ujazyka prvního atato variabilita je vázána na mimořádně vysoký počet významných proměnných, které při výzkumu ipři výuce potřebujeme brát vúvahu. Přinejmenším za současných technických podmínek apři současné velikosti žákovských korpusů není možné uvažovat ovyváženosti jakéhokoli žákovského korpusu ve vztahu kcelé populaci. Není to ani cílem jejich tvůrců. Hlavním cílem žákovských korpusů vtomto směru je umožnit studium variability žákovského jazyka (mezijazyka) ajeho užívání astudium vztahu této variability kco největšímu počtu sledovaných apečlivě zaznamenávaných proměnných. Při práci sžákovským korpusem tedy neočekáváme, že reprezentuje mezijazyk nerodilých mluvčích jako celek, to není dost dobře možné, ale že spolehlivě zaznamenává aumožňuje studovat užívání některé jeho variety ve vztahu kco největšímu počtu faktorů. Při posuzování kvality žákovského korpusu tak přihlížíme nejen kjeho velikosti, ale ktomu, zda obsahuje tu varietu mezijazyka žáků, která nás zajímá, ataké ktomu, kolik faktorů (akteré) ovlivňujících její užívání zaznamenává ajak podrobně. Nejčastěji to bývá první jazyk žáků (např.čeština žáků sprvním jazykem čínským) aúroveň ovládání cílového jazyka (zřídka jde ozačátečníky, častěji omírně pokročilé nebo pokročilé), téma (blízké, známé, citově zabarvené vs. vzdálené, neznámé, citově neutrální), žánr, způsob sběruapod. Korpusy řady CZESL28 byly budovány se snahou získat jazyková data vtakové skladbě, aby vnich byly zastoupeny všechny úrovně ovládání jazyka, od začátečníků po pokročilé, aaby vrepertoáru prvních jazyků studentů byly dostatečně zastoupeny tři jejich skupiny: jazyky slovan28 CZESL -PLAIN, CZESL -SGT, CZESL -MAN (sekundárně ijejich deriváty).
46 korpusy v jazykovém vyučování ii. dnes chybovým značkováním vybaven; volí se přitom různě detailní strategie– někdy jsou chyby pouze vyznačeny, emendovány, jindy též pojmenovány (zařazeny do určité kategorie), případně hodnocenyatd. Zkorpusů řady CZESL jsou emendovány, lemmatizovány aotagovány, včetně tagování chybového, CZESL -SGT aCZESL -MAN. CZESL -SGT byl emendován automaticky spomocí specifi ckých programů pro kontrolu pravopisu agramatiky; vznikly tak dvě vrstvy, původní aemendovaná, slovům vobou těchto vrstvách byla přiřazena, opět automaticky, lemmata atagy (slovnědruhové amorfologické značky), dále pak údaje ochybě. CZESL -MAN prošel emendací manuální anávazně semiautomatickou anotací, rovněž včetně anotace chybové. Při hledání vkorpusu CZESL -SGT můžeme vyjít způvodního tvaru (word, kněmu je vázáno lemma, tag; ktypům vyhledávání vizdále) nebo ztvaru emendovaného (word1, lemma1, tag1), můžeme hledat typy chyb (err)apod. Zadáme -li např.word137 slova miluje, zobrazí se nám na pozici word jak užité tvary standardní, tak itvary chybové (míluje, milujút). Je potřeba upozornit, že uautomatické emendace aanotace musíme počítat snepřesnostmi aomyly, ato jak ve vlastní emendaci, tak vanotaci. Pokud jsme si toho ale vědomi, může nám korpus CZESL -SGT posloužit jako mimořádně bohatý zdroj dat pro výzkum ivýuku. 37 Viz dále.
seznámení skorpusy akorpusovou lingvistikou 47 4. Práce skorpusem Vnásledující kapitole se seznámíme sněkolika korpusy češtiny ase základními způsoby vyhledávání vnich. 4.1. Český národní korpus (ČNK) 4.1.1. Materiál/Obsah Český národní korpus je projekt, který má za úkol vytváření dílčích korpusů češtiny. Obsahuje především korpusy psaného jazyka, ale také několik korpusů mluvené češtiny. Vsouhrnu se jedná onejobsáhlejší jazykový materiál, který je pro češtinu zpracován. Psané korpusy lze dělit na korpusy synchronní , které dokládají současný jazykový úzus, akorpusy diachronní , které zachycují jazyk vjeho vývoji. Nezanedbatelný je také mnohojazyčný paralelní korpus InterCorp , který nabízí zarovnané texty (překlady textů) ztéměř 40 jazyků. Kompletní přehled všech dostupných korpusů vč. jejich charakteristiky najdete na webu Českého národního korpusu.38 Pro výuku žáků sOMJ jsou relevantní především reprezentativní korpusy současné češtiny, např.SYN2015, nebo akviziční korpusy, např.žákovský korpus CZESL. Vzávislosti na cíli výuky apo zvážení jazykového původu žáků lze využít také texty paralelního korpusu InterCorp. 4.1.2. Vyhledávač neboli korpusový manažer ČNK využívá korpusový manažer KonText , dostupný zwebové stránky ČNK www.korpus.cz. KonText je umístěn vhorním menu vlevo. Lze jej využívat ibez registrace, po bezplatném zaregistrování je ale kdispozici více funkcí. 38 h\ ps://wiki.korpus.cz/doku.php/cnk:uvod
48 korpusy v jazykovém vyučování ii. Obrázek 1: Úvodní stránka manažeru KonText 4.1.3. Vyhledávání Před vyhledáváním je třeba si ujasnit základní parametry, které ovlivňují jeho výsledek. Jedná se ovolbu korpusu, výběr typu dotazu, zadání dotazu, příp.specifi kaci kontextu aomezení hledání. První tři jmenované kategorie jsou klíčové anelze je vynechat. Na volbě těchto tří kategorií také přímo závisí výsledek korpusové analýzy. Poslední dvě kategorie jsou fakultativní aumožňují přesnější zadání dotazu. Obrázek 2: Zadání dotazu vKonTextu
seznámení skorpusy akorpusovou lingvistikou 49 4.1.4. Volba korpusu Vprvní řadě je třeba zvolit korpus, vněmž bude hledání probíhat. Výběrem pole spřednastaveným korpusem se otevře tabulka se štítky, podle nichž lze vkorpusech hledat. Pro lepší přehlednost je možné se orientovat podle seznamu korpusů na encyklopedii wiki .39 Každý ze štítků pod sebou skrývá nabídku všech relevantních korpusů, znichž si lze následně vybrat ten nejvhodnější. Obrázek 3: Výběr zdrojového korpusu 4.1.5. Typ dotazu Před zadáním vlastního dotazu je třeba vybrat jeho typ. Přednastavený je základní typ dotazu . Jedná se ointuitivní způsob zadání dotazu. Pokud je do pole dotazu zadáno slovo vzákladním tvaru (upodstatných jmen první pád jednotného čísla, usloves infi nitiv, upřídavných jmen nestupňovaný tvar mužského roduapod.), zobrazí se výsledky obsahující všechny tvary hledaného slova (od slova mladý doklady obsahující všechny slovní tvary– mladými, mladým, mladéhoapod.). Pokud vzákladním typu dotazu zadáme konkrétní slovní tvar (např.mladými), budou výsledky analýzy zahrnovat pouze texty obsahující tento slovní tvar. Vzákladním dotazu lze zadávat islovní spojení, přičemž platí stejná pravidla jako ujednoslovných zadání. Usousloví vkonkrétním tvaru (např.svelkou pravděpodobností) budou výsledky obsahovat texty stímto konkrétním tvarem. Pro vyhledání všech tvarů sousloví je třeba zadat jeho komponenty vzákladním tvaru, tj.např.pro spojení svelkou pravděpodobností zadáme dotaz ve tvaru svelký pravděpodobnost. 39 h\ ps://wiki.korpus.cz/doku.php/cnk:uvod
50 korpusy v jazykovém vyučování ii. Výsledky pak obsahují sousloví svelkou pravděpodobností, světší pravděpodobností, snejvětší pravděpodobností. Využití základního typu dotazu je tedy vhodné pro jednodušší dotazy adoporučuje se pro korpusové začátečníky. Jeho nevýhodou je, že nemůže obsahovat tzv.regulární znaky, tj.znaky mající zástupnou funkci (více oregulárních znacích obsahuje wiki40). Druhým typem dotazu je lemma . Do pole dotazu se zadává základní tvar slova ave výsledcích se zobrazují všechny tvary zvoleného slova. Výhodou dotazu typu lemma je, že umožňuje doplnit dotaz ospecifi kaci slovního druhu, atím uněkterých slov zamezit vysoké chybovosti zdůvodu homonymie. Příkladem může být slovo stát, které včeštině existuje jako podstatné jméno isloveso. Třetím typem dotazu je fráze . Při volbě fráze se do pole dotazu zadává slovní spojení vkonkrétním tvaru, které je pak také vtémže tvaru zobrazeno ve výsledcích analýzy. Čtvrtým typem dotazu je slovní tvar . Do pole dotazu se zadává konkrétní slovní tvar, který je pak zobrazen ve výsledcích. Pokud je při tomto typu zadán neutrální slovní tvar (např.infi nitiv), je na rozdíl od základního typu dotazu ve výsledcích zobrazen jen infi nitiv, nikoli další slovní tvary. Slovní tvar je možné upřesnit volbou slovního druhu (např.mezi– předložka vs. podstatné jméno v6. pádě jednotného čísla). Utypů dotazů lemma aslovní tvar je na rozdíl od základního typu dotazu možné volit slovní druhy, atím eliminovat tvarovou homonymii. Předposledním nabízeným typem dotazu je část slova . Umožňuje vyhledat slovní tvary, které obsahují zadaný řetězec znaků, azahrnout do dotazu též regulární (tj.zástupné) znaky. Řetězcem znaků je myšlen pouhý sled znaků/písmen bez nároku na morfologické dělení (kořen slova, předpony, příponyatd.). Hledáme -li tedy pomocí tohoto typu dotazu slova spředponou před-, bude ve výsledcích analýzy zobrazen též slovesný tvar přede od slovesa příst. Posledním typem dotazu je CQL (= corpus query language ), což je dotazovací jazyk umožňující komplikovanější vyhledávání. Více kpráci sCQL najdete na wiki.41 Pro jednoduchou arychlou orientaci vrozdílech mezi typy dotazů slouží nápověda ve formě modrého pole sotazníkem, která uživateli poskytne rychlou charakteristiku zvoleného typu dotazu. 40 h\ ps://wiki.korpus.cz/doku.php/kurz:regularni_vyrazy 41 h\ ps://wiki.korpus.cz/doku.php/kurz:pokrocile_dotazy
seznámení skorpusy akorpusovou lingvistikou 51 Obrázek 4: Volba typu dotazu 4.1.6. Zadání dotazu Po výběru typu dotazu je třeba dotaz formulovat. Vzávislosti na vybraném typu dotazu lze zadat základní nebo konkrétní slovní tvar, příp.použít vdotazu regulární znaky . Po výběru některých typů dotazů je zpřístupněno doplňkové okno umožňující defi novat slovní druh. Uníže uvedeného příkladu je hledáno sloveso stát ve všech jeho tvarech (je tedy vyloučena homonymie spodstatným jménem stát). Obrázek 5: Zadání dotazu aspecifi kace slovního druhu
52 korpusy v jazykovém vyučování ii. 4.1.7. Specifi kace kontextu Oddíl specifi kace kontextu se využívá tehdy, pokud uživatel potřebuje ovlivnit kontext vyhledávaného výrazu nad rámec možností, které mu poskytuje zadání dotazu. Využívá se tehdy, pokud hledané slovo chceme vjeho nejbližším okolí rozšířit odalší slovo/slova, příp.pokud chceme další slovo/slova vokolí zvyhledávání vyloučit. Zadávat lze jak konkrétní slova/slovní tvary, tak kategorie slovních druhů. Specifi kace kontextu také slouží tam, kde je třeba vyhledat víceslovné spojení, jehož komponenty nestojí pevně za sebou (ktomu slouží typ dotazu fráze). Po volbě specifi kace kontextu se zadávací tabulka rozšíří oněkolik částí. Voddílu Filtrovat podle lemmatu je třeba nejprve určit, jaký kontext má být do vyhledávání zahrnut. Kontext se určuje vtokenech (jeden token = zjednodušeně jeden slovní tvar na daném místě), jejichž počet si uživatel volí vtabulce. Před údajem kpočtu tokenů uživatel vybírá, zda se počet zahrnutých tokenů týká jen části textu před hledaným slovem, tj.vlevo, nebo po hledaném slově, tj.vpravo, nebo na obě strany od hledaného slova, tj.vlevo ivpravo. Je možné zadávat slova vjejich základních tvarech, tj.lemmatech. Pole Lemma(ta) umožňuje vepsat jedno nebo více slov. Vtabulce na konci řádku je třeba vybrat, zda mají být zadaná slova obsažena všechna vzadaném kontextu, nebo zda může být vybráno kterékoli ze zadaných slov, příp.zda nemá být vybráno žádné. Při zadání jednoho slova znamená výběr všechny akteroukoli totéž. Uzadání všechna se ve výsledcích hledání zobrazí všechny úryvky textů, které obsahují hledaný výraz (vpoli Dotaz) azároveň také všechna zadaná slova vrámci nastaveného kontextu. Jako příklad uveďme podstatné jméno telefon zadané vpoli Dotaz, kněmuž jsou ve specifi kaci kontextu uvedeny atributy chytrý amobilní. Výsledky pak budou zobrazovat jen ty úryvky textů, které obsahují všechna tři slova, tj.chytrý, mobilní, telefon. Uzadání kteroukoli se ve výsledcích hledání zobrazí všechny úryvky textů, které obsahují hledaný výraz (vpoli Dotaz) azároveň vždy alespoň jedno ze zadaných slov, ve výše uvedeném příkladu to tedy budou úryvky obsahující slovní spojení chytrý telefon amobilní telefon. Uzadání žádnou se ve výsledcích hledání zobrazí všechny úryvky textů, které obsahují hledaný výraz (vpoli Dotaz) azároveň neobsahují ani jedno ze zadaných slov, obsahují tedy telefon, ale nikoli chytrý ani mobilní. Volba žádnou má tedy funkci negativního fi ltru, jímž defi nujeme, sjakými slovy se slovo zadané vdotazu nemá vyskytovat. Voddílu Slovní druh se postupuje při zadávání stejně jako voddílu Filtrovat podle lemmatu, jen stím rozdílem, že se nevypisují konkrétní slova vzákladním tvaru, ale volí se jen slovní druh/druhy jako kategorie.
seznámení skorpusy akorpusovou lingvistikou 53 Obrázek 6: Specifi kace kontextu 4.1.8. Omezení hledání Pokud se uživatel rozhodne, že nechce vyhledávat vcelém zvoleném korpusu, může své vyhledávání omezit. Texty jsou vkorpusu tříděny podle různých kritérií (podle textového druhu, žánru, typu média, pohlaví autoraapod.) ana základě těchto kritérií lze vybrat skupiny textů, které budou zanalýzy vyloučeny. Obrázek 7: Omezení hledání
54 korpusy v jazykovém vyučování ii. Po vyplnění úvodní zadávací tabulky (ne všechny oddíly je třeba vždy vyplnit) azvolení tlačítka Hledat se spustí analýza. 4.1.9. Výsledky hledání Vnásledujícím textu bude popsána výsledková tabulka amožnosti dalšího zpracování zobrazených výsledků. Pro zde použité vzorové vyhledávání byl zvolen výchozí korpus SYN2015, typ dotazu Lemma, dotaz stát se specifi kací slovního druhu sloveso. Ve výsledkové tabulce je zobrazeno shrnutí zadání dotazu apočet nalezených výsledků, tj.počet textů, vnichž se objevil slovní tvar odpovídající zadání. Kromě absolutního počtu výskytů slovního tvaru je uváděn také údaj i.p.m. , což je relativní frekvence přepočítaná na celkovou velikost korpusu. Pro kvantifi kaci se jedná orelevantnější údaj, než je frekvence absolutní. Výsledková tabulka obsahuje několik základních částí. Každý řádek (konkordance ) je úryvkem textu, vněmž se hledané slovo vyskytuje. Vkaždém řádku lze odlišit několik typů údajů, které napříč řádky tvoří sloupce. Zleva se jedná oikonu umožňující nahlédnout do syntaktické struktury zvolené věty. Následuje bibliografi cký údaj ozdrojovém textu, po jehož výběru se zobrazí kompletní bibliografi cké informace otextu. Nejdůležitější je střední část obrazovky, která nabízí úryvky textů svycentrovaným klíčovým/hledaným slovem (KWIC). Pokud je potřeba zobrazení delšího kontextu, je to umožněno kliknutím na vybrané klíčové slovo. Defaultní nastavení korpusu zobrazuje 40 konkordancí. Pro zobrazení dalších je třeba se přesunout na další stránku výsledků. Obrázek 8: Výsledky hledání Zobrazením výsledkové tabulky ale práce skorpusem nekončí/nemusí končit. Výsledky lze ještě třídit afi ltrovat nebo vnich dále hledat. Všechny nástroje pro zpracování výsledků aovládání vyhledávání jsou knalezení vhorním menu. Vnásledujícím textu si představíme ty nejdůležitější znich.
seznámení skorpusy akorpusovou lingvistikou 55 Pomocí záložky Dotaz je možné vrátit se do úvodní zadávací tabulky azahájit tak nové hledání. Nabídka Předchozí dotazy zobrazí historii dosavadních dotazů (vrámci jednoho sezení) aumožní se vrátit ke starším vyhledáváním ajejich výsledkům. Vzáložce Korpusy– Dostupné korpusy je nabízen přehled všech korpusů ČNK, které je možné zvolit jako zdroje pro vyhledávání (obdobně vúvodní zadávací tabulce při volbě korpusu). ČNK umožňuje svým uživatelům vytvoření vlastních subkorpusů, tj.korpusů, které si uživatel defi nuje zdostupného textového materiálu ČNK sám. Pro vytvoření vlastního subkorpusu musí být relevantní důvod, protože výběrem textů do korpusu jsou významně ovlivněny výsledky hledání atím iinterpretace těchto výsledků. Pro vytvoření asprávu vlastních subkorpusů slouží nabídka Mé subkorpusy, Vytvořit vlastní subkorpus aVytvořit veřejný subkorpus. Vlastní subkorpus bude kdispozici jen danému uživateli, veřejný subkorpus lze nasdílet vybraným uživatelům, např.studentům ve třídě. Obrázek 9: Vytvoření vlastního subkorpusu Výsledky hledání lze uložit na vlastní zařízení, např.na disk počítače. Je tím umožněna práce sdaty ivrežimu offl ine. Ukládat lze vrůzných formátech, např.csv.xlsx.xml či.txt. Obrázek 10: Uložení výsledků hledání Svýsledky hledání, resp. jednotlivými konkordancemi, lze dále pracovat. Relevantní může být jejich promíchání (volba Promíchat ) či výběr náhodného vzorku, jehož velikost určuje uživatel sám (volba Vzorek ). Tuto volbu lze provést vpřípadech, kdy je počet nalezených konkordancí příliš vysoký na to, aby mohlo dojít kjeho manuálnímu zpracování.
62 korpusy v jazykovém vyučování ii. riant vpsaném amluveném jazyce. Ostatní výsledky jsou roztříděné podle dalších kritérií ajsou knahlédnutí vzáložkách pod koláčovými grafy. Obrázek 24: SyD– výsledek vyhledávání porovnání tvarů bychom abysme Vzáložce Rozložení je možné nahlédnout do grafu znázorňujícího, vjakých textových typech ažánrech se zvolená varianta nachází. Po zvolení varianty 2 se graf přeskupí. Výsledky jsou opatřeny podrobným komentářem umožňujícím orientaci vproblematice interpretace těchto výsledků. Obrázek 25: SyD– typy textů Vnásledující záložce jsou graf týkající se psaného jazyka arozložení zvolených variant vtypech textů atextových žánrech zobrazeny podrobněji než vzáložce Rozložení. Pro ilustraci je vnásledujícím obrázku znázorněno rozložení podle žánrů.
seznámení skorpusy akorpusovou lingvistikou 63 Obrázek 26: SyD– rozložení podle žánrů Záložka pro mluvený jazyk nabízí jiné kategorie třídění, např.podle pohlaví avěku mluvčího, podle jeho vzdělání či nářeční příslušnosti. Obrázek 27: SyD– třídění podle pohlaví avěku
64 korpusy v jazykovém vyučování ii. Obrázek 28: SyD– třídění podle nářeční příslušnosti Poslední záložka nabízí nejčastější kolokace koběma variantám. Izde jsou výsledky opatřeny doprovodným vysvětlujícím textem. Více informací kpráci saplikací SyD je knalezení ve wiki.44 Obrázek 29: SyD– kolokace 44 h\ ps://wiki.korpus.cz/doku.php/manualy:syd
seznámení skorpusy akorpusovou lingvistikou 65 4.2.2. Aplikace Morfi o Aplikace Morfi o je navržena tak, aby umožňovala odhalovat apozorovat slovotvorné pravidelnosti češtiny. Využívá korpusových dat kodhadování rozsahu aproduktivity slovotvorných modelů se zaměřením na odvozování. Vychází zpoznatků slovotvorby češtiny avyhledává dvojice (nebo vícečetné kombinace) slov, která se chovají stejně jako zadaný model. Ve výuce žáků sOMJ lze Morfi o využít pro odhalování slovotvorných pravidel češtiny, pro uvědomění si jazykového systému aosvojení si nových slovotvorných postupů. Znalosti ze slovotvorby jsou při učení se každému jazyku mocným nástrojem pro rychlé obohacení slovní zásoby onová slova, ato na základě analogie, kterou slovotvorba disponuje. Vpřípadě slovotvorných produktů tak mluvíme opotenciální slovní zásobě, tj.slovní zásobě, kterou žák sice sám nikdy nepoužil ani se sní nesetkal, ale na základě znalosti slovotvorného pravidla dokáže slovo vytvořit apoužít. Práce sMorfi em tak představuje induktivní metodu výuky slovotvorby češtiny, která pracuje sjazykovým materiálem zábavnou formou. Východiskem práce sMorfi em je stanovení báze (základu slova) aformantů (částí slov, které podléhají změně). Při zadávání do vstupní tabulky lze využít jak kombinace písmen, tak regulárních znaků. Základem pro oba vzory může být tatáž konkrétní báze, např.škol-, nebo báze libovolná, tvořená jen regulárními znaky.+, přičemž uživatel volí, zda tato báze, příp.zvolené formanty mají být stejné nebo odlišné pro oba vzory. Oběma vzorům lze přiřknout ještě zvolený slovní druh, je -li tento údaj relevantní (např.slovo končící na -í může příslušet krůzným slovním druhům, aproto lze slovní druh vybrat). Výběr slovního druhu se doporučuje především proto, aby se eliminovaly nežádoucí výsledky. Uněkterých bází dochází při spojení srůznými formanty ke změnám, snimiž Morfi o počítá anazývá je alternace. Jedná se ozměny typu knih -aX kniž -ní; psá -t X psa -níapod. Důležité je, že ve vstupní tabulce není třeba vždy vyplňovat všechna zadávací pole, ale vždy jen taková, která jsou opodstatněná vzhledem kcíli analýzy. Východiskem je stanovení báze (základu slova) aformantů (částí slov, které podléhají změně). Základem slova škola (tj.bází) je škol-, formantem je -a, přičemž ibez korpusu jsme sami schopni vytvořit další slova sjinými formanty od téže báze, např.školní, školský, školník, školeníapod. Díky Morfi u můžeme rychle odhalit, která slova jsou schopna stejné změny jako slovo vyhledávané. Drobnou nevýhodou aplikace Morfi o je, že nedokáže rozeznat hranice morfémů (např.upředpony předjsou generována slova předevčírem, ale také předobrý).
66 korpusy v jazykovém vyučování ii. Obrázek 30: Morfi o Následující zadání umožňuje hledat dvojice slov, jejichž báze může být různá, ale která tvoří vždy dvojici, např.substantivum končící na -aatvořící adjektivum končící na -ní. Hledají se ave výsledcích se zobrazují lemmata. Alternace nebyly určeny. Obrázek 31: Morfi o– zadání dotazu Výsledky analýzy se zobrazí ve formě několika záložek amohou mít různou míru využití pro různé účely. Každá zvýsledkových tabulek je opatřena doprovodným komentářem. Úvodní tabulka agraf představují souhrnné výsledky analýzy. Pro účely výuky se jeví nejvyužitelnější tabulka Výpis, nabízející nalezené páry, které jsou kandidáty na hledaný slovotvorný produkt (např.abeceda– abecední). Jednotlivé slovní tvary lze kliknutím aktivovat adostat se tak do korpusových textů, vnichž lze pozorovat konkrétní užití daného slovního tvaru.
seznámení skorpusy akorpusovou lingvistikou 67 Obrázek 32: Morfi o– souhrnné výsledky Obrázek 33: Morfi o– záložka Výpis 4.2.3. Aplikace KWords KWords je aplikace umožňující analýzu až 20 vybraných textů, např.stejného textového druhu či žánru, při níž probíhá porovnání těchto vložených textů sreferenčním korpusem. Při analýze jsou vtextu vyhledávána klíčová slova (měří se relativní frekvence každého slovního tvaru aporovnává se srelativní frekvencí téhož slovního tvaru vreferenčním korpusu, čímž lze získat seznam slovních tvarů, které jsou ve vybraných textech užity výrazně častěji alze onich uvažovat jako oklíčových, resp. majících spojitost sdaným textových druhem, resp. žánrem). Texty lze vsoučasné době nahrávat včeštině nebo angličtině. Pro relevantní výsledky je však dobré zvážit volbu vhodného referenčního korpusu, snímž budou vložené texty porovnávány. Nabídku referenčních korpusů lze nalézt na wiki.45 Pro výuku žáků sOMJ však není angličtina relevantní aznabízených českých korpusů doporučujeme využít přednastavený referenční korpus SYN2015. 45 h\ ps://wiki.korpus.cz/doku.php/manualy:kwords
68 korpusy v jazykovém vyučování ii. Práce saplikací je intuitivní. Po otevření aplikace na webové stránce je třeba vyplnit zadávací tabulku. Klíčové je zadání vlastního textu. Analyzovaný text by měl mít od několika set do několika tisíc znaků aje možné ho vložit dvěma způsoby. Text (nebo ivíce textů) lze přímo kopírovat do připraveného okna, nebo lze vpřípadě vkládání více textů užít tzv.multianalýzy, při níž se do korpusu jednotlivé texty nahrají. Druhým klíčovým krokem je zvolení referenčního korpusu, tedy korpusu, snímž se vlastní nahrané texty budou porovnávat. Na výběr je několik referenčních korpusů. Pro analýzu současných textů doporučujeme využívat např.SYN2015. Před zahájením analýzy je vhodné zvážit, zda zní nevyloučit některé/všechny nabízené slovní druhy, které jsou většinou vysokofrekvenční amohou výsledky analýzy znehodnotit, např.předložky, zájmena, spojkyapod. Vyloučení zanalýzy lze provést vtzv.stop -listu. Vlastní analýza probíhá na základě statistických měr; je možné zvolit jednu ze statistických měr nebo obě dvě zároveň. Analýza začne probíhat po stisku příkazu Analyzovat vlevé dolní části stránky. Obrázek 34: KWords– Zahájení analýzy Výsledky analýzy se zobrazují několika způsoby. Vzáložce Text je zobrazen analyzovaný text avšechna nalezená signifi kantní slova jsou zbarvena červeně. Text lze tedy pročítat asoustředit se přitom na vyhledané výrazy.
seznámení skorpusy akorpusovou lingvistikou 69 Obrázek 35: KWords– ukázka analýzy46 Výsledky analýzy jsou nabízeny také vjiných formách. Vzáložce Klíčová slova uživatel nalezne souhrnnou tabulku slovních tvarů vyhodnocených jako signifi kantní pro zadaný text. Kromě seznamu je zde nabídnuta také hodnota statistické míry, podle které byl výpočet proveden, dále hodnota DIN, která uvádí míru relevance rozdílu mezi výskytem vzadaném textu avreferenčním korpusu (zde platí, že relevantní jsou slovní tvary shodnotou 75–100, přičemž čím je hodnota vyšší, tím je relevantnější). Uvygenerovaných slovních tvarů je také uvedena jejich frekvence vobou textových zdrojích. Obrázek 36: KWords– výsledek analýzy Další možností náhledu je distribuce zobrazující rozložení nalezených signifi kantních slov vtextu aKeyword links, jenž zobrazuje vztahy mezi jednotlivými klíčovými slovy. Interpretace těchto dat je určena spíše pro odborníky azkušené korpusové uživatele, proto se těmto doplňkovým informacím nebudeme dále věnovat. Bližší popis pro zájemce lze nalézt na wiki. 46 Analyzovaný text pochází z: h\ p://www.cesky -jazyk.cz/slohovky/pohadky/lez -ma -kratke- -nohy.html#axzz5IU96O5h7.
70 korpusy v jazykovém vyučování ii. Poslední zřady je přehled konkordancí, tj.konkrétních míst vtextu vzobrazení KWIC. Po výběru konkordance se soupis rozšíří ovšechny konkordance svybraným slovním tvarem. Tento náhled je výhodný především proto, že shromáždí všechny výskyty vybraného slovního tvaru pod jednu konkordanci alze na něm, na rozdíl od náhledu lineárního textu, analyzovat chování vybraného slovního tvaru ve všech jeho výskytech najednou. Obrázek 37: KWords– přehled konkordancí Využití aplikace KWords ve výuce jazyka může být různorodé. Nabízí se možnost analýzy textových druhů ažánrů, na jejímž podkladu žáci samostatně vytvářejí vybraný textový druh či žánr. Zajímavou možností je analýza vlastních vytvořených textů atím refl exe vlastního idiolektu nebo porovnání textů stejného zadání od žáků sčeštinou jako mateřštinou ažáků sOMJ. 4.2.4. Aplikace Treq Aplikace Treq je databází překladových ekvivalentů. Protože je založena na textech paralelního korpusu InterCorp, funguje obousměrně pro jazykové páry čeština–cizí jazyk aangličtina–cizí jazyk. Cizí jazyky jsou zde nabízeny vrozsahu odpovídajícím jazykům zastoupeným vInterCorpu. Samotné vyhledávání probíhá vprvním kroku zvolením výchozího acílového jazyka. Vdruhém kroku musí být zvolen hledaný výraz. Vyhledávané slovo musí být slovo zjazyka označeného jako výchozí alze ho formulovat jako určitý slovní tvar, jako lemma, případně lze vyhledávat víceslovná spojení nebo užít při hledání regulárních výrazů či ignorovat malá avelká písmena (až na vyhledávání konkrétního slovního tvaru je uvšech výše jmenovaných potřeba danou kategorii zaškrtnout). Hledání lze provést ve všech textech InterCorpu nebo lze omezit zdrojové texty na beletristické jádro (texty ručně zkontrolované azarovnané) nebo některou zkolekcí (texty automaticky zarovnané). Výsledkem hledání je seznam překladových ekvivalentů. Proklikem jednotlivých ekvivalentů se uživatel dostane do korpusu InterCorp, který mu zobrazí zarovnané texty obsahující jak výraz jazyka výchozího, tak nabídnutý ekvivalent jazyka cílového.
seznámení skorpusy akorpusovou lingvistikou 71 Na těchto kontextech lze ověřit, zda zvolený ekvivalent odpovídá nárokům hledaného ekvivalentu. Své využití najde Treq především tam, kde se žáci učí pracovat scizojazyčnými ekvivalenty ajejich výběrem ataké se synonymy. Treq sice nelze označit za slovník, protože mu chybí celá řada nezbytných lexikografi ckých informací, ale na rozdíl od běžného slovníku disponuje velkou výhodou, kterou je propojení sautentickými texty ve formě konkordancí obsahujících vyhledaný ekvivalent. Zkontextů tak lze mnohdy vyčíst stejné nebo ještě bohatší informace ovýznamové apragmatické stránce jazykového ekvivalentu než ze slovníku. Uživatel si užíváním Trequ cvičí nejen své jazykové znalosti, ale isvůj jazykový cit asenzibilizuje se na práci stextovým materiálem ajeho výpovědní hodnotou. Následující obrázky nabízejí náhled úvodní zadávací stránky aplikace Treq, stránky svýsledky (nabídkou překladových ekvivalentů) astránky zobrazující konkordance InterCorpu uzvoleného ekvivalentu. Více informací oaplikaci Treq je knalezení na stránkách wiki.47 Obrázek 38: Treq– zadávací tabulka Obrázek 39: Treq– výsledek frekvenční analýzy 47 h\ ps://wiki.korpus.cz/doku.php/manualy:treq
78 korpusy v jazykovém vyučování ii. Pořadí Vše Substantiva Adjektiva Slovesa Předložky Spojky 80 místo vlas dětský trvat 81 při skupina osobní bát 82 začít důvod volný tvrdit 83 protože světlo slavný postavit 84 podle možnost skvělý existovat 85 jiný hráč pracovní vydat 86 každý kolo prázdný líbit 87 druhý byt široký připadat 88 myslet výsledek určitý napsat 89 tenhle klub střední uvidět 90 náš rameno nutný zapomenout 91 takový Petr moderní ptát 92 dítě syn oblíbený poznat 93 mezi metr dnešní napadnout 94 nějaký srdce ruský koupit 95 jejich systém čistý působit 96 přijít přítel rodinný otočit 97 život začátek úspěšný milovat 98 však krok hezký číst 99 dostat akce jednotlivý chápat 100 hlava policie krajský pustit Tabulka 1: Nejfrekventovanější slova vkorpusu SYN2015 5.2. Pracovní listy Následující ukázkové pracovní listy obsahují čtyři části. Na první straně naleznete anotaci apopsaný postup práce spracovním listem. Druhou stranu tvoří samotný pracovní list, který lze namnožit arozdat žákům. Po pracovním listu následuje popis práce skorpusem snázornými snímky obrazovky. Na konec je zařazeno řešení úkolů. Pracovní listy obsahují jak cvičení, která vyžadují přímou práci skorpusem během výuky (hands -on), tak cvičení, která jsou založená na jazykových datech zkorpusu, ale přímou práci skorpusem během výuky nevyžadují (hands -off ). Pracovní listy mají sloužit jako inspirace pro tvorbu vlastních korpusových cvičení.48 48 Podobné pracovní listy naleznete také pod odkazem h\ ps://www.korpus.cz/proskoly.
využití korpusů ve výuce 79 5.2.1 Prostředí KonText Pracovní list č.1: ADJEKTIVA ZDRAVÝ AZDRAVOTNÍ– Zdravý životní styl = žádné zdravotní problémy? Anotace Cvičení tohoto typu je vhodné zařadit do výuky, pokud dělá žákům problém rozlišovat význam podobných adjektiv aužívat je ve správných spojeních. Může jít jak oadjektiva, která mají jiný význam– zde např.zdravý azdravotní, tak oadjektiva, která mají vněkterých kolokacích význam stejný, ale existují různá omezení– např.šedý ašedivý, kdy se některá substantiva mohou pojit jen sjedním adjektivem (šedá eminence). Cvičení také rozšiřují slovní zásobu. Pracovní list vyžaduje samostatnou práci skorpusovým rozhraním KonText aobsahuje tři úkoly, které vedou ktomu, aby si žák vhodné použití adjektiv osvojil sám pomocí vyhledávání typických kolokací, následně formulací pravidel jejich spojování se substantivy, anakonec jejich použitím vtextu. Postup práce Před rozdáním pracovního listu je nutné žáky připravit na téma úkolů avhodně je motivovat kjejich vypracování. Vtomto případě může učitel sžáky mluvit otom, co sami dělají pro své zdraví ajaké existují zdravotní problémy. Kdiskuzi může využít předem připravený text, který bude obsahovat tematizovaná adjektiva, nebo jen otázku vnázvu pracovního listu. Po tomto úvodu učitel obrátí pozornost žáků kadjektivům zdravý azdravotní azeptá se jich, jaký je vnich rozdíl akterá substantiva se snimi mohou pojit. Jako motivační prvek dobře slouží návodné obrázky (zdravé jídlo nebo tělesné aktivity x různá onemocnění, nemocniční personál). Odpovědi žáků lze zapisovat na tabuli formou myšlenkové mapy. Následně učitel rozdá žákům pracovní list. Ti pak splní první úkol dle schopnosti práce skorpusem sami, ve dvojicích nebo společně sučitelem. Před plněním je vhodné projít postup práce skorpusem. Žáci mohou první cvičení také dostat za domácí úkol. Vpřípadě, že žáci některým substantivům, která najdou, nerozumí, je třeba jejich význam osvětlit. Vhodné je využít předem připravené obrázky apříkladové věty. Příkladové věty mohou žáci sami najít kliknutím na pozitivní fi ltr (p/n) uvybraného substantiva vseznamu kolokátů, po kterém se jim objeví všechny věty sdaným adjektivem asubstantivem. Věty pocházejí zčeských textů, je třeba proto počítat stím, že mohou být pro žáky na nižší jazykové úrovni (asi do B2) nesrozumitelné anaopak matoucí. Důležité je
80 korpusy v jazykovém vyučování ii. upozornit žáky také na gramatický rozdíl mezi měkkým adjektivem zdravotní atvrdým adjektivem zdravý. Tvary adjektiv si opět mohou ověřit kliknutím na pozitivní fi ltr udaného substantiva. Nalezené kolokace by během kontroly vždy měli číst se správnou koncovkou adjektiva (tj.zdravý rozum, zdravá výživa X zdravotní problém, zdravotní sestra). Až si žáci najdou substantiva abude osvětlen jejich význam, měli by se sami nebo ve skupině pokusit zformulovat významovou defi nici. Mohou vymyslet příklady dalších kolokátů (některé jsou uvedeny včásti řešení). Druhý úkol žáci plní až po kontrole prvního. Opět je nutné, aby před začátkem práce rozuměli zadaným substantivům aaby adjektiva použili se správnou koncovkou. Třetí úkol mohou žáci plnit samostatně nebo ve dvojicích. Mohou soutěžit oto, který text bude nejvtipnější nebo ve kterém bude použito nejvíce spojení adjektiv asubstantiv. Učitel si může připravit začátek textu, na který budou žáci navazovat. Např.Když byla Klára malá, měla hodně zdravotních problémů. Kvůli nim často chyběla ve škole, atak ještě vdeseti letech neuměla dobře číst apsát… Texty poté mohou žáci přečíst vplénu nebo je učitel může vybrat aopravit. Texty si také žáci mohou opravit navzájem.
využití korpusů ve výuce 81 ZDRAVÝ ŽIVOTNÍ STYL = ŽÁDNÉ ZDRAVOTNÍ PROBLÉMY? 1. Najděte vkorpusu syn2015 deset nejčastějších substantiv po adjektivech zdravý azdravotní. Potom vysvětlete, co znamenají akdy se používají. zdravý zdravotní 1. 2. 3. 4. 5. 6. 7. 8. 9. 10. 2. Co ještě může být zdravé aco zdravotní? Přiřaďte anapište ksubstantivům adjektivum se správnou koncovkou. handicap, holčička, noha, obtíž, prohlídka, zub zdravý: zdravotní:
82 korpusy v jazykovém vyučování ii. 3. Napište krátký text, ve kterém použijete vždy alespoň třikrát adjektivum zdravý azdravotní. Ke každému adjektivu musíte použít jiné substantivum.
využití korpusů ve výuce 83 Postup práce skorpusem Postup 1 1. Vkorpusu syn2015 zvolte Typ dotazu lemma ado okénka Dotaz napište hledané adjektivum (zdravý nebo zdravotní). Dále rozbalte možnost Specifi kovat kontext. Zde včásti Slovní druh zadejte Velikost kontextu vpravo 1 token. Jako slovní druh zvolte podstatné jméno. Tím najdete všechny věty, ve kterých bude hned vpravo vedle daného adjektiva podstatné jméno. Obrázek 41
84 korpusy v jazykovém vyučování ii. 2. Až se vám zobrazí konkordance, vyberte možnost Kolokace, dále zvolte Vlastní. Jako Atribut si vyberte lemma, vkontextu od 0 do 1. Obrázek 42 3. Zobrazí se frekvenční seznam nejčastějších substantiv, která se pojí sdaným adjektivem astojí ve větě vždy hned vedle něj. Obrázek 43
využití korpusů ve výuce 85 Postup 2 1. Vkorpusu syn2015 zvolte Typ dotazu lemma ado okénka Dotaz napište hledané adjektivum (zdravý nebo zdravotní). Obrázek 44 2. Až se vám zobrazí konkordance, vyberte možnost Kolokace, dále zvolte Vlastní. Jako Atribut si vyberte lemma, vkontextu od 0 do 3. Obrázek 45
86 korpusy v jazykovém vyučování ii. 3. Zobrazí se vám frekvenční seznam nejčastějších slov následujících po daném adjektivu, ato až do třetí pozice od vlastního adjektiva. Protože jste na začátku nespecifi kovali slovní druh, je třeba ze seznamu kolokátů vybrat jen substantiva. Výhodou je, že najdete ikolokáty, které jsou dále od daného adjektiva (např.zdravý životní styl). Obrázek 46 4. Pokud chcete využít pozitivní fi ltr, klikněte na písmeno p ve sloupci fi ltr. Zde je příklad pozitivního fi ltru usubstantiva rozum vseznamu nejčastějších kolokátů adjektiva zdravý. Obrázek 47
využití korpusů ve výuce 87 Řešení 1. Seznam deseti nejčastějších kolokátů zdravý první postup druhý postup rozum rozum výživa výživa strava styl stravování strava potravina potravina sebevědomí stravování jídlo jídlo jedinec jedinec životospráva sebevědomí bydlení bydlení zdravotní první postup druhý postup pojišťovna pojišťovna postižení postižení pojištění pojištění stav péče péče stav sestra sestra potíž potíž problém problém komplikace komplikace služba služba
94 korpusy v jazykovém vyučování ii. 3. Doplňte tabulku. První řešení je příklad. první pád– koncovky čtvrtý pád– koncovky ženský rod celá láhev-á (celá), -konsonant (lahev)-ou (celou) --- (láhev) velká radost-á (velká), -konsonant (radost) ( ) ( ) další výhra-í (další), -a(výhra) ( ) ( ) poslední šance-í (poslední), -e (šance) ( ) ( ) mužský rod životný nový přítel / muž-ý (nový), -tel / měkký konsonant (přítel/muž) ( ) ( )/ ( ) mladší syn-í (mladší), -tvrdý konsonant (syn) ( ) ( ) starší kolega-í (starší), -a(kolega) ( ) ( ) dobrý rádce-ý, (dobrý), -e (rádce) ( ) ( ) mužský rod neživotný celý den-ý (celý), -konsonant (den) ( ) ( ) příští měsíc-í (příští), -konsonant (měsíc) ( ) ( ) střední rod dobré jídlo-é (dobré,), -vokál (jídlo) ( ) ( ) čisté oblečení-é (čisté), -vokál (oblečení) ( ) ( ) malé štěně-é (malé), -vokál (štěně) ( ) ( ) další rande-í (další), -vokál (rande) ( ) ( )
využití korpusů ve výuce 95 Postup práce skorpusem 1. Vrozhraní KonText zvolte korpus syn2015. Jako Typ dotazu zvolte CQL aklikněte na Vložit tag. Jako slovní druh vyberte adjektivum (hledáme věty, ve kterých se budou vyskytovat adjektiva), dále příslušný jmenný rod (femininum, maskulinum animatum, maskulinum inanimatum, neutrum), číslo singulár, pád akuzativ. Klikněte na Vložit. Obrázek 48 2. Výsledný tag se vloží do pole Dotaz. Jako Výchozí atribut ponechte word. Můžete specifi kovat kontext tak, aby se přímo za adjektivem objevilo podstatné jméno (vizobrázek). Není to ovšem nutné, vět bez substantiv se ibez specifi kace zobrazí jen málo.
96 korpusy v jazykovém vyučování ii. Obrázek 49 3. Dále klikněte na Hledat. Zobrazí se vám konkordance. Obrázek 50
využití korpusů ve výuce 97 4. Po kliknutí na tučně vyznačené adjektivum se vám zobrazí širší kontext. Zvět je třeba vybrat takové, které budou odpovídat úrovni žáků, případně je třeba věty přizpůsobit. Vhodné je zobrazit si nejprve nejfrekventovanější adjektiva pomocí funkce Frekvence. Po kliknutí na Frekvence azvolení atributu Lemmata se zobrazí frekvenční seznam. Obrázek 51 5. Příkladové věty zobrazíte funkcí pozitivní fi ltr (p). Znich vyberte vyhovující tak, aby byla zastoupena měkká itvrdá adjektiva ivšechny typy skloňování. Věty zjednodušte podle úrovně žáků.
98 korpusy v jazykovém vyučování ii. Pracovní list č.4: FRAZÉMY TYPU MÍT + PŘÍČESTÍ TRPNÉ– Máte hotovo? Anotace Pracovní list obsahuje cvičení založená na jazykovém materiálu zkorpusu. Učitel si cvičení připraví předem, žáci ve výuce skorpusem nepracují. Na základě autentického jazykového materiálu se seznámí sfrázemi typu mít + příčestí trpné. Cvičení lze samozřejmě upravit pro další frazémy. Postup práce Cvičení jsou věnována frazémům obsahujícím příčestí trpné. Je proto vhodné, aby byli žáci již dříve seznámeni spasivem askonstrukcí mít + příčestí trpné, která typicky vyjadřuje výsledný stav (viznázev listu). Vprvním úkolu žáci přiřazují kfrazémům jejich stručnou významovou defi nici. Vhodné je, aby pracovali ve dvojicích. Kontrola pak může proběhnout nejprve ve skupinách, poté vplénu. Druhý úkol žáci plní až po kontrole prvního. Je vhodné vyřešit první příklad dohromady. Po splnění druhého úkolu mohou žáci vymyslet podobné cvičení. To může být idomácí úkol– žáci mohou příkladové věty najít vkorpusu. Zde by ovšem bylo dobré, aby jim učitel pomohl se zadáním (vizčást Postup práce skorpusem) nebo aby vyhledávali jednoduše přímo pomocí fráze vdaném tvaru (např.má vyhráno).
využití korpusů ve výuce 99 MÁTE HOTOVO? 1. Spojte synonyma. 1. mít upito A. směřovat někam, např.jet někam 2. mít namířeno někam B. vidět směr své budoucnosti 3. mít nakročeno někam C. zaměřovat se na něco 4. mít zaostřeno na něco D. ještě bojovat 5. nemít vyhráno E. být zabezpečený, zajištěný 6. mít vystaráno F. mít strach 7. mít zaděláno na problém/úspěch G. mít vsobě alkohol 8. mít nahnáno zněkoho/něčeho H. být vsituaci, která způsobí problém/úspěch 2. Výrazy zlevého sloupce tabulky doplňte do vět ve správném tvaru. 1. Muž byl při autonehodě těžce zraněn anyní leží vkritickém stavu vnemocnici astále ještě . 2. Neukázněného řidiče, který usedl za volant, ačkoliv , zadrželi vúterý po půlnoci policisté vRožnově pod Radhoštěm. 3. Novináři na politické dění na Slovensku. 4. Recidivista zHlučína na rekordní již dvaadvacátý pobyt ve vězení. Policisté zjistili, že tentokrát vykradl rodinný dům vOstravě. 5. Ten muž se vůbec nebojí, ne zpolicie . 6. Vbranickém psím útulku se radují. Firma zPoděbrad jim věnovala jeden apůl tuny granulí. „Přinejmenším do konce roku ,“ odhaduje ošetřovatel Zdeněk Blažek. 7. Vrychlíku do Chebu jsem potkala bývalou spolužačku aptala jsem se jí, kam . 8. DiCaprio je pořád tahoun, fi lm sjeho jménem na úspěch. 3. Vyberte si pět frází avymyslete pro spolužáky podobné cvičení.
100 korpusy v jazykovém vyučování ii. Postup práce skorpusem 1. Vrozhraní KonText si vyberte korpus syn2015 aTyp dotazu CQL. Budete hledat všechny věty se slovesem mít apasivním příčestím. Kompletní dotaz vidíte na obrázku. Hledáte sloveso mít ve všech tvarech [lemma- =„mít“], dále může být ve větě několik libovolných slov– např.0–4 [] {0,4}, dále pasivní příčestí [tag=„Vs.*“]– tag si můžete vytvořit pomocí tlačítka Vytvořit tag (vizdruhý obrázek). Nakonec potřebujete zajistit, aby vše bylo vrámci jedné věty (within <s/>). Obrázek 52 Obrázek 53
využití korpusů ve výuce 101 2. Klikněte na Hledat azobrazí se vám konkordance: Obrázek 54 3. Pomocí funkce Frekvence (satributem slovní tvar) se podívejte na nejčastější spojení: Obrázek 55
102 korpusy v jazykovém vyučování ii. 4. Uvidíte, že frazémy jsou velmi frekventované. Pomocí pozitivního fi ltru (p) si zobrazte požadované věty. Na obrázku vidíte příklad pro má namířeno. Obrázek 56 5. Kliknutím na označenou frázi zobrazíte širší kontext. Nakonec vyberte aupravte vhodné věty pro cvičení. Řešení 1. 1G, 2A, 3B, 4C, 5D, 6E, 7H, 8F 2. 1 nemá vyhráno, 2 měl upito, 3 mají zaostřeno, 4 měl nakročeno, 5 nemá nahnáno, 6 máme vystaráno, 7 má namířeno, 8 má zaděláno
využití korpusů ve výuce 103 Pracovní list č.5: IDIOMY– Já snad vyletím zkůže! Anotace Cvičení tohoto typu rozvíjejí schopnost rozpoznat avhodně použít idiomy. Hodí se pro pokročilé žáky, kteří už většinou nemají potíže se základním významem slov. Žáci ve cvičení ztohoto pracovního listu aktivně pomocí korpusu dohledávají chybějící část idiomu, pomocí kontextu by pak měli být schopni vysvětlit jeho význam. Postup práce Před samotnou prací skorpusem musejí být žáci seznámeni sexistencí idiomů, nejlépe pomocí textu obsahujícího dostatečně názorné idiomy. Pro seznámení lze využít ikvíz vprvním cvičení. Učitel se následně zeptá, zda žáci znají některé další idiomy se slovem kůže. Kromě těch, které se objevují vtomto pracovním listu, to mohou být například spojení kůže líná nebo zachránit si kůži. Následně žáci samostatně nebo ve skupinách doplní znění idiomu, vypíšou zkorpusu jeden příklad apokusí se vysvětlit význam. Kontrola proběhne vplénu, žáci si případně ještě předtím mohou porovnat řešení. Druhé cvičení mohou žáci také dostat za domácí úkol. Ve třetím cvičení si poté prakticky vyzkouší, zda idiomům správě porozuměli.
110 korpusy v jazykovém vyučování ii. 3. Pokud chcete hledat pouze vtextech určité skupiny mluvčích, je třeba zaškrtnout vybranou kategorii včásti Omezit hledání. Obrázek 63 4. Pomocí funkce Frekvence (satributem lemmata) se můžete podívat, která slovesa jsou nerodilými mluvčími nejčastěji užívána, avybrat si příklady podle jejich zastoupení. Některé chyby odhalíte již vtomto seznamu (např.sloveso půjít).
využití korpusů ve výuce 111 Obrázek 64 Řešení 1. pošli– šli 2. půjít se mnou– se mnou jít 3. Přišla jsem tady– Přišla jsem sem 4. nemůžu přijít knarozeninám– nemůžu přijít/jít ktobě / na narozeniny 5. když jsem přišla vČechách– přišla / přijela do Čech 6. nikdy nepříjdeme do té restaurace– nepůjdeme do té restaurace 7. Všichni se přišli sdárky– všichni přišli sdárky 8. že ktobě nemůžu přejít– přijít 9. budu jít do kina– půjdu/jdu 10. tak sejdeme tam– tak se sejdeme tam 11. jsem prošel na poštu pro známku– jsem šel / si došel / na poštu pro známku
112 korpusy v jazykovém vyučování ii. Pracovní list č.7: OPRAVA CHYB – Kvantita Anotace Pracovní list obsahuje cvičení založené na jazykovém materiálu zkorpusu. Učitel si cvičení připraví předem, žáci ve výuce skorpusem nepracují. Jejich úkolem je opravit chyby vkvantitě. Texty pocházejí od nerodilých mluvčích češtiny, učitel je nalezne vkorpusu CzeSL -SGT. Postup práce Toto cvičení je vhodné zařadit do lekce věnované pravopisu. Je možné vybírat do něj věty schybami typickými pro danou skupinu. Učitel tak může například hledat pouze texty rodilých mluvčích jednoho jazyka odpovídajícího jazyku jeho žáků. Vhodnou motivací pro úkoly, ve kterých žáci opravují chyby, může být instrukce, že jsou nyní sami učitelé. Učitel by jim měl říct, že jsou texty ve cvičení autentické aže je napsali jiní žáci. První větu může učitel se žáky opravit sám, další poté opravují samostatně nebo ve dvojicích. Kontrolu učitel provede vplénu, měl by nechat žáky přednést různé návrhy oprav avpřípadě nejasností je nechat opravu vysvětlit.
využití korpusů ve výuce 113 Doplňte nebo škrtněte čárky. 1. Aja jsem chtěl velký byt. 2. Obědvala tam chutné jidlo. 3. Mám češtinu každe rano, ale ovikendu mam volno. 4. Moje město ma různá zajímavá mistá. 5. Auta take nepotřebujou jidlo anemusí odpočívat. 6. Mám se dobře, ale mám malý problem. Musím koupít nový byt. 7. 21.ledna musím byt na univerzitě, protože mám semestralní zkoušku. 8. Studuju češtinu každy den od 9:00 do 13:00. 9. Teď jsem moc spokojený, rad bydlím vPraze. 10. Ataký Praha je velmí hezká.
114 korpusy v jazykovém vyučování ii. Postup práce skorpusem 1. Zvolte korpus CzeSL -SGT aTyp dotazu CQL. Pro hledání slov chybně zapsaných bez kvantity vložte tag [err=„Quant0“], pro slova spřebývající kvantitou tak [err=„Quant1“]. Klikněte na Hledat. Obrázek 65 2. Zobrazí se vám konkordance se slovy schybějící nebo přebývající kvantitou, podle toho, který tag jste použili. 3. Pomocí funkce frekvence (satributem slovní tvary) si můžete zobrazit slovní tvary, které dělají žákům nejčastěji problém. Kliknutím na pozitivní fi ltr si zobrazíte věty. Znich vyberte vhodné příklady pro cvičení. Obrázek 66
využití korpusů ve výuce 115 Obrázek 67
116 korpusy v jazykovém vyučování ii. Obrázek 68 Řešení 1. Ajá jsem chtěl velký byt. 2. Obědvala tam chutné jídlo. 3. Mám češtinu každé ráno, ale ovíkendu mám volno. 4. Moje město má různá zajímavá místa. 5. Auta také nepotřebujou jídlo anemusí odpočívat. 6. Mám se dobře, ale mám malý problém. Musím koupit nový byt. 7. 21.ledna musím být na univerzitě, protože mám semestrální zkoušku. 8. Studuju češtinu každý den od 9:00 do 13:00. 9. Teď jsem moc spokojený, rád bydlím vPraze. 10. Ataky Praha je velmi hezká.
využití korpusů ve výuce 117 Pracovní list č.8: OPRAVA CHYB – Pasivum Anotace Pracovní list obsahuje cvičení založené na jazykovém materiálu zkorpusu. Učitel si cvičení připraví předem, žáci ve výuce skorpusem nepracují. Jejich úkolem je opravit chyby vpasivních konstrukcích. Texty pocházejí od nerodilých mluvčích češtiny, učitel je nalezne vkorpusu CzeSL -SGT. Postup práce Toto cvičení je vhodné zařadit jako shrnující opakování pasivních konstrukcí. Je možné vybírat do něj věty schybami typickými pro danou skupinu. Učitel tak může například hledat pouze texty rodilých mluvčích jednoho jazyka odpovídajícího jazyku jeho žáků. Vhodnou motivací pro úkoly, ve kterých žáci opravují chyby, může být instrukce, že jsou nyní sami učitelé. Učitel by jim měl říct, že jsou texty ve cvičení autentické aže je napsali jiní žáci. První větu může učitel opravit společně se žáky, další poté opravují samostatně nebo ve dvojicích. Kontrolu učitel provede vplénu, měl by nechat žáky přednést různé návrhy oprav avpřípadě nejasností je nechat opravu vysvětlit.
118 korpusy v jazykovém vyučování ii. Opravte chyby vpasivu apasivních adjektivech. 1. Já jsem měla šťastné dětství, zač velmi vděčena rodičům. 2. Sportovní hala otevřeno denně. 3. Ta učebnice napsána pro cizince, kteří mluví rusky. 4. Na obrázku vidíme manželský pár vletech. Starší pán nabídl paní rámě. Asi je jaro, protože nejsou oblečeny moc teple. 5. Ti lidé nejsou lhostejní, jenom je moc nezajímá, včem jsi oblečeny aco máš za účes, proto se po tobě vmetru nekoukají. 6. Studium vzahraničí je však spojen smnoha problémy. 7. Ačkoli vRusku je mnoho náboženských svátků acelkem Rusové jsou pravoslavní, tyto svátky jsou povětšinou neslaveny vkostelích. Můžeme to přirovnat kčeské oslavě svátků, např.na Vánoce zdaleka ne všichni jdou do kostela, ale zůstávají doma srodinou. 8. Studujeme proto, abychom mohli být vždy připraveny na všechny životní úkoly.
využití korpusů ve výuce 119 Postup práce skorpusem 1. Zvolte si korpus CzeSL-SGT aTyp dotazu CQL. Vložte tag pro slovesa, vdetailnějším určení slovního druhu zvolte příčestí trpné. Klikněte na Hledat. Obrázek 69 Vkonkordancích se vám zobrazí věty spříčestím trpným. Vyberte si vnich věty vhodné do cvičení apřípadně je upravte. Pomocí funkce Frekvence si můžete zobrazit slovní tvary, které dělají žákům největší potíže. Obrázek 70 Řešení 1. zač jsem velmi vděčná 2. Sportovní hala má otevřeno / je otevřená denně. 3. Ta učebnice byla napsána / je napsaná 4. nejsou oblečeni/í 5. jsi oblečený 6. je však spojeno/é 7. nejsou povětšinou slaveny 8. abychom mohli být vždy připraveni
126 korpusy v jazykovém vyučování ii. Postup práce skorpusem Do okének aplikace SyD jednotlivě napište všechny varianty. Nezaškrtávejte políčko a=A(hledáme začátek vět) ani políčko lemma. Klikněte na tlačítko Porovnat varianty. Pro zobrazení typů textů klikněte na záložku Psaný jazyk adále Typy textů. Řešení 1. vizúkol 2 a3 4. Při psaní se nejčastěji používá varianta Spozdravem Obrázek 72 5. Vkorespondenčních textech tato varianta převažuje ještě výrazněji. Obrázek 73
využití korpusů ve výuce 127 Pracovní list č.11: PRAVOPISNÉ DUBLETY – s/z Anotace Cvičení vtomto pracovním listu jsou zaměřena na pravopisné dublety gymnázium/gymnasium, univerzita/universita afi lozofi e/fi losofi e. Pro žáky mohou být oporou při rozhodování ovhodnosti způsobu zápisu. Zadání lze libovolně variovat, nabízí se zápis sodlišnou kvantitou (balon/balón) nebo psaní cizích slov (management/manažment). Postup práce Učitel žáky nejprve nechá samostatně doplnit snebo zdo slov ve cvičení jedna ařešení konzultovat se spolužákem. Následně svá řešení žáci zkonzultují vplénu. Je pravděpodobné, že nedojde ke shodě na jedné variantě, žáci mohou argumentovat pocitem líbivosti. Učitel zatím nebude řešení komentovat, ale odkáže žáky na aplikaci SyD. Ve dvojicích nebo vplénu do ní žáci postupně zadají všechny dvojice. Ve výsledcích nás tentokrát bude zajímat jen psaný jazyk. Vaplikaci žáci zjistí, že výrazně převládá zápis se z (vizřešení). Žáci se mohou pokusit sami přijít na to, vjakých textech se nejčastěji objevuje podoba se s. Jelikož ze zmíněných substantiv se zápis se s nejčastěji vyskytuje vpřípadě fi losofi e, je vhodné zaměřit se především na toto substantivum. Pomocí záložky Typy textů žáci zjistí, že se tato varianta nejčastěji vyskytuje vkorespondenci adále vbeletrii. Podrobnější dělení ukáže, že zbeletrie je zápis fi losofi e nejčastější vbásních adramatech. Žáci by tedy sami mohli přijít na to, že se tento způsob zápisu používá pro ozvláštnění. Zastaralost zápisu se sby teoreticky žáci mohli odvodit ztoho, že se častěji vyskytuje vkorespondenci, která dnes není tak často využívána. Zanalýzy by si měli odnést především to, že podoba se zje nyní při psaní přejatých jmen variantou neutrální. Nakonec se žáci mohou zamyslet nad tím, která další slova se dříve psala se sadnes už se píšou se z.
128 korpusy v jazykovém vyučování ii. 1. Doplňte písmena: gymná__ium, univer__ita, fi lo__fi e. Potom svoje řešení porovnejte se spolužákem. Doplnili jste stejné písmeno? 2. Porovnejte varianty gymnázium/gymnasium, univerzita/universita afi lozofi e/fi losofi e. Které varianty se vám více líbí? 3. Podívejte se do korpusu (h ps://syd.korpus.cz/) ařekněte, které varianty jsou při psaní častější. 4. Podívejte se, ve kterých textech se nejčastěji používá varianta se s. Proč to tak je? 5. Znáte další slova, která se dříve psala se sanyní se píšou se z?
využití korpusů ve výuce 129 Postup práce skorpusem Do okének aplikace SyD jednotlivě napište obě varianty. Nechte zaškrtnuté políčko a=A(nezáleží na tom, jestli je první písmeno malé nebo velké), políčko lemma nezaškrtávejte. varianty se přiřazují kjednomu lemmatu, proto byste našli jen nové varianty gymnázium, fi lozofi e auniverzita. Klikněte na tlačítko Porovnat varianty. Pro zobrazení typů textů klikněte na záložku Psaný jazyk adále Typy textů (nejprve základní dělení, poté podrobně). Řešení 1. gymnázium/gymnasium, univerzita/universita, fi lozofi e/fi losofi e 2. dle diskuze 3. Vždy výrazně převládá varianta se z(více než 97% pro gymnázium auniverzita, skoro 67% pro fi lozofi e). 4. Pomocí záložky Typy textů žáci zjistí, že se tato varianta nejčastěji vyskytuje vkorespondenci adále vbeletrii. Podrobnější dělení ukáže, že zbeletrie je zápis fi losofi e nejčastější vbásních adramatech. Je to kvůli zastaralosti této podoby nebo pro ozvláštnění. 5. Např.dezinfekce, epizoda, fantazie
130 korpusy v jazykovém vyučování ii. Pracovní list č.12: STYLOVÉ TRIPLETY– Stále mě někdo opravuje. Ještě pořád neumím dobře česky. Proč mi to furt nejde?! Anotace Cvičení tohoto typu je vhodné zařadit do výuky, pokud chceme žákům ozřejmit použití dublet (triplet), které se neliší významově, ale pouze svou stylovou platností. Zadání lze libovolně variovat, vtomto pracovním listu se jedná ovarianty stále, pořád afurt. Postup práce Před obdržením pracovního listu by měli žáci vidět všechny varianty aměli by si jich sami všimnout vtextu. Učitel se poté zeptá žáků, kdy by jakou variantu použili. Může je vyzvat, aby si představili, že mluví skamarádem / ředitelem / učitelem nebo že píší ofi ciální nebo neofi ciální e -mail. Varianty by se měli pokusit seřadit podle formálnosti. Následně se sami podívají do aplikace SyD, předem musí být obeznámeni sjejím fungováním. Po zobrazení výsledků si žáci mohou sami ověřit, zda odpovídají jejich očekáváním oformálnosti daných variant. Za tímto účelem se také mohou podívat na typy textů azjistit, vjakých se nejčastěji používá jaká varianta. Žáci si mohou povšimnout např.relativně častého užití varianty furt vkorespondenci. Učitel pak může sžáky diskutovat otom, jak se korespondence blíží mluvenému jazyku azda jsou tyto tendence silnější např.při psaní sms zpráv. Dále by měl upozornit na to, že spoužitím varianty furt vmluveném jazyce souvisí také její neformálnost aže se tedy nehodí do ofi ciálního projevu. Nakonec si mohou žáci vyzkoušet použití sami. Mohou si například vrolových hrách stěžovat různým lidem apodle toho vhodně měnit lexikum. Paní učitelce tak mohou říkat: Moje kamarádka pořád mluví ajá neslyším, co říkáte. Spolužákovi mohou říct: Eva furt kecá ajá nic neslyším! Role se zadanými problémy, situacemi aslovní zásobou si může učitel připravit předem nebo je mohou vymyslet sami žáci.
využití korpusů ve výuce 131 STÁLE MĚ NĚKDO OPRAVUJE. JEŠTĚ POŘÁD NEUMÍM DOBŘE ČESKY. PROČ MI TO FURT NEJDE?! 1. Porovnejte varianty stále, pořád, furt. Jaká je nejformálnější, jaká je nejméně formální? 2. Podívejte se do korpusu (h ps://syd.korpus.cz/) ařekněte, která varianta se nejčastěji používá při psaní akterá při mluvení? 3. Vjakých psaných textech se nejčastěji používá stále, vjakých pořád avjakých furt? stále: pořád: furt: 4. Stěžujte si na to, co často dělá váš kamarád / vaše kamarádka. Používejte vhodnou variantu avhodná slova podle toho, komu si stěžujete.
132 korpusy v jazykovém vyučování ii. Postup práce skorpusem Do okének aplikace SyD jednotlivě napište všechny varianty. Nechte zaškrtnuté políčko a=A(nezáleží na tom, jestli je první písmeno malé nebo velké), na políčku lemma nezáleží. Klikněte na tlačítko Porovnat varianty. Pro zobrazení typů textů klikněte na záložku Psaný jazyk adále Typy textů. Řešení 1. stále– pořád– furt Obrázek 74 2. Při psaní se nejčastěji používá varianta stále, při mluvení furt. 3. Typy textů Obrázek 75
využití korpusů ve výuce 133 Pracovní list č.13: OBECNÁ ČEŠTINA – ý>ej, é>í/ý Anotace Cvičení vtomto pracovním listu jsou zaměřena na obecnou češtinu ajejí použití na území České republiky. Konkrétně jde okonkurenci užití slov sdiftongizací ý > ej (dobrej) abez di¡ ongizace (dobrý) asúžením é > í (mlíko) abez úžení (mléko). Postup práce Žáci by měli před samotnou prací spracovním listem vědět, že vČeské republice existují různé nářeční oblasti. Učitel může žákům pomocí mapy ukázat, kde se nacházejí. Zároveň by měli být seznámeni sexistencí obecné češtiny avhodnosti jejího užití vrůzných komunikačních situacích. Pracovní list by měl navazovat na práci stextem, ve kterém se objevují obecně české prvky. Těch by si žáci měli povšimnout. Poté obdrží pracovní list. Učitel se nejprve zeptá žáků, co oobecné češtině vědí. Žáci mohou pracovat nejdřív ve skupinách. Typické charakteristiky poté zapisuje na tabuli učitel nebo žáci. Učitel se následně zaměří na změnu ý>ej aé > í. Vyzve žáky, aby se do korpusu podívali na rozložení jejího výskytu na území ČR pomocí daných příkladů. Příklady lze samozřejmě změnit. Důležité ale je, že vpřípadě sledování změn koncovek je potřeba zadávat celé spojení (např.celý den X celej den), jinak by se vyhledávala iadjektiva vjiném spojení (např.celý autaatd.), což by zkreslilo výsledek. Žáci se mohou před vlastní prací skorpusem pokusit odhadnout, kde bude která varianta převažovat. Při práci je důležité, aby pracovali svýsledky pro mluvený jazyk anářeční oblasti. Korpus není zhlediska nářečních oblastí vyvážený, proto nemá smysl vyhodnocovat pouze výskyt na celém území ČR zobrazující se vprvních kruhových grafech. Až žáci určí, kde di¡ ongizace aúžení typicky probíhá, vymyslí ve dvojicích příklady dalších slov, kde se ý mění na ej aé na í. Následně zahrají dialog, ve kterém si vyzkoušejí roli „typického Čecha“ a„typického Moravana“. Cvičení lze samozřejmě doplnit odalší charakteristiky obecné češtiny, např.převahu koncovky –ý vnominativu plurálu všech rodů (dobrý auta, ženy, muži, hrady).
134 korpusy v jazykovém vyučování ii. 1. Co víte oobecné češtině? Která obecně česká slova znáte? 2. Pro obecnou češtinu je typická změna ý>ej (dobrej kámoš) aé > í nebo ý (velký auto, mlíko). Podívejte se do korpusu (h ps://syd. korpus.cz/) ařekněte, kde jsou vČR tyto změny typické akde ne. Použijte příklady: výška - vejška, celý den– celej den, mléko– mlíko 3. Která další slova se můžou takto měnit? Napište co nejvíc příkladů. 4. Zahrajte dialog typického Čecha stypickým Moravanem. Jako Čech vněm používejte „ej“ a„ý/í“, jako Moravan mluvte spisovně.
využití korpusů ve výuce 135 Postup práce skorpusem Do okének aplikace SyD vždy jednotlivě napište obě varianty. Nechte zaškrtnuté políčko a=A(nezáleží na tom, jestli je první písmeno malé nebo velké), vpřípadě jednoslovných hledání ipolíčko lemma (hledáme všechny tvary). Klikněte na tlačítko Porovnat varianty. Dále vyberte záložku Mluvený jazyk aNářeční oblasti. Zobrazí se vám barevná mapa sgrafy azároveň graf pro jednotlivé nářeční oblasti. Adresy dotazů: http://syd.korpus.cz/c3RhKzYq.syn (vejška, výška), h\ p://syd.korpus.cz/visNjrSk.syn (celej den, celý den); h\ p://syd.korpus. cz/h2skGGPz.syn (mlíko, mléko) Řešení vizgrafy Obrázek 76
142 korpusy v jazykovém vyučování ii. 1. Napište ktučným slovesům infi nitiv. Rozumím ti dobře. Dám ti pusu, až se vrátíš. Vroli Julie se představí Radka Coufalová. „Nestíhám, nemám čas,“ slyšíme všude kolem sebe. Jaké rozdíly vidíte vpráci architekta vUSA avEvropě? Vždycky se říká, že lidé osobě rádi mluví. 2. Doplňte tabulku. Slovesa sinfi nitivní koncovkou - , - a- mají osobní koncovky: já - (např. ) ty - (např. ) on/ona/ono - (např. ) my - (např. ) vy - (např. ) oni - (např. ) Všude je písmeno - . 3. Doplňte vhodné sloveso ve správném tvaru. koupit, muset, platit, sedět, vidět, zkoušet (já) si letenku na Floridu. (ty) jít klékaři. Učitelka žáky zmatematiky. My jako organizátoři honorář kapele. Vjaké lavici (vy) ? Všichni , že mu je špatně.
využití korpusů ve výuce 143 Postup práce skorpusem 1. Vaplikaci Morfi o vyplňte pole podle obrázku. Pro obě první pole vyberte charakteristiku „společný“, protože kořen slova je vinfi nitivu ikonjugované formě stejný. Ponechte zde výchozí nastavení (.+), protože nezáleží na tom, jak budou hledaná slovesa vypadat. Pro druhé pole– pole pro formant vyberte charakteristiku „odlišný“. Vprvním vzoru vyplňujeme zakončení infi nitivu. Pro tento typ časování je to vždy vokál+t (až na výjimky, jako je jíst, okteré nám nyní nejde). Proto vyberte rozbalením druhého pole pro vzor 1 „samohlásky“ apo zobrazení další nabídky „všechny“ adopište t. Do políčka pro vzor 2 napište ím, tedy osobní koncovku první osoby singuláru. Hledají se tvary, protože nám jde otvary slovesa, nikoli olemmata. Dále klikněte na Hledat. Obrázek 80 2. Pro zobrazení frekvenčního seznamu nejčastějších sloves zvolte záložku Výpis aseznam sloves seřaďte podle frekvence. Jak je patrné ze seznamu, musíte výsledky protřídit, jelikož Morfi o neumí přiřadit infi nitiv ktvaru podle významu. Po vytřídění chybných údajů získáte představu onejfrekventovanějších slovesech, která poté můžete využít pro tvorbu cvičení.
144 korpusy v jazykovém vyučování ii. Obrázek 81 Příkladové věty nejlépe najdete přes rozhraní KonText pomocí funkce Slovní tvar, která vám umožní hledat přímo zadaný slovní tvar. Obrázek 82 Nalezené věty je třeba přizpůsobit jazykové úrovni žáků.
využití korpusů ve výuce 145 Řešení 1. rozumět, vrátit se, představit se, slyšet, vidět, mluvit 2. Osobní koncovky jsou zjednodušené, nepočítá se zde svariantou rozumějí. Slovesa sinfi nitivní koncovkou -it, -et a-ět mají osobní koncovky: já -ím (např. rozumím) ty -íš (např. vrátíš se) on/ona/ono -í (např. představí se) my -íme (např. slyšíme) vy -íte (např. vidíte) oni -í (např. mluví) Všude je písmeno -í . 3. koupím– musíš– zkouší– platíme– sedíte– vidí
146 korpusy v jazykovém vyučování ii. Pracovní list č.16: KONJUGACE – Slovesa čtvrté slovesné třídy II. Anotace Cvičení tohoto typu je vhodné zařadit pro názornou ukázku konjugace sloves. Žáci si díky nim lépe uvědomí, že lze konjugační typ odvodit podle zakončení infi nitivu. Vtomto pracovním listu bylo jako ilustrační příklad zvoleno sloveso mluvit, lze ale samozřejmě použít jakékoliv jiné sloveso stypickým zakončením. Postup práce Před obdržením pracovního listu by měli žáci ve vhodném textu najít několik sloves jednoho konjugačního typu, okterý poté půjde při plnění úkolů. Sloves by si měli sami všimnout, pokud je to nutné, mohou je vyčasovat. Zde lze využít např.slovesa mluvit, rozumět, myslet. Žáci by měli vědět, že ktomuto typu patří slovesa, která jsou vinfi nitivu zakončená na -it, -et nebo -ět (vizdotaz vprvním úkolu). Sami by měli být schopní vymyslet další příklady. Před vlastní prací skorpusem se žáci mohou pokusit odhadnout, která slovesa tohoto typu budou nejfrekventovanější. Učitel si může předem připravit obrázky ilustrující deset nejčastějších sloves (vizřešení) ažáci mohou hádat, okterá slovesa jde. Následně dle svých schopností sami, vpárech nebo vplénu použijí aplikaci Morfi o aověří si své domněnky. Je možné, že některá slovesa nebudou znát. Učitel by měl po zobrazení výsledků ověřit porozumění např.tím, že žákům opět ukáže obrázky azeptá se jich, co člověk na obrázku dělá. Žáci jako odpověď musí používat slovesa, která nalezli. Je vhodné, aby po vlastní práci skorpusem žáci slovesa použili např.při psaní krátkého příběhu a/nebo aby si je procvičili hrou „aktivity“, během níž jeden žák sloveso namaluje, vysvětlí nebo předvede aostatní hádají, okteré sloveso se jedná. Pro rychlé azvídavé žáky vyšší úrovně je možné využít třetí úkol, během nějž mají porovnat produktivitu tohoto vzoru se vzorem pít. Zde může učitel také upozornit na to, že slovesa sdlouhým -í vinfi nitivní koncovce patří kjinému typu. Pokud žáky práce zaujme, mohou hledat také zbývající slovesa stejného konjugačního typu, slovesa dalších typů (dělat, kupovat) nebo slovesa „nepravidelná“ (plavat– plavu…).
využití korpusů ve výuce 147 1. Jaký tvar má sloveso „mluvit“ pro „já“? Proč? Jaká další slovesa mají stejnou (identickou) konjugaci? 2. Která slovesa se stejnou konjugací jsou asi nejčastější? Diskutujte ve skupinách. Potom použijte Morfi o anajděte deset nejčastějších sloves. Napište si je avymyslete příběh, ve kterém použijete minimálně pět sloves. 3. Úkol pro rychlé: Kolik sloves má vkorpusu stejnou konjugaci jako mluvit (já mluvím) akolik jako pít (já piju)?
148 korpusy v jazykovém vyučování ii. Postup práce skorpusem. 1. Postup práce je stejný jako upředchozího pracovního listu. Vaplikaci Morfi o vyplňte pole podle obrázku. Pro obě první pole vyberte charakteristiku „společný“, protože kořen slova je vinfi nitivu ikonjugované formě stejný. Ponechte zde výchozí nastavení (.+), protože nezáleží na tom, jak budou hledaná slovesa vypadat. Pro druhé pole– pole pro formant– vyberte charakteristiku „odlišný“. Vprvním vzoru vyplňujeme zakončení infi nitivu. Pro tento typ časování je to vždy vokál+t (až na výjimky, jako je jíst, okteré nám nyní nejde). Proto vyberte rozbalením druhého pole pro vzor 1 „samohlásky“ apo zobrazení další nabídky „všechny“ adopište t. Do políčka pro vzor 2 napište ím, tedy osobní koncovku první osoby singuláru. Hledají se tvary, protože nám jde otvary slovesa, nikoli olemmata. Dále klikněte na Hledat. 2. Pro zobrazení sloves tohoto vzoru zvolte Výpis. Zobrazená slovesa následně seřaďte podle frekvence kliknutím na šipku směřující dolů uveličiny fq. Tak získáte deset nejčastějších (vizřešení). 3. Pro řešení doplňujícího úkolu (pít– piju) postupujte analogicky. Do políček pro odlišný formant tentokrát zadejte ít aiju. Poté porovnejte počet sloves obou typů. Řešení (na základě korpusu SYN2015) 1. Mluvím, protože všechna slovesa, jejichž infi nitiv končí na -et, -ět, -it + slovesa jíst, spát, stát mají osobní koncovky -ím, -íš, -í, -íme, -íte, -í. 2. myslet, vědět, muset, prosit, vidět, cítit, věřit, snažit, slyšet, vrátit 3. Stejnou konjugaci jako mluvit má asi 800 sloves, jako pít 21. Ve výsledcích se objeví 839, respektive 23 sloves, uněkterých ovšem najdeme inegativní formy. Přesto je zřejmé, že první typ je výrazně produktivnější než druhý. Když se na výsledky druhého hledání podíváte blíže, zjistíte, že se zde objevuje sedm prefi govaných sloves skořenem žít (dle frekvence: využít, použít, přežít, užít, zažít, prožít, dožít). Další slovesa jsou vpořadí dle frekvence zabít, pít, napít, vypít, bít, rozbít, nalít, šít, opít, zašít, lít, dopít.
využití korpusů ve výuce 149 Pracovní list č.17: TVORBA SUBSTANTIV SUFIXACÍ– Myslivec dnes ulovil velkého jelena. Byl to obrovský úlovek! Anotace Cvičení tohoto typu je vhodné zařadit pro znázornění různých slovotvorných modelů. Žáci si díky nim lépe uvědomí, že lze od známých slov odvozovat nová slova pomocí předpon apřípon. Cvičení lze libovolně variovat, je možné hledat např.jen slova odvozená předponami (např.chod– vchod) nebo naopak jen slova odvozená příponami (např.školit– školitel). Vtomto pracovním listu půjde oslova utvořená ze sloves předponou úapříponou -ek (např.úlovek). Postup práce Učitel by se měl nejdřív ujistit, že žáci rozumí slovu, které bude sloužit jako model. Vnašem případě je to slovo úlovek. Pokud ho žáci neznají, může se učitel na základě příkladové věty vpracovním listu nebo obrázku smyslivcem lovícím jelena zeptat: Co dělal myslivec? Žáci by se měli dostat kodpovědi: Lovil jelena. Poté se učitel opět na základě věty nebo dalšího obrázku zeptá, jaký byl výsledek lovu– ulovil jelena. Výsledek je tedy úlovek. Učitel se žáků dále zeptá, na které části lze toto slovo rozdělit, čímž přejde ktematice slovotvorby. Žáci by měli přijít na kořen lov, předponu ú apříponu ek. Pokud neznají názvosloví, může je sním učitel tímto způsobem seznámit. Následně se učitel žáků zeptá, zda znají další slova, která vznikla stejným způsobem. Učitel si předem může připravit obrázky nebo věty svynechanými slovy, která žáci hledají (vizřešení), ažáci se mohou sami pokusit zjistit, okterá slova se jedná. Pravděpodobně se jim nepodaří určit všechna slova, ato by mělo sloužit jako motivace pro práci skorpusem. Žáci se sami nebo sučitelem podívají do aplikace Morfi o azjistí, která další slova jsou odvozena stejným způsobem. Je vhodné, aby tato slova poté použili např.vkrátkém příběhu. Pokud žáky práce skorpusem zaujme, mohou následně ve skupinách nebo za domácí úkol vyhledávat slova vzniklá na základě jiného slovotvorného modelu (např.jména činitelská, konatelská, obyvatelskáatd.).
150 korpusy v jazykovém vyučování ii. MYSLIVEC DNES ULOVIL VELKÉHO JELENA. BYL TO OBROVSKÝ ÚLOVEK! 1. Co znamená slovo „úlovek“? Jak vzniklo? 2. Které části má toto slovo? 3. Znáte nějaké další slovo se stejnou předponou apříponou? 4. Použijte aplikaci Morfi o anajděte další slova se stejnou předponou apříponou. Potom napište krátký text, ve kterém alespoň tři slova použijete.
využití korpusů ve výuce 151 Postup práce skorpusem Do aplikace si přidejte na první místo uobou vzorů ještě jedno pole pro odlišný formant kliknutím na <+. Toto pole ponechte uprvního vzoru prázdné, udruhého do něj vyplňte ú. Udruhých polí ponechte charakteristiku „společný“ ivýchozí nastavení (.+). Do posledního pole pro odlišný morfém napište uprvního vzoru it, do druhého ek. Uprvního vzoru zvolte morfologickou specifi kaci slovesa, udruhého podstatná jména. Vyberte, že se hledají avyhodnocují lemmata. Velikost písmen můžete ignorovat. Nakonec klikněte na tlačítko Hledat. Obrázek 83 Řešení (na základě korpusu SYN2015) 1. Je to výsledek lovu, zvíře, které jsme ulovili nebo přeneseně cokoliv, co jsme získali např.koupí/výměnou (Ta vzácná známka, kterou jsem koupil od toho starého sběratele, je skvělý úlovek.) Vzniklo od slovesa ulovit příponou -ek. To zase vzniklo od slovesa lovit předponou -u. 2. Předponu ú-, kořen lov apříponu -ek. 3. viz4) 4. činit– účinek, lomit– úlomek, platit– úplatek, radit– úradek, šklebit– úšklebek, tulit– útulek Jak je zvýsledků analýzy patrné, je potřeba provést ještě interpretaci výsledků. Nedá se očekávat, že by slovo útulek významově vzniklo ze slovesa tulit, formálně ovšem souvislost má.