Full text
Tomáš Gráf Věra Hejhalová Barbora Kukrechtová Karel Šebesta Kateřina Šormová ISBN 978–80–7308–897–2 KORPUSY V JAZYKOVÉM VYUČOVÁNÍ / K. Šormová, K. Šebesta a kol. KORPUSY V JAZYKOVÉM VYUČOVÁNÍ Kateřina Šormová, Karel Šebesta a kol. práce filozofické fakulty univerzity karlovy Publikace Korpusy vjazykovém vyučování je určena učitelům, studentům učitelství idalším zájemcům ovyučování jazyka. V první části se čtenář seznámí steoriemi osvojování jazyka ajazykovým výzkumem, jsou mu představeny nejznámější anejvětší korpusy angličtiny, češtiny avýběrově idalších jazyků sdůrazem na korpusy akviziční, zejména na projekt AKCES. Pozornost je zaměřena také na typy korpusů ajejich parametry, tedy velikost, vyváženost, autentičnost, strukturní apoziční atributy. Vdruhé části publikace je představena práce skorpusy Českého národního korpusu, vyhledávání pomocí rozhraní KonText apomocí aplikací SyD, Morfio, KWords, Treq aukázka zapojení frekvenční analýzy do jazykového vyučování. Poslední část publikace tvoří pracovní listy věnované využití korpusových dat v jazykovém vyučování. Součástí pracovních listů je ipodrobný popis metodického postupu ařešení zadaných cvičení.
Tomáš Gráf Věra Hejhalová Barbora Kukrechtová Karel Šebesta Kateřina Šormová ISBN 978–80–7308–897–2 KORPUSY V JAZYKOVÉM VYUČOVÁNÍ / K. Šormová, K. Šebesta a kol. KORPUSY V JAZYKOVÉM VYUČOVÁNÍ Kateřina Šormová, Karel Šebesta a kol. práce filozofické fakulty univerzity karlovy Publikace Korpusy vjazykovém vyučování je určena učitelům, studentům učitelství idalším zájemcům ovyučování jazyka. Vprvní části se čtenář seznámí steoriemi osvojování jazyka ajazykovým výzkumem, jsou mu představeny nejznámější anejvětší korpusy angličtiny, češtiny avýběrově idalších jazyků sdůrazem na korpusy akviziční, zejména na projekt AKCES. Pozornost je zaměřena také na typy korpusů ajejich parametry, tedy velikost, vyváženost, autentičnost, strukturní apoziční atributy. Vdruhé části publikace je představena práce skorpusy Českého národního korpusu, vyhledávání pomocí rozhraní KonText apomocí aplikací SyD, Morfio, KWords, Treq aukázka zapojení frekvenční analýzy do jazykového vyučování. Poslední část publikace tvoří pracovní listy věnované využití korpusových dat v jazykovém vyučování. Součástí pracovních listů je ipodrobný popis metodického postupu ařešení zadaných cvičení.
filozofická fakulta univerzity karlovy, 2019 KORPUSY V JAZYKOVÉM VYUČOVÁNÍ Kateřina Šormová, Karel Šebesta a kol.
Kniha vznikla díky podpoře projektu Zvýšení kvality vzdělávání a začleňování žáků s OMJ spojené s jeho radikální inovací (CZ.07.4.68/0.0/0.0/16_037/0000299) a Kreativita a adaptabilita jako předpoklad úspěchu Evropy v propojeném světě (CZ.02.1.01/0.0/0.0/16_019/0000734). Recenzovali Mgr. Svatava Škodová, Ph.D. doc. PhDr. Milan Hrdlička, CSc. Mgr. Jarmila Valková, Ph.D. © Tomáš Gráf, Věra Hejhalová, Barbora Kukrechtová, Karel Šebesta, Kateřina Šormová, 2019 ©Univerzita Karlova, Filozofická fakulta, 2019 Za obsah a jazykovou správnost odpovídají autoři Všechna práva vyhrazena ISBN 978-80-7308-897-2 (online : pdf)
Obsah Úvod 7 Seznámení s korpusy a korpusovou lingvistikou 1. Korpusy, jejich typy; korpusy češtiny (Karel Šebesta) 11 2. Teorie osvojování jazyka a korpusový výzkum (Tomáš Gráf) 16 2.1. Korpus a jazykové testování 17 2.2. Žákovský korpus a jazyk pro specifické účely 19 2.3. Analýza žákovského jazyka 21 2.3.1. Gramatika 22 2.3.2. Slovní zásoba 24 2.3.3. Frazeologie 27 2.3.4. Diskurz 29 2.3.5. Pragmatika 31 2.3.6. Plynulost 32 3. Významné parametry korpusů (Karel Šebesta) 34 3.1. Velikost 34 3.2. Vyváženost 37 3.3. Autentičnost jazyka 40 3.4. Strukturní atributy 43 3.5. Poziční atributy – lingvistická (a chybová) anotace 44 4. Práce s korpusem (Věra Hejhalová) 47 4.1. Český národní korpus (ČNK) 47 4.1.1. Materiál/Obsah 47 4.1.2. Vyhledávač neboli korpusový manažer 47 4.1.3. Vyhledávání 48 4.1.4. Volba korpusu 49 4.1.5. Typ dotazu 49 4.1.6. Zadání dotazu 51 4.1.7. Specifikace kontextu 52 4.1.8. Omezení hledání 53 4.1.9. Výsledky hledání 54
4.2. Korpusové aplikace 60 4.2.1. Aplikace SyD 61 4.2.2. Aplikace Morfio 65 4.2.3. Aplikace KWords 67 4.2.4. Aplikace Treq 70 Využití korpusů ve výuce 5. Náměty pro strategie vyučování a pro tvorbu pracovních listů 75 5.1. Frekvenční analýza (Kateřina Šormová) 75 5.2. Pracovní listy (Barbora Kukrechtová) 78 5.2.1. Prostředí KonText 79 5.2.2. Morfio 89 5.2.3. SyD 93 5.2.4. KWords 96 Použitá literatura 103 Profily autorů 105 Rejstřík 107 Resumé / Summary 109
7 Úvod Milí čtenáři, právě jste otevřeli publikaci Korpusy vjazykovém vyučování. Je určena učitelům, studentům filologických oborů, jazykovým lektorům ivšem dalším zájemcům ojazyk ajeho vyučování. Při přípravě této příručky jsme měli na mysli dva cíle. Prvním bylo představení jazykového korpusu jako nástroje, jehož prostřednictvím můžeme zajímavým způsobem zkoumat jazyk, pohlížet na něj zrůzných úhlů pohledu avurčitém smyslu si sním ihrát. Zejména se zaměřujeme na korpusy akviziční, obsahující jazyková data zprojevů mluvčích, kteří se jazyk teprve učí. Druhým cílem bylo poskytnout Vám inspiraci vtom, jak můžeme jazykový korpus využít při výuce češtiny jako cizího/druhého jazyka. Ztoho důvodu tvoří poslední kapitolu příručky několik pracovních listů, které by Vám měly posloužit jako návodná ukázka aktivit, které lze na základě práce skorpusem do vyučování přinést. Budeme rádi, pokud Vás přivedou ktvorbě Vašich vlastních aktivit apracovních listů založených na korpusových datech. Přejeme Vám příjemné čtení aradost zpráce sjazykem. Autoři
14 korpusy v jazykovém vyučování To platí ipro korpusy češtiny, také česká korpusová lingvistika navazuje na dlouhou abohatou tradici jinak než elektronicky zpracovávaných sběrů. První snahy ovytvoření centrální národní instituce, která by koncentrovaně rozvíjela korpusové aktivity pro češtinu, se objevují přibližně od druhé poloviny 80. let. Vr.1994 vznikl na FF UK pod vedením F. Čermáka Ústav Českého národního korpusu, který budování korpusů českého jazyka, obecných ispeciálních, zaštiťuje. Vsoučasné době nabízí: – synchronní korpusy psaného jazyka řady SYN, – specializované korpusy psaného jazyka různého zaměření, včetně akvizičních (vizdále), – synchronní korpusy mluveného jazyka řady ORAL anový korpus OR‑ TOFON, – specializované korpusy mluveného jazyka různého zaměření, včetně akvizičních (vizdále), – diachronní korpus DIAKORP, – paralelní korpus InterCorp, – srovnatelné korpusy Aranea, psané jednojazyčné webové aspeciální korpusy jiných jazyků, než je čeština. Pro učitele češtiny jako cizího jazyka mají význam vedle korpusů akvizičních primárně obecné korpusy češtiny, tedy korpusy řady SYN aORAL, resp. ORTOFON, pro vyšší anejvyšší úrovně apro některé speciální účely je využitelný korpus paralelní– InterCorp. Vedle korpusů Českého národního korpusu je pro učitele významný rovněž Pražský závislostní korpus, budovaný Ústavem formální aaplikované lingvistiky MFF UK; zněj vycházejí iněkteré didaktické pomůcky zaměřené na výuku syntaxe. Korpusy akviziční navazují na neméně dlouhou tradici systematického sběru jazykových dat pro účely studia osvojování apozdějšího vývoje jazyka dětí předškolního iškolního věku, studia jazyka mládeže jako specifické jazykové variety, jazyka nerodilých mluvčích, jazyka mluvčích postižených jazykovou poruchouapod.3 Vroce 2005 byl pod vedením K. Šebesty zahájen projekt AKCES (Akviziční korpusy češtiny) při Ústavu českého jazyka ateorie komunikace FF UK, na jeho vytváření se však významně podílejí idalší pracoviště.4 3 Ktéto akviziční tradici sběrů vmezinárodním idomácím výzkumu ake vzniku prvních akvizičních korpusů počítačových podrobněji vizŠebesta, 2010. 4 Ústav teoretické akomputační lingvistiky, Ústav formální aaplikované lingvistiky MFF UK, Ústav Českého národního korpusu, Ústav jazykové aodborné přípravy UK adalší.
seznámení skorpusy akorpusovou lingvistikou 15 Projekt AKCES je pojat poměrně široce:5 zahrnuje postupné vytváření databází anávazně budování korpusů psaných imluvených zaměřených na: a. jazyk dětí předškolního věku, b. jazyk dětí amládeže od 5 do 24let, c. jazyk nerodilých mluvčích češtiny, d. jazyk sociokulturně znevýhodněných skupin, e. jazyk krajanských komunit, f. jazyk ve vzdělávacím kontextu. g. Poskytuje podporu rovněž korpusům terapeutickým. Jednotlivé korpusy jsou zveřejňovány zčásti vrámci Českého národního korpusu, zčásti vrámci Centra jazykové výzkumné infrastruktury LINDAT/ CLARIN6 Ústavu formální aaplikované lingvistiky MFF UK. Pro výuku nerodilých mluvčích jsou relevantní zejména: – korpusy žákovské (jazyka nerodilých mluvčích); znich byly dosud vrámci Českého národního korpusu7 zveřejněny korpusy řady CZESL (polovina korpusu CZESL ‑PLAIN, korpusy CZESL ‑SGT aCZESL ‑MAN– druhý znich není dosud veřejně přístupný), vrámci Centra LINDAT/ CLARIN pak korpus AKCES 5; volně se knim řadí ičeská část korpusu MERLIN, zpracovaná vrámci samostatně financovaného německo- -italsko -českého projektu;8 – korpusy jazyka žáků ze sociokulturně znevýhodňujícího prostředí– zkorpusů zveřejněných vrámci Českého národního korpusu sem patří ccačtvrtina korpusu CZESL ‑PLAIN, připravuje se kzveřejnění srovnávací korpus Compar, jehož polovinu tvoří data mluvčích ze sociokulturně znevýhodněných komunit; zkorpusů zveřejněných vrámci LINDATu jsou to korpusy AKCES 4 amluvený korpus ROMi_1.0; – korpusy písemných imluvených projevů českých žáků– vrámci Českého národního korpusu byl zveřejněn korpus písemných prací žáků SKRIPT2012; jejich mluvené projevy jsou zachyceny zčásti ve školníchdialozích přepsaných azveřejněných vkorpusech SCHOLA 2010 (na stránkách ČNK) aAKCES 2 ver 2. 5 Podrobnější informace ocelém projektu jsou na stránkách http://akces.ff.cuni.cz/. 6 https://lindat.mff.cuni.cz/cs/ 7 https://kontext.korpus.cz/first_form 8 https://merlin -platform.eu/
16 korpusy v jazykovém vyučování 2. Teorie osvojování jazyka akorpusový výzkum Nauka ojazykové akvizici se zabývá zkoumáním procesů osvojování mateřského či cizího jazyka. Jakkoliv doklady ospekulacích opodstatě tohoto procesu nacházíme již ve starověku, jako vědní obor asoučást aplikované lingvistiky se ustavuje až vpolovině 20. století, kdy nachází své místo vuniverzitních studijních programech. Jako každý vědecký obor pracuje inauka ojazykové akvizici skonkrétními daty aod 80. let 20. století tato data stále častěji pocházejí ztzv.akvizičních korpusů. Jde ospeciální typ jazykových korpusů, které si nejlépe představíme jako počítačově zpracované aprohledávatelné sbírky textů, jejichž původci jsou ti, kdo si jazyk osvojují: děti osvojující si mateřštinu nebo studenti (ať už vdětském, či dospělém věku) osvojující si další, zpravidla cizí, jazyk. Existují přitom různé typy těchto korpusů vzávislosti na médiu (psaný či mluvený korpus), typu jazyka (mateřský či cizí) či charakteristice mluvčího (dítě, dospělý, mluvčí sřečovou poruchou, rodilý či nerodilý mluvčí, mluvčí ze sociokulturně či jinak znevýhodněné komunityaj.). Společné pak mají tyto korpusy to, že zachycují tzv.mezijazyk, tedy jazyk ve vývojové fázi, která ještě nedosahuje úrovně obvyklé pro dospělého rodilého mluvčího. Akviziční korpusy jsou tak sbírkou dokladů otom, jak osvojování probíhá ajaké jsou typické rysy osvojovaného jazyka. Umožňují tak hledat odpověď na řadu klíčových otázek, kterými se nauka oakvizici zabývá, jako jsou například role jazykového transferu (tj.vlivu mateřštiny na osvojování cizího jazyka) aodlišnosti mezi mezijazykem ajazykem rodilého mluvčího, jakož iodlišnosti ve vyjadřování různých mluvčích. Je tak možné srovnávat jazykový projev studentů srůznou mateřštinou, kteří si ale osvojují stejný cizí jazyk (např.angličtinu). Tradiční výzkum voblasti jazykové akvizice často pracoval somezenými vzorky dat anezřídka isintuicí badatelů aučitelů cizích jazyků. Často tak byly výsledky výzkumu přijímány svýhradou, že se zjištěné skutečnosti mohou týkat právě jen onoho omezeného vzorku mluvčích anedají se zobecnit. Akviziční korpusy naproti tomu poskytují velké množství dat sesbírané od desítek, stovek či tisíců mluvčích aposkytuje tak rozsáhlou bázi pro empirické ověřování hypotéz svelkou možností zobecnění závěrů. Specifickým azřejmě inejběžnějším typem akvizičních korpusů jsou korpusy žákovské (angl. learner corpora). Jsou vystavěny ztextů nerodilých
seznámení skorpusy akorpusovou lingvistikou 17 mluvčích, kteří se učí cizí jazyk. Jazyk, který vyprodukují, pak označujeme jako jazyk žákovský (jakkoliv nezáleží na věku studenta; žákem je označován každý, kdo se učí). Zdrojem textů mohou být psané školní práce, materiály zjazykových zkoušek, přepsané nahrávky mluveného projevu či záznamy řečových úloh sestavených za účelem vytvoření samotného korpusu. Vkvětnu 2018 čítal seznam Learner corpora around the world9 167 žákovských korpusů. Další korpusy budou jistě inadále vznikat. Dalším typem akvizičních korpusů jsou korpusy osvojování mateřštiny. Nejznámější znich, korpus CHILDES10 (Child Language Data Exchange Sys‑ tem), začal vznikat již vr.1984 ashromažďuje data ze 130 specializovaných korpusů dětské řeči v26 jazycích. Korpus se posléze připojil kprojektu Talk‑ Bank, který obsahuje korpusy akvizice mluvčích sporuchami řeči (afázie), korpusy osvojování cizích jazyků, korpusy jazyka ve školních třídách akorpusy pro konverzační analýzu. Akviziční korpusy se vybavují různými systémy anotace. Ty přejímají buď zobecné korpusové lingvistiky (např.anotace slovnědruhová), nebo vytvářejí vlastní anotační systémy zachycující specifické rysy akvizice (např.jazykové odchylky, chyby či jiná specifika). Takto vybavené korpusy pak umožňují sofistikované metody vyhledávání ana nich založené analytické postupy, které dokážou odkrýt charakteristické rysy vyvíjejícího se jazyka, na jejichž základě je nezřídka možné formulovat ipedagogické závěry. 2.1. Korpus ajazykové testování Využití korpusů pro účely jazykového testování je jedním znejnovějších příkladů aplikace jazykových korpusů aje to bezesporu oblast, kde se do budoucna očekává velká aktivita, ato především voblasti definování apopisování úrovní pokročilosti. Současný stav výzkumu vtéto oblasti vychází především zmožností sběru dat při jazykových zkouškách. Takto získané vzorky žákovského jazyka, unichž je školenými examinátory stanovena jazyková úroveň např.dle Společného evropského referenčního rámce (SERR), se analyzují například zhlediska četnosti určitých jevů ana základě těchto analýz je pak možné popsat, které jazykové prostředky jsou charakteristické pro danou úroveň pokročilosti. Lingvistům se tak daří reagovat na časté kritické hlasy, které si všímají, že Společný evropský referenční rámec není dostatečně specifický avrámci popisu dovedností na jednotlivých 9 Centre for English Corpus Linguistics (date of access): Learner Corpora around the World. Louvain -la -Neuve: Université catholique de Louvain, https://uclouvain.be/en/research- -institutes/ilc/cecl/learner -corpora -around -the -world.html. 10 https://childes.talkbank.org
18 korpusy v jazykovém vyučování úrovních užívá příliš obecný jazyk. Výsledky tohoto výzkumu mají potenciál přispět klepší srovnatelnosti. Zatím nejvýznamnějším anejrozsáhlejším počinem vtéto oblasti je projekt English Profile11 (organizovaný University of Cambridge, Cambridge University Press aCambridge English Language Assessment apodpořený Evropskou komisí). Zdat zjazykových zkoušek na všech úrovních angličtiny dle SERR byl sestaven korpus ana jeho základě pak seznamy slovní zásoby (English Vocabulary Profile) agramatiky (English Grammar Profile) typické pro jednotlivé úrovně SERR. Tuto bezplatnou databázi mohou využívat učitelé, studenti či autoři jazykových materiálů aověřit si, jaký konkrétní jazyk mluvčí různých úrovní angličtiny dokážou používat. Očekává se, že tento výzkum se zpětně promítne ido vývoje dokonalejších, empiricky založených technik zjišťování jazykové pokročilosti. Největším žákovským korpusem, který vznikl na základě sběru materiálů ztestů, je Cambridge Learner Corpus, který obsahuje vsoučasnosti přes 57 milionů slov psaného žákovského jazyka od více než čtvrt milionu mluvčích. Korpus je přitom inadále rozšiřován. Dalším významným projektem je The Longman Learners‘ Corpus, který poskytl podklady pro sestavení jazykových doporučení vžákovském slovníku Longman Active Study Dictionary. Mnoho nových výzkumných projektů nyní vzniká na základě mluveného korpusu žákovské angličtiny Trinity ‑Lancaster Corpus, který je sestaven znahrávek apřepisů ústních zkoušek zangličtiny při zkouškách Graded Examinations in Spoken English organizovaných Trinity College vLondýně. Zatím zde však jde pouze oúrovně B1–C1. Pro účely vývoje jazykových testů se však využívají ikorpusy jazyka rodilých mluvčích. Například T2K ‑SWAL Corpus je souborem akademických textů, které se analyzují zpohledu analýzy diskurzu ažánrů. Výsledek tohoto výzkumu vedl ksestavení Test of English as aForeign Language, TOEFL iBT. Největší výhodou využití korpusové lingvistiky voblasti jazykového testování je bezesporu to, že jazykové korpusy (ať už žákovského jazyka, nebo jazyka rodilých mluvčích) umožňují empiricky ověřit intuici tvůrců testových materiálů apřipravit tak testy, které ověřují odpovídající jazykovou úroveň. To se může dít nejen na základě výzkumu toho, co mluvčí skutečně vjazyce dokážou, ale itoho, kde se odchylují od běžných norem (např.je možné zkoumat, jaké chyby jsou typické pro různé úrovně pokročilosti). Tvůrci jazykových testů se přitom mohou opřít oseznamy slov ajazykových struktur vygenerovaných zžákovských korpusů pro jednotlivé úrovně pokročilosti amohou na datech zkorpusu rovněž zkoumat, jak různé typy úloh ovlivňují výkon vtestu ajak se určité gramatické či lexikální jevy 11 http://www.englishprofile.org
seznámení skorpusy akorpusovou lingvistikou 19 vsouvislosti srostoucí pokročilostí proměňují. Cílem tohoto výzkumu je přispět ke zlepšování podoby avlastností jazykových testů. Pro účely jazykového testování se však dají využít ikorpusy běžné (pro angličtinu např.korpusy British National Corpus či Corpus of Contemporary American English), ato jako zdroj textů, které si mohou učitelé dle zadaných kritérií vyhledat avytvořit si tak testy na slovní zásobu či gramatiku. Takto získaná korpusová data jsou autentická ajazykově obvykle isprávná (co je vkorpusu vdaném registru či žánru frekventované, to zpravidla odpovídá zavedenému úzu/normě, atudíž odráží kodifikaci). 2.2. Žákovský korpus ajazyk pro specifické účely Jazykem pro specifické účely označujeme jazyk, který je užíván například vpracovním či akademickém prostředí akterý se řídí určitými pravidly příslušného funkčního stylu (např.styl odborný, publicistický aadministrativní), nezřídka je charakterizován ispecifickou slovní zásobou. Jeho znalost umožňuje uživatelům začlenit se do skupiny lidí, odborníků či profesionálů, kteří takový jazyk typicky používají akteří mají specifické komunikační potřeby azvyklosti. Jazyk pro specifické účely je od 60. let 20. století intenzivně zkoumán, což má mj.dopad ina jazykové vyučování, ato obzvláště pro angličtinu, která plní roli jazyka mezinárodní komunikace právě vprofesní oblasti. Je také vtomto ohledu nejlépe popsána. Existují tak četné učebnice odborného jazyka, slovníky, aplikace aspecializované jazykové kurzy. Rozlišuje se přitom mezi angličtinou pro pracovní účely (English for Occupational Purposes) aangličtinou pro účely akademické (English for Academic Purposes). Angličtina pro pracovní účely se nezaměřuje pouze na specifickou slovní zásobu (např.terminologii), ale především na to, jakým způsobem se vtěchto oblastech lidské činnosti komunikuje, aby komunikace byla efektivní apro dané účely vyhovující. To se týká jak jazyka psaného (např.obchodní korespondence, instruktážní texty), tak mluveného (např.komunikace lékařů spacienty, komunikace vleteckém provozu). Výzkum angličtiny pro akademické účely se zabývá celou škálou užití angličtiny vakademickém prostředí od interakcí mluvených (např.prezentace na konferencích) až po psaní akademických textů. Tato oblast je natolik široká, že se dále rozlišuje mezi angličtinou pro obecné apro specificky oborové akademické účely. Do této oblasti se nezřídka zahrnují ispecifické jazykové astudijní dovednosti anávyky (např.pořizování poznámek, práce sliteraturou, organizace textu), ale například iprezentační, rétorické techniky. Pedagogické úsilí vtéto nesmírně stratifikované oblasti pak směřuje především ktomu, aby byly naplněny potřeby studentů auživatelů jazyka vté které specializaci.
20 korpusy v jazykovém vyučování Korpusová lingvistika hraje vpopisu jazyka pro specifické účely nezastupitelnou roli. Disponuje totiž technikami, jak shromáždit dostatečně velké vzorky reprezentativních ukázek odborného jazyka, na jejichž základě je možné popsat jeho typické rysy. To je důležité jak pro tvorbu pedagogických materiálů, tak pro zkoumání projevu těch, kdo si tento jazyk osvojují vrámci jiného jazyka, než je jejich mateřština. Zkoumají se např.frekvenční vzorce vjednotlivých stylech aje tak možné velmi přesně určit, která specifická slovní zásoba je pro daný styl charakteristická. Na základě korpusu The Academic Corpus12 tak například vznikl seznam akademické slovní zásoby pro angličtinu (Academic Word List13), který je pro mezinárodní studenty neocenitelnou pomůckou při studiu akademické angličtiny apři psaní akademických textů. Využití pak samozřejmě nachází ipři výuce asestavování jazykových testů. Vedle textů napsaných rodilými mluvčími se však analyzují iakademické texty nerodilých mluvčích. Vznikají tak speciální žákovské korpusy akademického žákovského jazyka. Izde zcela převládají korpusy angličtiny. Jde obvykle odatabáze psaných úloh (esejů, písemných zkoušekatp.) vzniklých na univerzitách. Jazyk, který vdaném kontextu studenti používají, je charakteristický jak užitím terminologie, tak užitím specifických typů argumentace apostupů při výkladu. Jedním zprvních takových korpusů je International Corpus of Learner English (ICLE), který začal vznikat vBelgii, na Université catholique de Louvain, v80. letech 20. st. Práce na něm stále pokračuje, ač korpus vsoučasné době obsahuje eseje vrozsahu 3,7 milionu slov od pokročilých studentů angličtiny z16 různých zemí, respektive s16 rozdílnými mateřskými jazyky. Na stejném pracovišti se nyní rodí nový korpus akademické angličtiny snázvem Varieties of English for Academic Purposes (VESPA). Korpus je tvořen národními subkorpusy mluvčích srozdílnou mateřštinou. Je tak možné nejen zkoumat specifika vyvíjejícího se akademického jazyka ustudentů, ale zároveň srovnávat, do jaké míry může být jeho podoba ovlivněna mateřštinou. Dalšími významnými korpusy vtéto oblasti jsou British Academic Written English (BAWE) aamerický Michigan Corpus of Upper ‑level Student Papers (MICUSP) ajejich mluvené protějšky British Academic Spoken English (BASE) aMichigan Corpus of Academic Spoken English (MICASE). Tyto čtyři korpusy jsou přitom ze zhruba 80% tvořeny psaným projevem rodilých mluvčích, což umožňuje srovnávat jazyk cizojazyčných studentů sjazykem rodilých mluvčích. To je vžákovské korpusové lingvistice běžný přístup anezřídka jsou žákovské korpusy doplňovány okontrolní korpusy textů rodilých mluvčích, které jsou koncipovány tak, aby měly stejnou strukturu 12 https://www.victoria.ac.nz/lals/resources/academicwordlist/information/corpus 13 Pro češtinu je dostupný nástroj Akalex, vizwww.korpus.cz/akalex.
seznámení skorpusy akorpusovou lingvistikou 21 apodobaly se kvůli srovnatelnosti vco největší možné míře. Korpus ICLE je takto doplněn oLouvain Corpus of Native English Essays (LOCNESS), tedy korpus stejně zadaných esejů psaných rodilými mluvčími. Takový přístup však skrývá ijedno zásadní úskalí, atím je implicitní předpoklad, že text rodilého mluvčího je zpodstaty věci dokonalejší. Stranou přitom zůstává, zda jsou vybraní autoři zřad rodilých mluvčích kvalitními autory. 2.3. Analýza žákovského jazyka V50. letech 20. století se někteří lingvisté14 zabývali výzkumem jazyka za účelem zdokonalení metod jeho výuky. Vycházeli přitom zpředpokladu, že je snazší naučit se jazyk, který je podobnější žákově mateřštině, aže podrobný popis podobností arozdílů mezi mateřským jazykem ajazykem cizím je užitečnou pomůckou pro výuku apro tvorbu jazykových učebnic. Předpokládali, že žáci budou chybovat vtěch aspektech, které jsou rozdílné, anaopak snazší pro ně budou ty rysy, které jsou si mezi jazyky podobné. Domnívali se, že když se výuka bude zaměřovat především na tyto odlišnosti, žáci vnich nebudou chybovat. Skutečnost se ukázala být složitější apostupným výzkumem se ukázalo, že výuka vycházející ze srovnávání jazyků není zárukou bezchybného projevu žáků. Toto období bylo rovněž počátkem zájmu ožákovský jazyk, ato především ochyby, kterých se žáci dopouštějí při psaní či mluvení. Chyby byly analyzovány ze všech stran alingvisté se je pokoušeli pochopit vnaději, že objeví důvod, proč žáci chybují, abudou tak moci vyvinout dokonalejší výukové metody, které žákům umožní nechybovat. Stále více lingvistů však upozorňovalo, že chyby jsou nedílnou součástí učení aže představují doklad ovývoji pokročilosti aotom, že učení se cizímu jazyku je systematický proces. Tuto teorii završil vroce 1972 americký lingvista Larry Selinker formulací teorie tzv.mezijazyka. Selinkerův mezijazyk je dynamický, proměnlivý systém, který se vžákově mysli formuje na základě jeho zkušeností sjazykem akterý mu umožňuje cizí jazyk používat. To je možné díky pravidlům, která si vytváří sám žák, ato na základě výuky, učení se, kontaktu sosvojovaným jazykem adalších faktorů. Existence mezijazyka je základním principem, zněhož vychází výzkum jazykové akvizice. Data pro tento výzkum pak pocházejí stále častěji zžákovských korpusů. Ty umožňují analyzovat osvojování gramatiky, slovní zásoby, frazeologie, diskurzu, stylistiky, pragmatiky asnástupem videokorpusů vbudoucnosti ivýzkum nonverbální komunikace. 14 Např.Robert Lado, Charles Fries, Pitt Corder.
22 korpusy v jazykovém vyučování 2.3.1. Gramatika Vcentru zájmu při zkoumání žákovského jazyka stojí gramatika aslovní zásoba, které jsou vnímány jako dva základní komponenty znalosti cizího jazyka. Cílem žákovské korpusové lingvistiky vtéto oblasti je popsat, jakým způsobem studenti používají gramatiku cizího jazyka, který se učí, astanovit příslušné pedagogické postupy, které ztěchto informací vyplývají. Žákovská korpusová lingvistika má tedy velmi blízko kpedagogice adidaktice apřispívá kvytváření tzv.pedagogických gramatik, tzn.popisů cizojazyčných gramatických systémů při současném zohlednění možných postupů při jejich výuce. Ktomu, aby mohla být zkoumána gramatika vžákovském jazyce za použití žákovských korpusů, musí být tyto korpusy doplněny oanotace. Anotace jsou značky, které lingvisté doplňují do korpusu proto, aby se vněm dal vyhledávat nejen konkrétní řetězec znaků (např.slovo), ale ispecifická jazyková informace např.oslovním druhu či přítomnosti chyby. Rozlišujeme tak především značkování morfologické achybové. Zatímco morfologické značkování je možné provést víceméně automaticky svyužitím počítačových programů, značkování chybové se provádí ručně aje značně náročné na čas. Při morfologickém značkování je každému slovu přiřazena informace oslovním druhu apříslušném jazykovém tvaru. Díky tomu můžeme při vyhledávání vkorpusu zadat např.české slovo bez astanovit přitom, chceme -li, aby výsledky vyhledávání zahrnuly slovo bez jako podstatné jméno, či jako předložku. Pro žákovské korpusy jsou pak typické značky chybové, které se přiřazují všem výskytům chyb vjazykovém projevu, ať už jsou na úrovni gramatické, pravopisné, lexikální, či jiné. Chybová anotace se často vkládá přímo do textu. Označuje se přitom chybný tvar ačasto se doplňuje isprávná varianta (tzv.emendace). Jako příklad uveďme systém užívaný pro chybové značkování korpusu ICLE (vizvýše). Tento systém využívá značky složené zpísmen. Ty se vkládají před chybně užitý tvar. Na prvním místě bývá označení typu chyby (tj.jde- -li opravopis, gramatiku, slovní zásobu, lexikálně -gramatický jev či slovosled). Ve větě označené Příklad 1 je ukázáno, jakým způsobem je možné označkovat chybné užití gramatického času vanglické větě. Student ve větě chybně užil přítomný čas, proto je před chybným tvarem slovesa live vložena značka (GVT). Ta označuje, že jde ogramatickou chybu (G) týkající se třídy sloves (V, anglicky verb) akategorie času (T, anglicky tense). Po slovesu je vložena emendace, tedy návrh anotátora na to, jak by mohla znít správná věta. Vtomto případě anotátor navrhuje, aby místo tvaru přítomného času slovesa live bylo užito předpřítomného průběhového času.
seznámení skorpusy akorpusovou lingvistikou 23 původní věta: Ilive in Prague for ten years anotovaná věta: I(GVT) live $have been living$ in Prague for ten years Příklad 1: Ukázka chybové anotace anglické věty– gramatika Vtakto označkovaném korpusu je pak možné jednotlivé chybové značky vyhledávat anechat si zobrazit třeba právě všechny věty schybou vpoužití časů. Ty se pak dají dále analyzovat, případně je možné jich využít pro tvorbu cvičení pro výuku. Specifické uplatnění tyto postupy nacházejí při tzv.kontrastivní analýze mezijazyka, při níž se porovnává psaný nebo mluvený projev žáků sodlišnými mateřskými jazyky (např.angličtina Čechů aŠpanělů). Dají se tak odhalit podobnosti či rozdíly azkoumat, zčeho tyto rozdíly pramení. Častým zdrojem chyb přitom bývá tzv.jazykový transfer, kdy si žák přenáší do svého cizojazyčného projevu prvky ze své mateřštiny. Jako ukázka nám znovu může posloužit Příklad 1, uněhož se můžeme domnívat, že chybné užití přítomného času vangličtině pramení ztoho, že je vodpovídající větě včeštině používán právě přítomný čas (Bydlím vPraze už deset let.). Je -li označkován celý korpus, je možno přistoupit kanalýze chyb. Chyby se vyhledají aroztřídí do kategorií podle různých kritérií. Spoužitím statistických nástrojů je pak možné ověřovat hypotézy osouvislosti mezi chybovostí anejrůznějšími žákovskými proměnnými, jako jsou např.jazyková úroveň, věk, mateřský jazyk, délka studia nebo pobyt vzahraničí. Na základě chybové analýzy je pak možné sestavit katalogy chyb, které mohou být návodné pro výuku nebo se dají využít při psaní výukových materiálů. Jazykové učebnice aslovníky určené pro žáky angličtiny tak dnes nezřídka obsahují informace očastých chybách. Jsou návodné nejen pro žáky, ale ipro učitele. Existuje dokonce islovník chyb vangličtině,15 který obsahuje více než 2500 příkladů běžných chyb, vysvětlení daných jevů aukázky správného užití zBritish National Corpus. Zkoumat se ale nemusí pouze chyby. Srovnáváním jazyka rodilých mluvčích sjazykem žákovským je možné zjistit, co je pro žákovský jazyk charakteristické například frekvenčně, tj.které jevy se objevují častěji akteré méně často. Mluví se pak onadužívání či naopak menší míře používání určitých gramatických jevů. Takové analýzy jsou pak užitečné například pro výuku jazyka pro specifické účely (např.akademická angličtina, vizvýše). Jedním znejzajímavějších apro učitele angličtiny zřejmě inejužitečnějších využití žákovských korpusů voblasti gramatiky je projekt English 15 Turton, N.D. and J.B. Heaton (1996). Longman Dictionary of Common Errors. Harwich: Longman.
30 korpusy v jazykovém vyučování Ukázkovým příkladem využití korpusu vtomto směru je významná gramatika anglického jazyka Longman Grammar of Spoken and Written English.20 Vychází zkorpusu Longman Spoken and Written Corpus, který obsahuje 40 milionů slov z37 244 textů čtyř základních typů: konverzace, beletrie, žurnalistika aakademický text. Na jeho základě byl velmi přesně popsán například jazyk konverzace: bylo shledáno, že je bohatý na nevětné struktury, neúplné věty (vynechávají se například slova snízkou informační hodnotou) austálená víceslovná spojení, která plní různé funkce (např.mluvčí indikuje, že bude pokračovat vpromluvě, že se vrací kpůvodnímu tématuatp.). Obsahuje zároveň itzv.prostředky řečového managementu, které mluvčímu umožňují hovořit plynule. Sem patří např.výplňková slova avýplňkové pauzy, jejichž funkcí může být získání času pro plánování další promluvy nebo indikace, že mluvčí ještě současnou promluvu nedokončil. Tento výzkum inspiroval didaktiku cizích jazyků ktomu, aby se zaměřila nejen na tradiční výuku gramatiky založenou na psaném jazyce, ale ina jazykové prostředky charakteristické právě pro jazyk mluvený. Žákovská korpusová lingvistika pak vtéto oblasti zkoumá, do jaké míry tyto prostředky žáci využívají ajaké prostředky se naopak vjejich projevech vyskytují omezeně. Dalším zústředních témat je výzkum textové koherence. Jako koherenci označujeme sémantické, obsahové vztahy uvnitř diskurzu, které zajišťují jeho soudržnost, smysluplnost aplynulost. Mezi jednotlivými částmi koherentního textu totiž musí být patrná souvislost. Toho je možné dosáhnout používáním kohezních prvků, které explicitně naznačují, jak jsou jednotlivé úseky textu propojeny. Mezi tyto prvky patří například reference (odkazování na to, co již bylo řečeno, nebo na to, co bude vtextu následovat), konektory (spojovací výrazy vyjadřující logický vztah mezi jednotlivými částmi), substituce (použití jiného slova, které jasně odkazuje na to, co již bylo vyřčeno) atematicko -rematická struktura textu (tzv.aktuální členění větné). Výzkum koherence za použití korpusů je komplikovaný, neboť korpus neumožňuje zobrazit dlouhé úseky textu. Nejčastěji se proto pracuje právě sexplicitními kohezními prvky (obzvláště konektory), které je možno vkorpusu vyhledávat. Vžákovském jazyce se pak často zjišťuje, jak žáci tyto prostředky dokážou využít avjakých funkcích ajak jejich prostřednictvím vytvářejí strukturu textu. To má význam především při studiu avýuce akademického psaní. Ivtéto oblasti se využívají kontrastivní studie, které srovnávají texty žákovské stexty rodilých mluvčích. Pro vědecký text je též typické využívání rétorických prostředků pro zeslabování jistoty tvrzení (tzv.hedge) nebo jeho zesilování (tzv.booster). Ty se realizují použitím různých prostředků, např.modálních sloves (např.vý‑ 20 Biber, D., Stigg, J., Leech, G., Conrad, C. aE. Finegan. (1999) Longman Grammar of Spoken and Written English. Harlow: Pearson Education Limited.
seznámení skorpusy akorpusovou lingvistikou 31 sledky mohou naznačovat, že…), adverbií (např.tento výsledek nejspíš vypovídá o…)aj. Itoto je oblast, kterou si nerodilý mluvčí píšící vědecký text vcizím jazyce musí osvojit. Vžákovských korpusech akademického jazyka pak můžeme zkoumat, do jaké míry se to daří avčem spočívají odlišnosti od textů rodilých mluvčích či kompetentnějších autorů. Častým zjištěním je, že méně zkušení autoři nadužívají určitých prostředků modalizace vědeckého textu anevyužívají dostatečně jiných možností. Vneposlední řadě lze žákovský text korpusově analyzovat izpohledu zastoupení osobních zájmen ačinného či trpného rodu azjistit tak, do jaké míry dokáže žák prezentovat objektivní, neosobní vědecký text ajaké prostředky dokáže využít, když jako autor do textu potřebuje vstoupit například prezentováním svého postoje. 2.3.5. Pragmatika Pragmatika studuje jazyk zpohledu mluvčího apříjemce ataké to, jakým způsobem tito uživatelé jazyka dosahují svých komunikačních záměrů. Zkoumá tedy, jaký záměr má mluvčí, když něco sděluje, ajak je jeho sdělení interpretováno příjemcem. To závisí na takových faktorech, jako je například kontext promluvy či vztah mezi mluvčím apříjemcem, roli hraje ipříslušná jazyková kultura. Tyto faktory pak spolu svýznamem slov ovlivňují význam adopad celého sdělení. Podle teorie řečových aktů, která stojí vcentru pozornosti pragmatiky, je možné promluvou nejen něco prostě sdělit, ale iněco chtít, kněčemu se zavázat, kněčemu vyjádřit svůj postoj, případně vyřčením způsobit nějakou změnu. Vžákovském jazyce je pak možné tyto řečové akty identifikovat azjistit, jaké prostředky pro jejich vyjádření mluvčí používá. Izde je výhoda korpusů především ve zpřístupnění velkého objemu dat kvýzkumu, který může být navíc prohledáván automatickými algoritmy za účelem identifikovat vzorce, které se vtextu objevují. Kdiskurzní apragmatické analýze korpusů musejí být korpusy anotovány. To je však značně časově náročný ane vždy příliš snadný úkol, především vzhledem knutnosti správně vystihnout ainterpretovat původní záměr mluvčího.21 Zkoumají se tak například funkce tzv.diskurzních částic, což jsou prostředky, které umožňují vrozhovoru udržovat kontakt mezi mluvčími (např.angl. you know nebo české víte) ajsou vkorpusech snadno vyhledatelné. Výzkum též dokládá, že užívání diskurzních částic přispívá ke zvýšení plynulosti mluveného projevu azvyšuje jeho přirozenost. Zhlediska funkčního se značkují například korpusy zabývající se výzkumem specifických textových žánrů aútvarů. Existují např.korpusy 21 Jeden zpříkladů pragmatické anotace korpusu je nástroj DART, více viz např. Weisser, M. (2018) How to Do Corpus Pragmatics on Pragmatically Annotated Data Speech acts and beyond. Studies in Corpus Linguistics: John Benjamins.
32 korpusy v jazykovém vyučování abstraktů (tj.krátkých shrnutí akademického textu). Vnich jsou identifikovány aoznačkovány příslušné rétorické kroky (např.zasazení tématu do kontextu, stanovení cíle studieatp.), následně pak mohou být tyto rétorické postupy zkorpusu extrahovány aje možné zkoumat, jakými jazykovými prostředky jsou realizovány. Žákovský jazyk se zde znovu obvykle srovnává sjazykem rodilých mluvčích, ale provádějí se isrovnání mezi různými vědeckými obory ve snaze zefektivnit tento typ psané komunikace. Studium pragmatiky ukazuje, že žák cizího jazyka musí kromě gramatiky aslovní zásoby ovládnout ipravidla komunikace, která jsou běžná pro sociokulturní prostředí, vněmž se tento jazyk používá. Nejde jen oto, aby žák dosáhl svého komunikačního cíle, ale také aby svým jazykovým projevem neporušoval běžné (např.zdvořilostní) normy adokázal pro svá sdělení volit prostředky, které odpovídají konkrétní situaci, vníž se komunikace odehrává. Jakkoliv je tato oblast důležitá pro výzkum ivýuku, korpusové studie vtéto oblasti jsou zatím omezené. 2.3.6. Plynulost Snástupem korpusů zachycujících mluvený jazyk, jež jsou sohledem na nutnost nahrát apřepsat texty náročnější na sestavení než korpusy psané, se korpusově začínají zkoumat icharakteristiky řeči. Jednou ztakových oblastí je výzkum plynulosti. Plynulost je obtížně definovatelný pojem, pod kterým si však nejsnáze představíme produkci řeči vdostatečném tempu abez velkého množství prvků, které bezprostředně nesouvisejí svýznamem sdělení, jako jsou např.různé projevy váhání. Tempo mluvy lze vkorpusech měřit pouze tehdy, pokud jsou dostupné ipůvodní nahrávky. Uvádí se obvykle ve slovech za minutu či slabikách za vteřinu. Upokročilých studentů angličtiny zjišťujeme průměrné tempo mluvy asi 150 slov za minutu, urodilých mluvčích pak více než 180 slov za minutu. Mezi jevy, které tzv.narušují plynulost projevu, se řadí kupříkladu vyplněné anevyplněné (tiché) pauzy (např.byl jsem eh unavený), opakované segmenty (např.nevím co se co se přesně stalo), nedokončené segmenty (např.byl jsem šel jsem tam pěšky), opravy (např.vzala mě nás na výlet), fragmentovaná slova (např.to nemu nemuselo být) aprodlužování slabik (např.řekl mi žeee). Také tyto jevy se vkorpusech značkují. Pak je možné zjistit nejen jejich frekvenci, ale ito, na jakém místě se vpromluvě vyskytují. Jedním zrozdílů mezi žákovským jazykem ajazykem rodilého mluvčího je to, že žáci častěji umísťují tyto prvky mezi jednotlivé části frází, které rodilí mluvčí zpravidla vyřknou najednou (např.velký eh význam má). Vypovídá to zřejmě otom, že rodilí mluvčí jsou schopni rychleji plánovat promluvu aprodukují tak delší celky azároveň váhají spíše na jejich začátcích než vjejich průběhu.
seznámení skorpusy akorpusovou lingvistikou 33 Všechny tyto prvky lze srovnávat na různých úrovních pokročilosti ataké mezi žáky arodilými mluvčími. Zkoumat lze ito, jaký efekt má na plynulost ajejí součásti typ úlohy, který žáci řešili (např.šlo -li omonolog, dialog, projev spředchozí přípravou, popis obrázkuatp.). Tento výzkum pak krom studia pokročilosti arozdílů mezi žákovským arodilým jazykem přispívá ikpoznání, jakým způsobem je produkována řeč. Vdidaktice má tento výzkum význam především pro oblast testování, neboť poskytuje popis ukazatelů charakteristických pro plynulost projevu, což se uústních jazykových zkoušek nezřídka hodnotí azároveň je ijedním zparametrů popisovaných Společným evropským referenčním rámcem. Vtéto kapitole jsme se pokusili nastínit, co jsou akviziční korpusy ajak se využívají při výzkumu žákovského jazyka za účelem jeho poznání anavržení možných didaktických postupů. Akviziční korpusy umožňují zkoumat žákovský jazyk zrůzných pohledů, srovnávat, jak se mění na jednotlivých úrovních pokročilosti ajaké jazykové prostředky aprojevy tyto úrovně charakterizují. Dále umožňují srovnávání sjazykem rodilých mluvčích jako přirozeným cílem velké části žáků cizích jazyků avneposlední řadě poskytují iempiricky ověřená zjištění využitelná při tvorbě jazykových materiálů (učebnic, slovníků, aplikací), jazykových testů adidaktických postupů. Jakkoliv je žákovská korpusová lingvistika oborem mladým, přinesl již výzkum ve všech těchto oblastech cenné výsledky apředevším prokazuje, že akviziční korpusy mají velký výzkumný ipedagogický potenciál, zněhož mohou čerpat nejen badatelé, ale iučitelé, studenti atvůrci jazykových testů asylabů.
34 korpusy v jazykovém vyučování 3. Významné parametry korpusů Ukorpusů obecných se předpokládá, že směřují knaplnění určitých závazných parametrů. Jde zejména ovelikost avyváženost korpusu aoautentičnost jazykových dat, která korpus zahrnuje. Uvedené tři parametry zajišťují jeho reprezentativnost ve vztahu knormálnímu, obvyklému jazykovému úzu. Dalším důležitým parametrem je soustavné zaznamenávání informací opůvodu jednotlivých složek (textů), které jsou vněm zařazeny, ojejich autorech, žánru adalších údajů relevantních pro práci skorpusem. Tyto metatextové informace jsou přiřazeny všem strukturním jednotkám korpusu formou strukturních atributů. Kuvedeným parametrům přistupuje lingvistické značkování (lingvistická anotace), tj.připojování lingvistické interpretace kjednotlivým tokenům (výskytům, textovým pozicím) formou pozičních značek. Každé slovo tedy mívá přidělený základní slovníkový tvar adále značku, obvykle smorfologickými či méně často se syntaktickými informacemi. Korpusy speciální se vyznačují tím, že některý či některé ztěchto parametrů porušují, nenaplňují, případně ve snaze ojejich naplnění postupují specifickým způsobem, některé parametry rozšiřují (strukturní atributy, lingvistické značkování)apod.22 3.1. Velikost Obecné korpusy usilují omaximální možnou velikost. Čím větší objem jazykového materiálu zahrnují, tím větší je pravděpodobnost, že odrážejí reálný jazykový úzus aže budou využitelné iujevů méně frekventovaných. Větší velikost rovněž umožňuje, aby byly vkorpusu zahrnuty všechny relevantní variety daného jazyka vodpovídajících proporcích, tedy aby byl vyvážený aaby bylo možné považovat ho za reprezentativní vůči normálnímu, ob22 Ktematice obecných korpusů akorpusové lingvistiky podrobněji např.Mc Enery - Hardie (2012), kakvizičním korpusům, zvl. pro češtinu, Šebesta (2010), Šebesta - Škodová (2012), Štindlová (2011), kaktuálním datům onabídce korpusů pro češtinu akorpusů žákovských https://wiki.korpus.cz/doku.php/cnk:uvod, resp. Learner corpora around the world; ztěchto zdrojů tato iprvní kapitola převážně čerpají.
seznámení skorpusy akorpusovou lingvistikou 35 vyklému užívání jazyka. Díky tomu mohou tyto korpusy dobře sloužit pro tvorbu slovníků, gramatik, thesaurů adalších referenčních knih. Velikost synchronních korpusů vposledních desetiletích rychle roste. Zatímco vpočátcích korpusové lingvistiky, v60. a70. letech minulého století, se velikost korpusů uváděla vmilionech tokenů (konkrétní výskyt každého slovního tvaru vtextu),23 udnešních korpusů se uvádí vmiliardách. Např.Český národní korpus jako zastřešující projekt zajišťující budování korpusů českého jazyka na Univerzitě Karlově zahrnuje kdatu vzniku tohoto textu relativně nově český synchronní korpus SYN verze 6 ovelikosti cca4 miliardy slov, patří tedy mezi tzv.korpusy velké (pohybující se vřádu stovek milionů až vmiliardách textových slov). Vedle toho rozlišujeme dnes ještě korpusy střední (obsahující řádově desítky milionů textových slov) akorpusy malé (pohybující se vřádu stovek tisíc textových slov). Isebevětší korpus je ovšem menší než web– největší existující avolně dostupný soubor textů. Iweb lze využívat jako korpus; byla vyvinuta rozhraní, která kvyužití webu jako korpusu slouží– např.WebCorp.24 Web jako korpus má některá specifika, která se mohou jevit jako výhody, nebo nevýhody, vzávislosti na cíli, který při vyhledávání sledujeme. Většinou je nepochybnou výhodou webu jako korpusu jeho velikost. Některé výrazy či kolokace, které jsou málo frekventované, mohou vobyčejném korpusu úplně chybět nebo mít jen mizivé zastoupení, totéž platí ioněkterých druzích málo frekventovaných pravopisných či jiných formálních odchylek či variant, málo frekventovaných typů užitíapod., které na webu– vzhledem kjeho velikosti– můžeme najít svyšší úspěšností než vkorpusu. Hlavním problémem webu jako korpusu je skutečnost, že nám podává jazykový materiál vnerozlišené směsi textů různých typů, není tedy možné posoudit ani jeho skladbu, ani kontext užití hledaných jevů. To se může jevit jako značná potíž např.vpřípadech, kdy hledáme velmi frekventované jazykové jevy apotřebujeme počet nalezených řádků redukovat podle nějakých lingvisticky relevantních kritérií. Dalším problémem je nestálost webu– web se neustále aprůběžně mění, výzkum, který na něm byl založen, tedy není možné replikovat nebo jen velmi obtížně. Výhodou standardního obecného korpusu ve srovnání swebem je tedy jeho promyšlené složení zrůzných typů textů vnáležitých proporcích, větší nebo menší míra jeho vyváženosti, jeho relativní ustálenost azaznamenávání metatextových informací. Žákovské korpusy se co do velikosti od korpusů obecných výrazně liší, přesněji řečeno, jsou vtomto ohledu podstatně pestřejší. Žákovské korpusy 23 Už zmiňovaný Brown Corpus obsahoval jeden milion slov, stejnou velikost měl irovněž zmiňovaný korpus britské angličtiny LOB corpus. 24 http://www.webcorp.org.uk/live/
36 korpusy v jazykovém vyučování sobjemem několika (desítek) milionů textových slov najdeme vsoučasnosti pouze uangličtiny jako cizího jazyka. Dosud největší známý korpus je Chung‑ dahm Corpus, tvořený eseji, které napsali korejští studenti angličtiny na Chungdahm institutu, národním řetězci škol anglického jazyka, achybově anotovaný tutory. Eseje jsou uloženy jako stále doplňovaná databáze, nikoli korpus; ztéto databáze byl vyčleněn pro výzkumné účely velký objem dat jako Chungdahm Corpus ovelikosti přibližně 131 milionů slov (přesněji 130 754 tisíc slov) ve více než 860 esejích oprůměrné délce 152 slov (Han et al. 2010). Korpus této velikosti je však iuangličtiny spíše výjimkou. Co do velikosti následují The Cambridge Learner Corpus obsahující cca50 milionů textových slov (také ten je založen na esejích napsaných vrámci zkoušek angličtiny) aHKUST (The Hong Kong University of Science & Technology Learner Corpus) ovelikosti cca25 milionů slov. Ostatní korpusy angličtiny ikorpusy dalších jazyků se pohybují vpodstatně nižších hodnotách– jen výjimečně dosahují hodnoty 2 milionů slov nebo ji překračují. Mezi velikostně nejmenšími uváděnými korpusy jsou např.The Pilot Ara‑ bic Learner Corpus, korpus arabštiny užívané mluvčími angličtiny jako prvního jazyka, obsahující psané vyprávěcí texty mírně pokročilých apokročilých studentů arabštiny ocelkovém rozsahu 9 000 slov, nebo The PIKUST, korpus slovinštiny jako cizího jazyka, který obsahuje texty psané mluvčími 18 různých prvních jazyků, většinou chorvatštiny, srbštiny aruštiny, ocelkovém rozsahu 35 tisíc textových slov. Velikost žákovských korpusů sice postupně roste, podobně jako velikost korpusů obecných, ale podstatně nižším tempem. Menší objem žákovských korpusů je dán obtížností sběru dat afinanční ičasovou náročností jejich přepisu adalšího zpracování. První problém je spojen se skutečností, že je objem řečové produkce nerodilých mluvčích neporovnatelně menší než objem dat produkovaných mluvčími rodilými. Navíc se jedná oprodukci obtížně dostupnou– pokud jde např.opísemné práce psané pro školu, disponuje jimi škola anemusí je pro potřeby korpusu zpřístupnit. Umluvených projevů se sběry setkávají spodobnými problémy jako sběry pro mluvené korpusy jazyka rodilých mluvčích, jen stím rozdílem, že projev nerodilého mluvčího bývá mnohonásobně kratší než projev rodilého mluvčího acelkový objem mluvených projevů nerodilých mluvčích je rovněž neporovnatelně menší. Kobtížnostem sběru přistupuje fakt, že projevy nerodilých mluvčích se sbírají vpodobě nahrávek mluvených projevů nebo vpodobě rukopisů, vobou případech se tedy musí texty přepisovat. Zatímco umluvených projevů lze dnes, jde -li okvalitní nahrávky standardní mluvy, využít automatického přepisu, unerodilých mluvčích jde většinou onestandardní jazyková data, která automatické zpracování vdobré kvalitě neumožňují, přepisuje se tedy manuálně, příp.se automatický přepis následně upravuje.
seznámení skorpusy akorpusovou lingvistikou 37 Je příznačné, že větších velikostí dosahují ty žákovské korpusy, které se mohou opřít ospolupráci se školami nebo které jsou přímo sjejich činností spojeny– srov. výše uvedený Chungdahm Corpus, zpracovávající produkci žáků řetězce škol Chungdahm, Cambridge Learner Corpus, rovněž obsahující produkci žáků při zkouškách, nebo HKUST, obsahující písemné práce vzniklé vrámci maturitních zkoušek zangličtiny. Totéž platí iovětších žákovských korpusech mluvených, jako je např.mluvená složka korpusu BICCEL (Bilingual Corpus of Chinese English Learners), která vychází znahrávek při národním testu mluvené angličtiny, korpus NICT JLE (Japanese Lear‑ ner English), také čerpající ztestů mluvené angličtiny, nebo korpus SWECCL (Spoken and Written English Corpus of Chinese Learners). České žákovské korpusy řady CZESL patří svou velikostí vporovnání sjinými jazyky kromě angličtiny, která má vtomto ohledu mimořádné postavení, ke korpusům standardním, či spíše větším. Pro badatelské ipedagogické účely se zkorpusů této řady nejspíše nabízí automaticky emendovaný, anotovaný (také chybově) alemmatizovaný korpus CZESL ‑SGT. Zahrnuje 8617 textů od 1965 různých autorů (to znamená, že od jednoho autora jsou vkorpusu zařazeny vprůměru zhruba čtyři texty). Objem jazykových dat činí 1148 tisíc tokenů (pozic), ztoho 958 tisíc slov a111 tisíc vět. Druhým korpusem téže řady sprovedenou emendací, anotací alemmatizací je CZESL ‑MAN; od CZESL ‑SGT se liší tím, že byl emendován manuálně achybová anotace byla provedena poloautomaticky svysokým podílem manuálního zpracování. Manuální emendace aanotace je spolehlivější než emendace aanotace automatická, ale také je časově výrazně náročnější. CZESL ‑MAN je proto zatím podstatně menší než korpus CZSL ‑SGT (obsahuje cca124 tisíc slov) anení volně přístupný. 3.2. Vyváženost Vyváženost obecných korpusů je vlastnost, oniž se tvůrci korpusů vnějaké míře snaží, míra jejího dosažení záleží ale na tom, jaká kritéria zvolí ajak se vyrovnají sobtížemi, které jsou stím spojeny. Vzhledem kvelmi variabilním možnostem využití korpusů není možné vyváženost korpusu opírat ovnitřní, lingvistická hlediska, ale okritéria vnější. Obecné korpusy vČeském národním korpusu se opíraly zpočátku ozřetel krecepci– ty typy textů, které byly častěji čteny větším počtem mluvčích daného jazyka, byly vkorpusu zastoupeny ve větší proporci než typy textů, které se četly méně. Struktura typů textů aproporce jejich zastoupení vsynchronních korpusech současné psané češtiny byly tedy zpočátku stanoveny na základě výzkumů čtenářské recepce. Vprvním korpusu řady SYN, SYN2000, tvořila většinu (dvě třetiny) textů publicistika, přibližně čtvrtinu texty odborné, zbytek texty imaginativní
38 korpusy v jazykovém vyučování (beletrie, především próza). Vkorpusu SYN2005 se tyto proporce na základě nových výzkumů recepce změnily– publicistika představovala pouze 1/3 velikosti korpusu, odborná literatura 27%, podíl beletrie vzrostl na 40%; podobné proporce byly zvoleny pro korpus SYN2010. Korpus SYN2015 toto rozdělení opustil, tři textové makrotypy (publicistika, odborná literatura abeletrie) jsou vněm zastoupeny rovným dílem. Všechny uvedené korpusy (včetně korpusu SYN2015) se pokládají za reprezentativní vtom smyslu, že zahrnují co nejširší spektrum různých typů veřejných psaných (tištěných) komunikátů, které jako celek reprezentují současnou psanou češtinu, nezachycují ji však vproporcích odpovídajících přesně jazykové populaci.25 Vřadě SYN byly kromě toho zveřejněny rovněž korpusy české publicistiky (SYN2006PUB, SYN2009PUB, SYN2013PUB), které reprezentativní ve vztahu kobecnému jazykovému úzu nejsou (zahrnují pouze texty zoblasti publicistiky). Zatím poslední korpus SYN verze 6 zahrnuje všechny starší synchronní psané korpusy řady SYN včetně korpusů české publicistiky ataké nový publicistický materiál, vzhledem kvelké převaze publicistické složky ho tedy rovněž nelze označit za vyvážený areprezentativní. Vyváženost (ataké velikost) asnimi spojená reprezentativnost se řeší samostatně adosahuje jiných hodnot ukorpusů psaného akorpusů mluveného jazyka. Materiál pro psané korpusy se snáze získává (pro korpusy řady SYN získává tvůrce naprostou většinu materiálu, přibližně 90%, přímo velektronické podobě od nakladatelů avydavatelů na základě smluv), zatímco získat materiál pro mluvené korpusy je obtížnější (data se sbírají formou audio či videonahrávek; větší podíl má běžná mluva) anáročné je ijeho další zpracování, především přepis. Proto se umluvených korpusů pohybujeme vobjemech podstatně nižších. Pro češtinu je zatím největším mluveným korpusem ORAL, zahrnující dřívější korpusy řady ORAL (ORAL2006, ORAL2008, ORAL2013) apřepisy nových nahrávek (ORAL ‑Z). Přepisy nahrávek převážně neformálních rozhovorů, které ho tvoří, mají celkový objem 5,4 milionu textových slov, vporovnání se stamilionovými objemy psaných korpusů tedy podstatně menší. Korpus také není vyvážený zteritoriálního hlediska (podíl rozhovorů zČech je vyšší). Vyvážený co do relevantních sociologických kritérií (pohlaví, věk, vzdělání, oblast pobytu vdětství) aztohoto hlediska reprezentativní je nejnovější mluvený korpus češtiny ORTOFON oobjemu 1 milion textových slov. Svyvážeností volně souvisí ivolba komponent, znichž se korpus skládá; někdejší Brown Corpus adalší korpusy jím vtomto ohledu inspirované (Lancaster ‑Oslo ‑Bergen Corpus, British National Corpus) se skládaly ze vzorků textů ostandardním rozsahu (Brown Corpus např.obsahoval 500 vzorků 25 http://wiki.korpus.cz/doku.php/cnk:syn2015
seznámení skorpusy akorpusovou lingvistikou 39 textů o2000 slovech). Soudobé korpusy, včetně obecných korpusů ČNK, se skládají zcelých textů. Lze říci, že reprezentativnost korpusu ve vztahu kběžnému, normálnímu jazykovému úzu je hodnota, kníž obecné korpusy snahou ovelikost avyváženost směřují, ikdyž jí nikdy plně nedosahují. Při práci skorpusem ovšem sledujeme často jen určitou specifickou oblast jazyka ajeho užívání, posuzujeme tedy přirozeně ireprezentativnost příslušného korpusu zhlediska jeho výzkumného cíle apodle populace textů, na niž je náš výzkum zaměřen. Užákovských korpusů ovyváženost ve smyslu úplného aproporcionálního zastoupení jednotlivých variet jazyka nerodilých mluvčích neusilujeme. Je to dáno tím, že ucizího jazyka, jeho osvojování aužívání se setkáváme sneporovnatelně vyšší variabilitou než ujazyka prvního atato variabilita je vázána na mimořádně vysoký počet významných proměnných, které při výzkumu ipři výuce potřebujeme brát vúvahu. Přinejmenším za současných technických podmínek apři současné velikosti žákovských korpusů není možné uvažovat ovyváženosti jakéhokoli žákovského korpusu ve vztahu kcelé populaci. Není to ani cílem jejich tvůrců. Hlavním cílem žákovských korpusů vtomto směru je umožnit studium variability žákovského jazyka (mezijazyka) ajeho užívání astudium vztahu této variability kco největšímu počtu sledovaných apečlivě zaznamenávaných proměnných. Při práci sžákovským korpusem tedy neočekáváme, že reprezentuje mezijazyk nerodilých mluvčích jako celek, to není dost dobře možné, ale že spolehlivě zaznamenává aumožňuje studovat užívání některé jeho variety ve vztahu kco největšímu počtu faktorů. Při posuzování kvality žákovského korpusu tak přihlížíme nejen kjeho velikosti, ale ktomu, zda obsahuje tu varietu mezijazyka žáků, která nás zajímá, ataké ktomu, kolik faktorů (akteré) ovlivňujících její užívání zaznamenává ajak podrobně. Nejčastěji to bývá první jazyk žáků (např.čeština žáků sprvním jazykem čínským) aúroveň ovládání cílového jazyka (zřídka jde ozačátečníky, častěji omírně pokročilé nebo pokročilé), téma (blízké, známé, citově zabarvené vs. vzdálené, neznámé, citově neutrální), žánr, způsob sběruapod. Korpusy řady CZESL26 byly budovány se snahou získat jazyková data vtakové skladbě, aby vnich byly zastoupeny všechny úrovně ovládání jazyka, od začátečníků po pokročilé, aaby vrepertoáru prvních jazyků studentů byly dostatečně zastoupeny tři jejich skupiny: jazyky slovanské, indoevropské neslovanské ajazyky neindoevropské, češtině vzdálené. Jednotlivé úrovně ovládání jazyka (podle SERR) askupiny prvních jazyků nejsou vtěchto korpusech zastoupeny rovnoměrně, korpusy tedy nejsou ztěchto 26 CZESL ‑PLAIN, CZESL ‑SGT, CZESL ‑MAN.
46 korpusy v jazykovém vyučování šel emendací manuální anávazně semiautomatickou anotací, rovněž včetně anotace chybové. Při hledání vkorpusu CZESL ‑SGT můžeme vyjít způvodního tvaru (word, kněmu je vázáno lemma, tag; ktypům vyhledávání vizdále) nebo ztvaru emendovaného (word1, lemma1, tag1), můžeme hledat typy chyb (err)apod. Zadáme -li např.word132 slova miluje, zobrazí se nám na pozici word jak užité tvary standardní, tak itvary chybové (míluje, milujút). Je potřeba upozornit, že uautomatické emendace aanotace musíme počítat snepřesnostmi aomyly, ato jak ve vlastní emendaci, tak vanotaci. Pokud jsme si toho ale vědomi, může nám korpus CZESL ‑SGT posloužit jako mimořádně bohatý zdroj dat pro výzkum ivýuku. 32 Viz dále.
seznámení skorpusy akorpusovou lingvistikou 47 4. Práce skorpusem Vnásledující kapitole se seznámíme sněkolika korpusy češtiny ase základními způsoby vyhledávání vnich. 4.1. Český národní korpus (ČNK) 4.1.1. Materiál/Obsah Český národní korpus je projekt, který má za úkol vytváření dílčích korpusů češtiny. Obsahuje především korpusy psaného jazyka, ale také několik korpusů mluvené češtiny. Vsouhrnu se jedná onejobsáhlejší jazykový materiál, který je pro češtinu zpracován. Psané korpusy lze dělit na korpusy synchronní, které dokládají současný jazykový úzus, akorpusy diachronní, které zachycují jazyk vjeho vývoji. Nezanedbatelný je také mnohojazyčný paralelní korpus InterCorp, který nabízí zarovnané texty (překlady textů) ztéměř 40 jazyků. Kompletní přehled všech dostupných korpusů vč. jejich charakteristiky najdete na webu Českého národního korpusu.33 Pro výuku žáků sOMJ jsou relevantní především reprezentativní korpusy současné češtiny, např.SYN2015, nebo akviziční korpusy, např.žákovský korpus CZESL. Vzávislosti na cíli výuky apo zvážení jazykového původu žáků lze využít také texty paralelního korpusu InterCorp. 4.1.2. Vyhledávač neboli korpusový manažer ČNK využívá korpusový manažer KonText, dostupný zwebové stránky ČNK www.korpus.cz. KonText je umístěn vhorním menu vlevo. Lze jej využívat ibez registrace, po bezplatném zaregistrování je ale kdispozici více funkcí. 33 https://wiki.korpus.cz/doku.php/cnk:uvod
48 korpusy v jazykovém vyučování Obrázek 1: Úvodní stránka manažeru KonText 4.1.3. Vyhledávání Před vyhledáváním je třeba si ujasnit základní parametry, které ovlivňují jeho výsledek. Jedná se ovolbu korpusu, výběr typu dotazu, zadání dotazu, příp.specifikaci kontextu aomezení hledání. První tři jmenované kategorie jsou klíčové anelze je vynechat. Na volbě těchto tří kategorií také přímo závisí výsledek korpusové analýzy. Poslední dvě kategorie jsou fakultativní aumožňují přesnější zadání dotazu. Obrázek 2: Zadání dotazu vKonTextu
seznámení skorpusy akorpusovou lingvistikou 49 4.1.4. Volba korpusu Vprvní řadě je třeba zvolit korpus, vněmž bude hledání probíhat. Výběrem pole spřednastaveným korpusem se otevře tabulka se štítky, podle nichž lze vkorpusech hledat. Pro lepší přehlednost je možné se orientovat podle seznamu korpusů na encyklopedii wiki.34 Každý ze štítků pod sebou skrývá nabídku všech relevantních korpusů, znichž si lze následně vybrat ten nejvhodnější. Obrázek 3: Výběr zdrojového korpusu 4.1.5. Typ dotazu Před zadáním vlastního dotazu je třeba vybrat jeho typ. Přednastavený je základní typ dotazu. Jedná se ointuitivní způsob zadání dotazu. Pokud je do pole dotazu zadáno slovo vzákladním tvaru (upodstatných jmen první pád jednotného čísla, usloves infinitiv, upřídavných jmen nestupňovaný tvar mužského roduapod.), zobrazí se výsledky obsahující všechny tvary hledaného slova (od slova mladý doklady obsahující všechny slovní tvary– mla‑ dými, mladým, mladéhoapod.). Pokud vzákladním typu dotazu zadáme konkrétní slovní tvar (např.mladými), budou výsledky analýzy zahrnovat pouze texty obsahující tento slovní tvar. Vzákladním dotazu lze zadávat islovní spojení, přičemž platí stejná pravidla jako ujednoslovných zadání. Usousloví vkonkrétním tvaru (např.svelkou pravděpodobností) budou výsledky obsahovat texty stímto konkrétním tvarem. Pro vyhledání všech tvarů sousloví je třeba zadat jeho komponenty vzákladním tvaru, tj.např.pro spojení svelkou pravděpodobností zadáme dotaz ve tvaru svelký pravděpodobnost. 34 https://wiki.korpus.cz/doku.php/cnk:uvod
50 korpusy v jazykovém vyučování Výsledky pak obsahují sousloví svelkou pravděpodobností, světší pravděpo‑ dobností, snejvětší pravděpodobností. Využití základního typu dotazu je tedy vhodné pro jednodušší dotazy adoporučuje se pro korpusové začátečníky. Jeho nevýhodou je, že nemůže obsahovat tzv.regulární znaky, tj.znaky mající zástupnou funkci (více oregulárních znacích obsahuje wiki35). Druhým typem dotazu je lemma. Do pole dotazu se zadává základní tvar slova ave výsledcích se zobrazují všechny tvary zvoleného slova. Výhodou dotazu typu lemma je, že umožňuje doplnit dotaz ospecifikaci slovního druhu, atím uněkterých slov zamezit vysoké chybovosti zdůvodu homonymie. Příkladem může být slovo stát, které včeštině existuje jako podstatné jméno isloveso. Třetím typem dotazu je fráze. Při volbě fráze se do pole dotazu zadává slovní spojení vkonkrétním tvaru, které je pak také vtémže tvaru zobrazeno ve výsledcích analýzy. Čtvrtým typem dotazu je slovní tvar. Do pole dotazu se zadává konkrétní slovní tvar, který je pak zobrazen ve výsledcích. Pokud je při tomto typu zadán neutrální slovní tvar (např.infinitiv), je na rozdíl od základního typu dotazu ve výsledcích zobrazen jen infinitiv, nikoli další slovní tvary. Slovní tvar je možné upřesnit volbou slovního druhu (např.mezi– předložka vs. podstatné jméno v6. pádě jednotného čísla). Utypů dotazů lemma aslovní tvar je na rozdíl od základního typu dotazu možné volit slovní druhy, atím eliminovat tvarovou homonymii. Předposledním nabízeným typem dotazu je část slova. Umožňuje vyhledat slovní tvary, které obsahují zadaný řetězec znaků, azahrnout do dotazu též regulární (tj.zástupné) znaky. Řetězcem znaků je myšlen pouhý sled znaků/písmen bez nároku na morfologické dělení (kořen slova, předpony, příponyatd.). Hledáme -li tedy pomocí tohoto typu dotazu slova spředponou před‑, bude ve výsledcích analýzy zobrazen též slovesný tvar přede od slovesa příst. Posledním typem dotazu je CQL (= corpus query language), což je dotazovací jazyk umožňující komplikovanější vyhledávání. Více kpráci sCQL najdete na wiki.36 Pro jednoduchou arychlou orientaci vrozdílech mezi typy dotazů slouží nápověda ve formě modrého pole sotazníkem, která uživateli poskytne rychlou charakteristiku zvoleného typu dotazu. 35 https://wiki.korpus.cz/doku.php/kurz:regularni_vyrazy 36 https://wiki.korpus.cz/doku.php/kurz:pokrocile_dotazy
seznámení skorpusy akorpusovou lingvistikou 51 Obrázek 4: Volba typu dotazu 4.1.6. Zadání dotazu Po výběru typu dotazu je třeba dotaz formulovat. Vzávislosti na vybraném typu dotazu lze zadat základní nebo konkrétní slovní tvar, příp.použít vdotazu regulární znaky. Po výběru některých typů dotazů je zpřístupněno doplňkové okno umožňující definovat slovní druh. Uníže uvedeného příkladu je hledáno sloveso stát ve všech jeho tvarech (je tedy vyloučena homonymie spodstatným jménem stát). Obrázek 5: Zadání dotazu aspecifikace slovního druhu
52 korpusy v jazykovém vyučování 4.1.7. Specifikace kontextu Oddíl specifikace kontextu se využívá tehdy, pokud uživatel potřebuje ovlivnit kontext vyhledávaného výrazu nad rámec možností, které mu poskytuje zadání dotazu. Využívá se tehdy, pokud hledané slovo chceme vjeho nejbližším okolí rozšířit odalší slovo/slova, příp.pokud chceme další slovo/slova vokolí zvyhledávání vyloučit. Zadávat lze jak konkrétní slova/slovní tvary, tak kategorie slovních druhů. Specifikace kontextu také slouží tam, kde je třeba vyhledat víceslovné spojení, jehož komponenty nestojí pevně za sebou (ktomu slouží typ dotazu fráze). Po volbě specifikace kontextu se zadávací tabulka rozšíří oněkolik částí. Voddílu Filtrovat podle lemmatu je třeba nejprve určit, jaký kontext má být do vyhledávání zahrnut. Kontext se určuje vtokenech (jeden token = zjednodušeně jeden slovní tvar na daném místě), jejichž počet si uživatel volí vtabulce. Před údajem kpočtu tokenů uživatel vybírá, zda se počet zahrnutých tokenů týká jen části textu před hledaným slovem, tj.vlevo, nebo po hledaném slově, tj.vpravo, nebo na obě strany od hledaného slova, tj.vlevo ivpravo. Je možné zadávat slova vjejich základních tvarech, tj.lemmatech. Pole Lemma(ta) umožňuje vepsat jedno nebo více slov. Vtabulce na konci řádku je třeba vybrat, zda mají být zadaná slova obsažena všechna vzadaném kontextu, nebo zda může být vybráno kterékoli ze zadaných slov, příp.zda nemá být vybráno žádné. Při zadání jednoho slova znamená výběr všechny akteroukoli totéž. Uzadání všechna se ve výsledcích hledání zobrazí všechny úryvky textů, které obsahují hledaný výraz (vpoli Dotaz) azároveň také všechna zadaná slova vrámci nastaveného kontextu. Jako příklad uveďme podstatné jméno telefon zadané vpoli Dotaz, kněmuž jsou ve specifikaci kontextu uvedeny atributy chytrý amobilní. Výsledky pak budou zobrazovat jen ty úryvky textů, které obsahují všechna tři slova, tj.chytrý, mobilní, telefon. Uzadání kteroukoli se ve výsledcích hledání zobrazí všechny úryvky textů, které obsahují hledaný výraz (vpoli Dotaz) azároveň vždy alespoň jedno ze zadaných slov, ve výše uvedeném příkladu to tedy budou úryvky obsahující slovní spojení chytrý telefon amobilní telefon. Uzadání žádnou se ve výsledcích hledání zobrazí všechny úryvky textů, které obsahují hledaný výraz (vpoli Dotaz) azároveň neobsahují ani jedno ze zadaných slov, obsahují tedy telefon, ale nikoli chytrý ani mobilní. Volba žádnou má tedy funkci negativního filtru, jímž definujeme, sjakými slovy se slovo zadané vdotazu nemá vyskytovat. Voddílu Slovní druh se postupuje při zadávání stejně jako voddílu Fil‑ trovat podle lemmatu, jen stím rozdílem, že se nevypisují konkrétní slova vzákladním tvaru, ale volí se jen slovní druh/druhy jako kategorie.
seznámení skorpusy akorpusovou lingvistikou 53 Obrázek 6: Specifikace kontextu 4.1.8. Omezení hledání Pokud se uživatel rozhodne, že nechce vyhledávat vcelém zvoleném korpusu, může své vyhledávání omezit. Texty jsou vkorpusu tříděny podle různých kritérií (podle textového druhu, žánru, typu média, pohlaví autoraapod.) ana základě těchto kritérií lze vybrat skupiny textů, které budou zanalýzy vyloučeny. Obrázek 7: Omezení hledání
54 korpusy v jazykovém vyučování Po vyplnění úvodní zadávací tabulky (ne všechny oddíly je třeba vždy vyplnit) azvolení tlačítka Hledat se spustí analýza. 4.1.9. Výsledky hledání Vnásledujícím textu bude popsána výsledková tabulka amožnosti dalšího zpracování zobrazených výsledků. Pro zde použité vzorové vyhledávání byl zvolen výchozí korpus SYN2015, typ dotazu Lemma, dotaz stát se specifikací slovního druhu sloveso. Ve výsledkové tabulce je zobrazeno shrnutí zadání dotazu apočet nalezených výsledků, tj.počet textů, vnichž se objevil slovní tvar odpovídající zadání. Kromě absolutního počtu výskytů slovního tvaru je uváděn také údaj i.p.m., což je relativní frekvence přepočítaná na celkovou velikost korpusu. Pro kvantifikaci se jedná orelevantnější údaj, než je frekvence absolutní. Výsledková tabulka obsahuje několik základních částí. Každý řádek (konkordance) je úryvkem textu, vněmž se hledané slovo vyskytuje. Vkaždém řádku lze odlišit několik typů údajů, které napříč řádky tvoří sloupce. Zleva se jedná oikonu umožňující nahlédnout do syntaktické struktury zvolené věty. Následuje bibliografický údaj ozdrojovém textu, po jehož výběru se zobrazí kompletní bibliografické informace otextu. Nejdůležitější je střední část obrazovky, která nabízí úryvky textů svycentrovaným klíčovým/hledaným slovem (KWIC). Pokud je potřeba zobrazení delšího kontextu, je to umožněno kliknutím na vybrané klíčové slovo. Defaultní nastavení korpusu zobrazuje 40 konkordancí. Pro zobrazení dalších je třeba se přesunout na další stránku výsledků. Obrázek 8: Výsledky hledání Zobrazením výsledkové tabulky ale práce skorpusem nekončí/nemusí končit. Výsledky lze ještě třídit afiltrovat nebo vnich dále hledat. Všechny nástroje pro zpracování výsledků aovládání vyhledávání jsou knalezení vhorním menu. Vnásledujícím textu si představíme ty nejdůležitější znich.
seznámení skorpusy akorpusovou lingvistikou 55 Pomocí záložky Dotaz je možné vrátit se do úvodní zadávací tabulky azahájit tak nové hledání. Nabídka Předchozí dotazy zobrazí historii dosavadních dotazů (vrámci jednoho sezení) aumožní se vrátit ke starším vyhledáváním ajejich výsledkům. Vzáložce Korpusy– Dostupné korpusy je nabízen přehled všech korpusů ČNK, které je možné zvolit jako zdroje pro vyhledávání (obdobně vúvodní zadávací tabulce při volbě korpusu). ČNK umožňuje svým uživatelům vytvoření vlastních subkorpusů, tj.korpusů, které si uživatel definuje zdostupného textového materiálu ČNK sám. Pro vytvoření vlastního subkorpusu musí být relevantní důvod, protože výběrem textů do korpusu jsou významně ovlivněny výsledky hledání atím iinterpretace těchto výsledků. Pro vytvoření asprávu vlastních subkorpusů slouží nabídka Mé subkorpusy, Vytvořit vlastní subkorpus aVytvořit veřejný subkorpus. Vlastní subkorpus bude kdispozici jen danému uživateli, veřejný subkorpus lze nasdílet vybraným uživatelům, např.studentům ve třídě. Obrázek 9: Vytvoření vlastního subkorpusu Výsledky hledání lze uložit na vlastní zařízení, např.na disk počítače. Je tím umožněna práce sdaty ivrežimu offline. Ukládat lze vrůzných formátech, např.csv.xlsx.xml či.txt. Obrázek 10: Uložení výsledků hledání Svýsledky hledání, resp. jednotlivými konkordancemi, lze dále pracovat. Relevantní může být jejich promíchání (volba Promíchat) či výběr náhodného vzorku, jehož velikost určuje uživatel sám (volba Vzorek). Tuto volbu lze provést vpřípadech, kdy je počet nalezených konkordancí příliš vysoký na to, aby mohlo dojít kjeho manuálnímu zpracování.
62 korpusy v jazykovém vyučování riant vpsaném amluveném jazyce. Ostatní výsledky jsou roztříděné podle dalších kritérií ajsou knahlédnutí vzáložkách pod koláčovými grafy. Obrázek 24: SyD– výsledek vyhledávání porovnání tvarů bychom abysme Vzáložce Rozložení je možné nahlédnout do grafu znázorňujícího, vjakých textových typech ažánrech se zvolená varianta nachází. Po zvolení varianty 2 se graf přeskupí. Výsledky jsou opatřeny podrobným komentářem umožňujícím orientaci vproblematice interpretace těchto výsledků. Obrázek 25: SyD– typy textů Vnásledující záložce jsou graf týkající se psaného jazyka arozložení zvolených variant vtypech textů atextových žánrech zobrazeny podrobněji než vzáložce Rozložení. Pro ilustraci je vnásledujícím obrázku znázorněno rozložení podle žánrů.
seznámení skorpusy akorpusovou lingvistikou 63 Obrázek 26: SyD– rozložení podle žánrů Záložka pro mluvený jazyk nabízí jiné kategorie třídění, např.podle pohlaví avěku mluvčího, podle jeho vzdělání či nářeční příslušnosti. Obrázek 27: SyD– třídění podle pohlaví avěku
64 korpusy v jazykovém vyučování Obrázek 28: SyD– třídění podle nářeční příslušnosti Poslední záložka nabízí nejčastější kolokace koběma variantám. Izde jsou výsledky opatřeny doprovodným vysvětlujícím textem. Více informací kpráci saplikací SyD je knalezení ve wiki.39 Obrázek 29: SyD– kolokace 39 https://wiki.korpus.cz/doku.php/manualy:syd
seznámení skorpusy akorpusovou lingvistikou 65 4.2.2. Aplikace Morfio Aplikace Morfio je navržena tak, aby umožňovala odhalovat apozorovat slovotvorné pravidelnosti češtiny. Využívá korpusových dat kodhadování rozsahu aproduktivity slovotvorných modelů se zaměřením na odvozování. Vychází zpoznatků slovotvorby češtiny avyhledává dvojice (nebo vícečetné kombinace) slov, která se chovají stejně jako zadaný model. Ve výuce žáků sOMJ lze Morfio využít pro odhalování slovotvorných pravidel češtiny, pro uvědomění si jazykového systému aosvojení si nových slovotvorných postupů. Znalosti ze slovotvorby jsou při učení se každému jazyku mocným nástrojem pro rychlé obohacení slovní zásoby onová slova, ato na základě analogie, kterou slovotvorba disponuje. Vpřípadě slovotvorných produktů tak mluvíme opotenciální slovní zásobě, tj.slovní zásobě, kterou žák sice sám nikdy nepoužil ani se sní nesetkal, ale na základě znalosti slovotvorného pravidla dokáže slovo vytvořit apoužít. Práce sMorfiem tak představuje induktivní metodu výuky slovotvorby češtiny, která pracuje sjazykovým materiálem zábavnou formou. Východiskem práce sMorfiem je stanovení báze (základu slova) afor‑ mantů (částí slov, které podléhají změně). Při zadávání do vstupní tabulky lze využít jak kombinace písmen, tak regulárních znaků. Základem pro oba vzory může být tatáž konkrétní báze, např.škol‑, nebo báze libovolná, tvořená jen regulárními znaky.+, přičemž uživatel volí, zda tato báze, příp.zvolené formanty mají být stejné nebo odlišné pro oba vzory. Oběma vzorům lze přiřknout ještě zvolený slovní druh, je -li tento údaj relevantní (např.slovo končící na ‑í může příslušet krůzným slovním druhům, aproto lze slovní druh vybrat). Výběr slovního druhu se doporučuje především proto, aby se eliminovaly nežádoucí výsledky. Uněkterých bází dochází při spojení srůznými formanty ke změnám, snimiž Morfio počítá anazývá je alternace. Jedná se ozměny typu knih ‑aX kniž ‑ní; psá ‑t X psa ‑níapod. Důležité je, že ve vstupní tabulce není třeba vždy vyplňovat všechna zadávací pole, ale vždy jen taková, která jsou opodstatněná vzhledem kcíli analýzy. Východiskem je stanovení báze (základu slova) aformantů (částí slov, které podléhají změně). Základem slova škola (tj.bází) je škol‑, formantem je ‑a, přičemž ibez korpusu jsme sami schopni vytvořit další slova sjinými formanty od téže báze, např.školní, školský, školník, školeníapod. Díky Morfiu můžeme rychle odhalit, která slova jsou schopna stejné změny jako slovo vyhledávané. Drobnou nevýhodou aplikace Morfio je, že nedokáže rozeznat hranice morfémů (např.upředpony předjsou generována slova předevčírem, ale také předobrý).
66 korpusy v jazykovém vyučování Obrázek 30: Morfio Následující zadání umožňuje hledat dvojice slov, jejichž báze může být různá, ale která tvoří vždy dvojici, např.substantivum končící na ‑aatvořící adjektivum končící na ‑ní. Hledají se ave výsledcích se zobrazují lemmata. Alternace nebyly určeny. Obrázek 31: Morfio– zadání dotazu Výsledky analýzy se zobrazí ve formě několika záložek amohou mít různou míru využití pro různé účely. Každá zvýsledkových tabulek je opatřena doprovodným komentářem. Úvodní tabulka agraf představují souhrnné výsledky analýzy. Pro účely výuky se jeví nejvyužitelnější tabulka Výpis, nabízející nalezené páry, které jsou kandidáty na hledaný slovotvorný produkt (např.abeceda– abecední). Jednotlivé slovní tvary lze kliknutím aktivovat adostat se tak do korpusových textů, vnichž lze pozorovat konkrétní užití daného slovního tvaru.
seznámení skorpusy akorpusovou lingvistikou 67 Obrázek 32: Morfio– souhrnné výsledky Obrázek 33: Morfio– záložka Výpis 4.2.3. Aplikace KWords KWords je aplikace umožňující analýzu až 20 vybraných textů, např.stejného textového druhu či žánru, při níž probíhá porovnání těchto vložených textů sreferenčním korpusem. Při analýze jsou vtextu vyhledávána klíčová slova (měří se relativní frekvence každého slovního tvaru aporovnává se srelativní frekvencí téhož slovního tvaru vreferenčním korpusu, čímž lze získat seznam slovních tvarů, které jsou ve vybraných textech užity výrazně častěji alze onich uvažovat jako oklíčových, resp. majících spojitost sdaným textových druhem, resp. žánrem). Texty lze vsoučasné době nahrávat včeštině nebo angličtině. Pro relevantní výsledky je však dobré zvážit volbu vhodného referenčního korpusu, snímž budou vložené texty porovnávány. Nabídku referenčních korpusů lze nalézt na wiki.40 Pro výuku žáků sOMJ však není angličtina relevantní aznabízených českých korpusů doporučujeme využít přednastavený referenční korpus SYN2015. 40 https://wiki.korpus.cz/doku.php/manualy:kwords
68 korpusy v jazykovém vyučování Práce saplikací je intuitivní. Po otevření aplikace na webové stránce je třeba vyplnit zadávací tabulku. Klíčové je zadání vlastního textu. Analyzovaný text by měl mít od několika set do několika tisíc znaků aje možné ho vložit dvěma způsoby. Text (nebo ivíce textů) lze přímo kopírovat do připraveného okna, nebo lze vpřípadě vkládání více textů užít tzv.multianalýzy, při níž se do korpusu jednotlivé texty nahrají. Druhým klíčovým krokem je zvolení referenčního korpusu, tedy korpusu, snímž se vlastní nahrané texty budou porovnávat. Na výběr je několik referenčních korpusů. Pro analýzu současných textů doporučujeme využívat např.SYN2015. Před zahájením analýzy je vhodné zvážit, zda zní nevyloučit některé/všechny nabízené slovní druhy, které jsou většinou vysokofrekvenční amohou výsledky analýzy znehodnotit, např.předložky, zájmena, spojkyapod. Vyloučení zanalýzy lze provést vtzv.stop -listu. Vlastní analýza probíhá na základě statistických měr; je možné zvolit jednu ze statistických měr nebo obě dvě zároveň. Analýza začne probíhat po stisku příkazu Analyzovat vlevé dolní části stránky. Obrázek 34: KWords– Zahájení analýzy Výsledky analýzy se zobrazují několika způsoby. Vzáložce Text je zobrazen analyzovaný text avšechna nalezená signifikantní slova jsou zbarvena červeně. Text lze tedy pročítat asoustředit se přitom na vyhledané výrazy.
seznámení skorpusy akorpusovou lingvistikou 69 Obrázek 35: KWords– ukázka analýzy41 Výsledky analýzy jsou nabízeny také vjiných formách. Vzáložce Klíčová slova uživatel nalezne souhrnnou tabulku slovních tvarů vyhodnocených jako signifikantní pro zadaný text. Kromě seznamu je zde nabídnuta také hodnota statistické míry, podle které byl výpočet proveden, dále hodnota DIN, která uvádí míru relevance rozdílu mezi výskytem vzadaném textu avreferenčním korpusu (zde platí, že relevantní jsou slovní tvary shodnotou 75–100, přičemž čím je hodnota vyšší, tím je relevantnější). Uvygenerovaných slovních tvarů je také uvedena jejich frekvence vobou textových zdrojích. Obrázek 36: KWords– výsledek analýzy Další možností náhledu je distribuce zobrazující rozložení nalezených signifikantních slov vtextu aKeyword links, jenž zobrazuje vztahy mezi jednotlivými klíčovými slovy. Interpretace těchto dat je určena spíše pro odborníky azkušené korpusové uživatele, proto se těmto doplňkovým informacím nebudeme dále věnovat. Bližší popis pro zájemce lze nalézt na wiki. 41 Analyzovaný text pochází z: http://www.cesky -jazyk.cz/slohovky/pohadky/lez -ma -kratke- -nohy.html#axzz5IU96O5h7.
70 korpusy v jazykovém vyučování Poslední zřady je přehled konkordancí, tj.konkrétních míst vtextu vzobrazení KWIC. Po výběru konkordance se soupis rozšíří ovšechny konkordance svybraným slovním tvarem. Tento náhled je výhodný především proto, že shromáždí všechny výskyty vybraného slovního tvaru pod jednu konkordanci alze na něm, na rozdíl od náhledu lineárního textu, analyzovat chování vybraného slovního tvaru ve všech jeho výskytech najednou. Obrázek 37: KWords– přehled konkordancí Využití aplikace KWords ve výuce jazyka může být různorodé. Nabízí se možnost analýzy textových druhů ažánrů, na jejímž podkladu žáci samostatně vytvářejí vybraný textový druh či žánr. Zajímavou možností je analýza vlastních vytvořených textů atím reflexe vlastního idiolektu nebo porovnání textů stejného zadání od žáků sčeštinou jako mateřštinou ažáků sOMJ. 4.2.4. Aplikace Treq Aplikace Treq je databází překladových ekvivalentů. Protože je založena na textech paralelního korpusu InterCorp, funguje obousměrně pro jazykové páry čeština–cizí jazyk aangličtina–cizí jazyk. Cizí jazyky jsou zde nabízeny vrozsahu odpovídajícím jazykům zastoupeným vInterCorpu. Samotné vyhledávání probíhá vprvním kroku zvolením výchozího acílového jazyka. Vdruhém kroku musí být zvolen hledaný výraz. Vyhledávané slovo musí být slovo zjazyka označeného jako výchozí alze ho formulovat jako určitý slovní tvar, jako lemma, případně lze vyhledávat víceslovná spojení nebo užít při hledání regulárních výrazů či ignorovat malá avelká písmena (až na vyhledávání konkrétního slovního tvaru je uvšech výše jmenovaných potřeba danou kategorii zaškrtnout). Hledání lze provést ve všech textech InterCorpu nebo lze omezit zdrojové texty na beletristické jádro (texty ručně zkontrolované azarovnané) nebo některou zkolekcí (texty automaticky zarovnané). Výsledkem hledání je seznam překladových ekvivalentů. Proklikem jednotlivých ekvivalentů se uživatel dostane do korpusu InterCorp, který mu zobrazí zarovnané texty obsahující jak výraz jazyka výchozího, tak nabídnutý ekvivalent jazyka cílového.
seznámení skorpusy akorpusovou lingvistikou 71 Na těchto kontextech lze ověřit, zda zvolený ekvivalent odpovídá nárokům hledaného ekvivalentu. Své využití najde Treq především tam, kde se žáci učí pracovat scizojazyčnými ekvivalenty ajejich výběrem ataké se synonymy. Treq sice nelze označit za slovník, protože mu chybí celá řada nezbytných lexikografických informací, ale na rozdíl od běžného slovníku disponuje velkou výhodou, kterou je propojení sautentickými texty ve formě konkordancí obsahujících vyhledaný ekvivalent. Zkontextů tak lze mnohdy vyčíst stejné nebo ještě bohatší informace ovýznamové apragmatické stránce jazykového ekvivalentu než ze slovníku. Uživatel si užíváním Trequ cvičí nejen své jazykové znalosti, ale isvůj jazykový cit asenzibilizuje se na práci stextovým materiálem ajeho výpovědní hodnotou. Následující obrázky nabízejí náhled úvodní zadávací stránky aplikace Treq, stránky svýsledky (nabídkou překladových ekvivalentů) astránky zobrazující konkordance InterCorpu uzvoleného ekvivalentu. Více informací oaplikaci Treq je knalezení na stránkách wiki.42 Obrázek 38: Treq– zadávací tabulka Obrázek 39: Treq– výsledek frekvenční analýzy 42 https://wiki.korpus.cz/doku.php/manualy:treq
78 korpusy v jazykovém vyučování Pořadí Vše Substantiva Adjektiva Slovesa Předložky Spojky 80 místo vlas dětský trvat 81 při skupina osobní bát 82 začít důvod volný tvrdit 83 protože světlo slavný postavit 84 podle možnost skvělý existovat 85 jiný hráč pracovní vydat 86 každý kolo prázdný líbit 87 druhý byt široký připadat 88 myslet výsledek určitý napsat 89 tenhle klub střední uvidět 90 náš rameno nutný zapomenout 91 takový Petr moderní ptát 92 dítě syn oblíbený poznat 93 mezi metr dnešní napadnout 94 nějaký srdce ruský koupit 95 jejich systém čistý působit 96 přijít přítel rodinný otočit 97 život začátek úspěšný milovat 98 však krok hezký číst 99 dostat akce jednotlivý chápat 100 hlava policie krajský pustit Tabulka 1: Nejfrekventovanější slova vkorpusu SYN2015 5.2. Pracovní listy Následující ukázkové pracovní listy obsahují čtyři části. Na první straně naleznete anotaci apopsaný postup práce spracovním listem. Druhou stranu tvoří samotný pracovní list, který lze namnožit arozdat žákům. Po pracovním listu následuje popis práce skorpusem snázornými snímky obrazovky. Na konec je zařazeno řešení úkolů. Pracovní listy obsahují jak cvičení, která vyžadují přímou práci skorpusem během výuky (hands -on), tak cvičení, která jsou založená na jazykových datech zkorpusu, ale přímou práci skorpusem během výuky nevyžadují (hands -off). Pracovní listy mají sloužit jako inspirace pro tvorbu vlastních korpusových cvičení.43 43 Podobné pracovní listy naleznete také pod odkazem https://www.korpus.cz/proskoly.
využití korpusů ve výuce 79 5.2.1. Prostředí KonText Anotace Cvičení tohoto typu je vhodné zařadit do výuky, pokud dělá žákům problém rozlišovat význam podobných adjektiv aužívat je ve správných spojeních. Může jít jak oadjektiva, která mají jiný význam– zde např.zdravý azdra‑ votní, tak oadjektiva, která mají vněkterých kolokacích význam stejný, ale existují různá omezení– např.šedý ašedivý, kdy se některá substantiva mohou pojit jen sjedním adjektivem (šedá eminence). Cvičení také rozšiřují slovní zásobu. Pracovní list vyžaduje samostatnou práci skorpusovým rozhraním KonText aobsahuje tři úkoly, které vedou ktomu, aby si žák vhodné použití adjektiv osvojil sám pomocí vyhledávání typických kolokací, následně formulací pravidel jejich spojování se substantivy anakonec jejich použitím vtextu. Postup práce Před rozdáním pracovního listu je nutné žáky připravit na téma úkolů avhodně je motivovat kjejich vypracování. Vtomto případě může učitel sžáky mluvit otom, co sami dělají pro své zdraví ajaké existují zdravotní problémy. Kdiskuzi může využít předem připravený text, který bude obsahovat tematizovaná adjektiva, nebo jen otázku vnázvu pracovního listu. Po tomto úvodu učitel obrátí pozornost žáků kadjektivům zdravý azdra‑ votní azeptá se jich, jaký je vnich rozdíl akterá substantiva se snimi mohou pojit. Jako motivační prvek dobře slouží návodné obrázky (zdravé jídlo nebo tělesné aktivity X různá onemocnění, nemocniční personál). Odpovědi žáků lze zapisovat na tabuli formou myšlenkové mapy. Následně učitel rozdá žákům pracovní list. Ti pak splní první úkol dle schopnosti práce skorpusem sami, ve dvojicích nebo společně sučitelem. Před plněním je vhodné projít postup práce skorpusem. Žáci mohou první cvičení také dostat za domácí úkol. Vpřípadě, že žáci některým substantivům, která najdou, nerozumí, je třeba jejich význam osvětlit. Vhodné je využít předem připravené obrázky apříkladové věty. Příkladové věty mohou žáci sami najít kliknutím na pozitivní filtr (p/n) uvybraného substantiva vseznamu kolokátů, po kterém se jim objeví všechny věty sdaným adjektivem asubstantivem. Věty pocházejí zčeských textů, je třeba proto počítat stím, že mohou být pro žáky na nižší jazykové úrovni (asi do B2) nesrozumitelné amatoucí. Důležité je upozornit žáky také na gramatický rozdíl mezi měkkým adjektivem zdravotní atvrdým adjektivem zdravý. Tvary adjektiv si opět mohou ověřit kliknutím na pozitivní filtr udaného substantiva. Nalezené kolokace by během kontroly vždy měli číst se správnou koncovkou adjektiva (tj.zdravý rozum, zdravá výživa X zdravotní problém, zdravotní sestra).
80 korpusy v jazykovém vyučování Až si žáci najdou substantiva abude osvětlen jejich význam, měli by se sami nebo ve skupině pokusit zformulovat významovou definici. Mohou vymyslet příklady dalších kolokátů (některé jsou uvedeny včásti řešení). Druhý úkol žáci plní až po kontrole prvního. Opět je nutné, aby před začátkem práce rozuměli zadaným substantivům aaby adjektiva použili se správnou koncovkou. Třetí úkol mohou žáci plnit samostatně nebo ve dvojicích. Mohou soutěžit oto, který text bude nejvtipnější nebo ve kterém bude použito nejvíce spojení adjektiv asubstantiv. Učitel si může připravit začátek textu, na který budou žáci navazovat. Např.Když byla Klára malá, měla hodně zdravot‑ ních problémů. Kvůli nim často chyběla ve škole, atak ještě vdeseti letech neuměla dobře číst apsát… Texty poté mohou žáci přečíst vplénu nebo je učitel může vybrat aopravit. Texty si také žáci mohou opravit navzájem.
využití korpusů ve výuce 81 Pracovní list ZDRAVÝ ŽIVOTNÍ STYL = ŽÁDNÉ ZDRAVOTNÍ PROBLÉMY? 1. Najděte vkorpusu SYN2015 deset nejčastějších substantiv po adjektivech zdravý azdravotní. Potom vysvětlete, co znamenají akdy se používají. zdravý zdravotní 1. 2. 3. 4. 5. 6. 7. 8. 9. 10. 2. Co ještě může být zdravé aco zdravotní? Přiřaďte anapište ksubstantivům adjektivum se správnou koncovkou: handicap, holčička, noha, obtíž, prohlídka, zub zdravý: zdravotní:
82 korpusy v jazykovém vyučování 3. Napište krátký text, ve kterém použijete vždy alespoň třikrát adjektivum zdravý azdravotní. Ke každému adjektivu musíte použít jiné substantivum.
využití korpusů ve výuce 83 Postup práce skorpusem Postup 1 1. Vkorpusu SYN2015 zvolte Typ dotazu lemma ado okénka Dotaz napište hledané adjektivum (zdravý nebo zdravotní). Dále rozbalte možnost Spe‑ cifikovat kontext. Zde včásti Slovní druh zadejte Velikost kontextu vpravo 1 token. Jako slovní druh zvolte podstatné jméno. Tím najdete všechny věty, ve kterých bude hned vpravo vedle daného adjektiva podstatné jméno. Obrázek 41
84 korpusy v jazykovém vyučování 2. Až se vám zobrazí konkordance, vyberte možnost Kolokace, dále zvolte Vlastní. Jako Atribut si vyberte lemma, vkontextu od 0 do 1. Obrázek 42 3. Zobrazí se frekvenční seznam nejčastějších substantiv, která se pojí sdaným adjektivem astojí ve větě vždy hned vedle něj. Obrázek 43
využití korpusů ve výuce 85 Postup 2 1. Vkorpusu SYN2015 zvolte Typ dotazu lemma ado okénka Dotaz napište hledané adjektivum (zdravý nebo zdravotní). Obrázek 44 2. Až se vám zobrazí konkordance, vyberte možnost Kolokace, dále zvolte Vlastní. Jako Atribut si vyberte lemma, vkontextu od 0 do 3. Obrázek 45
86 korpusy v jazykovém vyučování 3. Zobrazí se vám frekvenční seznam nejčastějších slov následujících po daném adjektivu, ato až do třetí pozice od vlastního adjektiva. Protože jste na začátku nespecifikovali slovní druh, je třeba ze seznamu kolokátů ručně vybrat jen substantiva. Výhodou je, že najdete ikolokáty, které jsou dále od daného adjektiva (např.zdravý životní styl). Obrázek 46 4. Pokud chcete využít pozitivní filtr, klikněte na písmeno p ve sloupci filtr. Zde je příklad pozitivního filtru usubstantiva rozum vseznamu nejčastějších kolokátů adjektiva zdravý. Obrázek 47
využití korpusů ve výuce 87 Řešení: 1. Seznam deseti nejčastějších kolokátů zdravý první postup druhý postup rozum rozum výživa výživa strava styl stravování strava potravina potravina sebevědomí stravování jídlo jídlo jedinec jedinec životospráva sebevědomí bydlení bydlení zdravotní první postup druhý postup pojišťovna pojišťovna postižení postižení pojištění pojištění stav péče péče stav sestra sestra potíž potíž problém problém komplikace komplikace služba služba
94 korpusy v jazykovém vyučování Pracovní list DĚKUJU TI ZA DÁREK. DĚKUJI VÁM ZA POMOC. 1) Jak můžeme včeštině děkovat? 2) Co je typické pro psaní aco pro mluvení? Podívejte se do korpusu (https://syd.korpus.cz/). Pro psaní je typické: Pro mluvení je typické: 3) Doplňte do tabulky procenta zgrafů. varianta psaní mluvení děkuji děkuju 4) Zahrajte se spolužákem minidialog. Spolužákovi musíte vdialogu za něco poděkovat. 5) Napište krátký e ‑mail učiteli nebo učitelce. Ve ‑mailu musíte za něco poděkovat.
využití korpusů ve výuce 95 Postup práce skorpusem Do jednoho okénka aplikace SyD zadejte tvar děkuji, do druhého děkuju. Nechte zaškrtnuté políčko a=A(nezáleží na tom, jestli je první písmeno malé nebo velké), ale nezaškrtávejte políčko lemma (chcete hledat jen tyto konkrétní tvary slovesa). Klikněte na tlačítko Porovnat varianty. Zobrazí se vám tento výsledek: Obrázek 49 Řešení 1. děkuji, děkuju (děkuju/imoc, díky, dík, díkec, ď) 2. Pro psaní je typické děkuji. Pro mluvení je typické děkuju. 3. varianta psaní mluvení děkuji 64,12% 20,27% děkuju 35,88% 79,73% varianta psaní mluvení děkuji 64,12% 20,27% děkuju 35,88% 79,73%
96 korpusy v jazykovém vyučování 5.2.4. KWords Anotace Cvičení tohoto typu pomáhají žákům při psaní textů určitého žánru nebo zadání. Pomocí srovnání příslušných textů (zde charakteristik) avyváženého referenčního korpusu, který obsahuje texty všech žánrů, mohou žáci sami zjistit, která slova jsou pro dané texty typická. Tato slova poté mohou vědomě použít při psaní vlastního textu. Lze vytvořit také offline variantu, kdy si učitel klíčová slova najde předem ažákům je pouze prezentuje. Třetí úkol ztohoto pracovního listu by tak nevyžadoval práci skorpusem ve výuce, ostatní úkoly mohou žáci plnit stejným způsobem. Postup práce Pracovní list by měl být zařazen do výukového bloku, během kterého si mají žáci osvojit dovednosti potřebné kpsaní textu určitého žánru. Tento pracovní list je věnován charakteristice, lze jej ovšem obměnit pro potřeby jakéhokoliv jiného žánru. Než žáci začnou spracovním listem pracovat, měli by se seznámit stím, jak charakteristika vypadá. Na začátku výukového bloku může učitel pomocí brainstormingu zjistit, co si žáci pod pojmem charakteristika vybaví (úkol 1). Sami se mohou pokusit formulovat, co by měla dobrá charakteristika obsahovat ajak by měla být strukturována. Své domněnky by si poté měli ověřit na vhodně zvolené příkladové charakteristice, kterou by si měli přečíst aspolečně sučitelem okomentovat zhlediska použité slovní zásoby, struktury iobsahu (úkol 2).44 Práce skorpusem může být zařazena na toto místo pro zpestření ajako alternativní způsob nacházení klíčových slov typických pro daný žánr. Učitel by se žáků nejprve měl zeptat, která klíčová slova nacházejí vpříkladovém textu. Žáci by si je měli vyznačit apoté společně sučitelem diskutovat otom, zda to jsou opravdu slova typická pro daný žánr. Dále je možné využít vlastní práci skorpusem. Učitel si předem připraví soubor textů daného žánru, které následně sžáky zanalyzuje pomocí aplikace KWords. Textů musí být několik, aby obsahovaly dostatek materiálu pro analýzu. Ideální je rozsah několika set až několika tisíc slov. Příliš dlouhé texty analyzuje program moc dlouho.45 Při vkládání je nutné odstranit informaci, odkud byly texty zkopírovány, jinak by se názvy stránek pravděpodobně objevily mezi klíčovými slovy. Žáci mohou samozřejmě najít texty sami během hodiny, vtom případě je ovšem třeba počí44 Okomentované příklady textů různých žánrů, které mají být žáci schopni napsat během maturity zčeštiny, naleznete například na stránce http://www.statnimaturita -cestina.cz. 45 Vtomto pracovním listu byly použity texty ze stránek http://www.statnimaturita -cestina. cz/charakteristika ahttp://www.cesky -jazyk.cz/slohovky/charakteristiky/#axzz5IEYwRMn2.
využití korpusů ve výuce 97 tat svyšší časovou náročností. Výhodou je naopak to, že se žáci naučí hledat zdroje inspirace ataké budou během práce aktivnější. Alternativně může učitel shromáždit soubor prací žáků sčeštinou jako mateřštinou. Na žáky sOMJ může působit motivačně, že analyzují texty svých spolužáků. Analýzu mohou žáci provádět samostatně, jednodušší je ovšem práce vplénu. Výsledkem analýzy jsou texty sčerveně vyznačenými klíčovými slovy. Tato slova lze také zobrazit ve formě frekvenčního seznamu (vizpostup práce skorpusem). Žáci si mohou na výsledcích ověřit, zda se nalezená klíčová slova shodují sjejich představou oslovní zásobě typické pro daný žánr. Vklíčových slovech se nejspíš objeví slova ze skupiny vzhled, vlastnosti, zájmy, činnosti ajména. Pravděpodobně žáci naleznou také časová určení. Tato slova by měli shromažďovat do skupin aříct, proč se vcharakteristice objevují. Aplikace umožňuje také zobrazit, jak se jednotlivá klíčová slova propojují (vizpostup práce skorpusem). Na analýzu ainterpretaci výsledků by měla navázat vlastní produkce. Žáci by měli napsat vlastní charakteristiku apoužít např.deset klíčových slov, která nalezli.
98 korpusy v jazykovém vyučování Pracovní list 1. Co je typické pro žánr charakteristiky? Očem se vcharakteristi‑ kách nejčastěji píše? 2. Přečtěte si text charakteristiky. Najděte vní slova aobraty, které jsou pro charakteristiku typické. 3. Porovnejte vaplikaci KWords texty charakteristik sostatními texty. Najděte klíčová slova typická pro charakteristiku aseskupte je do skupin podle významu. Vymyslete pro každou skupinu název ado‑ plňte další příklady. např.vzhled: vlasy, nos, světlé 4. Napište vlastní charakteristiku apoužijte vní alespoň deset klí‑ čových slov.
využití korpusů ve výuce 99 Postup práce skorpusem 1. Vstupní text, který chcete analyzovat (vtomto případě texty charakteristik vrozsahu alespoň 500 slov), zkopírujte do příslušného políčka aplikace KWords, které se rozbalí, když myší najedete na ikonu Vložte text. Jako referenční korpus ponechte SYN2015. Pomocí stop -listu můžete zanalýzy vyloučit všechna nabízená slova (zájmena, předložky, spojky, čísla). Ponechte zaškrtnuté ignorovat velikost písma. Nakonec klikněte na Analyzovat. Obrázek 50 2. Zobrazí se vám analyzovaný text sčerveně vyznačenými klíčovými slovy, tedy se slovy, která se vanalyzovaném textu vyskytují relativně častěji než vtextech zreferenčního korpusu.46 Obrázek 51 46 Příklad je text ze stránky http://www.statnimaturita -cestina.cz/charakteristika.
100 korpusy v jazykovém vyučování 3. Pokud chcete zobrazit klíčová slova jako frekvenční seznam, klikněte na záložku Klíčová slova vhorní liště. Zobrazí se vám jednak seznam, jednak barevný graf. Obrázek 52 4. Pokud kliknete na záložku Keyword links, zobrazí se vám graf, který znázorňuje, jak jsou jednotlivá klíčová slova propojena, tedy vjakém kontextu se vyskytují. Obrázek 53
využití korpusů ve výuce 101 Řešení Výsledky úkolů 2 a3 závisí na zvolených vzorových textech. Vtextech zvolených pro výše uvedenou analýzu byla nalezena tato klíčová slova: štíra, vážím, zábavný, studuje, Libor, náladu, hraní, světlé, humor, inteligentní, kluk, znamení, nos, zájmy, narodil, modré, školu, úsměvem, úsměv, vlasy, li‑ dem, pokaždé, rád, nedávno, Tomáš, člověka, Petr, vždy, často, opravdu, patří, člověk, oči Vnašem případě je na prvním místě slovo štíra, které odkazuje na znamení. Ztoho lze usuzovat, že se vcharakteristikách často mluví oznamení daného člověka. Na prvním místě je proto, že názvy znamení nejsou tak typické pro texty ostatních žánrů. Dalším slovem je vážím, jelikož zadání vybraných charakteristik znělo Charakteristika člověka, kterého si vážím. Ostatní slova lze shromáždit do skupin, např.vlastnosti (zábavný, inteligentní, hu‑ mor), vzhled (světlé vlasy, nos) nebo časová určení (pokaždé, nedávno, často), která ukazují na to, že součástí charakteristiky bývá ivyprávění nějakého zážitku, který nás sdaným člověkem pojí. Skupiny lze samozřejmě rozšiřovat odalší příklady.
použitá literatura 103 Použitá literatura Cvrček, V. akol. (2010). Mluvnice současné češtiny. Praha: Karolinum. Čermák, F.– Schmiedtová, V. (2004): Český národní korpus– základní charakteristika aširší souvislosti. In: Národní knihovna, knihovnická revue 15, 2004, č.3., str.152–168. Čermák, F. (2011). Korpusy včera, dnes azítra. In: Korpusová lingvistika Praha 2011 2 Výzkum avýstavba korpusů (eds. F. Čermák akol.). Praha: Nakladatelství Lidové noviny. Český národní korpus– základní charakteristika aširší souvislosti. Národní knihovna, knihovnická revue, 15, 2004, č.3., str.152–168 Ellis, R. – Barkhuizen, G. (2005). Analysing Learner Language. Oxford: Oxford University Press. Granger, S. (2009). The contribution of learner corpora to second language acquisition and foreign language teaching: Acritical evaluation. In: Corpora and Language Teaching (ed. K. Aijmer). Amsterdam and Philadelphia: Benjamins, 2009, str.13–32. Han, N.-R. et al. (2010). Using an Error-Anotating Learner Corpus to Develop an ESL/ EFL Error Correction System. Dostupné online 13. 12. 2018: https://www.cs.rochester.edu/~tetreaul/han-lrec10-final.pdf McEnery, T. – Hardie, A. (2012). Corpus Linguistics. Method, Theory and Practice. Cambridge: Cambridge Universitřy Press. Sinclair, J. (Eagles, 1996). Preliminary recommendations on Corpus Typology. Dostupné zhttp://www.ilc.pi.cnr.it/EAGLES96/corpustyp/corpustyp.html. Slovník spisovného jazyka českého [online]. Dostupný zhttp://ssjc.ujc.cas.cz/ Šebesta, K. – Škodová, S. (2012). Čeština– cílový jazyk akorpusy. Liberec: Technická univerzita vLiberci. Šebesta, K. (2010). Korpusy češtiny aosvojování jazyka. In: Studie zaplikované lingvistiky / Studies in Applied Linguistics, 2, str.11–33. Štindlová, B. (2011). Žákovský korpus češtiny aevaluace jeho chybové anotace. Praha: FF UK. Šulc, M. (1999). Korpusová lingvistika. První vstup. Praha: Karolinum. Turton, N.D. and J.B. Heaton (1996). Longman Dictionary of Common Errors. Harwich: Longman. http://akces.ff.cuni.cz/ http://wiki.korpus.cz/doku.php/cnk:syn2015 https://wiki.korpus.cz/doku.php/cnk:uvod
110 korpusy v jazykovém vyučování king with the concordance listing and accompanying web apps, which are directly exploitable in work with students with different L1s, such as SyD, Morfio, KWords, and Treq. One of the book’s most interesting and useful aspects is the inclusion of sample practical worksheets. The authors have designed these to illustrate how corpus tools can be used for the development of teaching materials whilst bearing in mind the characteristic needs of the target group of students, i.e. the need of many of them to improve their knowledge of Czech in order to be able to succeed in the Czech educational system. The exercises include a variety of didactic approaches, and each worksheet is accompanied by a key which includes both the instructions for carrying out the task using one of the corpus tools and a possible solution. The book thus also offers highly practical concrete solutions for teachers who need to prepare language exercises to aid students’ progress in Czech as a second language.
Kateřina Šormová, Karel Šebesta a kol. Korpusy v jazykovém vyučování Vydala Univerzita Karlova, Filozofická fakulta, nám. Jana Palacha 2, Praha 1 Obrázky Marek Šorm Typografická osnova František Štorm Sazba zpísma Skolar Dušan Neumahr Vyrobila Togga, spol. s r. o., Praha Vydání první, Praha 2019
Tomáš Gráf Věra Hejhalová Barbora Kukrechtová Karel Šebesta Kateřina Šormová ISBN 978–80–7308–897–2 KORPUSY V JAZYKOVÉM VYUČOVÁNÍ / K. Šormová, K. Šebesta a kol. KORPUSY V JAZYKOVÉM VYUČOVÁNÍ Kateřina Šormová, Karel Šebesta a kol. práce filozofické fakulty univerzity karlovy Publikace Korpusy vjazykovém vyučování je určena učitelům, studentům učitelství idalším zájemcům ovyučování jazyka. Vprvní části se čtenář seznámí steoriemi osvojování jazyka ajazykovým výzkumem, jsou mu představeny nejznámější anejvětší korpusy angličtiny, češtiny avýběrově idalších jazyků sdůrazem na korpusy akviziční, zejména na projekt AKCES. Pozornost je zaměřena také na typy korpusů ajejich parametry, tedy velikost, vyváženost, autentičnost, strukturní apoziční atributy. Vdruhé části publikace je představena práce skorpusy Českého národního korpusu, vyhledávání pomocí rozhraní KonText apomocí aplikací SyD, Morfio, KWords, Treq aukázka zapojení frekvenční analýzy do jazykového vyučování. Poslední část publikace tvoří pracovní listy věnované využití korpusových dat v jazykovém vyučování. Součástí pracovních listů je ipodrobný popis metodického postupu ařešení zadaných cvičení.
Tomáš Gráf Věra Hejhalová Barbora Kukrechtová Karel Šebesta Kateřina Šormová ISBN 978–80–7308–897–2 KORPUSY V JAZYKOVÉM VYUČOVÁNÍ / K. Šormová, K. Šebesta a kol. KORPUSY V JAZYKOVÉM VYUČOVÁNÍ Kateřina Šormová, Karel Šebesta a kol. práce filozofické fakulty univerzity karlovy Publikace Korpusy vjazykovém vyučování je určena učitelům, studentům učitelství idalším zájemcům ovyučování jazyka. Vprvní části se čtenář seznámí steoriemi osvojování jazyka ajazykovým výzkumem, jsou mu představeny nejznámější anejvětší korpusy angličtiny, češtiny avýběrově idalších jazyků sdůrazem na korpusy akviziční, zejména na projekt AKCES. Pozornost je zaměřena také na typy korpusů ajejich parametry, tedy velikost, vyváženost, autentičnost, strukturní apoziční atributy. Vdruhé části publikace je představena práce skorpusy Českého národního korpusu, vyhledávání pomocí rozhraní KonText apomocí aplikací SyD, Morfio, KWords, Treq aukázka zapojení frekvenční analýzy do jazykového vyučování. Poslední část publikace tvoří pracovní listy věnované využití korpusových dat v jazykovém vyučování. Součástí pracovních listů je ipodrobný popis metodického postupu ařešení zadaných cvičení.