První česká monografie o žákovských korpusech
Abstract
98
Full text
98 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2013 PRVNí čESKá MONOGRAfIE OžáKOVSKýCH KORPUSECH Karel Kučera ŠEbESTA, Karel— ŠKODOVá, Svatava et al. (2012): Čeština— cílový jazyk akorpusy. Liberec: Technická univerzita vLiberci, 166 s.ISbN: 978-80-7372-848-9. Nedávno publikovaná monografie dvanácti autorů Čeština— cílový jazyk akorpusy sleduje tři hlavní cíle, ato seznámit českou učitelskou aodbornou veřejnost sobec‑ nou problematikou žákovských korpusů, představit první žákovský korpus češtiny CzeSL (Czech as aSecond Language), sjehož vznikem je většina autorů publikace spo‑ jena, anaznačit možnosti využití tohoto korpusu ve výzkumu ive výuce. CzeSL,1 je‑ hož koncepci avlastnostem je věnována podstatná část knihy, je při tomto pojetí mo‑ nografie představen komplexním způsobem, který umožňuje uživateli nebo jinému zájemci— specializovanému inespecializovanému— začlenit korpus do obecných historických, lingvistických adidaktických souvislostí avytvořit si strukturovanou představu ojeho parametrech iopovaze dat ametadat, která nabízí. Vzhledem kto‑ muto výrazně (zdaleka ne však výhradně) informativnímu zaměření monografie se tato recenze nevyhnutelně vyjadřuje nejen ktomu, jak se autorům podařilo korpus představit, ale do jisté míry ike korpusu samotnému. Obecný typologický ahistorický kontext, do něhož první žákovský korpus češtiny vstupuje, je přehledně vymezen vúvodních dvou kapitolách publikace, jejichž auto‑ rem je Karel Šebesta. Po stránce typologické je zde CzeSL charakterizován jako druh speciálního akvizičního korpusu (tj. korpusu orientovaného na úzus mluvčích, kteří si příslušný jazyk teprve osvojují, respektive ho neovládají na úrovni srovnatelné srodilými mluvčími odpovídajícího věku), ato jako korpus žákovský (ekvivalent roz‑ šířeného anglického označení learner corpus), tj. korpus zaměřený na užívání jazyka nerodilými mluvčími, atedy ina proces osvojování druhého/cizího jazyka, vdaném případě českého. Historického kontextu, vúvodních částech publikace naznačeného stručným přehledem historie budování akvizičních ažákovských korpusů, využívají autoři monografie vdalším textu jako pozadí pro podrobné parametrické ikoncepční srovnání korpusu CzeSL sexistujícími zahraničními korpusy.2 Je nepochybné, že CzeSL, vznikající od roku 2009, vtomto srovnání plně obstojí jak po stránce kvantitativní, tak po stránce koncepční. Rozsahem své první zveřej‑ 1 korpus CzeSl je pod názvem CzeSl-plain přístupný na stránkách Českého národního korpusu (<http://korpus.cz>), kde lze najít i jeho stručnou charakteristiku. Tato jeho zveřejněná verze má rozsah přibližně 2 000 000 slovních tvarů, z nichž zhruba 80 % připadá na projevy nerodilých mluvčích a 20 % na projevy romských dětí a mládeže. 2 Za počátek historie akvizičních korpusů se obvykle považuje rok 1983, v němž byly zahájeny práce na projektu CHIlDES, který dnes představuje vůbec největší existující soubor akvizičních korpusů. Počátky žákovských korpusů spadají do 90. let minulého století a jsou spojeny jednak se vznikem komerčních korpusů užívaných britskými nakladatelstvími při tvorbě příruček pro studenty angličtiny, jednak se vznikem nekomerčního korpusu IClE (International Corpus of learner English) na katolické univerzitě v lovani roku 1990.
KArEL KUčErA 99 něné verze (viz pozn.1) se CzeSL řadí knejvětším žákovským korpusům aje vtomto směru srovnatelný sodpovídajícími korpusy tak velkých jazyků, jako je francouz‑ ština, němčina nebo španělština.3 Zkvantitativního hlediska přitom CzeSL navíc vyniká irozsáhlým (vsoučasné době mezi žákovskými korpusy možná vůbec nej‑ rozsáhlejším) komplexem relevantních jazykových inejazykových informací při‑ pojovaných jak kjednotlivým slovním tvarům nebo ivětším úsekům textu, tak ke každému zkorpusových textů jako celku.4 Tomuto komplexu informací, který staví CzeSL na přední místo mezi žákovskými korpusy izkvalitativního hlediska, je vsouladu sjeho závažností věnována významná část monografie. Autoři vní představují především dva typy přidaných informací, které mají pro pedagogické ibadatelské využití žákovských korpusů zásadní význam, ato jednak informace, které se uplatňují přivnějším značkování textů, jednak stra‑ tifikované chybové informace, jimiž je obohacován přímo text. První typ informací je soustředěn do souboru 44 parametrů, znichž 4jsou spojeny stextem, 16se situací, vníž text vznikl, a24sosobností žáka (autora textu). Pro ilustraci lze uvést, že po‑ mocí parametrů spojených stextem se zaznamenává médium (mluvený text × rukopis × text psaný na počítači), převažující slohový postup (postup informační × popisný × vyprávěcí × úvahově‑argumentační), konkrétní téma atyp tématu (téma obecné × spe‑ ciální/odborné). Parametry spojené se situací vzniku textu zachycují například ito, zda pro text byl zadán rozsah či časový limit, zda text byl součástí zkoušky, zda bylo pro jeho vypracování povoleno užití slovníku, popř. jiných pomůcek atp. Problematika druhého typu přidaných informací, tj. problematika chybové anotace, je vzhledem ke své specifičnosti ivzhledem kmimořádnému významu, který má právě vžákovských korpusech, podrobně představena ve dvou nejrozsáhlejších kapitolách monografie. Vprvní znich, obecnější, se její autorka Barbora Štindlová věnuje okruhu problémů souvisejících spojmemjazyková chyba, který máklíčovou úlohu jak zširšího hlediska (vcelém empirickém studiu osvojování druhého jazyka), tak zejména zhle‑ diska užšího (ve studiu tzv. mezijazyka, svébytného přechodného systému zakládají‑ cího řečový projev žáka vdruhém/cizím jazyce). Vsouvislosti sžákovskými korpusy se pozornost vtéto kapitole soustřeďuje především na taxonomii chyb jako základ ja‑ kékoli systematické chybové anotace, dále na podstatu základních anotačních modelů (lineární anotace × víceúrovňová distanční anotace), najejich výhody inevýhody ana charakteristiku jejich konkrétních aplikací ve vybraných zahraničních korpusech. Toto obecnější srovnání ateoretické pozadí představuje vhodnou základnu pro bezpro‑ středně následující kapitolu, na níž se podílela šestice autorů (Vladimír Petkevič, Ale‑ xandr Rosen, Barbora Štindlová, Tomáš Jelínek, Milena Hnátková aPetr Jäger) akterá podává celkový obraz chybové taxonomie aanotace vkorpusu CzeSL. 3 vzhledem k širokému mezinárodnímu uplatnění angličtiny i vzhledem k délce anglické korpusové tradice nepřekvapí, že angličtina jako druhý/cizí jazyk se z takového kvantitativního mezinárodního srovnání vymyká. v současné době je zachycena v množství žákovských korpusů (resp. korpusových celků diferencovaných podle prvního jazyka žáků), z nichž největší mají rozsah přes 30 milionů slovních tvarů. 4 Zmíněná první zveřejněná verze CzeSL‑plain neobsahuje lingvistickou anotaci; texty smorfosyntaktickou a chybovou anotací budou zpřístupněny v jiném vyhledávacím rozhraní.
100 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2013 Jde okapitolu, která podle mého názoru zasluhuje dvojí ocenění, znichž jedno patří samotnému taxonomickému aanotačnímu systému adruhé jeho zasvěcené asoučasně přístupné prezentaci vmonografii. Taxonomii chyb ianotaci realizova‑ nou včeském žákovském korpusu koncipovali autoři tak, aby odrážela „specifické vlastnosti češtiny jako jazyka sbohatým flektivním podsystémem avolným slovosle‑ dem“ (s.62) asoučasně příliš nezatěžovala anotátory „teoretickými dilematy“ (s.64).5 Výsledkem je třírovinová anotace, vníž základní rovinu tvoří (přepsaný) původní text, kdežto první anotační rovina (vtextu označovaná jako R1) obsahuje emendaci izolovaných slovních tvarů, kterou lze provést bez ohledu na kontext (typicky jde opřepsání/překlepy achyby vpravopisu amorfologii), adruhá anotační rovina (R2) zahrnuje emendaci ostatních chyb, znichž nejčastější jsou chyby ve shodě, valenci aslovosledu. Vrámci roviny R1 je vyčleněno 10 konkrétních druhů chyb jako např.ne‑ správná flexe (např. užití spám místo spím), nesprávný slovní základ (posvětlit místo vysvětlit), neemendovatelné/„vymyšlené“ slovo (je tam hodně jinaků), slovo zcizího jazyka (jím rád eggs), obecněčeský tvar/podoba (dobrej), knižní/nářeční/slangový/hy‑ perkorektní tvar (shnědými očimi) atp. Na rovině R2 jde o13druhů chyb, knimž patří např. narušení shody (Petr vařím oběd), chyby vzájmenném odkazu (paní, jenž jsem potkal), vanalytickém tvaru (Jana bude dělá), vnegaci (mám žádný čas), chyba vužití gramatické kategorie (celé dopoledne uvařím oběd) aj. Na obou anotačních rovinách se přitom počítá svýskytem zbytkové kategorie „problémových chyb“, tj. chybných vyjádření, která nebude možno jednoznačně přiřadit kžádnému zexplicitně vyčle‑ něných druhů chyb. Jak už bylo řečeno, prezentace systému chybové taxonomie aanotace se vyznačuje zasvěceností asoučasně přístupností. Za zmínku stojí ještě jeden její sympatický rys, totiž realistické vědomí nemožnosti beze zbytku podchytit nepravidelnost apoten‑ cialitu přirozeného jazyka, která je vpřípadě žákovských textů navíc rozšířena ojen stěží předvídatelnou potencialitu chybování na straně žáka, popř. ina straně anotá‑ tora textu. Jistá střízlivost, která ztohoto vědomí vyplývá aza jejíž projev lze na ele‑ mentární úrovni považovat ivytvoření zmíněné zbytkové kategorie „problémových chyb“, ve skutečnosti prolíná celou koncepcí zvoleného anotačního schématu. Lze ji mimo jiné vysledovat ina úrovni nejvyšší, konkrétně vrealistické formulaci (ataké vpořadí) principů, na jejichž základě bylo toto výsledné anotační schéma vytvořeno: „Anotační schéma musí […] vyhovovat následujícím požadavkům: 1. schéma musí být zvladatelné pro anotátory, 2. taxonomie nemůže být příliš rozsáhlá, ale zároveň musí být dostatečně infor‑ mativní, tj. musí umožňovat dostatečně podrobné zachycení chyb, 3. taxonomie by měla umožňovat budoucí rozšiřování“ (s.62). 5 Tato zdánlivě přízemní zásada má ve skutečnosti klíčový význam a je nanejvýš vhodné, že ji autoři explicitně formulují. Spolehlivost závěrů veškerého výzkumu využívajícího anotace korpusu přirozeně záleží primárně na kvalitě a konzistentnosti anotace, a v případě manuálně anotovaných korpusů je proto třeba anotátory vybavit co nejjednoznačnějším (a v rámci možností i co nejjednodušším) anotačním schématem, které minimalizuje potřebu samostatného rozhodování v komplikovaných případech.
KArEL KUčErA 101 Příznačná je vtéto souvislosti skutečnost, že ipoté, co použitelnost anotačního sché‑ matu vytvořeného podle uvedených tří principů byla scelkově uspokojivými vý‑ sledky ověřena statistickými testy, autoři si zůstali vědomi jak potřeby dalšího zdo‑ konalování jednotlivých složek systému (zejména instrukcí vanotačním manuálu), tak hranic, které lze vsoučasné době sotva překročit: jak konstatují, „některé značky budou inadále do značné míry závislé na subjektivním dojmu anotátora avysokou míru shody mezi anotátory unich nelze očekávat“ (s.69). Součástí kapitoly věnované chybové taxonomii aanotaci vkorpusu CzeSL je iod‑ díl shrnující jednotlivé fáze zpracování textů. Celý proces začíná jejich přepisem do elektronické podoby auložením do databáze, pokračuje jejich konverzí amanuální opravouchyb spomocí editoru feat akončí kontrolou těchto manuálních oprav aau‑ tomatickými úpravami chybového značkování realizovanými sadou počítačových programů. Zásadou přitom je, že každý text je nezávisle zpracováván dvěma ano‑ tátory, jeho zpracování je kontrolováno nezávislým supervizorem azjištěné rozdíly vanotaci obou anotátorů odstraňuje další pracovník, tzv. adjudikátor. Celý proces od uložení textu do databáze až po kontrolu, adjudikaci anásledné zařazení do korpusu je řízen systémem Speed určeným pro správu přepsaných, zkonvertovaných aano‑ tovaných textů. Samostatná kapitola je vmonografii věnována problematice specifické složky korpusu CzeSL, kterou tvoří subkorpus ROMi. Jde osložku výjimečnou už tím, že se orientuje na projevy romské mládeže adětí žijících vČR, pro něž (na rozdíl od jino‑ jazyčných žáků, na které je zaměřen zbytek korpusu CzeSL) čeština zpravidla není druhým/cizím jazykem, čímž ROMi striktně vzato do jisté míry vybočuje zdefinice žákovských korpusů. Zařazení ROMi do žákovského korpusu CzeSL však přesto má své oprávnění, neboť běžná/většinová čeština sice není pro romské mluvčí druhým jazykem, ale vpravém slova smyslu není ani jejich jazykem prvním (tím je tzv. rom‑ ský etnolekt češtiny znatelně ovlivněný romštinou aslovenštinou). Toto mimořádné postavení romské češtiny spolu sfaktem, že velká část romských mluvčích „žije vso‑ ciokulturních podmínkách, které hraničí se sociálním vyloučením“ (s.109),6 pak stojí vpozadí dalších specifických rysů, kterými se vyznačuje jak sám korpus ROMi, tak jeho budování. Přestože jazyková data procházejí před zařazením do korpusu ROMi vzásadě stej‑ ným procesem, který byl výše stručně popsán vsouvislosti sprojevy jinojazyčných žáků osvojujících si češtinu jako druhý jazyk, bylo při sběru ipři zpracování těchto dat třeba hledat odpovědi na řadu nových otázek. Autorky kapitoly Zuzanna Bed‑ řichová aKateřina Šormová poskytují čtenáři základní vhled zejména do problémů spojených svýběrem respondentů (např. obavy potenciálních sběračů znařčení zdiskriminace; nemožnost přímo se dotazovat žáků na jejich romskou identitu atp.) asetickými aspekty sběru jazykového materiálu— například se skutečností, že texty se mnohdy týkají zážitků nebo situací, které jsou pro většinovou společnost vzdálené nebo těžko představitelné akteré by při určitém způsobu citace korpusových do‑ kladů mohly vést ke konstruování zkresleného obrazu dané skupiny mluvčích. Spe‑ 6 ke korpusu ROMi se proto v textu monografie odkazuje i obecněji jako ke korpusu mluvčích ohrožených sociálním vyloučením.
102 STUDIE ZAPLIKOVANÉ LINGVISTIKY 1/2013 cifické problémy se však objevily také vsouvislosti sezískáváním metadat (vzájmu co největší spontánnosti projevů se často ukázalo jako vhodné nebo ipotřebné ome‑ zit počet zaznamenávaných parametrů spojených sosobou respondenta aj.) avsou‑ vislosti spřepisem získaných textů (nesnáze spojené sobtížnou čitelností psaných textů asnízkou kvalitou nahrávek pořizovaných— opět vzájmu co největší spon‑ tánnosti projevu— vne zcela vhodném prostředí). Pragmatická řešení naznačených problémů vyústila vněkterá konkrétní opatření, jimiž se podařilo budování korpusu ROMi podstatně zefektivnit (např. získání individuálních sběračů jazykových dat zřad romských pedagogických asistentů nebo znevládních organizací spolupracují‑ cích sRomy). Vzhledem knaznačené zvýšené náročnosti práce na tomto korpusu je třeba zvlášť ohodnotit, že jeho materiálová základna (tj. souhrn jak psaných amluve‑ ných projevů již zpracovaných azveřejněných, tak projevů dosud nezpracovaných) svým rozsahem přes dva miliony slovních tvarů zhruba čtyřnásobně převýšila pů‑ vodní plán. Korpusu ROMi tak vrámci projektu CzeSL— ale imimo něj— přísluší významné místo nejen proto, že je prvním žákovským korpusem orientovaným na češtinu romských dětí amládeže, ale také proto, že se mezinašimi izahraničními žákovskými korpusy řadí knejvětším. Dodejme, že ROMi má ještě jeden pozoruhodný rys: na rozdíl od běžných žákovských korpusů vjeho materiálové základně výrazně převažují mluvené projevy (přibližně 1600000 slovních tvarů) nad texty psanými (přibližně 450000 slovních tvarů). Vedle pěti kapitol, které jsou věnovány výše naznačené celkové charakteristice korpusu CzeSL, chybové taxonomii, anotaci asubkorpusu ROMi, obsahuje recenzo‑ vaná monografie ještě tři kapitoly zaměřené pedagogicky. První znich, převážně te‑ oretická, zčásti navazuje na výklad kapitol ochybové taxonomii aanotaci (předkládá mj. ijednu zmožností elementární klasifikace morfologických tvarů na systémové, nesystémové adefektní), vcentru pozornosti jejího autora Milana Hrdličky však stojí především sám pojmem jazyková chyba (včetně jeho vztahu kpojmům jako jazyková správnost, norma, kodifikace aúzus) aproblematika práce sjazykovými chybami ve výuce cizího azčásti imateřského jazyka. Ostatní dvě kapitoly jsou zaměřeny vý‑ razněji aplikačně. Pavlína Vališová představuje vkapitole Využití korpusových dat při výuce češtiny jako cizího jazyka několik typů induktivních cvičení, která byla vytvořena na principu tzv. Data Driven Learning ajsou určena kposílení aktivní role žáka při studiu cizího jazyka (konkrétní ukázky těchto cvičení spočívají ve vyhledávání jazy‑ kových informací vsynchronních korpusech Českého národního korpusu). Kapitola Nástin využití žákovských korpusů pro jazykové vyučování, jejíž autorkou je Svatava Ško‑ dová, se zabývá zejména potenciálem alimity žákovských korpusů apodává stručný přehled dosavadních výsledků využívání žákovských korpusů vzahraničí. Lapidární konstatování, kněmuž autorka dospívá vzávěru kapitoly, lze podle mého názoru po‑ važovat za realistickou charakteristiku současného postavení žákovských korpusů astavu jejich využití vůbec: „Časné publikace týkající se výzkumu žákovských kor‑ pusů explicitně zdůrazňovaly jejich kladný potenciál pro jazykové vyučování […], ale přímé využití korpusů vhodinách cizích jazyků je neobvyklé adopad korpusové lingvistiky na sylaby nebo design materiálů je ive světovém kontextu minimální. Právě tyto oblasti se jeví jako jedny znejdůležitějších vnásledujícím bádání na poli aplikované lingvistiky opřené odata žákovských korpusů“ (s.138).
KArEL KUčErA 103 Celkově lze bez výhrad konstatovat, že monografie Čeština— cílový jazyk akorpusy splnila cíle, které si kolektiv jejích autorů vytkl, apředstavuje tak nejen koncepční auživatelskou charakteristiku korpusu CzeSL, ale ipřehledné asnadhledem zpra‑ cované uvedení do problematiky budování— azjisté části ivyužívání— žákovských korpusů vůbec. Vzhledem ktomu, že jde oprvní takto souborně zaměřenou mono‑ grafii unás asoučasně oprvní žákovský korpus orientovaný na český jazyk, nezbývá než si vnávaznosti na výše citovaná slova Svatavy Škodové přát, aby tato publikace našla své adresáty nejen mezi korpusovými lingvisty aodborníky zabývajícími se teorií výuky aosvojování druhého jazyka (popř. spisovné podoby jazyka prvního ve specifických případech typu romských žáků), ale především přímo mezi pedagogy ažáky, jimž korpus CzeSL nabízí nemalé možnosti využití při tvorbě učebních mate‑ riálů ipřímo ve výuce. Karel Kučera | Ústav Českého národního korpusu FFUK vPraze [email protected]