Práce s empirickými daty : příručka pro studenty Bc. studia ČJL
Full text
Práce sempirickými daty Příručka pro studenty Bc. studia ČJL Jan Chromý Grafická úprava Jan Šerých Sazba DTP Nakladatelství Karolinum Vydání první © Univerzita Karlova vPraze, 2014 © Jan Chromý, 2014 ISBN 978-80-246-2801-1 (online : pdf) Příručka vznikla vrámci projektu Rozvoj a inovace bakalářského studia českého jazyka vÚstavu českého jazyka a teorie komunikace FF UK vPraze (CZ.2.17/3.1.00/33275), který byl realizován vobdobí 2011–2013 za finanční podpory Operačního programu Praha Adaptabilita.
Univerzita Karlova v Praze Nakladatelství Karolinum 2014 http://www.cupress.cuni.cz
Obsah Úvod 7 1. Dotazník vempirickém výzkumu 10 1.1 Rozsah aformát dotazníku 10 1.2 Instrukce vdotazníku 11 1.3 Otázky vdotazníku 13 1.4 Předvýzkum apilotáž 16 1.5 Administrování dotazníků 18 1.6 Co dělat svybranými dotazníky? 20 2. Proměnné ajejich vztahy 22 2.1 Typy proměnných 22 2.2 Vztahy mezi proměnnými 25 2.3 Hypotézy 26 3. Koho či co zkoumáme? 28 3.1 Vzorek apopulace 28 3.2 Kvótní výběr 29 3.3 Náhodný výběr 30 3.4 Účelový výběr 31 4. Jak zjišťujeme vztahy mezi proměnnými? 33 4.1 Srovnávání statických skupin 34 4.2 Předběžné anásledné pozorování jedné skupiny 35 4.3 Klasický experiment 36 4.4 Následné pozorování na dvou skupinách 37 4.5 Reliabilita avalidita výzkumu 38 4.6 Longitudinální výzkum 40
5. Redukce azkreslení 42 5.1 Redukce prováděné ve výzkumu 42 5.2 Typy zkreslení zhlediska vztahu proměnných 44 5.3 Zkreslení zhlediska toho, co nezohledňujeme 46 6. Další pojmy 49 6.1 Indukce adedukce 49 6.2 Teorie, rámec, model 50 6.3 Výzkumná etika 51 7. Další nástroje sběru dat 54 7.1 Rozhovor jako nástroj sběru dat 54 7.2 Pozorování 56 7.3 Případová studie 59 8. Něco kstatistice 60 8.1 Deskriptivní statistika 60 8.2 Pravděpodobnost vinferenční statistice 65 8.3 Rozdělení dat 67 8.4 Jak zjišťovat pravděpodobnost? 72 Literatura 75
7 Tento text slouží primárně jako základní studijní materiál kpředmětu Práce sempirickými daty, vyučovanému vrámci odborného modulu bakalářského studia oboru Český jazyk aliteratura na Filozofické fakultě Univerzity Karlovy vPraze. Příručka pokrývá základní oblasti (především kvantitativně orientovaného) empirického bádání zaměřeného na jazyk ajeho užívání amohou ji tak využít idalší zájemci otento výzkumný směr. Základem textu je výklad ojednotlivých pojmech apřístupech empirického výzkumu. Rozsah příručky je relativně omezený aněkteré otázky tak budou zpracovány pouze obecně. Vtakových případech však budou čtenáři odkázáni na další, doplňkovou literaturu, zníž se otématu budou moci dozvědět více. Východiska Předkládaná příručka pochopitelně není prvním textem, který se věnuje problematice empirických metod – ať už v jejich obecnosti, anebo vrámci bádání o jazyce. Vevýkladu tak citujeme publikace, z nichž vycházíme, avšak pouze vpřípadě, že se jedná opoznatek, který jiné publikace neobsahují. Mezi práce, znichž vycházíme nejvíce akteré doporučuji čtenářské pozornosti, spadají následující tituly. Obecnou metodologii empirického výzkumu vsociálních vědách představuje kniha Miroslava Dismana Jak se vyrábí sociologická znalost (Disman, 2002). Tato publikace sice jednotlivé problémy ukazuje na sociologickém materiálu – většina poznatků je však přímo aplikovatelná ina výzkum lingvistický, přičemž její velkou výhodou je, že je psána včeštině. Druhou česky psanou příručkou, kterou lze Úvod
8 doporučit, je kniha Jana Volína Statistické metody ve fonetickém výzkumu (Volín, 2007). Jak název napovídá, jedná otext zaměřený nikoliv na empirický výzkum jako takový, ale primárně na jeho část analytickou, na kvantitativní vyhodnocení sebraných dat. Knih ostatistice je ivčeštině řada, právě Volínův text je však vhodné doporučit ztoho důvodu, že všechny statistické procedury ukotvuje na fonetickém materiálu, který by měl být studentům lingvistiky srozumitelný. Zanglicky psaných příruček je třeba vyzdvihnout práci Sebastiana Rasingera Quantitative Research in Linguistics: An Introduction (Rasinger, 2008). Tato publikace se vhrubých obrysech orientuje na tutéž problematiku jako práce Miroslava Dismana, její výhodu pro studenty lingvistiky však lze spatřovat vtom, že je založena na jazykovém materiálu. Zároveň je Rasingerova kniha doplněna onávody základních statistických výpočtů vprogramu Microsoft Excel, což je zvláště užitečné pro ty studenty, kteří nemají přístup kdrahým aplikacím pro statistickou analýzu, jako je například SPSS nebo Statistica, anebo se necítí být dostatečně schopní na relativně náročnou práci sprogramem R (Gries, 2013). Takto na úvod můžeme zmínit ještě dvě publikace, ato příručku Zoltána Dörnieye aTatsuyi Taguchiové Questionnaires in Second Language Research: Construction, Administration, and Processing (Dörniey – Taguchi, 2010) asborník Lii Litosselitiové Research Methods in Linguistics (Litosseliti, 2010). První uvedená publikace se velice podrobně zaměřuje na dotazníkový výzkum vlingvistickém výzkumu, konkrétně ve zkoumání osvojování druhého jazyka. Na závěr knihy je uveden ipraktický bodový seznam jednotlivých kroků, jež je třeba vdotazníkovém výzkumu udělat. Uvedený sborník zase základně představuje jednotlivé konkrétní metody empirických lingvistických analýz. Základní koncepce příručky Knihy, které jsme uváděli vpředchozím oddíle, ale idalší texty, které lze oempirických metodách (ať už vlingvistice nebo vjiných sociálních vědách) najít, postupují – logicky – od nejzákladnějších pojmů ktěm složitějším. Moje zkušenost zvýuky založené na tomto postupu však ukázala problémy spočívající v tom, že „nejzákladnější“ pojem nemusí být pro čtenáře, respektive studenty pojmem nejintuitivnějším. Je tak mnohem pravděpodobnější, že student bude schopen promyslet a pochopit koncepci dotazníku, než například rozdíl mezi nulovou apracovní hypotézou anebo rozdíl mezi jednotlivými typy proměnných.
9 Problém navíc tkví vtom, že jednotlivé základní pojmy je zpočátku třeba si prostě zapamatovat bez patřičného ukotvení, přičemž kpochopení toho, kčemu ty pojmy jsou aproč je nutné si je zapamatovat, dochází až omnoho stránek dál. Vtéto příručce se tak pokusíme opřístup odlišný. Začneme unejintuitivněji pochopitelných jevů apostupně budeme odkrývat pojmy asouvislosti další, méně intuitivní, avšak „základnější“. Pevně věřím, že tento přístup bude ku prospěchu věci astudenty od tohoto probíraného tématu neodradí. Cílem této příručky je vhrubých rysech nastínit základní aspekty empirického výzkumu v lingvistice. Pro úspěšnou realizaci vlastního výzkumu je však třeba zde získané poznatky ještě dále rozvíjet.
16 sdotazníky často tyto položky formulují jako výběr znabízených možností, jež představují určité intervaly (např. věk 20–25 let, 25–30 let atd.), to je však zbytečné. Je třeba mít na paměti, že mít přesnější představu okonkrétním věkovém rozložení se může vyplatit aže navíc tyto intervaly lze zdat, která získáte, dotvořit později, bude-li to třeba. Kromě uvedených typů otázek existují ještě otázky, které jsou specifické svým účelem. Na jedné straně jsou to takzvané kontrolní otázky, jež zjišťují, zda respondent odpovídá skutečně podle svého přesvědčení. Kontrolní otázka se ptá na stejnou věc, na jakou se již předtím tázala jiná otázka, ale jinými slovy. Pokud se zjistí, že se odpovědi na kontrolní otázku ana otázku předchozí liší, je na místě dotazník zvýzkumu vyřadit. Dalším příkladem specifického typu otázek jsou nepřímé otázky. Jejich princip tkví vtom, že se „ptáme oklikou“. Může jít například otzv. projekční otázky, prostřednictvím kterých se respondentů neptáme přímo na jejich názory či postoje, ale na mínění či postoje jiných osob či postav (např. kreslených postaviček vrámci určitého příběhu). Předpokladem je, že se respondent spředstavovanými osobami či postavami podvědomě ztotožní abude ověci vypovídat stejně, jako by v dané situaci byl sám. Posledním typem otázky, který zde uvedeme, je takzvaná dvouhlavňová otázka. Na rozdíl od všech otázek předtím však jde ootázku, jíž se vdotazníku musíme za každou cenu vyhnout. Jde totiž ootázku, která se ptá na dvě věci najednou – vpřípadě, že respondent má na dané dvě věci odlišný názor, nemůže na ni odpovědět. Například bychom se mohli zeptat: Jak často užíváte prostředky bysme abysem? běžně – často – málokdy – nikdy. Vpřípadě, že někdo užívá jednu zvariant zásadně častěji, je pro něj daná otázka nezodpověditelná. 1.4 Předvýzkum apilotáž Když máme sestavený dotazník, neznamená to, že můžeme rovnou začít svýzkumem. Přílišná horlivost by byla velmi kontraproduktivní amohla by vést ktomu, že náš výzkum bude provedený špatně. Ať už je váš dotazník sebejednodušší, musíte ho před samotným provedením sběru dat vyzkoušet.
17 Fázi, kdy zkoušíme, jestli daný nástroj pro sběr dat (nejenom dotazník, ale třeba iexperiment, strukturovaný rozhovor apod.) funguje tak, jak očekáváme, že by fungovat měl, se říká předvýzkum. Jinými slovy, cílem předvýzkumu je identifikovat problémy, které jsou spojeny sdaným nástrojem sběru dat. Provedení předvýzkumu není složité – prostě si výzkum ozkoušíte nanečisto. V případě dotazníkového zkoumání zkrátka rozdáte dotazník menšímu okruhu lidí apožádáte je ovyplnění. Následně snimi jejich vyplnění dotazníku proberete. Hlavním úkolem předvýzkumu (udotazníků) je zjistit: a) zda jsou otázky srozumitelné; b) zda respondent chápe otázky stejně jako badatel; c) zda je jasné, jak dotazník vyplňovat ajak/kde ho odevzdat (tj. zda jsou srozumitelné instrukce); d) jak dlouho vyplnění dotazníku trvá ajestli to není příliš namáhavé. Předvýzkum je zcela zásadní – ipokud předpokládáme, že je námi sestavený dotazník zcela bezproblémový, mohou nás respondenti něčím překvapit (avěřte, že nás taky překvapí). Blízko k pojmu předvýzkum má pojem pilotáž. V některých případech se můžete setkat stím, že jsou tyto pojmy volně zaměňovány, respektive používány synonymně. Jindy se však tyto pojmy rozlišují – pilotáž (nebo také pilotní studie) označuje provedení celého výzkumu na omezenější skupině lidí, na základě kterého se zjistí, jestli výzkum má smysl dělat vširším měřítku. Jinými slovy, zjistí se, jestli získané výsledky jsou nějakým způsobem zajímavé vzhledem ktomu, oco se ve výzkumu snažíme. Pokud nejsou, svýzkumem obvykle nepokračujeme, pokud jsou, má smysl výzkum rozšířit. Jinak řečeno, zatímco vpředvýzkumu ovýsledky jako takové nejde (neanalyzují se), ale jde pouze ootestování nástroje pro sběr dat, vpilotáži jsou výsledky klíčové, což má za následek, že pilotní studie může být vněkterých případech ipublikována. Děláme-li mezi předvýzkumem apilotáží rozdíl, pak navíc zprincipu platí, že pilotáž následuje až po předvýzkumu (viz např. Disman, 2000, kap. 6). Obecně řečeno, předvýzkum (resp. pilotáž) děláme proto, abychom si mohli být víceméně jisti tím, že vnásledném výzkumu budeme skutečně zkoumat to, co zkoumat chceme. Představme si ostatně, že ve výzkumu položíme otázku, které část respondentů bude rozumět jinak než vy jakožto badatelé. To způsobí, že výsledná data se zčásti nebudou vztahovat ke zkoumanému problému – my otom ale nebudeme vědět. To je problém, který se týká validity výzkumu. Výzkum je validní tehdy, když skutečně zkoumá to, co výzkumník deklaruje, že zkoumá. Je však důležité si uvědomit, že validita je mnohem spíše otázkou míry, než otázkou
18 ano – ne. Nikdy (zvláště vsociálních vědách, kam lingvistika spadá) si tak vpravém slova smyslu nemůžeme být jisti, že je náš výzkum zcela validní. Díky předvýzkumu však můžeme validitu našeho výzkumu posílit – můžeme totiž odstranit předtím netušené problémy, které ji snižují. Kproblému validity výzkumu se ještě vrátíme voddílu 5.5. 1.5 Administrování dotazníků Máme-li dotazník hotový aozkoušený zpředvýzkumu, můžeme ho začít rozdávat, tedy administrovat či distribuovat. Existuje více způsobů, jak tak činit akaždý znich má své výhody anevýhody, kterých je třeba si být vědom. Prvním ze způsobů administrace dotazníků je administrace skupině. To je patrně nejtypičtější způsob, jak dotazníky rozdávat. Je to poměrně jednoduché aefektivní: badatel (nebo jeho pomocníci) přijde do určitého auditoria atam rozdá (anásledně vybere) dotazníky. Náklady na výzkum (ať už časové či finanční) jsou relativně malé, protože je takto možné ve velmi krátkém čase získat velké množství dotazníků. Zároveň je vtomto případě poměrně přesvědčivá anonymita výzkumu, atedy i spolehlivost získaných výsledků. Největší problém tohoto způsobu administrace spočívá vtom, že jej není možné použít vždy. Je jasné, že takto můžeme udělat výzkum na studentech či na vojácích, případně na určitých zájmových skupinách, které se hromadně scházejí, ale představte si, že byste takto chtěli zkoumat například Moravany, kteří trvale žijí vPraze. To patrně nebude dost dobře proveditelné. Uadministrace skupině je vhodné upozornit ještě na jeden fenomén, typický pro české školní prostředí: Pokud rozdáte dotazník například na přednášce anebo při hodině na střední škole, mohou mít studenti tendenci od sebe opisovat, ato ivpřípadě, že se nejedná otest jejich znalostí, ale prostě ovýzkum toho, co si očem myslí. Druhým způsobem rozdávání dotazníků je administrace jeden na jednoho. Jedná se ozpůsob, který je časově (atedy ifinančně) náročnější než administrace skupině. Navíc si jistě dovedete představit, jak obtížné může být přinutit lidi ke spolupráci (vzpomeňte si, kolikrát vás na ulici chtěl někdo zastavit, jestli byste měli pár minut avyplnili dotazník). Má však isvé velké výhody. Vprvé řadě je to způsob, který je aplikovatelný takřka na jakékoliv množině lidí, kterou můžeme chtít zkoumat. Záro-
19 veň, administrace jeden na jednoho zaručuje silnější validitu, jelikož badatel nebo jeho pomocník může cokoliv dovysvětlit anemůže tak dojít knepochopení otázek. Pokud už navíc někoho přesvědčíte, aby vám dotazník vyplnil, pak to velice pravděpodobně učiní (tj. nenechá část dotazníku nevyplněnou), ato poměrně poctivě. Velkou výhodou tohoto způsobu sběru dat vrámci lingvistiky navíc je to, že badatel či jeho pomocník mohou odpovědi zapisovat sami. To se vyplácí zejména vdialektologických či sociolingvistických výzkumech, kde se odpovědi zapisují složitější (např. fonologickou) transkripcí, kterou neškolený respondent vůbec neovládá. Pochopitelně je to taky jediný způsob, jak pomocí dotazníků zkoumat negramotné či pologramotné jedince. Třetím typem dotazníkového sběru dat je administrace online, tedy prostřednictvím e-mailu či internetové stránky. Tento způsob administrace je vzhledem kdnešním technickým podmínkám poměrně často užívaný, je velmi efektivní ačasově ifinančně nenáročný. Mohlo by se zdát, že se jedná ozpůsob takřka ideální, ale vřadě výzkumů to tak není. Vprvé řadě je problém stím, jak oslovit lidi, které chceme zkoumat. Jestliže na ně nemáme přímý kontakt, je to velice komplikované. Navíc, pokud neposíláme dotazníky jako přílohu e-mailu, nemáme ani jistotu, kdo nám dotazníky vyplnil, což je závažný problém zhlediska stavby vzorku (viz kap. 4). Zejména vlingvistických výzkumech často potřebujeme, aby respondent vyplnil dotazník podle svého vlastního povědomí, ale dotazník administrovaný online nám nezaručuje, že si respondent například neotevřel slovník, nezjistil si otématu více informací atd. Zkrátka, jako způsob sběru dat je tento typ administrace krajně nespolehlivý aje lepší se mu vyhnout. Uchýlit se kněmu může mít smysl vpřípadech, když se potřebujeme dostat ke specifické skupině lidí, například krodičům dětí ve věku 2–3 roky. Ti se často znají navzájem amohou informaci odotazníku šířit mezi sebou (např. přes Facebook apod.) amůžeme tak získat relativně slušný počet dotazníků. Vpřípadě, že zkoumáme například porozumění slov udospělých jedinců, jedná se ozpůsob administrace vysloveně nefunkční. Dodejme, že pro administraci tohoto typu můžeme dnes využít řadu internetových stránek, na nichž si můžeme bezplatně vytvořit slušně vypadající dotazník (např. Google Forms). Posledním typem sběru dat vdotazníkovém výzkumu je administrace prostřednictvím pošty. Vdnešní době se tento způsob administrace užívá jen velmi omezeně, protože je poměrně nákladný azároveň je spojen srelativně nízkou návratností. Zároveň je pochopitelně nutné znát poš-
20 tovní adresy jedinců, které chceme do výzkumu zahrnout, což možnost využití tohoto typu sběru dat relativně limituje. Vkaždém případě, při uplatnění tohoto způsobu administrace je vhodné myslet na dvě věci. Vprvé řadě bychom respondentům měli poslat známku, aby nám mohli dotazník poslat zpět, aniž by to museli sami platit. Vdruhé řadě je dobré se zaměřit na zvýšení návratnosti. To můžeme udělat například tak, že vyhlásíme, že vylosovaní respondenti vyhrají určitou sumu peněz anebo nějaký lákavý dárkový předmět. To obvykle návratnost zvyšuje, na druhou stranu to však může způsobit vyšší finanční náročnost výzkumu. 1.6 Co dělat svybranými dotazníky? Aby bylo možné analyzovat výsledky dotazníků, je třeba zakódovat jednotlivé odpovědi. Ideální pro tyto účely je tabulkový procesor (např. Microsoft Excel či Open Office Calc). Důležité je přitom kódovat výsledky tak, abyste mohli zrekonstruovat, jak každý dotazník vypadal. Jinými slovy, je třeba, aby byl každý dotazník zákódován zvlášť. Konvenčně se data zaznamenávají tak, že na každém řádku je jeden dotazník ajednotlivé sloupce pak představují jednotlivé otázky. Zdůvodu přehlednosti abezproblémové analýzy je rovněž vhodné, aby způsob kódování byl co nejjednodušší. Pokud například používáte Lickertovu škálu achcete zjišťovat, jaká je průměrná odpověď, je důležité, abyste výsledky zakódovali číselně (tj. zcela souhlasím = 1, spíše souhlasím = 2 atd.). Číselně můžete kódovat i jiné výsledky, například odpovědi v rámci multiple-choice otázek – to však není nutné, principiálně postačí co nejjednodušší písmenné zkratky jednotlivých možností. Vpřípadě, že používáte možnost odpovědi „nevím“ (případně „nemám názor“ apod.), není vhodné používat nulu (jako číslo by se vám pak snadno mohla započítat do průměru adalších výpočtů). Poté, co výsledky zakódujete, je potřeba kódování ještě jednou zkontrolovat. To je pochopitelně práce velmi nevděčná, ato oto víc, že trvá obvykle déle než kódování samotné. Vězte však, že kontrola kódování by měla vašemu výzkumu prospět. Pokud je totiž váš výzkum rozumný askutečně odhaluje cosi zajímavého ve světě kolem nás, je pravděpodobné, že všechny špatně zakódované výsledky způsobují, že výzkum nevychází tak „hezky“ apřesvědčivě. Jinými slovy, můžeme předpokládat, že špatné zakódování výsledků jinak dobrého výzkumu se projevuje vtom, že je ve vašich datech více údajů, které jsou svaší teorií vnesouladu, než
21 by jich bylo, kdyby byly výsledky zakódovány správně. Při tak nevděčné práci, kterou kontrola kódování jistě je, se tak můžeme alespoň něčím utěšovat. Vdotazníkovém výzkumu je poměrně obvyklé, že narazíte na dotazníky, které byly vyplněny nesprávně (ipřesto, že jste si dali záležet na instrukcích audělali předvýzkum) anebo ve kterých nebyly některé povinné otázky zodpovězeny. Vtakovém případě je třeba být přísný apochybné dotazníky vyřazovat. Vněkterých případech můžeme zvážit, zda lze některý zúdajů doplnit. Například vjednom našem výzkumu bylo možné doplnit nevyplněnou položku „mateřský jazyk“ na základě toho, že vpoložce pro další jazyky, které respondent ovládal, byla uvedena angličtina, němčina, slovenština apolština, ale nikoliv čeština acelý dotazník byl česky. Ve většině případů však odpověď doplnit při nejlepší vůli nemůžeme. Poslední věc, kterou je třeba mít na paměti, je archivace dotazníků. Děláte-li výzkum, který poté publikujete (ať už jako odborný článek nebo například jako součást diplomové práce), měli byste být kdykoliv schopni doložit, že jste si svoje výsledky nevymysleli. Vpřípadě, že je dotazníků hodně, je vcelku pochopitelné, že je nechcete skladovat ve fyzické podobě – vhodné je proto sebrané dotazníky naskenovat aarchivovat elektronicky.
22 2. Proměnné ajejich vztahy Vpředchozí kapitole jsme si vhrubých rysech představili, jak vypadá dotazník azčeho je složen. Nyní se podíváme trochu hlouběji abudeme se zabývat tím, co se vrámci výzkumu (ať už dotazníkového nebo jiného) vlastně zkoumá. Obecně je to jednoduché – ve výzkumu vždy zkoumáme vztah nějakých proměnných, přičemž musí být alespoň dvě. 2.1 Typy proměnných Proměnná je určitá abstraktní jednotka (respektive určitá vlastnost), která nabývá alespoň dvou hodnot. Zkoumanými proměnnými například může být věk avelikost slovní zásoby – ve výzkumu, který sleduje vztah těchto proměnných, se pak mimo jiné můžeme ptát, jestli platí, že starší mluvčí mají větší slovní zásobu než mladší mluvčí apod. Nebo si můžeme vymezit například proměnné slovesný čas avidová interpretace azkoumat, jestli budou určitá vybraná obouvidová slovesa interpretována dokonavě nebo nedokonavě vpřípadě, že budou použita vpréteritu. Proměnné můžeme klasifikovat dvěma základními způsoby: a) zhlediska jejich kvality; b) zhlediska jejich vztahu. Zhlediska kvality rozlišujeme takzvané kvalitativní anumerické proměnné. Kvalitativní proměnné se dále dělí na nominální a řadové, numerické na poměrové aintervalové. Nominální proměnné jsou nejjednodušší – jejich hodnoty pouze poukazují na příslušnost kurčité skupině či členství vurčité kategorii. Zprincipu jsou nespojité (diskrétní), mezi jednotlivými hodnotami není plynulý přechod, nýbrž jsou mezi nimi striktní hranice. Nejčastěji uvádě-
23 nou nominální proměnnou je pohlaví. Tato proměnná má dvě hodnoty, tedy muž ažena. Každou osobu můžeme klasifikovat tak, že spadá do jedné z těchto kategorií. I kdybychom vytvořili ještě kategorie další (například transsexuál), nebude se na tom nic měnit, nepůjde oplynulý přechod mezi kategoriemi. Vlingvistice je zřejmou nominální proměnnou například zájmeno voslovení – to může nabývat hodnot ty, vy aVy. Složitějším příkladem jazykové nominální proměnné může být slovní druh. Včeštině jich základně vymezujeme deset, ale zkurzů morfologie víme, že to není nic daného (například lze jako specifický slovní druh chápat takzvaná predikativa). Jinými slovy, hodnoty proměnných nejsou dány univerzálně, ale závisí na pojetí, které si badatel zvolí. Ktomu se ještě zanedlouho vrátíme. Druhým typem kvalitativních proměnných je proměnná řadová (někdy též „ordinální“). Hodnoty řadové proměnné stejně jako hodnoty proměnné nominální poukazují na členství vkategorii či skupině ajsou zprincipu diskrétní. Rozdíl však spočívá vtom, že tyto hodnoty můžeme na základě určitého klíče seřadit, jinými slovy, že můžeme říct, že je nějaká hodnota vyšší než jiná. Nemůžeme však říci, okolik nebo kolikrát je vyšší. Typickým příkladem řadové proměnné je dosažené vzdělání. Jednotlivé osoby můžeme klasifikovat na základě toho, jaké nejvyšší ukončené vzdělání mají amůžeme zároveň říci, že středoškolské vzdělání smaturitou je vyšší hodnota než základoškolské vzdělání, ale zároveň, že je to nižší hodnota než vysokoškolské vzdělání. Hodnoty řadových proměnných můžeme zjišťovat prostřednictvím škál. Například lze vymezit proměnnou subjektivní hodnocení projevu, která bude mít hodnoty velmi dobrý – dobrý – špatný – velmi špatný. Je zřejmé, že můžeme říci, že velmi špatný je nižší stupeň než dobrý apod., ale říct, že velmi špatný je třikrát nižší nebo něco podobného, by nedávalo smysl. Poměrové (někdy též „podílové“) proměnné jsou prvním typem numerických proměnných. Na rozdíl od proměnných kvalitativních unich lze určit, okolik je určitá hodnota vyšší nebo nižší než jiná, azároveň, kolikrát je vyšší či nižší. Typickou proměnnou tohoto typu je věk. Pochopitelně můžeme říct, že určitá osoba je ox let starší než jiná nebo že je xkrát starší. Důležité je, že všechny numerické proměnné mohou být kontinuální (spojité), ale idiskrétní (nespojité). Kontinuální proměnnou je kupříkladu právě věk, protože mezi jednotlivými hodnotami jsou zcela plynulé přechody. Diskrétní poměrovou proměnnou je například počet slov ve větě. Ten nabývá hodnot, které se vyjadřují přirozenými
24 čísly, jež mezi sebou plynulé přechody nemají – ve větě může být například 5, 6, 7 nebo 8 slov, ale nikdy jich zprincipu nemůže být 5,513 apod. Poměrovou proměnnou sjistotou poznáte tak, že může nabývat pouze kladných hodnot. Asi nejsložitější na pochopení jsou takzvané intervalové proměnné. Ty jsou rovněž numerické, můžeme unich určit, okolik je která hodnota vyšší nebo nižší než jiná, ale zprincipu unich nelze stanovit, kolikrát je vyšší či nižší. Není to možné proto, že se jedná oproměnné, které nemají takzvanou „přirozenou nulu“ (tj. jejich nulová hodnota neoznačuje vpravém slova smyslu „nulovost“). Jako typický příklad se uvádí teplota ve stupních Celsia. Hodnota 0 °C je určena jako bod tání ledu, nejedná se tak vpravém slova smyslu onulovou teplotu. Můžeme sice říci, že 16 °C je o8 °C vyšší hodnota než 8°C, ale bylo by mylné, kdybychom řekli, že je to dvakrát vyšší teplota. To je dobře vidět na srovnání steplotou ve stupních Kelvina, což je poměrová proměnná, jelikož je zde přirozená nula (tzv. absolutní nula), amá stejně velké jednotlivé stupně jako Celsiova stupnice. Tím, že má Kelvinova stupnice přirozenou nulu, můžeme říct, že 100 Kje dvakrát nižší hodnota než 200 Kazároveň, že je o100 K nižší. Našich 16 °C je rovno 289,15 Ka8 °C je rovno 281,15 K. Ztoho je zřejmě vidět, že 16 °C není oproti 8 °C reálně dvakrát vyšší teplota, atedy že teplota ve stupních Celsia není proměnnou poměrovou. Intervalovou proměnnou poznáte tak, že může mít záporné hodnoty. Zároveň platí, že na tento typ proměnných vlingvistice narážíme jen zřídka. Při přemýšlení otypech proměnných zhlediska jejich kvality je důležité si uvědomit, že proměnné nejsou „dány shůry“, ale to, ojaký typ se vkonkrétním případě jedná, záleží do značné míry na badateli. Jinými slovy, ve světě kolem nás je nějaký zajímavý jev, jehož fungování chceme popsat. Vytvoříme si tedy určitou proměnnou amusíme si stanovit, jaké hodnoty může nabývat. Tomuto procesu se říká operacionalizace ajedná se ovelmi důležitý krok vrámci jakéhokoliv výzkumu. To, jakým způsobem si jev operacionalizujeme, předznamenává možnosti našeho výzkumu, tedy to, co vlastně můžeme zjistit. Charakteristické je, že různé proměnné můžeme uchopit různě. Například věk můžeme chápat jako numerickou proměnnou, ale můžeme ji operacionalizovat prostřednictvím věkových kategorií (např. 20–25 let, 26–30 let) jako řadovou. Souhlas stvrzením můžeme uchopit jako řadovou proměnnou (zcela souhlasím – spíše souhlasím – spíše nesouhlasím – zcela nesouhlasím), ale ijako nominální proměnnou (ano – ne).
25 Jak jsme uvedli výše, můžeme proměnné klasifikovat rovněž podle jejich vztahu. Vtakovém případě rozlišujeme mezi závislou anezávislou proměnnou. Nezávislá proměnná představuje předpokládanou příčinu, závislá proměnná předpokládaný následek. Ve výzkumu pak zjišťujeme, zda změna hodnoty nezávislé proměnné způsobuje změnu hodnoty závislé proměnné. Můžeme například zkoumat vztah proměnných znalost psané češtiny avěk učeských neslyšících. Jako nezávislou proměnnou si stanovíme věk ajako závislou znalost psané češtiny amůžeme se ptát, zda se liší znalost psané češtiny učeských neslyšících vzávislosti na jejich věku. Na závěr tohoto oddílu ještě uveďme, že proměnné můžeme ještě klasifikovat na základě toho, čeho se týkají. Můžeme vyčlenit jazykové proměnné (např. tvary koncovky vokativních tvarů mužských příjmení zakončených v1. p. sg. na -a, postavení přívlastku vantepozici či postpozici, délka věty ve slovech apod.), proměnné sociální (věk, etnicita, sociální status) či jiné (fyziologické, neurologické apod.). 2.2 Vztahy mezi proměnnými Ve výzkumu nás vždy zajímá vztah alespoň dvou proměnných. Zkoumat jednu proměnnou sice nemusí být úplně nuda, ale osvětě kolem nás se toho moc nedozvíme. Mohli bychom například různým lidem měřit úroveň znalosti cizích slov. To nám však samo osobě vůbec nic neřekne opodstatě toho, proč se urůzných lidí tato úroveň liší, jakým způsobem se cizí slova učíme atd. Zkrátka, zjistíme pouze určitý údaj, nic víc. Teprve tehdy, když se podíváme na vztah této proměnné sproměnnými dalšími, můžeme začít vyvozovat určité závěry otom, jak funguje svět kolem nás. Například můžeme dojít ktomu, že lidé smenší znalostí cizích slov mají spíše nižší vzdělání, že pochází spíše ze sociálně slabších vrstev apod. Vztahy mezi proměnnými mohou být dvou typů: a) korelace; b) kauzalita. Vprincipu nejběžnější však je, že mezi proměnnými žádný (alespoň přímý) vztah není. Například můžeme předpokládat, že velikost letošní úrody banánů vNigérii nebude vpřímém vztahu sprůměrnou délkou věty ve slohových pracích letošních českých maturantů. Ve výzkumu se však snažíme oto, abychom nějaký vztah našli, respektive abychom na základě dat, která jsme získali, mohli srelativně velkou jistotou tvrdit, že mezi zkoumanými proměnnými vztah existuje.
32 pochopitelně nabízí otázka, nakolik můžeme zvýsledků, které získáme popsáním vzorku, zobecňovat na celou populaci. Přísně vzato zobecňovat nemůžeme vůbec. Vsociálních vědách však vtomto směru existuje určitá tolerance, která je dána tím, že se vněkterých případech prostě nemůžeme opřít okvótní, ani onáhodný výběr anic jiného než výběr účelový nám tak nezbývá. Při využití účelového výběru je velká zodpovědnost na badateli. To, že sám rozhoduje otom, kdo nebo co se dostane do vzorku, pochopitelně neznamená, že by měl vylučovat ty jednotky, které neodpovídají tomu, co chce ve výzkumu dokázat. Naopak, badatel se musí snažit, aby výsledky, které na vzorku zjistí, skutečně reprezentovaly danou populaci, amusí tedy při výběru jednotek postupovat velmi uvážlivě. Důležité pak je, aby byl vzorek dostatečně velký – platí zde „dismanovské“ pravidlo: čím větší vzorek, tím větší je jeho shoda spopulací. K účelovému výběru se obvykle přistupuje například v sociolingvistických či dialektologických výzkumech. Často se pro tyto účely využívá takzvaná technika sněhové koule. Vtakovém případě se vzorek sestavuje tak, že jednotliví účastníci výzkumu doporučují další možné účastníky. Výhoda této techniky spočívá vtom, že účastníci mají menší tendenci odmítat účast ve výzkumu (badatele doporučil jejich známý, což je určité ujištění toho, že se nejedná onic nekalého, čeho by se měli obávat). Tento výzkum se vyplatí zejména tehdy, když zkoumáte fungování jazyka vrámci sociálních sítí (tím není myšlen Facebook apod., ale reálné sociální sítě vběžném životě). Jinými slovy, když zkoumáte, jak se užívá jazyk vzávislosti na tom, kdo je ským reálně vkontaktu. Výhodné je to rovněž tam, kde vůbec neznáte dané společenství. Například si můžete představit, že přijedete do nějakého místa, kde budete chtít provést dialektologický nebo sociolingvistický výzkum na základě rozhovorů. Sněkým se tam seznámíte, provedete rozhovor azeptáte se na další možné účastníky výzkumu. Za těmi pak přijdete, že vás posílá první osoba atd. Nakonec se seznámíte svelkým počtem místních azískáte mnoho cenných dat.
33 4. Jak zjišťujeme vztahy mezi proměnnými? Abychom mohli zjistit, zda je mezi proměnnými nějaký vztah, musíme provést alespoň dvě měření či zjištění, která srovnáme. Vopačném případě nemůžeme ovztahu proměnných nic říct. Představte si, že například ve svém výzkumu zjistíte, že muži zPrahy používají vurčitém situačním kontextu tvar bysme v80 % možných případů. Takový poznatek je sice svým způsobem zajímavý, ale sám osobě nestačí. Abychom mohli ovariaci mezi bychom abysme něco říci, potřebujeme ještě alespoň jedno měření. Pokud nás bude zajímat vliv nezávislé proměnné pohlaví, potřebujeme zjistit, jak užívají tyto tvary ženy. Vpřípadě, že nás bude zajímat vztah mezi regionem původu mluvčího adanými variantami, musíme zjistit, jak tyto varianty užívají mluvčí z jiných míst, než je Praha. Rovněž můžeme zjištovat roli situace azkoumat, nakolik se užívání bychom/bysme umužů zPrahy mění, pokud se ocitnout vjiném kontextu. Jinými slovy, potřebujeme alespoň dvě měření či zjištění, která se liší vhodnotách nezávislé proměnné, azjišťujeme, zda se zde liší (anakolik se liší) hodnoty závislé proměnné. Na tomto základě pak můžeme (pomocí statistických metod) vyvozovat, zda se jedná okorelaci, kauzální vztah anebo zda mezi proměnnými žádný vztah neexistuje. Důležité je, že nezávislou proměnnou lze vřadě případů takzvaně manipulovat. Manipulace proměnných vpodstatě spočívá vtom, že kontrolovaně měníme jejich hodnoty. Například bychom mohli měřit tempo řeči vzávislosti na hladině alkoholu vkrvi. Urůzných osob uměle „nastavujeme“ neboli „manipulujeme“ tuto hladinu a zkoumáme, jak se mění tempo řeči. Existuje několik postupů, jakým způsobem se různých měření dobrat. Vnásledujících oddílech si je představíme.
34 4.1 Srovnávání statických skupin Disman (2002, s. 33) nazývá tento typ zkoumání „předexperimentální vzorec“. Činí tak ztoho důvodu, že se jedná opostup, kdy hodnoty nezávislé proměnné nemanipulujeme. Princip totiž spočívá vtom, že předem máme dvě skupiny, onichž víme, že se liší vhodnotě nezávislých proměnných. Tyto skupiny pak podrobíme výzkumu azjistíme, nakolik se liší vhodnotách závislé proměnné. Pokud je tento rozdíl statisticky významný, můžeme dojít ktomu, že mezi nezávislou azávislou proměnnou je určitý vztah. 1 2 Obr. 1: Schéma srovnávání statických skupin. Máme dvě skupiny, které se nějak liší akteré srovnáváme. Představme si, že například mezi zahraničními studenty, kteří se učí česky, máme skupinu lidí, kteří kromě standardního kurzu absolvovali ještě doplňkový intenzivní kurz češtiny. Zároveň zde máme druhou skupinu, která absolvovala pouze kurz standardní. Na tomto základě si můžeme položit otázku, nakolik je doplňkový kurz účinný, asrovnávat úroveň znalosti češtiny vobou skupinách prostřednictvím určitého testu jazykových znalostí. Vrámci takového zkoumání pak můžeme zjistit, že lidé, kteří absolvovali doplňkový kurz, jsou vtestu úspěšnější aže tedy mají lepší znalost češtiny. Nabízí se závěr, že doplňkový kurz je tedy vskutku důležitý aže významně pomáhá rozvoji znalostí českého jazyka mezi zahraničními studenty. Takový závěr je však značně problematický anemusí vůbec odpovídat realitě. Vrámci tohoto postupu totiž například nemůžeme vědět, zda rozdíly mezi skupinami neexistovaly už dříve (mohlo se stát, že se na doplňkový kurz přihlásili studenti, jejichž znalosti češtiny byly už předtím lepší) anemůžeme vyloučit ani to, že zde hrají roli nějaké vnější příčiny (například mohli mít lidé ve skupině, která absolvovala doplňkový kurz, očeštinu obecně vyšší zájem, mohli mít větší motivaci naučit se česky apod.). Jinými slovy, rozdíl mezi skupinami nemůžeme jednoduše přičítat absolvování nadstavbového kurzu. Ikdyž tedy tento výzkumný postup není příliš dobrý, protože závěry, které na jeho základě získáme, jsou velmi vratké, jde opostup relativně běžný, alespoň vlingvistice. Srovnávání statických skupin provádíme
35 obvykle například vdialektologii, kdy srovnáváme různá nářečí, anebo třeba tehdy, když srovnáváme jazyk vurčitých periodikách oproti periodikům jiným, nebo například styl mluvených projevů proti psaným atd. Užití tohoto postupu má podobné důvody jako užití účelového výběru při stavbě vzorku – je vynuceno tím, že jiný postup není vdaném případě možný. 4.2 Předběžné anásledné pozorování jedné skupiny Prvním postupem, vrámci něhož badatel manipuluje hodnoty nezávislé proměnné, je předběžné anásledné pozorování jedné skupiny. Princip je zde velmi jednoduchý. Nejprve na dané skupině provedeme pozorování či měření apoté změníme hodnotu nezávislé proměnné (manipulujeme ji). Následně provedeme druhé pozorování. Pokud zjistíme, že se první adruhé pozorování statisticky významně liší (viz kapitola8), můžeme předpokládat, že daná nezávislá azávislá proměnná jsou ve vztahu. 1 ∼ 2 Obr. 2: Schéma předběžného anásledného srovnání jedné skupiny. Skupinu otestujeme, poté manipulujeme nezávislou proměnnou apoté ji otestujeme znovu. Vraťme se knašemu příkladu stempem řeči a hladinou alkoholu vkrvi. Vpřípadě uplatnění tohoto postupu bychom si sestavili určitý vzorek lidí avrámci stanoveného řečnického úkolu bychom ukaždého jedince změřili průměrné tempo jeho řeči. Poté bychom všem aplikovali alkohol až na určitou zvolenou hladinu (například 1 promile) anásledně bychom opět změřili průměrné tempo řeči každé testované osoby. Pokud se tempo řeči sníží (nebo naopak zvýší), můžeme předpokládat, že hladina alkoholu vkrvi skutečně vdané populaci ovlivňuje tempo projevu. Tato interpretace je však problematická podobně jako usrovnávání statických skupin. Ipři uplatnění tohoto postupu totiž narážíme na to, že nemůžeme vyloučit nějakou vnější příčinu. Vnašem případě je například velmi pravděpodobné, že svou roli vedle alkoholu hraje iúnava. Jak přesně však únava tempo řeči ovlivňuje, nejsme schopni vrámci takto realizovaného výzkumu říci. Vztah mezi tempem řeči aalkoholem vkrvi je tak sporný.
36 4.3 Klasický experiment Tento postup je ve svém principu podobný předchozímu vtom, že rovněž využívá předběžné anásledné pozorování. Rozdíl však spočívá vtom, že skupina není pouze jedna, ale jsou dvě: experimentální akontrolní skupina. Nezávislá proměnná je zde manipulována: experimentální skupina je vystavena určité hodnotě nezávislé proměnné, kontrolní skupina je vystavena jiné hodnotě nezávislé proměnné. Důležité je, aby jednotlivé jednotky v rámci vzorku byly do těchto skupin rozděleny náhodně. 1 ∼ 1 2 2 Obr. 3: Schéma klasického experimentu. Máme dvě náhodně rozdělené skupiny, obě otestujeme, pak odlišně manipulujeme nezávislou proměnnou uobou skupin apoté je znovu otestujeme. Vnašem případě salkoholem atempem řeči bychom tak postupovali následovně: Nejprve bychom si vzorek náhodně rozdělili na dvě skupiny. Jednotlivým osobám vkaždé skupině bychom změřili tempo řeči, poté bychom osobám vexperimentální skupině aplikovali alkohol do určité stanovené míry (osoby vkontrolní skupině by alkohol nedostali) anakonec bychom opět utestovaných osob zobou skupin zjistili, jaké je jejich tempo řeči. Proč to dělat tak komplikovaně? Je to ztoho důvodu, že se může snadno stát, že kontrolní skupina bude mít vdruhém měření rovněž nižší tempo řeči, než měla vpředchozím měření. Jinými slovy tak zjistíme, že zde hraje roli určitá proměnná, kterou do výzkumu nezahrnujeme (např. výše zmiňovaná únava). Klasický experiment je tak na rozdíl od předběžného anásledného pozorování jedné skupiny výhodný vtom, že jeho prostřednictvím zjistíme, zda ve výzkumu nenastalo nějaké zkreslení, zda nám neutekla nějaká proměnná, která ve zkoumaném vztahu hraje důležitou roli. Jinými slovy, tento relativně složitý postup využíváme za tím účelem, aby se odhalil dopad jiných proměnných, než jsou nezávislé proměnné, které zkoumáme. Vlingvistice je využití klasického experimentu relativně omezené, protože jde opoměrně komplikovaný ačasově náročný postup. Můžeme si však představit, že bychom ho použili při zkoumání učení se cizímu jazyku. Například bychom mohli zjišťovat funkčnost určité nově vymy-
37 šlené metody výuky na našich zahraničních studentech. Postupovat budeme tak, že nejprve náhodně rozdělíme naše studenty dodvou skupin apoté otestujeme úroveň jejich znalosti češtiny. Experimentální skupinu pak vyučujeme prostřednictvím nové metody, ukontrolní skupiny použijeme standardní metodu výuky. Po skončení kurzu obě skupiny opět otestujeme zhlediska jejich znalostí češtiny asrovnáme, jak se od sebe obě skupiny liší. Můžeme předpokládat nárůst znalostí češtiny vobou skupinách, pokud však vexperimentální skupině bude statisticky významně vyšší, lze se oprávněně domnívat, že nová metoda je skutečně účinnější než metoda standardní. 4.4 Následné pozorování na dvou skupinách Poslední výzkumný postup, který si uvedeme, je vzásadě totožný sklasickým experimentem, avšak stím rozdílem, že zde uobou skupin odpadá předchozí zkoumání. Vychází se přitom zpředpokladu, že pokud jsou kontrolní aexperimentální skupina rozděleny náhodně, platí, že následné pozorování na kontrolní skupině je ekvivalentní shypotetickým předběžným pozorováním na experimentální skupině. Jinými slovy, můžeme předpokládat, že rozdíl mezi zjištěním na experimentální skupině ana kontrolní skupině skutečně reflektuje vliv dané nezávislé proměnné azároveň, že je zde vyloučen vliv nějaké vnější příčiny (respektive je na obě měření identický). Vlingvistice se jedná osnad nejpoužívanější způsob experimentálního výzkumu, protože je vzásadě stejně účinný jako klasický experiment, avšak je jednodušší na uplatnění. Například vnašem výzkumu vlivu připravenosti anepřipravenosti na produkci psaných textů (Chromý – Milička, 2012) jsme vzorek cca 50 lidí rozdělili náhodně do dvou skupin atestované osoby zobou skupin měly za úkol popsat děj filmu, který jsme jim pouštěli. Experimentální skupina měla 5 minut na přípravu apromyšlení toho, co napíšou, kontrolní skupina film popisovala bez přípravy. Následně jsme zkoumali, včem se liší projevy vrámci obou Obr. 4: Následné pozorování na dvou skupinách. Vzorek rozdělíme náhodně na dvě skupiny, ukaždé znich odlišně manipulujeme nezávislou proměnnou aotestujeme je. 1 2
38 skupin. Vsouvislosti stím je dobré podotknout jednu věc – často je následné měření na dvou skupinách jediným solidním postupem, jak výzkum realizovat. Vuvedeném případě například nepřicházelo vúvahu, že bychom mohli udělat předchozí měření, protože bychom nemohli využít stejný film (při druhém měření by už byli připraveni všichni jedinci). 4.5 Reliabilita avalidita výzkumu Abychom si mohli být jisti tím, že mezi dvěma proměnnými skutečně existuje určitý vztah, musí nám při zopakování výzkumu za stejných podmínek vycházet stejné výsledky. Pokud by nám totiž vycházelo něco jiného, je prakticky jisté, že jsou ve hře nějaké proměnné, které nesledujeme akteré jsou zhlediska vztahu mezi zkoumanými proměnnými důležité. V případě, že by při opakovaných pozorováních vycházely odlišné výsledky, znamená to, že náš výzkum není reliabilní. Reliabilita výzkumu je tedy vlastně jeho spolehlivost. Reliabilita námi zvoleného výzkumného postupu se pochopitelně dá určitým způsobem zjišťovat. Prvním ze způsobů je tzv. metoda opakovaného měření (angl. test-retest method), která spočívá vtom, že výzkum zopakujeme aporovnáme výsledky. Vněkterých případech pochopitelně nemůžeme metodu opakovaného měření použít. Zejména je tomu tak tehdy, když zkoumáme jevy, které podléhají relativně rychlým změnám včase, například postoje kurčitým jazykovým jevům. Vjiných případech to však možné je. Badatelé vsociálních vědách přesto – zpraktických důvodů vcelku pochopitelně – reliabilitu svého výzkumu tímto způsobem obvykle neověřují. Výzkumy bývají relativně náročné, ato jak zhlediska času, tak zhlediska financí adělat takový výzkum dvakrát znamená tuto náročnost zdvojnásobit. Většinou tak na tento typ ověření reliability narážíme tehdy, když někdo zopakuje (takzvaně replikuje) výzkum někoho jiného (typicky třeba psycholingvistický výzkum provedený původně na angličtině někdo zopakuje stím, že jako materiál zvolí češtinu). Druhým způsobem zjišťování reliability je takzvaná metoda půlení (angl. split-half). Tato metoda spočívá vtom, že rozdělíme jednotlivé položky vnašem výzkumu do dvou skupin, spočítáme výsledky obou skupin a vzájemně je srovnáme. To pochopitelně nejde použít vždy, protože položky musí být určitého typu. Například můžeme využívat takzvanou úlohu detekce slova (testované osobě se na obrazovce objeví
39 slovo aúkolem je, zmáčknout určité tlačítko, pokud se jedná oreálně existující slovo, ajiné tlačítko, pokud se oslovo daného jazyka nejedná) amůžeme zjišťovat, jestli je nějaký rozdíl mezi reálnými slovy (např. prase), pseudoslovy (slova formálně blízká k existujícím, např. praso) aneslovy (formálně zcela nesmyslná slova, např. easrp). Pokud bychom měli například 20 reálných slov, 20 pseudoslov a20 neslov, mohli bychom reliabilitu zkoumat tak, že vždy porovnáme reakční časy poloviny slov daného typu sdruhou polovinou téhož typu (např. reálná sreálnými, pseudoslova spseudoslovy aneslova sneslovy). Pokud bychom zjistili, že se reakční časy mezi polovinami různí, znamenalo by to, že test není reliabilní aže je ve výzkumu přítomno významné zkreslení. Poslední metodou ověřování reliability, kterou si zde uvedeme, je tzv. metoda paralelního měření. Tu můžeme využít tehdy, pokud máme dvě verze téhož výzkumného nástroje (např. dvě verze testu znalosti cizího jazyka). Metoda spočívá vtom, že zkoumání provedeme oběma způsoby avýsledky srovnáme. Spojmem reliabilita úzce souvisí pojem validita, který už jsme zmínili vkap. 1.4. Validitu můžeme posuzovat zrůzných hledisek, přičemž základně rozlišujeme tři druhy validity: a) obsahovou; b) kriteriální; c) konstruktovou. Obsahová validita vychází ze znalostí badatele nebo skupiny badatelů aspočívá ve fundovaném zhodnocení toho, zda způsob testování skutečně zachycuje to, co je předmětem výzkumu. Obsahová validace se tak především zaměřuje na to, zda je zkoumaný jev ve výzkumu zachycen ve své úplnosti (nevalidní by ztohoto hlediska byl například výzkum postojů kobecné češtině, který by nezahrnoval otázku na tvar bysme). Pod pojem obsahové validity se někdy řadí itzv. zjevná validita (angl. face validity), která je založena primárně na intuici (badatele anebo skupiny badatelů). Výzkum je zjevně validní tehdy, pokud se nám zdá, že výsledky skutečně odráží zkoumanou realitu. Tento typ validity je pochopitelně značně nespolehlivý – Disman dokonce píše, že zjevná validita je „eufemismus pro situaci, kdy kontrola validity nebyla provedena vůbec“ (Disman, 2000, s. 67). Kriteriální validita je na rozdíl od obsahové validity založena na srovnání výsledků výzkumu snějakým vnějším kritériem. Základní podtypy kriteriální validity jsou tzv. prediktivní validita asouběžná validita. Prediktivní validita je vlastně míra, sjakou výsledky získané danou výzkumnou technikou odpovídají reálným výsledkům. Typicky můžeme
40 oprediktivní validitě mluvit vsouvislosti se zkoumáním volebních preferencí (to, jestli je tento způsob validní, se ukáže na srovnání svýsledky voleb), anebo vsouvislosti sjinými technikami (výsledky jednoho testu mohou být velmi dobrým prediktorem pro výsledky vdruhém testu; pokud by tak například byla státní maturita prediktivně validní, byly by její výsledky dobrým ukazatelem pro úspěšnost přijetí na vysokou školu). Souběžná validita vychází zprincipu, že dva rozdílné způsoby zkoumání téhož jevu by měly poskytovat velmi podobné výsledky. Výzkum je tedy souběžně validní tehdy, pokud jeho výsledky vykazují vysokou míru shody svýsledky získanými jinou metodou (resp. jinými metodami). Okonstruktové validitě mluvíme zhlediska vztahu mezi naším měřením aurčitým složitějším konstruktem. Předpokládáme, že je výzkum ztoho hlediska validní, pokud vněm zjistíme, že vztah mezi tím, co jsme naměřili, adalšími proměnnými odpovídá tomu, co bychom očekávali na základě teorie. Konstruktová validita má pak dva podtypy. Otzv. konvergentní validitě mluvíme tehdy, pokud jeden indikátor určitého konceptu koreluje sdalšími indikátory téhož konceptu. Jinými slovy, jde oto, zda použitá měřítka, která by na základě teorie měla souviset, spolu skutečně souvisí. Odiskriminační validitě naopak mluvíme tehdy, když určitý indikátor určitého konceptu není vkorelaci sindikátory příbuzného konceptu. Jinak řečeno, jde oto, zda užívaná měřítka, která by spolu neměla souviset, spolu skutečně nesouvisí. 4.6 Longitudinální výzkum Specifickým případem výzkumu je takzvaný longitudinální výzkum, vněmž se zajímáme oto, jak se určité vztahy proměnných mění vprůběhu času. Obecný princip je přitom jednoduchý: děláme opakovaná měření či pozorování, ato po delších časových intervalech (třeba ipo řadě let). Zhlediska konkrétního postupu pak rozlišujeme tři typy: a) panelové šetření; b) trendové šetření; c) kohortové šetření. Panelové šetření spočívá vtom, že sestavíme určitý vzorek adalší pozorování provádíme vždy na identickém vzorku, tj. na stejných jednotkách. To má svoje nesporné výhody, problém však může nastat vtom, že určité jednotky ze vzorku vprůběhu času odpadnou (např. lidé mohou zemřít, odstěhovat se, mohou posléze začít odmítat účast ve výzkumu apod.), čímž výzkum přestává mít váhu.
41 Odlišně vypadá trendové šetření. V jeho rámci se stanoví cílová populace azté se při každém pozorování vybere nový vzorek, který je podroben výzkumu. Klíčové utrendového šetření je to, že se složení populace vprůběhu času mění. Například můžeme zkoumat vývoj postojů obyvatel Třince kpolštině ačeštině, ato vintervalu pěti let. Vrámci každého měření budeme vzorek sestavovat zaktuálního seznamu obyvatel, který může být značně proměnlivý. Posledním typem longitudinálního výzkumu je kohortové šetření. Jedná se opostup, který stojí přesně mezi trendovým apanelovým šetřením. Strendovým šetřením ho spojuje to, že se při každém novém pozorování či měření sestavuje ze stanovené populace nový vzorek, který je podroben výzkumu. Spanelovým šetřením si je podobný vtom, že se populace vprůběhu výzkumu nemění (maximálně se zužuje, například vinou úmrtí apod.). Příkladem kohortového šetření by mohlo být zkoumání toho, jak se měnila znalost němčiny ulidí narozených v30. letech 20. století vPraze. Ze skupiny všech mluvčích tohoto typu bychom vždy vjednotlivých intervalech vybírali nový vzorek asledovali bychom, jak se úroveň znalosti němčiny mění.
48 ván vpsychologii. Ukazuje se, že první informace oosobě či jevu mají zásadnější vliv na pojímání této osoby či jevu než informace pozdější. Vdotaznících či rozhovorech se vliv tohoto efektu spatřuje vtom, že odpověď na určitou otázku může ovlivnit odpovědi na otázky následující. Ztoho důvodu je velmi vhodné položit otázky vdotazníku vnáhodném pořadí. Zcela ideální pak je, aby dotazník každého respondenta měl jinak seřazené otázky. Pak se haló efektu vdůsledku vyhneme (respektive se jeho dopad vrámci celkových výsledků vynuluje).
49 6. Další pojmy Než přejdeme kdalším nástrojům pro sběr dat, zastavíme se ještě krátce uněkolika důležitých pojmů. 6.1 Indukce adedukce Vrámci empirického zkoumání se idealizovaně rozlišuje mezi induktivním a deduktivním přístupem. Induktivní přístup spočívá v tom, že pozorujeme určitou realitu, vté nacházíme pravidelnosti, na jejich základě docházíme kurčitým závěrům avposledku vytváříme teorii. Příkladem tohoto přístupu je konverzační analýza: rozborem mnoha záznamů reálných konverzací můžeme zjistit, jakým způsobem funguje například střídání či přebírání replik (tj. jak se střídají lidé, kteří zrovna mluví), jaké prostředky naplňují jaké funkce apod. Deduktivní přístup je vzásadě opačný. Nejprve máme určitou teorii, na jejím základě vytváříme hypotézy, ty ověřujeme v rámci pozorování a naše závěry se pak zpětně odráží vteorii. Takto funguje například experimentální výzkum. Důležité je uvědomit si, že se jedná oidealizované přístupy. Reálně si lze jen stěží představit, že ke světu kolem nás přistupujeme bez určité alespoň základní teorie (ve velice širokém smyslu, například vkonverzační analýze musíme mít alespoň implicitní představu otom, co je to konverzace, jak vypadají její jednotlivé složky atd.). Stejně tak si dost dobře nemůžeme vytvořit teorii, aniž bychom předtím pozorovali svět kolem nás (to ostatně děláme od narození). Ve skutečnosti tak rozdíly mezi induktivním adeduktivním přístupem tkví spíše vdílčích aspektech vědecké práce (například vtom, zda se využívají kvantitativní nebo kvalitativní metody) ataké vdůrazu, který se na co klade (vrámci induk-
50 tivního přístupu je proklamována relativní teoretická volnost, zatímco deduktivní přístup je zhlediska teorie spíše rigorózní). 6.2 Teorie, rámec, model Vběžné komunikaci čas od času používáme slova jako teorie, model či rámec. Zhlediska výzkumu mají však tyto pojmy poměrně přesné vymezení, kterého je dobré si být vědomi. Teorii můžeme vymezit jako určitý soubor představ, přijímaných principů apravidel, který je určený kanalýze, predikci aexplanaci fungování určitého souboru jevů. Jinými slovy, jedná se opředstavy ourčitých jevech, na základě kterých můžeme tyto jevy analyzovat, můžeme předpovídat, jak se budou chovat za určitých okolností, amůžeme vysvětlovat, proč tomu tak je. Na základě určité teorie (ať už explicitně vymezené či implicitně přítomné) obvykle formulujeme své výzkumné hypotézy. Zásadní přitom je, že teorie musí odpovídat výsledkům, knimž se dobereme. Vempirickém výzkumu tak obecně platí, že pokud naše výsledky neodpovídají teorii, je chyba právě vteorii, nikoliv ve výsledcích (pochopitelně pokud výsledky nepodléhají zásadnímu zkreslení). TASK ENVIRONMENT WRITING PROCESS PLANNING TRANLATING REVIEWING THE WRITER’S LONG-TERM MEMORY THE RHETORICAL PROBLEM TEXT PRODUCED SO FAR Topic Audience Exigency Knowledge of Topic, Audience, and Writing Plans MONITOR EVALUATING REVISING GENERATING GOAL SETTING ORGANIZING Obr. 9: Model psané produkce Flowerové aHayese (1981).
51 Poněkud jinou roli než teorie zastává model. Ten lze vpodstatě vymezit jako reprezentaci určitého jevu. Důležité je, že model je vždy tvořen zurčité perspektivy anějakým způsobem redukuje realitu (kdyby to tak nebylo, nebyl by to model, ale realita). Model se tedy soustředí pouze na určité aspekty vybraného jevu ve světě kolem nás. Příkladem modelu může být například model psané produkce Lindy Flowerové aJohna Hayese (1981) na obrázku 9. Jistě si dovedeme představit, že to, jakým způsobem píšeme určitý text, je velice složitý proces a můžeme vymezit velké množství proměnných, které vněm hrají určitou roli. Flowerová aHayes se zaměřili základně na tři procesy psaní (plánování, translaci apřezkum), načrtli, jakým způsobem mezi sebou tyto tři procesy interagují ado modelu ještě zapojili dlouhodobou paměť pisatele ataké rysy samotné úlohy. Díky tomuto modelu můžeme vrámci výzkumu lépe uchopit složitý proces psaní, ikdyž jen zurčité perspektivy. Vurčitém smyslu blízký pojem kpojmu model je rámec. Vtomto případě se jedná ourčitou síť pojmů, která nám umožňuje či usnadňuje přemýšlení ourčitém komplexním jevu. Na rozdíl od teorie nemají rámce explanační ambice, ale poskytují nám společný jazyk popisu, usnadňují poznávání určitého jevu aorganizaci poznatků oněm, anabízí nám určité představy otom, jak tento jev funguje (díky tomu, že vymezuje vztahy mezi pojmy). Příkladem může být rámec „principy aparametry“ vgenerativní lingvistice. Jeho základem je předpoklad, že existují určité obecné principy platné pro všechny jazyky, tj. univerzální abstraktní pravidla (například každá větná struktura musí mít rozvíjený člen). Druhým předpokladem je, že existují určité parametry, díky kterým může existovat mezijazyková variabilita (například základní slovosled může být SVO včeštině, ale SOV vturečtině). 6.3 Výzkumná etika Mluvíme-li oetice ve společenskovědním výzkumu, jedná se ocelý soubor otázek, které se týkají nakládání sdaty, výzkumů na lidech, psaní výzkumných zpráv apod. Nás zde budou zajímat pouze první dva uvedené okruhy, které bezprostředně souvisí srealizací empirického výzkumu. Otázce psaní apublikování výzkumných zpráv se tak věnovat nebudeme – jedná se sice ovelice důležitou problematiku, ale již přesahuje rámec této příručky.
52 Vrámci vědecké činnosti se kromě nechvalně známého opisování prací dá pochopitelně podvádět ijinými způsoby. Největší (anejsložitěji kontrolovatelný) problém je vtomto ohledu podvádění sdaty. Přečinem proti výzkumné etice je například svévolné upravování výsledků (například vyloučení těch dat, která se nám nehodí apod.), případně dokonce úplné vymýšlení výsledků. Zdůvodu, že se to občas děje, je povinností výzkumníka poskytnout na vyžádání data zdaného výzkumu. Jak jsme již uvedli výše, je proto třeba data archivovat (ať už jde odotazníky či nahrávky). Zároveň je potřeba dát si pozor při statistické analýze. Může se lehce stát, že uděláte technickou chybu (například si spletete sloupečky vExcelu), vaše výsledky budou vypadat grandiózně, ale ve skutečnosti nebudou odpovídat realitě avy budete vystaveni podezření ze záměrného manipulování svýsledky. Vzhledem ktomu, že jazyk je prostředkem sociální interakce, jsou předmětem lingvistického výzkumu velmi často konkrétní lidé. Ztoho důvodu je třeba, aby se náš výzkum vždy držel vrámci určitých etických standardů. Pochopitelně je tato otázka méně složitá než třeba vlékařství, ale itak ji nemůžeme zanedbat. Jedním ze základních principů je, že musíme mít obvykle od jednotlivých účastníků výzkumu takzvaný informovaný souhlas súčastí ve výzkumu. Testované osoby nejprve seznámíme stím, co je cílem výzkumu, jak se bude nakládat sdaty, kdo knim bude mít přístup, kdo je autorem výzkumu azejména jaká je míra anonymity apoté nám musí podepsat, že souhlasí se svou účastí. Existují určité výjimky, kdy informovaný souhlas získávat nemusíme. Obvykle je tomu tak vpřípadě dotazníků, protože jejich anonymita je přece jenom snadno zaručitelná (oto větší roli zde však hrají obecné instrukce!). Obecně platí základní princip, že testované osoby nesmíme nijak poškodit. To pochopitelně neznamená pouze fyzicky, ale ipsychicky či sociálně. Klíčové je zejména zachování anonymity. Je proto například běžné, že ve zprávách ovýzkumu, kde mluvíme okonkrétních jedincích, používáme pseudonymy (případně iniciály), ato jak pro lidi, tak ipro místa. Jinými slovy, jednotliví účastníci výzkumu nesmí být zpětně identifikovatelní třetí stranou. Vněkterých případech nastává problém, že některé jevy nemůžeme zachytit jinak než potají. Vtomto ohledu by se nabízelo zejména skryté nahrávání. To je považováno za zcela neetické avýzkumy na jeho základě by neměly být realizovány, natožpak publikovány. Existuje přitom určitá možnost, jak tento problém vyřešit, ato nahrávat skrytě, ale po
53 ukončení nahrávání požádat osouhlas se zapojením do výzkumu. Pokud nám ho daná osoba dá, nahrávku do výzkumu zahrneme, pokud nikoliv, nahrávku vjejí přítomnosti vymažeme. Získaná data rovněž nesmíme za žádných okolností využívat jinak než pro výzkumné účely (ato ani například e-mailové kontakty).
54 7. Další nástroje sběru dat Vpředchozím výkladu jsme se podrobněji zabývali dotazníky, ale narazili jsme ina další způsoby sběru dat, ato na rozhovory apozorování. Na ně se teď podíváme blíže. 7.1 Rozhovor jako nástroj sběru dat Vrozhovoru získáváme informace vpřímé interakci srespondentem. Rozhovory mohou být takzvaně strukturované – vtakovém případě je předem stanoven jejich formát aseznam otázek apro všechny respondenty je to stejné. Strukturovaný rozhovor je tak víceméně totožný sústně distribuovaným dotazníkem. Na opačném pólu stojí nestrukturované rozhovory, vnichž je interakce srespondetem volná (přičemž se pochopitelně držíme našeho výzkumného tématu). Ve srovnání sdotazníkovým výzkumem je výzkum využívající rozhovory časově afinančně náročný, ale poskytuje nám obvykle relativně spolehlivá data. Pokud chceme mít vrámci výzkumu solidní vzorek, potřebujeme na to obvykle větší množství spolupracovníků. Problémem může být zároveň to, že výzkum využívající rozhovory nepůsobí příliš anonymně aje tak třeba dbát na to, abychom respondenta oanonymitě přesvědčili. Výhodou je, že vrámci rozhovoru můžete kontrolovat chování respondenta alze vyřešit spoustu problémů, které by potenciálně ohrožovaly validitu výzkumu (například můžeme vysvětlit, co se míní danou otázkou vpřípadě, že jí respondent nerozumí apod.). Rozhovor vsociálních vědách obvykle slouží ktomu, abychom od informanta zjistili jeho názory, postoje, přesvědčení apod. To je pochopitelně možné ivlingvistice, ale nejčastěji se rozhovory vlingvistice (zejména vsociolingvistice) používají kpřímému sběru dat. Jinými slovy,
55 vlingvistickém výzkumu nám nemusí jít ani tak oto, co respondent říká, jako spíš oto, jakým způsobem mluví. Vtakovém případě se pak obvykle volí buď semistrukturovaný či zcela nestrukturovaný rozhovor. Obecně je důležité, aby měl badatel připraven seznam témat, která budou pro zkoumané osoby zajímavá. Témata mohou být předem ipropojena – výzkumník tak může mít předem vymezené určité možnosti, jak tematicky pokračovat, když respondentovi dojde řeč. Ideálně pochopitelně chceme, aby daná zkoumaná osoba mluvila co nejvíce. To není tak lehké, jak se může na první pohled zdát. Zkuste se půl hodiny bavit sosobou, kterou jste předtím neviděli, tak, aby mluvila především tato osoba – velice lehce se vám může stát, že daná osoba odpovídá zkratkovitě aže vám brzo dojdou otázky, které máte připravené. Milroyová aGordon (2012) uvádí určité strategie, které je vtakových případech vhodné použít. Jednou znich je strategie snížení své autority – místo toho, abyste byli tím, kdo rozhovor určuje, se prostě postavíte do role toho, kdo se chce nechat poučit (například otom, jaký je pracovní postup vtom, čím se daná osoba zabývá, nebo otom, jak to vdaném místě chodí apod.). Zkoumat některé jazykové jevy prostřednictvím rozhovoru může být nicméně obtížné až nemožné. Snadno si to můžeme představit ujevů, které se vkaždodenní komunikaci objevují relativně málo. Asi stěží můžeme předpokládat, že vrozhovorech včeštině nasbíráme velké množství tvarů přechodníků, ale stejné to bude třeba isvloženými vedlejšími větami či složitějšími syntaktickými konstrukcemi. Podobně se vrozhovorech jen ve velmi omezené míře budou vyskytovat jevy, které je zpragmatických důvodů vodpovědích na otázky nemístné používat (například rozkazovací způsob či tázací dovětky jako viď?, že jo?, no ne?). Na druhou stranu, vhodným výběrem otázek můžeme dosáhnout toho, aby respondenti daný jev použili. Například pokud zkoumáme kondicionálové tvary včeštině, můžeme se zeptat, „co by daný člověk dělal, kdyby“ apod. Největší problém je elicitace „běžné mluvy“, tj. jak dosáhnout toho, aby mluvčí mluvil přirozeně, jako mluví například spřáteli, doma apod. Zde se nabízí otázka, co to je vlastně běžná mluva, respektive co je jejím základem, protože můžeme oprávněně předpokládat, že se naše mluva liší vtom, kdo je jejím adresátem (trochu jinak budeme patrně mluvit srodiči, se sourozenci, spřáteli apod.). Odpověď na ni je však mimo možnosti této příručky. Milroyová sGordonem (2012) uvádějí dva typy strategií, jak dosáhnout toho, aby mluvčí mluvil přirozeně. První znich je ovlivnění obsahu rozhovoru. To praktikoval už William Labov ve
56 svých raných výzkumech (shrnutých vLabov, 1972), když předpokládal, že lidi při určitém citlivém tématu přestanou reflektovat to, jak mluví, a budou mluvit „přirozeně“ (typicky využíval otázky na to, kdy byl mluvčí vnebezpečí smrti). Druhou strategií je pozměnění dvoustranného formátu rozhovoru. Jednak se můžeme přiklonit ktomu, že budou rozhovor sdaným mluvčím dělat dva lidé, což má výhodu vtom, že je rozhovor plynulejší. Jednak (ato je běžnější) můžeme dělat takzvaný skupinový rozhovor, tedy hovořit svíce mluvčími najednou. Skupinový rozhovor je založen na tom, že je badatel pouze vroli „moderátora“, který iniciuje diskusi, ale sám do ní spíše nezasahuje. Jinými slovy, moderátor nastolí určité téma aúčastníci rozhovoru se oněm začnou bavit. Pokud téma zvolíme dobře aje pro účastníky výzkumu zajímavé, měli bychom získat poměrně velké množství kvalitních dat. Výhodou pochopitelně může být, když se účastníci alespoň částečně znají. Určitou skupinu můžeme podrobit výzkumu opakovaně (např. sdílčími obměnami osazenstva), anebo se můžeme zaměřovat na více rozdílných skupin aočekávat, že vužívání jazyka bude mezi skupinami rozdíl. Mezi potenciální problémy skupinových rozhovorů patří zejména „silní“ jedinci, kteří mohou ovlivnit názory či postoje celé skupiny (vpřípadě, že to je to, co zkoumáme), případně to, jak lidé mluví (anakolik vůbec mluví – udržet podobný poměr objemu řeči ukaždého účastníka je velmi náročné). Technicky může být realizace skupinových rozhovorů obtížná avpřípadě špatného výběru témat anebo participantů může dojít kneúspěchu. Navíc se může stát, že lidé budou mluvit jeden přes druhého, což vpřípadě lingvistického výzkumu může být problematické (znahrávky nemusí být jednoznačně rozpoznatelné, kdo co řekl, jak přesně to řekl apod.). Složitou otázkou rovněž může být, jak zvýsledků získaných na skupině zobecňovat na širší populaci. 7.2 Pozorování Když jsme na začátku této příručky vymezovali empirický výzkum, používali jsme pojem „pozorování“ velice široce. V tuto chvíli nám půjde pouze opřímé pozorování, tedy opozorování reálného chování či jednání určitých jedinců. Řada výzkumů ukazuje, že představy ovlastním chování či chování jiných lidí (jazykovém inejazykovém) areálné chování se liší. Jeden
57 anekdotický příklad uvádí například Labov (2006, s. 314). Matka sdcerou, které zkoumal vrámci svého newyorského výzkumu, tvrdily, že nikdy nevypouštějí /r/ ve výslovnosti vsouladu stím, co se považovalo za prestižní mluvu. Otěch, kteří /r/ vypouštějí, mluvili spíše pohrdlivě aříkali, že jsou znižší sociální třídy. Ve skutečnosti však /r/ nezřídka vypouštěly. Labov jim pustil nahrávku, na které bylo jednoznačně zdokumentováno, že /r/ běžně vypouští. Matka sdcerou ze sebe byly šokovány azklamány. Důležité je, že nesoulad mezi tím, co ochování (vlastním nebo cizím) říkáme, atím, jak se reálně chováme (nebo jak se chovají jiní) není dán tím, že bychom badatelům lhali či záměrně neříkali přesně to, jak se věci mají. Naše představy ovlastním chování či chování jiných lidí jsou zkrátka určitou konstrukcí reality, která umožňuje vlastní porozumění světu (například lidé ze Slezska vytýkají Pražákům to, že mají otevřenou výslovnost – realitaje ale oněco složitější). Pro poznání určitého jevu je tak důležité se zaměřovat jak na to, jaké oněm mají představy lidé, tak na to, jak daný jev reálně vypadá. Obojí je zajímavé zhlediska toho, jak ve světě fungujeme. Výzkum využívající přímé pozorování je tak přirozeným doplňkem výzkumu dotazníkového nebo výzkumu založeného na rozhovorech. Pozorování může vypadat různě, ale stejně jako urozhovorů si zde můžeme vymezit dva póly: strukturované anestrukturované pozorování. Nestrukturované pozorování je časově velmi náročné. Data získaná jeho prostřednictvím má smysl primárně analyzovat kvalitativně, zobecnění je velmi složité aobvykle relativně málo věrohodné. Nezapomínejme na to, že však pozorování můžeme spojit sjinými výzkumnými metodami apak nám přináší užitečné informace, které bychom jinak nezískali. Badatel se vtakových případech obvykle přímo adlouhodobě zapojuje do daného společenství – mluvíme proto o takzvaném zúčastněném pozorování. To nám umožňuje velmi hluboké pochopení praxe chování vdaném společenství, protože chování sledujeme vcelkovém sociálním kontextu azpozorování předem nevylučujeme žádné proměnné. Jinými slovy, pozorujeme reálné chování lidí vrůzných situacích avedeme přirozené, nestrukturované rozhovory slidmi z daného společenství, přičemž si ovšem děláme poznámky, případně sbíráme další podpůrný materiál (fotografie, videonahrávky adalší dokumenty). Výsledkem takového pozorování je určitý narativ. Jedná se oetnografický přístup. Etnografie se obecně zaměřuje napopis pravidel apraxe vurčité kultuře či vurčitém společenství. Tento přístup je proklamovaně „ateoretický“ –
64 problém tkví vtom, že je výrazně ovlivňován extrémními hodnotami. Představme si, že máme dvě datové sady, přičemž každá má osm vět, azajímá nás průměrná délka těchto vět vkaždé sadě. První sada je složena zvět, které mají délku 2slova, 3 slova, 4 slova, 5 slov, 15 slov, 16 slov, 17 slov a18 slov, druhá je složena zvět, znichž 3 mají délku 9 slov, 2 délku 10 slov a3 délku 11 slov. Je na první pohled zřejmé, že se tyto sady mezi sebou liší – vprvní sadě jsou čtyři věty velmi krátké ačtyři naopak velmi dlouhé, vdruhé jsou všechny věty dlouhé víceméně stejně. Pokud bychom však chtěli popsat tyto dvě sady na základě průměru, vyšlo by nám vobou případech, že jsou věty dlouhé průměrně 10 slov. Průměr tedy může být ošidný ajako ukazatel nám sám osobě nestačí. Druhou střední hodnotou je median. Pokud uspořádáme všechny naměřené hodnoty podle jejich velikosti, je median přesně prostřední hodnota. Pokud je hodnot sudý počet, pak se median počítá jako průměr dvou prostředních hodnot. Median je užitečný v tom, že není tolik ovlivňován extrémními hodnotami. Proto je užitečné ho uvádět vtěch případech, kdy se extrémní hodnoty objevují (například umzdy vČeské republice). Median na rozdíl od průměru můžeme určovat jak unumerických, tak uřadových proměnných, nikoliv však uproměnných nominálních. Poslední středovou proměnnou je takzvaný modus. Jedná se onejčastěji se vyskytující hodnotu. Můžeme ho sice určovat uvšech typů proměnných, jeho informační hodnota je však poměrně omezená. Samotná střední hodnota nám nikdy nestačí, potřebujeme ještě určitou informaci otom, jak moc se jednotlivé naměřené hodnoty od těch středových liší. Tuto informaci nám poskytují ukazatele variability. Těch je větší množství – my si zde uvedeme pouze několik nejčastěji používaných: a) variační rozpětí; b) percentilové rozpětí; c) rozptyl; d) směrodatnou odchylku. Variační rozpětí představuje rozdíl mezi maximální aminimální hodnotou vdaném souboru. Někdy se rovněž používá specifikace prostřednictvím krajních bodů. Podobně jako uprůměru je zde problém tehdy, když jsou vsouboru extrémní hodnoty. Ztoho důvodu lze raději použít takzvané percentilové rozpětí. Percentil je hodnota, která ukazuje, kolik procent případů má vdatech uspořádaných podle velikosti nižší pozici. Jinými slovy, ukazuje relativní pozici jednotky vrámci populace (50. per-
65 centil = median). Percentilové rozpětí je varianta variačního rozpětí, kde si stanovíte, že budete ignorovat extrémní hodnoty. Například můžete zjišťovat rozpětí mezi 10. a90. percentilem. Velice důležitým ukazatelem variability je rozptyl. Ten se počítá odlišně pro populaci (značka σ2) apro vzorek (značka s2). Vprvním případě se jedná osoučet druhých mocnin odchylek datových bodů od průměru děleno počtem datových bodů, vdruhém případě jde osoučet druhých mocnin odchylek datových bodů od průměru děleno počtem datových bodů sníženým ojednu: Přesný vzorec není nutné si pamatovat (je však dobré si uvědomit, na jakém principu je rozptyl založen). Chceme-li spočítat rozptyl, můžeme dnes použít nejrůznější software. Například vprogramu Microsoft Excel můžete rozptyl vypočítat pomocí jednoduchého vložení funkce (VAR pro populaci aVAR.VÝBĚR pro vzorek). Problém rozptylu tkví vtom, že se jedná ohodnotu, která je vždy vjednotkách na druhou (například udélky věty by byl rozptyl značen vpočtu slov na druhou). Jinými slovy, rozptyl je poněkud složitě interpretovatelný. Ztoho důvodu se běžněji používá takzvaná směrodatná odchylka (značka σ pro populaci aspro vzorek; včláncích se pak často používá SD, tedy zkratka anglického standard deviation). Jedná se jednoduše odruhou odmocninu rozptylu – jinými slovy, její hodnoty jsou ve stejných jednotkách jako hodnoty dané proměnné: 8.2 Pravděpodobnost vinferenční statistice Vrámci této příručky nemáme prostor věnovat se inferenční statistice podrobněji. Ostatně, existuje oní řada podrobných publikací (např. již
66 zmiňovaný Volín, 2007 anebo snad nejpřívětivější kniha ostatistice pro úplné začátečníky svýstižným názvem Statistics without tears (Rowntree, 1981)). Vysvětlíme si zde pouze úplné základy, abyste tušili, oco jde, když budete číst nějakou studii, která sinferenční statistikou pracuje. Když jsme mluvili ohypotézách, řekli jsme, že nulová hypotéza nepředpokládá vztah mezi proměnnými, zatímco pracovní hypotéza ano. To je zhlediska inferenční statistiky důležité. Vsouvislosti sověřováním hypotéz se totiž můžeme dopustit určitých chyb. Takzvaná chyba 1. druhu nastává tehdy, když badatel nesprávně zamítne nulovou hypotézu (jinými slovy si myslí, že mezi proměnnými je vztah, ale ve skutečnosti tam není). Ochybě 2. druhu mluvíme vpřípadě, že výzkumník nulovou hypotézu nezamítl amylně se domnívá, že mezi zkoumanými proměnnými žádný vztah není (viz tabulka 2). Tab. 2: Schematické znázornění vztahů mezi nulovou hypotézou arealitou. realita vztah neexistuje vztah existuje nulová hypotéza odmítnuta chyba 1. druhu správný závěr neodmítnuta správný závěr chyba 2. druhu Pojmy chyba 1. a2. druhu úzce souvisí sklíčovým pojmem inferenční statistiky, kterým je pravděpodobnost. Naše závěry vždy tvrdíme pouze surčitou pravděpodobností. Vpravém slova smyslu tedy vempirickém výzkumu nemůžeme nic definitivně prokázat – je však důležité, že můžeme řadu věcí vyvrátit. Hodnota pravděpodobnosti (značka p), kterou ve výzkumu uvádíme, poukazuje na pravděpodobnost chyby 1. druhu. Jinými slovy, hodnota p označuje riziko, že se spleteme, pokud zamítneme nulovou hypotézu. Toto riziko může být pochopitelně různé. Například vjednom našem výzkumu jsme mimo jiné zjišťovali, zda respondenti ve větách Lektor demonstroval publiku funkce přístroje, Jeho kabinet renovovali profesionálové aLidé detoxikovali svůj organismus pomocí alternativních léčiv budou jako ekvivalent obouvidového slovesa cizího původu volit dokonavé nebo nedokonavé sloveso domácího původu. Vpřípadě tvaru demonstroval nám zcelkově 29 platných odpovědí vyšlo 19× dokonavé sloveso a10× nedokonavé sloveso, urenovovali z27 platných odpovědí 12× dokonavé sloveso a15× nedokonavé sloveso audetoxikovali z29 platných případů 23× dokonavé sloveso a 6× nedokonavé sloveso. Na základě statistického výpočtu pomocí tzv. chí-kvadrátu (viz níže) jsme došli
67 kzávěru, že uslovesa demonstroval je p= 0,0947, uslovesa renovovali je p = 0,5637 auslovesa detoxikovali je p = 0,0016. Co to však znamená? Při hodnocení toho, zda je pravděpodobnost chyby 1. druhu dostatečně malá na to, abychom mohli říci, že jsou výsledky nenáhodné, se opíráme otakzvanou hladinu významnosti. Ta je stanovena na základě konvence avymezuje určité hranice, odkud se již výsledek považuje za statisticky významný. Za takzvaně významný (neboli signifikantní) výsledek považujeme hodnotu p < 0,05 (jinými slovy, zvíce než 95 % si můžeme být jisti, že jsme neučinili chybu 1. druhu, když budeme tvrdit, že vztah mezi zkoumanými proměnnými existuje). Za vysoce významný výsledek pak považujeme hodnotu p < 0,001. Vsociálních vědách (na rozdíl od věd přírodních) se rovněž občas uvádí takzvaně „okrajově významný výsledek“, který tvoří hodnota 0,05 < p < 0,08. 8.3 Rozdělení dat Vinferenční statistice je klíčový pojem rozdělení. Výpočet toho, nakolik je pravděpodobné, že neděláme chybu 1. druhu, je totiž – zjednodušeně řečeno – založen na srovnání toho, jak by byly rozprostřeny hodnoty vurčitém ideálním případě, atoho, jak jsou rozprostřeny vpřípadě našeho výzkumu. Zde si řekneme odvou typech rozdělení – binomickém anormálním. Binomické rozdělení je vlastně rozdělení pravděpodobnosti vpřípadě, že proměnná nabývá pouze dvou hodnot. Standardně se jako příklad udává házení mincí (vyváženou – tj. mincí, kde je stejná pravděpodobnost, že padne jedna nebo druhá strana). Vyloučíme-li hypotetickou možnost, že mince spadne na svou hranu, nebo nikdy nedopadne zpátky, jsou možné pouze dva výsledky hodu – panna či orel. Na základě binomického rozdělení můžeme vypočítat, jak budou pravděpodobné nejrůznější výsledky hodů (např. jak je pravděpodobné, že z20 hodů padne 18× panna a2× orel; jak je pravděpodobné, že z20 hodů padne alespoň 12× orel apod.). Hodnotu pravděpodobnosti na základě binomického rozdělení můžete snadno spočítat vprogramu Microsoft Excel pomocí funkce BINOMDIST. Nejdůležitějším typem rozdělení je takzvané normální neboli Gaussovo rozdělení (viz graf 5). Otom mluvíme uspojitých proměnných, přičemž se jedná ojednovrcholové rozdělení symetrické okolo střední
68 Graf 5: Normální rozdělení. Převzato zwww.commons.wikimedia.org hodnoty. Pro střední hodnoty zde platí, že průměr, median imodus jsou totožné. Normální rozdělení je vymezeno středovou hodnotou arozptylem, respektive směrodatnou odchylkou. Jednotlivé hodnoty mají tendenci být blízko středové hodnotě. Čím vzdálenější je daná hodnota od průměru, tím se vdané množině dat objevuje méně často. Příkladů normálního rozdělení najdeme v reálném životě poměrně mnoho. Jedním z nich mohou být schody uvelmi starých budov, do nichž bývá normální rozdělení přímo „vryto“. Tyto schody se totiž postupně obrušují tím, jak se po nich chodí – nikoliv však rovnoměrně. Všimněte si, že typický schod tohoto typu mívá „vychozenou“ prohlubeň uprostřed, směrem od středu na obě strany se tato prohlubeň snižuje ana krajích je schod již prakticky nepoznamenaný. Ato je dáno tím, že chůze po schodech byla historicky normálně rozdělená (lidé nejčastěji na schod došlapovali vjeho prostředku, méně vjeho třetině či dvou třetinách aúplně minimálně na samotných krajích). To, zda jsou naše data normálně nebo nenormálně rozdělena, je zásadní pro to, jaké statistické metody můžeme použít. Vpřípadě, že normálně rozdělena jsou, nebo alespoň přibližně, používáme takzvané parametrické testy. Vpřípadě, že jsou naše data nějak vychýlená, používáme neparametrické testy. Naše data nebudou normálnímu rozdělení vnaprosté většině případů odpovídat dokonale, aproto knormálnímu rozdělení obvykle aproximujeme. Platí totiž, že vzorek má tendenci blížit se knormálnímu rozdělení se vzrůstající velikostí. V grafu 6 jsou zobra-
69 01234567 Počet bodů 8 18 19 2015 16 1713 14109 11 12 01234567 Počet bodů Test k BZK – 200 náhodných Test k BZK – 100 náhodných Test k BZK – 50 náhodných 8 18 19 2015 16 1713 14109 11 12 01234567 Počet bodů 8 18 19 2015 16 1713 14109 11 12 0 Počet studentů 5 10 15 20 30 25 35 0 Počet studentů 5 10 15 20 30 25 35 0 Počet studentů 5 10 15 20 30 25 35 zeny fiktivní, náhodně generované výsledky testu, zněhož mohl student získat maximálně 20 bodů. Rozdíl mezi příklady toho typu, jako je uvedené rozdělení v grafu 6, apříklady, kdy onormální rozdělení zjevně nejde, je poměrně výrazný. Pokud bychom si například vybrali náhodně 1000 mužů a 1000 žen zpopulace Čechů, dostali bychom velice pravděpodobně podobné rozdělení, jako najdeme v grafu 7. Takovému rozdělení říkáme bimodální (dvouvrcholové). Častá rozdělení, na která můžeme narazit, jsou tzv. pozitivně anebo negativně šikmá rozdělení. Pozitivně šikmé rozdělení je typické například pro rozdělení platu vkapitalistické společnosti – vrchol rozdělení bude vychýlen směrem nalevo (velmi mnoho lidí, kteří vydělávají málo) Graf 6: Náhodně generované výsledky testu – první graf sumarizuje výsledky 25 studentů, druhý výsledky 100 studentů atřetí výsledky 200 studentů. Se vzrůstající velikostí vzorku se rozdělení dat čím dál více blíží normálnímu rozdělení.
70 asměrem doprava se bude počet lidí snižovat (minimum lidí, kteří vydělávají statisíce či miliony měsíčně). Negativně šikmé rozdělení můžeme typicky najít vrozdělení odpovědí na uzavřenou otázku sLickertovou škálou (od zcela souhlasím po zcela nesouhlasím), pokud se ptáme na něco, co lidé obvykle odmítají (například Chtěl/abych platit školné.). Jen málo lidí nám odpoví zcela souhlasím či souhlasím, více lidí odpoví neutrálně, poměrně hodně nebude souhlasit anejvíce lidí zaškrtne zcela nesouhlasím. Vrchol rozdělení tak bude vychýlen napravo. Vraťme se ale ještě knormálnímu rozdělení. Kjeho vlastnostem, které jsme uvedli výše, je potřeba dodat ještě jednu důležitou věc, ato jeho vztah ke směrodatné odchylce. Unormálního rozdělení mimo jiné platí, že vpásmu 2 směrodatných odchylek na obě strany od průměru se nachází 95,44 % všech hodnot. Aprávě toto číslo je velmi důležité zhlediska určování pravděpodobnosti chyby 1. druhu. Když jsme mluvili onormálním rozdělení, zmínili jsme zatím pouze případy, kdy se jedná orozdělení dat ve vzorku (příklad se schody afiktivní výsledky testu). Normálně rozdělené ale nemusí být pouze základní naměřené hodnoty, ale ihodnoty jiné, jako je například průměr nebo rozdíl mezi průměry (anebo třeba isměrodatné odchylky). Tomu pak říkáme tzv. výběrové rozdělení. Kdybychom zurčité populace generovali velmi mnoho vzorků ostejné velikosti, budou se mezi jednotlivými vzorky lišit jejich střední hodnoty asměrodatná odchylka. Pokud však Graf 7: Hypotetické rozdělení osob podle jejich výšky ve vzorku složeném z1000 náhodně vybraných mužů a1000 náhodně vybraných žen. Světlejší barvou jsou zobrazené ženy, tmavší muži. Jedná se otakzvané bimodální (dvouvrcholové) rozdělení. 140 0 20 40 60 80 100 120 150 160 170 Výška osoby Počet osob 180 190 200 210
71 vezmeme všechny tyto hodnoty (například průměr) dohromady, dostaneme rozdělení průměrů. Toto rozdělení bude mí tendenci být normální, pokud budou vzorky vdostatečné velikosti. Právě tomuto konstruktu říkáme výběrové rozdělení, pro které platí stejné vlastnosti jako pro normální rozdělení. Uvýběrového rozdělení platí, že nemluvíme osměrodatné odchylce, ale osměrodatné chybě. Tu vypočítáme ze směrodatné odchylky, kterou jsme reálně naměřili vnašem vzorku, tak, že ji vydělíme odmocninou zpočtu jednotek ve vzorku: Abychom si fungování výběrového rozdělení více přiblížili, podívejme se na následující hypotetickou situaci. Představme si, že 200 uchazečů opráci na studijním oddělení dostane vrámci výběrového řízení úkol, aby osvědčili své statistické dovednosti. Každý znich dostane přístup do databáze 8000 studentů FF UK amá za úkol náhodně zní vybrat vzorek ovelikosti 100 studentek azjistit, jaký mají studentky vtomto vzorku průměrný počet kreditů získaný za právě končící akademický rok. Pro všechny je to úkol snadný akaždý dojde knějakému výsledku. Není přitom překvapivé, že tyto výsledky se mezi sebou budou lišit. Je to dáno tím, že si každý vytvářel vzorek sám, byť náhodně (jednotlivé studentky sice byly zastoupeny ivněkolika různých vzorcích, ale nikdy se nestalo, že by byly vzorky zcela totožné). Jinými slovy, jednomu uchazeči opráci vyšlo, že je průměr (po zaokrouhlení na celá čísla) 41 kreditů, dalšímu 43 kreditů, dalšímu 42 kreditů, ještě dalšímu 41 kreditů, dalšímu 37 kreditů atd. Důležité je, že tyto průměrné hodnoty zjištěné na různých vzorcích ostejné velikosti jsou normálně rozdělené. Jinými slovy, nejčastější hodnotou vtomto souboru průměrů bude průměr průměrů (to může být hypoteticky 41 kreditů) ačím dále bude hodnota od tohoto průměru, tím bude méně častá. Toto rozdělení bude mít rovněž svou směrodatnou odchylku (hypoteticky s = 3 kredity). Na základě těchto dvou hodnot pak víme, že 95,44 % všech průměrů, které můžeme získat při náhodném výběru vzorku 100 studentů, se bude pohybovat mezi 35 (minus dvě směrodatné odchylky od průměru) a47 (průměr plus dvě směrodatné odchylky) kredity. Ztoho plyne, že pravděpodobnost, že vybereme 100 studentek avyjde nám průměrný počet kreditů bude nižší než 35, anebo vyšší než 47, je menší než 5 %, přesněji je rovna 4,56%. Postupujme vtomto poněkud absurdním příkladu dále apředstavme si, že celé výběrové řízení kdosi zpochybnil amuselo se konat znovu.
72 Komise pro výběrové řízení dala uchazečům podobný úkol, tentokrát neměli sestavit vzorek 100 studentek, ale 100 studentů (mužů). Vše opět proběhlo hladce, výsledky jednotlivých uchazečů byly rozdílné aukázalo se, že průměr průměrů byl tentokrát 35 kreditů asměrodatná odchylka byla shodou okolností stejná jako uprůměrů vzorků studentek, tedy 3kredity. Jinými slovy, pro průměry studentů-mužů platilo, že 95,44 % znich se nacházelo vpásmu 29–41 kreditů. Komise pro výběrové řízení na základě dalších úloh vybrala z200 uchazečů 3 do užšího kola. Tentokrát měli uchazeči mimo jiné za úkol vyhodnotit měření na vzorcích studentek ana vzorcích studentů. Dva zuchazečů fatálně pohořeli, protože se domnívali, že pokud byl průměrný výsledek ustudentek 42 kreditů austudentů 35 kreditů, znamená to, že se studenti astudentky ve sbírání kreditů liší – studenti jich nasbírali méně. Jen jeden uchazeč se neuchýlil ktak rychlému závěru avzpomněl si na to, co slyšel onormálním, respektive výběrovém rozdělení. Díky tomu si odvodil, že přes 47 % případů průměrů zjištěných na vzorcích studentů-mužů je vpásmu 35–41 kreditů (dvě směrodatné odchylky nad průměrem) azároveň přes 47 % případů průměrů zjištěných na vzorcích studentek je rovněž vpásmu 35–41 (dvě směrodatné odchylky pod průměrem). To už vychytralému uchazeči stačilo na to, aby došel kzávěru, že se rozdělení průměrů velmi silně překrývají aže je tedy vysoce pravděpodobné, že by se spletl, kdyby řekl, že muži sbírají méně kreditů než ženy, tj. že by udělal chybu 1. druhu. Komisi proto řekl, že se nedá říct, že by rozdíly mezi počtem kreditů ustudentů apočtem kreditů ustudentek byly statisticky významné. Uvedená situace je pochopitelně zcela hypotetická. Nám posloužila pouze pro velmi jednoduchou ilustraci principů některých statistických metod, které se zakládají na výběrovém rozdělení. Vreálném výzkumu pochopitelně nesestavujeme 200 vzorků (dost často vyjdeme jen sjedním), technicky by to ostatně bylo složité až nemožné. Jeden vzorek nám ale stačí – pokud se zdá, že jsou naše data normálně rozdělená, můžeme použít statistické testy, které se ovýběrové rozdělení opírají. 8.4 Jak zjišťovat pravděpodobnost? Existuje řada různých statistických testů, prostřednictvím kterých můžeme ve svém výzkumu zjišťovat pravděpodobnost chyby 1. druhu. Zde si uvedeme dva, na které vlingvistice narazíme nejčastěji, ataké dva způsoby zjišťování síly korelace.
73 Prvním testem, který zde zmíníme, je takzvaný chí-kvadrát (χ2, angl. chi-square). Jedná se otest, který je určen ktestování rozdílů mezi četnostmi výskytu vurčitých kategoriích. Jinými slovy, chí-kvadrát užíváme tehdy, když chceme porovnat, zda poměr počtu výskytů jedné hodnoty apočtu výskytů druhé hodnoty je náhodný nebo není. Statistický výpočet je pak založen na rozdílech mezi očekávanými četnostmi ačetnostmi reálně zjištěnými. Vzhledem ktomu, že se jedná očetnosti, je vcelku zřejmé, že chí-kvadrát užíváme primárně unominálních ařadových proměnných – vlingvistice typicky vpřípadě srovnávání výskytů určitých variant jedné jazykové proměnné (viz výše příklad voddílu 8.2). Hodnotu chí-kvadrátu azněj plynoucí pravděpodobnosti chyby 1. druhu dnes můžeme spočítat snadno prostřednictvím programu Microsoft Excel (funkce CHITEST) nebo prostřednictvím online kalkulaček (např. http://www.graphpad.com/quickcalcs/). Nejpoužívanějším testem vlingvistice je vedle chí-kvadrátu patrně t-test. Ten používáme tehdy, chceme-li porovnat průměry hodnot zjištěných udvou skupin případů. Jinými slovy, t-test je nám nápomocen, pokud máme měření dvou skupin achceme zjistit, jestli se tyto skupiny statisticky významně liší nebo je rozdíl mezi nimi daný náhodně. Výpočet t-testu se liší tehdy, jsou-li dvě skupiny zhlediska svého složení shodné nebo nejsou. Vpřípadě, že jsou shodné (jde opředběžné anásledné pozorování), jedná se otakzvané závislé měření (angl. paired). Vpřípadě, že jsou rozdílné (typicky se jedná oexperimentální akontrolní skupinu), jedná se onezávislé měření (angl. unpaired). It-test můžeme snadno spočítat vprogramu Microsoft Excel nebo pomocí online kalkulaček. Vzhledem ktomu, že je založen na srovnání průměrů, počítáme ho zprincipu unumerických proměnných amusíme se vždy podívat na to, zda jsou naše data normálně rozdělená. Pokud normálně rozdělená nejsou, je třeba použít jinou metodu výpočtu (např. Mann-Whitneyho test nebo Wilcoxonův test – viz Volín, 2007). Na závěr si ještě představme dva způsoby, jak zjišťovat sílu korelačního vztahu. Existují dva koeficienty, které sílu korelace vyčíslují. Otom, který je pro daný výzkum užitečnější, rozhoduje typ korelace. Pokud se korelace zdá být víceméně lineární, to znamená, že platí, že čím vyšší hodnota jedné proměnné, tím vyšší hodnota druhé proměnné (případně nižší, jedná-li se ozápornou korelaci), je pro nás užitečný takzvaný Pearsonův korelační koeficient (značka r). Pokud je korelace nelineární, užívá se takzvaný Spearmanův koeficient pořadové korelace (značka ρ).