scieee AI-readable full text Open interactive document viewer

Práce s empirickými daty : příručka pro studenty Bc. studia ČJL

Chromý, Jan

Full text

Práce sempirickými daty Příručka pro studenty Bc. studia ČJL Jan Chromý Grafická úprava Jan Šerých Sazba DTP Nakladatelství Karolinum Vydání první © Univerzita Karlova vPraze, 2014 © Jan Chromý, 2014 ISBN 978-80-246-2801-1 (online : pdf) Příručka vznikla vrámci projektu Rozvoj a inovace bakalářského studia českého jazyka vÚstavu českého jazyka a teorie komunikace FF UK vPraze (CZ.2.17/3.1.00/33275), který byl realizován vobdobí 2011–2013 za finanční podpory Operačního programu Praha Adaptabilita. Univerzita Karlova v Praze Nakladatelství Karolinum 2014 http://www.cupress.cuni.cz Obsah Úvod 7 1. Dotazník vempirickém výzkumu 10 1.1 Rozsah aformát dotazníku 10 1.2 Instrukce vdotazníku 11 1.3 Otázky vdotazníku 13 1.4 Předvýzkum apilotáž 16 1.5 Administrování dotazníků 18 1.6 Co dělat svybranými dotazníky? 20 2. Proměnné ajejich vztahy 22 2.1 Typy proměnných 22 2.2 Vztahy mezi proměnnými 25 2.3 Hypotézy 26 3. Koho či co zkoumáme? 28 3.1 Vzorek apopulace 28 3.2 Kvótní výběr 29 3.3 Náhodný výběr 30 3.4 Účelový výběr 31 4. Jak zjišťujeme vztahy mezi proměnnými? 33 4.1 Srovnávání statických skupin 34 4.2 Předběžné anásledné pozorování jedné skupiny 35 4.3 Klasický experiment 36 4.4 Následné pozorování na dvou skupinách 37 4.5 Reliabilita avalidita výzkumu 38 4.6 Longitudinální výzkum 40 5. Redukce azkreslení 42 5.1 Redukce prováděné ve výzkumu 42 5.2 Typy zkreslení zhlediska vztahu proměnných 44 5.3 Zkreslení zhlediska toho, co nezohledňujeme 46 6. Další pojmy 49 6.1 Indukce adedukce 49 6.2 Teorie, rámec, model 50 6.3 Výzkumná etika 51 7. Další nástroje sběru dat 54 7.1 Rozhovor jako nástroj sběru dat 54 7.2 Pozorování 56 7.3 Případová studie 59 8. Něco kstatistice 60 8.1 Deskriptivní statistika 60 8.2 Pravděpodobnost vinferenční statistice 65 8.3 Rozdělení dat 67 8.4 Jak zjišťovat pravděpodobnost? 72 Literatura 75 7 Tento text slouží primárně jako základní studijní materiál kpředmětu Práce sempirickými daty, vyučovanému vrámci odborného modulu bakalářského studia oboru Český jazyk aliteratura na Filozofické fakultě Univerzity Karlovy vPraze. Příručka pokrývá základní oblasti (především kvantitativně orientovaného) empirického bádání zaměřeného na jazyk ajeho užívání amohou ji tak využít idalší zájemci otento výzkumný směr. Základem textu je výklad ojednotlivých pojmech apřístupech empirického výzkumu. Rozsah příručky je relativně omezený aněkteré otázky tak budou zpracovány pouze obecně. Vtakových případech však budou čtenáři odkázáni na další, doplňkovou literaturu, zníž se otématu budou moci dozvědět více. Východiska Předkládaná příručka pochopitelně není prvním textem, který se věnuje problematice empirických metod – ať už v jejich obecnosti, anebo vrámci bádání o jazyce. Vevýkladu tak citujeme publikace, z nichž vycházíme, avšak pouze vpřípadě, že se jedná opoznatek, který jiné publikace neobsahují. Mezi práce, znichž vycházíme nejvíce akteré doporučuji čtenářské pozornosti, spadají následující tituly. Obecnou metodologii empirického výzkumu vsociálních vědách představuje kniha Miroslava Dismana Jak se vyrábí sociologická znalost (Disman, 2002). Tato publikace sice jednotlivé problémy ukazuje na sociologickém materiálu – většina poznatků je však přímo aplikovatelná ina výzkum lingvistický, přičemž její velkou výhodou je, že je psána včeštině. Druhou česky psanou příručkou, kterou lze Úvod 8 doporučit, je kniha Jana Volína Statistické metody ve fonetickém výzkumu (Volín, 2007). Jak název napovídá, jedná otext zaměřený nikoliv na empirický výzkum jako takový, ale primárně na jeho část analytickou, na kvantitativní vyhodnocení sebraných dat. Knih ostatistice je ivčeštině řada, právě Volínův text je však vhodné doporučit ztoho důvodu, že všechny statistické procedury ukotvuje na fonetickém materiálu, který by měl být studentům lingvistiky srozumitelný. Zanglicky psaných příruček je třeba vyzdvihnout práci Sebastiana Rasingera Quantitative Research in Linguistics: An Introduction (Rasinger, 2008). Tato publikace se vhrubých obrysech orientuje na tutéž problematiku jako práce Miroslava Dismana, její výhodu pro studenty lingvistiky však lze spatřovat vtom, že je založena na jazykovém materiálu. Zároveň je Rasingerova kniha doplněna onávody základních statistických výpočtů vprogramu Microsoft Excel, což je zvláště užitečné pro ty studenty, kteří nemají přístup kdrahým aplikacím pro statistickou analýzu, jako je například SPSS nebo Statistica, anebo se necítí být dostatečně schopní na relativně náročnou práci sprogramem R (Gries, 2013). Takto na úvod můžeme zmínit ještě dvě publikace, ato příručku Zoltána Dörnieye aTatsuyi Taguchiové Questionnaires in Second Language Research: Construction, Administration, and Processing (Dörniey – Taguchi, 2010) asborník Lii Litosselitiové Research Methods in Linguistics (Litosseliti, 2010). První uvedená publikace se velice podrobně zaměřuje na dotazníkový výzkum vlingvistickém výzkumu, konkrétně ve zkoumání osvojování druhého jazyka. Na závěr knihy je uveden ipraktický bodový seznam jednotlivých kroků, jež je třeba vdotazníkovém výzkumu udělat. Uvedený sborník zase základně představuje jednotlivé konkrétní metody empirických lingvistických analýz. Základní koncepce příručky Knihy, které jsme uváděli vpředchozím oddíle, ale idalší texty, které lze oempirických metodách (ať už vlingvistice nebo vjiných sociálních vědách) najít, postupují – logicky – od nejzákladnějších pojmů ktěm složitějším. Moje zkušenost zvýuky založené na tomto postupu však ukázala problémy spočívající v tom, že „nejzákladnější“ pojem nemusí být pro čtenáře, respektive studenty pojmem nejintuitivnějším. Je tak mnohem pravděpodobnější, že student bude schopen promyslet a pochopit koncepci dotazníku, než například rozdíl mezi nulovou apracovní hypotézou anebo rozdíl mezi jednotlivými typy proměnných. 9 Problém navíc tkví vtom, že jednotlivé základní pojmy je zpočátku třeba si prostě zapamatovat bez patřičného ukotvení, přičemž kpochopení toho, kčemu ty pojmy jsou aproč je nutné si je zapamatovat, dochází až omnoho stránek dál. Vtéto příručce se tak pokusíme opřístup odlišný. Začneme unejintuitivněji pochopitelných jevů apostupně budeme odkrývat pojmy asouvislosti další, méně intuitivní, avšak „základnější“. Pevně věřím, že tento přístup bude ku prospěchu věci astudenty od tohoto probíraného tématu neodradí. Cílem této příručky je vhrubých rysech nastínit základní aspekty empirického výzkumu v lingvistice. Pro úspěšnou realizaci vlastního výzkumu je však třeba zde získané poznatky ještě dále rozvíjet. 16 sdotazníky často tyto položky formulují jako výběr znabízených možností, jež představují určité intervaly (např. věk 20–25 let, 25–30 let atd.), to je však zbytečné. Je třeba mít na paměti, že mít přesnější představu okonkrétním věkovém rozložení se může vyplatit aže navíc tyto intervaly lze zdat, která získáte, dotvořit později, bude-li to třeba. Kromě uvedených typů otázek existují ještě otázky, které jsou specifické svým účelem. Na jedné straně jsou to takzvané kontrolní otázky, jež zjišťují, zda respondent odpovídá skutečně podle svého přesvědčení. Kontrolní otázka se ptá na stejnou věc, na jakou se již předtím tázala jiná otázka, ale jinými slovy. Pokud se zjistí, že se odpovědi na kontrolní otázku ana otázku předchozí liší, je na místě dotazník zvýzkumu vyřadit. Dalším příkladem specifického typu otázek jsou nepřímé otázky. Jejich princip tkví vtom, že se „ptáme oklikou“. Může jít například otzv. projekční otázky, prostřednictvím kterých se respondentů neptáme přímo na jejich názory či postoje, ale na mínění či postoje jiných osob či postav (např. kreslených postaviček vrámci určitého příběhu). Předpokladem je, že se respondent spředstavovanými osobami či postavami podvědomě ztotožní abude ověci vypovídat stejně, jako by v dané situaci byl sám. Posledním typem otázky, který zde uvedeme, je takzvaná dvouhlavňová otázka. Na rozdíl od všech otázek předtím však jde ootázku, jíž se vdotazníku musíme za každou cenu vyhnout. Jde totiž ootázku, která se ptá na dvě věci najednou – vpřípadě, že respondent má na dané dvě věci odlišný názor, nemůže na ni odpovědět. Například bychom se mohli zeptat: Jak často užíváte prostředky bysme abysem? běžně – často – málokdy – nikdy. Vpřípadě, že někdo užívá jednu zvariant zásadně častěji, je pro něj daná otázka nezodpověditelná. 1.4 Předvýzkum apilotáž Když máme sestavený dotazník, neznamená to, že můžeme rovnou začít svýzkumem. Přílišná horlivost by byla velmi kontraproduktivní amohla by vést ktomu, že náš výzkum bude provedený špatně. Ať už je váš dotazník sebejednodušší, musíte ho před samotným provedením sběru dat vyzkoušet. 17 Fázi, kdy zkoušíme, jestli daný nástroj pro sběr dat (nejenom dotazník, ale třeba iexperiment, strukturovaný rozhovor apod.) funguje tak, jak očekáváme, že by fungovat měl, se říká předvýzkum. Jinými slovy, cílem předvýzkumu je identifikovat problémy, které jsou spojeny sdaným nástrojem sběru dat. Provedení předvýzkumu není složité – prostě si výzkum ozkoušíte nanečisto. V případě dotazníkového zkoumání zkrátka rozdáte dotazník menšímu okruhu lidí apožádáte je ovyplnění. Následně snimi jejich vyplnění dotazníku proberete. Hlavním úkolem předvýzkumu (udotazníků) je zjistit: a) zda jsou otázky srozumitelné; b) zda respondent chápe otázky stejně jako badatel; c) zda je jasné, jak dotazník vyplňovat ajak/kde ho odevzdat (tj. zda jsou srozumitelné instrukce); d) jak dlouho vyplnění dotazníku trvá ajestli to není příliš namáhavé. Předvýzkum je zcela zásadní – ipokud předpokládáme, že je námi sestavený dotazník zcela bezproblémový, mohou nás respondenti něčím překvapit (avěřte, že nás taky překvapí). Blízko k pojmu předvýzkum má pojem pilotáž. V některých případech se můžete setkat stím, že jsou tyto pojmy volně zaměňovány, respektive používány synonymně. Jindy se však tyto pojmy rozlišují – pilotáž (nebo také pilotní studie) označuje provedení celého výzkumu na omezenější skupině lidí, na základě kterého se zjistí, jestli výzkum má smysl dělat vširším měřítku. Jinými slovy, zjistí se, jestli získané výsledky jsou nějakým způsobem zajímavé vzhledem ktomu, oco se ve výzkumu snažíme. Pokud nejsou, svýzkumem obvykle nepokračujeme, pokud jsou, má smysl výzkum rozšířit. Jinak řečeno, zatímco vpředvýzkumu ovýsledky jako takové nejde (neanalyzují se), ale jde pouze ootestování nástroje pro sběr dat, vpilotáži jsou výsledky klíčové, což má za následek, že pilotní studie může být vněkterých případech ipublikována. Děláme-li mezi předvýzkumem apilotáží rozdíl, pak navíc zprincipu platí, že pilotáž následuje až po předvýzkumu (viz např. Disman, 2000, kap. 6). Obecně řečeno, předvýzkum (resp. pilotáž) děláme proto, abychom si mohli být víceméně jisti tím, že vnásledném výzkumu budeme skutečně zkoumat to, co zkoumat chceme. Představme si ostatně, že ve výzkumu položíme otázku, které část respondentů bude rozumět jinak než vy jakožto badatelé. To způsobí, že výsledná data se zčásti nebudou vztahovat ke zkoumanému problému – my otom ale nebudeme vědět. To je problém, který se týká validity výzkumu. Výzkum je validní tehdy, když skutečně zkoumá to, co výzkumník deklaruje, že zkoumá. Je však důležité si uvědomit, že validita je mnohem spíše otázkou míry, než otázkou 18 ano – ne. Nikdy (zvláště vsociálních vědách, kam lingvistika spadá) si tak vpravém slova smyslu nemůžeme být jisti, že je náš výzkum zcela validní. Díky předvýzkumu však můžeme validitu našeho výzkumu posílit – můžeme totiž odstranit předtím netušené problémy, které ji snižují. Kproblému validity výzkumu se ještě vrátíme voddílu 5.5. 1.5 Administrování dotazníků Máme-li dotazník hotový aozkoušený zpředvýzkumu, můžeme ho začít rozdávat, tedy administrovat či distribuovat. Existuje více způsobů, jak tak činit akaždý znich má své výhody anevýhody, kterých je třeba si být vědom. Prvním ze způsobů administrace dotazníků je administrace skupině. To je patrně nejtypičtější způsob, jak dotazníky rozdávat. Je to poměrně jednoduché aefektivní: badatel (nebo jeho pomocníci) přijde do určitého auditoria atam rozdá (anásledně vybere) dotazníky. Náklady na výzkum (ať už časové či finanční) jsou relativně malé, protože je takto možné ve velmi krátkém čase získat velké množství dotazníků. Zároveň je vtomto případě poměrně přesvědčivá anonymita výzkumu, atedy i spolehlivost získaných výsledků. Největší problém tohoto způsobu administrace spočívá vtom, že jej není možné použít vždy. Je jasné, že takto můžeme udělat výzkum na studentech či na vojácích, případně na určitých zájmových skupinách, které se hromadně scházejí, ale představte si, že byste takto chtěli zkoumat například Moravany, kteří trvale žijí vPraze. To patrně nebude dost dobře proveditelné. Uadministrace skupině je vhodné upozornit ještě na jeden fenomén, typický pro české školní prostředí: Pokud rozdáte dotazník například na přednášce anebo při hodině na střední škole, mohou mít studenti tendenci od sebe opisovat, ato ivpřípadě, že se nejedná otest jejich znalostí, ale prostě ovýzkum toho, co si očem myslí. Druhým způsobem rozdávání dotazníků je administrace jeden na jednoho. Jedná se ozpůsob, který je časově (atedy ifinančně) náročnější než administrace skupině. Navíc si jistě dovedete představit, jak obtížné může být přinutit lidi ke spolupráci (vzpomeňte si, kolikrát vás na ulici chtěl někdo zastavit, jestli byste měli pár minut avyplnili dotazník). Má však isvé velké výhody. Vprvé řadě je to způsob, který je aplikovatelný takřka na jakékoliv množině lidí, kterou můžeme chtít zkoumat. Záro- 19 veň, administrace jeden na jednoho zaručuje silnější validitu, jelikož badatel nebo jeho pomocník může cokoliv dovysvětlit anemůže tak dojít knepochopení otázek. Pokud už navíc někoho přesvědčíte, aby vám dotazník vyplnil, pak to velice pravděpodobně učiní (tj. nenechá část dotazníku nevyplněnou), ato poměrně poctivě. Velkou výhodou tohoto způsobu sběru dat vrámci lingvistiky navíc je to, že badatel či jeho pomocník mohou odpovědi zapisovat sami. To se vyplácí zejména vdialektologických či sociolingvistických výzkumech, kde se odpovědi zapisují složitější (např. fonologickou) transkripcí, kterou neškolený respondent vůbec neovládá. Pochopitelně je to taky jediný způsob, jak pomocí dotazníků zkoumat negramotné či pologramotné jedince. Třetím typem dotazníkového sběru dat je administrace online, tedy prostřednictvím e-mailu či internetové stránky. Tento způsob administrace je vzhledem kdnešním technickým podmínkám poměrně často užívaný, je velmi efektivní ačasově ifinančně nenáročný. Mohlo by se zdát, že se jedná ozpůsob takřka ideální, ale vřadě výzkumů to tak není. Vprvé řadě je problém stím, jak oslovit lidi, které chceme zkoumat. Jestliže na ně nemáme přímý kontakt, je to velice komplikované. Navíc, pokud neposíláme dotazníky jako přílohu e-mailu, nemáme ani jistotu, kdo nám dotazníky vyplnil, což je závažný problém zhlediska stavby vzorku (viz kap. 4). Zejména vlingvistických výzkumech často potřebujeme, aby respondent vyplnil dotazník podle svého vlastního povědomí, ale dotazník administrovaný online nám nezaručuje, že si respondent například neotevřel slovník, nezjistil si otématu více informací atd. Zkrátka, jako způsob sběru dat je tento typ administrace krajně nespolehlivý aje lepší se mu vyhnout. Uchýlit se kněmu může mít smysl vpřípadech, když se potřebujeme dostat ke specifické skupině lidí, například krodičům dětí ve věku 2–3 roky. Ti se často znají navzájem amohou informaci odotazníku šířit mezi sebou (např. přes Facebook apod.) amůžeme tak získat relativně slušný počet dotazníků. Vpřípadě, že zkoumáme například porozumění slov udospělých jedinců, jedná se ozpůsob administrace vysloveně nefunkční. Dodejme, že pro administraci tohoto typu můžeme dnes využít řadu internetových stránek, na nichž si můžeme bezplatně vytvořit slušně vypadající dotazník (např. Google Forms). Posledním typem sběru dat vdotazníkovém výzkumu je administrace prostřednictvím pošty. Vdnešní době se tento způsob administrace užívá jen velmi omezeně, protože je poměrně nákladný azároveň je spojen srelativně nízkou návratností. Zároveň je pochopitelně nutné znát poš- 20 tovní adresy jedinců, které chceme do výzkumu zahrnout, což možnost využití tohoto typu sběru dat relativně limituje. Vkaždém případě, při uplatnění tohoto způsobu administrace je vhodné myslet na dvě věci. Vprvé řadě bychom respondentům měli poslat známku, aby nám mohli dotazník poslat zpět, aniž by to museli sami platit. Vdruhé řadě je dobré se zaměřit na zvýšení návratnosti. To můžeme udělat například tak, že vyhlásíme, že vylosovaní respondenti vyhrají určitou sumu peněz anebo nějaký lákavý dárkový předmět. To obvykle návratnost zvyšuje, na druhou stranu to však může způsobit vyšší finanční náročnost výzkumu. 1.6 Co dělat svybranými dotazníky? Aby bylo možné analyzovat výsledky dotazníků, je třeba zakódovat jednotlivé odpovědi. Ideální pro tyto účely je tabulkový procesor (např. Microsoft Excel či Open Office Calc). Důležité je přitom kódovat výsledky tak, abyste mohli zrekonstruovat, jak každý dotazník vypadal. Jinými slovy, je třeba, aby byl každý dotazník zákódován zvlášť. Konvenčně se data zaznamenávají tak, že na každém řádku je jeden dotazník ajednotlivé sloupce pak představují jednotlivé otázky. Zdůvodu přehlednosti abezproblémové analýzy je rovněž vhodné, aby způsob kódování byl co nejjednodušší. Pokud například používáte Lickertovu škálu achcete zjišťovat, jaká je průměrná odpověď, je důležité, abyste výsledky zakódovali číselně (tj. zcela souhlasím = 1, spíše souhlasím = 2 atd.). Číselně můžete kódovat i jiné výsledky, například odpovědi v rámci multiple-choice otázek – to však není nutné, principiálně postačí co nejjednodušší písmenné zkratky jednotlivých možností. Vpřípadě, že používáte možnost odpovědi „nevím“ (případně „nemám názor“ apod.), není vhodné používat nulu (jako číslo by se vám pak snadno mohla započítat do průměru adalších výpočtů). Poté, co výsledky zakódujete, je potřeba kódování ještě jednou zkontrolovat. To je pochopitelně práce velmi nevděčná, ato oto víc, že trvá obvykle déle než kódování samotné. Vězte však, že kontrola kódování by měla vašemu výzkumu prospět. Pokud je totiž váš výzkum rozumný askutečně odhaluje cosi zajímavého ve světě kolem nás, je pravděpodobné, že všechny špatně zakódované výsledky způsobují, že výzkum nevychází tak „hezky“ apřesvědčivě. Jinými slovy, můžeme předpokládat, že špatné zakódování výsledků jinak dobrého výzkumu se projevuje vtom, že je ve vašich datech více údajů, které jsou svaší teorií vnesouladu, než 21 by jich bylo, kdyby byly výsledky zakódovány správně. Při tak nevděčné práci, kterou kontrola kódování jistě je, se tak můžeme alespoň něčím utěšovat. Vdotazníkovém výzkumu je poměrně obvyklé, že narazíte na dotazníky, které byly vyplněny nesprávně (ipřesto, že jste si dali záležet na instrukcích audělali předvýzkum) anebo ve kterých nebyly některé povinné otázky zodpovězeny. Vtakovém případě je třeba být přísný apochybné dotazníky vyřazovat. Vněkterých případech můžeme zvážit, zda lze některý zúdajů doplnit. Například vjednom našem výzkumu bylo možné doplnit nevyplněnou položku „mateřský jazyk“ na základě toho, že vpoložce pro další jazyky, které respondent ovládal, byla uvedena angličtina, němčina, slovenština apolština, ale nikoliv čeština acelý dotazník byl česky. Ve většině případů však odpověď doplnit při nejlepší vůli nemůžeme. Poslední věc, kterou je třeba mít na paměti, je archivace dotazníků. Děláte-li výzkum, který poté publikujete (ať už jako odborný článek nebo například jako součást diplomové práce), měli byste být kdykoliv schopni doložit, že jste si svoje výsledky nevymysleli. Vpřípadě, že je dotazníků hodně, je vcelku pochopitelné, že je nechcete skladovat ve fyzické podobě – vhodné je proto sebrané dotazníky naskenovat aarchivovat elektronicky. 22 2. Proměnné ajejich vztahy Vpředchozí kapitole jsme si vhrubých rysech představili, jak vypadá dotazník azčeho je složen. Nyní se podíváme trochu hlouběji abudeme se zabývat tím, co se vrámci výzkumu (ať už dotazníkového nebo jiného) vlastně zkoumá. Obecně je to jednoduché – ve výzkumu vždy zkoumáme vztah nějakých proměnných, přičemž musí být alespoň dvě. 2.1 Typy proměnných Proměnná je určitá abstraktní jednotka (respektive určitá vlastnost), která nabývá alespoň dvou hodnot. Zkoumanými proměnnými například může být věk avelikost slovní zásoby – ve výzkumu, který sleduje vztah těchto proměnných, se pak mimo jiné můžeme ptát, jestli platí, že starší mluvčí mají větší slovní zásobu než mladší mluvčí apod. Nebo si můžeme vymezit například proměnné slovesný čas avidová interpretace azkoumat, jestli budou určitá vybraná obouvidová slovesa interpretována dokonavě nebo nedokonavě vpřípadě, že budou použita vpréteritu. Proměnné můžeme klasifikovat dvěma základními způsoby: a) zhlediska jejich kvality; b) zhlediska jejich vztahu. Zhlediska kvality rozlišujeme takzvané kvalitativní anumerické proměnné. Kvalitativní proměnné se dále dělí na nominální a řadové, numerické na poměrové aintervalové. Nominální proměnné jsou nejjednodušší – jejich hodnoty pouze poukazují na příslušnost kurčité skupině či členství vurčité kategorii. Zprincipu jsou nespojité (diskrétní), mezi jednotlivými hodnotami není plynulý přechod, nýbrž jsou mezi nimi striktní hranice. Nejčastěji uvádě- 23 nou nominální proměnnou je pohlaví. Tato proměnná má dvě hodnoty, tedy muž ažena. Každou osobu můžeme klasifikovat tak, že spadá do jedné z těchto kategorií. I kdybychom vytvořili ještě kategorie další (například transsexuál), nebude se na tom nic měnit, nepůjde oplynulý přechod mezi kategoriemi. Vlingvistice je zřejmou nominální proměnnou například zájmeno voslovení – to může nabývat hodnot ty, vy aVy. Složitějším příkladem jazykové nominální proměnné může být slovní druh. Včeštině jich základně vymezujeme deset, ale zkurzů morfologie víme, že to není nic daného (například lze jako specifický slovní druh chápat takzvaná predikativa). Jinými slovy, hodnoty proměnných nejsou dány univerzálně, ale závisí na pojetí, které si badatel zvolí. Ktomu se ještě zanedlouho vrátíme. Druhým typem kvalitativních proměnných je proměnná řadová (někdy též „ordinální“). Hodnoty řadové proměnné stejně jako hodnoty proměnné nominální poukazují na členství vkategorii či skupině ajsou zprincipu diskrétní. Rozdíl však spočívá vtom, že tyto hodnoty můžeme na základě určitého klíče seřadit, jinými slovy, že můžeme říct, že je nějaká hodnota vyšší než jiná. Nemůžeme však říci, okolik nebo kolikrát je vyšší. Typickým příkladem řadové proměnné je dosažené vzdělání. Jednotlivé osoby můžeme klasifikovat na základě toho, jaké nejvyšší ukončené vzdělání mají amůžeme zároveň říci, že středoškolské vzdělání smaturitou je vyšší hodnota než základoškolské vzdělání, ale zároveň, že je to nižší hodnota než vysokoškolské vzdělání. Hodnoty řadových proměnných můžeme zjišťovat prostřednictvím škál. Například lze vymezit proměnnou subjektivní hodnocení projevu, která bude mít hodnoty velmi dobrý – dobrý – špatný – velmi špatný. Je zřejmé, že můžeme říci, že velmi špatný je nižší stupeň než dobrý apod., ale říct, že velmi špatný je třikrát nižší nebo něco podobného, by nedávalo smysl. Poměrové (někdy též „podílové“) proměnné jsou prvním typem numerických proměnných. Na rozdíl od proměnných kvalitativních unich lze určit, okolik je určitá hodnota vyšší nebo nižší než jiná, azároveň, kolikrát je vyšší či nižší. Typickou proměnnou tohoto typu je věk. Pochopitelně můžeme říct, že určitá osoba je ox let starší než jiná nebo že je xkrát starší. Důležité je, že všechny numerické proměnné mohou být kontinuální (spojité), ale idiskrétní (nespojité). Kontinuální proměnnou je kupříkladu právě věk, protože mezi jednotlivými hodnotami jsou zcela plynulé přechody. Diskrétní poměrovou proměnnou je například počet slov ve větě. Ten nabývá hodnot, které se vyjadřují přirozenými 24 čísly, jež mezi sebou plynulé přechody nemají – ve větě může být například 5, 6, 7 nebo 8 slov, ale nikdy jich zprincipu nemůže být 5,513 apod. Poměrovou proměnnou sjistotou poznáte tak, že může nabývat pouze kladných hodnot. Asi nejsložitější na pochopení jsou takzvané intervalové proměnné. Ty jsou rovněž numerické, můžeme unich určit, okolik je která hodnota vyšší nebo nižší než jiná, ale zprincipu unich nelze stanovit, kolikrát je vyšší či nižší. Není to možné proto, že se jedná oproměnné, které nemají takzvanou „přirozenou nulu“ (tj. jejich nulová hodnota neoznačuje vpravém slova smyslu „nulovost“). Jako typický příklad se uvádí teplota ve stupních Celsia. Hodnota 0 °C je určena jako bod tání ledu, nejedná se tak vpravém slova smyslu onulovou teplotu. Můžeme sice říci, že 16 °C je o8 °C vyšší hodnota než 8°C, ale bylo by mylné, kdybychom řekli, že je to dvakrát vyšší teplota. To je dobře vidět na srovnání steplotou ve stupních Kelvina, což je poměrová proměnná, jelikož je zde přirozená nula (tzv. absolutní nula), amá stejně velké jednotlivé stupně jako Celsiova stupnice. Tím, že má Kelvinova stupnice přirozenou nulu, můžeme říct, že 100 Kje dvakrát nižší hodnota než 200 Kazároveň, že je o100 K nižší. Našich 16 °C je rovno 289,15 Ka8 °C je rovno 281,15 K. Ztoho je zřejmě vidět, že 16 °C není oproti 8 °C reálně dvakrát vyšší teplota, atedy že teplota ve stupních Celsia není proměnnou poměrovou. Intervalovou proměnnou poznáte tak, že může mít záporné hodnoty. Zároveň platí, že na tento typ proměnných vlingvistice narážíme jen zřídka. Při přemýšlení otypech proměnných zhlediska jejich kvality je důležité si uvědomit, že proměnné nejsou „dány shůry“, ale to, ojaký typ se vkonkrétním případě jedná, záleží do značné míry na badateli. Jinými slovy, ve světě kolem nás je nějaký zajímavý jev, jehož fungování chceme popsat. Vytvoříme si tedy určitou proměnnou amusíme si stanovit, jaké hodnoty může nabývat. Tomuto procesu se říká operacionalizace ajedná se ovelmi důležitý krok vrámci jakéhokoliv výzkumu. To, jakým způsobem si jev operacionalizujeme, předznamenává možnosti našeho výzkumu, tedy to, co vlastně můžeme zjistit. Charakteristické je, že různé proměnné můžeme uchopit různě. Například věk můžeme chápat jako numerickou proměnnou, ale můžeme ji operacionalizovat prostřednictvím věkových kategorií (např. 20–25 let, 26–30 let) jako řadovou. Souhlas stvrzením můžeme uchopit jako řadovou proměnnou (zcela souhlasím – spíše souhlasím – spíše nesouhlasím – zcela nesouhlasím), ale ijako nominální proměnnou (ano – ne). 25 Jak jsme uvedli výše, můžeme proměnné klasifikovat rovněž podle jejich vztahu. Vtakovém případě rozlišujeme mezi závislou anezávislou proměnnou. Nezávislá proměnná představuje předpokládanou příčinu, závislá proměnná předpokládaný následek. Ve výzkumu pak zjišťujeme, zda změna hodnoty nezávislé proměnné způsobuje změnu hodnoty závislé proměnné. Můžeme například zkoumat vztah proměnných znalost psané češtiny avěk učeských neslyšících. Jako nezávislou proměnnou si stanovíme věk ajako závislou znalost psané češtiny amůžeme se ptát, zda se liší znalost psané češtiny učeských neslyšících vzávislosti na jejich věku. Na závěr tohoto oddílu ještě uveďme, že proměnné můžeme ještě klasifikovat na základě toho, čeho se týkají. Můžeme vyčlenit jazykové proměnné (např. tvary koncovky vokativních tvarů mužských příjmení zakončených v1. p. sg. na -a, postavení přívlastku vantepozici či postpozici, délka věty ve slovech apod.), proměnné sociální (věk, etnicita, sociální status) či jiné (fyziologické, neurologické apod.). 2.2 Vztahy mezi proměnnými Ve výzkumu nás vždy zajímá vztah alespoň dvou proměnných. Zkoumat jednu proměnnou sice nemusí být úplně nuda, ale osvětě kolem nás se toho moc nedozvíme. Mohli bychom například různým lidem měřit úroveň znalosti cizích slov. To nám však samo osobě vůbec nic neřekne opodstatě toho, proč se urůzných lidí tato úroveň liší, jakým způsobem se cizí slova učíme atd. Zkrátka, zjistíme pouze určitý údaj, nic víc. Teprve tehdy, když se podíváme na vztah této proměnné sproměnnými dalšími, můžeme začít vyvozovat určité závěry otom, jak funguje svět kolem nás. Například můžeme dojít ktomu, že lidé smenší znalostí cizích slov mají spíše nižší vzdělání, že pochází spíše ze sociálně slabších vrstev apod. Vztahy mezi proměnnými mohou být dvou typů: a) korelace; b) kauzalita. Vprincipu nejběžnější však je, že mezi proměnnými žádný (alespoň přímý) vztah není. Například můžeme předpokládat, že velikost letošní úrody banánů vNigérii nebude vpřímém vztahu sprůměrnou délkou věty ve slohových pracích letošních českých maturantů. Ve výzkumu se však snažíme oto, abychom nějaký vztah našli, respektive abychom na základě dat, která jsme získali, mohli srelativně velkou jistotou tvrdit, že mezi zkoumanými proměnnými vztah existuje. 32 pochopitelně nabízí otázka, nakolik můžeme zvýsledků, které získáme popsáním vzorku, zobecňovat na celou populaci. Přísně vzato zobecňovat nemůžeme vůbec. Vsociálních vědách však vtomto směru existuje určitá tolerance, která je dána tím, že se vněkterých případech prostě nemůžeme opřít okvótní, ani onáhodný výběr anic jiného než výběr účelový nám tak nezbývá. Při využití účelového výběru je velká zodpovědnost na badateli. To, že sám rozhoduje otom, kdo nebo co se dostane do vzorku, pochopitelně neznamená, že by měl vylučovat ty jednotky, které neodpovídají tomu, co chce ve výzkumu dokázat. Naopak, badatel se musí snažit, aby výsledky, které na vzorku zjistí, skutečně reprezentovaly danou populaci, amusí tedy při výběru jednotek postupovat velmi uvážlivě. Důležité pak je, aby byl vzorek dostatečně velký – platí zde „dismanovské“ pravidlo: čím větší vzorek, tím větší je jeho shoda spopulací. K účelovému výběru se obvykle přistupuje například v sociolingvistických či dialektologických výzkumech. Často se pro tyto účely využívá takzvaná technika sněhové koule. Vtakovém případě se vzorek sestavuje tak, že jednotliví účastníci výzkumu doporučují další možné účastníky. Výhoda této techniky spočívá vtom, že účastníci mají menší tendenci odmítat účast ve výzkumu (badatele doporučil jejich známý, což je určité ujištění toho, že se nejedná onic nekalého, čeho by se měli obávat). Tento výzkum se vyplatí zejména tehdy, když zkoumáte fungování jazyka vrámci sociálních sítí (tím není myšlen Facebook apod., ale reálné sociální sítě vběžném životě). Jinými slovy, když zkoumáte, jak se užívá jazyk vzávislosti na tom, kdo je ským reálně vkontaktu. Výhodné je to rovněž tam, kde vůbec neznáte dané společenství. Například si můžete představit, že přijedete do nějakého místa, kde budete chtít provést dialektologický nebo sociolingvistický výzkum na základě rozhovorů. Sněkým se tam seznámíte, provedete rozhovor azeptáte se na další možné účastníky výzkumu. Za těmi pak přijdete, že vás posílá první osoba atd. Nakonec se seznámíte svelkým počtem místních azískáte mnoho cenných dat. 33 4. Jak zjišťujeme vztahy mezi proměnnými? Abychom mohli zjistit, zda je mezi proměnnými nějaký vztah, musíme provést alespoň dvě měření či zjištění, která srovnáme. Vopačném případě nemůžeme ovztahu proměnných nic říct. Představte si, že například ve svém výzkumu zjistíte, že muži zPrahy používají vurčitém situačním kontextu tvar bysme v80 % možných případů. Takový poznatek je sice svým způsobem zajímavý, ale sám osobě nestačí. Abychom mohli ovariaci mezi bychom abysme něco říci, potřebujeme ještě alespoň jedno měření. Pokud nás bude zajímat vliv nezávislé proměnné pohlaví, potřebujeme zjistit, jak užívají tyto tvary ženy. Vpřípadě, že nás bude zajímat vztah mezi regionem původu mluvčího adanými variantami, musíme zjistit, jak tyto varianty užívají mluvčí z jiných míst, než je Praha. Rovněž můžeme zjištovat roli situace azkoumat, nakolik se užívání bychom/bysme umužů zPrahy mění, pokud se ocitnout vjiném kontextu. Jinými slovy, potřebujeme alespoň dvě měření či zjištění, která se liší vhodnotách nezávislé proměnné, azjišťujeme, zda se zde liší (anakolik se liší) hodnoty závislé proměnné. Na tomto základě pak můžeme (pomocí statistických metod) vyvozovat, zda se jedná okorelaci, kauzální vztah anebo zda mezi proměnnými žádný vztah neexistuje. Důležité je, že nezávislou proměnnou lze vřadě případů takzvaně manipulovat. Manipulace proměnných vpodstatě spočívá vtom, že kontrolovaně měníme jejich hodnoty. Například bychom mohli měřit tempo řeči vzávislosti na hladině alkoholu vkrvi. Urůzných osob uměle „nastavujeme“ neboli „manipulujeme“ tuto hladinu a zkoumáme, jak se mění tempo řeči. Existuje několik postupů, jakým způsobem se různých měření dobrat. Vnásledujících oddílech si je představíme. 34 4.1 Srovnávání statických skupin Disman (2002, s. 33) nazývá tento typ zkoumání „předexperimentální vzorec“. Činí tak ztoho důvodu, že se jedná opostup, kdy hodnoty nezávislé proměnné nemanipulujeme. Princip totiž spočívá vtom, že předem máme dvě skupiny, onichž víme, že se liší vhodnotě nezávislých proměnných. Tyto skupiny pak podrobíme výzkumu azjistíme, nakolik se liší vhodnotách závislé proměnné. Pokud je tento rozdíl statisticky významný, můžeme dojít ktomu, že mezi nezávislou azávislou proměnnou je určitý vztah. 1 2 Obr. 1: Schéma srovnávání statických skupin. Máme dvě skupiny, které se nějak liší akteré srovnáváme. Představme si, že například mezi zahraničními studenty, kteří se učí česky, máme skupinu lidí, kteří kromě standardního kurzu absolvovali ještě doplňkový intenzivní kurz češtiny. Zároveň zde máme druhou skupinu, která absolvovala pouze kurz standardní. Na tomto základě si můžeme položit otázku, nakolik je doplňkový kurz účinný, asrovnávat úroveň znalosti češtiny vobou skupinách prostřednictvím určitého testu jazykových znalostí. Vrámci takového zkoumání pak můžeme zjistit, že lidé, kteří absolvovali doplňkový kurz, jsou vtestu úspěšnější aže tedy mají lepší znalost češtiny. Nabízí se závěr, že doplňkový kurz je tedy vskutku důležitý aže významně pomáhá rozvoji znalostí českého jazyka mezi zahraničními studenty. Takový závěr je však značně problematický anemusí vůbec odpovídat realitě. Vrámci tohoto postupu totiž například nemůžeme vědět, zda rozdíly mezi skupinami neexistovaly už dříve (mohlo se stát, že se na doplňkový kurz přihlásili studenti, jejichž znalosti češtiny byly už předtím lepší) anemůžeme vyloučit ani to, že zde hrají roli nějaké vnější příčiny (například mohli mít lidé ve skupině, která absolvovala doplňkový kurz, očeštinu obecně vyšší zájem, mohli mít větší motivaci naučit se česky apod.). Jinými slovy, rozdíl mezi skupinami nemůžeme jednoduše přičítat absolvování nadstavbového kurzu. Ikdyž tedy tento výzkumný postup není příliš dobrý, protože závěry, které na jeho základě získáme, jsou velmi vratké, jde opostup relativně běžný, alespoň vlingvistice. Srovnávání statických skupin provádíme 35 obvykle například vdialektologii, kdy srovnáváme různá nářečí, anebo třeba tehdy, když srovnáváme jazyk vurčitých periodikách oproti periodikům jiným, nebo například styl mluvených projevů proti psaným atd. Užití tohoto postupu má podobné důvody jako užití účelového výběru při stavbě vzorku – je vynuceno tím, že jiný postup není vdaném případě možný. 4.2 Předběžné anásledné pozorování jedné skupiny Prvním postupem, vrámci něhož badatel manipuluje hodnoty nezávislé proměnné, je předběžné anásledné pozorování jedné skupiny. Princip je zde velmi jednoduchý. Nejprve na dané skupině provedeme pozorování či měření apoté změníme hodnotu nezávislé proměnné (manipulujeme ji). Následně provedeme druhé pozorování. Pokud zjistíme, že se první adruhé pozorování statisticky významně liší (viz kapitola8), můžeme předpokládat, že daná nezávislá azávislá proměnná jsou ve vztahu. 1 ∼ 2 Obr. 2: Schéma předběžného anásledného srovnání jedné skupiny. Skupinu otestujeme, poté manipulujeme nezávislou proměnnou apoté ji otestujeme znovu. Vraťme se knašemu příkladu stempem řeči a hladinou alkoholu vkrvi. Vpřípadě uplatnění tohoto postupu bychom si sestavili určitý vzorek lidí avrámci stanoveného řečnického úkolu bychom ukaždého jedince změřili průměrné tempo jeho řeči. Poté bychom všem aplikovali alkohol až na určitou zvolenou hladinu (například 1 promile) anásledně bychom opět změřili průměrné tempo řeči každé testované osoby. Pokud se tempo řeči sníží (nebo naopak zvýší), můžeme předpokládat, že hladina alkoholu vkrvi skutečně vdané populaci ovlivňuje tempo projevu. Tato interpretace je však problematická podobně jako usrovnávání statických skupin. Ipři uplatnění tohoto postupu totiž narážíme na to, že nemůžeme vyloučit nějakou vnější příčinu. Vnašem případě je například velmi pravděpodobné, že svou roli vedle alkoholu hraje iúnava. Jak přesně však únava tempo řeči ovlivňuje, nejsme schopni vrámci takto realizovaného výzkumu říci. Vztah mezi tempem řeči aalkoholem vkrvi je tak sporný. 36 4.3 Klasický experiment Tento postup je ve svém principu podobný předchozímu vtom, že rovněž využívá předběžné anásledné pozorování. Rozdíl však spočívá vtom, že skupina není pouze jedna, ale jsou dvě: experimentální akontrolní skupina. Nezávislá proměnná je zde manipulována: experimentální skupina je vystavena určité hodnotě nezávislé proměnné, kontrolní skupina je vystavena jiné hodnotě nezávislé proměnné. Důležité je, aby jednotlivé jednotky v rámci vzorku byly do těchto skupin rozděleny náhodně. 1 ∼ 1 2 2 Obr. 3: Schéma klasického experimentu. Máme dvě náhodně rozdělené skupiny, obě otestujeme, pak odlišně manipulujeme nezávislou proměnnou uobou skupin apoté je znovu otestujeme. Vnašem případě salkoholem atempem řeči bychom tak postupovali následovně: Nejprve bychom si vzorek náhodně rozdělili na dvě skupiny. Jednotlivým osobám vkaždé skupině bychom změřili tempo řeči, poté bychom osobám vexperimentální skupině aplikovali alkohol do určité stanovené míry (osoby vkontrolní skupině by alkohol nedostali) anakonec bychom opět utestovaných osob zobou skupin zjistili, jaké je jejich tempo řeči. Proč to dělat tak komplikovaně? Je to ztoho důvodu, že se může snadno stát, že kontrolní skupina bude mít vdruhém měření rovněž nižší tempo řeči, než měla vpředchozím měření. Jinými slovy tak zjistíme, že zde hraje roli určitá proměnná, kterou do výzkumu nezahrnujeme (např. výše zmiňovaná únava). Klasický experiment je tak na rozdíl od předběžného anásledného pozorování jedné skupiny výhodný vtom, že jeho prostřednictvím zjistíme, zda ve výzkumu nenastalo nějaké zkreslení, zda nám neutekla nějaká proměnná, která ve zkoumaném vztahu hraje důležitou roli. Jinými slovy, tento relativně složitý postup využíváme za tím účelem, aby se odhalil dopad jiných proměnných, než jsou nezávislé proměnné, které zkoumáme. Vlingvistice je využití klasického experimentu relativně omezené, protože jde opoměrně komplikovaný ačasově náročný postup. Můžeme si však představit, že bychom ho použili při zkoumání učení se cizímu jazyku. Například bychom mohli zjišťovat funkčnost určité nově vymy- 37 šlené metody výuky na našich zahraničních studentech. Postupovat budeme tak, že nejprve náhodně rozdělíme naše studenty dodvou skupin apoté otestujeme úroveň jejich znalosti češtiny. Experimentální skupinu pak vyučujeme prostřednictvím nové metody, ukontrolní skupiny použijeme standardní metodu výuky. Po skončení kurzu obě skupiny opět otestujeme zhlediska jejich znalostí češtiny asrovnáme, jak se od sebe obě skupiny liší. Můžeme předpokládat nárůst znalostí češtiny vobou skupinách, pokud však vexperimentální skupině bude statisticky významně vyšší, lze se oprávněně domnívat, že nová metoda je skutečně účinnější než metoda standardní. 4.4 Následné pozorování na dvou skupinách Poslední výzkumný postup, který si uvedeme, je vzásadě totožný sklasickým experimentem, avšak stím rozdílem, že zde uobou skupin odpadá předchozí zkoumání. Vychází se přitom zpředpokladu, že pokud jsou kontrolní aexperimentální skupina rozděleny náhodně, platí, že následné pozorování na kontrolní skupině je ekvivalentní shypotetickým předběžným pozorováním na experimentální skupině. Jinými slovy, můžeme předpokládat, že rozdíl mezi zjištěním na experimentální skupině ana kontrolní skupině skutečně reflektuje vliv dané nezávislé proměnné azároveň, že je zde vyloučen vliv nějaké vnější příčiny (respektive je na obě měření identický). Vlingvistice se jedná osnad nejpoužívanější způsob experimentálního výzkumu, protože je vzásadě stejně účinný jako klasický experiment, avšak je jednodušší na uplatnění. Například vnašem výzkumu vlivu připravenosti anepřipravenosti na produkci psaných textů (Chromý – Milička, 2012) jsme vzorek cca 50 lidí rozdělili náhodně do dvou skupin atestované osoby zobou skupin měly za úkol popsat děj filmu, který jsme jim pouštěli. Experimentální skupina měla 5 minut na přípravu apromyšlení toho, co napíšou, kontrolní skupina film popisovala bez přípravy. Následně jsme zkoumali, včem se liší projevy vrámci obou Obr. 4: Následné pozorování na dvou skupinách. Vzorek rozdělíme náhodně na dvě skupiny, ukaždé znich odlišně manipulujeme nezávislou proměnnou aotestujeme je. 1 2 38 skupin. Vsouvislosti stím je dobré podotknout jednu věc – často je následné měření na dvou skupinách jediným solidním postupem, jak výzkum realizovat. Vuvedeném případě například nepřicházelo vúvahu, že bychom mohli udělat předchozí měření, protože bychom nemohli využít stejný film (při druhém měření by už byli připraveni všichni jedinci). 4.5 Reliabilita avalidita výzkumu Abychom si mohli být jisti tím, že mezi dvěma proměnnými skutečně existuje určitý vztah, musí nám při zopakování výzkumu za stejných podmínek vycházet stejné výsledky. Pokud by nám totiž vycházelo něco jiného, je prakticky jisté, že jsou ve hře nějaké proměnné, které nesledujeme akteré jsou zhlediska vztahu mezi zkoumanými proměnnými důležité. V případě, že by při opakovaných pozorováních vycházely odlišné výsledky, znamená to, že náš výzkum není reliabilní. Reliabilita výzkumu je tedy vlastně jeho spolehlivost. Reliabilita námi zvoleného výzkumného postupu se pochopitelně dá určitým způsobem zjišťovat. Prvním ze způsobů je tzv. metoda opakovaného měření (angl. test-retest method), která spočívá vtom, že výzkum zopakujeme aporovnáme výsledky. Vněkterých případech pochopitelně nemůžeme metodu opakovaného měření použít. Zejména je tomu tak tehdy, když zkoumáme jevy, které podléhají relativně rychlým změnám včase, například postoje kurčitým jazykovým jevům. Vjiných případech to však možné je. Badatelé vsociálních vědách přesto – zpraktických důvodů vcelku pochopitelně – reliabilitu svého výzkumu tímto způsobem obvykle neověřují. Výzkumy bývají relativně náročné, ato jak zhlediska času, tak zhlediska financí adělat takový výzkum dvakrát znamená tuto náročnost zdvojnásobit. Většinou tak na tento typ ověření reliability narážíme tehdy, když někdo zopakuje (takzvaně replikuje) výzkum někoho jiného (typicky třeba psycholingvistický výzkum provedený původně na angličtině někdo zopakuje stím, že jako materiál zvolí češtinu). Druhým způsobem zjišťování reliability je takzvaná metoda půlení (angl. split-half). Tato metoda spočívá vtom, že rozdělíme jednotlivé položky vnašem výzkumu do dvou skupin, spočítáme výsledky obou skupin a vzájemně je srovnáme. To pochopitelně nejde použít vždy, protože položky musí být určitého typu. Například můžeme využívat takzvanou úlohu detekce slova (testované osobě se na obrazovce objeví 39 slovo aúkolem je, zmáčknout určité tlačítko, pokud se jedná oreálně existující slovo, ajiné tlačítko, pokud se oslovo daného jazyka nejedná) amůžeme zjišťovat, jestli je nějaký rozdíl mezi reálnými slovy (např. prase), pseudoslovy (slova formálně blízká k existujícím, např. praso) aneslovy (formálně zcela nesmyslná slova, např. easrp). Pokud bychom měli například 20 reálných slov, 20 pseudoslov a20 neslov, mohli bychom reliabilitu zkoumat tak, že vždy porovnáme reakční časy poloviny slov daného typu sdruhou polovinou téhož typu (např. reálná sreálnými, pseudoslova spseudoslovy aneslova sneslovy). Pokud bychom zjistili, že se reakční časy mezi polovinami různí, znamenalo by to, že test není reliabilní aže je ve výzkumu přítomno významné zkreslení. Poslední metodou ověřování reliability, kterou si zde uvedeme, je tzv. metoda paralelního měření. Tu můžeme využít tehdy, pokud máme dvě verze téhož výzkumného nástroje (např. dvě verze testu znalosti cizího jazyka). Metoda spočívá vtom, že zkoumání provedeme oběma způsoby avýsledky srovnáme. Spojmem reliabilita úzce souvisí pojem validita, který už jsme zmínili vkap. 1.4. Validitu můžeme posuzovat zrůzných hledisek, přičemž základně rozlišujeme tři druhy validity: a) obsahovou; b) kriteriální; c) konstruktovou. Obsahová validita vychází ze znalostí badatele nebo skupiny badatelů aspočívá ve fundovaném zhodnocení toho, zda způsob testování skutečně zachycuje to, co je předmětem výzkumu. Obsahová validace se tak především zaměřuje na to, zda je zkoumaný jev ve výzkumu zachycen ve své úplnosti (nevalidní by ztohoto hlediska byl například výzkum postojů kobecné češtině, který by nezahrnoval otázku na tvar bysme). Pod pojem obsahové validity se někdy řadí itzv. zjevná validita (angl. face validity), která je založena primárně na intuici (badatele anebo skupiny badatelů). Výzkum je zjevně validní tehdy, pokud se nám zdá, že výsledky skutečně odráží zkoumanou realitu. Tento typ validity je pochopitelně značně nespolehlivý – Disman dokonce píše, že zjevná validita je „eufemismus pro situaci, kdy kontrola validity nebyla provedena vůbec“ (Disman, 2000, s. 67). Kriteriální validita je na rozdíl od obsahové validity založena na srovnání výsledků výzkumu snějakým vnějším kritériem. Základní podtypy kriteriální validity jsou tzv. prediktivní validita asouběžná validita. Prediktivní validita je vlastně míra, sjakou výsledky získané danou výzkumnou technikou odpovídají reálným výsledkům. Typicky můžeme 40 oprediktivní validitě mluvit vsouvislosti se zkoumáním volebních preferencí (to, jestli je tento způsob validní, se ukáže na srovnání svýsledky voleb), anebo vsouvislosti sjinými technikami (výsledky jednoho testu mohou být velmi dobrým prediktorem pro výsledky vdruhém testu; pokud by tak například byla státní maturita prediktivně validní, byly by její výsledky dobrým ukazatelem pro úspěšnost přijetí na vysokou školu). Souběžná validita vychází zprincipu, že dva rozdílné způsoby zkoumání téhož jevu by měly poskytovat velmi podobné výsledky. Výzkum je tedy souběžně validní tehdy, pokud jeho výsledky vykazují vysokou míru shody svýsledky získanými jinou metodou (resp. jinými metodami). Okonstruktové validitě mluvíme zhlediska vztahu mezi naším měřením aurčitým složitějším konstruktem. Předpokládáme, že je výzkum ztoho hlediska validní, pokud vněm zjistíme, že vztah mezi tím, co jsme naměřili, adalšími proměnnými odpovídá tomu, co bychom očekávali na základě teorie. Konstruktová validita má pak dva podtypy. Otzv. konvergentní validitě mluvíme tehdy, pokud jeden indikátor určitého konceptu koreluje sdalšími indikátory téhož konceptu. Jinými slovy, jde oto, zda použitá měřítka, která by na základě teorie měla souviset, spolu skutečně souvisí. Odiskriminační validitě naopak mluvíme tehdy, když určitý indikátor určitého konceptu není vkorelaci sindikátory příbuzného konceptu. Jinak řečeno, jde oto, zda užívaná měřítka, která by spolu neměla souviset, spolu skutečně nesouvisí. 4.6 Longitudinální výzkum Specifickým případem výzkumu je takzvaný longitudinální výzkum, vněmž se zajímáme oto, jak se určité vztahy proměnných mění vprůběhu času. Obecný princip je přitom jednoduchý: děláme opakovaná měření či pozorování, ato po delších časových intervalech (třeba ipo řadě let). Zhlediska konkrétního postupu pak rozlišujeme tři typy: a) panelové šetření; b) trendové šetření; c) kohortové šetření. Panelové šetření spočívá vtom, že sestavíme určitý vzorek adalší pozorování provádíme vždy na identickém vzorku, tj. na stejných jednotkách. To má svoje nesporné výhody, problém však může nastat vtom, že určité jednotky ze vzorku vprůběhu času odpadnou (např. lidé mohou zemřít, odstěhovat se, mohou posléze začít odmítat účast ve výzkumu apod.), čímž výzkum přestává mít váhu. 41 Odlišně vypadá trendové šetření. V jeho rámci se stanoví cílová populace azté se při každém pozorování vybere nový vzorek, který je podroben výzkumu. Klíčové utrendového šetření je to, že se složení populace vprůběhu času mění. Například můžeme zkoumat vývoj postojů obyvatel Třince kpolštině ačeštině, ato vintervalu pěti let. Vrámci každého měření budeme vzorek sestavovat zaktuálního seznamu obyvatel, který může být značně proměnlivý. Posledním typem longitudinálního výzkumu je kohortové šetření. Jedná se opostup, který stojí přesně mezi trendovým apanelovým šetřením. Strendovým šetřením ho spojuje to, že se při každém novém pozorování či měření sestavuje ze stanovené populace nový vzorek, který je podroben výzkumu. Spanelovým šetřením si je podobný vtom, že se populace vprůběhu výzkumu nemění (maximálně se zužuje, například vinou úmrtí apod.). Příkladem kohortového šetření by mohlo být zkoumání toho, jak se měnila znalost němčiny ulidí narozených v30. letech 20. století vPraze. Ze skupiny všech mluvčích tohoto typu bychom vždy vjednotlivých intervalech vybírali nový vzorek asledovali bychom, jak se úroveň znalosti němčiny mění. 48 ván vpsychologii. Ukazuje se, že první informace oosobě či jevu mají zásadnější vliv na pojímání této osoby či jevu než informace pozdější. Vdotaznících či rozhovorech se vliv tohoto efektu spatřuje vtom, že odpověď na určitou otázku může ovlivnit odpovědi na otázky následující. Ztoho důvodu je velmi vhodné položit otázky vdotazníku vnáhodném pořadí. Zcela ideální pak je, aby dotazník každého respondenta měl jinak seřazené otázky. Pak se haló efektu vdůsledku vyhneme (respektive se jeho dopad vrámci celkových výsledků vynuluje). 49 6. Další pojmy Než přejdeme kdalším nástrojům pro sběr dat, zastavíme se ještě krátce uněkolika důležitých pojmů. 6.1 Indukce adedukce Vrámci empirického zkoumání se idealizovaně rozlišuje mezi induktivním a deduktivním přístupem. Induktivní přístup spočívá v tom, že pozorujeme určitou realitu, vté nacházíme pravidelnosti, na jejich základě docházíme kurčitým závěrům avposledku vytváříme teorii. Příkladem tohoto přístupu je konverzační analýza: rozborem mnoha záznamů reálných konverzací můžeme zjistit, jakým způsobem funguje například střídání či přebírání replik (tj. jak se střídají lidé, kteří zrovna mluví), jaké prostředky naplňují jaké funkce apod. Deduktivní přístup je vzásadě opačný. Nejprve máme určitou teorii, na jejím základě vytváříme hypotézy, ty ověřujeme v rámci pozorování a naše závěry se pak zpětně odráží vteorii. Takto funguje například experimentální výzkum. Důležité je uvědomit si, že se jedná oidealizované přístupy. Reálně si lze jen stěží představit, že ke světu kolem nás přistupujeme bez určité alespoň základní teorie (ve velice širokém smyslu, například vkonverzační analýze musíme mít alespoň implicitní představu otom, co je to konverzace, jak vypadají její jednotlivé složky atd.). Stejně tak si dost dobře nemůžeme vytvořit teorii, aniž bychom předtím pozorovali svět kolem nás (to ostatně děláme od narození). Ve skutečnosti tak rozdíly mezi induktivním adeduktivním přístupem tkví spíše vdílčích aspektech vědecké práce (například vtom, zda se využívají kvantitativní nebo kvalitativní metody) ataké vdůrazu, který se na co klade (vrámci induk- 50 tivního přístupu je proklamována relativní teoretická volnost, zatímco deduktivní přístup je zhlediska teorie spíše rigorózní). 6.2 Teorie, rámec, model Vběžné komunikaci čas od času používáme slova jako teorie, model či rámec. Zhlediska výzkumu mají však tyto pojmy poměrně přesné vymezení, kterého je dobré si být vědomi. Teorii můžeme vymezit jako určitý soubor představ, přijímaných principů apravidel, který je určený kanalýze, predikci aexplanaci fungování určitého souboru jevů. Jinými slovy, jedná se opředstavy ourčitých jevech, na základě kterých můžeme tyto jevy analyzovat, můžeme předpovídat, jak se budou chovat za určitých okolností, amůžeme vysvětlovat, proč tomu tak je. Na základě určité teorie (ať už explicitně vymezené či implicitně přítomné) obvykle formulujeme své výzkumné hypotézy. Zásadní přitom je, že teorie musí odpovídat výsledkům, knimž se dobereme. Vempirickém výzkumu tak obecně platí, že pokud naše výsledky neodpovídají teorii, je chyba právě vteorii, nikoliv ve výsledcích (pochopitelně pokud výsledky nepodléhají zásadnímu zkreslení). TASK ENVIRONMENT WRITING PROCESS PLANNING TRANLATING REVIEWING THE WRITER’S LONG-TERM MEMORY THE RHETORICAL PROBLEM TEXT PRODUCED SO FAR Topic Audience Exigency Knowledge of Topic, Audience, and Writing Plans MONITOR EVALUATING REVISING GENERATING GOAL SETTING ORGANIZING Obr. 9: Model psané produkce Flowerové aHayese (1981). 51 Poněkud jinou roli než teorie zastává model. Ten lze vpodstatě vymezit jako reprezentaci určitého jevu. Důležité je, že model je vždy tvořen zurčité perspektivy anějakým způsobem redukuje realitu (kdyby to tak nebylo, nebyl by to model, ale realita). Model se tedy soustředí pouze na určité aspekty vybraného jevu ve světě kolem nás. Příkladem modelu může být například model psané produkce Lindy Flowerové aJohna Hayese (1981) na obrázku 9. Jistě si dovedeme představit, že to, jakým způsobem píšeme určitý text, je velice složitý proces a můžeme vymezit velké množství proměnných, které vněm hrají určitou roli. Flowerová aHayes se zaměřili základně na tři procesy psaní (plánování, translaci apřezkum), načrtli, jakým způsobem mezi sebou tyto tři procesy interagují ado modelu ještě zapojili dlouhodobou paměť pisatele ataké rysy samotné úlohy. Díky tomuto modelu můžeme vrámci výzkumu lépe uchopit složitý proces psaní, ikdyž jen zurčité perspektivy. Vurčitém smyslu blízký pojem kpojmu model je rámec. Vtomto případě se jedná ourčitou síť pojmů, která nám umožňuje či usnadňuje přemýšlení ourčitém komplexním jevu. Na rozdíl od teorie nemají rámce explanační ambice, ale poskytují nám společný jazyk popisu, usnadňují poznávání určitého jevu aorganizaci poznatků oněm, anabízí nám určité představy otom, jak tento jev funguje (díky tomu, že vymezuje vztahy mezi pojmy). Příkladem může být rámec „principy aparametry“ vgenerativní lingvistice. Jeho základem je předpoklad, že existují určité obecné principy platné pro všechny jazyky, tj. univerzální abstraktní pravidla (například každá větná struktura musí mít rozvíjený člen). Druhým předpokladem je, že existují určité parametry, díky kterým může existovat mezijazyková variabilita (například základní slovosled může být SVO včeštině, ale SOV vturečtině). 6.3 Výzkumná etika Mluvíme-li oetice ve společenskovědním výzkumu, jedná se ocelý soubor otázek, které se týkají nakládání sdaty, výzkumů na lidech, psaní výzkumných zpráv apod. Nás zde budou zajímat pouze první dva uvedené okruhy, které bezprostředně souvisí srealizací empirického výzkumu. Otázce psaní apublikování výzkumných zpráv se tak věnovat nebudeme – jedná se sice ovelice důležitou problematiku, ale již přesahuje rámec této příručky. 52 Vrámci vědecké činnosti se kromě nechvalně známého opisování prací dá pochopitelně podvádět ijinými způsoby. Největší (anejsložitěji kontrolovatelný) problém je vtomto ohledu podvádění sdaty. Přečinem proti výzkumné etice je například svévolné upravování výsledků (například vyloučení těch dat, která se nám nehodí apod.), případně dokonce úplné vymýšlení výsledků. Zdůvodu, že se to občas děje, je povinností výzkumníka poskytnout na vyžádání data zdaného výzkumu. Jak jsme již uvedli výše, je proto třeba data archivovat (ať už jde odotazníky či nahrávky). Zároveň je potřeba dát si pozor při statistické analýze. Může se lehce stát, že uděláte technickou chybu (například si spletete sloupečky vExcelu), vaše výsledky budou vypadat grandiózně, ale ve skutečnosti nebudou odpovídat realitě avy budete vystaveni podezření ze záměrného manipulování svýsledky. Vzhledem ktomu, že jazyk je prostředkem sociální interakce, jsou předmětem lingvistického výzkumu velmi často konkrétní lidé. Ztoho důvodu je třeba, aby se náš výzkum vždy držel vrámci určitých etických standardů. Pochopitelně je tato otázka méně složitá než třeba vlékařství, ale itak ji nemůžeme zanedbat. Jedním ze základních principů je, že musíme mít obvykle od jednotlivých účastníků výzkumu takzvaný informovaný souhlas súčastí ve výzkumu. Testované osoby nejprve seznámíme stím, co je cílem výzkumu, jak se bude nakládat sdaty, kdo knim bude mít přístup, kdo je autorem výzkumu azejména jaká je míra anonymity apoté nám musí podepsat, že souhlasí se svou účastí. Existují určité výjimky, kdy informovaný souhlas získávat nemusíme. Obvykle je tomu tak vpřípadě dotazníků, protože jejich anonymita je přece jenom snadno zaručitelná (oto větší roli zde však hrají obecné instrukce!). Obecně platí základní princip, že testované osoby nesmíme nijak poškodit. To pochopitelně neznamená pouze fyzicky, ale ipsychicky či sociálně. Klíčové je zejména zachování anonymity. Je proto například běžné, že ve zprávách ovýzkumu, kde mluvíme okonkrétních jedincích, používáme pseudonymy (případně iniciály), ato jak pro lidi, tak ipro místa. Jinými slovy, jednotliví účastníci výzkumu nesmí být zpětně identifikovatelní třetí stranou. Vněkterých případech nastává problém, že některé jevy nemůžeme zachytit jinak než potají. Vtomto ohledu by se nabízelo zejména skryté nahrávání. To je považováno za zcela neetické avýzkumy na jeho základě by neměly být realizovány, natožpak publikovány. Existuje přitom určitá možnost, jak tento problém vyřešit, ato nahrávat skrytě, ale po 53 ukončení nahrávání požádat osouhlas se zapojením do výzkumu. Pokud nám ho daná osoba dá, nahrávku do výzkumu zahrneme, pokud nikoliv, nahrávku vjejí přítomnosti vymažeme. Získaná data rovněž nesmíme za žádných okolností využívat jinak než pro výzkumné účely (ato ani například e-mailové kontakty). 54 7. Další nástroje sběru dat Vpředchozím výkladu jsme se podrobněji zabývali dotazníky, ale narazili jsme ina další způsoby sběru dat, ato na rozhovory apozorování. Na ně se teď podíváme blíže. 7.1 Rozhovor jako nástroj sběru dat Vrozhovoru získáváme informace vpřímé interakci srespondentem. Rozhovory mohou být takzvaně strukturované – vtakovém případě je předem stanoven jejich formát aseznam otázek apro všechny respondenty je to stejné. Strukturovaný rozhovor je tak víceméně totožný sústně distribuovaným dotazníkem. Na opačném pólu stojí nestrukturované rozhovory, vnichž je interakce srespondetem volná (přičemž se pochopitelně držíme našeho výzkumného tématu). Ve srovnání sdotazníkovým výzkumem je výzkum využívající rozhovory časově afinančně náročný, ale poskytuje nám obvykle relativně spolehlivá data. Pokud chceme mít vrámci výzkumu solidní vzorek, potřebujeme na to obvykle větší množství spolupracovníků. Problémem může být zároveň to, že výzkum využívající rozhovory nepůsobí příliš anonymně aje tak třeba dbát na to, abychom respondenta oanonymitě přesvědčili. Výhodou je, že vrámci rozhovoru můžete kontrolovat chování respondenta alze vyřešit spoustu problémů, které by potenciálně ohrožovaly validitu výzkumu (například můžeme vysvětlit, co se míní danou otázkou vpřípadě, že jí respondent nerozumí apod.). Rozhovor vsociálních vědách obvykle slouží ktomu, abychom od informanta zjistili jeho názory, postoje, přesvědčení apod. To je pochopitelně možné ivlingvistice, ale nejčastěji se rozhovory vlingvistice (zejména vsociolingvistice) používají kpřímému sběru dat. Jinými slovy, 55 vlingvistickém výzkumu nám nemusí jít ani tak oto, co respondent říká, jako spíš oto, jakým způsobem mluví. Vtakovém případě se pak obvykle volí buď semistrukturovaný či zcela nestrukturovaný rozhovor. Obecně je důležité, aby měl badatel připraven seznam témat, která budou pro zkoumané osoby zajímavá. Témata mohou být předem ipropojena – výzkumník tak může mít předem vymezené určité možnosti, jak tematicky pokračovat, když respondentovi dojde řeč. Ideálně pochopitelně chceme, aby daná zkoumaná osoba mluvila co nejvíce. To není tak lehké, jak se může na první pohled zdát. Zkuste se půl hodiny bavit sosobou, kterou jste předtím neviděli, tak, aby mluvila především tato osoba – velice lehce se vám může stát, že daná osoba odpovídá zkratkovitě aže vám brzo dojdou otázky, které máte připravené. Milroyová aGordon (2012) uvádí určité strategie, které je vtakových případech vhodné použít. Jednou znich je strategie snížení své autority – místo toho, abyste byli tím, kdo rozhovor určuje, se prostě postavíte do role toho, kdo se chce nechat poučit (například otom, jaký je pracovní postup vtom, čím se daná osoba zabývá, nebo otom, jak to vdaném místě chodí apod.). Zkoumat některé jazykové jevy prostřednictvím rozhovoru může být nicméně obtížné až nemožné. Snadno si to můžeme představit ujevů, které se vkaždodenní komunikaci objevují relativně málo. Asi stěží můžeme předpokládat, že vrozhovorech včeštině nasbíráme velké množství tvarů přechodníků, ale stejné to bude třeba isvloženými vedlejšími větami či složitějšími syntaktickými konstrukcemi. Podobně se vrozhovorech jen ve velmi omezené míře budou vyskytovat jevy, které je zpragmatických důvodů vodpovědích na otázky nemístné používat (například rozkazovací způsob či tázací dovětky jako viď?, že jo?, no ne?). Na druhou stranu, vhodným výběrem otázek můžeme dosáhnout toho, aby respondenti daný jev použili. Například pokud zkoumáme kondicionálové tvary včeštině, můžeme se zeptat, „co by daný člověk dělal, kdyby“ apod. Největší problém je elicitace „běžné mluvy“, tj. jak dosáhnout toho, aby mluvčí mluvil přirozeně, jako mluví například spřáteli, doma apod. Zde se nabízí otázka, co to je vlastně běžná mluva, respektive co je jejím základem, protože můžeme oprávněně předpokládat, že se naše mluva liší vtom, kdo je jejím adresátem (trochu jinak budeme patrně mluvit srodiči, se sourozenci, spřáteli apod.). Odpověď na ni je však mimo možnosti této příručky. Milroyová sGordonem (2012) uvádějí dva typy strategií, jak dosáhnout toho, aby mluvčí mluvil přirozeně. První znich je ovlivnění obsahu rozhovoru. To praktikoval už William Labov ve 56 svých raných výzkumech (shrnutých vLabov, 1972), když předpokládal, že lidi při určitém citlivém tématu přestanou reflektovat to, jak mluví, a budou mluvit „přirozeně“ (typicky využíval otázky na to, kdy byl mluvčí vnebezpečí smrti). Druhou strategií je pozměnění dvoustranného formátu rozhovoru. Jednak se můžeme přiklonit ktomu, že budou rozhovor sdaným mluvčím dělat dva lidé, což má výhodu vtom, že je rozhovor plynulejší. Jednak (ato je běžnější) můžeme dělat takzvaný skupinový rozhovor, tedy hovořit svíce mluvčími najednou. Skupinový rozhovor je založen na tom, že je badatel pouze vroli „moderátora“, který iniciuje diskusi, ale sám do ní spíše nezasahuje. Jinými slovy, moderátor nastolí určité téma aúčastníci rozhovoru se oněm začnou bavit. Pokud téma zvolíme dobře aje pro účastníky výzkumu zajímavé, měli bychom získat poměrně velké množství kvalitních dat. Výhodou pochopitelně může být, když se účastníci alespoň částečně znají. Určitou skupinu můžeme podrobit výzkumu opakovaně (např. sdílčími obměnami osazenstva), anebo se můžeme zaměřovat na více rozdílných skupin aočekávat, že vužívání jazyka bude mezi skupinami rozdíl. Mezi potenciální problémy skupinových rozhovorů patří zejména „silní“ jedinci, kteří mohou ovlivnit názory či postoje celé skupiny (vpřípadě, že to je to, co zkoumáme), případně to, jak lidé mluví (anakolik vůbec mluví – udržet podobný poměr objemu řeči ukaždého účastníka je velmi náročné). Technicky může být realizace skupinových rozhovorů obtížná avpřípadě špatného výběru témat anebo participantů může dojít kneúspěchu. Navíc se může stát, že lidé budou mluvit jeden přes druhého, což vpřípadě lingvistického výzkumu může být problematické (znahrávky nemusí být jednoznačně rozpoznatelné, kdo co řekl, jak přesně to řekl apod.). Složitou otázkou rovněž může být, jak zvýsledků získaných na skupině zobecňovat na širší populaci. 7.2 Pozorování Když jsme na začátku této příručky vymezovali empirický výzkum, používali jsme pojem „pozorování“ velice široce. V tuto chvíli nám půjde pouze opřímé pozorování, tedy opozorování reálného chování či jednání určitých jedinců. Řada výzkumů ukazuje, že představy ovlastním chování či chování jiných lidí (jazykovém inejazykovém) areálné chování se liší. Jeden 57 anekdotický příklad uvádí například Labov (2006, s. 314). Matka sdcerou, které zkoumal vrámci svého newyorského výzkumu, tvrdily, že nikdy nevypouštějí /r/ ve výslovnosti vsouladu stím, co se považovalo za prestižní mluvu. Otěch, kteří /r/ vypouštějí, mluvili spíše pohrdlivě aříkali, že jsou znižší sociální třídy. Ve skutečnosti však /r/ nezřídka vypouštěly. Labov jim pustil nahrávku, na které bylo jednoznačně zdokumentováno, že /r/ běžně vypouští. Matka sdcerou ze sebe byly šokovány azklamány. Důležité je, že nesoulad mezi tím, co ochování (vlastním nebo cizím) říkáme, atím, jak se reálně chováme (nebo jak se chovají jiní) není dán tím, že bychom badatelům lhali či záměrně neříkali přesně to, jak se věci mají. Naše představy ovlastním chování či chování jiných lidí jsou zkrátka určitou konstrukcí reality, která umožňuje vlastní porozumění světu (například lidé ze Slezska vytýkají Pražákům to, že mají otevřenou výslovnost – realitaje ale oněco složitější). Pro poznání určitého jevu je tak důležité se zaměřovat jak na to, jaké oněm mají představy lidé, tak na to, jak daný jev reálně vypadá. Obojí je zajímavé zhlediska toho, jak ve světě fungujeme. Výzkum využívající přímé pozorování je tak přirozeným doplňkem výzkumu dotazníkového nebo výzkumu založeného na rozhovorech. Pozorování může vypadat různě, ale stejně jako urozhovorů si zde můžeme vymezit dva póly: strukturované anestrukturované pozorování. Nestrukturované pozorování je časově velmi náročné. Data získaná jeho prostřednictvím má smysl primárně analyzovat kvalitativně, zobecnění je velmi složité aobvykle relativně málo věrohodné. Nezapomínejme na to, že však pozorování můžeme spojit sjinými výzkumnými metodami apak nám přináší užitečné informace, které bychom jinak nezískali. Badatel se vtakových případech obvykle přímo adlouhodobě zapojuje do daného společenství – mluvíme proto o takzvaném zúčastněném pozorování. To nám umožňuje velmi hluboké pochopení praxe chování vdaném společenství, protože chování sledujeme vcelkovém sociálním kontextu azpozorování předem nevylučujeme žádné proměnné. Jinými slovy, pozorujeme reálné chování lidí vrůzných situacích avedeme přirozené, nestrukturované rozhovory slidmi z daného společenství, přičemž si ovšem děláme poznámky, případně sbíráme další podpůrný materiál (fotografie, videonahrávky adalší dokumenty). Výsledkem takového pozorování je určitý narativ. Jedná se oetnografický přístup. Etnografie se obecně zaměřuje napopis pravidel apraxe vurčité kultuře či vurčitém společenství. Tento přístup je proklamovaně „ateoretický“ – 64 problém tkví vtom, že je výrazně ovlivňován extrémními hodnotami. Představme si, že máme dvě datové sady, přičemž každá má osm vět, azajímá nás průměrná délka těchto vět vkaždé sadě. První sada je složena zvět, které mají délku 2slova, 3 slova, 4 slova, 5 slov, 15 slov, 16 slov, 17 slov a18 slov, druhá je složena zvět, znichž 3 mají délku 9 slov, 2 délku 10 slov a3 délku 11 slov. Je na první pohled zřejmé, že se tyto sady mezi sebou liší – vprvní sadě jsou čtyři věty velmi krátké ačtyři naopak velmi dlouhé, vdruhé jsou všechny věty dlouhé víceméně stejně. Pokud bychom však chtěli popsat tyto dvě sady na základě průměru, vyšlo by nám vobou případech, že jsou věty dlouhé průměrně 10 slov. Průměr tedy může být ošidný ajako ukazatel nám sám osobě nestačí. Druhou střední hodnotou je median. Pokud uspořádáme všechny naměřené hodnoty podle jejich velikosti, je median přesně prostřední hodnota. Pokud je hodnot sudý počet, pak se median počítá jako průměr dvou prostředních hodnot. Median je užitečný v tom, že není tolik ovlivňován extrémními hodnotami. Proto je užitečné ho uvádět vtěch případech, kdy se extrémní hodnoty objevují (například umzdy vČeské republice). Median na rozdíl od průměru můžeme určovat jak unumerických, tak uřadových proměnných, nikoliv však uproměnných nominálních. Poslední středovou proměnnou je takzvaný modus. Jedná se onejčastěji se vyskytující hodnotu. Můžeme ho sice určovat uvšech typů proměnných, jeho informační hodnota je však poměrně omezená. Samotná střední hodnota nám nikdy nestačí, potřebujeme ještě určitou informaci otom, jak moc se jednotlivé naměřené hodnoty od těch středových liší. Tuto informaci nám poskytují ukazatele variability. Těch je větší množství – my si zde uvedeme pouze několik nejčastěji používaných: a) variační rozpětí; b) percentilové rozpětí; c) rozptyl; d) směrodatnou odchylku. Variační rozpětí představuje rozdíl mezi maximální aminimální hodnotou vdaném souboru. Někdy se rovněž používá specifikace prostřednictvím krajních bodů. Podobně jako uprůměru je zde problém tehdy, když jsou vsouboru extrémní hodnoty. Ztoho důvodu lze raději použít takzvané percentilové rozpětí. Percentil je hodnota, která ukazuje, kolik procent případů má vdatech uspořádaných podle velikosti nižší pozici. Jinými slovy, ukazuje relativní pozici jednotky vrámci populace (50. per- 65 centil = median). Percentilové rozpětí je varianta variačního rozpětí, kde si stanovíte, že budete ignorovat extrémní hodnoty. Například můžete zjišťovat rozpětí mezi 10. a90. percentilem. Velice důležitým ukazatelem variability je rozptyl. Ten se počítá odlišně pro populaci (značka σ2) apro vzorek (značka s2). Vprvním případě se jedná osoučet druhých mocnin odchylek datových bodů od průměru děleno počtem datových bodů, vdruhém případě jde osoučet druhých mocnin odchylek datových bodů od průměru děleno počtem datových bodů sníženým ojednu: Přesný vzorec není nutné si pamatovat (je však dobré si uvědomit, na jakém principu je rozptyl založen). Chceme-li spočítat rozptyl, můžeme dnes použít nejrůznější software. Například vprogramu Microsoft Excel můžete rozptyl vypočítat pomocí jednoduchého vložení funkce (VAR pro populaci aVAR.VÝBĚR pro vzorek). Problém rozptylu tkví vtom, že se jedná ohodnotu, která je vždy vjednotkách na druhou (například udélky věty by byl rozptyl značen vpočtu slov na druhou). Jinými slovy, rozptyl je poněkud složitě interpretovatelný. Ztoho důvodu se běžněji používá takzvaná směrodatná odchylka (značka σ pro populaci aspro vzorek; včláncích se pak často používá SD, tedy zkratka anglického standard deviation). Jedná se jednoduše odruhou odmocninu rozptylu – jinými slovy, její hodnoty jsou ve stejných jednotkách jako hodnoty dané proměnné: 8.2 Pravděpodobnost vinferenční statistice Vrámci této příručky nemáme prostor věnovat se inferenční statistice podrobněji. Ostatně, existuje oní řada podrobných publikací (např. již 66 zmiňovaný Volín, 2007 anebo snad nejpřívětivější kniha ostatistice pro úplné začátečníky svýstižným názvem Statistics without tears (Rowntree, 1981)). Vysvětlíme si zde pouze úplné základy, abyste tušili, oco jde, když budete číst nějakou studii, která sinferenční statistikou pracuje. Když jsme mluvili ohypotézách, řekli jsme, že nulová hypotéza nepředpokládá vztah mezi proměnnými, zatímco pracovní hypotéza ano. To je zhlediska inferenční statistiky důležité. Vsouvislosti sověřováním hypotéz se totiž můžeme dopustit určitých chyb. Takzvaná chyba 1. druhu nastává tehdy, když badatel nesprávně zamítne nulovou hypotézu (jinými slovy si myslí, že mezi proměnnými je vztah, ale ve skutečnosti tam není). Ochybě 2. druhu mluvíme vpřípadě, že výzkumník nulovou hypotézu nezamítl amylně se domnívá, že mezi zkoumanými proměnnými žádný vztah není (viz tabulka 2). Tab. 2: Schematické znázornění vztahů mezi nulovou hypotézou arealitou. realita vztah neexistuje vztah existuje nulová hypotéza odmítnuta chyba 1. druhu správný závěr neodmítnuta správný závěr chyba 2. druhu Pojmy chyba 1. a2. druhu úzce souvisí sklíčovým pojmem inferenční statistiky, kterým je pravděpodobnost. Naše závěry vždy tvrdíme pouze surčitou pravděpodobností. Vpravém slova smyslu tedy vempirickém výzkumu nemůžeme nic definitivně prokázat – je však důležité, že můžeme řadu věcí vyvrátit. Hodnota pravděpodobnosti (značka p), kterou ve výzkumu uvádíme, poukazuje na pravděpodobnost chyby 1. druhu. Jinými slovy, hodnota p označuje riziko, že se spleteme, pokud zamítneme nulovou hypotézu. Toto riziko může být pochopitelně různé. Například vjednom našem výzkumu jsme mimo jiné zjišťovali, zda respondenti ve větách Lektor demonstroval publiku funkce přístroje, Jeho kabinet renovovali profesionálové aLidé detoxikovali svůj organismus pomocí alternativních léčiv budou jako ekvivalent obouvidového slovesa cizího původu volit dokonavé nebo nedokonavé sloveso domácího původu. Vpřípadě tvaru demonstroval nám zcelkově 29 platných odpovědí vyšlo 19× dokonavé sloveso a10× nedokonavé sloveso, urenovovali z27 platných odpovědí 12× dokonavé sloveso a15× nedokonavé sloveso audetoxikovali z29 platných případů 23× dokonavé sloveso a 6× nedokonavé sloveso. Na základě statistického výpočtu pomocí tzv. chí-kvadrátu (viz níže) jsme došli 67 kzávěru, že uslovesa demonstroval je p= 0,0947, uslovesa renovovali je p = 0,5637 auslovesa detoxikovali je p = 0,0016. Co to však znamená? Při hodnocení toho, zda je pravděpodobnost chyby 1. druhu dostatečně malá na to, abychom mohli říci, že jsou výsledky nenáhodné, se opíráme otakzvanou hladinu významnosti. Ta je stanovena na základě konvence avymezuje určité hranice, odkud se již výsledek považuje za statisticky významný. Za takzvaně významný (neboli signifikantní) výsledek považujeme hodnotu p < 0,05 (jinými slovy, zvíce než 95 % si můžeme být jisti, že jsme neučinili chybu 1. druhu, když budeme tvrdit, že vztah mezi zkoumanými proměnnými existuje). Za vysoce významný výsledek pak považujeme hodnotu p < 0,001. Vsociálních vědách (na rozdíl od věd přírodních) se rovněž občas uvádí takzvaně „okrajově významný výsledek“, který tvoří hodnota 0,05 < p < 0,08. 8.3 Rozdělení dat Vinferenční statistice je klíčový pojem rozdělení. Výpočet toho, nakolik je pravděpodobné, že neděláme chybu 1. druhu, je totiž – zjednodušeně řečeno – založen na srovnání toho, jak by byly rozprostřeny hodnoty vurčitém ideálním případě, atoho, jak jsou rozprostřeny vpřípadě našeho výzkumu. Zde si řekneme odvou typech rozdělení – binomickém anormálním. Binomické rozdělení je vlastně rozdělení pravděpodobnosti vpřípadě, že proměnná nabývá pouze dvou hodnot. Standardně se jako příklad udává házení mincí (vyváženou – tj. mincí, kde je stejná pravděpodobnost, že padne jedna nebo druhá strana). Vyloučíme-li hypotetickou možnost, že mince spadne na svou hranu, nebo nikdy nedopadne zpátky, jsou možné pouze dva výsledky hodu – panna či orel. Na základě binomického rozdělení můžeme vypočítat, jak budou pravděpodobné nejrůznější výsledky hodů (např. jak je pravděpodobné, že z20 hodů padne 18× panna a2× orel; jak je pravděpodobné, že z20 hodů padne alespoň 12× orel apod.). Hodnotu pravděpodobnosti na základě binomického rozdělení můžete snadno spočítat vprogramu Microsoft Excel pomocí funkce BINOMDIST. Nejdůležitějším typem rozdělení je takzvané normální neboli Gaussovo rozdělení (viz graf 5). Otom mluvíme uspojitých proměnných, přičemž se jedná ojednovrcholové rozdělení symetrické okolo střední 68 Graf 5: Normální rozdělení. Převzato zwww.commons.wikimedia.org hodnoty. Pro střední hodnoty zde platí, že průměr, median imodus jsou totožné. Normální rozdělení je vymezeno středovou hodnotou arozptylem, respektive směrodatnou odchylkou. Jednotlivé hodnoty mají tendenci být blízko středové hodnotě. Čím vzdálenější je daná hodnota od průměru, tím se vdané množině dat objevuje méně často. Příkladů normálního rozdělení najdeme v reálném životě poměrně mnoho. Jedním z nich mohou být schody uvelmi starých budov, do nichž bývá normální rozdělení přímo „vryto“. Tyto schody se totiž postupně obrušují tím, jak se po nich chodí – nikoliv však rovnoměrně. Všimněte si, že typický schod tohoto typu mívá „vychozenou“ prohlubeň uprostřed, směrem od středu na obě strany se tato prohlubeň snižuje ana krajích je schod již prakticky nepoznamenaný. Ato je dáno tím, že chůze po schodech byla historicky normálně rozdělená (lidé nejčastěji na schod došlapovali vjeho prostředku, méně vjeho třetině či dvou třetinách aúplně minimálně na samotných krajích). To, zda jsou naše data normálně nebo nenormálně rozdělena, je zásadní pro to, jaké statistické metody můžeme použít. Vpřípadě, že normálně rozdělena jsou, nebo alespoň přibližně, používáme takzvané parametrické testy. Vpřípadě, že jsou naše data nějak vychýlená, používáme neparametrické testy. Naše data nebudou normálnímu rozdělení vnaprosté většině případů odpovídat dokonale, aproto knormálnímu rozdělení obvykle aproximujeme. Platí totiž, že vzorek má tendenci blížit se knormálnímu rozdělení se vzrůstající velikostí. V grafu 6 jsou zobra- 69 01234567 Počet bodů 8 18 19 2015 16 1713 14109 11 12 01234567 Počet bodů Test k BZK – 200 náhodných Test k BZK – 100 náhodných Test k BZK – 50 náhodných 8 18 19 2015 16 1713 14109 11 12 01234567 Počet bodů 8 18 19 2015 16 1713 14109 11 12 0 Počet studentů 5 10 15 20 30 25 35 0 Počet studentů 5 10 15 20 30 25 35 0 Počet studentů 5 10 15 20 30 25 35 zeny fiktivní, náhodně generované výsledky testu, zněhož mohl student získat maximálně 20 bodů. Rozdíl mezi příklady toho typu, jako je uvedené rozdělení v grafu 6, apříklady, kdy onormální rozdělení zjevně nejde, je poměrně výrazný. Pokud bychom si například vybrali náhodně 1000 mužů a 1000 žen zpopulace Čechů, dostali bychom velice pravděpodobně podobné rozdělení, jako najdeme v grafu 7. Takovému rozdělení říkáme bimodální (dvouvrcholové). Častá rozdělení, na která můžeme narazit, jsou tzv. pozitivně anebo negativně šikmá rozdělení. Pozitivně šikmé rozdělení je typické například pro rozdělení platu vkapitalistické společnosti – vrchol rozdělení bude vychýlen směrem nalevo (velmi mnoho lidí, kteří vydělávají málo) Graf 6: Náhodně generované výsledky testu – první graf sumarizuje výsledky 25 studentů, druhý výsledky 100 studentů atřetí výsledky 200 studentů. Se vzrůstající velikostí vzorku se rozdělení dat čím dál více blíží normálnímu rozdělení. 70 asměrem doprava se bude počet lidí snižovat (minimum lidí, kteří vydělávají statisíce či miliony měsíčně). Negativně šikmé rozdělení můžeme typicky najít vrozdělení odpovědí na uzavřenou otázku sLickertovou škálou (od zcela souhlasím po zcela nesouhlasím), pokud se ptáme na něco, co lidé obvykle odmítají (například Chtěl/abych platit školné.). Jen málo lidí nám odpoví zcela souhlasím či souhlasím, více lidí odpoví neutrálně, poměrně hodně nebude souhlasit anejvíce lidí zaškrtne zcela nesouhlasím. Vrchol rozdělení tak bude vychýlen napravo. Vraťme se ale ještě knormálnímu rozdělení. Kjeho vlastnostem, které jsme uvedli výše, je potřeba dodat ještě jednu důležitou věc, ato jeho vztah ke směrodatné odchylce. Unormálního rozdělení mimo jiné platí, že vpásmu 2 směrodatných odchylek na obě strany od průměru se nachází 95,44 % všech hodnot. Aprávě toto číslo je velmi důležité zhlediska určování pravděpodobnosti chyby 1. druhu. Když jsme mluvili onormálním rozdělení, zmínili jsme zatím pouze případy, kdy se jedná orozdělení dat ve vzorku (příklad se schody afiktivní výsledky testu). Normálně rozdělené ale nemusí být pouze základní naměřené hodnoty, ale ihodnoty jiné, jako je například průměr nebo rozdíl mezi průměry (anebo třeba isměrodatné odchylky). Tomu pak říkáme tzv. výběrové rozdělení. Kdybychom zurčité populace generovali velmi mnoho vzorků ostejné velikosti, budou se mezi jednotlivými vzorky lišit jejich střední hodnoty asměrodatná odchylka. Pokud však Graf 7: Hypotetické rozdělení osob podle jejich výšky ve vzorku složeném z1000 náhodně vybraných mužů a1000 náhodně vybraných žen. Světlejší barvou jsou zobrazené ženy, tmavší muži. Jedná se otakzvané bimodální (dvouvrcholové) rozdělení. 140 0 20 40 60 80 100 120 150 160 170 Výška osoby Počet osob 180 190 200 210 71 vezmeme všechny tyto hodnoty (například průměr) dohromady, dostaneme rozdělení průměrů. Toto rozdělení bude mí tendenci být normální, pokud budou vzorky vdostatečné velikosti. Právě tomuto konstruktu říkáme výběrové rozdělení, pro které platí stejné vlastnosti jako pro normální rozdělení. Uvýběrového rozdělení platí, že nemluvíme osměrodatné odchylce, ale osměrodatné chybě. Tu vypočítáme ze směrodatné odchylky, kterou jsme reálně naměřili vnašem vzorku, tak, že ji vydělíme odmocninou zpočtu jednotek ve vzorku: Abychom si fungování výběrového rozdělení více přiblížili, podívejme se na následující hypotetickou situaci. Představme si, že 200 uchazečů opráci na studijním oddělení dostane vrámci výběrového řízení úkol, aby osvědčili své statistické dovednosti. Každý znich dostane přístup do databáze 8000 studentů FF UK amá za úkol náhodně zní vybrat vzorek ovelikosti 100 studentek azjistit, jaký mají studentky vtomto vzorku průměrný počet kreditů získaný za právě končící akademický rok. Pro všechny je to úkol snadný akaždý dojde knějakému výsledku. Není přitom překvapivé, že tyto výsledky se mezi sebou budou lišit. Je to dáno tím, že si každý vytvářel vzorek sám, byť náhodně (jednotlivé studentky sice byly zastoupeny ivněkolika různých vzorcích, ale nikdy se nestalo, že by byly vzorky zcela totožné). Jinými slovy, jednomu uchazeči opráci vyšlo, že je průměr (po zaokrouhlení na celá čísla) 41 kreditů, dalšímu 43 kreditů, dalšímu 42 kreditů, ještě dalšímu 41 kreditů, dalšímu 37 kreditů atd. Důležité je, že tyto průměrné hodnoty zjištěné na různých vzorcích ostejné velikosti jsou normálně rozdělené. Jinými slovy, nejčastější hodnotou vtomto souboru průměrů bude průměr průměrů (to může být hypoteticky 41 kreditů) ačím dále bude hodnota od tohoto průměru, tím bude méně častá. Toto rozdělení bude mít rovněž svou směrodatnou odchylku (hypoteticky s = 3 kredity). Na základě těchto dvou hodnot pak víme, že 95,44 % všech průměrů, které můžeme získat při náhodném výběru vzorku 100 studentů, se bude pohybovat mezi 35 (minus dvě směrodatné odchylky od průměru) a47 (průměr plus dvě směrodatné odchylky) kredity. Ztoho plyne, že pravděpodobnost, že vybereme 100 studentek avyjde nám průměrný počet kreditů bude nižší než 35, anebo vyšší než 47, je menší než 5 %, přesněji je rovna 4,56%. Postupujme vtomto poněkud absurdním příkladu dále apředstavme si, že celé výběrové řízení kdosi zpochybnil amuselo se konat znovu. 72 Komise pro výběrové řízení dala uchazečům podobný úkol, tentokrát neměli sestavit vzorek 100 studentek, ale 100 studentů (mužů). Vše opět proběhlo hladce, výsledky jednotlivých uchazečů byly rozdílné aukázalo se, že průměr průměrů byl tentokrát 35 kreditů asměrodatná odchylka byla shodou okolností stejná jako uprůměrů vzorků studentek, tedy 3kredity. Jinými slovy, pro průměry studentů-mužů platilo, že 95,44 % znich se nacházelo vpásmu 29–41 kreditů. Komise pro výběrové řízení na základě dalších úloh vybrala z200 uchazečů 3 do užšího kola. Tentokrát měli uchazeči mimo jiné za úkol vyhodnotit měření na vzorcích studentek ana vzorcích studentů. Dva zuchazečů fatálně pohořeli, protože se domnívali, že pokud byl průměrný výsledek ustudentek 42 kreditů austudentů 35 kreditů, znamená to, že se studenti astudentky ve sbírání kreditů liší – studenti jich nasbírali méně. Jen jeden uchazeč se neuchýlil ktak rychlému závěru avzpomněl si na to, co slyšel onormálním, respektive výběrovém rozdělení. Díky tomu si odvodil, že přes 47 % případů průměrů zjištěných na vzorcích studentů-mužů je vpásmu 35–41 kreditů (dvě směrodatné odchylky nad průměrem) azároveň přes 47 % případů průměrů zjištěných na vzorcích studentek je rovněž vpásmu 35–41 (dvě směrodatné odchylky pod průměrem). To už vychytralému uchazeči stačilo na to, aby došel kzávěru, že se rozdělení průměrů velmi silně překrývají aže je tedy vysoce pravděpodobné, že by se spletl, kdyby řekl, že muži sbírají méně kreditů než ženy, tj. že by udělal chybu 1. druhu. Komisi proto řekl, že se nedá říct, že by rozdíly mezi počtem kreditů ustudentů apočtem kreditů ustudentek byly statisticky významné. Uvedená situace je pochopitelně zcela hypotetická. Nám posloužila pouze pro velmi jednoduchou ilustraci principů některých statistických metod, které se zakládají na výběrovém rozdělení. Vreálném výzkumu pochopitelně nesestavujeme 200 vzorků (dost často vyjdeme jen sjedním), technicky by to ostatně bylo složité až nemožné. Jeden vzorek nám ale stačí – pokud se zdá, že jsou naše data normálně rozdělená, můžeme použít statistické testy, které se ovýběrové rozdělení opírají. 8.4 Jak zjišťovat pravděpodobnost? Existuje řada různých statistických testů, prostřednictvím kterých můžeme ve svém výzkumu zjišťovat pravděpodobnost chyby 1. druhu. Zde si uvedeme dva, na které vlingvistice narazíme nejčastěji, ataké dva způsoby zjišťování síly korelace. 73 Prvním testem, který zde zmíníme, je takzvaný chí-kvadrát (χ2, angl. chi-square). Jedná se otest, který je určen ktestování rozdílů mezi četnostmi výskytu vurčitých kategoriích. Jinými slovy, chí-kvadrát užíváme tehdy, když chceme porovnat, zda poměr počtu výskytů jedné hodnoty apočtu výskytů druhé hodnoty je náhodný nebo není. Statistický výpočet je pak založen na rozdílech mezi očekávanými četnostmi ačetnostmi reálně zjištěnými. Vzhledem ktomu, že se jedná očetnosti, je vcelku zřejmé, že chí-kvadrát užíváme primárně unominálních ařadových proměnných – vlingvistice typicky vpřípadě srovnávání výskytů určitých variant jedné jazykové proměnné (viz výše příklad voddílu 8.2). Hodnotu chí-kvadrátu azněj plynoucí pravděpodobnosti chyby 1. druhu dnes můžeme spočítat snadno prostřednictvím programu Microsoft Excel (funkce CHITEST) nebo prostřednictvím online kalkulaček (např. http://www.graphpad.com/quickcalcs/). Nejpoužívanějším testem vlingvistice je vedle chí-kvadrátu patrně t-test. Ten používáme tehdy, chceme-li porovnat průměry hodnot zjištěných udvou skupin případů. Jinými slovy, t-test je nám nápomocen, pokud máme měření dvou skupin achceme zjistit, jestli se tyto skupiny statisticky významně liší nebo je rozdíl mezi nimi daný náhodně. Výpočet t-testu se liší tehdy, jsou-li dvě skupiny zhlediska svého složení shodné nebo nejsou. Vpřípadě, že jsou shodné (jde opředběžné anásledné pozorování), jedná se otakzvané závislé měření (angl. paired). Vpřípadě, že jsou rozdílné (typicky se jedná oexperimentální akontrolní skupinu), jedná se onezávislé měření (angl. unpaired). It-test můžeme snadno spočítat vprogramu Microsoft Excel nebo pomocí online kalkulaček. Vzhledem ktomu, že je založen na srovnání průměrů, počítáme ho zprincipu unumerických proměnných amusíme se vždy podívat na to, zda jsou naše data normálně rozdělená. Pokud normálně rozdělená nejsou, je třeba použít jinou metodu výpočtu (např. Mann-Whitneyho test nebo Wilcoxonův test – viz Volín, 2007). Na závěr si ještě představme dva způsoby, jak zjišťovat sílu korelačního vztahu. Existují dva koeficienty, které sílu korelace vyčíslují. Otom, který je pro daný výzkum užitečnější, rozhoduje typ korelace. Pokud se korelace zdá být víceméně lineární, to znamená, že platí, že čím vyšší hodnota jedné proměnné, tím vyšší hodnota druhé proměnné (případně nižší, jedná-li se ozápornou korelaci), je pro nás užitečný takzvaný Pearsonův korelační koeficient (značka r). Pokud je korelace nelineární, užívá se takzvaný Spearmanův koeficient pořadové korelace (značka ρ).