nejdůležitější z nich, alespoň pro nás sociology – statistik by s námi možná nesouhlasil –, je tato vlastnost:
Náhodný vzorek reprezentuje všechny známé i neznámé vlastnosti populace.
A ještě dříve, než Dr. Watson začne namítat, uveďme si jednoduchý příklad. Máme teď novou populaci kuliček. Jsou opět červené a zelené. Ale mají ještě jednu zajímavou vlastnost, o které my nevíme: Jsou duté a uvnitř každé je malý papírek a na každém tom lístku je něco napsáno. (Znáte „fortune cookies“ z čínských restaurací?) Třeba nějaké neslušné slovo. Když jsme vybrali dobrý náhodný vzorek kuliček, budou reprezentovat celou populaci kuliček nejen vzhledem k distribuci barev, ale i vzhledem k distribuci neslušných slov, i když o tom nevíme a třeba nikdy nebudeme vědět. Uveďme si jiný, užitečnější příklad. V náhodném vzorku obyvatelstva hlavního města Prahy budeme mít slušnou reprezentaci populace vzhledem k věku, pohlaví, vzdělání, povolání, politické orientaci, vzhledem ke všem postojům, ale i reprezentaci třeba vzhledem k oblíbeným jídlům, počtu zubních kazů, věku, kdy se lidé poprvé zamilovali, množství vypitého piva, počtu milenek, počtu veksláků, peněžní hodnotě nakradeného zboží, číslům bot, prostě vzhledem ke všemu. To neznamená, že tohle všechno budeme schopni měřit, to je jiný problém. Ale znamená to, že ať už je naším cílem cokoli, víme, že proměnné, které jsou pro nás relevantní, budou mít v našem vzorku podobnou distribuci, jaká existuje v celé populaci, a naše závěry jsou tedy na tuto populaci aplikovatelné.
Náhodný výběr má ještě jednu pozoruhodnou vlastnost: U náhodného vzorku jsme schopni odhadnout, jak se vzorek liší od populace.
Jinými slovy, jsme schopni určit, jak dobrý je náš vzorek. Teď je načase naučit se několik slov z odborné hantýrky, jednak abychom mohli oslnit přátele, jednak abychom rozuměli správně významu publikovaných statistických dat. Podívejme se na následující tabulku:
98
Tabulka 5.1 Velikost vzorku a kondenční interval na 95% hladině významnosti pro alternativní znaky při distribuci 50:50 Velikost vzorku
Konfidenční interval
100
±10 %
400
±5 %
1600
±2,5 % Adaptováno z Babbie, Social Research for Consumer, 1982
To vypadá dost učeně, že? Ale nebojte se. Pochopit princip a vědět, jak se taková věc aplikuje, není těžké. Trochu obtížnější je statistické zdůvodnění. Ale takové vysvětlení necháme pro někoho jiného, kdo vás uvede do zajímavého světa skutečné statistiky. Řekněme, že jsme vybrali náhodně 400 kuliček a zjistili jsme, že ve vzorku (neboli ve výběrovém souboru) je 78 % zelených kuliček. Protože jsme nevybrali všechny kuličky, musíme předpokládat, že jsme se dopustili určité chyby, že pozorovaná relativní četnost zelených kuliček ve vzorku se liší od procenta, které skutečně existuje v celé populaci (základním souboru). My však potřebujeme vědět, jak moc se mýlíme. A v tom nám pomůže ta nepřátelsky vyhlížející tabulka. Pozor! Tahle tabulka je jen ilustrací a platí jen tehdy, je-li v populaci právě tolik zelených jako červených kuliček. Platí jen pro alternativní (binomické) proměnné, to je pro takové znaky, které mají jen dvě kategorie, jako ANO a NE. V našem případě zelená a „nezelená“ kulička. Velikost našeho vzorku je 400 a této velikosti vzorku odpovídá kondenční interval (interval spolehlivosti) 5 %. Odečteme tedy tuto hodnotu od pozorovaných 78 % a dostaneme tedy 73 %. Pak ji opět přičteme k pozorované hodnotě a dostaneme horní mez. A teď víme, že skutečná proporce zelených kuliček v celé populaci je mezi 73 a 83 %. Jenomže to nevíme docela určitě, vždyť jsme nepozorovali všechny kuličky. Teď se dostáváme k tomu poněkud kryptickému výrazu v podtitulu naší tabulky: hladina významnosti. 99
V našem případě to znamená, že skutečná proporce, která existuje v populaci, se nalézá s 95% pravděpodobností uvnitř vypočítaného intervalu spolehlivosti. Kdybychom vytvořili 100 vzorků obdobné velikosti, jen v 5 vzorcích by bylo možné, že skutečná proporce zelených kuliček leží pod nebo nad vypočítaným kondenčním intervalem. O tom, jakou hladinu zvolit, rozhodne výzkumník, a podle tohoto rozhodnutí je interval vypočítáván. Toto rozhodnutí je svobodné ovšem jen z hlediska statistické teorie; ve skutečnosti je vázán míněním přijatým v příslušné vědecké komunitě. V sociologii je to obvykle 95 nebo 98 %. (Vidíte, i v sociologii máme malý kousek paradigmatu.) A teď se podívejme, jak by se takový interval mohl vypočítat. Není to tak, jak se to opravdu dělá. Ve skutečnosti neznáme distribuci proměnné, která existuje v populaci. Ale náš popis výpočtu nám dá alespoň nějaký vhled do logiky, která je skryta za pozoruhodnými vlastnostmi náhodného výběru. Protože jsem vám slíbil, že v naší knize nebudou (skoro) žádné vzorečky, popíšeme si výpočet slovně. Nejdříve musíme vypočítat veličinu, která má opravdu zajímavé vlastnosti a které se říká směrodatná chyba. Uvidíte, že je to nejen snadné vypočítat, ale také že není těžké rozumět většině kroků v tomto výpočtu. Výpočet směrodatné chyby:
CO UDĚLÁME
CO TO ZNAMENÁ
Nejdříve vynásobíme proporci zelených kuliček v populaci proporcí červených.
Homogenita vzorku má vliv na velikost chyby. Čím nerovnoměrnější je distribuce ve vzorku, tím menší bude chyba a tím užší bude interval spolehlivosti.
Tato proporce musí být vyjádřena jako desetinný vzorek, ne v procentech. (Tedy kdyby v populaci bylo 50 % červených a 50 % zelených, budeme počítat 0.5krát 0.5.)
Kdyby například v populaci bylo 90 % zelených kuliček a velikost vzorku by byla 100, vypočítaný konfidenční interval by byl ±6 %. Kdyby ve stejně velkém vzorku byl stejný počet zelených jako červených kuliček, konfidenční interval by byl mnohem širší: ±10 %.
100
Ukázka elektronické knihy