8. Porovnání kvantitativní veličiny jednoho výběru s pevnou hodnotou
Lower Achieved CI Interpolated CI Upper Achieved CI
Conf.Level L.E.pt U.E.pt 0.9123 -Inf 33.5 0.9500 -Inf 33.5 0.9552 -Inf 33.5
Nyní provedeme tento výpočet ještě jednou, ale pro oboustranný test. > SIGN.test(b,md=33.3,alternative = One-sample Sign-Test data: b s~= 14, p-value = 0.3105 alternative hypothesis: true median 95 percent confidence interval: 32.50000 33.90694 sample estimates: median of x 33 Conf.Level L.E.pt Lower Achieved CI 0.9105 32.5 Interpolated CI 0.9500 32.5 Upper Achieved CI 0.9590 32.5 >
"two.sided")
is not equal to 33.3
U.E.pt 33.5000 33.9069 34.0000
P-hodnota pro jednostranný test je tedy 0, 1553; jednostranný test tedy není statisticky významný. Tím spíš není významný ani dvoustranný test, který je v druhé části tabulky.
8.1.4. Jednovýběrový Wilcoxonův test Můžeme použít i Wilcoxonův neparametrický test, který je vydatnější (snáze odhalí skutečné rozdíly) než předchozí znaménkový test. Někdy je nazýván též Mannův-Whitneyův test. Použití Wilcoxonova testu je vhodné, obzvlášť pokud je rozsah souboru menší a analyzovaná náhodná veličina nemusí mít normální rozložení. Předpokladem testu je rozsah alespoň 50 měření a to, že nejsou naměřeny shodné hodnoty. K tomu by nemělo docházet, protože předpokládáme, že měřená veličina je spojitá, a proto je pravděpodobnost naměření shodných hodnot rovna nule. Problém je ale v tom, že naměřené hodnoty jsou nějak zaokrouhlované – to může způsobit výskyt těchto shod (ties). Pokud se tyto shody vyskytnou, program nás upozorní. Tento test nepracuje přímo s naměřenými hodnotami, ale jen s jejich pořadím. Přesněji řečeno: seřadíme odchylky naměřených hodnot od zvolené hodnoty bez ohledu na znaménko (tj. v absolutní hodnotě). Dále se ptáme, zda se statisticky významně liší průměrné pořadí odchylek kladných a záporných hodnot, resp. hodnot nad testovanou hodnotou a pod ní (ve zmíněném příkladu s obvodem hlavy nad 33,3 cm a pod touto hodnotou). Popišme test přesněji. Nejprve vypočteme absolutní hodnoty odchylky (di = |xi − µ|) pozorovaných hodnot od µ, pak tyto odchylky seřadíme podle velikosti a pořadí hodnot di (tj. 1, ..., n = 35) označme jako ri . Dále součet všech ri , pro která je xi > µ označíme jako R+ . R+ =
X
ri = 411
X
ri = 219
xi ≥µ
a R− =
xi <µ
98
Ukázka elektronické knihy, UID: KOS214888
8.1. Testy charakteristik Minimální z těchto dvou hodnot porovnáme s kritickou hodnotou Wilcoxonova testu (viz např. [1], [38], [59]). Pro větší rozsahy souboru n nejsou ale kritické hodnoty tabelovány; pak je možno použít aproximaci rozložení testovací statistiky pomocí normálního rozložení. Nejprve tedy vypočteme testovací statistiku: W =q
R− − 41 n(n + 1)
219 − 14 35 · 36 =q = 1, 572 1 1 24 n(n + 1)(2n + 1) 24 35 · 36 · 71
Uvažujeme-li oboustrannou hypotézu, pak je například:
|W | = |1, 572| < 1, 96 = u α2 P = 0, 1169 Wilcoxonův dvoustranný test tedy není statisticky významný (P = 0, 1169), dokonce ani pokud bychom uvažovali test jednostranný (P = 0, 0585). Povšimněme si, že P-hodnota je mnohem blíže P-hodnotě znaménkového testu. Dále vypočteme dvoustranný jednovýběrový Wilcoxonův test obvodu hlavy novorozenců matek s PKU:
> library(BSDA) > wilcox.test(x[,"HLAVA_POR"],mu=33.3,alternative="two.sided", + conf.int =TRUE,na.rm=TRUE) Wilcoxon signed rank test with continuity correction data: x[, "HLAVA_POR"] V~= 219, p-value = 0.1169 alternative hypothesis: true location is not equal to 33.3 95 percent confidence interval: 32.49996 33.49997 sample estimates: (pseudo)median 32.99995 Warning messages: 1: In wilcox.test.default(x[,"HLAVA_POR"],mu=33.3 alternative="two.sided",: cannot compute exact p-value with ties > Systém nás informuje, že díky shodám („tiesÿ) nebyla P-hodnota vypočtena přesně. U t-testu jsme si říkali, že musí být splněn předpoklad normality. To není nutné u neparametrických testů (např. znaménkového nebo Wilcoxonova). Před použitím t-testu bychom měli mít ověřen předpoklad normality a nezávislosti jednotlivých pozorování9 . Pokud máme vypočten jak t-test, tak i znaménkový nebo Wilcoxonův test, tak signálem o porušení předpokladů t-testu může být výrazná neshoda závěrů těchto testů. 10 9 10
Ať již jsme jej ověřili v rámci prováděné studie, nebo dříve. Testy musí být samozřejmě počítány na stejné hladině významnosti. Pokud pak vychází t-test (na rozdíl od
99
Ukázka elektronické knihy, UID: KOS214888
8. Porovnání kvantitativní veličiny jednoho výběru s pevnou hodnotou
8.2. Intervalové odhady S výše zmíněnými testy velmi úzce souvisí i intervalové odhady. Ukažme si možnosti jejich konstrukce a použití.
8.2.1. Intervaly spolehlivosti Připomeňme si, že 100α% interval spolehlivosti pro určitou charakteristiku (např. pro průměr x ¯) je interval, který s 100α% spolehlivostí obsahuje populační průměr sledované veličiny. Dále si ukážeme konstrukce intervalů spolehlivosti pro nejčastěji používané statistické charakteristiky Intervaly spolehlivosti pro průměr x ¯ (σ známé) Oboustranný 100α% interval spolehlivosti je
σ σ x ¯ − u α2 √ , x¯ + u α2 √ n n
jednostranné 100α% intervaly spolehlivosti:
σ −∞, x ¯ + uα √ n
σ x ¯ − uα √ , +∞ n
Tento interval spolehlivosti přesně odpovídá Z-testu. Ukážeme výpočet jednostranného intervalu spolehlivosti od −∞ do hledané meze Funkce mean() a sd() umožňují říci, že chceme pracovat pouze s naměřenými hodnotami, bez NA, ale funkce length() tuto možnost nemá; musíme si tedy pomoci funkce na.omit(). Výpočet tedy vypadá takto:
> mean(x[,"HLAVA_POR"],na.rm="T")+qnorm(0.95)*sd(x[,"HLAVA_POR"],na.rm="T")/ + sqrt(length(na.omit(x[,"HLAVA_POR"]))) [1] 33.23094 > Průměr můžeme počítat i příkazem mean(na.omit(x[,"HLAVA_POR"])) (podobně i sd ) ve funkci length(na.omit(), ale nelze použít parametr na.rm="T"; proto je použita funkce length(na.omit(). Opačný interval vypočteme tak, že před funkci qnorm() vložíme opačné znaménko. Meze dvoustranného intervalu spolehlivosti se vypočtou (ve funkci qnorm() použijeme místo spolehlivosti 95% pouze 97,5 %, protože uvažovaných 5 % rozdělíme a dáme z obou stran): některého dalšího jmenovaného testu) nevýznamný, je použití t-testu podezřelé. Tato skutečnost může být způsobena nesplněním předpokladu, například předpokladu normality. Opačný rozdíl, obzvláště u menších souborů normálně rozložených dat, je možný díky větší síle t-testu pro normální rozložení.
100
Ukázka elektronické knihy, UID: KOS214888