Skip to main content

Psychometrika (Ukázka, strana 99)

Page 1

T (trait) reprezentuje rysovou (v čase neměnnou) složku měřené charakteristiky, S1 – Sn jsou latentní proměnné odpovídající stavu (state) v časech t1 – tn a O (occasion) představuje soubor aktuálních determinant stavu. Naměřený hrubý skór X je vždy sumou působení stabilního rysu (T), kontextuálních faktorů (S a O) a chyby měření e. Stabilitu v čase bychom v ideálním případě vyjádřili jako korelaci latentních proměnných S1 až Sn, v praxi častěji jako korelaci manifestních proměnných X1 až Xn. Přitom platí, že korelace latetních proměnných obvykle podává informaci spíše o stabilitě měřené charakteristiky, korelace manifestních proměnných spíše o stabilitě měřicího nástroje. Toto schéma je v literatuře známo jako Steyerův LST-AR model, latent state-trait autoregressive model (Cole, Martin, Steiger, 2005). Jak již bylo uvedeno, hlavní problém s tímto pojetím reliability, a tudíž i s platností odhadnutých hodnot, spočívá v samotném předpokladu stability měřených atributů. Pokud má být tento přístup k odhadu reliability používán, pak pouze v případech, kdy se skutečně jedná o měření relativně stabilních atributů. To znamená, že takto nelze zjišťovat reliabilitu metod pro měření přechodných psychických stavů. Ale i dlouhodobě relativně stabilní úroveň rysu osobnosti se při dlouhém odstupu mezi dvěma testováními může změnit, což vede k podhodnocení odhadu reliability. Změnu úrovně měřeného atributu je nutné uvážit hlavně u dětí, u kterých může docházet ke značným změnám i v krátkém časovém období. Naopak po příliš krátké době oddělující obě testování může dojít ke vzniku jiného artefaktu (tzn. jevu, který vzniká nesprávným použitím metody) – klamnému nadhodnocení reliability vlivem zapamatování odpovědí na jednotlivé otázky. Je to sice především problém výkonových testů, kde chceme, aby řešení úkolů obsažených v jednotlivých položkách bylo výsledkem kognitivní aktivity, kterou se projevuje příslušná schopnost nebo znalost, a nikoli pouze vybavováno z paměti, ale i u metod měření osobnostních rysů probandy ovlivní, jestliže si nějakou položku a svoji odpověď na ni pamatují. Proto se obvykle doporučuje, aby časový odstup mezi dvěma testováními byl přibližně tři měsíce (Kline, 1993, s. 7) – při kratším je údajně větší pravděpodobnost, že si probandi zapamatují svoje odpovědi z minula, a při delším se zase může stát, že se úroveň měřeného atributu změní natolik, že zkreslí odhad reliability. Obecně platí, že čím je odstup mezi měřeními menší, tím jsou zjištěné koeficienty stability vyšší (Aiken, 1996, s. 79). Užití ukazatele stability jako argumentu pro reliabilitu metody může být komplikováno i dalším faktorem, totiž samotnou povahou měřeného 100 Ukázka elektronické knihy, UID: KOS172012


konstruktu. Jako příklad můžeme uvést právě psychologickou diagnostiku u dětí, zejména velmi malých. Repertoár projevů chování dítěte se s jeho růstem velmi rychle rozšiřuje, a tím se značně rozšiřuje i doména, z níž se mohou rekrutovat položky pro posouzení nějaké oblasti chování (např. temperamentu). Jiné projevy naopak postupně odeznívají. V důsledku vzniká situace, kdy je tentýž rys (extraverze, emocionalita…) na úrovni latentní proměnné odhadován např. ve věku 6 měsíců z jiných manifestních proměnných, než ve věku 18 měsíců (Smékal, Širůček, 2002). Důsledkem jsou velmi nízké zjištěné stability dimenzí měřicího nástroje, ačkoli panuje obecná shoda, že charakteristiky jako temperament nebo intelekt jsou v čase velmi stabilní. Přes uvedené výhrady je velmi žádoucí testovou-retestovou metodu používat, ovšem s důsledným ohledem na teoretické znalosti o měřených konstruktech a jejich charakteristikách. V obecné rovině lze pro testovou-restestovou stabilitu nalézt následující argumenty: 1. Posouzení stability měřených atributů v čase není zajímavé jen z hlediska odhadu reliability, ale i pro posouzení míry stability samé. Protože tento předpoklad nemusí být platný, stojí za to ho pravidelně ověřovat. Navíc je zřejmé (viz obr. 5.2), že prověřování stability nástroje a stability rysu je z praktického hlediska jen obtížně oddělitelné. 2. Posouzení nějaké formy reliability ve smyslu vnitřní konzistence (viz níže) pro posouzení spolehlivosti měření nestačí. 3. U některých atributů není možné posouzení reliability jako vnitřní konzistence. Například u výkonových testů s rychlostní složkou (viz kap. 7) nelze vnitřní konzistenci posuzovat. Zbývá možnost posouzení homogenity (viz níže) a stability v čase.

Reliabilita paralelních forem Tento způsob odhadu reliability testu byl podle Helmstadtera (1964) původně vytvořen ve snaze vyloučit vliv paměti při testovém-retestovém způsobu odhadu reliability. Základní myšlenka spočívá v tom, že je nutné vytvořit dva testy, které jsou tzv. paralelní, což znamená, že měří tentýž atribut stejným způsobem (stejná instrukce, způsob administrace atd.). Někdy se rozlišuje více stupňů a mluví se o alternativních formách, které se liší 101 Ukázka elektronické knihy, UID: KOS172012


v míře paralelnosti – srovnatelné formy jsou si vysoce podobné z hlediska obsahu, ale nedá se nic říci o jejich parametrech, ekvivalentní formy jsou srovnatelné z hlediska odvozených skórů (viz kap. 10) a paralelní formy mají stejné průměry hrubých skórů, stejné směrodatné odchylky a stejné korelace s jinými měřicími nástroji v jakékoli populaci. Někdy se také hovoří o tzv. striktní paralelnosti forem, což znamená, že se položky vybírají ze stejného obsahového univerza položek (neboli tzv. domény) stejným způsobem. Posouzení je možné na základě expertního posudku nebo pomocí detailní analýzy položek (viz McDonald, 1999) nebo pomocí strukturního modelování (Urbánek, 2000). Tento postup odhadu reliability předpokládá, že chybou měření je jakýkoli rozdíl ve skórech získaných pomocí obou forem testu. Záleží samozřejmě na konkrétním postupu použitém při odhadu reliability, ale pokud jsou obě formy testu administrovány těsně po sobě, mluví se o reliabilitě ve smyslu ekvivalence. Možná je to příliš zobecňující tvrzení, ale domníváme se, že se v tomto případě už jedná v podstatě o chápání reliability jako vnitřní konzistence (viz níže). Empirické posouzení reliability paralelních forem se v rámci tzv. klasické teorie testů a klasického postupu analýzy položek (viz kap. 9) provádí pomocí jednoduché statistické analýzy. Porovnávají se průměry a rozptyly jednotlivých položek a také korelace (respektive kovariance) mezi všemi položkami v obou formách. Odhadem reliability je podobně jako v případě testové-retestové metody odhad korelace hodnot naměřených pomocí obou forem, z výše uvedených podmínek pro dosažení striktní paralelnosti je však zřejmé, že samotná argumentace založená na korelaci paralelních forem není postačující, přestože je často jedinou statistikou uváděnou u této metody odhadu reliability. Hlavní problém u tohoto způsobu odhadu reliability spočívá v obtížnosti tvorby skutečně paralelních forem. Bylo vyvinuto mnoho postupů tzv. vyrovnávání (angl. equating) forem testů, které má za cíl dosáhnout co největší srovnatelnosti získaných skórů (např. McDonald, 1999). Z praktického hlediska je dokladování reliability paralelních forem velmi důležitý postup, protože pouze pomocí něj lze zajistit vytvoření alternativ testové metody, které mohou být administrovány opakovaně s minimalizovaným rizikem efektu zácviku (např. Amthauerovy Testy struktury inteligence jsou tradičně vyvíjeny ve dvou formách). 102 Ukázka elektronické knihy, UID: KOS172012


Turn static files into dynamic content formats.

Create a flipbook
Psychometrika (Ukázka, strana 99) by Kosmas-CZ - Issuu