Skip to main content

Testování a hodnocení studentů na VŠ (Ukázka, strana 99)

Page 1

6

Analýza testu a jeho položek Obtížnost položky můžeme odhadnout podle toho, jaký podíl účastníků testu na ni dokázal správně odpovědět. Tomuto podílu se říká index obtížnosti a značí se P:

kde nS je počet testovaných, kteří na danou položku odpověděli správně a n je počet všech testovaných. Index obtížnosti nabývá hodnot mezi 0 a 100 % (respektive 0 a 1). Čím víc studentů na položku odpovědělo správně, tím je hodnota indexu blíže ke 100 % (respektive 1). Je to trochu matoucí, neboť mluvíme o obtížnosti a tento index je nejvyšší, když je položka nejsnazší. Proto se zavádí doplňková veličina, hodnota obtížnosti. Hodnota obtížnosti udává poměr testovaných, kteří na danou úlohu odpověděli nesprávně, jde tedy o doplněk indexu obtížnosti:

Pro složitěji bodované úlohy se indexy počítají pomocí aritmetického průměru bodových hodnocení všech testovaných v dané položce a nejvyššího dosažitelného počtu bodů za ni. Při sumativním testování přinášejí největší užitek, nejlepší diskriminaci, úlohy, jejichž hodnota obtížnosti není ani příliš velká, ani příliš malá (typicky 20–80 %). Je to logické, protože položky, které jsou příliš obtížné, nerozliší mezi slabšími a lepšími účastníky testu, neboť příliš těžkou úlohu prostě nikdo nevyřeší. Podobě na opačném konci obtížností nepřinese téměř žádnou informaci příliš snadná položka, protože příliš snadnou úlohu vyřeší i velmi slabí účastníci testu. U položek s okrajovými hodnotami obtížnosti se tedy zákonitě snižuje jejich diskriminační schopnost. Povšimněme si, že tento odhad obtížnosti položek (zavedený v rámci klasické testové teorie, CTT) je závislý na testovaných. Pro každou skupinu vyjde hodnota jinak, a budou-li se skupiny navzájem výrazněji lišit, může obtížnost téže úlohy vycházet pro každou skupinu úplně jinak. Překonání této provázanosti mezi obtížnosti a testovanými umožňuje teorie odpovědi na položku, v níž je schopnost testovaných jedním z parametrů. 6.4.2 Citlivost položky Citlivost úlohy, neboli její diskriminace, popisuje její schopnost rozlišovat mezi různě výkonnými studenty. Představme si, že skupinu studentů rozdělíme na lepší a horší, např. podle jejich celkového výsledku v testu. Rozdíl mezi průměrnou úspěšností obou skupin při řešení konkrétní úlohy vyjadřuje schopnost této položky rozlišovat mezi lepšími a horšími studenty a označuje se jako upper-lower index (ULI). ULI spočítáme jako rozdíl úspěšnosti mezi skupinou lepších (U – upper) a horších (L – lower) studentů při řešení konkrétní položky. , 98

Ukázka elektronické knihy, UID: KOS508884


Analýza testu a jeho položek

6

Obr. 6.4.1 Index ULI – rozdíl v pravděpodobnosti správné odpovědi na položku mezi lepšími a horšími studenty

Pro testy, které mají rozlišit mezi nejlepšími a druhými nejlepšími, např. při přijímacích testech s velkým převisem zájemců, nás může zajímat, jak položka rozlišuje právě v okolí dělícího skóre mezi přijatými a nepřijatými. V takovém případě lze použít index ULI zaměřený na předěl mezi určitými percentily, mezi něž padá dělící skóre. Index ULI může teoreticky nabývat hodnot mezi −1 a 1, ale záporné hodnoty jsou příznakem velmi hrubé chyby v položce (nebo chyby v klíči) a v praxi jsou vzácné. ULI rovné jedné znamená, že všichni lepší studenti položku zvládnou, zatímco všichni horší nikoli. Byčkovský a Zvára (2007) uvádějí, že: ● pro položky s obtížností mezi 0,2 a 0,3, nebo obtížností mezi 0,7 a 0,8 by citlivost ULI měla být alespoň 0,15, ● v případě úloh s obtížností mezi 0,3 a 0,7 by rozlišovací schopnost ULI měla být aspoň 0,25. Pokud je hodnota ULI nižší, je třeba úlohu považovat za podezřelou. V praxi se položky kolem uvedených hranic považují za sice nikoli ideální, ale tolerovatelné. Pokud je však hodnota ULI příliš nízká (ULI < 0,1), je třeba úlohu zkontrolovat, jestli je dobře zkonstruována a zda neobsahuje nějakou závažnou chybu. Pokud pracujeme s jemnějším dělením intervalu schopností (jako v případě ULI54), může být hodnota indexu kolem 0,1 naprosto v pořádku. Nicméně jakmile je hodnota libovolně pojatého ULI blízká nule, nebo dokonce záporná, znamená to, že úloha nefunguje. Záporná hodnota ULI znamená, že horší studenti odpovídali lépe než lepší. V položce tedy může být něco, co lepší studenty zavede na nesprávnou stopu, např. v úloze hledají chyták. Záporným ULI se také projeví chyba v klíči, podle kterého se úloha boduje. Takovou položku je třeba buď opravit, nebo z testování rovnou vyřadit. Zajímavý problém představuje metodika rozdělení intervalu schopností na menší díly. Může se stát, že interval nejde „strojově“ rozdělit úplně ideálně, např. proto, že na pomezí mezi 99

Ukázka elektronické knihy, UID: KOS508884


6

Analýza testu a jeho položek

Obr. 6.4.2 Index ULI54 – rozdíl v pravděpodobnosti správné odpovědi na položku mezi pětinou nejlepších a pětinou dalších studentů

skupinami je velká skupina se stejnými výsledky. V praxi se ukazuje, že pro představu o citlivosti položky je způsob dělení na hraně intervalu málo významný. I když spornou skupinu na hraně intervalů rozdělíte arbitrárně, výsledné ULI dává většinou velmi dobrou představu o chování položky. Některé práce používají jiné dělení intervalu schopností. Zkoušející například rozdělí studenty na tři skupiny podle výsledků v testu. Často se používá rozdělení testovaných na „horní třetinu“ a „spodní třetinu“, ale studie ukázaly, že když jsou studenti rozděleni na skupiny, které mají v „horní“ a „dolní“ skupině po 27 % studentů, hodnota diskriminace se zvyšuje (Swerdlik et al. 2012). Je zřejmé, že 46 % procent studentů se středním skóre v testu se při výpočtu indexu diskriminace neprojeví. Této praxe se přidržuje např. i testovací systém Rogō, který počítá ULI na základě dolních a horních 27,5 % studentů. 6.4.3 Vizualizace výsledků položkové analýzy 6.4.4 Příklady položek a grafické vyjádření jejich vlastností Ukažme si několik příkladů chování položek použitých v přijímacích testech a jejich grafické vyjádření. Příklad první: Člověk slyší zvuk v rozsahu: a) 16 až 20 000 Hz, b) do 100 000 Hz, c) méně než 16 Hz, d) více než 20 000 Hz. Při recenzi položky bychom mohli diskutovat řadu chyb, které položka vykazuje. Například navržené distraktory c) a d) nemají povahu „rozsahu“, o němž se mluví v zadání. Podívejme se však, jak dopadlo použití této položky v reálném testu. 100

Ukázka elektronické knihy


Turn static files into dynamic content formats.

Create a flipbook
Testování a hodnocení studentů na VŠ (Ukázka, strana 99) by Kosmas-CZ - Issuu