COMPROBAR LA HIPÓTESIS POR MÉTODOS ESTADÍSTICOS CUALITATIVOS
COMITÉ CIENTÍFICO DE LA EDITORIAL TIRANT LO BLANCH María José añón roig
Catedrática de Filosofía del Derecho de la Universidad de Valencia
ana Cañizares Laso
Catedrática de Derecho Civil de la Universidad de Málaga
Jorge a. Cerdio Herrán
Catedrático de Teoría y Filosofía de Derecho. Instituto Tecnológico Autónomo de México
José raMón Cossío díaz
Ministro en retiro de la Suprema Corte de Justicia de la Nación y miembro de El Colegio Nacional
eduardo Ferrer MaC-gregor Poisot
Juez de la Corte Interamericana de Derechos Humanos, Investigador del Instituto de Investigaciones Jurídicas de la UNAM
owen Fiss
Catedrático emérito de Teoría del Derecho de la Universidad de Yale (EEUU)
José antonio garCía-CruCes gonzáLez
Catedrático de Derecho Mercantil de la UNED
Luis LóPez guerra
Catedrático de Derecho Constitucional de la Universidad Carlos III de Madrid
ángeL M. LóPez y LóPez
Catedrático de Derecho Civil de la Universidad de Sevilla
Marta Lorente sariñena
Catedrática de Historia del Derecho de la Universidad Autónoma de Madrid
víCtor Moreno Catena
Catedrático de Derecho Procesal de la Universidad Carlos III de Madrid
FranCisCo Muñoz Conde
Catedrático de Derecho Penal de la Universidad Pablo de Olavide de Sevilla
angeLika nussberger
Catedrática de Derecho Constitucional e Internacional en la Universidad de Colonia (Alemania) Miembro de la Comisión de Venecia
HéCtor oLasoLo aLonso
Catedrático de Derecho Internacional de la Universidad del Rosario (Colombia) y Presidente del Instituto Ibero-Americano de La Haya (Holanda)
LuCiano PareJo aLFonso
Catedrático de Derecho Administrativo de la Universidad Carlos III de Madrid
ConsueLo raMón CHornet
Catedrática de Derecho Internacional Público y Relaciones Internacionales de la Universidad de Valencia
toMás saLa FranCo
Catedrático de Derecho del Trabajo y de la Seguridad Social de la Universidad de Valencia
ignaCio sanCHo gargaLLo
Magistrado de la Sala Primera (Civil) del Tribunal Supremo de España
toMás s. vives antón
Catedrático de Derecho Penal de la Universidad de Valencia
rutH ziMMerLing
Catedrática de Ciencia Política de la Universidad de Mainz (Alemania)
Javier de LuCas Martín
Catedrático de Filosofía del Derecho y Filosofía Política de la Universidad de Valencia
Procedimiento de selección de originales, ver página web: www.tirant.net/index.php/editorial/procedimiento-de-seleccion-de-originales
COMPROBAR LA HIPÓTESIS POR MÉTODOS ESTADÍSTICOS CUALITATIVOS
MOHAMMAD H. BADII, AMALIA GUILLÉN GAYTÁN, MARIO A. GARCÍA MARTÍNEZ & JUAN A. MARTÍNEZ ARRIETA
tirant lo blanch Ciudad de México, 2022
Copyright ® 2022 Todos los derechos reservados. Ni la totalidad ni parte de este libro puede reproducirse o transmitirse por ningún procedimiento electrónico o mecánico, incluyendo fotocopia, grabación magnética, o cualquier almacenamiento de información y sistema de recuperación sin permiso escrito de los autores y del editor. En caso de erratas y actualizaciones, la Editorial Tirant lo Blanch México publicará la pertinente corrección en la página web www.tirant.com/mex/ Este libro será publicado y distribuido internacionalmente en todos los países donde la Editorial Tirant lo Blanch esté presente.
© Mohammad H. Badii Amalia Guillén Gaytán Mario A. García Martínez & Juan A. Martínez Arrieta
© EDITA: TIRANT LO BLANCH DISTRIBUYE: TIRANT LO BLANCH MÉXICO Av. Tamaulipas 150, Oficina 502 Hipódromo, Cuauhtémoc CP 06100, Ciudad de México Telf: +52 1 55 65502317 infomex@tirant.com www.tirant.com/mex/ www.tirant.es ISBN: 978-84-1130-023-0 MAQUETA: Disset Ediciones Si tiene alguna queja o sugerencia, envíenos un mail a: atencioncliente@tirant.com. En caso de no ser atendida su sugerencia, por favor, lea en www.tirant.net/index.php/empresa/politicas-de-empresa nuestro procedimiento de quejas. Responsabilidad Social Corporativa: http://www.tirant.net/Docs/RSCTirant.pdf
ÍNDICE PRÓLOLGO...............................................................................................
9
INTRODUCCIÓN.......................................................................................
11
Ventajas de los métodos No-Paramétricos.....................................................................
12
Desventajas de los métodos No-Paramétricos...............................................................
13
TIPOS DE VARIABLES Y SU USO EN LA INVESTIGACIÓN......................
15
MODELO ESTADÍSTICOS PARA LA INVESTIGACIÓN CUALITATIVA.......
19
ESCALA NOMINAL...................................................................................
21
ESCALA NOMINAL: 1 MUESTRA.............................................................
23
Modelo Poisson............................................................................................................
23
Modelo Binomial..........................................................................................................
32
Modelo de Ji2 de Pearson ............................................................................................
46
ESCALA NOMINAL: 2 MUESTRAS...........................................................
57
Alternativas al Modelo de Ji2........................................................................................................................................
57
2
Prueba Xp de proporción (≥ 2 muestras independientes)..............................................
63
Tabla de Contingencia (TC2): 2 Muestras Independientes...............................................
70
Prueba de Cochran-Mantel-Hanzsel (C-M-H).................................................................
80
Modelo McNemar: 2 Muestras Dependientes...............................................................
86
ESCALA NOMINAL: “N” MUESTRAS.......................................................
96
Tabla de contingencia, TCn. “n” Muestras independientes.............................................
96
Modelo Q de Cochran: “n” Muestras Dependientes......................................................
109
MODELOS ESTADÍSTICOS EN DIFERENTES ESCALAS............................
129
ESCALA ORDINAL....................................................................................
130
Escala Ordinal: 1 Muestra.............................................................................................
130
Modelo Kolmogorov–Smirnov (K-S1): 1 Muestra...........................................................
130
ESCALA ORDINAL: 2 MUESTRAS............................................................
142
8
Índice
Modelo Kolmogorov–Smirnov (K-S2): 2 Muestras Independientes..................................
142
Prueba de signos: 2 Muestras Independientes...............................................................
155
Modelo Wald-Wolfowitz: 2 Muestras Independientes....................................................
164
Suma de Rangos de Wilcoxon (SRWT): 2 Muestra Dependientes....................................
167
Signo de Rangos de Wilcoxon (SRWT): 2 Muestra Dependientes....................................
174
Prueba de comparación de 2 medianas.........................................................................
189
Escala ordinal: “n” Muestras........................................................................................
191
Modelo Kruskal-Wallis (K-W): “n” Muestra Independientes...........................................
191
Comparación de medianas: “n” Muestra Independientes..............................................
206
Comparación de múltiples medianas, Ejemplo 1............................................................
207
Modelo Friedman: “n” Muestra Dependientes...............................................................
209
MODELOS DE ASOCIACIÓN O CORRELACIÓN NO-PARAMÉTRICA......
219
Correlación de Spearman, 1904....................................................................................
219
Correlación Tau de Kendall, 1939..................................................................................
222
Coeficiente de concordancia de Kendall........................................................................
224
Coeficiente de Correlación Biserial de Puntos................................................................
227
PRUEBA DE CONFIABILIDAD DE KAPPA........................................................................
230
DETECCIÓN Y VALIDACIÓN DE META-POBLACIONES...........................
233
JI2 Heterogénea............................................................................................................
233
TABLAS DE CONTINGENCIA HETEROGÉNEA (TCHET)...........................
236
REFERENCIAS...........................................................................................
239
PRÓLOLGO Existen diversos procedimientos, métodos y libros en el campo de la estadística no-paramétrica. Se ha tratado de mantener los aspectos teóricos a nivel mínimo para dedicar más al aspecto de la aplicación de los procedimientos. La selección de los métodos en este libro está basada en dos factores: la utilidad del método y su nivel del uso. Por tanto, aquí se encuentran los métodos más útiles y de uso más común para la investigación cualitativa. En el presente libro se pone énfasis en los casos en donde: a) los datos tanto en la escala nominal como ordinal, son observaciones y/o frecuencias y el investigador desea descubrir tendencia, asociación y/o independencia entre ellas, tanto para el caso de una muestra que se contrasta con la población de la cual se deriva, como para dos o más muestras (relacionados o no relacionados) provenientes de sus respectivas poblaciones; b) cuando el objetivo es determinar el nivel de asociación entre dos variables, sin embargo, no se reúnen los supuestos de la regresión paramétrica; c) situaciones en donde el propósito del investigador es comprobar la existencia de un metagrupo llamado meta-data, meta-población o meta-comunidad. Por tanto, los modelos utilizados en este libro contestan las dos predicciones fundamentales de la ciencia de la estadística, es decir, a) predecir la similitud y/o la diferencia entre grupos de datos; y b) predecir el nivel de asociación y el grado de dependencia entre las variables. Se presentan múltiples ejemplos de diferentes campos, para cada método, en el área de ciencias sociales con el propósito de servir como: a) una fuente de referencia para la investigación, b) un recurso de prácticas de los estudiantes, y c) una guía para los maestros dentro de las clases. Los autores,
San Nicolás de los Garza, N.L., México, Marzo de 2022
INTRODUCCIÓN El campo de la estadística no paramétrica y su aplicación en la investigación cualitativa ha tenido un desarrollo tan grande, que ahora tenemos, para casi cualquier diseño de investigación, pruebas estadísticas alternativas válidas que podemos utilizar para producir acerca de una hipótesis (Box, 1999, Foroughbakhsh y Badii, 2005, Badii et al., 2006, Gravetter et al, 2011 y Garza Olvera, 2014). Teniendo pruebas alternativas válidas, necesitamos algunas bases racionales para elegir entre ellas (Maxwell and Delaney, 1990). En este capítulo los procedimientos se centran en la estadística no paramétrica donde va presentar un análisis de las bases para elegir entre varias pruebas aplicables a un diseño de investigación determinado (Dixon and Massey, 1960, Kepner y Robinson, 1988, Daniel, 1989 y Camargo, et al., 2010). Las pruebas no paramétricas también llamadas pruebas de “distribución libre”, son aquellas en las que no existen supuestos sobre la distribución de los parámetros de la población. Se aplican con mayor frecuencia a los datos nominales y ordinales, si bien pueden emplearse también para analizar datos continuos transformados a una escala ordinal (Bancrof, 1968, Tanur, 1978, Glantz, 1992 y Howeel, 1999). Métodos estadísticos basados en supuestos de las distribuciones basales son Métodos Estadísticos Paramétricos. Los resultados arrojados de estos métodos dependen en la validez de sus supuestos. Hay que resaltar que si la distribución de los datos es normal, o se puede aplicar la Teorema de Límite Central “T.L.C.”, los métodos paramétricos son mejores y preferible a emplear. Métodos No-Paramétricos (libre de distribución) no asumen ninguna distribución. La teoría sobre la cual las pruebas paramétricas (Prueba de t student, ANOVA, Regresión, etc.) están basadas requiere que se reúnen ciertos supuestos tales como: a) la muestra provenga de una población normal, b) las varianzas sean homogéneas, c) existe una relación lineal, es decir que prevalezca la aditividad, d) que los residuales tengan una distribución normal.
12
Mohammad H. Badii, Amalia Guillén Gaytán Mario A. García Martínez & Juan A. Martínez Arrieta
Sin embargo, existe un cuerpo enorme de métodos estadísticos con procedimientos que no requieren la estimación de la media o la varianza de la población y no conducen pruebas de hipótesis sobre los parámetros de la población. Estos métodos de procedimientos se denominan “pruebas no-paramétricas”. Debido a que estos métodos tampoco hacen supuestos sobre la distribución (por ejemplo, normalidad) de los datos de las muestras tomadas de las poblaciones, entonces se les denominan también “pruebas libres de distribución”. Cuando hay justificación (por ejemplo, debido a que los supuestos para los modelos paramétricos no se cumplen) de utilizar las pruebas no-paramétricas, hay que usarlas. Sin embargo, cuando se puede emplear tanto el modelo paramétrico como el modelo noparamétrico, siempre hay que utilizar el de paramétrico ya que este modelo tiene mayor nivel de potencia estadística y por ende es más capaz de detectar una diferencia verdadera cuando existe, en otras palabras, los modelo no-paramétricos con mayor probabilidad cometen error tipo II, aunque la diferencia entre los dos modelos, en este sentido no es grande. A veces se declara que hay que utilizar los modelos no-paramétricos solamente, cuando los datos están en la escala ordinal, sin embargo, esto no es correcto. Esto se debe a que no hay una base teórica que indique que los modelos paramétricos requieran datos en escala de intervalo o razón. Sin embargo, puede argumentar que datos de una población en la escala ordinal tienen mayor probabilidad de desviarse de la distribución normal en comparación con los datos en la escala de intervalo o razón (Anderson, 1961; Gaito, 1959, 1960; Savage, 1957; Stevens, 1968).
VENTAJAS DE LOS MÉTODOS NO-PARAMÉTRICOS 1. No necesitan asumir distribución. Cuando es posible hacer solamente supuestos débiles acerca de la naturaleza de las distribuciones que fundamentan los datos,entonces los estadísticos no paramétricos son los apropiados.
Introducción
13
2. A veces, solo será posible poco más que categorizar los datos por falta de unaescala de medición adecuada. En este caso, lo ideal es hacer una prueba noparamétrica. 3. Cuando es posible asignar rangos a los datos, se dispone de procedimientos no paramétricos. Por ejemplo, puede asignarse rangos por textura o sabor; o bien por sexos. 4. Como la estadística no paramétrica usa recuentos, rangos o los signos de diferencias de observaciones pareadas, suelen ser, aunque no siempre, rápida y fácil de aplicar y aprender. 5. Se pueden usar para datos nominales y ordinales. 6. Se puede conducir pruebas de Hipótesis Cuando no hay la media “µ” o la varianza “σ2”. 7. Computación es más simple. 8. Debido a usar rangos, son menos sensibles a errores de medición.
DESVENTAJAS DE LOS MÉTODOS NO-PARAMÉTRICOS 1. Usan y generan menos información en comparación con los modelos paramétricos. 2.- Son menos sensibles en comparación a los modelos paramétricos ya que requieren diferencias mayores para rechazar la hipótesis nula “Ho”. 3. Son menos eficientes comparado con los modelos Paramétricos. Además, requieren tamaño de la muestra “n” mayor para superar la perdida de in formación. En resumen, Se puede mencionar que la ventaja principal de los modelos no-paramétricos es que son libre de distribución y sus procedimientos son muy sencillos, mientras que la desventaja principal de ellos es que, en el primer lugar, captan poca información y en el segundo lugar, el nivel de la potencia estadística en estos modelo es
14
Mohammad H. Badii, Amalia Guillén Gaytán Mario A. García Martínez & Juan A. Martínez Arrieta
más baja en comparación con los modelos paramétricos. Por ejemplo, en el caso del Modelo de Kruskal-Wallis que se utiliza en lugar de ANOVA una vía para muestras independientes tiene 3/π = 95% de poder estadístico de ANOVA para datos paramétrico. Y el Modelo Friedman (ANOVA doble entrada) tiene 3K/[π(K-1)] de la potencia estadística de ANOVA paramétrica, es decir, su potencia estadística incluye un rango desde 64% para K=2, a 72% para K=3 y hasta 95% para K = infinito, donde K es el número de muestras o grupos a contrastar. Hay que recordar que independientemente del área de interés académico de uno, existen solamente dos tipos de predicciones en todas las ramas de las ciencias. La primera predicción está relacionada con la noción de tratar de medir la diferencia o la similitud entre grupos de datos. En caso de un grupo de datos, es decir solamente una muestra, la idea es tratar de medir la diferencia (o similitud) del valor esperado de la muestra en comparación con el parámetro de la población. En caso de múltiples muestras o grupos de datos la noción se centra en buscar la diferencia o similitud entre los valores esperados de dichas muestras provenientes de sus probables poblaciones. La segunda predicción implica el investigar el grado de asociación entre dos variables o entre múltiples variables.
TIPOS DE VARIABLES Y SU USO EN LA INVESTIGACIÓN Para tener el mismo entendimiento de las variables se presentan de manera resumida las siguientes definiciones. Variable. Una característica de la unidad experimental. No todas las características de las unidades experimentales se pueden medir con la misma variable y por ende, hay varias escalas de variables. Escala nominal. Se trata de nombrar las unidades experimentales y sirve para ver si dos unidades experimentales son iguales o no. Cabe señalar que esta escala constituye la escala más general y la que provee la mínima cantidad de información. Se utiliza esta escala en la investigación cualitativa. Escala ordinal. Se trata de organizar las unidades experimentales en orden de magnitud, entonces, aquí no solamente se define si existe igualdad entre las unidades experimentales, sino también, qué relación en término de magnitud tienen la una con la otra. Se utiliza esta escala en la investigación cualitativa. Escala razón. Esta escala se utiliza cuando existen dos rasgos siguientes. 1. Entre dos valores adyacentes de la variable hay una distancia constante, 2. Se utiliza un cero verdadero. Un ejemplo de la escala razón sería el número de las los robos en casas habitacional durante una semana o el número de los votos emitidos en favor de un candidato en una contienda política. Escala intervalo. En comparación con la escala anterior, en esta escala existen los siguientes rasgos. 1. Entre dos valores adyacentes de la variable hay una distancia constante. 2. No utiliza un cero verdadero. Un ejemplo de la escala razón sería la hora (el cero es la 12 de media noche o 24 horas seleccionada en base a un convenio) o la temperatura en grados Celsius, en donde el cero está basado en el congelamiento del agua que también su origen está en base a un convenio.
16
Mohammad H. Badii, Amalia Guillén Gaytán Mario A. García Martínez & Juan A. Martínez Arrieta
Cabe mencionar que en primer lugar, las escalas nominal y ordinal se usan en la investigación cualitativa, mientras que las escalas de razón e intervalo se utilizan en la investigación de tipo cuantitativa. Además, las dos primeras escalas miden las variables en forma más aproximada en lugar de manera precisa. Cada uno de las dos escalas de razón e intervalo pueden presentarse en las dos formas siguientes. Escala discreta. En este caso, entre dos valores adyacentes de la variable solamente puede ocurrir un solo valor íntegro, un ejemplo sería el caso del número de accidentes automovilísticos durante un tiempo específico. Escala continua. En este caso, entre dos valores adyacentes de la variable puede ocurrir un infinito número de valores, un ejemplo sería el caso de la altura o el peso de los objetos. Aquí lo que determina la cantidad de los valores posibles será la precisión del instrumento que se utiliza para la medición de la variable. Población o universo. Un conjunto total de las observaciones o mediciones o individuos que uno desea estudiar, durante un tiempo y un espacio específico. Muestra. Es un segmento (por definición pequeño) tomada de la población basado en ciertos criterios, para poder representar la población. Parámetro. Es la variable de la población. Estimación o la estadística. Es la variable de la muestra. Rasgos de una buena estimación. 1. No tener sesgo, donde el sesgo significa la diferencia entre el parámetro y la estimación. 2. Tener alto grado de precisión, donde la precisión indica el grado de la similitud o la cercanía entre varias estimaciones derivadas de diferentes muestras tomadas de la misma población. La precisión se mide por medio de la varianza o desviación estándar, el error estándar o el coeficiente de variación de la muestra. 3. Poseer alto nivel de exactitud, donde la exactitud significa la diferencia estandarizada entre una observación estandarizada y el parámetro y se la mide por el cuadrado medio del término de residual o error experimental.
Comprobar la Hipótesis por Métodos Estadísticos Cualitativos
17
Estimador. Una expresión matemática que nos permite cuantificar la estimación. Modelo. Es un conjunto de supuestos acerca del proceso que se está estudiando. Un modelo es una abstracción del mundo real. Se usa el modelo para reflejar y por ende predecir el mundo y se mide el poder de un modelo en base al grado de la cercanía entre la predicción por el modelo y lo manifiesto en el mundo real.
MODELO ESTADÍSTICOS PARA LA INVESTIGACIÓN CUALITATIVA La Tabla A1 & A2 indican los diferentes modelos estadísticos en las escalas nominal y ordinal, respectivamente, según el número de las muestras.
A1. La escala nominal Los modelos para esta escala que responden a la predicción I (manejar diferencia entre datos) se presentan en la Tabla siguiente (Siegel, 2001. Siegel & Gastellum, 1995; Pagano, 2011 y PerézTejada, 2008). Tabla A1. Los modelos estadísticos, en la investigación cualitativa, en escala nominal$. Número de muestras 1 2 >2 Independientes Dependientes Independientes dependientes Ji2 Pearson (1904), Poisson (1837 [Struik, 1967]), BinoT.C. Pearson McNemar T.C. Pearson Q Cochran mial (Newton, (1904) (1947) (1904) (1947) 1676 [Cajori, 1954]) $: T.C. = Tablas de contingencia,
A2. La escala ordinal Los modelos para la escala ordinal que responden a la predicción I (tratar de diferenciar entre datos) se presentan en la Tabla siguiente (Badii et al, 2009).
20
Mohammad H. Badii, Amalia Guillén Gaytán Mario A. García Martínez & Juan A. Martínez Arrieta
Tabla A2. Los modelos estadísticos, en la investigación cualitativa, en escala ordinal$. Número de muestras 1 (K-S2) Kolmogor o v - S m i rnov (1933)
2 Independientes K-S2, Kolmogorov-Smirnov (1933)
>2 dependientes Independientes Wilcoxon (1945)
Kruskal-Wallis (1952)
$: K-S = Kolmogorov-Smirnov, K-W = Kruskal-Wallis
dependientes Friedman (1940)