jueves, 14 de junio de 2012

ESTADISTICA NO PARAMÉTRICA

La estadística no paramétrica es una rama de la estadística que estudia las pruebas y modelos estadísticos cuya distribución subyacente no se ajusta a los llamados criterios paramétricos. Su distribución no puede ser definida a priori, pues son los datos observados los que la determinan. La utilización de estos métodos se hace recomendable cuando no se puede asumir que los datos se ajusten a una distribución conocida, cuando el nivel de medida empleado no sea, como mínimo, de intervalo.

Las principales pruebas no paramétricas son las siguientes:

  • Prueba χ² de Pearson
  • Prueba binomial
  • Prueba de Anderson-Darling
  • Prueba de Cochran
  • Prueba de Cohen kappa
  • Prueba de Fisher
  • Prueba de Friedman
  • Prueba de Kendall
  • Prueba de Kolmogórov-Smirnov
  • Prueba de Kruskal-Wallis
  • Prueba de Kuiper
  • Prueba de Mann-Whitney o prueba de Wilcoxon
  • Prueba de McNemar
  • Prueba de la mediana
  • Prueba de Siegel-Tukey
  • Coeficiente de correlación de Spearman
  • Tablas de contingencia
  • Prueba de Wald-Wolfowitz
  • Prueba de los signos de Wilcoxon
La mayoría de estos test estadísticos están programados en los paquetes estadísticos más frecuentes, quedando para el investigador, simplemente, la tarea de decidir por cuál de todos ellos guiarse o qué hacer en caso de que dos test nos den resultados opuestos. Hay que decir que, para poder aplicar cada uno existen diversas hipótesis nulas que deben cumplir nuestros datos para que los resultados de aplicar el test sean fiables. Esto es, no se puede aplicar todos los test y quedarse con el que mejor convenga para la investigación sin verificar si se cumplen las hipótesis necesarias. La violación de las hipótesis necesarias para un test invalidan cualquier resultado posterior y son una de las causas más frecuentes de que un estudio sea estadísticamente incorrecto. Esto ocurre sobre todo cuando el investigador desconoce la naturaleza interna de los test y se limita a aplicarlos sistemáticamente.

MEDIDAS Y ESCALAS DE MEDIDA

El nivel de medida de una variable en matemáticas y estadísticas, también llamado escala de medición, es una clasificación acordada con el fin de describir la naturaleza de la información contenida dentro de los números asignados a los objetos y, por lo tanto, dentro de una variable. Según la teoría de las escalas de medida, varias operaciones matemáticas diferentes son posibles dependiendo del nivel en el cual la variable se mide.

Escalas de medición son una sucesión de medidas que permiten organizar datos en orden jerárquico. Las escalas de medición, pueden ser clasificadas de acuerdo a una degradación de las características de las variables. Estas escalas son: nominales, ordinales, intervalares o racionales. Según pasa de una escala a otra el atributo o la cualidad aumenta. Las escalas de medición ofrecen información sobre la clasificación de variables discretas o continuas, tambien mas conocidas como escalas grandes o pequeñas. Toda vez que dicha clasificación determina la selección de la gráfica adecuada.



PRUEBA BINOMIAL

La prueba binomial analiza variables dicotómicas y compara las frecuencias observadas en cada categoría con las que cabría esperar según una distribución binomial de parámetro especificado en la hipótesis nula tal como se ha explicado en elcapítulo anterior.
La secuencia para realizar este contraste es:
Analizar
Pruebas no paramétricas
Binomial
En el cuadro de diálogo se debe seleccionar la variable en Contrastar variables e indicar la proporción postulada en la hipótesis nula en Contrastar proporción.


Ilustremos con un ejemplo:

Supongamos que una ciudad hay 1000000 de habitantes de los cuales 450000 son varones y 550000 son mujeres . Si extraemos un individuo al azar la probabilidad. de que sea mujer será.
Si repetimos esta prueba varias veces y no reponemos "en el saco" al sujeto extraído la probabilidad de obtener una mujer en cada siguiente extracción variará, al variar la composición por sexos de la población restante. Sin embargo, al ser la población tan grande, la variación de esta probabilidad con cada sucesiva prueba será prácticamente despreciable y podremos considerar, en la práctica que las probabilidades son constantes: en efecto:

Si, en la primera prueba obtenemos una mujer y no la reintegramos a la población la de probabilidad de obtener una mujer en la segunda prueba será:
                                


PRUEBA DE RACHAS

Muchos de los procedimientos estadísticos que se han visto durante el curso requieren la selección aleatoria de datos. La prueba que es estudiaremos es la prueba de rachas que sirve para detectar aleatoriedad, que se basa en el número de series o rachas   que hay en una secuencia de datos.

La prueba aplica sólo si podemos asignar a cada uno de los valores de los datos a una de dos categorías distintas.

La prueba de rachas de una sola muestra nos permite determinar si el número de rachas en una muestra de datos, es o no suficientemente pequeño o suficientemente grande para rechazar la hipótesis nula de que la secuencia observada se debe al azar.

Definimos una racha como una secuencia de datos semejantes precedidas y seguidas por un tipo diferente de observación o por ninguna observación

Ejemplos:
  1. Supongamos, por ejemplo, que un lunes por la mañana se presentan cierto número de hombres y de mujeres a la oficina de transito   para pedir licencias de conducir en el siguiente orden
MM H MM H MM HH M HHH MMMM

En esta secuencia hay un total de nueve rachas. Tenemos una racha que consta de dos mujeres, seguida de una de un hombre, seguida de otra de dos mujeres, etc.

  2. considere el refresco de cola que escogen los consumidores en un proyecto de investigación de mercados. Denotaremos con D a un consumidor que prefiere el refresco de cola de dieta, y con R, uno que prefiere el refresco regular. La secuencia que sigue contiene exactamente cuatro rachas.
DDDD RR DDD R

La única suposición que fundamenta la prueba de rachas de una sola muestra consiste en que cada
observación se pueda clasificar como perteneciente a uno de los dos tipos de observación.

PRUEBA DE LA MEDIANA

La prueba de la mediana es una prueba no paramétrica que podemos considerar un caso especial de la prueba de chi-cuadrado, pues se basa en esta última. Su objetivo es comparar las medianas de dos muestras y determinar si pertencen a la misma población o no.

Para ello, se calcula la mediana de todos los datos conjuntamente. Después, se divide cada muestra en dos subgrupos: uno para aquellos datos que se sitúen por encima de la mediana y otro para los que se sitúen por debajo. La prueba de chi-cuadrado determinará si las frecuencias observadas en cada grupo difieren de las esperadas con respecto a una distribución de frecuencias que combine ambas muestras.
Esta prueba está especialmente indicada cuando los datos sean extremos o estén sesgados.


PRUEBA DE LOS SIGNOS WILCOXON

La prueba de los signos de Wilcoxon es una prueba no paramétrica para comparar la mediana de dos muestras relacionadas y determinar si existen diferencias entre ellas. Se utiliza como alternativa a la prueba t de Student cuando no se puede suponer la normalidad de dichas muestras. Debe su nombre a Frank Wilcoxon, que la publicó en 1945.
Se utiliza cuando la variable subyacente es continua pero presupone ningún tipo de distribución particular.


PLANTEAMIENTO
Supóngase que se dispone de n pares de observaciones, denominadas (x_i, y_i). El objetivo del test es comprobar si puede dictaminarse que los valores x_i e y_i son o no iguales.

SUPOSICIÓN

  1. Si z_i=y_i-x_i, entonces los valores z_i son independientes.
  2. Los valores z_i tienen una misma distribución continua y simétrica respecto a una mediana común \theta.
METODO

La hipótesis nula es H_0: \theta=0. Retrotrayendo dicha hipótesis a los valores x_i, y_i originales, ésta vendría a decir que son en cierto sentido del mismo tamaño.
Para verificar la hipótesis, en primer lugar, se ordenan los valores absolutos |z_1|,\dots,|z_n| y se les asigna su rango R_i. Entonces, el estadístico de la prueba de los signos de Wilcoxon, W^+, es
W^+=\sum_{z_i > 0} R_i,

es decir, la suma de los rangos R_i correspondientes a los valores positivos de z_i.
La distribución del estadístico W^+ puede consultarse en tablas para determinar si se acepta o no la hipótesis nula.

En ocasones, esta prueba se usa para comparar las diferencias entre dos muestras de datos tomados antes y después del tratamiento, cuyo valor central se espera que sea cero. Las diferencias iguales a cero son eliminadas y el valor absoluto de las desviaciones con respecto al valor central son ordenadas de menor a mayor. A los datos idénticos se les asigna el lugar medio en la serie. la suma de los rangos se hace por separado para los signos positivos y los negativos. S representa la menor de esas dos sumas. Comparamos S con el valor proporcionado por las tablas estadísticas al efecto para determinar si rechazamos o no la hipótesis nula, según el nivel de significación elegido.

LA PRUEBA DE MANN-WHITNEY

En estadística la prueba U de Mann-Whitney (también llamada de Mann-Whitney-Wilcoxon, prueba de suma de rangos Wilcoxon, o prueba de Wilcoxon-Mann-Whitney) es una prueba no paramétrica aplicada a dos muestras independientes. Es, de hecho, la versión no paramétrica de la habitual prueba t de Student.

Fue propuesto inicialmente en 1945 por Frank Wilcoxon para muestras de igual tamaños y extendido a muestras de tamaño arbitrario como en otros sentidos por Henry B. Mann y D. R. Whitney en 1947.

PLANTEAMIENTO DE LA PRUEBA

La prueba de Mann-Whitney se usa para comprobar la heterogeneidad de dos muestras ordinales. El planteamiento de partida es:
  1. Las observaciones de ambos grupos son independientes
  2. Las observaciones son variables ordinales o continuas.
  3. Bajo la hipótesis nula, las distribuciones de partida de ambas distribuciones es la misma
  4. Bajo la hipótesis alternativa, los valores de una de las muestras tienden a exceder a los de la otra: P(X > Y) + 0.5 P(X = Y)  > 0.5.

CALCULO DEL ESTADISTICO

Para calcular el estadístico U se asigna a cada uno de los valores de las dos muestras su rango para construir
U_1=R_1 - {n_1(n_1+1) \over 2}
U_2=R_2 - {n_2(n_2+1) \over 2}
donde n1 y n2 son los tamaños respectivos de cada muestra; R1 y R2 es la suma de los rangos de las observaciones de las muestras 1 y 2 respectivamente.

El estadístico U se define como el mínimo de U1 y U2.
Los cálculos tienen que tener en cuenta la presencia de observaciones idénticas a la hora de ordenarlas. No obstante, si su número es pequeño, se puede ignorar esa circunstancia.

DISTRIBUCIÓN DEL ESTADÍSTICO

La prueba calcula el llamado estadístico U, cuya distribución para muestras con más de 20 observaciones se aproxima bastante bien a la distribución normal.

La aproximación a la normal, z, cuando tenemos muestras lo suficientemente grandes viene dada por la expresión:

z=(U-m_U)/\sigma_{U}

Donde mU y σU son la media y la desviación estándar de U si la hipótesis nula es cierta, y vienen dadas por las siguientes fórmulas:

m_U=n_1 n_2/2.
\sigma_U=\sqrt{n_1 n_2 (n_1+n_2+1) \over 12}.

 

 

No hay comentarios:

Publicar un comentario