jueves, 14 de junio de 2012

MEDIDAS DE ASOCIACIÓN

En epidemiología, las medidas de asociación tratan de estimar la magnitud con la que dos fenómenos se relacionan. Dicha asociación no implica necesariamente causalidad. Ejemplos de medidas de asociación son:
  • El riesgo relativo, utilizado en los estudios de cohortes. Compara la ocurrencia o incidencia acumulada de un suceso entre quienes están expuestos a un factor de riesgo y quienes no.
  • La razón de tasas, compara tasas de incidencia, es decir, la velocidad a la que ocurre un determinado fenómeno entre personas expuestas y no expuestas a un factor de riesgo.
  • El odds ratio, que se usa en los estudios de casos y controles, y que nos permite relacionar cuánto más probable es que se produzca una exposición determinada entre las personas enfermas (casos) que entre las sanas (controles).
En estadística hay datos cualitativos y cuantitativos para las pruebas de 1, 2 y 3 o más variables. Típicos estadísticos de asociación son la regresión y la correlación, que a su vez se divide en datos cardinales y ordinales.

DEFINICIÓN DE CORRELACIÓN

El término correlación se utiliza generalmente para indicar la correspondencia o la relación recíproca que se da entre dos o más cosas, ideas, personas, entre otras.

En tanto, en probabilidad y estadística, la correlación es aquello que indicará la fuerza y la dirección lineal que se establece entre dos variables aleatorias.

DATOS QUE NOS APORTAN EL COEFICIENTE DE CORRELACIÓN


En estadística, el coeficiente de correlación de Pearson es un índice que mide la relación lineal entre dos variables aleatorias cuantitativas. A diferencia de la covarianza, la correlación de Pearson es independiente de la escala de medida de las variables.

De manera menos formal, podemos definir el coeficiente de correlación de Pearson como un índice que puede utilizarse para medir el grado de relación de dos variables siempre y cuando ambas sean cuantitativas.



CLASIFICACION DE CORRELACIÓN

Correlación directa

La correlación directa se da cuando al aumentar una de las variables la otra aumenta.
La recta correspondiente a la nube de puntos de la distribución es una recta creciente.


nube


Correlación inversa

La correlación inversa se da cuando al aumentar una de las variables la otra disminuye.
La recta correspondiente a la nube de puntos de la distribución es una recta decreciente.

nube


Correlación nula.

La correlación nula se da cuando no hay dependencia de ningún tipo entre las variables.
En este caso se dice que las variables son incorreladas y la nube de puntos tiene una forma redondeada.


nube

DIAGRAMA DE DISPERSIÓN

Un diagrama de dispersión es un tipo de diagrama matemático que utiliza las coordenadas cartesianas para mostrar los valores de dos variables para un conjunto de datos.
Los datos se muestran como un conjunto de puntos, cada uno con el valor de una variable que determina la posición en el eje horizontal y el valor de la otra variable determinado por la posición en el eje vertical.

 Un diagrama de dispersión se llama también gráfico de dispersión.




Se emplea cuando una variable está bajo el control del experimentador. Si existe un parámetro que se incrementa o disminuye de forma sistemática por el experimentador, se le denomina parámetro de control o variable independiente = eje de x y habitualmente se representa a lo largo del eje horizontal. La variable medida o dependiente = eje de y usualmente se representa a lo largo del eje vertical. Si no existe una variable dependiente, cualquier variable se puede representar en cada eje y el diagrama de dispersión mostrará el grado de correlación (no causalidad) entre las dos variables.

Un diagrama de dispersión puede sugerir varios tipos de correlaciones entre las variables con un intervalo de confianza determinado. La correlación puede ser positiva (aumento), negativa (descenso), o nula (las variables no están correlacionadas). Se puede dibujar una línea de ajuste (llamada también "línea de tendencia") con el fin de estudiar la correlación entre las variables. Una ecuación para la correlación entre las variables puede ser determinada por procedimientos de ajuste. Para una correlación lineal, el procedimiento de ajuste es conocido como regresión lineal y garantiza una solución correcta en un tiempo finito


ASOCIACIÓN ENTRE VARIABLES DE INTERVALOS: MÉTODO DE CORRELACIÓN, MOMENTO DE PEARSON

En este artículo trataremos de valorar la asociación entre dos variables cuantitativas estudiando el método conocido como correlación. Dicho cálculo es el primer paso para determinar la relación entre las variables. La predicción de una variable. La predicción de una variable dado un valor determinado de la otra precisa de la regresión lineal que abordaremos en otro artículo.

La cuantificación de la fuerza de la relación lineal entre dos variables cuantitativas, se estudia por medio del cálculo del coeficiente de correlación de Pearson 1-3. Dicho coeficiente oscila entre –1 y +1. Un valor de –1 indica una relación lineal o línea recta positiva perfecta. Una correlación próxima a cero indica que no hay relación lineal entre las dos variables.

El realizar la representación gráfica de los datos para demostrar la relación entre el valor del coeficiente de correlación y la forma de la gráfica es fundamental ya que existen relaciones no lineales.
El coeficiente de correlación posee las siguientes características 4:
  1. El valor del coeficiente de correlación es independiente de cualquier unidad usada para medir las variables.
  2. El valor del coeficiente de correlación se altera de forma importante ante la presencia de un valor extremo, como sucede con la desviación típica. Ante estas situaciones conviene realizar una transformación de datos que cambia la escala de medición y modera el efecto de valores extremos (como la transformación logarítmica).
  3. El coeficiente de correlación mide solo la relación con una línea recta. Dos variables pueden tener una relación curvilínea fuerte, a pesar de que su correlación sea pequeña. Por tanto cuando analicemos las relaciones entre dos variables debemos representarlas gráficamente y posteriormente calcular el coeficiente de correlación.
  4. El coeficiente de correlación no se debe extrapolar más allá del rango de valores observado de las variables a estudio ya que la relación existente entre X e Y puede cambiar fuera de dicho rango.
  5. La correlación no implica causalidad. La causalidad es un juicio de valor que requiere más información que un simple valor cuantitativo de un coeficiente de correlación 5.


La correlación entre dos variables refleja el grado en que las puntuaciones están asociadas. La formulación clásica, conocida como correlación producto momento de Pearson, se simboliza por la letra griega rho (xy) cuando ha sido calculada en la población. Si se obtiene sobre una muestra, se designa por la letra "rxy".
Este tipo de estadístico puede utilizarse para medir el grado de relación de dos variables si ambas utilizan una escala de medida a nivel de intervalo/razón (variables cuantitativas).
La formula suele aparecer expresada como:
-La primera expresión se resuelve utilizando la covarianza y las desviaciones típicas de las dos variables (en su forma insesgada).
-La segunda forma se utiliza cuando partimos de las puntuaciones típicas empíricas.
Este estadístico, refleja el grado de relación lineal que existe entre dos variables. El resultado numérico fluctua entre los rangos de +1 a -1.
  1. Una correlación de +1 significa que existe una relación lineal directa perfecta (positiva) entre las dos variables. Es decir, las puntuaciones bajas de la primera variable (X) se asocian con las puntuaciones bajas de la segunda variable (Y), mientras las puntuaciones altas de X se asocian con los valores altos de la variable Y.
  2. Una correlación de -1 significa que existe una relación lineal inversa perfecta (negativa) entre las dos variables. Lo que significa que las puntuaciones bajas en X se asocian con los valores altos en Y, mientras las puntuaciones altas en X se asocian con los valores bajos en Y.
  3. Una correlación de 0 se interpreta como la no existencia de una relación lineal entre las dos variables estudiadas.

 



ESTADISTICA NO PARAMÉTRICA

La estadística no paramétrica es una rama de la estadística que estudia las pruebas y modelos estadísticos cuya distribución subyacente no se ajusta a los llamados criterios paramétricos. Su distribución no puede ser definida a priori, pues son los datos observados los que la determinan. La utilización de estos métodos se hace recomendable cuando no se puede asumir que los datos se ajusten a una distribución conocida, cuando el nivel de medida empleado no sea, como mínimo, de intervalo.

Las principales pruebas no paramétricas son las siguientes:

  • Prueba χ² de Pearson
  • Prueba binomial
  • Prueba de Anderson-Darling
  • Prueba de Cochran
  • Prueba de Cohen kappa
  • Prueba de Fisher
  • Prueba de Friedman
  • Prueba de Kendall
  • Prueba de Kolmogórov-Smirnov
  • Prueba de Kruskal-Wallis
  • Prueba de Kuiper
  • Prueba de Mann-Whitney o prueba de Wilcoxon
  • Prueba de McNemar
  • Prueba de la mediana
  • Prueba de Siegel-Tukey
  • Coeficiente de correlación de Spearman
  • Tablas de contingencia
  • Prueba de Wald-Wolfowitz
  • Prueba de los signos de Wilcoxon
La mayoría de estos test estadísticos están programados en los paquetes estadísticos más frecuentes, quedando para el investigador, simplemente, la tarea de decidir por cuál de todos ellos guiarse o qué hacer en caso de que dos test nos den resultados opuestos. Hay que decir que, para poder aplicar cada uno existen diversas hipótesis nulas que deben cumplir nuestros datos para que los resultados de aplicar el test sean fiables. Esto es, no se puede aplicar todos los test y quedarse con el que mejor convenga para la investigación sin verificar si se cumplen las hipótesis necesarias. La violación de las hipótesis necesarias para un test invalidan cualquier resultado posterior y son una de las causas más frecuentes de que un estudio sea estadísticamente incorrecto. Esto ocurre sobre todo cuando el investigador desconoce la naturaleza interna de los test y se limita a aplicarlos sistemáticamente.

MEDIDAS Y ESCALAS DE MEDIDA

El nivel de medida de una variable en matemáticas y estadísticas, también llamado escala de medición, es una clasificación acordada con el fin de describir la naturaleza de la información contenida dentro de los números asignados a los objetos y, por lo tanto, dentro de una variable. Según la teoría de las escalas de medida, varias operaciones matemáticas diferentes son posibles dependiendo del nivel en el cual la variable se mide.

Escalas de medición son una sucesión de medidas que permiten organizar datos en orden jerárquico. Las escalas de medición, pueden ser clasificadas de acuerdo a una degradación de las características de las variables. Estas escalas son: nominales, ordinales, intervalares o racionales. Según pasa de una escala a otra el atributo o la cualidad aumenta. Las escalas de medición ofrecen información sobre la clasificación de variables discretas o continuas, tambien mas conocidas como escalas grandes o pequeñas. Toda vez que dicha clasificación determina la selección de la gráfica adecuada.



PRUEBA BINOMIAL

La prueba binomial analiza variables dicotómicas y compara las frecuencias observadas en cada categoría con las que cabría esperar según una distribución binomial de parámetro especificado en la hipótesis nula tal como se ha explicado en elcapítulo anterior.
La secuencia para realizar este contraste es:
Analizar
Pruebas no paramétricas
Binomial
En el cuadro de diálogo se debe seleccionar la variable en Contrastar variables e indicar la proporción postulada en la hipótesis nula en Contrastar proporción.


Ilustremos con un ejemplo:

Supongamos que una ciudad hay 1000000 de habitantes de los cuales 450000 son varones y 550000 son mujeres . Si extraemos un individuo al azar la probabilidad. de que sea mujer será.
Si repetimos esta prueba varias veces y no reponemos "en el saco" al sujeto extraído la probabilidad de obtener una mujer en cada siguiente extracción variará, al variar la composición por sexos de la población restante. Sin embargo, al ser la población tan grande, la variación de esta probabilidad con cada sucesiva prueba será prácticamente despreciable y podremos considerar, en la práctica que las probabilidades son constantes: en efecto:

Si, en la primera prueba obtenemos una mujer y no la reintegramos a la población la de probabilidad de obtener una mujer en la segunda prueba será:
                                


PRUEBA DE RACHAS

Muchos de los procedimientos estadísticos que se han visto durante el curso requieren la selección aleatoria de datos. La prueba que es estudiaremos es la prueba de rachas que sirve para detectar aleatoriedad, que se basa en el número de series o rachas   que hay en una secuencia de datos.

La prueba aplica sólo si podemos asignar a cada uno de los valores de los datos a una de dos categorías distintas.

La prueba de rachas de una sola muestra nos permite determinar si el número de rachas en una muestra de datos, es o no suficientemente pequeño o suficientemente grande para rechazar la hipótesis nula de que la secuencia observada se debe al azar.

Definimos una racha como una secuencia de datos semejantes precedidas y seguidas por un tipo diferente de observación o por ninguna observación

Ejemplos:
  1. Supongamos, por ejemplo, que un lunes por la mañana se presentan cierto número de hombres y de mujeres a la oficina de transito   para pedir licencias de conducir en el siguiente orden
MM H MM H MM HH M HHH MMMM

En esta secuencia hay un total de nueve rachas. Tenemos una racha que consta de dos mujeres, seguida de una de un hombre, seguida de otra de dos mujeres, etc.

  2. considere el refresco de cola que escogen los consumidores en un proyecto de investigación de mercados. Denotaremos con D a un consumidor que prefiere el refresco de cola de dieta, y con R, uno que prefiere el refresco regular. La secuencia que sigue contiene exactamente cuatro rachas.
DDDD RR DDD R

La única suposición que fundamenta la prueba de rachas de una sola muestra consiste en que cada
observación se pueda clasificar como perteneciente a uno de los dos tipos de observación.

PRUEBA DE LA MEDIANA

La prueba de la mediana es una prueba no paramétrica que podemos considerar un caso especial de la prueba de chi-cuadrado, pues se basa en esta última. Su objetivo es comparar las medianas de dos muestras y determinar si pertencen a la misma población o no.

Para ello, se calcula la mediana de todos los datos conjuntamente. Después, se divide cada muestra en dos subgrupos: uno para aquellos datos que se sitúen por encima de la mediana y otro para los que se sitúen por debajo. La prueba de chi-cuadrado determinará si las frecuencias observadas en cada grupo difieren de las esperadas con respecto a una distribución de frecuencias que combine ambas muestras.
Esta prueba está especialmente indicada cuando los datos sean extremos o estén sesgados.


PRUEBA DE LOS SIGNOS WILCOXON

La prueba de los signos de Wilcoxon es una prueba no paramétrica para comparar la mediana de dos muestras relacionadas y determinar si existen diferencias entre ellas. Se utiliza como alternativa a la prueba t de Student cuando no se puede suponer la normalidad de dichas muestras. Debe su nombre a Frank Wilcoxon, que la publicó en 1945.
Se utiliza cuando la variable subyacente es continua pero presupone ningún tipo de distribución particular.


PLANTEAMIENTO
Supóngase que se dispone de n pares de observaciones, denominadas (x_i, y_i). El objetivo del test es comprobar si puede dictaminarse que los valores x_i e y_i son o no iguales.

SUPOSICIÓN

  1. Si z_i=y_i-x_i, entonces los valores z_i son independientes.
  2. Los valores z_i tienen una misma distribución continua y simétrica respecto a una mediana común \theta.
METODO

La hipótesis nula es H_0: \theta=0. Retrotrayendo dicha hipótesis a los valores x_i, y_i originales, ésta vendría a decir que son en cierto sentido del mismo tamaño.
Para verificar la hipótesis, en primer lugar, se ordenan los valores absolutos |z_1|,\dots,|z_n| y se les asigna su rango R_i. Entonces, el estadístico de la prueba de los signos de Wilcoxon, W^+, es
W^+=\sum_{z_i > 0} R_i,

es decir, la suma de los rangos R_i correspondientes a los valores positivos de z_i.
La distribución del estadístico W^+ puede consultarse en tablas para determinar si se acepta o no la hipótesis nula.

En ocasones, esta prueba se usa para comparar las diferencias entre dos muestras de datos tomados antes y después del tratamiento, cuyo valor central se espera que sea cero. Las diferencias iguales a cero son eliminadas y el valor absoluto de las desviaciones con respecto al valor central son ordenadas de menor a mayor. A los datos idénticos se les asigna el lugar medio en la serie. la suma de los rangos se hace por separado para los signos positivos y los negativos. S representa la menor de esas dos sumas. Comparamos S con el valor proporcionado por las tablas estadísticas al efecto para determinar si rechazamos o no la hipótesis nula, según el nivel de significación elegido.

LA PRUEBA DE MANN-WHITNEY

En estadística la prueba U de Mann-Whitney (también llamada de Mann-Whitney-Wilcoxon, prueba de suma de rangos Wilcoxon, o prueba de Wilcoxon-Mann-Whitney) es una prueba no paramétrica aplicada a dos muestras independientes. Es, de hecho, la versión no paramétrica de la habitual prueba t de Student.

Fue propuesto inicialmente en 1945 por Frank Wilcoxon para muestras de igual tamaños y extendido a muestras de tamaño arbitrario como en otros sentidos por Henry B. Mann y D. R. Whitney en 1947.

PLANTEAMIENTO DE LA PRUEBA

La prueba de Mann-Whitney se usa para comprobar la heterogeneidad de dos muestras ordinales. El planteamiento de partida es:
  1. Las observaciones de ambos grupos son independientes
  2. Las observaciones son variables ordinales o continuas.
  3. Bajo la hipótesis nula, las distribuciones de partida de ambas distribuciones es la misma
  4. Bajo la hipótesis alternativa, los valores de una de las muestras tienden a exceder a los de la otra: P(X > Y) + 0.5 P(X = Y)  > 0.5.

CALCULO DEL ESTADISTICO

Para calcular el estadístico U se asigna a cada uno de los valores de las dos muestras su rango para construir
U_1=R_1 - {n_1(n_1+1) \over 2}
U_2=R_2 - {n_2(n_2+1) \over 2}
donde n1 y n2 son los tamaños respectivos de cada muestra; R1 y R2 es la suma de los rangos de las observaciones de las muestras 1 y 2 respectivamente.

El estadístico U se define como el mínimo de U1 y U2.
Los cálculos tienen que tener en cuenta la presencia de observaciones idénticas a la hora de ordenarlas. No obstante, si su número es pequeño, se puede ignorar esa circunstancia.

DISTRIBUCIÓN DEL ESTADÍSTICO

La prueba calcula el llamado estadístico U, cuya distribución para muestras con más de 20 observaciones se aproxima bastante bien a la distribución normal.

La aproximación a la normal, z, cuando tenemos muestras lo suficientemente grandes viene dada por la expresión:

z=(U-m_U)/\sigma_{U}

Donde mU y σU son la media y la desviación estándar de U si la hipótesis nula es cierta, y vienen dadas por las siguientes fórmulas:

m_U=n_1 n_2/2.
\sigma_U=\sqrt{n_1 n_2 (n_1+n_2+1) \over 12}.

 

 

ASOCIACIÓN ENTRE VARIABLES NOMINALES DE CORRELACIÓN PHI

Variable cualitativa nominal

Una variable cualitativa nominal presenta modalidades no numéricas que no admiten un criterio de orden. Por ejemplo:
El estado civil, con las siguientes modalidades: soltero, casado, separado, divorciado y viudo.










NOMINAL

Son variables numéricas cuyos valores representan una categoría o identifican un grupo de pertenencia. Este tipo de variables sólo nos permite establecer relaciones de igualdad/desigualdad entre los elementos de la variable. La asignación de los valores se realiza en forma aleatoria por lo que NO cuenta con un orden lógico. Un ejemplo de este tipo de variables es el Género ya que nosotros podemos asignarle un valor a los hombres y otro diferente a las mujeres y por más machistas o feministas que seamos no podríamos establecer que uno es mayor que el otro.


 
ASOCIACIÓN ENTRE VARIABLES ORDINALES, MÉTODO DE CORRELACION DE SPERMAN




Variable cualitativa ordinal o variable cuasicuantitativa

Una variable cualitativa ordinal presenta modalidades no númericas, en las que existe un orden. Por ejemplo:

La nota en un examen: suspenso, aprobado, notable, sobresaliente.
Puesto conseguido en una prueba deportiva: 1º, 2º, 3º, ...
Medallas de una prueba deportiva: oro, plata, bronce.


En el cuadro de diálogo Tablas de contingencia: Estadísticos pueden activarse diversas opciones que proporcionan medidas de asociación cuando las variables se miden por lo menos en una escala ordinal; las más utilizadas son:

  1. Correlaciones: con esta opción se obtienen los estadísticos:
  • Coeficiente de correlación de Pearson: es una medida de asociación lineal adecuada para variables medidas en escala de intervalo.

  •  Coeficiente de correlación de Spearman: mide el grado de correspondencia que existe entre los rangos que se asignan a los valores de las variables analizadas. Por ello, este coeficiente se puede calcular con datos ordinales, y se define: , siendo di la diferencia entre los rangos correspondientes a la observación i-ésima. El coeficiente toma valores entre -1 y +1. Un valor cercano a 0 indica que las variables apenas están relacionadas.
El cuadro Ordinal recoge una serie de estadísticos basados en el número de concordancias y discordancias que aparecen al comparar las puntuaciones asignadas a los mismos casos según dos criterios (o jueces) diferentes. Así, por ejemplo, si recoge las puntuaciones asignadas a los casos según el primer criterio y según el segundo, para la obtención de concordancias y discordancias que aparecen entre los dos criterios, se procede de la siguiente forma:
  • se ordenan los pares de puntuaciones de acuerdo con el orden natural de las puntuaciones asignadas según el primer criterio, .
  • se compara cada valor de con cada uno de los que le siguen, y se registra una concordancia (+1) cuando los dos valores siguen el orden natural, una discordancia (-1) cuando el orden está invertido y un empate (0) cuando coinciden ambas puntuaciones.
  • se calculan C total de las concordancias, D total de las discordancias y E el número total de empates.
El número total de comparaciones es incluyendo empates.

METODO DE SPEARMAN

En estadística, el coeficiente de correlación de Spearman, ρ (ro) es una medida de la correlación (la asociación o interdependencia) entre dos variables aleatorias continuas. Para calcular ρ, los datos son ordenados y reemplazados por su respectivo orden.
El estadístico ρ viene dado por la expresión:
 \rho = 1- {\frac {6 \sum D^2}{N(N^2 - 1)}}
donde D es la diferencia entre los correspondientes estadísticos de orden de x - y. N es el número de parejas.
Se tiene que considerar la existencia de datos idénticos a la hora de ordenarlos, aunque si éstos son pocos, se puede ignorar tal circunstancia
Para muestras mayores de 20 observaciones, podemos utilizar la siguiente aproximación a la distribución t de Student
t = \frac{\rho}{\sqrt{(1-\rho^2)/(n-2)}}

La interpretación de coeficiente de Spearman es igual que la del coeficiente de correlación de Pearson. Oscila entre -1 y +1, indicándonos asociaciones negativas o positivas respectivamente, 0 cero, significa no correlación pero no independencia. La tau de Kendall es un coeficiente de correlación por rangos, inversiones entre dos ordenaciones de una distribución normal bivariante.