Distribución Normal

Covid-19 Prevention

Capitulo 3

También denominada Distribución de Gauss o Gaussiana. Está completamente determinada por dos parámetros, su media y su desviación estándar.

Propiedades de la distribución normal:

  1. Tiene una única moda, que coincide con su media y su mediana.
  2. La curva normal es asintótica al eje de abscisas.  Por ello, cualquier valor entre  -∞ y  +∞ es teóricamente posible.  El área total bajo la curva es, por tanto, igual a 1.
  3. Es simétrica con respecto a su media.  Según esto, para este tipo de variables existe una probabilidad de un 50% de observar un dato mayor que la media, y un 50% de observar un dato menor.
  4. La distancia entre la línea trazada en la media y el punto de inflexión de la curva es igual a una desviación típica.  Cuanto mayor sea, más aplanada será la curva de la densidad.
  5. El área bajo la curva comprendida entre los valores situados aproximadamente a dos desviaciones estándar de la media es igual a 0,95.  En concreto, existe un 95% de posibilidades de observar un valor comprendido en el intervalo.
  6. La forma de la campana de Gauss depende de los parámetros  media y desviación típica.  La media indica la posición de la campana, de modo que para diferentes valores de media la gráfica es desplazada a lo largo del eje horizontal.  Por otra parte, la desviación estándar determina el grado de apuntamiento de la curva.  Cuanto mayor sea el valor de la desviación típica, más se dispersarán los datos en torno a la media y la curva será más plana.  Un valor pequeño de este parámetro indica, por tanto, una gran probabilidad de obtener datos cercanos al valor medio de la distribución.
  7. La proporción de mediciones situada entre la media y las desviaciones es una constante en la que:
    1. La media ± 1 * desviación estándar = cubre el 68,3% de los casos
    2. La media ± 2 * desviación estándar = cubre el 95,5% de los casos
    3. La media ± 3 * desviación estándar = cubre el 99,7% de los casos

Gráfico de Normalidad.

Los gráficos de probabilidad normal permiten comprobar si un conjunto de datos puede considerarse o no procedente de una distribución normal.  En un mismo gráfico se enfrentan los datos que han sido observados frente a los datos teóricos que se obtendrían de una distribución normal. Si la distribución de la variable coincide con la distribución gaussiana, los puntos tenderán a concentrarse en torno a una línea recta, teniendo en cuenta que siempre habrá una mayor variabilidad en los extremos. 

En los gráficos P-P se confrontan las proporciones acumuladas de una variable con las de una distribución normal.  Los gráficos Q-Q se obtienen de modo análogo, esta vez representando los cuantiles respecto a los cuantiles de la distribución normal.  Además de permitir valorar la desviación de la normalidad, los gráficos de probabilidad permiten conocer la causa de esa desviación.  Una curva en forma de “U” o con alguna curvatura, significa que la distribución es asimétrica con respecto a la gaussiana, mientras que un gráfico en forma de “S” significará que la distribución tiene colas mayores o menores que la normal, esto es, que existen pocas o demasiadas observaciones en las colas de la distribución.

Ejemplo de Gráfico Q-Q e histograma con curva de normalidad de una variable con distribución normal.

Ejemplo de Gráfico Q-Q e histograma con curva de normalidad de una variable sin una distribución normal.

Parece lógico que cada uno de estos métodos se complemente con procedimientos de análisis que cuantifiquen de un modo más exacto las desviaciones de la distribución normal.  Existen distintos tests estadísticos que podemos utilizar para este propósito.  El test de Kolmogorov-Smirnov es el más extendido en la práctica.  Se basa en la idea de comparar la función de distribución acumulada de los datos observados con la de una distribución normal, midiendo la máxima distancia entre ambas curvas.  Como en cualquier test de hipótesis, la hipótesis nula se rechaza cuando el valor del estadístico supera un cierto valor crítico que se obtiene de una tabla de probabilidad.  Cuando se dispone de un número suficiente de datos, cualquier test será capaz de detectar diferencias pequeñas aun cuando estas no sean relevantes para la mayor parte de los propósitos.  El test de Kolmogorov-Smirnov, en este sentido, otorga un peso menor a las observaciones extremas y por la tanto es menos sensible a las desviaciones que normalmente se producen en estos tramos. La otra prueba que se utiliza para determinar la normalidad es la de Shapiro-Wilk que es una del más potente sobretodo en poblaciones pequeñas.

En general utilizaremos la Prueba de Kolmogorov-Smirnov si hay más de 50 unidades de análisis o la de Shapiro-Wilk si hay menos de 50 unidades de análisis.

¿Cómo averiguar si una variable tiene una distribución normal con SPSS?

Primero, definir en la hoja de recogida de datos la variable cuantitativa continua que se quiere analizar.

Segundo, en la hoja de recogida de datos, hacer clic en Analizar →en pruebas no paramétricas→en cuadro de diálogos antiguos → en K-S de 1 muestra. En la ventana de Prueba de Kolmogorov-Smirnov para una muestra introducir la variable prueba (por ejemplo la edad) en la casilla de lista contrastar variables y hacer clic en aceptar. 

Tercero, en la hoja de resultados obtenemos una tabla en la que se representan el número (N), la media, desviación típica, las diferencias más extremas, el valor de Z de Kolmogorov-Smirnovy la significación estadística. En esta prueba se considera la H0 (hipótesis nula) como que la distribución es normal. Por lo tanto,  si la significación estadística es ≥0,05no podremos rechazar la hipótesis nula y tendremos que decir que la variable tiene una distribución NORMAL .

Cuarto, también podemos averiguar la normalidad de una variable distribuida por un factor, por ejemplo la edad distribuida por el sexo (entre los varones y mujeres). Para ello, hacer clic en analizar→estadísticosdescriptivos→explorar. En la ventana de Explorar introducir en lista de dependientes la variable a analizar (por ejemplo la edad) y en lista de factores las variables por las que se quiere distribuir la variable dependiente (por ejemplo el sexo). En gráficos señalar la pestaña “gráficos con pruebas de normalidad” y hacer clic en continuar.

En la ventana de resultados aparece una tabla con las “Pruebas de normalidad”. La prueba de Kolmogorov-Smirnov se debe utilizar si hay más de 50 unidades de análisis. Se considera que tiene una distribución NORMAL si la Sig. es ≥0,05. En cambio, la prueba de  Shapiro-Wilk se debe utilizar si hay menos de 50 unidades de análisis. Al igual que la anterior se considera que  tiene una distribución NORMAL si la Sig. es ≥0,05.

Tabla con las pruebas de Normalidad de la edad distribuida por sexo. En este ejemplo la edad tiene una distribución normal tanto en hombres como en mujeres, pero para los hombres hemos utilizado la prueba de Kolmogorov-Smirnov al tener una n superior a 50 (p=0,079) y para las mujeres la de Shapiro-Wilk al ser una n inferior a 50 (p=0,553).

¿Cómo expresar la distribución normal en un artículo?

En el apartado de material y métodos. Tenemos que reflejar que se han utilizado las pruebas de normalidad antes de realizar un contraste de hipótesis y en función del resultado se utiliza una prueba paramétrica o no paramétrica. Por ejemplo, “para comprobar si existe asociación entre las variables cuantitativas (edad, índice de masa corporal, niveles de tensión arterial,…) y la variable categórica del estudio (por ejemplo, neumonía) se ha utilizado la prueba de la t de student si las variables cuantitativas tenían una distribución normal o la prueba de la U de Mann Whitney si la distribución no era normal”.

En el apartado de resultados. Se puede decir simplemente que las variables cuantitativas tenían o no una distribución normal. Aunque no hace falta dar el resultado de los test de pruebas de normalidad, en algunas revistas es posible que nos lo pidan. En este caso se puede expresar así: “la edad tenía una distribución normal en los hombres (kolmogorov-smirnov, p=0,079) y en las mujeres (Shapiro-Wilk, p=0,553)”.

Ejercicio 3. Con la base de datos base_demogeneral. Determinar si el IMC (índice de masa corporal) tiene una distribución normal.

Solución: Kolmogorov-Smirnov 0,125; p=0,004. El IMC no tiene una distribución normal.