Estadística descriptiva
Covid-19 Prevention
Capitulo 2
La estadística descriptiva permite conocer cómo se distribuyen los datos de una muestra. Se dedica a recoger, ordenar, analizar y representar los datos mediante la utilización de tablas, gráficos y/o medidas resumen. Es por lo tanto la primera etapa a desarrollar en un análisis de información.
1. Medidas de tendencia central
Nos permiten identificar los valores más representativos de los datos, de acuerdo a la manera como se tienden a concentrar. Son la Media, Mediana y Moda
La media: Es la suma de todos los valores observados, dividido por el número total de observaciones: ej.: 4, 3, 5, 9, 8: Media = (4+3+5+9+8)/5= 5,8
Nos indica el promedio de los datos; es decir, nos informa el valor que obtendría cada uno de los individuos si se distribuyeran los valores en partes iguales.
Mediana: Nos permite conocer el valor que se encuentra exactamente en la mitad del conjunto de datos después que las observaciones se han ubicado en serie ordenada: ej.: 2, 3, 5, 7, 8, Mediana =5
Nos informa el valor que separa los datos en dos partes iguales, cada una de las cuales cuenta con el cincuenta por ciento de los datos
Moda: Indica el valor que más veces se repite dentro de los datos; es decir, si tenemos la serie ordenada (2, 2, 5 y 7), el valor que más veces se repite es el número 2
2. Medidas de dispersión
Nos permiten reconocer que tanto se dispersan los datos alrededor del punto central; es decir, nos indican cuanto se desvían las observaciones alrededor de su promedio aritmético (Media). Son la Varianza y desviación estándar o típica.
Varianza: Esta medida nos permite identificar la diferencia promedio que hay entre cada uno de los valores respecto a su punto central.
Este promedio es calculado, elevando cada una de las diferencias al cuadrado (con el fin de eliminar los signos negativos), y calculando su promedio o media; es decir, sumado todos los cuadrados de las diferencias de cada valor respecto a la media y dividiendo este resultado por el número de observaciones que se tengan.
S2 = Varianza
X1= Uno de los valores
x= Media de la muestra
n = Tamaño de la muestra
Desviación típica: Esta medida nos permite determinar el promedio aritmético de fluctuación de los datos respecto a su punto central o media.
La desviación estándar nos da como resultado un valor numérico que representa el promedio de diferencia que hay entre los datos y la media. Para calcular la desviación estándar basta con hallar la raíz cuadrada de la varianza.
S=Desviación típica S2=Varianza
3. Medidas de distribución
Nos permiten identificar la forma en que se separan o aglomeran los valores de acuerdo a su representación gráfica. Son la asimetría y curtosis.
Asimetría: Esta medida nos permite identificar si los datos se distribuyen de forma uniforme alrededor del punto central (Media aritmética).
Se dice que la asimetría es positiva cuando la mayoría de los datos se encuentran por encima del valor de la media aritmética y negativa cuando están por debajo.
Donde (g1) representa el coeficiente de asimetría de Fisher, (Xi) cada uno de los valores, (X) la media de la muestra y (ni) la frecuencia de cada valor. Los resultados de esta ecuación se interpretan:
(g1 = 0): Se acepta que la distribución es Simétrica, es decir, existe aproximadamente la misma cantidad de valores a los dos lados de la media. Este valor es difícil de conseguir por lo que se tiende a tomar los valores que son cercanos ya sean positivos o negativos (± 0.5).
(g1> 0): La curva es asimétricamente positiva por lo que los valores se tienden a reunir más en la parte izquierda que en la derecha de la media.
(g1< 0): La curva es asimétricamente negativa por lo que los valores se tienden a reunir más en la parte derecha de la media.
Curtosis: Esta medida determina el grado de concentración que presentan los valores en la región central de la distribución. Identifica una gran concentración de valores (Leptocúrtica), una concentración normal (Mesocúrtica) o una baja concentración (Platicúrtica).
Donde (g2) representa el coeficiente de Curtosis, (Xi) cada uno de los valores, (X) la media de la muestra y (ni) la frecuencia de cada valor. Los resultados de esta fórmula se interpretan:
(g2 = 0) la distribución es Mesocúrtica: Es bastante difícil encontrar un coeficiente de Curtosis de cero (0), por lo que se suelen aceptar los valores cercanos (± 0.5 aprox.).
(g2> 0) la distribución es Leptocúrtica
(g2< 0) la distribución es Platicúrtica
4. Medidas de tendencia no central: Cuantiles.
Permiten conocer otros puntos característicos de la distribución que no son los valores centrales. Los cuantiles suelen usarse por grupos que dividen la distribución en partes iguales, entendidas estas como intervalos que comprenden la misma proporción de valores. Los más usados son los Cuartiles, Quinquiles, Deciles y Percentiles
Cuartiles: Son los tres valores (Q1, Q2 y Q3) que dividen al conjunto de datos ordenados en cuatro partes porcentualmente iguales.
La diferencia entre el tercer cuartil y el primero (Q3-Q1) se conoce como rango intercuartílico (RIC).
Se representa gráficamente como la anchura de las cajas en los llamados diagramas de cajas. El Q2 representa a la mediana.
Percentiles: Surgen de dividir a la distribución en 100 partes iguales. Se representan por la letra P. El P25 corresponde al Q1, el P50 al Q2 (mediana) y P75 al Q3.
Gráfico de cajas y bigotes.
Representación de la distribución de la variable. La línea central de la caja representa la mediana, el P50 o el segundo cuartil. El extremo superior de la caja el P75 o el tercer cuartil y el extremo inferior el P2 o el primer cuartil. Las líneas verticales (bigotes) representan el 0% y el 100% de las observaciones.
Explicación: El percentil 75 significa que el 75% de la población tiene el valor de la variable o menos
Medidas de frecuencia de una enfermedad.
Para poder cuantificar el impacto que realimente tiene una enfermedad, en epidemiología se suele trabajar con diferentes tipos de fracciones:
- Proporción (probability o risk): es un cociente donde el numerador está incluido en el denominador. No tiene dimensión, sus valores van de 0 a 1 y suele expresarse en porcentajes. Por ejemplo, si en una población de 10000 habitantes se diagnostican 100 casos de VIH, la proporción de VIH en esa población será de 100/10000 = 0,01 (1%)
- Razón (ratio): Se obtiene de dividir dos cantidades donde el numerador no está contenido en el denominador. Puede tener o no dimensiones. En el ejemplo anterior, la razón entre la población con infección por VIH y la no infectada es de 100/9900 = 0,01
Cuando se calcula la probabilidad de que ocurra un evento entre la probabilidad que no ocurra se le denomina odds. En el ejemplo anterior, la odds es de 0,01 e indica que por cada 1/0,01 = 100 pacientes que no tienen VIH hay 1 que si lo tiene. Ver más adelante en el apartado de factores de riesgo.
Existe la siguiente relación entre una proporción y una odds:
Tasa (rate): Es similar a la proporción, con la diferencia de que las tasas llevan incorporado el concepto de tiempo. Hace referencia al ritmo al que aparecen nuevos eventos en un grupo de individuos a medida que transcurre el tiempo. El numerador lo constituye la frecuencia absoluta de casos del problema a estudiar y el denominador lo forma la suma de los periodos individuales de riesgo a los que han estado expuestos los sujetos susceptibles de la población en estudio. Tiene dimensiones (inversa del tiempo o tiempo-1) y un rango de 0 a infinito. Por ejemplo si de 100 pacientes con infección por VIH se controlan 80 en un año, tendríamos 80/100*1= 80 por 100 pacientes/año se controlan al tomar la medicación.
En epidemiología las medidas de frecuencia de enfermedad más comúnmente utilizadas son la prevalencia e incidencia
Prevalencia: Hace referencia a la proporción de individuos de una población que presentan una enfermedad en un momento determinado.
La prevalencia no tiene dimensión y sus valores oscilan entre 0 y 1.
Por ejemplo si en una población de 1000 habitantes existen 100 pacientes con infección por VIH, la prevalencia de la enfermedad por VIH en esa población será: P=100/1000 = 0,1 = 10%
La prevalencia de periodo se calcula como la proporción de personas que han presentado la enfermedad en algún momento a lo largo de un periodo de tiempo determinado, por ejemplo la prevalencia de SIDA en España en los últimos 10 años.
Incidencia: Hace referencia al número de casos nuevos de una enfermedad que se desarrollan en una población en un tiempo determinado. Son de especial interés para identificar factores de riesgo o factores pronósticos. Son la incidencia acumulada y la tasa de incidencia.
Incidencia acumulada (IA):Es la proporción de individuos sanos que desarrollan la enfermedad en un periodo de tiempo concreto.
Por ejemplo: Durante 5 años se siguió a una población de 577 varones homosexuales con prácticas de riesgo para adquirir la infección por el VIH, al final del seguimiento 121 pacientes adquirieron la infección. La incidencia acumulada sería: IA = 121 / 577 = 0,21 = 21% en 5 años.
La IA asume que la población entera a riesgo al principio del estudio ha sido seguida durante todo el periodo de tiempo, pero esto no siempre sucede puesto que hay sujetos que se pierden durante el seguimiento, por ello es más correcto utilizar la IA actuarial que tiene en cuenta a los sujetos perdidos:
Aquí, el denominador es el “número efectivo” de personas en riesgo, y asume que la media de abandonos ocurre en la mitad de tiempo de seguimiento.
Tasa de incidencia (TI). También denominada densidad de incidencia (DI). Es el cociente entre el número de casos nuevos de una enfermedad ocurridos durante el periodo de seguimiento y la suma de todos los tiempos individuales de observación.
Su valor no puede ser inferior a cero, pero no tiene límite superior. Es muy útil para estudiar las hipótesis etiológicas de las enfermedades con periodos de latencia largos.
Por ejemplo, supongamos que tenemos 6 pacientes con tuberculosis y los seguimos durante 48 semanas y queremos calcular la DI de curación tras inicio del tratamiento tuberculostático y observamos que el paciente 1 se ha curado a las 24 semanas, el 2 no se ha curado, el 3 lo ha hecho a las 16 semanas, el 4 a las 32 semanas, el 5 a las 24 semanas y el 6 no se ha curado. La IA de curaciones sería 4/6= 0,66, es decir en 48 semanas se han curado el 66%. En cambio la DI sería 4/(24+48+16+32+24+48) = 4/192 = 0,02 pacientes por semana. Es decir la velocidad de curación de la infección sería del 2% de control/semana.
¿Cómo realizar la estadística descriptiva con SPSS?
En SPSS se puede hacer de varias formas.
Con la opción de Frecuencias: Hacer clic en analizar→estadísticos descriptivos →en Frecuencias. En la ventana de frecuencias introducir la/s variable/s que se quiere analizar. Puede ser cuantitativa o categórica, por ejemplo la edad, sexo, etc.
En “Estadísticos”, señalar las pestañas que nos interese, por ejemplo cuartiles, percentiles (indicando que percentiles preferimos), medidas de tendencia central (media, mediana, moda y suma), de dispersión (desviación típica, varianza, etc.) o de distribución (asimetría y curtosis). En “Gráficos”, podemos señalar el tipo de gráfico, por ejemplo de barras o sectores para una variable cualitativa (ejemplo, el sexo o la raza) y el histograma para una variable cuantitativa continuar (por ejemplo la edad, talla, peso, etc.). En este último podemos indicar que aparezca la curva de normalidad. Además podemos indicar si queremos que aparezcan las frecuencias o porcentajes.
En la hoja de resultados obtenemos 2 tablas y una figura. Por ejemplo, vamos a realizar un estudio descriptivo de la edad de una muestra.
En esta tabla se representan los estadísticos que hemos elegido. En este caso, la edad media de esta muestra de 97 pacientes es de 41,88 ± 20,5 años y podemos decir que el 75% (P75) tienen 52,5 años o menos.
En esta tabla se representan todos los valores de la variable, la frecuencia y el porcentaje con que aparece. Por ejemplo, en el recuadro, 3 (frecuencia) pacientes (3,1%) tenían 18 años.
Histograma de la edad con curva de normalidad.
- Con la opción de Descriptivos: Hacer Clic en Analizar→Estadísticos descriptivos →en Descriptivos. En la ventana de Descriptivos introducir la variable que queremos analizar, por ejemplo la edad. En opciones elegir el estadístico que nos interese (aquí tenemos menos opciones que con el apartado anterior), por ejemplo media, desviación típica, etc.
- Con la opción de Explorar: Esta opción permite hacer estratificaciones, por ejemplo distribuir la edad por el sexo (hombre/mujer). Hacer clic en Analizar→Estadísticos descriptivos → Explorar.
En la ventana de “Explorar” añadir en lista de dependientes la variable cuantitativa continua que se quiere analizar (por ejemplo la edad) y en lista de factores la variable por la que se quiere estratificar (por ejemplo por el sexo).
En “Estadísticos” señalar por ejemplo Descriptivos (son la media, mediana, desv típica, máximo, mínimo, rango, amplitud intercuartílico, asimetría y curtosis) y Percentiles (son el P5, P10, P25, P75, P90 y P95).
En “Gráficos” se puede elegir diagramas de caja (factores juntos o dependientes juntos), descriptivos (tallo y hojas e histograma) y dispersión por nivel con prueba de Levane. Además se puede obtener los gráficos con pruebas de normalidad.
En la hoja de resultados obtenemos una tabla con el número de casos válidos por cada factor, cada uno de los estadísticos de la variable distribuidos por cada factor y los percentiles por cada factor.
Tabla en la que se representan cada uno de los estadísticos de la variable por cada factor. En este ejemplo se representan las edades medias, mediana, desv. típica, etc. de cada varón y mujer.
Tabla en la que se representan los percentiles de la variable distribuidos por cada factor, en este caso los percentiles de la edad por varones y mujeres.
Histograma de la edad distribuida por sexo (varón y mujer)
Gráfico de tallo y hojas. En el ejemplo hay 4 mujeres (cuadrado superior) que tienen 11, 12, 13 y 17 años; 3 (cuadrado inferior) que tienen 72, 74 y 79 años.
Gráfico de cajas por cada factor. Se representa las cajas y bigotes de la edad distribuido por el sexo.
¿Cómo expresar la estadística descriptiva en un artículo?
En el apartado de material y métodos, análisis estadístico, se puede expresar: “Los resultados se representan como media y desviación típica o bien, si utilizamos la mediana como mediana y rango intercuartílico (percentil25-percentil75). Las variables categóricas se representan como n (%)”.
En el apartado de resultados. Teniendo en cuenta el ejemplo anterior, se puede expresar así: “En nuestro estudio hay 97 pacientes de los que 54 (55,7%) eran varones de edades 41,8±20,5 años”. Si se utiliza la mediana y el rango intercuartílico se expresaría así: “ de edades, 40 (27-54) años”.
Siguiendo las recomendaciones APA, se puede expresar: “En nuestro estudio había 97 pacientes de los que el 55,7% eran varones. La edad promedio fue de 41,8 años (DE=20,5)” o bien, “La edad tenía un rango desde 11 a 80 años (M = 41,8, DE=20,5)”, o bien, “La mediana de la edad fue de 40 años (rango intercuartílico=27 a 54)”.
Ejercicio 2. Utilizar la base_demogeneral. Esta base es ficticia y está formada por un grupo de pacientes que ingresaron en un hospital por gripe A.
Determinar la edad media, mediana, desviación estándar y percentil 25 y 75 estratificados por la presencia de neumonía.
Solución: En los pacientes con neumonía, media y desviación estándar 42,69±3,17, mediana 41,5 y percentil 25 (28) y 75 (50). En los pacientes sin neumonía, media y desviación estándar 41,39±2,74, mediana 38 y percentil 25 (27,5) y 75 (50).
