Regresión lineal múltiple

Covid-19 Prevention

Capitulo 6.2

Permite evaluar si una serie de variables (variables independientes o predictoras) (ej. edad, sexo, etc.) predicen o están asociadas a otra variable cuantitativa continua (ej., edad, número de días ingresado, etc.).

La elección de las variables predictoras se realiza igual que con el análisis de regresión logística binaria. Es decir, en función de la revisión de la literatura, conocimiento del tema y del resultado de un análisis univariante realizado previamente (se eligen normalmente a las significativas). Habitualmente se escoge una variable por cada 10 individuos de muestra analizada.

Las variables cualitativas deben ser dicotómicas o variables dummy, es decir que toman los resultados 0 y 1. Si tenemos una variable con más de dos categorías debemos transformarla a una variable dummy. Por ejemplo, si nuestra variable son los grupos sanguíneos (A, AB, B, 0), debemos transformarla a dos categorías (por ejemplo 0 y el resto).

Antes de interpretar los resultados es muy importante que comprobemos que los residuos cumplen una serie de condiciones. Los residuos son la diferencia entre los valores observados y los predichos por el modelo:

  1. Independencia de los residuos. No debe existir una correlación entre los residuos. Se puede calcular con el estadístico de Durbin y Watson, cuyos valores oscilan entre 0 y 4. Se considera que no existe correlación entre los residuos si el valor está próximo a 2. Si encontramos una correlación entre los residuos el método de regresión lineal múltiple no es adecuado.
  2. Criterio de homocedasticidad. Indica que los residuos son iguales para todos los valores predichos por la variable dependiente. Se refiere a que la diferencia entre los valores reales y la recta ajustada (o plano o hiperplano, tratándose de un modelo lineal múltiple) se distribuyan de acuerdo a una función de densidad Normal con media 0 y varianza fija. Se puede comprobar mediante la realización de un gráfico de dispersión de puntos donde se enfrente los residuos estudentizados frente a los valores predichos no estandarizados. Esto lo discutiremos más abajo. Si no se cumple este criterio, se puede hacer una transformación de la variable dependiente o independiente, por ejemplo hacer transformación logarítmica o elevarla al cuadrado (ver apartado de transformación).
  3. Distribución normal de los residuos. Este criterio es importante pero no necesario. Si no tienen una distribución normal se puede hacer una transformación de la variable dependiente o ejecutar el análisis de todas formas y asumir el error.

Además se debe cumplir:

  1. Debería de haber una relación lineal entre cada una de las variables independientes por separado con la variable dependiente. Esto se puede comprobar mediante la realización de un gráfico de dispersión. Si no existe una relación lineal, se puede hacer una transformación de la variable dependiente o independiente, por ejemplo hacer transformación logarítmica o elevarla al cuadrado (ver apartado de transformación).
  2. Comprobar la multicolinealidad. La multicolinealidad ocurre cuando existen dos o más variables independientes que están correlacionadas entre sí. Es decir, dos o más variables aportan la misma información. Si esto ocurre no podemos saber que variable contribuye realmente en los resultados del modelo. Para comprobar la multicolinealidad debemos evaluar los coeficientes de tolerancia/VIF que discutiremos más abajo. Si ocurre la multicolinealidad existen métodos complicados que se pueden utilizar que no son objetos de este manual. La solución más sencilla es eliminar una de las variables del análisis. Otra solución es agruparlas en el caso de variables cualitativas. Por ejemplo, supongamos que queremos evaluar si en el rendimiento en matemáticas influyen la edad, el sexo, la motivación y el nivel cultural del padre y de la madre y nos sale que existe colinealidad entre el nivel cultural del padre y de la madre, podemos agrupar estas dos variables en una sola, por ejemplo nivel cultural de los padres.

Una vez ejecutado el análisis obtenemos un coeficiente beta cuyo signo indica la dirección de la asociación y el valor la fuerza de la asociación.

¿Cómo realizar un análisis de regresión múltiple lineal con SPSS?

En el siguiente ejemplo vamos a comprobar si una serie de variables independientes como son  la neumonía, sexo, edad y el índice de masa corporal predicen la estancia media hospitalaria (variable independiente) de un grupo de pacientes ingresados.

Primero, definir correctamente las variables en la base de datos.

Segundo, en la pantalla vista de datos, hacer clic en analizar → en regresión → en lineales. En la ventana de “regresión lineal” introducir en la casilla de dependientes la variable dependiente cuantitativa (en este caso el número de días ingresado) y en independiente el resto de variables predictoras.

En “Introducir” indicar el Método de evaluación. Con el método “Introducir” o “enter”  se permite al investigador decidir las variables que se introducen o extraen. Con los métodos automáticos “hacia delante”, “por pasos” y “hacia atrás”, el programa automáticamente decide las variables que se introducen y extraen del modelo.

Hacer clic en Estadísticos, y en la ventana que aparece señalar: Estimadores, Intervalos de confianza (95%), Ajuste del modelo, Descriptivos, Correlaciones parciales y semiparciales, Diagnósticos de colinealidad y en residuos, Durbin-Watson.

Hacer clic en Gráficos, y en la ventana que aparece señalar: Histograma, Gráfico de prob. Normal y Generar todos los gráficos parciales.

Hacer clic en Guardar, y en la ventana que aparece señalar: Valores pronosticados no tipificados, en Distancias, señalar de Cook y Valores de influencia y en Residuos, método de Student y Eliminados estudentizados. La pestaña “incluir la matriz de covarianzas” debe estar señalada.

Por último, hacer clic en aceptar y aparecerá la hoja de resultados.

Tercero, debemos ir comprobando cada una de las asunciones:

  1. Independencia de los residuos. Para ello debemos fijarnos en la tabla resumen del modelo.

El valor de Durbin-Watson (última columna) es 2,032, que al ser próximo a 2 indica que no existe correlación entre los residuos, por lo que se puede utilizar este modelo. Si el valor hubiera estado próximo a 4 o a 0 habría que abandonar la regresión lineal múltiple y utilizar otro modelo.

  1. Comprobar la relación lineal. En la regresión lineal múltiple se asume que existe una relación lineal entre las variables dependientes e independientes. Esto se comprueba mediante la generación de gráficos de dispersión y observar la relación lineal entre ambas variables. En nuestra hoja de resultados nos aparece cada uno de los gráficos parciales puesto que en la opción de Gráficos le hemos dado a la generación de todos los gráficos parciales.

Gráfico de relación parcial entre la edad y los días de estancia. Como se ve existe una relación lineal entre ambas variables

  1. Comprobar la homocedasticidad. La asunción de homocedasticidad indica que todos los residuos son iguales para todos los valores predichos de la variable dependiente. Para comprobar la heterocedasticidad se puede hacer mediante un gráfico de dispersión. Para ello enfrentamos las variables RESIDUOS ESTUDENTIZADOS (SER_1) frente a VALORES PREDICHOS NO ESTUDENTIZADOS (PRE_1). Estas variables se han generado cuando en la opción Guardar hemos indicado que aparezcan.

Gráfico de dispersión de los residuos. Como se puede observar la distribución es horizontal indicando que la distribución de los residuos es uniforme en los valores predichos de la variable dependiente, por lo que se puede asumir el criterio de homocedasticidad. Si no hubiera ocurrido así, habría que hacer una transformación (logarítmica o elevar al cuadrado) de las variable dependiente o independientes.

  1. Comprobar la multicolinealidad. La multicolinealidad ocurre cuando dos variables dependientes tienen una alta relación entre ellas y aportarían por tanto la misma información. Para comprobar la multicolinealidad debemos fijarnos en las tablas de correlaciones y en la de coeficientes.

Tabla de Correlaciones. Debemos fijarnos en los valores estadísticamente significativos y en que la correlación de Pearson no sea muy elevada (superior a 0,7). En este ejemplo únicamente se observa una relación estadísticamente significativa entre la edad y el IMC, pero es una correlación baja, inferior a 0,7.

Tabla de coeficientes. En el recuadro aparece el valor de la tolerancia y FIV (ambos están relacionados, FIV=1/Tolerancia). Se considera que existe colinealidad si el valor de tolerancia es bajo (<1-R2). La R2 se obtiene de la tabla “Resumen del modelo”. En este ejemplo, 1-R2 es igual a 1-0,382 = 0,618. Por lo que no hay ningún resultado de tolerancia inferior a este valor, por lo que podemos decir que no hay problema de colinealidad en este estudio.

  1. Comprobar la distribución normal de los residuos. En la hoja de resultados vamos a obtener un histograma con la distribución normal de los residuos puesto que previamente se lo hemos indicado en la opción de gráficos.

Histograma con curva de normalidad y gráfico P-P. En este gráfico se observa que los residuos tienen una distribución normal.

Si los residuos no tienen una distribución normal se puede hacer una transformación de la variable dependiente. De todas formas, este criterio no es imprescindible y el test podría realizarse igualmente asumiendo que no se cumple la normalidad de los residuos.

Cuarto, interpretar los resultados. Para esto nos tenemos que fijar en las siguientes tablas:

1.    Tabla resumen del modelo.

La R de la primera columna es el valor absoluto de la correlación de Pearson entre las variables dependientes e independientes. Indica la fuerza de asociación entre las variables y es mejor cuanto más se aproxime a 1.

R cuadrado representa la proporción de la varianza de la variable dependiente que puede ser explicada por nuestras variables independientes. En este ejemplo, R2 = 0,348, indica que un 34,8% de la variación de la variable dependiente es explicada por nuestras variables.

2.    La tabla de ANOVA.

Indica si las variables independientes explican bien o mal la variación de la variable dependiente. Si p<0,05 las variables independientes explican bien la variación de la variable dependiente. En cambio, si p≥0,05 las variables independientes no explican bien la variación de la variable dependiente.

3.    La tabla con los coeficientes.

Tabla de coeficientes que indica las variables que se asocian de forma independiente con la variable dependiente. En este ejemplo, la edad y la Neumonía se asocian a una estancia media hospitalaria de forma independiente

Como el IMC y el sexo no se asocian de forma independiente y hemos utilizado el método “enter”, debemos eliminarlas y ejecutar de nuevo en análisis. De esta forma el resultado sería el siguiente:

 La interpretación se basa en la siguiente fórmula

Donde “y” es la variable dependiente, “a” el valor de una constante, “x” cada una de las variables independientes y “b” el valor que se obtiene. Así en este ejemplo, para predecir la estancia media hospitalaria sería:

Estancia media = 0,297 + (0,07Edad) + (3,126Neumonia)

Es decir, por cada año de edad, la estancia media aumentaría en 0,07 días y por la presencia de neumonía en 3,126 días.

Si por ejemplo quiere saber la estancia media de un individuo de 60 años y con neumonía será de: 0,297 + (0,07*60) + 3,126= 7,62 días.

¿Cómo expresar en un artículo la regresión múltiple lineal?

En el apartado de material y métodos. Siguiendo con el ejemplo anterior, se puede expresar así: “para comprobar que variables se asociaron de forma independiente con la estancia media se realizó un análisis de regresión múltiple lineal. Las asunciones de linealidad, independencia de los errores, homocedasticidad y normalidad de los residuos fueron comprobados”. Se puede añadir qué criterios se utilizaron para seleccionar las variables que se incluyeron en el modelo, por ejemplo aquellas que salieron estadísticamente significativas en un análisis univariante realizado previamente o las que eran clínicamente relevantes. Además se puede especificar el método que se utilizó, por ejemplo, el método de introducir o uno de los automáticos.

En el apartado de resultados. Siguiendo con el ejemplo anterior se puede expresar así: “En el análisis lineal multivariante para predecir la estancia media hospitalaria se incluyeron la edad, sexo, índice de masa corporal y la neumonía. La edad y la neumonía fueron las únicas variables que predicen la estancia media de forma estadísticamente significativa, F (4,72) = 11,122, p<0,0005, adj. R2 = 0,382. Los coeficientes de regresión y los errores estándar se presentan en la tabla 1 (debajo)”. La F es el valor de la ANOVA, y entre paréntesis se ponen los grados de libertad (regresión, residual).

Ejercicio 12. Utilizar base_demogeneral. Determinar si la neumonía, obesidad mórbida, edad y sexo se asocian de forma independiente con la presencia de sepsis.

Solución: Por el método introducir obtenemos que sólo la obesidad mórbida, OR=10,28, IC95% [1,19 a 88,8], p=0,034 y la edad, OR=1,023, IC95% [1,002 a 1,045], p=0,036 se asociaron de forma independiente con la presencia de sepsis. Como se ha comentado en el ejercicio 8 para una correcta interpretación tenemos que definir muy bien las variables y asignar el valor más inferior a la presencia de la enfermedad y el superior a la no presencia, por ejemplo sepsis igual a “1” y no sepsis igual a “2”, pues el SPSS tiene de a ordenarlas de forma ascendente y esto nos puede llevar a errores de interpretación. Habitualmente tendemos a asignarle el valor “0” cuando no la tiene y el valor “1” en el caso que la tenga. Si la hubiéramos definido así en el caso de la sepsis, la OR obtenida hubiera sido de los pacientes que no tienen sepsis con respecto a los que la tienen y hubiéramos obtenido este resultado: para la obesidad mórbida (OR=0,097, IC95% 0,011-0,84) y para la edad (OR=0,977, IC95%, 0,957-0,998). En el primer caso sería factor de riesgo y el segundo factor protector. Si no estamos atentos podríamos habernos confundido e interpretar falsamente a la edad y la obesidad mórbida como factores protectores para la presencia de sepsis. Si ya tenemos definida la variable con 0 y 1 y no queremos transformarla, simplemente podemos hacer la inversa de la OR obtenida y tendremos la OR que realmente le corresponde. En este ejemplo la OR de la obesidad mórbida para sepsis es 10,28 y es 1/10,28 (0,097) para no sepsis.