Métodos de análisis de regresión
Definitions & Key takeaways
There are a variety of methods of regression analysis, each with its own strengths and weaknesses. The most commonly used methods are linear regression, logistic regression, and Poisson regression.
Linear regression is used when the data is assumed to be linear in nature. Logistic regression is used when the data is assumed to be binary (e.g., success/failure, yes/no), while Poisson regression is used when the data follows a Poisson distribution, and is used for modeling count data.
Hay cuatro tipos básicos de análisis estadísticos que se utilizan habitualmente en la investigación epidemiológica, y la elección de uno u otro depende de dos criterios principales.
El primer criterio es el tipo de datos, que pueden ser datos individuales o datos agrupados, que también se denominan datos de grupo.
Por ejemplo, si queremos saber cuántas personas de entre 100 han desarrollado cáncer de pulmón en los últimos 5 años Con los datos individuales, tenemos información sobre cada persona, por lo que podemos saber si cada una de las 100 personas desarrolló o no un cáncer de pulmón.
Digamos que seis personas desarrollaron cáncer de pulmón. Si disponemos de datos individuales, podemos observar las características individuales de cada una de esas seis personas, como su sexo, edad, raza o antecedentes de migrañas, y podemos compararlas con las personas que no desarrollaron cáncer de pulmón.
Por otro lado, si tenemos datos de grupo, no sabemos realmente qué personas concretas de los 100 desarrollaron cáncer de pulmó Así que aunque sabemos que seis personas lo tienen, no sabemos qué seis personas son ni ninguna de sus características individuales.
El segundo criterio es el tipo de resultado o variable "y" que se está midiendo, que puede ser cuantitativo, categórico o de tiempo hasta el acontecimient Las variables cuantitativas tienen un valor numérico, como el volumen espiratorio forzado de una persona, que es la cantidad total de aire, en litros, que una persona puede exhalar en una sola respiración fo rzada.
Una persona muy en forma puede tener un VEF de 5, mientras que una persona menos en forma puede tener un VEF de 3. Por otro lado, las variables categóricas tienen grados distintos.
Por ejemplo, podríamos utilizar una variable categórica para describir si una persona fue diagnosticada de cáncer de pulmón en los últimos 5 años o si no lo fue.
Y, por último, las variables de tiempo hasta el acontecimiento describen el tiempo que se siguió a una persona antes de que se produjera el acontecimiento o el resultado.
Por ejemplo, si empezamos a seguir a una persona a los 50 años y desarrolla un cáncer de pulmón a los 53, su tiempo hasta el acontecimiento sería de 3 años.
Uno de los tipos de análisis más sencillos y más utilizados es la regresión lineal. En la regresión lineal se utilizan datos individuales y la variable del resultado siempre es cuantitativa, mientras que la variable de la exposición puede ser categórica o cuantitativa.
Por ejemplo, digamos que queremos averiguar si existe una asociación entre el número de cigarrillos fumados y el VEF, así que preguntamos a 100 personas cuántos cigarrillos fuman al día y luego medimos el VEF de cada person En este estudio, la exposición es el número de cigarrillos, por lo que es cuantitativa, y el resultado es el VEF, que también es cuantitativ Normalmente, se utiliza un programa informático estadístico para calcular la ecuación lineal, y el programa informático proporcionará b0 y b1, que son dos números que podemos introducir en la ecuación y-hat = b0 + b1x Y-hat es el valor estimado de la variable del resultado, que en este caso es el VEF, y x1 es el valor de la variable de la exposición, que en este caso es el número de cigarrillos que fuma una person Supongamos que el programa informático nos da un b0 de 4 y un b1 de 0,1 negativo, por lo que la ecuación es y-hat igual a 4 menos 0,1 veces x1.
Ahora, b1 es el número más importante para la interpretación porque nos dice el tamaño del efecto, o cuánto cambia la variable del resultado por cada aumento de una unidad en la variable de la exposición.
Por ejemplo, un b1 de 0,1 negativo significa que, por término medio, el VEF disminuirá en 0,1 litros por segundo por cada cigarrillo adicional que se fume al día.
Una cosa importante que hay que saber es que la regresión lineal puede utilizarse en cualquier tipo de diseño de estudio siempre que se cumplan los dos criterios de datos individuales y variable del resultado cuantitativa.
Por ejemplo, supongamos que queremos averiguar si fumar más cigarrillos aumenta la probabilidad de padecer cáncer de pulmón entre los 55 y los 64 año Así, seguimos a 100 personas de 55 años que fuman y a 100 personas de 55 años que no fuman durante 10 años, y comparamos cuántas de ellas desarrollan cáncer de pulmón.
En este ejemplo, la variable de la exposición es si una persona fuma o no cigarrillos, por lo que es categórica; y la variable del resultado es si la persona desarrolla o no cáncer de pulmón, por lo que también es categórica.
Y más concretamente, como solo hay dos valores para cada variable, se denominan variables categóricas binarias. Como en el caso de la regresión lineal, el programa informático estadístico nos dará b0 y b1, y podemos introducirlos en la misma ecuación de y-hat = b0 + b1x1, pero la interpretación de los coeficientes beta es diferent En la regresión logística, los coeficientes beta representan las probabilidades logarítmicas de que se produzca el resultado.
Por ejemplo, supongamos que el programa informático nos da un b0 de 0,05 y un b1 de 1,9, por lo que la ecuación de la recta sería y-hat igual a 0,05 más 1,9 veces x1.
Si solo nos fijamos en b1, el tamaño del efecto, nos dice cuánto cambian las probabilidades logarítmicas de la variable del resultado para el grupo no expuesto, o los no fumadores, frente al grupo expuesto, o los fumadores.
Así, un b1 de 1,9 significa que, por término medio, las probabilidades logarítmicas de desarrollar un cáncer de pulmón para los fumadores son 1,9 veces las probabilidades logarítmicas de desarrollar un cáncer de pulmón para los no fumadores Puesto que puede ser confuso interpretar las probabilidades logarítmicas, también podemos convertir estos números en probabilidades regulares exponenciándolos por una base e.
Por ejemplo, e elevado a 1,9 es igual a 6,7, por lo que las probabilidades de desarrollar un cáncer de pulmón para los fumadores son 6,7 veces las probabilidades de desarrollar un cáncer de pulmón para los no fumadores.
La regresión logística puede utilizarse para cualquier tipo de estudio, pero la interpretación cambia ligeramente según el diseño del estudio.
Nuestro ejemplo fue un estudio de cohortes longitudinal, porque había un grupo de personas expuestas (las que fumaban) y un grupo de personas no expuestas (las que no fumaban) y se hizo un seguimiento a lo largo del tiempo.
Este tipo de diseño de estudio permite medir la incidencia o el riesgo, que es el número de casos nuevos que se producen en un determinado período de tiempo.
Utilizando la regresión logística, se calcula lo que se llama cociente de posibilidades de riesgo. Por otro lado, la regresión logística también puede utilizarse en estudios de casos y controles, en los que se comparan los antecedentes de dos grupos de personas: los que tienen un determinado resultado, llamados casos, y los que no tienen un determinado resultado, llamados controles, para ver si han estado expuestos a cosas diferentes.
Por ejemplo, se podría analizar a 100 personas que tuvieran cáncer de pulmón, que serían los casos, y a 100 personas que no tuvieran cáncer de pulmón, que serían los controles, y luego comparar cuántas personas de cada grupo fumaron cigarrillos en los últimos 10 años.
En los estudios de casos y controles no se puede medir la incidencia, ya que se seleccionan personas que ya tienen el resultado.
En su lugar, se mide la prevalencia, o el número de personas que ya fumaban cigarrillos antes de que empezaran las mediciones.
El emparejamiento se produce cuando los casos y los controles se seleccionan en función de una determinada característica, como la edad, el sexo, la raza, el estatus socioeconómico o la ocupación, y suele utilizarse para garantizar que los grupos de casos y controles sean similares.
Por ejemplo, se puede hacer un emparejamiento por sexo para garantizar que el 50% de los casos y el 50% de los controles sean mujere La regresión logística condicional produce cocientes de posibilidades emparejados, que se calculan de forma diferente con el programa informático estadístico pero se interpretan de forma muy similar a otros cocientes de posibilidades Por ejemplo, un b1 de 1,5 se interpretaría como que las probabilidades logarítmicas de desarrollar cáncer de pulmón para los fumadores son 1,5 veces las probabilidades logarítmicas de desarrollar cáncer de pulmón para los no fumadores emparejados.
El siguiente tipo de método estadístico es la regresión de Cox, que también se llama regresión de riesgos proporcionales de Cox.
En la regresión de Cox se utilizan datos individuales, y la variable de la exposición es categórica, mientras que la variable del resultado es el tiempo hasta el evento.
Por ejemplo, digamos que encontramos 500 personas que fuman y 500 que no fuman, y les hacemos un seguimiento anual durante los próximos 20 años.
En cada visita de seguimiento anual, registramos si la persona ha desarrollado o no un cáncer de pulmón, y si lo hace, anotamos cuántos años le hemos seguido antes de que desarrollara el resultado.
Para simplificar, tomemos como ejemplo a cinco personas, y digamos que están en el grupo de fumadore Supongamos que la persona 1 desarrolló un cáncer de pulmón al cabo de 5 años, la persona 2 lo desarrolló al cabo de 7 años, la persona 3 lo desarrolló al cabo de 10 años, la persona 4 lo desarrolló al cabo de 11 años y la persona 5 nunca desarrolló un cáncer de pulmón.
Por lo tanto, diríamos que el tiempo hasta el acontecimiento para las personas 1 a 4 es de 5, 7, 10 y 11 años, mientras que el tiempo hasta el acontecimiento para la persona 5 es de 20 años, ya que no desarrolló cáncer de pulmón en todo el seguimient A menudo, estos datos se presentan en un gráfico de Kaplan-Meier, que es un tipo de gráfico por pasos con el tiempo en el eje x y el porcentaje de "supervivientes", o libres de enfermedad, en el eje y.
En este caso, cada paso representa el diagnóstico de una persona, y una línea plana significa que no se diagnosticó a nadie durante ese tiempo Normalmente, los grupos expuestos y no expuestos se muestran en el mismo gráfico, así que añadamos el grupo de no fumadores, y supongamos que la persona 1 desarrolló cáncer de pulmón a los 8 años y la persona 2 lo desarrolló a los 18 años, mientras que las personas 3, 4 y 5 no lo desarrolla Una cosa que hay que observar es que la línea del grupo de no fumadores está por encima de la línea del grupo de fumadores, lo que indica que había un mayor porcentaje de personas sin la enfermedad en el grupo de no fumador Volvamos a la regresión de Cox.
La variable de la exposición es fumar o no fumar, que es una variable categórica binaria, y la variable del resultado es el tiempo que tarda en desarrollarse el cáncer de pulmón.
El programa informático estadístico calculará de nuevo b1, pero en la regresión de Cox esto representa el cociente del riesgo logarítmico, que es la diferencia del riesgo relativo entre los grupos de fumadores y no fumadore Y el riesgo se define como la posibilidad instantánea de que se produzca un suceso en un período de tiempo d eterminad Supongamos que b1 es igual a 0,9, lo que significa que el riesgo logarítmico de desarrollar cáncer de pulmón en el grupo de fumadores es 0,9 veces el riesgo logarítmico del grupo de no fumadores.
Igual que en la regresión logística, si exponenciamos b1, obtenemos el cociente de riesgo. Por lo tanto, e elevado a 0,9 es igual a 2,5, lo que significa que el riesgo de desarrollar cáncer de pulmón para el grupo de fumadores es 2,5 veces el riesgo para el grupo de no fumadores.
Normalmente, la regresión de Cox se utiliza para analizar los datos de los estudios de cohortes longitudinales, ya que hay que hacer un seguimiento de las personas a lo largo del tiempo para recoger los resultados del tiempo hasta el even Vamos a hablar ahora de los datos agrupados.
Un tipo de análisis estadístico que se puede hacer con los datos agrupados se llama regresión de Poisson y, como en la regresión de Cox, se utilizan los resultados del tiempo hasta el acontecimiento para analizar los datos de los estudios de cohortes longitudinales.
Pero el problema aquí es que, a diferencia de la regresión de Cox, no se conocen los tiempos exactos hasta el acontecimiento porque solo se dispone de información sobre los grupos y no sobre las personas dentro de cada grupo.
Esto ocurre a veces cuando el investigador no es el que ha recogido los datos y no puede acceder a los datos originales por razones logísticas, como restricciones éticas, físicas o económicas.
Supongamos que se quiere averiguar la relación entre el consumo de cigarrillos y el tiempo que transcurre hasta el diagnóstico de cáncer de pulmón en 200 personas (100 que fumaban y 100 que no fumaban) y que se hizo un seguimiento de todos ellos de un máximo de 20 años.
Como se trata de datos agrupados, se tiene el número total de personas que desarrollaron cáncer de pulmón en cada grupo y la cantidad total de tiempo que se siguió a las personas en cada grupo, pero no se sabe exactamente cuánto tiempo se siguió a cada una de las 200 personas.
Si nadie tiene cáncer (el acontecimiento), significaría que cada persona fue seguida durante los 20 años, y ese tiempo total sería 100 personas por 20 años, o 2.000 personas-año, en cada grupo.
Pero esto no es realista, así que supongamos que 14 personas del grupo de fumadores y 2 personas del grupo de no fumadores desarrollaron cáncer de pulmón Y que hay un total de 1.200 personas-año en el grupo de fumadores y 1.500 personas-año en el grupo de no fumadores.
A partir de estas cifras, podemos calcular el índice de incidencia en cada grupo, o el número de acontecimientos dividido entre el tiempo-persona.
En el grupo de fumadores, la tasa de incidencia es de 14 dividida entre 1.200, es decir, 0,012, que también puede expresarse como 12 casos de cáncer de pulmón por cada 1.000 personas-añ En el grupo de no fumadores, la tasa de incidencia es de 2 dividido entre 1.500, lo que equivale a 0,0013, y esto también puede expresarse como 1,3 casos de cáncer de pulmón por cada 1.000 personas-año Si se divide la tasa de incidencia del grupo de fumadores entre la tasa de incidencia del grupo de no fumadores, se obtiene 0,012 dividido entre 0,0013, que es igual a 9,23.
Y este es el cociente de la tasa de incidencia, lo que significa que la tasa de incidencia del cáncer de pulmón en el grupo de fumadores es 9,23 veces la tasa de incidencia del cáncer de pulmón en el grupo de no fumadores.
¿Cómo encaja esto en la regresión de Poisson? El programa informático estadístico utiliza la regresión de Poisson para calcular el cociente de la tasa de incidencia logarítmica, que es b1 Y esto se puede exponenciar para obtener la tasa de incidencia.
Así pues, aunque es posible calcular a mano cocientes de la tasa de incidencia más sencillos, se vuelve mucho más complejo cuando se empiezan a añadir otras variables, como el grupo de edad o el estatus socioeconómico, y es entonces cuando la regresión de Poisson resulta útil.
##Resumen Como breve resumen... Hay cuatro tipos básicos de análisis estadísticos que se utilizan habitualmente en la investigación epidemiológica, y la elección del análisis depende de dos criterios principales: el tipo de datos de que se dispone, que pueden ser datos individuales y datos agrupados o clasificados, y el resultado o la variable y que se está midiendo, que puede ser cuantitativa, categórica o el tiempo hasta el acontecimiento.
En la regresión lineal, logística y de Cox se utilizan datos a nivel individual, mientras que en la regresión de Poisson se utilizan datos agrupados.
En la regresión lineal, la variable del resultado es siempre cuantitativa, y el b1 puede interpretarse como el cambio en la variable del resultado por cada cambio de 1 unidad en la variable de la exposición.
En la regresión logística, la variable del resultado es siempre categórica, y cuando la exposición es también categórica, el b1 puede interpretarse como el cociente de posibilidades logarítmico del resultado para el grupo expuesto frente al no expuesto.
Y si se hace la exponenciación, e elevado a b1 se interpreta simplemente como el cociente de posibilidades del resultado para el grupo expuesto frente al no expuest En la regresión de Cox, la variable del resultado es el tiempo transcurrido hasta el acontecimiento, y e elevado a b1 puede interpretarse como el cociente de riesgo del resultado para el grupo expuesto frente al grupo no expuesto.
Por último, en la regresión de Poisson, la variable del resultado también es el tiempo hasta el acontecimiento, y e elevado a b1 puede interpretarse como el cociente de la tasa de incidencia del resultado para el grupo expuesto frente al no expuesto.
Aún no hay notas para este video
Intenta agregar una nota a continuación