Definitions & Key takeaways

Logistic regression is a statistical method used to describe the relationship between an outcome variable and one or more exposure variables. Logistic regression can help to figure out the effect of an exposure variable (e.g. the number of cigarettes per day) on a categorical outcome variable (e.g. Having a heart attack). Note that the outcome variable is always categorical, but the exposure variables can be either categorical or quantitative.

La regresión logística es un tipo de método estadístico que se utiliza para describir la relación entre una variable de resultado y una o más variables de exposició En la regresión logística, la variable de resultado es siempre categórica, y las de exposición pueden ser categóricas o cuantitativas.
Por ejemplo, supongamos que se quiere averiguar si fumar más cigarrillos aumenta la posibilidad de sufrir un infarto de miocardio En este caso, el número de cigarrillos es una exposición cuantitativa y el hecho de que una persona sufra o no un infarto de miocardio es un resultado categórico Ahora bien, para averiguarlo se podría preguntar a 200 personas cuántos cigarrillos fuman al día, y luego llevar un seguimiento de ese grupo de personas durante cinco años para ver quién tiene un infarto de miocardio y quién no.
Los datos podrían organizarse en una tabla como la que se muestra, en la que la primera columna, o variable, es el número de cigarrillos que fuma una persona, la segunda columna es si ha tenido o no un infarto de miocardio y el resto de las columnas son otras características, o variables, que se han recogido sobre cada persona, como la edad, el sexo y el índice de masa corporal, o I Normalmente, para las variables binarias, por ejemplo, con valores de sí/no, se utilizan los números 0 y 1 para representar las dos respuestas posibles.
Así, para la variable de infarto de miocardio, podría decirse que el 0 representa "no" y el 1 representa "sí". Podría tomarse la misma decisión para el sexo, donde el 0 representa a las mujeres y el 1 a los hombres.
Analicemos ahora las dos primeras variables: cuántos cigarrillos se fuman y si se ha tenido o no un infarto de miocardio.
Se podrían representar estas mediciones, o puntos de datos, en un gráfico de dispersión, con el número de cigarrillos en el eje de las abscisas y el infarto de miocardio en el de las ordenadas, y en el que cada punto de datos representa a una persona.
Este gráfico de dispersión puede parecer un poco extraño, porque todos los puntos de datos están agrupados en dos puntos del eje Y: en el 0, que representa el no, o en el 1, que representa el sí.
El gráfico de dispersión ayuda a averiguar cómo cambian las posibilidades ("odds") de sufrir un infarto de miocardio de las personas a medida que fuman cada vez más cigarrillos.
Tal es el objetivo de la regresión logística. En estadística es frecuente confundir los conceptos de probabilidad y de "odds" (posibilidades), por lo que a continuación se exponen las diferencias.
Se llama probabilidad al número de veces que ocurre un resultado dividido entre el número de veces que podría haber ocurrido; suele representarse con una P mayúscula.
Así, a partir de los datos, sería posible calcular la probabilidad de tener un infarto de miocardio por cada número de cigarrillos fumados al Supongamos que el rango del número de cigarrillos fumados está entre 0 y 19, por lo que el gráfico de dispersión se puede dividir en 20 secciones diferentes; son 20 secciones, y no 19, porque el 0 también es una sección.
Ahora, para hallar la probabilidad de sufrir un infarto de miocardio en una sección específica, se cuenta el número de personas que han sufrido infartos de miocardio en esa sección y se divide entre el número total de personas en la sección.
A modo de ejemplo, supongamos que hay 10 personas en la sección de 15 cigarrillos o, en otras palabras, 10 personas en el estudio que fuman 15 cigarrillos al día; de esas 10 personas, 6 tuvieron infartos de miocardio.
Así, la probabilidad de padecer un infarto de miocardio para las personas que fuman 15 cigarrillos al día es de 6 sobre 10, es decir, del 60 Ahora cambiemos de tercio y hablemos de las "odds" (posibilidades).
Las "odds" comparan la probabilidad de que se produzca un resultado con la probabilidad de que no se produzca, por lo que la ecuación de las "odds" es P dividida entre 1 menos P.
Así, en el ejemplo, se utilizaría la probabilidad de tener un infarto de miocardio, que es del 60%, o 0,6, comparada con la de no tener un infarto de miocardio, que es 1 menos 0,6, es decir, 0,4.
Si se dividen ambos lados entre 0,4 se obtiene 1,5 frente a 1. Para que sea más fácil de interpretar, multipliquemos ambos lados por dos, de modo que se obtiene una proporción de 3 a 2 Dicho de otro modo, de todas las personas que fuman 15 cigarrillos al día, hay 3 que sufren infartos de miocardio por cada 2 personas que no los tienen Volviendo al gráfico de dispersión...
Normalmente, en la regresión lineal se dibuja una línea de tendencia lineal para representar el patrón de los puntos de datos en el gráfico; esa línea se representa con la ecuación: y-hat es igual a b0 más b1x1, donde y-hat es el valor estimado para la variable de resultado; x1 es el valor de la variable de exposición; b0 representa la intersección y, y b1 representa la pendiente de la línea.
Ahora bien, en la regresión logística, la línea de tendencia tiene un aspecto algo diferente. Esto se debe a que los puntos de datos de la regresión logística no están dispuestos en línea recta, por lo que una línea de tendencia lineal no es un buen ajuste, o representación, de los dato En cambio, la línea de tendencia de la regresión logística es curva, y concretamente, una curva en forma de S.
La ecuación de esta curva en forma de S es P igual a e elevado a la potencia de b0 más b1x1, dividido entre 1 más e elevado a la potencia de b0 más b1x1.
Llegados a este punto, es razonable preguntarse qué tienen que ver las líneas de tendencia con la probabilidad y las "odds".
Pues bien, la pendiente de una línea en un punto concreto representa una determinada probabilidad, de modo que un punto de datos en una pendiente muy pronunciada representa una alta probabilidad y un punto de datos en una pendiente muy superficial representa una probabilidad baja.
Así, con una curva en forma de S, la probabilidad de un suceso, que en este caso es la de sufrir un infarto de miocardio, es diferente en varios puntos de la línea, lo que hace que sea bastante difícil de interpretar Por ejemplo, hacia la parte inferior de la línea, la probabilidad es baja, después aumenta hacia la mitad de la línea y luego, en la parte superior de la línea, es baja de nuevo.
Esto supone un problema porque, normalmente, se desea trazar una línea que represente a toda la población de la muestra, para poder obtener conclusiones sobre toda la misma en su conjunt Para solucionar este problema es preciso transformar, o cambiar, los puntos de datos para que estén dispuestos en el gráfico en un patrón más lineal.
Para ello, dejaremos a un lado la probabilidad para centrarnos en las "odds" o posibilidades; de hecho, hemos de dar un paso más allá y cambiar al logaritmo de las "odds", el llamado log-odds.
Así, si la ecuación básica de las "odds" es P sobre 1 menos P, entonces para cambiar la ecuación de probabilidad a una ecuación de "odds" hacemos que P sobre 1 menos P sea igual a -e elevado a la potencia de b0 más b1x1 - sobre - 1 menos e elevado a la potencia de b0 más b1x1 Si se simplifica esta ecuación, que no mostraremos aquí en aras de no complicar la exposición, lo que se obtiene es que P sobre 1 menos P es igual a e elevado a la potencia de b0 más b1x1.
Esta es la ecuación de las "odds". Para cambiar la ecuación de las "odds" por la de los logaritmos, simplemente tomamos el logaritmo de ambos lados.
Por lo tanto, terminamos con el logaritmo de P sobre 1 menos P igual a b0 más b1x1. Esta ecuación, como se puede reconocer, es la correspondiente a una línea de tendencia lineal.
De hecho, al mirar los datos recién transformados, se verá que están dispuestos linealmente en el gráfico. [delete] A veces las matemáticas pueden parecer un poco confusas, pero por suerte los programas informáticos de estadística hacen la mayor parte del trabajo en nuestro nombr Básicamente, el programa informático arroja valores para b0 y b1, que podemos introducir en nuestra ecuación.
Por ejemplo, supongamos que el programa informático nos da un b0 de 0,05 y un b1 de 0,2, por lo que la ecuación de la recta sería y-hat igual a 0,05 más 0,2 veces x1.
Esta ecuación nos revela dos elementos de información cruciales. En primer lugar, b0 nos indica la intersección y, que es el valor de log-odds de la variable de resultado cuando la variable de exposición es igual a 0.
Así, por ejemplo, un b0 de 0,05 significa que las personas que fuman 0 cigarrillos al día tienen un valor de log-odds de 0,05 de sufrir un infarto.
Dado que el logaritmo de las "odds" no es muy interpretable, normalmente se convierte de nuevo en "odds" regulares exponenciando el logaritmo de las "odds" con una base e.
Por lo tanto, e elevado a 0,05 es igual a 1,05, lo que significa que las "odds" de tener un infarto de miocardio para las personas que fuman 0 cigarrillos es de 1,05.
El otro elemento que nos transmite la ecuación es b1, que es el tamaño del efecto, o la magnitud de cambio del logaritmo de las "odds" de la variable de resultado por cada aumento de una unidad en la variable de exposició Por ejemplo, un b1 de 0,2 significa que, por término medio, el valor log-odds asociado a sufrir un infarto de miocardio aumentarán en 0,2 por cada cigarrillo adicional que se fume al día.
En otras palabras, si las personas que fuman 0 cigarrillos al día tienen un valor de log-odds de 0,05, las que fuman un cigarrillo al día tendrán una posibilidad de 0,05 más 0,2, es decir, 0,25; las personas que fuman dos cigarrillos tendrán un valor de log-odds de 0,05 más 2 veces 0,2, es decir, 0,45; y así sucesivamente.
Estos números también se pueden convertir en "odds" regulares exponenciándolos en una base e. Por ejemplo, e al 0,45 es igual a 1,6, por lo que las personas que fuman dos cigarrillos al día tienen un valor de log-odds de 0,45 de sufrir un infarto, y una probabilidad de 1,6 de padecerlo.
También puede utilizarse esta ecuación para predecir las "odds" de sufrir un infarto de miocardio para cualquier número específico de cigarrillos fumados al día.
Por ejemplo, supongamos que queremos predecir cuáles son el valor de log-odds y las "odds" para una persona que fuma 10 cigarrillos al día.
Para ello, introducimos el número 10 en el punto x1 de la ecuación, de modo que el valor de log-odds es igual a 0,05 más 0,2 veces 10.
0,2 veces 10 es 2, y 0,05 más 2 es 2,05, por lo que se pronostica que una persona que fuma 10 cigarrillos al día tendrá un valor de log-odds de 2,05 de sufrir un infarto de miocardio.
Al exponenciar el valor se obtiene 7,8. Así, predecimos que una persona que fuma 10 cigarrillos al día tendrá un 7,8 de posibilidades de sufrir un infarto de miocardio.
Todo lo anterior mostraba un ejemplo de regresión logística simple, ya que solo se tenían dos variables: una variable y, que es el infarto de miocardio o no, y una variable x, que es el número de cigarrillos fumados al día.
Este concepto es diferente de la regresión logística múltiple, en la que hay una variable y y dos o más variables x. Normalmente, la regresión logística múltiple se utiliza para controlar las variables de confusión, o variables x que distorsionan la verdadera relación entre la variable de exposición principal y la variable de resultados.
Por ejemplo, la edad es una variable de confusión en la relación entre el tabaquismo y los infartos de miocardio, ya que las personas mayores tienden a sufrir más infartos de miocardio que los jóvenes.
Supongamos que quiere averiguar cómo cambian las "odds" de sufrir un infarto de miocardio en las personas que fuman más cigarrillos al día, controlando la eda En este ejemplo, hay dos variables x (el número de cigarrillos que fuma una persona y su edad), por lo que habría que utilizar la regresión logística múltiple.
En este caso, la ecuación log-odds se convertirá en: log de P sobre 1 menos P es igual a b0 más b1x1, más b2x2, donde x1 es el número de cigarrillos y x2 la edad.
El programa informático estadístico proporciona la intersección y las pendientes de cada variable, así que supongamos que nos da una b0 de 0,05, una b1 de 0,2 y una b2 de 0, Un b2 de 0,01 significa que: el valor de log-odds de sufrir un infarto de miocardio aumentan en 0,01 por cada año de aumento de la edad.
También podemos utilizar esta ecuación para predecir las "odds" de sufrir un infarto de miocardio de una persona de cierta edad y que fuma un determinado número de cigarrillos al día.
Supongamos que queremos predecir las "odds" de sufrir un infarto de miocardio para una persona de 50 años que fuma 15 cigarrillos al día, así que introducimos cada número en nuestra ecuación y obtenemos 0,05 más 0,2 veces 15, más 0,01 veces 50.
0,2 por 15 es 3, y 0,01 por 50 es 0,5, por lo que la ecuación puede simplificarse a 0,05 más 3 más 0,5, que es igual a 3,55.
Esto significa que una persona de 50 años que fuma 15 cigarrillos al día tiene una posibilidad predicha según el valor de log-odds de sufrir un infarto de 3,55 Aplicando la exponenciación se obtiene un valor de 34,8, por lo que una persona de 50 años que fuma 15 cigarrillos al día tiene una posibilidad prevista de sufrir un infarto de miocardio de 34,8, que es muy alta.
Una de las limitaciones de la regresión logística es que no es posible extrapolar, o extraer conclusiones, sobre los puntos de datos que están fuera del rango de valores x de la muestra.
Por ejemplo, supongamos que el intervalo de cigarrillos fumados por las personas de un estudio es de 0 a 19, donde 0 es el número mínimo de cigarrillos fumados y 19 el máximo Ahora, sabemos que existe una relación entre los infartos de miocardio y el número de cigarrillos fumados en este rango, pero desconocemos si sigue habiendo una relación entre el infarto de miocardio y el tabaquismo fuera del rango de nuestros datos de muestra, digamos que para alguien que fuma 40 cigarrillos al día.
##Resumen Como breve resumen... La regresión logística es un método estadístico utilizado para calcular el efecto de una variable de exposición, como el número de cigarrillos al día, sobre una variable de resultado categórica, como tener un infarto de miocardio.
En concreto, la regresión logística calcula el valor de log-odds de un resultado y utiliza la ecuación b0 más b1x1. b0 representa el valor de log-odds del resultado cuando la variable de exposición es 0, y b1 representa el cambio medio en el valor de log-odds de la variable de resultado por cada aumento de una unidad en la variable de exposición.
Para hacerlo más interpretable, el valor de log-odds se puede transformar en "odds" o posibilidades exponenciando dichos logaritmos en base e.
En el caso de la regresión logística es importante tener en cuenta que solo se pueden extraer conclusiones sobre los puntos de datos situados dentro del rango de la muestra.