Regresión lineal
Definitions & Key takeaways
Linear regression is a mathematical technique used to estimate the relationship between two variables. It is used when the relationship between the two variables is linear (meaning that it follows a straight line).
The linear regression equation looks like this: y = ax + b, where y is the predicted value, x is the independent variable (the one we are trying to predict), a is the slope of the line, and b is the y-intercept.
If we know the values of a and b, we can use the equation to predict the value of y for any given x. We can also use linear regression to determine how strong (or weak) the relationship between x and y actually is.
Suponga que quiere averiguar si fumar más cigarrillos conduce a un menor volumen espiratorio forzado, o VEF, que es la cantidad total de aire, en litros por segundo, que una persona puede exhalar en una sola respiración forzada.
Los hombres sanos suelen tener un VEF de unos 4 litros por segundo. Ahora bien, para averiguar si los hombres que fuman tienen un VEF más bajo, se podría preguntar a 100 hombres cuántos cigarrillos fuman en un día, y luego medir el VEF de cada un Estas mediciones, o puntos de datos, se podrían representar en un gráfico de dispersión, con el número de cigarrillos, que es la exposición, en el eje de abscisas, y el VEF, que es el resultado, en el de ordenadas, y donde cada punto de datos representa a una person Normalmente, se dibuja una línea de tendencia lineal, o modelo, para representar el patrón de los puntos de datos en el gráfico En teoría, se pueden trazar muchas líneas para representar los puntos de datos, pero la mejor línea de tendencia es la que tiene el error más bajo, que se define como una medida de la distancia entre un punto de datos y la línea de tendencia.
Por lo general, nos interesa el error al cuadrado, que es la distancia entre el punto de datos y la línea, elevada al cuadrado.
Por ejemplo, si un punto de datos está muy cerca de la línea de tendencia, el error cuadrático es pequeñ Por otra parte, si un punto de datos está muy alejado de la línea de tendencia, el error cuadrático es grande.
Si se suman todos los errores al cuadrado de una línea, se obtiene el error total al cuadrado, y una línea con un error total al cuadrado menor se considera que se ajusta mejor a los datos que si la línea se asocia con un error total al cuadrado más elevado.
Ahora bien, cuando dos variables están relacionadas linealmente, es posible que queramos saber específicamente lo que ocurre con la variable de resultado cuando cambia la variable de exposici Por ejemplo, podríamos querer saber cómo cambia el VEF de una persona si fuma cinco cigarrillos al día en comparación con si diariamente fuma diez cigarrillos Para averiguarlo, tenemos que utilizar la regresión lineal, un método estadístico que calcula una ecuación para la línea de tendencia que mejor se ajusta a un conjunto de puntos de datos.
En concreto, en este caso, utilizaríamos una regresión lineal simple, ya que solo tenemos dos variables: una variable y, que es la medición del VEF, y una variable x, que es el número de cigarrillo En esto se diferencia de la regresión lineal múltiple, en la que hay una variable y y dos o más variables x.
Normalmente, la regresión lineal múltiple se utiliza para controlar las variables de confusión, o variables x que distorsionan la verdadera relación entre la variable de exposición principal y la variable de resultado.
Por ejemplo, la edad es una variable de confusión en la relación entre el tabaquismo y el VEF, ya que las personas mayores tienden a tener un VEF más bajo que los jóvenes Supongamos que se quiere averiguar cómo cambia el VEF en las personas que fuman más cigarrillos al día, controlando la edad.
En este ejemplo, hay dos variables x (el número de cigarrillos que fuma una persona y su edad), por lo que habría que utilizar la regresión lineal múltiple.
Ahora, en la regresión lineal se manejan cuatro supuestos clave, referidos colectivamente por el acrónimo L-I-N-E, o LINE.
En primer lugar, la relación entre las dos variables debe ser Lineal, lo que significa que la línea de tendencia trazada para representar los puntos de datos es una recta.
Las relaciones que tienen un tipo de curva diferente, como en una relación exponencial o en forma de U, tendrán un coeficiente de correlación bajo, porque una línea de tendencia recta no se ajusta a la forma de los puntos de datos El segundo supuesto establece que cada persona de la muestra fue reclutada de manera independiente con respecto a las demás.
En otras palabras, ninguna persona influyó en la inclusión o no de otra en el estudi Por ejemplo, si una persona acepta participar en el estudio solo si su amigo también puede ser incluido en el mismo, entonces estas dos personas no serían independientes entre sí y no se cumpliría el segundo supue El reclutamiento independiente garantiza que las personas incluidas en el estudio tienen características similares a las de la población diana, y que los resultados de la prueba pueden aplicarse a dicha población diana, con lo cual tendría una buena validez externa.
Además, la población de la muestra debe haber sido reclutada aleatoriamente, como si se eligieran 100 nombres al azar de una lista de todos los nombres de la población dian Al igual que el reclutamiento independiente, el muestreo aleatorio es importante porque garantiza que la población de la muestra se aproxima a la población diana.
El tercer supuesto es que los errores entre los valores observados y predichos de y se disponen según una distribución Normal en torno a un valor de x.
Aunque al principio pueda parecer confuso, no hay de qué preocuparse. Lo analizaremos despacio, revisando la línea de tendencia, que muestra un valor y predicho para un valor x específic Por ejemplo, supongamos que tenemos una línea de tendencia con el siguiente aspecto.
Según nuestra línea de tendencia, para las personas que fuman 10 cigarrillos al día, predecimos que su VEF será de unos 3 litros por segundo.
Pero en realidad, algunas personas que fuman 10 cigarrillos al día tendrán un VEF superior o inferior a 3, simplemente debido a las diferencias individuales, como la edad de la persona o la cantidad de ejercicio que real Recuerde, por otra parte, que la distancia a la que se encuentra un punto de la línea de predicción se llama error, y de los puntos que están lejos de la línea se dice que tienen un error alto.
De este modo, el tercer supuesto establece que los errores de un punto dado seguirán una curva de campana de distribución normal, lo que significa que la mayoría de las personas tendrán un error bajo, con lo que su VEF estará situado en torno a la línea de tendencia; solo algunas tendrán un error alto, con un VEF por encima o por debajo de dicha línea de tendencia.
Así sucede para todos los valores de x, o para cada número de cigarrillos fumados al día. El cuarto supuesto indica que los puntos de datos deben tener varianza Equivalente (igual), lo que también se llama homoscedasticidad.
Básicamente, esto significa que los puntos de datos están separados por la igual de la línea de tendencia para cada valor de x.
Si los puntos de los datos están más cerca de la línea de tendencia en un extremo y más lejos en el otro, entonces no se cumple el supuesto de equivalencia de varianza y los datos son heteroscedásticos.
Volviendo a la regresión lineal simple, una línea de tendencia lineal está representada por la ecuación y-hat es igual a b0 más b1x1, donde y-hat es el valor estimado para la variable de resultado, que en este caso es el VEF, y x1 es el valor de la variable de exposición, por lo que en este caso es el número de cigarrillos que fuma una persona.
b0 representa la intersección y, y b1 es la pendiente de la líne Normalmente, utilizamos un programa informático estadístico para calcular la ecuación lineal, y el programa informático proporcionará b0 y b1, que podemos introducir en nuestra ecuación Por ejemplo, digamos que el programa informático nos da un b0 de 4 y un b1 de 0,1 negativo, por lo que la ecuación de la recta sería y-hat igual a 4 menos 0,1 por x1 Esta ecuación proporciona dos datos cruciales.
En primer lugar, b0 indica el valor medio de la variable de resultado cuando la variable de exposición es igual a cero. Por ejemplo, un b0 de 4 significa que las personas que fuman 0 cigarrillos al día tienen un VEF medio de 4 litros por segund En segundo lugar, b1 indica el tamaño del efecto, o la magnitud de cambio en la variable de resultado por cada incremento de una unidad en la variable de exposición Por ejemplo, un b1 de 0,1 negativo significa que, por término medio, el VEF disminuirá en 0,1 litros por segundo por cada cigarrillo adicional que se fume al día.
En otras palabras, si las personas que fuman cero cigarrillos al día tienen un VEF medio de 4, entonces las personas que fuman un cigarrillo al día tendrán un VEF medio de 4 menos 0,1, es decir, 3,9; las personas que fuman dos cigarrillos tendrán un VEF medio de 3,9 menos 0,1, es decir, 3,8, y así sucesivame También puede utilizarse esta ecuación para predecir el VEF medio para un determinado número de cigarrillos fumados al día.
Por ejemplo, supongamos que queremos predecir cuál será el VEF de una persona que fuma 10 cigarrillos al dí Para ello, introducimos el número 10 en el punto x1 de nuestra ecuación, de modo que y-hat es igual a 4 menos 0,1 por 10, y luego resolvemos para y-hat.
0,1 por 10 es 1, y 4 menos 1 es 3, por lo que predecimos que una persona que fuma 10 cigarrillos al día tendrá un VEF medio de 3 litros por segundo.
En la regresión lineal múltiple es habitual tener 2, 3, 4 o más variables de exposición, que se incluyen en la ecuación de regresión lineal.
Para simplificar las cosas, ofrecemos a continuación un ejemplo con dos variables de exposición. Supongamos que queremos observar la relación entre el VEF y el número de cigarrillos, así como controlar la edad, que creemos que es un factor de confusión.
En este caso, las variables de exposición son el número de cigarrillos y la edad. En este caso, nuestra ecuación será: y-hat es igual a b0 más b1x1, más b2x2, donde x1 es el número de cigarrillos y x2 la edad.
El programa informático estadístico proporciona la intersección y las pendientes de cada variable, así que supongamos que obtenemos un valor de b0 de 4, una b1 de 0,1 negativo y una b2 de 0,02 negativo.
Un b2 negativo de 0,02 significa que: el VEF medio disminuye en 0,02 litros por segundo por cada año de aumento de la edad Supongamos ahora que queremos predecir el VEF medio de un hombre de 50 años que fuma 15 cigarrillos al día, así que introducimos cada número en la ecuación y obtenemos: y-hat es igual a 4 menos 0,1 por 15, menos 0,02 por 50.
0,1 por 15 es 1,5, y 0,02 por 50 es 1, por lo que la ecuación puede simplificarse a 4 menos 1,5 menos 1, que es igual a 1,5.
Esto significa que un hombre de 50 años que fuma 15 cigarrillos al día tiene un VEF previsto de 1,5 litros por segundo Un aspecto que es importante saber sobre la regresión lineal es que la variable de resultado siempre tiene que ser continua, como los litros por segundo, pero la de exposición puede ser continua, como el número de cigarrillos fumados al día, o categórica, por ejemplo, si una persona fuma o no fum Supongamos ahora que queremos averiguar cómo cambia el VEF en las personas que fuman frente a las que no fum El programa informático estadístico seguirá proporcionando un valor para b0 y b1, pero en este caso, b1 es ligeramente diferente Para las variables categóricas, el programa informático crea automáticamente una variable ficticia, que es básicamente una variable binaria en la que el número 1 representa el grupo de referencia, o simplemente, un subgrupo de la variable de exposición, como las personas que fuman.
Por otro lado, el 0 representa el otro subgrupo no de referencia de la variable de exposición, es decir, las personas que no fuman.
Digamos que el valor de b0 sigue siendo 4, y el valor de b1 es negativo 1,2, por lo que la ecuación lineal es y-hat igual a 4 menos 1,2 por x En este caso, el tamaño del efecto es de 1,2, lo que significa que, por término medio, las personas que fuman tienen un VEF de 1,2 litros por segundo menos que las personas que no fuman Para predecir el VEF de una persona que fuma, simplemente introducimos el número 1 en la ecuación, porque las personas que fuman conforman el grupo de referenci Así, 1,2 por 1 sigue siendo 1,2, y 4 menos 1,2 es 2,8, por lo que el VEF previsto para una persona que fuma es de 2,8 litros por segundo.
Por otro lado, para predecir el VEF de una persona que no fuma, introduciríamos 0 en la ecuación, ya que las personas que no fuman son el grupo de no referencia.
Así, 1,2 por 0 es 0, y 4 menos 0 sigue siendo 4, por lo que el VEF previsto para una persona que no fuma es de 4 litros por segundo Por lo general, el programa informático también proporcionará el coeficiente de determinación, o el valor R-cuadrado, que indica el modo en que la variación en la variable de resultado se explica por el modelo de regresión lineal, en contraposición a la variación natural.
En otras palabras, ¿el VEF de una persona puede explicarse por el número de cigarrillos que fuma o es más el resultado de otros factores, como el sexo, la edad o la cantidad de ejercicio que realiza?
Supongamos que obtenemos un valor R-cuadrado de 0,72. Esto significa que el 72% de la variación del VEF puede explicarse por el número de cigarrillos fumados al día, y el 28% restante responde a otros factores.
Un valor R-cuadrado alto como este nos indica que la mayor parte de la variación que vemos entre las personas con un VEF alto y un VEF bajo es el resultado de cuánto fuman, y en concreto, que las personas con un VEF más bajo fuman más cigarrillos que las que tienen un VEF alt Al llevar a cabo una regresión lineal se presentan dos limitaciones clave.
La primera limitación es que la regresión lineal puede ser sensible a los valores atípicos, o puntos de datos que son mucho más altos o mucho más bajos que todos los demás puntos de datos Supongamos, por ejemplo, que se añade una persona a nuestro estudio, y que esa persona fuma muchos cigarrillos pero también tiene un VEF muy alt En este caso, la línea de tendencia trataría de tener en cuenta este nuevo punto de datos, pero como está tan alejado de todos los demás, la pendiente será muy diferente de la que no incluye el valor atípico.
En la regresión lineal, los valores atípicos pueden afectar tanto al cálculo del tamaño del efecto como a las predicciones.
La otra limitación de la regresión lineal es que no es posible extrapolar, o extraer conclusiones, sobre los puntos de datos que están fuera del rango de valores x que están en la muestra Por ejemplo, supongamos que el rango de cigarrillos fumados por las personas de nuestro estudio es de 0 a 25, por lo que 0 es el número más bajo de cigarrillos fumados por las personas del estudio y 25 es el número más alto.
Sabemos que existe una relación lineal entre el número de cigarrillos fumados en este rango, pero no si la relación lineal entre el VEF y el tabaquismo continúa fuera del rango de nuestros datos de muestra, por ejemplo, para alguien que fuma 40 cigarrillos al día.
##Resumen Como breve resumen... La regresión lineal es un método estadístico que se utiliza para calcular el efecto de una variable de exposición, como el número de cigarrillos al día, sobre una variable de resultado, como el VEF, y utiliza la ecuación y-hat igual a b0 más b1x1.
b0 representa el valor medio del resultado cuando la variable de exposición es cero, y para las variables de exposición continuas, b1 representa el cambio medio en la variable de resultado por cada aumento de una unidad en la variable de exp osición.
En las variables de exposición categóricas, b1 representa el valor del resultado para el grupo de referencia en comparación con el grupo de no referencia.
Es importante tener en cuenta que la regresión lineal funciona mejor para los datos que no tienen valores atípicos, y que solo se pueden extraer conclusiones sobre los puntos de datos dentro del rango de la muestra.
Aún no hay notas para este video
Intenta agregar una nota a continuación