Correlación
Definitions & Key takeaways
A correlation is a statistical measure that quantifies the degree of relationship between two variables. In other words, it shows how closely two things are related. A correlation coefficient can range from -1 to 1, with a value of 1 indicating a perfect positive correlation and a value of -1 indicating a perfect negative correlation.
La correlación es una técnica estadística que muestra si dos variables cuantitativas están relacionadas, y también con qué intensidad.
Por ejemplo, supongamos que queremos averiguar si beber más refrescos está relacionado con tener un mayor índice de masa corporal o IMC.
Así, se pregunta a 100 personas cuántas bebidas azucaradas toman a la semana y luego se comprueba la altura y el peso de cada persona para calcular su IMC Estas mediciones o puntos de datos podrían representarse en un gráfico de dispersión, con el número de bebidas en el eje de las abscisas y el IMC en el de las ordenadas, de modo que cada punto de datos representa a una persona.
Normalmente, se dibuja una línea de tendencia para representar mejor el patrón de puntos de datos en el gráfico, con aproximadamente la mitad de los puntos por encima de la línea y la otra mitad por debajo.
Una correlación positiva significa que el IMC aumenta a medida que lo hace el número de bebidas y, si las dos variables mantienen una correlación positiva perfecta, la línea de tendencia pasará por todos los puntos de datos.
Imaginemos ahora que hay una correlación negativa. Esto significa que el IMC disminuye a medida que aumenta el número de bebidas y, con una correlación negativa perfecta, la línea de tendencia también pasa por todos los puntos de datos.
Por último, si no hay correlación, los puntos de datos se dispersarán aleatoriamente por todo el gráfico de dispersión y la línea de tendencia será plana, sin dirección positiva o negativ Para averiguar la intensidad de la correlación entre dos variables, podemos utilizar la prueba de correlación de Pearson, que es una prueba paramétrica que mide la proximidad o la dispersión de los puntos de datos con respecto a la línea de tendencia.
La prueba de correlación de Pearson calcula un coeficiente de correlación, que es un número que representa lo bien que están correlacionadas las dos variables, y normalmente se escribe con una r minúscula El coeficiente de correlación puede oscilar entre 1 negativo, que representa una correlación negativa perfecta, y 1 positivo, correspondiente a una correlación positiva perfecta.
Un coeficiente de correlación de 0 significa que no hay correlación entre las dos variables. Existen cuatro supuestos clave que se utilizan en una prueba de correlación de Pearson, y un acrónimo para estos supuestos es L-I-N-E, o LIN En primer lugar, la relación entre las dos variables debe ser lineal, lo que significa que la línea de tendencia trazada para representar los puntos de datos es una recta.
Las relaciones que tienen un tipo de curva diferente, como en una relación exponencial o en forma de U, tendrán un coeficiente de correlación bajo porque una línea de tendencia recta no se ajusta a la forma de los puntos de datos El segundo supuesto es que cada persona de la muestra fue reclutada independientemente de otras personas de la muestra.
En otras palabras, ninguna persona influyó en la inclusión o no de otra persona en el estudio Por ejemplo, si una persona acepta participar en el estudio solo si su amigo también puede ser incluido en el mismo, entonces estas dos personas no serían independientes entre sí y no se cumpliría el segundo supue El reclutamiento independiente garantiza que las personas incluidas en el estudio tienen características similares a las de la población diana, y que los resultados de la prueba pueden aplicarse a la población diana, lo que significa que tiene una buena validez externa.
Además, la población de la muestra debe haber sido reclutada aleatoriamente, como si se eligieran 100 nombres al azar de una lista de todos los nombres de la población dian Al igual que el reclutamiento independiente, el muestreo aleatorio es importante porque garantiza que la población de la muestra se aproxima a la población diana.
El tercer supuesto es que los errores entre los valores observados y predichos de y se distribuyen Normalmente en torno a un valor de x.
Esto puede parecer confuso, pero no se preocupe. Vamos a desglosarlo, revisando la línea de tendencia, que muestra un valor y predicho para un valor x e specífic Por ejemplo, supongamos que tenemos una línea de tendencia con el siguiente aspecto.
Según nuestra línea de tendencia, para las personas que toman 2 bebidas azucaradas a la semana, predecimos que su IMC será de alrededor de 23.
Pero, en realidad, algunas personas que toman 2 bebidas tendrán un IMC superior o inferior a 23, simplemente debido a diferencias individuales, como la edad de una persona o la cantidad de ejercicio que re aliza.
La distancia a la que se encuentra un punto de la línea de predicción se denomina error, y se dice que los puntos que están lejos de la línea tienen un error elevado La tercera suposición sostiene que los errores para un punto dado seguirán una curva en forma de campana con distribución normal, lo que significa que la mayoría de las personas tendrán un error bajo, por lo que su IMC se agrupará cerca de la línea de tendencia; y menos personas tendrán un error alto, con lo que su IMC será más alto o más bajo que la línea de tendencia.
Así sucede para cada valor de x, o para cada número de bebidas azucaradas por semana. El cuarto supuesto indica que los puntos de datos deben tener igual varianza, lo que también se llama homocedasticidad.
Básicamente, esto significa que los puntos de datos están igualmente separados de la línea de tendencia para cada valor de x.
Si los puntos de los datos están más cerca de la línea de tendencia en un extremo y más lejos en el otro, entonces no se cumple el supuesto de igualdad de varianza y los datos son heteroscedásticos Así que, volviendo a la prueba de correlación de Pearson, comienza con dos hipótesis.
La hipótesis nula establece que r es igual a cero, o lo que es lo mismo, que no hay correlación entre dos variables. Por su parte, la hipótesis alternativa es que r no es igual a cero, o que existe una correlación entre dos variables.
Para probar estas hipótesis tenemos que calcular el coeficiente de correlación, para lo cual se aplican cinco pasos. El primer paso consiste en hallar la suma de cada uno de los valores x, que en este ejemplo es el número de bebidas.
Como ejemplo sencillo, utilizaremos una muestra de 5 personas, y supondremos que el número de bebidas que consume cada persona es de 3, 5, 8, 10 y 12.
A menudo, la suma se escribe con la letra griega sigma, por lo que la suma de todos los valores x es 3 más 5 más 8 más 10 más 12, igual a 38.
Así, nuestra población de muestra de 5 personas toma alrededor de 38 bebidas azucaradas a la semana. El segundo paso consiste encontrar la suma de cada uno de los valores y, en este ejemplo, es el IMC de cada persona.
Así, digamos que los cinco personas tenían un IMC de 24, 23, 28, 29 y 35, y cuando los sumamos todos obtenemos 139. Esto significa que nuestra población de muestra de 5 personas tiene un IMC combinado de 139.
El tercer paso consiste en encontrar la suma de cada uno de los valores al cuadrado de x y la suma de cada uno de los valores al cuadrado de y.
Así, cuando elevamos al cuadrado cada valor x, obtenemos 9, 25, 64, 100 y 144, y si los sumamos todos obtenemos 342. Cuando elevamos al cuadrado cada valor y, obtenemos 576, 529, 784, 841 y 1.225, y si los sumamos todos obtenemos 3.995 El cuarto paso es encontrar la suma de x por y.
Para ello, multiplicamos el valor de x de la primera persona por el valor de y de dicha primera persona, por lo que 3 por 24 es 72.
Luego, lo repetimos para las otras cuatro personas: así, 5 por 23 es 115, 8 por 28 es 224, 10 por 29 es 290 y 12 por 35 es 42 Finalmente, sumamos esos valores para obtener 1.121.
El quinto paso consiste en introducir todas las sumas que acabamos de encontrar en la ecuación del coeficiente de correlación, que tiene el siguiente aspect Esta ecuación tiene muchas partes diferentes, así que vamos a desglosarla.
En el numerador, tenemos n, o el tamaño de la muestra, por la suma de x por y, menos la suma de x por la suma de y. Como el tamaño de la muestra en nuestro ejemplo es 5, multiplicamos 5 por la suma de x por y, que es 1.121, y el resultado es igual a 5.605.
A continuación multiplicamos la suma de x, o 38, por la suma de y, o 139, lo que es igual a 5.282. Así, el valor del numerador es 5.605 menos 5.282, que es igual a 323.
En el denominador tenemos tres partes diferentes. Primero, multiplicamos n por la suma de x al cuadrado, y luego le restamos la suma de x al cuadrado.
Entonces, usamos el mismo tamaño de muestra, que es 5, por la suma de x al cuadrado, que es 342, y eso es igual a 1.710 Entonces, usaremos la suma de x, que es 38, y la elevaremos al cuadrado, por lo que 38 al cuadrado es 1.444.
Para terminar esta parte, restaremos el segundo número, 1.444, al primero, 1.710, para obtener 266. Ahora hacemos lo mismo para y en la segunda parte.
Así, n (o 5) por la suma de y al cuadrado (o 3.955) es igual a 19.775. A su vez, la suma de y, o 139, al cuadrado es 19.321.
Así, 19.775 menos 19.321 es igual a 454. Para la tercera parte, multiplicamos los dos números que acabamos de obtener y hallamos la raíz cuadrada de los mismos.
Así, 266 por 454 es 120.764, y la raíz cuadrada de eso es 347,5. Ahora podemos dividir el numerador, que es 323, entre el denominador, que es 347,5, para obtener 0,93, que es el coeficiente de correlación.
Por regla general, los coeficientes de correlación superiores a 0,7 se consideran fuertes, por lo que, dado que nuestro coeficiente de correlación es superior a 0,7, podemos estar bastante seguros de que existe una fuerte correlación entre el número de bebidas azucaradas consumidas y el I Si observamos el gráfico de dispersión y la línea de tendencia de estos datos, podemos ver que la línea de tendencia también coincide bastante bien con los puntos de datos.
Para saber si la correlación es estadísticamente significativa, tenemos que comparar el coeficiente de correlación que hemos calculado con un valor crítico, que es un número predeterminado que se utiliza para determinar si se rechaza o no la hipótesis nul Si el valor del coeficiente de correlación es mayor que el valor crítico, entonces la hipótesis nula es falsa y podemos concluir que existe una correlación entre el número de bebidas azucaradas consumidas y el IMC.
Los valores críticos se pueden encontrar en una tabla de correlación de Pearson como esta, que tiene los grados de libertad en el lateral y el nivel de significación en la parte superior.
Los grados de libertad (df) para una prueba de correlación de Pearson son el tamaño de la muestra menos 2. Así, en nuestro ejemplo, los grados de libertad serían 5 menos 2, lo que equivale a 3.
El nivel de significación es el valor p que determinan los investigadores al principio de un estudio, y normalmente es solo 0,05, o el 5%.
Utilizando 3 grados de libertad y un nivel de significación de 0,05, encontramos un valor crítico de 0,878. El valor de nuestro coeficiente de correlación es 0,93, que está por encima del valor crítico, por lo que podemos rechazar la hipótesis nula y concluir que existe una correlación entre el número de bebidas azucaradas consumidas y el I Las pruebas de correlación de Pearson suelen calcularse con un software estadístico, que a menudo proporciona un valor de p.
Este valor de p es la probabilidad de obtener un coeficiente de correlación determinado o un coeficiente superior, si la hipótesis nula es verdadera.
En resumen, el valor de p elimina el paso de encontrar el valor crítico. Así, si utilizamos un nivel de significación de 0,05, una prueba con un valor de p inferior a 0,05 indicará que la hipótesis nula es falsa y que existe una correlación entre el número de bebidas azucaradas consumidas y el IMC.
Por lo general, el software también proporcionará el coeficiente de determinación, o el valor R-cuadrado, que es simplemente el coeficiente de correlación, al cuadrado.
Así, el valor de R-cuadrado para nuestro ejemplo sería de 0,93 al cuadrado, es decir, 0,86. El valor R-cuadrado indica la cantidad de variación de la variable y que se explica por la variable x, en contraposición a la variación natural.
Dicho de otro modo, el IMC de una persona puede explicarse por el número de bebidas azucaradas que toma, o es más el resultado de otros factores, como el sexo, la edad o la cantidad de ejercicio que hace.
En este ejemplo, un valor R-cuadrado de 0,86 significa que el 86% de la variación del IMC puede explicarse por el consumo de bebidas azucaradas, y el 14% restante se explica por otros factores.
Un valor R-cuadrado alto como este nos indica que la mayor parte de la variación que vemos entre las personas con un IMC alto y un IMC bajo es el resultado de beber diferentes cantidades de bebidas azucaradas, y concretamente, que las personas con un IMC más bajo toman menos bebidas azucaradas que las personas con un IMC alto.
Algo importante que hay que tener en cuenta es que la correlación y la causalidad no deben confundirse; así, aunque las personas con un IMC más alto tomen más bebidas azucaradas, no significa que el consumo de bebidas azucaradas provoque realmente que una persona posea un IMC superior.
A veces, la variable x es en realidad una medida aproximada o sustitutiva de una variable diferente. Por ejemplo, las personas que consumen más bebidas azucaradas probablemente tengan una dieta más pobre que las que toman menos bebidas azucaradas, y la dieta es un conocido factor de riesgo de un IMC elevado Así que, en realidad, es la dieta la que provoca un aumento del IMC, no las bebidas azucaradas.
Una variable que, como la dieta, queda oculta por otra variable, como el número de bebidas azucaradas, se denomina factor de confusión.
A la hora de calcular la correlación hay dos limitaciones clave. La primera limitación es que la correlación es sensible a los valores atípicos, o puntos de datos que son mucho más altos o mucho más bajos que todos los demás puntos de datos.
Por ejemplo, digamos que añadimos una sexta persona a nuestro ejemplo, y esa persona toma 8 bebidas azucaradas a la semana pero tiene un IMC muy bajo de 16.
En este caso, la línea de tendencia trataría de tener en cuenta este nuevo punto de datos, pero como está tan lejos de todos los demás puntos de datos, la correlación será mucho menor.
De hecho, cuando incluimos este dato, la correlación baja de 0,93 a 0,58. La otra limitación es que no podemos extrapolar, o sacar conclusiones, sobre los puntos de datos que están fuera del rango de valores de x que están en la muestra.
Por ejemplo, sabemos que existe una correlación entre el número de bebidas azucaradas consumidas y el IMC de las personas que toman de 2 a 12 bebidas azucaradas a la seman Pero, no sabemos si hay una correlación para las personas que toman 20 bebidas azucaradas por semana, porque eso está fuera del rango de nuestros datos de la muestra.
Por último, es importante tener en cuenta que si no se cumplen los supuestos de una prueba de correlación de Pearson, no podemos estar seguros de que los resultados de esa prueba puedan aplicarse a la población diana, por lo que no debería utilizarse una prueba de correlación de Pearson.
En su lugar, podríamos utilizar una prueba no paramétrica llamada prueba de correlación de Spearman, que no se basa en supuestos paramétricos.
En resumen, la prueba de correlación de Spearman mide la fuerza de las relaciones no lineales, siempre que las relaciones sean monótonas, lo que significa que son continuamente positivas o continuamente negativas, aunque no estén en línea recta.
##Resumen Como breve resumen, la prueba de correlación de Pearson es una prueba paramétrica que se utiliza para evaluar si existe una correlación entre dos variables.
Es importante tener en cuenta que la prueba de Pearson funciona mejor para los datos que no tienen valores atípicos, y que solo se pueden extraer conclusiones sobre los puntos de datos dentro del rango de la muestr La prueba de Pearson asume que los datos son lineales, independientes y muestreados aleatoriamente, con una distribución normal y con igual varianza.
Si no se cumplen estos supuestos, se puede utilizar la prueba de correlación de Spearman para determinar si existe una correlación entre dos variables, siempre que la relación sea monótona.
Aún no hay notas para este video
Intenta agregar una nota a continuación