Definitions & Key takeaways

Biostatistics refers to the process of collecting, organizing, and analyzing variables collected from living things. Biostatistics involves design studies to answer specific scientific questions, and the skills necessary to properly analyze the data collected from those studies. It also involves effective communication of the results of analyses to scientists and other non-statisticians.

Digamos que se quiere averiguar si las personas con un índice de masa corporal, o IMC, elevado tienen un mayor riesgo de padecer hipertensión, o presión arterial alta Supongamos que se seleccionan 100 personas con hipertensión y 100 personas sin hipertensión y se averigua el IMC de cada persona en cada grupo.
También puede recopilar otra información sobre las personas de cada grupo, como la edad que tienen, si fuman cigarrillos o si beben alcohol, ya que todos estos factores pueden influir en el riesgo de hipertensión de una persona.
Todas estas piezas de información, denominadas variables, pueden reunirse en un único documento o archivo, denominado conjunto de datos.
Un conjunto de datos suele incluir variables independientes, que se cree que influyen en las variables dependientes o las modifican.
En nuestro ejemplo, el índice de masa corporal sería la variable independiente y la hipertensión sería la variable dependiente.
El proceso de recopilación, organización y análisis de las variables de un conjunto de datos se denomina estadística, y cuando los datos se recogen de seres vivos (como los seres humanos, los osos hormigueros, las algas o las bacterias) se llama bioestadística porque bio significa vida Hay dos tipos principales de bioestadística.
El primer tipo es la estadística descriptiva, que se utiliza para describir o resumir la información sobre cada variable individual del conjunto de datos.
Se puede utilizar para hallar la media (el número promedio calculado a partir de una variable concreta), la mediana (el número intermedio de una variable) y la moda (el número que más aparece en la variable).
Las estadísticas descriptivas de cada variable pueden calcularse para toda la muestra (las 200 personas) o en cada grupo por separado (las 100 personas del grupo con hipertensión o las otras 100 del grupo sin hipertensión).
Por ejemplo, el índice de masa corporal medio de todas las personas del estudio podría ser de 24,5, o el índice de masa corporal medio podría ser de 28 para el grupo con hipertensión y de 21 para el grupo sin hipertensi También se puede utilizar la estadística descriptiva para hallar el rango, la varianza o la desviación estándar, que son formas de entender cómo se extienden o distribuyen los datos de una determinada variable.
Por ejemplo, el índice de masa corporal más bajo medido en el grupo con hipertensión podría ser de 23, y el más alto de 33, por lo que el rango del índice de masa corporal en este grupo sería de 23 a 33.
Normalmente, las estadísticas descriptivas se presentan en un gráfico o una tabla. El segundo tipo de bioestadística es la inferencial, que se diferencia de la estadística descriptiva en dos aspectos En primer lugar, la estadística inferencial analiza las relaciones entre dos o más variables, en lugar de analizar cada una de ellas por separado Por ejemplo, se podría utilizar la estadística inferencial para explorar la relación entre el índice de masa corporal y la hipertensió Se podría clasificar el índice de masa corporal en dos grupos: por encima de 25, o alto, y por debajo de 25, o bajo, y se podría descubrir que las personas con índices de masa corporal altos tienen 3 veces más probabilidades de padecer hipertensión que las personas con índices de masa corporal bajos.
Normalmente, las estadísticas inferenciales se presentan mediante riesgos relativos, riesgos atribuibles, cocientes de posibilidades o cocientes de riesgos.
El objetivo de la estadística descriptiva es describir la similitud o la diferencia entre los grupos de estudio de una muestra de población determinada.
Por ejemplo, si se utiliza la estadística descriptiva para descubrir que el 72% de las personas del grupo con hipertensión son hombres, pero solo el 16% de las personas del grupo sin hipertensión son hombr Se trata de un hallazgo importante porque los hombres suelen tener índices de masa corporal ligeramente inferiores a los de las mujeres En consecuencia, el hecho de que haya más hombres en el grupo con hipertensión significa que el índice de masa corporal medio de ese grupo será menor.
Si con la estadística descriptiva se descubre que los grupos de estudio no son muy similares, se dice que el estudio tiene una baja validez interna, y que los resultados encontrados mediante la estadística inferencial pueden deberse a diferencias en los dos grupos de estudio.
Por otro lado, el objetivo de la estadística inferencial es aplicar los resultados de la población de la muestra a una población diana, que suele ser la población general.
Así, la estadística inferencial se ocupa de saber si los dos grupos de estudio son similares o no, así como si la población de la muestra representa o no a la población diana Lo ideal es que el estudio se realice en una muestra de población de personas que sea similar a la población diana en todos los aspectos significativo Por ejemplo, si la población diana es gente de Lagos (Nigeria), lo ideal sería que la población de muestra incluyera personas de edades, razas y estatus socioeconómico que reflejen las características de la gente de Lagos.
Una herramienta para asegurarse de que la población de la muestra representa a la población diana se llama aleatorización, que significa que las personas se seleccionan para entrar en el estudio a través de un proceso al azar.
Supongamos que se tiene una lista de todas las personas de Lagos que tienen hipertensión y una lista de todas las personas de Lagos que no tienen hipertensión, y se cierran los ojos y se eligen 100 nombres de cada lista para incluirlos en el estudio.
Eso es aleatorización. Usando la aleatorización, hay una probabilidad bastante alta de que la población de la muestra y la población diana sean similares, y se diría que ese estudio tiene una alta validez externa.
En los estudios con alta validez externa, cualquier resultado de la estadística inferencial que se haga sobre la población de la muestra puede aplicarse también a la población dian Por lo tanto, si se descubre que las probabilidades de hipertensión son mayores en las personas con índices de masa corporal altos en la muestra de 100 personas de Lagos, se puede concluir que es muy probable que los cocientes de hipertensión sean mayores para todos los que tienen un índice de masa corporal alto en Lagos.
Normalmente, la estadística inferencial comienza con dos hipótesis. La primera hipótesis se llama hipótesis nula, y básicamente dice que no hay diferencia entre dos variable En el ejemplo, la hipótesis nula afirmaría que no hay diferencia en las probabilidades de hipertensión para las personas con índices de masa corporal altos en comparación con las personas con índices de masa corporal bajos, o simplemente, que no hay relación entre la hipertensión y el índice de masa corporal.
Por otro lado, la hipótesis alternativa afirmaría que existe una diferencia en las probabilidades de padecer hipertensión entre las personas con índices de masa corporal altos y las de índices de masa corporal bajos o, simplemente, que existe una relación entre la hipertensión y el índice de masa corpor Para comprobar estas hipótesis, se suele utilizar un modelo de regresión lineal o logística para ver si hay una diferencia significativa entre los dos grupos.
En términos comunes, "significativo" suele significar importante o interesante, pero en estadística significa que la relación entre dos variables está causada por algo distinto al azar, y normalmente se define por un valor de p inferior a 0,05 o el 5%.
Por ejemplo, si se utiliza la regresión logística para ver si hay una diferencia en las probabilidades de hipertensión en las personas con índices de masa corporal altos o bajos, y se obtiene un cociente de posibilidades de 3 y un valor de p de 0,02.
Esto significa que, si la hipótesis nula es cierta, la probabilidad de obtener un cociente de posibilidades de 3 o más simplemente por azar es de aproximadamente el 2%.
En otras palabras, hay una probabilidad muy pequeña, por debajo del 5%, de obtener un cociente de posibilidades de 3 si la hipótesis nula es verdader Y como la probabilidad es inferior al 5%, se puede concluir que, muy probablemente, la hipótesis nula es falsa y la hipótesis alternativa es verdadera.
Y la hipótesis alternativa es que realmente hay una diferencia significativa en las probabilidades de hipertensión entre los dos grupos.
La significación estadística es diferente de la significación clínica, que se refiere a la importancia práctica de los resultado En otras palabras, un resultado clínicamente significativo indicaría que la variable independiente tiene un efecto notable sobre la variable dependiente en la vida diaria del participante.
Por ejemplo, si se descubre que las personas con índices de masa corporal altos tienen 2,5 veces más probabilidades de padecer hipertensión que las personas con índices de masa corporal bajos, pero el valor de p es de 0,22, que es mucho más alto que 0,05.
En el estudio, podríamos concluir que el índice de masa corporal no tiene un efecto estadísticamente significativo sobre la hipertensión.
Pero, en realidad, un profesional sanitario podría llegar a la conclusión de que 2,5 veces es clínicamente significativo, y podría informar a las personas con índices de masa corporal elevados de que tienen más probabilidades de padecer hipertensión.
Puede haber cualquier combinación de significación estadística y clínica, por lo que es posible que los resultados del estudio sean estadísticamente significativos pero no sean clínicamente significativos, que tanto los resultados estadísticos como los clínicos sean significativos, o que ambos resultados no sean significativo Además, no hay un grado establecido de significación clínica, sino que depende en última instancia de la relación entre dos variables.
##Resumen Como breve resumen... La estadística descriptiva se utiliza para describir las características de cada variable dentro de una muestra específica, y la estadística inferencial se utiliza para describir las relaciones entre dos o más variables.
Normalmente, se utilizan los resultados de la estadística descriptiva para asegurarse de que los grupos del estudio son similares entre sí y de que el estudio tiene una alta validez intern La estadística inferencial se utiliza para sacar conclusiones sobre una población diana a partir de la población de la muestra, pero solo si el estudio tiene una alta validez interna y externa, lo que significa que la población de la muestra tiene características similares a la población diana.
En la estadística inferencial, las hipótesis nula y alternativa se evalúan en función de un valor de p establecido, mientras que la significación clínica se determina en función de cómo evalúa una persona la relación entre dos variables.