Definitions & Key takeaways

Categorical data includes nominal data in which the order does not matter, such as the hair color of a certain population and ordinal data in which the order is important, such as estimating the degree of pain on a scale from one to ten. Numeric data includes interval data, such as the temperature and ratio data, such as the length of a particular group of students. Numeric data can be continuous, i.e., with intermediary values or discrete, i.e., without intermediary values.
Los datos son como un conjunto de hechos que se miden y registran, y luego se resumen para ayudarnos a sacar conclusiones.Los datos pueden ser cuantitativos o en números, como la edad de una persona, medida en número de años que lleva viva, o pueden ser cualitativos, que no son numéricos, como el grupo sanguíneo de alguien {A, B, AB o 0}.Así, los datos se clasifican en dos grandes grupos: datos cuantitativos o numéricos y datos cualitativos o categóricos.Empecemos con los datos categóricos, que implican la asignación de sujetos a una categoría, es decir, "rojo" frente a "azul" o "alto" frente a "bajo".Los datos categóricos pueden desglosarse a su vez en datos nominales y ordinales.Los datos nominales se basan en categorías que no pueden ordenarse lógicamente.Por ejemplo, los tipos de sangre (A, B, AB y 0) son datos nominales; no hay un orden o magnitud lógica en el tipo de sangre.A no es más alto que AB, y 0 no es menos que B, simplemente son diferentes, como las manzanas y las naranjas.Ahora se podría decir que la sangre del tipo AB tiene más antígenos que la del tipo 0 o que las manzanas son más firmes que las naranjas, pero entonces estamos analizando datos diferentes: el número de antígenos y la firmeza, y no simplemente el tipo de sangre o de fruta.Otros atributos como el sexo, el tipo de religión o el origen étnico son ejemplos de datos nominales.Estos atributos se miden en categorías, en lugar de números.Por lo tanto, no tienen ninguna magnitud; por eso, cuando se resumen los datos nominales, hay que utilizar proporciones.Por ejemplo, tomemos un grupo de 20 compañeros de clase: 10 son del tipo de sangre A, 5 del tipo de sangre B y 5 del tipo de sangre 0.Se puede decir que el 50% son del tipo A, el 25% del tipo B y el 25% del tipo 0.Y aunque no se puede calcular la media o la mediana, se puede identificar la "moda", que es el valor que aparece con más frecuencia en estos datos: Sangre de tipo A.Los datos ordinales también se miden en categorías, pero a diferencia de los datos nominales, los datos ordinales vienen con un orden lógico adjunto.Por ejemplo, digamos que quiere medir la felicidad y envía a 100 personas una encuesta que pregunta: "¿Cómo de feliz es?"
Pueden responder a 1 de las 4 opciones de respuesta: "1.Triste", "2.No estoy contento" "3.Normal" y "4.Genial".A diferencia del ejemplo del grupo sanguíneo, aquí hay un claro orden lógico.En los datos ordinales, las categorías se clasifican como superiores o inferiores entre sí.Al pasar de la categoría 1 a la 4, la felicidad aumenta.Y como hay un orden en los datos, se puede calcular la "mediana", que es el valor más intermedio de un conjunto de datos ordenado de mayor a menor, y la "moda", pero no la "media", ya que no podemos establecer claramente si la diferencia entre la categoría 1 y la categoría 2 es cuantitativamente la misma que la diferencia entre la categoría 3 y la categoría 4.Un posible problema de los datos ordinales es que a veces pueden simplificar en exceso las relaciones entre categorías.El salto de la categoría 1 a la 2 puede ser muy pequeño, mientras que el salto de la categoría 3 a la 4 puede ser bastante grande.Los datos ordinales son ciegos a este matiz, y tratan las diferencias de las categorías como si fueran todas iguales.En medicina, la gravedad de las enfermedades suele registrarse como datos ordinales.Por ejemplo, la nefropatía crónica se clasifica en 5 etapas {Etapa 1, Etapa 2, Etapa 3, Etapa 4 y Etapa 5}.A medida que aumenta el estadio, la función renal empeora, y el estadio 5 significa que casi no queda función renal y requiere diálisis.Aquí, la diferencia entre la nefropatía en estadio 1 y 2 es mucho menor que la diferencia entre la enfermedad en estadio 4 y 5.Por eso no podemos calcular la "media" en el caso de un dato ordinal.Pasemos a los datos numéricos, que pueden ser datos discretos o continuos.Los datos discretos se miden en números enteros, lo que significa que no pueden tener valores decimales.Por ejemplo, si se mide el número de hijos de una familia, sólo se registrarán valores enteros "discretos" como {1, 3, 4 o 10} porque no se pueden tener fracciones de hijos.En cambio, los datos continuos, como la altura y el peso, pueden tomar cualquier valor, incluso con decimales.Por ejemplo, una báscula de alta tecnología puede indicar un peso de 70,42459310 kg.Los datos numéricos también pueden dividirse en datos de intervalo o datos de relación.Los datos de intervalo indican una diferencia cuantitativa significativa entre dos valores y que todos los valores pueden colocarse en un orden claro y lógico.Por ejemplo, si mide las temperaturas con una escala centígrada o Fahrenheit, obtendrá datos de intervalo.La diferencia entre 90 y 60 grados es de 30 grados medibles, al igual que la diferencia entre 60 y 30 grados.Así, podemos sumar y restar los valores de los datos de forma significativa.Porque los datos de intervalo son numéricos, están ordenados y hay diferencias significativas entre los valores: podemos calcular las medias, las medianas y las modas.Pero no podemos calcular relaciones con datos de intervalo.Por ejemplo, afirmar que 90 grados F es 3 veces más caliente que 30 grados F (90 = 3 x 30) es inexacto.Esto se debe a que los datos tienen que medirse en una escala que incluya un valor absoluto para el 0 con el fin de hacer declaraciones relacionales que impliquen la multiplicación o la división.Los datos de temperatura, medidos en Celsius o Fahrenheit, no tienen un valor significativo para el 0, eso es porque 0 grados F o C no implica que no haya temperatura.A diferencia de los datos de intervalo, los datos de relación tienen un 0 significativo.Por lo tanto, podemos calcular las relaciones mediante la multiplicación y la división, además de cuantificar las diferencias mediante la suma y la resta.Al igual que con los datos de intervalo, podemos calcular la media, la mediana y la moda utilizando datos de relación.Atributos como la edad, la estatura, el peso y las puntuaciones en los exámenes son datos de relación muy comúnmente medidos.Supongamos que tiene datos sobre las puntuaciones de los exámenes de 4 estudiantes y los valores son {20 40 70 80}.Se puede afirmar que "80 es 10 puntos más alto que 70", y como se tienen datos de relación, también se puede afirmar que el estudiante con 40 lo hizo el doble de bien que alguien con 20, y la mitad de bien que alguien con 80.##Resumen Como breve resumen...Los datos se clasifican a grandes rasgos en datos categóricos y numéricos.Los datos categóricos incluyen datos nominales, que no tienen un orden lógico, como los tipos de sangre, y datos ordinales en los que el orden es importante, como los grados de felicidad.Los datos numéricos incluyen datos de intervalo en los que no hay un cero significativo, como en el caso de la temperatura, y datos de relación que sí tienen un cero significativo, como en las puntuaciones de los exámenes.Los datos numéricos también pueden ser continuos con valores decimales o discretos sin valores decimales.