En estadística , la clasificación es la transformación de datos en la que los valores numéricos u ordinales se reemplazan por su rango cuando los datos se ordenan.
Por ejemplo, las posiciones de los datos numéricos 3.4, 5.1, 2.6, 7.3 son 2, 3, 1, 4.
Como otro ejemplo, los datos ordinales caliente, frío, tibio se reemplazarían por 3, 1, 2. En estos ejemplos, los rangos se asignan a los valores en orden ascendente, aunque también se pueden usar rangos descendentes.
Las clasificaciones están relacionadas con la lista indexada de estadísticas de orden , que consiste en el conjunto de datos original reordenado en orden ascendente.
Utilizar para pruebas
Algunos tipos de pruebas estadísticas emplean cálculos basados en rangos. Algunos ejemplos son:
- Prueba de Friedman
- Prueba de Kruskal-Wallis
- Clasificar productos
- Coeficiente de correlación de rangos de Spearman
- Prueba U de Mann-Whitney
- Prueba de rangos con signo de Wilcoxon
- Prueba de Van der Waerden
La distribución de valores en orden descendente de rango suele ser de interés cuando los valores varían ampliamente en escala; esta es la distribución rango-tamaño (o distribución rango-frecuencia), por ejemplo, para tamaños de ciudades o frecuencias de palabras. Estas suelen seguir una ley de potencias .
Algunos rangos pueden tener valores no enteros para datos empatados. Por ejemplo, cuando hay un número par de copias del mismo valor, el rango estadístico fraccional de los datos empatados termina en ½. El rango percentil es otro tipo de clasificación estadística.
Cálculo
Microsoft Excel proporciona dos funciones de clasificación: la función Rank.EQ , que asigna rangos de competencia en caso de empate, y la función Rank.AVG , que asigna rangos fraccionarios a los empates. Por ejemplo, si los datos que se están clasificando son ("5, 7, 7, 10"), Rank.EQ devolvería ("1, 2, 2, 4"), mientras que Rank.AVG devolvería ("1, 2.5, 2.5, 4"). Tenga en cuenta que Rank.AVG conserva las sumas de rangos en caso de empate, mientras que Rank.EQ no. Esto hace que esta última no sea deseable en muchas aplicaciones estadísticas. Las funciones tienen el argumento de orden , [ 1 ] que por defecto está configurado en descendente , es decir, el número más grande tendrá un rango 1. Esto generalmente no es común en estadística, donde la clasificación suele ser en orden ascendente, donde el número más pequeño tiene un rango 1.
Comparación de clasificaciones
Una correlación de rangos puede utilizarse para comparar dos clasificaciones del mismo conjunto de objetos. Por ejemplo, el coeficiente de correlación de rangos de Spearman es útil para medir la dependencia estadística entre las clasificaciones de atletas en dos torneos. El coeficiente de correlación de rangos de Kendall es otro enfoque. Alternativamente, los enfoques basados en intersección/superposición ofrecen mayor flexibilidad. Un ejemplo es el enfoque de "superposición hipergeométrica de rango-rango" [ 2 ] , diseñado para comparar la clasificación de los genes que se encuentran en la parte superior de dos listas ordenadas de genes diferencialmente expresados. Un enfoque similar se utiliza en la "superposición sesgada de rango (RBO)" [ 3 ] , que también implementa una probabilidad ajustable, p, para personalizar el peso asignado a una profundidad de clasificación deseada. Estos enfoques tienen las ventajas de abordar conjuntos disjuntos , conjuntos de diferentes tamaños y ponderación superior (teniendo en cuenta la posición absoluta de la clasificación, que puede ignorarse en los enfoques estándar de correlación de rangos no ponderados).
Definición
Dejarsea un conjunto de variables aleatorias. Al ordenarlas, hemos definido sus estadísticas de orden [ 4 ].
Si todos los valores son únicos, el rango de la variable númeroes la solución únicaa la ecuación. En presencia de empates, podemos utilizar un rango medio (correspondiente al "rango fraccional" mencionado anteriormente), definido como el promedio de todos los índices.de tal manera que, o la clasificación superior (correspondiente a la "clasificación de competencia modificada" ) definida por.
Referencias
- ↑ "Ayuda sobre RANK.AVG de Excel" . Soporte de Office . Microsoft . Consultado el 21 de enero de 2021 .
- ↑ Plaisier, Seema B.; Taschereau, Richard; Wong, Justin A.; Graeber, Thomas G. (septiembre de 2010). " Superposición hipergeométrica de rango a rango: identificación de superposición estadísticamente significativa entre firmas de expresión génica" . Nucleic Acids Research . 38 (17): e169. doi : 10.1093/nar/gkq636 . PMC 2943622. PMID 20660011 .
- ↑ Webber, William; Moffat, Alistair; Zobel, Justin (noviembre de 2010). "Una medida de similitud para clasificaciones indefinidas". ACM Transactions on Information Systems . 28 (4): 1– 38. doi : 10.1145/1852102.1852106 . S2CID 16050561 .
- ^ Vaart, AW van der (1998). Estadísticas asintóticas . Cambridge, Reino Unido: Cambridge University Press. ISBN 9780521784504.
- estadística no paramétrica