Articulo de referencia

Clasificación (estadísticas)

En estadística , la clasificación es la transformación de datos en la que los valores numéricos u ordinales se reemplazan por su rango cuando los datos se ordenan. Por ejemplo, ...

En estadística , la clasificación es la transformación de datos en la que los valores numéricos u ordinales se reemplazan por su rango cuando los datos se ordenan.

Por ejemplo, las posiciones de los datos numéricos 3.4, 5.1, 2.6, 7.3 son 2, 3, 1, 4.

Como otro ejemplo, los datos ordinales caliente, frío, tibio se reemplazarían por 3, 1, 2. En estos ejemplos, los rangos se asignan a los valores en orden ascendente, aunque también se pueden usar rangos descendentes.

Las clasificaciones están relacionadas con la lista indexada de estadísticas de orden , que consiste en el conjunto de datos original reordenado en orden ascendente.

Utilizar para pruebas

Algunos tipos de pruebas estadísticas emplean cálculos basados ​​en rangos. Algunos ejemplos son:

La distribución de valores en orden descendente de rango suele ser de interés cuando los valores varían ampliamente en escala; esta es la distribución rango-tamaño (o distribución rango-frecuencia), por ejemplo, para tamaños de ciudades o frecuencias de palabras. Estas suelen seguir una ley de potencias .

Algunos rangos pueden tener valores no enteros para datos empatados. Por ejemplo, cuando hay un número par de copias del mismo valor, el rango estadístico fraccional de los datos empatados termina en ½. El rango percentil es otro tipo de clasificación estadística.

Cálculo

Microsoft Excel proporciona dos funciones de clasificación: la función Rank.EQ , que asigna rangos de competencia en caso de empate, y la función Rank.AVG , que asigna rangos fraccionarios a los empates. Por ejemplo, si los datos que se están clasificando son ("5, 7, 7, 10"), Rank.EQ devolvería ("1, 2, 2, 4"), mientras que Rank.AVG devolvería ("1, 2.5, 2.5, 4"). Tenga en cuenta que Rank.AVG conserva las sumas de rangos en caso de empate, mientras que Rank.EQ no. Esto hace que esta última no sea deseable en muchas aplicaciones estadísticas. Las funciones tienen el argumento de orden , [ 1 ] que por defecto está configurado en descendente , es decir, el número más grande tendrá un rango 1. Esto generalmente no es común en estadística, donde la clasificación suele ser en orden ascendente, donde el número más pequeño tiene un rango 1.

Comparación de clasificaciones

Una correlación de rangos puede utilizarse para comparar dos clasificaciones del mismo conjunto de objetos. Por ejemplo, el coeficiente de correlación de rangos de Spearman es útil para medir la dependencia estadística entre las clasificaciones de atletas en dos torneos. El coeficiente de correlación de rangos de Kendall es otro enfoque. Alternativamente, los enfoques basados ​​en intersección/superposición ofrecen mayor flexibilidad. Un ejemplo es el enfoque de "superposición hipergeométrica de rango-rango" [ 2 ] , diseñado para comparar la clasificación de los genes que se encuentran en la parte superior de dos listas ordenadas de genes diferencialmente expresados. Un enfoque similar se utiliza en la "superposición sesgada de rango (RBO)" [ 3 ] , que también implementa una probabilidad ajustable, p, para personalizar el peso asignado a una profundidad de clasificación deseada. Estos enfoques tienen las ventajas de abordar conjuntos disjuntos , conjuntos de diferentes tamaños y ponderación superior (teniendo en cuenta la posición absoluta de la clasificación, que puede ignorarse en los enfoques estándar de correlación de rangos no ponderados).

Definición

Dejarincógnita1,..incógnitanorte{\displaystyle X_{1},..X_{n}}sea ​​un conjunto de variables aleatorias. Al ordenarlas, hemos definido sus estadísticas de orden [ 4 ].

incógnitanorte,(1)...incógnitanorte,(norte){\displaystyle X_{n,(1)}\leq ...\leq X_{n,(n)}}

Si todos los valores son únicos, el rango de la variable númeroi{\displaystyle i}es la solución únicaRnorte,i{\displaystyle R_{n,i}}a la ecuaciónincógnitai=incógnitanorte,(Rnorte,i){\displaystyle X_{i}=X_{N,(R_{n,i})}}. En presencia de empates, podemos utilizar un rango medio (correspondiente al "rango fraccional" mencionado anteriormente), definido como el promedio de todos los índices.i{\displaystyle i}de tal manera queincógnitaj=incógnitanorte,(Rnorte,j){\displaystyle X_{j}=X_{N,(R_{n,j})}}, o la clasificación superior (correspondiente a la "clasificación de competencia modificada" ) definida porj=1norte1{incógnitajincógnitai}{\displaystyle \sum _{j=1}^{n}1\{X_{j}\leq X_{i}\}}.

Referencias

  1. "Ayuda sobre RANK.AVG de Excel" . Soporte de Office . Microsoft . Consultado el 21 de enero de 2021 .
  2. Plaisier, Seema B.; Taschereau, Richard; Wong, Justin A.; Graeber, Thomas G. (septiembre de 2010). " Superposición hipergeométrica de rango a rango: identificación de superposición estadísticamente significativa entre firmas de expresión génica" . Nucleic Acids Research . 38 (17): e169. doi : 10.1093/nar/gkq636 . PMC 2943622. PMID 20660011 .  
  3. Webber, William; Moffat, Alistair; Zobel, Justin (noviembre de 2010). "Una medida de similitud para clasificaciones indefinidas". ACM Transactions on Information Systems . 28 (4): 1– 38. doi : 10.1145/1852102.1852106 . S2CID 16050561 . 
  4. ^ Vaart, AW van der (1998). Estadísticas asintóticas . Cambridge, Reino Unido: Cambridge University Press. ISBN 9780521784504.
Obtenido de " https://en.wikipedia.org/w/index.php?title=Ranking_(statistics)&oldid=1348309125 "