Articulo de referencia

Correlación de rangos

En estadística , la correlación de rangos es una estadística que mide la asociación ordinal : la relación entre clasificaciones de diferentes variables ordinales o diferentes cl...

En estadística , la correlación de rangos es una estadística que mide la asociación ordinal : la relación entre clasificaciones de diferentes variables ordinales o diferentes clasificaciones de la misma variable, donde una "clasificación" es la asignación de las etiquetas de ordenación "primero", "segundo", "tercero", etc., a diferentes observaciones de una variable en particular. El coeficiente de correlación de rangos mide el grado de similitud entre dos clasificaciones y puede utilizarse para evaluar la significancia de la relación entre ellas. Por ejemplo, dos métodos no paramétricos comunes de significancia que utilizan la correlación de rangos son la prueba U de Mann-Whitney y la prueba de rangos con signo de Wilcoxon .

Contexto

Por ejemplo, si una variable es la identidad de un programa de baloncesto universitario y otra variable es la identidad de un programa de fútbol americano universitario, se podría analizar la relación entre las clasificaciones de ambos programas: ¿tienden las universidades con un programa de baloncesto mejor clasificado a tener también un programa de fútbol americano mejor clasificado? Un coeficiente de correlación de rangos puede medir dicha relación, y la significancia de este coeficiente puede indicar si la relación observada es lo suficientemente pequeña como para ser una mera coincidencia.

Si solo existe una variable, la identidad de un programa de fútbol americano universitario, pero está sujeta a dos clasificaciones diferentes en encuestas (por ejemplo, una realizada por entrenadores y otra por periodistas deportivos), entonces la similitud de las clasificaciones de las dos encuestas diferentes se puede medir con un coeficiente de correlación de rangos.

Como otro ejemplo, en una tabla de contingencia con ingresos bajos , ingresos medios e ingresos altos en la variable de fila y nivel educativo ( sin escuela secundaria , escuela secundaria , universidad) en la variable de columna, [ 1 ] una correlación de rangos mide la relación entre ingresos y nivel educativo.

Coeficientes de correlación

Algunas de las estadísticas de correlación de rangos más populares incluyen:

  1. ρ de Spearman
  2. τ de Kendall
  3. γ de Goodman y Kruskal
  4. D de Somers

Un coeficiente de correlación de rangos creciente implica una mayor concordancia entre las clasificaciones. El coeficiente se encuentra dentro del intervalo [ 1,  1] y toma el valor:

  • 1 Si la concordancia entre las dos clasificaciones es perfecta, las dos clasificaciones son iguales.
  • 0 si las clasificaciones son completamente independientes.
  • 1 si la discrepancia entre las dos clasificaciones es perfecta; una clasificación es la inversa de la otra.

Siguiendo a Diaconis (1988) , una clasificación puede considerarse como una permutación de un conjunto de objetos. Así, podemos interpretar las clasificaciones observadas como datos obtenidos cuando el espacio muestral se identifica con un grupo simétrico . Podemos entonces introducir una métrica , transformando el grupo simétrico en un espacio métrico . Diferentes métricas corresponderán a diferentes correlaciones de rango.

Coeficiente de correlación general

Kendall 1970 [ 2 ] demostró que suτ{\displaystyle \tau }(tau) y Spearmanρ{\displaystyle \rho }(rho) son casos particulares de un coeficiente de correlación general.

Supongamos que tenemos un conjunto denorte{\displaystyle n}objetos, que se están considerando en relación con dos propiedades, representadas porincógnita{\displaystyle x}yy{\displaystyle y}, formando los conjuntos de valores{incógnitai}inorte{\displaystyle \{x_{i}\}_{i\leq n}}y{yi}inorte{\displaystyle \{y_{i}\}_{i\leq n}}. A cualquier par de individuos, digamos eli{\displaystyle i}-o y elj{\displaystyle j}-asignamos unincógnita{\displaystyle x}Puntuación -, denotada poraij{\displaystyle a_{ij}}y uny{\displaystyle y}Puntuación -, denotada porbij{\displaystyle b_{ij}}El único requisito para estas funciones es que sean antisimétricas, por lo queaij=aji{\displaystyle a_{ij}=-a_{ji}}ybij=bji{\displaystyle b_{ij}=-b_{ji}}. (Tenga en cuenta que en particularaij=bij=0{\displaystyle a_{ij}=b_{ij}=0}sii=j{\displaystyle i=j}.) Luego, el coeficiente de correlación generalizadoΓ{\displaystyle \Gamma }se define como

Γ=i,j=1norteaijbiji,j=1norteaij2i,j=1nortebij2{\displaystyle \Gamma ={\frac {\sum _ {i,j=1}^{n}a_ {ij}b_ {ij}}{\sqrt {\sum _ {i,j=1}^{n}a_ {ij}^{2}\sum _ {i,j=1}^{n}b_ {ij}^{2}}}}}

De forma equivalente, si todos los coeficientes se recopilan en matricesA=(aij){\displaystyle A=(a_{ij})}yB=(bij){\displaystyle B=(b_{ij})}, conAT=A{\displaystyle A^{\textsf {T}}=-A}yBT=B{\displaystyle B^{\textsf {T}}=-B}, entonces

Γ=A,BFAFBF{\displaystyle \Gamma ={\frac {\langle A,B\rangle _{\rm {F}}}{\|A\|_{\rm {F}}\|B\|_{\rm {F}}}}}

dóndeA,BF{\displaystyle \langle A,B\rangle _ {\rm {F}}}es el producto interno de Frobenius yAF=A,AF{\displaystyle \|A\|_{\rm {F}}={\sqrt {\langle A,A\rangle _{\rm {F}}}}}la norma de Frobenius . En particular, el coeficiente de correlación general es el coseno del ángulo entre las matrices.A{\displaystyle A}yB{\displaystyle B}.

El τ de Kendall como caso particular

Siri{\displaystyle r_{i}},si{\displaystyle s_{i}}son las filas de lai{\displaystyle i}-miembro según elincógnita{\displaystyle x}-calidad yy{\displaystyle y}-calidad respectivamente, entonces podemos definir

aij=sgn(rjri),bij=sgn(sjsi).{\displaystyle a_{ij}=\operatorname {sgn}(r_{j}-r_{i}),\quad b_{ij}=\operatorname {sgn}(s_{j}-s_{i}).}

La sumaaijbij{\displaystyle \sum a_{ij}b_{ij}}es el número de pares concordantes menos el número de pares discordantes (véase el coeficiente de correlación de rangos tau de Kendall ). La sumaaij2{\displaystyle \sum a_{ij}^{2}}es solonorte(norte1)/2{\displaystyle n(n-1)/2}, el número de términosaij{\displaystyle a_{ij}}, tal como estábij2{\displaystyle \sum b_{ij}^{2}}. Por lo tanto, en este caso,

Γ=2((número de pares concordantes)(número de pares discordantes))norte(norte1)=De Kendall τ{\displaystyle \Gamma ={\frac {2\,(({\text{número de pares concordantes}})-({\text{número de pares discordantes}}))}{n(n-1)}}={\text{Tau de Kendall }} }

El coeficiente ρ de Spearman como caso particular

Siri{\displaystyle r_{i}},si{\displaystyle s_{i}}son las filas de lai{\displaystyle i}-miembro según elincógnita{\displaystyle x}y ely{\displaystyle y}-calidad respectivamente, podemos considerar las matricesa,bMETRO(norte×norte;R){\displaystyle a,b\in M(n\times n;\mathbb {R} )}definido por

aij:=rjri{\displaystyle a_{ij}:=r_{j}-r_{i}}
bij:=sjsi{\displaystyle b_{ij}:=s_{j}-s_{i}}

Las sumasaij2{\displaystyle \sum a_{ij}^{2}}ybij2{\displaystyle \sum b_{ij}^{2}}son iguales, ya que ambosri{\displaystyle r_{i}}ysi{\displaystyle s_{i}}abarca desde1{\displaystyle 1}anorte{\displaystyle n}. Por eso

Γ=(rjri)(sjsi)(rjri)2{\displaystyle \Gamma ={\frac {\sum (r_{j}-r_{i})(s_{j}-s_{i})}{\sum (r_{j}-r_{i})^{2}}}}

Para simplificar esta expresión, dejemosdi:=risi{\displaystyle d_{i}:=r_{i}-s_{i}}denotan la diferencia en los rangos para cada unoi{\displaystyle i}. Además, dejemosU{\displaystyle U}sea ​​una variable aleatoria discreta uniformemente distribuida en{1,2,,norte}{\displaystyle \{1,2,\ldots ,n\}}. Desde los rangosr,s{\displaystyle r,s}son simplemente permutaciones de1,2,,norte{\displaystyle 1,2,\ldots ,n}, podemos ver ambas como variables aleatorias distribuidas comoU{\displaystyle U}. Utilizando resultados básicos de sumatoria de matemáticas discretas, es fácil ver que para la variable aleatoria uniformemente distribuida,U{\displaystyle U}, tenemos mi[U]=norte+12{\displaystyle \mathbb {E} [U]=\textstyle {\frac {n+1}{2}}} y mi[U2]=(norte+1)(2norte+1)6{\displaystyle \mathbb {E} [U^{2}]=\textstyle {\frac {(n+1)(2n+1)}{6}}} y por lo tanto Var(U)=(norte+1)(2norte+1)6(norte+1)(norte+1)4=norte2112{\displaystyle \mathrm {Var} (U)=\textstyle {\frac {(n+1)(2n+1)}{6}}-\textstyle {\frac {(n+1)(n+1)}{4}}=\textstyle {\frac {n^{2}-1}{12}}}Ahora, observar las simetrías nos permite calcular las partes deΓ{\displaystyle \Gamma } como sigue:

1norte2i,j=1norte(rjri)(sjsi)=2(1norte2nortei=1norterisi(1nortei=1norteri)(1nortej=1nortesj))=1nortei=1norte(ri2+si2di2)2(mi[U])2=1nortei=1norteri2+1nortei=1nortesi21nortei=1nortedi22(mi[U])2=2(mi[U2](mi[U])2)1nortei=1nortedi2{\displaystyle {\begin{aligned}{\frac {1}{n^{2}}}\sum _{i,j=1}^{n}(r_{j}-r_{i})(s_{j}-s_{i})&=2\left({\frac {1}{n^{2}}}\cdot n\sum _{i=1}^{n}r_{i}s_{i}-\left({\frac {1}{n}}\sum _{i=1}^{n}r_{i}\right)\left({\frac {1}{n}}\sum _{j=1}^{n}s_{j}\right)\right)\\&={\frac {1}{n}}\sum _{i=1}^{n}(r_{i}^{2}+s_{i}^{2}-d_{i}^{2})-2\left(\mathbb {E} [U]\right)^{2}\\&={\frac {1}{n}}\sum _{i=1}^{n}r_{i}^{2}+{\frac {1}{n}}\sum _{i=1}^{n}s_{i}^{2}-{\frac {1}{n}}\sum _{i=1}^{n}d_{i}^{2}-2\left(\mathbb {E} [U]\right)^{2}\\&=2\left(\mathbb {E} [U^{2}]-(\mathbb {E} [U])^{2}\right)-{\frac {1}{n}}\sum _{i=1}^{n}d_{i}^{2}\\\end{aligned}}}

y

1norte2i,j=1norte(rjri)2=1norte2nortei,j=1norte(ri2+rj22rirj)=21nortei=1norteri22(1nortei=1norteri)(1nortej=1norterj)=2(mi[U2](mi[U])2){\displaystyle {\begin{aligned}{\frac {1}{n^{2}}}\sum _{i,j=1}^{n}(r_{j}-r_{i})^{2}&={\frac {1}{n^{2}}}\cdot n\sum _{i,j=1}^{n}(r_{i}^{2}+r_{j}^{2}-2r_{i}r_{j})\\&=2{\frac {1}{n}}\sum _{i=1}^{n}r_{i}^{2}-2\left({\frac {1}{n}}\sum _{i=1}^{n}r_{i}\right)\left({\frac {1}{n}}\sum _{j=1}^{n}r_{j}\right)\\&=2(\mathbb {E} [U^{2}]-(\mathbb {E} [U])^{2})\\\end{aligned}}}

Por eso

Γ=1i=1nortedi22norteVar(U)=16i=1nortedi2norte(norte21){\displaystyle \Gamma =1-{\frac {\sum _{i=1}^{n}d_{i}^{2}}{2n\mathrm {Var} (U)}}=1-{\frac {6\sum _{i=1}^{n}d_{i}^{2}}{n(n^{2}-1)}}}

dóndedi=risi{\displaystyle d_{i}=r_{i}-s_{i}}es la diferencia entre rangos, que es exactamente el coeficiente de correlación de rangos de Spearmanρ{\displaystyle \rho }.

correlación biserial de rangos

Gene Glass (1965) señaló que el rango biserial puede derivarse del de Spearman.ρ{\displaystyle \rho }"Se puede derivar un coeficiente definido en X , la variable dicotómica, e Y , la variable de clasificación, que estima el coeficiente rho de Spearman entre X e Y de la misma manera que el coeficiente r biserial estima el coeficiente r de Pearson entre dos variables normales" (p.  91). La correlación biserial de rangos había sido introducida nueve años antes por Edward Cureton (1956) como una medida de correlación de rangos cuando los rangos están en dos grupos. [ 3 ]

Fórmula de diferencias simples de Kerby

Dave Kerby (2014) recomendó la correlación biserial de rangos como medida para introducir a los estudiantes a la correlación de rangos, ya que su lógica general puede explicarse a nivel introductorio. La correlación biserial de rangos se utiliza con la prueba U de Mann-Whitney , un método comúnmente estudiado en cursos universitarios introductorios de estadística. Los datos para esta prueba constan de dos grupos; y para cada miembro de los grupos, el resultado se clasifica para el estudio en su conjunto.

Kerby demostró que esta correlación de rangos puede expresarse en términos de dos conceptos: el porcentaje de datos que respaldan una hipótesis planteada y el porcentaje de datos que no la respaldan. La fórmula de diferencia simple de Kerby establece que la correlación de rangos puede expresarse como la diferencia entre la proporción de evidencia favorable ( f ) menos la proporción de evidencia desfavorable ( u ).

r=F{\displaystyle r=f-u}

Ejemplo e interpretación

Para ilustrar el cálculo, supongamos que un entrenador prepara a corredores de larga distancia durante un mes utilizando dos métodos. El Grupo A tiene 5 corredores y el Grupo B tiene 4. La hipótesis planteada es que el método A produce corredores más rápidos. La prueba para evaluar los resultados revela que los corredores del Grupo A efectivamente corren más rápido, con los siguientes puestos: 1, 2, 3, 4 y 6. Los corredores más lentos del Grupo B, por lo tanto, obtienen los puestos 5, 7, 8 y 9.

El análisis se realiza en pares, definidos como un miembro de un grupo comparado con un miembro del otro grupo. Por ejemplo, el corredor más rápido del estudio es miembro de cuatro pares: (1,5), (1,7), (1,8) y (1,9). Estos cuatro pares respaldan la hipótesis, ya que en cada par el corredor del Grupo A es más rápido que el corredor del Grupo B. Hay un total de 20 pares, y 19 pares respaldan la hipótesis. El único par que no la respalda son los dos corredores con rangos 5 y 6, porque en este par, el corredor del Grupo B tuvo el mejor tiempo. Según la fórmula de diferencia simple de Kerby, el 95% de los datos respaldan la hipótesis (19 de 20 pares) y el 5% no la respaldan (1 de 20 pares), por lo que la correlación de rangos es r = 0,95 0,05 = 0,90.

El valor máximo de la correlación es r = 1, lo que significa que el 100% de los pares respaldan la hipótesis. Una correlación de r = 0 indica que la mitad de los pares la respaldan y la otra mitad no; en otras palabras, los grupos de muestra no difieren en rangos, por lo que no hay evidencia de que provengan de dos poblaciones diferentes. Un tamaño del efecto de r = 0 indica que no existe relación entre la pertenencia al grupo y los rangos de sus miembros.

En su artículo «Mejorando la presentación de informes estadísticos en psicología», Anna-Lena Schubert y sus colegas (2025) establecieron directrices para la presentación de informes estadísticos, basándose en recomendaciones establecidas y prácticas recomendadas emergentes. En la Tabla 5, ofrecieron una visión general de los tamaños del efecto para los modelos estadísticos de uso común. En esta tabla, citaron el artículo de Kerby (2014) como un recurso clave para la aplicación e interpretación de la correlación biserial de rangos.

Referencias

  1. Kruskal, William H. (1958). "Medidas ordinales de asociación". Journal of the American Statistical Association . 53 (284): 814– 861. doi : 10.2307/2281954 . JSTOR 2281954 . 
  2. Kendall, Maurice G (1970). Métodos de correlación de rangos (4.ª ed.). Griffin. ISBN  978-0-85264-199-6.
  3. Zar, Jerrold H. (2005). "Correlación de rangos de Spearman" . Enciclopedia de Bioestadística . John Wiley & Sons, Ltd. doi : 10.1002/0470011815.b2a15150 . ISBN 978-0-470-84907-1.

Lecturas adicionales

  • Cureton, Edward E. (1956). "Correlación biserial de rangos". Psychometrika . 21 (3): 287– 290. doi : 10.1007/BF02289138 . S2CID 122500836 . 
  • Everitt, BS (2002), The Cambridge Dictionary of Statistics , Cambridge: Cambridge University Press, ISBN 0-521-81099-X
  • Diaconis, P. (1988), Representaciones de grupos en probabilidad y estadística , Serie de monografías de notas de clase, Hayward, CA: Instituto de Estadística Matemática, ISBN 0-940600-14-5
  • Glass, Gene V. (1965). "Una variable de clasificación análoga a la correlación biserial: implicaciones para el análisis de ítems abreviado". Journal of Educational Measurement . 2 (1): 91– 95. doi : 10.1111/j.1745-3984.1965.tb00396.x .
  • Kendall, MG (1970), Métodos de correlación de rangos , Londres: Griffin, ISBN 0-85264-199-0
  • Kerby, Dave S. (2014). "La fórmula de la diferencia simple: un enfoque para enseñar correlación no paramétrica" . Psicología integral . 3 (1) 11.IT.3.1. doi : 10.2466/11.IT.3.1 .
  • Schubert, AL; Steinhilber, M.; Kang, H.; Quintana, DS (2025). "Mejora de la presentación de informes estadísticos en psicología" . Communications Psychology . 3 (1) 156. doi : 10.1038/s44271-025-00356-w . PMC 12618885. PMID 41238797 .  
  • Breve guía del psicólogo experimental Karl L. Weunsch : Tamaños del efecto no paramétricos (Copyright 2015 por Karl L. Weunsch)