En estadística y teoría de la probabilidad , la correlación de distancia es una medida de dependencia entre dos vectores aleatorios emparejados de dimensión arbitraria, no necesariamente igual . El coeficiente de correlación de distancia poblacional es cero si y solo si los vectores aleatorios son independientes . Por lo tanto, la correlación de distancia mide tanto la asociación lineal como la no lineal entre dos variables o vectores aleatorios. Esto contrasta con la correlación de Pearson , que solo puede detectar la asociación lineal entre dos variables aleatorias .
La correlación de distancias se puede utilizar para realizar una prueba estadística de dependencia mediante una prueba de permutación . Primero se calcula la correlación de distancias (que implica el recentrado de matrices de distancias euclidianas) entre dos vectores aleatorios, y luego se compara este valor con las correlaciones de distancias de varias permutaciones de los datos.

Fondo
La medida clásica de dependencia, el coeficiente de correlación de Pearson , [ 1 ] es principalmente sensible a una relación lineal entre dos variables. La correlación de distancia fue introducida en 2005 por Gábor J. Székely en varias conferencias para abordar esta deficiencia de la correlación de Pearson , a saber, que puede ser fácilmente cero para variables dependientes . Correlación = 0 (no correlacionada) no implica independencia mientras que correlación de distancia = 0 sí implica independencia. Los primeros resultados sobre correlación de distancia se publicaron en 2007 y 2009. [ 2 ] [ 3 ] Se demostró que la covarianza de distancia es la misma que la covarianza browniana. [ 3 ] Estas medidas son ejemplos de distancias de energía .
La correlación de distancia se deriva de varias cantidades que se utilizan en su especificación, específicamente: varianza de distancia , desviación estándar de distancia y covarianza de distancia . Estas cantidades desempeñan las mismas funciones que los momentos ordinarios con nombres correspondientes en la especificación del coeficiente de correlación producto-momento de Pearson .
Definiciones
covarianza de distancia
Comencemos con la definición de la covarianza de distancia muestral . Sea ( X k , Y k ), k = 1, 2, ..., n una muestra estadística de un par de variables aleatorias de valor real o vectorial ( X , Y ). Primero, calcule las matrices de distancia n x n ( a j , k ) y ( b j , k ) que contienen todas las distancias por pares.
donde || ⋅ || denota la norma euclidiana . Luego, tome todas las distancias doblemente centradas.
dóndees la media de la j -ésima fila,es la media de la k -ésima columna, yes la media general de la matriz de distancias de la muestra X. La notación es similar para los valores b . (En las matrices de distancias centradas ( A j , k ) y ( B j , k ), todas las filas y todas las columnas suman cero). La covarianza de distancia de muestra al cuadrado (un escalar) es simplemente el promedio aritmético de los productos A j , k B j , k :
El estadístico T n = n dCov 2 n ( X , Y ) determina una prueba multivariante consistente de independencia de vectores aleatorios en dimensiones arbitrarias. Para una implementación, consulte la función dcov.test en el paquete energy para R. [ 4 ]
El valor poblacional de la covarianza de distancia se puede definir de forma similar. Sea X una variable aleatoria que toma valores en un espacio euclidiano p -dimensional con distribución de probabilidad μ y sea Y una variable aleatoria que toma valores en un espacio euclidiano q -dimensional con distribución de probabilidad ν , y supongamos que X e Y tienen esperanzas finitas. Escriba
Finalmente, definimos el valor poblacional de la covarianza de distancia al cuadrado de X e Y como
Se puede demostrar que esto es equivalente a la siguiente definición:
donde E denota el valor esperado yyson independientes e idénticamente distribuidas. Las variables aleatorias primadasydenotan copias independientes e idénticamente distribuidas (iid) de las variablesy y son igualmente i.i.d. [ 5 ] La covarianza de distancia se puede expresar en términos de la covarianza de Pearson clásica , cov , de la siguiente manera:
Esta identidad muestra que la covarianza de distancias no es la misma que la covarianza de distancias, cov( ‖ X − X' ‖ , ‖ Y − Y' ‖ ). Esta puede ser cero incluso si X e Y no son independientes. [ 6 ]
Alternativamente, la covarianza de distancia puede definirse como la norma L2 ponderada de la distancia entre la función característica conjunta de las variables aleatorias y el producto de sus funciones características marginales: [ 7 ]
dónde,, yson las funciones características de ( X , Y ), X y Y , respectivamente, p , q denotan la dimensión euclidiana de X e Y , y por lo tanto de s y t , y c p , c q son constantes. La función de pesose elige para producir una medida equivariante de escala e invariante de rotación que no tiende a cero para variables dependientes. [ 7 ] [ 8 ] Una interpretación de la definición de la función característica es que las variables e isX y e itY son representaciones cíclicas de X e Y con diferentes períodos dados por s y t , y la expresión ϕ X , Y ( s , t ) − ϕ X ( s ) ϕ Y ( t ) en el numerador de la definición de la función característica de la covarianza de distancia es simplemente la covarianza clásica de e isX y e itY . La definición de la función característica muestra claramente que dCov 2 ( X , Y ) = 0 si y solo si X e Y son independientes.
Varianza de la distancia y desviación estándar de la distancia
La varianza de la distancia es un caso especial de covarianza de la distancia cuando las dos variables son idénticas. El valor poblacional de la varianza de la distancia es la raíz cuadrada de
dónde,, yson variables aleatorias independientes e idénticamente distribuidas ,denota el valor esperado ypara función, p.ej,.
La varianza de la distancia de muestra es la raíz cuadrada de
que es un pariente de la diferencia media de Gini de Corrado introducida en 1912 (pero Gini no trabajó con distancias centradas). [ 9 ]
La desviación estándar de la distancia es la raíz cuadrada de la varianza de la distancia .
Correlación de distancia
La correlación de distancia [ 2 ] [ 3 ] de dos variables aleatorias se obtiene dividiendo su covarianza de distancia por el producto de sus desviaciones estándar de distancia . La correlación de distancia es la raíz cuadrada de
y la correlación de distancia de la muestra se define sustituyendo la covarianza de distancia de la muestra y las varianzas de distancia por los coeficientes poblacionales anteriores.
Para un cálculo sencillo de la correlación de distancia de muestra, consulte la función dcor en el paquete energy para R. [ 4 ]
Propiedades
Correlación de distancia
- yEsto contrasta con la correlación de Pearson, que puede ser negativa.
- si y solo si X e Y son independientes.
- implica que las dimensiones de los subespacios lineales generados por las muestras X e Y respectivamente son casi seguramente iguales y si asumimos que estos subespacios son iguales, entonces en este subespaciopara algún vector A , escalar b y matriz ortonormal.
covarianza de distancia
- y;
- para todos los vectores constantesescalaresy matrices ortonormales.
- Si los vectores aleatoriosyson independientes entonces
- si y solo si X e Y son independientes.
Esta última propiedad es el efecto más importante de trabajar con distancias centradas.
La estadísticaes un estimador sesgado de. Bajo independencia de X e Y [ 10 ]
Un estimador insesgado deEstá a cargo de Székely y Rizzo. [ 11 ]
Variación de distancia
- si y solo sicasi con seguridad.
- si y solo si cada observación de la muestra es idéntica.
- para todos los vectores constantes A , escalares b y matrices ortonormales.
- Si X e Y son independientes entonces.
La igualdad se cumple en (iv) si y solo si una de las variables aleatorias X o Y es una constante.
Generalización
La covarianza de distancia puede generalizarse para incluir potencias de la distancia euclidiana. Definir
Entonces, por cada,yson independientes si y solo siEsta caracterización no es válida para el exponente; en este caso para bivariado,es una función determinista de la correlación de Pearson. [ 2 ] Siysonpotencias de las distancias correspondientes,, entoncesLa covarianza de la distancia de muestra se puede definir como el número no negativo para el cual
Uno puede extendera variables aleatorias con valores en el espacio métricoy: Sitiene leyen un espacio métrico con métrica, luego definir,y (siempre que)es finito, es decir,tiene un primer momento finito),. Entonces sitiene ley(en un espacio métrico posiblemente diferente con primer momento finito), definimos
Esto no es negativo para todos ellos.si y solo si ambos espacios métricos tienen tipo negativo. [ 12 ] Aquí, un espacio métricotiene tipo negativo sies isométrico a un subconjunto de un espacio de Hilbert . [ 13 ] Si ambos espacios métricos tienen tipo negativo fuerte, entoncessi y solo sison independientes. [ 12 ]
Definición alternativa de covarianza de distancia
La covarianza de distancia original se ha definido como la raíz cuadrada de, en lugar del coeficiente al cuadrado en sí. tiene la propiedad de que es la distancia de energía entre la distribución conjunta dey el producto de sus marginales. Sin embargo, bajo esta definición, la varianza de la distancia, en lugar de la desviación estándar de la distancia , se mide en las mismas unidades que ladistancias.
Alternativamente, se podría definir la covarianza de distancia como el cuadrado de la distancia de energía: En este caso, la desviación estándar de la distancia dese mide en las mismas unidades quedistancia, y existe un estimador insesgado para la covarianza de la distancia poblacional. [ 11 ]
Según estas definiciones alternativas, la correlación de distancia también se define como el cuadrado, en lugar de la raíz cuadrada.
Formulación alternativa: covarianza browniana
La covarianza browniana se basa en la generalización del concepto de covarianza a procesos estocásticos. El cuadrado de la covarianza de las variables aleatorias X e Y se puede escribir de la siguiente forma:
donde E denota el valor esperado y la prima denota copias independientes e idénticamente distribuidas. Necesitamos la siguiente generalización de esta fórmula. Si U(s) y V(t) son procesos aleatorios arbitrarios definidos para todos los números reales s y t, entonces definimos la versión centrada en U de X mediante
siempre que exista el valor esperado condicional restado y denotemos por Y V la versión centrada en V de Y. [ 3 ] [ 14 ] [ 15 ] La covarianza (U,V) de (X,Y) se define como el número no negativo cuyo cuadrado es
siempre que el lado derecho sea no negativo y finito. El ejemplo más importante es cuando U y V son movimientos brownianos independientes bilaterales / procesos de Wiener con esperanza cero y covarianza | s | + | t | − | s − t | = 2 min( s , t ) (solo para s, t no negativos). (Esto es el doble de la covarianza del proceso de Wiener estándar; aquí el factor 2 simplifica los cálculos). En este caso, la covarianza ( U , V ) se llama covarianza browniana y se denota por
Existe una sorprendente coincidencia: la covarianza browniana es la misma que la covarianza de distancia:
y por lo tanto la correlación browniana es lo mismo que la correlación de distancia.
Por otro lado, si reemplazamos el movimiento browniano con la función identidad determinista id, entonces Cov id ( X , Y ) es simplemente el valor absoluto de la covarianza de Pearson clásica ,
Métricas relacionadas
Otras métricas de correlación, incluidas las métricas de correlación basadas en núcleos (como el Criterio de Independencia de Hilbert-Schmidt o HSIC), también pueden detectar interacciones lineales y no lineales. Tanto la correlación de distancia como las métricas basadas en núcleos pueden utilizarse en métodos como el análisis de correlación canónica y el análisis de componentes independientes para obtener una mayor potencia estadística .
Véase también
- coeficiente RV
- Para una estadística de tercer orden relacionada, consulte Asimetría de distancia .
Notas
- ↑ Pearson 1895a , 1895b
- ^ Székely , Rizzo y Bakirov 2007 .
- ^ Székely y Rizzo 2009a .
- 1 2 Rizzo y Székely 2021 .
- ↑ Székely y Rizzo 2014 , pág. 11.
- ↑ Raymaekers, Jakob; Rousseeuw, Peter J. (2 de enero de 2025). "Covarianza de distancia, independencia y diferencias por pares". The American Statistician . 79 (1): 122– 128. arXiv : 2406.13052 . doi : 10.1080/00031305.2024.2374966 .
- ^ Székely y Rizzo 2009a , pág. 1249 , Teorema 7, (3.7).
- ↑ Székely y Rizzo 2012 .
- ↑ Gini 1912 .
- ↑ Székely y Rizzo 2009b .
- 1 2 Székely y Rizzo 2014 .
- 1 2 Lyons 2014 .
- ↑ Klebanov 2005 , p..
- ↑ Bickel y Xu 2009 .
- ↑ Kosorok 2009 .
Referencias
- Bickel, Peter J.; Xu, Ying (2009). "Discusión sobre: covarianza de distancia browniana" . The Annals of Applied Statistics . 3 (4): 1266– 1269. arXiv : 0912.3295 . doi : 10.1214/09-AOAS312A .
- Gini, C. (1912). Variabilidad y mutabilidad . Bolonia: Tipografia di Paolo Cuppini. Bibcode : 1912vamu.book.....G .
- Klebanov, LB (2005).Distancias N y sus aplicaciones . Praga: Karolinum Press , Universidad Carolina. ISBN 9788024611525.
- Kosorok, Michael R. (2009). "Discusión sobre: covarianza de distancia browniana". Los anales de la estadística aplicada . 3 (4): 1270–1278 . arXiv : 1010.0822 . doi : 10.1214/09-AOAS312B . S2CID 88518490 .
- Lyons, Russell (2014). "Covarianza de distancia en espacios métricos". The Annals of Probability . 41 (5): 3284– 3305. arXiv : 1106.5758 . doi : 10.1214/12-AOP803 . S2CID 73677891 .
- Pearson, K. (1895a). "Nota sobre regresión y herencia en el caso de dos padres". Actas de la Royal Society . 58 : 240–242 . Bibcode : 1895RSPS...58..240P .
- Pearson, K. (1895b). "Notas sobre la historia de la correlación" . Biometrika . 13 : 25–45 . doi : 10.1093/biomet/13.1.25 .
- Rizzo, Maria; Székely, Gábor (22 de febrero de 2021). "energía: E-Estadística: Inferencia multivariante a través de la energía de los datos" . Versión: 1.7-8 . Recuperado el 31 de octubre de 2021 .
- Székely, Gábor J.; Rizzo, Maria L.; Bakirov, Nail K. (2007). "Medición y prueba de la independencia mediante la correlación de distancias". The Annals of Statistics . 35 (6): 2769– 2794. arXiv : 0803.4101 . doi : 10.1214/009053607000000505 . S2CID 5661488 .
- Székely, Gábor J.; Rizzo, Maria L. (2009a). "Covarianza de distancia browniana" . The Annals of Applied Statistics . 3 (4): 1236– 1265. doi : 10.1214/09-AOAS312 . PMC 2889501. PMID 20574547 .
- Székely, Gábor J.; Rizzo, María L. (2009b). "Dúplica: covarianza de distancia browniana" . Los anales de la estadística aplicada . 3 (4): 1303–1308 . arXiv : 1010.0844 . doi : 10.1214/09-AOAS312REJ .
- Székely, Gábor J.; Rizzo, Maria L. (2012). "Sobre la unicidad de la covarianza de distancia". Statistics & Probability Letters . 82 (12): 2278– 2282. doi : 10.1016/j.spl.2012.08.007 .
- Székely, Gabor J.; Rizzo, Maria L. (2014). "Correlación de distancia parcial con métodos para disimilitudes". The Annals of Statistics . 42 (6): 2382– 2412. arXiv : 1310.2926 . Bibcode : 2014arXiv1310.2926S . doi : 10.1214/14-AOS1255 . S2CID 55801702 .
Enlaces externos
- Estadísticas energéticas (E-statistics) Archivado el 13/09/2019 en Wayback Machine
- Distancia estadística
- Teoría de las distribuciones de probabilidad
- Covarianza y correlación