Articulo de referencia

Distancia de energía

La distancia energética es una distancia estadística entre distribuciones de probabilidad . Si X e Y son vectores aleatorios independientes en R d con funciones de distribución ...

La distancia energética es una distancia estadística entre distribuciones de probabilidad . Si X e Y son vectores aleatorios independientes en R d con funciones de distribución acumulativa (cdf) F y G respectivamente, entonces la distancia energética entre las distribuciones F y G se define como la raíz cuadrada de

D2(F,GRAMO)=2miincógnitaYmiincógnitaincógnitamiYY0,{\displaystyle D^{2}(F,G)=2\operatorname {E} \|XY\|-\operatorname {E} \|XX'\|-\operatorname {E} \|YY'\|\geq 0,}

donde (X, X', Y, Y') son independientes, la función de distribución acumulada de X y X' es F, la función de distribución acumulada de Y y Y' es G,mi{\displaystyle \operatorname {E} }es el valor esperado , y || . || denota la longitud de un vector. La distancia de energía satisface todos los axiomas de una métrica, por lo tanto, la distancia de energía caracteriza la igualdad de distribuciones: D(F,G) = 0 si y solo si F = G. La distancia de energía para aplicaciones estadísticas fue introducida en 1985 por Gábor J. Székely , quien demostró que para variables aleatorias de valor realD2(F,GRAMO){\displaystyle D^{2}(F,G)}es exactamente el doble de la distancia de Cramér : [ 1 ]

(F(incógnita)GRAMO(incógnita))2dincógnita.{\displaystyle \int _{-\infty }^{\infty }(F(x)-G(x))^{2}\,dx.}

Para una demostración sencilla de esta equivalencia, véase Székely (2002). [ 2 ]

En dimensiones superiores, sin embargo, las dos distancias son diferentes porque la distancia de energía es invariante a la rotación, mientras que la distancia de Cramér no lo es. (Nótese que la distancia de Cramér no es la misma que el criterio de Cramér-von Mises libre de distribución ).

Generalización a espacios métricos

Se puede generalizar la noción de distancia energética a distribuciones de probabilidad en espacios métricos. Sea(METRO,d){\displaystyle (M,d)}sea ​​un espacio métrico con su álgebra sigma de BorelB(METRO){\displaystyle {\mathcal {B}}(M)}. DejarPAG(METRO){\displaystyle {\mathcal {P}}(M)}denota el conjunto de todas las medidas de probabilidad en el espacio medible(METRO,B(METRO)){\displaystyle (M,{\mathcal {B}}(M))}. Si μ y ν son medidas de probabilidad enPAG(METRO){\displaystyle {\mathcal {P}}(M)}, entonces la distancia de energíaD{\displaystyle D}de μ y ν se puede definir como la raíz cuadrada de

D2(μ,ν)=2mi[d(incógnita,Y)]mi[d(incógnita,incógnita)]mi[d(Y,Y)].{\displaystyle D^{2}(\mu ,\nu )=2\operatorname {E} [d(X,Y)]-\operatorname {E} [d(X,X')]-\operatorname {E} [d(Y,Y')].}

Sin embargo, esto no es necesariamente no negativo. Si(METRO,d){\displaystyle (M,d)}es un núcleo fuertemente definido negativo, entonces D{\displaystyle D}es una métrica , y viceversa. [ 3 ] Esta condición se expresa diciendo que(METRO,d){\displaystyle (M,d)}tiene tipo negativo. El tipo negativo no es suficiente paraD{\displaystyle D}ser una métrica; esta última condición se expresa diciendo que(METRO,d){\displaystyle (M,d)}tiene un tipo negativo fuerte. En esta situación, la distancia de energía es cero si y solo si X e Y tienen la misma distribución. Un ejemplo de una métrica de tipo negativo pero no de tipo negativo fuerte es el plano con la métrica de taxicab . Todos los espacios euclidianos e incluso los espacios de Hilbert separables tienen un tipo negativo fuerte. [ 4 ]

En la literatura sobre métodos de kernel para aprendizaje automático , estas nociones generalizadas de distancia energética se estudian bajo el nombre de discrepancia media máxima. Varios autores abordan la equivalencia de los métodos basados ​​en distancia y en kernel para la prueba de hipótesis. [ 5 ] [ 6 ]

Estadísticas de energía

Un concepto estadístico relacionado, la noción de estadística E o estadística energética [ 7 ], fue introducido por Gábor J. Székely en la década de 1980 durante sus conferencias en Budapest, Hungría, y en el MIT, Yale y Columbia. Este concepto se basa en la noción de energía potencial de Newton [ 8 ] . La idea es considerar las observaciones estadísticas como cuerpos celestes regidos por una energía potencial estadística que es cero solo cuando una hipótesis nula estadística subyacente es verdadera. Las estadísticas energéticas son funciones de las distancias entre las observaciones estadísticas.

La distancia energética y el estadístico E se consideraron como N -distancias y N-estadístico en Zinger AA, Kakosyan AV, Klebanov LB Caracterización de distribuciones mediante valores medios de algunos estadísticos en conexión con algunas métricas de probabilidad, Problemas de estabilidad para modelos estocásticos. Moscú, VNIISI, 1989, 47-55. (en ruso), Traducción al inglés: Una caracterización de distribuciones mediante valores medios de estadísticos y ciertas métricas probabilísticas AA Zinger, AV Kakosyan, LB Klebanov en Journal of Soviet Mathematics (1992). En el mismo artículo se dio una definición de núcleo fuertemente definido negativo y se proporcionó una generalización en espacios métricos, discutidos anteriormente. El libro [ 3 ] presenta estos resultados y sus aplicaciones a pruebas estadísticas. El libro también contiene algunas aplicaciones para recuperar la medida a partir de su potencial.

Pruebas para comprobar la igualdad de distribuciones

Consideremos la hipótesis nula de que dos variables aleatorias, X e Y , tienen las mismas distribuciones de probabilidad:μ=ν{\displaystyle \mu =\nu }Para muestras estadísticas de X e Y :

incógnita1,,incógnitanorte{\displaystyle x_{1},\dots ,x_{n}}yy1,,ymetro{\displaystyle y_{1},\dots ,y_{m}},

Se calculan los siguientes promedios aritméticos de distancias entre las muestras X e Y:

A:=1nortemetroi=1nortej=1metroincógnitaiyj,B:=1norte2i=1nortej=1norteincógnitaiincógnitaj,do:=1metro2i=1metroj=1metroyiyj{\displaystyle A:={\frac {1}{nm}}\sum _{i=1}^{n}\sum _{j=1}^{m}\|x_{i}-y_{j}\|,B:={\frac {1}{n^{2}}}\sum _{i=1}^{n}\sum _{j=1}^{n}\|x_{i}-x_{j}\|,C:={\frac {1}{m^{2}}}\sum _{i=1}^{m}\sum _{j=1}^{m}\|y_{i}-y_{j}\|}.

El estadístico E de la hipótesis nula subyacente se define de la siguiente manera:

minorte,metro(incógnita,Y):=2ABdo{\displaystyle E_{n,m}(X,Y):=2A-B-C}

Se puede demostrar [ 8 ] [ 9 ] queminorte,metro(incógnita,Y)0{\displaystyle E_{n,m}(X,Y)\geq 0}y que el valor poblacional correspondiente es cero si y solo si X e Y tienen la misma distribución (μ=ν{\displaystyle \mu =\nu }). Bajo esta hipótesis nula, el estadístico de prueba

T=nortemetronorte+metrominorte,metro(incógnita,Y){\displaystyle T={\frac {nm}{n+m}}E_{n,m}(X,Y)}

converge en distribución a una forma cuadrática de variables aleatorias normales estándar independientes . Bajo la hipótesis alternativa, T tiende a infinito. Esto permite construir una prueba estadística consistente , la prueba de energía para distribuciones iguales. [ 10 ]

También se puede introducir el coeficiente E de inhomogeneidad. Este siempre está entre 0 y 1 y se define como

H=D2(Fincógnita,FY)2miincógnitaY=2miincógnitaYmiincógnitaincógnitamiYY2miincógnitaY,{\displaystyle H={\frac {D^{2}(F_{X},F_{Y})}{2\operatorname {\operatorname {E} } \|X-Y\|}}={\frac {2\operatorname {E} \|X-Y\|-\operatorname {E} \|X-X'\|-\operatorname {E} \|Y-Y'\|}{2\operatorname {\operatorname {E} } \|X-Y\|}},}

dóndemi{\displaystyle \operatorname {E} } denota el valor esperado . H  =  0  exactamente cuando X e Y tienen la misma distribución.

Bondad de ajuste

Se define una medida de bondad de ajuste multivariada para distribuciones en dimensión arbitraria (sin restricciones por el tamaño de la muestra). El estadístico de bondad de ajuste de energía es

Qnorte=norte(2nortei=1nortemiincógnitaiincógnitaαmiincógnitaincógnitaα1norte2i=1nortej=1norteincógnitaiincógnitajα),{\displaystyle Q_{n}=n\left({\frac {2}{n}}\sum _{i=1}^{n}\operatorname {E} \|x_{i}-X\|^{\alpha }-\operatorname {E} \|X-X'\|^{\alpha }-{\frac {1}{n^{2}}}\sum _{i=1}^{n}\sum _{j=1}^{n}\|x_{i}-x_{j}\|^{\alpha }\right),}

donde X y X' son independientes e idénticamente distribuidas según la distribución hipotética, yα(0,2){\displaystyle \alpha \in (0,2)}. La única condición requerida es que X tenga finitoα{\displaystyle \alpha }momento bajo la hipótesis nula. Bajo la hipótesis nulamiQnorte=miincógnitaincógnitaα{\displaystyle \operatorname {E} Q_{n}=\operatorname {E} \|X-X'\|^{\alpha }}y la distribución asintótica de Q n es una forma cuadrática de variables aleatorias gaussianas centradas. Bajo una hipótesis alternativa, Q n tiende a infinito estocásticamente, y por lo tanto determina una prueba estadísticamente consistente. Para la mayoría de las aplicaciones se puede aplicar el exponente 1 (distancia euclidiana). El caso especial importante de prueba de normalidad multivariada [ 9 ] está implementado en el paquete energy para R. También se desarrollan pruebas para distribuciones de cola pesada como Pareto ( ley de potencias ), o distribuciones estables mediante la aplicación de exponentes en (0,1).

Aplicaciones

Las aplicaciones incluyen:

Gneiting y Raftery [ 19 ] aplican la distancia de energía para desarrollar un nuevo y muy general tipo de regla de puntuación adecuada para predicciones probabilísticas, la puntuación de energía.

Las aplicaciones de las estadísticas energéticas se implementan en el paquete de energía de código abierto [ 28 ] para R .

Referencias

  1. ^ Cramér, H. (1928) Sobre la composición de errores elementales, Skandinavisk Aktuarietidskrift, 11, 141–180.
  2. E-Statistics: La energía de las muestras estadísticas (2002) PDF Archivado el 20/04/2016 en Wayback Machine
  3. 1 2 Klebanov, LB (2005) Distancias N y sus aplicaciones, Karolinum Press , Universidad Carolina, Praga.
  4. Lyons, R. (2013). "Covarianza de distancia en espacios métricos". The Annals of Probability . 41 (5): 3284– 3305. arXiv : 1106.5758 . doi : 10.1214/12-aop803 . S2CID 73677891 . 
  5. ^ Sejdinovic, D.; Sriperumbudur, B.; Gretton, A. y Fukumizu, K. (2013). "Equivalencia de estadísticas basadas en distancia y RKHS en pruebas de hipótesis". Los anales de la estadística . 41 (5): 2263–2291 . arXiv : 1207.6076 . doi : 10.1214/13-aos1140 . S2CID 8308769 . 
  6. Shen, Cencheng; Vogelstein, Joshua T. (2021). "La equivalencia exacta de los métodos de distancia y núcleo en la prueba de hipótesis". AStA Advances in Statistical Analysis . 105 (3): 385– 403. arXiv : 1806.05514 . doi : 10.1007/s10182-020-00378-1 . S2CID 49210956 . 
  7. GJ Szekely y ML Rizzo (2013). Estadísticas energéticas: estadísticas basadas en distancias. Journal of Statistical Planning and Inference, Volumen 143, Número 8, agosto de 2013, pp. 1249-1272. doi : 10.1016/j.jspi.2013.03.018
  8. 1 2 Székely, GJ (2002) E-estadística: La energía de las muestras estadísticas, Informe técnico BGSU No 02-16.
  9. 1 2 3 Székely, GJ; Rizzo, ML (2005). "Una nueva prueba para la normalidad multivariada" . Journal of Multivariate Analysis . 93 (1): 58– 80. doi : 10.1016/j.jmva.2003.12.002 .Reimpresión archivada el 5 de agosto de 2011 en Wayback Machine.
  10. GJ Szekely y ML Rizzo (2004). Pruebas de distribuciones iguales en alta dimensión, InterStat , noviembre (5). Reimpresión archivada el 5 de agosto de 2011 en Wayback Machine .
  11. Szekely, Gabor J.; Rizzo, Maria L. (2005). "Agrupamiento jerárquico mediante distancias conjuntas entre y dentro de los grupos: extensión del método de varianza mínima de Ward". Journal of Classification . 22 (2): 151– 183. doi : 10.1007/s00357-005-0012-9 .
  12. Varin, T., Bureau, R., Mueller, C. y Willett, P. (2009). "Agrupación de archivos de estructuras químicas utilizando la generalización de Szekely-Rizzo del método de Ward" (PDF) . Journal of Molecular Graphics and Modelling . 28 (2): 187– 195. Bibcode : 2009JMGM...28..187V . doi : 10.1016/j.jmgm.2009.06.006 . PMID 19640752 . {{cite journal}}: CS1 maint: nombres múltiples: lista de autores ( enlace ) "eprint" .
  13. Rizzo, Maria L.; Székely, Gábor J. (2010). "Análisis DISCO: una extensión no paramétrica del análisis de varianza". The Annals of Applied Statistics . 4 (2). arXiv : 1011.2288 . doi : 10.1214/09-AOAS245 .
  14. Szekely, GJ y Rizzo, ML (2004) Pruebas de distribuciones iguales en alta dimensión, InterStat, noviembre (5). Reimpresión archivada el 5 de agosto de 2011 en Wayback Machine .
  15. Ledlie, J.; Pietzuch, P.; Seltzer, M. (2006). "Coordenadas de red estables y precisas". 26.ª Conferencia Internacional IEEE sobre Sistemas de Computación Distribuida (ICDCS'06) . pág. 74. doi : 10.1109/ICDCS.2006.79 . ISBN  0-7695-2540-7.
  16. Albert Y. Kim; Caren Marzban; Donald B. Percival; Werner Stuetzle (2009). "Uso de datos etiquetados para evaluar detectores de cambios en un entorno de transmisión multivariante". Procesamiento de señales . 89 (12): 2529– 2536. Bibcode : 2009SigPr..89.2529K . CiteSeerX 10.1.1.143.6576 . doi : 10.1016/j.sigpro.2009.04.011 . ISSN 0165-1684 .  Preimpresión: TR534 .
  17. Székely, Gábor J.; Rizzo, Maria L.; Bakirov, Nail K. (2007). "Medición y prueba de la dependencia mediante la correlación de distancias". The Annals of Statistics . 35 (6). arXiv : 0803.4101 . doi : 10.1214/009053607000000505 .
  18. Székely, Gábor J.; Rizzo, Maria L. (2009). "Covarianza de distancia browniana" . The Annals of Applied Statistics . 3 (4): 1266– 1269. arXiv : 1010.0297 . doi : 10.1214 / 09-AOAS312 . PMC 2889501. PMID 20574547 .  
  19. T. Gneiting; AE Raftery (2007). "Reglas de puntuación estrictamente apropiadas, predicción y estimación". Journal of the American Statistical Association . 102 (477): 359– 378. doi : 10.1198/016214506000001437 . S2CID 1878582 . Reimpresión
  20. Klebanov, Lev B. (2002). "Una clase de métricas de probabilidad y sus aplicaciones estadísticas". Análisis de datos estadísticos basado en la norma L1 y métodos relacionados . págs. 241–252 . doi : 10.1007/978-3-0348-8201-9_20 . ISBN  978-3-0348-9472-2.
  21. F. Ziel (2021). "La distancia energética para la reducción de conjuntos y escenarios". Philosophical Transactions of the Royal Society A . 379 (2202) 20190431. arXiv : 2005.14670 . Bibcode : 2021RSPTA.37990431Z . doi : 10.1098/rsta.2019.0431 . ISSN 1364-503X . PMID 34092100 . S2CID 219124032 .   
  22. Hu, Rui; Qiu, Xing; Glazko, Galina; Klebanov, Lev; Yakovlev, Andrei (2009). "Detección de cambios en la correlación intergénica en el análisis de microarrays: un nuevo enfoque para la selección de genes" . BMC Bioinformatics . 10 20. doi : 10.1186/1471-2105-10-20 . PMC 2657217. PMID 19146700 .  
  23. Xiao, Yuanhui; Frisina, Robert; Gordon, Alexander; Klebanov, Lev; Yakovlev, Andrei (2004). "Búsqueda multivariada de combinaciones de genes expresados ​​diferencialmente" . BMC Bioinformatics . 5 164. doi : 10.1186/1471-2105-5-164 . PMC 529250. PMID 15507138 .  
  24. ^ Almudévar, Anthony; Klebanov, Lev B.; Qiu, Xing; Salzman, Peter; Yakovlev, Andrei Y. (2006). "Utilidad de medidas de correlación en el análisis de la expresión génica" . NeuroRx . 3 (3): 384– 395. doi : 10.1016/j.nurx.2006.05.037 . PMC 3593386 . PMID 16815221 .  
  25. Klebanov, L.; Gordon, A.; Xiao, Y.; Land, H.; Yakovlev, A. (2006). "Una prueba de permutación motivada por el análisis de datos de microarrays". Computational Statistics & Data Analysis . 50 (12): 3619– 3628. doi : 10.1016/j.csda.2005.08.005 .
  26. Beneš, Viktor; Lechnerová, Radka; Klebanov, Lev; Slámová, Margarita; Sláma, Peter (2009). "Comparación estadística de la geometría de partículas de segunda fase". Caracterización de Materiales . 60 (10): 1076– 1081. doi : 10.1016/j.matchar.2009.02.016 .
  27. Vaiciukynas, Evaldas; Verikas, Antanas; Gelzinis, Adas; Bacauskiene, Marija; Olenina, Irina (2015). "Aprovechamiento de la prueba de energía estadística para la comparación de múltiples grupos en datos morfométricos y quimiométricos". Chemometrics and Intelligent Laboratory Systems . 146 : 10–23 . doi : 10.1016/j.chemolab.2015.04.018 .
  28. "energy: versión 1.6.2 del paquete R" . Consultado el 30 de enero de 2015 .