Articulo de referencia

Métrica de probabilidad integral

En teoría de la probabilidad , las métricas de probabilidad integral son tipos de funciones de distancia entre distribuciones de probabilidad , definidas por la capacidad de una...

En teoría de la probabilidad , las métricas de probabilidad integral son tipos de funciones de distancia entre distribuciones de probabilidad , definidas por la capacidad de una clase de funciones para distinguir entre ambas distribuciones. Muchas distancias estadísticas importantes son métricas de probabilidad integral, como la distancia de Wasserstein-1 y la distancia de variación total . Además de su importancia teórica, las métricas de probabilidad integral se utilizan ampliamente en estadística y aprendizaje automático .

El nombre "métrica de probabilidad integral" fue dado por el estadístico alemán Alfred Müller; [ 1 ] las distancias también habían sido llamadas anteriormente "métricas con una estructura ζ ". [ 2 ]

Definición

Las métricas de probabilidad integral (IPM) son distancias en el espacio de distribuciones sobre un conjuntoincógnita{\displaystyle {\mathcal {X}}}, definido por una claseF{\displaystyle {\mathcal {F}}}de funciones de valor real enincógnita{\displaystyle {\mathcal {X}}}como DF(PAG,Q)=sorberFF|miincógnitaPAGF(incógnita)miYQF(Y)|=sorberFF|PAGFQF|;{\displaystyle D_{\mathcal {F}}(P,Q)=\sup _{f\in {\mathcal {F}}}{\big |}\mathbb {E} _{X\sim P}f(X)-\mathbb {E} _{Y\sim Q}f(Y){\big |}=\sup _{f\in {\mathcal {F}}}{\big |}Pf-Qf{\big |};} Aquí la notación P f se refiere a la esperanza de f bajo la distribución P . El valor absoluto en la definición es innecesario y a menudo se omite, para el caso usual donde para cadaFF{\displaystyle f\in {\mathcal {F}}}su negaciónF{\displaystyle -f}también está enF{\displaystyle {\mathcal {F}}}.

Las funciones f que se optimizan a veces se denominan funciones "críticas"; [ 3 ] si una función en particularFF{\displaystyle f^{*}\in {\mathcal {F}}}Cuando alcanza el supremo, a menudo se la denomina "función testigo" [ 4 ] (que "testifica" la diferencia en las distribuciones). Estas funciones intentan tener valores grandes para las muestras de P y valores pequeños (probablemente negativos) para las muestras de Q ; esto puede considerarse una versión más débil de los clasificadores , y de hecho, los IPM pueden interpretarse como el riesgo óptimo de un clasificador particular. [ 5 ] : sec. 4

La elección deF{\displaystyle {\mathcal {F}}}determina la distancia particular; más de unaF{\displaystyle {\mathcal {F}}}puede generar la misma distancia. [ 1 ]

Para cualquier elección deF{\displaystyle {\mathcal {F}}},DF{\displaystyle D_{\mathcal {F}}}satisface todas las definiciones de una métrica excepto que podemos tenerDF(PAG,Q)=0{\displaystyle D_{\mathcal {F}}(P,Q)=0}para algún PQ ; esto se denomina indistintamente " pseudométrico " o "semimétrico" según la comunidad. Por ejemplo, utilizando la claseF={incógnita0}{\displaystyle {\mathcal {F}}=\{x\mapsto 0\}}que solo contiene la función cero,DF(PAG,Q){\displaystyle D_{\mathcal {F}}(P,Q)}es idénticamente cero.DF{\displaystyle D_{\mathcal {F}}}es una métrica si y solo siF{\displaystyle {\mathcal {F}}}separa puntos en el espacio de distribuciones de probabilidad, es decir, para cualquier PQ existe algúnFF{\displaystyle f\in {\mathcal {F}}}de tal manera quePAGFQF{\displaystyle Pf\neq Qf}; [ 1 ] La mayoría, pero no todos, los casos particulares comunes satisfacen esta propiedad.

Ejemplos

Todos estos ejemplos son métricas, salvo que se indique lo contrario.

Relación con las divergencias f

Las f -divergencias son probablemente la forma más conocida de medir la disimilitud de las distribuciones de probabilidad. Se ha demostrado [ 5 ] : sección 2 que las únicas funciones que son a la vez IPM y f -divergencias son de la formadoTELEVISOR(PAG,Q){\displaystyle c\,\operatorname {TV} (P,Q)}, dóndedo[0,]{\displaystyle c\in [0,\infty ]}yTELEVISOR{\displaystyle \operatorname {TV} }es la distancia de variación total entre distribuciones.

Una diferencia importante entre las f -divergencias y la mayoría de los IPM es que cuando P y Q tienen soporte disjunto, todas las f- divergencias toman un valor constante; [ 18 ] por el contrario, los IPM donde las funciones enF{\displaystyle {\mathcal {F}}}son "suaves" pueden dar "crédito parcial". Por ejemplo, considere la secuenciaδ1/norte{\displaystyle \delta _{1/n}}de medidas de Dirac en 1/ n ; esta secuencia converge en distribución aδ0{\displaystyle \delta _{0}}y muchos IPM satisfacenDF(δ1/norte,δ0)0{\displaystyle D_{\mathcal {F}}(\delta _{1/n},\delta _{0})\to 0}, pero ninguna f -divergencia distinta de cero puede satisfacer esto. Es decir, muchas IPM son continuas en topologías más débiles que las f -divergencias. Esta propiedad a veces es de gran importancia, [ 19 ] aunque también existen otras opciones, como considerar f -divergencias entre distribuciones convolucionadas con ruido continuo [ 19 ] [ 20 ] o convoluciones informales entre f-divergencias y métricas de probabilidad integral. [ 21 ] [ 22 ]

Estimación a partir de muestras

Debido a que los valores de IPM entre distribuciones discretas suelen ser sensatos, a menudo es razonable estimarDF(PAG,Q){\displaystyle D_{\mathcal {F}}(P,Q)}utilizando un estimador simple de "conexión":DF(PAG^,Q^){\displaystyle D_{\mathcal {F}}({\hat {P}},{\hat {Q}})}dóndePAG^{\displaystyle {\hat {P}}}yQ^{\displaystyle {\hat {Q}}}son medidas empíricas de conjuntos de muestras. Estas distancias empíricas se pueden calcular exactamente para algunas clases.F{\displaystyle {\mathcal {F}}}; [ 5 ] La calidad de la estimación varía según la distancia, pero puede ser óptima en el sentido minimax en ciertas configuraciones. [ 15 ] [ 23 ] [ 24 ]

Cuando la maximización exacta no está disponible o es demasiado costosa, otro esquema comúnmente utilizado es dividir las muestras en conjuntos de "entrenamiento" (con medidas empíricas).PAG^trainorte{\displaystyle {\hat {P}}_{\mathit {train}}}yQ^trainorte{\displaystyle {\hat {Q}}_{\mathit {train}}}) y conjuntos de "prueba" (PAG^tmist{\displaystyle {\hat {P}}_{\mathit {test}}}yQ^tmist{\displaystyle {\hat {Q}}_{\mathit {test}}}), encontrarF^{\displaystyle {\hat {f}}}aproximadamente maximizando|PAG^trainorteFQ^trainorteF|{\displaystyle {\big |}{\hat {P}}_{\mathit {train}}f-{\hat {Q}}_{\mathit {train}}f{\big |}}, luego usar|PAG^tmistF^Q^tmistF^|{\displaystyle {\big |}{\hat {P}}_{\mathit {test}}{\hat {f}}-{\hat {Q}}_{\mathit {test}}{\hat {f}}{\big |}}como una estimación. [ 25 ] [ 13 ] [ 26 ] [ 27 ] Este estimador posiblemente sea consistente , pero tiene un sesgo negativo [ 25 ] : teorema 2 . De hecho, no puede existir un estimador insesgado para ningún IPM [ 25 ] : teorema 3 , aunque existe, por ejemplo, un estimador insesgado de la discrepancia media máxima al cuadrado . [ 4 ]

Referencias

  1. 1 2 3 4 Müller, Alfred (junio de 1997). " Métricas de probabilidad integral y sus clases generadoras de funciones". Advances in Applied Probability . 29 (2): 429– 443. doi : 10.2307/1428011 . JSTOR 1428011. S2CID 124648603 .  
  2. Zolotarev, VM (enero de 1984). "Métricas de probabilidad". Teoría de la probabilidad y sus aplicaciones . 28 (2): 278– 302. doi : 10.1137/1128025 .
  3. Arjovsky, Martin; Chintala, Soumith; Bottou, Léon (17 de julio de 2017). "Redes generativas adversarias de Wasserstein" . Conferencia internacional sobre aprendizaje automático . PMLR: 214–223 .
  4. ^ Gretton , Arturo; Borgwardt, Karsten M.; Rasche, Malte J.; Schölkopf, Bernhard; Smola, Alejandro (2012). "Una prueba de dos muestras del kernel" (PDF) . Revista de investigación sobre aprendizaje automático . 13 : 723–773 .
  5. 1 2 3 Sriperumbudur, Bharath K.; Fukumizu, Kenji; Gretton, Arthur; Schölkopf, Bernhard ; Lanckriet, Gert RG (2009). "Sobre métricas de probabilidad integral, φ-divergencias y clasificación binaria". arXiv : 0901.2698 [ cs.IT ].
  6. Chou, Yu-Lin (2020). "Sobre la continuidad casi uniforme de las funciones de Borel en espacios métricos polacos". arXiv : 2008.00786 [ math.FA ].
  7. Fukumizu, Kenji; Gretton, Arthur; Sun, Xiaohui; Schölkopf, Bernhard (2007). "Medidas de núcleo de dependencia condicional" . Avances en sistemas de procesamiento de información neuronal . 20 .
  8. Sejdinovic, Dino; Sriperumbudur, Bharath; Gretton, Arthur; Fukumizu, Kenji (2013). "Equivalencia de estadísticas basadas en distancias y en RKHS en pruebas de hipótesis". The Annals of Statistics . 41 (5): 2263– 2291. arXiv : 1207.6076 . doi : 10.1214/13-aos1140 . S2CID 8308769 . 
  9. Mroueh, Youssef; Li, Chun-Liang; Sercu, Tom; Raj, Anant; Cheng, Yu (2018). "Sobolev GAN" . Conferencia Internacional sobre Representaciones de Aprendizaje . arXiv : 1711.04894 .
  10. Uppal, Ananya; Singh, Shashank; Póczos, Barnabás (2019). "Estimación de densidad no paramétrica y tasas de convergencia para GANs bajo pérdidas IPM de Besov" . Advances in Neural Information Processing Systems . 32. arXiv : 1902.03511 .
  11. Uppal, Ananya; Singh, Shashank; Póczos, Barnabás (2020). "Estimación robusta de densidad bajo pérdidas IPM de Besov" . Advances in Neural Information Processing Systems . 33 : 5345–5355 . arXiv : 2004.08597 .
  12. Kim, Ilmun; Ramdas, Aaditya; Singh, Aarti; Wasserman, Larry (febrero de 2021). "La precisión de la clasificación como un indicador para las pruebas de dos muestras". The Annals of Statistics . 49 (1). arXiv : 1703.00573 . doi : 10.1214/20-AOS1962 . S2CID 17668083 . 
  13. 1 2 López-Paz, David; Oquab, Maxime (2017). "Revisiting Classifier Two-Sample Tests" . Conferencia Internacional sobre Representaciones de Aprendizaje . arXiv : 1610.06545 .
  14. 1 2 Arora, Sanjeev ; Ge, Rong; Liang, Yingyu; Ma, Tengyu; Zhang, Yi (2017). "Generalización y equilibrio en redes generativas adversarias (GAN)". Conferencia internacional sobre aprendizaje automático . arXiv : 1703.00573 .
  15. 1 2 Ji, Kaiyi; Liang, Yingbin (2018). "Estimación minimax de la distancia de la red neuronal". Avances en sistemas de procesamiento de información neuronal . arXiv : 1811.01054 .
  16. Stanczuk, Jan; Etmann, Christian; Lisa Maria Kreusser; Schönlieb, Carola-Bibiane (2021). "Las GAN de Wasserstein funcionan porque fallan (para aproximar la distancia de Wasserstein)". arXiv : 2103.01678 [ stat.ML ].
  17. ^ Mallasto, Antón; Montúfar, Guido; Gerolín, Augusto (2019). "¿Qué tan bien estiman las WGAN la métrica de Wasserstein?". arXiv : 1910.03875 [ cs.LG ].
  18. Sutherland, Danica J. "Cálculo de la divergencia de Jensen-Shannon entre distribuciones discretas y continuas" . Stack Exchange Network . Consultado el 18 de julio de 2023 .
  19. 1 2 Arjovsky, Martin; Bettou, Léon (2017). "Hacia métodos basados ​​en principios para el entrenamiento de redes generativas adversarias". Conferencia internacional sobre representaciones de aprendizaje . arXiv : 1701.04862 .
  20. Sønderby, Casper Kaae; Caballero, Jose; Theis, Lucas; Shi, Wenzhe; Huszár, Ferenc (2017). "Inferencia MAP amortizada para superresolución de imágenes". Conferencia internacional sobre aprendizaje de representaciones . Apéndice C. arXiv : 1610.04490 .
  21. Stein, Víktor; Neumayer, Sebastián; Rux, Nicolaj; Steidl, Gabriele (3 de mayo de 2025). "Flujos de gradiente de Wasserstein para envolventes de Moreau de divergencias f en la reproducción de espacios de Hilbert del núcleo" . Análisis y Aplicaciones . 24 : 21– 65. doi : 10.1142/S0219530525500162 . ISSN 0219-5305 . 
  22. ^ Birrell, Jeremías; Dupuis, Pablo; Katsoulakis, Markos A.; Pantazis, Yannis; Rey-Bellet, Luc (1 de enero de 2022). "(f, Γ) -Divergencias: interpolación entre f-divergencias y métricas de probabilidad integral" . J. Mach. Aprender. Res . 23 (1): 39:1816–39:1885. ISSN 1532-4435 . 
  23. Tolstikhin, Ilya O.; Sriperumbudur, Bharath K.; Schölkopf, Bernhard (2016). "Estimación minimax de la discrepancia media máxima con núcleos radiales" . Avances en sistemas de procesamiento de información neuronal . 29 .
  24. ^ Singh, Shashank; Póczos, Barnabás (2018). "Estimación de distribución minimax en distancia de Wasserstein". arXiv : 1802.08855 [ matemáticas.ST ].
  25. 1 2 3 Bińkowski, Mikołaj; Sutherland, Danica J.; Arbel, Michael; Gretton, Arthur (2018). "Desmitificando las GAN MMD" . Conferencia Internacional sobre Representaciones de Aprendizaje . arXiv : 1801.01401 .
  26. Liu, Feng; Xu, Wenkai; Lu, Jie; Zhang, Guangquan; Gretton, Arthur; Sutherland, Danica J. (2020). "Learning Deep Kernels for Non-Parametric Two-Sample Tests" . Conferencia Internacional sobre Aprendizaje Automático : 6316–6326 . arXiv : 2002.09116 .
  27. Kübler, Jonas M.; Jitkrittum, Wittawat; Schölkopf, Bernhard ; Muandent, Krikamol (2021). "Una prueba de dos muestras de testigos" . Conferencia internacional sobre inteligencia artificial y estadística : 1403–1419 . arXiv : 2102.05573 .