En teoría de la probabilidad , las métricas de probabilidad integral son tipos de funciones de distancia entre distribuciones de probabilidad , definidas por la capacidad de una clase de funciones para distinguir entre ambas distribuciones. Muchas distancias estadísticas importantes son métricas de probabilidad integral, como la distancia de Wasserstein-1 y la distancia de variación total . Además de su importancia teórica, las métricas de probabilidad integral se utilizan ampliamente en estadística y aprendizaje automático .
El nombre "métrica de probabilidad integral" fue dado por el estadístico alemán Alfred Müller; [ 1 ] las distancias también habían sido llamadas anteriormente "métricas con una estructura ζ ". [ 2 ]
Definición
Las métricas de probabilidad integral (IPM) son distancias en el espacio de distribuciones sobre un conjunto, definido por una clasede funciones de valor real encomo Aquí la notación P f se refiere a la esperanza de f bajo la distribución P . El valor absoluto en la definición es innecesario y a menudo se omite, para el caso usual donde para cadasu negacióntambién está en.
Las funciones f que se optimizan a veces se denominan funciones "críticas"; [ 3 ] si una función en particularCuando alcanza el supremo, a menudo se la denomina "función testigo" [ 4 ] (que "testifica" la diferencia en las distribuciones). Estas funciones intentan tener valores grandes para las muestras de P y valores pequeños (probablemente negativos) para las muestras de Q ; esto puede considerarse una versión más débil de los clasificadores , y de hecho, los IPM pueden interpretarse como el riesgo óptimo de un clasificador particular. [ 5 ] : sec. 4
La elección dedetermina la distancia particular; más de unapuede generar la misma distancia. [ 1 ]
Para cualquier elección de,satisface todas las definiciones de una métrica excepto que podemos tenerpara algún P ≠ Q ; esto se denomina indistintamente " pseudométrico " o "semimétrico" según la comunidad. Por ejemplo, utilizando la claseque solo contiene la función cero,es idénticamente cero.es una métrica si y solo sisepara puntos en el espacio de distribuciones de probabilidad, es decir, para cualquier P ≠ Q existe algúnde tal manera que; [ 1 ] La mayoría, pero no todos, los casos particulares comunes satisfacen esta propiedad.
Ejemplos
Todos estos ejemplos son métricas, salvo que se indique lo contrario.
- La distancia de Wasserstein-1 (también llamada distancia del transportador de tierra ), a través de su representación dual , tieneel conjunto de funciones Lipschitz de orden 1.
- La métrica de Dudley relacionada se genera mediante el conjunto de funciones 1-Lipschitz acotadas .
- La distancia de variación total se puede generar mediante, de modo quees un conjunto de funciones indicadoras para cualquier evento, o por la clase más amplia.
- La métrica de Radon, estrechamente relacionada , se genera mediante funciones continuas acotadas en [-1, 1] . La variación total y la métrica de Radon coinciden (salvo escalamiento) en espacios polacos [ 1 ] : sec. 5.2 [ 6 ] .
- La métrica de Kolmogorov utilizada en la prueba de Kolmogorov-Smirnov tiene una clase de funciones indicadoras,.
- La discrepancia media máxima del núcleo (MMD) tienela bola unitaria en un espacio de Hilbert con núcleo reproductor . Esta distancia es particularmente fácil de estimar a partir de muestras, sin necesidad de optimización; es una métrica adecuada precisamente cuando el núcleo subyacente es característico. [ 7 ]
- La distancia de energía , como un caso especial de la discrepancia media máxima, [ 8 ] es generada por la bola unitaria en un espacio de Hilbert de núcleo reproductor particular .
- Definiciónmediante funciones con una norma de Sobolev acotada proporciona una distancia útil para el modelado generativo , entre otras aplicaciones. [ 9 ]
- Las funciones con norma de Besov acotada generalizan muchas otras formas de IPM y son susceptibles de análisis teórico. [ 10 ] [ 11 ]
- Muchas variantes de redes generativas adversarias y pruebas de dos muestras basadas en clasificadores [ 12 ] [ 13 ] utilizan una "distancia de red neuronal" [ 14 ] [ 15 ] dondees una clase de redes neuronales ; estas no son métricas para redes típicas de tamaño fijo, pero podrían serlo para otros clasificadores. Para las GAN de Wasserstein en particular, se ha argumentado que el análisis en términos de esta distancia y no de la de Wasserstein a la que se aproximan es muy importante para el comportamiento de estos modelos. [ 14 ] [ 16 ] [ 17 ]
Relación con las divergencias f
Las f -divergencias son probablemente la forma más conocida de medir la disimilitud de las distribuciones de probabilidad. Se ha demostrado [ 5 ] : sección 2 que las únicas funciones que son a la vez IPM y f -divergencias son de la forma, dóndeyes la distancia de variación total entre distribuciones.
Una diferencia importante entre las f -divergencias y la mayoría de los IPM es que cuando P y Q tienen soporte disjunto, todas las f- divergencias toman un valor constante; [ 18 ] por el contrario, los IPM donde las funciones enson "suaves" pueden dar "crédito parcial". Por ejemplo, considere la secuenciade medidas de Dirac en 1/ n ; esta secuencia converge en distribución ay muchos IPM satisfacen, pero ninguna f -divergencia distinta de cero puede satisfacer esto. Es decir, muchas IPM son continuas en topologías más débiles que las f -divergencias. Esta propiedad a veces es de gran importancia, [ 19 ] aunque también existen otras opciones, como considerar f -divergencias entre distribuciones convolucionadas con ruido continuo [ 19 ] [ 20 ] o convoluciones informales entre f-divergencias y métricas de probabilidad integral. [ 21 ] [ 22 ]
Estimación a partir de muestras
Debido a que los valores de IPM entre distribuciones discretas suelen ser sensatos, a menudo es razonable estimarutilizando un estimador simple de "conexión":dóndeyson medidas empíricas de conjuntos de muestras. Estas distancias empíricas se pueden calcular exactamente para algunas clases.; [ 5 ] La calidad de la estimación varía según la distancia, pero puede ser óptima en el sentido minimax en ciertas configuraciones. [ 15 ] [ 23 ] [ 24 ]
Cuando la maximización exacta no está disponible o es demasiado costosa, otro esquema comúnmente utilizado es dividir las muestras en conjuntos de "entrenamiento" (con medidas empíricas).y) y conjuntos de "prueba" (y), encontraraproximadamente maximizando, luego usarcomo una estimación. [ 25 ] [ 13 ] [ 26 ] [ 27 ] Este estimador posiblemente sea consistente , pero tiene un sesgo negativo [ 25 ] : teorema 2 . De hecho, no puede existir un estimador insesgado para ningún IPM [ 25 ] : teorema 3 , aunque existe, por ejemplo, un estimador insesgado de la discrepancia media máxima al cuadrado . [ 4 ]
Referencias
- 1 2 3 4 Müller, Alfred (junio de 1997). " Métricas de probabilidad integral y sus clases generadoras de funciones". Advances in Applied Probability . 29 (2): 429– 443. doi : 10.2307/1428011 . JSTOR 1428011. S2CID 124648603 .
- ↑ Zolotarev, VM (enero de 1984). "Métricas de probabilidad". Teoría de la probabilidad y sus aplicaciones . 28 (2): 278– 302. doi : 10.1137/1128025 .
- ↑ Arjovsky, Martin; Chintala, Soumith; Bottou, Léon (17 de julio de 2017). "Redes generativas adversarias de Wasserstein" . Conferencia internacional sobre aprendizaje automático . PMLR: 214–223 .
- ^ Gretton , Arturo; Borgwardt, Karsten M.; Rasche, Malte J.; Schölkopf, Bernhard; Smola, Alejandro (2012). "Una prueba de dos muestras del kernel" (PDF) . Revista de investigación sobre aprendizaje automático . 13 : 723–773 .
- 1 2 3 Sriperumbudur, Bharath K.; Fukumizu, Kenji; Gretton, Arthur; Schölkopf, Bernhard ; Lanckriet, Gert RG (2009). "Sobre métricas de probabilidad integral, φ-divergencias y clasificación binaria". arXiv : 0901.2698 [ cs.IT ].
- ↑ Chou, Yu-Lin (2020). "Sobre la continuidad casi uniforme de las funciones de Borel en espacios métricos polacos". arXiv : 2008.00786 [ math.FA ].
- ↑ Fukumizu, Kenji; Gretton, Arthur; Sun, Xiaohui; Schölkopf, Bernhard (2007). "Medidas de núcleo de dependencia condicional" . Avances en sistemas de procesamiento de información neuronal . 20 .
- ↑ Sejdinovic, Dino; Sriperumbudur, Bharath; Gretton, Arthur; Fukumizu, Kenji (2013). "Equivalencia de estadísticas basadas en distancias y en RKHS en pruebas de hipótesis". The Annals of Statistics . 41 (5): 2263– 2291. arXiv : 1207.6076 . doi : 10.1214/13-aos1140 . S2CID 8308769 .
- ↑ Mroueh, Youssef; Li, Chun-Liang; Sercu, Tom; Raj, Anant; Cheng, Yu (2018). "Sobolev GAN" . Conferencia Internacional sobre Representaciones de Aprendizaje . arXiv : 1711.04894 .
- ↑ Uppal, Ananya; Singh, Shashank; Póczos, Barnabás (2019). "Estimación de densidad no paramétrica y tasas de convergencia para GANs bajo pérdidas IPM de Besov" . Advances in Neural Information Processing Systems . 32. arXiv : 1902.03511 .
- ↑ Uppal, Ananya; Singh, Shashank; Póczos, Barnabás (2020). "Estimación robusta de densidad bajo pérdidas IPM de Besov" . Advances in Neural Information Processing Systems . 33 : 5345–5355 . arXiv : 2004.08597 .
- ↑ Kim, Ilmun; Ramdas, Aaditya; Singh, Aarti; Wasserman, Larry (febrero de 2021). "La precisión de la clasificación como un indicador para las pruebas de dos muestras". The Annals of Statistics . 49 (1). arXiv : 1703.00573 . doi : 10.1214/20-AOS1962 . S2CID 17668083 .
- 1 2 López-Paz, David; Oquab, Maxime (2017). "Revisiting Classifier Two-Sample Tests" . Conferencia Internacional sobre Representaciones de Aprendizaje . arXiv : 1610.06545 .
- 1 2 Arora, Sanjeev ; Ge, Rong; Liang, Yingyu; Ma, Tengyu; Zhang, Yi (2017). "Generalización y equilibrio en redes generativas adversarias (GAN)". Conferencia internacional sobre aprendizaje automático . arXiv : 1703.00573 .
- 1 2 Ji, Kaiyi; Liang, Yingbin (2018). "Estimación minimax de la distancia de la red neuronal". Avances en sistemas de procesamiento de información neuronal . arXiv : 1811.01054 .
- ↑ Stanczuk, Jan; Etmann, Christian; Lisa Maria Kreusser; Schönlieb, Carola-Bibiane (2021). "Las GAN de Wasserstein funcionan porque fallan (para aproximar la distancia de Wasserstein)". arXiv : 2103.01678 [ stat.ML ].
- ^ Mallasto, Antón; Montúfar, Guido; Gerolín, Augusto (2019). "¿Qué tan bien estiman las WGAN la métrica de Wasserstein?". arXiv : 1910.03875 [ cs.LG ].
- ↑ Sutherland, Danica J. "Cálculo de la divergencia de Jensen-Shannon entre distribuciones discretas y continuas" . Stack Exchange Network . Consultado el 18 de julio de 2023 .
- 1 2 Arjovsky, Martin; Bettou, Léon (2017). "Hacia métodos basados en principios para el entrenamiento de redes generativas adversarias". Conferencia internacional sobre representaciones de aprendizaje . arXiv : 1701.04862 .
- ↑ Sønderby, Casper Kaae; Caballero, Jose; Theis, Lucas; Shi, Wenzhe; Huszár, Ferenc (2017). "Inferencia MAP amortizada para superresolución de imágenes". Conferencia internacional sobre aprendizaje de representaciones . Apéndice C. arXiv : 1610.04490 .
- ↑ Stein, Víktor; Neumayer, Sebastián; Rux, Nicolaj; Steidl, Gabriele (3 de mayo de 2025). "Flujos de gradiente de Wasserstein para envolventes de Moreau de divergencias f en la reproducción de espacios de Hilbert del núcleo" . Análisis y Aplicaciones . 24 : 21– 65. doi : 10.1142/S0219530525500162 . ISSN 0219-5305 .
- ^ Birrell, Jeremías; Dupuis, Pablo; Katsoulakis, Markos A.; Pantazis, Yannis; Rey-Bellet, Luc (1 de enero de 2022). "(f, Γ) -Divergencias: interpolación entre f-divergencias y métricas de probabilidad integral" . J. Mach. Aprender. Res . 23 (1): 39:1816–39:1885. ISSN 1532-4435 .
- ↑ Tolstikhin, Ilya O.; Sriperumbudur, Bharath K.; Schölkopf, Bernhard (2016). "Estimación minimax de la discrepancia media máxima con núcleos radiales" . Avances en sistemas de procesamiento de información neuronal . 29 .
- ^ Singh, Shashank; Póczos, Barnabás (2018). "Estimación de distribución minimax en distancia de Wasserstein". arXiv : 1802.08855 [ matemáticas.ST ].
- 1 2 3 Bińkowski, Mikołaj; Sutherland, Danica J.; Arbel, Michael; Gretton, Arthur (2018). "Desmitificando las GAN MMD" . Conferencia Internacional sobre Representaciones de Aprendizaje . arXiv : 1801.01401 .
- ↑ Liu, Feng; Xu, Wenkai; Lu, Jie; Zhang, Guangquan; Gretton, Arthur; Sutherland, Danica J. (2020). "Learning Deep Kernels for Non-Parametric Two-Sample Tests" . Conferencia Internacional sobre Aprendizaje Automático : 6316–6326 . arXiv : 2002.09116 .
- ↑ Kübler, Jonas M.; Jitkrittum, Wittawat; Schölkopf, Bernhard ; Muandent, Krikamol (2021). "Una prueba de dos muestras de testigos" . Conferencia internacional sobre inteligencia artificial y estadística : 1403–1419 . arXiv : 2102.05573 .
- Teoría de las distribuciones de probabilidad
- Geometría métrica