Articulo de referencia

Integración de distribuciones en el núcleo

En el aprendizaje automático , la incrustación de distribuciones en el núcleo (también llamada media del núcleo o mapa de medias ) comprende una clase de métodos no paramétricos...

En el aprendizaje automático , la incrustación de distribuciones en el núcleo (también llamada media del núcleo o mapa de medias ) comprende una clase de métodos no paramétricos en los que una distribución de probabilidad se representa como un elemento de un espacio de Hilbert del núcleo de reproducción (RKHS). [1] Una generalización del mapeo de características de puntos de datos individuales realizado en métodos de núcleo clásicos , la incrustación de distribuciones en espacios de características de dimensión infinita puede preservar todas las características estadísticas de distribuciones arbitrarias, al tiempo que permite comparar y manipular distribuciones utilizando operaciones del espacio de Hilbert como productos internos , distancias, proyecciones , transformaciones lineales y análisis espectral . [2] Este marco de aprendizaje es muy general y se puede aplicar a distribuciones sobre cualquier espacio en el que se pueda definir una función de núcleo sensible (que mida la similitud entre elementos de ). Por ejemplo, se han propuesto varios núcleos para aprender a partir de datos que son: vectores en , clases/categorías discretas, cadenas , gráficos / redes , imágenes, series de tiempo , variedades , sistemas dinámicos y otros objetos estructurados. [3] [4] La teoría detrás de la incrustación de núcleos en distribuciones ha sido desarrollada principalmente por Alex Smola, Le Song, Arthur Gretton y Bernhard Schölkopf . Se puede encontrar una revisión de trabajos recientes sobre incrustación de núcleos en distribuciones. [5] Ω {\displaystyle \Omega } Ω {\displaystyle \Omega } R d {\displaystyle \mathbb {R} ^{d}}

El análisis de distribuciones es fundamental en el aprendizaje automático y las estadísticas , y muchos algoritmos en estos campos se basan en enfoques teóricos de la información como la entropía , la información mutua o la divergencia de Kullback-Leibler . Sin embargo, para estimar estas cantidades, primero se debe realizar una estimación de densidad o emplear estrategias sofisticadas de partición del espacio/corrección de sesgo que normalmente no son factibles para datos de alta dimensión. [6] Comúnmente, los métodos para modelar distribuciones complejas se basan en suposiciones paramétricas que pueden ser infundadas o computacionalmente desafiantes (por ejemplo, modelos de mezcla gaussiana ), mientras que los métodos no paramétricos como la estimación de densidad de kernel (Nota: los kernels de suavizado en este contexto tienen una interpretación diferente a los kernels discutidos aquí) o la representación de función característica (a través de la transformada de Fourier de la distribución) fallan en entornos de alta dimensión. [2]

Los métodos basados ​​en la incrustación del núcleo de las distribuciones evitan estos problemas y también poseen las siguientes ventajas: [6]

  1. Los datos pueden modelarse sin suposiciones restrictivas sobre la forma de las distribuciones y las relaciones entre las variables.
  2. No es necesaria una estimación de densidad intermedia
  3. Los profesionales pueden especificar las propiedades de una distribución más relevantes para su problema (incorporando conocimiento previo a través de la elección del kernel)
  4. Si se utiliza un núcleo característico , entonces la incrustación puede preservar de forma única toda la información sobre una distribución, mientras que gracias al truco del núcleo , los cálculos sobre el RKHS potencialmente de dimensión infinita se pueden implementar en la práctica como simples operaciones de matriz de Gram .
  5. Se pueden demostrar tasas de convergencia independientes de la dimensionalidad para la media del kernel empírica (estimada utilizando muestras de la distribución) hacia la incrustación del kernel de la distribución subyacente real.
  6. Los algoritmos de aprendizaje basados ​​en este marco muestran una buena capacidad de generalización y convergencia de muestras finitas, y a menudo son más simples y más efectivos que los métodos de teoría de la información.

Por lo tanto, el aprendizaje a través de la incorporación del núcleo de distribuciones ofrece un reemplazo directo y de principios para los enfoques de teoría de la información y es un marco que no solo incluye muchos métodos populares en aprendizaje automático y estadísticas como casos especiales, sino que también puede conducir a algoritmos de aprendizaje completamente nuevos.

Definiciones

Sea una variable aleatoria con dominio y distribución . Dado un núcleo simétrico, definido positivamente, el teorema de Moore-Aronszajn afirma la existencia de un único RKHS en (un espacio de Hilbert de funciones equipado con un producto interno y una norma ) para el cual es un núcleo reproductor, es decir, en el que el elemento satisface la propiedad de reproducción X {\displaystyle X} Ω {\displaystyle \Omega } P {\displaystyle P} k : Ω × Ω R {\displaystyle k:\Omega \times \Omega \rightarrow \mathbb {R} } H {\displaystyle {\mathcal {H}}} Ω {\displaystyle \Omega } f : Ω R {\displaystyle f:\Omega \to \mathbb {R} } , H {\displaystyle \langle \cdot ,\cdot \rangle _{\mathcal {H}}} H {\displaystyle \|\cdot \|_{\mathcal {H}}} k {\displaystyle k} k ( x , ) {\displaystyle k(x,\cdot )}

f , k ( x , ) H = f ( x ) f H , x Ω . {\displaystyle \langle f,k(x,\cdot )\rangle _{\mathcal {H}}=f(x)\qquad \forall f\in {\mathcal {H}},\quad \forall x\in \Omega .}

Alternativamente, se puede considerar como un mapeo de características implícito (que por lo tanto también se llama espacio de características), de modo que puede verse como una medida de similitud entre puntos. Si bien la medida de similitud es lineal en el espacio de características, puede ser altamente no lineal en el espacio original dependiendo de la elección del kernel. x k ( x , ) {\displaystyle x\mapsto k(x,\cdot )} φ : Ω H {\displaystyle \varphi :\Omega \rightarrow {\mathcal {H}}} k ( x , x ) = φ ( x ) , φ ( x ) H {\displaystyle k(x,x')=\langle \varphi (x),\varphi (x')\rangle _{\mathcal {H}}} x , x Ω . {\displaystyle x,x'\in \Omega .}

Incorporación de kernel

La incrustación del núcleo de la distribución en (también llamada media del núcleo o mapa de medias ) viene dada por: [1] P {\displaystyle P} H {\displaystyle {\mathcal {H}}}

μ X := E [ k ( X , ) ] = E [ φ ( X ) ] = Ω φ ( x )   d P ( x ) {\displaystyle \mu _{X}:=\mathbb {E} [k(X,\cdot )]=\mathbb {E} [\varphi (X)]=\int _{\Omega }\varphi (x)\ \mathrm {d} P(x)}

Si permite una densidad integrable cuadrada , entonces , donde es el operador integral de Hilbert–Schmidt . Un kernel es característico si la incrustación media es inyectiva. [7] Por lo tanto, cada distribución puede representarse de forma única en el RKHS y todas las características estadísticas de las distribuciones se conservan mediante la incrustación del kernel si se utiliza un kernel característico. P {\displaystyle P} p {\displaystyle p} μ X = E k p {\displaystyle \mu _{X}={\mathcal {E}}_{k}p} E k {\displaystyle {\mathcal {E}}_{k}} μ : { family of distributions over  Ω } H {\displaystyle \mu :\{{\text{family of distributions over }}\Omega \}\to {\mathcal {H}}}

Incorporación de núcleo empírico

Dados los ejemplos de entrenamiento extraídos de forma independiente e idénticamente distribuida (iid) a partir de la incrustación del núcleo, se pueden estimar empíricamente como n {\displaystyle n} { x 1 , , x n } {\displaystyle \{x_{1},\ldots ,x_{n}\}} P , {\displaystyle P,} P {\displaystyle P}

μ ^ X = 1 n i = 1 n φ ( x i ) {\displaystyle {\widehat {\mu }}_{X}={\frac {1}{n}}\sum _{i=1}^{n}\varphi (x_{i})}

Incorporación de distribución conjunta

Si denota otra variable aleatoria (para simplificar, suponga que el codominio de también tiene el mismo núcleo que satisface ), entonces la distribución conjunta se puede mapear en un espacio de características del producto tensorial a través de [2] Y {\displaystyle Y} Y {\displaystyle Y} Ω {\displaystyle \Omega } k {\displaystyle k} φ ( x ) φ ( y ) , φ ( x ) φ ( y ) = k ( x , x ) k ( y , y ) {\displaystyle \langle \varphi (x)\otimes \varphi (y),\varphi (x')\otimes \varphi (y')\rangle =k(x,x')k(y,y')} P ( x , y ) ) {\displaystyle P(x,y))} H H {\displaystyle {\mathcal {H}}\otimes {\mathcal {H}}}

C X Y = E [ φ ( X ) φ ( Y ) ] = Ω × Ω φ ( x ) φ ( y )   d P ( x , y ) {\displaystyle {\mathcal {C}}_{XY}=\mathbb {E} [\varphi (X)\otimes \varphi (Y)]=\int _{\Omega \times \Omega }\varphi (x)\otimes \varphi (y)\ \mathrm {d} P(x,y)}

Por la equivalencia entre un tensor y un mapa lineal , esta incrustación conjunta puede interpretarse como un operador de covarianza cruzada no centrado a partir del cual la covarianza cruzada de funciones puede calcularse como [8] C X Y : H H {\displaystyle {\mathcal {C}}_{XY}:{\mathcal {H}}\to {\mathcal {H}}} f , g H {\displaystyle f,g\in {\mathcal {H}}}

Cov ( f ( X ) , g ( Y ) ) := E [ f ( X ) g ( Y ) ] E [ f ( X ) ] E [ g ( Y ) ] = f , C X Y g H = f g , C X Y H H {\displaystyle \operatorname {Cov} (f(X),g(Y)):=\mathbb {E} [f(X)g(Y)]-\mathbb {E} [f(X)]\mathbb {E} [g(Y)]=\langle f,{\mathcal {C}}_{XY}g\rangle _{\mathcal {H}}=\langle f\otimes g,{\mathcal {C}}_{XY}\rangle _{{\mathcal {H}}\otimes {\mathcal {H}}}}

Dados pares de ejemplos de entrenamiento extraídos de iid , también podemos estimar empíricamente la incrustación del núcleo de distribución conjunta mediante n {\displaystyle n} { ( x 1 , y 1 ) , , ( x n , y n ) } {\displaystyle \{(x_{1},y_{1}),\dots ,(x_{n},y_{n})\}} P {\displaystyle P}

C ^ X Y = 1 n i = 1 n φ ( x i ) φ ( y i ) {\displaystyle {\widehat {\mathcal {C}}}_{XY}={\frac {1}{n}}\sum _{i=1}^{n}\varphi (x_{i})\otimes \varphi (y_{i})}

Incrustación de distribución condicional

Dada una distribución condicional se puede definir la incrustación RKHS correspondiente como [2] P ( y x ) , {\displaystyle P(y\mid x),}

μ Y x = E [ φ ( Y ) X ] = Ω φ ( y )   d P ( y x ) {\displaystyle \mu _{Y\mid x}=\mathbb {E} [\varphi (Y)\mid X]=\int _{\Omega }\varphi (y)\ \mathrm {d} P(y\mid x)}

Nótese que la incrustación de define así una familia de puntos en el RKHS indexados por los valores tomados por la variable condicionante . Al fijar un valor particular, obtenemos un único elemento en , y por lo tanto es natural definir el operador P ( y x ) {\displaystyle P(y\mid x)} x {\displaystyle x} X {\displaystyle X} X {\displaystyle X} H {\displaystyle {\mathcal {H}}}

{ C Y X : H H C Y X = C Y X C X X 1 {\displaystyle {\begin{cases}{\mathcal {C}}_{Y\mid X}:{\mathcal {H}}\to {\mathcal {H}}\\{\mathcal {C}}_{Y\mid X}={\mathcal {C}}_{YX}{\mathcal {C}}_{XX}^{-1}\end{cases}}}

que, dada la asignación de características de las salidas, la incrustación condicional de dado Suponiendo que para todos se puede demostrar que [8] x {\displaystyle x} Y {\displaystyle Y} X = x . {\displaystyle X=x.} g H : E [ g ( Y ) X ] H , {\displaystyle g\in {\mathcal {H}}:\mathbb {E} [g(Y)\mid X]\in {\mathcal {H}},}

μ Y x = C Y X φ ( x ) {\displaystyle \mu _{Y\mid x}={\mathcal {C}}_{Y\mid X}\varphi (x)}

Esta suposición siempre es verdadera para dominios finitos con núcleos característicos, pero no necesariamente para dominios continuos. [2] Sin embargo, incluso en casos donde la suposición falla, todavía puede usarse para aproximar la incrustación del núcleo condicional y, en la práctica, el operador de inversión se reemplaza con una versión regularizada de sí mismo (donde denota la matriz identidad ). C Y X φ ( x ) {\displaystyle {\mathcal {C}}_{Y\mid X}\varphi (x)} μ Y x , {\displaystyle \mu _{Y\mid x},} ( C X X + λ I ) 1 {\displaystyle ({\mathcal {C}}_{XX}+\lambda \mathbf {I} )^{-1}} I {\displaystyle \mathbf {I} }

Dados ejemplos de entrenamiento, el operador de incrustación condicional del núcleo empírico se puede estimar como [2] { ( x 1 , y 1 ) , , ( x n , y n ) } , {\displaystyle \{(x_{1},y_{1}),\dots ,(x_{n},y_{n})\},}

C ^ Y X = Φ ( K + λ I ) 1 Υ T {\displaystyle {\widehat {C}}_{Y\mid X}={\boldsymbol {\Phi }}(\mathbf {K} +\lambda \mathbf {I} )^{-1}{\boldsymbol {\Upsilon }}^{T}}

donde son matrices de características formadas implícitamente, es la matriz de Gram para muestras de , y es un parámetro de regularización necesario para evitar el sobreajuste . Φ = ( φ ( y 1 ) , , φ ( y n ) ) , Υ = ( φ ( x 1 ) , , φ ( x n ) ) {\displaystyle {\boldsymbol {\Phi }}=\left(\varphi (y_{1}),\dots ,\varphi (y_{n})\right),{\boldsymbol {\Upsilon }}=\left(\varphi (x_{1}),\dots ,\varphi (x_{n})\right)} K = Υ T Υ {\displaystyle \mathbf {K} ={\boldsymbol {\Upsilon }}^{T}{\boldsymbol {\Upsilon }}} X {\displaystyle X} λ {\displaystyle \lambda }

Por lo tanto, la estimación empírica de la incrustación condicional del núcleo se da mediante una suma ponderada de muestras en el espacio de características: Y {\displaystyle Y}

μ ^ Y x = i = 1 n β i ( x ) φ ( y i ) = Φ β ( x ) {\displaystyle {\widehat {\mu }}_{Y\mid x}=\sum _{i=1}^{n}\beta _{i}(x)\varphi (y_{i})={\boldsymbol {\Phi }}{\boldsymbol {\beta }}(x)}

donde y β ( x ) = ( K + λ I ) 1 K x {\displaystyle {\boldsymbol {\beta }}(x)=(\mathbf {K} +\lambda \mathbf {I} )^{-1}\mathbf {K} _{x}} K x = ( k ( x 1 , x ) , , k ( x n , x ) ) T {\displaystyle \mathbf {K} _{x}=\left(k(x_{1},x),\dots ,k(x_{n},x)\right)^{T}}

Propiedades

  • La expectativa de cualquier función en el RKHS se puede calcular como un producto interno con la incrustación del núcleo: f {\displaystyle f}
E [ f ( X ) ] = f , μ X H {\displaystyle \mathbb {E} [f(X)]=\langle f,\mu _{X}\rangle _{\mathcal {H}}}
  • En presencia de muestras de gran tamaño, las manipulaciones de la matriz de Gram pueden ser computacionalmente exigentes. Mediante el uso de una aproximación de bajo rango de la matriz de Gram (como la factorización incompleta de Cholesky ), el tiempo de ejecución y los requisitos de memoria de los algoritmos de aprendizaje basados ​​en la incrustación de núcleos se pueden reducir drásticamente sin sufrir una gran pérdida en la precisión de la aproximación. [2] n × n {\displaystyle n\times n}

Convergencia de la media del núcleo empírico con la incrustación de la distribución verdadera

  • Si se define de tal manera que toma valores en para todos con (como es el caso de los núcleos de función de base radial ampliamente utilizados ), entonces con probabilidad al menos : [6] k {\displaystyle k} f {\displaystyle f} [ 0 , 1 ] {\displaystyle [0,1]} f H {\displaystyle f\in {\mathcal {H}}} f H 1 {\displaystyle \|f\|_{\mathcal {H}}\leq 1} 1 δ {\displaystyle 1-\delta }
μ X μ ^ X H = sup f B ( 0 , 1 ) | E [ f ( X ) ] 1 n i = 1 n f ( x i ) | 2 n E [ tr K ] + log ( 2 / δ ) 2 n {\displaystyle \|\mu _{X}-{\widehat {\mu }}_{X}\|_{\mathcal {H}}=\sup _{f\in {\mathcal {B}}(0,1)}\left|\mathbb {E} [f(X)]-{\frac {1}{n}}\sum _{i=1}^{n}f(x_{i})\right|\leq {\frac {2}{n}}\mathbb {E} \left[{\sqrt {\operatorname {tr} K}}\right]+{\sqrt {\frac {\log(2/\delta )}{2n}}}}
donde denota la bola unitaria en y es la matriz de Gram con B ( 0 , 1 ) {\displaystyle {\mathcal {B}}(0,1)} H {\displaystyle {\mathcal {H}}} K = ( k i j ) {\displaystyle \mathbf {K} =(k_{ij})} k i j = k ( x i , x j ) . {\displaystyle k_{ij}=k(x_{i},x_{j}).}
  • La tasa de convergencia (en la norma RKHS) de la incrustación del núcleo empírico a su contraparte de distribución es y no depende de la dimensión de . O ( n 1 / 2 ) {\displaystyle O(n^{-1/2})} X {\displaystyle X}
  • Las estadísticas basadas en incrustaciones de kernel evitan así la maldición de la dimensionalidad , y aunque en la práctica se desconoce la verdadera distribución subyacente, se puede (con alta probabilidad) obtener una aproximación dentro de la verdadera incrustación de kernel basada en una muestra finita de tamaño . O ( n 1 / 2 ) {\displaystyle O(n^{-1/2})} n {\displaystyle n}
  • Para la incrustación de distribuciones condicionales, la estimación empírica puede verse como un promedio ponderado de asignaciones de características (donde los pesos dependen del valor de la variable de condicionamiento y capturan el efecto del condicionamiento en la incrustación del núcleo). En este caso, la estimación empírica converge a la incrustación de distribución condicional RKHS con una tasa si se reduce el parámetro de regularización , como si se pudieran lograr tasas de convergencia más rápidas al colocar suposiciones adicionales en la distribución conjunta. [2] β i ( x ) {\displaystyle \beta _{i}(x)} O ( n 1 / 4 ) {\displaystyle O\left(n^{-1/4}\right)} λ {\displaystyle \lambda } O ( n 1 / 2 ) , {\displaystyle O\left(n^{-1/2}\right),}

Núcleos universales

  • Sea un espacio métrico compacto y el conjunto de funciones continuas . El núcleo reproductor se llama universal si y sólo si el RKHS de es denso en , es decir, para cualquier y todos existe un tal que . [9] Todos los núcleos universales definidos en un espacio compacto son núcleos característicos pero lo inverso no siempre es cierto. [10] X R b {\displaystyle {\mathcal {X}}\subseteq \mathbb {R} ^{b}} C ( X ) {\displaystyle C({\mathcal {X}})} k : X × X R {\displaystyle k:{\mathcal {X}}\times {\mathcal {X}}\rightarrow \mathbb {R} } H {\displaystyle {\mathcal {H}}} k {\displaystyle k} C ( X ) {\displaystyle C({\mathcal {X}})} g C ( X ) {\displaystyle g\in C({\mathcal {X}})} ε > 0 {\displaystyle \varepsilon >0} f H {\displaystyle f\in {\mathcal {H}}} f g ε {\displaystyle \|f-g\|_{\infty }\leq \varepsilon }
  • Sea un núcleo invariante de traducción continua con . Entonces el teorema de Bochner garantiza la existencia de una medida de Borel finita única (llamada medida espectral ) en tal que k {\displaystyle k} k ( x , x ) = h ( x x ) {\displaystyle k(x,x')=h(x-x')} x R b {\displaystyle x\in \mathbb {R} ^{b}} μ {\displaystyle \mu } R b {\displaystyle \mathbb {R} ^{b}}
h ( t ) = R b e i t , ω d μ ( ω ) , t R b . {\displaystyle h(t)=\int _{\mathbb {R} ^{b}}e^{-i\langle t,\omega \rangle }d\mu (\omega ),\quad \forall t\in \mathbb {R} ^{b}.}
Para que sea universal basta que la parte continua de en su única descomposición de Lebesgue sea distinta de cero. Además, si k {\displaystyle k} μ {\displaystyle \mu } μ = μ c + μ s {\displaystyle \mu =\mu _{c}+\mu _{s}}
d μ c ( ω ) = s ( ω ) d ω , {\displaystyle d\mu _{c}(\omega )=s(\omega )d\omega ,}
entonces es la densidad espectral de frecuencias en y es la transformada de Fourier de . Si el soporte de es todo de , entonces es también un núcleo característico. [11] [12] [13] s {\displaystyle s} ω {\displaystyle \omega } R b {\displaystyle \mathbb {R} ^{b}} h {\displaystyle h} s {\displaystyle s} μ {\displaystyle \mu } R b {\displaystyle \mathbb {R} ^{b}} k {\displaystyle k}
  • Si induce una matriz de núcleo definida estrictamente positiva para cualquier conjunto de puntos distintos, entonces es un núcleo universal. [6] Por ejemplo, el núcleo RBF gaussiano ampliamente utilizado k {\displaystyle k}
k ( x , x ) = exp ( 1 2 σ 2 x x 2 ) {\displaystyle k(x,x')=\exp \left(-{\frac {1}{2\sigma ^{2}}}\|x-x'\|^{2}\right)}
en subconjuntos compactos de es universal. R b {\displaystyle \mathbb {R} ^{b}}

Selección de parámetros para incrustaciones de núcleos de distribución condicional

  • El operador de incrustación de distribución condicional de núcleo empírico puede verse alternativamente como la solución del siguiente problema de regresión de mínimos cuadrados regularizados (con valor de función) [14] C ^ Y | X {\displaystyle {\widehat {\mathcal {C}}}_{Y|X}}
min C : H H i = 1 n φ ( y i ) C φ ( x i ) H 2 + λ C H S 2 {\displaystyle \min _{{\mathcal {C}}:{\mathcal {H}}\to {\mathcal {H}}}\sum _{i=1}^{n}\left\|\varphi (y_{i})-{\mathcal {C}}\varphi (x_{i})\right\|_{\mathcal {H}}^{2}+\lambda \|{\mathcal {C}}\|_{HS}^{2}}
¿Dónde está la norma de Hilbert-Schmidt ? H S {\displaystyle \|\cdot \|_{HS}}
  • De este modo, se puede seleccionar el parámetro de regularización realizando una validación cruzada basada en la función de pérdida al cuadrado del problema de regresión. λ {\displaystyle \lambda }

Reglas de probabilidad como operaciones en la RKHS

Esta sección ilustra cómo las reglas probabilísticas básicas pueden reformularse como operaciones algebraicas (multi)lineales en el marco de incrustación del núcleo y se basa principalmente en el trabajo de Song et al. [2] [8] Se adopta la siguiente notación:

  • P ( X , Y ) = {\displaystyle P(X,Y)=} distribución conjunta sobre variables aleatorias X , Y {\displaystyle X,Y}
  • P ( X ) = Ω P ( X , d y ) = {\displaystyle P(X)=\int _{\Omega }P(X,\mathrm {d} y)=} distribución marginal de ; distribución marginal de X {\displaystyle X} P ( Y ) = {\displaystyle P(Y)=} Y {\displaystyle Y}
  • P ( Y X ) = P ( X , Y ) P ( X ) = {\displaystyle P(Y\mid X)={\frac {P(X,Y)}{P(X)}}=} distribución condicional de lo dado con el operador de incrustación condicional correspondiente Y {\displaystyle Y} X {\displaystyle X} C Y X {\displaystyle {\mathcal {C}}_{Y\mid X}}
  • π ( Y ) = {\displaystyle \pi (Y)=} distribución previa sobre Y {\displaystyle Y}
  • Q {\displaystyle Q} Se utiliza para distinguir distribuciones que incorporan lo anterior de distribuciones que no se basan en lo anterior. P {\displaystyle P}

En la práctica, todas las incrustaciones se estiman empíricamente a partir de datos y se supone que se puede utilizar un conjunto de muestras para estimar la incrustación del núcleo de la distribución previa . { ( x 1 , y 1 ) , , ( x n , y n ) } {\displaystyle \{(x_{1},y_{1}),\dots ,(x_{n},y_{n})\}} { y ~ 1 , , y ~ n ~ } {\displaystyle \{{\widetilde {y}}_{1},\ldots ,{\widetilde {y}}_{\widetilde {n}}\}} π ( Y ) {\displaystyle \pi (Y)}

Regla de suma de kernel

En la teoría de la probabilidad, la distribución marginal de se puede calcular integrando a partir de la densidad conjunta (incluida la distribución previa en ) X {\displaystyle X} Y {\displaystyle Y} Y {\displaystyle Y}

Q ( X ) = Ω P ( X Y ) d π ( Y ) {\displaystyle Q(X)=\int _{\Omega }P(X\mid Y)\,\mathrm {d} \pi (Y)}

El análogo de esta regla en el marco de incrustación del núcleo establece que la incrustación RKHS de , se puede calcular mediante μ X π , {\displaystyle \mu _{X}^{\pi },} Q ( X ) {\displaystyle Q(X)}

μ X π = E [ C X Y φ ( Y ) ] = C X Y E [ φ ( Y ) ] = C X Y μ Y π {\displaystyle \mu _{X}^{\pi }=\mathbb {E} [{\mathcal {C}}_{X\mid Y}\varphi (Y)]={\mathcal {C}}_{X\mid Y}\mathbb {E} [\varphi (Y)]={\mathcal {C}}_{X\mid Y}\mu _{Y}^{\pi }}

¿Dónde está la incrustación del núcleo de En implementaciones prácticas, la regla de suma del núcleo toma la siguiente forma μ Y π {\displaystyle \mu _{Y}^{\pi }} π ( Y ) . {\displaystyle \pi (Y).}

μ ^ X π = C ^ X Y μ ^ Y π = Υ ( G + λ I ) 1 G ~ α {\displaystyle {\widehat {\mu }}_{X}^{\pi }={\widehat {\mathcal {C}}}_{X\mid Y}{\widehat {\mu }}_{Y}^{\pi }={\boldsymbol {\Upsilon }}(\mathbf {G} +\lambda \mathbf {I} )^{-1}{\widetilde {\mathbf {G} }}{\boldsymbol {\alpha }}}

dónde

μ Y π = i = 1 n ~ α i φ ( y ~ i ) {\displaystyle \mu _{Y}^{\pi }=\sum _{i=1}^{\widetilde {n}}\alpha _{i}\varphi ({\widetilde {y}}_{i})}

es la incrustación del núcleo empírico de la distribución anterior, y son matrices de Gram con entradas respectivamente. α = ( α 1 , , α n ~ ) T , {\displaystyle {\boldsymbol {\alpha }}=(\alpha _{1},\ldots ,\alpha _{\widetilde {n}})^{T},} Υ = ( φ ( x 1 ) , , φ ( x n ) ) {\displaystyle {\boldsymbol {\Upsilon }}=\left(\varphi (x_{1}),\ldots ,\varphi (x_{n})\right)} G , G ~ {\displaystyle \mathbf {G} ,{\widetilde {\mathbf {G} }}} G i j = k ( y i , y j ) , G ~ i j = k ( y i , y ~ j ) {\displaystyle \mathbf {G} _{ij}=k(y_{i},y_{j}),{\widetilde {\mathbf {G} }}_{ij}=k(y_{i},{\widetilde {y}}_{j})}

Regla de la cadena del núcleo

En la teoría de la probabilidad, una distribución conjunta se puede factorizar en un producto entre distribuciones condicionales y marginales.

Q ( X , Y ) = P ( X Y ) π ( Y ) {\displaystyle Q(X,Y)=P(X\mid Y)\pi (Y)}

El análogo de esta regla en el marco de incrustación del núcleo establece que la incrustación conjunta de se puede factorizar como una composición del operador de incrustación condicional con el operador de autocovarianza asociado con C X Y π , {\displaystyle {\mathcal {C}}_{XY}^{\pi },} Q ( X , Y ) , {\displaystyle Q(X,Y),} π ( Y ) {\displaystyle \pi (Y)}

C X Y π = C X Y C Y Y π {\displaystyle {\mathcal {C}}_{XY}^{\pi }={\mathcal {C}}_{X\mid Y}{\mathcal {C}}_{YY}^{\pi }}

dónde

C X Y π = E [ φ ( X ) φ ( Y ) ] , {\displaystyle {\mathcal {C}}_{XY}^{\pi }=\mathbb {E} [\varphi (X)\otimes \varphi (Y)],}
C Y Y π = E [ φ ( Y ) φ ( Y ) ] . {\displaystyle {\mathcal {C}}_{YY}^{\pi }=\mathbb {E} [\varphi (Y)\otimes \varphi (Y)].}

En implementaciones prácticas, la regla de la cadena del núcleo toma la siguiente forma

C ^ X Y π = C ^ X Y C ^ Y Y π = Υ ( G + λ I ) 1 G ~ diag ( α ) Φ ~ T {\displaystyle {\widehat {\mathcal {C}}}_{XY}^{\pi }={\widehat {\mathcal {C}}}_{X\mid Y}{\widehat {\mathcal {C}}}_{YY}^{\pi }={\boldsymbol {\Upsilon }}(\mathbf {G} +\lambda \mathbf {I} )^{-1}{\widetilde {\mathbf {G} }}\operatorname {diag} ({\boldsymbol {\alpha }}){\boldsymbol {\widetilde {\Phi }}}^{T}}

Regla de Bayes del núcleo

En la teoría de la probabilidad, una distribución posterior se puede expresar en términos de una distribución previa y una función de probabilidad como

Q ( Y x ) = P ( x Y ) π ( Y ) Q ( x ) {\displaystyle Q(Y\mid x)={\frac {P(x\mid Y)\pi (Y)}{Q(x)}}} dónde Q ( x ) = Ω P ( x y ) d π ( y ) {\displaystyle Q(x)=\int _{\Omega }P(x\mid y)\,\mathrm {d} \pi (y)}

El análogo de esta regla en el marco de incrustación del núcleo expresa la incrustación del núcleo de la distribución condicional en términos de operadores de incrustación condicional que son modificados por la distribución anterior.

μ Y x π = C Y X π φ ( x ) = C Y X π ( C X X π ) 1 φ ( x ) {\displaystyle \mu _{Y\mid x}^{\pi }={\mathcal {C}}_{Y\mid X}^{\pi }\varphi (x)={\mathcal {C}}_{YX}^{\pi }\left({\mathcal {C}}_{XX}^{\pi }\right)^{-1}\varphi (x)}

De donde proviene la regla de la cadena:

C Y X π = ( C X Y C Y Y π ) T . {\displaystyle {\mathcal {C}}_{YX}^{\pi }=\left({\mathcal {C}}_{X\mid Y}{\mathcal {C}}_{YY}^{\pi }\right)^{T}.}

En implementaciones prácticas, la regla de Bayes del núcleo toma la siguiente forma

μ ^ Y x π = C ^ Y X π ( ( C ^ X X ) 2 + λ ~ I ) 1 C ^ X X π φ ( x ) = Φ ~ Λ T ( ( D K ) 2 + λ ~ I ) 1 K D K x {\displaystyle {\widehat {\mu }}_{Y\mid x}^{\pi }={\widehat {\mathcal {C}}}_{YX}^{\pi }\left(\left({\widehat {\mathcal {C}}}_{XX}\right)^{2}+{\widetilde {\lambda }}\mathbf {I} \right)^{-1}{\widehat {\mathcal {C}}}_{XX}^{\pi }\varphi (x)={\widetilde {\boldsymbol {\Phi }}}{\boldsymbol {\Lambda }}^{T}\left((\mathbf {D} \mathbf {K} )^{2}+{\widetilde {\lambda }}\mathbf {I} \right)^{-1}\mathbf {K} \mathbf {D} \mathbf {K} _{x}}

dónde

Λ = ( G + λ ~ I ) 1 G ~ diag ( α ) , D = diag ( ( G + λ ~ I ) 1 G ~ α ) . {\displaystyle {\boldsymbol {\Lambda }}=\left(\mathbf {G} +{\widetilde {\lambda }}\mathbf {I} \right)^{-1}{\widetilde {\mathbf {G} }}\operatorname {diag} ({\boldsymbol {\alpha }}),\qquad \mathbf {D} =\operatorname {diag} \left(\left(\mathbf {G} +{\widetilde {\lambda }}\mathbf {I} \right)^{-1}{\widetilde {\mathbf {G} }}{\boldsymbol {\alpha }}\right).}

En este marco se utilizan dos parámetros de regularización: para la estimación de y para la estimación del operador de incrustación condicional final. λ {\displaystyle \lambda } C ^ Y X π , C ^ X X π = Υ D Υ T {\displaystyle {\widehat {\mathcal {C}}}_{YX}^{\pi },{\widehat {\mathcal {C}}}_{XX}^{\pi }={\boldsymbol {\Upsilon }}\mathbf {D} {\boldsymbol {\Upsilon }}^{T}} λ ~ {\displaystyle {\widetilde {\lambda }}}

C ^ Y X π = C ^ Y X π ( ( C ^ X X π ) 2 + λ ~ I ) 1 C ^ X X π . {\displaystyle {\widehat {\mathcal {C}}}_{Y\mid X}^{\pi }={\widehat {\mathcal {C}}}_{YX}^{\pi }\left(\left({\widehat {\mathcal {C}}}_{XX}^{\pi }\right)^{2}+{\widetilde {\lambda }}\mathbf {I} \right)^{-1}{\widehat {\mathcal {C}}}_{XX}^{\pi }.}

La última regularización se realiza sobre el cuadrado de porque puede no ser definida positiva . C ^ X X π {\displaystyle {\widehat {\mathcal {C}}}_{XX}^{\pi }} D {\displaystyle D}

Aplicaciones

Medición de distancias entre distribuciones

La discrepancia media máxima (MMD) es una medida de distancia entre distribuciones y que se define como la distancia entre sus incrustaciones en el RKHS [6] P ( X ) {\displaystyle P(X)} Q ( Y ) {\displaystyle Q(Y)}

MMD ( P , Q ) = μ X μ Y H . {\displaystyle {\text{MMD}}(P,Q)=\left\|\mu _{X}-\mu _{Y}\right\|_{\mathcal {H}}.}

Si bien la mayoría de las medidas de distancia entre distribuciones, como la divergencia de Kullback-Leibler ampliamente utilizada , requieren una estimación de densidad (paramétrica o no paramétrica) o estrategias de partición espacial/corrección de sesgo, [6] la MMD se estima fácilmente como una media empírica que se concentra alrededor del valor verdadero de la MMD. La caracterización de esta distancia como la discrepancia media máxima se refiere al hecho de que calcular la MMD es equivalente a encontrar la función RKHS que maximiza la diferencia en las expectativas entre las dos distribuciones de probabilidad.

MMD ( P , Q ) = sup f H 1 ( E [ f ( X ) ] E [ f ( Y ) ] ) , {\displaystyle {\text{MMD}}(P,Q)=\sup _{\|f\|_{\mathcal {H}}\leq 1}\left(\mathbb {E} [f(X)]-\mathbb {E} [f(Y)]\right),}

una forma de métrica de probabilidad integral .

Prueba de dos muestras del núcleo

Dados n ejemplos de entrenamiento de y m muestras de , se puede formular una estadística de prueba basada en la estimación empírica de la MMD P ( X ) {\displaystyle P(X)} Q ( Y ) {\displaystyle Q(Y)}

MMD ^ ( P , Q ) = 1 n i = 1 n φ ( x i ) 1 m i = 1 m φ ( y i ) H 2 = 1 n 2 i = 1 n j = 1 n k ( x i , x j ) + 1 m 2 i = 1 m j = 1 m k ( y i , y j ) 2 n m i = 1 n j = 1 m k ( x i , y j ) {\displaystyle {\begin{aligned}{\widehat {\text{MMD}}}(P,Q)&=\left\|{\frac {1}{n}}\sum _{i=1}^{n}\varphi (x_{i})-{\frac {1}{m}}\sum _{i=1}^{m}\varphi (y_{i})\right\|_{\mathcal {H}}^{2}\\[5pt]&={\frac {1}{n^{2}}}\sum _{i=1}^{n}\sum _{j=1}^{n}k(x_{i},x_{j})+{\frac {1}{m^{2}}}\sum _{i=1}^{m}\sum _{j=1}^{m}k(y_{i},y_{j})-{\frac {2}{nm}}\sum _{i=1}^{n}\sum _{j=1}^{m}k(x_{i},y_{j})\end{aligned}}}

para obtener una prueba de dos muestras [15] de la hipótesis nula de que ambas muestras provienen de la misma distribución (es decir, ) frente a la alternativa amplia . P = Q {\displaystyle P=Q} P Q {\displaystyle P\neq Q}

Estimación de densidad mediante incrustaciones de kernel

Aunque los algoritmos de aprendizaje en el marco de incrustación de núcleos evitan la necesidad de una estimación de densidad intermedia, se puede utilizar la incrustación empírica para realizar una estimación de densidad basada en n muestras extraídas de una distribución subyacente . Esto se puede hacer resolviendo el siguiente problema de optimización [6] [16] P X {\displaystyle P_{X}^{*}}

max P X H ( P X ) {\displaystyle \max _{P_{X}}H(P_{X})} sujeto a μ ^ X μ X [ P X ] H ε {\displaystyle \|{\widehat {\mu }}_{X}-\mu _{X}[P_{X}]\|_{\mathcal {H}}\leq \varepsilon }

donde la maximización se realiza sobre todo el espacio de distribuciones en Aquí, es la incrustación del kernel de la densidad propuesta y es una cantidad similar a la entropía (por ejemplo, Entropía , divergencia KL , divergencia de Bregman ). La distribución que resuelve esta optimización puede interpretarse como un compromiso entre ajustar bien las medias del kernel empíricas de las muestras, mientras se sigue asignando una parte sustancial de la masa de probabilidad a todas las regiones del espacio de probabilidad (muchas de las cuales pueden no estar representadas en los ejemplos de entrenamiento). En la práctica, se puede encontrar una buena solución aproximada de la difícil optimización restringiendo el espacio de densidades candidatas a una mezcla de M distribuciones candidatas con proporciones de mezcla regularizadas. Se pueden establecer conexiones entre las ideas que subyacen a los procesos gaussianos y los campos aleatorios condicionales con la estimación de distribuciones de probabilidad condicional de esta manera, si se consideran las asignaciones de características asociadas con el kernel como estadísticas suficientes en familias exponenciales generalizadas (posiblemente de dimensión infinita) . [6] Ω . {\displaystyle \Omega .} μ X [ P X ] {\displaystyle \mu _{X}[P_{X}]} P X {\displaystyle P_{X}} H {\displaystyle H}

Medición de la dependencia de variables aleatorias

Se puede formular una medida de la dependencia estadística entre variables aleatorias y (de cualquier dominio en el que se puedan definir núcleos sensibles) basándose en el criterio de independencia de Hilbert-Schmidt [17]. X {\displaystyle X} Y {\displaystyle Y}

HSIC ( X , Y ) = C X Y μ X μ Y H H 2 {\displaystyle {\text{HSIC}}(X,Y)=\left\|{\mathcal {C}}_{XY}-\mu _{X}\otimes \mu _{Y}\right\|_{{\mathcal {H}}\otimes {\mathcal {H}}}^{2}}

y se puede utilizar como un reemplazo de principios para la información mutua , la correlación de Pearson o cualquier otra medida de dependencia utilizada en algoritmos de aprendizaje. En particular, HSIC puede detectar dependencias arbitrarias (cuando se utiliza un núcleo característico en las incrustaciones, HSIC es cero si y solo si las variables son independientes ), y se puede utilizar para medir la dependencia entre diferentes tipos de datos (por ejemplo, imágenes y subtítulos de texto). Dadas n muestras iid de cada variable aleatoria, se puede calcular en el tiempo un estimador imparcial simple sin parámetros de HSIC que exhibe concentración sobre el valor verdadero , [6] donde las matrices de Gram de los dos conjuntos de datos se aproximan utilizando con . Las propiedades deseables de HSIC han llevado a la formulación de numerosos algoritmos que utilizan esta medida de dependencia para una variedad de tareas comunes de aprendizaje automático, como: selección de características (BAHSIC [18] ), agrupamiento (CLUHSIC [19] ) y reducción de dimensionalidad (MUHSIC [20] ). O ( n ( d f 2 + d g 2 ) ) {\displaystyle O(n(d_{f}^{2}+d_{g}^{2}))} A A T , B B T {\displaystyle \mathbf {A} \mathbf {A} ^{T},\mathbf {B} \mathbf {B} ^{T}} A R n × d f , B R n × d g {\displaystyle \mathbf {A} \in \mathbb {R} ^{n\times d_{f}},\mathbf {B} \in \mathbb {R} ^{n\times d_{g}}}

El HSIC se puede ampliar para medir la dependencia de múltiples variables aleatorias. La cuestión de cuándo el HSIC captura la independencia en este caso se ha estudiado recientemente: [21] para más de dos variables

  • en : la propiedad característica de los granos individuales permanece como una condición equivalente. R d {\displaystyle \mathbb {R} ^{d}}
  • sobre dominios generales: la propiedad característica de los componentes del núcleo es necesaria pero no suficiente .

Propagación de creencias del núcleo

La propagación de creencias es un algoritmo fundamental para la inferencia en modelos gráficos en los que los nodos pasan y reciben repetidamente mensajes correspondientes a la evaluación de expectativas condicionales. En el marco de incrustación de kernel, los mensajes pueden representarse como funciones RKHS y las incrustaciones de distribución condicional pueden aplicarse para calcular de manera eficiente las actualizaciones de mensajes. Dadas n muestras de variables aleatorias representadas por nodos en un campo aleatorio de Markov , el mensaje entrante al nodo t desde el nodo u puede expresarse como

m u t ( ) = i = 1 n β u t i φ ( x t i ) {\displaystyle m_{ut}(\cdot )=\sum _{i=1}^{n}\beta _{ut}^{i}\varphi (x_{t}^{i})}

Si se supone que se encuentra en el RKHS, el mensaje de actualización de propagación de creencias del núcleo desde t al nodo s se obtiene mediante [2].

m ^ t s = ( u N ( t ) s K t β u t ) T ( K s + λ I ) 1 Υ s T φ ( x s ) {\displaystyle {\widehat {m}}_{ts}=\left(\odot _{u\in N(t)\backslash s}\mathbf {K} _{t}{\boldsymbol {\beta }}_{ut}\right)^{T}(\mathbf {K} _{s}+\lambda \mathbf {I} )^{-1}{\boldsymbol {\Upsilon }}_{s}^{T}\varphi (x_{s})}

donde denota el producto vectorial elemento por elemento, es el conjunto de nodos conectados a t excluyendo el nodo s , , son las matrices de Gram de las muestras de las variables , respectivamente, y es la matriz de características de las muestras de . {\displaystyle \odot } N ( t ) s {\displaystyle N(t)\backslash s} β u t = ( β u t 1 , , β u t n ) {\displaystyle {\boldsymbol {\beta }}_{ut}=\left(\beta _{ut}^{1},\dots ,\beta _{ut}^{n}\right)} K t , K s {\displaystyle \mathbf {K} _{t},\mathbf {K} _{s}} X t , X s {\displaystyle X_{t},X_{s}} Υ s = ( φ ( x s 1 ) , , φ ( x s n ) ) {\displaystyle {\boldsymbol {\Upsilon }}_{s}=\left(\varphi (x_{s}^{1}),\dots ,\varphi (x_{s}^{n})\right)} X s {\displaystyle X_{s}}

Por lo tanto, si los mensajes entrantes al nodo t son combinaciones lineales de muestras con características asignadas de , entonces el mensaje saliente de este nodo también es una combinación lineal de muestras con características asignadas de . Por lo tanto, esta representación de la función RKHS de las actualizaciones de paso de mensajes produce un algoritmo de propagación de creencias eficiente en el que los potenciales son funciones no paramétricas inferidas a partir de los datos, de modo que se pueden modelar relaciones estadísticas arbitrarias. [2] X t {\displaystyle X_{t}} X s {\displaystyle X_{s}}

Filtrado no paramétrico en modelos ocultos de Markov

En el modelo oculto de Markov (HMM), dos magnitudes clave de interés son las probabilidades de transición entre estados ocultos y las probabilidades de emisión de las observaciones. Utilizando el marco de incrustación de distribución condicional de kernel, estas magnitudes pueden expresarse en términos de muestras del HMM. Una limitación importante de los métodos de incrustación en este dominio es la necesidad de muestras de entrenamiento que contengan estados ocultos, ya que de lo contrario no es posible realizar inferencias con distribuciones arbitrarias en el HMM. P ( S t S t 1 ) {\displaystyle P(S^{t}\mid S^{t-1})} P ( O t S t ) {\displaystyle P(O^{t}\mid S^{t})}

Un uso común de los HMM es el filtrado, en el que el objetivo es estimar la distribución posterior sobre el estado oculto en el paso de tiempo t dado un historial de observaciones previas del sistema. En el filtrado, un estado de creencia se mantiene recursivamente a través de un paso de predicción (donde las actualizaciones se calculan marginando el estado oculto anterior) seguido de un paso de condicionamiento (donde las actualizaciones se calculan aplicando la regla de Bayes para condicionar una nueva observación). [2] La incrustación RKHS del estado de creencia en el momento t+1 se puede expresar recursivamente como s t {\displaystyle s^{t}} h t = ( o 1 , , o t ) {\displaystyle h^{t}=(o^{1},\dots ,o^{t})} P ( S t + 1 h t + 1 ) {\displaystyle P(S^{t+1}\mid h^{t+1})} P ( S t + 1 h t ) = E [ P ( S t + 1 S t ) h t ] {\displaystyle P(S^{t+1}\mid h^{t})=\mathbb {E} [P(S^{t+1}\mid S^{t})\mid h^{t}]} P ( S t + 1 h t , o t + 1 ) P ( o t + 1 S t + 1 ) P ( S t + 1 h t ) {\displaystyle P(S^{t+1}\mid h^{t},o^{t+1})\propto P(o^{t+1}\mid S^{t+1})P(S^{t+1}\mid h^{t})}

μ S t + 1 h t + 1 = C S t + 1 O t + 1 π ( C O t + 1 O t + 1 π ) 1 φ ( o t + 1 ) {\displaystyle \mu _{S^{t+1}\mid h^{t+1}}={\mathcal {C}}_{S^{t+1}O^{t+1}}^{\pi }\left({\mathcal {C}}_{O^{t+1}O^{t+1}}^{\pi }\right)^{-1}\varphi (o^{t+1})}

calculando las incrustaciones del paso de predicción mediante la regla de suma de kernel y la incrustación del paso de condicionamiento mediante la regla de Bayes de kernel. Suponiendo que se proporciona una muestra de entrenamiento, en la práctica se puede estimar ( s ~ 1 , , s ~ T , o ~ 1 , , o ~ T ) {\displaystyle ({\widetilde {s}}^{1},\dots ,{\widetilde {s}}^{T},{\widetilde {o}}^{1},\dots ,{\widetilde {o}}^{T})}

μ ^ S t + 1 h t + 1 = i = 1 T α i t φ ( s ~ t ) {\displaystyle {\widehat {\mu }}_{S^{t+1}\mid h^{t+1}}=\sum _{i=1}^{T}\alpha _{i}^{t}\varphi ({\widetilde {s}}^{t})}

y el filtrado con incrustaciones de kernel se implementa de forma recursiva utilizando las siguientes actualizaciones para los pesos [2] α = ( α 1 , , α T ) {\displaystyle {\boldsymbol {\alpha }}=(\alpha _{1},\dots ,\alpha _{T})}

D t + 1 = diag ( ( G + λ I ) 1 G ~ α t ) {\displaystyle \mathbf {D} ^{t+1}=\operatorname {diag} \left((G+\lambda \mathbf {I} )^{-1}{\widetilde {G}}{\boldsymbol {\alpha }}^{t}\right)}
α t + 1 = D t + 1 K ( ( D t + 1 K ) 2 + λ ~ I ) 1 D t + 1 K o t + 1 {\displaystyle {\boldsymbol {\alpha }}^{t+1}=\mathbf {D} ^{t+1}\mathbf {K} \left((\mathbf {D} ^{t+1}K)^{2}+{\widetilde {\lambda }}\mathbf {I} \right)^{-1}\mathbf {D} ^{t+1}\mathbf {K} _{o^{t+1}}}

donde denotan las matrices de Gram de y respectivamente, es una matriz de Gram de transferencia definida como y G , K {\displaystyle \mathbf {G} ,\mathbf {K} } s ~ 1 , , s ~ T {\displaystyle {\widetilde {s}}^{1},\dots ,{\widetilde {s}}^{T}} o ~ 1 , , o ~ T {\displaystyle {\widetilde {o}}^{1},\dots ,{\widetilde {o}}^{T}} G ~ {\displaystyle {\widetilde {\mathbf {G} }}} G ~ i j = k ( s ~ i , s ~ j + 1 ) , {\displaystyle {\widetilde {\mathbf {G} }}_{ij}=k({\widetilde {s}}_{i},{\widetilde {s}}_{j+1}),} K o t + 1 = ( k ( o ~ 1 , o t + 1 ) , , k ( o ~ T , o t + 1 ) ) T . {\displaystyle \mathbf {K} _{o^{t+1}}=(k({\widetilde {o}}^{1},o^{t+1}),\dots ,k({\widetilde {o}}^{T},o^{t+1}))^{T}.}

Máquinas de medida de soporte

La máquina de medida de soporte (SMM) es una generalización de la máquina de vectores de soporte (SVM) en la que los ejemplos de entrenamiento son distribuciones de probabilidad emparejadas con etiquetas . [22] Las SMM resuelven el problema de optimización dual estándar de SVM utilizando el siguiente núcleo esperado { P i , y i } i = 1 n ,   y i { + 1 , 1 } {\displaystyle \{P_{i},y_{i}\}_{i=1}^{n},\ y_{i}\in \{+1,-1\}}

K ( P ( X ) , Q ( Z ) ) = μ X , μ Z H = E [ k ( x , z ) ] {\displaystyle K\left(P(X),Q(Z)\right)=\langle \mu _{X},\mu _{Z}\rangle _{\mathcal {H}}=\mathbb {E} [k(x,z)]}

que se puede calcular en forma cerrada para muchas distribuciones específicas comunes (como la distribución gaussiana) combinadas con núcleos de incrustación populares (por ejemplo, el núcleo gaussiano o el núcleo polinomial), o se puede estimar empíricamente con precisión a partir de muestras iid mediante P i {\displaystyle P_{i}} k {\displaystyle k} { x i } i = 1 n P ( X ) , { z j } j = 1 m Q ( Z ) {\displaystyle \{x_{i}\}_{i=1}^{n}\sim P(X),\{z_{j}\}_{j=1}^{m}\sim Q(Z)}

K ^ ( X , Z ) = 1 n m i = 1 n j = 1 m k ( x i , z j ) {\displaystyle {\widehat {K}}(X,Z)={\frac {1}{nm}}\sum _{i=1}^{n}\sum _{j=1}^{m}k(x_{i},z_{j})}

Bajo ciertas elecciones del núcleo de incrustación , el SMM aplicado a los ejemplos de entrenamiento es equivalente a un SVM entrenado en muestras , y por lo tanto el SMM puede verse como un SVM flexible en el que un núcleo dependiente de datos diferente (especificado por la forma asumida de la distribución ) puede colocarse en cada punto de entrenamiento. [22] k {\displaystyle k} { P i , y i } i = 1 n {\displaystyle \{P_{i},y_{i}\}_{i=1}^{n}} { x i , y i } i = 1 n {\displaystyle \{x_{i},y_{i}\}_{i=1}^{n}} P i {\displaystyle P_{i}}

Adaptación del dominio bajo cambios de covariables, objetivos y condicionales

El objetivo de la adaptación de dominios es la formulación de algoritmos de aprendizaje que se generalicen bien cuando los datos de entrenamiento y de prueba tienen distribuciones diferentes. Dados ejemplos de entrenamiento y un conjunto de prueba donde se desconocen, se suponen comúnmente tres tipos de diferencias entre la distribución de los ejemplos de entrenamiento y la distribución de prueba : [23] [24] { ( x i tr , y i tr ) } i = 1 n {\displaystyle \{(x_{i}^{\text{tr}},y_{i}^{\text{tr}})\}_{i=1}^{n}} { ( x j te , y j te ) } j = 1 m {\displaystyle \{(x_{j}^{\text{te}},y_{j}^{\text{te}})\}_{j=1}^{m}} y j te {\displaystyle y_{j}^{\text{te}}} P tr ( X , Y ) {\displaystyle P^{\text{tr}}(X,Y)} P te ( X , Y ) {\displaystyle P^{\text{te}}(X,Y)}

  1. Cambio de covariable en el que la distribución marginal de las covariables cambia entre dominios: P tr ( X ) P te ( X ) {\displaystyle P^{\text{tr}}(X)\neq P^{\text{te}}(X)}
  2. Cambio de objetivo en el que la distribución marginal de los resultados cambia entre dominios: P tr ( Y ) P te ( Y ) {\displaystyle P^{\text{tr}}(Y)\neq P^{\text{te}}(Y)}
  3. Cambio condicional en el que permanece igual en todos los dominios, pero las distribuciones condicionales difieren: . En general, la presencia de un cambio condicional conduce a un problema mal planteado , y se impone comúnmente el supuesto adicional de que los cambios solo ocurren bajo transformaciones de ubicación - escala (LS) para que el problema sea manejable. P ( Y ) {\displaystyle P(Y)} P tr ( X Y ) P te ( X Y ) {\displaystyle P^{\text{tr}}(X\mid Y)\neq P^{\text{te}}(X\mid Y)} P ( X Y ) {\displaystyle P(X\mid Y)} X {\displaystyle X}

Al utilizar la incrustación de kernel de distribuciones marginales y condicionales, se pueden formular enfoques prácticos para tratar la presencia de estos tipos de diferencias entre los dominios de entrenamiento y de prueba. El cambio de covariable se puede explicar reponderando los ejemplos a través de estimaciones de la relación obtenida directamente de las incrustaciones de kernel de las distribuciones marginales de en cada dominio sin necesidad de ninguna estimación explícita de las distribuciones. [24] El cambio de objetivo, que no se puede tratar de manera similar ya que no hay muestras de disponibles en el dominio de prueba, se explica ponderando los ejemplos de entrenamiento utilizando el vector que resuelve el siguiente problema de optimización (donde en la práctica, se deben utilizar aproximaciones empíricas) [23] P te ( X ) / P tr ( X ) {\displaystyle P^{\text{te}}(X)/P^{\text{tr}}(X)} X {\displaystyle X} Y {\displaystyle Y} β ( y tr ) {\displaystyle {\boldsymbol {\beta }}^{*}(\mathbf {y} ^{\text{tr}})}

min β ( y ) C ( X Y ) tr E [ β ( y ) φ ( y tr ) ] μ X te H 2 {\displaystyle \min _{{\boldsymbol {\beta }}(y)}\left\|{\mathcal {C}}_{{(X\mid Y)}^{\text{tr}}}\mathbb {E} [{\boldsymbol {\beta }}(y)\varphi (y^{\text{tr}})]-\mu _{X^{\text{te}}}\right\|_{\mathcal {H}}^{2}} sujeto a β ( y ) 0 , E [ β ( y tr ) ] = 1 {\displaystyle {\boldsymbol {\beta }}(y)\geq 0,\mathbb {E} [{\boldsymbol {\beta }}(y^{\text{tr}})]=1}

Para abordar el cambio condicional de escala de ubicación, se puede realizar una transformación LS de los puntos de entrenamiento para obtener nuevos datos de entrenamiento transformados (donde denota el producto vectorial elemento por elemento). Para garantizar distribuciones similares entre las nuevas muestras de entrenamiento transformadas y los datos de prueba, se estiman minimizando la siguiente distancia de incrustación de kernel empírica [23] X new = X tr W + B {\displaystyle \mathbf {X} ^{\text{new}}=\mathbf {X} ^{\text{tr}}\odot \mathbf {W} +\mathbf {B} } {\displaystyle \odot } W , B {\displaystyle \mathbf {W} ,\mathbf {B} }

μ ^ X new μ ^ X te H 2 = C ^ ( X Y ) new μ ^ Y tr μ ^ X te H 2 {\displaystyle \left\|{\widehat {\mu }}_{X^{\text{new}}}-{\widehat {\mu }}_{X^{\text{te}}}\right\|_{\mathcal {H}}^{2}=\left\|{\widehat {\mathcal {C}}}_{(X\mid Y)^{\text{new}}}{\widehat {\mu }}_{Y^{\text{tr}}}-{\widehat {\mu }}_{X^{\text{te}}}\right\|_{\mathcal {H}}^{2}}

En general, los métodos de incrustación de kernel para tratar el cambio condicional de LS y el cambio objetivo se pueden combinar para encontrar una transformación reponderada de los datos de entrenamiento que imite la distribución de prueba, y estos métodos pueden funcionar bien incluso en presencia de cambios condicionales distintos de los cambios de escala de ubicación. [23]

Generalización de dominios mediante la representación de características invariantes

Dados N conjuntos de ejemplos de entrenamiento muestreados iid de distribuciones , el objetivo de la generalización de dominio es formular algoritmos de aprendizaje que funcionen bien en ejemplos de prueba muestreados de un dominio nunca visto previamente donde no hay datos del dominio de prueba disponibles en el momento del entrenamiento. Si se supone que las distribuciones condicionales son relativamente similares en todos los dominios, entonces un aprendiz capaz de generalizar el dominio debe estimar una relación funcional entre las variables que sea robusta a los cambios en los marginales . Basado en incrustaciones de kernel de estas distribuciones, el Análisis de Componentes Invariantes de Dominio (DICA) es un método que determina la transformación de los datos de entrenamiento que minimiza la diferencia entre distribuciones marginales mientras preserva una distribución condicional común compartida entre todos los dominios de entrenamiento. [25] Por lo tanto, DICA extrae invariantes , características que se transfieren a través de dominios, y puede verse como una generalización de muchos métodos populares de reducción de dimensión como el análisis de componentes principales de kernel , el análisis de componentes de transferencia y la regresión inversa del operador de covarianza. [25] P ( 1 ) ( X , Y ) , P ( 2 ) ( X , Y ) , , P ( N ) ( X , Y ) {\displaystyle P^{(1)}(X,Y),P^{(2)}(X,Y),\ldots ,P^{(N)}(X,Y)} P ( X , Y ) {\displaystyle P^{*}(X,Y)} P ( Y X ) {\displaystyle P(Y\mid X)} P ( X ) {\displaystyle P(X)}

Definición de una distribución de probabilidad en el RKHS con P {\displaystyle {\mathcal {P}}} H {\displaystyle {\mathcal {H}}}

P ( μ X ( i ) Y ( i ) ) = 1 N  for  i = 1 , , N , {\displaystyle {\mathcal {P}}\left(\mu _{X^{(i)}Y^{(i)}}\right)={\frac {1}{N}}\qquad {\text{ for }}i=1,\dots ,N,}

DICA mide la disimilitud entre dominios a través de la varianza distributiva que se calcula como

V H ( P ) = 1 N tr ( G ) 1 N 2 i , j = 1 N G i j {\displaystyle V_{\mathcal {H}}({\mathcal {P}})={\frac {1}{N}}\operatorname {tr} (\mathbf {G} )-{\frac {1}{N^{2}}}\sum _{i,j=1}^{N}\mathbf {G} _{ij}}

dónde

G i j = μ X ( i ) , μ X ( j ) H {\displaystyle \mathbf {G} _{ij}=\left\langle \mu _{X^{(i)}},\mu _{X^{(j)}}\right\rangle _{\mathcal {H}}}

Por lo tanto, es una matriz de Gram sobre las distribuciones de las que se toman muestras de los datos de entrenamiento. Al encontrar una transformación ortogonal en un subespacio de baja dimensión B (en el espacio de características) que minimice la varianza distribucional, DICA garantiza simultáneamente que B se alinee con las bases de un subespacio central C para el cual se vuelve independiente de dado en todos los dominios. En ausencia de valores objetivo , se puede formular una versión no supervisada de DICA que encuentre un subespacio de baja dimensión que minimice la varianza distribucional mientras maximiza simultáneamente la varianza de (en el espacio de características) en todos los dominios (en lugar de preservar un subespacio central). [25] G {\displaystyle \mathbf {G} } N × N {\displaystyle N\times N} Y {\displaystyle Y} X {\displaystyle X} C T X {\displaystyle C^{T}X} Y {\displaystyle Y} X {\displaystyle X}

Regresión de distribución

En la regresión de distribución, el objetivo es regresar de distribuciones de probabilidad a números reales (o vectores). Muchas tareas estadísticas y de aprendizaje automático importantes encajan en este marco, incluido el aprendizaje de múltiples instancias y los problemas de estimación puntual sin solución analítica (como la estimación de hiperparámetros o de entropía ). En la práctica, solo se pueden observar muestras de distribuciones muestreadas y las estimaciones deben basarse en similitudes calculadas entre conjuntos de puntos . La regresión de distribución se ha aplicado con éxito, por ejemplo, en el aprendizaje de entropía supervisado y la predicción de aerosoles utilizando imágenes satelitales multiespectrales. [26]

Dados los datos de entrenamiento, donde la bolsa contiene muestras de una distribución de probabilidad y la etiqueta de salida es , se puede abordar la tarea de regresión de distribución tomando las incrustaciones de las distribuciones y aprendiendo el regresor a partir de las incrustaciones hasta las salidas. En otras palabras, se puede considerar el siguiente problema de regresión de cresta de kernel ( { X i , n } n = 1 N i , y i ) i = 1 {\displaystyle {\left(\{X_{i,n}\}_{n=1}^{N_{i}},y_{i}\right)}_{i=1}^{\ell }} X i ^ := { X i , n } n = 1 N i {\displaystyle {\hat {X_{i}}}:=\{X_{i,n}\}_{n=1}^{N_{i}}} X i {\displaystyle X_{i}} i th {\displaystyle i^{\text{th}}} y i R {\displaystyle y_{i}\in \mathbb {R} } ( λ > 0 ) {\displaystyle (\lambda >0)}

J ( f ) = 1 i = 1 [ f ( μ X i ^ ) y i ] 2 + λ f H ( K ) 2 min f H ( K ) , {\displaystyle J(f)={\frac {1}{\ell }}\sum _{i=1}^{\ell }\left[f\left(\mu _{\hat {X_{i}}}\right)-y_{i}\right]^{2}+\lambda \|f\|_{{\mathcal {H}}(K)}^{2}\to \min _{f\in {\mathcal {H}}(K)},}

dónde

μ X ^ i = Ω k ( , u ) d X ^ i ( u ) = 1 N i n = 1 N i k ( , X i , n ) {\displaystyle \mu _{{\hat {X}}_{i}}=\int _{\Omega }k(\cdot ,u)\,\mathrm {d} {\hat {X}}_{i}(u)={\frac {1}{N_{i}}}\sum _{n=1}^{N_{i}}k(\cdot ,X_{i,n})}

con un núcleo en el dominio de -s , es un núcleo en las distribuciones embebidas y es el RKHS determinado por . Los ejemplos de incluyen el núcleo lineal , el núcleo gaussiano , el núcleo exponencial , el núcleo de Cauchy , el núcleo t-student generalizado o el núcleo multicuadrático inverso . k {\displaystyle k} X i {\displaystyle X_{i}} ( k : Ω × Ω R ) {\displaystyle (k:\Omega \times \Omega \to \mathbb {R} )} K {\displaystyle K} H ( K ) {\displaystyle {\mathcal {H}}(K)} K {\displaystyle K} K {\displaystyle K} [ K ( μ P , μ Q ) = μ P , μ Q H ( k ) ] {\displaystyle \left[K(\mu _{P},\mu _{Q})=\langle \mu _{P},\mu _{Q}\rangle _{{\mathcal {H}}(k)}\right]} [ K ( μ P , μ Q ) = e μ P μ Q H ( k ) 2 / ( 2 σ 2 ) ] {\displaystyle \left[K(\mu _{P},\mu _{Q})=e^{-\left\|\mu _{P}-\mu _{Q}\right\|_{H(k)}^{2}/(2\sigma ^{2})}\right]} [ K ( μ P , μ Q ) = e μ P μ Q H ( k ) / ( 2 σ 2 ) ] {\displaystyle \left[K(\mu _{P},\mu _{Q})=e^{-\left\|\mu _{P}-\mu _{Q}\right\|_{H(k)}/(2\sigma ^{2})}\right]} [ K ( μ P , μ Q ) = ( 1 + μ P μ Q H ( k ) 2 / σ 2 ) 1 ] {\displaystyle \left[K(\mu _{P},\mu _{Q})=\left(1+\left\|\mu _{P}-\mu _{Q}\right\|_{H(k)}^{2}/\sigma ^{2}\right)^{-1}\right]} [ K ( μ P , μ Q ) = ( 1 + μ P μ Q H ( k ) σ ) 1 , ( σ 2 ) ] {\displaystyle \left[K(\mu _{P},\mu _{Q})=\left(1+\left\|\mu _{P}-\mu _{Q}\right\|_{H(k)}^{\sigma }\right)^{-1},(\sigma \leq 2)\right]} [ K ( μ P , μ Q ) = ( μ P μ Q H ( k ) 2 + σ 2 ) 1 2 ] {\displaystyle \left[K(\mu _{P},\mu _{Q})=\left(\left\|\mu _{P}-\mu _{Q}\right\|_{H(k)}^{2}+\sigma ^{2}\right)^{-{\frac {1}{2}}}\right]}

La predicción de una nueva distribución toma la forma analítica simple ( X ^ ) {\displaystyle ({\hat {X}})}

y ^ ( X ^ ) = k [ G + λ ] 1 y , {\displaystyle {\hat {y}}{\big (}{\hat {X}}{\big )}=\mathbf {k} [\mathbf {G} +\lambda \ell ]^{-1}\mathbf {y} ,}

donde , , , . Bajo condiciones de regularidad leve, se puede demostrar que este estimador es consistente y puede alcanzar la tasa óptima minimax muestreada en una etapa (como si uno tuviera acceso a la verdadera -s) . [26] En la función objetivo , -s son números reales; los resultados también se pueden extender al caso en que -s son vectores -dimensionales, o más generalmente elementos de un espacio de Hilbert separable usando núcleos con valores de operador. k = [ K ( μ X ^ i , μ X ^ ) ] R 1 × {\displaystyle \mathbf {k} ={\big [}K{\big (}\mu _{{\hat {X}}_{i}},\mu _{\hat {X}}{\big )}{\big ]}\in \mathbb {R} ^{1\times \ell }} G = [ G i j ] R × {\displaystyle \mathbf {G} =[G_{ij}]\in \mathbb {R} ^{\ell \times \ell }} G i j = K ( μ X ^ i , μ X ^ j ) R {\displaystyle G_{ij}=K{\big (}\mu _{{\hat {X}}_{i}},\mu _{{\hat {X}}_{j}}{\big )}\in \mathbb {R} } y = [ y 1 ; ; y ] R {\displaystyle \mathbf {y} =[y_{1};\ldots ;y_{\ell }]\in \mathbb {R} ^{\ell }} X i {\displaystyle X_{i}} J {\displaystyle J} y i {\displaystyle y_{i}} y i {\displaystyle y_{i}} d {\displaystyle d} K {\displaystyle K}

Ejemplo

En este ejemplo simple, tomado de Song et al., [2] se supone que son variables aleatorias discretas que toman valores en el conjunto y se elige el núcleo para que sea la función delta de Kronecker , por lo que . El mapa de características correspondiente a este núcleo es el vector de base estándar . Las incrustaciones del núcleo de tales distribuciones son, por lo tanto, vectores de probabilidades marginales, mientras que las incrustaciones de distribuciones conjuntas en este contexto son matrices que especifican tablas de probabilidad conjunta, y la forma explícita de estas incrustaciones es X , Y {\displaystyle X,Y} { 1 , , K } {\displaystyle \{1,\ldots ,K\}} k ( x , x ) = δ ( x , x ) {\displaystyle k(x,x')=\delta (x,x')} φ ( x ) = e x {\displaystyle \varphi (x)=\mathbf {e} _{x}} K × K {\displaystyle K\times K}

μ X = E [ e X ] = ( P ( X = 1 ) P ( X = K ) ) {\displaystyle \mu _{X}=\mathbb {E} [\mathbf {e} _{X}]={\begin{pmatrix}P(X=1)\\\vdots \\P(X=K)\\\end{pmatrix}}}
C X Y = E [ e X e Y ] = ( P ( X = s , Y = t ) ) s , t { 1 , , K } {\displaystyle {\mathcal {C}}_{XY}=\mathbb {E} [\mathbf {e} _{X}\otimes \mathbf {e} _{Y}]=(P(X=s,Y=t))_{s,t\in \{1,\ldots ,K\}}}

Cuando , para todos , el operador de incrustación de distribución condicional, P ( X = s ) > 0 {\displaystyle P(X=s)>0} s { 1 , , K } {\displaystyle s\in \{1,\ldots ,K\}}

C Y X = C Y X C X X 1 , {\displaystyle {\mathcal {C}}_{Y\mid X}={\mathcal {C}}_{YX}{\mathcal {C}}_{XX}^{-1},}

¿Es en este contexto una tabla de probabilidad condicional?

C Y X = ( P ( Y = s X = t ) ) s , t { 1 , , K } {\displaystyle {\mathcal {C}}_{Y\mid X}=(P(Y=s\mid X=t))_{s,t\in \{1,\dots ,K\}}}

y

C X X = ( P ( X = 1 ) 0 0 P ( X = K ) ) {\displaystyle {\mathcal {C}}_{XX}={\begin{pmatrix}P(X=1)&\dots &0\\\vdots &\ddots &\vdots \\0&\dots &P(X=K)\\\end{pmatrix}}}

Por lo tanto, las incrustaciones de la distribución condicional bajo un valor fijo de pueden calcularse como X {\displaystyle X}

μ Y x = C Y X φ ( x ) = ( P ( Y = 1 X = x ) P ( Y = K X = x ) ) {\displaystyle \mu _{Y\mid x}={\mathcal {C}}_{Y\mid X}\varphi (x)={\begin{pmatrix}P(Y=1\mid X=x)\\\vdots \\P(Y=K\mid X=x)\\\end{pmatrix}}}

En esta configuración de valor discreto con el kernel delta de Kronecker, la regla de suma del kernel se convierte en

( P ( X = 1 ) P ( X = N ) ) μ X π = ( P ( X = s Y = t ) ) C X Y ( π ( Y = 1 ) π ( Y = N ) ) μ Y π {\displaystyle \underbrace {\begin{pmatrix}P(X=1)\\\vdots \\P(X=N)\\\end{pmatrix}} _{\mu _{X}^{\pi }}=\underbrace {\begin{pmatrix}\\P(X=s\mid Y=t)\\\\\end{pmatrix}} _{{\mathcal {C}}_{X\mid Y}}\underbrace {\begin{pmatrix}\pi (Y=1)\\\vdots \\\pi (Y=N)\\\end{pmatrix}} _{\mu _{Y}^{\pi }}}

La regla de la cadena del núcleo en este caso viene dada por

( P ( X = s , Y = t ) ) C X Y π = ( P ( X = s Y = t ) ) C X Y ( π ( Y = 1 ) 0 0 π ( Y = K ) ) C Y Y π {\displaystyle \underbrace {\begin{pmatrix}\\P(X=s,Y=t)\\\\\end{pmatrix}} _{{\mathcal {C}}_{XY}^{\pi }}=\underbrace {\begin{pmatrix}\\P(X=s\mid Y=t)\\\\\end{pmatrix}} _{{\mathcal {C}}_{X\mid Y}}\underbrace {\begin{pmatrix}\pi (Y=1)&\dots &0\\\vdots &\ddots &\vdots \\0&\dots &\pi (Y=K)\\\end{pmatrix}} _{{\mathcal {C}}_{YY}^{\pi }}}

Referencias

  1. ^ ab A. Smola, A. Gretton, L. Song, B. Schölkopf. (2007). Una incrustación de espacios de Hilbert para distribuciones Archivado el 15 de diciembre de 2013 en Wayback Machine . Teoría del aprendizaje algorítmico: 18.ª conferencia internacional . Springer: 13–31.
  2. ^ abcdefghijklmn L. Song, K. Fukumizu, F. Dinuzzo, A. Gretton (2013). Incrustaciones de núcleo de distribuciones condicionales: un marco de núcleo unificado para inferencia no paramétrica en modelos gráficos. Revista IEEE Signal Processing 30 : 98–111.
  3. ^ J. Shawe-Taylor, N. Christianini. (2004). Métodos de núcleo para análisis de patrones . Cambridge University Press, Cambridge, Reino Unido.
  4. ^ T. Hofmann, B. Schölkopf, A. Smola. (2008). Métodos de núcleo en aprendizaje automático. Annals of Statistics 36 (3):1171–1220.
  5. ^ Muandet, Krikamol; Fukumizu, Kenji; Sriperumbudur, Bharath; Schölkopf, Bernhard (28 de junio de 2017). "Incorporación de medias de núcleo de distribuciones: una revisión y más allá". Fundamentos y tendencias en aprendizaje automático . 10 ( 1– 2 ): 1– 141. arXiv : 1605.09522 . doi :10.1561/2200000060. ISSN  1935-8237.
  6. ^ abcdefghi L. Song. (2008) Aprendizaje mediante incrustación de distribuciones en el espacio de Hilbert. Tesis doctoral, Universidad de Sydney.
  7. ^ K. Fukumizu, A. Gretton, X. Sun y B. Schölkopf (2008). Medidas de kernel de independencia condicional. Avances en sistemas de procesamiento de información neuronal 20 , MIT Press, Cambridge, MA.
  8. ^ abc L. Song, J. Huang, AJ Smola, K. Fukumizu. (2009).Incorporaciones en el espacio de Hilbert de distribuciones condicionales. Proc. Int. Conf. Machine Learning . Montreal, Canadá: 961–968.
  9. ^ * Steinwart, Ingo; Christmann, Andreas (2008). Máquinas de vectores de soporte . Nueva York: Springer. ISBN 978-0-387-77241-7.
  10. ^ Sriperumbudur, BK; Fukumizu, K.; Lanckriet, GRG (2011). "Universalidad, núcleos característicos e integración de medidas RKHS". Revista de investigación en aprendizaje automático . 12 (70).
  11. ^ Liang, Percy (2016), CS229T/STAT231: Teoría del aprendizaje estadístico (PDF) , notas de clase de Stanford
  12. ^ Sriperumbudur, BK; Fukumizu, K.; Lanckriet, GRG (2010). Sobre la relación entre universalidad, núcleos característicos e incorporación de medidas RKHS. Actas de la Decimotercera Conferencia Internacional sobre Inteligencia Artificial y Estadística. Italia.
  13. ^ Micchelli, CA; Xu, Y.; Zhang, H. (2006). "Núcleos universales". Revista de investigación en aprendizaje automático . 7 (95): 2651– 2667.
  14. ^ S. Grunewalder, G. Lever, L. Baldassarre, S. Patterson, A. Gretton, M. Pontil. (2012). Incrustaciones de media condicional como regresores. Proc. Int. Conf. Machine Learning : 1823–1830.
  15. ^ A. Gretton, K. Borgwardt, M. Rasch, B. Schölkopf, A. Smola. (2012). Una prueba de dos muestras de kernel. Journal of Machine Learning Research , 13 : 723–773.
  16. ^ M. Dudík, SJ Phillips, RE Schapire. (2007). Estimación de la distribución de máxima entropía con regularización generalizada y una aplicación al modelado de la distribución de especies. Journal of Machine Learning Research , 8 : 1217–1260.
  17. ^ A. Gretton, O. Bousquet, A. Smola, B. Schölkopf. (2005). Medición de la dependencia estadística con normas de Hilbert-Schmidt. Proc. Intl. Conf. on Algorithmic Learning Theory : 63–78.
  18. ^ L. Song, A. Smola, A. Gretton, K. Borgwardt, J. Bedo. (2007). Selección de características supervisada mediante estimación de dependencia. Proc. Intl. Conf. Machine Learning , Omnipress: 823–830.
  19. ^ L. Song, A. Smola, A. Gretton, K. Borgwardt. (2007). Una visión de maximización de dependencia de la agrupación. Proc. Intl. Conf. Machine Learning . Omnipress: 815–822.
  20. ^ L. Song, A. Smola, K. Borgwardt, A. Gretton. (2007). Desarrollo de varianza máxima coloreada. Sistemas de procesamiento de información neuronal .
  21. ^ Zoltán Szabó, Bharath K. Sriperumbudur. Núcleos de productos tensoriales característicos y universales. Journal of Machine Learning Research , 19:1–29, 2018.
  22. ^ ab K. Muandet, K. Fukumizu, F. Dinuzzo, B. Schölkopf. (2012). Aprendizaje a partir de distribuciones mediante máquinas de medida de soporte. Avances en sistemas de procesamiento de información neuronal : 10–18.
  23. ^ abcd K. Zhang, B. Schölkopf, K. Muandet, Z. Wang. (2013). Adaptación de dominio bajo cambio de objetivo y condicional. Journal of Machine Learning Research, 28 (3): 819–827.
  24. ^ ab A. Gretton, A. Smola, J. Huang, M. Schmittfull, K. Borgwardt, B. Schölkopf. (2008). Cambio de covariables y aprendizaje local mediante emparejamiento de distribuciones. En J. Quinonero-Candela, M. Sugiyama, A. Schwaighofer, N. Lawrence (eds.). Cambio de conjunto de datos en aprendizaje automático , MIT Press, Cambridge, MA: 131–160.
  25. ^ abc K. Muandet, D. Balduzzi, B. Schölkopf. (2013).Generalización de dominio mediante representación de características invariantes. 30.ª Conferencia internacional sobre aprendizaje automático .
  26. ^ ab Z. Szabó, B. Sriperumbudur, B. Póczos, A. Gretton. Teoría del aprendizaje para la regresión de distribución. Journal of Machine Learning Research , 17(152):1–40, 2016.
  • Caja de herramientas de estimadores teóricos de información (demostración de regresión de distribución).
Retrieved from "https://en.wikipedia.org/w/index.php?title=Kernel_embedding_of_distributions&oldid=1262820065"