Articulo de referencia

Espacio de Hilbert con núcleo reproductor

La figura ilustra enfoques relacionados pero diferentes para visualizar el RKHS. En análisis funcional , un espacio de Hilbert con núcleo reproductor ( RKHS ) es un espacio de H...

La figura ilustra enfoques relacionados pero diferentes para visualizar el RKHS.

En análisis funcional , un espacio de Hilbert con núcleo reproductor ( RKHS ) es un espacio de Hilbert de funciones en el que la evaluación de un punto es un funcional lineal continuo . Específicamente, un espacio de HilbertH{\displaystyle H}de funciones de un conjuntoincógnita{\displaystyle X}(aR{\displaystyle \mathbb {R} }odo{\displaystyle \mathbb {C} }) es un RKHS si la función de evaluación de puntosLincógnita:Hdo{\displaystyle L_{x}:H\to \mathbb {C} },Lincógnita(F)=F(incógnita){\displaystyle L_{x}(f)=f(x)}es continuo para cadaincógnitaincógnita{\displaystyle x\in X}. De forma equivalente,H{\displaystyle H}es un RKHS si existe una funciónKincógnitaH{\displaystyle K_{x}\in H}de tal manera que, para todosFH{\displaystyle f\in H},F,Kincógnita=F(incógnita).{\displaystyle \langle f,K_{x}\rangle =f(x).}La funciónKincógnita{\displaystyle K_{x}}entonces se le llama núcleo reproductor , y reproduce el valor deF{\displaystyle f}enincógnita{\displaystyle x}a través del producto interno.

Una consecuencia inmediata de esta propiedad es que la convergencia en norma implica convergencia uniforme en cualquier subconjunto deincógnita{\displaystyle X}en el cualKincógnita{\displaystyle \|K_{x}\|}está acotado. Sin embargo, lo contrario no necesariamente se cumple. A menudo el conjuntoincógnita{\displaystyle X}lleva una topología yKincógnita{\displaystyle \|K_{x}\|}depende continuamente deincógnitaincógnita{\displaystyle x\in X}, en cuyo caso: la convergencia en norma implica convergencia uniforme en subconjuntos compactos deincógnita{\displaystyle X}.

No es del todo sencillo construir ejemplos naturales de un espacio de Hilbert que no sean un RKHS de manera no trivial. [ 1 ] Sin embargo, se han encontrado algunos ejemplos. [ 2 ] [ 3 ]

Si bien, formalmente, los espacios L2 se definen como espacios de Hilbert de clase de equivalenciaes de funciones, esta definición puede extenderse trivialmente a un espacio de Hilbert de funciones eligiendo una función (total) como representante para cada clase de equivalencia. Sin embargo, ninguna elección de representantes puede hacer de este espacio un RKHS (K0{\displaystyle K_{0}}necesitaría ser la función delta de Dirac inexistente). Sin embargo, hay RKHS en los que la norma es una norma L2 , como el espacio de funciones de banda limitada (véase el ejemplo a continuación).

Un RKHS está asociado con un núcleo que reproduce cada función en el espacio en el sentido de que para cadaincógnita{\displaystyle x}en el conjunto en el que se definen las funciones, "evaluación enincógnita{\displaystyle x}" se puede realizar tomando un producto interno con una función determinada por el núcleo. Dicho núcleo reproductor existe si y solo si cada funcional de evaluación es continuo.

El núcleo reproductor fue introducido por primera vez en el trabajo de Stanisław Zaremba de 1907 [ 4 ] sobre problemas de contorno para funciones armónicas y biarmónicas . James Mercer examinó simultáneamente funciones que satisfacen la propiedad de reproducción en la teoría de ecuaciones integrales . La idea del núcleo reproductor permaneció sin ser explorada durante casi veinte años hasta que apareció en las disertaciones de Gábor Szegő , Stefan Bergman y Salomon Bochner . El tema fue finalmente desarrollado sistemáticamente a principios de la década de 1950 por Nachman Aronszajn y Stefan Bergman. [ 5 ]

Estos espacios tienen amplias aplicaciones, incluyendo el análisis complejo , el análisis armónico y la mecánica cuántica . Los espacios de Hilbert con núcleo reproductor son particularmente importantes en el campo de la teoría del aprendizaje estadístico debido al célebre teorema del representante , que establece que toda función en un espacio de Hilbert con núcleo reproductor que minimiza una función de riesgo empírica puede expresarse como una combinación lineal de la función núcleo evaluada en los puntos de entrenamiento. Este es un resultado práctico, ya que simplifica eficazmente el problema de minimización del riesgo empírico, transformándolo de un problema de optimización de dimensión infinita a uno de dimensión finita.

Para facilitar la comprensión, proporcionamos el marco para los espacios de Hilbert de valores reales. La teoría se puede extender fácilmente a espacios de funciones de valores complejos y, por lo tanto, incluye los muchos ejemplos importantes de espacios de Hilbert de núcleo reproductor que son espacios de funciones analíticas . [ 6 ]

Definición

Dejarincógnita{\displaystyle X}sea ​​un conjunto arbitrario yH{\displaystyle H}un espacio de Hilbert de funciones de valor real enincógnita{\displaystyle X}, equipado con suma punto por punto y multiplicación escalar punto por punto . El funcional de evaluación sobre el espacio de Hilbert de funcionesH{\displaystyle H}es un funcional lineal que evalúa cada función en un puntoincógnita{\displaystyle x},

Lincógnita:FF(incógnita) FH.{\displaystyle L_{x}:f\mapsto f(x){\text{ }}\forall f\in H.}

Decimos que H es un espacio de Hilbert con núcleo reproductor si, para todoincógnita{\displaystyle x}enincógnita{\displaystyle X},Lincógnita{\displaystyle L_{x}}es continuo en cadaF{\displaystyle f}enH{\displaystyle H}o, equivalentemente, siLincógnita{\displaystyle L_{x}}es un operador acotado enH{\displaystyle H}, es decir, existe algunaMETROincógnita>0{\displaystyle M_{x}>0}de tal manera que

A pesar deMETROincógnita<{\displaystyle M_{x}<\infty }se asume para todosincógnitaincógnita{\displaystyle x\in X}, aún podría ser el caso quesorberincógnitaMETROincógnita={\textstyle \sup _{x}M_{x}=\infty }.

Mientras que la propiedad ( 1 ) es la condición más débil que garantiza tanto la existencia de un producto interno como la evaluación de cada función enH{\displaystyle H}En cada punto del dominio, no se presta a una fácil aplicación en la práctica. Una definición más intuitiva del RKHS se puede obtener observando que esta propiedad garantiza que el funcional de evaluación se puede representar tomando el producto interno deF{\displaystyle f}con una funciónKincógnita{\displaystyle K_{x}}enH{\displaystyle H}Esta función es el llamado núcleo reproductor para el espacio de Hilbert.H{\displaystyle H}de donde la RKHS toma su nombre. Más formalmente, el teorema de representación de Riesz implica que para todoincógnita{\displaystyle x}enincógnita{\displaystyle X}existe un elemento únicoKincógnita{\displaystyle K_{x}}deH{\displaystyle H}con la propiedad de reproducción,

DesdeKincógnita{\displaystyle K_{x}}es en sí misma una función definida enincógnita{\displaystyle X}con valores en el campoR{\displaystyle \mathbb {R} }(odo{\displaystyle \mathbb {C} }en el caso de espacios de Hilbert complejos) y comoKincógnita{\displaystyle K_{x}}está enH{\displaystyle H}tenemos eso

Kincógnita(y)=Ly(Kincógnita)=Kincógnita, KyH,{\displaystyle K_{x}(y)=L_{y}(K_{x})=\langle K_{x},\ K_{y}\rangle _{H},}

dónde KyH{\displaystyle K_{y}\in H}es el elemento enH{\displaystyle H}asociado aLy{\displaystyle L_{y}}.

Esto nos permite definir el núcleo reproductor deH{\displaystyle H}como funciónK:incógnita×incógnitaR{\displaystyle K:X\times X\to \mathbb {R} }(odo{\displaystyle \mathbb {C} }en el caso complejo) por

K(incógnita,y)=Kincógnita, KyH.{\displaystyle K(x,y)=\langle K_{x},\ K_{y}\rangle _{H}.}

A partir de esta definición es fácil ver queK:incógnita×incógnitaR{\displaystyle K:X\times X\to \mathbb {R} }(odo{\displaystyle \mathbb {C} }en el caso complejo) es tanto simétrica (respectivamente, simétrica conjugada) como definida positiva , es decir

i,j=1nortedoidojK(incógnitai,incógnitaj)=i=1nortedoiKincógnitai,j=1nortedojKincógnitajH=i=1nortedoiKincógnitai,j=1nortedojKincógnitajH=i=1nortedoiKincógnitaiH20{\displaystyle \sum _{i,j=1}^{n}c_{i}c_{j}K(x_{i},x_{j})=\sum _{i=1}^{n}c_{i}\left\langle K_{x_{i}},\sum _{j=1}^{n}c_{j}K_{x_{j}}\right\rangle _{H}=\left\langle \sum _{i=1}^{n}c_{i}K_{x_{i}},\sum _{j=1}^{n}c_{j}K_{x_{j}}\right\rangle _{H}=\left\|\sum _{i=1}^{n}c_{i}K_{x_{i}}\right\|_{H}^{2}\geq 0}

por cadanortenorte,incógnita1,,incógnitanorteincógnita, y do1,,donorteR.{\displaystyle n\in \mathbb {N} ,x_{1},\dots ,x_{n}\in X,{\text{ and }}c_{1},\dots ,c_{n}\in \mathbb {R} .}[ 7 ] El teorema de Moore-Aronszajn (véase más abajo) es una especie de recíproco a esto: si una funciónK{\displaystyle K}Si se cumplen estas condiciones, entonces existe un espacio de Hilbert de funciones enincógnita{\displaystyle X}para lo cual es un núcleo reproductor.

Ejemplos

El ejemplo más simple de un espacio de Hilbert con núcleo reproductor es el espacioL2(incógnita,μ){\displaystyle L^{2}(X,\mu )}dóndeincógnita{\displaystyle X}es un conjunto yμ{\displaystyle \mu }es la medida de conteo enincógnita{\displaystyle X}. Paraincógnitaincógnita{\displaystyle x\in X}, el núcleo reproductorKincógnita{\displaystyle K_{x}}es la función indicadora del conjunto de un punto{incógnita}incógnita{\displaystyle \{x\}\subset X}.

Los espacios de Hilbert con núcleo reproductor no triviales a menudo involucran funciones analíticas , como ilustraremos ahora con un ejemplo. Consideremos el espacio de Hilbert de funciones continuas de banda limitada .H{\displaystyle H}Fijar una frecuencia de corte0<a<{\displaystyle 0<a<\infty }y definir el espacio de Hilbert

H={FL2(R)suplemento(F)[a,a]}{\displaystyle H=\{f\in L^{2}(\mathbb {R} )\mid \operatorname {supp} (F)\subset [-a,a]\}}

dóndeL2(R){\displaystyle L^{2}(\mathbb {R} )}es el conjunto de funciones de cuadrado integrable, yF(ω)=F(t)miiωtdt{\textstyle F(\omega )=\int _{-\infty }^{\infty }f(t)e^{-i\omega t}\,dt}es la transformada de Fourier deF{\displaystyle f}Como producto interno, utilizamos

F,gramoL2=F(incógnita)gramo(incógnita)¯dincógnita.{\displaystyle \langle f,g\rangle _{L^{2}}=\int _{-\infty }^{\infty }f(x)\cdot {\overline {g(x)}}\,dx.}

Dado que este es un subespacio cerrado deL2(R){\displaystyle L^{2}(\mathbb {R} )}, es un espacio de Hilbert. Además, los elementos deH{\displaystyle H}son funciones suaves enR{\displaystyle \mathbb {R} }que tienden a cero en el infinito, esencialmente por el lema de Riemann-Lebesgue . De hecho, los elementos deH{\displaystyle H}son las restricciones aR{\displaystyle \mathbb {R} }de funciones holomorfas enteras , por el teorema de Paley-Wiener .

Del teorema de inversión de Fourier , tenemos

F(incógnita)=12πaaF(ω)miiincógnitaωdω.{\displaystyle f(x)={\frac {1}{2\pi }}\int _{-a}^{a}F(\omega )e^{ix\omega }\,d\omega .}

De la desigualdad de Cauchy-Schwarz y del teorema de Plancherel se deduce entonces que, para todoincógnita{\displaystyle x},

|F(incógnita)|12π2aaa|F(ω)|2dω=2a2π|F(ω)|2dω=aπFL2.{\displaystyle |f(x)|\leq {\frac {1}{2\pi }}{\sqrt {2a\int _{-a}^{a}|F(\omega )|^{2}\,d\omega }}={\frac {\sqrt {2a}}{2\pi }}{\sqrt {\int _{-\infty }^{\infty }|F(\omega )|^{2}\,d\omega }}={\sqrt {\frac {a}{\pi }}}\|f\|_{L^{2}}.}

Esta desigualdad muestra que el funcional de evaluación está acotado, lo que prueba queH{\displaystyle H}Es cierto que es un RKHS.

La función kernelKincógnita{\displaystyle K_{x}}en este caso viene dado por

Kincógnita(y)=aπdesde(aπ(yincógnita))=pecado(a(yincógnita))π(yincógnita).{\displaystyle K_{x}(y)={\frac {a}{\pi }}\operatorname {sinc} \left({\frac {a}{\pi }}(y-x)\right)={\frac {\sin(a(y-x))}{\pi (y-x)}}.}

La transformada de Fourier deKincógnita(y){\displaystyle K_{x}(y)}definido anteriormente viene dado por

Kincógnita(y)miiωydy={miiωincógnitasi ω[a,a],0de lo contrario,{\displaystyle \int _{-\infty }^{\infty }K_{x}(y)e^{-i\omega y}\,dy={\begin{cases}e^{-i\omega x}&{\text{if }}\omega \in [-a,a],\\0&{\textrm {otherwise}},\end{cases}}}

lo cual es consecuencia de la propiedad de desplazamiento temporal de la transformada de Fourier . En consecuencia, utilizando el teorema de Plancherel , tenemos

F,KincógnitaL2=F(y)Kincógnita(y)¯dy=12πaaF(ω)miiωincógnitadω=F(incógnita).{\displaystyle \langle f,K_{x}\rangle _{L^{2}}=\int _{-\infty }^{\infty }f(y)\cdot {\overline {K_{x}(y)}}\,dy={\frac {1}{2\pi }}\int _{-a}^{a}F(\omega )\cdot e^{i\omega x}\,d\omega =f(x).}

De este modo obtenemos la propiedad de reproducción del núcleo.

Kincógnita{\displaystyle K_{x}}en este caso es la "versión de banda limitada" de la función delta de Dirac , y queKincógnita(y){\displaystyle K_{x}(y)}converge aδ(yincógnita){\displaystyle \delta (y-x)}en el sentido débil como la frecuencia de cortea{\displaystyle a}tiende al infinito.

Teorema de Moore-Aronszajn

Hemos visto cómo un espacio de Hilbert con núcleo reproductor define una función de núcleo reproductor que es simétrica y definida positiva . El teorema de Moore-Aronszajn va en la dirección opuesta; afirma que todo núcleo simétrico y definido positivo define un único espacio de Hilbert con núcleo reproductor. El teorema apareció por primera vez en la obra de Aronszajn, * Theory of Reproducing Kernels* , aunque él se lo atribuye a E.H. Moore .

Teorema . Supongamos que K es un núcleo simétrico y definido positivo en un conjunto X. Entonces existe un único espacio de Hilbert de funciones en X para el cual K es un núcleo reproductor.

Demostración . Para todo x en X , definimos K x = K ( x , ⋅ ). Sea H 0 el espacio vectorial generado por { K x  : xX }. Definimos un producto interno en H 0 mediante

j=1nortebjKyj,i=1metroaiKincógnitaiH0=i=1metroj=1norteaibjK(yj,incógnitai),{\displaystyle \left\langle \sum _{j=1}^{n}b_{j}K_{y_{j}},\sum _{i=1}^{m}a_{i}K_{x_{i}}\right\rangle _{H_{0}}=\sum _{i=1}^{m}\sum _{j=1}^{n}{a_{i}}b_{j}K(y_{j},x_{i}),}

lo cual implicaK(incógnita,y)=Kincógnita,KyH0{\displaystyle K(x,y)=\left\langle K_{x},K_{y}\right\rangle _{H_{0}}}La simetría de este producto interno se deriva de la simetría de K y la no degeneración se deriva del hecho de que K es definida positiva.

Sea H la completación de H 0 con respecto a este producto interno. Entonces H consta de funciones de la forma

F(incógnita)=i=1aiKincógnitai(incógnita)dóndelímitenortesorberpag0i=nortenorte+pagaiKincógnitaiH0=0.{\displaystyle f(x)=\sum _{i=1}^{\infty }a_{i}K_{x_{i}}(x)\quad {\text{where}}\quad \lim _{n\to \infty }\sup _{p\geq 0}\left\|\sum _{i=n}^{n+p}a_{i}K_{x_{i}}\right\|_{H_{0}}=0.}

Ahora podemos comprobar la propiedad de reproducción ( 2 ):

F,KincógnitaH=i=1aiKincógnitai,KincógnitaH0=i=1aiK(incógnitai,incógnita)=F(incógnita).{\displaystyle \langle f,K_{x}\rangle _{H}=\sum _{i=1}^{\infty }a_{i}\left\langle K_{x_{i}},K_{x}\right\rangle _{H_{0}}=\sum _{i=1}^{\infty }a_{i}K(x_{i},x)=f(x).}

Para demostrar la unicidad, sea G otro espacio de Hilbert de funciones para el cual K es un núcleo reproductor. Para cada x e y en X , ( 2 ) implica que

Kincógnita,KyH=K(incógnita,y)=Kincógnita,KyGRAMO.{\displaystyle \langle K_{x},K_{y}\rangle _{H}=K(x,y)=\langle K_{x},K_{y}\rangle _{G}.}

Por linealidad,,H=,GRAMO{\displaystyle \langle \cdot ,\cdot \rangle _{H}=\langle \cdot ,\cdot \rangle _{G}}en el lapso de{Kincógnita:incógnitaincógnita}{\displaystyle \{K_{x}:x\in X\}}. EntoncesHGRAMO{\displaystyle H\subset G}porque G es completo y contiene H 0 y por lo tanto contiene su completitud.

Ahora necesitamos demostrar que cada elemento de G está en H. SeaF{\displaystyle f}Sea H un elemento de G. Dado que H es un subespacio cerrado de G , podemos escribirF=FH+FH{\displaystyle f=f_{H}+f_{H^{\bot }}}dóndeFHH{\displaystyle f_{H}\in H}yFHH{\displaystyle f_{H^{\bot }}\in H^{\bot }}Ahora bien, siincógnitaincógnita{\displaystyle x\in X}entonces, puesto que K es un núcleo reproductor de G y H :

F(incógnita)=Kincógnita,FGRAMO=Kincógnita,FHGRAMO+Kincógnita,FHGRAMO=Kincógnita,FHGRAMO=Kincógnita,FHH=FH(incógnita),{\displaystyle f(x)=\langle K_{x},f\rangle _{G}=\langle K_{x},f_{H}\rangle _{G}+\langle K_{x},f_{H^{\bot }}\rangle _{G}=\langle K_{x},f_{H}\rangle _{G}=\langle K_{x},f_{H}\rangle _{H}=f_{H}(x),}

donde hemos utilizado el hecho de queKincógnita{\displaystyle K_{x}}pertenece a H de modo que su producto interno conFH{\displaystyle f_{H^{\bot }}}en G es cero. Esto demuestra queF=FH{\displaystyle f=f_{H}}en G y concluye la demostración.

Operadores integrales y el teorema de Mercer

Podemos caracterizar un núcleo simétrico definido positivo.K{\displaystyle K}mediante el operador integral utilizando el teorema de Mercer y obtener una vista adicional del RKHS. Seaincógnita{\displaystyle X}ser un espacio compacto equipado con una medida de Borel finita estrictamente positivaμ{\displaystyle \mu }yK:incógnita×incógnitaR{\displaystyle K:X\times X\to \mathbb {R} }una función continua, simétrica y definida positiva. Defina el operador integral.TK:L2(incógnita)L2(incógnita){\displaystyle T_{K}:L_{2}(X)\to L_{2}(X)}como

[TKF]()=incógnitaK(,t)F(t)dμ(t){\displaystyle [T_{K}f](\cdot )=\int _{X}K({}\cdot {},t)f(t)\,d\mu (t)}

dóndeL2(incógnita){\displaystyle L_{2}(X)}es el espacio de funciones de cuadrado integrable con respecto aμ{\displaystyle \mu }.

El teorema de Mercer establece que la descomposición espectral del operador integralTK{\displaystyle T_{K}}deK{\displaystyle K}produce una representación en serie deK{\displaystyle K}en términos de los autovalores y autofunciones deTK{\displaystyle T_{K}}Esto implica entonces queK{\displaystyle K}es un núcleo reproductor, de modo que el RKHS correspondiente se puede definir en términos de estos autovalores y autofunciones. A continuación, proporcionamos los detalles.

Bajo estos supuestosTK{\displaystyle T_{K}}es un operador compacto, continuo, autoadjunto y positivo . El teorema espectral para operadores autoadjuntos implica que existe una secuencia decreciente como máximo numerable.(σi)i0{\displaystyle (\sigma _{i})_{i\geq 0}}de tal manera quelímiteiσi=0{\textstyle \lim _{i\to \infty }\sigma _{i}=0}y TKφi(incógnita)=σiφi(incógnita){\displaystyle T_{K}\varphi _{i}(x)=\sigma _{i}\varphi _{i}(x)}, donde el{φi}{\displaystyle \{\varphi _{i}\}}formar una base ortonormal deL2(incógnita){\displaystyle L_{2}(X)}. Por la positividad deTK,σi>0{\displaystyle T_{K},\sigma _{i}>0}a pesar dei.{\displaystyle i.}También se puede demostrar queTK{\displaystyle T_{K}}mapea continuamente en el espacio de funciones continuasdo(incógnita){\displaystyle C(X)}y por lo tanto podemos elegir funciones continuas como vectores propios, es decir,φido(incógnita){\displaystyle \varphi _{i}\in C(X)}a pesar dei.{\displaystyle i.}Entonces, por el teorema de Mercer K{\displaystyle K}puede escribirse en términos de los autovalores y las autofunciones continuas como

K(incógnita,y)=j=1σjφj(incógnita)φj(y){\displaystyle K(x,y)=\sum _{j=1}^{\infty }\sigma _{j}\,\varphi _{j}(x)\,\varphi _{j}(y)}

a pesar deincógnita,yincógnita{\displaystyle x,y\in X}de tal manera que

límitenortesorber,v|K(,v)j=1norteσjφj()φj(v)|=0.{\displaystyle \lim _{n\to \infty }\sup _{u,v}\left|K(u,v)-\sum _{j=1}^{n}\sigma _{j}\,\varphi _{j}(u)\,\varphi _{j}(v)\right|=0.}

Esta representación en serie anterior se denomina núcleo de Mercer o representación de Mercer.K{\displaystyle K}.

Además, se puede demostrar que el RKHSH{\displaystyle H}deK{\displaystyle K}es dado por

H={FL2(incógnita)|i=1F,φiL22σi<}{\displaystyle H=\left\{f\in L_{2}(X)\,{\Bigg \vert }\,\sum _{i=1}^{\infty }{\frac {\left\langle f,\varphi _{i}\right\rangle _{L_{2}}^{2}}{\sigma _{i}}}<\infty \right\}}

donde el producto interno deH{\displaystyle H}dado por

F,gramoH=i=1F,φiL2gramo,φiL2σi.{\displaystyle \left\langle f,g\right\rangle _{H}=\sum _{i=1}^{\infty }{\frac {\left\langle f,\varphi _{i}\right\rangle _{L_{2}}\left\langle g,\varphi _{i}\right\rangle _{L_{2}}}{\sigma _{i}}}.}

Esta representación del RKHS tiene aplicaciones en probabilidad y estadística, por ejemplo, en la representación de Karhunen-Loève para procesos estocásticos y en el PCA de kernel .

Mapas de características

Un mapa de características es un mapaφ:incógnitaF{\displaystyle \varphi \colon X\rightarrow F}, dóndeF{\displaystyle F}es un espacio de Hilbert que llamaremos espacio de características. Las primeras secciones presentaron la conexión entre funciones de evaluación acotadas/continuas, funciones definidas positivas y operadores integrales, y en esta sección proporcionamos otra representación del RKHS en términos de mapas de características.

Cada mapa de características define un núcleo mediante

ClaramenteK{\displaystyle K}es simétrico y la definición positiva se deduce de las propiedades del producto interno enF{\displaystyle F}. Por el contrario, toda función definida positiva y su correspondiente espacio de Hilbert con núcleo reproductor tiene infinitos mapas de características asociados tales que ( 3 ) se cumple.

Por ejemplo, podemos tomar trivialmenteF=H{\displaystyle F=H}yφ(incógnita)=Kincógnita{\displaystyle \varphi (x)=K_{x}}a pesar deincógnitaincógnita{\displaystyle x\in X}Entonces ( 3 ) se satisface por la propiedad de reproducción. Otro ejemplo clásico de un mapa de características se relaciona con la sección anterior sobre operadores integrales al tomarF=2{\displaystyle F=\ell ^{2}}yφ(incógnita)=(σiφi(incógnita))i{\displaystyle \varphi (x)=({\sqrt {\sigma _{i}}}\varphi _{i}(x))_{i}}.

Esta conexión entre núcleos y mapas de características nos proporciona una nueva forma de entender las funciones definidas positivas y, por lo tanto, de reproducir núcleos como productos internos enH{\displaystyle H}Además, cada mapa de características puede definir naturalmente un RKHS mediante la definición de una función definida positiva.

Por último, los mapas de características nos permiten construir espacios de funciones que revelan otra perspectiva sobre el RKHS. Consideremos el espacio lineal.

Hφ={F:incógnitaRwF,F(incógnita)=w,φ(incógnita)F, incógnitaincógnita}.{\displaystyle H_{\varphi }=\{f:X\to \mathbb {R} \mid \exists w\in F,f(x)=\langle w,\varphi (x)\rangle _{F},\forall {\text{ }}x\in X\}.}

Podemos definir una norma sobreHφ{\displaystyle H_{\varphi }} por

Fφ=inf{wF:wF,F(incógnita)=w,φ(incógnita)F, incógnitaincógnita}.{\displaystyle \|f\|_{\varphi }=\inf\{\|w\|_{F}:w\in F,f(x)=\langle w,\varphi (x)\rangle _{F},\forall {\text{ }}x\in X\}.}

Se puede demostrar queHφ{\displaystyle H_{\varphi }}es un RKHS con núcleo definido porK(incógnita,y)=φ(incógnita),φ(y)F{\displaystyle K(x,y)=\langle \varphi (x),\varphi (y)\rangle _{F}}Esta representación implica que los elementos del RKHS son productos internos de elementos en el espacio de características y, por lo tanto, pueden verse como hiperplanos. Esta visión del RKHS está relacionada con el truco del kernel en el aprendizaje automático. [ 8 ]

Propiedades

Propiedades útiles de los RKHS:

  • Dejar(incógnitai)i=1pag{\displaystyle (X_{i})_{i=1}^{p}}ser una secuencia de conjuntos y(Ki)i=1pag{\displaystyle (K_{i})_{i=1}^{p}}sea ​​una colección de funciones definidas positivas correspondientes en(incógnitai)i=1pag.{\displaystyle (X_{i})_{i=1}^{p}.}De ello se deduce que
    K((incógnita1,,incógnitapag),(y1,,ypag))=K1(incógnita1,y1)Kpag(incógnitapag,ypag){\displaystyle K((x_{1},\ldots ,x_{p}),(y_{1},\ldots ,y_{p}))=K_{1}(x_{1},y_{1})\cdots K_{p}(x_{p},y_{p})}
    es un kernel enincógnita=incógnita1××incógnitapag.{\displaystyle X=X_{1}\times \dots \times X_{p}.}
  • Dejarincógnita0incógnita,{\displaystyle X_{0}\subset X,}entonces la restricción deK{\displaystyle K}aincógnita0×incógnita0{\displaystyle X_{0}\times X_{0}}También es un núcleo reproductor.
  • Consideremos un núcleo normalizado.K{\displaystyle K}de tal manera queK(incógnita,incógnita)=1{\displaystyle K(x,x)=1}a pesar deincógnitaincógnita{\displaystyle x\in X}. Definimos una pseudométrica en X como
    dK(incógnita,y)=KincógnitaKyH2=2(1K(incógnita,y))incógnitaincógnita.{\displaystyle d_{K}(x,y)=\|K_{x}-K_{y}\|_{H}^{2}=2(1-K(x,y))\qquad \forall x\in X.}
    Por la desigualdad de Cauchy-Schwarz ,
    K(incógnita,y)2K(incógnita,incógnita)K(y,y)=1incógnita,yincógnita.{\displaystyle K(x,y)^{2}\leq K(x,x)K(y,y)=1\qquad \forall x,y\in X.}
    Esta desigualdad nos permite verK{\displaystyle K}como medida de similitud entre entradas. Siincógnita,yincógnita{\displaystyle x,y\in X}son similares entoncesK(incógnita,y){\displaystyle K(x,y)}estará más cerca de 1 mientras que siincógnita,yincógnita{\displaystyle x,y\in X}son diferentes entoncesK(incógnita,y){\displaystyle K(x,y)}estará más cerca de 0.
  • El cierre del tramo de{Kincógnitaincógnitaincógnita}{\displaystyle \{K_{x}\mid x\in X\}}coincide conH{\displaystyle H}. [ 9 ]

Ejemplos comunes

núcleos bilineales

K(incógnita,y)=incógnita,y{\displaystyle K(x,y)=\langle x,y\rangle }

La RKHSH{\displaystyle H}A este núcleo le corresponde el espacio dual , que consta de funciones.F(incógnita)=incógnita,β{\displaystyle f(x)=\langle x,\beta \rangle }satisfactorioFH2=β2{\displaystyle \|f\|_{H}^{2}=\|\beta \|^{2}}.

Núcleos polinómicos

K(incógnita,y)=(αincógnita,y+1)d,αR,dnorte{\displaystyle K(x,y)=(\alpha \langle x,y\rangle +1)^{d},\qquad \alpha \in \mathbb {R} ,d\in \mathbb {N} }

Estas son otra clase común de núcleos que satisfacenK(incógnita,y)=K(incógnitay){\displaystyle K(x,y)=K(\|x-y\|)}Algunos ejemplos incluyen:

  • Núcleo gaussiano o exponencial cuadrático :
    K(incógnita,y)=miincógnitay22σ2,σ>0{\displaystyle K(x,y)=e^{-{\frac {\|x-y\|^{2}}{2\sigma ^{2}}}},\qquad \sigma >0}
  • núcleo laplaciano :
    K(incógnita,y)=miincógnitayσ,σ>0{\displaystyle K(x,y)=e^{-{\frac {\|x-y\|}{\sigma }}},\qquad \sigma >0}
    La norma al cuadrado de una funciónF{\displaystyle f}en el RKHSH{\displaystyle H}con este núcleo es: [ 10 ] [ 11 ]
    FH2=R(1σF(incógnita)2+σF(incógnita)2)dincógnita.{\displaystyle \|f\|_{H}^{2}=\int _{\mathbb {R} }{\Big (}{\frac {1}{\sigma }}f(x)^{2}+\sigma f'(x)^{2}{\Big )}\mathrm {d} x.}

También proporcionamos ejemplos de núcleos de Bergman . Sea X un conjunto finito y sea H el conjunto de todas las funciones de valor complejo definidas en X. Entonces, un elemento de H puede representarse como una matriz de números complejos. Si se utiliza el producto interno usual , entonces K x es la función cuyo valor es 1 en x y 0 en cualquier otro lugar, yK(incógnita,y){\displaystyle K(x,y)}puede considerarse como una matriz identidad ya que

K(incógnita,y)={1incógnita=y0incógnitay{\displaystyle K(x,y)={\begin{cases}1&x=y\\0&x\neq y\end{cases}}}

En este caso, H es isomorfo adonorte{\displaystyle \mathbb {C} ^{n}}.

El caso deincógnita=D{\displaystyle X=\mathbb {D} }(dóndeD{\displaystyle \mathbb {D} }denota el disco unitario ) es más sofisticado. Aquí el espacio de BergmanA2(D){\displaystyle A^{2}(\mathbb {D} )}es el espacio de funciones holomorfas de cuadrado integrable enD{\displaystyle \mathbb {D} }. Se puede demostrar que el núcleo reproductor paraA2(D){\displaystyle A^{2}(\mathbb {D} )}es

K(incógnita,y)=1π1(1incógnitay¯)2.{\displaystyle K(x,y)={\frac {1}{\pi }}{\frac {1}{(1-x{\overline {y}})^{2}}}.}

Por último, el espacio de funciones de banda limitada enL2(R){\displaystyle L^{2}(\mathbb {R} )}con ancho de banda2a{\displaystyle 2a}es un RKHS con núcleo reproductor

K(incógnita,y)=pecadoa(incógnitay)π(incógnitay).{\displaystyle K(x,y)={\frac {\sin a(x-y)}{\pi (x-y)}}.}

Extensión a funciones con valores vectoriales

En esta sección extendemos la definición del RKHS a espacios de funciones con valores vectoriales, ya que esta extensión es particularmente importante en el aprendizaje multitarea y la regularización de variedades . La principal diferencia radica en el núcleo reproductor.Γ{\displaystyle \Gamma }es una función simétrica que ahora es una matriz semidefinida positiva para cadaincógnita,y{\displaystyle x,y}enincógnita{\displaystyle X}. De manera más formal, definimos un RKHS con valores vectoriales (vvRKHS) como un espacio de Hilbert de funcionesF:incógnitaRT{\displaystyle f:X\to \mathbb {R} ^{T}}de tal manera que para todosdoRT{\displaystyle c\in \mathbb {R} ^{T}}yincógnitaincógnita{\displaystyle x\in X}

Γincógnitado(y)=Γ(incógnita,y)doH para yincógnita{\displaystyle \Gamma _{x}c(y)=\Gamma (x,y)c\in H{\text{ for }}y\in X}

y

F,ΓincógnitadoH=F(incógnita)do.{\displaystyle \langle f,\Gamma _{x}c\rangle _{H}=f(x)^{\intercal }c.}

Esta segunda propiedad es paralela a la propiedad de reproducción para el caso escalar. Esta definición también se puede conectar con operadores integrales, funciones de evaluación acotadas y mapas de características, como vimos para el RKHS escalar. Podemos definir equivalentemente el vvRKHS como un espacio de Hilbert vectorial con un funcional de evaluación acotado y demostrar que esto implica la existencia de un núcleo reproductor único por el teorema de representación de Riesz. El teorema de Mercer también se puede extender para abordar el entorno vectorial y, por lo tanto, podemos obtener una vista de mapa de características del vvRKHS. Por último, también se puede demostrar que el cierre del espacio generado por{Γincógnitado:incógnitaincógnita,doRT}{\displaystyle \{\Gamma _{x}c:x\in X,c\in \mathbb {R} ^{T}\}}coincide conH{\displaystyle H}, otra propiedad similar al caso de valores escalares.

Podemos obtener intuición sobre el vvRKHS adoptando una perspectiva componente a componente sobre estos espacios. En particular, encontramos que todo vvRKHS es isométricamente isomorfo a un RKHS escalar en un espacio de entrada particular. SeaΛ={1,,T}{\displaystyle \Lambda =\{1,\dots ,T\}}. Considere el espacioincógnita×Λ{\displaystyle X\times \Lambda }y el núcleo reproductor correspondiente

Como se indicó anteriormente, el RKHS asociado a este núcleo reproductor viene dado por el cierre del intervalo de{γ(incógnita,t):incógnitaincógnita,tΛ}{\displaystyle \{\gamma _{(x,t)}:x\in X,t\in \Lambda \}}dónde γ(incógnita,t)(y,s)=γ((incógnita,t),(y,s)){\displaystyle \gamma _{(x,t)}(y,s)=\gamma ((x,t),(y,s))}para cada conjunto de pares(incógnita,t),(y,s)incógnita×Λ{\displaystyle (x,t),(y,s)\in X\times \Lambda }.

La conexión con el RKHS de valores escalares se puede establecer mediante el hecho de que cada núcleo de valores matriciales se puede identificar con un núcleo de la forma de ( 4 ) a través de

Γ(incógnita,y)(t,s)=γ((incógnita,t),(y,s)).{\displaystyle \Gamma (x,y)_{(t,s)}=\gamma ((x,t),(y,s)).}

Además, cada núcleo con la forma de ( 4 ) define un núcleo con valores matriciales con la expresión anterior. Ahora, dejando el mapaD:HΓHγ{\displaystyle D:H_{\Gamma }\to H_{\gamma }}ser definido como

(DF)(incógnita,t)=F(incógnita),mitRT{\displaystyle (Df)(x,t)=\langle f(x),e_{t}\rangle _{\mathbb {R} ^{T}}}

dóndemit{\displaystyle e_{t}}es eltel{\displaystyle t^{\text{th}}}componente de la base canónica paraRT{\displaystyle \mathbb {R} ^{T}}, se puede demostrar queD{\displaystyle D}es biyectiva y una isometría entreHΓ{\displaystyle H_{\Gamma }}yHγ{\displaystyle H_{\gamma }}.

Si bien esta perspectiva del vvRKHS puede ser útil en el aprendizaje multitarea, esta isometría no reduce el estudio del caso vectorial al caso escalar. De hecho, este procedimiento de isometría puede dificultar demasiado el trabajo práctico tanto con el núcleo escalar como con el espacio de entrada, ya que a menudo se pierden propiedades de los núcleos originales. [ 12 ] [ 13 ] [ 14 ]

Una clase importante de núcleos reproductores con valores matriciales son los núcleos separables que pueden factorizarse como el producto de un núcleo con valores escalares y unT{\displaystyle T}Matriz simétrica semidefinida positiva de dimensión . En vista de nuestra discusión anterior, estos núcleos son de la forma

γ((incógnita,t),(y,s))=K(incógnita,y)KT(t,s){\displaystyle \gamma ((x,t),(y,s))=K(x,y)K_{T}(t,s)}

a pesar deincógnita,y{\displaystyle x,y}enincógnita{\displaystyle X}yt,s{\displaystyle t,s}enT{\displaystyle T}Así como el núcleo escalar codifica las dependencias entre las entradas, podemos observar que el núcleo matricial codifica las dependencias tanto entre las entradas como entre las salidas.

Por último, cabe señalar que la teoría anterior puede extenderse a espacios de funciones con valores en espacios de funciones, pero obtener núcleos para estos espacios es una tarea más difícil. [ 15 ]

Conexión entre los RKHS y la función ReLU

La función ReLU se define comúnmente comoF(incógnita)=máximo{0,incógnita}{\displaystyle f(x)=\max\{0,x\}}y es un elemento fundamental en la arquitectura de las redes neuronales, donde se utiliza como función de activación. Se puede construir una función no lineal similar a ReLU utilizando la teoría de los espacios de Hilbert con núcleo reproductor. A continuación, derivamos esta construcción y mostramos cómo implica el poder de representación de las redes neuronales con activaciones ReLU.

Trabajaremos con el espacio de Hilbert.H=L21(0)[0,){\displaystyle {\mathcal {H}}=L_{2}^{1}(0)[0,\infty )}de funciones absolutamente continuas conF(0)=0{\displaystyle f(0)=0}y de cuadrado integrable (es decir,L2{\displaystyle L_{2}}) derivado. Tiene el producto interno

F,gramoH=0F(incógnita)gramo(incógnita)dincógnita.{\displaystyle \langle f,g\rangle _{\mathcal {H}}=\int _{0}^{\infty }f'(x)g'(x)\,dx.}

Para construir el núcleo reproductor basta con considerar un subespacio denso, así que seaFdo1[0,){\displaystyle f\in C^{1}[0,\infty )}yF(0)=0{\displaystyle f(0)=0}El Teorema Fundamental del Cálculo entonces da

F(y)=0yF(incógnita)dincógnita=0GRAMO(incógnita,y)F(incógnita)dincógnita=Ky,F{\displaystyle f(y)=\int _{0}^{y}f'(x)\,dx=\int _{0}^{\infty }G(x,y)f'(x)\,dx=\langle K_{y},f\rangle }

dónde

GRAMO(incógnita,y)={1,incógnita<y0,de lo contrario{\displaystyle G(x,y)={\begin{cases}1,&x<y\\0,&{\text{otherwise}}\end{cases}}}

yKy(incógnita)=GRAMO(incógnita,y), Ky(0)=0{\displaystyle K_{y}'(x)=G(x,y),\ K_{y}(0)=0}es decir

K(incógnita,y)=Ky(incógnita)=0incógnitaGRAMO(z,y)dz={incógnita,0incógnita<yy,de lo contrario.=min(incógnita,y){\displaystyle K(x,y)=K_{y}(x)=\int _{0}^{x}G(z,y)\,dz={\begin{cases}x,&0\leq x<y\\y,&{\text{otherwise.}}\end{cases}}=\min(x,y)}

Esto implicaKy=K(,y){\displaystyle K_{y}=K(\cdot ,y)}reproduceF{\displaystyle f}.

Además, la función mínima enincógnita×incógnita=[0,)×[0,){\displaystyle X\times X=[0,\infty )\times [0,\infty )}tiene las siguientes representaciones con la función ReLU:

min(incógnita,y)=incógnitaReLU(incógnitay)=yReLU(yincógnita).{\displaystyle \min(x,y)=x-\operatorname {ReLU} (x-y)=y-\operatorname {ReLU} (y-x).}

Utilizando esta formulación, podemos aplicar el teorema del representante al RKHS, lo que permite demostrar la optimalidad del uso de activaciones ReLU en entornos de redes neuronales.

Véase también

Notas

  1. Alpay, D., y TM Mills. "Una familia de espacios de Hilbert que no son espacios de Hilbert con núcleo reproductor." J. Anal. Appl. 1.2 (2003): 107–111.
  2. Z. Pasternak-Winiarski, "Sobre pesos que admiten núcleos reproductores de tipo Bergman", International Journal of Mathematics and Mathematical Sciences , vol. 15, número 1, 1992.
  3. T. Ł. Żynda, "Sobre pesos que admiten núcleos reproductores de tipo Szegő", Revista de Análisis Matemático Contemporáneo (Academia Armenia de Ciencias), 55, 2020.
  4. ^ Zaremba, S. L'équation biharmonique et una clase remarquable de funciones fundamentales armónicas. Krakauer Anzeiger, 147-196 (1907)
  5. Okutmustur
  6. Paulson
  7. Durrett
  8. Rosasco
  9. Rosasco
  10. Berlinet, Alain y Thomas, Christine. Espacios de Hilbert con núcleo reproductor en Probabilidad y Estadística , Kluwer Academic Publishers, 2004
  11. Thomas-Agnan C. Cálculo de una familia de núcleos reproductores para aplicaciones estadísticas. Numerical Algorithms, 13, pp. 21-32 (1996)
  12. De Vito
  13. Zhang
  14. Álvarez
  15. Rosasco

Referencias

  • Álvarez, Mauricio, Rosasco, Lorenzo y Lawrence, Neil, “Núcleos para funciones con valores vectoriales: una revisión”, https://arxiv.org/abs/1106.6251 , junio de 2011.
  • Aronszajn, Nachman (1950). "Teoría de los núcleos reproductores" . Transactions of the American Mathematical Society . 68 (3): 337– 404. Bibcode : 1950TAMS...68..337A . doi : 10.1090/S0002-9947-1950-0051437-7 . JSTOR 1990404. MR 0051437 .  
  • Berlinet, Alain y Thomas, Christine. Espacios de Hilbert con núcleo reproductor en Probabilidad y Estadística , Kluwer Academic Publishers, 2004.
  • Cucker, Felipe; Smale, Steve (2002). "Sobre los fundamentos matemáticos del aprendizaje" . Boletín de la Sociedad Matemática Americana . 39 (1): 1– 49. doi : 10.1090/S0273-0979-01-00923-5 . MR 1864085 . 
  • De Vito, Ernest, Umanita, Veronica y Villa, Silvia. "Una extensión del teorema de Mercer a núcleos medibles con valores vectoriales", arXiv : 1110.4017 , junio de 2013.
  • Durrett, Greg. Apuntes del curso 9.520, Instituto Tecnológico de Massachusetts, https://www.mit.edu/~9.520/scribe-notes/class03_gdurett.pdf , febrero de 2010.
  • Kimeldorf, George; Wahba, Grace (1971). "Algunos resultados sobre funciones spline de Chebyshev" (PDF) . Journal of Mathematical Analysis and Applications . 33 (1): 82– 95. Bibcode : 1971JMAA...33...82K . doi : 10.1016/0022-247X(71)90184-3 . MR 0290013 . 
  • Okutmustur, Baver. “Espacios de Hilbert con núcleo reproductor”, tesis de maestría, Universidad de Bilkent, https://users.metu.edu.tr/baver/MS.Thesis.pdf , agosto de 2005.
  • Paulsen, Vern. “Una introducción a la teoría de los espacios de Hilbert con núcleo reproductor”, https://citeseerx.ist.psu.edu/document?repid=rep1&type=pdf&doi=440218056738e05b5ab43679f932a9f33fccee87 .
  • Steinwart, Ingo; Scovel, Clint (2012). "Teorema de Mercer sobre dominios generales: Sobre la interacción entre medidas, núcleos y RKHS". Constr . Approx . 35 (3): 363– 417. doi : 10.1007/s00365-012-9153-3 . MR 2914365. S2CID 253885172 .  
  • Rosasco, Lorenzo y Poggio, Thomas. "Un recorrido por la regularización en el aprendizaje automático: apuntes de clase del MIT 9.520". Manuscrito, diciembre de 2014.
  • Wahba, Grace , Modelos de splines para datos observacionales , SIAM , 1990.
  • Zhang, Haizhang; Xu, Yuesheng; Zhang, Qinghui (2012). "Refinamiento de núcleos reproductores con valores de operador" (PDF) . Journal of Machine Learning Research . 13 : 91–136 .