Articulo de referencia

núcleo definido positivo

En la teoría de operadores , una rama de las matemáticas, un núcleo definido positivo es una generalización de una función definida positiva o una matriz definida positiva . Fue...

En la teoría de operadores , una rama de las matemáticas, un núcleo definido positivo es una generalización de una función definida positiva o una matriz definida positiva . Fue introducido por primera vez por James Mercer a principios del siglo XX, en el contexto de la resolución de ecuaciones integrales de operadores . Desde entonces, las funciones definidas positivas y sus diversos análogos y generalizaciones han surgido en diversas áreas de las matemáticas. Aparecen de forma natural en el análisis de Fourier , la teoría de la probabilidad , la teoría de operadores , la teoría de funciones complejas , los problemas de momentos , las ecuaciones integrales , los problemas de contorno para ecuaciones diferenciales parciales , el aprendizaje automático , el problema de incrustación , la teoría de la información y otras áreas.

Definición

Dejarincógnita{\displaystyle {\mathcal {X}}}ser un conjunto no vacío, a veces denominado conjunto de índices . Una función simétricaK:incógnita×incógnitaR{\displaystyle K:{\mathcal {X}}\times {\mathcal {X}}\to \mathbb {R} }se denomina núcleo definido positivo (pd) enincógnita{\displaystyle {\mathcal {X}}}si

se aplica a todosincógnita1,,incógnitanorteincógnita{\displaystyle x_{1},\dots ,x_{n}\in {\mathcal {X}}},nortenorte,do1,,donorteR{\displaystyle n\in \mathbb {N} ,c_{1},\dots ,c_{n}\in \mathbb {R} }.

En teoría de la probabilidad, a veces se hace una distinción entre núcleos definidos positivos, para los cuales la igualdad en (1.1) implicadoi=0(i){\displaystyle c_{i}=0\;(\forall i)}y núcleos semidefinidos positivos (psd), que no imponen esta condición. Nótese que esto es equivalente a exigir que toda matriz finita construida mediante evaluación por pares,Kij=K(incógnitai,incógnitaj){\displaystyle \mathbf {K} _{ij}=K(x_{i},x_{j})}, tiene valores propios totalmente positivos (pd) o no negativos (psd) .

En la literatura matemática, los núcleos suelen ser funciones de valor complejo. Es decir, una función de valor complejo.K:incógnita×incógnitado{\displaystyle K:{\mathcal {X}}\times {\mathcal {X}}\to \mathbb {C} }se denomina núcleo hermitiano siK(incógnita,y)=K(y,incógnita)¯{\displaystyle K(x,y)={\overline {K(y,x)}}}y definida positiva si para cada conjunto finito de puntosincógnita1,,incógnitanorteincógnita{\displaystyle x_{1},\dots ,x_{n}\in {\mathcal {X}}}y cualquier número complejoξ1,,ξnortedo{\displaystyle \xi _{1},\dots ,\xi _{n}\in \mathbb {C} },

i=1nortej=1norteξiξ¯jK(incógnitai,incógnitaj)0{\displaystyle \sum _{i=1}^{n}\sum _{j=1}^{n}\xi _{i}{\overline {\xi }}_{j}K(x_{i},x_{j})\geq 0}

dóndeξ¯j{\displaystyle {\overline {\xi }}_{j}}denota el conjugado complejo . [ 1 ] En el resto de este artículo asumimos funciones de valor real, que es la práctica común en las aplicaciones de los núcleos pd.

Algunas propiedades generales

  • Para una familia de núcleos pd(Ki)inorte,  Ki:incógnita×incógnitaR{\displaystyle (K_{i})_{i\in \mathbb {N} },\ \ K_{i}:{\mathcal {X}}\times {\mathcal {X}}\to \mathbb {R} }
    • La suma cónicai=1norteλiKi{\displaystyle \sum _{i=1}^{n}\lambda _{i}K_{i}} es pd, dadoλ1,,λnorte0{\displaystyle \lambda _ {1},\dots,\lambda _ {n}\geq 0}
    • El productoK1a1Knorteanorte{\displaystyle K_{1}^{a_{1}}\dots K_{n}^{a_{n}}}es pd, dadoa1,,anortenorte{\displaystyle a_{1},\dots ,a_{n}\in \mathbb {N} }
    • El límiteK=límitenorteKnorte{\displaystyle K=\lim _{n\to \infty }K_{n}}es pd si el límite existe.
  • Si(incógnitai)i=1norte{\displaystyle ({\mathcal {X}}_{i})_{i=1}^{n}} es una secuencia de conjuntos, y(Ki)i=1norte,  Ki:incógnitai×incógnitaiR{\displaystyle (K_{i})_{i=1}^{n},\ \ K_{i}:{\mathcal {X}}_{i}\times {\mathcal {X}}_{i}\to \mathbb {R} }una secuencia de núcleos pd, luego ambosK((incógnita1,,incógnitanorte),(y1,,ynorte))=i=1norteKi(incógnitai,yi){\displaystyle K((x_{1},\dots ,x_{n}),(y_{1},\dots ,y_{n}))=\prod _{i=1}^{n}K_{i}(x_{i},y_{i})}yK((incógnita1,,incógnitanorte),(y1,,ynorte))=i=1norteKi(incógnitai,yi){\displaystyle K((x_{1},\dots ,x_{n}),(y_{1},\dots ,y_{n}))=\sum _{i=1}^{n}K_{i}(x_{i},y_{i})}¿Están los kernels de PD en?incógnita=incógnita1××incógnitanorte{\displaystyle {\mathcal {X}}={\mathcal {X}}_{1}\times \dots \times {\mathcal {X}}_{n}}.
  • Dejarincógnita0incógnita{\displaystyle {\mathcal {X}}_{0}\subset {\mathcal {X}}}. Entonces la restricciónK0{\displaystyle K_{0}}deK{\displaystyle K}aincógnita0×incógnita0{\displaystyle {\mathcal {X}}_{0}\times {\mathcal {X}}_{0}}También es un núcleo pd.

Ejemplos de núcleos pd

  • Ejemplos comunes de núcleos pd definidos en el espacio euclidianoRd{\displaystyle \mathbb {R} ^{d}}incluir:
    • Núcleo lineal:K(incógnita,y)=incógnitaTy,incógnita,yRd{\displaystyle K(\mathbf {x} ,\mathbf {y} )=\mathbf {x} ^{T}\mathbf {y} ,\quad \mathbf {x} ,\mathbf {y} \in \mathbb {R} ^{d}}.
    • Núcleo polinomial :K(incógnita,y)=(incógnitaTy+r)norte,incógnita,yRd,r0,norte1{\displaystyle K(\mathbf {x} ,\mathbf {y} )=(\mathbf {x} ^{T}\mathbf {y} +r)^{n},\quad \mathbf {x} ,\mathbf {y} \in \mathbb {R} ^{d},r\geq 0,n\geq 1}.
    • Núcleo gaussiano ( núcleo RBF ):K(incógnita,y)=miincógnitay22σ2,incógnita,yRd,σ>0{\displaystyle K(\mathbf {x} ,\mathbf {y} )=e^{-{\frac {\|\mathbf {x} -\mathbf {y} \|^{2}}{2\sigma ^{2}}}},\quad \mathbf {x} ,\mathbf {y} \in \mathbb {R} ^{d},\sigma >0}.
    • Núcleo laplaciano:K(incógnita,y)=miαincógnitay,incógnita,yRd,α>0{\displaystyle K(\mathbf {x} ,\mathbf {y} )=e^{-\alpha \|\mathbf {x} -\mathbf {y} \|},\quad \mathbf {x} ,\mathbf {y} \in \mathbb {R} ^{d},\alpha >0}.
    • Núcleo de Abel:K(incógnita,y)=miα|incógnitay|,incógnita,yR,α>0{\displaystyle K(x,y)=e^{-\alpha |x-y|},\quad x,y\in \mathbb {R} ,\alpha >0}.
    • Núcleo generador de espacios de SobolevW2k(Rd){\displaystyle W_{2}^{k}(\mathbb {R} ^{d})}:K(incógnita,y)=incógnitay2kd2Bkd2(incógnitay2){\displaystyle K(x,y)=\|x-y\|_{2}^{k-{\frac {d}{2}}}B_{k-{\frac {d}{2}}}(\|x-y\|_{2})}, dóndeBν{\displaystyle B_{\nu }}es la función de Bessel de tercer tipo .
    • Núcleo generador del espacio Paley-Wiener:K(incógnita,y)=desde(α(incógnitay)),incógnita,yR,α>0{\displaystyle K(x,y)=\operatorname {sinc} (\alpha (x-y)),\quad x,y\in \mathbb {R} ,\alpha >0}.
  • SiH{\displaystyle H}Si es un espacio de Hilbert , entonces su producto interno correspondiente(,)H:H×HR{\displaystyle (\cdot ,\cdot )_{H}:H\times H\to \mathbb {R} }es un kernel pd. De hecho, tenemosi,j=1nortedoidoj(incógnitai,incógnitaj)H=(i=1nortedoiincógnitai,j=1nortedojincógnitaj)H=i=1nortedoiincógnitaiH20{\displaystyle \sum _{i,j=1}^{n}c_{i}c_{j}(x_{i},x_{j})_{H}=\left(\sum _{i=1}^{n}c_{i}x_{i},\sum _{j=1}^{n}c_{j}x_{j}\right)_{H}=\left\|\sum _{i=1}^{n}c_{i}x_{i}\right\|_{H}^{2}\geq 0}
  • Núcleos definidos enR+d{\displaystyle \mathbb {R} _{+}^{d}} y los histogramas: Los histogramas se encuentran con frecuencia en aplicaciones de problemas de la vida real. La mayoría de las observaciones suelen estar disponibles en forma de vectores no negativos de recuentos, que, si se normalizan, producen histogramas de frecuencias. Se ha demostrado [ 2 ] que la siguiente familia de métricas al cuadrado, respectivamente la divergencia de Jensen, laχ{\displaystyle \chi }-cuadrado, variación total y dos variaciones de la distancia de Hellinger :ψJD=H(θ+θ2)H(θ)+H(θ)2,{\displaystyle \psi _{JD}=H\left({\frac {\theta +\theta '}{2}}\right)-{\frac {H(\theta )+H(\theta ')}{2}},}ψχ2=i(θiθi)2θi+θi,ψTV=i|θiθi|,{\displaystyle \psi _{\chi ^{2}}=\sum _{i}{\frac {(\theta _{i}-\theta _{i}')^{2}}{\theta _{i}+\theta _{i}'}},\quad \psi _{TV}=\sum _{i}\left|\theta _{i}-\theta _{i}'\right|,}ψH1=i|θiθi|,ψH2=i|θiθi|2,{\displaystyle \psi _{H_{1}}=\sum _{i}\left|{\sqrt {\theta _{i}}}-{\sqrt {\theta _{i}'}}\right|,\psi _{H_{2}}=\sum _{i}\left|{\sqrt {\theta _{i}}}-{\sqrt {\theta _{i}'}}\right|^{2},}se puede utilizar para definir núcleos pd utilizando la siguiente fórmulaK(θ,θ)=miαψ(θ,θ),α>0.{\displaystyle K(\theta ,\theta ')=e^{-\alpha \psi (\theta ,\theta ')},\alpha >0.}

Ejemplos de otros núcleos

El núcleo sigmoide, o núcleo tangente hiperbólico, se define comoK(incógnita,y)=tanh(γincógnitaTy+r),incógnita,yRd{\displaystyle K(\mathbf {x} ,\mathbf {y} )=\tanh(\gamma \mathbf {x} ^{T}\mathbf {y} +r),\quad \mathbf {x} ,\mathbf {y} \in \mathbb {R} ^{d}}dóndeγ,r{\displaystyle \gamma ,r}son parámetros reales. El núcleo no es PD, pero a veces se ha utilizado para algoritmos de núcleo. [ 3 ]

Historia

Los núcleos definidos positivos, tal como se definen en (1.1), aparecieron por primera vez en 1909 en un artículo sobre ecuaciones integrales de James Mercer. [ 4 ] Varios otros autores utilizaron este concepto en las dos décadas siguientes, pero ninguno de ellos utilizó explícitamente núcleos.K(incógnita,y)=F(incógnitay){\displaystyle K(x,y)=f(x-y)}, funciones iepd (de hecho, M. Mathias y S. Bochner parecen no haber estado al tanto del estudio de los núcleos pd). El trabajo de Mercer surgió del artículo de Hilbert de 1904 [ 5 ] sobre ecuaciones integrales de Fredholm de segundo tipo:

En particular, Hilbert había demostrado que

dóndeK{\displaystyle K}es un núcleo simétrico real continuo,incógnita{\displaystyle x}es continuo,{ψnorte}{\displaystyle \{\psi _{n}\}}es un sistema completo de autofunciones ortonormales yλnorte{\displaystyle \lambda _{n}}son los autovalores correspondientes de (1.2). Hilbert definió un núcleo “definido” como aquel para el cual la integral doble J(incógnita)=ababK(s,t)incógnita(s)incógnita(t) dsdt{\displaystyle J(x)=\int _{a}^{b}\int _{a}^{b}K(s,t)x(s)x(t)\ \mathrm {d} s\;\mathrm {d} t} SatisfaceJ(incógnita)>0{\displaystyle J(x)>0}exceptoincógnita(t)=0{\displaystyle x(t)=0}El objetivo original del artículo de Mercer era caracterizar los núcleos definidos en el sentido de Hilbert, pero Mercer pronto descubrió que la clase de tales funciones era demasiado restrictiva para caracterizarla en términos de determinantes. Por lo tanto, definió un núcleo simétrico real continuo.K(s,t){\displaystyle K(s,t)}ser de tipo positivo (es decir, definido positivo) siJ(incógnita)0{\displaystyle J(x)\geq 0}para todas las funciones continuas realesincógnita{\displaystyle x}en[a,b]{\displaystyle [a,b]}y demostró que (1.1) es una condición necesaria y suficiente para que un núcleo sea de tipo positivo. Mercer demostró entonces que para cualquier núcleo pd continuo la expansión K(s,t)=norteψnorte(s)ψnorte(t)λnorte{\displaystyle K(s,t)=\sum _{n}{\frac {\psi _{n}(s)\psi _{n}(t)}{\lambda _{n}}}} se cumple de forma absoluta y uniforme.

Casi al mismo tiempo, WH Young, [ 6 ] motivado por una cuestión diferente en la teoría de ecuaciones integrales, demostró que para núcleos continuos la condición (1.1) es equivalente aJ(incógnita)0{\displaystyle J(x)\geq 0}a pesar deincógnitaL1[a,b]{\displaystyle x\in L^{1}[a,b]}.

EH Moore [ 7 ] [ 8 ] inició el estudio de un tipo muy general de núcleo pd. Simi{\displaystyle E}es un conjunto abstracto, él llama funcionesK(incógnita,y){\displaystyle K(x,y)}definido enmi×mi{\displaystyle E\times E}“matrices hermíticas positivas” si satisfacen (1.1) para todoincógnitaimi{\displaystyle x_{i}\in E}Moore estaba interesado en la generalización de ecuaciones integrales y demostró que para cada una de ellas...K{\displaystyle K}Hay un espacio de HilbertH{\displaystyle H}de funciones tales que, para cadaFH,F(y)=(F,K(,y))H{\displaystyle f\in H,f(y)=(f,K(\cdot ,y))_{H}}Esta propiedad se denomina propiedad de reproducción del núcleo y resulta ser importante en la solución de problemas de contorno para ecuaciones diferenciales parciales elípticas.

Otra línea de desarrollo en la que los núcleos pd desempeñaron un papel importante fue la teoría de armónicos en espacios homogéneos, iniciada por E. Cartan en 1929 y continuada por H. Weyl y S. Ito. La teoría más completa de los núcleos pd en espacios homogéneos es la de M. Krein [ 9 ] , que incluye como casos especiales el trabajo sobre funciones pd y representaciones unitarias irreducibles de grupos localmente compactos.

En teoría de la probabilidad, los núcleos pd surgen como núcleos de covarianza de procesos estocásticos. [ 10 ]

Conexión con espacios de Hilbert de núcleo reproductor y mapas de características

Los núcleos definidos positivos proporcionan un marco que abarca algunas construcciones básicas de espacios de Hilbert. A continuación, presentamos una estrecha relación entre los núcleos definidos positivos y dos objetos matemáticos: los espacios de Hilbert reproductores y los mapas de características.

Dejarincógnita{\displaystyle X}ser un conjunto,H{\displaystyle H}un espacio de Hilbert de funcionesF:incógnitaR{\displaystyle f:X\to \mathbb {R} }, y(,)H:H×HR{\displaystyle (\cdot ,\cdot )_{H}:H\times H\to \mathbb {R} }el producto interno correspondiente enH{\displaystyle H}. Para cualquierincógnitaincógnita{\displaystyle x\in X}la evaluación funcionalmiincógnita:HR{\displaystyle e_{x}:H\to \mathbb {R} }se define porFmiincógnita(F)=F(incógnita){\displaystyle f\mapsto e_{x}(f)=f(x)}. En primer lugar, definimos un espacio de Hilbert con núcleo reproductor (RKHS):

Definición : EspacioH{\displaystyle H}Se denomina espacio de Hilbert con núcleo reproductor si los funcionales de evaluación son continuos.

Cada RKHS tiene asociada una función especial, a saber, el núcleo reproductor:

Definición : El núcleo reproductor es una funciónK:incógnita×incógnitaR{\displaystyle K:X\times X\to \mathbb {R} }de tal manera que

  1. Kincógnita()H,incógnitaincógnita{\displaystyle K_{x}(\cdot )\in H,\forall x\in X}, y
  2. (F,Kincógnita)H=F(incógnita){\displaystyle (f,K_{x})_{H}=f(x)}, para todosFH{\displaystyle f\in H}yincógnitaincógnita{\displaystyle x\in X}.

Esta última propiedad se denomina propiedad reproductora.

El siguiente resultado muestra la equivalencia entre RKHS y núcleos reproductores:

Teorema : Todo núcleo reproductorK{\displaystyle K}induce un RKHS único, y cada RKHS tiene un núcleo reproductor único.

Ahora bien, la conexión entre los núcleos definidos positivos y RKHS viene dada por el siguiente teorema:

Teorema : Todo núcleo reproductor es definido positivo, y todo núcleo definido positivo define un único RKHS, del cual es el único núcleo reproductor.

Por lo tanto, dado un núcleo definido positivoK{\displaystyle K}, es posible construir un RKHS asociado conK{\displaystyle K}como núcleo reproductor.

Como se indicó anteriormente, los núcleos definidos positivos se pueden construir a partir de productos internos. Este hecho se puede utilizar para conectar los núcleos pd con otro objeto interesante que surge en las aplicaciones de aprendizaje automático, a saber, el mapa de características.F{\displaystyle F}ser un espacio de Hilbert y(,)F{\displaystyle (\cdot ,\cdot )_{F}}el producto interno correspondiente. Cualquier mapaΦ:incógnitaF{\displaystyle \Phi :X\to F}se llama mapa de características. En este caso lo llamamosF{\displaystyle F}el espacio de características. Es fácil ver [ 11 ] que cada mapa de características define un núcleo pd único por K(incógnita,y)=(Φ(incógnita),Φ(y))F.{\displaystyle K(x,y)=(\Phi (x),\Phi (y))_{F}.} De hecho, la definitividad positiva deK{\displaystyle K}Se deduce de la propiedad pd del producto interno. Por otro lado, cada núcleo pd, y su correspondiente RKHS, tienen muchos mapas de características asociados. Por ejemplo: SeaF=H{\displaystyle F=H}, yΦ(incógnita)=Kincógnita{\displaystyle \Phi (x)=K_{x}}a pesar deincógnitaincógnita{\displaystyle x\in X}. Entonces(Φ(incógnita),Φ(y))F=(Kincógnita,Ky)H=K(incógnita,y){\displaystyle (\Phi (x),\Phi (y))_{F}=(K_{x},K_{y})_{H}=K(x,y)}, por la propiedad de reproducción. Esto sugiere una nueva mirada a los núcleos pd como productos internos en espacios de Hilbert apropiados, o en otras palabras, los núcleos pd pueden verse como mapas de similitud que cuantifican de manera efectiva cuán similares son dos puntos.incógnita{\displaystyle x} yy{\displaystyle y}son a través del valorK(incógnita,y){\displaystyle K(x,y)}Además, mediante la equivalencia de los núcleos pd y su RKHS correspondiente, cada mapa de características puede utilizarse para construir un RKHS.

Núcleos y distancias

Los métodos de kernel se comparan a menudo con métodos basados ​​en distancias, como los de vecinos más cercanos . En esta sección analizamos los paralelismos entre sus dos componentes respectivos, a saber, los kernels.K{\displaystyle K}y distanciasd{\displaystyle d}.

Aquí, mediante una función de distancia entre cada par de elementos de algún conjuntoincógnita{\displaystyle X}Nos referimos a una métrica definida en ese conjunto, es decir, cualquier función con valores no negativos.d{\displaystyle d}enincógnita×incógnita{\displaystyle {\mathcal {X}}\times {\mathcal {X}}}lo cual satisface

  • d(incógnita,y)0{\displaystyle d(x,y)\geq 0}, yd(incógnita,y)=0{\displaystyle d(x,y)=0}si y solo siincógnita=y{\displaystyle x=y},
  • d(incógnita,y)=d(y,incógnita),{\displaystyle d(x,y)=d(y,x),}
  • d(incógnita,z)d(incógnita,y)+d(y,z).{\displaystyle d(x,z)\leq d(x,y)+d(y,z).}

Un vínculo entre las distancias y los núcleos pd viene dado por un tipo particular de núcleo, llamado núcleo definido negativo, y se define de la siguiente manera:

Definición : Una función simétricaψ:incógnita×incógnitaR{\displaystyle \psi :{\mathcal {X}}\times {\mathcal {X}}\to \mathbb {R} } se denomina núcleo definido negativo (nd) enincógnita{\displaystyle {\mathcal {X}}}si

se mantiene para cualquiernortenorte,incógnita1,,incógnitanorteincógnita,{\displaystyle n\in \mathbb {N} ,x_{1},\dots ,x_{n}\in {\mathcal {X}},}ydo1,,donorteR{\displaystyle c_{1},\dots ,c_{n}\in \mathbb {R} }de tal manera quei=1nortedoi=0{\textstyle \sum _{i=1}^{n}c_{i}=0}.

El paralelismo entre los núcleos nd y las distancias es el siguiente: siempre que un núcleo nd se anule en el conjunto{(incógnita,incógnita):incógnitaincógnita}{\displaystyle \{(x,x):x\in {\mathcal {X}}\}}y es cero solo en este conjunto, entonces su raíz cuadrada es una distancia paraincógnita{\displaystyle {\mathcal {X}}}. [ 12 ] Al mismo tiempo, cada distancia no corresponde necesariamente a un núcleo nd. Esto solo es cierto para las distancias hilbertianas, donde la distanciad{\displaystyle d}Se denomina hilbertiano si se puede incrustar el espacio métrico.(incógnita,d){\displaystyle ({\mathcal {X}},d)}isométricamente en algún espacio de Hilbert.

Por otro lado, los núcleos nd pueden identificarse con una subfamilia de núcleos pd conocidos como núcleos infinitamente divisibles. Un núcleo de valor no negativoK{\displaystyle K}Se dice que es infinitamente divisible si para cadanortenorte{\displaystyle n\in \mathbb {N} }Existe un núcleo definido positivoKnorte{\displaystyle K_{n}}de tal manera queK=(Knorte)norte{\displaystyle K=(K_{n})^{n}}.

Otro vínculo es que un núcleo pd induce una pseudométrica , donde la primera restricción sobre la función de distancia se relaja para permitird(incógnita,y)=0{\displaystyle d(x,y)=0}paraincógnitay{\displaystyle x\neq y}Dado un núcleo definido positivoK{\displaystyle K}Podemos definir una función de distancia como: d(incógnita,y)=K(incógnita,incógnita)2K(incógnita,y)+K(y,y){\displaystyle d(x,y)={\sqrt {K(x,x)-2K(x,y)+K(y,y)}}}

Algunas aplicaciones

Núcleos en el aprendizaje automático

Los núcleos definidos positivos, gracias a su equivalencia con los espacios de Hilbert con núcleo reproductor (RKHS), son particularmente importantes en el campo de la teoría del aprendizaje estadístico debido al célebre teorema del representante , que establece que toda función minimizadora en un RKHS puede expresarse como una combinación lineal de la función núcleo evaluada en los puntos de entrenamiento. Este resultado resulta de gran utilidad práctica, ya que simplifica eficazmente el problema de minimización del riesgo empírico, transformándolo de un problema de optimización de dimensión infinita a uno de dimensión finita.

Núcleos en modelos probabilísticos

En la teoría de la probabilidad, existen varias formas diferentes en que surgen los núcleos.

  • Problemas de recuperación no deterministas: Supongamos que queremos encontrar la respuesta.F(incógnita){\displaystyle f(x)}de una función modelo desconocidaF{\displaystyle f}en un nuevo puntoincógnita{\displaystyle x}de un conjuntoincógnita{\displaystyle {\mathcal {X}}}, siempre que tengamos una muestra de pares entrada-respuesta(incógnitai,Fi)=(incógnitai,F(incógnitai)){\displaystyle (x_{i},f_{i})=(x_{i},f(x_{i}))}dada por observación o experimentación. La respuestaFi{\displaystyle f_{i}}enincógnitai{\displaystyle x_{i}}no es una función fija deincógnitai{\displaystyle x_{i}}sino más bien una realización de una variable aleatoria de valor real.Z(incógnitai){\displaystyle Z(x_{i})}El objetivo es obtener información sobre la función.mi[Z(incógnitai)]{\displaystyle E[Z(x_{i})]}que reemplazaF{\displaystyle f}en el entorno determinista. Para dos elementosincógnita,yincógnita{\displaystyle x,y\in {\mathcal {X}}}las variables aleatoriasZ(incógnita){\displaystyle Z(x)}yZ(y){\displaystyle Z(y)}no estarán descorrelacionados, porque siincógnita{\displaystyle x}está demasiado cerca dey{\displaystyle y}los experimentos aleatorios descritos porZ(incógnita){\displaystyle Z(x)}yZ(y){\displaystyle Z(y)}A menudo mostrarán un comportamiento similar. Esto se describe mediante un núcleo de covarianza.K(incógnita,y)=mi[Z(incógnita)Z(y)]{\displaystyle K(x,y)=E[Z(x)\cdot Z(y)]}. Dicho núcleo existe y es definido positivo bajo supuestos adicionales débiles. Ahora, una buena estimación paraZ(incógnita){\displaystyle Z(x)}se puede obtener utilizando la interpolación de núcleo con el núcleo de covarianza, ignorando por completo el fondo probabilístico.

Supongamos ahora que una variable de ruidoϵ(incógnita){\displaystyle \epsilon (x)}, con media cero y varianza ceroσ2{\displaystyle \sigma ^{2}}, se agrega aincógnita{\displaystyle x}, de tal manera que el ruido sea independiente para diferentesincógnita{\displaystyle x}y independiente deZ{\displaystyle Z}ahí, entonces el problema de encontrar una buena estimación paraF{\displaystyle f}es idéntico al anterior, pero con un núcleo modificado dado porK(incógnita,y)=mi[Z(incógnita)Z(y)]+σ2δincógnitay{\displaystyle K(x,y)=E[Z(x)\cdot Z(y)]+\sigma ^{2}\delta _{xy}}.

  • Estimación de densidad mediante núcleos: El problema consiste en recuperar la densidad.F{\displaystyle f}de una distribución multivariada sobre un dominioincógnita{\displaystyle {\mathcal {X}}}, de una muestra grandeincógnita1,,incógnitanorteincógnita{\displaystyle x_{1},\dots ,x_{n}\in {\mathcal {X}}}incluyendo repeticiones. Cuando los puntos de muestreo son densos, la verdadera función de densidad debe tomar valores grandes. Es posible una estimación simple de la densidad contando el número de muestras en cada celda de una cuadrícula y graficando el histograma resultante, lo que produce una estimación de densidad constante por partes. Se puede obtener una mejor estimación utilizando un núcleo invariante a la traslación no negativo.K{\displaystyle K}, con la integral total igual a uno, y definimosF(incógnita)=1nortei=1norteK(incógnitaincógnitaih){\displaystyle f(x)={\frac {1}{n}}\sum _{i=1}^{n}K\left({\frac {x-x_{i}}{h}}\right)}como una estimación aproximada.

Solución numérica de ecuaciones diferenciales parciales

Una de las principales áreas de aplicación de los llamados métodos sin malla es la solución numérica de EDP . Algunos de los métodos sin malla más populares están estrechamente relacionados con núcleos definidos positivos (como el método de Petrov-Galerkin local sin malla (MLPG) , el método de partículas con núcleo reproductor (RKPM) y la hidrodinámica de partículas suavizadas (SPH) ). Estos métodos utilizan un núcleo de base radial para la colocación . [ 13 ]

Teorema de dilatación de Stinespring

Otras aplicaciones

En la literatura sobre experimentos computacionales [ 14 ] y otros experimentos de ingeniería, se encuentran cada vez más modelos basados ​​en núcleos pd, RBF o kriging . Un ejemplo de ello es la metodología de superficies de respuesta . Otros tipos de aplicaciones que se reducen al ajuste de datos son el prototipado rápido y los gráficos por computadora . En estos casos, se suelen utilizar modelos de superficie implícitos para aproximar o interpolar datos de nubes de puntos.

Las aplicaciones de los núcleos pd en diversas ramas de las matemáticas se encuentran en la integración multivariada, la optimización multivariada y en el análisis numérico y la computación científica, donde se estudian algoritmos rápidos, precisos y adaptativos, idealmente implementados en entornos de computación de alto rendimiento. [ 15 ]

Véase también

Referencias

  1. Berezanskij, Jurij Makarovič (1968). Expansiones en autofunciones de operadores autoadjuntos . Providence, RI: American Mathematical Soc. pp. 45–47 . ISBN  978-0-8218-1567-0.
  2. Hein, M. y Bousquet, O. (2005). " Métricas hilbertianas y núcleos definidos positivos en medidas de probabilidad ". En Ghahramani, Z. y Cowell, R., editores, Actas de AISTATS 2005.
  3. Lin, Hsuan-Tien y Chih-Jen Lin. "Un estudio sobre núcleos sigmoideos para SVM y el entrenamiento de núcleos no PSD mediante métodos de tipo SMO." Neural Comput 3.1-32 (2003): 16.
  4. Mercer, J. (1909). “Funciones de tipo positivo y negativo y su conexión con la teoría de ecuaciones integrales”. Philosophical Transactions of the Royal Society of London, Serie A 209, pp. 415–446.
  5. ^ Hilbert, D. (1904). "Grundzuge einer allgemeinen Theorie der linearen Integralgleichungen I", Gott. Nachrichten, matemáticas-física. K1 (1904), págs. 49–91.
  6. Young, WH (1909). "Una nota sobre una clase de funciones simétricas y sobre un teorema requerido en la teoría de ecuaciones integrales", Philos. Trans. Roy.Soc. London, Ser. A, 209, pp. 415–446.
  7. Moore, EH (1916). "Sobre matrices hermíticas propiamente positivas", Bull. Amer. Math. Soc. 23, 59, pp. 66–67.
  8. Moore, EH (1935). "Análisis general, parte I", Memorias de la Sociedad Filosófica Americana 1, Filadelfia.
  9. Krein. M (1949/1950). "Núcleos hermíticos positivos en espacios homogéneos I y II" (en ruso), Ukrain. Mat. Z. 1(1949), pp. 64–98, y 2(1950), pp. 10–59. Traducción al inglés: Amer. Math. Soc. Translations Ser. 2, 34 (1963), pp. 69–164.
  10. Loève, M. (1960). "Teoría de la probabilidad", 2.ª ed., Van Nostrand, Princeton, NJ
  11. Rosasco, L. y Poggio, T. (2015). "Un recorrido por la regularización del aprendizaje automático: apuntes de clase del MIT 9.520" Manuscrito.
  12. Berg, C., Christensen, JPR y Ressel, P. (1984). "Análisis armónico en semigrupos". Número 100 en Textos de posgrado en matemáticas, Springer Verlag.
  13. Schaback, R. y Wendland, H. (2006). "Técnicas de kernel: del aprendizaje automático a los métodos sin malla", Cambridge University Press, Acta Numerica (2006), págs. 1–97.
  14. Haaland, B. y Qian, PZG (2010). "Emuladores precisos para experimentos informáticos a gran escala", Ann. Stat.
  15. Gumerov, NA y Duraiswami, R. (2007). " Interpolación rápida de funciones de base radial mediante iteración de Krylov precondicionada ". SIAM J. Scient. Computing 29/5, pp. 1876–1899.
Obtenido de " https://en.wikipedia.org/w/index.php?title=Positive-definite_kernel&oldid=1352984397 "