En la teoría de operadores , una rama de las matemáticas, un núcleo definido positivo es una generalización de una función definida positiva o una matriz definida positiva . Fue introducido por primera vez por James Mercer a principios del siglo XX, en el contexto de la resolución de ecuaciones integrales de operadores . Desde entonces, las funciones definidas positivas y sus diversos análogos y generalizaciones han surgido en diversas áreas de las matemáticas. Aparecen de forma natural en el análisis de Fourier , la teoría de la probabilidad , la teoría de operadores , la teoría de funciones complejas , los problemas de momentos , las ecuaciones integrales , los problemas de contorno para ecuaciones diferenciales parciales , el aprendizaje automático , el problema de incrustación , la teoría de la información y otras áreas.
Definición
Dejarser un conjunto no vacío, a veces denominado conjunto de índices . Una función simétricase denomina núcleo definido positivo (pd) ensi
se aplica a todos,.
En teoría de la probabilidad, a veces se hace una distinción entre núcleos definidos positivos, para los cuales la igualdad en (1.1) implicay núcleos semidefinidos positivos (psd), que no imponen esta condición. Nótese que esto es equivalente a exigir que toda matriz finita construida mediante evaluación por pares,, tiene valores propios totalmente positivos (pd) o no negativos (psd) .
En la literatura matemática, los núcleos suelen ser funciones de valor complejo. Es decir, una función de valor complejo.se denomina núcleo hermitiano siy definida positiva si para cada conjunto finito de puntosy cualquier número complejo,
dóndedenota el conjugado complejo . [ 1 ] En el resto de este artículo asumimos funciones de valor real, que es la práctica común en las aplicaciones de los núcleos pd.
Algunas propiedades generales
- Para una familia de núcleos pd
- La suma cónica es pd, dado
- El productoes pd, dado
- El límitees pd si el límite existe.
- Si es una secuencia de conjuntos, yuna secuencia de núcleos pd, luego ambosy¿Están los kernels de PD en?.
- Dejar. Entonces la restriccióndeaTambién es un núcleo pd.
Ejemplos de núcleos pd
- Ejemplos comunes de núcleos pd definidos en el espacio euclidianoincluir:
- Núcleo lineal:.
- Núcleo polinomial :.
- Núcleo gaussiano ( núcleo RBF ):.
- Núcleo laplaciano:.
- Núcleo de Abel:.
- Núcleo generador de espacios de Sobolev:, dóndees la función de Bessel de tercer tipo .
- Núcleo generador del espacio Paley-Wiener:.
- SiSi es un espacio de Hilbert , entonces su producto interno correspondientees un kernel pd. De hecho, tenemos
- Núcleos definidos en y los histogramas: Los histogramas se encuentran con frecuencia en aplicaciones de problemas de la vida real. La mayoría de las observaciones suelen estar disponibles en forma de vectores no negativos de recuentos, que, si se normalizan, producen histogramas de frecuencias. Se ha demostrado [ 2 ] que la siguiente familia de métricas al cuadrado, respectivamente la divergencia de Jensen, la-cuadrado, variación total y dos variaciones de la distancia de Hellinger :se puede utilizar para definir núcleos pd utilizando la siguiente fórmula
Ejemplos de otros núcleos
El núcleo sigmoide, o núcleo tangente hiperbólico, se define comodóndeson parámetros reales. El núcleo no es PD, pero a veces se ha utilizado para algoritmos de núcleo. [ 3 ]
Historia
Los núcleos definidos positivos, tal como se definen en (1.1), aparecieron por primera vez en 1909 en un artículo sobre ecuaciones integrales de James Mercer. [ 4 ] Varios otros autores utilizaron este concepto en las dos décadas siguientes, pero ninguno de ellos utilizó explícitamente núcleos., funciones iepd (de hecho, M. Mathias y S. Bochner parecen no haber estado al tanto del estudio de los núcleos pd). El trabajo de Mercer surgió del artículo de Hilbert de 1904 [ 5 ] sobre ecuaciones integrales de Fredholm de segundo tipo:
En particular, Hilbert había demostrado que
dóndees un núcleo simétrico real continuo,es continuo,es un sistema completo de autofunciones ortonormales yson los autovalores correspondientes de (1.2). Hilbert definió un núcleo “definido” como aquel para el cual la integral doble SatisfaceexceptoEl objetivo original del artículo de Mercer era caracterizar los núcleos definidos en el sentido de Hilbert, pero Mercer pronto descubrió que la clase de tales funciones era demasiado restrictiva para caracterizarla en términos de determinantes. Por lo tanto, definió un núcleo simétrico real continuo.ser de tipo positivo (es decir, definido positivo) sipara todas las funciones continuas realeseny demostró que (1.1) es una condición necesaria y suficiente para que un núcleo sea de tipo positivo. Mercer demostró entonces que para cualquier núcleo pd continuo la expansión se cumple de forma absoluta y uniforme.
Casi al mismo tiempo, WH Young, [ 6 ] motivado por una cuestión diferente en la teoría de ecuaciones integrales, demostró que para núcleos continuos la condición (1.1) es equivalente aa pesar de.
EH Moore [ 7 ] [ 8 ] inició el estudio de un tipo muy general de núcleo pd. Sies un conjunto abstracto, él llama funcionesdefinido en“matrices hermíticas positivas” si satisfacen (1.1) para todoMoore estaba interesado en la generalización de ecuaciones integrales y demostró que para cada una de ellas...Hay un espacio de Hilbertde funciones tales que, para cadaEsta propiedad se denomina propiedad de reproducción del núcleo y resulta ser importante en la solución de problemas de contorno para ecuaciones diferenciales parciales elípticas.
Otra línea de desarrollo en la que los núcleos pd desempeñaron un papel importante fue la teoría de armónicos en espacios homogéneos, iniciada por E. Cartan en 1929 y continuada por H. Weyl y S. Ito. La teoría más completa de los núcleos pd en espacios homogéneos es la de M. Krein [ 9 ] , que incluye como casos especiales el trabajo sobre funciones pd y representaciones unitarias irreducibles de grupos localmente compactos.
En teoría de la probabilidad, los núcleos pd surgen como núcleos de covarianza de procesos estocásticos. [ 10 ]
Conexión con espacios de Hilbert de núcleo reproductor y mapas de características
Los núcleos definidos positivos proporcionan un marco que abarca algunas construcciones básicas de espacios de Hilbert. A continuación, presentamos una estrecha relación entre los núcleos definidos positivos y dos objetos matemáticos: los espacios de Hilbert reproductores y los mapas de características.
Dejarser un conjunto,un espacio de Hilbert de funciones, yel producto interno correspondiente en. Para cualquierla evaluación funcionalse define por. En primer lugar, definimos un espacio de Hilbert con núcleo reproductor (RKHS):
Definición : EspacioSe denomina espacio de Hilbert con núcleo reproductor si los funcionales de evaluación son continuos.
Cada RKHS tiene asociada una función especial, a saber, el núcleo reproductor:
Definición : El núcleo reproductor es una funciónde tal manera que
- , y
- , para todosy.
Esta última propiedad se denomina propiedad reproductora.
El siguiente resultado muestra la equivalencia entre RKHS y núcleos reproductores:
Teorema : Todo núcleo reproductorinduce un RKHS único, y cada RKHS tiene un núcleo reproductor único.
Ahora bien, la conexión entre los núcleos definidos positivos y RKHS viene dada por el siguiente teorema:
Teorema : Todo núcleo reproductor es definido positivo, y todo núcleo definido positivo define un único RKHS, del cual es el único núcleo reproductor.
Por lo tanto, dado un núcleo definido positivo, es posible construir un RKHS asociado concomo núcleo reproductor.
Como se indicó anteriormente, los núcleos definidos positivos se pueden construir a partir de productos internos. Este hecho se puede utilizar para conectar los núcleos pd con otro objeto interesante que surge en las aplicaciones de aprendizaje automático, a saber, el mapa de características.ser un espacio de Hilbert yel producto interno correspondiente. Cualquier mapase llama mapa de características. En este caso lo llamamosel espacio de características. Es fácil ver [ 11 ] que cada mapa de características define un núcleo pd único por De hecho, la definitividad positiva deSe deduce de la propiedad pd del producto interno. Por otro lado, cada núcleo pd, y su correspondiente RKHS, tienen muchos mapas de características asociados. Por ejemplo: Sea, ya pesar de. Entonces, por la propiedad de reproducción. Esto sugiere una nueva mirada a los núcleos pd como productos internos en espacios de Hilbert apropiados, o en otras palabras, los núcleos pd pueden verse como mapas de similitud que cuantifican de manera efectiva cuán similares son dos puntos. yson a través del valorAdemás, mediante la equivalencia de los núcleos pd y su RKHS correspondiente, cada mapa de características puede utilizarse para construir un RKHS.
Núcleos y distancias
Los métodos de kernel se comparan a menudo con métodos basados en distancias, como los de vecinos más cercanos . En esta sección analizamos los paralelismos entre sus dos componentes respectivos, a saber, los kernels.y distancias.
Aquí, mediante una función de distancia entre cada par de elementos de algún conjuntoNos referimos a una métrica definida en ese conjunto, es decir, cualquier función con valores no negativos.enlo cual satisface
- , ysi y solo si,
Un vínculo entre las distancias y los núcleos pd viene dado por un tipo particular de núcleo, llamado núcleo definido negativo, y se define de la siguiente manera:
Definición : Una función simétrica :{\mathcal {X}}\times {\mathcal {X}}\to \mathbb {R} } se denomina núcleo definido negativo (nd) ensi
se mantiene para cualquieryde tal manera que.
El paralelismo entre los núcleos nd y las distancias es el siguiente: siempre que un núcleo nd se anule en el conjuntoy es cero solo en este conjunto, entonces su raíz cuadrada es una distancia para. [ 12 ] Al mismo tiempo, cada distancia no corresponde necesariamente a un núcleo nd. Esto solo es cierto para las distancias hilbertianas, donde la distanciaSe denomina hilbertiano si se puede incrustar el espacio métrico.isométricamente en algún espacio de Hilbert.
Por otro lado, los núcleos nd pueden identificarse con una subfamilia de núcleos pd conocidos como núcleos infinitamente divisibles. Un núcleo de valor no negativoSe dice que es infinitamente divisible si para cadaExiste un núcleo definido positivode tal manera que.
Otro vínculo es que un núcleo pd induce una pseudométrica , donde la primera restricción sobre la función de distancia se relaja para permitirparaDado un núcleo definido positivoPodemos definir una función de distancia como:
Algunas aplicaciones
Núcleos en el aprendizaje automático
Los núcleos definidos positivos, gracias a su equivalencia con los espacios de Hilbert con núcleo reproductor (RKHS), son particularmente importantes en el campo de la teoría del aprendizaje estadístico debido al célebre teorema del representante , que establece que toda función minimizadora en un RKHS puede expresarse como una combinación lineal de la función núcleo evaluada en los puntos de entrenamiento. Este resultado resulta de gran utilidad práctica, ya que simplifica eficazmente el problema de minimización del riesgo empírico, transformándolo de un problema de optimización de dimensión infinita a uno de dimensión finita.
Núcleos en modelos probabilísticos
En la teoría de la probabilidad, existen varias formas diferentes en que surgen los núcleos.
- Problemas de recuperación no deterministas: Supongamos que queremos encontrar la respuesta.de una función modelo desconocidaen un nuevo puntode un conjunto, siempre que tengamos una muestra de pares entrada-respuestadada por observación o experimentación. La respuestaenno es una función fija desino más bien una realización de una variable aleatoria de valor real.El objetivo es obtener información sobre la función.que reemplazaen el entorno determinista. Para dos elementoslas variables aleatoriasyno estarán descorrelacionados, porque siestá demasiado cerca delos experimentos aleatorios descritos poryA menudo mostrarán un comportamiento similar. Esto se describe mediante un núcleo de covarianza.. Dicho núcleo existe y es definido positivo bajo supuestos adicionales débiles. Ahora, una buena estimación parase puede obtener utilizando la interpolación de núcleo con el núcleo de covarianza, ignorando por completo el fondo probabilístico.
Supongamos ahora que una variable de ruido, con media cero y varianza cero, se agrega a, de tal manera que el ruido sea independiente para diferentesy independiente deahí, entonces el problema de encontrar una buena estimación paraes idéntico al anterior, pero con un núcleo modificado dado por.
- Estimación de densidad mediante núcleos: El problema consiste en recuperar la densidad.de una distribución multivariada sobre un dominio, de una muestra grandeincluyendo repeticiones. Cuando los puntos de muestreo son densos, la verdadera función de densidad debe tomar valores grandes. Es posible una estimación simple de la densidad contando el número de muestras en cada celda de una cuadrícula y graficando el histograma resultante, lo que produce una estimación de densidad constante por partes. Se puede obtener una mejor estimación utilizando un núcleo invariante a la traslación no negativo., con la integral total igual a uno, y definimoscomo una estimación aproximada.
Solución numérica de ecuaciones diferenciales parciales
Una de las principales áreas de aplicación de los llamados métodos sin malla es la solución numérica de EDP . Algunos de los métodos sin malla más populares están estrechamente relacionados con núcleos definidos positivos (como el método de Petrov-Galerkin local sin malla (MLPG) , el método de partículas con núcleo reproductor (RKPM) y la hidrodinámica de partículas suavizadas (SPH) ). Estos métodos utilizan un núcleo de base radial para la colocación . [ 13 ]
Teorema de dilatación de Stinespring
Otras aplicaciones
En la literatura sobre experimentos computacionales [ 14 ] y otros experimentos de ingeniería, se encuentran cada vez más modelos basados en núcleos pd, RBF o kriging . Un ejemplo de ello es la metodología de superficies de respuesta . Otros tipos de aplicaciones que se reducen al ajuste de datos son el prototipado rápido y los gráficos por computadora . En estos casos, se suelen utilizar modelos de superficie implícitos para aproximar o interpolar datos de nubes de puntos.
Las aplicaciones de los núcleos pd en diversas ramas de las matemáticas se encuentran en la integración multivariada, la optimización multivariada y en el análisis numérico y la computación científica, donde se estudian algoritmos rápidos, precisos y adaptativos, idealmente implementados en entornos de computación de alto rendimiento. [ 15 ]
Véase también
Referencias
- ↑ Berezanskij, Jurij Makarovič (1968). Expansiones en autofunciones de operadores autoadjuntos . Providence, RI: American Mathematical Soc. pp. 45–47 . ISBN 978-0-8218-1567-0.
- ↑ Hein, M. y Bousquet, O. (2005). " Métricas hilbertianas y núcleos definidos positivos en medidas de probabilidad ". En Ghahramani, Z. y Cowell, R., editores, Actas de AISTATS 2005.
- ↑ Lin, Hsuan-Tien y Chih-Jen Lin. "Un estudio sobre núcleos sigmoideos para SVM y el entrenamiento de núcleos no PSD mediante métodos de tipo SMO." Neural Comput 3.1-32 (2003): 16.
- ↑ Mercer, J. (1909). “Funciones de tipo positivo y negativo y su conexión con la teoría de ecuaciones integrales”. Philosophical Transactions of the Royal Society of London, Serie A 209, pp. 415–446.
- ^ Hilbert, D. (1904). "Grundzuge einer allgemeinen Theorie der linearen Integralgleichungen I", Gott. Nachrichten, matemáticas-física. K1 (1904), págs. 49–91.
- ↑ Young, WH (1909). "Una nota sobre una clase de funciones simétricas y sobre un teorema requerido en la teoría de ecuaciones integrales", Philos. Trans. Roy.Soc. London, Ser. A, 209, pp. 415–446.
- ↑ Moore, EH (1916). "Sobre matrices hermíticas propiamente positivas", Bull. Amer. Math. Soc. 23, 59, pp. 66–67.
- ↑ Moore, EH (1935). "Análisis general, parte I", Memorias de la Sociedad Filosófica Americana 1, Filadelfia.
- ↑ Krein. M (1949/1950). "Núcleos hermíticos positivos en espacios homogéneos I y II" (en ruso), Ukrain. Mat. Z. 1(1949), pp. 64–98, y 2(1950), pp. 10–59. Traducción al inglés: Amer. Math. Soc. Translations Ser. 2, 34 (1963), pp. 69–164.
- ↑ Loève, M. (1960). "Teoría de la probabilidad", 2.ª ed., Van Nostrand, Princeton, NJ
- ↑ Rosasco, L. y Poggio, T. (2015). "Un recorrido por la regularización del aprendizaje automático: apuntes de clase del MIT 9.520" Manuscrito.
- ↑ Berg, C., Christensen, JPR y Ressel, P. (1984). "Análisis armónico en semigrupos". Número 100 en Textos de posgrado en matemáticas, Springer Verlag.
- ↑ Schaback, R. y Wendland, H. (2006). "Técnicas de kernel: del aprendizaje automático a los métodos sin malla", Cambridge University Press, Acta Numerica (2006), págs. 1–97.
- ↑ Haaland, B. y Qian, PZG (2010). "Emuladores precisos para experimentos informáticos a gran escala", Ann. Stat.
- ↑ Gumerov, NA y Duraiswami, R. (2007). " Interpolación rápida de funciones de base radial mediante iteración de Krylov precondicionada ". SIAM J. Scient. Computing 29/5, pp. 1876–1899.
- teoría de operadores
- espacios de Hilbert