La interpretación bayesiana de la regularización de kernel examina cómo se pueden comprender los métodos de kernel en el aprendizaje automático a través de la estadística bayesiana , un marco que utiliza la probabilidad para modelar la incertidumbre. Los métodos de kernel se basan en el concepto de similitud entre entradas dentro de un espacio estructurado. Si bien técnicas como las máquinas de vectores de soporte (SVM) y su regularización (una técnica para hacer que un modelo sea más generalizable y transferible) no se formularon originalmente utilizando principios bayesianos, analizarlas desde una perspectiva bayesiana proporciona información valiosa.
En el marco bayesiano, los métodos de núcleo sirven como un componente fundamental de los procesos gaussianos , donde la función de núcleo opera como una función de covarianza que define relaciones entre las entradas. Tradicionalmente, estos métodos se han aplicado a problemas de aprendizaje supervisado donde las entradas se representan como vectores y las salidas como escalares. Desarrollos recientes han extendido los métodos de núcleo para manejar múltiples salidas , como se observa en el aprendizaje multitarea . [ 1 ]
El marco matemático para los métodos de núcleo generalmente implica espacios de Hilbert de núcleo reproductor (RKHS). No todos los núcleos forman espacios de producto interno, ya que no siempre son semidefinidos positivos (una propiedad que garantiza medidas de similitud no negativas), pero aun así operan dentro de estos RKHS más generales. Se puede establecer una equivalencia matemática entre los enfoques de regularización y los métodos bayesianos, particularmente en casos donde el espacio de Hilbert de núcleo reproductor es de dimensión finita. Esta equivalencia demuestra cómo ambas perspectivas convergen a estimadores esencialmente iguales , revelando la conexión subyacente entre estos enfoques aparentemente diferentes.
El problema del aprendizaje supervisado
El problema clásico de aprendizaje supervisado requiere estimar la salida para algún nuevo punto de entrada.mediante el aprendizaje de un estimador de valor escalarsobre la base de un conjunto de entrenamientocompuesto depares de entrada-salida,. [ 2 ] Dada una función bivariada simétrica y positivallamado kernel , uno de los estimadores más populares en aprendizaje automático viene dado por
dóndees la matriz del núcleo con entradas,, yVeremos cómo se puede derivar este estimador tanto desde una perspectiva de regularización como desde una perspectiva bayesiana.
Una perspectiva de regularización
La principal suposición en la perspectiva de regularización es que el conjunto de funcionesSe supone que pertenece a un espacio de Hilbert con núcleo reproductor.. [ 2 ] [ 3 ] [ 4 ] [ 5 ]
Espacio de Hilbert con núcleo reproductor
Un espacio de Hilbert con núcleo reproductor (RKHS)es un espacio de Hilbert de funciones definido por una función simétrica definida positivallamado núcleo reproductor de tal manera que la funciónpertenece aa pesar de. [ 6 ] [ 7 ] [ 8 ] Hay tres propiedades principales que hacen que un RKHS sea atractivo:
1. La propiedad de reproducción , de la cual toma su nombre el RKHS,
dóndees el producto interno en.
2. Las funciones en un RKHS están en la clausura de la combinación lineal del núcleo en puntos dados,
- .
Esto permite la construcción, dentro de un marco unificado, de modelos lineales y modelos lineales generalizados.
3. La norma al cuadrado en un RKHS se puede escribir como
y podría considerarse como una forma de medir la complejidad de la función.
La función regularizada
El estimador se obtiene como el minimizador de la función regularizada.
dóndeyes la norma en. El primer término de este funcional, que mide el promedio de los cuadrados de los errores entre losy el, se denomina riesgo empírico y representa el costo que pagamos al predecirpor el valor realEl segundo término en el funcional es la norma al cuadrado en un RKHS multiplicada por un pesoy sirve para estabilizar el problema [ 3 ] [ 5 ] así como para añadir un equilibrio entre el ajuste y la complejidad del estimador. [ 2 ] El peso, llamado regularizador , determina el grado en que se debe penalizar la inestabilidad y la complejidad del estimador (mayor penalización por valor creciente de).
Derivación del estimador
La forma explícita del estimador en la ecuación ( 1 ) se deriva en dos pasos. Primero, el teorema del representante [ 9 ] [ 10 ] [ 11 ] establece que el minimizador del funcional ( 2 ) siempre se puede escribir como una combinación lineal de los núcleos centrados en los puntos del conjunto de entrenamiento,
para algunos. La forma explícita de los coeficientesse puede encontrar sustituyendo poren el funcional ( 2 ). Para una función de la forma en la ecuación ( 3 ), tenemos que
Podemos reescribir el funcional ( 2 ) como
Este funcional es convexo eny por lo tanto podemos encontrar su mínimo estableciendo el gradiente con respecto aa cero,
Sustituyendo esta expresión por los coeficientes en la ecuación ( 3 ), obtenemos el estimador mencionado anteriormente en la ecuación ( 1 ),
Una perspectiva bayesiana
La noción de núcleo juega un papel crucial en la probabilidad bayesiana como la función de covarianza de un proceso estocástico llamado proceso gaussiano .
Una revisión de la probabilidad bayesiana
Como parte del marco bayesiano, el proceso gaussiano especifica la distribución a priori que describe las creencias previas sobre las propiedades de la función que se está modelando. Estas creencias se actualizan tras considerar los datos de observación mediante una función de verosimilitud que relaciona las creencias a priori con las observaciones. En conjunto, la distribución a priori y la función de verosimilitud dan lugar a una distribución actualizada denominada distribución a posteriori , que se utiliza habitualmente para predecir casos de prueba.
El proceso gaussiano
Un proceso gaussiano (PG) es un proceso estocástico en el que cualquier número finito de variables aleatorias muestreadas siguen una distribución normal conjunta . [ 12 ] El vector de medias y la matriz de covarianza de la distribución gaussiana especifican completamente el PG. Los PG se utilizan habitualmente como distribución a priori para funciones, y como tales, el vector de medias y la matriz de covarianza pueden considerarse funciones, donde la función de covarianza también se denomina núcleo del PG. Sea una funciónsigue un proceso gaussiano con función mediay función kernel,
En términos de la distribución gaussiana subyacente, tenemos que para cualquier conjunto finitosi dejamosentonces
dóndees el vector medio yes la matriz de covarianza de la distribución gaussiana multivariada.
Derivación del estimador
En un contexto de regresión, la función de verosimilitud generalmente se asume que es una distribución gaussiana y que las observaciones son independientes e idénticamente distribuidas (iid),
Esta suposición corresponde a que las observaciones estén corrompidas con ruido gaussiano de media cero con varianzaLa suposición de i.i.d. permite factorizar la función de verosimilitud sobre los puntos de datos dado el conjunto de entradas.y la varianza del ruidoy, por lo tanto, la distribución posterior se puede calcular analíticamente. Para un vector de entrada de prueba, dados los datos de entrenamiento, la distribución posterior viene dada por
dóndedenota el conjunto de parámetros que incluyen la varianza del ruidoy cualquier parámetro de la función de covarianzay dónde
La conexión entre la regularización y Bayes
La conexión entre la teoría de la regularización y la teoría bayesiana solo se puede lograr en el caso de RKHS de dimensión finita . Bajo esta suposición, la teoría de la regularización y la teoría bayesiana se conectan a través de la predicción de procesos gaussianos. [ 3 ] [ 12 ] [ 13 ]
En el caso de dimensión finita, cada RKHS puede describirse en términos de un mapa de características. :{\mathcal {X}}\rightarrow \mathbb {R} ^{p}} tal que [ 2 ]
Funciones en el RKHS con kernelentonces se puede escribir como
y también tenemos eso
Ahora podemos construir un proceso gaussiano asumiendopara ser distribuida según una distribución gaussiana multivariada con media cero y matriz de covarianza identidad,
Si asumimos una probabilidad gaussiana tenemos
dóndeLa distribución posterior resultante viene dada por
Podemos ver que una estimación de máxima posterior (MAP) es equivalente al problema de minimización que define la regularización de Tikhonov , donde en el caso bayesiano el parámetro de regularización está relacionado con la varianza del ruido.
Desde una perspectiva filosófica, la función de pérdida en un entorno de regularización juega un papel diferente al de la función de verosimilitud en el entorno bayesiano. Mientras que la función de pérdida mide el error que se incurre al predeciren lugar deLa función de verosimilitud mide la probabilidad de que las observaciones provengan del modelo que se asumió como verdadero en el proceso generativo. Sin embargo, desde una perspectiva matemática, las formulaciones de los marcos de regularización y bayesianos hacen que la función de pérdida y la función de verosimilitud tengan el mismo papel matemático de promover la inferencia de funciones.que se aproximan a las etiquetastodo lo posible.
Véase también
Referencias
- ↑ Álvarez, Mauricio A.; Rosasco, Lorenzo; Lawrence, Neil D. (junio de 2011). "Núcleos para funciones con valores vectoriales: una revisión". arXiv : 1106.6251 [ stat.ML ].
- 1 2 3 4 Vapnik, Vladimir (1998). Teoría del aprendizaje estadístico . Wiley. ISBN 9780471030034.
- 1 2 3 Wahba, Grace (1990). Modelos de splines para datos observacionales . SIAM. Bibcode : 1990smod.conf.....W .
- ↑ Schölkopf, Bernhard; Smola, Alexander J. (2002). Aprendizaje con núcleos: máquinas de vectores de soporte, regularización, optimización y más allá . MIT Press. ISBN 9780262194754.
- 1 2 Girosi, F.; Poggio, T. (1990). "Redes y la propiedad de mejor aproximación" (PDF) . Cibernética biológica . 63 (3). Springer: 169– 176. doi : 10.1007/bf00195855 . hdl : 1721.1/6017 . S2CID 18824241 .
- ↑ Aronszajn, N (mayo de 1950). "Teoría de los núcleos reproductores" . Transactions of the American Mathematical Society . 68 (3): 337– 404. doi : 10.2307/1990404 . JSTOR 1990404 .
- ^ Schwartz, Laurent (1964). "Sous-espaces hilbertiens d'espaces vectoriels topologiques et noyaux associés (noyaux reproduisants)". Revista de Análisis Matemático . 13 (1). Springer: 115– 256. doi : 10.1007/bf02786620 . S2CID 117202393 .
- ↑ Cucker, Felipe; Smale, Steve (5 de octubre de 2001). "Sobre los fundamentos matemáticos del aprendizaje" . Boletín de la Sociedad Matemática Americana . 39 (1): 1– 49. doi : 10.1090/s0273-0979-01-00923-5 .
- ↑ Kimeldorf, George S.; Wahba, Grace (1970). "Una correspondencia entre la estimación bayesiana en procesos estocásticos y el suavizado mediante splines" . The Annals of Mathematical Statistics . 41 (2): 495– 502. doi : 10.1214/aoms/1177697089 .
- ↑ Schölkopf, Bernhard; Herbrich, Ralf; Smola, Alex J. (2001). «Un teorema generalizado del representante». Teoría del aprendizaje computacional . Lecture Notes in Computer Science. Vol. 2111/2001. pp. 416–426 . doi : 10.1007/3-540-44581-1_27 . ISBN 978-3-540-42343-0.
- ↑ De Vito, Ernesto; Rosasco, Lorenzo; Caponnetto, Andrea; Piana, Michele; Verri, Alessandro (octubre de 2004). "Algunas propiedades de los métodos de kernel regularizados". Journal of Machine Learning Research . 5 : 1363–1390 .
- 1 2 Rasmussen, Carl Edward; Williams, Christopher KI (2006). Procesos gaussianos para el aprendizaje automático . The MIT Press. ISBN 0-262-18253-X.
- ↑ Huang, Yunfei.; et al. (2019). "Microscopía de fuerza de tracción con regularización optimizada y selección automatizada de parámetros bayesianos para comparar células" . Scientific Reports . 9 (1) 539: 537. arXiv : 1810.05848 . Bibcode : 2019NatSR...9..539H . doi : 10.1038/s41598-018-36896- x . PMC 6345967. PMID 30679578 .
- estadística bayesiana
- Aprendizaje automático