Articulo de referencia

Interpretación bayesiana de la regularización del núcleo

La interpretación bayesiana de la regularización de kernel examina cómo se pueden comprender los métodos de kernel en el aprendizaje automático a través de la estadística bayesi...

La interpretación bayesiana de la regularización de kernel examina cómo se pueden comprender los métodos de kernel en el aprendizaje automático a través de la estadística bayesiana , un marco que utiliza la probabilidad para modelar la incertidumbre. Los métodos de kernel se basan en el concepto de similitud entre entradas dentro de un espacio estructurado. Si bien técnicas como las máquinas de vectores de soporte (SVM) y su regularización (una técnica para hacer que un modelo sea más generalizable y transferible) no se formularon originalmente utilizando principios bayesianos, analizarlas desde una perspectiva bayesiana proporciona información valiosa.

En el marco bayesiano, los métodos de núcleo sirven como un componente fundamental de los procesos gaussianos , donde la función de núcleo opera como una función de covarianza que define relaciones entre las entradas. Tradicionalmente, estos métodos se han aplicado a problemas de aprendizaje supervisado donde las entradas se representan como vectores y las salidas como escalares. Desarrollos recientes han extendido los métodos de núcleo para manejar múltiples salidas , como se observa en el aprendizaje multitarea . [ 1 ]

El marco matemático para los métodos de núcleo generalmente implica espacios de Hilbert de núcleo reproductor (RKHS). No todos los núcleos forman espacios de producto interno, ya que no siempre son semidefinidos positivos (una propiedad que garantiza medidas de similitud no negativas), pero aun así operan dentro de estos RKHS más generales. Se puede establecer una equivalencia matemática entre los enfoques de regularización y los métodos bayesianos, particularmente en casos donde el espacio de Hilbert de núcleo reproductor es de dimensión finita. Esta equivalencia demuestra cómo ambas perspectivas convergen a estimadores esencialmente iguales , revelando la conexión subyacente entre estos enfoques aparentemente diferentes.

El problema del aprendizaje supervisado

El problema clásico de aprendizaje supervisado requiere estimar la salida para algún nuevo punto de entrada.incógnita{\displaystyle \mathbf {x} '}mediante el aprendizaje de un estimador de valor escalarF^(incógnita){\displaystyle {\sombrero {f}}(\mathbf {x} ')}sobre la base de un conjunto de entrenamientoS{\displaystyle S}compuesto denorte{\displaystyle n}pares de entrada-salida,S=(incógnita,Y)=(incógnita1,y1),,(incógnitanorte,ynorte){\displaystyle S=(\mathbf {X} ,\mathbf {Y} )=(\mathbf {x} _{1},y_{1}),\ldots ,(\mathbf {x} _{n},y_{n})}. [ 2 ] Dada una función bivariada simétrica y positivak(,){\displaystyle k(\cdot ,\cdot )}llamado kernel , uno de los estimadores más populares en aprendizaje automático viene dado por

dóndeKk(incógnita,incógnita){\displaystyle \mathbf {K} \equiv k(\mathbf {X} ,\mathbf {X} )}es la matriz del núcleo con entradasKij=k(incógnitai,incógnitaj){\displaystyle \mathbf {K} _{ij}=k(\mathbf {x} _{i},\mathbf {x} _{j})},k=[k(incógnita1,incógnita),,k(incógnitanorte,incógnita)]{\displaystyle \mathbf {k} =[k(\mathbf {x} _{1},\mathbf {x} '),\ldots ,k(\mathbf {x} _{n},\mathbf {x} ')]^{\top }}, yY=[y1,,ynorte]{\displaystyle \mathbf {Y} =[y_{1},\ldots,y_{n}]^{\top }}Veremos cómo se puede derivar este estimador tanto desde una perspectiva de regularización como desde una perspectiva bayesiana.

Una perspectiva de regularización

La principal suposición en la perspectiva de regularización es que el conjunto de funcionesF{\displaystyle {\mathcal {F}}}Se supone que pertenece a un espacio de Hilbert con núcleo reproductor.Hk{\displaystyle {\mathcal {H}}_{k}}. [ 2 ] [ 3 ] [ 4 ] [ 5 ]

Espacio de Hilbert con núcleo reproductor

Un espacio de Hilbert con núcleo reproductor (RKHS)Hk{\displaystyle {\mathcal {H}}_{k}}es un espacio de Hilbert de funciones definido por una función simétrica definida positivak:incógnita×incógnitaR{\displaystyle k:{\mathcal {X}}\times {\mathcal {X}}\rightarrow \mathbb {R} }llamado núcleo reproductor de tal manera que la funciónk(incógnita,){\displaystyle k(\mathbf {x} ,\cdot )}pertenece aHk{\displaystyle {\mathcal {H}}_{k}}a pesar deincógnitaincógnita{\displaystyle \mathbf {x} \in {\mathcal {X}}}. [ 6 ] [ 7 ] [ 8 ] Hay tres propiedades principales que hacen que un RKHS sea atractivo:

1. La propiedad de reproducción , de la cual toma su nombre el RKHS,

F(incógnita)=F,k(incógnita,)k, FHk,{\displaystyle f(\mathbf {x} )=\langle f,k(\mathbf {x} ,\cdot )\rangle _ {k},\quad \forall \ f\in {\mathcal {H}}_{k},}

dónde,k{\displaystyle \langle \cdot ,\cdot \rangle _{k}}es el producto interno enHk{\displaystyle {\mathcal {H}}_{k}}.

2. Las funciones en un RKHS están en la clausura de la combinación lineal del núcleo en puntos dados,

F(incógnita)=ik(incógnitai,incógnita)doi{\displaystyle f(\mathbf {x} )=\sum _{i}k(\mathbf {x} _{i},\mathbf {x} )c_{i}}.

Esto permite la construcción, dentro de un marco unificado, de modelos lineales y modelos lineales generalizados.

3. La norma al cuadrado en un RKHS se puede escribir como

Fk2=i,jk(incógnitai,incógnitaj)doidoj{\displaystyle \|f\|_{k}^{2}=\sum _{i,j}k(\mathbf {x} _{i},\mathbf {x} _{j})c_{i}c_{j}}

y podría considerarse como una forma de medir la complejidad de la función.

La función regularizada

El estimador se obtiene como el minimizador de la función regularizada.

dóndeFHk{\displaystyle f\in {\mathcal {H}}_{k}}yk{\displaystyle \|\cdot \|_{k}}es la norma enHk{\displaystyle {\mathcal {H}}_{k}}. El primer término de este funcional, que mide el promedio de los cuadrados de los errores entre losF(incógnitai){\displaystyle f(\mathbf {x} _{i})}y elyi{\displaystyle y_{i}}, se denomina riesgo empírico y representa el costo que pagamos al predecirF(incógnitai){\displaystyle f(\mathbf {x} _{i})}por el valor realyi{\displaystyle y_{i}}El segundo término en el funcional es la norma al cuadrado en un RKHS multiplicada por un pesoλ{\displaystyle \lambda }y sirve para estabilizar el problema [ 3 ] [ 5 ] así como para añadir un equilibrio entre el ajuste y la complejidad del estimador. [ 2 ] El pesoλ{\displaystyle \lambda }, llamado regularizador , determina el grado en que se debe penalizar la inestabilidad y la complejidad del estimador (mayor penalización por valor creciente deλ{\displaystyle \lambda }).

Derivación del estimador

La forma explícita del estimador en la ecuación ( 1 ) se deriva en dos pasos. Primero, el teorema del representante [ 9 ] [ 10 ] [ 11 ] establece que el minimizador del funcional ( 2 ) siempre se puede escribir como una combinación lineal de los núcleos centrados en los puntos del conjunto de entrenamiento,

para algunosdoRnorte{\displaystyle \mathbf {c} \in \mathbb {R} ^{n}}. La forma explícita de los coeficientesdo=[do1,,donorte]{\displaystyle \mathbf {c} =[c_{1},\ldots ,c_{n}]^{\top }}se puede encontrar sustituyendo porF(){\displaystyle f(\cdot )}en el funcional ( 2 ). Para una función de la forma en la ecuación ( 3 ), tenemos que

Fk2=F,Fk,=i=1nortedoik(incógnitai,),j=1nortedojk(incógnitaj,)k,=i=1nortej=1nortedoidojk(incógnitai,),k(incógnitaj,)k,=i=1nortej=1nortedoidojk(incógnitai,incógnitaj),=doKdo.{\displaystyle {\begin{aligned}\|f\|_{k}^{2}&=\langle f,f\rangle _{k},\\&=\left\langle \sum _{i=1}^{N}c_{i}k(\mathbf {x} _{i},\cdot ),\sum _{j=1}^{N}c_{j}k(\mathbf {x} _{j},\cdot )\right\rangle _{k},\\&=\sum _{i=1}^{N}\sum _{j=1}^{N}c_{i}c_{j}\langle k(\mathbf {x} _{i},\cdot ),k(\mathbf {x} _{j},\cdot )\rangle _{k},\\&=\sum _{i=1}^{N}\sum _{j=1}^{N}c_{i}c_{j}k(\mathbf {x} _{i},\mathbf {x} _{j}),\\&=\mathbf {c} ^{\top }\mathbf {K} \mathbf {c} .\end{aligned}}}

Podemos reescribir el funcional ( 2 ) como

1norteyKdo2+λdoKdo.{\displaystyle {\frac {1}{n}}\|\mathbf {y} -\mathbf {K} \mathbf {c} \|^{2}+\lambda \mathbf {c} ^{\top }\mathbf {K} \mathbf {c} .}

Este funcional es convexo endo{\displaystyle \mathbf {c} }y por lo tanto podemos encontrar su mínimo estableciendo el gradiente con respecto ado{\displaystyle \mathbf {c} }a cero,

1norteK(YKdo)+λKdo=0,(K+λnorteI)do=Y,do=(K+λnorteI)1Y.{\displaystyle {\begin{aligned}-{\frac {1}{n}}\mathbf {K} (\mathbf {Y} -\mathbf {K} \mathbf {c} )+\lambda \mathbf {K} \mathbf {c} &=0,\\(\mathbf {K} +\lambda n\mathbf {I} )\mathbf {c} &=\mathbf {Y} ,\\\mathbf {c} &=(\mathbf {K} +\lambda n\mathbf {I} )^{-1}\mathbf {Y} .\end{aligned}}}

Sustituyendo esta expresión por los coeficientes en la ecuación ( 3 ), obtenemos el estimador mencionado anteriormente en la ecuación ( 1 ),

F^(incógnita)=k(K+λnorteI)1Y.{\displaystyle {\hat {f}}(\mathbf {x} ')=\mathbf {k} ^{\top }(\mathbf {K} +\lambda n\mathbf {I} )^{-1}\mathbf {Y} .}

Una perspectiva bayesiana

La noción de núcleo juega un papel crucial en la probabilidad bayesiana como la función de covarianza de un proceso estocástico llamado proceso gaussiano .

Una revisión de la probabilidad bayesiana

Como parte del marco bayesiano, el proceso gaussiano especifica la distribución a priori que describe las creencias previas sobre las propiedades de la función que se está modelando. Estas creencias se actualizan tras considerar los datos de observación mediante una función de verosimilitud que relaciona las creencias a priori con las observaciones. En conjunto, la distribución a priori y la función de verosimilitud dan lugar a una distribución actualizada denominada distribución a posteriori , que se utiliza habitualmente para predecir casos de prueba.

El proceso gaussiano

Un proceso gaussiano (PG) es un proceso estocástico en el que cualquier número finito de variables aleatorias muestreadas siguen una distribución normal conjunta . [ 12 ] El vector de medias y la matriz de covarianza de la distribución gaussiana especifican completamente el PG. Los PG se utilizan habitualmente como distribución a priori para funciones, y como tales, el vector de medias y la matriz de covarianza pueden considerarse funciones, donde la función de covarianza también se denomina núcleo del PG. Sea una funciónF{\displaystyle f}sigue un proceso gaussiano con función mediametro{\displaystyle m}y función kernelk{\displaystyle k},

FGRAMOPAG(metro,k).{\displaystyle f\sim {\mathcal {GP}}(m,k).}

En términos de la distribución gaussiana subyacente, tenemos que para cualquier conjunto finitoincógnita={incógnitai}i=1norte{\displaystyle \mathbf {X} =\{\mathbf {x} _{i}\}_{i=1}^{n}}si dejamosF(incógnita)=[F(incógnita1),,F(incógnitanorte)]{\displaystyle f(\mathbf {X} )=[f(\mathbf {x} _{1}),\ldots ,f(\mathbf {x} _{n})]^{\top }}entonces

F(incógnita)norte(metro,K),{\displaystyle f(\mathbf {X} )\sim {\mathcal {N}}(\mathbf {m} ,\mathbf {K} ),}

dóndemetro=metro(incógnita)=[metro(incógnita1),,metro(incógnitanorte)]{\displaystyle \mathbf {m} =m(\mathbf {X} )=[m(\mathbf {x} _{1}),\ldots ,m(\mathbf {x} _{N})]^{\top }}es el vector medio yK=k(incógnita,incógnita){\displaystyle \mathbf {K} =k(\mathbf {X} ,\mathbf {X} )}es la matriz de covarianza de la distribución gaussiana multivariada.

Derivación del estimador

En un contexto de regresión, la función de verosimilitud generalmente se asume que es una distribución gaussiana y que las observaciones son independientes e idénticamente distribuidas (iid),

pag(y|F,incógnita,σ2)=norte(F(incógnita),σ2).{\displaystyle p(y|f,\mathbf {x} ,\sigma ^{2})={\mathcal {N}}(f(\mathbf {x} ),\sigma ^{2}).}

Esta suposición corresponde a que las observaciones estén corrompidas con ruido gaussiano de media cero con varianzaσ2{\displaystyle \sigma ^{2}}La suposición de i.i.d. permite factorizar la función de verosimilitud sobre los puntos de datos dado el conjunto de entradas.incógnita{\displaystyle \mathbf {X} }y la varianza del ruidoσ2{\displaystyle \sigma ^{2}}y, por lo tanto, la distribución posterior se puede calcular analíticamente. Para un vector de entrada de pruebaincógnita{\displaystyle \mathbf {x} '}, dados los datos de entrenamientoS={incógnita,Y}{\displaystyle S=\{\mathbf {X} ,\mathbf {Y} \}}, la distribución posterior viene dada por

pag(F(incógnita)|S,incógnita,ϕ)=norte(metro(incógnita),σ2(incógnita)),{\displaystyle p(f(\mathbf {x} ')|S,\mathbf {x} ',{\boldsymbol {\phi }})={\mathcal {N}}(m(\mathbf {x} '),\sigma ^{2}(\mathbf {x} ')),}

dóndeϕ{\displaystyle {\boldsymbol {\phi }}}denota el conjunto de parámetros que incluyen la varianza del ruidoσ2{\displaystyle \sigma ^{2}}y cualquier parámetro de la función de covarianzak{\displaystyle k}y dónde

metro(incógnita)=k(K+σ2I)1Y,σ2(incógnita)=k(incógnita,incógnita)k(K+σ2I)1k.{\displaystyle {\begin{aligned}m(\mathbf {x} ')&=\mathbf {k} ^{\top }(\mathbf {K} +\sigma ^{2}\mathbf {I} )^{-1}\mathbf {Y} ,\\\sigma ^{2}(\mathbf {x} ')&=k(\mathbf {x} ',\mathbf {x} ')-\mathbf {k} ^{\top }(\mathbf {K} +\sigma ^{2}\mathbf {I} )^{-1}\mathbf {k} .\end{aligned}}}

La conexión entre la regularización y Bayes

La conexión entre la teoría de la regularización y la teoría bayesiana solo se puede lograr en el caso de RKHS de dimensión finita . Bajo esta suposición, la teoría de la regularización y la teoría bayesiana se conectan a través de la predicción de procesos gaussianos. [ 3 ] [ 12 ] [ 13 ]

En el caso de dimensión finita, cada RKHS puede describirse en términos de un mapa de características.Φ:incógnitaRpag{\displaystyle \Phi :{\mathcal {X}}\rightarrow \mathbb {R} ^{p}} tal que [ 2 ]

k(incógnita,incógnita)=i=1pagΦi(incógnita)Φi(incógnita).{\displaystyle k(\mathbf {x} ,\mathbf {x} ')=\sum _{i=1}^{p}\Phi ^{i}(\mathbf {x} )\Phi ^{i}(\mathbf {x} ').}

Funciones en el RKHS con kernelK{\displaystyle \mathbf {K} }entonces se puede escribir como

Fw(incógnita)=i=1pagwiΦi(incógnita)=w,Φ(incógnita),{\displaystyle f_{\mathbf {w} }(\mathbf {x} )=\sum _{i=1}^{p}\mathbf {w} ^{i}\Phi ^{i}(\mathbf {x} )=\langle \mathbf {w} ,\Phi (\mathbf {x} )\rangle ,}

y también tenemos eso

Fwk=w.{\displaystyle \|f_{\mathbf {w} }\|_{k}=\|\mathbf {w} \|.}

Ahora podemos construir un proceso gaussiano asumiendow=[w1,,wpag]{\displaystyle \mathbf {w} =[w^{1},\ldots ,w^{p}]^{\top }}para ser distribuida según una distribución gaussiana multivariada con media cero y matriz de covarianza identidad,

wnorte(0,I)exp(w2).{\displaystyle \mathbf {w} \sim {\mathcal {N}}(0,\mathbf {I} )\propto \exp(-\|\mathbf {w} \|^{2}).}

Si asumimos una probabilidad gaussiana tenemos

PAG(Y|incógnita,F)=norte(F(incógnita),σ2I)exp(1σ2Fw(incógnita)Y2),{\displaystyle P(\mathbf {Y} |\mathbf {X} ,f)={\mathcal {N}}(f(\mathbf {X} ),\sigma ^{2}\mathbf {I} )\propto \exp \left(-{\frac {1}{\sigma ^{2}}}\|f_{\mathbf {w} }(\mathbf {X} )-\mathbf {Y} \|^{2}\right),}

dóndeFw(incógnita)=(w,Φ(incógnita1),,w,Φ(incógnitanorte){\displaystyle f_{\mathbf {w} }(\mathbf {X} )=(\langle \mathbf {w} ,\Phi (\mathbf {x} _{1})\rangle ,\ldots ,\langle \mathbf {w} ,\Phi (\mathbf {x} _{n}\rangle )}La distribución posterior resultante viene dada por

PAG(F|incógnita,Y)exp(1σ2Fw(incógnita)Ynorte2+w2){\displaystyle P(f|\mathbf {X} ,\mathbf {Y} )\propto \exp \left(-{\frac {1}{\sigma ^{2}}}\|f_{\mathbf {w} }(\mathbf {X} )-\mathbf {Y} \|_{n}^{2}+\|\mathbf {w} \|^{2}\right)}

Podemos ver que una estimación de máxima posterior (MAP) es equivalente al problema de minimización que define la regularización de Tikhonov , donde en el caso bayesiano el parámetro de regularización está relacionado con la varianza del ruido.

Desde una perspectiva filosófica, la función de pérdida en un entorno de regularización juega un papel diferente al de la función de verosimilitud en el entorno bayesiano. Mientras que la función de pérdida mide el error que se incurre al predecirF(incógnita){\displaystyle f(\mathbf {x} )}en lugar dey{\displaystyle y}La función de verosimilitud mide la probabilidad de que las observaciones provengan del modelo que se asumió como verdadero en el proceso generativo. Sin embargo, desde una perspectiva matemática, las formulaciones de los marcos de regularización y bayesianos hacen que la función de pérdida y la función de verosimilitud tengan el mismo papel matemático de promover la inferencia de funciones.F{\displaystyle f}que se aproximan a las etiquetasy{\displaystyle y}todo lo posible.

Véase también

Referencias

  1. Álvarez, Mauricio A.; Rosasco, Lorenzo; Lawrence, Neil D. (junio de 2011). "Núcleos para funciones con valores vectoriales: una revisión". arXiv : 1106.6251 [ stat.ML ].
  2. 1 2 3 4 Vapnik, Vladimir (1998). Teoría del aprendizaje estadístico . Wiley. ISBN 9780471030034.
  3. 1 2 3 Wahba, Grace (1990). Modelos de splines para datos observacionales . SIAM. Bibcode : 1990smod.conf.....W .
  4. Schölkopf, Bernhard; Smola, Alexander J. (2002). Aprendizaje con núcleos: máquinas de vectores de soporte, regularización, optimización y más allá . MIT Press. ISBN 9780262194754.
  5. 1 2 Girosi, F.; Poggio, T. (1990). "Redes y la propiedad de mejor aproximación" (PDF) . Cibernética biológica . 63 (3). Springer: 169– 176. doi : 10.1007/bf00195855 . hdl : 1721.1/6017 . S2CID 18824241 . 
  6. Aronszajn, N (mayo de 1950). "Teoría de los núcleos reproductores" . Transactions of the American Mathematical Society . 68 (3): 337– 404. doi : 10.2307/1990404 . JSTOR 1990404 . 
  7. ^ Schwartz, Laurent (1964). "Sous-espaces hilbertiens d'espaces vectoriels topologiques et noyaux associés (noyaux reproduisants)". Revista de Análisis Matemático . 13 (1). Springer: 115– 256. doi : 10.1007/bf02786620 . S2CID 117202393 . 
  8. Cucker, Felipe; Smale, Steve (5 de octubre de 2001). "Sobre los fundamentos matemáticos del aprendizaje" . Boletín de la Sociedad Matemática Americana . 39 (1): 1– 49. doi : 10.1090/s0273-0979-01-00923-5 .
  9. Kimeldorf, George S.; Wahba, Grace (1970). "Una correspondencia entre la estimación bayesiana en procesos estocásticos y el suavizado mediante splines" . The Annals of Mathematical Statistics . 41 (2): 495– 502. doi : 10.1214/aoms/1177697089 .
  10. Schölkopf, Bernhard; Herbrich, Ralf; Smola, Alex J. (2001). «Un teorema generalizado del representante». Teoría del aprendizaje computacional . Lecture Notes in Computer Science. Vol. 2111/2001. pp. 416–426 . doi : 10.1007/3-540-44581-1_27 . ISBN   978-3-540-42343-0.
  11. De Vito, Ernesto; Rosasco, Lorenzo; Caponnetto, Andrea; Piana, Michele; Verri, Alessandro (octubre de 2004). "Algunas propiedades de los métodos de kernel regularizados". Journal of Machine Learning Research . 5 : 1363–1390 .
  12. 1 2 Rasmussen, Carl Edward; Williams, Christopher KI (2006). Procesos gaussianos para el aprendizaje automático . The MIT Press. ISBN 0-262-18253-X.
  13. Huang, Yunfei.; et al. (2019). "Microscopía de fuerza de tracción con regularización optimizada y selección automatizada de parámetros bayesianos para comparar células" . Scientific Reports . 9 (1) 539: 537. arXiv : 1810.05848 . Bibcode : 2019NatSR...9..539H . doi : 10.1038/s41598-018-36896- x . PMC 6345967. PMID 30679578 .