Articulo de referencia

Teoría del aprendizaje estadístico

La teoría del aprendizaje estadístico es un marco para el aprendizaje automático que se nutre de los campos de la estadística y el análisis funcional . [ 1 ] [ 2 ] [ 3 ] La teor...

La teoría del aprendizaje estadístico es un marco para el aprendizaje automático que se nutre de los campos de la estadística y el análisis funcional . [ 1 ] [ 2 ] [ 3 ] La teoría del aprendizaje estadístico aborda el problema de la inferencia estadística para encontrar una función predictiva basada en datos. La teoría del aprendizaje estadístico ha dado lugar a aplicaciones exitosas en campos como la visión por computadora , el reconocimiento de voz y la bioinformática .

Introducción

Los objetivos del aprendizaje son la comprensión y la predicción. El aprendizaje se divide en muchas categorías, incluyendo el aprendizaje supervisado , el aprendizaje no supervisado , el aprendizaje en línea y el aprendizaje por refuerzo . Desde la perspectiva de la teoría del aprendizaje estadístico, el aprendizaje supervisado es el que mejor se comprende. [ 4 ] El aprendizaje supervisado implica aprender a partir de un conjunto de datos de entrenamiento. Cada punto en el entrenamiento es un par entrada-salida, donde la entrada se corresponde con una salida. El problema de aprendizaje consiste en inferir la función que relaciona la entrada con la salida, de modo que la función aprendida pueda utilizarse para predecir la salida a partir de entradas futuras.

Dependiendo del tipo de salida, los problemas de aprendizaje supervisado son problemas de regresión o problemas de clasificación . Si la salida toma un rango continuo de valores, es un problema de regresión. Usando la ley de Ohm como ejemplo, se podría realizar una regresión con el voltaje como entrada y la corriente como salida. La regresión encontraría la relación funcional entre el voltaje y la corriente que esR{\displaystyle R}, de tal manera que V=IR{\displaystyle V=IR} Los problemas de clasificación son aquellos en los que la salida será un elemento de un conjunto discreto de etiquetas. La clasificación es muy común en las aplicaciones de aprendizaje automático. En el reconocimiento facial , por ejemplo, la entrada sería una fotografía del rostro de una persona y la etiqueta de salida sería el nombre de esa persona. La entrada estaría representada por un vector multidimensional grande cuyos elementos representan píxeles en la imagen.

Tras aprender una función basándose en los datos del conjunto de entrenamiento, dicha función se valida en un conjunto de datos de prueba, datos que no aparecieron en el conjunto de entrenamiento.

Descripción formal

Llevarincógnita{\displaystyle X}ser el espacio vectorial de todas las entradas posibles, yY{\displaystyle Y}ser el espacio vectorial de todas las posibles salidas. La teoría del aprendizaje estadístico adopta la perspectiva de que existe alguna distribución de probabilidad desconocida sobre el espacio producto.Z=incógnita×Y{\displaystyle Z=X\times Y}, es decir, existe algún desconocidopag(z)=pag(incógnita,y){\displaystyle p(z)=p(\mathbf {x},y)}El conjunto de entrenamiento está compuesto por:norte{\displaystyle n}muestras de esta distribución de probabilidad, y se denota S={(incógnita1,y1),,(incógnitanorte,ynorte)}={z1,,znorte}{\displaystyle S=\{(\mathbf {x} _{1},y_{1}),\dots ,(\mathbf {x} _{n},y_{n})\}=\{\mathbf {z} _{1},\dots ,\mathbf {z} _{n}\}} Cadaincógnitai{\displaystyle \mathbf {x} _ {i}}es un vector de entrada de los datos de entrenamiento, yyi{\displaystyle y_{i}}es la salida que le corresponde.

En este formalismo, el problema de inferencia consiste en encontrar una funciónF:incógnitaY{\displaystyle f:X\to Y}de tal manera queF(incógnita)y{\displaystyle f(\mathbf {x} )\sim y}. DejarH{\displaystyle {\mathcal {H}}}ser un espacio de funcionesF:incógnitaY{\displaystyle f:X\to Y}llamado espacio de hipótesis. El espacio de hipótesis es el espacio de funciones que el algoritmo explorará. SeaV(F(incógnita),y){\displaystyle V(f(\mathbf {x} ),y)}sea ​​la función de pérdida , una métrica para la diferencia entre el valor predichoF(incógnita){\displaystyle f(\mathbf {x} )}y el valor realy{\displaystyle y}. El riesgo esperado se define como I[F]=incógnita×YV(F(incógnita),y)pag(incógnita,y)dincógnitady{\displaystyle I[f]=\int _{X\times Y}V(f(\mathbf {x} ),y)\,p(\mathbf {x} ,y)\,d\mathbf {x} \,dy} La función objetivo, la mejor función posibleF{\displaystyle f}que se puede elegir, viene dado por elF{\displaystyle f}que satisface F=argininahHI[h]{\displaystyle f=\mathop {\operatorname {argmin} } _{h\in {\mathcal {H}}}I[h]}

Debido a la distribución de probabilidadpag(incógnita,y){\displaystyle p(\mathbf {x},y)}Si se desconoce, se debe utilizar una medida indirecta del riesgo esperado. Esta medida se basa en el conjunto de entrenamiento, una muestra de esta distribución de probabilidad desconocida. Se denomina riesgo empírico.IS[F]=1nortei=1norteV(F(incógnitai),yi){\displaystyle I_{S}[f]={\frac {1}{n}}\sum _{i=1}^{n}V(f(\mathbf {x} _{i}),y_{i})} Un algoritmo de aprendizaje que elige la funciónFS{\displaystyle f_{S}}Aquello que minimiza el riesgo empírico se denomina minimización del riesgo empírico .

Funciones de pérdida

La elección de la función de pérdida es un factor determinante en la función.FS{\displaystyle f_{S}}que será elegido por el algoritmo de aprendizaje. La función de pérdida también afecta la tasa de convergencia de un algoritmo. Es importante que la función de pérdida sea convexa . [ 5 ]

Se utilizan diferentes funciones de pérdida dependiendo de si el problema es de regresión o de clasificación.

Regresión

La función de pérdida más común para la regresión es la función de pérdida cuadrática (también conocida como norma L2 ). Esta función de pérdida familiar se utiliza en la regresión de mínimos cuadrados ordinarios . Su forma es: V(F(incógnita),y)=(yF(incógnita))2{\displaystyle V(f(\mathbf {x} ),y)=(yf(\mathbf {x} ))^{2}}

La función de pérdida de valor absoluto (también conocida como norma L1 ) también se utiliza en ocasiones: V(F(incógnita),y)=|yF(incógnita)|{\displaystyle V(f(\mathbf {x} ),y)=|yf(\mathbf {x} )|}

Clasificación

En cierto sentido, la función indicadora 0-1 es la función de pérdida más natural para la clasificación. Toma el valor 0 si la salida predicha es igual a la salida real, y toma el valor 1 si la salida predicha es diferente de la salida real. Para la clasificación binaria conY={1,1}{\displaystyle Y=\{-1,1\}}, esto es: V(F(incógnita),y)=θ(yF(incógnita)){\displaystyle V(f(\mathbf {x} ),y)=\theta (-yf(\mathbf {x} ))} dóndeθ{\displaystyle \theta }es la función escalón de Heaviside .

Regularización

Esta imagen representa un ejemplo de sobreajuste en el aprendizaje automático. Los puntos rojos representan los datos del conjunto de entrenamiento. La línea verde representa la relación funcional real, mientras que la línea azul muestra la función aprendida, que se ha sobreajustado a los datos del conjunto de entrenamiento.

En los problemas de aprendizaje automático, surge un problema importante: el sobreajuste . Dado que el aprendizaje es un problema de predicción, el objetivo no es encontrar una función que se ajuste mejor a los datos (previamente observados), sino encontrar una que prediga con mayor precisión la salida a partir de datos de entrada futuros. La minimización del riesgo empírico conlleva este riesgo de sobreajuste: encontrar una función que se ajuste exactamente a los datos, pero que no prediga bien la salida futura.

El sobreajuste es síntoma de soluciones inestables; una pequeña perturbación en los datos del conjunto de entrenamiento provocaría una gran variación en la función aprendida. Se puede demostrar que si se garantiza la estabilidad de la solución, también se garantizan la generalización y la consistencia. [ 6 ] [ 7 ] La regularización puede resolver el problema del sobreajuste y proporcionar estabilidad al problema.

La regularización se puede lograr restringiendo el espacio de hipótesis.H{\displaystyle {\mathcal {H}}}Un ejemplo común sería restringirH{\displaystyle {\mathcal {H}}}a funciones lineales: esto puede verse como una reducción al problema estándar de regresión lineal .H{\displaystyle {\mathcal {H}}}También podría restringirse a polinomios de gradopag{\displaystyle p}, exponenciales o funciones acotadas en L1 . La restricción del espacio de hipótesis evita el sobreajuste porque la forma de las funciones potenciales es limitada y, por lo tanto, no permite la elección de una función que dé un riesgo empírico arbitrariamente cercano a cero.

Un ejemplo de regularización es la regularización de Tikhonov . Esta consiste en minimizar 1nortei=1norteV(F(incógnitai),yi)+γFH2{\displaystyle {\frac {1}{n}}\sum _{i=1}^{n}V(f(\mathbf {x} _{i}),y_{i})+\gamma \left\|f\right\|_{\mathcal {H}}^{2}} dóndeγ{\displaystyle \gamma }es un parámetro fijo y positivo, el parámetro de regularización. La regularización de Tikhonov garantiza la existencia, unicidad y estabilidad de la solución. [ 8 ]

Limitar el riesgo empírico

Consideremos un clasificador binarioF:incógnita{0,1}{\displaystyle f:{\mathcal {X}}\to \{0,1\}}Podemos aplicar la desigualdad de Hoeffding para acotar la probabilidad de que el riesgo empírico se desvíe del riesgo verdadero a una distribución subgaussiana . PAG(|R^(F)R(F)|ϵ)2mi2norteϵ2{\displaystyle \mathbb {P} (|{\hat {R}}(f)-R(f)|\geq \epsilon )\leq 2e^{-2n\epsilon ^{2}}} Pero, por lo general, cuando realizamos una minimización empírica del riesgo, no se nos proporciona un clasificador; debemos elegirlo. Por lo tanto, un resultado más útil consiste en acotar la probabilidad del supremo de la diferencia sobre toda la clase. PAG(sorberFF|R^(F)R(F)|ϵ)2S(F,norte)minorteϵ2/8nortedminorteϵ2/8{\displaystyle \mathbb {P} {\bigg (}\sup _{f\in {\mathcal {F}}}|{\hat {R}}(f)-R(f)|\geq \epsilon {\bigg )}\leq 2S({\mathcal {F}},n)e^{-n\epsilon ^{2}/8}\approx n^{d}e^{-n\epsilon ^{2}/8}} dóndeS(F,norte){\displaystyle S({\mathcal {F}},n)}es el número devastador ynorte{\displaystyle n}es el número de muestras en su conjunto de datos. El término exponencial proviene de Hoeffding, pero hay un costo adicional al tomar el supremo sobre toda la clase, que es el número de ruptura.

Véase también

Referencias

  1. Vapnik, Vladimir N. (1995). La naturaleza de la teoría del aprendizaje estadístico . Nueva York: Springer. ISBN 978-1-475-72440-0.
  2. Hastie, Trevor ; Tibshirani, Robert; Friedman, Jerome H. (2009). Los elementos del aprendizaje estadístico: minería de datos, inferencia y predicción . Springer Series in Statistics. Nueva York, NY: Springer. ISBN 978-0-387-84857-0.
  3. Mohri, Mehryar ; Rostamizadeh, Afshin; Talwalkar, Ameet (2012). Fundamentos del aprendizaje automático . EE. UU., Massachusetts: MIT Press. ISBN 9780262018258.
  4. Tomaso Poggio, Lorenzo Rosasco, et al. Teoría y aplicaciones del aprendizaje estadístico , 2012, Clase 1
  5. Rosasco, Lorenzo; De Vito, Ernesto; Caponnetto, Andrea; Piana, Michele; Verri, Alessandro (1 de mayo de 2004). "¿Son todas las funciones de pérdida iguales?" . Computación neuronal . 16 (5): 1063– 1076. doi : 10.1162/089976604773135104 . hdl : 11380/4590 . ISSN 0899-7667 . PMID 15070510 .  
  6. Vapnik, VN y Chervonenkis, AY 1971. Sobre la convergencia uniforme de las frecuencias relativas de los eventos a sus probabilidades . Theory of Probability and Its Applications Vol 16, pp 264-280.
  7. Mukherjee, S., Niyogi, P., Poggio, T. y Rifkin, R. 2006. Teoría del aprendizaje: la estabilidad es suficiente para la generalización y necesaria y suficiente para la consistencia de la minimización del riesgo empírico . Advances in Computational Mathematics . Vol. 25, pp. 161-193.
  8. Tomaso Poggio, Lorenzo Rosasco, et al. Teoría y aplicaciones del aprendizaje estadístico , 2012, Clase 2