Articulo de referencia

Minimización de riesgos estructurales

La minimización del riesgo estructural (SRM) es un principio inductivo que se utiliza en el aprendizaje automático . Habitualmente, en el aprendizaje automático, se debe selecci...

La minimización del riesgo estructural (SRM) es un principio inductivo que se utiliza en el aprendizaje automático . Habitualmente, en el aprendizaje automático, se debe seleccionar un modelo generalizado a partir de un conjunto finito de datos, con el consiguiente problema de sobreajuste : el modelo se adapta demasiado a las particularidades del conjunto de entrenamiento y se generaliza mal a los nuevos datos. El principio SRM aborda este problema equilibrando la complejidad del modelo frente a su éxito a la hora de ajustarse a los datos de entrenamiento. Este principio fue establecido por primera vez en un libro de 1974 [1] de Vladimir Vapnik y Alexey Chervonenkis y utiliza la dimensión VC .

En términos prácticos, la minimización del riesgo estructural se implementa minimizando , donde es el error de entrenamiento, la función se denomina función de regularización y es una constante. se elige de modo que tome valores grandes en parámetros que pertenecen a subconjuntos de alta capacidad del espacio de parámetros. La minimización, en efecto, limita la capacidad de los subconjuntos accesibles del espacio de parámetros, controlando así el equilibrio entre minimizar el error de entrenamiento y minimizar la brecha esperada entre el error de entrenamiento y el error de prueba. [2] mi a a a i norte + β yo ( Yo ) {\displaystyle E_{tren}+\beta H(W)} mi a a a i norte {\displaystyle E_{tren}} yo ( Yo ) {\displaystyle H(W)} β {\estilo de visualización \beta} yo ( Yo ) {\displaystyle H(W)} Yo {\estilo de visualización W} yo ( Yo ) {\displaystyle H(W)}

El problema de SRM se puede formular en términos de datos. Dados n puntos de datos que constan de datos x y etiquetas y, el objetivo suele expresarse de la siguiente manera: Yo ( θ ) {\displaystyle J(\theta )}

Yo ( θ ) = 1 2 norte i = 1 norte ( yo θ ( incógnita i ) y i ) 2 + la 2 yo = 1 d θ yo 2 {\displaystyle J(\theta )={\frac {1}{2n}}\sum _{i=1}^{n}(h_{\theta }(x^{i})-y^{i})^{2}+{\frac {\lambda }{2}}\sum _{j=1}^{d}\theta _{j}^{2}}

El primer término es el término de error cuadrático medio (MSE) entre el valor del modelo aprendido, , y las etiquetas dadas . Este término es el error de entrenamiento, , que se discutió anteriormente. El segundo término, coloca un valor previo sobre los pesos, para favorecer la escasez y penalizar los pesos más grandes. El coeficiente de compensación, , es un hiperparámetro que otorga más o menos importancia al término de regularización. Un valor más grande fomenta pesos más dispersos a expensas de un MSE más óptimo, y un valor más pequeño relaja la regularización permitiendo que el modelo se ajuste a los datos. Tenga en cuenta que a medida que los pesos se vuelven cero, y como , el modelo generalmente sufre de sobreajuste. yo θ estilo de visualización h_{\theta} y {\estilo de visualización y} mi a a a i norte {\displaystyle E_{tren}} la {\estilo de visualización \lambda} la {\estilo de visualización \lambda} la {\estilo de visualización \lambda} la {\displaystyle \lambda \to \infty } la 0 {\displaystyle \lambda \a 0}


Véase también

Referencias

  1. ^ Vapnik, VN; Chervonenkis, A. Ya. (1974). Teoriya raspoznavaniya obrazov [ Teoría del reconocimiento de patrones ] (en ruso). Nauka, Moscú.
  2. ^ LeCun, Yann. "Aprendizaje basado en gradientes aplicado al reconocimiento de documentos" (PDF) .
  • Minimización de riesgos estructurales en el sitio web de máquinas de vectores de soporte.


Obtenido de "https://es.wikipedia.org/w/index.php?title=Minimización_del_riesgo_estructural&oldid=1198145991"