Articulo de referencia

pérdida de bisagra

El eje vertical representa el valor de la pérdida de bisagra (en azul) y la pérdida cero-uno (en verde) para un t = 1 fijo , mientras que el eje horizontal representa el valor d...

El eje vertical representa el valor de la pérdida de bisagra (en azul) y la pérdida cero-uno (en verde) para un t = 1 fijo , mientras que el eje horizontal representa el valor de la predicción y . El gráfico muestra que la pérdida de bisagra penaliza las predicciones y < 1 , lo que corresponde al concepto de margen en una máquina de vectores de soporte.

En aprendizaje automático , la pérdida de bisagra es una función de pérdida que se utiliza para entrenar clasificadores . La pérdida de bisagra se utiliza para la clasificación de "máximo margen", sobre todo para las máquinas de vectores de soporte (SVM). [ 1 ]

Para una salida prevista t = ±1 y una puntuación del clasificador y , la pérdida de bisagra de la predicción y se define como:

(y)=máximo(0,1ty){\displaystyle \ell (y)=\max(0,1-t\cdot y)}

Tenga en cuenta quey{\displaystyle y}debe ser la salida "bruta" de la función de decisión del clasificador, no la etiqueta de clase predicha. Por ejemplo, en las SVM lineales,y=wincógnita+b{\displaystyle y=\mathbf {w} \cdot \mathbf {x} +b}, dónde(w,b){\displaystyle (\mathbf {w},b)}son los parámetros del hiperplano yincógnita{\displaystyle \mathbf {x} }es la(s) variable(s) de entrada.

Cuando t e y tienen el mismo signo (lo que significa que y predice la clase correcta) y|y|1{\displaystyle |y|\geq 1}, la pérdida de bisagra(y)=0{\displaystyle \ell (y)=0}Cuando tienen signos opuestos,(y){\displaystyle \ell (y)}aumenta linealmente con y , y de manera similar si|y|<1{\displaystyle |y|<1}, incluso si tiene el mismo signo (predicción correcta, pero no por suficiente margen).

La pérdida de bisagra no es una regla de puntuación adecuada .

Extensiones

Si bien las SVM binarias se extienden comúnmente a la clasificación multiclase de forma uno contra todos o uno contra uno, [ 2 ] también es posible extender la pérdida de bisagra para tal fin. Se han propuesto varias variaciones diferentes de la pérdida de bisagra multiclase. [ 3 ] Por ejemplo, Crammer y Singer [ 4 ] la definieron para un clasificador lineal como [ 5 ]

(y)=máximo(0,1+máximoytwyincógnitawtincógnita){\displaystyle \ell (y)=\max(0,1+\max _{y\neq t}\mathbf {w} _{y}\mathbf {x} -\mathbf {w} _{t}\mathbf {x} )},

dóndet{\displaystyle t}es la etiqueta objetivo,wt{\displaystyle \mathbf {w} _ {t}}ywy{\displaystyle \mathbf {w} _ {y}}son los parámetros del modelo.

Weston y Watkins proporcionaron una definición similar, pero con una suma en lugar de un máximo: [ 6 ] [ 3 ]

(y)=ytmáximo(0,1+wyincógnitawtincógnita){\displaystyle \ell (y)=\sum _{y\neq t}\max(0,1+\mathbf {w} _{y}\mathbf {x} -\mathbf {w} _{t}\mathbf {x} )}.

En la predicción estructurada , la pérdida de bisagra se puede extender aún más a espacios de salida estructurados. Las SVM estructuradas con reescalado de margen utilizan la siguiente variante, donde w denota los parámetros de la SVM, y las predicciones de la SVM, φ la función de características conjunta y Δ la pérdida de Hamming :

(y)=máximo(0,Δ(y,t)+w,ϕ(incógnita,y)w,ϕ(incógnita,t))=máximo(0,máximoyY(Δ(y,t)+w,ϕ(incógnita,y))w,ϕ(incógnita,t)){\displaystyle {\begin{aligned}\ell (\mathbf {y} )&=\max(0,\Delta (\mathbf {y} ,\mathbf {t} )+\langle \mathbf {w} ,\phi (\mathbf {x} ,\mathbf {y} )\rangle -\langle \mathbf {w} ,\phi (\mathbf {x} ,\mathbf {t} )\rangle )\\&=\max(0,\max _{y\in {\mathcal {Y}}}\left(\Delta (\mathbf {y} ,\mathbf {t} )+\langle \mathbf {w} ,\phi (\mathbf {x} ,\mathbf {y} )\rangle \right)-\langle \mathbf {w} ,\phi (\mathbf {x} ,\mathbf {t} )\rangle )\end{aligned}}}.

Mejoramiento

La pérdida de bisagra es una función convexa , por lo que muchos de los optimizadores convexos habituales utilizados en el aprendizaje automático pueden trabajar con ella. No es diferenciable , pero tiene un subgradiente con respecto a los parámetros del modelo w de una SVM lineal con función de puntuación.y=wincógnita{\displaystyle y=\mathbf {w} \cdot \mathbf {x} }que se da por

wi={tincógnitaisi ty<1,0de lo contrario.{\displaystyle {\frac {\partial \ell }{\partial w_{i}}}={\begin{cases}-t\cdot x_{i}&{\text{if }}t\cdot y<1,\\0&{\text{otherwise}}.\end{cases}}}
Gráfico de tres variantes de pérdida de bisagra en función de z = ty : la variante "ordinaria" (azul), su cuadrado (verde) y la versión suave por partes de Rennie y Srebro (rojo). El eje y es la pérdida de bisagra l(y) y el eje x es el parámetro t

Sin embargo, dado que la derivada de la pérdida de bisagra enty=1{\displaystyle ty=1}Si no está definido, se pueden preferir versiones suavizadas para la optimización, como las de Rennie y Srebro [ 7 ].

(y)={12tysi  ty0,12(1ty)2si  0<ty<1,0si  1ty{\displaystyle \ell (y)={\begin{cases}{\frac {1}{2}}-ty&{\text{if}}~~ty\leq 0,\\{\frac {1}{2}}(1-ty)^{2}&{\text{if}}~~0<ty<1,\\0&{\text{if}}~~1\leq ty\end{cases}}}

o el suavizado cuadrático

γ(y)={12γmáximo(0,1ty)2si  ty1γ,1γ2tyde lo contrario{\displaystyle \ell _{\gamma }(y)={\begin{cases}{\frac {1}{2\gamma }}\max(0,1-ty)^{2}&{\text{if}}~~ty\geq 1-\gamma ,\\1-{\frac {\gamma }{2}}-ty&{\text{otherwise}}\end{cases}}}

sugerido por Zhang. [ 8 ] La pérdida de Huber modificadaL{\displaystyle L}es un caso especial de esta función de pérdida conγ=2{\displaystyle \gamma =2}, específicamenteL(t,y)=42(y){\displaystyle L(t,y)=4\ell _{2}(y)}.

Véase también

Referencias

  1. Rosasco, L.; De Vito, ED; Caponnetto, A.; Piana, M.; Verri, A. (2004). "¿Son todas las funciones de pérdida iguales?" (PDF) . Computación neuronal . 16 (5): 1063–1076 . CiteSeerX 10.1.1.109.6786 . doi : 10.1162/089976604773135104 . PMID 15070510 .  
  2. Duan, KB; Keerthi, SS (2005). "¿Cuál es el mejor método SVM multiclase? Un estudio empírico" (PDF) . Sistemas de clasificadores múltiples . LNCS . Vol. 3541. pp. 278–285 . CiteSeerX 10.1.1.110.6789 . doi : 10.1007/11494683_28 . ISBN    978-3-540-26306-7.
  3. 1 2 Doğan, Ürün; Glasmachers, Tobias; Igel, Christian (2016). "Una visión unificada de la clasificación de vectores de soporte multiclase" (PDF) . Journal of Machine Learning Research . 17 : 1–32 .
  4. Crammer, Koby; Singer, Yoram (2001). "Sobre la implementación algorítmica de máquinas vectoriales basadas en kernels multiclase" (PDF) . Journal of Machine Learning Research . 2 : 265–292 .
  5. Moore, Robert C.; DeNero, John (2011). " Regularización L1 y L2 para modelos de pérdida de bisagra multiclase" ( PDF ) . Actas del Simposio sobre Aprendizaje Automático en Procesamiento del Habla y del Lenguaje . Archivado del original (PDF) el 28 de agosto de 2017. Consultado el 23 de octubre de 2013 .
  6. Weston, Jason; Watkins, Chris (1999). "Máquinas de vectores de soporte para el reconocimiento de patrones multiclase" (PDF) . Simposio Europeo sobre Redes Neuronales Artificiales . Archivado del original (PDF) el 5 de mayo de 2018. Consultado el 1 de marzo de 2017 .
  7. Rennie, Jason DM; Srebro, Nathan (2005). Funciones de pérdida para niveles de preferencia: regresión con etiquetas ordenadas discretas (PDF) . Actas del Taller Multidisciplinario IJCAI sobre Avances en el Manejo de Preferencias.
  8. Zhang, Tong (2004). Resolución de problemas de predicción lineal a gran escala mediante algoritmos de descenso de gradiente estocástico (PDF) . ICML.