
En aprendizaje automático , la pérdida de bisagra es una función de pérdida que se utiliza para entrenar clasificadores . La pérdida de bisagra se utiliza para la clasificación de "máximo margen", sobre todo para las máquinas de vectores de soporte (SVM). [ 1 ]
Para una salida prevista t = ±1 y una puntuación del clasificador y , la pérdida de bisagra de la predicción y se define como:
Tenga en cuenta quedebe ser la salida "bruta" de la función de decisión del clasificador, no la etiqueta de clase predicha. Por ejemplo, en las SVM lineales,, dóndeson los parámetros del hiperplano yes la(s) variable(s) de entrada.
Cuando t e y tienen el mismo signo (lo que significa que y predice la clase correcta) y, la pérdida de bisagraCuando tienen signos opuestos,aumenta linealmente con y , y de manera similar si, incluso si tiene el mismo signo (predicción correcta, pero no por suficiente margen).
La pérdida de bisagra no es una regla de puntuación adecuada .
Extensiones
Si bien las SVM binarias se extienden comúnmente a la clasificación multiclase de forma uno contra todos o uno contra uno, [ 2 ] también es posible extender la pérdida de bisagra para tal fin. Se han propuesto varias variaciones diferentes de la pérdida de bisagra multiclase. [ 3 ] Por ejemplo, Crammer y Singer [ 4 ] la definieron para un clasificador lineal como [ 5 ]
- ,
dóndees la etiqueta objetivo,yson los parámetros del modelo.
Weston y Watkins proporcionaron una definición similar, pero con una suma en lugar de un máximo: [ 6 ] [ 3 ]
- .
En la predicción estructurada , la pérdida de bisagra se puede extender aún más a espacios de salida estructurados. Las SVM estructuradas con reescalado de margen utilizan la siguiente variante, donde w denota los parámetros de la SVM, y las predicciones de la SVM, φ la función de características conjunta y Δ la pérdida de Hamming :
- .
Mejoramiento
La pérdida de bisagra es una función convexa , por lo que muchos de los optimizadores convexos habituales utilizados en el aprendizaje automático pueden trabajar con ella. No es diferenciable , pero tiene un subgradiente con respecto a los parámetros del modelo w de una SVM lineal con función de puntuación.que se da por

Sin embargo, dado que la derivada de la pérdida de bisagra enSi no está definido, se pueden preferir versiones suavizadas para la optimización, como las de Rennie y Srebro [ 7 ].
o el suavizado cuadrático
sugerido por Zhang. [ 8 ] La pérdida de Huber modificadaes un caso especial de esta función de pérdida con, específicamente.
Véase también
Referencias
- ↑ Rosasco, L.; De Vito, ED; Caponnetto, A.; Piana, M.; Verri, A. (2004). "¿Son todas las funciones de pérdida iguales?" (PDF) . Computación neuronal . 16 (5): 1063–1076 . CiteSeerX 10.1.1.109.6786 . doi : 10.1162/089976604773135104 . PMID 15070510 .
- ↑ Duan, KB; Keerthi, SS (2005). "¿Cuál es el mejor método SVM multiclase? Un estudio empírico" (PDF) . Sistemas de clasificadores múltiples . LNCS . Vol. 3541. pp. 278–285 . CiteSeerX 10.1.1.110.6789 . doi : 10.1007/11494683_28 . ISBN 978-3-540-26306-7.
- 1 2 Doğan, Ürün; Glasmachers, Tobias; Igel, Christian (2016). "Una visión unificada de la clasificación de vectores de soporte multiclase" (PDF) . Journal of Machine Learning Research . 17 : 1–32 .
- ↑ Crammer, Koby; Singer, Yoram (2001). "Sobre la implementación algorítmica de máquinas vectoriales basadas en kernels multiclase" (PDF) . Journal of Machine Learning Research . 2 : 265–292 .
- ↑ Moore, Robert C.; DeNero, John (2011). " Regularización L1 y L2 para modelos de pérdida de bisagra multiclase" ( PDF ) . Actas del Simposio sobre Aprendizaje Automático en Procesamiento del Habla y del Lenguaje . Archivado del original (PDF) el 28 de agosto de 2017. Consultado el 23 de octubre de 2013 .
- ↑ Weston, Jason; Watkins, Chris (1999). "Máquinas de vectores de soporte para el reconocimiento de patrones multiclase" (PDF) . Simposio Europeo sobre Redes Neuronales Artificiales . Archivado del original (PDF) el 5 de mayo de 2018. Consultado el 1 de marzo de 2017 .
- ↑ Rennie, Jason DM; Srebro, Nathan (2005). Funciones de pérdida para niveles de preferencia: regresión con etiquetas ordenadas discretas (PDF) . Actas del Taller Multidisciplinario IJCAI sobre Avances en el Manejo de Preferencias.
- ↑ Zhang, Tong (2004). Resolución de problemas de predicción lineal a gran escala mediante algoritmos de descenso de gradiente estocástico (PDF) . ICML.
- Funciones de pérdida
- Máquinas de vectores de soporte