
En el aprendizaje automático y la optimización matemática , las funciones de pérdida para la clasificación son funciones de pérdida computacionalmente factibles que representan el precio pagado por la inexactitud de las predicciones en problemas de clasificación (problemas de identificar a qué categoría pertenece una observación particular). [ 1 ] Dadocomo el espacio de todas las entradas posibles (generalmente), ycomo el conjunto de etiquetas (posibles resultados), un objetivo típico de los algoritmos de clasificación es encontrar una funciónque mejor predice una etiquetapara una entrada dada. [ 2 ] Sin embargo, debido a información incompleta, ruido en la medición o componentes probabilísticos en el proceso subyacente, es posible que el mismopara generar diferentes. [ 3 ] Como resultado, el objetivo del problema de aprendizaje es minimizar la pérdida esperada (también conocida como riesgo), definida como
dóndees una función de pérdida dada, y es la función de densidad de probabilidad del proceso que generó los datos, que puede escribirse de forma equivalente como
Dentro de la clasificación, varias funciones de pérdida de uso común se escriben únicamente en términos del producto de la etiqueta verdadera.y la etiqueta previstaPor lo tanto, pueden definirse como funciones de una sola variable., de modo quecon una función elegida adecuadamente :\mathbb {R} \to \mathbb {R} } . Estas se denominan funciones de pérdida basadas en el margen . Elegir una función de pérdida basada en el margen equivale a elegirLa selección de una función de pérdida dentro de este marco impacta en el óptimoque minimiza el riesgo esperado, véase minimización del riesgo empírico .
En el caso de clasificación binaria, es posible simplificar el cálculo del riesgo esperado a partir de la integral especificada anteriormente. Específicamente,
La segunda igualdad se deduce de las propiedades descritas anteriormente. La tercera igualdad se deduce del hecho de que 1 y −1 son los únicos valores posibles paray el cuarto porqueEl término entre paréntesisse conoce como riesgo condicional.
Se puede resolver para el minimizador detomando la derivada funcional de la última igualdad con respecto ay haciendo que la derivada sea igual a 0. Esto dará como resultado la siguiente ecuación.
dónde, lo cual también equivale a establecer la derivada del riesgo condicional igual a cero.
Dada la naturaleza binaria de la clasificación, una selección natural para una función de pérdida (suponiendo el mismo costo para los falsos positivos y los falsos negativos ) sería la función de pérdida 0-1 ( función indicadora 0-1 ), que toma el valor de 0 si la clasificación predicha es igual a la de la clase verdadera o un 1 si la clasificación predicha no coincide con la clase verdadera. Esta selección se modela mediante
dóndeindica la función escalón de Heaviside . Sin embargo, esta función de pérdida no es convexa ni suave, y resolver la solución óptima es un problema de optimización combinatoria NP-difícil . [ 4 ] Como resultado, es mejor sustituir funciones de pérdida sustitutas que sean manejables para los algoritmos de aprendizaje comúnmente utilizados, ya que tienen propiedades convenientes como ser convexas y suaves. Además de su manejabilidad computacional, se puede demostrar que las soluciones al problema de aprendizaje que utilizan estas funciones de pérdida sustitutas permiten recuperar la solución real al problema de clasificación original. [ 5 ] Algunas de estas sustitutas se describen a continuación.
En la práctica, la distribución de probabilidades desconocido. En consecuencia, utilizar un conjunto de entrenamiento depuntos de muestra distribuidos de forma independiente e idéntica
Al extraer datos del espacio muestral , se busca minimizar el riesgo empírico.
como un indicador del riesgo esperado. [ 3 ] (Véase la teoría del aprendizaje estadístico para una descripción más detallada).
Consistencia bayesiana
Utilizando el teorema de Bayes , se puede demostrar que el óptimo, es decir, la que minimiza el riesgo esperado asociado con la pérdida cero-uno, implementa la regla de decisión óptima de Bayes para un problema de clasificación binaria y tiene la forma de
- .
Se dice que una función de pérdida está calibrada para la clasificación o es consistente con Bayes si su valor óptimoes tal quey, por lo tanto, es óptimo bajo la regla de decisión de Bayes. Una función de pérdida consistente con Bayes nos permite encontrar la función de decisión óptima de Bayes.minimizando directamente el riesgo esperado y sin tener que modelar explícitamente las funciones de densidad de probabilidad.
Para pérdida de margen convexo, se puede demostrar quees consistente en Bayes si y solo si es diferenciable en 0 y. [ 6 ] [ 1 ] Sin embargo, este resultado no excluye la existencia de funciones de pérdida consistentes con Bayes no convexas. Un resultado más general establece que las funciones de pérdida consistentes con Bayes se pueden generar utilizando la siguiente formulación [ 7 ]
- ,
dóndees cualquier función invertible tal queyes cualquier función diferenciable estrictamente cóncava tal queLa Tabla I muestra las funciones de pérdida consistentes de Bayes generadas para algunas opciones de ejemplo deyNótese que las funciones de pérdida de Savage y Tangent no son convexas. Se ha demostrado que estas funciones de pérdida no convexas son útiles para tratar con valores atípicos en la clasificación. [ 7 ] [ 8 ] Para todas las funciones de pérdida generadas a partir de (2), la probabilidad posteriorse puede encontrar utilizando la función de enlace invertible como Las funciones de pérdida en las que la probabilidad posterior se puede recuperar utilizando el enlace invertible se denominan funciones de pérdida propias .
El único minimizador del riesgo esperado,, asociadas con las funciones de pérdida generadas anteriormente, se pueden encontrar directamente a partir de la ecuación (1) y se demuestra que son iguales a las correspondientesEsto se cumple incluso para las funciones de pérdida no convexas, lo que significa que se pueden utilizar algoritmos basados en el descenso de gradiente, como el aumento de gradiente, para construir el minimizador.
Funciones de pérdida adecuadas, margen de pérdida y regularización.

Para funciones de pérdida adecuadas, el margen de pérdida se puede definir comoy se ha demostrado que está directamente relacionado con las propiedades de regularización del clasificador. [ 9 ] Específicamente, una función de pérdida con un margen mayor aumenta la regularización y produce mejores estimaciones de la probabilidad posterior. Por ejemplo, el margen de pérdida se puede aumentar para la pérdida logística introduciendo unparámetro y escribiendo la pérdida logística comodonde más pequeñoaumenta el margen de pérdida. Se demuestra que esto es directamente equivalente a disminuir la tasa de aprendizaje en el aumento de gradiente.donde disminuyemejora la regularización del clasificador potenciado. La teoría deja claro que cuando una tasa de aprendizaje deSe utiliza la fórmula correcta para recuperar la probabilidad posterior..
En conclusión, al elegir una función de pérdida con un margen mayor (menor) aumentamos la regularización y mejoramos nuestras estimaciones de la probabilidad posterior, lo que a su vez mejora la curva ROC del clasificador final.
pérdida cuadrada
Aunque se usa más comúnmente en regresión, la función de pérdida cuadrática se puede reescribir como una función.y se utiliza para la clasificación. Se puede generar utilizando (2) y la Tabla I de la siguiente manera:
La función de pérdida cuadrática es convexa y suave. Sin embargo, la función de pérdida cuadrática tiende a penalizar excesivamente los valores atípicos, lo que conduce a tasas de convergencia más lentas (en lo que respecta a la complejidad de la muestra) que para las funciones de pérdida logística o de bisagra. [ 1 ] Además, las funciones que producen valores altos depara algunostendrá un rendimiento deficiente con la función de pérdida cuadrada, ya que los valores altos deserá penalizado severamente, independientemente de si los signos deyfósforo.
Una ventaja de la función de pérdida cuadrática es que su estructura facilita la validación cruzada de los parámetros de regularización. Específicamente para la regularización de Tikhonov , se puede calcular el parámetro de regularización mediante validación cruzada de exclusión de un elemento en el mismo tiempo que se tardaría en resolver un solo problema. [ 10 ]
El minimizador depara la función de pérdida cuadrática se puede encontrar directamente de la ecuación (1) como
Pérdida logística
La función de pérdida logística se puede generar utilizando (2) y la Tabla I de la siguiente manera:
La función de pérdida logística es convexa y crece linealmente para valores negativos, lo que la hace menos sensible a los valores atípicos. Esta función se utiliza en el algoritmo LogitBoost .
El minimizador deLa función de pérdida logística se puede obtener directamente de la ecuación (1) como
Esta función no está definida cuandoo (tendiendo hacia ∞ y −∞ respectivamente), pero predice una curva suave que crece cuandoaumenta y es igual a 0 cuando. [ 3 ]
Es fácil comprobar que la pérdida logística y la pérdida de entropía cruzada binaria (pérdida logarítmica) son de hecho iguales (salvo una constante multiplicativa).La pérdida de entropía cruzada está estrechamente relacionada con la divergencia de Kullback-Leibler entre la distribución empírica y la distribución predicha. La pérdida de entropía cruzada es omnipresente en las redes neuronales profundas modernas .
Pérdida exponencial
La función de pérdida exponencial se puede generar utilizando (2) y la Tabla-I de la siguiente manera.
La pérdida exponencial es convexa y crece exponencialmente para valores negativos, lo que la hace más sensible a los valores atípicos. La pérdida exponencial ponderada de 0 a 1 se utiliza en el algoritmo AdaBoost, lo que da lugar implícitamente a la pérdida exponencial.
El minimizador deLa función de pérdida exponencial se puede encontrar directamente a partir de la ecuación (1) como
Pérdida brutal
La pérdida de Savage [ 7 ] se puede generar utilizando (2) y la Tabla-I de la siguiente manera:
La función de pérdida de Savage es cuasi-convexa y está acotada para valores negativos grandes, lo que la hace menos sensible a los valores atípicos. Esta función se ha utilizado en el algoritmo de potenciación de gradiente y en el algoritmo SavageBoost.
El minimizador deLa función de pérdida de Savage se puede encontrar directamente a partir de la ecuación (1) como
pérdida tangente
La pérdida tangente [ 11 ] se puede generar utilizando (2) y la Tabla-I de la siguiente manera:
La función de pérdida Tangent es cuasi-convexa y está acotada para valores negativos grandes, lo que la hace menos sensible a los valores atípicos. Curiosamente, la función de pérdida Tangent también asigna una penalización acotada a los puntos de datos que se han clasificado "demasiado correctamente". Esto puede ayudar a prevenir el sobreentrenamiento en el conjunto de datos. La función de pérdida Tangent se ha utilizado en el potenciador de gradiente , el algoritmo TangentBoost y los bosques de decisión alternados. [ 12 ]
El minimizador deLa función de pérdida tangente se puede encontrar directamente a partir de la ecuación (1) como
pérdida de bisagra
La función de pérdida de bisagra se define con, dóndees la función de la parte positiva .
La función de pérdida de bisagra proporciona una cota superior convexa relativamente ajustada para la función indicadora 0-1 . Específicamente, la función de pérdida de bisagra es igual a la función indicadora 0-1 cuandoyAdemás, la minimización del riesgo empírico de esta pérdida es equivalente a la formulación clásica para máquinas de vectores de soporte (SVM). Los puntos clasificados correctamente que se encuentran fuera de los límites de los vectores de soporte no se penalizan, mientras que los puntos dentro de los límites o en el lado incorrecto del hiperplano se penalizan de forma lineal en comparación con su distancia al límite correcto. [ 4 ]
Si bien la función de pérdida de bisagra es convexa y continua, no es suave (no es diferenciable) enEn consecuencia, la función de pérdida de bisagra no se puede utilizar con métodos de descenso de gradiente o métodos de descenso de gradiente estocástico que dependen de la diferenciabilidad en todo el dominio. Sin embargo, la pérdida de bisagra sí tiene un subgradiente en, lo que permite la utilización de métodos de descenso de subgradiente . [ 4 ] Las SVM que utilizan la función de pérdida de bisagra también se pueden resolver utilizando programación cuadrática .
El minimizador depara la función de pérdida de bisagra es
cuando, que coincide con la de la función indicadora 0-1. Esta conclusión hace que la pérdida de bisagra sea bastante atractiva, ya que se pueden establecer límites a la diferencia entre el riesgo esperado y el signo de la función de pérdida de bisagra. [ 1 ] La pérdida de bisagra no se puede derivar de (2) ya que no es invertible.
Pérdida generalizada de bisagra suave
La función de pérdida de bisagra suave generalizada con parámetrose define como
dónde
Es monótonamente decreciente y llega a 0 cuando.
Véase también
Referencias
- 1 2 3 4 Rosasco, L.; De Vito, ED; Caponnetto, A.; Piana, M.; Verri, A. (2004). "¿Son todas las funciones de pérdida iguales?" (PDF) . Computación neuronal . 16 (5): 1063–1076 . CiteSeerX 10.1.1.109.6786 . doi : 10.1162/089976604773135104 . PMID 15070510 . S2CID 11845688 .
- ↑ Shen, Yi (2005), Funciones de pérdida para clasificación binaria y estimación de probabilidad de clase (PDF) , Universidad de Pensilvania , consultado el 6 de diciembre de 2014.
- 1 2 3 Rosasco, Lorenzo; Poggio, Tomaso (2014), Un recorrido por la regularización del aprendizaje automático , Notas de clase MIT-9.520, vol. Manuscrito
- 1 2 3 Piyush, Rai (13 de septiembre de 2011), Máquinas de vectores de soporte (continuación), funciones de pérdida de clasificación y regularizadores (PDF) , Utah CS5350/6350: Aprendizaje automático , consultado el 4 de mayo de 2021
- ↑ Ramanan, Deva (27 de febrero de 2008), Lección 14 (PDF) , UCI ICS273A: Aprendizaje automático , consultado el 6 de diciembre de 2014
{{citation}}: CS1 mantenimiento: ubicación del editor ( enlace ) - ↑ Bartlett, Peter L.; Jordan, Michael I.; Mcauliffe, Jon D. (2006). "Convexidad, clasificación y límites de riesgo". Journal of the American Statistical Association . 101 (473): 138– 156. doi : 10.1198/016214505000000907 . ISSN 0162-1459 . JSTOR 30047445 . S2CID 2833811 .
- 1 2 3 Masnadi-Shirazi, Hamed; Vasconcelos, Nuno (2008). "Sobre el diseño de funciones de pérdida para la clasificación: teoría, robustez ante valores atípicos y SavageBoost" (PDF) . Actas de la 21.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal . NIPS'08. EE. UU.: Curran Associates Inc.: 1049–1056 . ISBN 9781605609492.
- ↑ Leistner, C.; Saffari, A.; Roth, PM; Bischof, H. (septiembre de 2009). "Sobre la robustez del boosting en línea: un estudio comparativo". 2009 IEEE 12th International Conference on Computer Vision Workshops, ICCV Workshops . pp. 1362–1369 . doi : 10.1109/ICCVW.2009.5457451 . ISBN 978-1-4244-4442-7. S2CID 6032045 .
- ↑ Vasconcelos, Nuno; Masnadi-Shirazi, Hamed (2015). "Una perspectiva de las pérdidas de margen como regularizadores de estimaciones de probabilidad" . Journal of Machine Learning Research . 16 (85): 2751– 2795. ISSN 1533-7928 .
- ↑ Rifkin, Ryan M.; Lippert, Ross A. (1 de mayo de 2007), Notas sobre mínimos cuadrados regularizados (PDF) , Laboratorio de Ciencias de la Computación e Inteligencia Artificial del MIT
- ↑ Masnadi-Shirazi, H.; Mahadevan, V.; Vasconcelos, N. (junio de 2010). "Sobre el diseño de clasificadores robustos para visión por computadora". Conferencia de la Sociedad de Computación IEEE de 2010 sobre Visión por Computadora y Reconocimiento de Patrones . págs. 779–786 . CiteSeerX 10.1.1.172.6416 . doi : 10.1109/CVPR.2010.5540136 . ISBN 978-1-4244-6984-0. S2CID 632758 .
- ↑ Schulter, S.; Wohlhart, P.; Leistner, C.; Saffari, A.; Roth, PM; Bischof, H. (junio de 2013). «Alternating Decision Forests». 2013 IEEE Conference on Computer Vision and Pattern Recognition . pp. 508–515 . CiteSeerX 10.1.1.301.1305 . doi : 10.1109/CVPR.2013.72 . ISBN 978-0-7695-4989-7. S2CID 6557162 .
- algoritmos de aprendizaje automático