En estadística , la función de pérdida de Huber es una función de pérdida utilizada en regresión robusta , que es menos sensible a los valores atípicos en los datos que la pérdida de error cuadrático . En ocasiones, también se utiliza una variante para clasificación.
Definición

La función de pérdida de Huber describe la penalización incurrida por un procedimiento de estimación f . Huber (1964) define la función de pérdida por partes mediante [ 1 ].
Esta función es cuadrática para valores pequeños de a , y lineal para valores grandes, con valores y pendientes iguales de las diferentes secciones en los dos puntos dondeLa variable a se refiere a menudo a los residuos, es decir, a la diferencia entre los valores observados y predichos., por lo que el primero se puede ampliar a [ 2 ]
La función de pérdida de Huber es la convolución de la función de valor absoluto con la función rectangular , escalada y trasladada. De esta forma, suaviza la esquina de la primera en el origen.

Motivación
Dos funciones de pérdida muy utilizadas son la pérdida al cuadrado ,y la pérdida absoluta ,La función de pérdida cuadrática da como resultado un estimador insesgado de media aritmética , y la función de pérdida de valor absoluto da como resultado un estimador insesgado de mediana (en el caso unidimensional, y un estimador insesgado de mediana geométrica para el caso multidimensional). La pérdida cuadrática tiene la desventaja de que tiende a estar dominada por valores atípicos, cuando se suma sobre un conjunto dede (como en), la media de la muestra está demasiado influenciada por unos pocos valores particularmente grandesvalores -cuando la distribución tiene cola pesada: en términos de teoría de estimación , la eficiencia relativa asintótica de la media es baja para distribuciones con cola pesada. [ 3 ]
Como se definió anteriormente, la función de pérdida de Huber es fuertemente convexa en un entorno uniforme de su mínimo.; en el límite de este vecindario uniforme, la función de pérdida de Huber tiene una extensión diferenciable a una función afín en puntosyEstas propiedades le permiten combinar gran parte de la sensibilidad del estimador de la media insesgado y de varianza mínima (que utiliza la función de pérdida cuadrática) y la robustez del estimador insesgado de la mediana (que utiliza la función de valor absoluto).
Función de pérdida de Pseudo-Huber
La función de pérdida Pseudo-Huber puede utilizarse como una aproximación suave de la función de pérdida Huber. Combina las mejores propiedades de la pérdida L2 al cuadrado y la pérdida L1 absoluta al ser fuertemente convexa cuando está cerca del objetivo/mínimo y menos pronunciada para valores extremos. La escala en la que la función de pérdida Pseudo-Huber transita de la pérdida L2 para valores cercanos al mínimo a la pérdida L1 para valores extremos y la pendiente en valores extremos se pueden controlar mediante lavalor. La función de pérdida Pseudo-Huber asegura que las derivadas sean continuas para todos los grados. Se define como [ 4 ] [ 5 ]
Por lo tanto, esta función se aproxima apara valores pequeños dey se aproxima a una línea recta con pendientepara valores grandes de.
Si bien la anterior es la forma más común, también existen otras aproximaciones suaves de la función de pérdida de Huber. [ 6 ]
Variante para clasificación
Para fines de clasificación , a veces se utiliza una variante de la pérdida de Huber llamada Huber modificada . Dada una predicción(una puntuación de clasificador de valor real) y una etiqueta de clase binaria verdadera, la pérdida de Huber modificada se define como [ 7 ]
El términoes la pérdida de bisagra utilizada por las máquinas de vectores de soporte ; la pérdida de bisagra suavizada cuadráticamente es una generalización de. [ 7 ]
Aplicaciones
La función de pérdida de Huber se utiliza en estadística robusta , estimación M y modelado aditivo . [ 8 ]
Véase también
Referencias
- ↑ Huber, Peter J. (1964). "Estimación robusta de un parámetro de localización" . Annals of Statistics . 53 (1): 73– 101. doi : 10.1214/aoms/1177703732 . JSTOR 2238020 .
- ↑ Hastie, Trevor; Tibshirani, Robert; Friedman, Jerome (2009). Los elementos del aprendizaje estadístico . pág. 349. Archivado del original el 26 de enero de 2015. En comparación con Hastie et al. , la pérdida se escala por un factor de 1/2 , para ser coherente con la definición original de Huber dada anteriormente .
- ↑ Géron, Aurélien (2023). Aprendizaje automático práctico con Scikit-Learn, Keras y TensorFlow (3.ª ed.). O'Reilly (publicado el 20 de octubre de 2023). pp. 314, 412. ISBN 978-1-098-12597-4.
- ↑ Charbonnier, P.; Blanc-Féraud, L. ; Aubert, G.; Barlaud, M. (1997). "Regularización determinista que preserva los bordes en imágenes computarizadas". IEEE Trans. Image Process . 6 (2): 298– 311. Bibcode : 1997ITIP....6..298C . CiteSeerX 10.1.1.64.7521 . doi : 10.1109/83.551699 . PMID 18282924 .
- ↑ Hartley, R.; Zisserman, A. (2003). Geometría de múltiples vistas en visión por computadora ( 2.ª ed.). Cambridge University Press. pág. 619. ISBN 978-0-521-54051-3.
- ↑ Lange, K. (1990). "Convergencia de algoritmos de reconstrucción de imágenes con suavizado de Gibbs". IEEE Trans. Med. Imaging . 9 (4): 439– 446. doi : 10.1109/42.61759 . PMID 18222791 .
- 1 2 Zhang, Tong (2004). Resolución de problemas de predicción lineal a gran escala utilizando algoritmos de descenso de gradiente estocástico . ICML.
- ↑ Friedman, JH (2001). "Aproximación de funciones voraces: una máquina de potenciación de gradiente" . Annals of Statistics . 26 (5): 1189– 1232. doi : 10.1214/aos/1013203451 . JSTOR 2699986 .
- Estadísticas sólidas
- estimadores M
- Funciones de pérdida