Articulo de referencia

Pérdida de Huber

En estadística , la función de pérdida de Huber es una función de pérdida utilizada en regresión robusta , que es menos sensible a los valores atípicos en los datos que la pérdi...

En estadística , la función de pérdida de Huber es una función de pérdida utilizada en regresión robusta , que es menos sensible a los valores atípicos en los datos que la pérdida de error cuadrático . En ocasiones, también se utiliza una variante para clasificación.

Definición

Pérdida de Huber (verde,δ=1{\displaystyle \delta =1}) y la pérdida de error cuadrático (azul) en función deyF(incógnita){\displaystyle yf(x)}

La función de pérdida de Huber describe la penalización incurrida por un procedimiento de estimación f . Huber (1964) define la función de pérdida por partes mediante [ 1 ].Lδ(a)={12a2para |a|δ,δ(|a|12δ),de lo contrario.{\displaystyle L_{\delta }(a)={\begin{cases}{\frac {1}{2}}{a^{2}}&{\text{para }}|a|\leq \delta ,\\[4pt]\delta \cdot \left(|a|-{\frac {1}{2}}\delta \right),&{\text{en otro caso.}}\end{cases}}}

Esta función es cuadrática para valores pequeños de a , y lineal para valores grandes, con valores y pendientes iguales de las diferentes secciones en los dos puntos donde|a|=δ{\displaystyle |a|=\delta }La variable a se refiere a menudo a los residuos, es decir, a la diferencia entre los valores observados y predichos.a=yF(incógnita){\displaystyle a=yf(x)}, por lo que el primero se puede ampliar a [ 2 ]

Lδ(y,F(incógnita))={12(yF(incógnita))2para |yF(incógnita)|δ,δ (|yF(incógnita)|12δ),de lo contrario.{\displaystyle L_{\delta }(y,f(x))={\begin{cases}{\frac {1}{2}}{\left(yf(x)\right)}^{2}&{\text{para }}\left|yf(x)\right|\leq \delta ,\\[4pt]\delta \ \cdot \left(\left|yf(x)\right|-{\frac {1}{2}}\delta \right),&{\text{en otro caso.}}\end{cases}}}

La función de pérdida de Huber es la convolución de la función de valor absoluto con la función rectangular , escalada y trasladada. De esta forma, suaviza la esquina de la primera en el origen.

Comparación de la función de pérdida de Huber con otras funciones de pérdida utilizadas para la regresión robusta.

Motivación

Dos funciones de pérdida muy utilizadas son la pérdida al cuadrado ,L(a)=a2{\displaystyle L(a)=a^{2}}y la pérdida absoluta ,L(a)=|a|{\displaystyle L(a)=|a|}La función de pérdida cuadrática da como resultado un estimador insesgado de media aritmética , y la función de pérdida de valor absoluto da como resultado un estimador insesgado de mediana (en el caso unidimensional, y un estimador insesgado de mediana geométrica para el caso multidimensional). La pérdida cuadrática tiene la desventaja de que tiende a estar dominada por valores atípicos, cuando se suma sobre un conjunto dea{\displaystyle a}de (como eni=1norteL(ai){\textstyle \sum _ {i=1}^{n}L(a_{i})}), la media de la muestra está demasiado influenciada por unos pocos valores particularmente grandesa{\displaystyle a}valores -cuando la distribución tiene cola pesada: en términos de teoría de estimación , la eficiencia relativa asintótica de la media es baja para distribuciones con cola pesada. [ 3 ]

Como se definió anteriormente, la función de pérdida de Huber es fuertemente convexa en un entorno uniforme de su mínimo.a=0{\displaystyle a=0}; en el límite de este vecindario uniforme, la función de pérdida de Huber tiene una extensión diferenciable a una función afín en puntosa=δ{\displaystyle a=-\delta }ya=δ{\displaystyle a=\delta }Estas propiedades le permiten combinar gran parte de la sensibilidad del estimador de la media insesgado y de varianza mínima (que utiliza la función de pérdida cuadrática) y la robustez del estimador insesgado de la mediana (que utiliza la función de valor absoluto).

Función de pérdida de Pseudo-Huber

La función de pérdida Pseudo-Huber puede utilizarse como una aproximación suave de la función de pérdida Huber. Combina las mejores propiedades de la pérdida L2 al cuadrado y la pérdida L1 absoluta al ser fuertemente convexa cuando está cerca del objetivo/mínimo y menos pronunciada para valores extremos. La escala en la que la función de pérdida Pseudo-Huber transita de la pérdida L2 para valores cercanos al mínimo a la pérdida L1 para valores extremos y la pendiente en valores extremos se pueden controlar mediante laδ{\displaystyle \delta }valor. La función de pérdida Pseudo-Huber asegura que las derivadas sean continuas para todos los grados. Se define como [ 4 ] [ 5 ]

Lδ(a)=δ2(1+(a/δ)21).{\displaystyle L_{\delta }(a)=\delta ^{2}\left({\sqrt {1+(a/\delta )^{2}}}-1\right).}

Por lo tanto, esta función se aproxima aa2/2{\displaystyle a^{2}/2}para valores pequeños dea{\displaystyle a}y se aproxima a una línea recta con pendienteδ{\displaystyle \delta }para valores grandes dea{\displaystyle a}.

Si bien la anterior es la forma más común, también existen otras aproximaciones suaves de la función de pérdida de Huber. [ 6 ]

Variante para clasificación

Para fines de clasificación , a veces se utiliza una variante de la pérdida de Huber llamada Huber modificada . Dada una predicciónF(incógnita){\displaystyle f(x)}(una puntuación de clasificador de valor real) y una etiqueta de clase binaria verdaderay{+1,1}{\displaystyle y\in \{+1,-1\}}, la pérdida de Huber modificada se define como [ 7 ]

L(y,F(incógnita))={máximo(0,1yF(incógnita))2para yF(incógnita)>1,4yF(incógnita)de lo contrario.{\displaystyle L(y,f(x))={\begin{cases}\max(0,1-y\,f(x))^{2}&{\text{for }}\,\,y\,f(x)>-1,\\[4pt]-4y\,f(x)&{\text{otherwise.}}\end{cases}}}

El términomáximo(0,1yF(incógnita)){\displaystyle \max(0,1-y\,f(x))}es la pérdida de bisagra utilizada por las máquinas de vectores de soporte ; la pérdida de bisagra suavizada cuadráticamente es una generalización deL{\displaystyle L}. [ 7 ]

Aplicaciones

La función de pérdida de Huber se utiliza en estadística robusta , estimación M y modelado aditivo . [ 8 ]

Véase también

Referencias

  1. Huber, Peter J. (1964). "Estimación robusta de un parámetro de localización" . Annals of Statistics . 53 (1): 73– 101. doi : 10.1214/aoms/1177703732 . JSTOR 2238020 . 
  2. Hastie, Trevor; Tibshirani, Robert; Friedman, Jerome (2009). Los elementos del aprendizaje estadístico . pág. 349. Archivado del original el 26 de enero de 2015. En comparación con Hastie et al. , la pérdida se escala por un factor de 1/2 , para ser coherente con la definición original de Huber dada anteriormente .
  3. Géron, Aurélien (2023). Aprendizaje automático práctico con Scikit-Learn, Keras y TensorFlow (3.ª ed.). O'Reilly (publicado el 20 de octubre de 2023). pp. 314, 412. ISBN   978-1-098-12597-4.
  4. Charbonnier, P.; Blanc-Féraud, L. ; Aubert, G.; Barlaud, M. (1997). "Regularización determinista que preserva los bordes en imágenes computarizadas". IEEE Trans. Image Process . 6 (2): 298– 311. Bibcode : 1997ITIP....6..298C . CiteSeerX 10.1.1.64.7521 . doi : 10.1109/83.551699 . PMID 18282924 .  
  5. Hartley, R.; Zisserman, A. (2003). Geometría de múltiples vistas en visión por computadora ( 2.ª ed.). Cambridge University Press. pág. 619. ISBN   978-0-521-54051-3.
  6. Lange, K. (1990). "Convergencia de algoritmos de reconstrucción de imágenes con suavizado de Gibbs". IEEE Trans. Med. Imaging . 9 (4): 439– 446. doi : 10.1109/42.61759 . PMID 18222791 . 
  7. 1 2 Zhang, Tong (2004). Resolución de problemas de predicción lineal a gran escala utilizando algoritmos de descenso de gradiente estocástico . ICML.
  8. Friedman, JH (2001). "Aproximación de funciones voraces: una máquina de potenciación de gradiente" . Annals of Statistics . 26 (5): 1189– 1232. doi : 10.1214/aos/1013203451 . JSTOR 2699986 .