Articulo de referencia

Funciones de pérdida para la clasificación

Funciones de pérdida consistentes de Bayes: Pérdida cero-uno (gris), pérdida de Savage (verde), pérdida logística (naranja), pérdida exponencial (púrpura), pérdida tangente (mar...

Funciones de pérdida consistentes de Bayes: Pérdida cero-uno (gris), pérdida de Savage (verde), pérdida logística (naranja), pérdida exponencial (púrpura), pérdida tangente (marrón), pérdida cuadrática (azul)

En el aprendizaje automático y la optimización matemática , las funciones de pérdida para la clasificación son funciones de pérdida computacionalmente factibles que representan el precio pagado por la inexactitud de las predicciones en problemas de clasificación (problemas de identificar a qué categoría pertenece una observación particular). [ 1 ] Dadoincógnita{\displaystyle {\mathcal {X}}}como el espacio de todas las entradas posibles (generalmenteincógnitaRd{\displaystyle {\mathcal {X}}\subset \mathbb {R} ^{d}}), yY={1,1}{\displaystyle {\mathcal {Y}}=\{-1,1\}}como el conjunto de etiquetas (posibles resultados), un objetivo típico de los algoritmos de clasificación es encontrar una funciónF:incógnitaY{\displaystyle f:{\mathcal {X}}\to {\mathcal {Y}}}que mejor predice una etiquetay{\displaystyle y}para una entrada dadaincógnita{\displaystyle {\vec {x}}}. [ 2 ] Sin embargo, debido a información incompleta, ruido en la medición o componentes probabilísticos en el proceso subyacente, es posible que el mismoincógnita{\displaystyle {\vec {x}}}para generar diferentesy{\displaystyle y}. [ 3 ] Como resultado, el objetivo del problema de aprendizaje es minimizar la pérdida esperada (también conocida como riesgo), definida como

I[F]=incógnita×YV(F(incógnita),y)pag(incógnita,y)dincógnitady{\displaystyle I[f]=\displaystyle \int _{{\mathcal {X}}\times {\mathcal {Y}}}V(f({\vec {x}}),y)\,p({\vec {x}},y)\,d{\vec {x}}\,dy}

dóndeV(F(incógnita),y){\displaystyle V(f({\vec {x}}),y)}es una función de pérdida dada, y pag(incógnita,y){\displaystyle p({\vec {x}},y)}es la función de densidad de probabilidad del proceso que generó los datos, que puede escribirse de forma equivalente como

pag(incógnita,y)=pag(yincógnita)pag(incógnita).{\displaystyle p({\vec {x}},y)=p(y\mid {\vec {x}})p({\vec {x}}).}

Dentro de la clasificación, varias funciones de pérdida de uso común se escriben únicamente en términos del producto de la etiqueta verdadera.y{\displaystyle y}y la etiqueta previstaF(incógnita){\displaystyle f({\vec {x}})}Por lo tanto, pueden definirse como funciones de una sola variable.υ=yF(incógnita){\displaystyle \upsilon =yf({\vec {x}})}, de modo queV(F(incógnita),y)=ϕ(yF(incógnita))=ϕ(υ){\displaystyle V(f({\vec {x}}),y)=\phi (yf({\vec {x}}))=\phi (\upsilon )}con una función elegida adecuadamenteϕ:RR{\displaystyle \phi :\mathbb {R} \to \mathbb {R} } . Estas se denominan funciones de pérdida basadas en el margen . Elegir una función de pérdida basada en el margen equivale a elegirϕ{\displaystyle \phi }La selección de una función de pérdida dentro de este marco impacta en el óptimoFϕ{\displaystyle f_{\phi }^{*}}que minimiza el riesgo esperado, véase minimización del riesgo empírico .

En el caso de clasificación binaria, es posible simplificar el cálculo del riesgo esperado a partir de la integral especificada anteriormente. Específicamente,

I[F]=incógnita×YV(F(incógnita),y)pag(incógnita,y)dincógnitady=incógnitaYϕ(yF(incógnita))pag(yincógnita)pag(incógnita)dydincógnita=incógnita[ϕ(F(incógnita))pag(1incógnita)+ϕ(F(incógnita))pag(1incógnita)]pag(incógnita)dincógnita=incógnita[ϕ(F(incógnita))pag(1incógnita)+ϕ(F(incógnita))(1pag(1incógnita))]pag(incógnita)dincógnita{\displaystyle {\begin{aligned}I[f]&=\int _{{\mathcal {X}}\times {\mathcal {Y}}}V(f({\vec {x}}),y)\,p({\vec {x}},y)\,d{\vec {x}}\,dy\\[6pt]&=\int _{\mathcal {X}}\int _{\mathcal {Y}}\phi (yf({\vec {x}}))\,p(y\mid {\vec {x}})\,p({\vec {x}})\,dy\,d{\vec {x}}\\[6pt]&=\int _ {\mathcal {X}}[\phi (f({\vec {x}}))\,p(1\mid {\vec {x}})+\phi (-f({\vec {x}}))\,p(-1\mid {\vec {x}})]\,p({\vec {x}})\,d{\vec {x}}\\[6pt]&=\int _{\mathcal {X}}[\phi (f({\vec {x}}))\,p(1\mid {\vec {x}})+\phi (-f({\vec {x}}))\,(1-p(1\mid {\vec {x}}))]\,p({\vec {x}})\,d{\vec {x}}\end{aligned}}}

La segunda igualdad se deduce de las propiedades descritas anteriormente. La tercera igualdad se deduce del hecho de que 1 y −1 son los únicos valores posibles paray{\displaystyle y}y el cuarto porquepag(1incógnita)=1pag(1incógnita){\displaystyle p(-1\mid x)=1-p(1\mid x)}El término entre paréntesis[ϕ(F(incógnita))pag(1incógnita)+ϕ(F(incógnita))(1pag(1incógnita))]{\displaystyle [\phi (f({\vec {x}}))p(1\mid {\vec {x}})+\phi (-f({\vec {x}}))(1-p(1\mid {\vec {x}}))]}se conoce como riesgo condicional.

Se puede resolver para el minimizador deI[F]{\displaystyle I[f]}tomando la derivada funcional de la última igualdad con respecto aF{\displaystyle f}y haciendo que la derivada sea igual a 0. Esto dará como resultado la siguiente ecuación.

ϕ(F)Fη+ϕ(F)F(1η)=0,(1){\displaystyle {\frac {\partial \phi (f)}{\partial f}}\eta +{\frac {\partial \phi (-f)}{\partial f}}(1-\eta )=0,\;\;\;\;\;(1)}

dóndeη=pag(y=1|incógnita){\displaystyle \eta =p(y=1|{\vec {x}})}, lo cual también equivale a establecer la derivada del riesgo condicional igual a cero.

Dada la naturaleza binaria de la clasificación, una selección natural para una función de pérdida (suponiendo el mismo costo para los falsos positivos y los falsos negativos ) sería la función de pérdida 0-1 ( función indicadora 0-1 ), que toma el valor de 0 si la clasificación predicha es igual a la de la clase verdadera o un 1 si la clasificación predicha no coincide con la clase verdadera. Esta selección se modela mediante

V(F(incógnita),y)=H(yF(incógnita)){\displaystyle V(f({\vec {x}}),y)=H(-yf({\vec {x}}))}

dóndeH{\displaystyle H}indica la función escalón de Heaviside . Sin embargo, esta función de pérdida no es convexa ni suave, y resolver la solución óptima es un problema de optimización combinatoria NP-difícil . [ 4 ] Como resultado, es mejor sustituir funciones de pérdida sustitutas que sean manejables para los algoritmos de aprendizaje comúnmente utilizados, ya que tienen propiedades convenientes como ser convexas y suaves. Además de su manejabilidad computacional, se puede demostrar que las soluciones al problema de aprendizaje que utilizan estas funciones de pérdida sustitutas permiten recuperar la solución real al problema de clasificación original. [ 5 ] Algunas de estas sustitutas se describen a continuación.

En la práctica, la distribución de probabilidadpag(incógnita,y){\displaystyle p({\vec {x}},y)}es desconocido. En consecuencia, utilizar un conjunto de entrenamiento denorte{\displaystyle n}puntos de muestra distribuidos de forma independiente e idéntica

S={(incógnita1,y1),,(incógnitanorte,ynorte)}{\displaystyle S=\{({\vec {x}}_{1},y_{1}),\dots ,({\vec {x}}_{n},y_{n})\}}

Al extraer datos del espacio muestral , se busca minimizar el riesgo empírico.

IS[F]=1nortei=1norteV(F(incógnitai),yi){\displaystyle I_{S}[f]={\frac {1}{n}}\sum _{i=1}^{n}V(f({\vec {x}}_{i}),y_{i})}

como un indicador del riesgo esperado. [ 3 ] (Véase la teoría del aprendizaje estadístico para una descripción más detallada).

Consistencia bayesiana

Utilizando el teorema de Bayes , se puede demostrar que el óptimoF0/1{\displaystyle f_{0/1}^{*}}, es decir, la que minimiza el riesgo esperado asociado con la pérdida cero-uno, implementa la regla de decisión óptima de Bayes para un problema de clasificación binaria y tiene la forma de

F0/1(incógnita)={1si pag(1incógnita)>pag(1incógnita)0si pag(1incógnita)=pag(1incógnita)1si pag(1incógnita)<pag(1incógnita){\displaystyle f_{0/1}^{*}({\vec {x}})\;=\;{\begin{cases}\;\;\;1&{\text{if }}p(1\mid {\vec {x}})>p(-1\mid {\vec {x}})\\\;\;\;0&{\text{if }}p(1\mid {\vec {x}})=p(-1\mid {\vec {x}})\\-1&{\text{if }}p(1\mid {\vec {x}})<p(-1\mid {\vec {x}})\end{cases}}}.

Se dice que una función de pérdida está calibrada para la clasificación o es consistente con Bayes si su valor óptimoFϕ{\displaystyle f_{\phi }^{*}}es tal queF0/1(incógnita)=sgn(Fϕ(incógnita)){\displaystyle f_{0/1}^{*}({\vec {x}})=\operatorname {sgn} (f_{\phi }^{*}({\vec {x}}))}y, por lo tanto, es óptimo bajo la regla de decisión de Bayes. Una función de pérdida consistente con Bayes nos permite encontrar la función de decisión óptima de Bayes.Fϕ{\displaystyle f_{\phi }^{*}}minimizando directamente el riesgo esperado y sin tener que modelar explícitamente las funciones de densidad de probabilidad.

Para pérdida de margen convexoϕ(υ){\displaystyle \phi (\upsilon )}, se puede demostrar queϕ(υ){\displaystyle \phi (\upsilon )}es consistente en Bayes si y solo si es diferenciable en 0 yϕ(0)<0{\displaystyle \phi '(0)<0}. [ 6 ] [ 1 ] Sin embargo, este resultado no excluye la existencia de funciones de pérdida consistentes con Bayes no convexas. Un resultado más general establece que las funciones de pérdida consistentes con Bayes se pueden generar utilizando la siguiente formulación [ 7 ]

ϕ(v)=do[F1(v)]+(1F1(v))do[F1(v)](2){\displaystyle \phi (v)=C[f^{-1}(v)]+(1-f^{-1}(v))C'[f^{-1}(v)]\;\;\;\;\;(2)},

dóndeF(η),(0η1){\displaystyle f(\eta ),(0\leq \eta \leq 1)}es cualquier función invertible tal queF1(v)=1F1(v){\displaystyle f^{-1}(-v)=1-f^{-1}(v)}ydo(η){\displaystyle C(\eta )}es cualquier función diferenciable estrictamente cóncava tal quedo(η)=do(1η){\displaystyle C(\eta )=C(1-\eta )}La Tabla I muestra las funciones de pérdida consistentes de Bayes generadas para algunas opciones de ejemplo dedo(η){\displaystyle C(\eta )}yF1(v){\displaystyle f^{-1}(v)}Nótese que las funciones de pérdida de Savage y Tangent no son convexas. Se ha demostrado que estas funciones de pérdida no convexas son útiles para tratar con valores atípicos en la clasificación. [ 7 ] [ 8 ] Para todas las funciones de pérdida generadas a partir de (2), la probabilidad posteriorpag(y=1|incógnita){\displaystyle p(y=1|{\vec {x}})}se puede encontrar utilizando la función de enlace invertible como pag(y=1|incógnita)=η=F1(v){\displaystyle p(y=1|{\vec {x}})=\eta =f^{-1}(v)}Las funciones de pérdida en las que la probabilidad posterior se puede recuperar utilizando el enlace invertible se denominan funciones de pérdida propias .

El único minimizador del riesgo esperado,Fϕ{\displaystyle f_{\phi }^{*}}, asociadas con las funciones de pérdida generadas anteriormente, se pueden encontrar directamente a partir de la ecuación (1) y se demuestra que son iguales a las correspondientesF(η){\displaystyle f(\eta )}Esto se cumple incluso para las funciones de pérdida no convexas, lo que significa que se pueden utilizar algoritmos basados ​​en el descenso de gradiente, como el aumento de gradiente, para construir el minimizador.

Funciones de pérdida adecuadas, margen de pérdida y regularización.

(Rojo) Pérdida logística estándar (γ=1,μ=2{\displaystyle \gamma =1,\mu =2}) y (Azul) margen aumentado Pérdida logística (γ=0,2{\displaystyle \gamma =0.2})

Para funciones de pérdida adecuadas, el margen de pérdida se puede definir comoμϕ=ϕ(0)ϕ(0){\displaystyle \mu _{\phi }=-{\frac {\phi '(0)}{\phi ''(0)}}}y se ha demostrado que está directamente relacionado con las propiedades de regularización del clasificador. [ 9 ] Específicamente, una función de pérdida con un margen mayor aumenta la regularización y produce mejores estimaciones de la probabilidad posterior. Por ejemplo, el margen de pérdida se puede aumentar para la pérdida logística introduciendo unγ{\displaystyle \gamma }parámetro y escribiendo la pérdida logística como1γregistro(1+miγv){\displaystyle {\frac {1}{\gamma }}\log(1+e^{-\gamma v})}donde más pequeño0<γ<1{\displaystyle 0<\gamma <1}aumenta el margen de pérdida. Se demuestra que esto es directamente equivalente a disminuir la tasa de aprendizaje en el aumento de gradiente.Fmetro(incógnita)=Fmetro1(incógnita)+γhmetro(incógnita),{\displaystyle F_{m}(x)=F_{m-1}(x)+\gamma h_{m}(x),}donde disminuyeγ{\displaystyle \gamma }mejora la regularización del clasificador potenciado. La teoría deja claro que cuando una tasa de aprendizaje deγ{\displaystyle \gamma }Se utiliza la fórmula correcta para recuperar la probabilidad posterior.η=F1(γF(incógnita)){\displaystyle \eta =f^{-1}(\gamma F(x))}.

En conclusión, al elegir una función de pérdida con un margen mayor (menorγ{\displaystyle \gamma }) aumentamos la regularización y mejoramos nuestras estimaciones de la probabilidad posterior, lo que a su vez mejora la curva ROC del clasificador final.

pérdida cuadrada

Aunque se usa más comúnmente en regresión, la función de pérdida cuadrática se puede reescribir como una función.ϕ(yF(incógnita)){\displaystyle \phi (yf({\vec {x}}))}y se utiliza para la clasificación. Se puede generar utilizando (2) y la Tabla I de la siguiente manera:

ϕ(v)=do[F1(v)]+(1F1(v))do[F1(v)]=4(12(v+1))(112(v+1))+(112(v+1))(48(12(v+1)))=(1v)2.{\displaystyle \phi (v)=C[f^{-1}(v)]+(1-f^{-1}(v))C'[f^{-1}(v)]=4({\frac {1}{2}}(v+1))(1-{\frac {1}{2}}(v+1))+(1-{\frac {1}{2}}(v+1))(4-8({\frac {1}{2}}(v+1)))=(1-v)^{2}.}

La función de pérdida cuadrática es convexa y suave. Sin embargo, la función de pérdida cuadrática tiende a penalizar excesivamente los valores atípicos, lo que conduce a tasas de convergencia más lentas (en lo que respecta a la complejidad de la muestra) que para las funciones de pérdida logística o de bisagra. [ 1 ] Además, las funciones que producen valores altos deF(incógnita){\displaystyle f({\vec {x}})}para algunosincógnitaincógnita{\displaystyle x\in X}tendrá un rendimiento deficiente con la función de pérdida cuadrada, ya que los valores altos deyF(incógnita){\displaystyle yf({\vec {x}})}será penalizado severamente, independientemente de si los signos dey{\displaystyle y}yF(incógnita){\displaystyle f({\vec {x}})}fósforo.

Una ventaja de la función de pérdida cuadrática es que su estructura facilita la validación cruzada de los parámetros de regularización. Específicamente para la regularización de Tikhonov , se puede calcular el parámetro de regularización mediante validación cruzada de exclusión de un elemento en el mismo tiempo que se tardaría en resolver un solo problema. [ 10 ]

El minimizador deI[F]{\displaystyle I[f]}para la función de pérdida cuadrática se puede encontrar directamente de la ecuación (1) como

FCuadrado=2η1=2pag(1incógnita)1.{\displaystyle f_{\text{Square}}^{*}=2\eta -1=2p(1\mid x)-1.}

Pérdida logística

La función de pérdida logística se puede generar utilizando (2) y la Tabla I de la siguiente manera:

ϕ(v)=do[F1(v)]+(1F1(v))do[F1(v)]=1registro(2)[miv1+mivregistromiv1+miv(1miv1+miv)registro(1miv1+miv)]+(1miv1+miv)[1registro(2)registro(miv1+miv1miv1+miv)]=1registro(2)registro(1+miv).{\displaystyle {\begin{aligned}\phi (v)&=C[f^{-1}(v)]+\left(1-f^{-1}(v)\right)\,C'\left[f^{-1}(v)\right]\\&={\frac {1}{\log(2)}}\left[{\frac {-e^{v}}{1+e^{v}}}\log {\frac {e^{v}}{1+e^{v}}}-\left(1-{\frac {e^{v}}{1+e^{v}}}\right)\log \left(1-{\frac {e^{v}}{1+e^{v}}}\right)\right]+\left(1-{\frac {e^{v}}{1+e^{v}}}\right)\left[{\frac {-1}{\log(2)}}\log \left({\frac {\frac {e^{v}}{1+e^{v}}}{1-{\frac {e^{v}}{1+e^{v}}}}}\right)\right]\\&={\frac {1}{\log(2)}}\log(1+e^{-v}).\end{aligned}}}

La función de pérdida logística es convexa y crece linealmente para valores negativos, lo que la hace menos sensible a los valores atípicos. Esta función se utiliza en el algoritmo LogitBoost .

El minimizador deI[F]{\displaystyle I[f]}La función de pérdida logística se puede obtener directamente de la ecuación (1) como

FLogístico=registro(η1η)=registro(pag(1incógnita)1pag(1incógnita)).{\displaystyle f_{\text{Logistic}}^{*}=\log \left({\frac {\eta }{1-\eta }}\right)=\log \left({\frac {p(1\mid x)}{1-p(1\mid x)}}\right).}

Esta función no está definida cuandopag(1incógnita)=1{\displaystyle p(1\mid x)=1}o pag(1incógnita)=0{\displaystyle p(1\mid x)=0}(tendiendo hacia ∞ y −∞ respectivamente), pero predice una curva suave que crece cuandopag(1incógnita){\displaystyle p(1\mid x)}aumenta y es igual a 0 cuandopag(1incógnita)=0,5{\displaystyle p(1\mid x)=0.5}. [ 3 ]

Es fácil comprobar que la pérdida logística y la pérdida de entropía cruzada binaria (pérdida logarítmica) son de hecho iguales (salvo una constante multiplicativa).1registro(2){\displaystyle {\frac {1}{\log(2)}}}La pérdida de entropía cruzada está estrechamente relacionada con la divergencia de Kullback-Leibler entre la distribución empírica y la distribución predicha. La pérdida de entropía cruzada es omnipresente en las redes neuronales profundas modernas .

Pérdida exponencial

La función de pérdida exponencial se puede generar utilizando (2) y la Tabla-I de la siguiente manera.

ϕ(v)=do[F1(v)]+(1F1(v))do[F1(v)]=2(mi2v1+mi2v)(1mi2v1+mi2v)+(1mi2v1+mi2v)(12mi2v1+mi2vmi2v1+mi2v(1mi2v1+mi2v))=miv{\displaystyle \phi (v)=C[f^{-1}(v)]+(1-f^{-1}(v))C'[f^{-1}(v)]=2{\sqrt {\left({\frac {e^{2v}}{1+e^{2v}}}\right)\left(1-{\frac {e^{2v}}{1+e^{2v}}}\right)}}+\left(1-{\frac {e^{2v}}{1+e^{2v}}}\right)\left({\frac {1-{\frac {2e^{2v}}{1+e^{2v}}}}{\sqrt {{\frac {e^{2v}}{1+e^{2v}}}(1-{\frac {e^{2v}}{1+e^{2v}}})}}}\right)=e^{-v}}

La pérdida exponencial es convexa y crece exponencialmente para valores negativos, lo que la hace más sensible a los valores atípicos. La pérdida exponencial ponderada de 0 a 1 se utiliza en el algoritmo AdaBoost, lo que da lugar implícitamente a la pérdida exponencial.

El minimizador deI[F]{\displaystyle I[f]}La función de pérdida exponencial se puede encontrar directamente a partir de la ecuación (1) como

FExp=12registro(η1η)=12registro(pag(1incógnita)1pag(1incógnita)).{\displaystyle f_{\text{Exp}}^{*}={\frac {1}{2}}\log \left({\frac {\eta }{1-\eta }}\right)={\frac {1}{2}}\log \left({\frac {p(1\mid x)}{1-p(1\mid x)}}\right).}

Pérdida brutal

La pérdida de Savage [ 7 ] se puede generar utilizando (2) y la Tabla-I de la siguiente manera:

ϕ(v)=do[F1(v)]+(1F1(v))do[F1(v)]=(miv1+miv)(1miv1+miv)+(1miv1+miv)(12miv1+miv)=1(1+miv)2.{\displaystyle \phi (v)=C[f^{-1}(v)]+(1-f^{-1}(v))C'[f^{-1}(v)]=\left({\frac {e^{v}}{1+e^{v}}}\right)\left(1-{\frac {e^{v}}{1+e^{v}}}\right)+\left(1-{\frac {e^{v}}{1+e^{v}}}\right)\left(1-{\frac {2e^{v}}{1+e^{v}}}\right)={\frac {1}{(1+e^{v})^{2}}}.}

La función de pérdida de Savage es cuasi-convexa y está acotada para valores negativos grandes, lo que la hace menos sensible a los valores atípicos. Esta función se ha utilizado en el algoritmo de potenciación de gradiente y en el algoritmo SavageBoost.

El minimizador deI[F]{\displaystyle I[f]}La función de pérdida de Savage se puede encontrar directamente a partir de la ecuación (1) como

FSalvaje=registro(η1η)=registro(pag(1incógnita)1pag(1incógnita)).{\displaystyle f_{\text{Savage}}^{*}=\log \left({\frac {\eta }{1-\eta }}\right)=\log \left({\frac {p(1\mid x)}{1-p(1\mid x)}}\right).}

pérdida tangente

La pérdida tangente [ 11 ] se puede generar utilizando (2) y la Tabla-I de la siguiente manera:

ϕ(v)=do[F1(v)]+(1F1(v))do[F1(v)]=4(arctan(v)+12)(1(arctan(v)+12))+(1(arctan(v)+12))(48(arctan(v)+12))=(2arctan(v)1)2.{\displaystyle {\begin{aligned}\phi (v)&=C[f^{-1}(v)]+\left(1-f^{-1}(v)\right)C'[f^{-1}(v)]\\&=4\left(\arctan(v)+{\frac {1}{2}}\right)\left(1-\left(\arctan(v)+{\frac {1}{2}}\right)\right)+\left(1-\left(\arctan(v)+{\frac {1}{2}}\right)\right)\left(4-8\left(\arctan(v)+{\frac {1}{2}}\right)\right)\\&=\left(2\arctan(v)-1\right)^{2}.\end{aligned}}}

La función de pérdida Tangent es cuasi-convexa y está acotada para valores negativos grandes, lo que la hace menos sensible a los valores atípicos. Curiosamente, la función de pérdida Tangent también asigna una penalización acotada a los puntos de datos que se han clasificado "demasiado correctamente". Esto puede ayudar a prevenir el sobreentrenamiento en el conjunto de datos. La función de pérdida Tangent se ha utilizado en el potenciador de gradiente , el algoritmo TangentBoost y los bosques de decisión alternados. [ 12 ]

El minimizador deI[F]{\displaystyle I[f]}La función de pérdida tangente se puede encontrar directamente a partir de la ecuación (1) como

FTangente=broncearse(η12)=broncearse(pag(1incógnita)12).{\displaystyle f_{\text{Tangent}}^{*}=\tan \left(\eta -{\frac {1}{2}}\right)=\tan \left(p\left(1\mid x\right)-{\frac {1}{2}}\right).}

pérdida de bisagra

La función de pérdida de bisagra se define conϕ(υ)=máximo(0,1υ)=[1υ]+{\displaystyle \phi (\upsilon )=\max(0,1-\upsilon )=[1-\upsilon ]_{+}}, dónde[a]+=máximo(0,a){\displaystyle [a]_{+}=\max(0,a)}es la función de la parte positiva .

V(F(incógnita),y)=máximo(0,1yF(incógnita))=[1yF(incógnita)]+.{\displaystyle V(f({\vec {x}}),y)=\max(0,1-yf({\vec {x}}))=[1-yf({\vec {x}})]_{+}.}

La función de pérdida de bisagra proporciona una cota superior convexa relativamente ajustada para la función indicadora 0-1 . Específicamente, la función de pérdida de bisagra es igual a la función indicadora 0-1 cuandosgn(F(incógnita))=y{\displaystyle \operatorname {sgn} (f({\vec {x}}))=y}y|yF(incógnita)|1{\displaystyle |yf({\vec {x}})|\geq 1}Además, la minimización del riesgo empírico de esta pérdida es equivalente a la formulación clásica para máquinas de vectores de soporte (SVM). Los puntos clasificados correctamente que se encuentran fuera de los límites de los vectores de soporte no se penalizan, mientras que los puntos dentro de los límites o en el lado incorrecto del hiperplano se penalizan de forma lineal en comparación con su distancia al límite correcto. [ 4 ]

Si bien la función de pérdida de bisagra es convexa y continua, no es suave (no es diferenciable) enyF(incógnita)=1{\displaystyle yf({\vec {x}})=1}En consecuencia, la función de pérdida de bisagra no se puede utilizar con métodos de descenso de gradiente o métodos de descenso de gradiente estocástico que dependen de la diferenciabilidad en todo el dominio. Sin embargo, la pérdida de bisagra sí tiene un subgradiente enyF(incógnita)=1{\displaystyle yf({\vec {x}})=1}, lo que permite la utilización de métodos de descenso de subgradiente . [ 4 ] Las SVM que utilizan la función de pérdida de bisagra también se pueden resolver utilizando programación cuadrática .

El minimizador deI[F]{\displaystyle I[f]}para la función de pérdida de bisagra es

FBisagra(incógnita)={1si pag(1incógnita)>pag(1incógnita)1si pag(1incógnita)<pag(1incógnita){\displaystyle f_{\text{Hinge}}^{*}({\vec {x}})\;=\;{\begin{cases}1&{\text{if }}p(1\mid {\vec {x}})>p(-1\mid {\vec {x}})\\-1&{\text{if }}p(1\mid {\vec {x}})<p(-1\mid {\vec {x}})\end{cases}}}

cuandopag(1incógnita)0,5{\displaystyle p(1\mid x)\neq 0.5}, que coincide con la de la función indicadora 0-1. Esta conclusión hace que la pérdida de bisagra sea bastante atractiva, ya que se pueden establecer límites a la diferencia entre el riesgo esperado y el signo de la función de pérdida de bisagra. [ 1 ] La pérdida de bisagra no se puede derivar de (2) ya queFBisagra{\displaystyle f_{\text{Hinge}}^{*}} no es invertible.

Pérdida generalizada de bisagra suave

La función de pérdida de bisagra suave generalizada con parámetroα{\displaystyle \alpha }se define como

Fα(z)={αα+1zsi z01α+1zα+1z+αα+1si 0<z<10si z1,{\displaystyle f_{\alpha }^{*}(z)\;=\;{\begin{cases}{\frac {\alpha }{\alpha +1}}-z&{\text{if }}z\leq 0\\{\frac {1}{\alpha +1}}z^{\alpha +1}-z+{\frac {\alpha }{\alpha +1}}&{\text{if }}0<z<1\\0&{\text{if }}z\geq 1\end{cases}},}

dónde

z=yF(incógnita).{\displaystyle z=yf({\vec {x}}).}

Es monótonamente decreciente y llega a 0 cuandoz=1{\displaystyle z=1}.

Véase también

Referencias

  1. 1 2 3 4 Rosasco, L.; De Vito, ED; Caponnetto, A.; Piana, M.; Verri, A. (2004). "¿Son todas las funciones de pérdida iguales?" (PDF) . Computación neuronal . 16 (5): 1063–1076 . CiteSeerX 10.1.1.109.6786 . doi : 10.1162/089976604773135104 . PMID 15070510 . S2CID 11845688 .   
  2. Shen, Yi (2005), Funciones de pérdida para clasificación binaria y estimación de probabilidad de clase (PDF) , Universidad de Pensilvania , consultado el 6 de diciembre de 2014.
  3. 1 2 3 Rosasco, Lorenzo; Poggio, Tomaso (2014), Un recorrido por la regularización del aprendizaje automático , Notas de clase MIT-9.520, vol. Manuscrito 
  4. 1 2 3 Piyush, Rai (13 de septiembre de 2011), Máquinas de vectores de soporte (continuación), funciones de pérdida de clasificación y regularizadores (PDF) , Utah CS5350/6350: Aprendizaje automático , consultado el 4 de mayo de 2021
  5. Ramanan, Deva (27 de febrero de 2008), Lección 14 (PDF) , UCI ICS273A: Aprendizaje automático , consultado el 6 de diciembre de 2014{{citation}}: CS1 mantenimiento: ubicación del editor ( enlace )
  6. Bartlett, Peter L.; Jordan, Michael I.; Mcauliffe, Jon D. (2006). "Convexidad, clasificación y límites de riesgo". Journal of the American Statistical Association . 101 (473): 138– 156. doi : 10.1198/016214505000000907 . ISSN 0162-1459 . JSTOR 30047445 . S2CID 2833811 .   
  7. 1 2 3 Masnadi-Shirazi, Hamed; Vasconcelos, Nuno (2008). "Sobre el diseño de funciones de pérdida para la clasificación: teoría, robustez ante valores atípicos y SavageBoost" (PDF) . Actas de la 21.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal . NIPS'08. EE. UU.: Curran Associates Inc.: 1049–1056 . ISBN 9781605609492.
  8. Leistner, C.; Saffari, A.; Roth, PM; Bischof, H. (septiembre de 2009). "Sobre la robustez del boosting en línea: un estudio comparativo". 2009 IEEE 12th International Conference on Computer Vision Workshops, ICCV Workshops . pp. 1362–1369 . doi : 10.1109/ICCVW.2009.5457451 . ISBN  978-1-4244-4442-7. S2CID 6032045 . 
  9. Vasconcelos, Nuno; Masnadi-Shirazi, Hamed (2015). "Una perspectiva de las pérdidas de margen como regularizadores de estimaciones de probabilidad" . Journal of Machine Learning Research . 16 (85): 2751– 2795. ISSN 1533-7928 . 
  10. Rifkin, Ryan M.; Lippert, Ross A. (1 de mayo de 2007), Notas sobre mínimos cuadrados regularizados (PDF) , Laboratorio de Ciencias de la Computación e Inteligencia Artificial del MIT
  11. Masnadi-Shirazi, H.; Mahadevan, V.; Vasconcelos, N. (junio de 2010). "Sobre el diseño de clasificadores robustos para visión por computadora". Conferencia de la Sociedad de Computación IEEE de 2010 sobre Visión por Computadora y Reconocimiento de Patrones . págs. 779–786 . CiteSeerX 10.1.1.172.6416 . doi : 10.1109/CVPR.2010.5540136 . ISBN   978-1-4244-6984-0. S2CID 632758 . 
  12. Schulter, S.; Wohlhart, P.; Leistner, C.; Saffari, A.; Roth, PM; Bischof, H. (junio de 2013). «Alternating Decision Forests». 2013 IEEE Conference on Computer Vision and Pattern Recognition . pp. 508–515 . CiteSeerX 10.1.1.301.1305 . doi : 10.1109/CVPR.2013.72 . ISBN   978-0-7695-4989-7. S2CID 6557162 .