Articulo de referencia

Softplus

Gráfico de la función softplus y la función rampa. En matemáticas y aprendizaje automático , la función softplus es F ( incógnita ) = ln ⁡ ( 1 + mi incógnita ) . {\displaystyle ...

Gráfico de la función softplus y la función rampa.

En matemáticas y aprendizaje automático , la función softplus es

F(incógnita)=ln(1+miincógnita).{\displaystyle f(x)=\ln(1+e^{x}).}

Es una aproximación suave (de hecho, una función analítica ) a la función rampa , que se conoce como rectificador o ReLU (unidad lineal rectificada) en aprendizaje automático. Para valores negativos grandesincógnita{\displaystyle x}esln(1+miincógnita)=ln(1+ϵ)ln1=0{\displaystyle \ln(1+e^{x})=\ln(1+\epsilon )\gtrapprox \ln 1=0}, así que justo por encima de 0, mientras que para valores positivos grandesincógnita{\displaystyle x}esln(1+miincógnita)ln(miincógnita)=incógnita{\displaystyle \ln(1+e^{x})\gtrapprox \ln(e^{x})=x}, así que justo encimaincógnita{\displaystyle x}.

Los nombres softplus [ 1 ] [ 2 ] y SmoothReLU [ 3 ] se utilizan en el aprendizaje automático. El nombre "softplus" (2000), por analogía con el softmax anterior (1989), se debe presumiblemente a que es una aproximación suave ( soft ) de la parte positiva de x , que a veces se denota con un superíndice plus ,incógnita+:=máximo(0,incógnita){\displaystyle x^{+}:=\max(0,x)}.

Formas alternativas

Esta función se puede aproximar como:

ln(1+miincógnita){ln2,incógnita=0,incógnita1miincógnita/ln2,incógnita0{\displaystyle \ln \left(1+e^{x}\right)\approx {\begin{cases}\ln 2,&x=0,\\[6pt]{\frac {x}{1-e^{-x/\ln 2}}},&x\neq 0\end{cases}}}

Al realizar el cambio de variablesincógnita=yln(2){\displaystyle x=y\ln(2)}, esto es equivalente a

registro2(1+2y){1,y=0,y1miy,y0.{\displaystyle \log _{2}(1+2^{y})\approx {\begin{cases}1,&y=0,\\[6pt]{\frac {y}{1-e^{-y}}},&y\neq 0.\end{cases}}}

Un parámetro de nitidezk{\displaystyle k}Puede incluirse:

F(incógnita)=ln(1+mikincógnita)k,F(incógnita)=mikincógnita1+mikincógnita=11+mikincógnita.{\displaystyle f(x)={\frac {\ln(1+e^{kx})}{k}},\qquad \qquad f'(x)={\frac {e^{kx}}{1+e^{kx}}}={\frac {1}{1+e^{-kx}}}.}

Además, la función softplus es equivalente al logaritmo de la función sigmoide de la siguiente manera:

ln(sigmoideo(incógnita))=ln(11+miincógnita)=ln(1+miincógnita)=softplus(incógnita){\displaystyle -\ln({\text{sigmoide}}(-x))=-\ln \left({\frac {1}{1+e^{x}}}\right)=\ln \left(1+e^{x}\right)={\text{súperplus}}(x)}

La derivada de softplus es la función logística estándar :

F(incógnita)=miincógnita1+miincógnita=11+miincógnita{\displaystyle f'(x)={\frac {e^{x}}{1+e^{x}}}={\frac {1}{1+e^{-x}}}}

La función logística o la función sigmoide es una aproximación suave del rectificador, la función escalón de Heaviside .

LogSumExp

La generalización multivariable de softplus de una sola variable es LogSumExp con el primer argumento establecido en cero:

LSmi0+(incógnita1,,incógnitanorte):=LSE(0,incógnita1,,incógnitanorte)=ln(1+miincógnita1++miincógnitanorte).{\displaystyle \operatorname {LSE_{0}} ^{+}(x_{1},\dots ,x_{n}):=\operatorname {LSE} (0,x_{1},\dots ,x_{n})=\ln(1+e^{x_{1}}+\cdots +e^{x_{n}}).}

La función LogSumExp es

LSE(incógnita1,,incógnitanorte)=ln(miincógnita1++miincógnitanorte),{\displaystyle \operatorname {LSE} (x_{1},\dots ,x_{n})=\ln(e^{x_{1}}+\cdots +e^{x_{n}}),}

y su gradiente es la función softmax ; la función softmax con el primer argumento igual a cero es la generalización multivariable de la función logística. Tanto LogSumExp como softmax se utilizan en el aprendizaje automático.

conjugado convexo

La función convexa conjugada (específicamente, la transformación de Legendre ) de la función softplus es la función de entropía binaria negativa (con base e ). Esto se debe a que (siguiendo la definición de la transformación de Legendre: las derivadas son funciones inversas) la derivada de softplus es la función logística, cuya función inversa es el logit , que es la derivada de la entropía binaria negativa.

Softplus puede interpretarse como pérdida logística (un número positivo), por lo que, por dualidad , minimizar la pérdida logística equivale a maximizar la entropía. Esto justifica el principio de máxima entropía como minimización de pérdidas.

Referencias

  1. Dugas, Charles; Bengio, Yoshua; Bélisle, François; Nadeau, Claude; Garcia, René (2000). "Incorporating second-order functional knowledge for better option pricing" (PDF) . Actas de la 13.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal (NIPS'00) . MIT Press: 451–457 . Dado que la sigmoide h tiene una primera derivada positiva, su primitiva, que llamamos softplus, es convexa.
  2. Glorot, Xavier; Bordes, Antoine; Bengio, Yoshua (14 de junio de 2011). "Redes neuronales rectificadoras dispersas profundas" . Actas de la Decimocuarta Conferencia Internacional sobre Inteligencia Artificial y Estadística . Actas de talleres y conferencias de JMLR: 315–323 . Funciones de activación rectificadoras y softplus. La segunda es una versión suavizada de la primera.
  3. "Capa directa de la unidad lineal rectificadora suave (SmoothReLU)" . Guía del desarrollador para la biblioteca de aceleración de análisis de datos de Intel . 2017. Consultado el 4 de diciembre de 2018 .{{cite web}}: CS1 mantenimiento: estado de la URL ( enlace )