
En matemáticas y aprendizaje automático , la función softplus es
Es una aproximación suave (de hecho, una función analítica ) a la función rampa , que se conoce como rectificador o ReLU (unidad lineal rectificada) en aprendizaje automático. Para valores negativos grandeses, así que justo por encima de 0, mientras que para valores positivos grandeses, así que justo encima.
Los nombres softplus [ 1 ] [ 2 ] y SmoothReLU [ 3 ] se utilizan en el aprendizaje automático. El nombre "softplus" (2000), por analogía con el softmax anterior (1989), se debe presumiblemente a que es una aproximación suave ( soft ) de la parte positiva de x , que a veces se denota con un superíndice plus ,.
Formas alternativas
Esta función se puede aproximar como:
Al realizar el cambio de variables, esto es equivalente a
Un parámetro de nitidezPuede incluirse:
Además, la función softplus es equivalente al logaritmo de la función sigmoide de la siguiente manera:
Funciones relacionadas
La derivada de softplus es la función logística estándar :
La función logística o la función sigmoide es una aproximación suave del rectificador, la función escalón de Heaviside .
LogSumExp
La generalización multivariable de softplus de una sola variable es LogSumExp con el primer argumento establecido en cero:
La función LogSumExp es
y su gradiente es la función softmax ; la función softmax con el primer argumento igual a cero es la generalización multivariable de la función logística. Tanto LogSumExp como softmax se utilizan en el aprendizaje automático.
conjugado convexo
La función convexa conjugada (específicamente, la transformación de Legendre ) de la función softplus es la función de entropía binaria negativa (con base e ). Esto se debe a que (siguiendo la definición de la transformación de Legendre: las derivadas son funciones inversas) la derivada de softplus es la función logística, cuya función inversa es el logit , que es la derivada de la entropía binaria negativa.
Softplus puede interpretarse como pérdida logística (un número positivo), por lo que, por dualidad , minimizar la pérdida logística equivale a maximizar la entropía. Esto justifica el principio de máxima entropía como minimización de pérdidas.
Referencias
- ↑ Dugas, Charles; Bengio, Yoshua; Bélisle, François; Nadeau, Claude; Garcia, René (2000). "Incorporating second-order functional knowledge for better option pricing" (PDF) . Actas de la 13.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal (NIPS'00) . MIT Press: 451–457 .
Dado que la sigmoide h tiene una primera derivada positiva, su primitiva, que llamamos softplus, es convexa.
- ↑ Glorot, Xavier; Bordes, Antoine; Bengio, Yoshua (14 de junio de 2011). "Redes neuronales rectificadoras dispersas profundas" . Actas de la Decimocuarta Conferencia Internacional sobre Inteligencia Artificial y Estadística . Actas de talleres y conferencias de JMLR: 315–323 .
Funciones de activación rectificadoras y softplus. La segunda es una versión suavizada de la primera.
- ↑ "Capa directa de la unidad lineal rectificadora suave (SmoothReLU)" . Guía del desarrollador para la biblioteca de aceleración de análisis de datos de Intel . 2017. Consultado el 4 de diciembre de 2018 .
{{cite web}}: CS1 mantenimiento: estado de la URL ( enlace )
- Redes neuronales artificiales
- Neurociencia computacional
- Entropía e información
- exponenciales
- Funciones y asignaciones
- Regresión logística
- Funciones de pérdida