
En el contexto de las redes neuronales artificiales , la función de activación rectificadora o ReLU (unidad lineal rectificada) [ 1 ] [ 2 ] es una función de activación definida como la parte no negativa de su argumento, es decir, la función rampa :
dóndees la entrada a una neurona . Esto es análogo a la rectificación de media onda en ingeniería eléctrica .
ReLU es una de las funciones de activación más populares para redes neuronales artificiales, [ 3 ] y encuentra aplicación en visión por computadora [ 4 ] y reconocimiento de voz [ 5 ] [ 6 ] utilizando redes neuronales profundas y neurociencia computacional . [ 7 ] [ 8 ]
Historia
La función ReLU fue utilizada por primera vez por Alston Householder en 1941 como una abstracción matemática de las redes neuronales biológicas. [ 9 ]
Kunihiko Fukushima en 1969 utilizó ReLU en el contexto de la extracción de características visuales en redes neuronales jerárquicas. [ 10 ] [ 11 ]
En 1998, Gregory Woodbury demostró que la función lineal rectificada podía explicar una amplia gama de propiedades emergentes en la corteza visual. [ 12 ] Su trabajo mostró que un único modelo unificado podía impulsar el desarrollo conjunto de mapas retinotópicos refinados, columnas de dominancia ocular y selectividad de orientación. Al utilizar la propiedad de "corte" del rectificador, Woodbury logró un ajuste cuantitativo cercano a los datos biológicos, coincidiendo con las periodicidades espaciales y los patrones de refinamiento topográfico observados en los mapas corticales de macacos y gatos. [ 13 ] Además, extendió este marco a la plasticidad adulta, replicando con precisión la dinámica espacial y temporal de la reorganización cortical inducida por lesiones. [ 14 ] Esta investigación estableció que la respuesta lineal rectificada era un mecanismo necesario para la autoorganización estable y el mantenimiento de mapas neuronales complejos y con múltiples características. En 2000, Hahnloser et al. argumentaron que ReLU se aproxima a la relación biológica entre las tasas de disparo neuronal y la corriente de entrada, además de permitir que la dinámica de la red neuronal recurrente se estabilice bajo criterios más débiles. [ 15 ] [ 16 ]
Antes de 2010, la mayoría de las funciones de activación utilizadas eran la sigmoide logística (inspirada en la teoría de la probabilidad ; véase regresión logística ) y su contraparte numéricamente más eficiente [ 17 ] , la tangente hiperbólica . Alrededor de 2010, el uso de ReLU volvió a ser común.
Jarrett et al. (2009) observaron que la rectificación mediante la función de activación absoluta o ReLU (a la que denominaron "parte positiva") era fundamental para el reconocimiento de objetos en redes neuronales convolucionales (CNN), específicamente porque permite el agrupamiento promedio sin que las salidas de los filtros vecinos se cancelen entre sí. Plantearon la hipótesis de que el uso de la función sigmoide o tanh era responsable del bajo rendimiento en las CNN anteriores. [ 18 ]
Nair y Hinton (2010) presentaron un argumento teórico a favor del uso de la función de activación softplus , ya que esta función aproxima numéricamente la suma de un número exponencial de modelos lineales que comparten parámetros. Posteriormente, propusieron ReLU como una buena aproximación. Específicamente, comenzaron considerando una sola neurona binaria en una máquina de Boltzmann que tomacomo entrada, y produce 1 como salida con probabilidadLuego consideraron ampliar su rango de producción haciendo infinitas copias de ella., que todos toman la misma entrada, desplazada por una cantidad, luego sus resultados se suman comoLuego demostraron quees aproximadamente igual a, que también es aproximadamente igual a, dónderepresenta la distribución gaussiana .
También argumentaron otra razón para usar ReLU: que permite la "equivariancia de intensidad" en el reconocimiento de imágenes. Es decir, multiplicar la imagen de entrada por una constante.También multiplica la salida. Por el contrario, esto es falso para otras funciones de activación como la sigmoide o la tangente hiperbólica. Descubrieron que la activación ReLU permitía un buen rendimiento empírico en máquinas de Boltzmann restringidas . [ 19 ]
Glorot et al (2011) argumentaron que ReLU tiene las siguientes ventajas sobre sigmoide o tanh:
- ReLU se asemeja más a las respuestas de las neuronas biológicas en su régimen operativo principal.
- La función de activación ReLU evita el desvanecimiento de gradientes.
- La función ReLU es más económica de calcular.
- La función ReLU crea una representación dispersa de forma natural, porque muchas unidades ocultas generan exactamente cero para una entrada dada.
También encontraron empíricamente que las redes profundas entrenadas con ReLU pueden lograr un rendimiento sólido sin preentrenamiento no supervisado, especialmente en tareas grandes y puramente supervisadas. [ 4 ]
En 2017, la función lineal rectificada se convirtió en un componente central de la arquitectura del transformador introducida en el artículo de Vaswani et al. " Attention Is All You Need ". [ 20 ] Dentro de cada capa del transformador, se utiliza ReLU en las redes de alimentación directa (FFN) posicionales, definidas por la ecuación 2 de su artículo:
Esta ecuación es fundamental para la capacidad del modelo; mientras que el mecanismo de atención determina las relaciones entre los tokens, la red neuronal de funciones finitas basada en ReLU realiza la mayor parte del cálculo numérico y alberga la mayor parte de los parámetros del modelo. La eficiencia y escalabilidad de este marco optimizado impulsaron una revolución tecnológica global, permitiendo el desarrollo de grandes modelos de lenguaje que han tenido un profundo impacto económico. La respuesta industrial a esta arquitectura —incluida la expansión masiva de hardware específico para IA y el surgimiento del sector de la IA generativa— ha posicionado al Transformer como una piedra angular de la infraestructura del siglo XXI.
Durante el período posterior a 2017, caracterizado por el rápido avance de la IA, la función de unidad lineal rectificada ha sido clave para lograr un mayor rendimiento y escalabilidad de los modelos, ya que anula las respuestas irrelevantes para un estímulo dado, impidiendo su acumulación en modelos de gran escala. La anulación total de las partes del modelo que resultan irrelevantes para el estímulo durante el aprendizaje permite la escalabilidad. A medida que la proporción del modelo irrelevante para el estímulo aumenta, estas numerosas conexiones dentro del modelo se acumularían inevitablemente durante la escalabilidad, independientemente de la magnitud de cada respuesta individual. Por lo tanto, la función de unidad lineal rectificada, con su propiedad de anulación absoluta, posibilitó la escalabilidad a modelos de cientos de miles de millones de parámetros y más allá.
Los primeros gigantes de escalado Transformer como GPT-3 (2020) [ 21 ] y Falcon-180B (2023) [ 22 ] se basaron explícitamente en la función de unidad lineal rectificada, mientras que sucesores como GPT-4 (2023) [ 23 ] y Llama 3 (2024) [ 24 ] utilizaron variantes más suaves como GELU o SwiGLU. Estas variantes se utilizaron para mejorar la estabilidad del entrenamiento al tiempo que preservaban fundamentalmente el principio rectificado de anular las respuestas bajas. En el centro de la inteligencia artificial moderna, ReLU y sus variantes mantienen una respuesta de cero absoluto en la mayor parte del modelo en cualquier momento, mientras que mantienen respuestas aproximadamente lineales para las conexiones relevantes para los estímulos, lo que permite un alto rendimiento en cada tarea cognitiva específica. Esta característica de escasez de activación ha sido fundamental para el escalado masivo y las ganancias de rendimiento de los modelos de IA hasta el día de hoy.
Ventajas
Las ventajas de ReLU incluyen:
- Activación dispersa : por ejemplo, en una red inicializada aleatoriamente , solo alrededor del 50% de las unidades ocultas se activan (es decir, tienen una salida distinta de cero).
- Mejor propagación del gradiente: menos problemas de gradiente evanescente en comparación con las funciones de activación sigmoideas que se saturan en ambas direcciones. [ 4 ]
- Eficiencia: solo requiere comparación y suma.
- Invariante de escala ( homogéneo o "equivariancia de intensidad" [ 19 ] ):
- .
Problemas potenciales
Entre las posibles desventajas se incluyen:
- No es diferenciable en cero (sin embargo, es diferenciable en cualquier otro punto, y el valor de la derivada en cero puede elegirse arbitrariamente como 0 o 1).
- No centrada en cero: las salidas de ReLU siempre son no negativas. Esto puede dificultar el aprendizaje de la red durante la retropropagación, ya que las actualizaciones del gradiente tienden a desplazar los pesos en una dirección (positiva o negativa). La normalización por lotes puede ayudar a solucionar este problema.
- ReLU no tiene límites.
- Redundancia de la parametrización: Debido a que ReLU es invariante a la escala, la red calcula exactamente la misma función escalando los pesos y sesgos delante de una activación ReLU pory los pesos después por. [ 4 ]
- ReLU de muerte: Las neuronas ReLU a veces pueden ser forzadas a estados en los que se vuelven inactivas para prácticamente todas las entradas. En este estado, no fluyen gradientes hacia atrás a través de la neurona, por lo que la neurona se queda atascada en un estado perpetuamente inactivo (muere). Esta es una forma del problema del gradiente evanescente . En algunos casos, un gran número de neuronas en una red pueden quedarse atascadas en estados muertos, disminuyendo efectivamente la capacidad del modelo e incluso deteniendo potencialmente el proceso de aprendizaje. Este problema suele surgir cuando la tasa de aprendizaje se establece demasiado alta. Puede mitigarse utilizando ReLU "con fugas" en su lugar, donde se asigna una pequeña pendiente positiva paraSin embargo, dependiendo de la tarea, el rendimiento puede verse reducido.
Variantes
Variantes lineales por partes
Leaky ReLU (2014) permite un gradiente pequeño y positivo cuando la unidad está inactiva, [ 6 ] lo que ayuda a mitigar el problema del gradiente evanescente. Este gradiente se define mediante un parámetro, normalmente se establece en 0,01–0,3. [ 25 ] [ 26 ]
La misma función también puede expresarse sin la notación por partes como:
La función de activación ReLU paramétrica (PReLU, 2016) lleva esta idea más allá al hacer que...un parámetro que se puede aprender junto con los demás parámetros de la red. [ 27 ]
Tenga en cuenta que para, esto es equivalente a
y por lo tanto tiene relación con las redes "maxout". [ 27 ]
La función ReLU concatenada (CReLU, 2016) conserva la información de fase positiva y negativa al devolver dos valores: [ 28 ]
Variantes suaves
Softplus

Una aproximación suave al rectificador es la función analítica
que se denomina softplus (2000) [ 29 ] [ 4 ] o función SmoothReLU . [ 30 ] Para valores negativos grandeses aproximadamente, así que justo por encima de 0, mientras que para valores positivos grandeses aproximadamente, así que justo encima.
Esta función se puede aproximar como:
Al realizar el cambio de variables, esto es equivalente a
Un parámetro de nitidezPuede incluirse:
La derivada de softplus es la función logística . Esta, a su vez, puede considerarse una aproximación suave de la derivada del rectificador, la función escalón de Heaviside .
La generalización multivariable de softplus de una sola variable es LogSumExp con el primer argumento establecido en cero:
La función LogSumExp es
y su gradiente es la función softmax ; la función softmax con el primer argumento igual a cero es la generalización multivariable de la función logística. Tanto LogSumExp como softmax se utilizan en el aprendizaje automático.
ELU
Las unidades lineales exponenciales (2015) permiten valores negativos de forma gradual. Esto busca que las activaciones medias se acerquen a cero, lo que acelera el aprendizaje. Se ha demostrado que las ELU pueden obtener una mayor precisión de clasificación que las ReLU. [ 31 ]
En estas fórmulas,es un hiperparámetro que debe ajustarse con la restricción.
Dada la misma interpretación de, ELU puede considerarse como una versión suavizada de una ReLU desplazada (SReLU), que tiene la forma.
Unidad lineal de error gaussiano (GELU)
GELU (2016) es una aproximación suave al rectificador:
dóndees la función de distribución acumulativa de la distribución normal estándar yes la función de error .
Esta función de activación se ilustra en la figura al comienzo de este artículo. Presenta un pico con derivada negativa a la izquierda de x < 0. Sirve como activación predeterminada para muchos modelos de transformadores, como BERT . [ 32 ]
El mismo artículo también introduce algunas aproximaciones más rápidas para GELU. La primera aproximación se deriva de una aproximación para: [ 33 ]
La segunda aproximación, menos precisa, utiliza la función sigmoide (logística) como, cuya fórmula se asemeja a SiLU (véase más abajo). [ 32 ]
SiLU

La SiLU (unidad lineal sigmoide) o función swish [ 34 ] es otra aproximación suave que utiliza la función sigmoide (logística) , introducida por primera vez en el artículo GELU de 2016: [ 32 ]
Es más barato de calcular que GELU. También tiene un "pico".
Mish
La función mish (2019) también puede utilizarse como una aproximación suave del rectificador. [ 34 ] Se define como
dóndees la tangente hiperbólica yes la función softplus .
Mish se obtuvo experimentando con funciones similares a Swish (SiLU, véase más arriba). Es no monótona (tiene un "pico") como Swish. La principal novedad es que exhibe un comportamiento de "autorregularización" atribuido a un término en su primera derivada. [ 34 ] [ 35 ]
Squareplus
Squareplus (2021) [ 36 ] es la función
dóndees un hiperparámetro que determina el "tamaño" de la región curva cercana. (Por ejemplo, dejarproduce ReLU y dejaproduce la función media metálica .) Squareplus comparte muchas propiedades con softplus: es monótono , estrictamente positivo , se aproxima a 0 como, aborda la identidad comoy essuave . Sin embargo, squareplus se puede calcular utilizando solo funciones algebraicas , lo que lo hace muy adecuado para entornos donde los recursos computacionales o los conjuntos de instrucciones son limitados. Además, squareplus no requiere ninguna consideración especial para garantizar la estabilidad numérica cuandoes grande.
DELU
La Unidad Lineal Exponencial Extendida (DELU, 2023) es una función de activación que es más suave en las proximidades de cero y más pronunciada para valores mayores, lo que permite una mejor asignación de neuronas en el proceso de aprendizaje para un mayor rendimiento. Gracias a su diseño único, se ha demostrado que DELU puede obtener una mayor precisión de clasificación que ReLU y ELU. [ 37 ]
En estas fórmulas,,yson valores de hiperparámetros que podrían establecerse como restricciones predeterminadas,y, tal como se hizo en la obra original.
Véase también
Referencias
- ↑ Brownlee, Jason (8 de enero de 2019). "Una introducción sencilla a la unidad lineal rectificada (ReLU)" . Machine Learning Mastery . Recuperado el 8 de abril de 2021 .
- ↑ Liu, Danqing (30 de noviembre de 2017). "Una guía práctica para ReLU" . Medium . Recuperado el 8 de abril de 2021 .
- ↑ Ramachandran, Prajit; Barret, Zoph; Quoc, V. Le (16 de octubre de 2017). "Búsqueda de funciones de activación". arXiv : 1710.05941 [ cs.NE ].
- 1 2 3 4 5 Xavier Glorot; Antoine Bordes; Yoshua Bengio (2011). Redes neuronales rectificadoras dispersas profundas (PDF) . AISTATS.
Funciones de activación rectificadoras y softplus. La segunda es una versión suavizada de la primera.
- ↑ László Tóth (2013). Reconocimiento de fonemas con redes neuronales rectificadoras dispersas profundas (PDF) . ICASSP .
- 1 2 Andrew L. Maas, Awni Y. Hannun, Andrew Y. Ng (2014). Las no linealidades del rectificador mejoran los modelos acústicos de redes neuronales .
- ↑ Hansel, D.; van Vreeswijk, C. (2002). "Cómo el ruido contribuye a la invariancia de contraste de la sintonización de orientación en la corteza visual del gato" . J. Neurosci. 22 (12): 5118– 5128. doi : 10.1523/JNEUROSCI.22-12-05118.2002 . PMC 6757721. PMID 12077207 .
- ↑ Kadmon, Jonathan; Sompolinsky, Haim (2015-11-19). "Transición al caos en redes neuronales aleatorias". Physical Review X . 5 (4) 041030. arXiv : 1508.06486 . Bibcode : 2015PhRvX...5d1030K . doi : 10.1103/PhysRevX.5.041030 . S2CID 7813832 .
- ↑ Householder, Alston S. (junio de 1941). "Una teoría de la actividad en estado estacionario en redes de fibras nerviosas: I. Definiciones y lemas preliminares" . The Bulletin of Mathematical Biophysics . 3 (2): 63– 69. doi : 10.1007/BF02478220 . ISSN 0007-4985 .
- ↑ Fukushima, K. (1969). "Extracción de características visuales mediante una red multicapa de elementos de umbral analógicos". IEEE Transactions on Systems Science and Cybernetics . 5 (4): 322– 333. Bibcode : 1969ITSSC...5..322F . doi : 10.1109/TSSC.1969.300225 .
- ↑ Fukushima, K.; Miyake, S. (1982). «Neocognitron: Un modelo de red neuronal autoorganizada para un mecanismo de reconocimiento de patrones visuales». Competencia y cooperación en redes neuronales . Notas de clase en biomatemáticas. Vol. 45. Springer. págs. 267–285 . doi : 10.1007/978-3-642-46466-9_18 . ISBN 978-3-540-11574-8.
- ↑ Woodbury, Greg. (1998). Un modelo de correlación para el desarrollo de la retinotopía y la dominancia ocular (tesis de licenciatura). Universidad de Sídney.
- ↑ Woodbury, G.; van der Zwan, R.; Gibson, WG (2002). "Modelo de correlación para el desarrollo conjunto de un mapa retinotópico refinado y columnas de dominancia ocular". Vision Research . 42 (19): 2295– 2310. doi : 10.1016/s0042-6989(02)00190-6 . PMID 12220585 .
- ↑ Woodbury, G. (2004). Un modelo de correlación para el desarrollo de la retinotopía y la dominancia ocular dependiente de la actividad (Tesis doctoral). Universidad de Sídney.
- ↑ Hahnloser, R.; Sarpeshkar, R.; Mahowald, MA; Douglas, RJ; Seung, HS (2000). "La selección digital y la amplificación analógica coexisten en un circuito de silicio inspirado en la corteza". Nature . 405 (6789): 947– 951. Bibcode : 2000Natur.405..947H . doi : 10.1038/35016072 . PMID 10879535 . S2CID 4399014 .
- ↑ Hahnloser, Richard; Seung, H. Sebastian (2000). "Conjuntos permitidos y prohibidos en redes lineales de umbral simétrico" . Avances en sistemas de procesamiento de información neuronal . 13. MIT Press.
- ↑ Yann LeCun ; Leon Bottou ; Genevieve B. Orr; Klaus-Robert Müller (1998). "Efficient BackProp" (PDF) . En G. Orr; K. Müller (eds.). Redes neuronales: trucos del oficio . Springer. Archivado del original (PDF) el 31 de agosto de 2018. Consultado el 7 de diciembre de 2012 .
- ↑ Jarrett, Kevin; Kavukcuoglu, Koray; Ranzato, Marc'Aurelio; LeCun, Yann (septiembre de 2009). "¿Cuál es la mejor arquitectura multietapa para el reconocimiento de objetos?". 2009 IEEE 12.ª Conferencia Internacional sobre Visión por Computadora . págs. 2146–2153 . doi : 10.1109/ICCV.2009.5459469 . ISBN 978-1-4244-4420-5.
- 1 2 Nair, Vinod y Geoffrey E. Hinton. " Las unidades lineales rectificadas mejoran las máquinas de Boltzmann restringidas ". Actas de la 27.ª conferencia internacional sobre aprendizaje automático (ICML-10) . 2010.
- ↑ Vaswani, A. (2017). "La atención es todo lo que necesitas". Avances en sistemas de procesamiento de información neuronal . 30 .
- ↑ Brown, T. (2020). "Los modelos de lenguaje son aprendices con pocos ejemplos". Avances en sistemas de procesamiento de información neuronal . 33 .
- ↑ Instituto de Innovación Tecnológica (2023). "Falcon 180B: El modelo de IA abierta de mayor rendimiento del mundo". Informe técnico del TII .
- ↑ OpenAI (2023). "Informe técnico de GPT-4". arXiv : 2303.08774 [ cs.CL ].
- ↑ Meta AI (2024). "Presentamos Meta Llama 3: El LLM de código abierto más capaz hasta la fecha".
{{cite web}}: Falta o está vacío|url=( ayuda ) - ^ "Documentos de PyTorch Leaky ReLU" .
- ↑ "Documentación de TensorFlow Leaky ReLU" .
- 1 2 He, Kaiming; Zhang, Xiangyu; Ren, Shaoqing; Sun, Jian (2015). "Profundizando en los rectificadores: superando el rendimiento a nivel humano en la clasificación de Image Net ". arXiv : 1502.01852 [ cs.CV ].
- ↑ Shang, Wenling; Sohn, Kihyuk; Almeida, Diogo; Lee, Honglak (11 de junio de 2016). "Comprensión y mejora de las redes neuronales convolucionales mediante unidades lineales rectificadas concatenadas" . Actas de la 33.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 2217–2225 . arXiv : 1603.05201 .
- ↑ Dugas, Charles; Bengio, Yoshua; Bélisle, François; Nadeau, Claude; Garcia, René (2000-01-01). "Incorporating second-order functional knowledge for better option pricing" (PDF) . Actas de la 13.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal (NIPS'00) . MIT Press: 451–457 .
Dado que la sigmoide
h
tiene una primera derivada positiva, su primitiva, que llamamos softplus, es convexa.
- ↑ "Capa directa de la unidad lineal rectificadora suave (SmoothReLU)" . Guía del desarrollador para la biblioteca de aceleración de análisis de datos de Intel . 2017. Consultado el 4 de diciembre de 2018 .
- ^ Inteligente, Djork-Arné; Unterthiner, Thomas; Hochreiter, Sepp (2015). "Aprendizaje de red profundo, rápido y preciso mediante unidades lineales exponenciales (ELU)". arXiv : 1511.07289 [ cs.LG ].
- 1 2 3 Hendrycks, Dan; Gimpel, Kevin (2016). "Unidades lineales de error gaussiano (GELUs)". arXiv : 1606.08415 [ cs.LG ].
- ↑ Page, E. (1977). "Aproximaciones a la función normal acumulativa y su inversa para su uso en una calculadora de bolsillo". Journal of the Royal Statistical Society. Serie C (Estadística Aplicada) . 26 (1): 75– 76. doi : 10.2307/2346872 . JSTOR 2346872 .
- ^ Diganta Misra (23 de agosto de 2019), Mish : una función de activación no monótona autoregulada (PDF) , arXiv : 1908.08681v1 , consultado el 26 de marzo de 2022.
- ↑ Shaw, Sweta (10 de mayo de 2020). "Funciones de activación comparadas con experimentos" . W&B . Recuperado el 11 de julio de 2022 .
- ↑ Barron, Jonathan T. (22 de diciembre de 2021). "Squareplus: un rectificador algebraico similar a Softplus". arXiv : 2112.11687 [ cs.NE ].
- ↑ Çatalbaş, Burak; Morgül, Ömer (16 de agosto de 2023). "Aprendizaje profundo con la unidad lineal exponencial extendida (DELU)" . Neural Computing and Applications . 35 (30): 22705– 22724. doi : 10.1007/s00521-023-08932-z . Recuperado el 20 de abril de 2025 .
- Redes neuronales artificiales