En las redes neuronales , el mecanismo de compuerta es un motivo arquitectónico para controlar el flujo de señales de activación y gradiente . Se utilizan principalmente en redes neuronales recurrentes (RNN), pero también se han encontrado aplicaciones en otras arquitecturas.
Redes neuronales recurrentes
Los mecanismos de compuerta son la pieza central de la memoria a corto y largo plazo (LSTM). [ 1 ] Se propusieron para mitigar el problema del gradiente evanescente que suelen encontrar las RNN regulares.
Una unidad LSTM contiene tres compuertas:
- Una puerta de entrada , que controla el flujo de nueva información hacia la celda de memoria.
- Una puerta de olvido , que controla cuánta información se retiene del paso de tiempo anterior.
- Una puerta de salida , que controla cuánta información se pasa a la siguiente capa.
Las ecuaciones para LSTM son: [ 2 ]
Aquí,representa la multiplicación elemento a elemento .
- Arquitectura LSTM, con puertas




La unidad recurrente con compuertas (GRU) simplifica la LSTM. [ 3 ] En comparación con la LSTM, la GRU tiene solo dos compuertas: una de reinicio y otra de actualización . La GRU también combina el estado de la celda y el estado oculto. La compuerta de reinicio se corresponde aproximadamente con la compuerta de olvido, y la compuerta de actualización se corresponde aproximadamente con la compuerta de entrada. Se elimina la compuerta de salida.
Hay varias variantes de GRU. Una variante en particular tiene estas ecuaciones: [ 4 ]
- Arquitectura de unidad recurrente con compuertas



Unidad lineal controlada
Las unidades lineales con compuerta (GLU) [ 5 ] adaptan el mecanismo de compuerta para su uso en redes neuronales de alimentación directa , a menudo dentro de arquitecturas basadas en transformadores . Se definen como:
dóndeson la primera y la segunda entrada, respectivamente.representa la función de activación sigmoide .
Reemplazarcon otras funciones de activación conduce a variantes de GLU:
donde ReLU , GELU y Swish son diferentes funciones de activación.
En los modelos de transformadores, estas unidades de compuerta se utilizan a menudo en los módulos de alimentación directa . Para una única entrada vectorial, esto resulta en: [ 6 ]
Otras arquitecturas
El mecanismo de compuerta se utiliza en redes de autopistas , que fueron diseñadas mediante el despliegue de una LSTM.
El control de canales [ 7 ] utiliza una compuerta para controlar el flujo de información a través de diferentes canales dentro de una red neuronal convolucional (CNN).
Véase también
Referencias
- ↑ Sepp Hochreiter ; Jürgen Schmidhuber (1997). «Memoria larga a corto plazo» . Computación neuronal . 9 (8): 1735-1780 . doi : 10.1162/neco.1997.9.8.1735 . PMID 9377276 . S2CID 1915014 .
- ↑ Zhang, Aston; Lipton, Zachary; Li, Mu; Smola, Alexander J. (2024). "10.1. Memoria a corto y largo plazo (LSTM)" . Sumérgete en el aprendizaje profundo . Cambridge, Nueva York, Puerto Melbourne, Nueva Delhi, Singapur: Cambridge University Press. ISBN 978-1-009-38943-3.
- ↑ Cho, Kyunghyun; van Merrienboer, Bart; Bahdanau, DZmitry; Bougares, Fethi; Schwenk, Holger; Bengio, Yoshua (2014). "Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation". Association for Computational Linguistics . arXiv : 1406.1078 .
- ↑ Zhang, Aston; Lipton, Zachary; Li, Mu; Smola, Alexander J. (2024). "10.2. Unidades recurrentes con compuertas (GRU)" . Sumérgete en el aprendizaje profundo . Cambridge, Nueva York, Puerto Rico, Melbourne, Nueva Delhi, Singapur: Cambridge University Press. ISBN 978-1-009-38943-3.
- ↑ Dauphin, Yann N.; Fan, Angela; Auli, Michael; Grangier, David (2017-07-17). "Modelado del lenguaje con redes neuronales convolucionales con compuertas" . Actas de la 34.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 933–941 . arXiv : 1612.08083 .
- ↑ Shazeer, Noam (14 de febrero de 2020). "Las variantes de GLU mejoran Transformer". arXiv : 2002.05202 [ cs.LG ].
- ↑ Hua, Weizhe; Zhou, Yuan; De Sa, Christopher M; Zhang, Zhiru; Suh, G. Edward (2019). "Redes neuronales de compuerta de canal" . Avances en sistemas de procesamiento de información neuronal . 32. Curran Associates, Inc. arXiv : 1805.12549 .
Lecturas adicionales
- Zhang, Aston; Lipton, Zachary; Li, Mu; Smola, Alexander J. (2024). "10.1. Memoria a corto y largo plazo (LSTM)" . Sumérgete en el aprendizaje profundo . Cambridge, Nueva York, Puerto Rico, Melbourne, Nueva Delhi, Singapur: Cambridge University Press. ISBN 978-1-009-38943-3.
- Arquitecturas de redes neuronales
- Aprendizaje profundo