En las redes neuronales artificiales , la unidad recurrente con compuerta ( GRU ) es un mecanismo de compuerta utilizado en redes neuronales recurrentes , introducido en 2014 por Kyunghyun Cho et al. [ 1 ] La GRU es como una memoria a corto y largo plazo (LSTM) con un mecanismo de compuerta para introducir u olvidar ciertas características, [ 2 ] pero carece de un vector de contexto o compuerta de salida, lo que resulta en menos parámetros que LSTM. [ 3 ] Se encontró que el rendimiento de la GRU en ciertas tareas de modelado de música polifónica, modelado de señales de voz y procesamiento del lenguaje natural era similar al de LSTM. [ 4 ] [ 5 ] Las GRU demostraron que la compuerta es realmente útil en general, y el equipo de Bengio no llegó a una conclusión concreta sobre cuál de las dos unidades de compuerta era mejor. [ 6 ] [ 7 ]
Arquitectura
Existen varias variaciones de la unidad de compuerta completa, con la compuerta realizada utilizando el estado oculto anterior y el sesgo en diversas combinaciones, y una forma simplificada llamada unidad de compuerta mínima. [ 8 ]
A continuación, el operadordenota el producto de Hadamard .
Unidad totalmente cerrada

Inicialmente, para, el vector de salida es.
Variables (denota el número de características de entrada yel número de características de salida):
- : vector de entrada
- : vector de salida
- : vector de activación candidato
- : actualizar vector de puerta
- : vector de puerta de reinicio
- ,y: matrices de parámetros y vector que deben aprenderse durante el entrenamiento
- : La original es una función logística .
- : La original es una tangente hiperbólica .
Son posibles funciones de activación alternativas, siempre que.



Se pueden crear formas alternativas cambiandoy[ 9 ]
- Tipo 1: cada puerta depende únicamente del estado oculto anterior y del sesgo.
- Tipo 2: cada puerta depende únicamente del estado oculto anterior.
- Tipo 3: cada puerta se calcula utilizando únicamente la polarización.
Unidad mínima con puerta
La unidad de compuerta mínima (MGU) es similar a la unidad de compuerta completa, excepto que el vector de compuerta de actualización y reinicio se fusiona en una compuerta de olvido. Esto también implica que la ecuación para el vector de salida debe cambiarse: [ 10 ]
Variables
- : vector de entrada
- : vector de salida
- : vector de activación candidato
- : olvida el vector
- ,y: matrices de parámetros y vector
unidad recurrente controlada por luz
La unidad recurrente controlada por luz (LiGRU) [ 4 ] elimina por completo la puerta de reinicio, reemplaza tanh con la activación ReLU y aplica normalización por lotes (BN):
LiGRU ha sido estudiado desde una perspectiva bayesiana. [ 11 ] Este análisis produjo una variante llamada unidad recurrente bayesiana ligera (LiBRU), que mostró ligeras mejoras sobre LiGRU en tareas de reconocimiento de voz .
Referencias
- ↑ Cho, Kyunghyun; van Merrienboer, Bart; Gulcehre, Caglar; Bahdanau, Dzmitry; Bougares, Fethi; Schwenk, Holger; Bengio, Yoshua (2014). "Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation". Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP) : 1724– 1734. arXiv : 1406.1078 . doi : 10.3115/v1/D14-1179 .
- ↑ Felix Gers ; Jürgen Schmidhuber ; Fred Cummins (1999). «Aprender a olvidar: predicción continua con LSTM». 9.ª Conferencia Internacional sobre Redes Neuronales Artificiales: ICANN '99 . Vol. 1999. págs. 850–855 . doi : 10.1049/cp:19991218 . ISBN 0-85296-721-7.
- ↑ "Tutorial de redes neuronales recurrentes, parte 4: Implementación de una RNN GRU/LSTM con Python y Theano – WildML" . Wildml.com . 27 de octubre de 2015. Archivado del original el 10 de noviembre de 2021. Consultado el 18 de mayo de 2016 .
- 1 2 Ravanelli, Mirco; Brakel, Philemon; Omologo, Maurizio; Bengio, Yoshua (2018). "Unidades recurrentes con compuerta de luz para el reconocimiento de voz". IEEE Transactions on Emerging Topics in Computational Intelligence . 2 (2): 92– 102. arXiv : 1803.10225 . Bibcode : 2018ITECI...2...92R . doi : 10.1109/TETCI.2017.2762739 . S2CID 4402991 .
- ↑ Su, Yuahang; Kuo, Jay (2019). "Sobre la memoria a corto y largo plazo extendida y la red neuronal recurrente bidireccional dependiente". Neurocomputing . 356 : 151–161 . arXiv : 1803.01686 . doi : 10.1016/j.neucom.2019.04.044 . S2CID 3675055 .
- ↑ Chung, Junyoung; Gulcehre, Caglar; Cho, KyungHyun; Bengio, Yoshua (2014). "Evaluación empírica de redes neuronales recurrentes con compuertas en el modelado de secuencias". arXiv : 1412.3555 [ cs.NE ].
- ↑ Gruber, N.; Jockisch, A. (2020), "¿Son las células GRU más específicas y las células LSTM más sensibles en la clasificación de motivos en texto?", Frontiers in Artificial Intelligence , 3 40, doi : 10.3389/frai.2020.00040 , PMC 7861254 , PMID 33733157 , S2CID 220252321
- ↑ Chung, Junyoung; Gulcehre, Caglar; Cho, KyungHyun; Bengio, Yoshua (2014). "Evaluación empírica de redes neuronales recurrentes con compuertas en el modelado de secuencias". arXiv : 1412.3555 [ cs.NE ].
- ↑ Dey, Rahul; Salem, Fathi M. (2017-01-20). "Variantes de compuerta de redes neuronales de unidades recurrentes con compuerta (GRU)". arXiv : 1701.05923 [ cs.NE ].
- ↑ Heck, Joel; Salem, Fathi M. (2017-01-12). "Variaciones simplificadas de unidades de compuerta mínimas para redes neuronales recurrentes". arXiv : 1701.03452 [ cs.NE ].
- ↑ Bittar, Alexandre; Garner, Philip N. (mayo de 2021). "Una interpretación bayesiana de la unidad recurrente con compuerta de luz" . ICASSP 2021. Conferencia Internacional IEEE de Acústica, Habla y Procesamiento de Señales (ICASSP) de 2021. Toronto, ON, Canadá: IEEE. págs. 2965–2969 . 10.1109/ICASSP39728.2021.9414259.
- Arquitecturas de redes neuronales
- Redes neuronales artificiales
- Software de 2014
- 2014 en inteligencia artificial