Articulo de referencia

Mecanismo de compuerta

En las redes neuronales , el mecanismo de compuerta es un motivo arquitectónico para controlar el flujo de señales de activación y gradiente . Se utilizan principalmente en rede...

En las redes neuronales , el mecanismo de compuerta es un motivo arquitectónico para controlar el flujo de señales de activación y gradiente . Se utilizan principalmente en redes neuronales recurrentes (RNN), pero también se han encontrado aplicaciones en otras arquitecturas.

Redes neuronales recurrentes

Los mecanismos de compuerta son la pieza central de la memoria a corto y largo plazo (LSTM). [ 1 ] Se propusieron para mitigar el problema del gradiente evanescente que suelen encontrar las RNN regulares.

Una unidad LSTM contiene tres compuertas:

  • Una puerta de entrada , que controla el flujo de nueva información hacia la celda de memoria.
  • Una puerta de olvido , que controla cuánta información se retiene del paso de tiempo anterior.
  • Una puerta de salida , que controla cuánta información se pasa a la siguiente capa.

Las ecuaciones para LSTM son: [ 2 ]

It=σ(incógnitatWincógnitai+Ht1Whi+bi)Ft=σ(incógnitatWincógnitaF+Ht1WhF+bF)Ot=σ(incógnitatWincógnitao+Ht1Who+bo)do~t=tanh(incógnitatWincógnitado+Ht1Whdo+bdo)dot=Ftdot1+Itdo~tHt=Ottanh(dot){\displaystyle {\begin{aligned}\mathbf {I} _{t}&=\sigma (\mathbf {X} _{t}\mathbf {W} _{xi}+\mathbf {H} _{t-1}\mathbf {W} _{hi}+\mathbf {b} _{i})\\\mathbf {F} _{t}&=\sigma (\mathbf {X} _{t}\mathbf {W} _{xf}+\mathbf {H} _{t-1}\mathbf {W} _{hf}+\mathbf {b} _{f})\\\mathbf {O} _{t}&=\sigma (\mathbf {X} _{t}\mathbf {W} _{xo}+\mathbf {H} _{t-1}\mathbf {W} _{ho}+\mathbf {b} _{o})\\{\tilde {\mathbf {C} }}_{t}&=\tanh(\mathbf {X} _{t}\mathbf {W} _{xc}+\mathbf {H} _{t-1}\mathbf {W} _{hc}+\mathbf {b} _{c})\\\mathbf {C} _{t}&=\mathbf {F} _{t}\odot \mathbf {C} _{t-1}+\mathbf {I} _{t}\odot {\tilde {\mathbf {C} }}_{t}\\\mathbf {H} _{t}&=\mathbf {O} _{t}\odot \tanh(\mathbf {C} _{t})\end{aligned}}}

Aquí,{\displaystyle \odot }representa la multiplicación elemento a elemento .

La unidad recurrente con compuertas (GRU) simplifica la LSTM. [ 3 ] En comparación con la LSTM, la GRU tiene solo dos compuertas: una de reinicio y otra de actualización . La GRU también combina el estado de la celda y el estado oculto. La compuerta de reinicio se corresponde aproximadamente con la compuerta de olvido, y la compuerta de actualización se corresponde aproximadamente con la compuerta de entrada. Se elimina la compuerta de salida.

Hay varias variantes de GRU. Una variante en particular tiene estas ecuaciones: [ 4 ]

Rt=σ(incógnitatWincógnitar+Ht1Whr+br)Zt=σ(incógnitatWincógnitaz+Ht1Whz+bz)H~t=tanh(incógnitatWincógnitah+(RtHt1)Whh+bh)Ht=ZtHt1+(1Zt)H~t{\displaystyle {\begin{aligned}\mathbf {R} _{t}&=\sigma (\mathbf {X} _{t}\mathbf {W} _{xr}+\mathbf {H} _{t-1}\mathbf {W} _{hr}+\mathbf {b} _{r})\\\mathbf {Z} _{t}&=\sigma (\mathbf {X} _{t}\mathbf {W} _{xz}+\mathbf {H} _{t-1}\mathbf {W} _{hz}+\mathbf {b} _{z})\\{\tilde {\mathbf {H} }}_{t}&=\tanh(\mathbf {X} _{t}\mathbf {W} _{xh}+(\mathbf {R} _{t}\odot \mathbf {H} _{t-1})\mathbf {W} _{hh}+\mathbf {b} _{h})\\\mathbf {H} _{t}&=\mathbf {Z} _{t}\odot \mathbf {H} _{t-1}+(1-\mathbf {Z} _{t})\odot {\tilde {\mathbf {H} }}_{t}\end{aligned}}}

Unidad lineal controlada

Las unidades lineales con compuerta (GLU) [ 5 ] adaptan el mecanismo de compuerta para su uso en redes neuronales de alimentación directa , a menudo dentro de arquitecturas basadas en transformadores . Se definen como:

GRAMOLU(a,b)=aσ(b){\displaystyle \mathrm {GLU} (a,b)=a\odot \sigma (b)}

dóndea,b{\displaystyle a,b}son la primera y la segunda entrada, respectivamente.σ{\displaystyle \sigma }representa la función de activación sigmoide .

Reemplazarσ{\displaystyle \sigma }con otras funciones de activación conduce a variantes de GLU:

RmiGRAMOLU(a,b)=aReLU(b)GRAMOmiGRAMOLU(a,b)=aGELU(b)SwiGRAMOLU(a,b,β)=aSilbidoβ(b){\displaystyle {\begin{aligned}\mathrm {ReGLU} (a,b)&=a\odot {\text{ReLU}}(b)\\\mathrm {GEGLU} (a,b)&=a\odot {\text{GELU}}(b)\\\mathrm {SwiGLU} (a,b,\beta )&=a\odot {\text{Swish}}_{\beta }(b)\end{aligned}}}

donde ReLU , GELU y Swish son diferentes funciones de activación.

En los modelos de transformadores, estas unidades de compuerta se utilizan a menudo en los módulos de alimentación directa . Para una única entrada vectorial, esto resulta en: [ 6 ]

GLU(incógnita,W,V,b,do)=σ(incógnitaW+b)(incógnitaV+do)Bilineal(incógnita,W,V,b,do)=(incógnitaW+b)(incógnitaV+do)ReGLU(incógnita,W,V,b,do)=máximo(0,incógnitaW+b)(incógnitaV+do)GEGLU(incógnita,W,V,b,do)=GELU(incógnitaW+b)(incógnitaV+do)SwiGLU(incógnita,W,V,b,do,β)=Silbidoβ(incógnitaW+b)(incógnitaV+do){\displaystyle {\begin{aligned}\operatorname {GLU} (x,W,V,b,c)&=\sigma (xW+b)\odot (xV+c)\\\operatorname {Bilinear} (x,W,V,b,c)&=(xW+b)\odot (xV+c)\\\operatorname {ReGLU} (x,W,V,b,c)&=\max(0,xW+b)\odot (xV+c)\\\operatorname {GEGLU} (x,W,V,b,c)&=\operatorname {GELU} (xW+b)\odot (xV+c)\\\operatorname {SwiGLU} (x,W,V,b,c,\beta )&=\operatorname {Swish} _{\beta }(xW+b)\odot (xV+c)\end{aligned}}}

Otras arquitecturas

El mecanismo de compuerta se utiliza en redes de autopistas , que fueron diseñadas mediante el despliegue de una LSTM.

El control de canales [ 7 ] utiliza una compuerta para controlar el flujo de información a través de diferentes canales dentro de una red neuronal convolucional (CNN).

Véase también

Referencias

  1. Sepp Hochreiter ; Jürgen Schmidhuber (1997). «Memoria larga a corto plazo» . Computación neuronal . 9 (8): 1735-1780 . doi : 10.1162/neco.1997.9.8.1735 . PMID 9377276 . S2CID 1915014 .  
  2. Zhang, Aston; Lipton, Zachary; Li, Mu; Smola, Alexander J. (2024). "10.1. Memoria a corto y largo plazo (LSTM)" . Sumérgete en el aprendizaje profundo . Cambridge, Nueva York, Puerto Melbourne, Nueva Delhi, Singapur: Cambridge University Press. ISBN 978-1-009-38943-3.
  3. Cho, Kyunghyun; van Merrienboer, Bart; Bahdanau, DZmitry; Bougares, Fethi; Schwenk, Holger; Bengio, Yoshua (2014). "Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation". Association for Computational Linguistics . arXiv : 1406.1078 .
  4. Zhang, Aston; Lipton, Zachary; Li, Mu; Smola, Alexander J. (2024). "10.2. Unidades recurrentes con compuertas (GRU)" . Sumérgete en el aprendizaje profundo . Cambridge, Nueva York, Puerto Rico, Melbourne, Nueva Delhi, Singapur: Cambridge University Press. ISBN 978-1-009-38943-3.
  5. Dauphin, Yann N.; Fan, Angela; Auli, Michael; Grangier, David (2017-07-17). "Modelado del lenguaje con redes neuronales convolucionales con compuertas" . Actas de la 34.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 933–941 . arXiv : 1612.08083 .
  6. Shazeer, Noam (14 de febrero de 2020). "Las variantes de GLU mejoran Transformer". arXiv : 2002.05202 [ cs.LG ].
  7. Hua, Weizhe; Zhou, Yuan; De Sa, Christopher M; Zhang, Zhiru; Suh, G. Edward (2019). "Redes neuronales de compuerta de canal" . Avances en sistemas de procesamiento de información neuronal . 32. Curran Associates, Inc. arXiv : 1805.12549 .

Lecturas adicionales

  • Zhang, Aston; Lipton, Zachary; Li, Mu; Smola, Alexander J. (2024). "10.1. Memoria a corto y largo plazo (LSTM)" . Sumérgete en el aprendizaje profundo . Cambridge, Nueva York, Puerto Rico, Melbourne, Nueva Delhi, Singapur: Cambridge University Press. ISBN 978-1-009-38943-3.