
La memoria a corto y largo plazo ( LSTM ) [ 1 ] es un tipo de red neuronal recurrente (RNN) que busca mitigar el problema del gradiente evanescente [ 2 ] comúnmente encontrado por las RNN tradicionales. Su relativa insensibilidad a la longitud del intervalo es su ventaja sobre otras RNN, modelos ocultos de Markov y otros métodos de aprendizaje de secuencias. Su objetivo es proporcionar una memoria a corto plazo para la RNN que pueda durar miles de pasos de tiempo (de ahí el nombre de " memoria a corto y largo plazo"). [ 1 ] El nombre se basa en la analogía con la memoria a largo y corto plazo y su relación, estudiada por psicólogos cognitivos desde principios del siglo XX.
Una unidad LSTM se compone típicamente de una celda y tres compuertas : una compuerta de entrada, una compuerta de salida [ 3 ] y una compuerta de olvido [ 4 ] . La celda recuerda valores durante intervalos de tiempo arbitrarios, y las compuertas regulan el flujo de información hacia dentro y hacia fuera de la celda. Las compuertas de olvido deciden qué información descartar del estado anterior, mapeando el estado anterior y la entrada actual a un valor entre 0 y 1. Un valor (redondeado) de 1 significa retención de la información, y un valor de 0 representa el descarte. Las compuertas de entrada deciden qué fragmentos de información nueva almacenar en el estado actual de la celda, utilizando el mismo sistema que las compuertas de olvido. Las compuertas de salida controlan qué fragmentos de información del estado actual de la celda emitir, asignando un valor de 0 a 1 a la información, considerando los estados anterior y actual. La emisión selectiva de información relevante del estado actual permite a la red LSTM mantener dependencias útiles a largo plazo para realizar predicciones, tanto en pasos de tiempo actuales como futuros.
LSTM tiene amplias aplicaciones en clasificación , [ 5 ] [ 6 ] procesamiento de datos , tareas de análisis de series temporales , [ 7 ] reconocimiento de voz , [ 8 ] [ 9 ] traducción automática , [ 10 ] [ 11 ] detección de actividad de voz, [ 12 ] control de robots , [ 13 ] [ 14 ] videojuegos , [ 15 ] [ 16 ] atención médica , [ 17 ] pronóstico de energía . [ 18 ]
Motivación
En teoría, las RNN clásicas pueden realizar un seguimiento de dependencias arbitrarias a largo plazo en las secuencias de entrada. El problema con las RNN clásicas es de naturaleza computacional (o práctica): al entrenar una RNN clásica mediante retropropagación , los gradientes a largo plazo que se retropropagan pueden "desvanecerse" , lo que significa que pueden tender a cero debido a que números muy pequeños se introducen en los cálculos, lo que provoca que el modelo deje de aprender. Las RNN que utilizan unidades LSTM resuelven parcialmente el problema del gradiente evanescente , ya que las unidades LSTM permiten que los gradientes fluyan con poca o ninguna atenuación. Sin embargo, las redes LSTM aún pueden sufrir el problema del gradiente explosivo. [ 19 ]
La intuición detrás de la arquitectura LSTM es crear un módulo adicional en una red neuronal que aprende cuándo recordar y cuándo olvidar información pertinente. [ 4 ] En otras palabras, la red aprende efectivamente qué información podría ser necesaria más adelante en una secuencia y cuándo esa información ya no es necesaria. Por ejemplo, en el contexto del procesamiento del lenguaje natural , la red puede aprender dependencias gramaticales. [ 20 ] Una LSTM podría procesar la oración " Dave , como resultado de sus controvertidas afirmaciones, ahora es un paria" recordando el género gramatical y el número (estadísticamente probables) del sujeto Dave . Nótese que esta información es pertinente para el pronombre his y que esta información ya no es importante después del verbo is .
Variantes
En las ecuaciones siguientes, las variables en minúscula representan vectores. Matricesycontienen, respectivamente, los pesos de las conexiones de entrada y recurrentes, donde el subíndicepuede ser la puerta de entrada, puerta de salida, la puerta del olvidoo la célula de memoria, dependiendo de la activación que se esté calculando. En esta sección, por lo tanto, estamos utilizando una "notación vectorial". Así, por ejemplo,no es solo una unidad de una celda LSTM, sino que contieneUnidades de la celda LSTM.
LSTM con puerta de olvido (crucial)
Las formas compactas de las ecuaciones para el paso hacia adelante de una celda LSTM con una puerta de olvido son: [ 1 ] [ 4 ]
donde los valores iniciales sonyy el operadordenota el producto de Hadamard (producto elemento a elemento). El subíndiceindexa el paso de tiempo.
Variables
Dejando los superíndicesyse refiere al número de características de entrada y al número de unidades ocultas, respectivamente:
- : vector de entrada a la unidad LSTM
- : olvidar el vector de activación de la puerta
- : vector de activación de la puerta de entrada/actualización
- : vector de activación de la puerta de salida
- : vector de estado oculto, también conocido como vector de salida de la unidad LSTM
- : vector de activación de entrada celular
- : vector de estado de la celda
- ,y: matrices de pesos y parámetros del vector de sesgo que deben aprenderse durante el entrenamiento
- : función sigmoide .
- : función tangente hiperbólica .
- : función tangente hiperbólica o, como sugiere el artículo de LSTM de mirilla [ 21 ] [ 22 ] ,.
Mirilla LSTM

La figura de la derecha es una representación gráfica de una unidad LSTM con conexiones de mirilla (es decir, una LSTM de mirilla). [ 21 ] [ 22 ] Las conexiones de mirilla permiten que las compuertas accedan al carrusel de error constante (CEC), cuya activación es el estado de la celda. [ 21 ]no se utiliza,En su lugar se utiliza en la mayoría de los lugares.
Cada una de las compuertas puede considerarse como una neurona "estándar" en una red neuronal de alimentación directa (o multicapa): es decir, calculan una activación (utilizando una función de activación) de una suma ponderada.yrepresentan las activaciones de las compuertas de entrada, salida y olvido, respectivamente, en el paso de tiempo.
Las 3 flechas de salida de la celda de memoriaa las 3 puertasyrepresentan las conexiones de mirilla . Estas conexiones de mirilla en realidad denotan las contribuciones de la activación de la célula de memoria.en el paso de tiempo, es decir, la contribución de(y no, como la imagen puede sugerir). En otras palabras, las puertasycalcular sus activaciones en el paso de tiempo(es decir, respectivamente,y) considerando también la activación de la célula de memoriaen el paso de tiempo, es decir.
La única flecha de izquierda a derecha que sale de la celda de memoria no es una conexión de mirilla y denota.
Los pequeños círculos que contienen unLos símbolos representan una multiplicación elemento a elemento entre sus entradas. Los círculos grandes que contienen una curva en forma de S representan la aplicación de una función diferenciable (como la función sigmoide) a una suma ponderada.
LSTM convolucional tipo mirilla
LSTM convolucional de mirilla . [ 23 ] Eldenota el operador de convolución .
Capacitación
Una RNN que utiliza unidades LSTM puede entrenarse de forma supervisada en un conjunto de secuencias de entrenamiento, utilizando un algoritmo de optimización como el descenso de gradiente combinado con retropropagación a través del tiempo para calcular los gradientes necesarios durante el proceso de optimización, con el fin de cambiar cada peso de la red LSTM en proporción a la derivada del error (en la capa de salida de la red LSTM) con respecto al peso correspondiente.
Un problema al usar el descenso de gradiente para las RNN estándar es que los gradientes de error se desvanecen exponencialmente rápido con el tamaño del retardo de tiempo entre eventos importantes. Esto se debe asi el radio espectral dees menor que 1. [ 2 ] [ 24 ]
Sin embargo, en las unidades LSTM, cuando los valores de error se retropropagan desde la capa de salida, el error permanece en la celda de la unidad LSTM. Este "carrusel de errores" retroalimenta continuamente el error a cada una de las compuertas de la unidad LSTM, hasta que aprenden a descartar el valor.
Función de puntuación CTC
Muchas aplicaciones utilizan pilas de RNN LSTM [ 25 ] y las entrenan mediante clasificación temporal conexionista (CTC) [ 5 ] para encontrar una matriz de pesos de RNN que maximice la probabilidad de las secuencias de etiquetas en un conjunto de entrenamiento, dadas las secuencias de entrada correspondientes. CTC logra tanto la alineación como el reconocimiento.
Alternativas
A veces, puede ser ventajoso entrenar (partes de) una LSTM mediante neuroevolución [ 7 ] o mediante métodos de gradiente de política, especialmente cuando no hay un "maestro" (es decir, etiquetas de entrenamiento).
Aplicaciones
Las aplicaciones de LSTM incluyen:
- Control de robots [ 13 ]
- Predicción de series temporales [ 7 ]
- Reconocimiento de voz [ 26 ] [ 27 ] [ 28 ]
- Aprendizaje del ritmo [ 22 ]
- Modelado hidrológico de precipitación-escorrentía [ 29 ]
- Composición musical [ 30 ]
- Pronóstico energético [ 18 ]
- Aprendizaje de la gramática [ 31 ] [ 21 ] [ 32 ]
- Reconocimiento de escritura a mano [ 33 ] [ 34 ]
- Reconocimiento de acciones humanas [ 35 ]
- traducción del lenguaje de señas [ 36 ]
- Detección de homología de proteínas [ 37 ]
- Predicción de la localización subcelular de proteínas [ 38 ]
- Detección de anomalías en series temporales [ 39 ]
- Varias tareas de predicción en el área de gestión de procesos de negocio [ 40 ]
- Predicción en las vías de atención médica [ 41 ]
- Análisis semántico [ 42 ]
- Cosegmentación de objetos [ 43 ] [ 44 ]
- Gestión de pasajeros en el aeropuerto [ 45 ]
- Pronóstico de tráfico a corto plazo [ 46 ]
- Diseño de fármacos [ 47 ]
- Previsión financiera [ 48 ]
- Clasificación de la actividad en vídeo [ 49 ]
2015: Google comenzó a usar una LSTM entrenada por CTC para el reconocimiento de voz en Google Voice . [ 50 ] [ 51 ] Según la publicación oficial del blog, el nuevo modelo redujo los errores de transcripción en un 49 %. [ 52 ]
2016: Google comenzó a usar una LSTM para sugerir mensajes en la aplicación de conversación Allo. [ 53 ] Ese mismo año, Google lanzó el sistema de traducción automática neuronal de Google para Google Translate, que utilizaba LSTM para reducir los errores de traducción en un 60 %. [ 10 ] [ 54 ] [ 55 ]
Apple anunció en su Conferencia Mundial de Desarrolladores que comenzaría a usar la LSTM para quicktype [ 56 ] [ 57 ] [ 58 ] en el iPhone y para Siri. [ 59 ] [ 60 ]
Amazon lanzó Polly , que genera las voces detrás de Alexa, utilizando una LSTM bidireccional para la tecnología de texto a voz. [ 61 ]
2017: Facebook realizaba unos 4.500 millones de traducciones automáticas al día utilizando redes de memoria a corto y largo plazo. [ 11 ]
Microsoft informó haber alcanzado una precisión de reconocimiento del 94,9 % en el corpus Switchboard , que incorpora un vocabulario de 165 000 palabras. El enfoque utilizado fue la "memoria a corto y largo plazo basada en sesiones de diálogo". [ 62 ]
2018: OpenAI utilizó LSTM entrenado con gradientes de política para vencer a los humanos en el complejo videojuego Dota 2, [ 15 ] y para controlar una mano robótica similar a la humana que manipula objetos físicos con una destreza sin precedentes. [ 14 ] [ 63 ]
2019: DeepMind utilizó LSTM entrenado con gradientes de política para sobresalir en el complejo videojuego Starcraft II . [ 16 ] [ 63 ]
Historia
Desarrollo
Aspectos de LSTM fueron anticipados por la "retropropagación enfocada", [ 64 ] citada en el artículo de LSTM. [ 1 ]
La tesis de diploma alemana de Sepp Hochreiter de 1991 analizó el problema del gradiente evanescente y desarrolló los principios del método. [ 2 ] Su director de tesis, Jürgen Schmidhuber , consideró la tesis de gran importancia. [ 65 ]
Una versión temprana de LSTM fue publicada en 1995 en un informe técnico de Sepp Hochreiter y Jürgen Schmidhuber , [ 66 ] luego publicada en la conferencia NIPS 1996. [ 3 ]
El punto de referencia más comúnmente utilizado para LSTM se publicó en 1997 en la revista Neural Computation . [ 1 ] Al introducir unidades Constant Error Carousel (CEC), LSTM aborda el problema del gradiente evanescente . La versión inicial del bloque LSTM incluía celdas, compuertas de entrada y salida. [ 67 ]
Felix Gers , Jürgen Schmidhuber y Fred Cummins introdujeron la puerta de olvido (también llamada "puerta de retención") en la arquitectura LSTM en 1999, [ 68 ] permitiendo que la LSTM restableciera su propio estado. [ 67 ] Esta es la versión de LSTM más utilizada actualmente. Añadieron conexiones de mirilla en 2000. [ 21 ] [ 22 ] Además, se omitió la función de activación de salida. [ 67 ]
Desarrollo de variantes
En 2005, Graves y Schmidhuber [ 26 ] publicaron LSTM con retropropagación completa a través del tiempo y LSTM bidireccional.
En 2006, Graves, Fernández, Gómez y Schmidhuber [ 5 ] introdujeron una nueva función de error para LSTM: Clasificación Temporal Conexionista (CTC) para alineación y reconocimiento simultáneos de secuencias.
En 2014, Kyunghyun Cho y otros [ 69 ] publicaron una variante simplificada de la LSTM de puerta de olvido [ 68 ] llamada unidad recurrente con puerta (GRU).
En 2015, Srivastava, Greff y Schmidhuber utilizaron principios LSTM [ 68 ] para crear la red Highway , una red neuronal de alimentación directa con cientos de capas, mucho más profunda que las redes anteriores. [ 70 ] [ 71 ] [ 72 ] Simultáneamente, se desarrolló la arquitectura ResNet . Es equivalente a una red de autopistas con o sin puertas. [ 73 ]
Una actualización moderna de LSTM llamada xLSTM es publicada por un equipo liderado por Sepp Hochreiter . [ 74 ] [ 75 ] Uno de los 2 bloques (mLSTM) de la arquitectura es paralelizable como la arquitectura Transformer , los otros (sLSTM) permiten el seguimiento de estado.
Aplicaciones
2001: Gers y Schmidhuber entrenaron LSTM para aprender idiomas imposibles de aprender con modelos tradicionales como los modelos ocultos de Markov. [ 21 ] [ 63 ]
Hochreiter et al. utilizaron LSTM para metaaprendizaje (es decir, aprender un algoritmo de aprendizaje). [ 76 ]
2004: Primera aplicación exitosa de LSTM al habla Alex Graves et al. [ 77 ] [ 63 ]
2005: Daan Wierstra, Faustino Gomez y Schmidhuber entrenaron LSTM mediante neuroevolución sin un maestro. [ 7 ]
Mayer et al. entrenaron LSTM para controlar robots . [ 13 ]
2007: Wierstra, Foerster, Peters y Schmidhuber entrenaron LSTM mediante gradientes de política para el aprendizaje por refuerzo sin un maestro. [ 78 ]
Hochreiter, Heuesel y Obermayr aplicaron LSTM a la detección de homología de proteínas en el campo de la biología . [ 37 ]
2009: Justin Bayer et al. introdujeron la búsqueda de arquitectura neuronal para LSTM. [ 79 ] [ 63 ]
2009: Una LSTM entrenada por CTC ganó la competición de reconocimiento de escritura a mano conectada de ICDAR . Tres modelos de este tipo fueron presentados por un equipo liderado por Alex Graves . [ 80 ] Uno fue el modelo más preciso de la competición y otro el más rápido. [ 81 ] Esta fue la primera vez que una RNN ganó competiciones internacionales. [ 63 ]
2013: Alex Graves, Abdel-rahman Mohamed y Geoffrey Hinton utilizaron redes LSTM como componente principal de una red que logró una tasa récord de error de fonemas del 17,7 % en el conjunto de datos de habla natural clásico TIMIT . [ 28 ]
2017: Investigadores de la Universidad Estatal de Michigan , IBM Research y la Universidad de Cornell publicaron un estudio en la conferencia Knowledge Discovery and Data Mining (KDD). [ 82 ] Su LSTM sensible al tiempo (T-LSTM) funciona mejor en ciertos conjuntos de datos que el LSTM estándar.
2020: Kaplan y McCandlish et al. exploraron la ley de escalado de la arquitectura LSTM en el modelado del lenguaje y la compararon con Transformers , demostrando que Transformers escala mejor que LSTM en datos de texto. [ 83 ]
Véase también
- Atención (aprendizaje automático)
- Aprendizaje profundo
- Computadora neuronal diferenciable
- unidad recurrente controlada
- Red de carreteras
- Potenciación a largo plazo
- corteza prefrontal ganglios basales memoria de trabajo
- Red neuronal recurrente
- Seq2seq
- Transformer (modelo de aprendizaje automático)
- Series temporales
Referencias
- 1 2 3 4 5 Sepp Hochreiter ; Jürgen Schmidhuber (1997). «Memoria larga a corto plazo» . Computación neuronal . 9 (8): 1735–1780 . doi : 10.1162/neco.1997.9.8.1735 . PMID 9377276 . S2CID 1915014 .
- ^ Hochreiter , Sepp (1991) . Untersuchungen zu dynamischen neuronalen Netzen (PDF) (tesis de diploma). Universidad Técnica de Munich , Instituto de Informática.
- 1 2 Hochreiter, Sepp; Schmidhuber, Jürgen (1996-12-03). "LSTM puede resolver problemas difíciles de retardo de tiempo prolongado" . Actas de la 9.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal . NIPS'96. Cambridge, MA, EE. UU.: MIT Press: 473–479 .
- 1 2 3 Felix A. Gers; Jürgen Schmidhuber; Fred Cummins (2000). "Aprender a olvidar: predicción continua con LSTM" . Neural Computation . 12 (10): 2451– 2471. CiteSeerX 10.1.1.55.5709 . doi : 10.1162/089976600300015015 . PMID 11032042. S2CID 11598600. Archivado del original el 7 de abril de 2019. Recuperado el 15 de abril de 2017 .
- 1 2 3 Graves, Alex; Fernández, Santiago; Gomez, Faustino; Schmidhuber, Jürgen (2006). "Clasificación temporal conexionista: Etiquetado de datos de secuencias no segmentadas con redes neuronales recurrentes". En Actas de la Conferencia Internacional sobre Aprendizaje Automático, ICML 2006 : 369–376 . CiteSeerX 10.1.1.75.6306 .
- ↑ Karim, Fazle; Majumdar, Somshubra; Darabi, Houshang; Chen, Shun (2018). "Redes totalmente convolucionales LSTM para la clasificación de series temporales" . IEEE Access . 6 : 1662–1669 . arXiv : 1709.05206 . Bibcode : 2018IEEEA...6.1662K . doi : 10.1109/ACCESS.2017.2779939 . ISSN 2169-3536 .
- 1 2 3 4 Wierstra, Daan; Schmidhuber, J.; Gomez, FJ (2005). "Evolino: Neuroevolución híbrida/Búsqueda lineal óptima para el aprendizaje de secuencias" . Actas de la 19.ª Conferencia Internacional Conjunta sobre Inteligencia Artificial (IJCAI), Edimburgo : 853–858 .
- ↑ Sak, Hasim; Senior, Andrew; Beaufays, Francoise (2014). "Arquitecturas de redes neuronales recurrentes de memoria a corto y largo plazo para modelado acústico a gran escala" (PDF) . Archivado del original (PDF) el 24 de abril de 2018.
- ↑ Li, Xiangang; Wu, Xihong (2014-10-15). "Construcción de redes neuronales recurrentes profundas basadas en memoria a corto y largo plazo para el reconocimiento de voz con vocabulario extenso". arXiv : 1410.4281 [ cs.CL ].
- 1 2 Wu, Yonghui; Schuster, Mike; Chen, Zhifeng; Le, Quoc V.; Norouzi, Mohammad; Macherey, Wolfgang; Krikun, Maxim; Cao, Yuan; Gao, Qin (2016-09-26). "Sistema de traducción automática neuronal de Google: Cerrando la brecha entre la traducción humana y la automática". arXiv : 1609.08144 [ cs.CL ].
- 1 2 Ong, Thuy (4 de agosto de 2017). "Las traducciones de Facebook ahora funcionan completamente con IA" . www.allthingsdistributed.com . Recuperado el 15 de febrero de 2019 .
- ^ Sahidullah, Maryland; Patiño, José; Cornell, Samuele; Yin, Ruiking; Sivasankaran, Sunit; Bredin, Hervé; Korshunov, Pavel; Brutti, Alessio; Serizel, Romain; Vicente, Emmanuel; Evans, Nicolás; Marcel, Sebastián; Squartini, Stefano; Barras, Claude (6 de noviembre de 2019). "La presentación rápida a DIHARD II: contribuciones y lecciones aprendidas". arXiv : 1911.02388 [ eess.AS ].
- 1 2 3 Mayer, H.; Gomez, F.; Wierstra, D.; Nagy, I.; Knoll, A.; Schmidhuber, J. (octubre de 2006). "Un sistema para cirugía cardíaca robótica que aprende a hacer nudos usando redes neuronales recurrentes". Conferencia Internacional IEEE/RSJ de 2006 sobre Robots y Sistemas Inteligentes . págs. 543–548 . CiteSeerX 10.1.1.218.3399 . doi : 10.1109/IROS.2006.282190 . ISBN 978-1-4244-0258-8. S2CID 12284900 .
- 1 2 "Aprendizaje de la destreza" . OpenAI . 30 de julio de 2018. Recuperado el 28 de junio de 2023 .
- 1 2 Rodríguez, Jesús (2 de julio de 2018). "La ciencia detrás de OpenAI Five que acaba de producir uno de los mayores avances en la historia de la IA" . Hacia la ciencia de datos . Archivado del original el 26 de diciembre de 2019. Recuperado el 15 de enero de 2019 .
- 1 2 Stanford, Stacy (25 de enero de 2019). "La IA de DeepMind, AlphaStar, muestra un progreso significativo hacia la IAG" . Medium ML Memoirs . Recuperado el 15 de enero de 2019 .
- ↑ Schmidhuber, Jürgen (2021). "La década de 2010: Nuestra década de aprendizaje profundo / Perspectivas para la década de 2020" . Blog de IA . IDSIA, Suiza . Recuperado el 30 de abril de 2022 .
- 1 2 Maity, Abhishek; Tukarul, Viraj (23 de enero de 2026). "Pronóstico del consumo de energía mediante redes neuronales recurrentes: un análisis comparativo". arXiv : 2601.17110 [ cs.CY ].
- ↑ Calin, Ovidiu (14 de febrero de 2020). Arquitecturas de aprendizaje profundo . Cham, Suiza: Springer Nature. pág. 555. ISBN 978-3-030-36720-6.
- ^ Lakretz, Yair; Kruszewski, alemán; Desbordes, Theo; Hupkes, Dieuwke; Dehaene, Estanislao; Baroni, Marco (2019), "La aparición de unidades numéricas y de sintaxis en" , La aparición de unidades numéricas y de sintaxis (PDF) , Asociación de Lingüística Computacional, págs. 11-20 , doi : 10.18653/v1/N19-1002 , hdl : 11245.1/16cb6800-e10d-4166-8e0b-fed61ca6ebb4 , S2CID 81978369
- 1 2 3 4 5 6 Gers, FA; Schmidhuber, J. (2001). "Las redes recurrentes LSTM aprenden lenguajes simples, libres de contexto y sensibles al contexto" (PDF) . IEEE Transactions on Neural Networks . 12 (6): 1333– 1340. Bibcode : 2001ITNN...12.1333G . doi : 10.1109/72.963769 . PMID 18249962. S2CID 10192330. Archivado del original (PDF) el 6 de julio de 2017.
- 1 2 3 4 Gers, F.; Schraudolph, N.; Schmidhuber, J. (2002). "Aprendizaje de sincronización precisa con redes recurrentes LSTM" (PDF) . Journal of Machine Learning Research . 3 : 115–143 . Archivado del original (PDF) el 28 de julio de 2017. Recuperado el 15 de abril de 2017 .
- ↑ Xingjian Shi; Zhourong Chen; Hao Wang; Dit-Yan Yeung; Wai-kin Wong; Wang-chun Woo (2015). "Red LSTM convolucional: un enfoque de aprendizaje automático para la predicción inmediata de precipitaciones". Actas de la 28.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal : 802–810 . arXiv : 1506.04214 . Bibcode : 2015arXiv150604214S .
- ↑ Hochreiter, S.; Bengio, Y.; Frasconi, P.; Schmidhuber, J. (2001). "Flujo de gradiente en redes recurrentes: la dificultad de aprender dependencias a largo plazo (descarga en PDF disponible)" . En Kremer y, SC; Kolen, JF (eds.). Guía de campo para redes neuronales recurrentes dinámicas . IEEE Press.
- ↑ Fernández, Santiago; Graves, Alex; Schmidhuber, Jürgen (2007). "Etiquetado de secuencias en dominios estructurados con redes neuronales recurrentes jerárquicas". Actas de la 20.ª Conferencia Internacional Conjunta sobre Inteligencia Artificial, Ijcai 2007 : 774–779 . CiteSeerX 10.1.1.79.1887 .
- 1 2 Graves, A.; Schmidhuber, J. (2005). "Clasificación de fonemas por marco con LSTM bidireccional y otras arquitecturas de redes neuronales" . Redes neuronales . 18 ( 5– 6): 602– 610. CiteSeerX 10.1.1.331.5800 . doi : 10.1016/j.neunet.2005.06.042 . PMID 16112549. S2CID 1856462 .
- ↑ Fernández, S.; Graves, A.; Schmidhuber, J. (9 de septiembre de 2007). «Una aplicación de redes neuronales recurrentes para la detección discriminativa de palabras clave» . Actas de la 17.ª Conferencia Internacional sobre Redes Neuronales Artificiales . ICANN'07. Berlín, Heidelberg: Springer-Verlag: 220–229 . ISBN 978-3540746935Consultado el 28 de diciembre de 2023 .
- 1 2 Graves, Alex; Mohamed, Abdel-rahman; Hinton, Geoffrey (2013). "Reconocimiento de voz con redes neuronales recurrentes profundas". 2013 IEEE International Conference on Acoustics, Speech and Signal Processing . pp. 6645– 6649. arXiv : 1303.5778 . doi : 10.1109/ICASSP.2013.6638947 . ISBN 978-1-4799-0356-6. S2CID 206741496 .
- ↑ Kratzert, Frederik; Klotz, Daniel; Shalev, Guy; Klambauer, Günter; Hochreiter, Sepp; Nearing, Grey (17 de diciembre de 2019). "Hacia el aprendizaje de comportamientos hidrológicos universales, regionales y locales mediante aprendizaje automático aplicado a conjuntos de datos de muestras grandes" . Hydrology and Earth System Sciences . 23 (12): 5089– 5110. arXiv : 1907.08456 . Bibcode : 2019HESS...23.5089K . doi : 10.5194/hess-23-5089-2019 . ISSN 1027-5606 .
- ↑ Eck, Douglas; Schmidhuber, Jürgen (28 de agosto de 2002). «Aprendiendo la estructura a largo plazo del blues». Redes neuronales artificiales — ICANN 2002. Notas de clase en ciencias de la computación. Vol. 2415. Springer, Berlín, Heidelberg. págs. 284–289 . CiteSeerX 10.1.1.116.3620 . doi : 10.1007/3-540-46084-5_47 . ISBN 978-3540460848.
- ↑ Schmidhuber, J.; Gers, F.; Eck, D.; Schmidhuber, J.; Gers, F. (2002). "Aprendizaje de lenguajes no regulares: una comparación de redes recurrentes simples y LSTM". Neural Computation . 14 (9): 2039– 2041. CiteSeerX 10.1.1.11.7369 . doi : 10.1162/089976602320263980 . PMID 12184841 . S2CID 30459046 .
- ↑ Perez-Ortiz, JA; Gers, FA; Eck, D.; Schmidhuber, J. (2003). "Los filtros de Kalman mejoran el rendimiento de las redes LSTM en problemas irresolubles por redes recurrentes tradicionales" . Neural Networks . 16 (2): 241– 250. CiteSeerX 10.1.1.381.1992 . doi : 10.1016/s0893-6080(02)00219-8 . PMID 12628609 .
- ↑ A. Graves, J. Schmidhuber. Reconocimiento de escritura a mano fuera de línea con redes neuronales recurrentes multidimensionales. Advances in Neural Information Processing Systems 22, NIPS'22, pp 545–552, Vancouver, MIT Press, 2009.
- ↑ Graves, A.; Fernández, S.; Liwicki, M.; Bunke, H.; Schmidhuber, J. (3 de diciembre de 2007). «Reconocimiento de escritura a mano en línea sin restricciones con redes neuronales recurrentes» . Actas de la 20.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal . NIPS'07. EE. UU.: Curran Associates Inc.: 577–584 . ISBN 9781605603520Consultado el 28 de diciembre de 2023 .
- ↑ Baccouche, M.; Mamalet, F.; Wolf, C.; Garcia, C.; Baskurt, A. (2011). "Aprendizaje profundo secuencial para el reconocimiento de acciones humanas". En Salah, AA; Lepri, B. (eds.). 2.º Taller Internacional sobre la Comprensión del Comportamiento Humano (HBU) . Lecture Notes in Computer Science. Vol. 7065. Ámsterdam, Países Bajos: Springer. pp. 29–39 . doi : 10.1007/978-3-642-25446-8_4 . ISBN 978-3-642-25445-1.
- ^ Huang, Jie; Zhou, Wengang; Zhang, Qilin; Li, Houqiang; Li, Weiping (30 de enero de 2018). "Reconocimiento de lengua de signos basado en vídeo sin segmentación temporal". arXiv : 1801.10111 [ cs.CV ].
- 1 2 Hochreiter, S.; Heusel, M.; Obermayer, K. (2007). "Detección rápida de homología de proteínas basada en modelos sin alineación" . Bioinformatics . 23 (14): 1728– 1736. doi : 10.1093/bioinformatics/btm247 . PMID 17488755 .
- ↑ Thireou, T.; Reczko, M. (2007). "Redes bidireccionales de memoria a corto y largo plazo para predecir la localización subcelular de proteínas eucariotas". IEEE/ACM Transactions on Computational Biology and Bioinformatics . 4 (3): 441– 446. Bibcode : 2007ITCBB...4..441T . doi : 10.1109/tcbb.2007.1015 . PMID 17666763 . S2CID 11787259 .
- ↑ Malhotra, Pankaj; Vig, Lovekesh; Shroff, Gautam; Agarwal, Puneet (abril de 2015). "Redes de memoria a corto y largo plazo para la detección de anomalías en series temporales" (PDF) . Simposio Europeo sobre Redes Neuronales Artificiales, Inteligencia Computacional y Aprendizaje Automático — ESANN 2015. Archivado del original (PDF) el 30 de octubre de 2020. Consultado el 21 de febrero de 2018 .
- ↑ Tax, N.; Verenich, I.; La Rosa, M.; Dumas, M. (2017). "Monitoreo predictivo de procesos de negocio con redes neuronales LSTM". Ingeniería avanzada de sistemas de información . Notas de clase en ciencias de la computación. Vol. 10253. pp. 477–492 . arXiv : 1612.02130 . doi : 10.1007/978-3-319-59536-8_30 . ISBN 978-3-319-59535-1. S2CID 2192354 .
- ↑ Choi, E.; Bahadori, MT; Schuetz, E.; Stewart, W.; Sun, J. (2016). "Doctor AI: Predicción de eventos clínicos mediante redes neuronales recurrentes" . Actas del taller y conferencia de JMLR . 56 : 301–318 . arXiv : 1511.05942 . Bibcode : 2015arXiv151105942C . PMC 5341604. PMID 28286600 .
- ↑ Jia, Robin; Liang, Percy (2016). "Recombinación de datos para el análisis semántico neuronal". arXiv : 1606.03622 [ cs.CL ].
- ↑ Wang, Le; Duan, Xuhuan; Zhang, Qilin; Niu, Zhenxing; Hua, Gang; Zheng, Nanning (2018-05-22). "Segment-Tube: Localización de acciones espaciotemporales en vídeos sin recortar con segmentación por fotograma" (PDF) . Sensors . 18 (5): 1657. Bibcode : 2018Senso..18.1657W . doi : 10.3390/s18051657 . ISSN 1424-8220 . PMC 5982167. PMID 29789447 .
- ^ Duan, Xuhuan; Wang, Le; Zhai, Changbo; Zheng, Nanning; Zhang, Qilin; Niu, Zhenxing; Hua, pandilla (2018). "Localización conjunta de acciones espacio-temporales en vídeos sin recortar con segmentación por fotograma". 2018 25a Conferencia Internacional IEEE sobre Procesamiento de Imágenes (ICIP) . 25ª Conferencia Internacional IEEE sobre Procesamiento de Imágenes (ICIP). págs. 918– 922. doi : 10.1109/icip.2018.8451692 . ISBN 978-1-4799-7061-2.
- ↑ Orsini, F.; Gastaldi, M.; Mantecchini, L.; Rossi, R. (2019). Redes neuronales entrenadas con rastros de WiFi para predecir el comportamiento de los pasajeros en aeropuertos . 6.ª Conferencia Internacional sobre Modelos y Tecnologías para Sistemas de Transporte Inteligentes. Cracovia: IEEE. arXiv : 1910.14026 . doi : 10.1109/MTITS.2019.8883365 . 8883365.
- ↑ Zhao, Z.; Chen, W.; Wu, X.; Chen, PCY; Liu, J. (2017). "Red LSTM: Un enfoque de aprendizaje profundo para la predicción del tráfico a corto plazo". IET Intelligent Transport Systems . 11 (2): 68– 75. doi : 10.1049/iet-its.2016.0208 . S2CID 114567527 .
- ↑ Gupta A, Müller AT, Huisman BJH, Fuchs JA, Schneider P, Schneider G (2018). "Redes recurrentes generativas para el diseño de fármacos de novo" . Mol Inform . 37 ( 1–2 ) 1700111. doi : 10.1002/minf.201700111 . PMC 5836943. PMID 29095571 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Saiful Islam, Md.; Hossain, Emam (26 de octubre de 2020). "Predicción del tipo de cambio de divisas mediante una red híbrida GRU-LSTM" . Soft Computing Letters . 3 100009. doi : 10.1016/j.socl.2020.100009 . ISSN 2666-2221 .
- ↑ Martin, Abbey; Hill, Andrew J.; Seiler, Konstantin M.; Balamurali, Mehala (27-05-2024). "Reconocimiento y localización automáticos de acciones de excavadoras para vídeo sin recortar utilizando redes híbridas LSTM-Transformer" . International Journal of Mining, Reclamation and Environment . 38 (5): 353– 372. Bibcode : 2024IJMRE..38..353M . doi : 10.1080/17480930.2023.2290364 . ISSN 1748-0930 .
- ↑ Beaufays, Françoise (11 de agosto de 2015). "Las redes neuronales detrás de la transcripción de Google Voice" . Blog de investigación . Recuperado el 27 de junio de 2017 .
- ↑ Sak, Haşim; Senior, Andrew; Rao, Kanishka; Beaufays, Françoise; Schalkwyk, Johan (24 de septiembre de 2015). "Búsqueda por voz de Google: más rápida y precisa" . Blog de investigación . Recuperado el 27 de junio de 2017 .
- ↑ "Receta de neón... o mejor dicho, Nueva transcripción para Google Voice" . Blog oficial de Google . 23 de julio de 2015. Consultado el 25 de abril de 2020 .
- ↑ Khaitan, Pranav (18 de mayo de 2016). "Chatea de forma más inteligente con Allo" . Blog de investigación . Recuperado el 27 de junio de 2017 .
- ↑ Metz, Cade (27 de septiembre de 2016). "Una infusión de IA hace que Google Translate sea más potente que nunca | WIRED" . Wired . Consultado el 27 de junio de 2017 .
- ↑ "Una red neuronal para la traducción automática a escala de producción" . Blog de IA de Google . 27 de septiembre de 2016. Consultado el 25 de abril de 2020 .
- ↑ Efrati, Amir (13 de junio de 2016). "Las máquinas de Apple también pueden aprender" . The Information . Recuperado el 27 de junio de 2017 .
- ↑ Ranger, Steve (14 de junio de 2016). "iPhone, IA y big data: así es como Apple planea proteger tu privacidad" . ZDNet . Consultado el 27 de junio de 2017 .
- ↑ "¿Puede el contexto semántico global mejorar los modelos de lenguaje neuronales? – Apple" . Revista de aprendizaje automático de Apple . Consultado el 30 de abril de 2020 .
- ↑ Smith, Chris (13 de junio de 2016). "iOS 10: Siri ahora funciona en aplicaciones de terceros y viene con funciones de IA adicionales" . BGR . Consultado el 27 de junio de 2017 .
- ↑ Capes, Tim; Coles, Paul; Conkie, Alistair; Golipour, Ladan; Hadjitarkhani, Abie; Hu, Qiong; Huddleston, Nancy; Hunt, Melvyn; Li, Jiangchuan; Neeracher, Matthias; Prahallad, Kishore (2017-08-20). "Siri On-Device Deep Learning-Guided Unit Selection Text-to-Speech System" . Interspeech 2017. ISCA: 4011–4015 . doi : 10.21437/Interspeech.2017-1798 .
- ↑ Vogels, Werner (30 de noviembre de 2016). "Llevando la magia de la IA de Amazon y Alexa a las aplicaciones en AWS. – All Things Distributed" . www.allthingsdistributed.com . Consultado el 27 de junio de 2017 .
- ↑ Xiong, W.; Wu, L.; Alleva, F.; Droppo, J.; Huang, X.; Stolcke, A. (abril de 2018). "El sistema de reconocimiento de voz conversacional de Microsoft 2017". Conferencia Internacional IEEE de 2018 sobre Acústica, Habla y Procesamiento de Señales (ICASSP) . IEEE. págs. 5934–5938 . arXiv : 1708.06073 . doi : 10.1109/ICASSP.2018.8461870 . ISBN 978-1-5386-4658-8.
- 1 2 3 4 5 6 Schmidhuber, Juergen (10 de mayo de 2021). "Aprendizaje profundo: nuestro año milagroso 1990-1991". arXiv : 2005.05744 [ cs.NE ].
- ↑ Mozer, Mike (1989). "Un algoritmo de retropropagación focalizado para el reconocimiento de patrones temporales". Sistemas complejos .
- ↑ Schmidhuber, Juergen (2022). "Historia anotada de la IA moderna y el aprendizaje profundo". arXiv : 2212.11279 [ cs.NE ].
- ↑ Sepp Hochreiter ; Jürgen Schmidhuber (21 de agosto de 1995), Memoria a largo plazo , Wikidata Q98967430
- 1 2 3 Klaus Greff; Rupesh Kumar Srivastava; Jan Koutník; Bas R. Steunebrink; Jürgen Schmidhuber (2015). "LSTM: Una odisea en el espacio de búsqueda". IEEE Transactions on Neural Networks and Learning Systems . 28 (10): 2222– 2232. arXiv : 1503.04069 . Bibcode : 2015arXiv150304069G . doi : 10.1109/TNNLS.2016.2582924 . PMID 27411231 . S2CID 3356463 .
- 1 2 3 Gers, Felix; Schmidhuber, Jürgen; Cummins, Fred (1999). "Aprender a olvidar: predicción continua con LSTM". 9.ª Conferencia Internacional sobre Redes Neuronales Artificiales: ICANN '99 . Vol. 1999. págs. 850–855 . doi : 10.1049/cp:19991218 . ISBN 0-85296-721-7.
- ↑ Cho, Kyunghyun; van Merrienboer, Bart; Gulcehre, Caglar; Bahdanau, Dzmitry; Bougares, Fethi; Schwenk, Holger; Bengio, Yoshua (2014). "Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation". arXiv : 1406.1078 [ cs.CL ].
- ^ Srivastava, Rupesh Kumar; Greff, Klaus; Schmidhuber, Jürgen (2 de mayo de 2015). "Redes de Carreteras". arXiv : 1505.00387 [ cs.LG ].
- ↑ Srivastava, Rupesh K; Greff, Klaus; Schmidhuber, Juergen (diciembre de 2015). Escrito en Montreal, Canadá. Entrenamiento de redes neuronales muy profundas . NIPS'15: Actas de la 29.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal. Vol. 2. Cambridge, MA, Estados Unidos: MIT Press. págs. 2377–2385 .
- ↑ Schmidhuber, Jürgen (2021). "Las redes neuronales más citadas se basan en trabajos realizados en mis laboratorios" . Blog de IA . IDSIA, Suiza . Consultado el 30 de abril de 2022 .
- ↑ He, Kaiming; Zhang, Xiangyu; Ren, Shaoqing; Sun, Jian (2016). "Aprendizaje residual profundo para el reconocimiento de imágenes". Conferencia IEEE de 2016 sobre visión por computadora y reconocimiento de patrones (CVPR) . IEEE. págs. 770–778 . arXiv : 1512.03385 . doi : 10.1109/CVPR.2016.90 . ISBN 978-1-4673-8851-1.
- ^ Beck, Maximiliano; Pöppel, korbiniano; Sparing, Markus; Auer, Andreas; Prudnikova, Oleksandra; Kopp, Michael; Klambauer, Günter; Brandstetter, Johannes; Hochreiter, Sepp (7 de mayo de 2024). "xLSTM: memoria extendida a largo plazo". arXiv : 2405.04517 [ cs.LG ].
- ^ NX-AI/xlstm , NXAI, 4 de junio de 2024 , consultado el 4 de junio de 2024
- ↑ Hochreiter, S.; Younger, AS; Conwell, PR (2001). "Aprender a aprender usando el descenso de gradiente". Redes neuronales artificiales — ICANN 2001 (PDF) . Notas de clase en ciencias de la computación. Vol. 2130. págs. 87–94 . CiteSeerX 10.1.1.5.323 . doi : 10.1007/3-540-44668-0_13 . ISBN 978-3-540-42486-4. ISSN 0302-9743 . S2CID 52872549 .
- ↑ Graves, Alex; Beringer, Nicole; Eck, Douglas; Schmidhuber, Juergen (2004). Reconocimiento de voz biológicamente plausible con redes neuronales LSTM . Taller sobre enfoques de inspiración biológica para la tecnología de la información avanzada, Bio-ADIT 2004, Lausana, Suiza. págs. 175–184 .
- ↑ Wierstra, Daan; Foerster, Alexander; Peters, Jan; Schmidhuber, Juergen (2005). "Resolución de POMDP de memoria profunda con gradientes de política recurrentes" . Conferencia Internacional sobre Redes Neuronales Artificiales ICANN'07 .
- ↑ Bayer, Justin; Wierstra, Daan; Togelius, Julian; Schmidhuber, Juergen (2009). "Evolución de las estructuras de las células de memoria para el aprendizaje de secuencias". Conferencia Internacional sobre Redes Neuronales Artificiales ICANN'09, Chipre .
- ↑ Graves, A.; Liwicki, M.; Fernández, S.; Bertolami, R.; Bunke, H.; Schmidhuber, J. (mayo de 2009). "Un novedoso sistema conexionista para el reconocimiento de escritura a mano sin restricciones". IEEE Transactions on Pattern Analysis and Machine Intelligence . 31 (5): 855– 868. Bibcode : 2009ITPAM..31..855G . CiteSeerX 10.1.1.139.4502 . doi : 10.1109 /tpami.2008.137 . ISSN 0162-8828 . PMID 19299860. S2CID 14635907 .
- ↑ Märgner, Volker; Abed, Haikal El (julio de 2009). «Concurso de reconocimiento de escritura a mano en árabe ICDAR 2009». 10.ª Conferencia Internacional sobre Análisis y Reconocimiento de Documentos , 2009. págs. 1383–1387 . doi : 10.1109/ICDAR.2009.256 . ISBN 978-1-4244-4500-4. S2CID 52851337 .
- ↑ Baytas, Inci M.; Xiao, Cao; Zhang, Xi; Wang, Fei; Jain, Anil K.; Zhou, Jiayu (2017-08-04). "Subtipificación de pacientes mediante redes LSTM sensibles al tiempo" . Actas de la 23.ª Conferencia Internacional ACM SIGKDD sobre Descubrimiento de Conocimiento y Minería de Datos . Nueva York, NY, EE. UU.: Association for Computing Machinery. págs. 65–74 . doi : 10.1145/3097983.3097997 . ISBN 978-1-4503-4887-4.
- ↑ Kaplan, Jared; McCandlish, Sam; Henighan, Tom; Brown, Tom B.; Chess, Benjamin; Child, Rewon; Gray, Scott; Radford, Alec; Wu, Jeffrey; Amodei, Dario (2020). "Leyes de escala para modelos de lenguaje neuronal". arXiv : 2001.08361 [ cs.LG ].
Lecturas adicionales
- Sherstinsky, Alex (2018). "Fundamentos de la red neuronal recurrente (RNN) y la red de memoria a corto y largo plazo (LSTM)". arXiv : 1808.03314 [ cs.LG ].
- Monner, Derek D.; Reggia, James A. (2010). "Un algoritmo de entrenamiento generalizado tipo LSTM para redes neuronales recurrentes de segundo orden" (PDF) . Neural Networks . 25 (1): 70– 83. doi : 10.1016/j.neunet.2011.07.003 . PMC 3217173. PMID 21803542. Archivado del original (PDF) el 23 de abril de 2013.
Extensión de alto rendimiento de LSTM que se ha simplificado a un solo tipo de nodo y puede entrenar arquitecturas arbitrarias
. - Gers, Felix A.; Schraudolph, Nicol N.; Schmidhuber, Jürgen (agosto de 2002). "Aprendizaje de sincronización precisa con redes recurrentes LSTM" (PDF) . Journal of Machine Learning Research . 3 : 115–143 .
- Gers, Felix (2001). "Memoria a corto y largo plazo en redes neuronales recurrentes" (PDF) . Tesis doctoral .
- Abidogun, Olusola Adeniyi (2005). Minería de datos, detección de fraude y telecomunicaciones móviles: análisis de patrones de llamadas con redes neuronales no supervisadas . Tesis de maestría (Tesis). Universidad del Cabo Occidental. hdl : 11394/249 . Archivado (PDF) del original el 22 de mayo de 2012.
- Original con dos capítulos dedicados a explicar las redes neuronales recurrentes, especialmente las LSTM.
Enlaces externos
- Redes neuronales recurrentes con más de 30 artículos sobre LSTM del grupo de Jürgen Schmidhuber en IDSIA.
- Zhang, Aston; Lipton, Zachary; Li, Mu; Smola, Alexander J. (2024). "10.1. Memoria a corto y largo plazo (LSTM)" . Sumérgete en el aprendizaje profundo . Cambridge, Nueva York, Puerto Rico, Melbourne, Nueva Delhi, Singapur: Cambridge University Press. ISBN 978-1-009-38943-3.
- Arquitecturas de redes neuronales
- Aprendizaje profundo
- 1997 en inteligencia artificial