En las redes neuronales artificiales , las redes neuronales recurrentes ( RNN ) están diseñadas para procesar datos secuenciales, como texto, voz y series temporales , [ 1 ] donde el orden de los elementos es importante. A diferencia de las redes neuronales de propagación directa , que procesan las entradas de forma independiente, las RNN utilizan conexiones recurrentes, donde la salida de una neurona en un instante se retroalimenta como entrada a la red en el siguiente instante. Esto permite a las RNN capturar dependencias temporales y patrones dentro de las secuencias.
El componente fundamental de las RNN es la unidad recurrente , que mantiene un estado oculto —una forma de memoria que se actualiza en cada paso de tiempo en función de la entrada actual y el estado oculto anterior—. Este mecanismo de retroalimentación permite que la red aprenda de entradas pasadas e incorpore ese conocimiento a su procesamiento actual. Las RNN se han aplicado con éxito a tareas como el reconocimiento de escritura a mano conectada y no segmentada , [ 2 ] el reconocimiento de voz , [ 3 ] [ 4 ] el procesamiento del lenguaje natural y la traducción automática neuronal . [ 5 ] [ 6 ]
Sin embargo, las RNN tradicionales sufren del problema del gradiente evanescente , que limita su capacidad para aprender dependencias de largo alcance. Este problema se abordó con el desarrollo de la arquitectura de memoria a corto y largo plazo (LSTM) en 1997, convirtiéndola en la variante estándar de RNN para el manejo de dependencias de largo plazo. Posteriormente, se introdujeron las unidades recurrentes con compuertas (GRU) como una alternativa computacionalmente más eficiente.
En los últimos años, los transformadores , que se basan en mecanismos de autoatención en lugar de recurrencia, se han convertido en la arquitectura dominante para muchas tareas de procesamiento de secuencias, especialmente en el procesamiento del lenguaje natural, debido a su manejo superior de dependencias de largo alcance y su mayor paralelización. No obstante, las redes neuronales recurrentes (RNN) siguen siendo relevantes para aplicaciones donde la eficiencia computacional, el procesamiento en tiempo real o la naturaleza inherentemente secuencial de los datos son cruciales.
Historia
Antes de la era moderna
Uno de los orígenes de RNN fue la neurociencia. La palabra "recurrente" se usa para describir estructuras en forma de bucle en anatomía . En 1901, Cajal observó "semicírculos recurrentes" en la corteza cerebelosa formados por fibras paralelas , células de Purkinje y células granulares . [ 7 ] [ 8 ] En 1933, Lorente de Nó descubrió "conexiones recurrentes y recíprocas" mediante el método de Golgi y propuso que los bucles excitatorios explican ciertos aspectos del reflejo vestíbulo-ocular . [ 9 ] [ 10 ] Durante la década de 1940, varias personas propusieron la existencia de retroalimentación en el cerebro, lo que contrastaba con la comprensión previa del sistema neural como una estructura puramente de alimentación directa. Hebb consideró el "circuito reverberante" como una explicación para la memoria a corto plazo. [ 11 ] El artículo de McCulloch y Pitts (1943), que propuso el modelo neuronal de McCulloch-Pitts , consideró redes que contienen ciclos. La actividad actual de tales redes puede verse afectada por la actividad indefinidamente lejana en el pasado. [ 12 ] Ambos estaban interesados en los bucles cerrados como posibles explicaciones para, por ejemplo, la epilepsia y la causalgia . [ 13 ] [ 14 ] La inhibición recurrente se propuso en 1946 como un mecanismo de retroalimentación negativa en el control motor. Los bucles de retroalimentación neuronal fueron un tema común de discusión en las conferencias de Macy . [ 15 ] Véase [ 16 ] para una revisión extensa de los modelos de redes neuronales recurrentes en neurociencia.

En 1960, Frank Rosenblatt publicó "perceptrones de bucle cerrado acoplados cruzadamente", que son redes de perceptrones de tres capas cuya capa intermedia contiene conexiones recurrentes que cambian según una regla de aprendizaje hebbiana . [ 18 ] : 73–75 Posteriormente, en Principios de Neurodinámica (1961), describió redes de perceptrones "acopladas cruzadamente en bucle cerrado" y "acopladas hacia atrás", y realizó estudios teóricos y experimentales sobre el aprendizaje hebbiano en estas redes, [ 17 ] : Capítulo 19, 21 y señaló que una red de perceptrones totalmente acoplada cruzadamente es equivalente a una red de alimentación directa infinitamente profunda. [ 17 ] : Sección 19.11
Redes similares fueron publicadas por Kaoru Nakano en 1971, [ 19 ] [ 20 ] Shun'ichi Amari en 1972, [ 21 ] y William A. Little en 1974, [ 22 ] a quien Hopfield reconoció en su artículo de 1982.
Otro origen de las RNN fue la mecánica estadística . El modelo de Ising fue desarrollado por Wilhelm Lenz [ 23 ] y Ernst Ising [ 24 ] en la década de 1920 [ 25 ] como un modelo mecánico estadístico simple de imanes en equilibrio. Glauber, en 1963, estudió el modelo de Ising evolucionando en el tiempo, como un proceso hacia el equilibrio ( dinámica de Glauber ), añadiendo el componente temporal. [ 26 ]
El modelo de vidrio de espín de Sherrington-Kirkpatrick, publicado en 1975, [ 27 ] es la red de Hopfield con inicialización aleatoria. Sherrington y Kirkpatrick encontraron que es muy probable que la función de energía del modelo SK tenga muchos mínimos locales. En el artículo de 1982, Hopfield aplicó esta teoría recientemente desarrollada para estudiar la red de Hopfield con funciones de activación binarias. [ 28 ] En un artículo de 1984, la extendió a funciones de activación continuas. [ 29 ] Se convirtió en un modelo estándar para el estudio de redes neuronales mediante mecánica estadística. [ 30 ] [ 31 ]
Moderno
Las redes RNN modernas se basan principalmente en dos arquitecturas: LSTM y BRNN. [ 32 ]
En el resurgimiento de las redes neuronales en la década de 1980, se volvieron a estudiar las redes recurrentes. A veces se las denominaba "redes iteradas". [ 33 ] Dos trabajos influyentes iniciales fueron la red de Jordan (1986) y la red de Elman (1990), que aplicaron RNN al estudio de la psicología cognitiva . En 1993, un sistema de compresor de historial neuronal resolvió una tarea de "aprendizaje muy profundo" que requería más de 1000 capas subsiguientes en una RNN desplegada en el tiempo. [ 34 ]
Las redes de memoria a corto y largo plazo (LSTM) fueron inventadas por Hochreiter y Schmidhuber en 1995 y establecieron récords de precisión en múltiples dominios de aplicación. [ 35 ] [ 36 ] Se convirtió en la opción predeterminada para la arquitectura RNN.
Las redes neuronales recurrentes bidireccionales (BRNN) utilizan dos RNN que procesan la misma entrada en direcciones opuestas. [ 37 ] Estas dos se combinan a menudo, dando lugar a la arquitectura LSTM bidireccional.
Alrededor de 2006, las LSTM bidireccionales comenzaron a revolucionar el reconocimiento de voz , superando a los modelos tradicionales en ciertas aplicaciones de voz. [ 38 ] [ 39 ] También mejoraron el reconocimiento de voz de vocabulario amplio [ 3 ] [ 4 ] y la síntesis de texto a voz [ 40 ] y se utilizaron en la búsqueda por voz de Google y el dictado en dispositivos Android . [ 41 ] Rompieron récords en la mejora de la traducción automática , [ 42 ] el modelado del lenguaje [ 43 ] y el procesamiento del lenguaje multilingüe. [ 44 ] Además, las LSTM combinadas con redes neuronales convolucionales (CNN) mejoraron la generación automática de subtítulos de imágenes . [ 45 ]
La idea de la transducción de secuencias codificador-decodificador se desarrolló a principios de la década de 2010. Los artículos más citados como los originadores de seq2seq son dos artículos de 2014. [ 46 ] [ 47 ] Una arquitectura seq2seq emplea dos RNN, típicamente LSTM, un "codificador" y un "decodificador", para la transducción de secuencias, como la traducción automática. Se convirtieron en el estado del arte en traducción automática y fueron fundamentales en el desarrollo de mecanismos de atención y transformadores .
Configuraciones
Un modelo basado en RNN se puede dividir en dos partes: configuración y arquitectura. Varias RNN se pueden combinar en un flujo de datos, y el flujo de datos en sí constituye la configuración. Cada RNN puede tener cualquier arquitectura, incluyendo LSTM, GRU, etc.
Estándar

Las RNN vienen en muchas variantes. En abstracto, una RNN es una funciónde tipo, dónde
- : vector de entrada;
- : vector oculto;
- : vector de salida;
- : parámetros de la red neuronal.
En otras palabras, es una red neuronal que mapea una entradaen una salida, con el vector ocultoDesempeña el papel de "memoria", un registro parcial de todos los pares de entrada-salida anteriores. En cada paso, transforma la entrada en una salida y modifica su "memoria" para optimizar el procesamiento futuro.
La ilustración de la derecha puede resultar engañosa para muchos, ya que las topologías prácticas de las redes neuronales suelen estar organizadas en "capas" y el dibujo da esa impresión. Sin embargo, lo que parecen ser capas son, de hecho, diferentes etapas en el tiempo, "desplegadas" para producir la apariencia de capas .
Red neuronal recurrente apilada

Una RNN apilada , o RNN profunda , está compuesta por múltiples RNN apiladas una encima de la otra. En abstracto, se estructura de la siguiente manera:
- La capa 1 tiene un vector oculto, parámetrosy mapas.
- La capa 2 tiene un vector oculto, parámetrosy mapas.
- ...
- Capatiene vector oculto, parámetrosy mapas.
Cada capa funciona como una RNN independiente, y la secuencia de salida de cada capa se utiliza como secuencia de entrada para la capa superior. No existe un límite conceptual para la profundidad de las RNN apiladas.
Bidireccional

Una RNN bidireccional (biRNN) se compone de dos RNN, una que procesa la secuencia de entrada en una dirección y otra en la dirección opuesta. En abstracto, se estructura de la siguiente manera:
- Los procesos RNN hacia adelante se realizan en una dirección:
- Los procesos RNN hacia atrás en la dirección opuesta:
Las dos secuencias de salida se concatenan para obtener la salida total:.
La RNN bidireccional permite que el modelo procese un token tanto en el contexto de lo que lo precedió como de lo que lo siguió. Al apilar varias RNN bidireccionales, el modelo puede procesar un token de forma cada vez más contextual. El modelo ELMo (2018) [ 48 ] es una LSTM bidireccional apilada que toma como entrada caracteres y produce incrustaciones a nivel de palabra.
Codificador-decodificador



Dos RNN pueden ejecutarse de adelante hacia atrás en una configuración codificador-decodificador . La RNN codificadora procesa una secuencia de entrada en una secuencia de vectores ocultos, y la RNN decodificadora procesa la secuencia de vectores ocultos en una secuencia de salida, con un mecanismo de atención opcional. Esto se utilizó para construir traductores automáticos neuronales de última generación durante el período 2014-2017. Este fue un paso fundamental hacia el desarrollo de los transformadores . [ 49 ]
PixelRNN
Una RNN puede procesar datos con más de una dimensión. PixelRNN procesa datos bidimensionales, con muchas direcciones posibles. [ 50 ] Por ejemplo, la dirección fila por fila procesa unacuadrícula de vectoresen el siguiente orden:La BiLSTM diagonal utiliza dos LSTM para procesar la misma cuadrícula. Una la procesa desde la esquina superior izquierda hasta la inferior derecha, de modo que procesadependiendo de su estado oculto y el estado de la celda en la parte superior y en el lado izquierdo:yEl otro lo procesa desde la esquina superior derecha hasta la inferior izquierda.
Arquitecturas
Totalmente recurrente

Las redes neuronales totalmente recurrentes (FRNN) conectan las salidas de todas las neuronas con las entradas de todas ellas. En otras palabras, se trata de una red totalmente conectada . Esta es la topología de red neuronal más general, ya que todas las demás topologías pueden representarse estableciendo algunos pesos de conexión a cero para simular la ausencia de conexiones entre dichas neuronas.

Hopfield
La red de Hopfield es una RNN en la que todas las conexiones entre capas tienen el mismo tamaño. Requiere entradas estacionarias y, por lo tanto, no es una RNN general, ya que no procesa secuencias de patrones. Sin embargo, garantiza la convergencia. Si las conexiones se entrenan mediante aprendizaje hebbiano , la red de Hopfield puede funcionar como una memoria direccionable por contenido robusta , resistente a la alteración de las conexiones.
Redes Elman y redes Jordan

Una red de Elman es una red de tres capas (dispuestas horizontalmente como x , y y z en la ilustración) con la adición de un conjunto de unidades de contexto ( u en la ilustración). La capa intermedia (oculta) está conectada a estas unidades de contexto fijas con un peso de uno. [ 51 ] En cada paso de tiempo, la entrada se propaga hacia adelante y se aplica una regla de aprendizaje . Las retroconexiones fijas guardan una copia de los valores anteriores de las unidades ocultas en las unidades de contexto (ya que se propagan a través de las conexiones antes de que se aplique la regla de aprendizaje). De esta manera, la red puede mantener una especie de estado, lo que le permite realizar tareas como la predicción de secuencias que están más allá de la capacidad de un perceptrón multicapa estándar .
Las redes de Jordan son similares a las redes de Elman. Las unidades de contexto se alimentan desde la capa de salida en lugar de la capa oculta. Las unidades de contexto en una red de Jordan también se denominan capa de estado. Tienen una conexión recurrente consigo mismas. [ 51 ]
Las redes de Elman y Jordan también se conocen como "redes recurrentes simples" (SRN, por sus siglas en inglés).
Variables y funciones
- : vector de entrada
- : vector de capa oculta
- : vector "estado",
- : vector de salida
- ,y: matrices de parámetros y vector
- Funciones de activación
Memoria a corto y largo plazo

La memoria a corto y largo plazo (LSTM) es la arquitectura RNN más utilizada. Fue diseñada para resolver el problema del gradiente evanescente . LSTM normalmente se aumenta con puertas recurrentes llamadas "puertas de olvido". [ 54 ] LSTM evita que los errores retropropagados se desvanezcan o exploten. [ 55 ] En cambio, los errores pueden fluir hacia atrás a través de un número ilimitado de capas virtuales desplegadas en el espacio. Es decir, LSTM puede aprender tareas que requieren memoria de eventos que ocurrieron miles o incluso millones de pasos de tiempo discretos antes. Se pueden desarrollar topologías similares a LSTM específicas para cada problema. [ 56 ] LSTM funciona incluso con grandes retrasos entre eventos significativos y puede manejar señales que mezclan componentes de baja y alta frecuencia.
Muchas aplicaciones utilizan pilas de LSTM, [ 57 ] por lo que se denomina "LSTM profunda". A diferencia de los modelos anteriores basados en modelos ocultos de Markov (HMM) y conceptos similares, las LSTM pueden aprender a reconocer lenguajes sensibles al contexto. [ 58 ]
unidad recurrente controlada

La unidad recurrente con compuerta (GRU), introducida en 2014, fue diseñada como una simplificación de la LSTM. Se utilizan en su forma completa y en varias variantes simplificadas. [ 59 ] [ 60 ] Tienen menos parámetros que la LSTM, ya que carecen de una compuerta de salida. [ 61 ]
Se encontró que su desempeño en el modelado de música polifónica y el modelado de señales de voz era similar al de la memoria a corto y largo plazo. [ 62 ] No parece haber una diferencia de desempeño particular entre LSTM y GRU. [ 62 ] [ 63 ]
memoria asociativa bidireccional
Introducida por Bart Kosko , [ 64 ] una red de memoria asociativa bidireccional (BAM) es una variante de una red de Hopfield que almacena datos asociativos como un vector. La bidireccionalidad proviene del paso de la información a través de una matriz y su transpuesta . Por lo general, se prefiere la codificación bipolar a la codificación binaria de los pares asociativos. Recientemente, los modelos BAM estocásticos que utilizan pasos de Markov se han optimizado para aumentar la estabilidad de la red y su relevancia para aplicaciones del mundo real. [ 65 ]
Una red BAM tiene dos capas, cualquiera de las cuales puede ser controlada como entrada para recordar una asociación y producir una salida en la otra capa. [ 66 ]
Estado de eco
Las redes de estado de eco (ESN) tienen una capa oculta aleatoria con conexiones dispersas. Los pesos de las neuronas de salida son la única parte de la red que puede cambiar (entrenarse). Las ESN son buenas para reproducir ciertas series temporales . [ 67 ] Una variante para neuronas de picos se conoce como máquina de estado líquido . [ 68 ]
Recursivo
Una red neuronal recursiva [ 69 ] se crea aplicando el mismo conjunto de pesos recursivamente sobre una estructura diferenciable similar a un grafo, recorriendo la estructura en orden topológico . Estas redes también se entrenan típicamente mediante el modo inverso de diferenciación automática . [ 70 ] [ 71 ] Pueden procesar representaciones distribuidas de la estructura, como términos lógicos . Un caso especial de redes neuronales recursivas es la RNN cuya estructura corresponde a una cadena lineal. Las redes neuronales recursivas se han aplicado al procesamiento del lenguaje natural . [ 72 ] La red neuronal tensorial recursiva utiliza una función de composición basada en tensores para todos los nodos del árbol. [ 73 ]
Máquinas de Turing neuronales
Las máquinas de Turing neuronales (MTN) son un método para extender las redes neuronales recurrentes acoplándolas a recursos de memoria externos con los que interactúan. El sistema combinado es análogo a una máquina de Turing o a una arquitectura de Von Neumann, pero es diferenciable de extremo a extremo, lo que permite entrenarlo eficientemente mediante descenso de gradiente . [ 74 ]
Las computadoras neuronales diferenciables (DNC) son una extensión de las máquinas de Turing neuronales, que permiten el uso de cantidades difusas de cada dirección de memoria y un registro de cronología. [ 75 ]
Los autómatas de pila de redes neuronales (NNPDA) son similares a las NTM, pero las cintas se reemplazan por pilas analógicas que son diferenciables y entrenadas. De esta manera, su complejidad es similar a la de los reconocedores de gramáticas libres de contexto (CFG). [ 76 ]
Las redes neuronales recurrentes son Turing completas y pueden ejecutar programas arbitrarios para procesar secuencias arbitrarias de entradas. [ 77 ]
Capacitación
Profesor obligando

Una RNN se puede entrenar para convertirla en un modelo generativo condicional de secuencias, también conocido como autorregresión .
Concretamente, consideremos el problema de la traducción automática, es decir, dada una secuenciade palabras en inglés, el modelo es producir una secuenciade palabras francesas. Se resolverá mediante un modelo seq2seq .
Ahora, durante el entrenamiento, la mitad del codificador del modelo primero ingeriría, entonces la mitad del decodificador comenzaría a generar una secuenciaEl problema es que si el modelo comete un error al principio, digamos en, entonces es probable que los tokens subsiguientes también sean errores. Esto hace que sea ineficiente para el modelo obtener una señal de aprendizaje, ya que el modelo aprendería principalmente a cambiar.haciapero no los demás.
La forzadura del profesor hace que el decodificador utilice la secuencia de salida correcta para generar la siguiente entrada en la secuencia. Por ejemplo, veríapara generar.
Descenso de gradiente
El descenso de gradiente es un algoritmo de optimización iterativo de primer orden para encontrar el mínimo de una función. En redes neuronales, se puede utilizar para minimizar el término de error cambiando cada peso en proporción a la derivada del error con respecto a ese peso, siempre que las funciones de activación no lineales sean diferenciables .
El método estándar para entrenar RNN mediante descenso de gradiente es el algoritmo de " retropropagación a través del tiempo " (BPTT), que es un caso especial del algoritmo general de retropropagación . Una variante en línea computacionalmente más costosa se denomina "aprendizaje recurrente en tiempo real" o RTRL, [ 78 ] [ 79 ] que es una instancia de diferenciación automática en el modo de acumulación hacia adelante con vectores tangentes apilados. A diferencia de BPTT, este algoritmo es local en el tiempo pero no en el espacio.
En este contexto, local en el espacio significa que el vector de pesos de una unidad se puede actualizar utilizando únicamente la información almacenada en las unidades conectadas y en la propia unidad, de modo que la complejidad de actualización de una sola unidad es lineal con respecto a la dimensionalidad del vector de pesos. Local en el tiempo significa que las actualizaciones se realizan de forma continua (en línea) y dependen únicamente del paso de tiempo más reciente, en lugar de depender de múltiples pasos de tiempo dentro de un horizonte temporal determinado, como en BPTT. Las redes neuronales biológicas parecen ser locales tanto en el tiempo como en el espacio. [ 80 ] [ 81 ]
Para el cálculo recursivo de las derivadas parciales, RTRL tiene una complejidad temporal de O(número de ocultas x número de pesos) por paso de tiempo para calcular las matrices jacobianas , mientras que BPTT solo toma O(número de pesos) por paso de tiempo, a costa de almacenar todas las activaciones hacia adelante dentro del horizonte de tiempo dado. [ 82 ] Existe un híbrido en línea entre BPTT y RTRL con complejidad intermedia, [ 83 ] [ 84 ] junto con variantes para tiempo continuo. [ 85 ]
Un problema importante del descenso de gradiente para las arquitecturas RNN estándar es que los gradientes de error se desvanecen exponencialmente rápido con el tamaño del retardo de tiempo entre eventos importantes. [ 55 ] [ 86 ] LSTM combinado con un método de aprendizaje híbrido BPTT/RTRL intenta superar estos problemas. [ 36 ] Este problema también se resuelve en la red neuronal recurrente independiente (IndRNN) [ 87 ] al reducir el contexto de una neurona a su propio estado pasado y la información entre neuronas puede explorarse en las capas siguientes. Se pueden aprender memorias de diferentes rangos, incluida la memoria a largo plazo, sin los problemas de desvanecimiento y explosión del gradiente.
El algoritmo en línea denominado retropropagación recursiva causal (CRBP) implementa y combina los paradigmas BPTT y RTRL para redes recurrentes locales. [ 88 ] Funciona con la mayoría de las redes recurrentes locales. El algoritmo CRBP puede minimizar el término de error global. Este hecho mejora la estabilidad del algoritmo, proporcionando una visión unificada de las técnicas de cálculo de gradiente para redes recurrentes con retroalimentación local.
Un enfoque para el cálculo de información de gradiente en RNN con arquitecturas arbitrarias se basa en la derivación diagramática de grafos de flujo de señales. [ 89 ] Utiliza el algoritmo por lotes BPTT, basado en el teorema de Lee para cálculos de sensibilidad de red. [ 90 ] Fue propuesto por Wan y Beaufays, mientras que su versión rápida en línea fue propuesta por Campolucci, Uncini y Piazza. [ 90 ]
Clasificación temporal conexionista
La clasificación temporal conexionista (CTC) [ 91 ] es una función de pérdida especializada para entrenar RNN para problemas de modelado de secuencias donde el tiempo es variable. [ 92 ]
Métodos de optimización global
El entrenamiento de los pesos en una red neuronal puede modelarse como un problema de optimización global no lineal . Se puede definir una función objetivo para evaluar la aptitud o el error de un vector de pesos específico de la siguiente manera: Primero, se establecen los pesos de la red según el vector de pesos. A continuación, se evalúa la red con respecto a la secuencia de entrenamiento. Normalmente, la suma de las diferencias al cuadrado entre las predicciones y los valores objetivo especificados en la secuencia de entrenamiento se utiliza para representar el error del vector de pesos actual. Posteriormente, se pueden utilizar técnicas de optimización global arbitrarias para minimizar esta función objetivo.
El método de optimización global más común para entrenar RNN son los algoritmos genéticos , especialmente en redes no estructuradas. [ 93 ] [ 94 ] [ 95 ]
Inicialmente, el algoritmo genético se codifica con los pesos de la red neuronal de una manera predefinida, donde un gen en el cromosoma representa un enlace de peso. Toda la red se representa como un solo cromosoma. La función de aptitud se evalúa de la siguiente manera:
- Cada peso codificado en el cromosoma se asigna al enlace de peso correspondiente de la red.
- El conjunto de entrenamiento se presenta a la red, que propaga las señales de entrada hacia adelante.
- El error cuadrático medio se devuelve a la función de aptitud.
- Esta función impulsa el proceso de selección genética.
La población está compuesta por muchos cromosomas; por lo tanto, se desarrollan muchas redes neuronales diferentes hasta que se cumple un criterio de parada. Un esquema de parada común puede ser:
- Cuando la red neuronal ha aprendido un cierto porcentaje de los datos de entrenamiento.
- Cuando se cumple el valor mínimo del error cuadrático medio.
- Cuando se haya alcanzado el número máximo de generaciones de entrenamiento.
La función de aptitud evalúa el criterio de parada al recibir el recíproco del error cuadrático medio de cada red durante el entrenamiento. Por lo tanto, el objetivo del algoritmo genético es maximizar la función de aptitud, reduciendo el error cuadrático medio.
Se pueden utilizar otras técnicas de optimización global (y/o evolutiva) para buscar un buen conjunto de ponderaciones, como el recocido simulado o la optimización por enjambre de partículas .
Otras arquitecturas
Red neuronal recurrente independiente (IndRNN)
La red neuronal recurrente independiente (IndRNN) [ 87 ] aborda los problemas de desaparición y explosión del gradiente en la RNN totalmente conectada tradicional. Cada neurona en una capa solo recibe su propio estado pasado como información de contexto (en lugar de conectividad completa con todas las demás neuronas en esta capa) y por lo tanto las neuronas son independientes del historial de las demás. La retropropagación del gradiente se puede regular para evitar la desaparición y explosión del gradiente con el fin de mantener la memoria a largo o corto plazo. La información entre neuronas se explora en las siguientes capas. IndRNN se puede entrenar de forma robusta con funciones no lineales no saturadas como ReLU . Las redes profundas se pueden entrenar utilizando conexiones de salto .
Compresor de historial neuronal
El compresor de historial neuronal es una pila no supervisada de RNN. [ 96 ] A nivel de entrada, aprende a predecir su siguiente entrada a partir de las entradas anteriores. Solo las entradas impredecibles de alguna RNN en la jerarquía se convierten en entradas para la RNN de nivel superior, que, por lo tanto, recalcula su estado interno solo en raras ocasiones. Cada RNN de nivel superior estudia así una representación comprimida de la información de la RNN inferior. Esto se hace de tal manera que la secuencia de entrada se puede reconstruir con precisión a partir de la representación del nivel más alto.
El sistema minimiza eficazmente la longitud de la descripción o el logaritmo negativo de la probabilidad de los datos. [ 97 ] Dada una gran predictibilidad aprendible en la secuencia de datos entrantes, la RNN de nivel más alto puede utilizar el aprendizaje supervisado para clasificar fácilmente incluso secuencias profundas con largos intervalos entre eventos importantes.
Es posible destilar la jerarquía de la RNN en dos RNN: el segmentador "consciente" (nivel superior) y el autómata "subconsciente" (nivel inferior). [ 96 ] Una vez que el segmentador ha aprendido a predecir y comprimir entradas que son impredecibles para el autómata, este último puede verse obligado, en la siguiente fase de aprendizaje, a predecir o imitar, mediante unidades adicionales, las unidades ocultas del segmentador, que cambia más lentamente. Esto facilita que el autómata aprenda recuerdos apropiados y que cambian con poca frecuencia a lo largo de intervalos prolongados. A su vez, esto ayuda al autómata a hacer predecibles muchas de sus entradas que antes eran impredecibles, de modo que el segmentador pueda centrarse en los eventos impredecibles restantes. [ 96 ]
En 1992, un modelo generativo superó parcialmente el problema del gradiente evanescente [ 55 ] de la diferenciación automática o retropropagación en redes neuronales. En 1993, dicho sistema resolvió una tarea de "aprendizaje muy profundo" que requería más de 1000 capas subsiguientes en una RNN desplegada en el tiempo. [ 34 ]
Redes neuronales recurrentes de segundo orden
Las RNN de segundo orden utilizan pesos de orden superior.en lugar del estándarLos pesos y los estados pueden ser un producto. Esto permite un mapeo directo a una máquina de estados finitos tanto en el entrenamiento como en la representación. [ 98 ] [ 99 ] La memoria a corto y largo plazo es un ejemplo de esto, pero no tiene tales mapeos formales ni prueba de estabilidad.
Red neuronal recurrente jerárquica
Las redes neuronales recurrentes jerárquicas (HRNN) conectan sus neuronas de diversas maneras para descomponer el comportamiento jerárquico en subprogramas útiles. [ 96 ] [ 100 ] Estas estructuras jerárquicas de la cognición están presentes en las teorías de la memoria presentadas por el filósofo Henri Bergson , cuyas ideas filosóficas han inspirado modelos jerárquicos. [ 101 ]
Las redes neuronales recurrentes jerárquicas son útiles para la previsión , ya que ayudan a predecir los componentes desagregados de la inflación del índice de precios al consumidor (IPC). El modelo HRNN aprovecha la información de los niveles superiores de la jerarquía del IPC para mejorar las predicciones de los niveles inferiores. La evaluación de un conjunto de datos sustancial del índice IPC-U de EE. UU. demuestra el rendimiento superior del modelo HRNN en comparación con varios métodos establecidos de predicción de la inflación . [ 102 ]
Red neuronal perceptrón multicapa recurrente
Generalmente, una red perceptrón multicapa recurrente (RMLPN) consta de subredes en cascada, cada una con múltiples capas de nodos. Cada subred es de alimentación directa, excepto la última capa, que puede tener conexiones de retroalimentación. Cada una de estas subredes está conectada únicamente mediante conexiones de alimentación directa. [ 103 ]
Modelo de múltiples escalas temporales
Una red neuronal recurrente de múltiples escalas temporales (MTRNN) es un modelo computacional basado en redes neuronales que puede simular la jerarquía funcional del cerebro mediante la autoorganización, dependiendo de la conexión espacial entre neuronas y de distintos tipos de actividades neuronales, cada una con propiedades temporales distintas. [ 104 ] [ 105 ] Con actividades neuronales tan variadas, las secuencias continuas de cualquier conjunto de comportamientos se segmentan en primitivas reutilizables, que a su vez se integran de forma flexible en diversos comportamientos secuenciales. La validación biológica de este tipo de jerarquía fue analizada en la teoría de la predicción de la memoria de la función cerebral por Hawkins en su libro Sobre la inteligencia . Dicha jerarquía también concuerda con las teorías de la memoria propuestas por el filósofo Henri Bergson , que se han incorporado a un modelo MTRNN. [ 101 ] [ 106 ]
Redes memristivas
Greg Snider de HP Labs describe un sistema de computación cortical con nanodispositivos memristivos. [ 107 ] Los memristores (resistencias de memoria) se implementan mediante materiales de película delgada en los que la resistencia se ajusta eléctricamente a través del transporte de iones o vacantes de oxígeno dentro de la película. El proyecto SyNAPSE de DARPA ha financiado a IBM Research y HP Labs, en colaboración con el Departamento de Sistemas Cognitivos y Neuronales (CNS) de la Universidad de Boston, para desarrollar arquitecturas neuromórficas que pueden basarse en sistemas memristivos. Las redes memristivas son un tipo particular de red neuronal física que tiene propiedades muy similares a las redes (Little)Hopfield, ya que tienen dinámica continua, una capacidad de memoria limitada y relajación natural a través de la minimización de una función que es asintótica al modelo de Ising . En este sentido, la dinámica de un circuito memristivo tiene la ventaja, en comparación con una red de resistencia-capacitancia, de tener un comportamiento no lineal más interesante. Desde este punto de vista, la ingeniería de redes memristivas analógicas da cuenta de un tipo peculiar de ingeniería neuromórfica en la que el comportamiento del dispositivo depende del cableado o la topología del circuito. La evolución de estas redes puede estudiarse analíticamente utilizando variaciones de la ecuación de Caravelli-Traversa-Di Ventra . [ 108 ]
Tiempo continuo
Una red neuronal recurrente de tiempo continuo (CTRNN) utiliza un sistema de ecuaciones diferenciales ordinarias para modelar los efectos de las entradas en una neurona. Suelen analizarse mediante la teoría de sistemas dinámicos . Muchos modelos RNN en neurociencia son de tiempo continuo. [ 16 ]
Para una neuronaen la red con activaciónLa tasa de cambio de activación viene dada por:
Dónde:
- : Constante de tiempo del nodo postsináptico
- : Activación del nodo postsináptico
- : Tasa de cambio de activación del nodo postsináptico
- : Peso de la conexión desde el nodo presináptico al postsináptico
- : Sigmoide de x, por ejemplo.
- : Activación del nodo presináptico
- : Sesgo del nodo presináptico
- : Entrada (si la hay) al nodo
Las CTRNN se han aplicado a la robótica evolutiva, donde se han utilizado para abordar la visión, [ 109 ] la cooperación, [ 110 ] y el comportamiento cognitivo mínimo. [ 111 ]
Nótese que, según el teorema de muestreo de Shannon , las redes neuronales recurrentes de tiempo discreto pueden considerarse como redes neuronales recurrentes de tiempo continuo donde las ecuaciones diferenciales se han transformado en ecuaciones de diferencias equivalentes . [ 112 ] Esta transformación puede pensarse como ocurriendo después de las funciones de activación del nodo postsináptico.Se han aplicado filtros de paso bajo, pero antes del muestreo.
En realidad, se trata de redes neuronales recursivas con una estructura particular: la de una cadena lineal. Mientras que las redes neuronales recursivas operan sobre cualquier estructura jerárquica, combinando representaciones hijas para formar representaciones padres, las redes neuronales recurrentes operan sobre la progresión lineal del tiempo, combinando el paso de tiempo anterior y una representación oculta para formar la representación del paso de tiempo actual.
Desde una perspectiva de series temporales, las RNN pueden aparecer como versiones no lineales de filtros de respuesta de impulso finito e infinito y también como un modelo exógeno autorregresivo no lineal (NARX). [ 113 ] La RNN tiene una respuesta de impulso infinito mientras que la red neuronal convolucional tiene una respuesta de impulso finito . Ambas clases de redes exhiben un comportamiento dinámico temporal . [ 114 ] Una red recurrente de impulso finito es un grafo dirigido acíclico que puede desplegarse y reemplazarse con una red neuronal estrictamente de alimentación directa, mientras que una red recurrente de impulso infinito es un grafo dirigido cíclico que no puede desplegarse.
El efecto del aprendizaje basado en la memoria para el reconocimiento de secuencias también puede implementarse mediante un modelo más biológico que utiliza el mecanismo de silenciamiento exhibido en neuronas con una actividad de disparo de frecuencia relativamente alta . [ 115 ]
Se pueden añadir estados almacenados adicionales y almacenamiento bajo control directo de la red tanto a redes de impulsos infinitos como de impulsos finitos . Otra red o grafo también puede reemplazar el almacenamiento si incorpora retardos temporales o bucles de retroalimentación. Estos estados controlados se denominan estados controlados o memoria controlada y forman parte de las redes de memoria a corto y largo plazo (LSTM) y las unidades recurrentes controladas . Esto también se conoce como red neuronal de retroalimentación (FNN).
Bibliotecas
Las bibliotecas modernas proporcionan implementaciones optimizadas en tiempo de ejecución de la funcionalidad anterior o permiten acelerar el bucle lento mediante la compilación justo a tiempo .
- Apache Singa
- Caffe : Creado por el Centro de Visión y Aprendizaje de Berkeley (BVLC). Es compatible con CPU y GPU. Desarrollado en C++ , cuenta con interfaces para Python y MATLAB .
- Chainer : Desarrollado íntegramente en Python, con soporte para producción en CPU, GPU y entrenamiento distribuido.
- Deeplearning4j : Aprendizaje profundo en Java y Scala en Spark con soporte para múltiples GPU .
- Flux : incluye interfaces para RNN, incluyendo GRU y LSTM, escritas en Julia .
- Keras : API de alto nivel que proporciona una interfaz para muchas otras bibliotecas de aprendizaje profundo.
- Kit de herramientas cognitivas de Microsoft
- MXNet : un marco de aprendizaje profundo de código abierto que se utiliza para entrenar e implementar redes neuronales profundas.
- PyTorch : Tensores y redes neuronales dinámicas en Python con aceleración por GPU.
- TensorFlow : biblioteca tipo Theano con licencia Apache 2.0 con soporte para CPU, GPU y TPU propietaria de Google , [ 116 ] móvil
- Theano : Una biblioteca de aprendizaje profundo para Python con una API en gran medida compatible con la biblioteca NumPy .
- Torch : Un marco de computación científica con soporte para algoritmos de aprendizaje automático, escrito en C y Lua .
Aplicaciones
Las aplicaciones de las redes neuronales recurrentes incluyen:
- Traducción automática [ 42 ]
- Control de robots [ 117 ]
- Predicción de series temporales [ 118 ] [ 119 ] [ 120 ]
- Reconocimiento de voz [ 121 ] [ 39 ] [ 122 ]
- Síntesis de voz [ 123 ]
- Interfaces cerebro-computadora [ 124 ]
- Detección de anomalías en series temporales [ 125 ]
- Modelo de texto a vídeo [ 126 ]
- Previsión energética [ 127 ]
- Aprendizaje del ritmo [ 128 ]
- Composición musical [ 129 ]
- Aprendizaje de la gramática [ 130 ] [ 58 ] [ 131 ]
- Reconocimiento de escritura a mano [ 132 ] [ 133 ]
- Reconocimiento de acciones humanas [ 134 ]
- Detección de homología de proteínas [ 135 ]
- Predicción de la localización subcelular de proteínas [ 136 ]
- Varias tareas de predicción en el área de gestión de procesos de negocio [ 137 ]
- Predicción en las vías de atención médica [ 138 ]
- Predicciones de disrupciones del plasma de fusión en reactores (código de red neuronal recurrente de fusión (FRNN)) [ 139 ]
Referencias
- ↑ Tealab, Ahmed (1 de diciembre de 2018). "Pronóstico de series temporales mediante metodologías de redes neuronales artificiales: una revisión sistemática" . Future Computing and Informatics Journal . 3 (2): 334– 340. doi : 10.1016/j.fcij.2018.10.003 . ISSN 2314-7288 .
- ↑ Graves, Alex ; Liwicki, Marcus; Fernandez, Santiago; Bertolami, Roman; Bunke, Horst; Schmidhuber, Jürgen (2009). "Un nuevo sistema conexionista para el reconocimiento mejorado de escritura a mano sin restricciones" (PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . 31 (5): 855– 868. CiteSeerX 10.1.1.139.4502 . doi : 10.1109 / tpami.2008.137 . PMID 19299860. S2CID 14635907 .
- 1 2 Sak, Haşim; Senior, Andrew; Beaufays, Françoise (2014). "Arquitecturas de redes neuronales recurrentes de memoria a corto y largo plazo para modelado acústico a gran escala" (PDF) . Google Research.
- 1 2 Li, Xiangang; Wu, Xihong (2014-10-15). "Construcción de redes neuronales recurrentes profundas basadas en memoria a corto y largo plazo para el reconocimiento de voz con vocabulario extenso". arXiv : 1410.4281 [ cs.CL ].
- ↑ Dupond, Samuel (2019). "Una revisión exhaustiva sobre el avance actual de las estructuras de redes neuronales" . Annual Reviews in Control . 14 : 200–230 .
- ^ Abiodun, Oludare Isaac; Jantan, Aman; Omolara, Abiodun Esther; Dada, Kemi Victoria; Mohamed, Nachaat Abdelatif; Arshad, Humaira (1 de noviembre de 2018). "Estado del arte en aplicaciones de redes neuronales artificiales: una encuesta" . Heliyón . 4 (11) e00938. Código Bib : 2018Heliy...400938A . doi : 10.1016/j.heliyon.2018.e00938 . ISSN 2405-8440 . PMC 6260436 . PMID 30519653 .
- ↑ Espinosa-Sánchez, Juan Manuel; Gómez-Marín, Alex; de Castro, Fernando (5 de julio de 2023). "La importancia de la neurociencia de Cajal y Lorente de Nó para el nacimiento de la cibernética" . The Neuroscientist . 31 (1): 14–30 . doi : 10.1177/10738584231179932 . hdl : 10261/348372 . ISSN 1073-8584 . PMID 37403768 .
- ↑ Ramón y Cajal, Santiago (1909). Histología del sistema nervioso del hombre y de las vértebras . vol. II. Biblioteca de colecciones especiales de Foyle King's College de Londres. París : A. Maloine. pag. 149.
- ↑ de NÓ, R. Lorente (1933-08-01). "Arco reflejo vestíbulo-ocular" . Archives of Neurology and Psychiatry . 30 (2): 245. doi : 10.1001/archneurpsyc.1933.02240140009001 . ISSN 0096-6754 .
- ^ Larriva-Sahd, Jorge A. (3 de diciembre de 2014). «Algunas predicciones de Rafael Lorente de Nó 80 años después» . Fronteras en Neuroanatomía . 8 : 147. doi : 10.3389/fnana.2014.00147 . ISSN 1662-5129 . PMC 4253658 . PMID 25520630 .
- ↑ "circuito reverberante" . Oxford Reference . Consultado el 27 de julio de 2024 .
- ↑ McCulloch, Warren S.; Pitts, Walter (diciembre de 1943). "Un cálculo lógico de las ideas inmanentes en la actividad nerviosa" . The Bulletin of Mathematical Biophysics . 5 (4): 115– 133. doi : 10.1007/BF02478259 . ISSN 0007-4985 .
- ↑ Moreno-Díaz, Roberto; Moreno-Díaz, Arminda (abril de 2007). "Sobre el legado de WS McCulloch" . Biosystems . 88 (3): 185– 190. Bibcode : 2007BiSys..88..185M . doi : 10.1016/j.biosystems.2006.08.010 . PMID 17184902 .
- ↑ Arbib, Michael A (diciembre de 2000). "La búsqueda de Warren McCulloch de la lógica del sistema nervioso" . Perspectives in Biology and Medicine . 43 (2): 193– 216. doi : 10.1353/pbm.2000.0001 . ISSN 1529-8795 . PMID 10804585 .
- ↑ Renshaw, Birdsey (1946-05-01). "Efectos centrales de los impulsos centrípetos en los axones de las raíces ventrales espinales" . Journal of Neurophysiology . 9 (3): 191– 204. doi : 10.1152/jn.1946.9.3.191 . ISSN 0022-3077 . PMID 21028162 .
- 1 2 Grossberg, Stephen (22-02-2013). "Redes neuronales recurrentes" . Scholarpedia . 8 (2): 1888. Bibcode : 2013SchpJ...8.1888G . doi : 10.4249/scholarpedia.1888 . ISSN 1941-6016 .
- 1 2 3 Rosenblatt, Frank (1961-03-15). DTIC AD0256582: PRINCIPIOS DE NEURODINÁMICA. PERCEPTRONES Y LA TEORÍA DE LOS MECANISMOS CEREBRAL . Centro de Información Técnica de Defensa.
- ↑ F. Rosenblatt, " Generalización perceptual sobre grupos de transformación ", págs. 63-100 en Sistemas autoorganizados: Actas de una conferencia interdisciplinaria, 5 y 6 de mayo de 1959. Editado por Marshall C. Yovitz y Scott Cameron. Londres, Nueva York, [etc.], Pergamon Press, 1960. ix, 322 págs.
- ↑ Nakano, Kaoru (1971). "Proceso de aprendizaje en un modelo de memoria asociativa". Reconocimiento de patrones y aprendizaje automático . págs. 172–186 . doi : 10.1007/978-1-4615-7566-5_15 . ISBN 978-1-4615-7568-9.
- ↑ Nakano, Kaoru (1972). "Associatron-A Model of Associative Memory". IEEE Transactions on Systems, Man, and Cybernetics . SMC-2 (3): 380– 388. Bibcode : 1972ITSMC...2..380N . doi : 10.1109/TSMC.1972.4309133 .
- ↑ Amari, Shun-Ichi (1972). "Aprendizaje de patrones y secuencias de patrones mediante redes autoorganizadas de elementos umbral". IEEE Transactions . C (21): 1197– 1206.
- ↑ Little, WA (1974). "La existencia de estados persistentes en el cerebro". Mathematical Biosciences . 19 ( 1–2 ): 101–120 . doi : 10.1016/0025-5564(74)90031-5 .
- ^ Lenz, W. (1920), "Beiträge zum Verständnis der magnetischen Eigenschaften in festen Körpern", Physikalische Zeitschrift , 21 : 613–615 .
- ^ Ising, E. (1925), "Beitrag zur Theorie des Ferromagnetismus", Z. Phys. , 31 (1): 253– 258, Bibcode : 1925ZPhy...31..253I , doi : 10.1007/BF02980577 , S2CID 122157319
- ↑ Brush, Stephen G. (1967). "Historia del modelo de Lenz-Ising". Reviews of Modern Physics . 39 (4): 883– 893. Bibcode : 1967RvMP...39..883B . doi : 10.1103/RevModPhys.39.883 .
- ↑ Glauber, Roy J. (febrero de 1963). "Roy J. Glauber "Estadísticas dependientes del tiempo del modelo de Ising"" . Journal of Mathematical Physics . 4 (2): 294– 307. doi : 10.1063/1.1703954 . Consultado el 21-03-2021 .
- ↑ Sherrington, David; Kirkpatrick, Scott (1975-12-29). "Modelo soluble de un vidrio de espín" . Physical Review Letters . 35 (26): 1792– 1796. Bibcode : 1975PhRvL..35.1792S . doi : 10.1103/PhysRevLett.35.1792 . ISSN 0031-9007 .
- ↑ Hopfield, JJ (1982). "Redes neuronales y sistemas físicos con capacidades computacionales colectivas emergentes" . Actas de la Academia Nacional de Ciencias . 79 ( 8): 2554– 2558. Bibcode : 1982PNAS...79.2554H . doi : 10.1073/pnas.79.8.2554 . PMC 346238. PMID 6953413 .
- ↑ Hopfield, JJ (1984). "Las neuronas con respuesta graduada tienen propiedades computacionales colectivas como las de las neuronas de dos estados" . Actas de la Academia Nacional de Ciencias . 81 (10): 3088– 3092. Bibcode : 1984PNAS...81.3088H . doi : 10.1073/pnas.81.10.3088 . PMC 345226. PMID 6587342 .
- ↑ Engel, A.; Broeck, C. van den (2001). Mecánica estadística del aprendizaje . Cambridge, Reino Unido; Nueva York, NY: Cambridge University Press. ISBN 978-0-521-77307-2.
- ↑ Seung, HS; Sompolinsky, H.; Tishby, N. (1992-04-01). "Mecánica estadística del aprendizaje a partir de ejemplos" . Physical Review A. 45 ( 8): 6056– 6091. Bibcode : 1992PhRvA..45.6056S . doi : 10.1103/PhysRevA.45.6056 . PMID 9907706 .
- ↑ Zhang, Aston; Lipton, Zachary; Li, Mu; Smola, Alexander J. (2024). "10. Redes neuronales recurrentes modernas" . Sumérgete en el aprendizaje profundo . Cambridge, Nueva York, Puerto Rico, Melbourne, Nueva Delhi, Singapur: Cambridge University Press. ISBN 978-1-009-38943-3.
- ↑ Rumelhart, David E.; Hinton, Geoffrey E.; Williams, Ronald J. (octubre de 1986). "Aprendizaje de representaciones mediante la retropropagación de errores" . Nature . 323 (6088): 533– 536. Bibcode : 1986Natur.323..533R . doi : 10.1038/323533a0 . ISSN 1476-4687 .
- 1 2 Schmidhuber, Jürgen (1993). Tesis de habilitación: Modelado y optimización de sistemas (PDF) .En la página 150 y siguientes se muestra la asignación de créditos a través del equivalente a 1200 capas en una RNN desplegada.
- ↑ Sepp Hochreiter ; Jürgen Schmidhuber (21 de agosto de 1995), Memoria a largo plazo , Wikidata Q98967430
- 1 2 Hochreiter, Sepp ; Schmidhuber, Jürgen (1 de noviembre de 1997). "Memoria a largo plazo". Computación neuronal . 9 (8): 1735–1780 . doi : 10.1162/neco.1997.9.8.1735 . PMID 9377276 . S2CID 1915014 .
- ↑ Schuster, Mike y Kuldip K. Paliwal. " Redes neuronales recurrentes bidireccionales ". Procesamiento de señales, IEEE Transactions on 45.11 (1997): 2673-2681.2. Awni Hannun, Carl Case, Jared Casper, Bryan Catanzaro, Greg Diamos, Erich Elsen, Ryan
- ↑ Graves, Alex; Schmidhuber, Jürgen (2005-07-01). "Clasificación de fonemas por marco con LSTM bidireccional y otras arquitecturas de redes neuronales". Redes neuronales . IJCNN 2005. 18 (5): 602– 610. CiteSeerX 10.1.1.331.5800 . doi : 10.1016/j.neunet.2005.06.042 . PMID 16112549. S2CID 1856462 .
- 1 2 Fernández, Santiago; Graves, Alex; Schmidhuber, Jürgen (2007). "Una aplicación de redes neuronales recurrentes para la detección discriminativa de palabras clave" . Actas de la 17.ª Conferencia Internacional sobre Redes Neuronales Artificiales . ICANN'07. Berlín, Heidelberg: Springer-Verlag. pp. 220–229 . ISBN 978-3-540-74693-5.
- ↑ Fan, Bo; Wang, Lijuan; Soong, Frank K.; Xie, Lei (2015). "Photo-Real Talking Head with Deep Bidirectional LSTM". Actas de ICASSP 2015 IEEE International Conference on Acoustics, Speech and Signal Processing . págs. 4884–8 . doi : 10.1109/ICASSP.2015.7178899 . ISBN 978-1-4673-6997-8.
- ↑ Sak, Haşim; Senior, Andrew; Rao, Kanishka; Beaufays, Françoise; Schalkwyk, Johan (septiembre de 2015). "Búsqueda por voz de Google: más rápida y precisa" .
- 1 2 Sutskever, Ilya; Vinyals, Oriol; Le, Quoc V. (2014). "Aprendizaje secuencia a secuencia con redes neuronales" (PDF) . Actas electrónicas de la Conferencia sobre Sistemas de Procesamiento de Información Neuronal . 27 : 5346. arXiv : 1409.3215 . Bibcode : 2014arXiv1409.3215S .
- ↑ Jozefowicz, Rafal; Vinyals, Oriol; Schuster, Mike; Shazeer, Noam; Wu, Yonghui (2016-02-07). "Explorando los límites del modelado del lenguaje". arXiv : 1602.02410 [ cs.CL ].
- ↑ Gillick, Dan; Brunk, Cliff; Vinyals, Oriol; Subramanya, Amarnag (2015-11-30). "Procesamiento de lenguaje multilingüe a partir de bytes". arXiv : 1512.00103 [ cs.CL ].
- ↑ Vinyals, Oriol; Toshev, Alexander; Bengio, Samy; Erhan, Dumitru (2014-11-17). "Show and Tell: A Neural Image Caption Generator". arXiv : 1411.4555 [ cs.CV ].
- ↑ Cho, Kyunghyun; van Merrienboer, Bart; Gulcehre, Caglar; Bahdanau, Dzmitry; Bougares, Fethi; Schwenk, Holger; Bengio, Yoshua (2014-06-03). "Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation". arXiv : 1406.1078 [ cs.CL ].
- ↑ Sutskever, Ilya; Vinyals, Oriol; Le, Quoc Viet (14 de diciembre de 2014). "Aprendizaje secuencia a secuencia con redes neuronales". arXiv : 1409.3215 [ cs.CL ].[Primera versión publicada en arXiv el 10 de septiembre de 2014]
- ↑ Peters ME, Neumann M, Iyyer M, Gardner M, Clark C, Lee K, Zettlemoyer L (2018). "Representaciones de palabras contextualizadas profundas". arXiv : 1802.05365 [ cs.CL ].
- ^ Vaswani, Ashish; Shazeer, Noam; Parmar, Niki; Uszkoreit, Jakob; Jones, León; Gómez, Aidan N; Kaiser, Łukasz; Polosukhin, Illia (2017). "La atención es todo lo que necesitas" . Avances en los sistemas de procesamiento de información neuronal . 30 . Curran asociados, Inc.
- ↑ Oord, Aäron van den; Kalchbrenner, Nal; Kavukcuoglu, Koray (11 de junio de 2016). "Redes neuronales recurrentes de píxeles" . Actas de la 33.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 1747–1756 .
- 1 2 Cruse, Holk; Redes neuronales como sistemas cibernéticos , 2.ª edición revisada
- ↑ Elman, Jeffrey L. (1990). "Encontrando estructura en el tiempo" . Cognitive Science . 14 (2): 179– 211. doi : 10.1016/0364-0213(90)90002-E .
- ↑ Jordan, Michael I. (1997-01-01). "Orden serial: un enfoque de procesamiento distribuido en paralelo". Modelos de redes neuronales de la cognición: fundamentos bioconductuales . Avances en psicología. Vol. 121. págs. 471–495 . doi : 10.1016/s0166-4115(97)80111-2 . ISBN 978-0-444-81931-4. S2CID 15375627 .
- ↑ Gers, Felix A.; Schraudolph, Nicol N.; Schmidhuber, Jürgen (2002). "Aprendizaje de sincronización precisa con redes recurrentes LSTM" (PDF) . Journal of Machine Learning Research . 3 : 115–143 . Recuperado el 13 de junio de 2017 .
- ^ Hochreiter , Sepp (1991) . Untersuchungen zu dynamischen neuronalen Netzen (PDF) (Diploma). Instituto f. Informatik, Universidad Técnica de Munich .
- ↑ Bayer, Justin; Wierstra, Daan; Togelius, Julian; Schmidhuber, Jürgen (14 de septiembre de 2009). «Evolución de las estructuras de las células de memoria para el aprendizaje de secuencias». Redes neuronales artificiales – ICANN 2009 (PDF) . Notas de clase en informática. Vol. 5769. Berlín, Heidelberg: Springer. págs. 755–764 . doi : 10.1007/978-3-642-04277-5_76 . ISBN 978-3-642-04276-8.
- ↑ Fernández, Santiago; Graves, Alex; Schmidhuber, Jürgen (2007). "Etiquetado de secuencias en dominios estructurados con redes neuronales recurrentes jerárquicas" (PDF) . Actas de la 20.ª Conferencia Internacional Conjunta sobre Inteligencia Artificial, Ijcai 2007. págs. 774–9 . CiteSeerX 10.1.1.79.1887 .
- 1 2 Gers, Felix A.; Schmidhuber, Jürgen (2001). "LSTM Recurrent Networks Learn Simple Context Free and Context Sensitive Languages" ( PDF) . IEEE Transactions on Neural Networks . 12 (6): 1333– 40. Bibcode : 2001ITNN...12.1333G . doi : 10.1109/72.963769 . PMID 18249962. S2CID 10192330. Archivado del original (PDF) el 6 de julio de 2017. Recuperado el 12 de diciembre de 2017 .
- ↑ Heck, Joel; Salem, Fathi M. (2017-01-12). "Variaciones simplificadas de unidades de compuerta mínimas para redes neuronales recurrentes". arXiv : 1701.03452 [ cs.NE ].
- ↑ Dey, Rahul; Salem, Fathi M. (2017-01-20). "Variantes de compuerta de redes neuronales de unidades recurrentes con compuerta (GRU)". arXiv : 1701.05923 [ cs.NE ].
- ↑ Britz, Denny (27 de octubre de 2015). "Tutorial de redes neuronales recurrentes, parte 4: implementación de una RNN GRU/LSTM con Python y Theano – WildML" . Wildml.com . Consultado el 18 de mayo de 2016 .
- 1 2 Chung, Junyoung; Gulcehre, Caglar; Cho, KyungHyun; Bengio, Yoshua (2014). "Evaluación empírica de redes neuronales recurrentes con compuertas en el modelado de secuencias". arXiv : 1412.3555 [ cs.NE ].
- ↑ Gruber, N.; Jockisch, A. (2020), "¿Son las células GRU más específicas y las células LSTM más sensibles en la clasificación de motivos en texto?", Frontiers in Artificial Intelligence , 3 40, doi : 10.3389/frai.2020.00040 , PMC 7861254 , PMID 33733157 , S2CID 220252321
- ↑ Kosko, Bart (1988). "Memorias asociativas bidireccionales" . IEEE Transactions on Systems, Man, and Cybernetics . 18 (1): 49– 60. Bibcode : 1988ITSMC..18...49K . doi : 10.1109/21.87054 . S2CID 59875735 .
- ↑ Rakkiyappan, Rajan; Chandrasekar, Arunachalam; Lakshmanan, Subramanian; Park, Ju H. (2 de enero de 2015). "Estabilidad exponencial para redes neuronales BAM estocásticas de salto markoviano con retardos variables en el tiempo probabilísticos dependientes del modo y control de impulsos". Complexity . 20 (3): 39– 65. Bibcode : 2015Cmplx..20c..39R . doi : 10.1002/cplx.21503 .
- ↑ Rojas, Rául (1996). Redes neuronales: una introducción sistemática . Springer. pág. 336. ISBN 978-3-540-60505-8.
- ↑ Jaeger, Herbert; Haas, Harald (2004-04-02). "Aprovechamiento de la no linealidad: predicción de sistemas caóticos y ahorro de energía en la comunicación inalámbrica". Science . 304 (5667): 78– 80. Bibcode : 2004Sci...304...78J . CiteSeerX 10.1.1.719.2301 . doi : 10.1126/science.1091277 . PMID 15064413 . S2CID 2184251 .
- ↑ Maass, Wolfgang; Natschläger, Thomas; Markram, Henry (2002). "Computación en tiempo real sin estados estables: un nuevo marco para la computación neuronal basado en perturbaciones" ( PDF) . Neural Computation . 14 (11): 2531– 2560. doi : 10.1162/089976602760407955 . PMID 12433288. S2CID 1045112 .
- ↑ Goller, Christoph; Küchler, Andreas (1996). «Aprendizaje de representaciones distribuidas dependientes de la tarea mediante retropropagación a través de la estructura». Actas de la Conferencia Internacional sobre Redes Neuronales (ICNN'96) . Vol. 1. pág. 347. CiteSeerX 10.1.1.52.4759 . doi : 10.1109/ICNN.1996.548916 . ISBN 978-0-7803-3210-2. S2CID 6536466 .
- ↑ Linnainmaa, Seppo (1970). La representación del error de redondeo acumulativo de un algoritmo como una expansión de Taylor de los errores de redondeo locales (MSc) (en finés). Universidad de Helsinki.
- ↑ Griewank, Andreas; Walther, Andrea (2008). Evaluación de derivadas: Principios y técnicas de diferenciación algorítmica (Segunda edición). SIAM. ISBN 978-0-89871-776-1.
- ↑ Socher, Richard; Lin, Cliff; Ng, Andrew Y.; Manning, Christopher D., "Análisis de escenas naturales y lenguaje natural con redes neuronales recursivas" (PDF) , 28.ª Conferencia Internacional sobre Aprendizaje Automático (ICML 2011)
- ↑ Socher, Richard; Perelygin, Alex; Wu, Jean Y.; Chuang, Jason; Manning, Christopher D.; Ng, Andrew Y.; Potts, Christopher. "Modelos profundos recursivos para la composicionalidad semántica sobre un banco de árboles de sentimiento" (PDF) . Emnlp 2013 .
- ^ Tumbas, Alex; Wayne, Greg; Danihelka, Ivo (2014). "Máquinas neuronales de Turing". arXiv : 1410.5401 [ cs.NE ].
- ↑ Graves, Alex; Wayne, Greg; Reynolds, Malcolm; Harley, Tim; Danihelka, Ivo; Grabska-Barwińska, Agnieszka; Colmenarejo, Sergio Gómez; Grefenstette, Edward; Ramalho, Tiago (2016-10-12). "Computación híbrida usando una red neuronal con memoria externa dinámica" . Nature . 538 ( 7626): 471– 476. Bibcode : 2016Natur.538..471G . doi : 10.1038/nature20101 . ISSN 1476-4687 . PMID 27732574. S2CID 205251479 .
- ↑ Sun, Guo-Zheng; Giles, C. Lee; Chen, Hsing-Hen (1998). "The Neural Network Pushdown Automaton: Architecture, Dynamics and Training". En Giles, C. Lee; Gori, Marco (eds.). Adaptive Processing of Sequences and Data Structures . Lecture Notes in Computer Science. Berlín, Heidelberg: Springer. pp. 296–345 . CiteSeerX 10.1.1.56.8723 . doi : 10.1007/bfb0054003 . ISBN 978-3-540-64341-8.
- ↑ Hyötyniemi, Heikki (1996). "Las máquinas de Turing son redes neuronales recurrentes". Actas de STeP '96/Publicaciones de la Sociedad Finlandesa de Inteligencia Artificial : 13–24 .
- ↑ Robinson, Anthony J.; Fallside, Frank (1987). La red de propagación de errores dinámica impulsada por la utilidad . Informe técnico CUED/F-INFENG/TR.1. Departamento de Ingeniería, Universidad de Cambridge.
- ↑ Williams, Ronald J.; Zipser, D. (1 de febrero de 2013). «Algoritmos de aprendizaje basados en gradientes para redes recurrentes y su complejidad computacional». En Chauvin, Yves; Rumelhart, David E. (eds.). Retropropagación: Teoría, arquitecturas y aplicaciones . Psychology Press. ISBN 978-1-134-77581-1.
- ↑ Schmidhuber, Jürgen (1989-01-01). "Un algoritmo de aprendizaje local para redes recurrentes y de alimentación directa dinámicas". Connection Science . 1 (4): 403– 412. doi : 10.1080/09540098908915650 . S2CID 18721007 .
- ↑ Príncipe, José C.; Euliano, Neil R.; Lefebvre, W. Curt (2000). Sistemas neuronales y adaptativos: fundamentos a través de simulaciones . Wiley. ISBN 978-0-471-35167-2.
- ^ Yann, Ollivier; Tallec, Corentin; Charpiat, Guillaume (28 de julio de 2015). "Formación de redes recurrentes online sin retroceso". arXiv : 1507.07680 [ cs.NE ].
- ↑Schmidhuber, Jürgen (1992-03-01). "A Fixed Size Storage O(n3) Time Complexity Learning Algorithm for Fully Recurrent Continually Running Networks". Neural Computation. 4 (2): 243–248. doi:10.1162/neco.1992.4.2.243. S2CID 11761172.
- ↑Williams, Ronald J. (1989). Complexity of exact gradient computation algorithms for recurrent neural networks (Report). Technical Report NU-CCS-89-27. Boston (MA): Northeastern University, College of Computer Science. Archived from the original on 2017-10-20. Retrieved 2017-07-02.
- ↑Pearlmutter, Barak A. (1989-06-01). "Learning State Space Trajectories in Recurrent Neural Networks". Neural Computation. 1 (2): 263–269. doi:10.1162/neco.1989.1.2.263. S2CID 16813485.
- ↑Hochreiter, Sepp; et al. (15 January 2001). "Gradient flow in recurrent nets: the difficulty of learning long-term dependencies". In Kolen, John F.; Kremer, Stefan C. (eds.). A Field Guide to Dynamical Recurrent Networks. John Wiley & Sons. ISBN 978-0-7803-5369-5.
- 12Li, Shuai; Li, Wanqing; Cook, Chris; Zhu, Ce; Yanbo, Gao (2018). "Independently Recurrent Neural Network (IndRNN): Building a Longer and Deeper RNN". arXiv:1803.04831 [cs.CV].
- ↑Campolucci, Paolo; Uncini, Aurelio; Piazza, Francesco; Rao, Bhaskar D. (1999). "On-Line Learning Algorithms for Locally Recurrent Neural Networks". IEEE Transactions on Neural Networks. 10 (2): 253–271. Bibcode:1999ITNN...10..253C. CiteSeerX 10.1.1.33.7550. doi:10.1109/72.750549. PMID 18252525.
- ↑Wan, Eric A.; Beaufays, Françoise (1996). "Diagrammatic derivation of gradient algorithms for neural networks". Neural Computation. 8: 182–201. doi:10.1162/neco.1996.8.1.182. S2CID 15512077.
- 1 2 Campolucci, Paolo; Uncini, Aurelio; Plaza, Francesco (2000). "Un enfoque de gráfico de flujo de señal para el cálculo de gradiente en línea". Computación neuronal . 12 (8): 1901–1927 . CiteSeerX 10.1.1.212.5406 . doi : 10.1162/089976600300015196 . PMID 10953244 . S2CID 15090951 .
- ↑ Graves, Alex; Fernández, Santiago; Gomez, Faustino J. (2006). "Clasificación temporal conexionista: Etiquetado de datos de secuencias no segmentadas con redes neuronales recurrentes" (PDF) . Actas de la Conferencia Internacional sobre Aprendizaje Automático . pp. 369–376 . CiteSeerX 10.1.1.75.6306 . doi : 10.1145/1143844.1143891 . ISBN 1-59593-383-2.
- ↑ Hannun, Awni (27-11-2017). "Modelado de secuencias con CTC" . Distill . 2 (11) e8. doi : 10.23915/distill.00008 . ISSN 2476-0757 .
- ↑ Gomez, Faustino J.; Miikkulainen, Risto (1999), "Resolución de tareas de control no markoviano con neuroevolución" (PDF) , IJCAI 99 , Morgan Kaufmann , consultado el 5 de agosto de 2017.
- ↑ Syed, Omar (mayo de 1995). Aplicación de algoritmos genéticos a redes neuronales recurrentes para el aprendizaje de parámetros y arquitectura de redes (MSc). Departamento de Ingeniería Eléctrica, Universidad Case Western Reserve.
- ↑ Gomez, Faustino J.; Schmidhuber, Jürgen; Miikkulainen, Risto (junio de 2008). "Evolución neuronal acelerada mediante sinapsis coevolucionadas cooperativamente" (PDF) . Journal of Machine Learning Research . 9 : 937–965 .
- 1 2 3 4 Schmidhuber, Jürgen (1992). "Aprendizaje de secuencias complejas y extendidas mediante el principio de compresión histórica" (PDF) . Neural Computation . 4 (2): 234– 242. doi : 10.1162/neco.1992.4.2.234 . S2CID 18271205. Archivado del original (PDF) el 6 de julio de 2017.
- ↑ Schmidhuber, Jürgen (2015). "Aprendizaje profundo" . Scholarpedia . 10 (11) 32832. Bibcode : 2015SchpJ..1032832S . doi : 10.4249/scholarpedia.32832 .
- ↑ Giles, C. Lee; Miller, Clifford B.; Chen, Dong; Chen, Hsing-Hen; Sun, Guo-Zheng; Lee, Yee-Chun (1992). "Aprendizaje y extracción de autómatas de estados finitos con redes neuronales recurrentes de segundo orden" (PDF) . Neural Computation . 4 (3): 393– 405. doi : 10.1162/neco.1992.4.3.393 . S2CID 19666035 .
- ↑ Omlin, Christian W.; Giles, C. Lee (1996). "Construcción de autómatas deterministas de estados finitos en redes neuronales recurrentes". Journal of the ACM . 45 (6): 937– 972. CiteSeerX 10.1.1.32.2364 . doi : 10.1145/235809.235811 . S2CID 228941 .
- ↑ Paine, Rainer W.; Tani, Jun (1 de septiembre de 2005). "Cómo se autoorganiza el control jerárquico en los sistemas adaptativos artificiales". Adaptive Behavior . 13 (3): 211– 225. doi : 10.1177/105971230501300303 . S2CID 9932565 .
- 1 2 "Burns, Benureau, Tani (2018) Una constante de tiempo adaptativa inspirada en Bergson para el modelo de red neuronal recurrente de múltiples escalas de tiempo. JNNS" .
- ↑ Barkan, Oren; Benchimol, Jonathan; Caspi, Itamar; Cohen, Eliya; Hammer, Allon; Koenigstein, Noam (2023). "Pronóstico de los componentes de la inflación del IPC con redes neuronales recurrentes jerárquicas". International Journal of Forecasting . 39 (3): 1145– 1162. arXiv : 2011.07920 . doi : 10.1016/j.ijforecast.2022.04.009 .
- ↑ Tutschku, Kurt (junio de 1995). Perceptrones multicapa recurrentes para identificación y control: el camino hacia las aplicaciones . Informe de investigación del Instituto de Ciencias de la Computación. Vol. 118. Universidad de Würzburg Am Hubland. CiteSeerX 10.1.1.45.3527 .
- ↑ Yamashita, Yuichi; Tani, Jun (2008-11-07). "Emergencia de jerarquía funcional en un modelo de red neuronal de escala temporal múltiple: un experimento con robot humanoide" . PLOS Computational Biology . 4 (11) e1000220. Bibcode : 2008PLSCB...4E0220Y . doi : 10.1371/journal.pcbi.1000220 . PMC 2570613. PMID 18989398 .
- ↑ Alnajjar, Fady; Yamashita, Yuichi; Tani, Jun (2013). "La conectividad jerárquica y funcional de los mecanismos cognitivos de orden superior: modelo neurorrobótico para investigar la estabilidad y flexibilidad de la memoria de trabajo" . Frontiers in Neurorobotics . 7 :2. doi : 10.3389 /fnbot.2013.00002 . PMC 3575058. PMID 23423881 .
- ↑ "Actas de la 28.ª Conferencia Anual de la Sociedad Japonesa de Redes Neuronales (octubre de 2018)" (PDF) . Archivado del original (PDF) el 9 de mayo de 2020. Consultado el 6 de febrero de 2021 .
- ↑ Snider, Greg (2008), "Computación cortical con nanodispositivos memristivos" , Sci-DAC Review , 10 : 58–65 , archivado del original el 16 de mayo de 2016 , recuperado el 6 de septiembre de 2019.
- ↑ Caravelli, Francesco; Traversa, Fabio Lorenzo; Di Ventra, Massimiliano (2017). "La dinámica compleja de los circuitos memristivos: resultados analíticos y relajación lenta universal". Physical Review E . 95 (2) 022140. arXiv : 1608.08651 . Bibcode : 2017PhRvE..95b2140C . doi : 10.1103/PhysRevE.95.022140 . PMID 28297937 . S2CID 6758362 .
- ↑ Harvey, Inman; Husbands, Phil; Cliff, Dave (1994), " Seeing the light: Artificial evolution, real vision" , 3.ª conferencia internacional sobre simulación del comportamiento adaptativo: de los animales a los animats 3 , págs. 392–401
- ↑ Quinn, Matt (2001). «Comunicación evolutiva sin canales de comunicación dedicados». Avances en Vida Artificial: 6.ª Conferencia Europea, ECAL 2001. págs. 357–366 . doi : 10.1007/3-540-44811-X_38 . ISBN 978-3-540-42567-0.
- ↑ Beer, Randall D. (1997). "La dinámica del comportamiento adaptativo: un programa de investigación" . Robótica y sistemas autónomos . 20 ( 2–4 ): 257–289 . doi : 10.1016/S0921-8890(96)00063-2 .
- ↑ Sherstinsky, Alex (2018-12-07). Bloem-Reddy, Benjamin; Paige, Brooks; Kusner, Matt; Caruana, Rich; Rainforth, Tom; Teh, Yee Whye (eds.). Derivación de la definición de red neuronal recurrente y desenrollado de RNN mediante procesamiento de señales . Taller de crítica y corrección de tendencias en aprendizaje automático en NeurIPS-2018 .
- ↑ Siegelmann, Hava T.; Horne, Bill G.; Giles, C. Lee (1995). "Capacidades computacionales de las redes neuronales recurrentes NARX" . IEEE Transactions on Systems, Man, and Cybernetics - Part B: Cybernetics . 27 (2): 208– 15. CiteSeerX 10.1.1.48.7468 . doi : 10.1109/3477.558801 . PMID 18255858 .
- ↑ Miljanovic, Milos (feb–mar 2012). "Análisis comparativo de redes neuronales de respuesta de impulso recurrente y finita en la predicción de series temporales" (PDF) . Indian Journal of Computer and Engineering . 3 (1).
- ↑ Hodassman, Shiri; Meir, Yuval; Kisos, Karin; Ben-Noam, Itamar; Tugendhaft, Yael; Goldental, Amir; Vardi, Roni; Kanter, Ido (2022-09-29). "Mecanismo de silenciamiento neuronal inspirado en el cerebro para permitir una identificación de secuencia confiable" . Scientific Reports . 12 (1): 16003. arXiv : 2203.13028 . Bibcode : 2022NatSR..1216003H . doi : 10.1038/s41598-022-20337- x . ISSN 2045-2322 . PMC 9523036. PMID 36175466 .
- ↑ Metz, Cade (18 de mayo de 2016). "Google creó sus propios chips para potenciar sus bots de IA" . Wired .
- ↑ Mayer, Hermann; Gómez, Faustino J.; Wierstra, Daan; Nagy, István; Loma, Alois; Schmidhuber, Jürgen (octubre de 2006). "Un sistema para cirugía cardíaca robótica que aprende a hacer nudos utilizando redes neuronales recurrentes". 2006 Conferencia internacional IEEE/RSJ sobre robots y sistemas inteligentes . págs. 543– 548. CiteSeerX 10.1.1.218.3399 . doi : 10.1109/IROS.2006.282190 . ISBN 978-1-4244-0258-8. S2CID 12284900 .
- ↑ Wierstra, Daan; Schmidhuber, Jürgen; Gomez, Faustino J. (2005). "Evolino: Neuroevolución híbrida/Búsqueda lineal óptima para el aprendizaje de secuencias" . Actas de la 19.ª Conferencia Internacional Conjunta sobre Inteligencia Artificial (IJCAI), Edimburgo . págs. 853–8 . OCLC 62330637 .
- ↑ Petneházi, Gábor (2019-01-01). "Redes neuronales recurrentes para la predicción de series temporales". arXiv : 1901.00069 [ cs.LG ].
- ↑ Hewamalage, Hansika; Bergmeir, Christoph; Bandara, Kasun (2020). "Redes neuronales recurrentes para la predicción de series temporales: estado actual y direcciones futuras". International Journal of Forecasting . 37 : 388–427 . arXiv : 1909.00590 . doi : 10.1016/j.ijforecast.2020.06.008 . S2CID 202540863 .
- ↑ Graves, Alex; Schmidhuber, Jürgen (2005). "Clasificación de fonemas por marco con LSTM bidireccional y otras arquitecturas de redes neuronales". Neural Networks . 18 ( 5– 6): 602– 610. CiteSeerX 10.1.1.331.5800 . doi : 10.1016/j.neunet.2005.06.042 . PMID 16112549 . S2CID 1856462 .
- ↑ Graves, Alex; Mohamed, Abdel-rahman; Hinton, Geoffrey E. (2013). "Reconocimiento de voz con redes neuronales recurrentes profundas". 2013 IEEE International Conference on Acoustics, Speech and Signal Processing . pp. 6645–9 . arXiv : 1303.5778 . doi : 10.1109/ICASSP.2013.6638947 . ISBN 978-1-4799-0356-6. S2CID 206741496 .
- ↑ Chang, Edward F.; Chartier, Josh; Anumanchipalli, Gopala K. (24 de abril de 2019). "Síntesis del habla a partir de la decodificación neuronal de oraciones habladas" . Nature . 568 ( 7753): 493–8 . Bibcode : 2019Natur.568..493A . doi : 10.1038/ s41586-019-1119-1 . ISSN 1476-4687 . PMC 9714519. PMID 31019317. S2CID 129946122 .
- ↑ Moses, David A.; Metzger, Sean L.; Liu, Jessie R.; Anumanchipalli, Gopala K.; Makin, Joseph G.; Sun, Pengfei F.; Chartier, Josh; Dougherty, Maximilian E.; Liu, Patricia M.; Abrams, Gary M.; Tu-Chan, Adelyn; Ganguly, Karunesh; Chang, Edward F. (2021-07-15). "Neuroprótesis para la decodificación del habla en una persona paralizada con anartria" . New England Journal of Medicine . 385 (3): 217– 227. doi : 10.1056/NEJMoa2027540 . PMC 8972947. PMID 34260835 .
- ↑ Malhotra, Pankaj; Vig, Lovekesh; Shroff, Gautam; Agarwal, Puneet (abril de 2015). «Redes de memoria a corto y largo plazo para la detección de anomalías en series temporales» . Simposio Europeo sobre Redes Neuronales Artificiales, Inteligencia Computacional y Aprendizaje Automático – ESANN 2015. Ciaco. págs. 89–94 . ISBN 978-2-87587-015-5.
- ↑ "Papers with Code - DeepHS-HDRVideo: Reconstrucción de vídeo de alta velocidad y alto rango dinámico profundo" . paperswithcode.com . Consultado el 13 de octubre de 2022 .
- ↑ Maity, Abhishek; Tukarul, Viraj (23 de enero de 2026). "Pronóstico del consumo de energía mediante redes neuronales recurrentes: un análisis comparativo". arXiv : 2601.17110 [ cs.CY ].
- ↑ Gers, Felix A.; Schraudolph, Nicol N.; Schmidhuber, Jürgen (2002). "Aprendizaje de sincronización precisa con redes recurrentes LSTM" (PDF) . Journal of Machine Learning Research . 3 : 115–143 .
- ↑ Eck, Douglas; Schmidhuber, Jürgen (28 de agosto de 2002). «Aprendiendo la estructura a largo plazo del blues». Redes neuronales artificiales — ICANN 2002. Notas de clase en informática. Vol. 2415. Berlín, Heidelberg: Springer. págs. 284–289 . CiteSeerX 10.1.1.116.3620 . doi : 10.1007/3-540-46084-5_47 . ISBN 978-3-540-46084-8.
- ↑ Schmidhuber, Jürgen; Gers, Felix A.; Eck, Douglas (2002). "Aprendizaje de lenguajes no regulares: una comparación de redes recurrentes simples y LSTM". Neural Computation . 14 (9): 2039– 2041. CiteSeerX 10.1.1.11.7369 . doi : 10.1162/089976602320263980 . PMID 12184841 . S2CID 30459046 .
- ↑ Pérez-Ortiz, Juan Antonio; Gers, Felix A.; Eck, Douglas; Schmidhuber, Jürgen (2003). "Los filtros de Kalman mejoran el rendimiento de las redes LSTM en problemas irresolubles por redes recurrentes tradicionales". Neural Networks . 16 (2): 241– 250. CiteSeerX 10.1.1.381.1992 . doi : 10.1016/s0893-6080(02)00219-8 . PMID 12628609 .
- ↑ Graves, Alex; Schmidhuber, Jürgen (2009). "Reconocimiento de escritura a mano fuera de línea con redes neuronales recurrentes multidimensionales" (PDF) . Advances in Neural Information Processing Systems . Vol. 22, NIPS'22. MIT Press. pp. 545–552 .
- ↑ Graves, Alex; Fernández, Santiago; Liwicki, Marcus; Bunke, Horst; Schmidhuber, Jürgen (2007). «Reconocimiento de escritura a mano en línea sin restricciones con redes neuronales recurrentes» . Actas de la 20.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal . Curran Associates. págs. 577–584 . ISBN 978-1-60560-352-0.
- ↑ Baccouche, Moez; Mamalet, Franck; Wolf, Christian; Garcia, Christophe; Baskurt, Atilla (2011). «Aprendizaje profundo secuencial para el reconocimiento de acciones humanas». En Salah, Albert Ali; Lepri, Bruno (eds.). Comprensión del comportamiento humano . Lecture Notes in Computer Science. Vol. 7065. Ámsterdam, Países Bajos: Springer. pp. 29–39 . doi : 10.1007/978-3-642-25446-8_4 . ISBN 978-3-642-25445-1.
- ↑ Hochreiter, Sepp; Heusel, Martin; Obermayer, Klaus (2007). "Detección rápida de homología de proteínas basada en modelos sin alineación" . Bioinformatics . 23 (14): 1728– 1736. doi : 10.1093/bioinformatics/btm247 . PMID 17488755 .
- ↑ Thireou, Trias; Reczko, Martin (julio de 2007). "Redes bidireccionales de memoria a corto y largo plazo para predecir la localización subcelular de proteínas eucariotas". IEEE /ACM Transactions on Computational Biology and Bioinformatics . 4 (3): 441– 446. Bibcode : 2007ITCBB...4..441T . doi : 10.1109/tcbb.2007.1015 . PMID 17666763. S2CID 11787259 .
- ↑ Tax, Niek; Verenich, Ilya; La Rosa, Marcello; Dumas, Marlon (2017). "Monitoreo predictivo de procesos de negocio con redes neuronales LSTM". Ingeniería avanzada de sistemas de información . Notas de clase en ciencias de la computación. Vol. 10253. pp. 477–492 . arXiv : 1612.02130 . doi : 10.1007/978-3-319-59536-8_30 . ISBN 978-3-319-59535-1. S2CID 2192354 .
- ↑ Choi, Edward; Bahadori, Mohammad Taha; Schuetz, Andy; Stewart, Walter F.; Sun, Jimeng (2016). " Doctor AI: Predicción de eventos clínicos mediante redes neuronales recurrentes" . Actas del taller y conferencia de JMLR . 56 : 301–318 . arXiv : 1511.05942 . PMC 5341604. PMID 28286600 .
- ↑ "La inteligencia artificial ayuda a acelerar el progreso hacia reacciones de fusión eficientes" . Universidad de Princeton . Consultado el 12 de junio de 2023 .
Lecturas adicionales
- Mandic, Danilo P.; Chambers, Jonathon A. (2001). Redes neuronales recurrentes para la predicción: algoritmos de aprendizaje, arquitecturas y estabilidad . Wiley. ISBN 978-0-471-49517-8.
- Grossberg, Stephen (22 de febrero de 2013). "Redes neuronales recurrentes" . Scholarpedia . 8 (2): 1888. Bibcode : 2013SchpJ...8.1888G . doi : 10.4249/scholarpedia.1888 . ISSN 1941-6016 .
- Redes neuronales recurrentes . Lista de artículos sobre RNN del grupo de Jürgen Schmidhuber en el Instituto Dalle Molle para la Investigación en Inteligencia Artificial .
- Arquitecturas de redes neuronales