Articulo de referencia

Interferencia catastrófica

La interferencia catastrófica , también conocida como olvido catastrófico , es la tendencia de una red neuronal artificial a olvidar abrupta y drásticamente la información previ...

La interferencia catastrófica , también conocida como olvido catastrófico , es la tendencia de una red neuronal artificial a olvidar abrupta y drásticamente la información previamente aprendida al aprender información nueva. [ 1 ] [ 2 ]

Las redes neuronales son una parte importante del enfoque conexionista de la ciencia cognitiva . El problema de la interferencia catastrófica al modelar la memoria humana con modelos conexionistas fue originalmente llamado a la atención de la comunidad científica por la investigación de McCloskey y Cohen (1989) [ 1 ] y Ratcliff (1990) [ 2 ] . Es una manifestación radical del dilema de «sensibilidad-estabilidad» [ 3 ] o del dilema de «estabilidad-plasticidad» [ 4 ] . Específicamente, estos problemas se refieren al desafío de crear una red neuronal artificial que sea sensible a la nueva información, pero que no se vea afectada por ella.

Las tablas de búsqueda y las redes conexionistas se sitúan en extremos opuestos del espectro de plasticidad de estabilidad. [ 5 ] Las primeras permanecen completamente estables en presencia de nueva información, pero carecen de la capacidad de generalizar , es decir, de inferir principios generales a partir de nuevas entradas. Por otro lado, las redes conexionistas, como la red de retropropagación estándar , pueden generalizar a entradas no vistas, pero son sensibles a la nueva información. Los modelos de retropropagación pueden compararse con la memoria humana en la medida en que tienen una capacidad de generalización similar , pero estas redes suelen presentar menor estabilidad que la memoria humana. Cabe destacar que estas redes de retropropagación son susceptibles a la interferencia catastrófica. Esto representa un problema al modelar la memoria humana, ya que, a diferencia de estas redes, los humanos normalmente no muestran olvido catastrófico. [ 6 ]

Descubrimiento

El término interferencia catastrófica fue acuñado originalmente por McCloskey y Cohen (1989), pero también fue dado a conocer a la comunidad científica por la investigación de Ratcliff (1990). [ 2 ]

El problema del aprendizaje secuencial : McCloskey y Cohen (1989)

McCloskey y Cohen (1989) señalaron el problema de la interferencia catastrófica durante dos experimentos diferentes con modelado de redes neuronales de retropropagación.

  • Experimento 1: Aprendiendo las sumas de uno y dos.

En su primer experimento, entrenaron una red neuronal de retropropagación estándar con un único conjunto de entrenamiento que constaba de 17 problemas de suma de un dígito (es decir, de 1 + 1 a 9 + 1, y de 1 + 2 a 1 + 9) hasta que la red pudo representarlos y responderlos correctamente. El error entre la salida real y la salida deseada disminuyó progresivamente a lo largo de las sesiones de entrenamiento, lo que reflejó que la red aprendió a representar mejor las salidas objetivo en cada ensayo. A continuación, entrenaron la red con un único conjunto de entrenamiento que constaba de 17 problemas de suma de dos dígitos (es decir, de 2 + 1 a 2 + 9, y de 1 + 2 a 9 + 2) hasta que la red pudo representarlos y responderlos correctamente. Observaron que su procedimiento era similar a cómo un niño aprende las sumas básicas. Tras cada ensayo de aprendizaje de las sumas de dos dígitos, se evaluó el conocimiento de la red sobre las sumas de uno y de dos dígitos. Al igual que con las sumas de uno, la red aprendió fácilmente las sumas de dos dígitos. Sin embargo, McCloskey y Cohen observaron que la red ya no era capaz de responder correctamente a los problemas de suma de uno, incluso después de una sola prueba de aprendizaje con los problemas de suma de dos. El patrón de salida generado en respuesta a las sumas de uno a menudo se parecía más al de un número incorrecto que al de un número correcto. Esto se considera un error considerable. Además, los problemas 2+1 y 1+2, incluidos en ambos conjuntos de entrenamiento, mostraron una alteración drástica incluso durante las primeras pruebas de aprendizaje de las sumas de dos.

  • Experimento 2: Replicación del estudio de Barnes y Underwood (1959) [ 7 ]

En su segundo modelo conexionista, McCloskey y Cohen intentaron replicar el estudio sobre interferencia retroactiva en humanos realizado por Barnes y Underwood (1959). Entrenaron el modelo con listas AB y AC y utilizaron un patrón de contexto en el vector de entrada (patrón de entrada) para diferenciar entre las listas. Específicamente, la red fue entrenada para responder con la respuesta B correcta cuando se le mostraba el estímulo A y el patrón de contexto AB, y para responder con la respuesta C correcta cuando se le mostraba el estímulo A y el patrón de contexto AC. Cuando el modelo se entrenó simultáneamente con los elementos AB y AC, la red aprendió fácilmente todas las asociaciones correctamente. En el entrenamiento secuencial, primero se entrenó la lista AB, seguida de la lista AC. Después de cada presentación de la lista AC, se midió el rendimiento para ambas listas, AB y AC. Descubrieron que la cantidad de entrenamiento en la lista AC del estudio de Barnes y Underwood que condujo a un 50 % de respuestas correctas, condujo a casi un 0 % de respuestas correctas por parte de la red de retropropagación. Además, descubrieron que la red tendía a mostrar respuestas similares al patrón de respuesta C cuando se le pedía que diera el patrón de respuesta B. Esto indicaba que la lista AC aparentemente había sobrescrito la lista AB. Esto podría compararse con aprender la palabra "perro", luego la palabra "taburete" y, finalmente, pensar en la palabra "taburete" al escuchar la palabra "perro".

McCloskey y Cohen intentaron reducir la interferencia mediante diversas manipulaciones, como cambiar el número de unidades ocultas, modificar el valor del parámetro de tasa de aprendizaje, realizar un sobreentrenamiento en la lista AB, congelar ciertos pesos de conexión y cambiar los valores objetivo de 0 a 1 en lugar de 0,1 y 0,9. Sin embargo, ninguna de estas manipulaciones logró reducir satisfactoriamente la interferencia catastrófica que presentaban las redes.

En resumen, McCloskey y Cohen (1989) concluyeron que:

  • Se producirá al menos algún tipo de interferencia siempre que el nuevo aprendizaje altere los pesos involucrados en la representación del aprendizaje anterior.
  • Cuanto mayor sea la cantidad de nuevos aprendizajes, mayor será la alteración de los conocimientos previos.
  • La interferencia fue catastrófica en las redes de retropropagación cuando el aprendizaje era secuencial pero no concurrente.

Restricciones impuestas por las funciones de aprendizaje y olvido : Ratcliff (1990)

Ratcliff (1990) utilizó múltiples conjuntos de modelos de retropropagación aplicados a procedimientos estándar de memoria de reconocimiento, en los que los elementos se aprendieron secuencialmente. [ 2 ] Después de inspeccionar los modelos de rendimiento de reconocimiento, encontró dos problemas principales:

  • La información bien aprendida se olvidó de forma catastrófica a medida que se aprendía nueva información tanto en redes de retropropagación pequeñas como grandes.

Incluso un solo ensayo de aprendizaje con información nueva resultó en una pérdida significativa de la información anterior, en paralelo a los hallazgos de McCloskey y Cohen (1989). [ 1 ] Ratcliff también encontró que los resultados resultantes a menudo eran una mezcla de la entrada anterior y la nueva entrada. En redes más grandes, los elementos aprendidos en grupos (por ejemplo, AB y luego CD) eran más resistentes al olvido que los elementos aprendidos individualmente (por ejemplo, A, luego B y luego C...). Sin embargo, el olvido para los elementos aprendidos en grupos seguía siendo grande. Agregar nuevas unidades ocultas a la red no redujo la interferencia.

  • La capacidad de discriminación entre los elementos estudiados y los elementos no vistos previamente disminuyó a medida que la red aprendía más.

Este hallazgo contradice estudios sobre la memoria humana, que indicaban que la discriminación aumenta con el aprendizaje. Ratcliff intentó mitigar este problema añadiendo «nodos de respuesta» que respondieran selectivamente a estímulos nuevos y antiguos. Sin embargo, este método no funcionó, ya que estos nodos de respuesta se activaban para todos los estímulos. Un modelo que utilizaba un patrón de contexto tampoco logró aumentar la discriminación entre elementos nuevos y antiguos.

Soluciones propuestas

La principal causa de interferencia catastrófica parece ser la superposición en las representaciones en la capa oculta de las redes neuronales distribuidas. [ 8 ] [ 9 ] [ 10 ] En una representación distribuida, cada entrada tiende a crear cambios en los pesos de muchos de los nodos. El olvido catastrófico ocurre porque cuando se cambian muchos de los pesos donde se "almacena el conocimiento", es improbable que el conocimiento previo se mantenga intacto. Durante el aprendizaje secuencial, las entradas se mezclan, y las nuevas entradas se superponen sobre las antiguas. [ 9 ] Otra forma de conceptualizar esto es visualizando el aprendizaje como un movimiento a través de un espacio de pesos. [ 11 ] Este espacio de pesos puede compararse con una representación espacial de todas las combinaciones posibles de pesos que la red podría poseer. Cuando una red aprende por primera vez a representar un conjunto de patrones, encuentra un punto en el espacio de pesos que le permite reconocer todos esos patrones. [ 10 ] Sin embargo, cuando la red aprende un nuevo conjunto de patrones, se moverá a un lugar en el espacio de pesos donde la única preocupación es el reconocimiento de los nuevos patrones. [ 10 ] Para reconocer ambos conjuntos de patrones, la red debe encontrar un lugar en el espacio de pesos adecuado para reconocer tanto los patrones nuevos como los antiguos.

A continuación se presentan varias técnicas que cuentan con respaldo empírico para reducir con éxito la interferencia catastrófica en redes neuronales de retropropagación:

Ortogonalidad

Muchas de las primeras técnicas para reducir la superposición de representaciones implicaban hacer que los vectores de entrada o los patrones de activación de la unidad oculta fueran ortogonales entre sí. Lewandowsky y Li (1995) [ 12 ] observaron que la interferencia entre patrones aprendidos secuencialmente se minimiza si los vectores de entrada son ortogonales entre sí. Se dice que los vectores de entrada son ortogonales entre sí si el producto por pares de sus elementos a través de los dos vectores suma cero. Por ejemplo, se dice que los patrones [0,0,1,0] y [0,1,0,0] son ​​ortogonales porque (0×0 + 0×1 + 1×0 + 0×0) = 0. Una de las técnicas que puede crear representaciones ortogonales en las capas ocultas implica la codificación de características bipolares (es decir, codificación usando -1 y 1 en lugar de 0 y 1). [ 10 ] Los patrones ortogonales tienden a producir menos interferencia entre sí. Sin embargo, no todos los problemas de aprendizaje pueden representarse utilizando este tipo de vectores y algunos estudios informan que el grado de interferencia sigue siendo problemático con vectores ortogonales. [ 2 ]

Técnica de agudeza de nodos

Según French (1991), [ 8 ] la interferencia catastrófica surge en redes de retropropagación de alimentación directa debido a la interacción de las activaciones de los nodos, o superposición de activación, que ocurre en representaciones distribuidas en la capa oculta. Las redes neuronales que emplean representaciones muy localizadas no muestran interferencia catastrófica debido a la falta de superposición en la capa oculta. Por lo tanto, French sugirió que reducir el valor de la superposición de activación en la capa oculta reduciría la interferencia catastrófica en redes distribuidas. Específicamente propuso que esto podría hacerse cambiando las representaciones distribuidas en la capa oculta a representaciones "semidistribuidas". Una representación "semidistribuida" tiene menos nodos ocultos activos, y/o un valor de activación más bajo para estos nodos, para cada representación, lo que hará que las representaciones de las diferentes entradas se superpongan menos en la capa oculta. French recomendó que esto podría hacerse mediante el "ajuste de activación", una técnica que aumenta ligeramente la activación de un cierto número de los nodos más activos en la capa oculta, reduce ligeramente la activación de todas las demás unidades y luego cambia los pesos de la capa de entrada a la capa oculta para reflejar estos cambios de activación (similar a la retropropagación de errores).

Regla de novedad

Kortge (1990) [ 13 ] propuso una regla de aprendizaje para entrenar redes neuronales, llamada "regla de novedad", para ayudar a mitigar la interferencia catastrófica. Como su nombre lo indica, esta regla ayuda a la red neuronal a aprender solo los componentes de una nueva entrada que difieren de una entrada antigua. En consecuencia, la regla de novedad cambia solo los pesos que no estaban dedicados previamente a almacenar información, reduciendo así la superposición en las representaciones en las unidades ocultas. Para aplicar la regla de novedad, durante el aprendizaje el patrón de entrada se reemplaza por un vector de novedad que representa los componentes que difieren. Cuando la regla de novedad se usa en una red de retropropagación estándar, no hay, o se reduce, el olvido de elementos antiguos cuando se presentan nuevos elementos secuencialmente. [ 13 ] Sin embargo, una limitación es que esta regla solo se puede usar con redes autoencoder o autoasociativas, en las que la respuesta objetivo para la capa de salida es idéntica al patrón de entrada.

Redes de preentrenamiento

McRae y Hetherington (1993) [ 9 ] argumentaron que los humanos, a diferencia de la mayoría de las redes neuronales, no abordan nuevas tareas de aprendizaje con un conjunto aleatorio de pesos. Por el contrario, las personas tienden a aportar una gran cantidad de conocimiento previo a una tarea, lo que ayuda a evitar el problema de la interferencia. Demostraron que cuando una red se preentrena con una muestra aleatoria de datos antes de comenzar una tarea de aprendizaje secuencial, este conocimiento previo limitará naturalmente la forma en que se puede incorporar la nueva información. Esto ocurriría porque una muestra aleatoria de datos de un dominio con un alto grado de estructura interna, como el idioma inglés, permitiría capturar las regularidades, o patrones recurrentes, que se encuentran dentro de ese dominio. Dado que el dominio se basa en regularidades, un elemento recién aprendido tenderá a ser similar a la información aprendida previamente, lo que permitirá a la red incorporar nuevos datos con poca interferencia con los datos existentes. Específicamente, un vector de entrada que sigue el mismo patrón de regularidades que los datos previamente entrenados no debería causar un patrón de activación drásticamente diferente en la capa oculta ni alterar drásticamente los pesos.

Ensayo

Robins (1995) [ 14 ] describió que el olvido catastrófico puede prevenirse mediante mecanismos de repaso. Esto significa que, al añadir nueva información, la red neuronal se reentrena con parte de la información previamente aprendida. Sin embargo, en general, la información previamente aprendida  puede no estar disponible para dicho reentrenamiento. Una solución para esto es el "pseudorepaso", en el que la red no se reentrena con los datos previos reales, sino con representaciones de los mismos. Varios métodos se basan en este mecanismo general.

Figura 2: Arquitectura de una red pseudorrecurrente

Redes pseudorrecurrentes

French (1997) propuso una red de retropropagación pseudorecurrente (véase la Figura 2). [ 5 ] En este modelo, la red se divide en dos subredes funcionalmente distintas pero que interactúan. Este modelo está inspirado biológicamente y se basa en la investigación de McClelland et al. (1995) [ 15 ] McClelland y sus colegas sugirieron que el hipocampo y la neocorteza actúan como sistemas de memoria separables pero complementarios, con el hipocampo para el almacenamiento de la memoria a corto plazo y la neocorteza para el almacenamiento de la memoria a largo plazo . La información almacenada inicialmente en el hipocampo puede ser "transferida" a la neocorteza mediante reactivación o reproducción. En la red pseudorecurrente, una de las subredes actúa como un área de procesamiento temprano, similar al hipocampo, y funciona para aprender nuevos patrones de entrada. La otra subred actúa como un área de almacenamiento final, similar a la neocorteza. Sin embargo, a diferencia de McClelland et al. (1995) modelo, el área de almacenamiento final envía representaciones generadas internamente de vuelta al área de procesamiento temprano. Esto crea una red recurrente. French propuso que esta intercalación de representaciones antiguas con nuevas es la única forma de reducir el olvido radical. Dado que el cerebro probablemente no tendría acceso a los patrones de entrada originales, los patrones que se retroalimentarían al neocórtex serían representaciones generadas internamente llamadas pseudopatrones . Estos pseudopatrones son aproximaciones de entradas previas [ 14 ] y pueden intercalarse con el aprendizaje de nuevas entradas.

Memoria autorregenerativa

Inspirados por Robins (1995) [ 14 ] e independientemente de French (1997), [ 5 ] Ans y Rousset (1997) [ 16 ] también propusieron una arquitectura neuronal artificial de dos redes con autorrefresco de memoria que supera la interferencia catastrófica cuando se llevan a cabo tareas de aprendizaje secuenciales en redes distribuidas entrenadas por retropropagación. El principio es aprender nuevos patrones externos concurrentemente con pseudopatrones generados internamente, o 'pseudomemorias', que reflejan la información aprendida previamente. Lo que distingue principalmente a este modelo de aquellos que utilizan el pseudoensayo clásico [ 14 ] [ 5 ] en redes multicapa de alimentación directa es un proceso de reverberación que se utiliza para generar pseudopatrones. Tras varias reinyecciones de actividad a partir de una única semilla aleatoria, este proceso tiende a ascender a atractores de red no lineales que son más adecuados para capturar de forma óptima la estructura profunda del conocimiento distribuido dentro de los pesos de conexión que el único paso de retroalimentación de actividad utilizado en el pseudoensayo. El procedimiento de autorrefresco de la memoria resultó ser muy eficiente en los procesos de transferencia [ 17 ] y en el aprendizaje serial de secuencias temporales de patrones sin olvido catastrófico. [ 18 ]

Reproducción generativa

En los últimos años, el pseudoensayo ha recuperado popularidad gracias al progreso en las capacidades de los modelos generativos profundos . Cuando estos modelos se utilizan para generar los "pseudodatos" que se van a ensayar, este método se conoce como reproducción generativa. [ 19 ] Esta reproducción generativa puede prevenir eficazmente el olvido catastrófico, especialmente cuando se realiza en las capas ocultas en lugar de en el nivel de entrada. [ 20 ] [ 21 ]

Reproducción espontánea

Los conocimientos sobre los mecanismos de consolidación de la memoria durante los procesos de sueño en el cerebro humano y animal llevaron a otros enfoques de inspiración biológica. Mientras que las memorias declarativas se consolidan en el modelo clásico mediante el diálogo hipocampo-neocortical durante la fase NREM del sueño (véase más arriba), se sugirió que algunos tipos de memorias procedimentales no dependen del hipocampo e involucran la fase REM del sueño (por ejemplo, McDevitt et al. (2015), [ 22 ] pero véase MacDonald y Cote (2021) [ 23 ] para la complejidad del tema). Esto inspiró modelos donde las representaciones internas (memorias) creadas por el aprendizaje previo se reproducen espontáneamente durante períodos similares al sueño en la propia red [ 24 ] [ 25 ] (es decir, sin la ayuda de la red secundaria realizada por los enfoques de reproducción generativa mencionados anteriormente).

aprendizaje latente

El aprendizaje latente es una técnica utilizada por Gutstein y Stump (2015) [ 26 ] para mitigar la interferencia catastrófica aprovechando el aprendizaje por transferencia . Este enfoque intenta encontrar codificaciones óptimas para cualquier clase nueva que se vaya a aprender, de modo que tengan la menor probabilidad de interferir catastróficamente con las respuestas existentes. Dada una red que ha aprendido a discriminar entre un conjunto de clases utilizando códigos de salida de corrección de errores (ECOC) [ 27 ] (en contraposición a los códigos 1-hot ), las codificaciones óptimas para las nuevas clases se eligen observando las respuestas promedio de la red a ellas. Dado que estas respuestas promedio surgieron mientras se aprendía el conjunto original de clases sin ninguna exposición a las nuevas clases , se las denomina "codificaciones aprendidas latentemente". Esta terminología toma prestada el concepto de aprendizaje latente , introducido por Tolman en 1930. [ 28 ] En efecto, esta técnica utiliza el aprendizaje por transferencia para evitar interferencias catastróficas, haciendo que las respuestas de una red a nuevas clases sean lo más consistentes posible con las respuestas existentes a las clases ya aprendidas.

consolidación elástica de peso

Kirkpatrick et al. (2017) [ 29 ] propusieron la consolidación elástica de pesos (EWC), un método para entrenar secuencialmente una única red neuronal artificial en múltiples tareas. Esta técnica supone que algunos pesos de la red neuronal entrenada son más importantes para las tareas aprendidas previamente que otros. Durante el entrenamiento de la red neuronal en una nueva tarea, los cambios en los pesos de la red se vuelven menos probables a medida que aumenta su importancia. Para estimar la importancia de los pesos de la red, EWC utiliza mecanismos probabilísticos, en particular la matriz de información de Fisher, pero esto también puede hacerse de otras maneras. [ 30 ] [ 31 ] [ 32 ]

Recuerdo catastrófico

El recuerdo catastrófico, también conocido como sobregeneralización y déjà vu extremo , [ 33 ] se refiere a la tendencia de las redes neuronales artificiales a perder abruptamente la capacidad de discriminar entre datos antiguos y nuevos cuando se trata de un gran número de patrones y la red ya no aprende a reproducir una población específica de patrones, sino que simplemente aprende a "pasar" por alto cualquier entrada que se le dé. [ 34 ] El recuerdo catastrófico puede ocurrir a menudo como resultado de la eliminación de la interferencia catastrófica mediante el uso de un gran conjunto de entrenamiento representativo o suficientes conjuntos de memoria secuenciales (reproducción de memoria o ensayo de datos), lo que lleva a una ruptura en la discriminación entre los patrones de entrada que se han aprendido y los que no. [ 33 ] El problema fue investigado inicialmente por Sharkey y Sharkey (1995), [ 33 ] Robins (1993) [ 34 ] y Ratcliff (1990), [ 2 ] y French (1999). [ 10 ]

Véase también

Referencias

  1. 1 2 3 McCloskey, Michael; Cohen, Neal J. (1989). Interferencia catastrófica en redes conexionistas: El problema del aprendizaje secuencial . Psicología del aprendizaje y la motivación. Vol.  24. págs. 109–165 . doi : 10.1016/S0079-7421(08)60536-8 . ISBN  978-0-12-543324-2.
  2. 1 2 3 4 5 6 Ratcliff, Roger (1990). "Modelos conexionistas de la memoria de reconocimiento: Restricciones impuestas por las funciones de aprendizaje y olvido". Psychological Review . 97 (2): 285– 308. doi : 10.1037/0033-295x.97.2.285 . PMID 2186426 . S2CID 18556305 .  
  3. Hebb, Donald Olding (1949). La organización del comportamiento: una teoría neuropsicológica . Wiley. ISBN 978-0-471-36727-7OCLC 569043119 {{cite book}}: Incompatibilidad de ISBN/Fecha ( ayuda )
  4. Carpenter, Gail A.; Grossberg, Stephen (1 de diciembre de 1987). "ART 2: autoorganización de códigos estables de reconocimiento de categorías para patrones de entrada analógica". Applied Optics . 26 (23): 4919– 4930. Bibcode : 1987ApOpt..26.4919C . doi : 10.1364/AO.26.004919 . PMID 20523470 . 
  5. 1 2 3 4 French, Robert M (diciembre de 1997). "Redes conexionistas pseudorrecurrentes: un enfoque al dilema 'sensibilidad-estabilidad'" . Connection Science . 9 (4): 353– 380. Bibcode : 1997ConSc...9..353F . doi : 10.1080/095400997116595 .
  6. González, Oscar C; Sokolov, Yury; Krishnan, Giri P; Delanois, Jean Erik; Bazhenov, Maxim (4 de agosto de 2020). "¿Puede el sueño proteger los recuerdos del olvido catastrófico?" . eLife . 9 e51005. doi : 10.7554/eLife.51005 . PMC 7440920 . PMID 32748786 .  
  7. Barnes, Jean M.; Underwood, Benton J. (agosto de 1959).El destino de las asociaciones de primera lista en la teoría de la transferencia. Revista de Psicología Experimental . 58 (2): 97– 105. doi : 10.1037/h0047507 . PMID 13796886 . 
  8. 1 2 French, Robert M. (1991). Using Semi-Distributed Representations to Overcome Catastrophic Forgetting in Connectionist Networks (PDF) . Proceedings of the 13th Annual Cognitive Science Society Conference. New Jersey: Lawrence Erlbaum. pp. 173–178 . CiteSeerX 10.1.1.1040.3564 .  
  9. 1 2 3 "Se elimina la interferencia catastrófica en redes preentrenadas" . Actas de la Decimoquinta Conferencia Anual de la Sociedad de Ciencias Cognitivas: del 18 al 21 de junio de 1993, Instituto de Ciencias Cognitivas, Universidad de Colorado-Boulder . Psychology Press. 1993. págs. 723–728 . ISBN  978-0-8058-1487-3.
  10. 1 2 3 4 5 French, R (1 de abril de 1999). "Olvido catastrófico en redes conexionistas". Trends in Cognitive Sciences . 3 (4): 128– 135. doi : 10.1016/S1364-6613(99)01294-2 . PMID 10322466 . S2CID 2691726 .  
  11. Lewandowsky, Stephan (1991). «Desaprendizaje gradual e interferencia catastrófica: una comparación de arquitecturas distribuidas» . En Hockley, William E.; Lewandowsky, Stephan (eds.). Relacionando teoría y datos: ensayos sobre la memoria humana en honor a Bennet B. Murdock . Psychology Press. pp. 445–476 . ISBN  978-1-317-76013-9.
  12. Lewandowsky, Stephan; Li, Shu-Chen (1995). «Interferencia catastrófica en redes neuronales». Interferencia e inhibición en la cognición . págs. 329–361 . doi : 10.1016/B978-012208930-5/50011-8 . ISBN  978-0-12-208930-5.
  13. 1 2 Kortge, CA (1990). Memoria episódica en redes conexionistas. En: Duodécima Conferencia Anual de la Sociedad de Ciencias Cognitivas , (págs. 764-771). Hillsdale, NJ: Lawrence Erlbaum.
  14. 1 2 3 4 Robins, Anthony (junio de 1995). "Olvido catastrófico, ensayo y pseudoensayo". Connection Science . 7 (2): 123– 146. doi : 10.1080/09540099550039318 . S2CID 22882861 . 
  15. McClelland, James L.; McNaughton, Bruce L.; O'Reilly, Randall C. (julio de 1995). "Por qué existen sistemas de aprendizaje complementarios en el hipocampo y la neocorteza: Perspectivas a partir de los éxitos y fracasos de los modelos conexionistas de aprendizaje y memoria". Psychological Review . 102 (3): 419– 457. doi : 10.1037/0033-295X.102.3.419 . PMID 7624455. S2CID 2832081 .  
  16. ^ Respuesta, Bernard; Rousset, Stéphane (diciembre de 1997). "Evitar el olvido catastrófico acoplando dos redes neuronales reverberantes". Cuentas Rendus de la Academia de Ciencias, Serie III . 320 (12): 989– 997. Código bibliográfico : 1997CRASG.320..989A . doi : 10.1016/S0764-4469(97)82472-9 .
  17. Ans, Bernard; Rousset, Stéphane (marzo de 2000). "Redes neuronales con memoria autorrefrescante: transferencia de conocimiento en tareas de aprendizaje secuencial sin olvido catastrófico". Connection Science . 12 (1): 1– 19. Bibcode : 2000ConSc..12....1A . doi : 10.1080/095400900116177 . S2CID 7019649 . 
  18. Ans, Bernard; Rousset, Stéphane; French, Robert M.; Musca, Serban (junio de 2004). "Memoria autorrefrescante en redes neuronales artificiales: aprendizaje de secuencias temporales sin olvido catastrófico" . Connection Science . 16 (2): 71– 99. Bibcode : 2004ConSc..16...71A . doi : 10.1080/09540090412331271199 . S2CID 13462914 . 
  19. Mocanu, Decebal Constantin; Torres Vega, Maria; Eaton, Eric; Stone, Peter; Liotta, Antonio (18 de octubre de 2016). "Divergencia contrastiva en línea con reproducción generativa: reproducción de experiencias sin almacenar datos". arXiv : 1610.05555 [ cs.LG ].
  20. Shin, Hanul; Lee, Jung Kwon; Kim, Jaehong; Kim, Jiwon (diciembre de 2017). Aprendizaje continuo con reproducción generativa profunda . NIPS'17: Actas de la 31.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal. Curran Associates. págs. 2994–3003 . ISBN  978-1-5108-6096-4.
  21. van de Ven, Gido M.; Siegelmann, Hava T.; Tolias, Andreas S. (13 de agosto de 2020). "Reproducción inspirada en el cerebro para el aprendizaje continuo con redes neuronales artificiales" . Nature Communications . 11 (1): 4069. Bibcode : 2020NatCo..11.4069V . doi : 10.1038/s41467-020-17866-2 . PMC 7426273. PMID 32792531 .  
  22. McDevitt, Elizabeth A.; Duggan, Katherine A.; Mednick, Sara C. (2015-07-01). "El sueño REM rescata el aprendizaje de la interferencia" . Neurobiología del aprendizaje y la memoria . Sueño REM y memoria. 122 : 51–62 . doi : 10.1016/j.nlm.2014.11.015 . ISSN 1074-7427 . PMC 4704701. PMID 25498222 .   
  23. MacDonald, Kevin J.; Cote, Kimberly A. (2021-10-01). "Contribuciones del sueño REM y NREM posterior al aprendizaje a la recuperación de la memoria" . Sleep Medicine Reviews . 59 101453. doi : 10.1016/j.smrv.2021.101453 . hdl : 10464/17792 . ISSN 1087-0792 . PMID 33588273 .  
  24. Golden, Ryan; Delanois, Jean Erik; Sanda, Pavel; Bazhenov, Maxim (2022-11-18). "El sueño previene el olvido catastrófico en redes neuronales de picos mediante la formación de una representación conjunta del peso sináptico" . PLOS Computational Biology . 18 (11) e1010628. Bibcode : 2022PLSCB..18E0628G . doi : 10.1371/journal.pcbi.1010628 . ISSN 1553-7358 . PMC 9674146. PMID 36399437 .   
  25. Tadros, Timothy; Krishnan, Giri P.; Ramyaa, Ramyaa; Bazhenov, Maxim (2022-12-15). "La reproducción no supervisada similar al sueño reduce el olvido catastrófico en redes neuronales artificiales" . Nature Communications . 13 (1): 7742. Bibcode : 2022NatCo..13.7742T . doi : 10.1038/s41467-022-34938-7 . ISSN 2041-1723 . PMC 9755223. PMID 36522325 .   
  26. Gutstein, Steven; Stump, Ethan (2015). "Reducción del olvido catastrófico con aprendizaje por transferencia y códigos de salida ternarios". Conferencia Internacional Conjunta sobre Redes Neuronales (IJCNN) de 2015. págs. 1–8 . doi : 10.1109/IJCNN.2015.7280416 . ISBN  978-1-4799-1960-4. S2CID 18745466 . 
  27. Dietterich, TG; Bakiri, G. (1 de enero de 1995). "Resolución de problemas de aprendizaje multiclase mediante códigos de salida de corrección de errores" . Journal of Artificial Intelligence Research . 2 : 263–286 . arXiv : cs/9501101 . doi : 10.1613/jair.105 . S2CID 47109072 . 
  28. Tolman, EC; Honzik, CH (1930)."Perspicacia" en ratas. Publicaciones en Psicología . 4. Universidad de California: 215–232 .
  29. Kirkpatrick, James; Pascanu, Razvan; Rabinowitz, Neil; Veness, Joel; Desjardins, Guillaume; Rusu, Andrei A.; Milan, Kieran; Quan, John; Ramalho, Tiago; Grabska-Barwinska, Agnieszka; Hassabis, Demis; Clopath, Claudia; Kumaran, Dharshan; Hadsell, Raia (14 de marzo de 2017). "Superando el olvido catastrófico en redes neuronales" . Actas de la Academia Nacional de Ciencias . 114 (13): 3521– 3526. arXiv : 1612.00796 . Bibcode : 2017PNAS..114.3521K . doi : 10.1073/pnas.1611835114 . PMC 5380101 . PMID 28292907 .  
  30. Zenke, Friedemann; Poole, Ben; Ganguli, Surya (2017). "Aprendizaje continuo a través de la inteligencia sináptica" . Actas de la investigación en aprendizaje automático . 70 : 3987–3995 . arXiv : 1703.04200 . PMC 6944509. PMID 31909397 .  
  31. Aljundi, Rahaf; Babiloni, Francesca; Elhoseiny, Mohamed; Rohrbach, Marcus; Tuytelaars, Tinne (2018). "Sinapsis conscientes de la memoria: aprender qué (no) olvidar". Visión por computadora – ECCV 2018. Notas de clase en ciencias de la computación. Vol. 11207. págs. 144–161 . arXiv : 1711.09601 . doi : 10.1007/978-3-030-01219-9_9 . ISBN   978-3-030-01218-2. S2CID 4254748 . 
  32. Kutalev, Alexey (2020). "Natural Way to Overcome Catastrophic Forgetting in Neural Networks". Modern Information Technologies and IT-Education . 16 (2): 331– 337. arXiv : 2005.07107 . doi : 10.25559/SITITO.16.202002.331-337 . S2CID 218628670 . 
  33. 1 2 3 Sharkey, Noel E.; Sharkey, Amanda JC (septiembre de 1995). "Retropropagación Discriminación Análisis geométrico Interferencia Modelado de memoria Redes neuronales". Connection Science . 7 ( 3– 4): 301– 330. doi : 10.1080/09540099550039264 . ISSN 0954-0091 . S2CID 35249001 .  
  34. 1 2 Robins, A. (1993). "Olvido catastrófico en redes neuronales: El papel de los mecanismos de ensayo". Actas de la Primera Conferencia Internacional de Nueva Zelanda de Dos Corrientes sobre Redes Neuronales Artificiales y Sistemas Expertos de 1993. pp. 65–68 . doi : 10.1109/ANNES.1993.323080 . ISBN  0-8186-4260-2. S2CID 41831331 .