
Una red de estado de eco ( ESN ) [ 1 ] [ 2 ] es un tipo de computadora de reservorio que utiliza una red neuronal recurrente con una capa oculta escasamente conectada (con una conectividad típica del 1%). La conectividad y los pesos de las neuronas ocultas son fijos y se asignan aleatoriamente. Los pesos de las neuronas de salida se pueden aprender para que la red pueda producir o reproducir patrones temporales específicos. El principal interés de esta red radica en que, si bien su comportamiento es no lineal, los únicos pesos que se modifican durante el entrenamiento son los de las sinapsis que conectan las neuronas ocultas con las neuronas de salida. Por lo tanto, la función de error es cuadrática con respecto al vector de parámetros y se puede diferenciar fácilmente a un sistema lineal.
Alternativamente, se puede considerar una formulación bayesiana no paramétrica de la capa de salida, bajo la cual: (i) se impone una distribución a priori sobre los pesos de salida; y (ii) los pesos de salida se marginalizan en el contexto de la generación de predicciones, dados los datos de entrenamiento. Esta idea se ha demostrado en [ 3 ] mediante el uso de distribuciones a priori gaussianas, con lo cual se obtiene un modelo de proceso gaussiano con una función de núcleo impulsada por ESN. Se demostró que dicha solución supera a las ESN con conjuntos de pesos entrenables (finitos) en varios benchmarks.
Algunas implementaciones eficientes de ESN disponibles públicamente son aureservoir (una biblioteca de C++ para varios tipos con enlaces a python/numpy), MATLAB , ReservoirComputing.jl (una implementación basada en Julia de varios tipos) y pyESN (para ESN simples en Python ).
Fondo
La red de estado de eco (ESN) [ 4 ] pertenece a la familia de redes neuronales recurrentes (RNN) y proporciona su arquitectura y principio de aprendizaje supervisado. A diferencia de las redes neuronales de alimentación directa, las redes neuronales recurrentes son sistemas dinámicos y no funciones. Las redes neuronales recurrentes se utilizan típicamente para:
- Aprendizaje de procesos dinámicos: tratamiento de señales en ingeniería y telecomunicaciones, análisis de vibraciones, sismología y control de motores y generadores.
- Pronóstico y generación de señales: texto, música, señales eléctricas, señales caóticas. [ 5 ]
- Modelado de sistemas biológicos, neurociencias (neurodinámica cognitiva), modelado de la memoria, interfaces cerebro-computadora (BCI), filtrado y procesos de Kalman, aplicaciones militares, modelado de volatilidad, etc.
Para el entrenamiento de RNN se dispone de varios algoritmos de aprendizaje: retropropagación a través del tiempo, aprendizaje recurrente en tiempo real . La convergencia no está garantizada debido a la inestabilidad y los fenómenos de bifurcación. [ 4 ]
El enfoque principal de la ESN consiste, en primer lugar, en operar una red neuronal aleatoria, grande, fija y recurrente con la señal de entrada, que induce una señal de respuesta no lineal en cada neurona dentro de esta red de "reservorio", y en segundo lugar, conectar una señal de salida deseada mediante una combinación lineal entrenable de todas estas señales de respuesta. [ 2 ]
Otra característica de la ESN es su funcionamiento autónomo en la predicción: si se entrena con una entrada que es una versión desplazada hacia atrás de la salida, entonces puede utilizarse para la generación/predicción de señales utilizando la salida anterior como entrada. [ 4 ] [ 5 ]
La idea principal de las ESN está ligada a las máquinas de estado líquido , que fueron desarrolladas de forma independiente y simultánea con las ESN por Wolfgang Maass. [ 6 ] Estas, las ESN y la regla de aprendizaje de decorrelación de retropropagación recientemente investigada para RNN [ 7 ] se resumen cada vez más bajo el nombre de Computación de Reservorio.
Schiller y Steil [ 7 ] también demostraron que en los enfoques de entrenamiento convencionales para RNN, en los que se adaptan todos los pesos (no solo los pesos de salida), los cambios dominantes se producen en los pesos de salida. En neurociencia cognitiva, Peter F. Dominey analizó un proceso relacionado con el modelado del procesamiento de secuencias en el cerebro de los mamíferos, en particular el reconocimiento del habla en el cerebro humano. [ 8 ] La idea básica también incluía un modelo de discriminación de entrada temporal en redes neuronales biológicas. [ 9 ] Una formulación temprana y clara de la idea de computación de reservorio se debe a K. Kirby, quien reveló este concepto en una contribución a una conferencia prácticamente olvidada. [ 10 ] La primera formulación de la idea de computación de reservorio conocida hoy proviene de L. Schomaker, [ 11 ] quien describió cómo se podía obtener una salida objetivo deseada de una RNN aprendiendo a combinar señales de un conjunto configurado aleatoriamente de osciladores neuronales de picos. [ 2 ]
Variantes
Las redes de estado de eco se pueden construir de diferentes maneras. Se pueden configurar con o sin conexiones de entrada a salida directamente entrenables, con o sin retroalimentación de reserva de salida, con diferentes neurotipos, diferentes patrones de conectividad interna del reservorio, etc. El peso de salida se puede calcular para la regresión lineal con todos los algoritmos, ya sean en línea o fuera de línea. Además de las soluciones para errores con cuadrados más pequeños, se utilizan criterios de maximización de margen, las llamadas máquinas de vectores de soporte de entrenamiento, para determinar los valores de salida. [ 12 ] Otras variantes de redes de estado de eco buscan cambiar la formulación para que se ajuste mejor a los modelos comunes de sistemas físicos, como los que típicamente se definen por ecuaciones diferenciales. El trabajo en esta dirección incluye redes de estado de eco que incluyen parcialmente modelos físicos, [ 13 ] redes de estado de eco híbridas, [ 14 ] y redes de estado de eco de tiempo continuo. [ 15 ]
La RNN fija actúa como un medio aleatorio no lineal cuya respuesta dinámica, el "eco", se utiliza como base de señal. La combinación lineal de esta base se puede entrenar para reconstruir la salida deseada minimizando algún criterio de error. [ 2 ]
Las redes de estado de eco cuántico, definidas sobre nodos basados en registros de cúbits, son a su vez universales. [ 16 ] A diferencia de otros algoritmos cuánticos que sufren el ruido intrínseco de las computadoras cuánticas, el ruido de amortiguación de amplitud que afecta, por ejemplo, a los cúbits superconductores, es beneficioso para inducir la propiedad de estado de eco y la memoria de desvanecimiento, por lo que se ha informado experimentalmente del entrenamiento de una red de estado de eco cuántico asistida por ruido cuántico. [ 17 ]
Significado
Las RNN rara vez se usaban en la práctica antes de la introducción de las ESN, debido a la complejidad que implicaba ajustar sus conexiones (por ejemplo, falta de autodiferenciación, susceptibilidad a gradientes evanescentes/explosivos, etc.). Los algoritmos de entrenamiento de RNN eran lentos y a menudo vulnerables a problemas, como errores de ramificación. [ 18 ] Por lo tanto, no se podía garantizar la convergencia. Por otro lado, el entrenamiento de ESN no tiene problemas con la ramificación y es fácil de implementar. En estudios iniciales, se demostró que las ESN tenían un buen desempeño en tareas de predicción de series temporales a partir de conjuntos de datos sintéticos. [ 1 ] [ 19 ]
Hoy en día, muchos de los problemas que hacían que las RNN fueran lentas y propensas a errores se han solucionado con la llegada de las bibliotecas de autodiferenciación (aprendizaje profundo), así como con arquitecturas más estables como la memoria a corto y largo plazo y la unidad recurrente con compuertas ; por lo tanto, la principal ventaja de las ESN se ha perdido. Las RNN también han demostrado su valía en diversas áreas prácticas, como el procesamiento del lenguaje. Para abordar tareas de complejidad similar utilizando métodos de cálculo de reservorio se requiere una memoria excesiva.
Las ESN se utilizan en algunas áreas, como las aplicaciones de procesamiento de señales. En particular, se han utilizado ampliamente como un principio de computación que se integra bien con sustratos informáticos no digitales. Dado que las ESN no necesitan modificar los parámetros de la RNN, permiten utilizar muchos objetos diferentes como su "reservorio" no lineal. Por ejemplo, microchips ópticos, nanoosciladores mecánicos, mezclas de polímeros o incluso extremidades artificiales blandas. [ 2 ]
Referencias
- 1 2 Jaeger, H.; Haas, H. (2004). "Aprovechamiento de la no linealidad: predicción de sistemas caóticos y ahorro de energía en la comunicación inalámbrica" ( PDF) . Science . 304 (5667): 78– 80. Bibcode : 2004Sci...304...78J . doi : 10.1126/science.1091277 . PMID 15064413. S2CID 2184251 .
- 1 2 3 4 5 Jaeger, Herbert (2007). "Red de estado de eco" . Scholarpedia . 2 (9): 2330. Bibcode : 2007SchpJ...2.2330J . doi : 10.4249/scholarpedia.2330 .
- ↑ Chatzis, SP; Demiris, Y. (2011). "Proceso gaussiano de estado de eco". IEEE Transactions on Neural Networks . 22 (9): 1435– 1445. Bibcode : 2011ITNN...22.1435C . doi : 10.1109/TNN.2011.2162109 . PMID 21803684 . S2CID 8553623 .
- 1 2 3 Jaeger, Herbert (2002). Un tutorial sobre el entrenamiento de redes neuronales recurrentes, que abarca BPPT, RTRL, EKF y el enfoque de "red de estado de eco" . Alemania: Centro Nacional Alemán de Investigación en Tecnologías de la Información. pp. 1– 45.
- 1 2 Antonik, Piotr; Gulina, Marvyn; Pauwels, Jaël; Massar, Serge (2018). "Uso de una computadora de reservorio para aprender atractores caóticos, con aplicaciones a la sincronización del caos y la criptografía". Phys. Rev. E . 98 (1) 012215. arXiv : 1802.02844 . Bibcode : 2018PhRvE..98a2215A . doi : 10.1103/PhysRevE.98.012215 . PMID 30110744 . S2CID 3616565 .
- ↑ Maass W., Natschlaeger T., y Markram H. (2002). "Computación en tiempo real sin estados estables: un nuevo marco para la computación neuronal basado en perturbaciones" . Neural Computation . 14 (11): 2531– 2560. doi : 10.1162/089976602760407955 . PMID 12433288. S2CID 1045112 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - 1 2 Schiller UD y Steil JJ (2005). "Análisis de la dinámica de pesos de algoritmos de aprendizaje recurrente". Neurocomputing . 63 : 5–23 . doi : 10.1016/j.neucom.2004.04.006 .
- ↑ Dominey PF (1995). "Aprendizaje de secuencias sensoriomotoras complejas basado en la representación de estados recurrentes y el aprendizaje por refuerzo". Biol. Cybernetics . 73 (3): 265– 274. doi : 10.1007/BF00201428 . PMID 7548314 . S2CID 1603500 .
- ↑ Buonomano, DV y Merzenich, MM (1995). "Información temporal transformada en un código espacial por una red neuronal con propiedades realistas". Science . 267 ( 5200): 1028– 1030. Bibcode : 1995Sci...267.1028B . doi : 10.1126/science.7863330 . PMID 7863330. S2CID 12880807 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Kirby, K. (1991). "Dinámica del contexto en el aprendizaje secuencial neuronal. Actas". Simposio de Investigación en IA de Florida : 66–70 .
- ↑ Schomaker, L. (1992). "Un modelo de red de osciladores neuronales para la generación de patrones temporales". Human Movement Science . 11 ( 1–2 ): 181–192 . doi : 10.1016/0167-9457(92)90059-K .
- ↑ Schmidhuber J., Gomez F., Wierstra D., y Gagliolo M. (2007). "Entrenamiento de redes recurrentes con evolino". Neural Computation . 19 (3): 757– 779. CiteSeerX 10.1.1.218.3086 . doi : 10.1162/neco.2007.19.3.757 . PMID 17298232. S2CID 11745761 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Doan N, Polifke W, Magri L (2020). "Redes de estado de eco informadas por la física". Journal of Computational Science . 47 101237. arXiv : 2011.02280 . doi : 10.1016/j.jocs.2020.101237 . S2CID 226246385 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Pathak J, Wikner A, Russel R, Chandra S, Hunt B, Girvan M, Ott E (2018). "Pronóstico híbrido de procesos caóticos: uso de aprendizaje automático en conjunción con un modelo basado en el conocimiento". Chaos . 28 (4) 041101. arXiv : 1803.04779 . Bibcode : 2018Chaos..28d1101P . doi : 10.1063/1.5028373 . PMID 31906641 . S2CID 3883587 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Anantharaman, Ranjan; Ma, Yingbo; Gowda, Shashi; Laughman, Chris; Shah, Viral; Edelman, Alan; Rackauckas, Chris (2020). "Aceleración de la simulación de sistemas no lineales rígidos mediante redes de estado de eco de tiempo continuo". arXiv : 2010.04004 [ cs.LG ].
- ↑ Monzani, Francesco; Prati, Enrico (2025). "Condiciones de universalidad de la computación de reservorio clásica y cuántica unificada". Neurocomputing . 643 130391. arXiv : 2401.15067 . doi : 10.1016/j.neucom.2025.130391 .
- ^ Monzani, Francisco; Ricci, Emanuele; Nigro, Luca; Prati, Enrico (2024). "Aprovechamiento del ruido no unitario para la computación de reservorios cuánticos basada en puertas". arXiv : 2409.07886 [ cuántico-ph ].
{{cite arXiv}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Doya K. (1992). "Bifurcaciones en el aprendizaje de redes neuronales recurrentes". [ Actas ] Simposio Internacional IEEE de Circuitos y Sistemas de 1992. Vol. 6. págs. 2777–2780 . doi : 10.1109/ISCAS.1992.230622 . ISBN 0-7803-0593-0. S2CID 15069221 .
- ↑ Jaeger H. (2007). "Descubrimiento de características dinámicas multiescala con redes jerárquicas de estado de eco". Informe técnico 10, Escuela de Ingeniería y Ciencias, Universidad Jacobs .
- Arquitecturas de redes neuronales
- Redes neuronales artificiales
- 2007 en inteligencia artificial