Las redes neuronales artificiales son una clase de modelos utilizados en el aprendizaje automático , inspirados en las redes neuronales biológicas . Son el componente central de los algoritmos modernos de aprendizaje profundo . La computación en las redes neuronales artificiales se organiza generalmente en capas secuenciales de neuronas artificiales . El número de neuronas en una capa se denomina ancho de capa. El análisis teórico de las redes neuronales artificiales a veces considera el caso límite en el que el ancho de capa se vuelve grande o infinito. Este límite permite realizar afirmaciones analíticas sencillas sobre las predicciones de la red neuronal, la dinámica de entrenamiento, la generalización y las superficies de pérdida. Este amplio límite de capa también es de interés práctico, ya que las redes neuronales de ancho finito suelen tener un rendimiento estrictamente mejor a medida que aumenta el ancho de capa. [ 1 ] [ 2 ] [ 3 ] [ 4 ] [ 5 ] [ 6 ]
Enfoques teóricos basados en un límite de ancho amplio
- El proceso gaussiano de red neuronal (NNGP) corresponde al límite de ancho infinito de las redes neuronales bayesianas y a la distribución sobre funciones realizada por redes neuronales no bayesianas después de una inicialización aleatoria. [ 7 ] [ 8 ] [ 9 ] [ 10 ]
- Los mismos cálculos subyacentes que se utilizan para derivar el núcleo NNGP también se utilizan en la propagación profunda de información para caracterizar la propagación de información sobre gradientes y entradas a través de una red profunda. [ 11 ] Esta caracterización se utiliza para predecir cómo la capacidad de entrenamiento del modelo depende de la arquitectura y los hiperparámetros de inicialización.
- El núcleo tangente neuronal describe la evolución de las predicciones de la red neuronal durante el entrenamiento por descenso de gradiente. En el límite de ancho infinito, el NTK suele volverse constante, lo que a menudo permite expresiones de forma cerrada para la función calculada por una red neuronal ancha a lo largo del entrenamiento por descenso de gradiente. [ 12 ] La dinámica de entrenamiento se linealiza esencialmente. [ 13 ]
- Análisis de límite de campo medio , cuando se aplica a redes neuronales con escalado de peso deen lugar dey tasas de aprendizaje suficientemente grandes, predice dinámicas de entrenamiento no lineales cualitativamente distintas en comparación con el comportamiento lineal estático descrito por el núcleo tangente neuronal fijo, lo que sugiere vías alternativas para comprender las redes de ancho infinito. [ 14 ] [ 15 ]
- La dinámica de catapulta describe la dinámica de entrenamiento de redes neuronales en el caso de que los logits diverjan al infinito a medida que el ancho de la capa tiende al infinito, y describe propiedades cualitativas de la dinámica de entrenamiento temprana. [ 16 ]
Referencias
- ↑ Novak, Roman; Bahri, Yasaman; Abolafia, Daniel A.; Pennington, Jeffrey; Sohl-Dickstein, Jascha (2018-02-15). "Sensibilidad y generalización en redes neuronales: un estudio empírico" . Conferencia internacional sobre representaciones de aprendizaje . arXiv : 1802.08760 . Bibcode : 2018arXiv180208760N .
- ↑ Canziani, Alfredo; Paszke, Adam; Culurciello, Eugenio (2016-11-04). "Análisis de modelos de redes neuronales profundas para aplicaciones prácticas" . arXiv : 1605.07678 . Bibcode : 2016arXiv160507678C .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - ↑ Novak, Roman; Xiao, Lechao; Lee, Jaehoon; Bahri, Yasaman; Yang, Greg; Abolafia, Dan; Pennington, Jeffrey; Sohl-Dickstein, Jascha (2018). "Las redes neuronales convolucionales profundas bayesianas con muchos canales son procesos gaussianos". Conferencia internacional sobre representaciones de aprendizaje . arXiv : 1810.05148 . Bibcode : 2018arXiv181005148N .
- ↑ Neyshabur, Behnam; Li, Zhiyuan; Bhojanapalli, Srinadh; LeCun, Yann; Srebro, Nathan (2019). "Hacia la comprensión del papel de la sobreparametrización en la generalización de redes neuronales". Conferencia Internacional sobre Representaciones de Aprendizaje . arXiv : 1805.12076 . Bibcode : 2018arXiv180512076N .
- ↑ Lawrence, Steve; Giles, C. Lee; Tsoi, Ah Chung (1996). "¿Qué tamaño de red neuronal proporciona una generalización óptima? Propiedades de convergencia de la retropropagación". CiteSeerX 10.1.1.125.6019 .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - ↑ Bartlett, PL (1998). "La complejidad de la muestra en la clasificación de patrones con redes neuronales: el tamaño de los pesos es más importante que el tamaño de la red". IEEE Transactions on Information Theory . 44 (2): 525– 536. doi : 10.1109/18.661502 . ISSN 1557-9654 .
- ↑ Neal, Radford M. (1996), "Priors for Infinite Networks", Bayesian Learning for Neural Networks , Lecture Notes in Statistics, vol. 118, Springer New York, pp. 29–53 , doi : 10.1007/978-1-4612-0745-0_2 , ISBN 978-0-387-94724-2
- ↑ Lee, Jaehoon; Bahri, Yasaman; Novak, Roman; Schoenholz, Samuel S.; Pennington, Jeffrey; Sohl-Dickstein, Jascha (2017). "Redes neuronales profundas como procesos gaussianos". Conferencia internacional sobre representaciones de aprendizaje . arXiv : 1711.00165 . Bibcode : 2017arXiv171100165L .
- ↑ G. de G. Matthews, Alexander; Rowland, Mark; Hron, Jiri; Turner, Richard E.; Ghahramani, Zoubin (2017). "Comportamiento de procesos gaussianos en redes neuronales profundas y amplias". Conferencia Internacional sobre Representaciones de Aprendizaje . arXiv : 1804.11271 . Bibcode : 2018arXiv180411271M .
- ↑ Hron, Jiri; Bahri, Yasaman; Novak, Roman; Pennington, Jeffrey; Sohl-Dickstein, Jascha (2020). "Distribuciones posteriores exactas de redes neuronales bayesianas amplias". Taller ICML 2020 sobre incertidumbre y robustez en el aprendizaje profundo . arXiv : 2006.10541 .
- ↑ Schoenholz, Samuel S.; Gilmer, Justin; Ganguli, Surya; Sohl-Dickstein, Jascha (2016). "Propagación profunda de información". Conferencia Internacional sobre Representaciones de Aprendizaje . arXiv : 1611.01232 .
- ↑ Jacot, Arthur; Gabriel, Franck; Hongler, Clement (2018). "Neural tangent kernel: Convergence and generalization in neural networks". Advances in Neural Information Processing Systems . arXiv : 1806.07572 .
- ↑ Lee, Jaehoon; Xiao, Lechao; Schoenholz, Samuel S.; Bahri, Yasaman; Novak, Roman; Sohl-Dickstein, Jascha; Pennington, Jeffrey (2020). "Las redes neuronales amplias de cualquier profundidad evolucionan como modelos lineales bajo descenso de gradiente". Journal of Statistical Mechanics: Theory and Experiment . 2020 (12): 124002. arXiv : 1902.06720 . Bibcode : 2020JSMTE2020l4002L . doi : 10.1088/1742-5468/abc62b . S2CID 62841516 .
- ↑ Mei, Song Montanari, Andrea Nguyen, Phan-Minh (2018-04-18). Una visión de campo medio del panorama de las redes neuronales de dos capas . OCLC 1106295873 .
{{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Nguyen, Phan-Minh; Pham, Huy Tuan (2020). "Un marco riguroso para el límite de campo medio de redes neuronales multicapa". arXiv : 2001.11443 [ cs.LG ].
- ↑ Lewkowycz, Aitor; Bahri, Yasaman; Dyer, Ethan; Sohl-Dickstein, Jascha; Gur-Ari, Guy (2020). "La fase de alta tasa de aprendizaje del aprendizaje profundo: el mecanismo de catapulta". arXiv : 2003.02218 [ stat.ML ].
- Aprendizaje profundo
- Redes neuronales artificiales