En el estudio de las redes neuronales artificiales (RNA), el núcleo tangente neuronal ( NTK ) es un núcleo que describe la evolución de las redes neuronales artificiales profundas durante su entrenamiento mediante descenso de gradiente . Permite estudiar las RNA utilizando herramientas teóricas de los métodos de núcleo .
En general, un kernel es una función simétrica semidefinida positiva de dos entradas que representa alguna noción de similitud entre ellas. El NTK es un kernel específico derivado de una red neuronal dada; por lo general, cuando los parámetros de la red neuronal cambian durante el entrenamiento, el NTK también evoluciona. Sin embargo, en el límite de ancho de capa grande, el NTK se vuelve constante, revelando una dualidad entre el entrenamiento de la red neuronal ancha y los métodos de kernel: el descenso de gradiente en el límite de ancho infinito es totalmente equivalente al descenso de gradiente de kernel con el NTK. Como resultado, usar el descenso de gradiente para minimizar la pérdida de mínimos cuadrados para redes neuronales produce el mismo estimador de media que la regresión de kernel sin cresta con el NTK. Esta dualidad permite ecuaciones simples de forma cerrada que describen la dinámica de entrenamiento, la generalización y las predicciones de las redes neuronales anchas.
El NTK fue introducido en 2018 por Arthur Jacot, Franck Gabriel y Clément Hongler, [ 1 ] quienes lo utilizaron para estudiar las propiedades de convergencia y generalización de redes neuronales totalmente conectadas. Trabajos posteriores [ 2 ] [ 3 ] extendieron los resultados del NTK a otras arquitecturas de redes neuronales. De hecho, el fenómeno subyacente al NTK no es específico de las redes neuronales y puede observarse en modelos no lineales genéricos, generalmente mediante un escalado adecuado. [ 4 ]
Resultados principales (informales)
Sea la función escalar calculada por una red neuronal dada con parámetros en la entrada . Entonces, el núcleo tangente neuronal se define [ 1 ] como Dado que se escribe como un producto escalar entre entradas mapeadas (con el gradiente de la función de la red neuronal sirviendo como mapa de características), estamos garantizados de que el NTK es simétrico y semidefinido positivo . Por lo tanto, el NTK es una función de núcleo válida.
Consideremos una red neuronal completamente conectada cuyos parámetros se eligen de forma independiente e idénticamente distribuida (i.i.d.) según cualquier distribución de media cero. Esta inicialización aleatoria induce una distribución sobre cuyas estadísticas analizaremos, tanto en la inicialización como durante el entrenamiento (descenso de gradiente en un conjunto de datos específico). Podemos visualizar esta distribución mediante un conjunto de redes neuronales que se construye extrayendo repetidamente de la distribución inicial sobre y entrenando cada extracción según el mismo procedimiento de entrenamiento.

El número de neuronas en cada capa se denomina ancho de la capa. Consideremos llevar el ancho de cada capa oculta hasta el infinito y entrenar la red neuronal con descenso de gradiente (con una tasa de aprendizaje suficientemente pequeña ). En este límite de ancho infinito , surgen varias propiedades interesantes:
- En la inicialización (antes del entrenamiento), el conjunto de redes neuronales es un proceso gaussiano (GP) de media cero . [ 5 ] Esto significa que la distribución de funciones es la distribución de máxima entropía con media y covarianza , donde la covarianza del GP se puede calcular a partir de la arquitectura de la red . En otras palabras, la distribución de las funciones de la red neuronal en la inicialización no tiene otra estructura que sus momentos primero y segundo (media y covarianza). Esto se deduce del teorema del límite central .
- El NTK es determinista. [ 1 ] [ 6 ] En otras palabras, el NTK es independiente de la inicialización del parámetro aleatorio.
- El NTK no cambia durante el entrenamiento. [ 1 ] [ 6 ]
- Cada parámetro cambia de forma insignificante a lo largo del entrenamiento. Como señalan Lee et al. [ 6 ] , "aunque los parámetros individuales varían en una cantidad ínfima, en conjunto contribuyen a producir un cambio finito en la salida final de la red, tal como es necesario para el entrenamiento".
- Durante el entrenamiento, la red neuronal se linealiza, es decir, su dependencia de parámetros puede capturarse mediante su expansión de Taylor de primer orden : , donde son los parámetros iniciales. [ 6 ] Esto se deduce del hecho de que cada parámetro cambia de forma insignificante durante el entrenamiento. (La red neuronal permanece no lineal con respecto a las entradas).
- La dinámica de entrenamiento es equivalente al descenso de gradiente de kernel usando el NTK como kernel. [ 1 ] Si la función de pérdida es el error cuadrático medio , la distribución final sobre sigue siendo un proceso gaussiano, pero con una nueva media y covarianza. [ 1 ] [ 6 ] En particular, la media converge al mismo estimador producido por la regresión de kernel con el NTK como kernel y regularización de cresta cero , y la covarianza se puede expresar en términos del NTK y la covarianza GP inicial. Se puede demostrar que la varianza del conjunto se anula en los puntos de entrenamiento (en otras palabras, la red neuronal siempre interpola los datos de entrenamiento, independientemente de la inicialización).
Desde un punto de vista físico, el NTK puede entenderse como un tipo de hamiltoniano , ya que genera la evolución temporal de las observables cuando la red neuronal se entrena mediante descenso de gradiente con pasos infinitesimalmente pequeños (el límite continuo ). [ 7 ]
Aplicaciones
Regresión de núcleo sin cresta y descenso de gradiente de núcleo
Los métodos de kernel son algoritmos de aprendizaje automático que utilizan únicamente relaciones por pares entre puntos de entrada. Los métodos de kernel no dependen de los valores concretos de las entradas; solo dependen de las relaciones entre las entradas y otras entradas (como el conjunto de entrenamiento). Estas relaciones por pares se capturan completamente mediante la función de kernel: una función simétrica , semidefinida positiva de dos entradas que representa alguna noción de similitud entre las dos entradas. Una condición totalmente equivalente es que exista algún mapa de características tal que la función de kernel se pueda escribir como un producto escalar de las entradas mapeadas. Las propiedades de un método de kernel dependen de la elección de la función de kernel. (Tenga en cuenta que puede tener una dimensión mayor que .) Como ejemplo relevante, considere la regresión lineal . Esta es la tarea de estimar dadas muestras generadas a partir de , donde cada se extrae de acuerdo con alguna distribución de datos de entrada. En esta configuración, es el vector de pesos que define la función verdadera ; deseamos utilizar las muestras de entrenamiento para desarrollar un modelo que aproxime . Lo hacemos minimizando el error cuadrático medio entre nuestro modelo y las muestras de entrenamiento: Existe una solución explícita que minimiza el error cuadrático: , donde es la matriz cuyas columnas son las entradas de entrenamiento y es el vector de salidas de entrenamiento. Entonces, el modelo puede hacer predicciones sobre nuevas entradas: .
Sin embargo, este resultado puede reescribirse como: . [ 8 ] Nótese que esta solución dual se expresa únicamente en términos de los productos internos entre las entradas. Esto motiva extender la regresión lineal a entornos en los que, en lugar de tomar directamente productos internos entre las entradas, primero transformamos las entradas de acuerdo con un mapa de características elegido y luego evaluamos los productos internos entre las entradas transformadas. Como se discutió anteriormente, esto puede capturarse mediante una función kernel , ya que todas las funciones kernel son productos internos de entradas mapeadas con características. Esto produce el estimador de regresión kernel sin cresta: Si la matriz kernel es singular , se utiliza la pseudoinversa de Moore-Penrose . Las ecuaciones de regresión se denominan "sin cresta" porque carecen de un término de regularización de cresta .
Desde esta perspectiva, la regresión lineal es un caso especial de regresión kernel con el mapa de características identidad: . De forma equivalente, la regresión kernel es simplemente una regresión lineal en el espacio de características (es decir, el rango del mapa de características definido por el kernel elegido). Cabe destacar que la regresión kernel suele ser una regresión no lineal en el espacio de entrada, lo cual constituye una gran ventaja del algoritmo.
Así como es posible realizar una regresión lineal utilizando algoritmos de optimización iterativos como el descenso de gradiente, también se puede realizar una regresión kernel utilizando el descenso de gradiente kernel. Esto equivale a realizar un descenso de gradiente en el espacio de características. Se sabe que si el vector de pesos se inicializa cerca de cero, el descenso de gradiente por mínimos cuadrados converge a la solución de norma mínima, es decir, el vector de pesos final tiene la norma euclidiana mínima de todas las soluciones de interpolación. De la misma manera, el descenso de gradiente kernel produce la solución de norma mínima con respecto a la norma RKHS . Este es un ejemplo de la regularización implícita del descenso de gradiente.
El NTK establece una conexión rigurosa entre la inferencia realizada por redes neuronales artificiales (RNA) de ancho infinito y la realizada por métodos de kernel : cuando la función de pérdida es la pérdida de mínimos cuadrados , la inferencia realizada por una RNA es, en promedio, igual a la regresión de kernel sin cresta con respecto al NTK. Esto sugiere que el rendimiento de las RNA grandes en la parametrización NTK puede replicarse mediante métodos de kernel para kernels elegidos adecuadamente. [ 1 ] [ 2 ]
Sobreparametrización, interpolación y generalización
En los modelos sobreparametrizados, el número de parámetros ajustables supera el número de muestras de entrenamiento. En este caso, el modelo es capaz de memorizar (ajustarse perfectamente) a los datos de entrenamiento. Por lo tanto, los modelos sobreparametrizados interpolan los datos de entrenamiento, logrando un error de entrenamiento prácticamente nulo. [ 9 ]

La regresión kernel se suele considerar un algoritmo de aprendizaje no paramétrico, ya que no hay parámetros explícitos que ajustar una vez elegida la función kernel. Otra perspectiva consiste en recordar que la regresión kernel es simplemente una regresión lineal en el espacio de características, por lo que el número "efectivo" de parámetros es la dimensión de dicho espacio. Por lo tanto, el estudio de kernels con mapas de características de alta dimensión puede aportar información valiosa sobre modelos con un exceso de parámetros.
Como ejemplo, consideremos el problema de la generalización. Según la estadística clásica, la memorización debería hacer que los modelos se ajusten a señales ruidosas en los datos de entrenamiento, perjudicando su rendimiento en datos no vistos. Para mitigar esto, los algoritmos de aprendizaje automático a menudo introducen regularización para mitigar las tendencias de ajuste al ruido. Sorprendentemente, las redes neuronales modernas (que tienden a estar fuertemente sobreparametrizadas) parecen generalizar bien, incluso en ausencia de regularización explícita. [ 9 ] [ 10 ] Para estudiar las propiedades de generalización de las redes neuronales sobreparametrizadas, se puede explotar la dualidad de ancho infinito con regresión de núcleo sin cresta. Trabajos recientes [ 11 ] [ 12 ] [ 13 ] han derivado ecuaciones que describen el error de generalización esperado de la regresión de núcleo de alta dimensión; estos resultados explican inmediatamente la generalización de redes neuronales suficientemente anchas entrenadas para converger en mínimos cuadrados.
Convergencia a un mínimo global
Para una función de pérdida convexa con un mínimo global , si el NTK permanece definido positivo durante el entrenamiento, la pérdida de la ANN converge a ese mínimo cuando . Esta propiedad de definición positiva se ha demostrado en varios casos, proporcionando las primeras pruebas de que las ANN de gran ancho convergen a mínimos globales durante el entrenamiento. [ 1 ] [ 14 ] [ 15 ] [ 16 ] [ 17 ] [ 18 ] ;\theta \left(t\right)\right)\right)}
Extensiones y limitaciones
El NTK se puede estudiar para varias arquitecturas de ANN , [ 2 ] en particular redes neuronales convolucionales (CNN), [ 19 ] redes neuronales recurrentes (RNN) y transformadores . [ 20 ] En tales configuraciones, el límite de ancho grande corresponde a dejar crecer el número de parámetros, mientras se mantiene fijo el número de capas: para las CNN , esto implica dejar crecer el número de canales.
Los parámetros individuales de una red neuronal amplia en el régimen del kernel cambian de forma insignificante durante el entrenamiento. Sin embargo, esto implica que las redes neuronales de ancho infinito no pueden exhibir aprendizaje de características , que se considera una propiedad importante de las redes neuronales profundas realistas. Esta no es una característica genérica de las redes neuronales de ancho infinito y se debe en gran medida a una elección específica de la escala mediante la cual el ancho se lleva al límite infinito; de hecho, varios trabajos [ 21 ] [ 22 ] [ 23 ] [ 24 ] han encontrado límites de escala de ancho infinito alternativos para redes neuronales en los que no hay dualidad con la regresión del kernel y el aprendizaje de características ocurre durante el entrenamiento. Otros [ 25 ] introducen una "jerarquía tangente neuronal" para describir los efectos de ancho finito, que pueden impulsar el aprendizaje de características.
Neural Tangents es una biblioteca de Python gratuita y de código abierto que se utiliza para calcular y realizar inferencias con el NTK de ancho infinito y el proceso gaussiano de red neuronal (NNGP) correspondiente a varias arquitecturas ANN comunes. [ 26 ] Además, existe una implementación compatible con scikit-learn del NTK de ancho infinito para procesos gaussianos llamada scikit-ntk . [ 27 ]
Detalles
Al optimizar los parámetros de una red neuronal artificial (RNA) para minimizar una pérdida empírica mediante el descenso de gradiente , el NTK rige la dinámica de la función de salida de la RNA durante todo el entrenamiento.
Caso 1: Salida escalar
Una ANN con salida escalar consta de una familia de funciones parametrizadas por un vector de parámetros .
El NTK es un kernel definido por En el lenguaje de los métodos de kernel , el NTK es el kernel asociado con el mapa de características . Para ver cómo este kernel impulsa la dinámica de entrenamiento de la ANN, considere un conjunto de datos con etiquetas escalares y una función de pérdida . Entonces, la pérdida empírica asociada, definida en funciones , viene dada por Cuando la ANN se entrena para ajustarse al conjunto de datos (es decir, minimizar ) mediante descenso de gradiente en tiempo continuo, los parámetros evolucionan a través de la ecuación diferencial ordinaria : :\mathbb {R} ^{n_{\mathrm {in} }}\times \mathbb {R} ^{n_{\mathrm {in} }}\to \mathbb {R} } ;\theta \right):\mathbb {R} ^{n_{\mathrm {in} }}\to \mathbb {R} }
- ;\theta \right)\right).}
Durante el entrenamiento, la función de salida de la ANN sigue una ecuación diferencial de evolución dada en términos del NTK:
Esta ecuación muestra cómo el NTK impulsa la dinámica en el espacio de funciones durante el entrenamiento. ;\theta \left(t\right)\right)}
Caso 2: Salida vectorial
Una ANN con salida vectorial de tamaño consiste en una familia de funciones parametrizadas por un vector de parámetros . ;\theta \right):\mathbb {R} ^{n_{\mathrm {in} }}\to \mathbb {R} ^{n_{\mathrm {out} }}}
En este caso, el NTK es un kernel con valores matriciales , con valores en el espacio de matrices, definido por La minimización del riesgo empírico procede como en el caso escalar, con la diferencia de que la función de pérdida toma entradas vectoriales . El entrenamiento de a través del descenso de gradiente en tiempo continuo produce la siguiente evolución en el espacio de funciones impulsada por el NTK: Esto generaliza la ecuación mostrada en el caso 1 para salidas escalares. :\mathbb {R} ^{n_{\mathrm {in} }}\times \mathbb {R} ^{n_{\mathrm {in} }}\to {\mathcal {M}}_{n_{\mathrm {out} }}\left(\mathbb {R} \right)}
Interpretación
Cada punto de datos influye en la evolución de la salida para cada entrada a lo largo del entrenamiento. Más concretamente, con respecto al ejemplo , el valor NTK determina la influencia del gradiente de pérdida en la evolución de la salida de la ANN a través de un paso de descenso de gradiente. En el caso escalar, esto se lee:
Las redes neuronales artificiales (RNA) amplias y totalmente conectadas tienen un NTK determinista, que permanece constante durante todo el entrenamiento.
Consideremos una ANN con capas totalmente conectadas de anchos , de modo que , donde es la composición de una transformación afín con la aplicación puntual de una no linealidad , donde parametriza los mapas . Los parámetros se inicializan aleatoriamente, de forma independiente e idénticamente distribuida . ;\theta \right)=R_{L-1}\circ \cdots \circ R_{0}} :\mathbb {R} \to \mathbb {R} }
A medida que aumentan los anchos, la escala del NTK se ve afectada por la parametrización exacta de los parámetros y por su inicialización. Esto motiva la denominada parametrización del NTK . Esta parametrización garantiza que, si los parámetros se inicializan como variables normales estándar , el NTK tiene un límite finito no trivial. En el límite de ancho grande, el NTK converge a un límite determinista (no aleatorio) que permanece constante en el tiempo.
El NTK viene dado explícitamente por , donde está determinado por el conjunto de ecuaciones recursivas:
donde denota el núcleo definido en términos de la esperanza gaussiana :
En esta fórmula, los núcleos son los llamados núcleos de activación de la ANN. [ 28 ] [ 29 ] [ 5 ]
Las redes amplias totalmente conectadas son lineales en sus parámetros a lo largo del entrenamiento.
El NTK describe la evolución de las redes neuronales bajo descenso de gradiente en el espacio de funciones. Dual a esta perspectiva es la comprensión de cómo evolucionan las redes neuronales en el espacio de parámetros , ya que el NTK se define en términos del gradiente de las salidas de la ANN con respecto a sus parámetros. En el límite de ancho infinito, la conexión entre estas dos perspectivas se vuelve especialmente interesante. El hecho de que el NTK permanezca constante durante el entrenamiento en anchos grandes coincide con que la ANN se describa bien durante el entrenamiento mediante su expansión de Taylor de primer orden alrededor de sus parámetros en la inicialización: [ 6 ]
Véase también
Referencias
- 1 2 3 4 5 6 7 8 Jacot, Arthur; Gabriel, Franck; Hongler, Clement (2018), Bengio, S.; Wallach, H.; Larochelle, H.; Grauman, K. (eds.), "Neural Tangent Kernel: Convergence and Generalization in Neural Networks" (PDF) , Advances in Neural Information Processing Systems 31 , Curran Associates, Inc., pp. 8571–8580 , arXiv : 1806.07572 , consultado el 27 de noviembre de 2019
- 1 2 3 Arora, Sanjeev; Du, Simon S.; Hu, Wei; Li, Zhiyuan; Salakhutdinov, Ruslan; Wang, Ruosong (2019-11-04). "Sobre el cálculo exacto con una red neuronal infinitamente ancha". arXiv : 1904.11955 [ cs.LG ].
- ↑ Yang, Greg (2020-11-29). "Programas tensoriales II: núcleo tangente neuronal para cualquier arquitectura". arXiv : 2006.14548 [ stat.ML ].
- ↑ Chizat, Lénaïc; Oyallon, Edouard; Bach, Francis (2019-12-08), "Sobre el entrenamiento perezoso en programación diferenciable" , Actas de la 33.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal , Red Hook, NY, EE. UU.: Curran Associates Inc., págs. 2937–2947 , arXiv : 1812.07956 , consultado el 11 de mayo de 2023.
- 1 2 Lee, Jaehoon; Bahri, Yasaman; Novak, Roman; Schoenholz, Samuel S.; Pennington, Jeffrey; Sohl-Dickstein, Jascha (2018-02-15). Redes neuronales profundas como procesos gaussianos . Conferencia internacional sobre representaciones de aprendizaje .
- 1 2 3 4 5 6 Lee, Jaehoon; Xiao, Lechao; Schoenholz, Samuel S.; Bahri, Yasaman; Novak, Roman; Sohl-Dickstein, Jascha; Pennington, Jeffrey (2020). "Las redes neuronales amplias de cualquier profundidad evolucionan como modelos lineales bajo descenso de gradiente". Journal of Statistical Mechanics: Theory and Experiment . 2020 (12): 124002. arXiv : 1902.06720 . Bibcode : 2020JSMTE2020l4002L . doi : 10.1088/1742-5468/abc62b . S2CID 62841516 .
- ↑ Roberts, Daniel A.; Yaida, Sho (2022). "∞. El fin del entrenamiento". Los principios de la teoría del aprendizaje profundo: un enfoque teórico eficaz para comprender las redes neuronales . Boris Hanin. Cambridge Nueva York, NY Port Melbourne, VIC Nueva Delhi Singapur: Cambridge University Press. pág. 360. ISBN 978-1-316-51933-2.
- ↑ Shawe-Taylor, John; Cristianini, Nello (28 de junio de 2004). Métodos de núcleo para el análisis de patrones . Cambridge University Press. doi : 10.1017/cbo9780511809682 . ISBN 978-0-521-81397-6.
- 1 2 3 Belkin, Mikhail (2021-05-29). "En forma sin miedo: fenómenos matemáticos notables del aprendizaje profundo a través del prisma de la interpolación". arXiv : 2105.14368 [ stat.ML ].
- ↑ Novak, Roman; Bahri, Yasaman; Abolafia, Daniel A.; Pennington, Jeffrey; Sohl-Dickstein, Jascha (2018-02-15). "Sensibilidad y generalización en redes neuronales: un estudio empírico". arXiv : 1802.08760 [ stat.ML ].
- ↑ Jacot, Arthur; Şimşek, Berfin; Spadaro, Francesco; Hongler, Clément; Gabriel, Franck (2020-06-17). "Estimador de riesgo de alineación de kernel: predicción de riesgo a partir de datos de entrenamiento". arXiv : 2006.09796 [ stat.ML ].
- ↑ Canatar, Abdulkadir; Bordelon, Blake; Pehlevan, Cengiz (2021-05-18). "El sesgo espectral y la alineación del modelo de tarea explican la generalización en la regresión de kernel y las redes neuronales infinitamente amplias" . Nature Communications . 12 (1): 2914. arXiv : 2006.13198 . Bibcode : 2021NatCo..12.2914C . doi : 10.1038/ s41467-021-23103-1 . ISSN 2041-1723 . PMC 8131612. PMID 34006842 .
- ↑ Simon, James B.; Dickens, Madeline; Karkada, Dhruva; DeWeese, Michael R. (2022-10-12). "The Eigenlearning Framework: A Conservation Law Perspective on Kernel Regression and Wide Neural Networks". arXiv : 2110.03922 [ cs.LG ].
- ^ Allen-Zhu, Zeyuan; Li, Yuanzhi; Canción, Zhao (2018). "Una teoría de la convergencia para el aprendizaje profundo mediante la sobreparametrización". arXiv : 1811.03962 [ cs.LG ].
- ↑ Du, Simon S; Zhai, Xiyu; Poczos, Barnabas; Aarti, Singh (2019). "El descenso de gradiente optimiza de forma demostrable las redes neuronales sobreparametrizadas". arXiv : 1810.02054 [ cs.LG ].
- ↑ Zou, Difan; Cao, Yuan; Zhou, Dongruo; Gu, Quanquan (2020). "El descenso de gradiente optimiza las redes ReLU profundas sobreparametrizadas" . Machine Learning . 109 (3): 467– 492. doi : 10.1007/s10994-019-05839-6 . S2CID 53752874 .
- ↑ Allen-Zhu, Zeyuan; Li, Yuanzhi; Song, Zhao (27-05-2019). "Sobre la tasa de convergencia del entrenamiento de redes neuronales recurrentes". arXiv : 1810.12065 [ cs.LG ].
- ↑ Du, Simon; Lee, Jason; Li, Haochuan; Wang, Liwei; Zhai, Xiyu (2019-05-24). "El descenso de gradiente encuentra mínimos globales de redes neuronales profundas". pp. 1675– 1685. arXiv : 1811.03804 [ cs.LG ].
- ↑ Yang, Greg (2019-02-13). "Límites de escala de redes neuronales amplias con compartición de pesos: comportamiento de proceso gaussiano, independencia de gradiente y derivación del núcleo tangente neuronal". arXiv : 1902.04760 [ cs.NE ].
- ^ Hron, Jiri; Bahri, Yasamán; Sohl-Dickstein, Jascha; Novak, romano (18 de junio de 2020). "Atención infinita: NNGP y NTK para redes de atención profunda". arXiv : 2006.10540 [ estad.ML ].
- ↑ Mei, Song; Montanari, Andrea; Nguyen, Phan-Minh (2018-08-14). "Una visión de campo medio del panorama de las redes neuronales de dos capas" . Actas de la Academia Nacional de Ciencias . 115 (33): E7665– E7671. arXiv : 1804.06561 . Bibcode : 2018PNAS..115E7665M . doi : 10.1073/pnas.1806579115 . ISSN 0027-8424 . PMC 6099898. PMID 30054315 .
- ↑ Chizat, Lénaïc; Bach, Francis (2018-12-03). "Sobre la convergencia global del descenso de gradiente para modelos sobreparametrizados utilizando transporte óptimo" . Actas de la 32.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal . NIPS'18. Red Hook, NY, EE. UU.: Curran Associates Inc.: 3040–3050 . arXiv : 1805.09545 .
- ↑ Nguyen, Phan-Minh; Pham, Huy Tuan (2020-01-30). "Un marco riguroso para el límite de campo medio de redes neuronales multicapa". arXiv : 2001.11443 [ cs.LG ].
- ↑ Yang, Greg; Hu, Edward J. (2022-07-15). "Aprendizaje de características en redes neuronales de ancho infinito". arXiv : 2011.14522 [ cs.LG ].
- ↑ Huang, Jiaoyang; Yau, Horng-Tzer (2019-09-17). "Dinámica de redes neuronales profundas y jerarquía de tangentes neuronales". arXiv : 1909.08156 [ cs.LG ].
- ↑ Novak, Roman; Xiao, Lechao; Hron, Jiri; Lee, Jaehoon; Alemi, Alexander A.; Sohl-Dickstein, Jascha; Schoenholz, Samuel S. (2019-12-05), "Neural Tangents: Fast and Easy Infinite Neural Networks in Python", International Conference on Learning Representations (ICLR) , vol. 2020, arXiv : 1912.02803 , Bibcode : 2019arXiv191202803N
- ↑ Lencevicius, Ronaldas Paulius (2022). "Análisis empírico de los núcleos tangentes de Laplace y neuronales". arXiv : 2208.03761 [ stat.ML ].
- ↑ Cho, Youngmin; Saul, Lawrence K. (2009), Bengio, Y.; Schuurmans, D.; Lafferty, JD; Williams, CKI (eds.), "Métodos de núcleo para aprendizaje profundo" (PDF) , Advances in Neural Information Processing Systems 22 , Curran Associates, Inc., pp. 342–350 , consultado el 27 de noviembre de 2019 .
- ↑ Daniely, Amit; Frostig, Roy; Singer, Yoram (2016), Lee, DD; Sugiyama, M.; Luxburg, UV; Guyon, I. (eds.), "Hacia una comprensión más profunda de las redes neuronales: el poder de la inicialización y una visión dual de la expresividad" (PDF) , Advances in Neural Information Processing Systems 29 , Curran Associates, Inc., pp. 2253–2261 , arXiv : 1602.05897 , Bibcode : 2016arXiv160205897D , consultado el 27 de noviembre de 2019 .
Enlaces externos
- Ananthaswamy, Anil (11 de octubre de 2021). "Un nuevo vínculo con un modelo antiguo podría descifrar el misterio del aprendizaje profundo" . Quanta Magazine .
- Métodos de kernel para el aprendizaje automático