Articulo de referencia

Tipos de redes neuronales artificiales

Los tipos de redes neuronales (RN) comprenden una familia de técnicas. Los tipos más simples tienen componentes estáticos, como el número de unidades, el número de capas, los pe...

Los tipos de redes neuronales (RN) comprenden una familia de técnicas. Los tipos más simples tienen componentes estáticos, como el número de unidades, el número de capas, los pesos de las unidades y la topología . Las RN dinámicas evolucionan mediante el aprendizaje. Algunos tipos permiten o requieren que el operador supervise el aprendizaje, mientras que otros operan de forma independiente. Algunos tipos operan exclusivamente en hardware, mientras que otros son puramente software y se ejecutan en ordenadores de propósito general.

Los principales tipos son:

  • Transformers : estos utilizan la atención para analizar cada token en el flujo de entrada comparándolo con todos los demás tokens del mismo flujo. Esta técnica ha permitido que las redes neuronales lleguen al público general a través de chatbots, generadores de código y muchas otras formas.
  • Redes neuronales convolucionales (CNN): una FNN que utiliza núcleos y regularización para evitar problemas en generaciones anteriores de NN. Se utilizan típicamente para analizar datos visuales y otros datos bidimensionales. [ 1 ] [ 2 ]
  • Las redes generativas antagónicas enfrentan redes (de estructura variable) entre sí, cada una intentando presionar a la(s) otra(s) para producir mejores resultados, como ganar un juego [ 3 ] o engañar al oponente sobre la autenticidad de una entrada. [ 4 ]

Retroalimentación anticipada

En las redes neuronales de propagación directa, la información se mueve directamente de la entrada a la salida en cada capa. Pueden existir capas ocultas con o sin ciclos/bucles para secuenciar las entradas. Estas redes pueden construirse con diversos tipos de unidades, como las neuronas binarias de McCulloch-Pitts , cuyo ejemplo más simple es el perceptrón . Las neuronas continuas, frecuentemente con activación sigmoidal , se utilizan en el contexto de la retropropagación .

Método de agrupación para el manejo de datos

El método de manejo de datos de grupo (GMDH) [ 5 ] presenta una optimización de modelo estructural y paramétrica totalmente automática. Las funciones de activación de nodos son polinomios de Kolmogorov-Gabor que permiten sumas y multiplicaciones. Utiliza un perceptrón multicapa profundo con ocho capas. [ 6 ] Es una red de aprendizaje supervisado que crece capa por capa, donde cada capa se entrena mediante análisis de regresión . Los elementos inútiles se detectan utilizando un conjunto de validación y se podan mediante regularización . El tamaño y la profundidad de la red resultante dependen de la tarea. [ 7 ]

Autoencoder

Un autoencoder, autoasociador o red Diabolo [ 8 ] : 19 es similar al perceptrón multicapa (MLP), con una capa de entrada, una capa de salida y una o más capas ocultas que las conectan. Sin embargo, la capa de salida tiene el mismo número de unidades que la capa de entrada. Su propósito es reconstruir sus propias entradas (en lugar de emitir un valor objetivo). Por lo tanto, los autoencoders son modelos de aprendizaje no supervisado . Un autoencoder se utiliza para el aprendizaje no supervisado de codificaciones eficientes , [ 9 ] [ 10 ] típicamente con el propósito de reducir la dimensionalidad y para aprender modelos generativos de datos. [ 11 ] [ 12 ]

Probabilístico

Una red neuronal probabilística (PNN) es una red neuronal de alimentación directa de cuatro capas. Las capas son Entrada, patrón oculto, suma oculta y salida. En el algoritmo PNN, la función de distribución de probabilidad (PDF) de cada clase se aproxima mediante una ventana de Parzen y una función no paramétrica. Luego, utilizando la PDF de cada clase, se estima la probabilidad de clase de una nueva entrada y se emplea la regla de Bayes para asignarla a la clase con la mayor probabilidad posterior. [ 13 ] Se derivó de la red bayesiana [ 14 ] y de un algoritmo estadístico llamado análisis discriminante de Kernel Fisher . [ 15 ] Se utiliza para clasificación y reconocimiento de patrones.

Retraso de tiempo

Una red neuronal con retardo temporal (TDNN, por sus siglas en inglés) es una arquitectura de propagación directa para datos secuenciales que reconoce características independientemente de la posición en la secuencia. Para lograr la invariancia temporal, se añaden retardos a la entrada, de modo que se analizan simultáneamente múltiples puntos de datos (puntos en el tiempo).

Generalmente forma parte de un sistema de reconocimiento de patrones más amplio. Se ha implementado utilizando una red perceptrón cuyos pesos de conexión se entrenaron con retropropagación (aprendizaje supervisado). [ 16 ]

Convolucional

Una red neuronal convolucional (CNN, o ConvNet, o invariante de desplazamiento, o invariante espacial) es una clase de red profunda, compuesta por una o más capas convolucionales con capas totalmente conectadas (que coinciden con las de las ANN típicas) en la parte superior. [ 17 ] [ 18 ] Utiliza pesos vinculados y capas de agrupación . En particular, agrupación máxima. [ 19 ] A menudo se estructura mediante la arquitectura convolucional de Fukushima. [ 20 ] Son variaciones de perceptrones multicapa que utilizan un preprocesamiento mínimo . [ 21 ] Esta arquitectura permite a las CNN aprovechar la estructura 2D de los datos de entrada.

Su patrón de conectividad de unidades se inspira en la organización de la corteza visual . Las unidades responden a estímulos en una región restringida del espacio conocida como campo receptivo . Los campos receptivos se superponen parcialmente, cubriendo todo el campo visual . La respuesta de las unidades se puede aproximar matemáticamente mediante una operación de convolución . [ 22 ]

Las CNN son adecuadas para procesar datos visuales y otros datos bidimensionales. [ 23 ] [ 24 ] Han demostrado resultados superiores tanto en aplicaciones de imagen como de voz. Se pueden entrenar con retropropagación estándar. Las CNN son más fáciles de entrenar que otras redes neuronales profundas de alimentación directa y tienen muchos menos parámetros que estimar. [ 25 ]

Las redes neuronales de cápsulas (CapsNet) añaden estructuras llamadas cápsulas a una CNN y reutilizan la salida de varias cápsulas para formar representaciones más estables (con respecto a diversas perturbaciones). [ 26 ]

Ejemplos de aplicaciones en visión artificial incluyen DeepDream [ 27 ] y navegación robótica . [ 28 ] Tienen amplias aplicaciones en reconocimiento de imágenes y video , sistemas de recomendación [ 29 ] y procesamiento del lenguaje natural . [ 30 ]

Red de apilamiento profundo

Una red de apilamiento profundo (DSN) [ 31 ] (red convexa profunda) se basa en una jerarquía de bloques de módulos de redes neuronales simplificadas. Fue introducida en 2011 por Deng y Yu. [ 32 ] Formula el aprendizaje como un problema de optimización convexa con una solución de forma cerrada , enfatizando la similitud del mecanismo con la generalización apilada . [ 33 ] Cada bloque DSN es un módulo simple que es fácil de entrenar por sí mismo de forma supervisada sin retropropagación para todos los bloques. [ 8 ]

Cada bloque consta de un perceptrón multicapa (MLP) simplificado con una sola capa oculta. La capa oculta h tiene unidades sigmoideas logísticas y la capa de salida tiene unidades lineales. Las conexiones entre estas capas están representadas por la matriz de pesos U; las conexiones de entrada a la capa oculta tienen la matriz de pesos W. Los vectores objetivo t forman las columnas de la matriz T y los vectores de datos de entrada x forman las columnas de la matriz X. La matriz de unidades ocultas esH=σ(WTincógnita){\displaystyle {\boldsymbol {H}}=\sigma ({\boldsymbol {W}}^{T}{\boldsymbol {X}})}Los módulos se entrenan en orden, por lo que los pesos de la capa inferior W se conocen en cada etapa. La función realiza la operación sigmoide logística elemento a elemento . Cada bloque estima la misma clase de etiqueta final y , y su estimación se concatena con la entrada original X para formar la entrada expandida para el siguiente bloque. Por lo tanto, la entrada del primer bloque contiene solo los datos originales, mientras que la entrada de los bloques posteriores agrega la salida de los bloques precedentes. Entonces, el aprendizaje de la matriz de pesos de la capa superior U, dados otros pesos en la red, se puede formular como un problema de optimización convexa:

minUTF=UTHTF2,{\displaystyle \min _{U^{T}}f=\|{\boldsymbol {U}}^{T}{\boldsymbol {H}}-{\boldsymbol {T}}\|_{F}^{2},}

que tiene una solución en forma cerrada. [ 31 ]

A diferencia de otras arquitecturas profundas, como las DBN , el objetivo no es descubrir la representación de características transformadas . La estructura jerárquica de este tipo de arquitectura simplifica el aprendizaje paralelo, tratándolo como un problema de optimización por lotes. En tareas puramente discriminativas , las DSN superan a las DBN convencionales.

redes de apilamiento profundo tensorial

Esta arquitectura es una extensión de DSN. Ofrece dos mejoras importantes: utiliza información de orden superior de las estadísticas de covarianza y transforma el problema no convexo de una capa inferior en un subproblema convexo de una capa superior. [ 34 ] Las TDSN utilizan estadísticas de covarianza en un mapeo bilineal desde cada uno de los dos conjuntos distintos de unidades ocultas en la misma capa a predicciones, a través de un tensor de tercer orden .

Si bien la paralelización y la escalabilidad no se consideran seriamente en las DNN convencionales , [ 35 ] [ 36 ] [ 37 ] todo el aprendizaje para DSN y TDSN se realiza en modo por lotes, para permitir la paralelización. [ 32 ] [ 31 ] La paralelización permite escalar el diseño a arquitecturas y conjuntos de datos más grandes (más profundos).

La arquitectura básica es adecuada para diversas tareas, como la clasificación y la regresión .

Con base en la física

Dicha red neuronal está diseñada para la solución numérica de ecuaciones matemáticas , tales como diferenciales, integrales, con retardo, fraccionarias y otras. Como parámetros de entrada, PINN [ 38 ] acepta variables (espaciales, temporales y otras) y las transmite a través del bloque de la red. En la salida, produce una solución aproximada y la sustituye en el modelo matemático, considerando las condiciones iniciales y de contorno. Si la solución no satisface la precisión requerida, se utiliza la retropropagación para rectificarla.

Además de PINN, se han desarrollado otras arquitecturas para producir modelos sustitutos para tareas de computación científica. Algunos ejemplos incluyen DeepONet, [ 39 ] operadores neuronales integrales (p. ej., FNO), [ 40 ] y campos neuronales (p. ej., CORAL). [ 41 ]

Retroalimentación regulatoria

Las redes de retroalimentación regulatoria explican la retroalimentación presente en las áreas de procesamiento de reconocimiento del cerebro. En lugar de que la inferencia de reconocimiento sea de alimentación directa (de entradas a salida), como en las redes neuronales, la retroalimentación regulatoria supone que la inferencia compara iterativamente las entradas con las salidas, y las neuronas inhiben sus propias entradas, evaluando colectivamente la importancia y singularidad de cada entrada para la siguiente iteración. Esto, en última instancia, permite que las activaciones neuronales minimicen la superposición mutua de entradas, estimando las distribuciones durante el reconocimiento y eliminando la necesidad de un entrenamiento y ensayo complejos de la red neuronal. [ 42 ]

El procesamiento de retroalimentación regulatoria sugiere un importante papel en el reconocimiento en tiempo real para la retroalimentación ubicua que se encuentra entre las neuronas pre y postsinápticas del cerebro, la cual se mantiene meticulosamente mediante la plasticidad homeostática : se ha descubierto que se mantiene en equilibrio a través de múltiples mecanismos, a menudo redundantes. La RF también muestra inherentemente fenómenos neurocientíficos como el equilibrio excitación-inhibición, la activación generalizada de la red seguida de un período de calma, y ​​fenómenos de búsqueda cognitiva humana como la dificultad con la similitud y la aparición repentina cuando hay múltiples entradas presentes, sin parámetros adicionales.

Una red de retroalimentación regulatoria realiza inferencias mediante retroalimentación negativa . [ 43 ] La retroalimentación se utiliza para encontrar la activación óptima de las unidades. Es muy similar a un método no paramétrico , pero se diferencia del algoritmo de los k vecinos más cercanos en que emula matemáticamente las redes de alimentación directa.

Función de base radial

Las funciones de base radial (RBF) son funciones que tienen un criterio de distancia con respecto a un centro. Se han aplicado como reemplazo de la característica de transferencia de la capa oculta sigmoidal en perceptrones multicapa. Las redes RBF tienen dos capas: en la primera, la entrada se mapea a cada RBF en la capa oculta. La RBF elegida suele ser una gaussiana. En problemas de regresión, la capa de salida es una combinación lineal de los valores de la capa oculta que representa la media de la salida predicha. La interpretación de este valor de la capa de salida es la misma que la de un modelo de regresión en estadística. En problemas de clasificación, la capa de salida es típicamente una función sigmoide de una combinación lineal de los valores de la capa oculta, que representa una probabilidad posterior. El rendimiento en ambos casos suele mejorarse mediante técnicas de contracción , conocidas como regresión de cresta en estadística clásica. Esto corresponde a una creencia previa en valores de parámetros pequeños (y, por lo tanto, funciones de salida suaves) en un marco bayesiano .

Las redes RBF tienen la ventaja de evitar mínimos locales, al igual que los perceptrones multicapa. Esto se debe a que los únicos parámetros que se ajustan durante el proceso de aprendizaje son la función de mapeo lineal entre la capa oculta y la capa de salida. La linealidad garantiza que la superficie de error sea cuadrática y, por lo tanto, tenga un único mínimo fácilmente detectable. En problemas de regresión, este mínimo se puede encontrar con una sola operación matricial. En problemas de clasificación, la no linealidad fija introducida por la función de salida sigmoide se maneja de manera más eficiente mediante el método iterativo de mínimos cuadrados ponderados .

Las redes RBF tienen la desventaja de requerir una buena cobertura del espacio de entrada mediante funciones de base radial. Los centros de las RBF se determinan en función de la distribución de los datos de entrada, pero sin tener en cuenta la tarea de predicción. Como resultado, se pueden desperdiciar recursos de representación en áreas del espacio de entrada irrelevantes para la tarea. Una solución común consiste en asociar cada punto de datos con su propio centro, aunque esto puede ampliar el sistema lineal a resolver en la capa final y requiere técnicas de reducción para evitar el sobreajuste .

Asociar cada dato de entrada con una RBF conduce naturalmente a métodos de kernel como las máquinas de vectores de soporte (SVM) y los procesos gaussianos (la RBF es la función kernel ). Los tres enfoques utilizan una función kernel no lineal para proyectar los datos de entrada en un espacio donde el problema de aprendizaje se puede resolver usando un modelo lineal. Al igual que los procesos gaussianos, y a diferencia de las SVM, las redes RBF se entrenan típicamente en un marco de máxima verosimilitud maximizando la probabilidad (minimizando el error). Las SVM evitan el sobreajuste maximizando en cambio un margen . Las SVM superan a las redes RBF en la mayoría de las aplicaciones de clasificación. En aplicaciones de regresión pueden ser competitivas cuando la dimensionalidad del espacio de entrada es relativamente pequeña.

Cómo funcionan las redes RBF

Las redes neuronales RBF son conceptualmente similares a los modelos de k vecinos más cercanos (k-NN). La idea básica es que entradas similares producen salidas similares.

Supongamos que cada caso en un conjunto de entrenamiento tiene dos variables predictoras, x e y, y la variable objetivo tiene dos categorías, positiva y negativa. Dado un nuevo caso con valores predictores x=6, y=5.1, ¿cómo se calcula la variable objetivo?

La clasificación del vecino más cercano que se realiza en este ejemplo depende de cuántos puntos vecinos se consideren. Si se utiliza la clasificación 1-NN y el punto más cercano es negativo, el nuevo punto se clasificará como negativo. Por otro lado, si se utiliza la clasificación 9-NN y se consideran los 9 puntos más cercanos, el efecto de los 8 puntos positivos circundantes puede ser mayor que el del noveno punto (negativo).

Una red RBF posiciona las neuronas en el espacio descrito por las variables predictoras (x, y en este ejemplo). Este espacio tiene tantas dimensiones como variables predictoras. Se calcula la distancia euclidiana desde el nuevo punto hasta el centro de cada neurona, y se aplica una función de base radial (RBF, también llamada función kernel) a dicha distancia para calcular el peso (influencia) de cada neurona. La función de base radial recibe este nombre porque la distancia radial es el argumento de la función.

Peso = RBF( distancia )

Función de base radial

El valor del nuevo punto se obtiene sumando los valores de salida de las funciones RBF multiplicados por los pesos calculados para cada neurona.

La función de base radial de una neurona tiene un centro y un radio (también llamado dispersión). El radio puede ser diferente para cada neurona y, en las redes RBF generadas por DTREG, el radio puede ser diferente en cada dimensión.

Cuanto mayor es la dispersión, mayor es la influencia de las neuronas que se encuentran a cierta distancia de un punto.

Arquitectura

Las redes RBF tienen tres capas:

  • Capa de entrada: Una neurona aparece en la capa de entrada por cada variable predictora. En el caso de variables categóricas , se utilizan N-1 neuronas, donde N es el número de categorías. Las neuronas de entrada estandarizan los rangos de valores restando la mediana y dividiendo por el rango intercuartil . Posteriormente, las neuronas de entrada envían estos valores a cada una de las neuronas de la capa oculta.
  • Capa oculta: Esta capa tiene un número variable de neuronas (determinado por el proceso de entrenamiento). Cada neurona consiste en una función de base radial centrada en un punto con tantas dimensiones como variables predictoras. La dispersión (radio) de la función RBF puede ser diferente para cada dimensión. Los centros y las dispersiones se determinan mediante el entrenamiento. Al recibir el vector x de valores de entrada de la capa de entrada, una neurona oculta calcula la distancia euclidiana del caso de prueba al punto central de la neurona y luego aplica la función kernel RBF a esta distancia utilizando los valores de dispersión. El valor resultante se pasa a la capa de suma.
  • Capa de sumatoria: El valor que sale de una neurona en la capa oculta se multiplica por un peso asociado a dicha neurona y se suma a los valores ponderados de las demás neuronas. Esta suma constituye la salida. En problemas de clasificación, se genera una salida (con un conjunto independiente de pesos y una unidad de sumatoria) para cada categoría objetivo. El valor de salida para una categoría representa la probabilidad de que el caso evaluado pertenezca a dicha categoría.

Capacitación

Los siguientes parámetros se determinan mediante el proceso de entrenamiento:

  • El número de neuronas en la capa oculta
  • Las coordenadas del centro de cada función RBF de capa oculta
  • El radio (expansión) de cada función RBF en cada dimensión
  • Los pesos aplicados a las salidas de la función RBF a medida que pasan a la capa de suma.

Se han utilizado diversos métodos para entrenar redes RBF. Un enfoque emplea primero el algoritmo de agrupamiento K-means para identificar los centros de los clústeres, que luego se utilizan como centros para las funciones RBF. Sin embargo, el agrupamiento K-means requiere una gran capacidad de cálculo y, a menudo, no genera el número óptimo de centros. Otro enfoque consiste en utilizar un subconjunto aleatorio de los puntos de entrenamiento como centros.

DTREG utiliza un algoritmo de entrenamiento basado en un enfoque evolutivo para determinar los puntos centrales y la dispersión óptimos para cada neurona. Determina cuándo dejar de añadir neuronas a la red monitorizando el error estimado de validación cruzada (LOO) y finaliza el proceso cuando este error comienza a aumentar debido al sobreajuste.

El cálculo de los pesos óptimos entre las neuronas de la capa oculta y la capa de suma se realiza mediante regresión de cresta. Un procedimiento iterativo calcula el parámetro Lambda de regularización óptimo que minimiza el error de validación cruzada generalizada (GCV).

Red neuronal de regresión general

Una GRNN es una red neuronal de memoria asociativa similar a una red neuronal probabilística , pero que se utiliza para regresión y aproximación en lugar de clasificación.

Red de creencias profundas

Máquina de Boltzmann restringida (RBM) con unidades visibles y ocultas totalmente conectadas. Nótese que no existen conexiones entre unidades ocultas ni entre unidades visibles.

Una red de creencias profundas (DBN) es un modelo generativo probabilístico compuesto por múltiples capas ocultas. Puede considerarse una composición de módulos de aprendizaje simples. [ 44 ]

Una DBN se puede utilizar para preentrenar de forma generativa una red neuronal profunda (DNN) usando los pesos aprendidos de la DBN como pesos iniciales de la DNN. Varios algoritmos discriminativos pueden luego ajustar estos pesos. Esto es particularmente útil cuando los datos de entrenamiento son limitados, ya que unos pesos mal inicializados pueden obstaculizar significativamente el aprendizaje. Estos pesos preentrenados terminan en una región del espacio de pesos más cercana a los pesos óptimos que las elecciones aleatorias. Esto permite tanto un modelado mejorado como una convergencia final más rápida. [ 45 ]

Red neuronal recurrente

Las redes neuronales recurrentes (RNN) propagan los datos hacia adelante, pero también hacia atrás, desde etapas de procesamiento posteriores a etapas anteriores. Las RNN pueden utilizarse como procesadores de secuencias generales.

Totalmente recurrente

Esta arquitectura se desarrolló en la década de 1980. Su red crea una conexión dirigida entre cada par de unidades. Cada una tiene una activación (salida) de valor real (más allá de cero o uno) que varía con el tiempo. Cada conexión tiene un peso de valor real modificable. Algunos nodos se denominan nodos etiquetados, otros nodos de salida y el resto nodos ocultos.

Para el aprendizaje supervisado en entornos de tiempo discreto, las secuencias de entrenamiento de vectores de entrada de valor real se convierten en secuencias de activaciones de los nodos de entrada, un vector de entrada a la vez. En cada paso de tiempo, cada unidad que no es de entrada calcula su activación actual como una función no lineal de la suma ponderada de las activaciones de todas las unidades de las que recibe conexiones. El sistema puede activar explícitamente (independientemente de las señales entrantes) algunas unidades de salida en ciertos pasos de tiempo. Por ejemplo, si la secuencia de entrada es una señal de voz que corresponde a un dígito hablado, la salida objetivo final al final de la secuencia puede ser una etiqueta que clasifique el dígito. Para cada secuencia, su error es la suma de las desviaciones de todas las activaciones calculadas por la red con respecto a las señales objetivo correspondientes. Para un conjunto de entrenamiento de numerosas secuencias, el error total es la suma de los errores de todas las secuencias individuales.

Para minimizar el error total, se puede utilizar el descenso de gradiente para cambiar cada peso en proporción a su derivada con respecto al error, siempre que las funciones de activación no lineales sean diferenciables . El método estándar se llama " retropropagación a través del tiempo " o BPTT, una generalización de la retropropagación para redes de alimentación directa. [ 46 ] [ 47 ] Una variante en línea más costosa computacionalmente se llama " aprendizaje recurrente en tiempo real " o RTRL. [ 48 ] [ 49 ] A diferencia de BPTT, este algoritmo es local en el tiempo pero no local en el espacio . [ 50 ] [ 51 ] Existe un híbrido en línea entre BPTT y RTRL con complejidad intermedia, [ 52 ] [ 53 ] con variantes para tiempo continuo. [ 54 ] Un problema importante con el descenso de gradiente para arquitecturas RNN estándar es que los gradientes de error se desvanecen exponencialmente rápido con el tamaño del retardo de tiempo entre eventos importantes. [ 55 ] [ 56 ] La arquitectura de memoria a corto y largo plazo supera estos problemas. [ 57 ]

En los sistemas de aprendizaje por refuerzo , ningún profesor proporciona señales objetivo. En su lugar, a veces se utiliza una función de aptitud , de recompensa o de utilidad para evaluar el rendimiento, la cual influye en su flujo de entrada a través de unidades de salida conectadas a actuadores que afectan al entorno. Con frecuencia se utilizan variantes de computación evolutiva para optimizar la matriz de ponderación.

Hopfield

La red de Hopfield (al igual que otras redes basadas en atractores) tiene interés histórico, aunque no es una RNN general, ya que no está diseñada para procesar secuencias de patrones. En cambio, requiere entradas estacionarias. Es una RNN en la que todas las conexiones son simétricas, lo que garantiza su convergencia. Si las conexiones se entrenan mediante aprendizaje hebbiano, la red de Hopfield puede funcionar como una memoria direccionable por contenido robusta , resistente a la alteración de las conexiones.

Máquina de Boltzmann

La máquina de Boltzmann puede considerarse una red de Hopfield con ruido. Es una de las primeras redes neuronales en demostrar el aprendizaje de variables latentes (unidades ocultas). Inicialmente, la simulación del aprendizaje automático de Boltzmann era lenta, pero el algoritmo de divergencia contrastiva acelera el entrenamiento tanto para las máquinas de Boltzmann como para los Productos de Expertos .

Mapa autoorganizado

El mapa autoorganizado (SOM) utiliza aprendizaje no supervisado . Un conjunto de neuronas aprende a mapear puntos de un espacio de entrada a coordenadas en un espacio de salida. El espacio de entrada puede tener dimensiones y topología diferentes al espacio de salida, y el SOM intenta preservar estas diferencias.

Aprendizaje de la cuantización vectorial

La cuantización vectorial de aprendizaje (LVQ) puede interpretarse como una arquitectura de red neuronal. Los representantes prototípicos de las clases se parametrizan, junto con una medida de distancia apropiada, en un esquema de clasificación basado en la distancia.

Recurrente simple

Las redes recurrentes simples tienen tres capas, con la adición de un conjunto de "unidades de contexto" en la capa de entrada. Estas unidades se conectan desde la capa oculta o la capa de salida con un peso fijo de uno. [ 58 ] En cada paso de tiempo, la entrada se propaga de forma estándar de alimentación directa, y luego se aplica una regla de aprendizaje similar a la retropropagación (sin realizar descenso de gradiente ). Las conexiones de retroceso fijas dejan una copia de los valores anteriores de las unidades ocultas en las unidades de contexto (ya que se propagan a través de las conexiones antes de que se aplique la regla de aprendizaje).

computación de reservorio

La computación de reservorio es un marco computacional que puede considerarse una extensión de las redes neuronales . [ 59 ] Típicamente, una señal de entrada se introduce en un sistema dinámico fijo (aleatorio) llamado reservorio , cuya dinámica mapea la entrada a una dimensión superior. Se entrena un mecanismo de lectura para mapear el reservorio a la salida deseada. El entrenamiento se realiza únicamente en la etapa de lectura. Las máquinas de estado líquido [ 60 ] son ​​un tipo de computación de reservorio. [ 61 ]

Estado de eco

La red de estado de eco (ESN) emplea una capa oculta aleatoria con conexiones dispersas. Los pesos de las neuronas de salida son la única parte de la red que se entrena. Las ESN son buenas para reproducir ciertas series temporales . [ 62 ]

Memoria a corto y largo plazo

La memoria a corto y largo plazo (LSTM) [ 57 ] evita el problema del gradiente evanescente . Funciona incluso con grandes retardos entre entradas y puede manejar señales que mezclan componentes de baja y alta frecuencia. La RNN LSTM superó a otras RNN y otros métodos de aprendizaje de secuencias, como HMM, en aplicaciones como el aprendizaje de idiomas [ 63 ] y el reconocimiento de escritura a mano conectada. [ 64 ]

Bidireccional

Las RNN bidireccionales, o BRNN, utilizan una secuencia finita para predecir o etiquetar cada elemento de una secuencia basándose tanto en el contexto pasado como futuro del elemento. [ 65 ] Esto se logra sumando las salidas de dos RNN: una procesando la secuencia de izquierda a derecha y la otra de derecha a izquierda. Las salidas combinadas son las predicciones de las señales objetivo proporcionadas por el maestro. Esta técnica ha demostrado ser especialmente útil cuando se combina con LSTM. [ 66 ]

Jerárquico

Las RNN jerárquicas conectan elementos de diversas maneras para descomponer el comportamiento jerárquico en subprogramas útiles. [ 67 ] [ 68 ]

Estocástico

A diferencia de las redes neuronales convencionales, la red neuronal artificial estocástica se utiliza como aproximación a funciones aleatorias.

Escala genética

Una RNN (a menudo una LSTM) descompone una serie en varias escalas, donde cada escala indica la distancia entre dos puntos consecutivos. Una escala de primer orden consiste en una RNN normal, una de segundo orden en todos los puntos separados por dos índices, y así sucesivamente. La RNN de orden N conecta el primer y el último nodo. Las salidas de todas las escalas se procesan como un conjunto de datos y las puntuaciones asociadas se utilizan de forma genética para la siguiente iteración.

Modular

Los estudios biológicos han demostrado que el cerebro humano funciona como un conjunto de pequeñas redes. Esta constatación dio origen al concepto de redes neuronales modulares , en las que varias redes pequeñas cooperan o compiten para resolver problemas.

Comité de máquinas

Un comité de máquinas (CoM) es un conjunto de diferentes redes neuronales que, en conjunto, "votan" sobre un ejemplo dado. Esto generalmente proporciona un resultado mucho mejor que el de las redes individuales. Debido a que las redes neuronales sufren de mínimos locales, comenzar con la misma arquitectura y entrenamiento, pero utilizando pesos iniciales aleatorios diferentes, suele dar resultados muy distintos. Un CoM tiende a estabilizar el resultado.

El método CoM es similar al método general de bagging de aprendizaje automático , con la diferencia de que la variedad necesaria de máquinas en el comité se obtiene mediante el entrenamiento a partir de diferentes pesos iniciales, en lugar de entrenar con diferentes subconjuntos seleccionados aleatoriamente de los datos de entrenamiento.

De asociación

La red neuronal asociativa (ASNN) es una extensión del comité de máquinas que combina múltiples redes neuronales de alimentación directa y la técnica de k-vecinos más cercanos. Utiliza la correlación entre las respuestas del conjunto como medida de distancia entre los casos analizados para el kNN. Esto corrige el sesgo del conjunto de redes neuronales. Una red neuronal asociativa tiene una memoria que puede coincidir con el conjunto de entrenamiento. Si se dispone de nuevos datos, la red mejora instantáneamente su capacidad predictiva y proporciona una aproximación de datos (autoaprendizaje) sin necesidad de reentrenamiento. Otra característica importante de la ASNN es la posibilidad de interpretar los resultados de la red neuronal mediante el análisis de las correlaciones entre los casos de datos en el espacio de modelos. [ 69 ]

Físico

Una red neuronal física incluye material de resistencia ajustable eléctricamente para simular sinapsis artificiales. Ejemplos de ello son la red neuronal basada en memristores ADALINE . [ 70 ] Una red neuronal óptica es una implementación física de una red neuronal artificial con componentes ópticos .     

Dinámica

A diferencia de las redes neuronales estáticas, las redes neuronales dinámicas adaptan su estructura y/o parámetros a la entrada durante la inferencia [ 71 ], mostrando un comportamiento dependiente del tiempo, como fenómenos transitorios y efectos de retardo. Las redes neuronales dinámicas en las que los parámetros pueden cambiar con el tiempo están relacionadas con la arquitectura de pesos rápidos (1987) [ 72 ] , donde una red neuronal genera los pesos de otra red neuronal.

Cascada

Cascade-Correlation es una arquitectura y un algoritmo de aprendizaje supervisado . En lugar de simplemente ajustar los pesos en una red de topología fija, [ 73 ] Cascade-Correlation comienza con una red mínima, luego entrena automáticamente y agrega nuevas unidades ocultas una por una, creando una estructura multicapa. Una vez que se ha agregado una nueva unidad oculta a la red, sus pesos del lado de entrada se congelan. Esta unidad se convierte entonces en un detector de características permanente en la red, disponible para producir salidas o para crear otros detectores de características más complejos. La arquitectura Cascade-Correlation tiene varias ventajas: aprende rápidamente, determina su propio tamaño y topología, retiene las estructuras que ha construido incluso si el conjunto de entrenamiento cambia y no requiere retropropagación .

Neurodifuso

Una red neurodifusa es un sistema de inferencia difusa integrado en una red neuronal artificial. Según el tipo de sistema de inferencia difusa (FIS, por sus siglas en inglés), varias capas simulan los procesos involucrados en la inferencia difusa, como la difusificación , la inferencia, la agregación y la desdifusificación . Integrar un FIS en la estructura general de una red neuronal artificial (RNA) permite utilizar los métodos de entrenamiento de RNA disponibles para determinar los parámetros del sistema difuso.

Producción de patrones compositivos

Las redes de producción de patrones compositivos (CPPN) son una variante de las redes neuronales artificiales que se diferencian por su conjunto de funciones de activación y su aplicación. Mientras que las redes neuronales artificiales típicas suelen contener únicamente funciones sigmoideas (y a veces funciones gaussianas ), las CPPN pueden incluir ambos tipos de funciones y muchas otras. Además, a diferencia de las redes neuronales artificiales típicas, las CPPN se aplican a todo el espacio de posibles entradas, lo que les permite representar una imagen completa. Al ser composiciones de funciones, las CPPN codifican imágenes con una resolución infinita y pueden muestrearse para una pantalla específica con la resolución óptima.

Redes de memoria

Las redes de memoria [ 74 ] [ 75 ] incorporan memoria a largo plazo . Esta memoria puede leerse y escribirse con el fin de utilizarla para la predicción. Estos modelos se han aplicado en el contexto de la respuesta a preguntas (QA), donde la memoria a largo plazo actúa eficazmente como una base de conocimiento (dinámica) y la salida es una respuesta textual. [ 76 ]

En la memoria distribuida dispersa o memoria temporal jerárquica , los patrones codificados por redes neuronales se utilizan como direcciones para la memoria direccionable por contenido , donde las "neuronas" actúan esencialmente como codificadores y decodificadores de direcciones . Sin embargo, los primeros controladores de dichas memorias no eran diferenciables. [ 77 ]

Memoria asociativa de un solo uso

Este tipo de red puede agregar nuevos patrones sin necesidad de reentrenamiento. Esto se logra mediante la creación de una estructura de memoria específica, que asigna cada nuevo patrón a un plano ortogonal utilizando matrices jerárquicas conectadas adyacentemente. [ 78 ] La red ofrece reconocimiento de patrones en tiempo real y alta escalabilidad; esto requiere procesamiento paralelo y, por lo tanto, es más adecuada para plataformas como redes de sensores inalámbricos , computación en malla y GPGPU .

Memoria temporal jerárquica

La memoria temporal jerárquica (MTH) modela algunas de las propiedades estructurales y algorítmicas del neocórtex . La MTH es un modelo biomimético basado en la teoría de la predicción de la memoria . La MTH es un método para descubrir e inferir las causas de alto nivel de los patrones y secuencias de entrada observados, construyendo así un modelo del mundo cada vez más complejo.

HTM combina ideas existentes para imitar la neocorteza con un diseño simple que ofrece múltiples capacidades. HTM combina y amplía enfoques utilizados en redes bayesianas y algoritmos de agrupamiento espacial y temporal, al tiempo que utiliza una jerarquía de nodos en forma de árbol, común en las redes neuronales .

Memoria asociativa holográfica

La memoria asociativa holográfica (HAM) es un sistema analógico, basado en correlación, asociativo y de estímulo-respuesta. La información se mapea en la orientación de fase de los números complejos. Esta memoria es eficaz para tareas de memoria asociativa , generalización y reconocimiento de patrones con atención variable. La localización de búsqueda dinámica es fundamental para la memoria biológica. En la percepción visual, los humanos se centran en objetos específicos dentro de un patrón. Pueden cambiar el enfoque de un objeto a otro sin necesidad de aprendizaje. La HAM puede imitar esta capacidad mediante la creación de representaciones explícitas del enfoque. Utiliza una representación bimodal del patrón y un espacio de estados de peso esférico complejo similar a un holograma. Las HAM son útiles para la realización óptica porque los cálculos hiperesféricos subyacentes pueden implementarse mediante computación óptica. [ 79 ]

Además de la memoria a corto y largo plazo (LSTM), otros enfoques también añadieron memoria diferenciable a las funciones recurrentes. Por ejemplo:

  • Acciones de empuje y extracción diferenciables para redes de memoria alternativas llamadas máquinas de pila neuronal [ 80 ] [ 81 ]
  • Redes de memoria donde el almacenamiento diferenciable externo de la red de control está en los pesos rápidos de otra red [ 82 ]
  • Compuertas de olvido LSTM [ 83 ]
  • RNN autorreferenciales con unidades de salida especiales para direccionar y manipular rápidamente los propios pesos de la RNN de forma diferenciable (almacenamiento interno) [ 84 ] [ 85 ]
  • Aprender a transducir con memoria ilimitada [ 86 ]

Máquinas de Turing neuronales

Las máquinas de Turing neuronales (NTM) [ 87 ] acoplan redes LSTM a recursos de memoria externos, con los que pueden interactuar mediante procesos atencionales. El sistema combinado es análogo a una máquina de Turing , pero es diferenciable de extremo a extremo, lo que permite entrenarlo eficientemente mediante descenso de gradiente . Los resultados preliminares demuestran que las máquinas de Turing neuronales pueden inferir algoritmos simples como copiar, ordenar y recordar asociativamente a partir de ejemplos de entrada y salida.

Las computadoras neuronales diferenciables (DNC) son una extensión de las NTM. Superaron a las máquinas de Turing neuronales, los sistemas de memoria a corto y largo plazo y las redes de memoria en tareas de procesamiento de secuencias. [ 88 ] [ 89 ] [ 90 ] [ 91 ] [ 92 ]

Hashing semántico

Los enfoques que representan experiencias previas directamente y utilizan una experiencia similar para formar un modelo local se denominan a menudo métodos de vecino más cercano o k-vecinos más cercanos . [ 93 ] El aprendizaje profundo es útil en el hash semántico [ 94 ] donde un modelo gráfico profundo los vectores de recuento de palabras [ 95 ] obtenidos de un gran conjunto de documentos. Los documentos se asignan a direcciones de memoria de tal manera que los documentos semánticamente similares se encuentran en direcciones cercanas. Los documentos similares a un documento de consulta se pueden encontrar accediendo a todas las direcciones que difieren solo en unos pocos bits de la dirección del documento de consulta. A diferencia de la memoria distribuida dispersa que opera en direcciones de 1000 bits, el hash semántico funciona en direcciones de 32 o 64 bits que se encuentran en una arquitectura de computadora convencional.

Redes de punteros

Las redes neuronales profundas pueden mejorarse potencialmente mediante la profundización y la reducción de parámetros, manteniendo la capacidad de entrenamiento. Si bien entrenar redes neuronales extremadamente profundas (por ejemplo, de 1 millón de capas) puede no ser práctico, las arquitecturas similares a las de la CPU , como las redes de punteros [ 96 ] y las máquinas neuronales de acceso aleatorio [ 97 ], superan esta limitación mediante el uso de memoria de acceso aleatorio externa y otros componentes que normalmente pertenecen a una arquitectura de computadora, como registros , ALU y punteros . Estos sistemas operan con vectores de distribución de probabilidad almacenados en celdas de memoria y registros. Por lo tanto, el modelo es completamente diferenciable y se entrena de extremo a extremo. La característica clave de estos modelos es que su profundidad, el tamaño de su memoria a corto plazo y el número de parámetros pueden modificarse de forma independiente.

Híbridos

Redes codificador-decodificador

Los marcos codificador-decodificador se basan en redes neuronales que mapean entradas altamente estructuradas a salidas altamente estructuradas. El enfoque surgió en el contexto de la traducción automática , [ 98 ] [ 99 ] [ 100 ] donde la entrada y la salida son oraciones escritas en dos idiomas naturales. En ese trabajo, se utilizó una RNN o CNN LSTM como codificador para resumir una oración de origen, y el resumen se decodificó utilizando un modelo de lenguaje RNN condicional para producir la traducción. [ 101 ] Estos sistemas comparten bloques de construcción: RNN y CNN con compuertas y mecanismos de atención entrenados.

Otros tipos

Entrenado al instante

Las redes neuronales de entrenamiento instantáneo (ITNN) se inspiraron en el fenómeno del aprendizaje a corto plazo, que parece ocurrir de forma instantánea. En estas redes, los pesos de las capas ocultas y de salida se asignan directamente a partir de los datos vectoriales de entrenamiento. Generalmente, funcionan con datos binarios, pero existen versiones para datos continuos que requieren un procesamiento adicional mínimo.

picos

Las redes neuronales de impulsos (SNN) consideran explícitamente la sincronización de las entradas. La entrada y la salida de la red se representan generalmente como una serie de impulsos ( función delta o formas más complejas). Las SNN pueden procesar información en el dominio del tiempo (señales que varían con el tiempo). A menudo se implementan como redes recurrentes. Las SNN también son una forma de computador de impulsos . [ 102 ]

Las redes neuronales de impulsos con retrasos en la conducción axonal exhiben policronización y, por lo tanto, podrían tener una capacidad de memoria muy grande. [ 103 ]

Las redes neuronales de impulsos (SNN) y las correlaciones temporales de los conjuntos neuronales en dichas redes se han utilizado para modelar la separación figura/fondo y la vinculación de regiones en el sistema visual.

Espacial

Las redes neuronales espaciales (SNN) constituyen una supercategoría de redes neuronales (NN) diseñadas para representar y predecir fenómenos geográficos. Generalmente mejoran tanto la precisión estadística como la fiabilidad de las NN no espaciales/clásicas cuando manejan conjuntos de datos geoespaciales , y también de otros modelos espaciales (estadísticos) (por ejemplo, modelos de regresión espacial) cuando las variables de los conjuntos de datos geoespaciales muestran relaciones no lineales . [ 104 ] [ 105 ] [ 106 ] Ejemplos de SNN son las redes neuronales espaciales OSFA, SVANN y GWNN.

Neocognitrón

El neocognitrón es una red jerárquica multicapa modelada a partir de la corteza visual . Utiliza varios tipos de unidades (originalmente dos, llamadas células simples y complejas ) como un modelo en cascada para su uso en tareas de reconocimiento de patrones. [ 107 ] [ 108 ] [ 109 ] Las células S extraen características locales cuya deformación es tolerada por las células C. Las características locales en la entrada se integran gradualmente y se clasifican en capas superiores. [ 110 ] Entre los diversos tipos de neocognitrón [ 111 ] hay sistemas que pueden detectar múltiples patrones en la misma entrada utilizando retropropagación para lograr atención selectiva . [ 112 ] Se ha utilizado para tareas de reconocimiento de patrones y ha inspirado redes neuronales convolucionales . [ 113 ]

Modelos jerárquicos profundos compuestos

Los modelos jerárquicos profundos compuestos componen redes profundas con modelos bayesianos no paramétricos . Las características se pueden aprender utilizando arquitecturas profundas como DBN , [ 114 ] máquinas de Boltzmann profundas (DBM), [ 115 ] autoencoders profundos, [ 116 ] variantes convolucionales, [ 117 ] [ 118 ] ssRBM , [ 119 ] redes de codificación profunda, [ 120 ] DBN con aprendizaje de características dispersas, [ 121 ] RNN , [ 122 ] DBN condicionales, [ 123 ] autoencoders de eliminación de ruido . [ 124 ] Esto proporciona una mejor representación, lo que permite un aprendizaje más rápido y una clasificación más precisa con datos de alta dimensión. Sin embargo, estas arquitecturas son deficientes para aprender clases nuevas con pocos ejemplos, porque todas las unidades de la red están involucradas en representar la entrada (unrepresentación distribuida ) y deben ajustarse juntos (altogrado de libertad). Limitar el grado de libertad reduce el número de parámetros a aprender, facilitando el aprendizaje de nuevas clases a partir de pocos ejemplos.Los modelos bayesianos jerárquicos (HB) permiten aprender a partir de pocos ejemplos, por ejemplo [ 125 ] [ 126 ] [ 127 ] [ 128 ] [ 129 ] paravisión por computadora,estadísticayciencia cognitiva.

Las arquitecturas HD compuestas buscan integrar características tanto de las redes HB como de las redes profundas. La arquitectura compuesta HDP-DBM es un proceso de Dirichlet jerárquico (HDP) como modelo jerárquico, que incorpora la arquitectura DBM. Es un modelo generativo completo , generalizado a partir de conceptos abstractos que fluyen a través de las capas del modelo, capaz de sintetizar nuevos ejemplos en clases novedosas que parecen "razonablemente" naturales. Todos los niveles se aprenden conjuntamente maximizando una puntuación de probabilidad logarítmica conjunta . [ 130 ]

En un DBM con tres capas ocultas, la probabilidad de una entrada visible '' ν '' es:

pag(ν,ψ)=1Zhexp(ijWij(1)νihj1+jWj(2)hj1h2+metroWmetro(3)h2hmetro3),{\displaystyle p({\boldsymbol {\nu }},\psi )={\frac {1}{Z}}\sum _{h}\exp \left(\sum _{ij}W_{ij}^{(1)}\nu _{i}h_{j}^{1}+\sum _{j\ell }W_{j\ell }^{(2)}h_{j}^{1}h_{\ell }^{2}+\sum _{\ell m}W_{\ell m}^{(3)}h_{\ell }^{2}h_{m}^{3}\right),}

dóndeh={h(1),h(2),h(3)}{\displaystyle {\boldsymbol {h}}=\{{\boldsymbol {h}}^{(1)},{\boldsymbol {h}}^{(2)},{\boldsymbol {h}}^{(3)}\}}es el conjunto de unidades ocultas, yψ={W(1),W(2),W(3)}{\displaystyle \psi =\{{\boldsymbol {W}}^{(1)},{\boldsymbol {W}}^{(2)},{\boldsymbol {W}}^{(3)}\}}son los parámetros del modelo, que representan términos de interacción simétrica visible-oculto y oculto-oculto.

Un modelo DBM aprendido es un modelo no dirigido que define la distribución conjunta.PAG(ν,h1,h2,h3){\displaystyle P(\nu ,h^{1},h^{2},h^{3})}Una forma de expresar lo que se ha aprendido es mediante el modelo condicional .PAG(ν,h1,h2h3){\displaystyle P(\nu ,h^{1},h^{2}\mid h^{3})}y un término anteriorPAG(h3){\displaystyle P(h^{3})}.

AquíPAG(ν,h1,h2h3){\displaystyle P(\nu ,h^{1},h^{2}\mid h^{3})}representa un modelo DBM condicional, que puede verse como un DBM de dos capas pero con términos de sesgo dados por los estados deh3{\displaystyle h^{3}}:

PAG(ν,h1,h2h3)=1Z(ψ,h3)exp(ijWij(1)νihj1+jWj(2)hj1h2+metroWmetro(3)h2hmetro3).{\displaystyle P(\nu ,h^{1},h^{2}\mid h^{3})={\frac {1}{Z(\psi ,h^{3})}}\exp \left(\sum _{ij}W_{ij}^{(1)}\nu _{i}h_{j}^{1}+\sum _{j\ell }W_{j\ell }^{(2)}h_{j}^{1}h_{\ell }^{2}+\sum _{\ell m}W_{\ell m}^{(3)}h_{\ell }^{2}h_{m}^{3}\right).}

Redes de codificación predictiva profunda

Una red de codificación predictiva profunda (DPCN) es un esquema de codificación predictiva que utiliza información descendente para ajustar empíricamente las probabilidades a priori necesarias para un procedimiento de inferencia ascendente mediante un modelo generativo profundo, conectado localmente . Esto funciona extrayendo características dispersas de observaciones que varían en el tiempo utilizando un modelo dinámico lineal. Luego, se utiliza una estrategia de agrupación para aprender representaciones de características invariantes. Estas unidades se componen para formar una arquitectura profunda y se entrenan mediante aprendizaje no supervisado capa por capa con enfoque voraz . Las capas constituyen una especie de cadena de Markov, de modo que los estados en cualquier capa dependen solo de las capas anterior y posterior.

Las DPCN predicen la representación de la capa, utilizando un enfoque descendente que emplea la información de la capa superior y las dependencias temporales de estados anteriores. [ 131 ]

Las DPCN se pueden extender para formar una red convolucional . [ 131 ]

Máquina de núcleos multicapa

Las máquinas de núcleo multicapa (MKM) son una forma de aprender funciones altamente no lineales mediante la aplicación iterativa de núcleos débilmente no lineales. Utilizan el análisis de componentes principales de núcleo (KPCA), [ 132 ] como método para el paso de preentrenamiento codicioso no supervisado por capas del aprendizaje profundo. [ 133 ]

Capa+1{\displaystyle \ell +1}aprende la representación de la capa anterior{\displaystyle \ell }, extrayendo elnortel{\displaystyle n_{l}}componente principal (CP) de la capa de proyecciónl{\displaystyle l}Salida en el dominio de características inducido por el kernel. Para reducir la dimensionalidad de la representación actualizada en cada capa, una estrategia supervisada selecciona las características más informativas entre las extraídas por KPCA. El proceso es:

  • clasificar elnorte{\displaystyle n_{\ell }}características según su información mutua con las etiquetas de clase;
  • para diferentes valores de K ymetro{1,,norte}{\displaystyle m_{\ell }\in \{1,\ldots ,n_{\ell }\}}, calcular la tasa de error de clasificación de un clasificador de K vecinos más cercanos (K-NN) utilizando únicamente elmetrol{\displaystyle m_{l}}características más informativas en un conjunto de validación ;
  • el valor demetro{\displaystyle m_{\ell }}El valor con el que el clasificador ha alcanzado la tasa de error más baja determina el número de características que se deben conservar.

El método KPCA para los MKM presenta algunos inconvenientes.

Se desarrolló una forma más directa de usar máquinas de kernel para el aprendizaje profundo en la comprensión del lenguaje hablado. [ 134 ] La idea principal es usar una máquina de kernel para aproximar una red neuronal superficial con un número infinito de unidades ocultas, luego usar una red de apilamiento profundo para combinar la salida de la máquina de kernel y la entrada sin procesar para construir el siguiente nivel superior de la máquina de kernel. El número de niveles en la red convexa profunda es un hiperparámetro del sistema general, que se determinará mediante validación cruzada .

Véase también

Referencias

  1. LeCun Y, Boser B, Denker JS, Henderson D, Howard RE, Hubbard W, Jackel LD (1989). "Retropropagación aplicada al reconocimiento de códigos postales manuscritos". Neural Computation . 1 (4): 541– 551. doi : 10.1162/neco.1989.1.4.541 . S2CID 41312633 . 
  2. Yann LeCun (2016). Diapositivas sobre aprendizaje profundo en línea. Archivadas el 23 de abril de 2016 en Wayback Machine.
  3. Silver, David ; Hubert, Thomas; Schrittwieser, Julian; Antonoglou, Ioannis; Lai, Matthew; Guez, Arthur; Lanctot, Marc; Sifre, Laurent; Kumaran, Dharshan ; Graepel, Thore; Lillicrap, Timothy; Simonyan, Karen; Hassabis, Demis (5 de diciembre de 2017). "Dominando el ajedrez y el shogi mediante el autoaprendizaje con un algoritmo general de aprendizaje por refuerzo". arXiv : 1712.01815 [ cs.AI ].
  4. Goodfellow, Ian; Pouget-Abadie, Jean; Mirza, Mehdi; Xu, Bing; Warde-Farley, David; Ozair, Sherjil; Courville, Aaron; Bengio, Yoshua (2014). Generative Adversarial Networks (PDF) . Actas de la Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal (NIPS 2014). págs. 2672–2680 . Archivado (PDF) del original el 22 de noviembre de 2019. Recuperado el 20 de agosto de 2019 . 
  5. Ivakhnenko, Alexey Grigorevich (1968). "El método de grupo para el manejo de datos: un rival del método de aproximación estocástica" . Control Automático Soviético . 13 (3): 43– 55.
  6. Ivakhnenko, AG (1971). "Teoría polinómica de sistemas complejos" . IEEE Transactions on Systems, Man, and Cybernetics . 1 (4): 364– 378. doi : 10.1109/TSMC.1971.4308320 . S2CID 17606980 . 
  7. Kondo, T.; Ueno, J. (2008). "Arquitectura de red neuronal óptima auto-seleccionable de tipo GMDH multicapa y su aplicación al reconocimiento de imágenes médicas tridimensionales de vasos sanguíneos" . International Journal of Innovative Computing, Information and Control . 4 (1): 175– 187.
  8. 1 2 Bengio, Y. (2009-11-15). "Learning Deep Architectures for AI" (PDF) . Foundations and Trends in Machine Learning . 2 (1): 1– 127. CiteSeerX 10.1.1.701.9550 . doi : 10.1561/2200000006 . ISSN 1935-8237 . S2CID 207178999 .   
  9. Liou, Cheng-Yuan (2008). "Modelado de la percepción de palabras mediante la red de Elman" (PDF) . Neurocomputing . 71 ( 16–18 ): 3150–3157 . doi : 10.1016/j.neucom.2008.04.030 .
  10. Liou, Cheng-Yuan (2014). "Autoencoder para palabras". Neurocomputing . 139 : 84–96 . doi : 10.1016/j.neucom.2013.09.055 .
  11. Diederik P. Kingma; Bien, Max (2013). "Bayes variacionales de codificación automática". arXiv : 1312.6114 [ estad.ML ].
  12. Boesen, A.; Larsen, L.; Sonderby, SK (2015). "Generando rostros con Torch" .
  13. "Red neuronal probabilística competitiva (descarga en PDF disponible)" . ResearchGate . Consultado el 16 de marzo de 2017 .
  14. "Redes neuronales probabilísticas" . Archivado del original el 18 de diciembre de 2010. Consultado el 22 de marzo de 2012 .
  15. Cheung, Vincent; Cannons, Kevin (10 de junio de 2002). "Introducción a las redes neuronales probabilísticas" (PDF) . Grupo de Inferencia Probabilística y Estadística . Archivado del original (PDF) el 31 de enero de 2012. Consultado el 22 de marzo de 2012 .
  16. "Fundamentos de TDNN" . Archivado del original el 22 de marzo de 2017. Consultado el 18 de junio de 2017 ., un capítulo del manual en línea de SNNS
  17. Zhang, Wei (1990). "Modelo de procesamiento distribuido en paralelo con interconexiones locales invariantes en el espacio y su arquitectura óptica" . Applied Optics . 29 (32): 4790–7 . Bibcode : 1990ApOpt..29.4790Z . doi : 10.1364/ao.29.004790 . PMID 20577468 . 
  18. Zhang, Wei (1988). "Red neuronal de reconocimiento de patrones invariante al desplazamiento y su arquitectura óptica" . Actas de la Conferencia Anual de la Sociedad Japonesa de Física Aplicada .
  19. Weng, J.; Ahuja, N.; Huang, TS (mayo de 1993). Aprendizaje del reconocimiento y segmentación de objetos 3D a partir de imágenes 2D (PDF) . 4.ª Conferencia Internacional sobre Visión por Computadora. Berlín, Alemania. págs. 121–128 . 
  20. Fukushima, K. (1980). "Neocognitron: Un modelo de red neuronal autoorganizada para un mecanismo de reconocimiento de patrones no afectado por el cambio de posición" . Biol . Cybern . 36 (4): 193–202 . doi : 10.1007/bf00344251 . PMID 7370364. S2CID 206775608 .  
  21. LeCun, Yann. "LeNet-5, redes neuronales convolucionales" . Consultado el 16 de noviembre de 2013 .
  22. "Redes neuronales convolucionales (LeNet) – Documentación de DeepLearning 0.1" . DeepLearning 0.1 . LISA Lab. Archivado del original el 28 de diciembre de 2017. Recuperado el 31 de agosto de 2013 .
  23. LeCun, et al. (1989). "Retropropagación aplicada al reconocimiento de códigos postales manuscritos" . Neural Computation . 1 (4): 541– 551. doi : 10.1162/neco.1989.1.4.541 . 
  24. LeCun, Yann (2016). "Diapositivas sobre aprendizaje profundo en línea" .
  25. "Tutorial de aprendizaje de características no supervisado y aprendizaje profundo" . ufldl.stanford.edu .
  26. Hinton, Geoffrey E.; Krizhevsky, Alex; Wang, Sida D. (2011), "Transforming Auto-Encoders", Redes neuronales artificiales y aprendizaje automático – ICANN 2011 , Lecture Notes in Computer Science, vol. 6791, Springer, pp. 44–51 , CiteSeerX 10.1.1.220.5099 , doi : 10.1007/978-3-642-21735-7_6 , ISBN    9783642217340, S2CID 6138085 
  27. Szegedy, Christian; Liu, Wei; Jia, Yangqing; Sermanet, Pierre; Reed, Scott E.; Anguelov, Dragomir; Erhan, Dumitru; Vanhoucke, Vincent; Rabinovich, Andrew (2015). "Going deeper with convolutions". Conferencia IEEE sobre Visión por Computadora y Reconocimiento de Patrones, CVPR 2015, Boston, MA, EE. UU., 7-12 de junio de 2015. IEEE Computer Society. págs. 1-9 . arXiv : 1409.4842 . doi : 10.1109/CVPR.2015.7298594 . ISBN  978-1-4673-6964-0.
  28. Ran, Lingyan; Zhang, Yanning; Zhang, Qilin; Yang, Tao (2017-06-12). "Navegación de robots basada en redes neuronales convolucionales utilizando imágenes esféricas sin calibrar" ( PDF) . Sensors . 17 (6): 1341. Bibcode : 2017Senso..17.1341R . doi : 10.3390/s17061341 . ISSN 1424-8220 . PMC 5492478. PMID 28604624 .   
  29. ^ van den Oord, Aarón; Dieleman, Sander; Schrauwen, Benjamín (1 de enero de 2013). Burges, CJC; Bottou, L.; Bien, M.; Ghahramani, Z.; Weinberger, KQ (eds.). Recomendación musical profunda basada en contenido (PDF) . Asociados Curran. págs. 2643-2651 . 
  30. Collobert, Ronan; Weston, Jason (1 de enero de 2008). «Una arquitectura unificada para el procesamiento del lenguaje natural». Actas de la 25.ª conferencia internacional sobre aprendizaje automático - ICML '08 . Nueva York, NY, EE. UU.: ACM. págs. 160–167 . doi : 10.1145/1390156.1390177 . ISBN  978-1-60558-205-4. S2CID 2617020 . 
  31. 1 2 3 Deng, Li; Yu, Dong; Platt, John (2012). "Apilamiento y aprendizaje escalables para la construcción de arquitecturas profundas" (PDF) . Conferencia Internacional IEEE de 2012 sobre Acústica, Habla y Procesamiento de Señales (ICASSP) . págs. 2133–2136 . doi : 10.1109/ICASSP.2012.6288333 . ISBN  978-1-4673-0046-9. S2CID 16171497 . 
  32. 1 2 Deng, Li; Yu, Dong (2011). "Deep Convex Net: A Scalable Architecture for Speech Pattern Classification" (PDF) . Actas de Interspeech : 2285–2288 . doi : 10.21437/Interspeech.2011-607 . S2CID 36439 . 
  33. David, Wolpert (1992). "Generalización apilada". Redes neuronales . 5 (2): 241– 259. CiteSeerX 10.1.1.133.8090 . doi : 10.1016/S0893-6080(05)80023-1 . 
  34. Hutchinson, Brian; Deng, Li; Yu, Dong (2012). "Redes de apilamiento profundo de tensores". IEEE Transactions on Pattern Analysis and Machine Intelligence . 1–15 (8): 1944–1957 . doi : 10.1109/tpami.2012.268 . PMID 23267198. S2CID 344385 .  
  35. Hinton, Geoffrey; Salakhutdinov, Ruslan (2006). "Reducción de la dimensionalidad de los datos con redes neuronales" . Science . 313 (5786): 504– 507. Bibcode : 2006Sci...313..504H . doi : 10.1126/science.1127647 . PMID 16873662. S2CID 1658773 .  
  36. Dahl, G.; Yu, D.; Deng, L.; Acero, A. (2012). "Redes neuronales profundas preentrenadas dependientes del contexto para el reconocimiento de voz con vocabulario extenso". IEEE Transactions on Audio, Speech, and Language Processing . 20 (1): 30– 42. Bibcode : 2012ITASL..20...30D . CiteSeerX 10.1.1.227.8990 . doi : 10.1109/tasl.2011.2134090 . S2CID 14862572 .  
  37. Mohamed, Abdel-rahman; Dahl, George; Hinton, Geoffrey (2012). "Modelado acústico mediante redes neuronales profundas". IEEE Transactions on Audio, Speech, and Language Processing . 20 (1): 14– 22. Bibcode : 2012ITASL..20...14M . CiteSeerX 10.1.1.338.2670 . doi : 10.1109/tasl.2011.2109382 . S2CID 9530137 .  
  38. Pang, Guofei; Lu, Lu; Karniadakis, George Em (2019). "fPINNs: Redes neuronales fraccionarias basadas en la física" . SIAM Journal on Scientific Computing . 41 (4): A2603– A2626. arXiv : 1811.08967 . Bibcode : 2019SJSC...41A2603P . doi : 10.1137/18M1229845 . ISSN 1064-8275 . 
  39. Lu, Lu; Jin, Pengzhan; Pang, Guofei; Zhang, Zhongqiang; Karniadakis, George Em (2021-03-18). "Aprendizaje de operadores no lineales mediante DeepONet basado en el teorema de aproximación universal de operadores" . Nature Machine Intelligence . 3 (3): 218– 229. arXiv : 1910.03193 . doi : 10.1038/s42256-021-00302-5 . ISSN 2522-5839 . 
  40. You, Huaiqian; Zhang, Quinn; Ross, Colton J.; Lee, Chung-Hao; Yu, Yue (2022-08-01). "Aprendizaje de operadores neuronales implícitos de Fourier profundos (IFNO) con aplicaciones al modelado de materiales heterogéneos" . Métodos informáticos en mecánica aplicada e ingeniería . 398 115296. arXiv : 2203.08205 . doi : 10.1016/j.cma.2022.115296 . ISSN 0045-7825 . 
  41. ^ Serrano, Luis; Lisé Le Boudec; Armand Kassaï Koupaï; Tomás X Wang; Yin, Yuan; Vittaut, Jean-Noël; Gallinari, Patricio (2023). "Aprendizaje de operadores con campos neuronales: abordar PDE en geometrías generales". arXiv : 2306.07266 [ cs.LG ].
  42. Achler, T. (2023). "Lo que la IA, la neurociencia y la ciencia cognitiva pueden aprender unas de otras: una perspectiva integrada". Computación cognitiva .
  43. Achler, T.; Omar, C.; Amir, E. (2008). Aligerando peso: Más con menos . Conferencia Internacional Conjunta sobre Redes Neuronales.
  44. Hinton, GE (2009). "Redes de creencias profundas" . Scholarpedia . 4 (5): 5947. Bibcode : 2009SchpJ...4.5947H . doi : 10.4249/scholarpedia.5947 .
  45. Larochelle, Hugo; Erhan, Dumitru; Courville, Aaron; Bergstra, James; Bengio, Yoshua (2007). "Una evaluación empírica de arquitecturas profundas en problemas con muchos factores de variación". Actas de la 24.ª conferencia internacional sobre aprendizaje automático . ICML '07. Nueva York, NY, EE. UU.: ACM. págs. 473–480 . CiteSeerX 10.1.1.77.3242 . doi : 10.1145/1273496.1273556 . ISBN   9781595937933. S2CID 14805281 . 
  46. Werbos, PJ (1988). "Generalización de la retropropagación con aplicación a un modelo recurrente de mercado de gas" . Redes neuronales . 1 (4): 339– 356. doi : 10.1016/0893-6080(88)90007-x .
  47. Rumelhart, David E.; Hinton, Geoffrey E.; Williams, Ronald J. Aprendizaje de representaciones internas mediante propagación de errores (Informe). S2CID 62245742 . 
  48. Robinson, AJ; Fallside, F. (1987). La red dinámica de propagación de errores impulsada por la utilidad. Informe técnico CUED/F-INFENG/TR.1 (PDF) (Informe). Departamento de Ingeniería de la Universidad de Cambridge.
  49. Williams, RJ; Zipser, D. (1994). "Algoritmos de aprendizaje basados ​​en gradientes para redes recurrentes y su complejidad computacional" (PDF) . Retropropagación: Teoría, arquitecturas y aplicaciones . Hillsdale, NJ: Erlbaum. S2CID 14792754 . 
  50. Schmidhuber, J. (1989). "Un algoritmo de aprendizaje local para redes recurrentes y de alimentación directa dinámicas". Connection Science . 1 (4): 403– 412. doi : 10.1080/09540098908915650 . S2CID 18721007 . 
  51. Principe, JC; Euliano, NR; Lefebvre, WC Sistemas neuronales y adaptativos: Fundamentos a través de la simulación .
  52. Schmidhuber, J. (1992). "Un algoritmo de aprendizaje con complejidad temporal O(n3) de almacenamiento de tamaño fijo para redes neuronales recurrentes de ejecución continua". Neural Computation . 4 (2): 243– 248. doi : 10.1162/neco.1992.4.2.243 . S2CID 11761172 . 
  53. Williams, RJ (1989). Complejidad de los algoritmos de cálculo de gradiente exacto para redes neuronales recurrentes. Informe técnico NU-CCS-89-27 (Informe). Boston: Northeastern University, Facultad de Ciencias de la Computación.
  54. Pearlmutter, BA (1989). "Aprendizaje de trayectorias en el espacio de estados en redes neuronales recurrentes" (PDF) . Neural Computation . 1 (2): 263– 269. doi : 10.1162/neco.1989.1.2.263 . S2CID 16813485 . 
  55. ^ Hochreiter, S. (1991). Untersuchungen zu dynamischen neuronalen Netzen (tesis de diploma) (en alemán). Múnich: Instituto f. Informática, Universidad Técnica.
  56. Hochreiter, S.; Bengio, Y.; Frasconi, P.; Schmidhuber, J. (2001). "Flujo de gradiente en redes recurrentes: la dificultad de aprender dependencias a largo plazo" (PDF) . En Kremer, SC; Kolen, JF (eds.). Guía de campo para redes neuronales recurrentes dinámicas . IEEE Press.
  57. 1 2 Hochreiter, S.; Schmidhuber, J. (1997). "Memoria a corto y largo plazo". Neural Computation . 9 (8): 1735– 1780. doi : 10.1162/neco.1997.9.8.1735 . PMID 9377276 . S2CID 1915014 .  
  58. Cruse, Holk. Redes neuronales como sistemas cibernéticos (PDF) (2.ª ed. revisada). 
  59. ^ Schrauwen, Benjamín; Verstraeten, David; Campenhout, Jan Van (2007). Una descripción general de la computación de yacimientos: teoría, aplicaciones e implementaciones . Simposio europeo sobre redes neuronales artificiales ESANN. págs. 471– 482. 
  60. Mass, Wolfgang; Nachtschlaeger, T.; Markram, H. (2002). "Computación en tiempo real sin estados estables: un nuevo marco para la computación neuronal basado en perturbaciones" . Neural Computation . 14 (11): 2531– 2560. doi : 10.1162/089976602760407955 . PMID 12433288. S2CID 1045112 .  
  61. Jaeger, Herbert (2007). "Red de estado de eco" . Scholarpedia . 2 (9): 2330. Bibcode : 2007SchpJ...2.2330J . doi : 10.4249/scholarpedia.2330 .
  62. Jaeger, H.; Harnessing (2004). "Predicción de sistemas caóticos y ahorro de energía en la comunicación inalámbrica" . Science . 304 (5667): 78– 80. Bibcode : 2004Sci...304...78J . CiteSeerX 10.1.1.719.2301 . doi : 10.1126 /science.1091277 . PMID 15064413. S2CID 2184251 .   
  63. Gers, FA; Schmidhuber, J. (2001). "Las redes recurrentes LSTM aprenden lenguajes simples, tanto libres de contexto como sensibles al contexto" . IEEE Transactions on Neural Networks . 12 (6): 1333– 1340. Bibcode : 2001ITNN...12.1333G . doi : 10.1109/72.963769 . PMID 18249962 . 
  64. Graves, A.; Schmidhuber, J. (2009). Reconocimiento de escritura a mano fuera de línea con redes neuronales recurrentes multidimensionales (PDF) . Advances in Neural Information Processing Systems 22, NIPS'22. Vancouver: MIT Press. pp. 545–552 . 
  65. Schuster, Mike; Paliwal, Kuldip K. (1997). "Redes neuronales recurrentes bidireccionales" . IEEE Transactions on Signal Processing . 45 (11): 2673– 2681. Bibcode : 1997ITSP...45.2673S . CiteSeerX 10.1.1.331.9441 . doi : 10.1109/78.650093 . S2CID 18375389 .  
  66. Graves, A.; Schmidhuber, J. (2005). "Clasificación de fonemas por marco con LSTM bidireccional y otras arquitecturas de redes neuronales" . Redes neuronales . 18 ( 5–6 ): 602–610 . CiteSeerX 10.1.1.331.5800 . doi : 10.1016/j.neunet.2005.06.042 . PMID 16112549. S2CID 1856462 .   
  67. Schmidhuber, J. (1992). "Aprendizaje de secuencias complejas y extendidas mediante el principio de compresión histórica". Neural Computation . 4 (2): 234– 242. doi : 10.1162/neco.1992.4.2.234 . S2CID 18271205 . 
  68. "Representación dinámica de primitivas de movimiento en una red neuronal recurrente evolucionada" (PDF) . Archivado del original (PDF) el 18 de julio de 2011. Consultado el 12 de julio de 2010 .
  69. "Red neuronal asociativa" . www.vcclab.org . Consultado el 17 de junio de 2017 .
  70. Anderson, James A.; Rosenfeld, Edward (2000). Talking Nets: An Oral History of Neural Networks . MIT Press. ISBN 9780262511117.
  71. Y. Han, G. Huang, S. Song, L. Yang, H. Wang y Y. Wang, "Redes neuronales dinámicas: una revisión", en IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 44, n.º 11, págs. 7436-7456, 1 de noviembre de 2022, doi: 10.1109/TPAMI.2021.3117837.
  72. Hinton, Geoffrey E.; Plaut, David C. (1987). "Uso de pesos rápidos para desenfocar recuerdos antiguos" . Actas de la Reunión Anual de la Sociedad de Ciencias Cognitivas . 9 .
  73. Fahlman, Scott E.; Lebiere, Christian (29 de agosto de 1991). "The Cascade-Correlation Learning Architecture" (PDF) . Universidad Carnegie Mellon . Archivado del original (PDF) el 3 de mayo de 2013. Recuperado el 4 de octubre de 2014 .
  74. Schmidhuber, Juergen (2014). "Redes de memoria". arXiv : 1410.3916 [ cs.AI ].
  75. Schmidhuber, Juergen (2015). "Redes de memoria de extremo a extremo". arXiv : 1503.08895 [ cs.NE ].
  76. Schmidhuber, Juergen (2015). "Large-scale Simple Question Answering with Memory Networks". arXiv : 1506.02075 [ cs.LG ].
  77. Hinton, Geoffrey E. (1984). "Representaciones distribuidas" . Archivado del original el 2 de mayo de 2016.
  78. Nasution, BB; Khan, AI (febrero de 2008). "Un esquema jerárquico de neuronas gráficas para el reconocimiento de patrones en tiempo real". IEEE Transactions on Neural Networks . 19 (2): 212– 229. Bibcode : 2008ITNN...19..212N . doi : 10.1109/TNN.2007.905857 . PMID 18269954. S2CID 17573325 .  
  79. Sutherland, John G. (1 de enero de 1990). "Un modelo holográfico de memoria, aprendizaje y expresión". International Journal of Neural Systems . 01 (3): 259– 267. doi : 10.1142/S0129065790000163 .
  80. Das, S.; Giles, CL; Sun, GZ (1992). Aprendizaje de gramáticas libres de contexto: limitaciones de una red neuronal recurrente con memoria de pila externa . 14.ª Conferencia Anual de la Sociedad de Ciencias Cognitivas, pág. 79. 
  81. Mozer, MC; Das, S. (1993). "Un manipulador de símbolos conexionista que descubre la estructura de los lenguajes libres de contexto" . Advances in Neural Information Processing Systems . 5 : 863–870 . Archivado del original el 6 de diciembre de 2019. Consultado el 25 de agosto de 2019 .
  82. Schmidhuber, J. (1992). "Aprendizaje para controlar memorias de peso rápido: una alternativa a las redes recurrentes". Neural Computation . 4 (1): 131– 139. doi : 10.1162/neco.1992.4.1.131 . S2CID 16683347 . 
  83. Gers, F.; Schraudolph, N.; Schmidhuber, J. (2002). "Aprendizaje de sincronización precisa con redes recurrentes LSTM" (PDF) . JMLR . 3 : 115–143 .
  84. Jürgen Schmidhuber (1993). "Una red introspectiva que puede aprender a ejecutar su propio algoritmo de cambio de peso". Actas de la Conferencia Internacional sobre Redes Neuronales Artificiales, Brighton . IEE. págs. 191–195 . 
  85. Hochreiter, Sepp; Younger, A. Steven; Conwell, Peter R. (2001). "Learning to Learn Using Gradient Descent". ICANN . 2130 : 87– 94. CiteSeerX 10.1.1.5.323 . 
  86. Schmidhuber, Juergen (2015). "Learning to Transduce with Unbounded Memory". arXiv : 1506.02516 [ cs.NE ].
  87. Schmidhuber, Juergen (2014). "Máquinas de Turing neuronales". arXiv : 1410.5401 [ cs.NE ].
  88. Burgess, Matt. "La IA de DeepMind aprendió a viajar en el metro de Londres utilizando razonamiento y memoria similares a los humanos" . WIRED UK . Consultado el 19 de octubre de 2016 .
  89. "La IA de DeepMind 'aprende' a navegar por el metro de Londres" . PCMAG . Consultado el 19 de octubre de 2016 .
  90. Mannes, John (13 de octubre de 2016). "La computadora neuronal diferenciable de DeepMind te ayuda a navegar por el metro con su memoria" . TechCrunch . Recuperado el 19 de octubre de 2016 .
  91. Graves, Alex; Wayne, Greg; Reynolds, Malcolm; Harley, Tim; Danihelka, Ivo; Grabska-Barwińska, Agnieszka; Colmenarejo, Sergio Gómez; Grefenstette, Edward; Ramalho, Tiago (2016-10-12). "Computación híbrida usando una red neuronal con memoria externa dinámica" . Nature . 538 ( 7626): 471– 476. Bibcode : 2016Natur.538..471G . doi : 10.1038/nature20101 . ISSN 1476-4687 . PMID 27732574. S2CID 205251479 .   
  92. "Computadoras neuronales diferenciables | DeepMind" . DeepMind . 12 de octubre de 2016. Consultado el 19 de octubre de 2016 .
  93. Atkeson, Christopher G.; Schaal, Stefan (1995). "Redes neuronales basadas en memoria para el aprendizaje de robots". Neurocomputing . 9 (3): 243– 269. doi : 10.1016/0925-2312(95)00033-6 .
  94. Salakhutdinov, Ruslan; Hinton, Geoffrey (2009). "Semantic hashing" (PDF) . International Journal of Approximate Reasoning . 50 (7): 969– 978. doi : 10.1016/j.ijar.2008.11.006 .
  95. Le, Quoc V.; Mikolov, Tomas (2014). "Representaciones distribuidas de oraciones y documentos". arXiv : 1405.4053 [ cs.CL ].
  96. Schmidhuber, Juergen (2015). "Redes de punteros". arXiv : 1506.03134 [ stat.ML ].
  97. Schmidhuber, Juergen (2015). "Máquinas neuronales de acceso aleatorio". arXiv : 1511.06392 [ cs.LG ].
  98. Kalchbrenner, N.; Blunsom, P. (2013). Modelos de traducción continua recurrente . EMNLP'2013. pp. 1700–1709 . 
  99. Sutskever, I.; Vinyals, O.; Le, QV (2014). "Aprendizaje secuencia a secuencia con redes neuronales" (PDF) . Vigésimo octava Conferencia sobre Sistemas de Procesamiento de Información Neuronal . arXiv : 1409.3215 .
  100. Schmidhuber, Juergen (2014). "Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation". arXiv : 1406.1078 [ cs.CL ].
  101. Schmidhuber, Juergen; Courville, Aaron; Bengio, Yoshua (2015). "Descripción de contenido multimedia mediante redes codificador-decodificador basadas en atención". IEEE Transactions on Multimedia . 17 (11): 1875– 1886. arXiv : 1507.01053 . Bibcode : 2015arXiv150701053C . doi : 10.1109/TMM.2015.2477044 . S2CID 1179542 . 
  102. Gerstner; Kistler. "Modelos de neuronas de disparo: neuronas individuales, poblaciones, plasticidad" . icwww.epfl.ch . Archivado del original el 4 de junio de 2017. Consultado el 18 de junio de 2017 .Libro de texto disponible gratuitamente en línea
  103. Izhikevich EM (febrero de 2006). "Policronización: computación con picos". Neural Computation . 18 (2): 245–82 . doi : 10.1162/089976606775093882 . PMID 16378515. S2CID 14253998 .  
  104. Morer I, Cardillo A, Díaz-Guilera A, Prignano L, Lozano S (2020). "Comparación de redes espaciales: un enfoque basado en la eficiencia que se adapta a todos los casos". Physical Review . 101 (4) 042301. arXiv : 1807.00565 . Bibcode : 2020PhRvE.101d2301M . doi : 10.1103/PhysRevE.101.042301 . hdl : 2445/161417 . PMID 32422764 . S2CID 49564277 .  
  105. Gupta J, Molnar C, Xie Y, Knight J, Shekhar S (2021). "Redes neuronales profundas conscientes de la variabilidad espacial (SVANN): un enfoque general". ACM Transactions on Intelligent Systems and Technology . 12 (6): 1– 21. doi : 10.1145/3466688 . S2CID 244786699 . 
  106. Hagenauer J, Helbich M (2022). "Una red neuronal artificial ponderada geográficamente" . International Journal of Geographical Information Science . 36 (2): 215– 235. Bibcode : 2022IJGIS..36..215H . doi : 10.1080/13658816.2021.1871618 . S2CID 233883395 . 
  107. David H. Hubel y Torsten N. Wiesel (2005). Cerebro y percepción visual: la historia de una colaboración de 25 años . Oxford University Press. pág. 106. ISBN  978-0-19-517618-6.
  108. Hubel, DH; Wiesel, TN (octubre de 1959). " Campos receptivos de neuronas individuales en la corteza estriada del gato" . J. Physiol . 148 (3): 574– 91. doi : 10.1113/jphysiol.1959.sp006308 . PMC 1363130. PMID 14403679 .  
  109. Fukushima 1987 , pág. 83.
  110. Fukushima 1987 , pág. 84.
  111. Fukushima 2007 .
  112. Fukushima 1987 , págs. 81, 85.
  113. LeCun, Yann; Bengio, Yoshua; Hinton, Geoffrey (2015). " Aprendizaje profundo" (PDF) . Nature . 521 (7553): 436– 444. Bibcode : 2015Natur.521..436L . doi : 10.1038/nature14539 . PMID 26017442. S2CID 3074096 .  
  114. Hinton, GE ; Osindero, S.; Teh, Y. (2006). "Un algoritmo de aprendizaje rápido para redes de creencias profundas" ( PDF) . Neural Computation . 18 (7): 1527– 1554. CiteSeerX 10.1.1.76.1541 . doi : 10.1162/neco.2006.18.7.1527 . PMID 16764513. S2CID 2309950 .   
  115. Hinton, Geoffrey; Salakhutdinov, Ruslan (2009). "Aprendizaje eficiente de máquinas de Boltzmann profundas" (PDF) . 3 : 448–455 . Archivado del original (PDF) el 6 de noviembre de 2015. Recuperado el 25 de agosto de 2019 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  116. Larochelle, Hugo; Bengio, Yoshua; Louradour, Jerdme; Lamblin, Pascal (2009). "Explorando estrategias para entrenar redes neuronales profundas" . The Journal of Machine Learning Research . 10 : 1–40 .
  117. Coates, Adam; Carpenter, Blake; Case, Carl; Satheesh, Sanjeev; Suresh, Bipin; Wang, Tao; Wu, David J.; Ng, A. (18 de septiembre de 2011). "Detección de texto y reconocimiento de caracteres en imágenes de escenas con aprendizaje de características no supervisado" (PDF) . Conferencia Internacional IEEE sobre Análisis y Reconocimiento de Documentos : 440–445 .
  118. Lee, Honglak; Grosse, Roger (2009). «Redes neuronales profundas convolucionales para el aprendizaje no supervisado escalable de representaciones jerárquicas». Actas de la 26.ª Conferencia Internacional Anual sobre Aprendizaje Automático . págs. 609–616 . CiteSeerX 10.1.1.149.6800 . doi : 10.1145/1553374.1553453 . ISBN   9781605585161. S2CID 12008458 . 
  119. Courville, Aaron; Bergstra, James; Bengio, Yoshua (2011). "Modelos no supervisados ​​de imágenes mediante RBM de picos y placas" (PDF) . Actas de la 28.ª Conferencia Internacional sobre Aprendizaje Automático . Vol. 10. págs. 1–8 . Archivado del original (PDF) el 4 de marzo de 2016. Consultado el 25 de agosto de 2019 .  
  120. ^ Lin, Yuanqing; Zhang, Tong; Zhu, Shenghuo; Yu, Kai (2010). "Red de codificación profunda" . Avances en los sistemas de procesamiento de información neuronal 23 (NIPS 2010) . vol. 23. págs. 1 a 9.  
  121. Ranzato, Marc Aurelio; Boureau, Y-Lan (2007). "Sparse Feature Learning for Deep Belief Networks" (PDF) . Advances in Neural Information Processing Systems . 23 : 1–8 . Archivado del original (PDF) el 4 de marzo de 2016. Consultado el 25 de agosto de 2019 .
  122. Socher, Richard; Lin, Clif (2011). "Análisis de escenas naturales y lenguaje natural con redes neuronales recursivas" (PDF) . Actas de la 26.ª Conferencia Internacional sobre Aprendizaje Automático . Archivado del original (PDF) el 4 de marzo de 2016. Consultado el 25 de agosto de 2019 .
  123. Taylor, Graham; Hinton, Geoffrey (2006). "Modelado del movimiento humano mediante variables latentes binarias" (PDF) . Advances in Neural Information Processing Systems . Archivado del original (PDF) el 4 de marzo de 2016. Consultado el 25 de agosto de 2019 .
  124. Vincent, Pascal; Larochelle, Hugo (2008). "Extracción y composición de características robustas con autoencoders de eliminación de ruido". Actas de la 25.ª conferencia internacional sobre aprendizaje automático - ICML '08 . pp. 1096–1103 . CiteSeerX 10.1.1.298.4083 . doi : 10.1145/1390156.1390294 . ISBN   9781605582054. S2CID 207168299 . 
  125. Kemp, Charles; Perfors, Amy; Tenenbaum, Joshua (2007). "Aprendizaje de sobrehipótesis con modelos bayesianos jerárquicos". Developmental Science . 10 (3): 307– 21. CiteSeerX 10.1.1.141.5560 . doi : 10.1111/j.1467-7687.2007.00585.x . PMID 17444972 .  
  126. Xu, Fei; Tenenbaum, Joshua (2007). "Aprendizaje de palabras como inferencia bayesiana". Psychol. Rev. 114 ( 2): 245– 72. CiteSeerX 10.1.1.57.9649 . doi : 10.1037/0033-295X.114.2.245 . PMID 17500627 .  
  127. Chen, Bo; Polatkan, Gungor (2011). "El proceso beta jerárquico para el análisis factorial convolucional y el aprendizaje profundo" (PDF) . Actas de la 28.ª Conferencia Internacional sobre Aprendizaje Automático . Omnipress. págs. 361–368 . ISBN  978-1-4503-0619-5.
  128. Fei-Fei, Li; Fergus, Rob (2006). "Aprendizaje de categorías de objetos con una sola muestra". IEEE Transactions on Pattern Analysis and Machine Intelligence . 28 (4): 594– 611. Bibcode : 2006ITPAM..28..594F . CiteSeerX 10.1.1.110.9024 . doi : 10.1109/TPAMI.2006.79 . PMID 16566508. S2CID 6953475 .   
  129. Rodríguez, Abel; Dunson, David (2008). "El proceso de Dirichlet anidado" . Journal of the American Statistical Association . 103 (483): 1131– 1154. CiteSeerX 10.1.1.70.9873 . doi : 10.1198/016214508000000553 . S2CID 13462201 .  
  130. Ruslan, Salakhutdinov; Joshua, Tenenbaum (2012). "Aprendizaje con modelos jerárquicos profundos". IEEE Transactions on Pattern Analysis and Machine Intelligence . 35 (8): 1958– 71. CiteSeerX 10.1.1.372.909 . doi : 10.1109 / TPAMI.2012.269 . PMID 23787346. S2CID 4508400 .   
  131. 1 2 Chalasani, Rakesh; Principe, Jose (2013). "Redes de codificación predictiva profunda". arXiv : 1301.3541 [ cs.LG ].
  132. Scholkopf, B; Smola, Alexander (1998). "Análisis de componentes no lineales como un problema de valores propios del núcleo". Neural Computation . 44 (5): 1299– 1319. CiteSeerX 10.1.1.53.8911 . doi : 10.1162/089976698300017467 . S2CID 6674407 .  
  133. Cho, Youngmin (2012). Métodos de kernel para aprendizaje profundo (PDF) (tesis doctoral). págs. 1–9 . 
  134. Deng, Li; Tur, Gokhan; He, Xiaodong; Hakkani-Tür, Dilek (2012-12-01). "Uso de redes neuronales profundas convexas con kernel y aprendizaje de extremo a extremo para la comprensión del lenguaje hablado" . Microsoft Research .

Lecturas adicionales

  • Fukushima, Kunihiko (1987). "Un modelo de red neuronal jerárquica para la atención selectiva". En Eckmiller, R.; Von der Malsburg, C. (eds.). Computadoras neuronales . Springer-Verlag. pp. 81–90 . 
  • Fukushima, Kunihiko (2007). "Neocognitron" . Scholarpedia . 2 (1): 1717. Bibcode : 2007SchpJ...2.1717F . doi : 10.4249/scholarpedia.1717 .