Articulo de referencia

Red neuronal convolucional

Una red neuronal convolucional ( CNN ) es un tipo de red neuronal de alimentación directa que aprende características mediante la optimización de filtros (o núcleos ). Este tipo...

Una red neuronal convolucional ( CNN ) es un tipo de red neuronal de alimentación directa que aprende características mediante la optimización de filtros (o núcleos ). Este tipo de red de aprendizaje profundo se ha aplicado para procesar y hacer predicciones a partir de muchos tipos diferentes de datos, incluidos texto, imágenes y audio. [ 1 ] Las CNN son el estándar de facto en los enfoques basados ​​en aprendizaje profundo para la visión por computadora [ 2 ] y el procesamiento de imágenes , y solo recientemente han sido reemplazadas —en algunos casos— por arquitecturas más nuevas como el transformador .

Los gradientes evanescentes y explosivos, observados durante la retropropagación en redes neuronales anteriores, se evitan mediante la regularización que proviene del uso de pesos compartidos sobre menos conexiones. [ 3 ] [ 4 ] Por ejemplo, para cada neurona en la capa totalmente conectada, se requerirían 10 000 pesos para procesar una imagen de 100 × 100 píxeles. Sin embargo, al aplicar núcleos de convolución en cascada (o correlación cruzada), [ 5 ] [ 6 ] solo se requieren 25 pesos para cada capa convolucional para procesar mosaicos de 5x5. [ 7 ] [ 8 ] Las características de las capas superiores se extraen de ventanas de contexto más amplias, en comparación con las características de las capas inferiores.

Algunas aplicaciones de las CNN incluyen:

Las CNN también se conocen como redes neuronales artificiales invariantes a la traslación o invariantes al espacio , basadas en la arquitectura de pesos compartidos de los núcleos de convolución o filtros que se deslizan a lo largo de las características de entrada y proporcionan respuestas equivariantes a la traslación conocidas como mapas de características. [ 14 ] [ 15 ] Contrariamente a lo que podría pensarse, la mayoría de las redes neuronales convolucionales no son invariantes a la traslación , debido a la operación de submuestreo que aplican a la entrada. [ 16 ]

Las redes neuronales de propagación directa suelen ser redes totalmente conectadas, es decir, cada neurona de una capa está conectada a todas las neuronas de la siguiente capa . La "conectividad total" de estas redes las hace propensas al sobreajuste de datos. Las formas típicas de regularización, o de prevenir el sobreajuste, incluyen: penalizar parámetros durante el entrenamiento (como la disminución de peso) o recortar la conectividad (conexiones omitidas, abandono, etc.). Los conjuntos de datos robustos también aumentan la probabilidad de que las CNN aprendan los principios generalizados que caracterizan un conjunto de datos dado, en lugar de los sesgos de un conjunto poco poblado. [ 17 ]

Las redes neuronales convolucionales se inspiraron en procesos biológicos [ 18 ] [ 19 ] [ 20 ] [ 21 ] en que el patrón de conectividad entre neuronas se asemeja a la organización de la corteza visual animal . Las neuronas corticales individuales responden a estímulos solo en una región restringida del campo visual conocida como campo receptivo . Los campos receptivos de diferentes neuronas se superponen parcialmente de manera que cubren todo el campo visual.

Las redes neuronales convolucionales (CNN) utilizan relativamente poco preprocesamiento en comparación con otros algoritmos de clasificación de imágenes . Esto significa que la red aprende a optimizar los filtros (o núcleos) mediante aprendizaje automático, mientras que en los algoritmos tradicionales estos filtros se diseñan manualmente . Esto simplifica y automatiza el proceso, mejorando la eficiencia y la escalabilidad y superando los cuellos de botella derivados de la intervención humana.

Arquitectura

Comparación de las capas de convolución, agrupación y densas de LeNet (1995) y AlexNet (2012).

Una red neuronal convolucional consta de una capa de entrada, capas ocultas y una capa de salida. En una red neuronal convolucional, las capas ocultas incluyen una o más capas que realizan convoluciones. Normalmente, esto incluye una capa que realiza el producto escalar del núcleo de convolución con la matriz de entrada de la capa. Este producto suele ser el producto interno de Frobenius , y su función de activación es comúnmente ReLU . A medida que el núcleo de convolución se desplaza a lo largo de la matriz de entrada de la capa, la operación de convolución genera un mapa de características, que a su vez contribuye a la entrada de la siguiente capa. A esto le siguen otras capas, como capas de agrupación , capas totalmente conectadas y capas de normalización. Cabe destacar aquí la similitud entre una red neuronal convolucional y un filtro adaptado . [ 22 ]

Capas convolucionales

En una CNN, la entrada es un tensor con forma:

(número de entradas) × (altura de entrada) × (ancho de entrada) × ( canales de entrada )

Después de pasar por una capa convolucional, la imagen se abstrae en un mapa de características, también llamado mapa de activación, con forma:

(número de entradas) × (altura del mapa de características) × (ancho del mapa de características) × ( canales del mapa de características ).

Las capas convolucionales convolucionan la entrada y pasan su resultado a la siguiente capa. Esto es similar a la respuesta de una neurona en la corteza visual a un estímulo específico. [ 23 ] Cada neurona convolucional procesa datos solo para su campo receptivo .

Ejemplo de red neuronal convolucional 1D de propagación hacia adelante

Aunque las redes neuronales de alimentación directa totalmente conectadas pueden usarse para aprender características y clasificar datos, esta arquitectura generalmente no es práctica para entradas más grandes (por ejemplo, imágenes de alta resolución), que requerirían una cantidad masiva de neuronas porque cada píxel es una característica de entrada relevante. Una capa totalmente conectada para una imagen de tamaño 100 × 100 tiene 10 000 pesos para cada neurona en la segunda capa. La convolución reduce la cantidad de parámetros libres, lo que permite que la red sea más profunda. [ 7 ] Por ejemplo, usar una región de mosaico de 5 × 5, cada una con los mismos pesos compartidos, requiere solo 25 neuronas. El uso de pesos compartidos significa que hay muchos menos parámetros, lo que ayuda a evitar los problemas de gradientes evanescentes y gradientes explosivos observados durante la retropropagación en redes neuronales anteriores. [ 3 ] [ 4 ]

Para acelerar el procesamiento, las capas convolucionales estándar pueden reemplazarse por capas convolucionales separables en profundidad, [ 24 ] que se basan en una convolución en profundidad seguida de una convolución puntual. La convolución en profundidad es una convolución espacial aplicada independientemente sobre cada canal del tensor de entrada, mientras que la convolución puntual es una convolución estándar restringida al uso de1×1{\displaystyle 1\times 1}granos.

capas de agrupación

Las redes convolucionales pueden incluir capas de agrupación local y/o global junto con las capas convolucionales tradicionales. Las capas de agrupación reducen las dimensiones de los datos al combinar las salidas de los grupos de neuronas en una capa en una sola neurona en la siguiente capa. La agrupación local combina pequeños grupos, se utilizan comúnmente tamaños de mosaico como 2 × 2. La agrupación global actúa sobre todas las neuronas del mapa de características. [ 25 ] [ 26 ] Hay dos tipos comunes de agrupación en uso popular: máximo y promedio. La agrupación máxima utiliza el valor máximo de cada grupo local de neuronas en el mapa de características, [ 27 ] [ 28 ] mientras que la agrupación promedio toma el valor promedio.

capas totalmente conectadas

Las capas totalmente conectadas conectan cada neurona de una capa con cada neurona de otra capa. Es similar a una red neuronal perceptrón multicapa (MLP) tradicional. Cada neurona de la capa totalmente conectada recibe información de todas las neuronas de la capa anterior. Estas entradas se ponderan y suman con los sesgos correspondientes, y luego se procesan mediante una función de activación para realizar una transformación no lineal, generando así la salida. La matriz resultante pasa por una capa totalmente conectada para clasificar las imágenes.

Campo receptivo

En las redes neuronales, cada neurona recibe información de varias ubicaciones en la capa anterior. En una capa convolucional, cada neurona recibe información solo de un área restringida de la capa anterior, denominada campo receptivo . Normalmente, esta área es cuadrada (por ejemplo, de 5x5 neuronas). En cambio, en una capa totalmente conectada, el campo receptivo abarca toda la capa anterior . Por lo tanto, en cada capa convolucional, cada neurona recibe información de un área mayor que la de las capas anteriores. Esto se debe a la aplicación repetida de la convolución, que tiene en cuenta el valor de un píxel, así como el de los píxeles circundantes. Al utilizar capas dilatadas, el número de píxeles en el campo receptivo permanece constante, pero este se dispersa a medida que sus dimensiones aumentan al combinar el efecto de varias capas.

Para manipular el tamaño del campo receptivo según se desee, existen algunas alternativas a la capa convolucional estándar. Por ejemplo, la convolución atrosa o dilatada [ 29 ] [ 30 ] expande el tamaño del campo receptivo sin aumentar el número de parámetros mediante la intercalación de regiones visibles y ciegas. Además, una única capa convolucional dilatada puede comprender filtros con múltiples índices de dilatación [ 31 ] , lo que permite obtener un tamaño de campo receptivo variable.

Pesos

Cada neurona de una red neuronal calcula un valor de salida aplicando una función específica a los valores de entrada recibidos del campo receptivo de la capa anterior. La función aplicada a los valores de entrada está determinada por un vector de pesos y un sesgo (generalmente números reales). El aprendizaje consiste en ajustar iterativamente estos sesgos y pesos.

Los vectores de pesos y sesgos se denominan filtros y representan características particulares de la entrada (por ejemplo, una forma específica). Una característica distintiva de las CNN es que muchas neuronas pueden compartir el mismo filtro. Esto reduce el consumo de memoria, ya que se utiliza un único sesgo y un único vector de pesos en todos los campos receptivos que comparten ese filtro, en lugar de que cada campo receptivo tenga su propio sesgo y vector de ponderación. [ 32 ]

Desconvolucional

Una red neuronal deconvolucional es esencialmente lo opuesto a una CNN. Consta de capas deconvolucionales y capas de desagrupación. [ 33 ]

Una capa de deconvolución es la transpuesta de una capa convolucional. Específicamente, una capa convolucional se puede escribir como una multiplicación por una matriz, y una capa de deconvolución es una multiplicación por la transpuesta de esa matriz. [ 34 ]

Una capa de desagrupación expande la capa. La capa de desagrupación máxima es la más simple, ya que simplemente copia cada entrada varias veces. Por ejemplo, una capa de desagrupación máxima de 2x2 es[incógnita][incógnitaincógnitaincógnitaincógnita]{\displaystyle [x]\mapsto {\begin{bmatrix}x&x\\x&x\end{bmatrix}}}.

Las capas de deconvolución se utilizan en los generadores de imágenes. Por defecto, crean un artefacto periódico de tablero de ajedrez, que se puede corregir mediante el escalado y posterior convolución. [ 35 ]

Historia

Las CNN se comparan a menudo con la forma en que el cerebro logra el procesamiento de la visión en los organismos vivos . [ 36 ]

Campos receptivos en la corteza visual

El trabajo de Hubel y Wiesel en las décadas de 1950 y 1960 demostró que las cortezas visuales de los gatos contienen neuronas que responden individualmente a pequeñas regiones del campo visual . Siempre que los ojos no se muevan, la región del espacio visual dentro de la cual los estímulos visuales afectan el disparo de una sola neurona se conoce como su campo receptivo . [ 37 ] Las células vecinas tienen campos receptivos similares y superpuestos. El tamaño y la ubicación del campo receptivo varían sistemáticamente a lo largo de la corteza para formar un mapa completo del espacio visual. La corteza en cada hemisferio representa el campo visual contralateral .

Su artículo de 1968 identificó dos tipos básicos de células visuales en el cerebro: [ 19 ]

  • células simples , cuya producción se maximiza mediante bordes rectos que tienen orientaciones particulares dentro de su campo receptivo.
  • células complejas , que tienen campos receptivos más grandes , cuya salida es insensible a la posición exacta de los bordes en el campo.

Hubel y Wiesel también propusieron un modelo en cascada de estos dos tipos de células para su uso en tareas de reconocimiento de patrones. [ 38 ] [ 37 ]

Elementos de umbral analógico de Fukushima en un modelo de visión

En 1969, Kunihiko Fukushima introdujo una red de detección de características visuales multicapa, inspirada en el trabajo de Hubel y Wiesel mencionado anteriormente, en la que "Todos los elementos de una capa tienen el mismo conjunto de coeficientes de interconexión; la disposición de los elementos y sus interconexiones son homogéneas en toda la capa". Este es el núcleo esencial de una red convolucional, pero los pesos no fueron entrenados. En el mismo artículo, Fukushima también introdujo la función de activación ReLU (unidad lineal rectificada) . [ 39 ] [ 40 ]

Neocognitron, origen de la arquitectura CNN entrenable

El " neocognitrón " [ 18 ] fue introducido por Fukushima en 1980. [ 20 ] [ 28 ] [ 1 ] El neocognitrón introdujo los dos tipos básicos de capas:

  • Capa S: una capa de campo receptivo de pesos compartidos, posteriormente conocida como capa convolucional, que contiene unidades cuyos campos receptivos cubren una porción de la capa anterior. Un grupo de campos receptivos de pesos compartidos (un "plano" en la terminología neocognitónica) suele denominarse filtro, y una capa normalmente tiene varios de estos filtros.
  • Capa C: una capa de submuestreo que contiene unidades cuyos campos receptivos cubren parches de capas convolucionales previas. Esta unidad calcula un promedio ponderado de las activaciones de las unidades en su parche y aplica inhibición (normalización divisiva) agrupada a partir de un parche algo mayor y a través de diferentes filtros en una capa, y aplica una función de activación saturante. Los pesos de los parches son no negativos y no se pueden entrenar en el neocognitrón original. El submuestreo y la inhibición competitiva ayudan a clasificar características y objetos en escenas visuales incluso cuando los objetos están desplazados.

Se han propuesto varios algoritmos de aprendizaje supervisado y no supervisado a lo largo de las décadas para entrenar los pesos de un neocognitrón. [ 18 ] Sin embargo, hoy en día, la arquitectura CNN se suele entrenar mediante retropropagación .

La función de activación ReLU de Fukushima no se utilizó en su neocognitrón, ya que todos los pesos eran no negativos; en su lugar, se empleó la inhibición lateral. El rectificador se ha convertido en una función de activación muy popular para las CNN y las redes neuronales profundas en general. [ 41 ]

Convolución en el tiempo

El término "convolución" aparece por primera vez en redes neuronales en un artículo de Toshiteru Homma, Les Atlas y Robert Marks II en la primera Conferencia sobre Sistemas de Procesamiento de Información Neuronal en 1987. Su artículo reemplazó la multiplicación con convolución en el tiempo, proporcionando inherentemente invariancia de desplazamiento, motivado por y conectándose más directamente con el concepto de filtro de procesamiento de señales , y lo demostraron en una tarea de reconocimiento de voz. [ 8 ] También señalaron que, como sistema entrenable con datos, la convolución es esencialmente equivalente a la correlación ya que la inversión de los pesos no afecta la función aprendida final ("Para conveniencia, denotamos * como correlación en lugar de convolución. Nótese que convolucionar a(t) con b(t) es equivalente a correlacionar a(-t) con b(t)."). [ 8 ] Las implementaciones modernas de CNN suelen hacer correlación y la llaman convolución, por conveniencia, como hicieron aquí.

Redes neuronales con retardo temporal

La red neuronal con retardo temporal (TDNN) fue introducida en 1987 por Alex Waibel et al. para el reconocimiento de fonemas y fue una de las primeras redes convolucionales que exhibía invariancia de desplazamiento. [ 42 ] Una TDNN es una red neuronal convolucional unidimensional donde la convolución se realiza a lo largo del eje temporal de los datos. Es la primera CNN que utiliza el uso compartido de pesos en combinación con un entrenamiento por descenso de gradiente, utilizando retropropagación . [ 43 ] Por lo tanto, si bien también utiliza una estructura piramidal como en el neocognitrón, realizó una optimización global de los pesos en lugar de una local. [ 42 ]

Las TDNN son redes convolucionales que comparten pesos a lo largo de la dimensión temporal. [ 44 ] Permiten procesar señales de voz de forma invariante en el tiempo. En 1990, Hampshire y Waibel introdujeron una variante que realiza una convolución bidimensional. [ 45 ] Dado que estas TDNN operaban sobre espectrogramas, el sistema de reconocimiento de fonemas resultante era invariante tanto a los cambios de tiempo como de frecuencia, al igual que las imágenes procesadas por un neocognitrón.

Las TDNN mejoraron el rendimiento del reconocimiento de voz a larga distancia. [ 46 ]

Reconocimiento de imágenes con CNN entrenadas mediante descenso de gradiente.

Denker et al. (1989) diseñaron un sistema CNN 2D para reconocer números de códigos postales escritos a mano . [ 47 ] Sin embargo, la falta de un método de entrenamiento eficiente para determinar los coeficientes del núcleo de las convoluciones involucradas significó que todos los coeficientes tuvieron que diseñarse manualmente de manera laboriosa. [ 48 ]

Tras los avances en el entrenamiento de CNN 1D por Waibel et al. (1987), Yann LeCun et al. (1989) [ 48 ] utilizaron la retropropagación para aprender los coeficientes del núcleo de convolución directamente a partir de imágenes de números escritos a mano. El aprendizaje fue, por lo tanto, completamente automático, tuvo un mejor rendimiento que el diseño manual de coeficientes y se adaptó a una gama más amplia de problemas de reconocimiento de imágenes y tipos de imágenes. Wei Zhang et al. (1988) [ 14 ] [ 15 ] utilizaron la retropropagación para entrenar los núcleos de convolución de una CNN para el reconocimiento de alfabetos. El modelo se denominó red neuronal de reconocimiento de patrones invariante a la traslación antes de que se acuñara el nombre CNN a principios de la década de 1990. Wei Zhang et al. también aplicaron la misma CNN sin la última capa totalmente conectada para la segmentación de objetos en imágenes médicas (1991) [ 49 ] y la detección de cáncer de mama en mamografías (1994). [ 50 ]

Este enfoque se convirtió en la base de la visión artificial moderna .

Agrupación máxima

En 1990, Yamaguchi et al. introdujeron el concepto de max pooling, una operación de filtrado fijo que calcula y propaga el valor máximo de una región determinada. Lo hicieron combinando TDNN con max pooling para lograr un sistema de reconocimiento de palabras aisladas independiente del hablante. [ 27 ] En su sistema, utilizaron varias TDNN por palabra, una para cada sílaba . Los resultados de cada TDNN sobre la señal de entrada se combinaron mediante max pooling y las salidas de las capas de pooling se pasaron a las redes que realizaban la clasificación de palabras propiamente dicha.

En una variante del neocognitrón llamada cresceptrón , en lugar de utilizar el promedio espacial de Fukushima con inhibición y saturación, J. Weng et al. en 1993 utilizaron el max pooling, donde una unidad de submuestreo calcula el máximo de las activaciones de las unidades en su parche, [ 51 ] introduciendo este método en el campo de visión.

El max pooling se usa con frecuencia en las CNN modernas. [ 52 ]

LeNet-5

LeNet-5, una red neuronal convolucional pionera de 7 niveles desarrollada por LeCun et al. en 1995, [ 53 ] clasifica números escritos a mano en cheques digitalizados en imágenes de 32×32 píxeles. La capacidad de procesar imágenes de mayor resolución requiere redes neuronales convolucionales más grandes y con más capas, por lo que esta técnica está limitada por la disponibilidad de recursos informáticos.

Era superior a otros sistemas comerciales de lectura de importes de cortesía (a partir de 1995). El sistema se integró en los sistemas de lectura de cheques de NCR y se implementó en varios bancos estadounidenses desde junio de 1996, leyendo millones de cheques por día. [ 54 ]

Red neuronal invariante a la traslación

Wei Zhang et al. propusieron una red neuronal invariante a desplazamientos para el reconocimiento de caracteres en imágenes en 1988. [ 14 ] [ 15 ] Se trata de una modificación del Neocognitron, conservando únicamente las interconexiones convolucionales entre las capas de características de la imagen y la última capa totalmente conectada. El modelo se entrenó mediante retropropagación. El algoritmo de entrenamiento se mejoró aún más en 1991 [ 55 ] para optimizar su capacidad de generalización. La arquitectura del modelo se modificó eliminando la última capa totalmente conectada y se aplicó a la segmentación de imágenes médicas (1991) [ 49 ] y a la detección automática de cáncer de mama en mamografías (1994) . [ 50 ]

En 1988 se propuso un diseño diferente basado en convolución [ 56 ] para su aplicación a la descomposición de señales convolucionadas de electromiografía unidimensional mediante deconvolución. Este diseño se modificó en 1989 para dar lugar a otros diseños basados ​​en deconvolución. [ 57 ] [ 58 ]

implementaciones de GPU

Aunque las redes neuronales convolucionales (CNN) se inventaron en la década de 1980, su gran avance en la década de 2000 requirió implementaciones rápidas en unidades de procesamiento gráfico (GPU).

En 2004, KS Oh y K. Jung demostraron que las redes neuronales estándar pueden acelerarse enormemente en GPU. Su implementación fue 20 veces más rápida que una implementación equivalente en CPU . [ 59 ] En 2005, otro artículo también destacó el valor de GPGPU para el aprendizaje automático . [ 60 ]

La primera implementación de una CNN en GPU fue descrita en 2006 por K. Chellapilla et al. Su implementación fue 4 veces más rápida que una implementación equivalente en CPU. [ 61 ] En el mismo período, las GPU también se utilizaron para el entrenamiento no supervisado de redes de creencias profundas . [ 62 ] [ 63 ] [ 64 ] [ 65 ]

En 2010, Dan Ciresan y otros en IDSIA entrenaron redes neuronales profundas de alimentación directa en GPU. [ 66 ] En 2011, extendieron esto a CNN, acelerando en 60 en comparación con el entrenamiento en CPU. [ 25 ] En 2011, la red ganó un concurso de reconocimiento de imágenes donde lograron un rendimiento sobrehumano por primera vez. [ 67 ] Luego ganaron más competiciones y lograron el estado del arte en varios benchmarks. [ 68 ] [ 52 ] [ 28 ]

Posteriormente, AlexNet , una CNN similar basada en GPU de Alex Krizhevsky et al., ganó el ImageNet Large Scale Visual Recognition Challenge 2012. [ 69 ] Fue un evento catalizador temprano para el auge de la IA .

En comparación con el entrenamiento de CNN usando GPU , no se le prestó mucha atención a la CPU. (Viebke et al 2019) paraleliza CNN mediante paralelismo a nivel de hilos y SIMD que está disponible en el Intel Xeon Phi . [ 70 ] [ 71 ]

Características distintivas

Anteriormente, se utilizaban modelos tradicionales de perceptrón multicapa (MLP) para el reconocimiento de imágenes. Sin embargo, la conectividad total entre los nodos generaba el problema de la maldición de la dimensionalidad y resultaba computacionalmente inviable con imágenes de alta resolución. Una imagen de 1000 × 1000 píxeles con canales de color RGB tiene 3 millones de pesos por neurona totalmente conectada, lo cual es demasiado elevado para procesarla de manera eficiente a gran escala.

Capas de CNN dispuestas en 3 dimensiones

Por ejemplo, en CIFAR-10 , las imágenes tienen un tamaño de solo 32×32×3 (32 de ancho, 32 de alto, 3 canales de color), por lo que una sola neurona totalmente conectada en la primera capa oculta de una red neuronal regular tendría 32*32*3 = 3072 pesos. Sin embargo, una imagen de 200×200 daría lugar a neuronas con 200*200*3 = 120 000 pesos.

Además, esta arquitectura de red no tiene en cuenta la estructura espacial de los datos, tratando los píxeles de entrada distantes de la misma manera que los cercanos. Esto ignora la localidad de referencia en datos con topología de cuadrícula (como las imágenes), tanto a nivel computacional como semántico. Por lo tanto, la conectividad total de las neuronas resulta ineficiente para aplicaciones como el reconocimiento de imágenes, que se basan principalmente en patrones de entrada espacialmente localizados .

Las redes neuronales convolucionales son variantes de los perceptrones multicapa, diseñadas para emular el comportamiento de la corteza visual . Estos modelos mitigan los desafíos que plantea la arquitectura MLP al explotar la fuerte correlación espacial local presente en las imágenes naturales. A diferencia de las MLP, las CNN tienen las siguientes características distintivas:

  • Volúmenes 3D de neuronas. Las capas de una CNN tienen neuronas dispuestas en 3 dimensiones : ancho, alto y profundidad. [ 72 ] Cada neurona dentro de una capa convolucional está conectada solo a una pequeña región de la capa anterior, llamada campo receptivo. Se apilan distintos tipos de capas, tanto conectadas localmente como completamente conectadas, para formar una arquitectura CNN.
  • Conectividad local: siguiendo el concepto de campos receptivos, las CNN aprovechan la localidad espacial al imponer un patrón de conectividad local entre neuronas de capas adyacentes. De este modo, la arquitectura garantiza que los "filtros" aprendidos produzcan la respuesta más fuerte a un patrón de entrada espacialmente local. Apilar muchas de estas capas da lugar a filtros no lineales que se vuelven cada vez más globales (es decir, que responden a una región más amplia del espacio de píxeles), de modo que la red primero crea representaciones de pequeñas partes de la entrada y, a partir de ellas, ensambla representaciones de áreas más grandes.
  • Pesos compartidos: En las CNN, cada filtro se replica en todo el campo visual. Estas unidades replicadas comparten la misma parametrización (vector de pesos y sesgo) y forman un mapa de características. Esto significa que todas las neuronas en una capa convolucional dada responden a la misma característica dentro de su campo de respuesta específico. La replicación de unidades de esta manera permite que el mapa de activación resultante sea equivariante ante cambios en la ubicación de las características de entrada en el campo visual, es decir, garantiza la equivariancia traslacional , dado que la capa tiene un paso de uno. [ 73 ]
  • Agrupación: En las capas de agrupación de una CNN , los mapas de características se dividen en subregiones rectangulares, y las características de cada rectángulo se submuestrean de forma independiente a un único valor, generalmente tomando su valor promedio o máximo. Además de reducir el tamaño de los mapas de características, la operación de agrupación otorga cierto grado de invariancia traslacional local a las características que contienen, lo que permite que la CNN sea más robusta ante variaciones en sus posiciones. [ 16 ]

En conjunto, estas propiedades permiten que las CNN logren una mejor generalización en problemas de visión . El uso compartido de pesos reduce drásticamente la cantidad de parámetros libres aprendidos, lo que disminuye los requisitos de memoria para ejecutar la red y permite el entrenamiento de redes más grandes y potentes.

bloques de construcción

Una arquitectura CNN se compone de una pila de capas distintas que transforman el volumen de entrada en un volumen de salida (por ejemplo, las puntuaciones de las clases) mediante una función diferenciable. Se suelen utilizar varios tipos de capas, que se describen con más detalle a continuación.

Neuronas de una capa convolucional (azul), conectadas a su campo receptivo (rojo).

Capa convolucional

Un ejemplo práctico de cómo realizar una convolución. La convolución tiene un paso de 1, relleno de ceros y un tamaño de núcleo de 3x3. El núcleo de convolución es un operador laplaciano discreto .

La capa convolucional es el componente básico de una CNN. Los parámetros de la capa consisten en un conjunto de filtros (o núcleos ) entrenables, que tienen un campo receptivo pequeño, pero se extienden a través de toda la profundidad del volumen de entrada. Durante el paso hacia adelante, cada filtro se convoluciona a través del ancho y la altura del volumen de entrada, calculando el producto escalar entre las entradas del filtro y la entrada, lo que produce un mapa de activación bidimensional de ese filtro. Como resultado, la red aprende filtros que se activan cuando detecta algún tipo específico de característica en alguna posición espacial en la entrada. [ 74 ] [ nb 1 ]

Al apilar los mapas de activación de todos los filtros a lo largo de la dimensión de profundidad, se forma el volumen de salida completo de la capa de convolución. Por lo tanto, cada entrada en el volumen de salida puede interpretarse como la salida de una neurona que analiza una pequeña región de la entrada. Cada entrada en un mapa de activación utiliza el mismo conjunto de parámetros que definen el filtro.

El aprendizaje autosupervisado se ha adaptado para su uso en capas convolucionales mediante el uso de parches dispersos con una alta relación de máscara y una capa de normalización de respuesta global.

Conectividad local

Arquitectura típica de CNN

Al trabajar con entradas de alta dimensionalidad, como imágenes, resulta poco práctico conectar neuronas con todas las neuronas del volumen anterior, ya que dicha arquitectura de red no tiene en cuenta la estructura espacial de los datos. Las redes neuronales convolucionales aprovechan la correlación espacial local al imponer un patrón de conectividad local dispersa entre neuronas de capas adyacentes: cada neurona se conecta únicamente a una pequeña región del volumen de entrada.

La extensión de esta conectividad es un hiperparámetro denominado campo receptivo de la neurona. Las conexiones son locales en el espacio (a lo largo del ancho y la altura), pero siempre se extienden a lo largo de toda la profundidad del volumen de entrada. Esta arquitectura garantiza que los filtros aprendidos produzcan la respuesta más fuerte a un patrón de entrada espacialmente local. [ 75 ]

Disposición espacial

Tres hiperparámetros controlan el tamaño del volumen de salida de la capa convolucional: la profundidad, el paso y el tamaño del relleno:

  • La profundidad del volumen de salida controla la cantidad de neuronas en una capa que se conectan a la misma región del volumen de entrada. Estas neuronas aprenden a activarse ante diferentes características de la entrada. Por ejemplo, si la primera capa convolucional toma la imagen original como entrada, diferentes neuronas a lo largo de la dimensión de profundidad pueden activarse en presencia de bordes orientados de distinta manera o manchas de color.
  • El paso controla cómo se asignan las columnas de profundidad alrededor del ancho y la altura. Si el paso es 1, movemos los filtros un píxel a la vez. Esto da como resultado campos receptivos muy superpuestos entre las columnas y grandes volúmenes de salida. Para cualquier enteroS>0,{\textstyle S>0,}Un paso S significa que el filtro se traslada S unidades a la vez por cada salida. En la práctica,S3{\textstyle S\geq 3}es raro. Una zancada mayor significa una menor superposición de campos receptivos y dimensiones espaciales más pequeñas del volumen de salida. [ 76 ]
  • En ocasiones, resulta conveniente rellenar el volumen de entrada con ceros (u otros valores, como el promedio de la región). El tamaño de este relleno es un tercer hiperparámetro. El relleno permite controlar el tamaño espacial del volumen de salida. En particular, a veces se desea conservar exactamente el tamaño espacial del volumen de entrada; esto se conoce comúnmente como relleno "mismo".
Tres ejemplos de condiciones de relleno. La condición de replicación implica que el píxel exterior se rellena con el píxel interior más cercano. El relleno por reflexión consiste en que el píxel exterior se rellena con el píxel interior, reflejado a través del borde de la imagen. El relleno circular consiste en que el píxel exterior se extiende hacia el otro lado de la imagen.

El tamaño espacial del volumen de salida es una función del tamaño del volumen de entrada.W{\displaystyle W}, el tamaño del campo del kernelK{\displaystyle K}de las neuronas de la capa convolucional, el pasoS{\displaystyle S}y la cantidad de relleno de cerosPAG{\displaystyle P}en la frontera. El número de neuronas que "caben" en un volumen dado es entonces:

WK+2PAGS+1.{\displaystyle {\frac {W-K+2P}{S}}+1.}

Si este número no es un entero , entonces los pasos son incorrectos y las neuronas no se pueden organizar para que se ajusten al volumen de entrada de forma simétrica . En general, establecer el relleno de ceros enPAG=(K1)/2{\textstyle P=(K-1)/2}cuando la zancada esS=1{\displaystyle S=1}Garantiza que el volumen de entrada y el de salida tengan el mismo tamaño espacial. Sin embargo, no siempre es necesario utilizar todas las neuronas de la capa anterior. Por ejemplo, un diseñador de redes neuronales puede decidir utilizar solo una parte del relleno.

Compartición de parámetros

En las capas convolucionales se utiliza un esquema de compartición de parámetros para controlar el número de parámetros libres. Este esquema se basa en la suposición de que si una característica de parche es útil para calcular en una posición espacial determinada, también debería serlo en otras posiciones. Al denominar una única sección bidimensional de profundidad como sección de profundidad , las neuronas en cada sección de profundidad están restringidas a utilizar los mismos pesos y sesgos.

Dado que todas las neuronas en una misma sección de profundidad comparten los mismos parámetros, el paso hacia adelante en cada sección de profundidad de la capa convolucional se puede calcular como una convolución de los pesos de la neurona con el volumen de entrada. [ nb 2 ] Por lo tanto, es común referirse a los conjuntos de pesos como un filtro (o un núcleo ), que se convoluciona con la entrada. El resultado de esta convolución es un mapa de activación , y el conjunto de mapas de activación para cada filtro diferente se apilan a lo largo de la dimensión de profundidad para producir el volumen de salida. El uso compartido de parámetros contribuye a la invariancia de traslación de la arquitectura CNN. [ 16 ]

En ocasiones, la suposición de compartir parámetros puede no tener sentido. Esto ocurre especialmente cuando las imágenes de entrada a una CNN presentan una estructura centrada específica, para la cual se espera que se aprendan características completamente diferentes en distintas ubicaciones espaciales. Un ejemplo práctico es cuando las entradas son rostros centrados en la imagen: podríamos esperar que se aprendan características específicas de los ojos o del cabello en distintas partes de la imagen. En ese caso, es común flexibilizar el esquema de compartir parámetros y, en su lugar, denominar a la capa simplemente "capa conectada localmente". En esta capa, los parámetros de los núcleos convolucionales no se comparten. En cambio, la red aprende pesos y sesgos independientes para cada ubicación espacial. Esto permite que cada ubicación tenga su propia capacidad de aprendizaje de características, lo que la hace más adecuada para procesar imágenes con estructuras centrales distintas o características irregulares.

capa de agrupación

Ejemplo práctico de maxpooling 2x2 con paso 2
Agrupación máxima con un filtro de 2x2 y paso = 2

Otro concepto importante de las CNN es el pooling, que se utiliza como una forma de submuestreo no lineal . El pooling proporciona submuestreo porque reduce las dimensiones espaciales (altura y anchura) de los mapas de características de entrada mientras conserva la información más importante. Hay varias funciones no lineales para implementar el pooling, siendo el pooling máximo y el pooling promedio las más comunes. El pooling agrega información de pequeñas regiones de la entrada creando particiones del mapa de características de entrada, normalmente utilizando una ventana de tamaño fijo (como 2x2) y aplicando un paso (a menudo 2) para mover la ventana a través de la entrada. [ 77 ] Cabe señalar que sin utilizar un paso mayor que 1, el pooling no realizaría submuestreo, ya que simplemente movería la ventana de pooling a través de la entrada paso a paso, sin reducir el tamaño del mapa de características. En otras palabras, el paso es lo que realmente causa el submuestreo al determinar cuánto se mueve la ventana de pooling sobre la entrada.

Intuitivamente, la ubicación exacta de una característica es menos importante que su ubicación aproximada en relación con otras características. Esta es la idea detrás del uso de pooling en redes neuronales convolucionales. La capa de pooling sirve para reducir progresivamente el tamaño espacial de la representación, para reducir el número de parámetros, la huella de memoria y la cantidad de computación en la red, y por lo tanto también para controlar el sobreajuste . Esto se conoce como submuestreo. Es común insertar periódicamente una capa de pooling entre capas convolucionales sucesivas (cada una típicamente seguida de una función de activación, como una capa ReLU ) en una arquitectura CNN. [ 74 ] : 460–461 Si bien las capas de pooling contribuyen a la invariancia de traslación local, no proporcionan invariancia de traslación global en una CNN, a menos que se utilice una forma de pooling global. [ 16 ] [ 73 ] La capa de pooling comúnmente opera de forma independiente en cada profundidad, o corte, de la entrada y la redimensiona espacialmente. Una forma muy común de agrupación máxima es una capa con filtros de tamaño 2×2, aplicada con un paso de 2, que submuestrea cada segmento de profundidad en la entrada por 2 tanto a lo largo del ancho como de la altura, descartando el 75% de las activaciones:Fincógnita,Y(S)=máximoa,b=01S2incógnita+a,2Y+b.{\displaystyle f_{X,Y}(S)=\max _{a,b=0}^{1}S_{2X+a,2Y+b}.} En este caso, cada operación de máximo se realiza sobre 4 números. La dimensión de profundidad permanece sin cambios (esto también es cierto para otras formas de agrupación).

Además del max pooling, las unidades de pooling pueden usar otras funciones, como el average pooling o el ℓ 2 -norm pooling. El average pooling se usó con frecuencia históricamente, pero recientemente ha caído en desuso en comparación con el max pooling, que generalmente ofrece un mejor rendimiento en la práctica. [ 78 ]

Debido a los efectos de la rápida reducción espacial del tamaño de la representación, existe una tendencia reciente hacia el uso de filtros más pequeños [ 79 ] o el descarte total de las capas de agrupación. [ 80 ]

Agrupación de RoI a un tamaño de 2x2. En este ejemplo, la propuesta de región (un parámetro de entrada) tiene un tamaño de 7x5.

agrupación máxima de canales

Una capa de operación de agrupación máxima de canales (CMP) realiza la operación MP a lo largo del lado del canal entre las posiciones correspondientes de los mapas de características consecutivos con el fin de eliminar información redundante. La CMP hace que las características significativas se agrupen en menos canales, lo cual es importante para la clasificación de imágenes de grano fino que requiere más características discriminatorias. Mientras tanto, otra ventaja de la operación CMP es que reduce el número de canales de los mapas de características antes de que se conecten a la primera capa totalmente conectada (FC). De manera similar a la operación MP, denotamos los mapas de características de entrada y salida de una capa CMP como F ∈ R(C×M×N) y C ∈ R(c×M×N), respectivamente, donde C y c son el número de canales de los mapas de características de entrada y salida, y M y N son el ancho y la altura de los mapas de características, respectivamente. Nótese que la operación CMP solo cambia el número de canales de los mapas de características. El ancho y la altura de los mapas de características no se modifican, a diferencia de la operación MP. [ 81 ]

Consulte [ 82 ] [ 83 ] para ver revisiones de métodos de agrupación.

capa ReLU

ReLU es la abreviatura de unidad lineal rectificada . Fue propuesta por Alston Householder en 1941, [ 84 ] y utilizada en CNN por Kunihiko Fukushima en 1969. [ 39 ] ReLU aplica la función de activación no saturanteF(incógnita)=máximo(0,incógnita){\textstyle f(x)=\max(0,x)}[ 69 ] Elimina eficazmente los valores negativos de un mapa de activación estableciéndolos en cero. [ 85 ] Introduce no linealidad en la función de decisión y en la red general sin afectar los campos receptivos de las capas de convolución. En 2011, Xavier Glorot, Antoine Bordes y Yoshua Bengio descubrieron que ReLU permite un mejor entrenamiento de redes más profundas, [ 86 ] en comparación con las funciones de activación ampliamente utilizadas antes de 2011.

También se pueden utilizar otras funciones para aumentar la no linealidad, por ejemplo la tangente hiperbólica saturada.F(incógnita)=tanh(incógnita){\displaystyle f(x)=\tanh(x)},F(incógnita)=|tanh(incógnita)|{\displaystyle f(x)=|\tanh(x)|}y la función sigmoideσ(incógnita)=(1+miincógnita)1{\textstyle \sigma (x)=(1+e^{-x})^{-1}}. A menudo se prefiere ReLU a otras funciones porque entrena la red neuronal varias veces más rápido sin una penalización significativa en la precisión de generalización . [ 87 ]

capa totalmente conectada

Tras varias capas convolucionales y de agrupación máxima, la clasificación final se realiza mediante capas totalmente conectadas. Las neuronas de una capa totalmente conectada tienen conexiones con todas las activaciones de la capa anterior, como en las redes neuronales artificiales convencionales (no convolucionales) . Por lo tanto, sus activaciones se pueden calcular como una transformación afín , con una multiplicación de matrices seguida de un desplazamiento de sesgo ( suma vectorial de un término de sesgo aprendido o fijo).

Capa de pérdida

La "capa de pérdida" o " función de pérdida " ejemplifica cómo el entrenamiento penaliza la desviación entre la salida predicha por la red y las etiquetas de datos reales (durante el aprendizaje supervisado). Se pueden utilizar diversas funciones de pérdida , según la tarea específica.

La función de pérdida Softmax se utiliza para predecir una sola clase de K clases mutuamente excluyentes. [ nb 3 ] La pérdida de entropía cruzada sigmoide se utiliza para predecir K valores de probabilidad independientes en[0,1]{\displaystyle [0,1]}La pérdida euclidiana se utiliza para la regresión a etiquetas de valor real .(,){\displaystyle (-\infty,\infty)}.

Hiperparámetros

Los hiperparámetros son diversas configuraciones que se utilizan para controlar el proceso de aprendizaje. Las redes neuronales convolucionales (CNN) utilizan más hiperparámetros que un perceptrón multicapa (MLP) estándar.

Relleno

El relleno consiste en añadir píxeles (normalmente) con valor cero en los bordes de una imagen. Esto se hace para que los píxeles de los bordes no se subvaloren (se pierdan) en la salida, ya que normalmente solo participan en una única instancia del campo receptivo. El relleno aplicado suele ser uno menos que la dimensión del núcleo correspondiente. Por ejemplo, una capa convolucional que utiliza núcleos de 3x3 recibiría un relleno de 2 píxeles, es decir, 1 píxel a cada lado de la imagen.

Paso

El paso es el número de píxeles que la ventana de análisis se desplaza en cada iteración. Un paso de 2 significa que cada núcleo se desplaza 2 píxeles con respecto al anterior.

Número de filtros

Dado que el tamaño del mapa de características disminuye con la profundidad, las capas cercanas a la capa de entrada tienden a tener menos filtros, mientras que las capas superiores pueden tener más. Para igualar el cálculo en cada capa, el producto de los valores de las características v a con la posición del píxel se mantiene prácticamente constante entre capas. Para conservar más información sobre la entrada, sería necesario que el número total de activaciones (número de mapas de características multiplicado por el número de posiciones de píxeles) no disminuya de una capa a otra.

El número de mapas de características controla directamente la capacidad y depende del número de ejemplos disponibles y de la complejidad de la tarea.

Tamaño del filtro (o núcleo)

Los tamaños de filtro comunes que se encuentran en la literatura varían mucho y generalmente se eligen en función del conjunto de datos. Los tamaños típicos de filtro van desde 1x1 hasta 7x7. Dos ejemplos conocidos son AlexNet , que utilizó 3x3, 5x5 y 11x11, e Inceptionv3, que utilizó 1x1, 3x3 y 5x5.

El reto consiste en encontrar el nivel de granularidad adecuado para crear abstracciones a la escala apropiada, dado un conjunto de datos particular, y sin sobreajuste .

Tipo y tamaño de la piscina

Normalmente se utiliza el agrupamiento máximo (max pooling) , a menudo con una dimensión de 2x2. Esto implica que la entrada se submuestrea drásticamente , lo que reduce el coste de procesamiento.

Un mayor agrupamiento reduce la dimensión de la señal y puede resultar en una pérdida de información inaceptable . A menudo, las ventanas de agrupamiento no superpuestas ofrecen el mejor rendimiento. [ 78 ]

Dilatación

La dilatación implica ignorar píxeles dentro de un núcleo. Esto reduce la memoria de procesamiento, potencialmente sin una pérdida significativa de señal. Una dilatación de 2 en un núcleo de 3x3 expande el núcleo a 5x5, mientras que sigue procesando 9 píxeles (espaciados uniformemente). Específicamente, los píxeles procesados ​​después de la dilatación son las celdas (1,1), (1,3), (1,5), (3,1), (3,3), (3,5), (5,1), (5,3), (5,5), donde (i,j) denota la celda de la i-ésima fila y j-ésima columna en el núcleo expandido de 5x5. En consecuencia, una dilatación de 4 expande el núcleo a 7x7.

Equivariancia de la traducción y aliasing

Se suele asumir que las CNN son invariantes a los desplazamientos de la entrada. Las capas de convolución o agrupación dentro de una CNN que no tienen un paso mayor que uno son, de hecho, equivariantes a las traslaciones de la entrada. [ 73 ] Sin embargo, las capas con un paso mayor que uno ignoran el teorema de muestreo de Nyquist-Shannon y podrían provocar aliasing de la señal de entrada. [ 73 ] Si bien, en principio, las CNN son capaces de implementar filtros anti-aliasing, se ha observado que esto no ocurre en la práctica, [ 88 ] y por lo tanto producen modelos que no son equivariantes a las traslaciones.

Además, si una CNN utiliza capas totalmente conectadas, la equivariancia de traslación no implica invariancia de traslación, ya que las capas totalmente conectadas no son invariantes a los desplazamientos de la entrada. [ 89 ] [ 16 ] Una solución para la invariancia de traslación completa es evitar cualquier submuestreo en toda la red y aplicar un pooling promedio global en la última capa. [ 73 ] Adicionalmente, se han propuesto varias otras soluciones parciales, como el antialiasing antes de las operaciones de submuestreo, [ 90 ] redes de transformadores espaciales, [ 91 ] aumento de datos , submuestreo combinado con pooling, [ 16 ] y redes neuronales de cápsulas . [ 92 ]

Evaluación

La precisión del modelo final se estima normalmente en una subparte del conjunto de datos reservada al inicio, a menudo denominada conjunto de prueba. Alternativamente, se aplican métodos como la validación cruzada k -fold. Otras estrategias incluyen el uso de la predicción conforme . [ 93 ] [ 94 ]

Métodos de regularización

La regularización es un proceso que consiste en introducir información adicional para resolver un problema mal condicionado o para evitar el sobreajuste . Las redes neuronales convolucionales (CNN) utilizan diversos tipos de regularización.

Empírico

Abandonar

Debido a que las redes tienen tantos parámetros, son propensas al sobreajuste. Un método para reducir el sobreajuste es el dropout , introducido en 2014. [ 95 ] En cada etapa de entrenamiento, los nodos individuales son "excluidos" de la red (ignorados) con probabilidad1pag{\displaystyle 1-p}o se mantuvo con probabilidadpag{\displaystyle p}De esta forma, se obtiene una red reducida; también se eliminan las conexiones entrantes y salientes hacia el nodo eliminado. En esta etapa, solo se entrena la red reducida con los datos. Posteriormente, los nodos eliminados se reinsertan en la red con sus pesos originales.

En las etapas de entrenamiento,pag{\displaystyle p}Suele ser 0,5; para los nodos de entrada, suele ser mucho mayor porque se pierde información directamente cuando se ignoran los nodos de entrada.

En el momento de la prueba, una vez finalizado el entrenamiento, idealmente nos gustaría encontrar un promedio de muestra de todos los posibles2norte{\displaystyle 2^{n}}redes abandonadas; desafortunadamente esto no es factible para valores grandes denorte{\displaystyle n}Sin embargo, podemos encontrar una aproximación utilizando la red completa con la salida de cada nodo ponderada por un factor depag{\displaystyle p}, por lo que el valor esperado de la salida de cualquier nodo es el mismo que en las etapas de entrenamiento. Esta es la mayor contribución del método dropout: aunque genera efectivamente2norte{\displaystyle 2^{n}}redes neuronales, y como tal permite la combinación de modelos, en el momento de la prueba solo es necesario probar una única red.

Al evitar entrenar todos los nodos con todos los datos de entrenamiento, el abandono reduce el sobreajuste. Este método también mejora significativamente la velocidad de entrenamiento. Esto hace que la combinación de modelos sea práctica, incluso para redes neuronales profundas . La técnica parece reducir las interacciones entre nodos, lo que les permite aprender características más robustas que se generalizan mejor a nuevos datos.

DropConnect

DropConnect es la generalización de dropout en la que cada conexión, en lugar de cada unidad de salida, puede ser descartada con probabilidad1pag{\displaystyle 1-p}Cada unidad recibe así la entrada de un subconjunto aleatorio de unidades en la capa anterior. [ 96 ]

DropConnect es similar a Dropout, ya que introduce dispersión dinámica en el modelo, pero se diferencia en que la dispersión se aplica a los pesos, en lugar de a los vectores de salida de una capa. En otras palabras, la capa totalmente conectada con DropConnect se convierte en una capa dispersa, donde las conexiones se eligen aleatoriamente durante la fase de entrenamiento.

Agrupación estocástica

Una desventaja importante del dropout es que no ofrece los mismos beneficios para las capas convolucionales, donde las neuronas no están completamente conectadas.

Incluso antes de dropout, en 2013 una técnica llamada agrupación estocástica, [ 97 ] las operaciones de agrupación deterministas convencionales fueron reemplazadas por un procedimiento estocástico, donde la activación dentro de cada región de agrupación se elige aleatoriamente de acuerdo con una distribución multinomial , dada por las actividades dentro de la región de agrupación. Este enfoque no tiene hiperparámetros y puede combinarse con otros enfoques de regularización, como dropout y aumento de datos .

Una visión alternativa del agrupamiento estocástico es que es equivalente al agrupamiento máximo estándar, pero con muchas copias de una imagen de entrada, cada una con pequeñas deformaciones locales . Esto es similar a las deformaciones elásticas explícitas de las imágenes de entrada, [ 98 ] que ofrece un rendimiento excelente en el conjunto de datos MNIST . [ 98 ] El uso de agrupamiento estocástico en un modelo multicapa produce un número exponencial de deformaciones, ya que las selecciones en las capas superiores son independientes de las inferiores.

Datos artificiales

Dado que el grado de sobreajuste del modelo está determinado tanto por su potencia como por la cantidad de entrenamiento que recibe, proporcionar a una red convolucional más ejemplos de entrenamiento puede reducir el sobreajuste. Como a menudo no hay suficientes datos disponibles para entrenar, especialmente considerando que una parte debe reservarse para pruebas posteriores, existen dos enfoques: generar nuevos datos desde cero (si es posible) o perturbar los datos existentes para crear otros nuevos. Este último se utiliza desde mediados de la década de 1990. [ 53 ] Por ejemplo, las imágenes de entrada se pueden recortar, rotar o reescalar para crear nuevos ejemplos con las mismas etiquetas que el conjunto de entrenamiento original. [ 99 ]

Explícito

Parada temprana

Uno de los métodos más sencillos para evitar el sobreajuste de una red neuronal consiste simplemente en detener el entrenamiento antes de que se produzca. Sin embargo, esto tiene la desventaja de que el proceso de aprendizaje se interrumpe.

Número de parámetros

Otra forma sencilla de prevenir el sobreajuste es limitar el número de parámetros, normalmente limitando el número de unidades ocultas en cada capa o la profundidad de la red. En las redes convolucionales, el tamaño del filtro también afecta al número de parámetros. Limitar el número de parámetros restringe directamente la capacidad predictiva de la red, reduciendo la complejidad de la función que puede realizar sobre los datos y, por lo tanto, limita el sobreajuste. Esto equivale a una norma cero .

Disminución del peso

Una forma sencilla de regularización adicional es la disminución de peso, que simplemente añade un error adicional, proporcional a la suma de los pesos ( norma L1 ) o al cuadrado de la magnitud ( norma L2 ) del vector de pesos, al error en cada nodo. El nivel de complejidad aceptable del modelo se puede reducir aumentando la constante de proporcionalidad (hiperparámetro 'alfa'), lo que incrementa la penalización para vectores de pesos grandes.

La regularización L2 es la forma más común de regularización. Se puede implementar penalizando el cuadrado de la magnitud de todos los parámetros directamente en la función objetivo. La regularización L2 se interpreta intuitivamente como una penalización severa de los vectores de peso con picos pronunciados y una preferencia por los vectores de peso difusos. Debido a las interacciones multiplicativas entre los pesos y las entradas, esto tiene la útil propiedad de incentivar a la red a usar todas sus entradas en menor medida, en lugar de usar solo algunas de ellas en mayor medida.

La regularización L1 también es común. Hace que los vectores de peso sean dispersos durante la optimización. En otras palabras, las neuronas con regularización L1 terminan usando solo un subconjunto disperso de sus entradas más importantes y se vuelven casi invariantes a las entradas ruidosas. La regularización L1 con la regularización L2 se pueden combinar; esto se denomina regularización de red elástica .

restricciones de norma máxima

Otra forma de regularización consiste en imponer un límite superior absoluto a la magnitud del vector de pesos para cada neurona y utilizar el descenso de gradiente proyectado para imponer la restricción. En la práctica, esto corresponde a realizar la actualización de parámetros de forma normal y, a continuación, imponer la restricción limitando el vector de pesos.w{\displaystyle {\vec {w}}}de cada neurona para satisfacerw2<do{\displaystyle \|{\vec {w}}\|_{2}<c}. Valores típicos dedo{\displaystyle c}son del orden de 3–4. Algunos artículos informan mejoras [ 100 ] al utilizar esta forma de regularización.

Marcos de coordenadas jerárquicos

La agrupación de imágenes pierde las relaciones espaciales precisas entre partes de alto nivel (como la nariz y la boca en una imagen facial). Estas relaciones son necesarias para el reconocimiento de identidad. Superponer las agrupaciones de imágenes, de modo que cada característica aparezca en varias, ayuda a conservar la información. La traducción por sí sola no puede extrapolar la comprensión de las relaciones geométricas a un punto de vista radicalmente nuevo, como una orientación o escala diferente. Por otro lado, las personas son muy buenas extrapolando; después de ver una nueva forma una vez, pueden reconocerla desde un punto de vista diferente. [ 101 ]

Una forma común de abordar este problema consistía en entrenar la red con datos transformados en diferentes orientaciones, escalas, iluminación, etc., para que pudiera manejar estas variaciones. Esto resulta computacionalmente intensivo para conjuntos de datos grandes. La alternativa es utilizar una jerarquía de sistemas de coordenadas y un grupo de neuronas para representar la conjunción de la forma de la característica y su pose relativa a la retina . La pose relativa a la retina es la relación entre el sistema de coordenadas de la retina y el sistema de coordenadas de las características intrínsecas. [ 102 ]

Así, una forma de representar algo es incrustar el sistema de coordenadas dentro de él. Esto permite reconocer características grandes utilizando la consistencia de las poses de sus partes (por ejemplo, las poses de la nariz y la boca hacen una predicción consistente de la pose de toda la cara). Este enfoque garantiza que la entidad de nivel superior (por ejemplo, la cara) esté presente cuando las de nivel inferior (por ejemplo, la nariz y la boca) coinciden en su predicción de la pose. Los vectores de actividad neuronal que representan la pose ("vectores de pose") permiten transformaciones espaciales modeladas como operaciones lineales que facilitan a la red el aprendizaje de la jerarquía de entidades visuales y la generalización a través de diferentes puntos de vista. Esto es similar a la forma en que el sistema visual humano impone sistemas de coordenadas para representar formas. [ 103 ]

Aplicaciones

Reconocimiento de imágenes

Las CNN se utilizan a menudo en sistemas de reconocimiento de imágenes . En 2012, se informó una tasa de error del 0,23 % en la base de datos MNIST . [ 28 ] Otro artículo sobre el uso de CNN para la clasificación de imágenes informó que el proceso de aprendizaje fue "sorprendentemente rápido"; en el mismo artículo, los mejores resultados publicados hasta 2011 se lograron en la base de datos MNIST y la base de datos NORB. [ 25 ] Posteriormente, una CNN similar llamada AlexNet [ 104 ] ganó el ImageNet Large Scale Visual Recognition Challenge 2012.

Cuando se aplicaron al reconocimiento facial , las CNN lograron una gran disminución en la tasa de error. [ 105 ] Otro artículo reportó una tasa de reconocimiento del 97,6 % en "5600 imágenes fijas de más de 10 sujetos". [ 21 ] Las CNN se utilizaron para evaluar la calidad del video de manera objetiva después del entrenamiento manual; el sistema resultante tuvo un error cuadrático medio muy bajo . [ 106 ]

El ImageNet Large Scale Visual Recognition Challenge es un referente en la clasificación y detección de objetos, con millones de imágenes y cientos de clases de objetos. En el ILSVRC 2014, [ 107 ] un desafío de reconocimiento visual a gran escala, casi todos los equipos mejor clasificados utilizaron CNN como su marco básico. El ganador GoogLeNet [ 108 ] (la base de DeepDream ) aumentó la precisión media de detección de objetos a 0,439329 y redujo el error de clasificación a 0,06656, el mejor resultado hasta la fecha. Su red aplicó más de 30 capas. Ese rendimiento de las redes neuronales convolucionales en las pruebas de ImageNet fue cercano al de los humanos. [ 109 ] Los mejores algoritmos aún tienen dificultades con objetos pequeños o delgados, como una pequeña hormiga en el tallo de una flor o una persona sosteniendo una pluma en la mano. También tienen problemas con imágenes que han sido distorsionadas con filtros, un fenómeno cada vez más común con las cámaras digitales modernas. Por el contrario, ese tipo de imágenes rara vez suponen un problema para los humanos. Sin embargo, los humanos suelen tener dificultades con otros aspectos. Por ejemplo, no son buenos clasificando objetos en categorías muy específicas, como la raza de perro o la especie de ave, mientras que las redes neuronales convolucionales sí lo hacen.

En 2015, una CNN multicapa demostró la capacidad de detectar rostros desde una amplia gama de ángulos, incluso boca abajo, incluso cuando estaban parcialmente ocluidos, con un rendimiento competitivo. La red se entrenó con una base de datos de 200 000 imágenes que incluían rostros en varios ángulos y orientaciones, y otros 20 millones de imágenes sin rostros. Se utilizaron lotes de 128 imágenes durante 50 000 iteraciones. [ 110 ]

Análisis de vídeo

En comparación con los dominios de datos de imágenes, hay relativamente poco trabajo sobre la aplicación de CNN a la clasificación de video. El video es más complejo que las imágenes ya que tiene otra dimensión (temporal). Sin embargo, se han explorado algunas extensiones de CNN al dominio del video. Un enfoque es tratar el espacio y el tiempo como dimensiones equivalentes de la entrada y realizar convoluciones tanto en el tiempo como en el espacio. [ 111 ] [ 112 ] Otra forma es fusionar las características de dos redes neuronales convolucionales, una para el flujo espacial y otra para el flujo temporal. [ 113 ] [ 114 ] [ 115 ] Las unidades recurrentes de memoria a corto y largo plazo (LSTM) se incorporan típicamente después de la CNN para tener en cuenta las dependencias entre fotogramas o entre clips. [ 116 ] [ 117 ] Se han introducido esquemas de aprendizaje no supervisado para entrenar características espaciotemporales, basados ​​en máquinas de Boltzmann restringidas con compuertas convolucionales [ 118 ] y análisis de subespacio independiente. [ 119 ] Su aplicación se puede observar en modelos de texto a vídeo .

Procesamiento del lenguaje natural

Las CNN también se han explorado para el procesamiento del lenguaje natural . Los modelos CNN son eficaces para varios problemas de PLN y han logrado excelentes resultados en el análisis semántico , [ 120 ] la recuperación de consultas de búsqueda, [ 121 ] el modelado de oraciones, [ 122 ] la clasificación, [ 123 ] la predicción [ 124 ] y otras tareas tradicionales de PLN. [ 125 ] En comparación con los métodos tradicionales de procesamiento del lenguaje, como las redes neuronales recurrentes , las CNN pueden representar diferentes realidades contextuales del lenguaje que no dependen de una suposición de secuencia de series, mientras que las RNN son más adecuadas cuando se requiere el modelado clásico de series temporales. [ 126 ] [ 127 ] [ 128 ] [ 129 ]

detección del comportamiento animal

Las CNN se han aplicado en la investigación ecológica y del comportamiento para detectar y cuantificar automáticamente el comportamiento animal a partir de datos visuales, [ 130 ] [ 131 ] permitiendo la identificación de animales, [ 132 ] [ 133 ] el seguimiento de individuos, [ 134 ] la estimación de la postura, [ 135 ] [ 136 ] [ 137 ] y la clasificación de acciones específicas como la alimentación, [ 138 ] y las interacciones sociales. [ 131 ] [ 138 ] Combinados con el seguimiento de múltiples objetos y el modelado temporal, estos sistemas pueden extraer secuencias de comportamiento en grabaciones extensas, reduciendo la dependencia de la anotación manual y aumentando el rendimiento para estudios de variación individual, redes sociales y dinámicas colectivas.

Detección de anomalías

Se utilizó una CNN con convoluciones 1-D en series temporales en el dominio de la frecuencia (residuo espectral) mediante un modelo no supervisado para detectar anomalías en el dominio del tiempo. [ 139 ]

descubrimiento de fármacos

Las CNN se han utilizado en el descubrimiento de fármacos . Predecir la interacción entre moléculas y proteínas biológicas puede identificar tratamientos potenciales. En 2015, Atomwise presentó AtomNet, la primera red neuronal de aprendizaje profundo para el diseño de fármacos basado en la estructura . [ 140 ] El sistema se entrena directamente con representaciones tridimensionales de interacciones químicas. De forma similar a como las redes de reconocimiento de imágenes aprenden a componer características más pequeñas y espacialmente próximas en estructuras más grandes y complejas, [ 141 ] AtomNet descubre características químicas, como aromaticidad , carbonos sp3 y enlaces de hidrógeno . Posteriormente, AtomNet se utilizó para predecir nuevas biomoléculas candidatas para múltiples dianas de enfermedades, en particular tratamientos para el virus del Ébola [ 142 ] y la esclerosis múltiple . [ 143 ]

Juego de damas

Las CNN se han utilizado en el juego de damas . Entre 1999 y 2001, Fogel y Chellapilla publicaron artículos que mostraban cómo una red neuronal convolucional podía aprender a jugar a las damas mediante coevolución. El proceso de aprendizaje no utilizó partidas profesionales previas de humanos, sino que se centró en un conjunto mínimo de información contenida en el tablero: la ubicación y el tipo de piezas, y la diferencia en el número de piezas entre los dos bandos. Finalmente, el programa ( Blondie24 ) se probó en 165 partidas contra jugadores y se clasificó en el 0,4% superior. [ 144 ] [ 145 ] También obtuvo una victoria contra el programa Chinook en su nivel de juego "experto". [ 146 ]

Ir

Las CNN se han utilizado en el Go computarizado . En diciembre de 2014, Clark y Storkey publicaron un artículo que mostraba que una CNN entrenada mediante aprendizaje supervisado a partir de una base de datos de partidas de profesionales humanos podía superar a GNU Go y ganar algunas partidas contra el programa de búsqueda de árbol de Monte Carlo Fuego 1.1 en una fracción del tiempo que le tomaba a Fuego jugar. [ 147 ] Posteriormente se anunció que una gran red neuronal convolucional de 12 capas había predicho correctamente el movimiento profesional en el 55% de las posiciones, igualando la precisión de un jugador humano de 6 dan . Cuando la red convolucional entrenada se usó directamente para jugar partidas de Go, sin ninguna búsqueda, venció al programa de búsqueda tradicional GNU Go en el 97% de las partidas e igualó el rendimiento del programa de búsqueda de árbol de Monte Carlo Fuego simulando diez mil jugadas (aproximadamente un millón de posiciones) por movimiento. [ 148 ]

AlphaGo , el primero en vencer al mejor jugador humano de la época, utilizó un par de CNN para elegir los movimientos a intentar ("red de políticas") y evaluar las posiciones ("red de valores") que impulsan el MCTS. [ 149 ]

Pronóstico de series temporales

Las redes neuronales recurrentes generalmente se consideran las mejores arquitecturas de redes neuronales para la predicción de series temporales (y el modelado de secuencias en general), pero estudios recientes muestran que las redes convolucionales pueden tener un rendimiento comparable o incluso mejor. [ 150 ] [ 13 ] Las convoluciones dilatadas [ 151 ] podrían permitir que las redes neuronales convolucionales unidimensionales aprendan de manera efectiva las dependencias de las series temporales. [ 152 ] Las convoluciones se pueden implementar de manera más eficiente que las soluciones basadas en RNN, y no sufren de gradientes que se desvanecen (o explotan). [ 153 ] Las redes convolucionales pueden proporcionar un rendimiento de predicción mejorado cuando hay múltiples series temporales similares de las que aprender. [ 154 ] Las CNN también se pueden aplicar a otras tareas en el análisis de series temporales (por ejemplo, clasificación de series temporales [ 155 ] o predicción de cuantiles [ 156 ] ).

Patrimonio cultural y conjuntos de datos 3D

A medida que los hallazgos arqueológicos, como las tablillas de arcilla con escritura cuneiforme , se adquieren cada vez más mediante escáneres 3D , se dispone de conjuntos de datos de referencia, incluido HeiCuBeDa [ 157 ] , que proporciona casi 2000 conjuntos de datos 2D y 3D normalizados preparados con el marco de software GigaMesh . [ 158 ] Así, las medidas basadas en la curvatura se utilizan junto con redes neuronales geométricas (GNN), por ejemplo, para la clasificación por períodos de aquellas tablillas de arcilla que se encuentran entre los documentos más antiguos de la historia de la humanidad. [ 159 ] [ 160 ]

Sintonia FINA

Para muchas aplicaciones, los datos de entrenamiento no están muy disponibles. Las redes neuronales convolucionales suelen requerir una gran cantidad de datos de entrenamiento para evitar el sobreajuste . Una técnica común consiste en entrenar la red con un conjunto de datos más grande de un dominio relacionado. Una vez que los parámetros de la red han convergido, se realiza un paso de entrenamiento adicional utilizando los datos del dominio para ajustar con precisión los pesos de la red; esto se conoce como aprendizaje por transferencia . Además, esta técnica permite aplicar con éxito arquitecturas de redes convolucionales a problemas con conjuntos de entrenamiento muy pequeños. [ 161 ]

explicaciones interpretables por humanos

El entrenamiento y la predicción de extremo a extremo son prácticas comunes en la visión por computadora . Sin embargo, se requieren explicaciones interpretables por humanos para sistemas críticos como los automóviles autónomos . [ 162 ] Con los avances recientes en prominencia visual , atención espacial y atención temporal , las regiones espaciales/instantes temporales más críticos podrían visualizarse para justificar las predicciones de la CNN. [ 163 ] [ 164 ]

Redes Q profundas

Una red Q profunda (DQN) es un tipo de modelo de aprendizaje profundo que combina una red neuronal profunda con el aprendizaje Q , una forma de aprendizaje por refuerzo . A diferencia de los agentes de aprendizaje por refuerzo anteriores, las DQN que utilizan CNN pueden aprender directamente de entradas sensoriales de alta dimensión mediante el aprendizaje por refuerzo. [ 165 ]

Los resultados preliminares se presentaron en 2014, con un artículo complementario en febrero de 2015. [ 166 ] La investigación describió una aplicación a los juegos de Atari 2600. Otros modelos de aprendizaje profundo por refuerzo la precedieron. [ 167 ]

Redes de creencias profundas

Las redes neuronales convolucionales de creencias profundas (CDBN) tienen una estructura muy similar a las redes neuronales convolucionales y se entrenan de forma similar a las redes de creencias profundas. Por lo tanto, aprovechan la estructura 2D de las imágenes, como lo hacen las CNN, y utilizan el preentrenamiento, al igual que las redes de creencias profundas . Proporcionan una estructura genérica que puede utilizarse en muchas tareas de procesamiento de imágenes y señales. Se han obtenido resultados de referencia en conjuntos de datos de imágenes estándar como CIFAR [ 168 ] utilizando CDBN. [ 169 ]

Pirámide de abstracción neuronal
Pirámide de abstracción neuronal

Pirámide de abstracción neuronal

La arquitectura de propagación directa de las redes neuronales convolucionales se extendió en la pirámide de abstracción neuronal [ 170 ] mediante conexiones laterales y de retroalimentación. La red convolucional recurrente resultante permite la incorporación flexible de información contextual para resolver iterativamente ambigüedades locales. A diferencia de los modelos anteriores, se generaron salidas similares a imágenes con la máxima resolución, por ejemplo, para tareas de segmentación semántica, reconstrucción de imágenes y localización de objetos.

Bibliotecas destacadas

  • Caffe : Una biblioteca para redes neuronales convolucionales. Creada por el Berkeley Vision and Learning Center (BVLC). Es compatible con CPU y GPU. Desarrollada en C++ , cuenta con interfaces para Python y MATLAB .
  • Deeplearning4j : Aprendizaje profundo en Java y Scala sobre Spark con múltiples GPU . Una biblioteca de aprendizaje profundo de propósito general para la pila de producción de la JVM que se ejecuta sobre un motor de computación científica en C++. Permite la creación de capas personalizadas. Se integra con Hadoop y Kafka.
  • Dlib : Un conjunto de herramientas para crear aplicaciones de aprendizaje automático y análisis de datos del mundo real en C++.
  • Microsoft Cognitive Toolkit : Un conjunto de herramientas de aprendizaje profundo desarrollado por Microsoft con varias características únicas que mejoran la escalabilidad en múltiples nodos. Admite interfaces completas para el entrenamiento en C++ y Python, y ofrece soporte adicional para la inferencia de modelos en C# y Java.
  • TensorFlow : biblioteca tipo Theano con licencia Apache 2.0 con soporte para CPU, GPU, la unidad de procesamiento tensorial (TPU) propietaria de Google, [ 171 ] y dispositivos móviles.
  • Theano : La biblioteca de referencia para el aprendizaje profundo en Python, con una API compatible en gran medida con la popular biblioteca NumPy . Permite al usuario escribir expresiones matemáticas simbólicas y genera automáticamente sus derivadas, evitando así la necesidad de programar gradientes o retropropagación. Estas expresiones simbólicas se compilan automáticamente a código CUDA para una implementación rápida en la GPU .
  • Torch : Un marco de computación científica con amplio soporte para algoritmos de aprendizaje automático, escrito en C y Lua .

Véase también

Notas

  1. Cuando se aplica a otros tipos de datos que no sean datos de imagen, como datos de sonido, la "posición espacial" puede corresponder de diversas maneras a diferentes puntos en el dominio del tiempo , el dominio de la frecuencia u otros espacios matemáticos .
  2. de ahí el nombre "capa convolucional"
  3. Los llamados datos categóricos .

Referencias

  1. 1 2 LeCun, Yann; Bengio, Yoshua; Hinton, Geoffrey (2015-05-28). "Aprendizaje profundo" . Nature . 521 (7553): 436– 444. Bibcode : 2015Natur.521..436L . doi : 10.1038/nature14539 . ISSN 1476-4687 . PMID 26017442 .  
  2. LeCun, Y.; Boser, B.; Denker, JS; Henderson, D.; Howard, RE; Hubbard, W.; Jackel, LD (diciembre de 1989). "Retropropagación aplicada al reconocimiento de códigos postales manuscritos" . Neural Computation . 1 (4): 541– 551. doi : 10.1162/neco.1989.1.4.541 . ISSN 0899-7667 . 
  3. 1 2 Venkatesan, Ragav; Li, Baoxin (23 de octubre de 2017). Redes neuronales convolucionales en computación visual: una guía concisa . CRC Press. ISBN 978-1-351-65032-8Archivado del original el 16 de octubre de 2023. Consultado el 13 de diciembre de 2020 .
  4. 1 2 Balas, Valentina E.; Kumar, Raghvendra; Srivastava, Rajshree (19 de noviembre de 2019). Tendencias y avances recientes en inteligencia artificial e Internet de las cosas . Springer Nature. ISBN 978-3-030-32644-9Archivado del original el 16 de octubre de 2023. Consultado el 13 de diciembre de 2020 .
  5. Zhang, Yingjie; Soon, Hong Geok; Ye, Dongsen; Fuh, Jerry Ying Hsi; Zhu, Kunpeng (septiembre de 2020). "Monitoreo del proceso de fusión de lecho de polvo mediante visión artificial con redes neuronales convolucionales híbridas". IEEE Transactions on Industrial Informatics . 16 (9): 5769– 5779. Bibcode : 2020ITII...16.5769Z . doi : 10.1109/TII.2019.2956078 . ISSN 1941-0050 . S2CID 213010088 .  
  6. Chervyakov, NI; Lyakhov, PA; Deryabin, MA; Nagornov, NN; Valueva, MV; Valuev, GV (septiembre de 2020). " Solución basada en el sistema de numeración de residuos para reducir el costo de hardware de una red neuronal convolucional" . Neurocomputing . 407 : 439–453 . doi : 10.1016/j.neucom.2020.04.018 . S2CID 219470398. Archivado del original el 29 de junio de 2023. Recuperado el 12 de agosto de 2023. Las redes neuronales convolucionales representan arquitecturas de aprendizaje profundo que se utilizan actualmente en una amplia gama de aplicaciones, incluyendo visión artificial, reconocimiento de voz, detección de malware, análisis de series temporales en finanzas y muchas otras. 
  7. 1 2 Aghdam, Hamed Habibi; Heravi, Elnaz Jahani (30 de mayo de 2017). Guía de redes neuronales convolucionales: una aplicación práctica a la detección y clasificación de señales de tráfico . Cham, Suiza: Springer. ISBN 978-3-319-57549-0OCLC 987790957 
  8. 1 2 3 Homma, Toshiteru; Les Atlas; Robert Marks II (1987). "Una red neuronal artificial para patrones bipolares espaciotemporales: aplicación a la clasificación de fonemas" (PDF) . Avances en sistemas de procesamiento de información neuronal . 1 : 31–40 . Archivado (PDF) del original el 31-03-2022 . Recuperado el 31-03-2022 . La noción de convolución o correlación utilizada en los modelos presentados es popular en disciplinas de ingeniería y se ha aplicado ampliamente al diseño de filtros, sistemas de control, etc.
  9. Valueva, MV; Nagornov, NN; Lyakhov, PA; Valuev, GV; Chervyakov, NI (2020). "Aplicación del sistema de numeración de residuos para reducir los costos de hardware de la implementación de redes neuronales convolucionales". Matemáticas y Computadoras en Simulación . 177. Elsevier BV: 232–243 . doi : 10.1016/j.matcom.2020.04.031 . ISSN 0378-4754 . S2CID 218955622. Las redes neuronales convolucionales son una herramienta prometedora para resolver el problema del reconocimiento de patrones.  
  10. ^ van den Oord, Aarón; Dieleman, Sander; Schrauwen, Benjamín (1 de enero de 2013). Burges, CJC; Bottou, L.; Bien, M.; Ghahramani, Z.; Weinberger, KQ (eds.). Recomendación musical profunda basada en contenido (PDF) . Curran Associates, Inc. págs. 2643–2651 . Archivado (PDF) desde el original el 7 de marzo de 2022 . Consultado el 31 de marzo de 2022 . 
  11. Collobert, Ronan; Weston, Jason (1 de enero de 2008). «Una arquitectura unificada para el procesamiento del lenguaje natural». Actas de la 25.ª conferencia internacional sobre aprendizaje automático - ICML '08 . Nueva York, NY, EE. UU.: ACM. págs. 160–167 . doi : 10.1145/1390156.1390177 . ISBN  978-1-60558-205-4. S2CID 2617020 . 
  12. Avilov, Oleksii; Rimbert, Sebastien; Popov, Anton; Bougrain, Laurent (julio de 2020). «Técnicas de aprendizaje profundo para mejorar la detección de la conciencia intraoperatoria a partir de señales electroencefalográficas» . 42.ª Conferencia Internacional Anual de la Sociedad de Ingeniería en Medicina y Biología del IEEE (EMBC) (PDF) . Vol. 2020. Montreal, QC, Canadá: IEEE. págs. 142-145 . doi : 10.1109/EMBC44109.2020.9176228 . ISBN   978-1-7281-1990-8. PMID 33017950 . S2CID 221386616 . Archivado (PDF) del original el 19-05-2022 . Recuperado el 21-07-2023 .  
  13. 1 2 Tsantekidis, Avraam; Passalis, Nikolaos; Tefas, Anastasios; Kanniainen, Juho; Gabbouj, Moncef; Iosifidis, Alexandros (julio de 2017). "Pronóstico de precios de acciones a partir del libro de órdenes límite mediante redes neuronales convolucionales". 2017 IEEE 19.ª Conferencia sobre Informática Empresarial (CBI) . Tesalónica, Grecia: IEEE. págs. 7–12 . doi : 10.1109/CBI.2017.23 . ISBN  978-1-5386-3035-8. S2CID 4950757 . 
  14. 1 2 3 Zhang, Wei (1988). "Red neuronal de reconocimiento de patrones invariante al desplazamiento y su arquitectura óptica" . Actas de la Conferencia Anual de la Sociedad Japonesa de Física Aplicada . Archivado del original el 23 de junio de 2020. Recuperado el 22 de junio de 2020 .
  15. 1 2 3 Zhang, Wei (1990). "Modelo de procesamiento distribuido en paralelo con interconexiones locales invariantes en el espacio y su arquitectura óptica" . Applied Optics . 29 (32): 4790– 7. Bibcode : 1990ApOpt..29.4790Z . doi : 10.1364/AO.29.004790 . PMID 20577468. Archivado del original el 6 de febrero de 2017. Recuperado el 22 de septiembre de 2016 . 
  16. 1 2 3 4 5 6 Mouton, Coenraad; Myburgh, Johannes C.; Davel, Marelie H. (2020). "Invariancia de traslación y paso en CNN" . En Gerber, Aurona (ed.). Investigación en inteligencia artificial . Communications in Computer and Information Science. Vol. 1342. Cham: Springer International Publishing. pp. 267–281 . arXiv : 2103.10097 . doi : 10.1007/978-3-030-66151-9_17 . ISBN   978-3-030-66151-9. S2CID 232269854 . Archivado del original el 27-06-2021 . Recuperado el 26-03-2021 . 
  17. Kurtzman, Thomas (20 de agosto de 2019). "El sesgo oculto en el conjunto de datos DUD-E conduce a un rendimiento engañoso del aprendizaje profundo en el cribado virtual basado en la estructura" . PLOS ONE . 14 (8) e0220113. Bibcode : 2019PLoSO..1420113C . doi : 10.1371/journal.pone.0220113 . PMC 6701836. PMID 31430292 .  
  18. 1 2 3 Fukushima, K. (2007). "Neocognitron" . Scholarpedia . 2 (1): 1717. Bibcode : 2007SchpJ...2.1717F . doi : 10.4249/scholarpedia.1717 .
  19. 1 2 Hubel, DH; Wiesel, TN (1968-03-01). "Campos receptivos y arquitectura funcional de la corteza estriada del mono" . The Journal of Physiology . 195 (1): 215– 243. doi : 10.1113/jphysiol.1968.sp008455 . ISSN 0022-3751 . PMC 1557912. PMID 4966457 .   
  20. 1 2 Fukushima, Kunihiko (1980). "Neocognitron: un modelo de red neuronal autoorganizada para un mecanismo de reconocimiento de patrones no afectado por el cambio de posición" ( PDF) . Cibernética biológica . 36 (4): 193– 202. doi : 10.1007/BF00344251 . PMID 7370364. S2CID 206775608. Archivado (PDF) del original el 3 de junio de 2014. Recuperado el 16 de noviembre de 2013 .  
  21. 1 2 Matusugu, Masakazu; Katsuhiko Mori; Yusuke Mitari; Yuji Kaneda (2003). "Reconocimiento de expresiones faciales independiente del sujeto con detección facial robusta mediante una red neuronal convolucional" ( PDF) . Redes neuronales . 16 (5): 555– 559. Bibcode : 2003NN.....16..555M . doi : 10.1016/S0893-6080(03)00115-1 . PMID 12850007. Archivado (PDF) del original el 13 de diciembre de 2013. Recuperado el 17 de noviembre de 2013 . 
  22. Redes neuronales convolucionales desmitificadas: un tutorial basado en la perspectiva del filtrado adaptado https://arxiv.org/abs/2108.11663v3
  23. "Redes neuronales convolucionales (LeNet) – Documentación de DeepLearning 0.1" . DeepLearning 0.1 . LISA Lab. Archivado del original el 28 de diciembre de 2017. Recuperado el 31 de agosto de 2013 .
  24. Chollet, François (2017-04-04). "Xception: Deep Learning with Depthwise Separable Convolutions". arXiv : 1610.02357 [ cs.CV ].
  25. 1 2 3 Ciresan, Dan; Ueli Meier; Jonathan Masci; Luca M. Gambardella; Jurgen Schmidhuber (2011). "Redes neuronales convolucionales flexibles y de alto rendimiento para la clasificación de imágenes" (PDF) . Actas de la Vigésimo Segunda Conferencia Internacional Conjunta sobre Inteligencia Artificial - Volumen Dos . 2 : 1237–1242 . Archivado (PDF) del original el 5 de abril de 2022. Recuperado el 17 de noviembre de 2013 .
  26. Krizhevsky , Alex. "Clasificación de ImageNet con redes neuronales convolucionales profundas" (PDF) . Archivado (PDF) del original el 25 de abril de 2021. Recuperado el 17 de noviembre de 2013 .
  27. 1 2 Yamaguchi, Kouichi; Sakamoto, Kenji; Akabane, Toshio; Fujimoto, Yoshiji (noviembre de 1990). Una red neuronal para el reconocimiento de palabras aisladas independientes del hablante . Primera Conferencia Internacional sobre Procesamiento del Lenguaje Hablado (ICSLP 90). Kobe, Japón. Archivado del original el 7 de marzo de 2021. Recuperado el 4 de septiembre de 2019 .
  28. 1 2 3 4 Ciresan, Dan; Meier, Ueli; Schmidhuber, Jürgen (junio de 2012). "Redes neuronales profundas multicolumna para la clasificación de imágenes". Conferencia IEEE de 2012 sobre Visión por Computadora y Reconocimiento de Patrones . Nueva York, NY: Instituto de Ingenieros Eléctricos y Electrónicos (IEEE). págs. 3642–3649 . arXiv : 1202.2745 . CiteSeerX 10.1.1.300.3283 . doi : 10.1109/CVPR.2012.6248110 . ISBN   978-1-4673-1226-4. OCLC 812295155 . S2CID 2161592 .  
  29. Yu, Fisher; Koltun, Vladlen (2016-04-30). "Agregación de contexto multiescala mediante convoluciones dilatadas". arXiv : 1511.07122 [ cs.CV ].
  30. Chen, Liang-Chieh; Papandreou, George; Schroff, Florian; Adam, Hartwig (2017-12-05). "Repensando la convolución atrosa para la segmentación semántica de imágenes". arXiv : 1706.05587 [ cs.CV ].
  31. ^ Duta, Ionut Cosmin; Georgescu, Mariana Juliana; Ionescu, Radu Tudor (16 de agosto de 2021). "Redes neuronales convolucionales contextuales". arXiv : 2108.07387 [ cs.CV ].
  32. LeCun, Yann. "LeNet-5, redes neuronales convolucionales" . Archivado del original el 24 de febrero de 2021. Recuperado el 16 de noviembre de 2013 .
  33. Zeiler, Matthew D.; Taylor, Graham W.; Fergus, Rob (noviembre de 2011). "Redes deconvolucionales adaptativas para el aprendizaje de características de nivel medio y alto" . Conferencia Internacional de Visión por Computadora de 2011. IEEE. págs. 2018–2025 . doi : 10.1109/iccv.2011.6126474 . ISBN  978-1-4577-1102-2.
  34. Dumoulin, Vincent; Visin, Francesco (2018-01-11), Una guía para la aritmética de convolución para el aprendizaje profundo , arXiv : 1603.07285
  35. ^ Ódena, Augusto; Dumoulin, Vicente; Olah, Chris (17 de octubre de 2016). "Artefactos de deconvolución y tablero de ajedrez" . Destilar . 1 (10) e3. doi : 10.23915/distill.00003 . ISSN 2476-0757 . 
  36. van Dyck, Leonard Elia; Kwitt, Roland; Denzler, Sebastian Jochen; Gruber, Walter Roland (2021). "Comparación del reconocimiento de objetos en humanos y redes neuronales convolucionales profundas: un estudio de seguimiento ocular" . Frontiers in Neuroscience . 15 750639. doi : 10.3389/fnins.2021.750639 . ISSN 1662-453X . PMC 8526843. PMID 34690686 .   
  37. 1 2 Hubel, DH; Wiesel, TN (octubre de 1959). " Campos receptivos de neuronas individuales en la corteza estriada del gato" . J. Physiol . 148 (3): 574– 91. doi : 10.1113/jphysiol.1959.sp006308 . PMC 1363130. PMID 14403679 .  
  38. David H. Hubel y Torsten N. Wiesel (2005). Cerebro y percepción visual: la historia de una colaboración de 25 años . Oxford University Press, EE. UU., pág. 106. ISBN  978-0-19-517618-6Archivado del original el 16 de octubre de 2023. Consultado el 18 de enero de 2019 .
  39. 1 2 Fukushima, K. (1969). "Extracción de características visuales mediante una red multicapa de elementos de umbral analógicos". IEEE Transactions on Systems Science and Cybernetics . 5 (4): 322– 333. Bibcode : 1969ITSSC...5..322F . doi : 10.1109/TSSC.1969.300225 .
  40. Schmidhuber, Juergen (2022). "Historia anotada de la IA moderna y el aprendizaje profundo". arXiv : 2212.11279 [ cs.NE ].
  41. Ramachandran, Prajit; Barret, Zoph; Quoc, V. Le (16 de octubre de 2017). "Búsqueda de funciones de activación". arXiv : 1710.05941 [ cs.NE ].
  42. 1 2 Waibel, Alex (18 de diciembre de 1987). Reconocimiento de fonemas mediante redes neuronales con retardo temporal (PDF) . Reunión del Instituto de Ingenieros Eléctricos, de Información y de Comunicación (IEICE). Tokio, Japón.
  43. Alexander Waibel et al., Reconocimiento de fonemas mediante redes neuronales con retardo temporal Archivado el 25/02/2021 en Wayback Machine IEEE Transactions on Acoustics, Speech, and Signal Processing, Volumen 37, No. 3, pp. 328 - 339 Marzo de 1989.
  44. LeCun, Yann; Bengio, Yoshua (1995). "Redes neuronales convolucionales para imágenes, voz y series temporales" . En Arbib, Michael A. (ed.). Manual de teoría cerebral y redes neuronales (Segunda edición). The MIT Press. pp. 276–278 . Archivado del original el 28 de julio de 2020. Consultado el 3 de diciembre de 2019 .  
  45. John B. Hampshire y Alexander Waibel, Arquitecturas conexionistas para el reconocimiento de fonemas de múltiples hablantes Archivado el 31-03-2022 en Wayback Machine , Advances in Neural Information Processing Systems, 1990, Morgan Kaufmann.
  46. Ko, ​​Tom; Peddinti, Vijayaditya; Povey, Daniel; Seltzer, Michael L.; Khudanpur, Sanjeev (marzo de 2018). Un estudio sobre el aumento de datos del habla reverberante para el reconocimiento robusto del habla (PDF) . La 42.ª Conferencia Internacional IEEE sobre Acústica, Habla y Procesamiento de Señales (ICASSP 2017). Nueva Orleans, LA, EE. UU. Archivado (PDF) del original el 8 de julio de 2018. Recuperado el 4 de septiembre de 2019 .
  47. Denker, JS, Gardner, WR, Graf, H. P, Henderson, D, Howard, RE, Hubbard, W, Jackel, LD, BaIrd, HS y Guyon (1989) Reconocedor de red neuronal para dígitos de códigos postales escritos a mano. Archivado el 4 de agosto de 2018 en Wayback Machine , AT&T Bell Laboratories.
  48. 1 2 Y. LeCun, B. Boser, JS Denker, D. Henderson, RE Howard, W. Hubbard, LD Jackel, Retropropagación aplicada al reconocimiento de códigos postales manuscritos Archivado el 10/01/2020 en Wayback Machine ; AT&T Bell Laboratories
  49. 1 2 Zhang, Wei (1991). " Procesamiento de imágenes del endotelio corneal humano basado en una red de aprendizaje" . Applied Optics . 30 (29): 4211– 7. Bibcode : 1991ApOpt..30.4211Z . doi : 10.1364/AO.30.004211 . PMID 20706526. Archivado del original el 6 de febrero de 2017. Recuperado el 22 de septiembre de 2016 . 
  50. 1 2 Zhang, Wei (1994). "Detección computarizada de microcalcificaciones agrupadas en mamografías digitales mediante una red neuronal artificial invariante al desplazamiento" . Física Médica . 21 (4): 517– 24. Bibcode : 1994MedPh..21..517Z . doi : 10.1118/1.597177 . PMID 8058017. Archivado del original el 6 de febrero de 2017. Recuperado el 22 de septiembre de 2016 . 
  51. Weng, J; Ahuja, N; Huang, TS (1993). "Aprendizaje del reconocimiento y segmentación de objetos 3D a partir de imágenes 2D". 1993 (4.ª) Conferencia Internacional sobre Visión por Computadora . IEEE. pp. 121–128 . doi : 10.1109/ICCV.1993.378228 . ISBN  0-8186-3870-2. S2CID 8619176 . 
  52. 1 2 Schmidhuber, Jürgen (2015). "Deep Learning" . Scholarpedia . 10 (11): 1527– 54. CiteSeerX 10.1.1.76.1541 . doi : 10.1162/neco.2006.18.7.1527 . PMID 16764513. S2CID 2309950. Archivado del original el 19 de abril de 2016. Recuperado el 20 de enero de 2019 .   
  53. 12Lecun, Y.; Jackel, L. D.; Bottou, L.; Cortes, C.; Denker, J. S.; Drucker, H.; Guyon, I.; Muller, U. A.; Sackinger, E.; Simard, P.; Vapnik, V. (August 1995). Learning algorithms for classification: A comparison on handwritten digit recognition(PDF). World Scientific. pp. 261–276. doi:10.1142/2808. ISBN 978-981-02-2324-3. Archived(PDF) from the original on 2 May 2023.
  54. Lecun, Y.; Bottou, L.; Bengio, Y.; Haffner, P. (November 1998). "Gradient-based learning applied to document recognition"(PDF). Proceedings of the IEEE. 86 (11): 2278–2324. Bibcode:1998IEEEP..86.2278L. doi:10.1109/5.726791.
  55. Zhang, Wei (1991). "Error Back Propagation with Minimum-Entropy Weights: A Technique for Better Generalization of 2-D Shift-Invariant NNs". Proceedings of the International Joint Conference on Neural Networks. Archived from the original on 2017-02-06. Retrieved 2016-09-22.
  56. Daniel Graupe, Ruey Wen Liu, George S Moschytz."Applications of neural networks to medical signal processingArchived 2020-07-28 at the Wayback Machine". In Proc. 27th IEEE Decision and Control Conf., pp. 343–347, 1988.
  57. Daniel Graupe, Boris Vern, G. Gruener, Aaron Field, and Qiu Huang. "Decomposition of surface EMG signals into single fiber action potentials by means of neural networkArchived 2019-09-04 at the Wayback Machine". Proc. IEEE International Symp. on Circuits and Systems, pp. 1008–1011, 1989.
  58. Qiu Huang, Daniel Graupe, Yi Fang Huang, Ruey Wen Liu."Identification of firing patterns of neuronal signals." In Proc. 28th IEEE Decision and Control Conf., pp. 266–271, 1989. https://ieeexplore.ieee.org/document/70115Archived 2022-03-31 at the Wayback Machine
  59. Oh, KS; Jung, K (2004). "GPU implementation of neural networks". Pattern Recognition. 37 (6): 1311–1314. Bibcode:2004PatRe..37.1311O. doi:10.1016/j.patcog.2004.01.013.
  60. Dave Steinkraus; Patrice Simard; Ian Buck (2005). "Uso de GPU para algoritmos de aprendizaje automático" . XII Conferencia Internacional sobre Análisis y Reconocimiento de Documentos (ICDAR 2005) . págs. 1115–1119 . doi : 10.1109/ICDAR.2005.251 . Archivado del original el 31 de marzo de 2022. Consultado el 31 de marzo de 2022 . 
  61. Kumar Chellapilla; Sid Puri; Patrice Simard (2006). "Redes neuronales convolucionales de alto rendimiento para el procesamiento de documentos" . En Lorette, Guy (ed.). Décimo taller internacional sobre fronteras en el reconocimiento de escritura a mano . Suvisoft. Archivado del original el 18 de mayo de 2020. Recuperado el 14 de marzo de 2016 .
  62. Hinton, GE; Osindero, S; Teh, YW (julio de 2006). "Un algoritmo de aprendizaje rápido para redes de creencias profundas". Neural Computation . 18 (7): 1527– 54. CiteSeerX 10.1.1.76.1541 . doi : 10.1162/neco.2006.18.7.1527 . PMID 16764513. S2CID 2309950 .   
  63. Bengio, Yoshua; Lamblin, Pascal; Popovici, Dan; Larochelle, Hugo (2007). "Entrenamiento codicioso por capas de redes neuronales profundas" (PDF) . Advances in Neural Information Processing Systems : 153–160 . Archivado (PDF) del original el 2 de junio de 2022. Consultado el 31 de marzo de 2022 .
  64. Ranzato, MarcAurelio; Poultney, Christopher; Chopra, Sumit; LeCun, Yann (2007). "Aprendizaje eficiente de representaciones dispersas con un modelo basado en energía" (PDF) . Advances in Neural Information Processing Systems . Archivado (PDF) del original el 22 de marzo de 2016. Recuperado el 26 de junio de 2014 .
  65. Raina, R; Madhavan, A; Ng, Andrew (14 de junio de 2009). "Aprendizaje profundo no supervisado a gran escala mediante procesadores gráficos" (PDF) . Actas de la 26.ª Conferencia Internacional Anual sobre Aprendizaje Automático . ICML '09: Actas de la 26.ª Conferencia Internacional Anual sobre Aprendizaje Automático. págs. 873–880 . doi : 10.1145/1553374.1553486 . ISBN  978-1-60558-516-1. S2CID 392458 . Archivado (PDF) del original el 8 de diciembre de 2020 . Recuperado el 22 de diciembre de 2023 . 
  66. Ciresan, Dan; Meier, Ueli; Gambardella, Luca; Schmidhuber, Jürgen (2010). "Redes neuronales profundas, grandes y simples para el reconocimiento de dígitos escritos a mano". Neural Computation . 22 (12): 3207– 3220. arXiv : 1003.0358 . Bibcode : 2010NeCom..22.3207C . doi : 10.1162/NECO_a_00052 . PMID 20858131 . S2CID 1918673 .  
  67. "Tabla de resultados del concurso IJCNN 2011" . CONCURSO OFICIAL IJCNN2011 . 2010. Archivado del original el 17 de enero de 2021. Consultado el 14 de enero de 2019 .
  68. Schmidhuber, Jürgen (17 de marzo de 2017). "Historia de concursos de visión por computadora ganados por CNN profundas en GPU" . Archivado del original el 19 de diciembre de 2018. Recuperado el 14 de enero de 2019 .
  69. 1 2 Krizhevsky, Alex; Sutskever, Ilya; Hinton, Geoffrey E. (2017-05-24). "Clasificación de ImageNet con redes neuronales convolucionales profundas" ( PDF) . Communications of the ACM . 60 (6): 84– 90. doi : 10.1145/3065386 . ISSN 0001-0782 . S2CID 195908774. Archivado (PDF) del original el 16-05-2017 . Recuperado el 04-12-2018 .  
  70. Viebke, Andre; Memeti, Suejb; Pllana, Sabri; Abraham, Ajith (2019). "CHAOS: un esquema de paralelización para entrenar redes neuronales convolucionales en Intel Xeon Phi". The Journal of Supercomputing . 75 (1): 197– 227. arXiv : 1702.07908 . doi : 10.1007/s11227-017-1994-x . S2CID 14135321 . 
  71. Viebke, Andre; Pllana, Sabri (2015). "El potencial del Intel (R) Xeon Phi para el aprendizaje profundo supervisado" . 2015 IEEE 17.ª Conferencia Internacional sobre Computación y Comunicaciones de Alto Rendimiento, 2015 IEEE 7.º Simposio Internacional sobre Seguridad en el Ciberespacio y 2015 IEEE 12.ª Conferencia Internacional sobre Software y Sistemas Embebidos . IEEE Xplore . IEEE 2015. pp. 758–765 . doi : 10.1109/HPCC-CSS-ICESS.2015.45 . ISBN  978-1-4799-8937-9. S2CID 15411954 . Archivado del original el 06-03-2023 . Recuperado el 31-03-2022 . 
  72. Hinton, Geoffrey (2012). "Clasificación de ImageNet con redes neuronales convolucionales profundas" . NIPS'12: Actas de la 25.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal - Volumen 1. 1 : 1097–1105 . Archivado del original el 20 de diciembre de 2019. Recuperado el 26 de marzo de 2021 a través de ACM.
  73. 1 2 3 4 5 Azulay, Aharon; Weiss, Yair (2019). "¿Por qué las redes neuronales convolucionales profundas se generalizan tan mal a pequeñas transformaciones de imágenes?" . Journal of Machine Learning Research . 20 (184): 1– 25. ISSN 1533-7928 . Archivado del original el 31-03-2022 . Recuperado el 31-03-2022 . 
  74. 1 2 Géron, Aurélien (2019). Aprendizaje automático práctico con Scikit-Learn, Keras y TensorFlow . Sebastopol, CA: O'Reilly Media. ISBN 978-1-492-03264-9., págs. 448
  75. Li, Zewen; Liu, Fan; Yang, Wenjie; Peng, Shouheng; Zhou, Jun (diciembre de 2022). "Una revisión de las redes neuronales convolucionales: análisis, aplicaciones y perspectivas". IEEE Transactions on Neural Networks and Learning Systems . 33 (12): 6999– 7019. arXiv : 2004.02806 . Bibcode : 2022ITNNL..33.6999L . doi : 10.1109/TNNLS.2021.3084827 . hdl : 10072/405164 . PMID 34111009 . 
  76. "CS231n Redes neuronales convolucionales para el reconocimiento visual" . cs231n.github.io . Archivado del original el 23/10/2019 . Consultado el 25/04/2017 .
  77. Nirthika, Rajendran; Manivannan, Siyamalan; Ramanan, Amirthalingam; Wang, Ruixuan (2022-04-01). "Pooling en redes neuronales convolucionales para el análisis de imágenes médicas: una revisión y un estudio empírico" . Neural Computing and Applications . 34 (7): 5321– 5347. doi : 10.1007/s00521-022-06953-8 . ISSN 1433-3058 . PMC 8804673. PMID 35125669 .   
  78. 1 2 Scherer, Dominik; Müller, Andreas C.; Behnke, Sven (2010). "Evaluación de operaciones de agrupación en arquitecturas convolucionales para el reconocimiento de objetos" (PDF) . Redes neuronales artificiales (ICANN), 20.ª Conferencia Internacional sobre . Tesalónica, Grecia: Springer. pp. 92–101 . Archivado (PDF) del original el 3 de abril de 2018. Recuperado el 28 de diciembre de 2016 . 
  79. Graham, Benjamin (2014-12-18). "Fractional Max-Pooling". arXiv : 1412.6071 [ cs.CV ].
  80. Springenberg, Jost Tobias; Dosovitskiy, Alexey; Brox, Thomas; Riedmiller, Martin (2014-12-21). "En busca de la simplicidad: la red totalmente convolucional". arXiv : 1412.6806 [ cs.LG ].
  81. Ma, Zhanyu; Chang, Dongliang; Xie, Jiyang; Ding, Yifeng; Wen, Shaoguo; Li, Xiaoxu; Si, Zhongwei; Guo, Jun (2019). "Clasificación de vehículos de grano fino con CNN modificadas de agrupación máxima de canales". IEEE Transactions on Vehicular Technology . 68 (4). Instituto de Ingenieros Eléctricos y Electrónicos (IEEE): 3224– 3233. Bibcode : 2019ITVT...68.3224M . doi : 10.1109/tvt.2019.2899972 . ISSN 0018-9545 . S2CID 86674074 .  
  82. Zafar, Afia; Aamir, Muhammad; Mohd Nawi, Nazri; Arshad, Ali; Riaz, Saman; Alruban, Abdulrahman; Dutta, Ashit Kumar; Almotairi, Sultan (2022-08-29). "Una comparación de métodos de agrupación para redes neuronales convolucionales" . Applied Sciences . 12 (17): 8643. Bibcode : 2022ApSci..12.8643Z . doi : 10.3390/app12178643 . ISSN 2076-3417 . 
  83. Gholamalinezhad, Hossein; Khosravi, Hossein (2020-09-16), Métodos de agrupación en redes neuronales profundas, una revisión , arXiv : 2009.07485
  84. Householder, Alston S. (junio de 1941). "Una teoría de la actividad en estado estacionario en redes de fibras nerviosas: I. Definiciones y lemas preliminares" . The Bulletin of Mathematical Biophysics . 3 (2): 63– 69. doi : 10.1007/BF02478220 . ISSN 0007-4985 . 
  85. Romanuke, Vadim (2017). "Número y asignación apropiados de ReLU en redes neuronales convolucionales" . Boletín de investigación de NTUU "Instituto Politécnico de Kiev" . 1 (1): 69– 78. doi : 10.20535/1810-0546.2017.1.88156 .
  86. Xavier Glorot; Antoine Bordes; Yoshua Bengio (2011). Redes neuronales rectificadoras dispersas profundas (PDF) . AISTATS. Archivado del original (PDF) el 13 de diciembre de 2016. Recuperado el 10 de abril de 2023. Funciones de activación rectificadoras y softplus. La segunda es una versión suavizada de la primera.
  87. Krizhevsky, A.; Sutskever, I.; Hinton, GE (2012). "Clasificación de ImageNet con redes neuronales convolucionales profundas" (PDF) . Advances in Neural Information Processing Systems . 1 : 1097–1105 . Archivado (PDF) del original el 31 de marzo de 2022. Recuperado el 31 de marzo de 2022 .
  88. Ribeiro, Antonio H.; Schön, Thomas B. (2021). "Cómo las redes neuronales convolucionales abordan el aliasing". ICASSP 2021 - Conferencia Internacional IEEE de Acústica, Habla y Procesamiento de Señales (ICASSP) 2021. pp. 2755–2759 . arXiv : 2102.07757 . doi : 10.1109/ICASSP39728.2021.9414627 . ISBN  978-1-7281-7605-5. S2CID 231925012 . 
  89. Myburgh, Johannes C.; Mouton, Coenraad; Davel, Marelie H. (2020). "Seguimiento de la invariancia de traslación en CNNS" . En Gerber, Aurona (ed.). Investigación en inteligencia artificial . Communications in Computer and Information Science. Vol. 1342. Cham: Springer International Publishing. pp. 282–295 . arXiv : 2104.05997 . doi : 10.1007/978-3-030-66151-9_18 . ISBN   978-3-030-66151-9. S2CID 233219976 . Archivado del original el 22-01-2022 . Recuperado el 26-03-2021 . 
  90. Richard, Zhang (25 de abril de 2019). Haciendo que las redes neuronales convolucionales sean nuevamente invariantes a los cambios . OCLC 1106340711 . 
  91. Jadeberg, Max; Simonyan, Karen; Zisserman, Andrew; Kavukcuoglu, Koray (2015). "Redes de transformadores espaciales" (PDF) . Avances en sistemas de procesamiento de información neuronal . 28. Archivado (PDF) del original el 25 de julio de 2021. Recuperado el 26 de marzo de 2021 a través de NIPS.
  92. Sabour, Sara; Frosst, Nicholas; Hinton, Geoffrey E. (2017-10-26). Enrutamiento dinámico entre cápsulas . OCLC 1106278545 . 
  93. Matiz, Sergio; Barner, Kenneth E. (2019-06-01). "Predictor conforme inductivo para redes neuronales convolucionales: aplicaciones al aprendizaje activo para la clasificación de imágenes" . Pattern Recognition . 90 : 172–182 . Bibcode : 2019PatRe..90..172M . doi : 10.1016/j.patcog.2019.01.035 . ISSN 0031-3203 . S2CID 127253432. Archivado del original el 29-09-2021 . Recuperado el 29-09-2021 .  
  94. Wieslander, Håkan; Harrison, Philip J.; Skogberg, Gabriel; Jackson, Sonya; Fridén, Markus; Karlsson, Johan; Spjuth, Ola; Wählby, Carolina (febrero de 2021). "Aprendizaje profundo con predicción conforme para el análisis jerárquico de imágenes de tejido de diapositivas completas a gran escala" . IEEE Journal of Biomedical and Health Informatics . 25 (2): 371– 380. Bibcode : 2021IJBHI..25..371W . doi : 10.1109/JBHI.2020.2996300 . ISSN 2168-2208 . PMID 32750907. S2CID 219885788 .   
  95. Srivastava, Nitish; C. Geoffrey Hinton; Alex Krizhevsky; Ilya Sutskever; Ruslan Salakhutdinov (2014). "Dropout: una forma sencilla de evitar el sobreajuste en redes neuronales" (PDF) . Journal of Machine Learning Research . 15 (1): 1929–1958 . Archivado (PDF) del original el 19 de enero de 2016. Recuperado el 3 de enero de 2015 .
  96. "Regularización de redes neuronales mediante DropConnect | ICML 2013 | JMLR W&CP" . jmlr.org : 1058–1066 . 13 de febrero de 2013. Archivado del original el 12 de agosto de 2017. Consultado el 17 de diciembre de 2015 .
  97. Zeiler, Matthew D.; Fergus, Rob (2013-01-15). "Agrupación estocástica para la regularización de redes neuronales convolucionales profundas". arXiv : 1301.3557 [ cs.LG ].
  98. 1 2 Platt, John; Steinkraus, Dave; Simard, Patrice Y. (agosto de 2003). "Mejores prácticas para redes neuronales convolucionales aplicadas al análisis visual de documentos – Microsoft Research" . Microsoft Research . Archivado del original el 7 de noviembre de 2017. Recuperado el 17 de diciembre de 2015 .
  99. Hinton, Geoffrey E.; Srivastava, Nitish; Krizhevsky, Alex; Sutskever, Ilya; Salakhutdinov, Ruslan R. (2012). "Mejora de las redes neuronales mediante la prevención de la coadaptación de los detectores de características". arXiv : 1207.0580 [ cs.NE ].
  100. "Dropout: una forma sencilla de evitar el sobreajuste en redes neuronales" . jmlr.org . Archivado del original el 5 de marzo de 2016. Consultado el 17 de diciembre de 2015 .
  101. Hinton, Geoffrey (1979). "Algunas demostraciones de los efectos de las descripciones estructurales en la imaginería mental" . Cognitive Science . 3 (3): 231– 250. doi : 10.1016/s0364-0213(79)80008-7 .
  102. Rock, Irvin. "El marco de referencia". El legado de Solomon Asch: Ensayos sobre cognición y psicología social (1990): 243–268.
  103. J. Hinton, Conferencias de Coursera sobre redes neuronales, 2012, URL: https://www.coursera.org/learn/neural-networks Archivado el 31/12/2016 en Wayback Machine
  104. Dave Gershgorn (18 de junio de 2018). "La historia interna de cómo la IA llegó a ser lo suficientemente buena como para dominar Silicon Valley" . Quartz . Archivado del original el 12 de diciembre de 2019. Consultado el 5 de octubre de 2018 .
  105. Lawrence, Steve; C. Lee Giles; Ah Chung Tsoi; Andrew D. Back (1997). "Reconocimiento facial: un enfoque de red neuronal convolucional". IEEE Transactions on Neural Networks . 8 (1): 98– 113. CiteSeerX 10.1.1.92.5813 . doi : 10.1109/72.554195 . PMID 18255614 . S2CID 2883848 .   
  106. Le Callet, Patrick; Christian Viard-Gaudin; Dominique Barba (2006). "Un enfoque de red neuronal convolucional para la evaluación objetiva de la calidad de vídeo" ( PDF) . IEEE Transactions on Neural Networks . 17 (5): 1316– 1327. Bibcode : 2006ITNN...17.1316L . doi : 10.1109/TNN.2006.879766 . PMID 17001990. S2CID 221185563. Archivado (PDF) del original el 24 de febrero de 2021. Recuperado el 17 de noviembre de 2013 .  
  107. "Concurso de reconocimiento visual a gran escala ImageNet 2014 (ILSVRC2014)" . Archivado del original el 5 de febrero de 2016. Consultado el 30 de enero de 2016 .
  108. Szegedy, Christian; Liu, Wei; Jia, Yangqing; Sermanet, Pierre; Reed, Scott E.; Anguelov, Dragomir; Erhan, Dumitru; Vanhoucke, Vincent; Rabinovich, Andrew (2015). "Going deeper with convolutions". Conferencia IEEE sobre Visión por Computadora y Reconocimiento de Patrones, CVPR 2015, Boston, MA, EE. UU., 7-12 de junio de 2015. IEEE Computer Society. págs. 1-9 . arXiv : 1409.4842 . doi : 10.1109/CVPR.2015.7298594 . ISBN  978-1-4673-6964-0.
  109. Rusakovsky, Olga ; Deng, Jia; Su, Hao; Krause, Jonathan; Satheesh, Sanjeev; Mamá, Sean; Huang, Zhiheng; Karpathy, Andrej ; Khosla, Aditya; Bernstein, Michael; Berg, Alejandro C.; Fei-Fei, Li (2014). " Desafío de reconocimiento visual a gran escala de Image Net ". arXiv : 1409.0575 [ cs.CV ].
  110. "El algoritmo de detección de rostros revolucionará la búsqueda de imágenes" . Technology Review . 16 de febrero de 2015. Archivado del original el 20 de septiembre de 2020. Consultado el 27 de octubre de 2017 .
  111. Baccouche, Moez; Mamalet, Franck; Wolf, Christian; Garcia, Christophe; Baskurt, Atilla (16 de noviembre de 2011). «Aprendizaje profundo secuencial para el reconocimiento de acciones humanas». En Salah, Albert Ali; Lepri, Bruno (eds.). Comprensión del comportamiento humano . Lecture Notes in Computer Science. Vol. 7065. Springer Berlin Heidelberg. pp. 29–39 . CiteSeerX 10.1.1.385.4740 . doi : 10.1007/978-3-642-25446-8_4 . ISBN    978-3-642-25445-1.
  112. Ji, Shuiwang; Xu, Wei; Yang, Ming; Yu, Kai (2013-01-01). "Redes neuronales convolucionales 3D para el reconocimiento de acciones humanas". IEEE Transactions on Pattern Analysis and Machine Intelligence . 35 (1): 221– 231. Bibcode : 2013ITPAM..35..221J . CiteSeerX 10.1.1.169.4046 . doi : 10.1109/TPAMI.2012.59 . ISSN 0162-8828 . PMID 22392705 . S2CID 1923924 .    
  113. ^ Huang, Jie; Zhou, Wengang; Zhang, Qilin; Li, Houqiang; Li, Weiping (2018). "Reconocimiento de lengua de signos basado en vídeo sin segmentación temporal". arXiv : 1801.10111 [ cs.CV ].
  114. Karpathy, Andrej, et al. " Clasificación de vídeo a gran escala con redes neuronales convolucionales. Archivado el 6 de agosto de 2019 en Wayback Machine ". Conferencia IEEE sobre Visión por Computadora y Reconocimiento de Patrones (CVPR). 2014.
  115. Simonyan, Karen; Zisserman, Andrew (2014). "Redes neuronales convolucionales de dos flujos para el reconocimiento de acciones en vídeos". arXiv : 1406.2199 [ cs.CV ].(2014).
  116. Wang, Le; Duan, Xuhuan; Zhang, Qilin; Niu, Zhenxing; Hua, Gang; Zheng, Nanning (2018-05-22). "Segment-Tube: Localización de acciones espaciotemporales en vídeos sin recortar con segmentación por fotograma" (PDF) . Sensors . 18 (5): 1657. Bibcode : 2018Senso..18.1657W . doi : 10.3390/s18051657 . ISSN 1424-8220 . PMC 5982167. PMID 29789447. Archivado (PDF) del original el 1 de marzo de 2021. Recuperado el 14 de septiembre de 2018 .   
  117. ^ Duan, Xuhuan; Wang, Le; Zhai, Changbo; Zheng, Nanning; Zhang, Qilin; Niu, Zhenxing; Hua, pandilla (2018). "Localización conjunta de acciones espacio-temporales en vídeos sin recortar con segmentación por fotograma". 2018 25a Conferencia Internacional IEEE sobre Procesamiento de Imágenes (ICIP) . 25ª Conferencia Internacional IEEE sobre Procesamiento de Imágenes (ICIP). págs. 918– 922. doi : 10.1109/icip.2018.8451692 . ISBN  978-1-4799-7061-2.
  118. Taylor, Graham W.; Fergus, Rob; LeCun, Yann; Bregler, Christoph (1 de enero de 2010). Aprendizaje convolucional de características espaciotemporales . Actas de la 11.ª Conferencia Europea sobre Visión por Computadora: Parte VI. ECCV'10. Berlín, Heidelberg: Springer-Verlag. págs. 140–153 . ISBN  978-3-642-15566-6Archivado del original el 31/03/2022 . Consultado el 31/03/2022 .
  119. Le, QV; Zou, WY; Yeung, SY; Ng, AY (2011-01-01). "Aprendizaje de características espaciotemporales invariantes jerárquicas para el reconocimiento de acciones con análisis de subespacios independientes" (PDF) . CVPR 2011. CVPR '11. Washington, DC, EE . UU.: IEEE Computer Society. pp. 3361–3368 . CiteSeerX 10.1.1.294.5948 . doi : 10.1109/CVPR.2011.5995496 . ISBN   978-1-4577-0394-2. S2CID 6006618 . 
  120. Grefenstette, Edward; Blunsom, Phil; de Freitas, Nando; Hermann, Karl Moritz (2014-04-29). "Una arquitectura profunda para el análisis semántico". arXiv : 1404.7296 [ cs.CL ].
  121. Mesnil, Gregoire; Deng, Li; Gao, Jianfeng; He, Xiaodong; Shen, Yelong (abril de 2014). "Aprendizaje de representaciones semánticas mediante redes neuronales convolucionales para la búsqueda web – Microsoft Research" . Microsoft Research . Archivado del original el 15 de septiembre de 2017. Consultado el 17 de diciembre de 2015 .
  122. Kalchbrenner, Nal; Grefenstette, Edward; Blunsom, Phil (2014-04-08). "Una red neuronal convolucional para modelar oraciones". arXiv : 1404.2188 [ cs.CL ].
  123. Kim, Yoon (2014-08-25). "Redes neuronales convolucionales para la clasificación de oraciones". arXiv : 1408.5882 [ cs.CL ].
  124. Collobert, Ronan y Jason Weston. " Una arquitectura unificada para el procesamiento del lenguaje natural: redes neuronales profundas con aprendizaje multitarea. Archivado el 4 de septiembre de 2019 en Wayback Machine ". Actas de la 25.ª conferencia internacional sobre aprendizaje automático. ACM, 2008.
  125. Collobert, Ronan; Weston, Jason; Bottou, Leon; Karlen, Michael; Kavukcuoglu, Koray; Kuksa, Pavel (2011-03-02). "Procesamiento del lenguaje natural (casi) desde cero". arXiv : 1103.0398 [ cs.LG ].
  126. Yin, W; Kann, K; Yu, M; Schütze, H (2017-03-02). "Estudio comparativo de CNN y RNN para el procesamiento del lenguaje natural". arXiv : 1702.01923 [ cs.LG ].
  127. Bai, S.; Kolter, JS; Koltun, V. (2018). "Una evaluación empírica de redes convolucionales y recurrentes genéricas para el modelado de secuencias". arXiv : 1803.01271 [ cs.LG ].
  128. Gruber, N. (2021). "Detección de la dinámica de la acción en texto con una red neuronal recurrente". Neural Computing and Applications . 33 (12): 15709– 15718. doi : 10.1007/S00521-021-06190-5 . S2CID 236307579 . 
  129. Haotian, J.; Zhong, Li; Qianxiao, Li (2021). "Teoría de aproximación de arquitecturas convolucionales para el modelado de series temporales". Conferencia internacional sobre aprendizaje automático . arXiv : 2107.09355 .
  130. Bohnslav, James P; Wimalasena, Nivanthika K; Clausing, Kelsey J; Dai, Yu Y; Yarmolinsky, David A; Cruz, Tomás; Kashlan, Adam D; Chiappe, M Eugenia; Orefice, Lauren L; Woolf, Clifford J; Harvey, Christopher D (2021-09-02). "DeepEthogram, una canalización de aprendizaje automático para la clasificación supervisada del comportamiento a partir de píxeles sin procesar" . eLife . 10 e63377. doi : 10.7554/eLife.63377 . ISSN 2050-084X . PMC 8455138. PMID 34473051 .   
  131. 1 2 Gernat, Tim; Jagla, Tobias; Jones, Beryl M.; Middendorf, Martin; Robinson, Gene E. (2023-01-27). "El monitoreo automatizado de abejas melíferas con códigos de barras e inteligencia artificial revela dos redes sociales distintas a partir de un único comportamiento afiliativo" . Scientific Reports . 13 (1) 1541. Bibcode : 2023NatSR..13.1541G . doi : 10.1038/ s41598-022-26825-4 . ISSN 2045-2322 . PMC 9883485. PMID 36707534 .   
  132. Norouzzadeh, Mohammad Sadegh; Nguyen, Anh; Kosmala, Margaret; Swanson, Alexandra; Palmer, Meredith S.; Packer, Craig; Clune, Jeff (2018-06-19). "Identificación, conteo y descripción automática de animales salvajes en imágenes de cámaras trampa con aprendizaje profundo" . Actas de la Academia Nacional de Ciencias . 115 (25): E5716– E5725. Bibcode : 2018PNAS..115E5716N . doi : 10.1073/pnas.1719367115 . ISSN 0027-8424 . PMC 6016780. PMID 29871948 .   
  133. ^ Svenning, Asger; Mougeot, Guillaume; Alison, Jamie; Caballero, Dafne; Molina, Nisa Luise Chávez; Ong, Song-Quan; Bjerge, Kim; Carrillo, Julio; Hoeye, Toke Thomas (14 de abril de 2025). "Un método general para la detección y segmentación de artrópodos terrestres en imágenes". bioRxiv 10.1101/2025.04.08.647223 . 
  134. Torrents, Jordi; Costa, Tiago; De Polavieja, Gonzalo G. (2025-06-02). "Nuevo idtracker.ai: repensando el seguimiento de múltiples animales como un problema de aprendizaje de representación para aumentar la precisión y reducir los tiempos de seguimiento". bioRxiv 10.1101/2025.05.30.657023 . 
  135. Mathis, Alexander; Mamidanna, Pranav; Cury, Kevin M.; Abe, Taiga; Murthy, Venkatesh N.; Mathis, Mackenzie Weygandt; Bethge, Matthias (septiembre de 2018). "DeepLabCut: estimación de pose sin marcadores de partes del cuerpo definidas por el usuario con aprendizaje profundo" . Nature Neuroscience . 21 (9): 1281– 1289. doi : 10.1038/s41593-018-0209-y . ISSN 1097-6256 . PMID 30127430 .  
  136. Graving, Jacob M; Chae, Daniel; Naik, Hemal; Li, Liang; Koger, Benjamin; Costelloe, Blair R; Couzin, Iain D (2019-10-01). "DeepPoseKit, un conjunto de herramientas de software para la estimación rápida y robusta de la postura animal mediante aprendizaje profundo" . eLife . 8 e47994 . Bibcode : 2019eLife...847994G . doi : 10.7554/eLife.47994 . ISSN 2050-084X . PMC 6897514. PMID 31570119 .   
  137. ^ Pereira, Talmo D.; Tabris, Natanael; Matsliah, Arie; Turner, David M.; Li, Junyu; Ravindranath, Shruthi; Papadoyannis, Eleni S.; Normanda, Edna; Deutsch, David S.; Wang, Z. Yan; McKenzie-Smith, Grace C.; Mitelut, Catalín C.; Castro, Marielisa Díez; D'Uva, John; Kislin, Mikhail (mayo de 2022). "Corrección del editor: SLEAP: un sistema de aprendizaje profundo para el seguimiento de poses de varios animales" . Métodos de la naturaleza . 19 (5): 628. doi : 10.1038/s41592-022-01495-2 . ISSN 1548-7091 . PMC 9119847 . PMID 35468969 .   
  138. 1 2 Arac, Ahmet; Zhao, Pingping; Dobkin, Bruce H.; Carmichael, S. Thomas; Golshani, Peyman (2019-05-07). " DeepBehavior: una caja de herramientas de aprendizaje profundo para el análisis automatizado de datos de imágenes de comportamiento animal y humano" . Frontiers in Systems Neuroscience . 13 20. doi : 10.3389/fnsys.2019.00020 . ISSN 1662-5137 . PMC 6513883. PMID 31133826 .   
  139. ^ Ren, Hansheng; Xu, Bixiong; Wang, Yujing; Yi, Chao; Huang, Congrui; Kou, Xiaoyu; Xing, Tony; Yang, Mao; Tong, Jie; Zhang, Qi (2019). Servicio de detección de anomalías de series temporales en Microsoft | Actas de la 25ª Conferencia Internacional ACM SIGKDD sobre Descubrimiento de Conocimiento y Minería de Datos . arXiv : 1906.03821 . doi : 10.1145/3292500.3330680 . S2CID 182952311 . 
  140. Wallach, Izhar; Dzamba, Michael; Heifets, Abraham (2015-10-09). "AtomNet: una red neuronal convolucional profunda para la predicción de bioactividad en el descubrimiento de fármacos basado en la estructura". arXiv : 1510.02855 [ cs.LG ].
  141. Yosinski, Jason; Clune, Jeff; Nguyen, Anh; Fuchs, Thomas; Lipson, Hod (2015-06-22). "Understanding Neural Networks Through Deep Visualization". arXiv : 1506.06579 [ cs.CV ].
  142. "Una startup de Toronto tiene una forma más rápida de descubrir medicamentos eficaces" . The Globe and Mail . Archivado del original el 20 de octubre de 2015. Consultado el 9 de noviembre de 2015 .
  143. "Empresa emergente utiliza supercomputadoras para buscar curas" . KQED Future of You . 27 de mayo de 2015. Archivado del original el 6 de diciembre de 2018. Consultado el 9 de noviembre de 2015 .
  144. Chellapilla, K; Fogel, DB (1999). "Desarrollo de redes neuronales para jugar a las damas sin depender del conocimiento experto". IEEE Trans Neural Netw . 10 (6): 1382– 91. Bibcode : 1999ITNN...10.1382C . doi : 10.1109/72.809083 . PMID 18252639 . 
  145. Chellapilla, K.; Fogel, DB (2001). "Desarrollo de un programa experto para jugar a las damas sin utilizar la experiencia humana". IEEE Transactions on Evolutionary Computation . 5 (4): 422– 428. Bibcode : 2001ITEC....5..422C . doi : 10.1109/4235.942536 .
  146. Fogel, David (2001). Blondie24: Jugando al límite de la IA . San Francisco, CA: Morgan Kaufmann. ISBN 978-1-55860-783-5.
  147. Clark, Christopher; Storkey, Amos (2014). "Enseñando a las redes neuronales convolucionales profundas a jugar al Go". arXiv : 1412.3409 [ cs.AI ].
  148. Maddison, Chris J.; Huang, Aja; Sutskever, Ilya; Silver, David (2014). "Evaluación de movimientos en Go mediante redes neuronales convolucionales profundas". arXiv : 1412.6564 [ cs.LG ].
  149. "AlphaGo – Google DeepMind" . Archivado del original el 30 de enero de 2016. Consultado el 30 de enero de 2016 .
  150. ^ Bai, Shaojie; Kolter, J. Zico; Koltun, Vladlen (19 de abril de 2018). "Una evaluación empírica de redes convolucionales y recurrentes genéricas para el modelado de secuencias". arXiv : 1803.01271 [ cs.LG ].
  151. Yu, Fisher; Koltun, Vladlen (2016-04-30). "Agregación de contexto multiescala mediante convoluciones dilatadas". arXiv : 1511.07122 [ cs.CV ].
  152. Borovykh, Anastasia; Bohte, Sander; Oosterlee, Cornelis W. (2018-09-17). "Pronóstico de series temporales condicionales con redes neuronales convolucionales". arXiv : 1703.04691 [ stat.ML ].
  153. Mittelman, Roni (2015-08-03). "Modelado de series temporales con redes neuronales totalmente convolucionales no diezmadas". arXiv : 1508.00317 [ stat.ML ].
  154. ^ Chen, Yitian; Kang, Yanfei; Chen, Yixiong; Wang, Zizhuo (11 de junio de 2019). "Predicción probabilística con red neuronal convolucional temporal". arXiv : 1906.04397 [ estad.ML ].
  155. Zhao, Bendong; Lu, Huanzhang; Chen, Shangfeng; Liu, Junliang; Wu, Dongya (2017-02-01). "Redes neuronales convolucionales para la clasificación de series temporales". Journal of Systems Engineering and Electronics . 28 (1): 162– 169. doi : 10.21629/JSEE.2017.01.18 .
  156. ^ Petneházi, Gábor (21 de agosto de 2019). "QCNN: red neuronal convolucional cuantil". arXiv : 1908.07978 [ cs.LG ].
  157. Hubert Mara (2019-06-07), HeiCuBeDa Hilprecht – Conjunto de datos de referencia cuneiforme de Heidelberg para la colección Hilprecht (en alemán), heiDATA – repositorio institucional de datos de investigación de la Universidad de Heidelberg, doi : 10.11588/data/IE8CCN
  158. Hubert Mara y Bartosz Bogacz (2019), «Descifrando el código en tablillas rotas: El desafío del aprendizaje para la escritura cuneiforme anotada en conjuntos de datos 2D y 3D normalizados», Actas de la 15.ª Conferencia Internacional sobre Análisis y Reconocimiento de Documentos (ICDAR) (en alemán), Sídney, Australia, pp. 148–153 , doi : 10.1109/ICDAR.2019.00032 , ISBN  978-1-7281-3014-9, S2CID 211026941 {{citation}}: CS1 mantenimiento: falta el editor de ubicación ( enlace )
  159. Bogacz, Bartosz; Mara, Hubert (2020), "Clasificación de periodos de tablillas cuneiformes 3D con redes neuronales geométricas", Actas de la 17.ª Conferencia Internacional sobre Fronteras del Reconocimiento de Escritura a Mano (ICFHR) , Dortmund, Alemania
  160. Presentación del artículo del ICFHR sobre la clasificación de periodos de tablillas cuneiformes 3D con redes neuronales geométricas en YouTube
  161. Durjoy Sen Maitra; Ujjwal Bhattacharya; SK Parui, "Enfoque común basado en CNN para el reconocimiento de caracteres manuscritos de múltiples escrituras" Archivado el 16 de octubre de 2023 en Wayback Machine , en Análisis y Reconocimiento de Documentos (ICDAR), 13.ª Conferencia Internacional de 2015, vol., n.º, págs. 1021-1025, 23-26 de agosto de 2015
  162. "NIPS 2017" . Simposio de ML interpretable . 2017-10-20. Archivado del original el 2019-09-07 . Consultado el 2018-09-12 .
  163. Zang, Jinliang; Wang, Le; Liu, Ziyi; Zhang, Qilin; Hua, Gang; Zheng, Nanning (2018). "Red neuronal convolucional ponderada temporalmente basada en la atención para el reconocimiento de acciones". Aplicaciones e innovaciones de la inteligencia artificial . Avances de IFIP en tecnología de la información y la comunicación. Vol. 519. Cham: Springer International Publishing. pp. 97–108 . arXiv : 1803.07179 . doi : 10.1007/978-3-319-92007-8_9 . ISBN   978-3-319-92006-1. ISSN 1868-4238 . S2CID 4058889 .  
  164. Wang, Le; Zang, Jinliang; Zhang, Qilin; Niu, Zhenxing; Hua, Gang; Zheng, Nanning (2018-06-21). " Reconocimiento de acciones mediante una red neuronal convolucional ponderada temporalmente con atención" ( PDF) . Sensors . 18 (7): 1979. Bibcode : 2018Senso..18.1979W . doi : 10.3390/s18071979 . ISSN 1424-8220 . PMC 6069475. PMID 29933555. Archivado (PDF) del original el 13 de septiembre de 2018. Recuperado el 14 de septiembre de 2018 .   
  165. Ong, Hao Yi; Chavez, Kevin; Hong, Augustus (2015-08-18). "Distributed Deep Q-Learning". arXiv : 1508.04186v2 [ cs.LG ].
  166. Mnih, Volodymyr; et al. (2015). "Control a nivel humano mediante aprendizaje profundo por refuerzo" . Nature . 518 ( 7540): 529– 533. Bibcode : 2015Natur.518..529M . doi : 10.1038/nature14236 . PMID 25719670. S2CID 205242740 .   
  167. Sun, R.; Sessions, C. (junio de 2000). "Autosegmentación de secuencias: formación automática de jerarquías de comportamientos secuenciales". IEEE Transactions on Systems, Man, and Cybernetics - Part B: Cybernetics . 30 (3): 403– 418. Bibcode : 2000ITSMB..30..403S . CiteSeerX 10.1.1.11.226 . doi : 10.1109/3477.846230 . ISSN 1083-4419 . PMID 18252373 .   
  168. "Redes neuronales profundas convolucionales en CIFAR-10" (PDF) . Archivado (PDF) del original el 30 de agosto de 2017. Consultado el 18 de agosto de 2017 .
  169. Lee, Honglak; Grosse, Roger; Ranganath, Rajesh; Ng, Andrew Y. (1 de enero de 2009). «Redes neuronales profundas convolucionales para el aprendizaje no supervisado escalable de representaciones jerárquicas». Actas de la 26.ª Conferencia Internacional Anual sobre Aprendizaje Automático . ACM. págs. 609–616 . CiteSeerX 10.1.1.149.6800 . doi : 10.1145/1553374.1553453 . ISBN   978-1-60558-516-1. S2CID 12008458 . 
  170. Behnke, Sven (2003). Redes neuronales jerárquicas para la interpretación de imágenes (PDF) . Lecture Notes in Computer Science. Vol. 2766. Springer. doi : 10.1007/b11963 . ISBN  978-3-540-40722-5. S2CID 1304548 . Archivado (PDF) del original el 10-08-2017 . Recuperado el 28-12-2016 . 
  171. Choi, Rene Y.; Coyner, Aaron S.; Kalpathy-Cramer, Jayashree; Chiang, Michael F.; Campbell, J. Peter (febrero de 2020). "Introducción al aprendizaje automático, las redes neuronales y el aprendizaje profundo" . Wired . Archivado del original el 13 de enero de 2018. Recuperado el 6 de marzo de 2017 .
  • CS231n: Redes neuronales convolucionales para el reconocimiento visual — Curso de informática de Andrej Karpathy en Stanford sobre CNN en visión artificial.
  • vdumoulin/conv_arithmetic: Un informe técnico sobre aritmética de convolución en el contexto del aprendizaje profundo . Animaciones de convoluciones.