

y AlexNet (el tamaño de la imagen de AlexNet debería ser 227×227×3, en lugar de 224×224×3, para que los cálculos salgan bien. El artículo original decía números diferentes, pero Andrej Karpathy, exdirector de visión por computadora en Tesla, dijo que debería ser 227×227×3 (dijo que Alex no describió por qué puso 224×224×3). La siguiente convolución debería ser 11×11 con paso 4: 55×55×96 (en lugar de 54×54×96). Se calcularía, por ejemplo, como: [(ancho de entrada 227 - ancho del kernel 11) / paso 4] + 1 = [(227 - 11) / 4] + 1 = 55. Dado que la salida del kernel tiene la misma longitud que el ancho, Su área es 55×55.)

AlexNet es el nombre de una arquitectura de red neuronal convolucional (CNN), diseñada por Alex Krizhevsky en colaboración con Ilya Sutskever y Geoffrey Hinton , quien fue asesor de doctorado de Krizhevsky en la Universidad de Toronto. [1] [2]
Los tres formaron el equipo SuperVision [3] y presentaron AlexNet en el ImageNet Large Scale Visual Recognition Challenge el 30 de septiembre de 2012. [4] La red logró un error de 15,3 %, más de 10,8 puntos porcentuales por debajo del del segundo puesto. El resultado principal del artículo original fue que la profundidad del modelo era esencial para su alto rendimiento, que era costoso en términos computacionales, pero que se hacía factible debido a la utilización de unidades de procesamiento gráfico (GPU) durante el entrenamiento. [2]
Contexto histórico
AlexNet no fue la primera implementación rápida de una CNN en GPU que ganó un concurso de reconocimiento de imágenes. Una CNN en GPU de K. Chellapilla et al. (2006) fue 4 veces más rápida que una implementación equivalente en CPU. [5] Una CNN profunda de Dan Cireșan et al. (2011) en IDSIA fue 60 veces más rápida que una versión en CPU. [6] Entre el 15 de mayo de 2011 y el 10 de septiembre de 2012, su CNN ganó cuatro concursos de imágenes y logró la SOTA para múltiples bases de datos de imágenes . [7] [8] [9]
Según el artículo de AlexNet, [2] la red anterior de Cireșan es "algo similar". Ambas fueron escritas originalmente con CUDA para funcionar con soporte de GPU . De hecho, ambas son en realidad solo variantes de los diseños de CNN introducidos por Yann LeCun et al. (1989) [10] [11] quienes aplicaron el algoritmo de retropropagación a una variante de la arquitectura de CNN original de Kunihiko Fukushima llamada " neocognitron ". [12] [13] La arquitectura fue modificada posteriormente por el método de J. Weng llamado max-pooling . [14] [15]
El conjunto de entrenamiento tenía 1,2 millones de imágenes. Se entrenó durante 90 épocas, lo que llevó de cinco a seis días en dos GPU NVIDIA GTX 580 de 3 GB. [2]
En 2015, AlexNet fue superado por un proyecto de Microsoft Research Asia con más de 100 capas , que ganó el concurso ImageNet 2015. [16]
Diseño de red

AlexNet contiene ocho capas: las primeras cinco son capas convolucionales , algunas de ellas seguidas de capas de agrupamiento máximo , y las últimas tres son capas completamente conectadas. La red, excepto la última capa, se divide en dos copias, cada una de las cuales se ejecuta en una GPU. [2] La estructura completa se puede escribir como: donde
- CNN = capa convolucional (con activación ReLU)
- RN = normalización de respuesta local
- MP = agrupamiento máximo
- FC = capa completamente conectada (con activación ReLU)
- Lineal = capa completamente conectada (sin activación)
- DO = abandono escolar
Se utilizó la función de activación ReLU no saturante , que mostró un rendimiento de entrenamiento mejorado con respecto a tanh y sigmoid . [2]
Influencia
AlexNet se considera uno de los artículos más influyentes publicados en visión artificial, y ha impulsado la publicación de muchos más artículos que emplean CNN y GPU para acelerar el aprendizaje profundo . [17] A mediados de 2024, el artículo de AlexNet ha sido citado más de 157.000 veces según Google Scholar. [18]
Referencias
- ^ Gershgorn, Dave (26 de julio de 2017). "Los datos que transformaron la investigación en IA y, posiblemente, el mundo". Quartz .
- ^ abcdef Krizhevsky, Alex; Sutskever, Ilya; Hinton, Geoffrey E. (24 de mayo de 2017). "Clasificación ImageNet con redes neuronales convolucionales profundas" (PDF) . Comunicaciones de la ACM . 60 (6): 84–90. doi : 10.1145/3065386 . ISSN 0001-0782. S2CID 195908774.
- ^ Desafío de reconocimiento visual a gran escala 2012 (ILSVRC2012)
- ^ "Concurso de reconocimiento visual a gran escala ImageNet 2012 (ILSVRC2012)". image-net.org .
- ^ Kumar Chellapilla; Sidd Puri; Patrice Simard (2006). "Redes neuronales convolucionales de alto rendimiento para el procesamiento de documentos". En Lorette, Guy (ed.). Décimo taller internacional sobre fronteras en el reconocimiento de escritura a mano . Suvisoft.
- ^ Cireșan, Dan; Ueli Meier; Jonathan Masci; Luca M. Gambardella; Jurgen Schmidhuber (2011). "Redes neuronales convolucionales flexibles y de alto rendimiento para la clasificación de imágenes" (PDF) . Actas de la vigésimo segunda conferencia conjunta internacional sobre inteligencia artificial, volumen dos . 2 : 1237–1242 . Consultado el 17 de noviembre de 2013 .
- ^ "Tabla de resultados de la competición IJCNN 2011". COMPETICIÓN OFICIAL IJCNN2011 . 2010. Consultado el 14 de enero de 2019 .
- ^ Schmidhuber, Jürgen (17 de marzo de 2017). «Historia de los concursos de visión artificial ganados por las CNN profundas en la GPU» . Consultado el 14 de enero de 2019 .
- ^ Cireșan, Dan; Meier, Ueli; Schmidhuber, Jürgen (junio de 2012). "Redes neuronales profundas de múltiples columnas para la clasificación de imágenes". Conferencia IEEE de 2012 sobre visión artificial y reconocimiento de patrones . Nueva York, NY: Instituto de Ingenieros Eléctricos y Electrónicos (IEEE). págs. 3642–3649. arXiv : 1202.2745 . CiteSeerX 10.1.1.300.3283 . doi :10.1109/CVPR.2012.6248110. ISBN . 978-1-4673-1226-4. OCLC 812295155. S2CID 2161592.
- ^ LeCun, Y.; Boser, B.; Denker, JS; Henderson, D.; Howard, RE; Hubbard, W.; Jackel, LD (1989). "Retropropagación aplicada al reconocimiento de códigos postales escritos a mano" (PDF) . Neural Computation . 1 (4). MIT Press - Revistas: 541–551. doi :10.1162/neco.1989.1.4.541. ISSN 0899-7667. OCLC 364746139.
- ^ LeCun, Yann; Léon Bottou; Yoshua Bengio; Patrick Haffner (1998). "Gradient-based learning applied to document awareness" (PDF) . Actas del IEEE . 86 (11): 2278–2324. CiteSeerX 10.1.1.32.9552 . doi :10.1109/5.726791. S2CID 14542261 . Consultado el 7 de octubre de 2016 .
- ^ Fukushima, K. (2007). "Neocognitron". Scholarpedia . 2 (1): 1717. Código Bibliográfico :2007SchpJ...2.1717F. doi : 10.4249/scholarpedia.1717 .
- ^ Fukushima, Kunihiko (1980). "Neocognitron: A Self-organizing Neural Network Model for a Mechanism of Pattern Recognition Noffected by Shift in Position" (PDF) . Cibernética biológica . 36 (4): 193–202. doi :10.1007/BF00344251. PMID 7370364. S2CID 206775608 . Consultado el 16 de noviembre de 2013 .
- ^ Weng, J; Ahuja, N; Huang, TS (1993). "Aprendizaje del reconocimiento y segmentación de objetos 3-D a partir de imágenes 2-D". Proc. 4th International Conf. Computer Vision : 121–128.
- ^ Schmidhuber, Jürgen (2015). "Aprendizaje profundo". Scholarpedia . 10 (11): 1527–54. CiteSeerX 10.1.1.76.1541 . doi :10.1162/neco.2006.18.7.1527. PMID 16764513. S2CID 2309950.
- ^ He, Kaiming; Zhang, Xiangyu; Ren, Shaoqing; Sun, Jian (2016). "Aprendizaje residual profundo para reconocimiento de imágenes". Conferencia IEEE de 2016 sobre visión artificial y reconocimiento de patrones (CVPR) . págs. 770–778. arXiv : 1512.03385 . doi :10.1109/CVPR.2016.90. ISBN . 978-1-4673-8851-1.S2CID206594692 .
- ^ Deshpande, Adit. "Los 9 artículos sobre aprendizaje profundo que debes conocer (Comprensión de las CNN, parte 3)". adeshpande3.github.io . Consultado el 4 de diciembre de 2018 .
- ^ Artículo de AlexNet en Google Scholar