Articulo de referencia

VGGNet

Arquitectura del módulo VGG en comparación con la arquitectura de AlexNet. Las VGGNets son una serie de redes neuronales convolucionales (CNN) desarrolladas por el Grupo de Geom...

Arquitectura del módulo VGG en comparación con la arquitectura de AlexNet.

Las VGGNets son una serie de redes neuronales convolucionales (CNN) desarrolladas por el Grupo de Geometría Visual (VGG) de la Universidad de Oxford .

La familia VGG incluye varias configuraciones con diferentes profundidades, indicadas por la letra "VGG" seguida del número de capas de peso. Las más comunes son VGG-16 (13 capas convolucionales + 3 capas totalmente conectadas, 138 millones de parámetros ) y VGG-19 (16 + 3, 144 millones de parámetros). [ 1 ]

La familia VGG se aplicó ampliamente en diversas áreas de visión por computadora. [ 2 ] Un modelo de conjunto de VGGNets logró resultados de vanguardia en el ImageNet Large Scale Visual Recognition Challenge (ILSVRC) en 2014. [ 1 ] [ 3 ] Se utilizó como comparación de referencia en el artículo ResNet para clasificación de imágenes , [ 4 ] como la red en la CNN basada en regiones rápidas para detección de objetos , y como una red base en transferencia de estilo neuronal . [ 5 ]

La serie fue históricamente importante como un modelo influyente inicial diseñado mediante la composición de módulos genéricos, mientras que AlexNet (2012) fue diseñado "desde cero". También fue fundamental para cambiar los núcleos convolucionales estándar en CNN de grandes (hasta 11x11 en AlexNet) a solo 3x3, una decisión que solo se revisó en ConvNext (2022). [ 6 ] [ 7 ]

Las VGGNets quedaron obsoletas con la llegada de Inception , ResNet y DenseNet . RepVGG (2021) es una versión actualizada de la arquitectura. [ 8 ]

Arquitectura

Arquitectura Network-in-Network comparada con la arquitectura VGG. La arquitectura Network-in-Network (2013) [ 9 ] fue una CNN anterior. Modificó la arquitectura AlexNet añadiendo convoluciones de 1x1 y utilizando un agrupamiento promedio global después de la última convolución.

El principio arquitectónico clave de los modelos VGG es el uso consistente de pequeños3×3{\displaystyle 3\times 3}filtros convolucionales en toda la red. Esto contrasta con las arquitecturas CNN anteriores que empleaban filtros más grandes, como11×11{\displaystyle 11\times 11}en AlexNet. [ 7 ]

Por ejemplo, dos3×3{\textstyle 3\times 3}Las convoluciones apiladas tienen los mismos píxeles de campo receptivo que una sola5×5{\textstyle 5\times 5}convolución, pero este último utiliza(25do2){\textstyle \left(25\cdot c^{2}\right)}parámetros, mientras que el primero utiliza(18do2){\textstyle \left(18\cdot c^{2}\right)}parámetros (dondedo{\displaystyle c}es el número de canales). La publicación original mostró que las CNN profundas y estrechas superan significativamente a sus contrapartes superficiales y anchas. [ 7 ]

La serie de modelos VGG son redes neuronales profundas compuestas por módulos genéricos:

  1. Módulos convolucionales :3×3{\displaystyle 3\times 3}capas convolucionales con paso 1, seguidas de activaciones ReLU.
  2. Capas de agrupación máxima : Después de algunos módulos convolucionales, capas de agrupación máxima con una2×2{\displaystyle 2\times 2}Se aplica un filtro con un paso de 2 para reducir la resolución de los mapas de características. Esto reduce a la mitad tanto el ancho como la altura, pero mantiene el número de canales.
  3. Capas totalmente conectadas : Tres capas totalmente conectadas al final de la red, con tamaños de 4096-4096-1000. La última tiene 1000 canales que corresponden a las 1000 clases de ImageNet.
  4. Capa Softmax : Una capa softmax genera la distribución de probabilidad sobre las clases.

La familia VGG incluye varias configuraciones con diferentes profundidades, indicadas por la letra "VGG" seguida del número de capas de peso. Las más comunes son VGG-16 (13 capas convolucionales + 3 capas totalmente conectadas) y VGG-19 (16 + 3), denominadas configuraciones D y E en el artículo original. [ 10 ]

Como ejemplo, las 16 capas convolucionales de VGG-19 están estructuradas de la siguiente manera:36464submuestreo64128128submuestreo128256256256256submuestreo256512512512512submuestreo512512512512512submuestreo{\displaystyle {\begin{aligned}&3\to 64\to 64&\xrightarrow {\text{downsample}} \\&64\to 128\to 128&\xrightarrow {\text{downsample}} \\&128\to 256\to 256\to 256\to 256&\xrightarrow {\text{downsample}} \\&256\to 512\to 512\to 512\to 512&\xrightarrow {\text{downsample}} \\&512\to 512\to 512\to 512\to 512&\xrightarrow {\text{downsample}} \end{aligned}}}donde la flechado1do2{\displaystyle c_{1}\to c_{2}}significa una convolución de 3x3 condo1{\displaystyle c_{1}}canales de entrada ydo2{\displaystyle c_{2}}canales de salida y paso 1, seguido de activación ReLU. Elsubmuestreo{\displaystyle \xrightarrow {\text{downsample}} }significa una capa de submuestreo mediante maxpooling 2x2 con paso 2.

Capacitación

Los modelos VGG originales se implementaron en una versión de C++ Caffe , modificada para entrenamiento y evaluación multi-GPU con paralelismo de datos . En un sistema equipado con 4 GPU NVIDIA Titan Black , el entrenamiento de una sola red tardó entre 2 y 3 semanas, dependiendo de la arquitectura. [ 1 ]

Referencias

  1. 1 2 3 Simonyan, Karen; Zisserman, Andrew (2015-04-10), Redes neuronales convolucionales muy profundas para el reconocimiento de imágenes a gran escala , arXiv : 1409.1556
  2. Dhillon, Anamika; Verma, Gyanendra K. (1 de junio de 2020). "Red neuronal convolucional: una revisión de modelos, metodologías y aplicaciones para la detección de objetos" . Progress in Artificial Intelligence . 9 (2): 85– 112. doi : 10.1007/s13748-019-00203-0 . ISSN 2192-6360 . 
  3. "Resultados de ILSVRC2014" . image-net.org . Consultado el 6 de septiembre de 2024 .
  4. He, Kaiming; Zhang, Xiangyu; Ren, Shaoqing; Sun, Jian (2016). "Aprendizaje residual profundo para el reconocimiento de imágenes" . Conferencia IEEE de 2016 sobre visión por computadora y reconocimiento de patrones (CVPR) . págs. 770–778 . arXiv : 1512.03385 . Bibcode : 2016cvpr.confE...1H . doi : 10.1109/CVPR.2016.90 . ISBN  978-1-4673-8851-1.
  5. Gatys, Leon A.; Ecker, Alexander S.; Bethge, Matthias (2016). Transferencia de estilo de imagen mediante redes neuronales convolucionales . Conferencia IEEE sobre visión por computadora y reconocimiento de patrones (CVPR). págs. 2414–2423 . 
  6. Liu, Zhuang; Mao, Hanzi; Wu, Chao-Yuan; Feichtenhofer, Christoph; Darrell, Trevor; Xie, Saining (2022). "Una red neuronal convolucional para la década de 2020" . Conferencia IEEE/CVF de 2022 sobre visión por computadora y reconocimiento de patrones (CVPR) . págs. 11976–11986 . arXiv : 2201.03545 . doi : 10.1109/CVPR52688.2022.01167 . ISBN  978-1-6654-6946-3.
  7. 1 2 3 Zhang, Aston; Lipton, Zachary; Li, Mu; Smola, Alexander J. (2024). "8.2. Redes que utilizan bloques (VGG)" . Sumérgete en el aprendizaje profundo . Cambridge Nueva York Puerto Melbourne Nueva Delhi Singapur: Cambridge University Press. ISBN 978-1-009-38943-3.
  8. Ding, Xiaohan; Zhang, Xiangyu; Ma, Ningning; Han, Jungong; Ding, Guiguang; Sun, Jian (2021). "RepVGG: Haciendo que las redes neuronales convolucionales al estilo VGG vuelvan a ser geniales" . Conferencia IEEE/CVF de 2021 sobre visión por computadora y reconocimiento de patrones (CVPR) . págs. 13733–13742 . arXiv : 2101.03697 . doi : 10.1109/CVPR46437.2021.01352 . ISBN  978-1-6654-4509-2.
  9. Lin, Min; Chen, Qiang; Yan, Shuicheng (2013). "Red en red". arXiv : 1312.4400 [ cs.NE ].
  10. "Very Deep Convolutional Networks for Large-Scale Visual Recognition". Computer Vision group from the University of Oxford. Retrieved 2024-09-06.
Retrieved from "https://en.wikipedia.org/w/index.php?title=VGGNet&oldid=1333146983"