Articulo de referencia

Redes neuronales convolucionales basadas en regiones

Arquitectura R-CNN Las redes neuronales convolucionales basadas en regiones (R-CNN) son una familia de modelos de aprendizaje automático para visión artificial , específicamente...

Arquitectura R-CNN

Las redes neuronales convolucionales basadas en regiones (R-CNN) son una familia de modelos de aprendizaje automático para visión artificial , específicamente para detección y localización de objetos . [ 1 ] El objetivo original de las R-CNN era tomar una imagen de entrada y producir un conjunto de cuadros delimitadores como salida, donde cada cuadro delimitador contiene un objeto y también la categoría (por ejemplo, automóvil o peatón) del objeto. En general, las arquitecturas R-CNN realizan una búsqueda selectiva [ 2 ] sobre los mapas de características generados por una CNN.

R-CNN se ha extendido para realizar otras tareas de visión artificial, como: seguimiento de objetos desde una cámara montada en un dron, [ 3 ] localización de texto en una imagen, [ 4 ] y habilitación de la detección de objetos en Google Lens . [ 5 ]

Mask R-CNN es también una de las siete tareas del MLPerf Training Benchmark, que es una competición para acelerar el entrenamiento de redes neuronales. [ 6 ]

Historia

A continuación se describen algunas de las versiones de R-CNN que se han desarrollado.

  • Noviembre de 2013: R-CNN . [ 7 ]
  • Abril de 2015: Fast R-CNN . [ 8 ]
  • Junio ​​de 2015: Faster R-CNN . [ 9 ]
  • Marzo de 2017: Mask R-CNN . [ 10 ]
  • Diciembre de 2017: Cascade R-CNN se entrena con umbrales crecientes de Intersección sobre Unión (IoU, también conocido como índice de Jaccard ), lo que hace que cada etapa sea más selectiva contra los falsos positivos cercanos. [ 11 ]
  • Junio ​​de 2019: Mesh R-CNN añade la capacidad de generar una malla 3D a partir de una imagen 2D. [ 12 ]

Arquitectura

Para artículos de revisión, véase. [ 1 ] [ 13 ]

Dada una imagen (o un mapa de características similar a una imagen), la búsqueda selectiva (también llamada agrupación jerárquica) primero segmenta la imagen mediante el algoritmo en (Felzenszwalb y Huttenlocher, 2004), [ 14 ] luego realiza lo siguiente: [ 2 ]

Entrada: Imagen (en color) Salida: Conjunto de hipótesis de ubicación del objeto L Segmentar la imagen en regiones iniciales R = {r 1 , ..., r n } utilizando Felzenszwalb y Huttenlocher (2004). Inicializar el conjunto de similitud S = ∅ para cada par de regiones vecinas (r i , r j ) hacer Calcular la similitud s(r i , r j ) S = S ∪ s(r i , r j ) mientras S ≠ ∅ hacer Obtener la mayor similitud s(r i , r j ) = max(S) Fusionar las regiones correspondientes r t = r i ∪ r j Eliminar las similitudes con respecto a r i : S = S \ s(r i , r∗) Eliminar similitudes con respecto a r j : S = S \ s(r∗, r j ) Calcular el conjunto de similitud S t entre r t y sus vecinos. S = S ∪ S t R = R ∪ r t Extraer cuadros de ubicación de objetos L de todas las regiones en R

R-CNN

Arquitectura R-CNN

Con R-CNN, la predicción sigue un proceso de dos pasos. Un paso de búsqueda selectiva de preprocesamiento genera un gran conjunto de objetos candidatos (normalmente hasta 2000), conocidos como regiones de interés (ROI). Estos se envían a una CNN , que predice una puntuación de clase de objeto y una estimación del cuadro delimitador, de forma independiente para cada ROI.

Es importante destacar que las regiones de interés (ROI) se filtran rigurosamente para eliminar los candidatos sobrantes. Esto se logra mediante dos mecanismos. El filtrado comienza eliminando las ROI asignadas a la categoría de fondo . Esta es una categoría especializada que la CNN evalúa junto con otras categorías.

Una realidad lamentable es que las ROI restantes suelen sufrir una gran duplicación. Es decir, a varias ROI que cubren los mismos objetos en la imagen se les asignan categorías distintas al fondo. Esto se resuelve mediante un paso de supresión no máxima heurística [ 15 ] ( NMS ).

Fast R-CNN

Fast R-CNN

Mientras que el R-CNN original calculaba de forma independiente las características de la red neuronal en cada una de las hasta dos mil regiones de interés, Fast R-CNN ejecuta la red neuronal una sola vez en toda la imagen. [ 8 ]

Agrupación de RoI a un tamaño de 2x2. En este ejemplo, la propuesta de región (un parámetro de entrada) tiene un tamaño de 7x5.

Al final de la red se encuentra un módulo de ROIPooling , que extrae cada ROI del tensor de salida de la red, lo remodela y lo clasifica. Al igual que en la R-CNN original, la Fast R-CNN utiliza una búsqueda selectiva para generar sus propuestas de región.

Faster R-CNN

Faster R-CNN

Mientras que Fast R-CNN utilizaba una búsqueda selectiva para generar ROI, Faster R-CNN integra la generación de ROI en la propia red neuronal. [ 9 ]

Máscara R-CNN

Máscara R-CNN

Mientras que las versiones anteriores de R-CNN se centraban en la detección de objetos, Mask R-CNN añade la segmentación de instancias. Mask R-CNN también sustituyó ROIPooling por un nuevo método llamado ROIAlign, que puede representar fracciones de un píxel. [ 10 ]

Referencias

  1. 1 2 Zhang, Aston; Lipton, Zachary; Li, Mu; Smola, Alexander J. (2024). "14.8. CNN basadas en regiones (R-CNN)" . Sumérgete en el aprendizaje profundo . Cambridge Nueva York Puerto Melbourne Nueva Delhi Singapur: Cambridge University Press. ISBN 978-1-009-38943-3.
  2. ^ Uijlings , JRR; van de Sande, KEA; Gevers, T.; Smeulders, AWM (1 de septiembre de 2013). «Búsqueda selectiva de reconocimiento de objetos» . Revista Internacional de Visión por Computadora . 104 (2): 154– 171. doi : 10.1007/s11263-013-0620-5 . ISSN 1573-1405 . 
  3. Nene, Vidi (2 de agosto de 2019). "Detección y seguimiento de múltiples objetos en tiempo real mediante dron basado en aprendizaje profundo" . Drone Below . Recuperado el 28 de marzo de 2020 .
  4. Ray, Tiernan (11 de septiembre de 2018). "Facebook potencia el reconocimiento de caracteres para extraer memes" . ZDNET . Consultado el 28 de marzo de 2020 .
  5. Sagar, Ram (9 de septiembre de 2019). "Estos métodos de aprendizaje automático hacen de Google Lens un éxito" . Analytics India . Recuperado el 28 de marzo de 2020 .
  6. Mattson, Peter; et al. (2019). "MLPerf Training Benchmark". arXiv : 1910.01500v3 [ math.LG ]. 
  7. Girshick, Ross; Donahue, Jeff; Darrell, Trevor; Malik, Jitendra (2016-01-01). "Redes neuronales convolucionales basadas en regiones para la detección y segmentación precisa de objetos". IEEE Transactions on Pattern Analysis and Machine Intelligence . 38 (1): 142– 158. Bibcode : 2016ITPAM..38..142G . doi : 10.1109/TPAMI.2015.2437384 . ISSN 0162-8828 . PMID 26656583 .  
  8. 1 2 Girshick, Ross (7–13 de diciembre de 2015). "Fast R-CNN". 2015 IEEE International Conference on Computer Vision (ICCV) . IEEE. pp. 1440–1448 . doi : 10.1109/ICCV.2015.169 . ISBN  978-1-4673-8391-2.
  9. 1 2 Ren, Shaoqing; He, Kaiming; Girshick, Ross; Sun, Jian (2017-06-01). "Faster R-CNN: Hacia la detección de objetos en tiempo real con redes de propuesta de regiones". IEEE Transactions on Pattern Analysis and Machine Intelligence . 39 (6): 1137– 1149. arXiv : 1506.01497 . Bibcode : 2017ITPAM..39.1137R . doi : 10.1109/TPAMI.2016.2577031 . ISSN 0162-8828 . PMID 27295650 .  
  10. 1 2 He, Kaiming; Gkioxari, Georgia; Dollar, Piotr; Girshick, Ross (octubre de 2017). "Mask R-CNN". 2017 IEEE International Conference on Computer Vision (ICCV) . IEEE. págs. 2980–2988 . doi : 10.1109/ICCV.2017.322 . ISBN  978-1-5386-1032-9.
  11. Cai, Zhaowei; Vasconcelos, Nuno (2017). "Cascade R-CNN: Profundizando en la detección de objetos de alta calidad". arXiv : 1712.00726 [ cs.CV ].
  12. Gkioxari, Georgia; Malik, Jitendra; Johnson, Justin (2019). "Mesh R-CNN". arXiv : 1906.02739 [ cs.CV ].
  13. Weng, Lilian (31 de diciembre de 2017). "Detección de objetos para principiantes, parte 3: Familia R-CNN" . Lil'Log . Consultado el 12 de marzo de 2020 .
  14. Felzenszwalb, Pedro F.; Huttenlocher, Daniel P. (2004-09-01). "Segmentación de imágenes eficiente basada en grafos" . International Journal of Computer Vision . 59 (2): 167– 181. doi : 10.1023/B:VISI.0000022288.19776.77 . ISSN 1573-1405 . 
  15. Neubeck, A.; Van Gool, L. (agosto de 2006). «Supresión no máxima eficiente». 18.ª Conferencia Internacional sobre Reconocimiento de Patrones (ICPR'06) . Vol. 3. págs. 850–855 . doi : 10.1109/ICPR.2006.479 . ISBN   0-7695-2521-0.

Lecturas adicionales

  • Parthasarathy, Dhruv (27 de abril de 2017). "Una breve historia de las CNN en la segmentación de imágenes: de R-CNN a Mask R-CNN" . Medium . Recuperado el 11 de septiembre de 2024 .