En las redes neuronales , una capa de agrupación es un tipo de capa de red que reduce el tamaño y agrega la información dispersa en muchos vectores, concentrándola en menos vectores. [ 1 ] Tiene varias aplicaciones. Elimina la información redundante, reduciendo así la cantidad de computación y memoria requeridas, lo que hace que el modelo sea más robusto ante pequeñas variaciones en la entrada; y aumenta el campo receptivo de las neuronas en las capas posteriores de la red.
Agrupación de redes neuronales convolucionales
El pooling se utiliza con mayor frecuencia en redes neuronales convolucionales (CNN). A continuación, se describe el pooling en CNN bidimensionales. La generalización a n dimensiones es inmediata.
Como notación, consideramos un tensor, dóndees altura,es ancho, yes el número de canales. Una capa de agrupación genera un tensor..
Definimos dos variablesdenominados "tamaño del filtro" (también conocido como "tamaño del kernel") y "paso". A veces, es necesario utilizar un tamaño de filtro y un paso diferentes para las direcciones horizontal y vertical. En tales casos, definimos 4 variables:.
El campo receptivo de una entrada en el tensor de salida,, son todas las entradas eneso puede afectar esa entrada.
Agrupación máxima

El Max Pooling (MaxPool) se utiliza comúnmente en las CNN para reducir las dimensiones espaciales de los mapas de características.
Definirdóndesignifica el rango. Tenga en cuenta que debemos evitar el error de desfase de uno . La siguiente entrada esy así sucesivamente. El campo receptivo dees, así que en general,Si el tamaño y los pasos del filtro horizontal y vertical difieren, entonces, en general,De forma más concisa, podemos escribir:.

Sino se puede expresar comodóndeSi es un número entero, para calcular las entradas del tensor de salida en los límites, el agrupamiento máximo intentaría tomar como entradas variables del tensor. En este caso, el manejo de esas variables inexistentes depende de las condiciones de relleno , como se ilustra a la derecha.
Global Max Pooling (GMP) es un tipo específico de max pooling donde el tensor de salida tiene formay el campo receptivo dees todo deEs decir, toma el valor máximo en cada canal completo. Se suele utilizar justo antes de las capas finales totalmente conectadas en el cabezal de clasificación de una CNN.
Agrupación promedio
La agrupación promedio (AvgPool) se define de manera similar.El agrupamiento promedio global (GAP) se define de forma similar al GMP. Se propuso por primera vez en redes dentro de redes. [ 2 ] Al igual que el GMP, se suele utilizar justo antes de las capas totalmente conectadas finales en una capa de clasificación CNN.
Interpolaciones
Existen algunas interpolaciones de max pooling y average pooling.
El agrupamiento mixto es una suma lineal del agrupamiento máximo y el agrupamiento promedio. [ 3 ] Es decir,dóndees un hiperparámetro, un parámetro que se puede aprender o se muestrea aleatoriamente de nuevo cada vez.
El agrupamiento Lp es similar al agrupamiento promedio, pero utiliza el promedio de la norma Lp en lugar del promedio:dóndees el tamaño del campo receptivo yes un hiperparámetro. Si todas las activaciones no son negativas, entonces el agrupamiento promedio es el caso dey el max pooling es el caso de. La agrupación de raíz cuadrada es el caso de. [ 4 ]
El agrupamiento estocástico muestrea una activación aleatoriadel campo receptivo con probabilidad. Es lo mismo que la agrupación promedio en términos de esperanza . [ 5 ]
El softmax pooling es como el max pooling, pero usa softmax , es decirdónde. El promedio de agrupamiento es el caso dey el max pooling es el caso de[ 4 ]
El agrupamiento basado en la importancia local generaliza el agrupamiento softmax mediantedóndees una función aprendible. [ 6 ]

Otras agrupaciones
El agrupamiento piramidal espacial aplica el agrupamiento máximo (o cualquier otra forma de agrupamiento) en una estructura piramidal . Es decir, aplica el agrupamiento máximo global, luego aplica el agrupamiento máximo a la imagen dividida en 4 partes iguales, luego en 16, etc. Los resultados se concatenan . Es una forma jerárquica de agrupamiento global y, al igual que este, se suele utilizar justo antes de un cabezal de clasificación. [ 7 ]
El agrupamiento de regiones de interés (también conocido como agrupamiento RoI) es una variante del agrupamiento máximo que se utiliza en las R-CNN para la detección de objetos . [ 8 ] Está diseñado para tomar una matriz de entrada de tamaño arbitrario y generar una matriz de salida de tamaño fijo.
La agrupación de covarianzas calcula la matriz de covarianza de los vectores.que luego se aplana hasta convertirse en unvector de -dimensionesLa agrupación de covarianza global se utiliza de forma similar a la agrupación máxima global. Dado que la agrupación promedio calcula el promedio, que es una estadística de primer grado , y la covarianza es una estadística de segundo grado, la agrupación de covarianza también se denomina "agrupación de segundo orden". Puede generalizarse a agrupaciones de orden superior. [ 9 ] [ 10 ]
Blur Pooling significa aplicar un método de desenfoque antes del submuestreo. Por ejemplo, el blur pooling Rect-2 significa tomar un promedio de pooling en, luego tomando cada segundo píxel (identidad con). [ 11 ]
Agrupación de transformadores de visión
En Vision Transformers (ViT), existen los siguientes tipos comunes de agrupaciones.
El agrupamiento tipo BERT utiliza un[CLS]token ficticio, "clasificación". Para la clasificación, la salida[CLS]es el token de clasificación, que luego es procesado por un módulo LayerNorm- feedforward-softmax para generar una distribución de probabilidad, que es la predicción de la red sobre la distribución de probabilidad de clase. Este es el método utilizado por el ViT original [ 12 ] y el Masked Autoencoder [ 13 ] .
El agrupamiento promedio global (GAP) no utiliza el token ficticio, sino que simplemente toma el promedio de todos los tokens de salida como token de clasificación. En el ViT original se mencionaba que era igualmente bueno. [ 12 ]
El agrupamiento de atención multicabeza (MAP) aplica un bloque de atención multicabeza al agrupamiento. Específicamente, toma como entrada una lista de vectores., que podrían considerarse como los vectores de salida de una capa de un ViT. Luego aplica una capa de alimentación directa.en cada vector, lo que da como resultado una matriz. Esto se envía luego a una atención de múltiples cabezas, lo que da como resultado, dóndees una matriz de parámetros entrenables. [ 14 ] Esto se propuso por primera vez en la arquitectura Set Transformer. [ 15 ]
Trabajos posteriores demostraron que tanto GAP como MAP funcionan mejor que el pooling tipo BERT. [ 14 ] [ 16 ]
Agrupación de redes neuronales gráficas
En las redes neuronales gráficas (GNN), también existen dos formas de agrupación: global y local. La agrupación global se puede reducir a una agrupación local donde el campo receptivo es la salida completa.
- Agrupación local : una capa de agrupación local reduce la resolución del grafo mediante submuestreo . La agrupación local se utiliza para aumentar el campo receptivo de una GNN, de forma similar a las capas de agrupación en las redes neuronales convolucionales . Ejemplos: agrupación de k vecinos más cercanos , agrupación de los k elementos principales [ 17 ] y agrupación de autoatención [ 18 ] .
- Agrupación global : una capa de agrupación global, también conocida como capa de lectura , proporciona una representación de tamaño fijo de todo el grafo. La capa de agrupación global debe ser invariante a las permutaciones, de modo que las permutaciones en el orden de los nodos y aristas del grafo no alteren la salida final. [ 19 ] Algunos ejemplos incluyen la suma elemento a elemento, la media o el máximo.
Las capas de agrupación local reducen el tamaño del grafo mediante submuestreo. Aquí presentamos varias estrategias de agrupación local aprendibles que se han propuesto. [ 19 ] Para cada caso, la entrada en el grafo inicial está representada por una matrizde las características de los nodos y la matriz de adyacencia del grafoEl resultado es la nueva matriz.de las características de los nodos y la nueva matriz de adyacencia del grafo.
Agrupación Top-k
Primero establecimos
dóndees un vector de proyección aprendible . El vector de proyecciónCalcula un valor de proyección escalar para cada nodo del gráfico.
La capa de agrupación top-k [ 17 ] se puede formalizar de la siguiente manera:
dóndees el subconjunto de nodos con las puntuaciones de proyección más altas (top-k),denota la multiplicación de matrices elemento a elemento , yes la función sigmoide . En otras palabras, los nodos con las puntuaciones de proyección más altas (top-k) se conservan en la nueva matriz de adyacencia.. ElLa operación hace que el vector de proyecciónentrenable mediante retropropagación , que de otro modo produciría salidas discretas. [ 17 ]
Agrupación de la autoatención
Primero establecimos
dóndees una capa GNN equivariante de permutación genérica (por ejemplo, GCN, GAT, MPNN).
La capa de agrupación de autoatención [ 18 ] se puede formalizar de la siguiente manera:
dóndees el subconjunto de nodos con las puntuaciones de proyección más altas (top-k),denota la multiplicación de matrices elemento a elemento .
La capa de agrupación de autoatención puede considerarse una extensión de la capa de agrupación top-k. A diferencia de la agrupación top-k, las puntuaciones de autoatención calculadas en la capa de agrupación de autoatención tienen en cuenta tanto las características del grafo como su topología.
Historia
A principios del siglo XX, los neuroanatomistas observaron un patrón en el que múltiples neuronas hacen sinapsis con la misma neurona. Esto se explicó funcionalmente como "agrupación local", lo que hace que la visión sea invariante a la traslación. Hartline aportó evidencia que respaldaba la teoría mediante experimentos electrofisiológicos en los campos receptivos de las células ganglionares de la retina. [ 20 ] Los experimentos de Hubel y Wiesel demostraron que el sistema visual en gatos es similar a una red neuronal convolucional, con algunas células sumando entradas de la capa inferior. [ 21 ] : Fig. 19, 20 Véase Westheimer para citas de esta literatura temprana. [ 22 ]
Durante la década de 1970, para explicar los efectos de la percepción de profundidad , algunos autores, como Julesz y Chang, propusieron que el sistema visual implementa un mecanismo selectivo de disparidad mediante agrupamiento global, donde las salidas de pares coincidentes de regiones retinianas en ambos ojos se agrupan en células de orden superior. [ 23 ] Véase Schumer y Ganz para citas de esta literatura temprana. [ 24 ]
En redes neuronales artificiales, el max pooling se utilizó en 1990 para el procesamiento del habla (convolución unidimensional), [ 25 ] y para el procesamiento de imágenes, se utilizó por primera vez en el Cresceptron de 1992. [ 26 ]
Véase también
Referencias
- ↑ Zhang, Aston; Lipton, Zachary; Li, Mu; Smola, Alexander J. (2024). "7.5. Agrupación" . Sumérgete en el aprendizaje profundo . Cambridge Nueva York Puerto Melbourne Nueva Delhi Singapur: Cambridge University Press. ISBN 978-1-009-38943-3.
- ↑ Lin, Min; Chen, Qiang; Yan, Shuicheng (2013). "Red en red". arXiv : 1312.4400 [ cs.NE ].
- ↑ Yu, Dingjun; Wang, Hanli; Chen, Peiqiu; Wei, Zhihua (2014). "Mixed Pooling for Convolutional Neural Networks" . En Miao, Duoqian; Pedrycz, Witold; Ślȩzak, Dominik; Peters, Georg; Hu, Qinghua; Wang, Ruizhi (eds.). Rough Sets and Knowledge Technology . Lecture Notes in Computer Science. Vol. 8818. Cham: Springer International Publishing. pp. 364–375 . doi : 10.1007/978-3-319-11740-9_34 . ISBN 978-3-319-11740-9.
- 1 2 Boureau, Y-Lan; Ponce, Jean; LeCun, Yann (21 de junio de 2010). "Análisis teórico de la agrupación de características en el reconocimiento visual" . Actas de la 27.ª Conferencia Internacional sobre Aprendizaje Automático . ICML'10. Madison, WI, EE. UU.: Omnipress: 111–118 . ISBN 978-1-60558-907-7.
- ↑ Zeiler, Matthew D.; Fergus, Rob (2013-01-15). "Agrupación estocástica para la regularización de redes neuronales convolucionales profundas". arXiv : 1301.3557 [ cs.LG ].
- ^ Gao, Ziteng; Wang, Limin; Wu, Gangshan (2019). "LIP: agrupación basada en importancia local" : 3355–3364 . arXiv : 1908.04156 .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - ↑ He, Kaiming; Zhang, Xiangyu; Ren, Shaoqing; Sun, Jian (2015-09-01). "Agrupación piramidal espacial en redes neuronales convolucionales profundas para el reconocimiento visual". IEEE Transactions on Pattern Analysis and Machine Intelligence . 37 (9): 1904– 1916. arXiv : 1406.4729 . Bibcode : 2015ITPAM..37.1904H . doi : 10.1109/TPAMI.2015.2389824 . ISSN 0162-8828 . PMID 26353135 .
- ↑ Zhang, Aston; Lipton, Zachary; Li, Mu; Smola, Alexander J. (2024). "14.8. Redes neuronales convolucionales basadas en regiones (R-CNN)" . Sumérgete en el aprendizaje profundo . Cambridge, Nueva York, Puerto Rico, Melbourne, Nueva Delhi, Singapur: Cambridge University Press. ISBN 978-1-009-38943-3.
- ↑ Tuzel, Oncel; Porikli, Fatih; Meer, Peter (2006). "Covarianza de región: un descriptor rápido para detección y clasificación" . En Leonardis, Aleš; Bischof, Horst; Pinz, Axel (eds.). Visión por computadora – ECCV 2006. Vol. 3952. Berlín, Heidelberg: Springer Berlin Heidelberg. pp. 589–600 . doi : 10.1007/11744047_45 . ISBN 978-3-540-33834-5. Consultado el 09-09-2024 .
- ↑ Wang, Qilong; Xie, Jiangtao; Zuo, Wangmeng; Zhang, Lei; Li, Peihua (2020). "Deep CNNs Meet Global Covariance Pooling: Better Representation and Generalization". IEEE Transactions on Pattern Analysis and Machine Intelligence . 43 (8): 2582– 2597. arXiv : 1904.06836 . doi : 10.1109/TPAMI.2020.2974833 . ISSN 0162-8828 . PMID 32086198 .
- ↑ Zhang, Richard (27-09-2018). "Haciendo que las redes convolucionales sean nuevamente invariantes a los cambios" . arXiv : 1904.11486 .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - 1 2 Dosovitskiy, Alexey; Beyer, Lucas; Kolesnikov, Alejandro; Weissenborn, Dirk; Zhai, Xiaohua; Unterthiner, Thomas; Dehghani, Mostafa; Minderer, Matías; Heigold, Georg; Gelly, Sylvain; Uszkoreit, Jakob (3 de junio de 2021). "Una imagen vale 16 x 16 palabras: transformadores para el reconocimiento de imágenes a escala". arXiv : 2010.11929 [ cs.CV ].
- ↑ He, Kaiming; Chen, Xinlei; Xie, Saining; Li, Yanghao; Dollar, Piotr; Girshick, Ross (junio de 2022). "Los autoencoders enmascarados son aprendices de visión escalables" . Conferencia IEEE/CVF de 2022 sobre visión por computadora y reconocimiento de patrones (CVPR) . IEEE. págs. 15979–15988 . arXiv : 2111.06377 . doi : 10.1109/cvpr52688.2022.01553 . ISBN 978-1-6654-6946-3.
- 1 2 Zhai, Xiaohua; Kolesnikov, Alexander; Houlsby, Neil; Beyer, Lucas (junio de 2022). "Scaling Vision Transformers" . Conferencia IEEE/CVF de 2022 sobre Visión por Computadora y Reconocimiento de Patrones (CVPR) . IEEE. págs. 1204–1213 . arXiv : 2106.04560 . doi : 10.1109 /cvpr52688.2022.01179 . ISBN 978-1-6654-6946-3.
- ↑ Lee, Juho; Lee, Yoonho; Kim, Jungtaek; Kosiorek, Adam; Choi, Seungjin; Teh, Yee Whye (2019-05-24). "Set Transformer: Un marco para redes neuronales invariantes a permutaciones basadas en atención" . Actas de la 36.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 3744–3753 . arXiv : 1810.00825 .
- ↑ Karamcheti, Siddharth; Nair, Suraj; Chen, Annie S.; Kollar, Thomas; Finn, Chelsea; Sadigh, Dorsa; Liang, Percy (2023-02-24). "Aprendizaje de representación impulsado por el lenguaje para robótica". arXiv : 2302.12766 [ cs.RO ].
- 1 2 3 Gao, Hongyang; Ji, Shuiwang Ji (2019). "Graficar U-Nets". arXiv : 1905.05178 [ a cs.LG a ].
- 1 2 Lee, Junhyun; Lee, Inyeop; Kang, Jaewoo (2019). "Agrupación de grafos con autoatención". arXiv : 1904.08082 [ cs.LG ].
- 1 2 Liu, Chuang; Zhan, Yibing; Li, Chang; Du, Bo; Wu, Jia; Hu, Wenbin; Liu, Tongliang; Tao, Dacheng (2022). "Agrupación de gráficos para redes neuronales de gráficos: avances, desafíos y oportunidades". arXiv : 2204.07321 [ cs.LG ].
- ↑ Hartline, HK (1940-09-30). "Los campos receptivos de las fibras del nervio óptico" . American Journal of Physiology. Legacy Content . 130 (4): 690– 699. doi : 10.1152/ajplegacy.1940.130.4.690 . ISSN 0002-9513 .
- ↑ Hubel, DH; Wiesel, TN (enero de 1962). "Campos receptivos, interacción binocular y arquitectura funcional en la corteza visual del gato" . The Journal of Physiology . 160 (1): 106–154.2. doi : 10.1113/jphysiol.1962.sp006837 . ISSN 0022-3751 . PMC 1359523. PMID 14449617 .
- ↑ Westheimer, G (diciembre de 1965). " Interacción espacial en la retina humana durante la visión escotópica" . The Journal of Physiology . 181 (4): 881– 894. doi : 10.1113/jphysiol.1965.sp007803 . ISSN 0022-3751 . PMC 1357689. PMID 5881260 .
- ↑ Julesz, Bela; Chang, Jih Jie (marzo de 1976). "Interacción entre grupos de detectores de disparidad binocular sintonizados a diferentes disparidades" . Cibernética Biológica . 22 (2): 107– 119. doi : 10.1007/BF00320135 . ISSN 0340-1200 . PMID 1276243 .
- ↑ Schumer, Robert; Ganz, Leo (1979-01-01). "Canales estereoscópicos independientes para diferentes grados de agrupación espacial" . Vision Research . 19 (12): 1303– 1314. doi : 10.1016/0042-6989(79)90202-5 . ISSN 0042-6989 . PMID 532098 .
- ↑ Yamaguchi, Kouichi; Sakamoto, Kenji; Akabane, Toshio; Fujimoto, Yoshiji (noviembre de 1990). Una red neuronal para el reconocimiento de palabras aisladas independiente del hablante . Primera Conferencia Internacional sobre Procesamiento del Lenguaje Hablado (ICSLP 90). Kobe, Japón. Archivado del original el 7 de marzo de 2021. Consultado el 4 de septiembre de 2019 .
- ↑ Weng, J.; Ahuja, N.; Huang, TS (1992). "Cresceptron: Una red neuronal autoorganizada que crece de forma adaptativa". [ Actas de 1992 ] IJCNN Conferencia Internacional Conjunta sobre Redes Neuronales . Vol. 1. IEEE. págs. 576–581 . doi : 10.1109/IJCNN.1992.287150 . ISBN 978-0-7803-0559-5.
- Arquitecturas de redes neuronales
- visión por computadora
- Neurociencia computacional