Articulo de referencia

Transformador de visión

Arquitectura del transformador de visión. Una imagen de entrada se divide en parches, cada uno de los cuales se mapea linealmente a través de una capa de incrustación de parches...

Arquitectura del transformador de visión. Una imagen de entrada se divide en parches, cada uno de los cuales se mapea linealmente a través de una capa de incrustación de parches, antes de entrar en un codificador Transformer estándar.

Un transformador de visión ( ViT ) es un transformador diseñado para la visión artificial . [ 1 ] Un ViT descompone una imagen de entrada en una serie de parches (en lugar de texto en tokens ), serializa cada parche en un vector y lo asigna a una dimensión menor con una sola multiplicación de matrices . Estas incrustaciones vectoriales son procesadas por un codificador de transformador como si fueran incrustaciones de tokens.

Las ViT se diseñaron como alternativas a las redes neuronales convolucionales (CNN) en aplicaciones de visión artificial. Presentan diferentes sesgos inductivos, estabilidad de entrenamiento y eficiencia de datos. [ 2 ] En comparación con las CNN, las ViT son menos eficientes en el uso de datos, pero tienen mayor capacidad. Algunos de los modelos de visión artificial modernos más grandes son ViT, como uno con 22 mil millones de parámetros. [ 3 ] [ 4 ]

Tras su publicación, se propusieron muchas variantes, con arquitecturas híbridas que combinan características de ViTs y CNNs. [ 5 ] Las ViTs han encontrado aplicación en el reconocimiento de imágenes , la segmentación de imágenes , la predicción meteorológica y la conducción autónoma . [ 6 ] [ 7 ]

Historia

Los Transformers se introdujeron en Attention Is All You Need (2017) [ 8 ] y se han utilizado ampliamente en el procesamiento del lenguaje natural . Un artículo de 2019 [ 9 ] aplicó ideas de Transformer a la visión artificial. Específicamente, partieron de una ResNet , una red neuronal convolucional estándar utilizada en visión artificial, y reemplazaron todos los núcleos convolucionales por el mecanismo de autoatención presente en un Transformer. Esto resultó en un rendimiento superior. Sin embargo, no se trata de un Vision Transformer.

En 2020, se adaptó un transformador de solo codificador para visión artificial, dando lugar al ViT, que alcanzó un estado del arte en clasificación de imágenes, superando el dominio previo de las CNN. [ 1 ] El autoencoder enmascarado (2022) extendió el ViT para trabajar con entrenamiento no supervisado. El transformador de visión y el autoencoder enmascarado, a su vez, impulsaron nuevos desarrollos en redes neuronales convolucionales. [ 10 ] [ 11 ]

Posteriormente, se produjo una fertilización cruzada entre el enfoque CNN anterior y el enfoque ViT.

En 2021, se propusieron algunas variantes importantes de Vision Transformers. Estas variantes están principalmente destinadas a ser más eficientes, más precisas o más adecuadas para un dominio específico. Dos estudios [ 12 ] [ 13 ] mejoraron la eficiencia y la robustez de ViT al agregar una CNN como preprocesador. El Swin Transformer [ 14 ] logró resultados de vanguardia en algunos conjuntos de datos de detección de objetos, como COCO , mediante el uso de ventanas deslizantes tipo convolución del mecanismo de atención y el proceso piramidal en la visión por computadora clásica.

Descripción general

Arquitectura Vision Transformer, mostrando los bloques Transformer que solo contienen el codificador en su interior.

La arquitectura básica, utilizada en el artículo original de 2020, [ 1 ] es la siguiente. En resumen, es un Transformer con solo codificador similar a BERT .

La imagen de entrada es de tipoRH×W×do{\displaystyle \mathbb {R} ^{H\times W\times C}}, dóndeH,W,do{\displaystyle H,W,C}son altura, anchura, canal ( RGB ). Luego se divide en parches de forma cuadrada de tipoRPAG×PAG×do{\displaystyle \mathbb {R} ^{P\times P\times C}}.

Para cada parche, se pasa a través de un operador lineal para obtener un vector ("incrustación de parche"). La posición del parche también se transforma en un vector mediante "codificación de posición" (el artículo probó sin incrustación, incrustación 1D, incrustación 2D e incrustación relativa: se adoptó 1D). [ a ] ​​[ 1 ] : §D.4 Los dos vectores se suman y luego se pasan a través de varios codificadores Transformer.

El mecanismo de atención en un transformador de imágenes transforma repetidamente los vectores de representación de los fragmentos de imagen, incorporando cada vez más relaciones semánticas entre ellos. Esto es análogo a cómo, en el procesamiento del lenguaje natural, a medida que los vectores de representación fluyen a través de un transformador, incorporan cada vez más relaciones semánticas entre las palabras, desde la sintaxis hasta la semántica.

La arquitectura descrita anteriormente convierte una imagen en una secuencia de representaciones vectoriales. Para utilizarlas en aplicaciones posteriores, es necesario entrenar un módulo adicional para interpretarlas.

Por ejemplo, para usarlo en clasificación, se puede agregar una MLP superficial que genere una distribución de probabilidad sobre las clases. El artículo original utiliza una red lineal- GeLU -softmax lineal. [ 1 ]

Variantes

ViT original

Animación de ViT. El token 0 es el especial <CLS>. Los otros 9 parches son proyectados por una capa lineal antes de ser introducidos en el codificador Transformer como tokens de entrada del 1 al 9.

El ViT original era un Transformer con solo un codificador, entrenado bajo supervisión para predecir la etiqueta de la imagen a partir de los parches de la misma. Al igual que en el caso de BERT , utiliza un token especial <CLS>en la entrada, y el vector de salida correspondiente se usa como única entrada del cabezal MLP de salida final. El token especial es una solución arquitectónica que permite al modelo comprimir toda la información relevante para predecir la etiqueta de la imagen en un solo vector. [ 1 ]

Los transformadores encontraron sus aplicaciones iniciales en tareas de procesamiento del lenguaje natural , como lo demuestran modelos de lenguaje como BERT y GPT-3 . Por el contrario, el sistema típico de procesamiento de imágenes utiliza una red neuronal convolucional (CNN). Algunos proyectos conocidos incluyen Xception, ResNet , EfficientNet , [ 15 ] DenseNet , [ 16 ] e Inception . [ 17 ]

Los transformadores miden las relaciones entre pares de tokens de entrada (palabras en el caso de cadenas de texto), denominadas atención . El costo es cuadrático en el número de tokens. Para las imágenes, la unidad básica de análisis es el píxel . Sin embargo, calcular las relaciones para cada par de píxeles en una imagen típica es prohibitivo en términos de memoria y computación. En cambio, ViT calcula las relaciones entre píxeles en varias secciones pequeñas de la imagen (por ejemplo, 16x16 píxeles), a un costo drásticamente reducido. Las secciones (con incrustaciones posicionales) se colocan en una secuencia. Las incrustaciones son vectores entrenables. Cada sección se organiza en una secuencia lineal y se multiplica por la matriz de incrustación. El resultado, con la incrustación de posición, se introduce en el transformador. [ 17 ]

Mejoras arquitectónicas

Agrupación

Tras procesar una imagen, ViT genera vectores de incrustación. Estos deben convertirse en una predicción de probabilidad de una sola clase mediante una red neuronal. En las versiones originales de ViT y Masked Autoencoder, se utilizaba un [CLS]token ficticio, emulando el modelo de lenguaje BERT . El resultado [CLS]es el token de clasificación, que posteriormente se procesa mediante un módulo LayerNorm -feedforward-softmax para obtener una distribución de probabilidad.

El agrupamiento promedio global (GAP) no utiliza el token ficticio, sino que simplemente toma el promedio de todos los tokens de salida como token de clasificación. En el ViT original se mencionaba que era igualmente bueno. [ 1 ]

El agrupamiento de atención multi-cabeza (MAP) aplica un bloque de atención multi-cabeza al agrupamiento. Específicamente, toma como entrada una lista de vectores.incógnita1,incógnita2,,incógnitanorte{\displaystyle x_{1},x_{2},\dots ,x_{n}}, que podrían considerarse como los vectores de salida de una capa de un ViT. La salida de MAP esMETROltihmiadmidAttminortetionorte(Q,V,V){\displaystyle \mathrm {Atención multicabezal} (Q,V,V)}, dóndeq{\displaystyle q}es un vector de consulta entrenable yV{\displaystyle V}es la matriz con filas siendoincógnita1,incógnita2,,incógnitanorte{\displaystyle x_{1},x_{2},\dots ,x_{n}}. [ 18 ] Esto se propuso por primera vez en la arquitectura Set Transformer . [ 19 ]

Trabajos posteriores demostraron que tanto GAP como MAP funcionan mejor que el pooling tipo BERT. [ 18 ] [ 20 ] Se propuso una variante de MAP como atención de clase , que aplica MAP, luego alimentación hacia adelante y luego MAP nuevamente. [ 21 ]

Se propuso la reatención para permitir el entrenamiento de ViT profundo. Cambia el módulo de atención multi-cabeza. [ 22 ]

Autoencoder enmascarado

Arquitectura de codificador automático enmascarado

El autoencoder enmascarado [ 23 ] se inspiró en los autoencoders de eliminación de ruido y los codificadores de contexto. [ 24 ] Tiene dos ViT colocados en serie. El primero ("codificador") recibe parches de imagen con codificación posicional y genera vectores que representan cada parche. El segundo (llamado "decodificador", aunque sigue siendo un Transformer solo codificador) recibe vectores con codificación posicional y genera nuevamente parches de imagen.

Capacitación

Durante el entrenamiento, las imágenes de entrada (224 px x 224 px en la implementación original) se dividen a lo largo de un número designado de líneas en cada eje, produciendo parches de imagen. [ 25 ] Se selecciona un cierto porcentaje de parches para ser enmascarados por tokens de máscara, mientras que todos los demás se conservan en la imagen. La red tiene la tarea de reconstruir la imagen a partir de los parches no enmascarados restantes. Los tokens de máscara en la implementación original son cantidades vectoriales aprendibles . [ 25 ] Luego se aplica una proyección lineal con incrustaciones posicionales al vector de parches no enmascarados. Los experimentos que varían la proporción de máscara en redes entrenadas en el conjunto de datos ImageNet-1K encontraron que las proporciones de máscara del 75 % [ 25 ] lograron un alto rendimiento tanto en el ajuste fino como en el sondeo lineal del espacio latente del codificador . El MAE procesa solo parches no enmascarados durante el entrenamiento, aumentando la eficiencia del procesamiento de datos en el codificador y reduciendo el uso de memoria del transformador . [ 25 ]

En la implementación original del MAE, se utiliza una ViT menos exigente computacionalmente para el decodificador. Los parches enmascarados se añaden a la salida del bloque codificador como tokens de máscara, y ambos se introducen en el decodificador. Se calcula una pérdida de reconstrucción para los parches enmascarados con el fin de evaluar el rendimiento de la red.

Predicción

En la fase de predicción, se descarta por completo la arquitectura del decodificador. La imagen de entrada se divide en parches mediante el mismo algoritmo que en el entrenamiento, pero sin enmascarar ningún parche. A cada parche se le aplica una proyección lineal con una incrustación posicional, y las representaciones vectoriales de incrustación resultantes de cada parche se envían al codificador.

Usos y derivados

Se han explorado varias variantes del MAE original. El MAE se ha aplicado para el preentrenamiento auto-supervisado en contextos médicos, incluyendo la interpretación de radiografías de tórax. [ 26 ] Las variantes del MAE se han aplicado en este contexto para mejorar su utilidad como preentrenamiento en entornos médicos.

MAE supervisado médicamente [ 27 ]
Medically Supervised MAE busca abordar la aplicación de las altas proporciones de máscara de MAE cuando se aplica a conjuntos de datos de lesiones médicas y utiliza un conjunto de entrenamiento supervisado para crear mapas de atención local para imágenes médicas con el fin de restringir qué parches se enmascaran. Medically Supervised MAE logró un rendimiento de vanguardia en enero de 2025 en la clasificación de lesiones médicas en los conjuntos de datos Messidor-2, BTMD, HAM10000, DeepLesion y ChestXRay2017 [ 28 ].
Matriz de coocurrencia de niveles de gris MAE (GLCM-MAE)
[ 29 ] GCLM-MAE utiliza GCLM para extraer información de textura de las imágenes con el fin de preservar dicha información. Aborda un problema en el que un MAE clásico suaviza excesivamente las imágenes, lo que provoca la pérdida de detalles granulares que pueden ser importantes en contextos médicos. GLCM-MAE logra un rendimiento de vanguardia en la identificación de cáncer de vesícula biliar, cáncer de mama mediante ecografía, neumonía mediante radiografías y COVID-19 mediante tomografía computarizada a julio de 2025.
MAE con reconocimiento de región, [ 30 ] R-MAE
R-MAE reemplaza el paso de generación de parches del MAE original con un algoritmo que asigna píxeles individuales a regiones de interés en una imagen, las cuales se enmascaran conjuntamente. La arquitectura de codificación de regiones es independiente, pero puede combinarse con el MAE para la reconstrucción de regiones.
MAEs siameses (SiamMAE) [ 31 ]
SiamMAE es una red neuronal diseñada para aplicar MAE a datos de vídeo. Toma muestras de dos fotogramas de un vídeo (en comparación con uno en el MAE original) y los etiqueta como "pasado" y "futuro". La red enmascara la mayoría de los parches (~95%) del fotograma futuro, deja el fotograma pasado intacto y procesa ambos mediante el bloque codificador de MAE. La arquitectura del decodificador se reemplaza con bloques de atención que mapean los parches del fotograma pasado al fotograma futuro para su reconstrucción. SiamMAE logra un rendimiento competitivo frente a modelos más grandes en segmentación y propagación de vídeo.

Una arquitectura similar fue BERT ViT (BEiT), publicada simultáneamente. [ 32 ]

DINOSAURIO

Al igual que el Masked Autoencoder, el método DINO ( autodestilación sin etiquetas ) es una forma de entrenar un ViT mediante autosupervisión . [ 33 ] DINO es una forma de autodestilación maestro-alumno . En DINO, el alumno es el propio modelo y el maestro es un promedio exponencial de los estados pasados ​​del alumno. El método es similar a trabajos anteriores como el contraste de momento [ 34 ] y el bootstrap your own latent (BYOL). [ 35 ]

La función de pérdida utilizada en DINO es la pérdida de entropía cruzada entre la salida de la red maestra (Fθt{\displaystyle f_{\theta '_{t}}}) y el resultado de la red de estudiantes (Fθt{\displaystyle f_{\theta _{t}}}). La red del profesor es un promedio que disminuye exponencialmente de los parámetros pasados ​​de la red del estudiante:θt=αθt+α(1α)θt1+{\displaystyle \theta '_{t}=\alpha \theta _{t}+\alpha (1-\alpha )\theta _{t-1}+\cdots }. Las entradas a las redes son dos recortes diferentes de la misma imagen, representados comoT(incógnita){\displaystyle T(x)}yT(incógnita){\displaystyle T'(x)}, dóndeincógnita{\displaystyle x}es la imagen original. La función de pérdida se escribe comoL(Fθt(T(incógnita)),Fθt(T(incógnita))){\displaystyle L(f_{\theta '_{t}}(T(x)),f_{\theta _{t}}(T'(x)))}Un problema es que la red puede "colapsar" al generar siempre el mismo valor (y{\displaystyle y}), independientemente de la entrada. Para evitar este colapso, DINO emplea dos estrategias:

  • Refinamiento : La salida de la red del profesor se refina mediante una función softmax con una temperatura más baja. Esto hace que el profesor tenga mayor confianza en sus predicciones, lo que obliga al estudiante a aprender representaciones más significativas para que coincidan con la salida refinada del profesor.
  • Centrado : La salida de la red neuronal del profesor se centra promediándola con sus salidas anteriores. Esto evita que el profesor se incline hacia algún valor de salida en particular, lo que anima al estudiante a aprender un conjunto más diverso de características.

En enero de 2024, Meta AI Research lanzó una versión actualizada llamada DINOv2 [ 36 ] con mejoras en la arquitectura, la función de pérdida y la técnica de optimización. Fue entrenada con un conjunto de datos más grande y diverso. Las características aprendidas por DINOv2 eran más transferibles , lo que significa que tenía un mejor rendimiento en tareas posteriores.

En agosto de 2025, Meta AI Research lanzó DINOv3, una actualización de DINOv2. Introdujo la alineación de imágenes y texto como CLIP . Amplió el modelo a 7 mil millones de parámetros y el conjunto de datos de entrenamiento a 1.7 mil millones de imágenes (obtenidas mediante muestreo de diversidad de un conjunto de datos inicial con 17 mil millones de imágenes). Arquitectónicamente, introdujo dos mejoras: anclaje de Gram y RoPE axial ( incrustaciones posicionales rotatorias ) con fluctuación. El anclaje de Gram aplica la autodestilación maestro-estudiante para la matriz de Gram entre los vectores de características de los parches de una imagen. Evita el problema observado anteriormente de degradación de mapas de características densos: mientras que el rendimiento en tareas globales (como la clasificación) continuaba mejorando, el rendimiento en tareas densas (como la segmentación) alcanzaba su punto máximo rápidamente y luego disminuía, con mapas de características que se volvían ruidosos. RoPE axial hace que el modelo sea más robusto a resoluciones, escalas y relaciones de aspecto variables de las imágenes. [ 37 ] [ 38 ]

Transformador Swin

El Swin Transformer (" S shifted windows ") [ 14 ] se inspiró en las CNN estándar:

  • En lugar de aplicar la autoatención a toda la secuencia de tokens, uno por cada parche, aplica una autoatención basada en ventanas desplazadas, lo que significa que solo aplica la atención a bloques de parches de forma cuadrada. Un bloque de parches es análogo al campo receptivo de una convolución.
  • Tras cada cierto número de bloques de atención, se aplica una capa de fusión que combina tokens vecinos de 2x2 en un único token. Esto es similar al agrupamiento (mediante núcleos de convolución de 2x2 con paso 2). La fusión consiste en la concatenación seguida de la multiplicación por una matriz.

Se mejora mediante Swin Transformer V2, [ 39 ] que modifica el ViT mediante un mecanismo de atención diferente [ 14 ] : Figura 1 :

  • LayerNorm inmediatamente después de cada capa de atención y de alimentación directa ("res-post-norm");
  • atención de coseno escalada para reemplazar la atención de producto escalar original;
  • sesgo de posición relativa continua espaciada logarítmicamente , que permite el aprendizaje por transferencia a través de diferentes resoluciones de ventana.

TimeSformer

El TimeSformer [ 40 ] fue diseñado para tareas de comprensión de video y aplicó una autoatención factorizada, similar a los núcleos de convolución factorizados que se encuentran en la arquitectura CNN Inception . [ 41 ] Esquematicamente, divide un video en fotogramas y cada fotograma en una cuadrícula cuadrada de parches (igual que ViT). Sea cada coordenada de parche denotada porincógnita,y,t{\displaystyle x,y,t}, que denota horizontal, vertical y tiempo.

  • Una capa de atención espacial es una capa de autoatención donde cada parche de consultaqincógnita,y,t{\displaystyle q_{x,y,t}}Se ocupa únicamente de los parches clave y de valor.kincógnita,y,t,vincógnita,y,t{\displaystyle k_{x',y',t'},v_{x',y',t'}}de tal manera quet=t{\displaystyle t=t'}.
  • Una capa de atención temporal es donde se requiereincógnita=incógnita,y=y{\displaystyle x'=x,y'=y}en cambio.

El TimeSformer también consideró otros diseños de capas de atención, como la "capa de atención de altura" donde el requisito esincógnita=incógnita,t=t{\displaystyle x'=x,t'=t}Sin embargo, descubrieron empíricamente que el mejor diseño intercala una capa de atención espacial y una capa de atención temporal.

ViT-VQGAN

En ViT-VQGAN , [ 42 ] hay dos codificadores ViT y un discriminador. Uno codifica parches de 8x8 de una imagen en una lista de vectores, uno para cada parche. Los vectores solo pueden provenir de un conjunto discreto de "libro de códigos", como en la cuantización vectorial . Otro codifica los vectores cuantizados de nuevo en parches de imagen. El objetivo del entrenamiento intenta que la imagen reconstruida (la imagen de salida) sea fiel a la imagen de entrada. El discriminador (generalmente una red convolucional, pero se permiten otras redes) intenta decidir si una imagen es una imagen real original o una imagen reconstruida por el ViT.

La idea es esencialmente la misma que la del autoencoder variacional cuantificado vectorial (VQVAE) más la red generativa antagónica (GAN).

Una vez entrenado un ViT-VQGAN, se puede utilizar para codificar una imagen arbitraria en una lista de símbolos y, a su vez, codificar una lista arbitraria de símbolos en una imagen. Esta lista de símbolos se puede utilizar para entrenar un transformador autorregresivo estándar (como GPT) y generar una imagen de forma autorregresiva. Además, se puede tomar una lista de pares imagen-texto, convertir las imágenes en cadenas de símbolos y entrenar un transformador estándar de estilo GPT. Luego, en la fase de prueba, basta con proporcionar un texto para la imagen y que esta se genere de forma autorregresiva. Esta es la estructura de Google Parti. [ 43 ]

Otros

Otros ejemplos incluyen el transformador visual, [ 44 ] CoAtNet, [ 45 ] CvT, [ 46 ] el ViT eficiente en datos (DeiT), [ 47 ] etc.

En la arquitectura Transformer in Transformer, cada capa aplica una capa Vision Transformer a cada incrustación de parche de imagen, vuelve a agregar los tokens resultantes a la incrustación y luego aplica otra capa Vision Transformer. [ 48 ]

Comparación con redes neuronales convolucionales (CNN)

Por lo general, ViT utiliza tamaños de parche mayores que los de los núcleos CNN estándar (de 3x3 a 7x7). ViT es más sensible a la elección del optimizador, los hiperparámetros y la profundidad de la red. El preprocesamiento con una capa de filtros convolucionales superpuestos de menor tamaño (paso < tamaño) ayuda a mejorar el rendimiento y la estabilidad. [ 13 ]

Este comportamiento diferente parece derivarse de los diferentes sesgos inductivos que poseen:

  • Las CNN aplican el mismo conjunto de filtros para procesar la imagen completa. Esto les permite ser más eficientes en el uso de datos y menos sensibles a las perturbaciones locales. [ 2 ]
  • ViT aplica autoatención, lo que les permite capturar fácilmente relaciones de largo alcance entre parches. [ 49 ] También requieren más datos para entrenar, pero pueden ingerir más datos de entrenamiento en comparación con CNN, que podría no mejorar después de entrenar en un conjunto de datos de entrenamiento suficientemente grande. ViT también parece ser más robusto a distorsiones de la imagen de entrada, como parches adversarios o permutaciones. [ 50 ]

Aplicaciones

Las ViT se han utilizado en muchas tareas de visión por computadora con excelentes resultados y en algunos casos incluso de vanguardia, como en clasificación de imágenes , detección de objetos , detección de deepfake de video , [ 51 ] segmentación de imágenes , [ 52 ] detección de anomalías , síntesis de imágenes , análisis de clústeres , conducción autónoma . [ 6 ] [ 7 ]

ViT se ha utilizado para la generación de imágenes como arquitectura base para GAN [ 53 ] y para modelos de difusión (transformador de difusión, o DiT). [ 54 ]

Se ha demostrado que DINO [ 33 ] aprende representaciones útiles para agrupar imágenes y explorar perfiles morfológicos en conjuntos de datos biológicos, como imágenes generadas con el ensayo Cell Painting . [ 55 ]

En 2024, se diseñó un modelo ViT de 113 mil millones de parámetros (el ViT más grande hasta la fecha) para la predicción del tiempo y el clima , y ​​se entrenó en la supercomputadora Frontier con un rendimiento de 1,6 exaFLOPs . [ 56 ]

Véase también

Notas

  1. Todos los incrustamientos posicionales en Dosovitskiy et al. (2021) obtuvieron mejores resultados que la ausencia de incrustamiento. No mostraron grandes diferencias entre sí, aunque el método 1D presentó una ligera ventaja en la puntuación.

Referencias

  1. 1 2 3 4 5 6 7 Dosovitskiy, Alexey; Beyer, Lucas; Kolesnikov, Alejandro; Weissenborn, Dirk; Zhai, Xiaohua; Unterthiner, Thomas; Dehghani, Mostafa; Minderer, Matías; Heigold, Georg; Gelly, Sylvain; Uszkoreit, Jakob (3 de junio de 2021). "Una imagen vale 16 x 16 palabras: transformadores para el reconocimiento de imágenes a escala". arXiv : 2010.11929 [ cs.CV ].
  2. 1 2 Raghu, Maithra; Unterthiner, Thomas; Kornblith, Simon; Zhang, Chiyuan; Dosovitskiy, Alexey (2021-08-19). "¿Los transformadores de visión ven como las redes neuronales convolucionales?". arXiv : 2108.08810 [ cs.CV ].
  3. ^ Dehghani, Mostafa; Djolonga, Josip; Mustafa, Albahaca; Padlewski, Piotr; Hola, Jonathan; Gilmer, Justin; Steiner, Andreas; Carón, Mathilde; Geirhos, Robert (10 de febrero de 2023), Escalado de transformadores de visión a 22 mil millones de parámetros , arXiv : 2302.05442
  4. "Escalando transformadores de visión a 22 mil millones de parámetros" . research.google . Consultado el 7 de agosto de 2024 .
  5. ^ Koresh, Ella; Bruto, Ronit D.; Meir, Yuval; Tzach, Yarden; Halevi, Tal; Kanter, Ido (2025). "El mecanismo de aprendizaje subyacente de los transformadores y las CNN unificadas revela un modus vivendi de atención de múltiples cabezas" . Physica A: Mecánica estadística y sus aplicaciones . 666 130529. arXiv : 2501.12900 . Código Bib : 2025PhyA..66630529K . doi : 10.1016/j.physa.2025.130529 . ISSN 0378-4371 . 
  6. 1 2 Han, Kai; Wang, Yunhe; Chen, Hanting; Chen, Xinghao; Guo, Jianyuan; Liu, Zhenhua; Tang, Yehui; Xiao, An; Xu, Chunjing; Xu, Yixing; Yang, Zhaohui; Zhang, Yiman; Tao, Dacheng (1 de enero de 2023). "Una encuesta sobre Vision Transformer". Transacciones IEEE sobre análisis de patrones e inteligencia artificial . 45 (1): 87– 110. arXiv : 2012.12556 . Código Bib : 2023ITPAM..45...87H . doi : 10.1109/TPAMI.2022.3152247 . ISSN 0162-8828 . PMID 35180075 .  
  7. 1 2 Khan, Salman; Naseer, Muzammal; Hayat, Munawar; Zamir, Syed Waqas; Khan, Fahad Shahbaz; Shah, Mubarak (13 de septiembre de 2022). "Transformadores en visión: una encuesta". Computación ACM. Sobrevivir . 54 (10s): 200:1–200:41. arXiv : 2101.01169 . doi : 10.1145/3505244 . ISSN 0360-0300 . 
  8. ^ Vaswani, Ashish ; Shazeer, Noam; Parmar, Niki; Uszkoreit, Jakob; Jones, León; Gómez, Aidan N ; Káiser, Łukasz; Polosukhin, Illia (2017). "La atención es todo lo que necesita" (PDF) . Avances en los sistemas de procesamiento de información neuronal . 30 . Curran asociados, Inc.
  9. Ramachandran, Prajit; Parmar, Niki; Vaswani, Ashish; Bello, Irwan; Levskaya, Anselm; Shlens, Jon (2019). "Autoatención independiente en modelos de visión" . Advances in Neural Information Processing Systems . 32. Curran Associates, Inc. arXiv : 1906.05909 .
  10. Liu, Zhuang; Mao, Hanzi; Wu, Chao-Yuan; Feichtenhofer, Christoph; Darrell, Trevor; Xie, Saining (2022). "Una red neuronal convolucional para la década de 2020" : 11976–11986 . arXiv : 2201.03545 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  11. Woo, Sanghyun; Debnath, Shoubhik; Hu, Ronghang; Chen, Xinlei; Liu, Zhuang; Kweon, In So; Xie, Saining (2023). "ConvNeXt V2: Co-Designing and Scaling ConvNets With Masked Autoencoders" : 16133–16142 . arXiv : 2301.00808 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  12. ^ Wu, Bichén; Xu, Chenfeng; Dai, Xiaoliang; Wan, Alvin; Zhang, Peizhao; Yan, Zhicheng; Masayoshi, Tomizuka; González, José; Keutzer, Kurt; Vajda, Peter (2020). "Visual Transformers: representación y procesamiento de imágenes basadas en tokens para visión por computadora". arXiv : 2006.03677 [ cs.CV ].
  13. 1 2 Xiao, Tete; Singh, Mannat; Mintun, Eric; Darrell, Trevor; Dollár, Piotr; Girshick, Ross (2021-06-28). "Las convoluciones tempranas ayudan a los transformadores a ver mejor". arXiv : 2106.14881 [ cs.CV ].
  14. 1 2 3 Liu, Ze; Lin, Yutong; Cao, Yue; Hu, Han; Wei, Yixuan; Zhang, Zheng; Lin, Esteban; Guo, Baining (25 de marzo de 2021). "Swin Transformer: transformador de visión jerárquica que utiliza ventanas desplazadas". arXiv : 2103.14030 [ cs.CV ].
  15. Tan, Mingxing; Le, Quoc (23 de junio de 2021). "EfficientNetV2: modelos más pequeños y entrenamiento más rápido" (PDF) . Actas de la 38.ª Conferencia Internacional sobre Aprendizaje Automático (PMLR) . 139 : 10096–10106 . arXiv : 2104.00298 . Recuperado el 31 de octubre de 2023 .
  16. Huang, Gao; Liu, Zhuang; van der Maaten, Laurens; Q. Weinberger, Kilian (28 de enero de 2018). "Redes neuronales convolucionales densamente conectadas". arXiv : 1608.06993 [ cs.CV ].
  17. 1 2 Sarkar, Arjun (2021-05-20). "¿Son los Transformers mejores que las CNN en el reconocimiento de imágenes?" . Medium . Archivado del original el 11-05-2022 . Recuperado el 11-07-2021 .
  18. 1 2 Zhai, Xiaohua; Kolesnikov, Alexander; Houlsby, Neil; Beyer, Lucas (junio de 2022). "Scaling Vision Transformers" . Conferencia IEEE/CVF de 2022 sobre Visión por Computadora y Reconocimiento de Patrones (CVPR) . IEEE. págs. 1204–1213 . arXiv : 2106.04560 . doi : 10.1109 /cvpr52688.2022.01179 . ISBN  978-1-6654-6946-3.
  19. Lee, Juho; Lee, Yoonho; Kim, Jungtaek; Kosiorek, Adam; Choi, Seungjin; Teh, Yee Whye (2019-05-24). "Set Transformer: Un marco para redes neuronales invariantes a permutaciones basadas en atención" . Actas de la 36.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 3744–3753 . arXiv : 1810.00825 .
  20. Karamcheti, Siddharth; Nair, Suraj; Chen, Annie S.; Kollar, Thomas; Finn, Chelsea; Sadigh, Dorsa; Liang, Percy (2023-02-24), Aprendizaje de representaciones basado en el lenguaje para robótica , arXiv : 2302.12766
  21. ^ Touvron, Hugo; Cordón, Matthieu; Sablayrolles, Alexandre; Synnaeve, Gabriel; Jégou, Hervé (2021). "Profundizando con Image Transformers" : 32– 42. arXiv : 2103.17239 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  22. ^ Zhou, Daquan; Kang, Bingyi; Jin, Xiaojie; Yang, Linjie; Lian, Xiaochen; Jiang, Zihang; Hou, Qibin; Feng, Jiashi (19 de abril de 2021), DeepViT: hacia un transformador de visión más profunda , arXiv : 2103.11886
  23. He, Kaiming; Chen, Xinlei; Xie, Saining; Li, Yanghao; Dollár, Piotr; Girshick, Ross (2021). "Los autoencoders enmascarados son aprendices de visión escalables". arXiv : 2111.06377 [ cs.CV ].
  24. Pathak, Deepak; Krahenbuhl, Philipp; Donahue, Jeff; Darrell, Trevor; Efros, Alexei A. (junio de 2016). "Codificadores de contexto: aprendizaje de características mediante relleno de imágenes". Conferencia IEEE de 2016 sobre visión por computadora y reconocimiento de patrones (CVPR) . IEEE. págs. 2536–2544 . arXiv : 1604.07379 . doi : 10.1109/CVPR.2016.278 . ISBN  978-1-4673-8851-1.
  25. 1 2 3 4 Liu, Ze; Lin, Yutong; Cao, Yue; Hu, Han; Wei, Yixuan; Zhang, Zheng; Lin, Esteban; Guo, Baining (2021). "Swin Transformer: transformador de visión jerárquica que utiliza ventanas desplazadas". arXiv : 2111.06377 [ cs.CV ].
  26. Zhou, Lei; Liu, Huidong; Bae, Joseph; He, Junjun; Samaras, Dimitris; Prasanna, Prateek (2022). "Autoaprendizaje previo con autoencoders enmascarados para la clasificación y segmentación de imágenes médicas". arXiv : 2203.05573 [ eess.IV ].
  27. Chen, Rui; Yang, Xiaotong; Li, Yue; Peng, Guocheng; Zhu, Qiuyue; Zhang, Zhenyu; Jiang, Hong (2024). "Modelo basado en aprendizaje profundo para la detección y clasificación automática de la disfunción de las glándulas de Meibomio a partir de imágenes infrarrojas". Applied Soft Computing . 164 112905. doi : 10.1016/j.asoc.2024.112905 (inactivo el 17 de octubre de 2025).{{cite journal}}: CS1 maint: DOI inactivo desde octubre de 2025 ( enlace )
  28. ^ Chen, Rui; Yang, Xiaotong; Li, Yue; Peng, Guocheng; Zhu, Qiuyue; Zhang, Zhenyu; Jiang, Hong (2024). "Modelo basado en aprendizaje profundo para la detección y clasificación automática de la disfunción de las glándulas de Meibomio a partir de imágenes infrarrojas". Computación blanda aplicada . 164 112905. arXiv : 2507.10869 .
  29. ^ Madán, Chetan; Satia, Aarjav; Basu, Soumen; Gupta, Pankaj; Dutta, Usha; Arora, Chetan (2025). "Centrarse en la textura: repensar la capacitación previa en codificadores automáticos enmascarados para la clasificación de imágenes médicas". arXiv : 2507.10869 [ eess.IV ].
  30. Nguyen, Duy Kien; Li, Yanghao; Aggarwal, Vaibhav; Oswald, Martin R.; Kirillov, Alexander; Snoek, Cees GM; Chen, Xinlei (2024). "R-MAE: Regions Meet Masked Autoencoders" (PDF) . OpenReview.net . Conferencia Internacional sobre Representaciones de Aprendizaje.
  31. Gupta, Agrim; Wu, Jiajun; Deng, Jia; Fei-Fei, Li (2023). "Autoencoders enmascarados siameses". arXiv : 2305.14344 [ cs.CV ].
  32. Bao, Hangbo; Dong, Li; Piao, Songhao; Wei, Furu (2021-10-06). "BEiT: BERT Pre-Training of Image Transformers" . Conferencia Internacional sobre Representaciones de Aprendizaje . arXiv : 2106.08254 .
  33. ^ Carón , Mathilde; Touvron, Hugo; Misra, Ishan; Jegou, Hervé; Mairal, Julien; Bojanowski, Piotr; Joulin, Armand (octubre de 2021). "Propiedades emergentes en transformadores de visión autosupervisados" . Conferencia internacional IEEE/CVF 2021 sobre visión por computadora (ICCV) . IEEE. págs. 9630–9640 . arXiv : 2104.14294 . doi : 10.1109/iccv48922.2021.00951 . ISBN  978-1-6654-2812-5.
  34. He, Kaiming; Fan, Haoqi; Wu, Yuxin; Xie, Saining; Girshick, Ross (2020). "Contraste de impulso para el aprendizaje de representación visual no supervisado" : 9729–9738 . arXiv : 1911.05722 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  35. Grill, Jean-Bastien; Strub, Florian; Altché, Florent; Tallec, Corentin; Richemond, Pierre; Buchatskaya, Elena; Doersch, Carl; Avila Pires, Bernardo; Guo, Zhaohan; Gheshlaghi Azar, Mohammad; Piot, Bilal; kavukcuoglu, koray; Munos, Remi; Valko, Michal (2020). "Bootstrap Your Own Latent - A New Approach to Self-Supervised Learning" . Advances in Neural Information Processing Systems . 33. Curran Associates, Inc.: 21271–21284 .
  36. ^ Oquab, Maxime; Darcet, Timothée; Moutakani, Théo; Vo, Huy; Szafraniec, Marc; Khalidov, Vasil; Fernández, Pierre; Haziza, Daniel; Massa, Francisco (2023-04-14). "DINOv2: aprendizaje de funciones visuales sólidas sin supervisión". arXiv : 2304.07193 [ cs.CV ].
  37. "DINOv3: Aprendizaje autosupervisado para visión a una escala sin precedentes" . ai.meta.com . Archivado del original el 14 de agosto de 2025. Consultado el 16 de agosto de 2025 .
  38. ^ Siméoni, Oriane; Vo, Huy V.; Seitzer, Maximiliano; Baldassarre, Federico; Oquab, Maxime; José, Cijo; Khalidov, Vasil; Szafraniec, Marc; Yi, Seungeun; Ramamonjisoa, Michaël; Massa, Francisco; Haziza, Daniel; Wehrstedt, Luca; Wang, Jianyuan; Darcet, Timothée; Moutakani, Théo; Sentaña, Leonel; Roberts, Claire; Vedaldi, Andrea; Tolan, Jamie; Brandt, Juan; Couprie, Camille; Mairal, Julien; Jégou, Hervé; Labatut, Patricio; Bojanowski, Piotr (2025). "DINOv3". arXiv : 2508.10104 [ cs.CV ].
  39. ^ Liu, Ze; Hu, Han; Lin, Yutong; Yao, Zhuliang; Xie, Zhenda; Wei, Yixuan; Ning, Jia; Cao, Yue; Zhang, Zheng; Dong, Li; Wei, Furu; Guo, Baining (2022). "Swin Transformer V2: aumento de la capacidad y la resolución" . Actas de la Conferencia IEEE/CVF sobre visión por computadora y reconocimiento de patrones. págs. 12009-12019 . 
  40. Bertasius, Gedas; Wang, Heng; Torresani, Lorenzo (2021-02-09). "¿Es la atención espacio-temporal todo lo que necesitas para comprender el vídeo?". arXiv : 2102.05095 [ cs.CV ].
  41. Szegedy, Christian; Vanhoucke, Vincent; Ioffe, Sergey; Shlens, Jon; Wojna, Zbigniew (2016). "Repensando la arquitectura Inception para la visión por computadora" : 2818–2826 . arXiv : 1512.00567 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  42. ^ Yu, Jiahui; Li, Xin; Koh, Jing Yu; Zhang, Han; Pang, Ruoming; Qin, James; Ku, Alejandro; Xu, Yuanzhong; Baldridge, Jason; Wu, Yonghui (2021). "Modelado de imágenes cuantificadas por vectores con VQGAN mejorado". arXiv : 2110.04627 [ cs.CV ].
  43. "Parti: Pathways Autoregressive Text-to-Image Model" . sites.research.google . Consultado el 3 de noviembre de 2023 .
  44. ^ Wu, Bichén; Xu, Chenfeng; Dai, Xiaoliang; Wan, Alvin; Zhang, Peizhao; Yan, Zhicheng; Tomizuka, Masayoshi; González, José; Keutzer, Kurt (19 de noviembre de 2020), Transformadores visuales: representación y procesamiento de imágenes basadas en tokens para visión por computadora , arXiv : 2006.03677
  45. Dai, Zihang; Liu, Hanxiao; Le, Quoc V.; Tan, Mingxing (2021-06-09). "CoAtNet: Combinando convolución y atención para todos los tamaños de datos". arXiv : 2106.04803 [ cs.CV ].
  46. ^ Wu, Haiping; Xiao, Bin; Codella, Noel; Liu, Mengchen; Dai, Xiyang; Yuan, Lu; Zhang, Lei (29 de marzo de 2021). "CvT: Introducción de convoluciones a los transformadores de visión". arXiv : 2103.15808 [ cs.CV ].
  47. ^ Touvron, Hugo; Cordón, Matthieu; Jégou, Hervé (2022). "DeiT III: La venganza de ViT". En Avidan, Shai; Brostow, Gabriel; Cissé, Moustapha; Farinella, Giovanni María; Hassner, Tal (eds.). Visión por Computador – ECCV 2022 . Apuntes de conferencias sobre informática. vol. 13684. Cham: Springer Nature Suiza. págs. 516– 533. arXiv : 2204.07118 . doi : 10.1007/978-3-031-20053-3_30 . ISBN   978-3-031-20053-3.
  48. Han, Kai; Xiao, An; Wu, Enhua; Guo, Jianyuan; XU, Chunjing; Wang, Yunhe (2021). «Transformador en Transformador» . Avances en los sistemas de procesamiento de información neuronal . 34 . Curran Associates, Inc.: 15908–15919 .
  49. ^ Bruto, Ronit D.; Halevi, Tal; Koresh, Ella; Tzach, Yarden; Kanter, Ido (2025). "Transformadores de visión de baja latencia mediante atención de múltiples cabezales a gran escala" . Physica A: Mecánica estadística y sus aplicaciones . 675 130835. arXiv : 2506.23832 . Código Bib : 2025PhyA..67530835G . doi : 10.1016/j.physa.2025.130835 . ISSN 0378-4371 . 
  50. ^ Naseer, Muzammal; Ranasinghe, Kanchana; Khan, Salman; Hayat, Munawar; Khan, Fahad Shahbaz; Yang, Ming-Hsuan (21 de mayo de 2021). "Propiedades intrigantes de los transformadores de visión". arXiv : 2105.10497 [ cs.CV ].
  51. Coccomini, Davide; Messina, Nicola; Gennaro, Claudio; Falchi, Fabrizio (2022). "Combining Efficient Net and Vision Transformers for Video Deepfake Detection". Image Analysis and Processing – ICIAP 2022. Lecture Notes in Computer Science. Vol. 13233. pp. 219–229 . arXiv : 2107.02612 . doi : 10.1007/978-3-031-06433-3_19 . ISBN   978-3-031-06432-6. S2CID 235742764 . 
  52. Kirillov, Alejandro; Mintun, Eric; Ravi, Nikhila; Mao, Hanzi; Rolland, Cloe; Gustafson, Laura; Xiao, Tete; Whitehead, Spencer; Berg, Alejandro C.; Lo, Wan-Yen; Dólar, Piotr; Girshick, Ross (2023). "Segmentar cualquier cosa" : 4015– 4026.{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  53. Jiang, Yifan; Chang, Shiyu; Wang, Zhangyang (2021). "TransGAN: Dos transformadores puros pueden crear una GAN fuerte y escalable" . Advances in Neural Information Processing Systems . 34. Curran Associates, Inc.: 14745–14758 . arXiv : 2102.07074 .
  54. Peebles, William; Xie, Saining (marzo de 2023). "Modelos de difusión escalables con transformadores". arXiv : 2212.09748v2 [ cs.CV ].
  55. Doron, Michael; Moutakanni, Théo; Chen, Zitong S.; Moshkov, Nikita; Caron, Mathilde; Touvron, Hugo; Bojanowski, Piotr; Pernice, Wolfgang M.; Caicedo, Juan C. (2023-06-18). "Morfología unicelular imparcial con transformadores de visión autosupervisada". bioRxiv 10.1101/2023.06.16.545359 . 
  56. Wang, Xiao; Liu, Siyan; Tsaris, Aristeidis; Choi, Jong-Youl; Aji, Ashwin; Fan, Ming; Zhang, Wei; Yin, Junqi; Ashfaq, Moetasim; Lu, Dan; Balaprakash, Prasanna (2024). "ORBIT: Oak Ridge Base Foundation Model for Earth System Predictability". arXiv : 2404.14712 [ physics.ao-ph ].

Lecturas adicionales

  • Zhang, Aston; Lipton, Zachary; Li, Mu; Smola, Alexander J. (2024). "11.8. Transformers for Vision" . Sumérgete en el aprendizaje profundo . Cambridge, Nueva York, Puerto Rico, Melbourne, Nueva Delhi, Singapur: Cambridge University Press. ISBN 978-1-009-38943-3.
  • Steiner, Andreas; Kolesnikov, Alexander; Zhai, Xiaohua; Wightman, Ross; Uszkoreit, Jakob; Beyer, Lucas (18 de junio de 2021). "¿Cómo entrenar tu ViT? Datos, aumento y regularización en Vision Transformers". arXiv : 2106.10270 [ cs.CV ].