Articulo de referencia

Modelo de lenguaje visual

Un modelo de visión-lenguaje ( VLM , por sus siglas en inglés ) es un tipo de sistema de inteligencia artificial que puede interpretar y generar información de forma conjunta a ...

Un modelo de visión-lenguaje ( VLM , por sus siglas en inglés ) es un tipo de sistema de inteligencia artificial que puede interpretar y generar información de forma conjunta a partir de imágenes y texto, ampliando las capacidades de los modelos de lenguaje grandes (LLM, por sus siglas en inglés), que se limitan al texto. Es un ejemplo de aprendizaje multimodal .

Muchas aplicaciones comerciales de uso generalizado ahora dependen de esta capacidad. OpenAI introdujo capacidades de visión artificial en su variante GPT-4V del modelo GPT-4 , lo que permite a los usuarios incorporar fotografías o diagramas cargados en sus conversaciones con ChatGPT . Desde entonces, se ha convertido en una parte integral de la oferta estándar de ChatGPT. Se añadieron capacidades similares a Gemini de Google , Claude 3 Opus de Anthropic [ 1 ] y Copilot with Vision de Microsoft [ 2 ] . Junto con estos modelos, la comunidad investigadora ha publicado varios modelos de visión-lenguaje de código abierto, como LLaVA [3], InstructBLIP [4] y MiniGPT-4 [5], que ofrecen alternativas a menor escala para la experimentación y el estudio académico .

Historia

Los modelos de lenguaje visual evolucionaron a partir de los sistemas de descripción de imágenes . Dichos sistemas fueron diseñados para tomar imágenes por sí solas (sin instrucciones que las acompañen) y producir descripciones.

La mayoría de los sistemas de subtitulado de imágenes utilizaban una arquitectura codificador-decodificador, donde un codificador resumía las imágenes en vectores de características , que se introducían en un decodificador para generar la descripción asociada. Los primeros métodos (principios de la década de 2010) combinaban características visuales diseñadas manualmente para codificar las imágenes y plantillas de texto basadas en n-gramas o reglas para generar las descripciones. [ 6 ] [ 7 ]

Con el auge del aprendizaje profundo , las redes neuronales se volvieron dominantes en la generación de subtítulos para imágenes. En 2015, surgieron métodos que utilizaban variaciones de redes neuronales convolucionales (CNN) para codificar imágenes y redes neuronales recurrentes (RNN) para generar los subtítulos. [ 8 ] [ 9 ] Para 2018, las redes transformadoras reemplazaron a las RNN en el rol de decodificadores de lenguaje. [ 10 ] Es importante destacar que el entrenamiento de los parámetros de la red se basó en conjuntos de datos de pares imagen-texto, como MS COCO (Common Objects in Context). [ 11 ] El alcance de las aplicaciones también se amplió para incluir la respuesta visual a preguntas (VQA), [ 12 ] la fundamentación de frases [ 13 ] y otras.

En 2021, el lanzamiento de CLIP ( Contrastive Language–Image Pretraining ) por parte de OpenAI supuso un paso fundamental hacia la evolución de los modelos de lenguaje virtual (VLM). En lugar de centrarse en una tarea específica como la generación de subtítulos para imágenes, CLIP es un modelo base de propósito general que puede extenderse a una amplia gama de tareas posteriores . Es importante destacar que los componentes de CLIP se entrenaron con un vasto conjunto de datos de 400 millones de pares imagen-texto, lo que dio como resultado modelos potentes. La estructura de propósito general de CLIP también pone esta potente capacidad a disposición de sistemas con presupuestos computacionales mucho menores.

A partir de 2022, se propusieron muchas arquitecturas VLM, basadas en filosofías de diseño similares (que se detallan a continuación). Estas incluyeron Flamingo, propiedad de Google DeepMind [ 14 ] , y una variante de código abierto [ 15 ] , LLaVA [ 3 ] , InstructBLIP de SalesForce [ 4 ] , Kosmos de Microsoft [ 16 ] , MiniGPT-4 de KAUST [ 5 ] y otras. Todas estas fusionaron un codificador de imágenes tipo CLIP entrenado por separado, un modelo de lenguaje grande (LLM) comercial para codificación de texto, ensamblados mediante componentes especializados. El sistema conjunto resultante se entrenó con conjuntos de datos seleccionados.

El lanzamiento de GPT-4V en 2023 marcó el surgimiento de aplicaciones comerciales de gran impacto. A esto le siguieron rápidamente otros sistemas mencionados anteriormente (incluidos Gemini de Google , Claude 3 Opus de Anthropic [ 1 ] y Copilot with Vision de Microsoft [ 2 ] ). Estas aplicaciones son sustancialmente más potentes para tareas de propósito general , suelen contener muchos más parámetros, se entrenan con conjuntos de datos masivos y requieren una enorme capacidad de procesamiento. Sus arquitecturas no se han divulgado.

Arquitectura

La entrada a los VLM consiste en elementos visuales (imágenes y vídeos) y texto. La salida suele ser el texto correspondiente. Los modelos generativos, que también generan elementos visuales (por ejemplo, DALL-E ), quedan fuera del alcance de este artículo.

A continuación se describe algunos modelos representativos cuya arquitectura es conocida. Es probable que los VLM comerciales, como el GPT-4V, cuyos diseños no se han divulgado públicamente, se basen en conceptos similares.

LLaVA 1.0

LLaVA (Large Language and Vision Assistant) [ 3 ] 1.0 es un modelo simple que captura algunos de los conceptos principales de los VLM de código abierto. La entrada al modelo es una imagen y una instrucción de lenguaje textual que la acompaña.

Arquitectura de LLaVA 1.0.

Estructura básica del modelo de lenguaje

Conceptualmente, el diseño se basa en un LLM estándar (una variante perfeccionada de Llama [ 17 ] llamada Vicuna), con componentes añadidos para admitir las entradas de imagen.

LLaVA toma prestados los módulos de tokenización y transformación (incluidos sus pesos ) de Vicuna y los utiliza para procesar el texto que lo acompaña. Recordemos que en una aplicación anterior (no VLM) de Vicuna, el tokenizador convierte el texto en una secuencia de tokens, que se transfieren al módulo de transformación, el cual a su vez produce una secuencia de tokens de respuesta. Estos se convierten posteriormente de nuevo a texto mediante el tokenizador.

Codificación de la visión

A esto, LLaVA añade dos componentes para admitir entradas de imágenes:

  • Codificador de visión: Este se basa en un modelo CLIP comercial, entrenado por separado (específicamente, la variante ViT-L/14) de OpenAI. El codificador de visión convierte la imagen en una matriz de vectores de incrustación de características (más información a continuación), que codifican información útil sobre la imagen. Esta información puede ser utilizada directamente por el LLM, ya que este está diseñado para recibir tokens con diferentes dimensiones. Además, al ser un LLM comercial, Vicuna no fue entrenado para reconocer y responder a dicha información.
  • Proyección (también conocida como puente ) : Este módulo conecta el codificador de visión con el LLM. Es decir, es una matriz simple de parámetros entrenables que convierte las dimensiones de las salidas del codificador de visión y que también puede entrenarse (véase más abajo) para que sea útil para el LLM. Sus salidas se denominan tokens de imagen .

Los tokens de imagen se anteponen a los tokens de texto y el LLM los procesa exactamente como tokens de texto ordinarios, lo que produce la respuesta final.

Se utilizó una modificación sencilla del codificador de visión CLIP ViT-L/14 para obtener vectores codificados más eficaces. Dado que este módulo es un transformador de visión , una aplicación directa habría utilizado el token de clase en la salida de su última capa transformadora (véase la clase del transformador de visión ) como una única salida vectorial. Sin embargo, LLaVA 1.0 utiliza los tokens de cuadrícula (no de clase) en la salida de la capa anterior (penúltima) para generar múltiples salidas vectoriales. Los tokens de cuadrícula corresponden a parches espaciales en estas imágenes de entrada y, por lo tanto, capturan información de mayor granularidad.

Capacitación

Se requirió entrenamiento para alinear los módulos de modo que pudieran combinarse en un solo modelo . En la terminología VLM, este paso se denomina ajuste de instrucciones. LLaVA 1.0 logró esto en dos etapas. La etapa 1 se centró en la alineación preliminar de la capa de proyección. Solo se entrenaron los pesos de ese módulo, mientras que los de los demás módulos permanecieron congelados. El conjunto de datos era un subconjunto del conjunto de datos CC3M [ 18 ] de pares imagen-leyenda. Este conjunto de datos era pequeño (595.000 pares) y limitado en su alcance, ya que contenía solo pares imagen-leyenda simples. La etapa 2 se centró en un entrenamiento más elaborado tanto de la capa de proyección como del LLM. El codificador de visión permaneció congelado. Para esta etapa se produjo un conjunto de datos de entrenamiento enriquecido (LLaVA-Instruct-158K [ 19 ] ) de pares de imágenes y texto, aprovechando un LLM de solo texto ( GPT-4 ) para convertir los subtítulos simples de los pares de imágenes y subtítulos (del conjunto de datos COCO [ 11 ] ) en indicaciones elaboradas al estilo de una conversación.

Las versiones posteriores de LLaVA introdujeron varias mejoras con respecto a LLaVA 1.0. Algunas mejoras conceptuales notables incluyen la sustitución en LLaVA 1.5 [ 20 ] del módulo de proyección simple por un MLP más elaborado . LLaVA-NeXT [ 21 ] añadió soporte para múltiples relaciones de aspecto de imagen, más allá de los 224x224 de LLaVA 1.0.

Flamenco

Flamingo [ 14 ] ( DeepMind , 2022) , que se lanzó un año antes que LLaVA 1.0, presenta un diseño más elaborado que LLaVA. Entre sus ventajas se incluyen la compatibilidad con múltiples imágenes en una misma conversación y la compatibilidad con vídeo.

Arquitectura del Flamingo VLM

Desde el punto de vista arquitectónico, el diseño implica una integración más estrecha entre los módulos de lenguaje y visión, y un módulo de remuestreo de percepción (que se describe a continuación).

LLM y Vision Backbones

Al igual que LLaVA, Flamingo comienza con un modelo de lenguaje natural (LLM) y un codificador de visión diseñados de forma independiente, para el análisis de texto y la incrustación de imágenes, respectivamente. Ambos se entrenan previamente para sus propósitos específicos, independientemente de su utilidad final como componentes de Flamingo. Además, como componentes, sus pesos permanecen fijos durante el entrenamiento conjunto (véase más abajo).

Flamingo utiliza Chinchilla de DeepMind como su arquitectura base LLM. Para el codificador de visión, optaron por un diseño sin transformador ( NFNet-F6 basado en ResNet [ 22 ] ). Lo entrenaron utilizando una pérdida contrastiva al estilo CLIP en pares de imagen-leyenda de ALIGN [ 23 ] y un conjunto de datos especialmente seleccionado llamado LTIP (Long Text & Image Pairs).

El codificador de visión toma imágenes individuales como entrada (más información en los vídeos a continuación) y produce una cuadrícula bidimensional de vectores de características.

Remuestreador-perceptor

El componente perceptor-remuestreador [ 24 ] juega un papel clave en el soporte para video y número variable de imágenes en la entrada Flamingo.

Varias imágenes consecutivas (una o más) se introducen una a una en el codificador de visión, generando una cuadrícula tridimensional de vectores de características. Los vídeos se convierten en una secuencia de imágenes mediante un muestreo a una velocidad de 1 fotograma por segundo . La cuadrícula resultante se transforma en una matriz larga y de tamaño variable de vectores de características.

El remuestreador-perceptor convierte esto en una matriz corta de tokens de longitud fija . Utiliza un diseño basado en la atención cruzada entre un número fijo de vectores de consulta artificiales y predeterminados (cuyos valores se determinan mediante entrenamiento) y pares (clave, valor) derivados de la matriz de vectores de características.

Cabe señalar que, en este contexto, se asume que las imágenes consecutivas son contiguas, sin texto intermedio. El caso general se analizará más adelante.

Bloques densos/de atención cruzada controlada

Se trata de varios bloques (véase la figura superior) que desempeñan una función paralela a la del módulo de proyección de LLaVA, sirviendo de interfaz entre los módulos de visión y procesamiento de texto. Sin embargo, su diseño está más estrechamente ligado al modelo de lenguaje.

Atención cruzada controlada y bloque denso

En concreto, Flamingo inserta estos bloques de atención cruzada y densos entre bloques transformadores seleccionados del modelo de lenguaje. Estos bloques se asemejan a los bloques decodificadores de las arquitecturas transformadoras codificador-decodificador. Es decir, sus consultas se obtienen del bloque transformador de autoatención heredado anterior del modelo de lenguaje principal. Sus claves y valores se derivan de los vectores de características de visión. Sus salidas se envían al siguiente bloque del modelo de lenguaje principal. También incluyen conexiones de salto.

Una modificación importante en los bloques añadidos, en comparación con los bloques de transformadores codificador-decodificador, es la inclusión de una compuerta tanh . Estos pequeños módulos multiplican sus entradas y están controlados por un peso escalar entrenable en el intervalo (-1, 1), específico para cada bloque. Estos pesos modulan el impacto del bloque de atención cruzada densa en el proceso de generación de texto. Se inicializan a cero al comienzo del entrenamiento, cuando los pesos de los demás módulos del bloque aún no están entrenados y son aleatorios. A medida que avanza el entrenamiento, sus valores aumentan gradualmente. Estas compuertas desempeñan un papel crucial para garantizar la estabilidad del entrenamiento.

Agrupación

Para admitir secuencias de imágenes y texto intercaladas, Flamingo introdujo una adaptación sencilla que, sin duda, mejora el rendimiento en el aprendizaje contextual (con pocos ejemplos). Concretamente, dividen el flujo de entrada en fragmentos, cada uno de los cuales contiene una única entrada visual (imagen, secuencia contigua de imágenes o vídeo). Al aplicar la atención cruzada entre texto y características visuales, los tokens de texto solo pueden prestar atención a la entrada visual dentro de su fragmento. Las demás entradas visuales se enmascaran.

Cabe señalar que los tokens de texto siguen estando influenciados indirectamente por todas las entradas de vídeo, a través de la autoatención intratextual.

Capacitación

Durante el entrenamiento, las estructuras básicas de lenguaje y texto permanecen fijas (como se indicó anteriormente). El entrenamiento utilizó tres conjuntos de datos: el conjunto de datos LTIP mencionado anteriormente, un conjunto de datos seleccionado de pares de vídeo y texto (denominado VTP) y un conjunto de datos masivo de secuencias de texto e imagen intercaladas, derivado de documentos HTML (MultiModal MassiveWeb - M3W).

Qwen2-VL

Qwen2-VL [ 25 ] de Alibaba (2024) tiene una arquitectura conceptualmente simple que también proporciona funcionalidad y flexibilidad que superan a Flamingo.

Al igual que LLaVA 1.0 y Flamingo, comienza con un modelo de lenguaje base ( Qwen2 ) y un codificador de visión ( transformador de visión DFN [ 26 ] ).

Al igual que LLaVA y a diferencia de Flamingo, Qwen2-VL utiliza un procesamiento unificado de datos de visión y texto, introduciendo todos los tokens en la entrada del modelo de lenguaje, en lugar de insertarlos en bloques internos. El modelo de lenguaje trata los tokens por igual, utilizando autoatención en lugar de atención cruzada . Para admitir datos de texto y visión intercalados, y delimitar las secuencias de tokens de estos últimos, se utilizan tokens especiales (vision_start y vision_end).

Resolución dinámica ingenua

Una diferencia clave con respecto a LLaVA 1.0 y Flamingo es que el codificador de visión admite resoluciones de imagen arbitrarias , sin necesidad de redimensionar la imagen a una forma fija. El número de tokens codificados es variable y depende de la forma de la imagen.

Los vídeos se muestrean a 2 fotogramas por segundo para generar una secuencia de imágenes, cada una de las cuales se codifica por separado. Esto también contribuye a la longitud variable del array de tokens.

Una MLP alinea la dimensión de incrustación del ViT con la del modelo de lenguaje. También contribuye a reducir la dimensionalidad de la codificación de imágenes mediante la fusión de parches adyacentes de 2x2 incrustaciones vectoriales (véase ViT ). La codificación de vídeo también se beneficia de una convolución 3D que opera en la dimensión temporal.

Codificación posicional rotatoria multimodal (M-RoPE)

La codificación posicional estándar no es adecuada para datos de visión, especialmente cuando estos se codifican en incrustaciones de tokens de longitud variable. En concreto, su representación unidimensional pierde la disposición espacial de las imágenes y la continuidad temporal del vídeo.

Qwen2-VL utiliza una variante multidimensional para datos de visión, que denomina codificación posicional rotacional multimodal (M-RoPE). Con esta implementación, a cada token se le asigna una tripleta de índices ( i , x , y ), definida de la siguiente manera: para las imágenes, x e y representan las coordenadas espaciales del token en la imagen. i es constante para todos los tokens de la imagen e iguala el número de secuencia de la imagen dentro del flujo de entrada unificado al modelo. La codificación posicional M-RoPE se construye intercalando codificaciones RoPE unidimensionales separadas para los tres índices. [ 27 ]

La codificación posicional de vídeo utiliza tripletes similares, con la diferencia de que i no es constante y progresa con cada imagen en la secuencia de vídeo. De este modo, codifica la ubicación temporal.

Capacitación

Qwen2-VL se entrena mediante un proceso de tres etapas que integra progresivamente la comprensión visual y lingüística. En la Etapa 1, se entrena el codificador de visión, manteniendo los demás módulos congelados. En la Etapa 2, se desbloquea toda la arquitectura, y en la Etapa 3, se congela el codificador de visión mientras se ajusta el modelo de lenguaje. El conjunto de datos de entrenamiento incluye una amplia gama de modalidades, que suman finalmente 1,4 billones de tokens (incluidos los tokens de visión codificados). La pérdida de entrenamiento se calcula sobre los tokens de texto en la salida del modelo de lenguaje.

Conexión visual

Una funcionalidad clave que permite la codificación posicional multimodal es la contextualización visual; es decir, la capacidad de razonar sobre objetos específicos dentro de una imagen. La preservación de la ubicación espacial de los elementos de la imagen por parte de M-RoPE es esencial para ello.

Para facilitar la contextualización, gran parte de los datos de entrenamiento incluyen información sobre objetos en imágenes, como subtítulos y coordenadas de cuadros delimitadores . La preparación del conjunto de datos de entrenamiento implica formatear estos datos en una estructura estándar, que incluye tokens especiales como object_ref_start, object_ref_end, box_start, y box_end.

Véase también

Referencias

  1. 1 2 "Visión" . Claude Docs . Recuperado el 15-10-2025 .
  2. 1 2 "Uso de Copilot Vision con Microsoft Copilot - Soporte técnico de Microsoft" . support.microsoft.com . Consultado el 15 de octubre de 2025 .
  3. 1 2 3 Liu, Haotian; Li, Chunyuan; Wu, Qingyang; Lee, Yong Jae (11 de diciembre de 2023). "Ajuste de instrucciones visuales". arXiv : 2304.08485 [ cs.CV ].
  4. 1 2 Dai, Wenliang; Li, Junnan; Li, Dongxu; Tiong, Anthony Meng Huat; Zhao, Junqi; Wang, Weisheng; Li, Boyang; Fung, Pascale; Hola, Steven (15 de junio de 2023). "InstructBLIP: hacia modelos de visión y lenguaje de uso general con ajuste de instrucciones". arXiv : 2305.06500 [ cs.CV ].
  5. 1 2 Zhu, Deyao; Chen, junio; Shen, Xiaoqian; Li, Xiang; Elhoseiny, Mohamed (2 de octubre de 2023). "MiniGPT-4: mejora de la comprensión del lenguaje y la visión con modelos avanzados de lenguaje grande". arXiv : 2304.10592 [ cs.CV ].
  6. Kulkarni, Girish; Premraj, Visruth; Dhar, Sagnik; Li, Siming; Choi, Yejin; Berg, Alexander C; Berg, Tamara L (25 de junio de 2011). «Dibujo infantil: Comprensión y generación de descripciones sencillas de imágenes». CVPR 2011. págs. 1601–1608 . doi : 10.1109/CVPR.2011.5995466 . ISBN  978-1-4577-0394-2.
  7. Paragios, Nikos; Daniilidis, Kostas; Maragos, Petros (2010). Visión por Computadora - ECCV 2010: 11.ª Conferencia Europea sobre Visión por Computadora, Heraklion, Creta, Grecia, 5-11 de septiembre de 2010, Actas, Parte IV . Lecture Notes in Computer Science. Berlín, Heidelberg: Springer Berlin Heidelberg Springer e-books. ISBN 978-3-642-15561-1.
  8. Vinyals, Oriol; Toshev, Alexander; Bengio, Samy; Erhan, Dumitru (2015). "Show and Tell: A Neural Image Caption Generator" . CVPR 2015 : 3156–3164 .
  9. Xu, Kelvin; Ba, Jimmy Lei; Kiros, Ryan; Cho, Kyunghyun; Courville, Aaron; Salakhutdinov, Ruslan; Zemel, Richard S.; Bengio, Yoshua (2015-07-06). "Mostrar, atender y contar: generación de subtítulos de imágenes neuronales con atención visual" . Actas de la 32.ª Conferencia Internacional sobre Aprendizaje Automático . ICML'15. Lille, Francia: JMLR.org: 2048–2057 .
  10. Lu, Jiasen; Batra, Dhruv; Parikh, Devi; Lee, Stefan (2019-08-06). "ViLBERT: Preentrenamiento de representaciones visiolingüísticas independientes de la tarea para tareas de visión y lenguaje". arXiv : 1908.02265 [ cs.CV ].
  11. 1 2 "COCO - Objetos comunes en contexto" . cocodataset.org . Consultado el 20 de octubre de 2025 .
  12. "¿Modelos de lenguaje visual (VLM) frente a sistemas de respuesta a preguntas visuales (VQA) en 2025?" . www.gravio.com . Consultado el 20 de octubre de 2025 .
  13. "¿Qué es la fundamentación de frases?" . Blog de Roboflow . 13/11/2024 . Consultado el 21/10/2025 .
  14. 1 2 Alayrac, Jean-Baptiste; Donahue, Jeff; Luc, Pauline; Miech, Antoine; Barr, Iain; Hasson, Yana; Lenc, Karel; Mensch, Arthur; Millican, Katie (2022-11-15). "Flamingo: un modelo de lenguaje visual para el aprendizaje con pocos ejemplos". arXiv : 2204.14198 [ cs.CV ].
  15. Awadalla, Anas; Gao, Irena; Gardner, Josh; Hessel, Jack; Hanafy, Yusuf; Zhu, Wanrong; Marathe, Kalyani; Bitton, Yonatan; Gadre, Samir (2023-08-07). "OpenFlamingo: Un marco de código abierto para entrenar grandes modelos autorregresivos de visión y lenguaje". arXiv : 2308.01390 [ cs.CV ].
  16. Huang, Shaohan; Dong, Li; Wang, Wenhui; Hao, Yaru; Singhal, Saksham; Ma, Shuming; Lv, Tengchao; Cui, Lei; Mohammed, Owais Khan (2023-03-01). "El lenguaje no es todo lo que necesitas: alineando la percepción con los modelos de lenguaje". arXiv : 2302.14045 [ cs.CL ].
  17. "Vicuna: Un chatbot de código abierto que impresiona a GPT-4 con una calidad ChatGPT del 90%* | LMSYS Org" . lmsys.org . Consultado el 25 de octubre de 2025 .
  18. Sharma, Piyush; Ding, Nan; Goodman, Sebastian; Soricut, Radu (2018). Gurevych, Iryna; Miyao, Yusuke (eds.). "Conceptual Captions: A Cleaned, Hypernymed, Image Alt-text Dataset For Automatic Image Captioning" . Actas de la 56.ª Reunión Anual de la Asociación de Lingüística Computacional (Volumen 1: Artículos extensos) . Melbourne, Australia: Asociación de Lingüística Computacional: 2556–2565 . doi : 10.18653/v1/P18-1238 .
  19. "liuhaotian/LLaVA-Instruct-150K · Conjuntos de datos en Hugging Face" . huggingface.co . 2025-06-06 . Consultado el 2025-10-25 .
  20. ^ Liu, Haotian; Li, Chunyuan; Li, Yuheng; Lee, Yong Jae (15 de mayo de 2024). "Líneas de base mejoradas con ajuste de instrucciones visuales". arXiv : 2310.03744 [ cs.CV ].
  21. Li, Feng; Zhang, Renrui; Zhang, Hao; Zhang, Yuanhan; Li, Bo; Li, Wei; Mamá, Zejun; Li, Chunyuan (28 de julio de 2024). "LLaVA-NeXT-Interleave: abordar múltiples imágenes, vídeos y 3D en grandes modelos multimodales". arXiv : 2407.07895 [ cs.CV ].
  22. Brock, Andrew; De, Soham; Smith, Samuel L.; Simonyan, Karen (2021-02-11). "Reconocimiento de imágenes a gran escala de alto rendimiento sin normalización". arXiv : 2102.06171 [ cs.CV ].
  23. Jia, Chao; Yang, Yinfei; Xia, Ye; Chen, Yi-Ting; Parekh, Zarana; Pham, Hieu; Le, Quoc V.; Sung, Yunhsuan; Li, Zhen (2021-06-11). "Ampliación del aprendizaje de representación visual y de lenguaje visuovisual con supervisión de texto ruidoso". arXiv : 2102.05918 [ cs.CV ].
  24. Jaegle, Andrew; Gimeno, Felix; Brock, Andrew; Zisserman, Andrew; Vinyals, Oriol; Carreira, Joao (2021-06-23). ​​"Perceiver: Percepción general con atención iterativa". arXiv : 2103.03206 [ cs.CV ].
  25. ^ Wang, Peng; Bai, Shuai; Bronceado, Sinan; Wang, Shijie; Fan, Zhihao; Bai, Jinze; Chen, Keqin; Liu, Xuejing; Wang, Jialin (3 de octubre de 2024). "Qwen2-VL: mejora de la percepción del mundo del modelo visión-lenguaje en cualquier resolución". arXiv : 2409.12191 [ cs.CV ].
  26. Fang, Alex; Jose, Albin Madappally; Jain, Amit; Schmidt, Ludwig; Toshev, Alexander; Shankar, Vaishaal (2023-11-06). "Redes de filtrado de datos". arXiv : 2309.17425 [ cs.AI ].
  27. tangbasky (2025-09-08). "Variante RoPE de Qwen2-VL: M-RoPE" . Everyday AI . Consultado el 30 de octubre de 2025 .