El preentrenamiento contrastivo de lenguaje e imagen ( CLIP ) es una técnica para entrenar un par de modelos de redes neuronales , uno para la comprensión de imágenes y otro para la comprensión de texto, utilizando un objetivo contrastivo . [ 1 ] Este método ha permitido amplias aplicaciones en múltiples dominios, incluyendo la recuperación multimodal, [ 2 ] la generación de texto a imagen, [ 3 ] y la clasificación estética. [ 4 ]
Algoritmo

El método CLIP entrena un par de modelos de forma contrastiva. [ 1 ] Un modelo recibe un texto como entrada y genera un único vector que representa su contenido semántico. El otro modelo recibe una imagen y genera un único vector que representa su contenido visual. Los modelos se entrenan de manera que los vectores correspondientes a pares de texto-imagen semánticamente similares estén cerca unos de otros en el espacio vectorial compartido, mientras que los correspondientes a pares disímiles estén muy separados. [ 1 ]
Para entrenar un par de modelos CLIP, se comenzaría preparando un gran conjunto de datos de pares imagen-leyenda. Durante el entrenamiento, a los modelos se les presentan lotes depares imagen-leyenda. Sean las salidas de los modelos de texto e imagen respectivamenteDos vectores se consideran "similares" si su producto escalar es grande.
Para cada imagen, las puntuaciones de similitud con laLos textos se convierten mediante una función softmax en una distribución de probabilidad que determina qué texto coincide. A continuación, se calcula la entropía cruzada con respecto al objetivo one-hot, que asigna una probabilidad de 1 al texto correcto; este mismo cálculo se realiza también en la dirección de texto a imagen.
La pérdida incurrida en este lote es la pérdida de N pares de múltiples clases, [ 5 ] que es una pérdida de entropía cruzada simétrica sobre puntuaciones de similitud:En esencia, esta función de pérdida fomenta el producto escalar entre vectores de imagen y texto coincidentes () para que sea alto, al tiempo que se desalientan los productos escalares altos entre pares que no coinciden. El parámetroes la temperatura , que se parametriza en el modelo CLIP original comodóndees un parámetro aprendido.
Son posibles otras funciones de pérdida. Por ejemplo, Sigmoid CLIP (SigLIP) [ 6 ] propone la siguiente función de pérdida:dóndees la pérdida sigmoide logarítmica negativa y el símbolo delta de Diraces 1 side lo contrario 0.
Modelos CLIP
Si bien el modelo original fue desarrollado por OpenAI , los modelos posteriores también han sido entrenados por otras organizaciones.
Modelo de imagen

Los modelos de codificación de imágenes utilizados en CLIP suelen ser transformadores de visión (ViT). La nomenclatura de estos modelos a menudo refleja la arquitectura ViT específica empleada. Por ejemplo, "ViT-L/14" significa un "transformador de visión grande" (en comparación con otros modelos de la misma serie) con un tamaño de parche de 14, lo que significa que la imagen se divide en parches de 14 x 14 píxeles antes de ser procesada por el transformador. El indicador de tamaño va de B, L, H, G (base, grande, enorme, gigante), en ese orden.
Aparte de ViT, el modelo de imagen suele ser una red neuronal convolucional , como ResNet (en la serie original de OpenAI) o ConvNeXt [ 7 ] (en la serie de modelos OpenCLIP de LAION [ 8 ] ).
Dado que los vectores de salida del modelo de imagen y del modelo de texto deben tener exactamente la misma longitud, ambos modelos tienen vectores de salida de longitud fija, lo que en el informe original se denomina "dimensión de incrustación". [ nota 1 ]
Por ejemplo, en el modelo original de OpenAI, los modelos ResNet tienen dimensiones de incrustación que van de 512 a 1024, [ 9 ] : Tabla 19 y para los ViT, de 512 a 768. [ 9 ] : Tabla 20
Su implementación de ViT fue la misma que la original, [ 11 ] con una modificación: después de agregar las incrustaciones de posición a las incrustaciones de parche iniciales, hay una LayerNorm .
Su implementación de ResNet fue la misma que la original, [ 12 ] con 3 modificaciones:
- En el inicio de la CNN (el "tallo"), utilizaron tres convoluciones apiladas de 3x3 en lugar de una sola convolución de 7x7, como se sugiere en [ 13 ] .
- Hay un agrupamiento promedio de paso 2 al inicio de cada capa convolucional de submuestreo (lo denominaron agrupamiento de desenfoque rect-2 según la terminología de [ 14 ] ). Esto tiene el efecto de desenfocar las imágenes antes del submuestreo, para suavizar el aliasing. [ 15 ]
- La capa convolucional final va seguida de una agrupación de atención multi-cabeza .
ALIGN, un modelo con capacidades similares, entrenado por investigadores de Google [ 16 ], utilizó EfficientNet [ 17 ] , un tipo de red neuronal convolucional .
Modelo de texto

Los modelos de codificación de texto utilizados en CLIP suelen ser transformadores .
En el informe original de OpenAI, informaron del uso de un Transformer (63M parámetros, 12 capas, 512 de ancho, 8 cabezas de atención) con codificación de pares de bytes en minúsculas (BPE) con un tamaño de vocabulario de 49152. La longitud del contexto se limitó a 76 para mayor eficiencia. Al igual que GPT , era solo decodificador, con solo autoatención enmascarada causalmente. [ 1 ] : 5 Su arquitectura es la misma que la de GPT-2 . [ 18 ]
Al igual que BERT , la secuencia de texto está delimitada por dos tokens especiales [SOS]( [EOS]"inicio de secuencia" y "fin de secuencia"). Se toman las activaciones de la capa superior del transformador [EOS], se aplica LayerNorm y, finalmente, un mapeo lineal. Esta es la codificación de texto de la secuencia de entrada. El mapeo lineal final tiene una dimensión de salida igual a la dimensión de incrustación del codificador de imágenes con el que se combina. Todos estos modelos tenían una longitud de contexto de 77 y un tamaño de vocabulario de 49408.
ALIGN [ 16 ] utilizó BERT de varios tamaños.
Conjunto de datos
Texto de imagen web
Los modelos CLIP publicados por OpenAI fueron entrenados con un conjunto de datos llamado "WebImageText" (WIT) que contiene 400 millones de pares de imágenes y sus correspondientes subtítulos extraídos de internet. El número total de palabras en este conjunto de datos es similar al del conjunto de datos WebText utilizado para entrenar a GPT-2 , que contiene aproximadamente 40 gigabytes de datos de texto. [ 1 ]
El conjunto de datos contiene 500.000 consultas de texto, con hasta 20.000 pares (imagen, texto) por consulta. Las consultas de texto se generaron partiendo de todas las palabras que aparecen al menos 100 veces en la Wikipedia en inglés , y luego se ampliaron con bigramas con alta información mutua , nombres de todos los artículos de Wikipedia con un volumen de búsqueda superior a un determinado valor y conjuntos de sinónimos de WordNet .
El conjunto de datos es privado y no se ha hecho público, y no hay más información al respecto. [ nota 3 ]
preprocesamiento de datos
Para los modelos de imágenes CLIP, las imágenes de entrada se preprocesan dividiendo primero cada uno de los valores R, G, B de una imagen por el valor máximo posible, de modo que estos valores caigan entre 0 y 1, luego restando [0.48145466, 0.4578275, 0.40821073]y dividiendo por [0.26862954, 0.26130258, 0.27577711].
La justificación fue que estos son la media y la desviación estándar de las imágenes en el conjunto de datos WebImageText, por lo que este paso de preprocesamiento blanquea aproximadamente el tensor de la imagen. Estos números difieren ligeramente del preprocesamiento estándar para ImageNet , que utiliza [0.485, 0.456, 0.406]y [0.229, 0.224, 0.225]. [ 20 ]
Si la imagen de entrada no tiene la misma resolución que la resolución nativa (224×224 para todas excepto ViT-L/14@336px, que tiene una resolución de 336×336), entonces la imagen de entrada se escala primero mediante interpolación bicúbica , de modo que su lado más corto sea igual a la resolución nativa, y luego se recorta el cuadrado central de la imagen .
Otros
ALIGN [ 16 ] utilizó más de mil millones de pares imagen-texto, obtenidos mediante la extracción de imágenes y sus etiquetas alt a partir de rastreos en línea. El método se describió como similar a cómo se construyó el conjunto de datos Conceptual Captions [ 21 ] , pero en lugar de un filtrado complejo, solo aplicaron un filtrado basado en la frecuencia.
Modelos posteriores entrenados por otras organizaciones tenían conjuntos de datos publicados. Por ejemplo, LAION entrenó OpenCLIP con los conjuntos de datos publicados LAION-400M, LAION-2B y DataComp-1B. [ 22 ] [ 8 ]
Capacitación
En el informe original de OpenAI CLIP, se informó del entrenamiento de 5 modelos ResNet y 3 ViT (ViT-B/32, ViT-B/16, ViT-L/14). Cada uno se entrenó durante 32 épocas. El modelo ResNet más grande tardó 18 días en entrenarse con 592 GPU V100 . El modelo ViT más grande tardó 12 días en entrenarse con 256 GPU V100.
Todos los modelos ViT se entrenaron con una resolución de imagen de 224×224. El ViT-L/14 se mejoró a una resolución de 336×336 mediante FixRes, [ 23 ] lo que dio como resultado un modelo. [ nota 4 ] Encontraron que este era el modelo con mejor rendimiento. [ 1 ] : Apéndice F. Hiperparámetros del modelo
En la serie OpenCLIP, el modelo ViT-L/14 fue entrenado en 384 GPU A100 en el conjunto de datos LAION-2B, durante 160 épocas para un total de 32 mil millones de muestras vistas. [ 24 ]
Aplicaciones
Recuperación multimodal
La recuperación multimodal de CLIP permite la alineación de datos visuales y textuales en un espacio latente compartido , lo que permite a los usuarios recuperar imágenes a partir de descripciones de texto y viceversa, sin necesidad de anotaciones explícitas de imágenes. [ 25 ] En la recuperación de texto a imagen , los usuarios introducen texto descriptivo y CLIP recupera imágenes con incrustaciones coincidentes. En la recuperación de imagen a texto , las imágenes se utilizan para encontrar contenido de texto relacionado.
La capacidad de CLIP para conectar datos visuales y textuales ha encontrado aplicaciones en la búsqueda multimedia , el descubrimiento de contenido y los sistemas de recomendación. [ 26 ] [ 27 ]
Clasificación de imágenes
CLIP puede realizar tareas de clasificación de imágenes sin ejemplos previos. Esto se logra proporcionando al codificador de texto los nombres de las clases y seleccionando la clase cuya representación vectorial sea la más cercana a la de la imagen. Por ejemplo, para clasificar una imagen, se compara la representación vectorial de la imagen con la del texto "Una foto de una {clase}.", y se muestra la {clase} que produce el producto escalar más alto.
CLIP para el aprendizaje multimodal
CLIP se ha utilizado como componente en el aprendizaje multimodal . Por ejemplo, durante el entrenamiento de Flamingo de Google DeepMind (2022), [ 28 ] los autores entrenaron un par CLIP, con BERT como codificador de texto y NormalizerFree ResNet F6 [ 29 ] como codificador de imágenes. El codificador de imágenes del par CLIP se tomó con parámetros congelados y el codificador de texto se descartó. El codificador de imágenes congelado se combinó luego con un modelo de lenguaje Chinchilla congelado , mediante un ajuste fino con algunos parámetros adicionales que conectan los dos modelos congelados.
Aplicaciones en otros ámbitos
- El codificador de imágenes de CLIP es un extractor de características de imágenes preentrenado . Este puede luego ser introducido en otros modelos de IA. [ 1 ]
- Modelos como Stable Diffusion utilizan el codificador de texto de CLIP para transformar indicaciones de texto en incrustaciones para la generación de imágenes. [ 3 ] CLIP también puede utilizarse como una señal de gradiente para guiar directamente la difusión ("guía CLIP") [ 30 ] [ 31 ] u otro arte generativo. [ 32 ]
- Los modelos CLIP ajustados pueden utilizarse para clasificar imágenes por calidad estética, lo que puede ser útil como paso previo para filtrar un conjunto de datos grande y obtener uno más pequeño de mayor calidad. [ 33 ]
- CLIP se puede utilizar para generar subtítulos de imágenes haciendo coincidir entradas de texto con incrustaciones de imágenes. [ 34 ]
Notas
- ↑ Similar a la "dimensión de incrustación" de la incrustación de texto en los modelos Transformer.
- ↑
! pip install git + https : // github . com / openai / CLIP . git ! wget https : // github . com / openai / CLIP / raw / main / CLIP . png - O CLIP . pngimport torch import clip from PIL import Image import numpy as npdispositivo = " cuda " si torch.cuda.is_available ( ) else " cpu " para m en clip.available_models ( ) : modelo , preprocesamiento = clip.load ( m , dispositivo = dispositivo )resolución_entrada = modelo.visual.resolución_entrada longitud_contexto = modelo.longitud_contexto tamaño_vocabulario = modelo.tamaño_vocabularioprint ( " Parámetros del modelo:" , f " { np.sum ( [ int ( np.prod ( p.shape ) ) for p in model.parameters ( ) ] ) :, } " ) print ( "Resolución de entrada:" , input_resolution ) print ( " Longitud del contexto:" , context_length ) print ( "Tamaño del vocabulario: " , vocab_size )n_params_vision = sum ( p.numel ( ) for p in model.visual.parameters ()) n_params_text = sum ( p.numel ( ) for p in model.transformer.parameters ( ) ) image = preprocess ( Image.open ( " CLIP.png " ) ) . unsqueeze ( 0 ) .to ( device ) image_features = model.encode_image ( image ) print ( f " Modelo: { m } , # parámetros de visión : { n_params_vision :, } , # parámetros de texto : { n_params_text :, } , dimensión de incrustación : { image_features.shape [ 1 ] } " ) del model , preprocess , image , image_features
- ↑ No es lo mismo que el conjunto de datos Image Text basado en Wikipedia, también llamado "WIT". [ 19 ]
- ↑ Se refirieron a esto como ambos
ViT-L/14-336pxyViT-L/14@336px, de manera inconsistente a lo largo del informe.
Referencias
- 1 2 3 4 5 6 7 Radford, Alec; Kim, Jong Wook; Hallacy, Chris; Ramesh, Aditya; Goh, Gabriel; Agarwal, Sandhini; Sastry, Girish; Askell, Amanda; Mishkin, Pamela; Clark, Jack; Krueger, Gretchen; Sutskever, Ilya (2021-07-01). Aprendizaje de modelos visuales transferibles a partir de la supervisión del lenguaje natural . Actas de la 38.ª Conferencia Internacional sobre Aprendizaje Automático. PMLR. págs. 8748–8763 .
- ^ Hendriksen, Mariya; Bleeker, Maurits; Vakulenko, Svitlana; van Noord, Nanne; Kuiper, Ernst; de Rijke, Maarten (2022). "Ampliación de CLIP para la recuperación de categoría a imagen en el comercio electrónico" . En Hagen, Matías; Verberne, Suzan; Macdonald, Craig; Seifert, Christin; Balog, Krisztian; Nørvåg, Kjetil; Setty, Vinay (eds.). Avances en la recuperación de información . Apuntes de conferencias sobre informática. vol. 13185. Cham: Springer International Publishing. págs. 289– 303. doi : 10.1007/978-3-030-99736-6_20 . ISBN 978-3-030-99736-6.
- 1 2 "Repositorio de difusión estable en GitHub" . CompVis - Grupo de investigación en visión artificial y aprendizaje, LMU Múnich. 17 de septiembre de 2022. Archivado del original el 18 de enero de 2023. Recuperado el 17 de septiembre de 2022 .
- ↑ LAION-AI/predictor estético , LAION AI, 6 de septiembre de 2024 , consultado el 8 de septiembre de 2024
- ↑ Sohn, Kihyuk (2016). "Aprendizaje métrico profundo mejorado con objetivo de pérdida de N pares multiclase" . Avances en sistemas de procesamiento de información neuronal . 29. Curran Associates, Inc.
- ↑ Zhai, Xiaohua; Mustafa, Basil; Kolesnikov, Alexander; Beyer, Lucas (2023). Pérdida sigmoide para el preentrenamiento de imágenes de lenguaje . Conferencia internacional IEEE/CVF sobre visión por computadora (ICCV). págs. 11975–11986 .
- ↑ Liu, Zhuang; Mao, Hanzi; Wu, Chao-Yuan; Feichtenhofer, Christoph; Darrell, Trevor; Xie, Saining (2022). Una red neuronal convolucional para la década de 2020. Conferencia IEEE/CVF sobre visión por computadora y reconocimiento de patrones (CVPR). págs. 11976–11986 .
- 1 2 Ilharco, Gabriel; Wortsman, Mitchell; Wightman, Ross; Gordon, Cade; Carlini, Nicolás ; Taori, Rohan; Dave, Achal; Shankar, Vaishaal; Namkoong, Hongseok (julio de 2021), "OpenCLIP" , Zenodo , Bibcode : 2021zndo...5143773I , doi : 10.5281/zenodo.5143773 , consultado el 6 de septiembre de 2024
- 1 2 Radford, Alec; Kim, Jong Wook; Hallacy, Chris; Ramesh, Aditya; Goh, Gabriel; Agarwal, Sandhini; Sastry, Girish; Askell, Amanda; Mishkin, Pamela; Clark, Jack; Krueger, Gretchen; Sutskever, Ilya (2021). "Learning Transferable Visual Models From Natural Language Supervision". arXiv : 2103.00020 [ cs.CV ].
- ^ openai/CLIP , OpenAI, 6 de septiembre de 2024 , consultado el 6 de septiembre de 2024
- ↑ Dosovitskiy, Alexey; Beyer, Lucas; Kolesnikov, Alejandro; Weissenborn, Dirk; Zhai, Xiaohua; Unterthiner, Thomas; Dehghani, Mostafa; Minderer, Matías; Heigold, Georg; Gelly, Sylvain; Uszkoreit, Jakob (3 de junio de 2021). "Una imagen vale 16 x 16 palabras: transformadores para el reconocimiento de imágenes a escala". arXiv : 2010.11929 [ cs.CV ].
- ↑ Él, Kaiming; Zhang, Xiangyu; Ren, Shaoqing; Sun, Jian (10 de diciembre de 2015). Aprendizaje residual profundo para el reconocimiento de imágenes . arXiv : 1512.03385 .
- ↑ He, Tong; Zhang, Zhi; Zhang, Hang; Zhang, Zhongyue; Xie, Junyuan; Li, Mu (2018-12-05). "Bag of Tricks for Image Classification with Convolutional Neural Networks". arXiv : 1812.01187 [ cs.CV ].
- ↑ Zhang, Richard (27 de septiembre de 2018). "Haciendo que las redes neuronales convolucionales sean nuevamente invariantes a los cambios" . Actas de la 36.ª Conferencia Internacional sobre Aprendizaje Automático .
- ↑ Zhang, Richard (2019-06-08). "Haciendo que las redes convolucionales sean nuevamente invariantes a los cambios". arXiv : 1904.11486 [ cs.CV ].
- 1 2 3 Jia, Chao; Yang, Yinfei; Xia, Ye; Chen, Yi-Ting; Parekh, Zarana; Pham, Hieu; Le, Quoc; Sung, Yun-Hsuan; Li, Zhen; Duerig, Tom (2021-07-01). "Ampliación del aprendizaje de representación visual y de lenguaje de visión con supervisión de texto ruidoso" . Actas de la 38.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 4904–4916 .
- ↑ Tan, Mingxing; Le, Quoc V. (2020-09-11). "EfficientNet: Repensando el escalado de modelos para redes neuronales convolucionales". arXiv : 1905.11946 [ cs.LG ].
- ↑ Radford, Alec; Wu, Jeff; Child, R.; Luan, D.; Amodei, Dario; Sutskever, I. (2019). "Los modelos de lenguaje son aprendices multitarea no supervisados". OpenAI . S2CID 160025533 .
- ↑ Srinivasan, Krishna; Raman, Karthik; Chen, Jiecao; Bendersky, Michael; Najork, Marc (11 de julio de 2021). "WIT: Conjunto de datos de texto e imágenes basado en Wikipedia para el aprendizaje automático multimodal y multilingüe". Actas de la 44.ª Conferencia Internacional ACM SIGIR sobre Investigación y Desarrollo en Recuperación de Información . págs. 2443–2449 . arXiv : 2103.01913 . doi : 10.1145 /3404835.3463257 . ISBN 978-1-4503-8037-9.
- ↑ "std y media para la normalización de imágenes diferente de ImageNet · Problema n.° 20 · openai/CLIP" . GitHub . Consultado el 19 de septiembre de 2024 .
- ↑ Sharma, Piyush; Ding, Nan; Goodman, Sebastian; Soricut, Radu (julio de 2018). Gurevych, Iryna; Miyao, Yusuke (eds.). "Conceptual Captions: A Cleaned, Hypernymed, Image Alt-text Dataset For Automatic Image Captioning" . Actas de la 56.ª Reunión Anual de la Asociación de Lingüística Computacional (Volumen 1: Artículos extensos) . Melbourne, Australia: Asociación de Lingüística Computacional: 2556–2565 . doi : 10.18653/v1/P18-1238 .
- ↑ Cherti, Mehdi; Beaumont, Romain; Wightman, Ross; Wortsman, Mitchell; Ilharco, Gabriel; Gordon, Cade; Schuhmann, Christoph; Schmidt, Ludwig; Jitsev, Jenia (junio de 2023). «Leyes de escalado reproducibles para el aprendizaje contrastivo de lenguaje e imagen». Conferencia IEEE/CVF de 2023 sobre visión por computadora y reconocimiento de patrones (CVPR) . págs. 2818–2829 . arXiv : 2212.07143 . doi : 10.1109/CVPR52729.2023.00276 . ISBN 979-8-3503-0129-8.
- ↑ Touvron, Hugo; Vedaldi, Andrea; Douze, Matthijs; Jegou, Herve (2019). "Corrección de la discrepancia en la resolución de entrenamiento y prueba" . Advances in Neural Information Processing Systems . 32. Curran Associates, Inc.
- ↑ "laion/CLIP-ViT-L-14-laion2B-s32B-b82K · Hugging Face" . huggingface.co . 10-09-2023 . Consultado el 06-09-2024 .
- ^ Hendriksen, Mariya; Bleeker, Maurits; Vakulenko, Svitlana; van Noord, Nanne; Kuiper, Ernst; de Rijke, Maarten (2021). "Ampliación de CLIP para la recuperación de categoría a imagen en el comercio electrónico". arXiv : 2112.11294 [ cs.CV ].
- ↑ Beaumont, Romain (2024-09-07), rom1504/clip-retrieval , consultado el 2024-09-08
- ↑ Haltakov, Vladimir (2024-09-03), haltakov/natural-language-image-search , consultado el 2024-09-06
- ↑ Alayrac, Jean-Baptiste; Donahue, Jeff; Luc, Pauline; Miech, Antoine; Barr, Iain; Hasson, Yana; Lenc, Karel; Mensch, Arthur; Millican, Katherine; Reynolds, Malcolm; Ring, Roman; Rutherford, Eliza; Cabi, Serkan; Han, Tengda; Gong, Zhitao (2022-12-06). "Flamingo: un modelo de lenguaje visual para el aprendizaje con pocos ejemplos" . Advances in Neural Information Processing Systems . 35 : 23716–23736 .
- ↑ Brock, Andy; De, Soham; Smith, Samuel L.; Simonyan, Karen (1 de julio de 2021). "Reconocimiento de imágenes a gran escala de alto rendimiento sin normalización" . Actas de la 38.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 1059–1071 .
- ↑ Ramesh, Aditya; Dhariwal, Prafulla; Nichol, Alex; Chu, Casey; Chen, Mark (2022-04-12). "Generación jerárquica de imágenes condicionales de texto con latentes CLIP". arXiv : 2204.06125 [ cs.CV ].
- ^ Hendriksen, Mariya; Bleeker, Maurits; Vakulenko, Svitlana; van Noord, Nanne; Kuiper, Ernst; de Rijke, Maarten (2022). "Ampliación de CLIP para la recuperación de categoría a imagen en el comercio electrónico" . En Hagen, Matías; Verberne, Suzan; Macdonald, Craig; Seifert, Christin; Balog, Krisztian; Nørvåg, Kjetil; Setty, Vinay (eds.). Avances en la recuperación de información . Apuntes de conferencias sobre informática. vol. 13185. Cham: Springer International Publishing. págs. 289– 303. doi : 10.1007/978-3-030-99736-6_20 . ISBN 978-3-030-99736-6.
- ↑ Whitaker, Jonathan (22 de mayo de 2022). "Diversión con autómatas celulares neuronales" . W&B . Recuperado el 8 de septiembre de 2024 .
- ↑ LAION-AI/predictor estético , LAION AI, 6 de septiembre de 2024 , consultado el 8 de septiembre de 2024
- ↑ Mokady, Ron; Hertz, Amir; Bermano, Amit H. (2021). "ClipCap: Prefijo CLIP para subtítulos de imágenes". arXiv : 2111.09734 [ cs.CV ].
Enlaces externos
- Página web de CLIP de OpenAI
- OpenCLIP: Una implementación de código abierto de CLIP
- Arora, Aman (2023-03-11). "The Annotated CLIP (Part-2)" . amaarora.github.io . Recuperado el 2024-09-11 .
- Aprendizaje automático
- Redes neuronales artificiales
- visión por computadora
- Procesamiento del lenguaje natural