Articulo de referencia

aprendizaje multimodal

El aprendizaje multimodal es un tipo de aprendizaje profundo que integra y procesa múltiples tipos de datos, denominados modalidades , como texto, audio, imágenes o vídeo. Esta ...

El aprendizaje multimodal es un tipo de aprendizaje profundo que integra y procesa múltiples tipos de datos, denominados modalidades , como texto, audio, imágenes o vídeo. Esta integración permite una comprensión más holística de datos complejos, mejorando el rendimiento del modelo en tareas como la respuesta visual a preguntas, la recuperación multimodal , [ 1 ] la generación de texto a imagen, [ 2 ] la clasificación estética [ 3 ] y la generación de subtítulos para imágenes. [ 4 ]

El aprendizaje multimodal se propuso en 2011 al comienzo del período del aprendizaje profundo. [ 5 ] Los grandes modelos multimodales , como Google Gemini y GPT-4o , se han vuelto cada vez más populares desde 2023, lo que permite una mayor versatilidad y una comprensión más amplia de los fenómenos del mundo real. [ 6 ]

Motivación

Los datos suelen presentarse en diferentes modalidades que transmiten información distinta. Por ejemplo, es muy común añadir un pie de foto a una imagen para comunicar información que no se muestra directamente en ella. Del mismo modo, a veces resulta más sencillo utilizar una imagen para describir información que no es evidente a partir de un texto. En consecuencia, si aparecen palabras diferentes en imágenes similares, es probable que describan lo mismo. Por el contrario, si una palabra se utiliza para describir imágenes aparentemente distintas, estas imágenes podrían representar el mismo objeto. Por lo tanto, en el caso de datos multimodales, es importante utilizar un modelo capaz de representar la información de forma conjunta, de manera que pueda capturar la información combinada de las diferentes modalidades.

transformadores multimodales

Multimodalidad significa tener múltiples modalidades, donde una " modalidad " se refiere a un tipo de entrada o salida, como video, imagen, audio, texto, propiocepción , etc. [ 7 ] Por ejemplo, el modelo Google PaLM se ajustó a un modelo multimodal y se aplicó al control robótico . [ 8 ] Los modelos LLaMA también se han vuelto multimodales usando el método de tokenización, para permitir entradas de imágenes, [ 9 ] y entradas de video. [ 10 ] GPT-4o puede procesar y generar texto, audio e imágenes. [ 11 ]

Un método común para crear modelos multimodales a partir de un LLM es "tokenizar" la salida de un codificador entrenado. Concretamente, se puede construir un LLM que pueda entender imágenes de la siguiente manera: tomar un LLM entrenado y tomar un codificador de imágenes entrenado.mi{\displaystyle E}. Construye un pequeño perceptrón multicapaF{\displaystyle f}, de modo que para cualquier imageny{\displaystyle y}, el vector posprocesadoF(mi(y)){\displaystyle f(E(y))}tiene las mismas dimensiones que un token codificado. Eso es un "token de imagen". Luego, se pueden intercalar tokens de texto y tokens de imagen. El modelo compuesto se ajusta con precisión en un conjunto de datos de imagen-texto. Esta construcción básica se puede aplicar con mayor sofisticación para mejorar el modelo. El codificador de imagen se puede congelar para mejorar la estabilidad. [ 12 ] Este tipo de método, donde se fusionan incrustaciones de múltiples modalidades y el predictor se entrena en las incrustaciones combinadas, se llama fusión temprana .

Otro método, denominado fusión intermedia , implica que cada modalidad se procese primero de forma independiente para obtener representaciones específicas de cada modalidad; luego, estas representaciones intermedias se fusionan. [ 13 ] En general, la atención cruzada se utiliza para integrar información de diferentes modalidades. Por ejemplo, el modelo Flamingo utiliza capas de atención cruzada para inyectar información visual en su modelo de lenguaje preentrenado. [ 14 ]

Los transformadores también pueden utilizarse/adaptarse para modalidades (de entrada o salida) que van más allá del texto, normalmente encontrando una forma de "tokenizar" la modalidad.

Los modelos multimodales pueden entrenarse desde cero o mediante ajuste fino. Un estudio de 2022 encontró que los transformadores preentrenados solo en lenguaje natural pueden ajustarse con solo el 0,03 % de los parámetros y volverse competitivos con las LSTM en una variedad de tareas lógicas y visuales, demostrando el aprendizaje por transferencia . [ 15 ] El LLaVA era un modelo de visión-lenguaje compuesto por un modelo de lenguaje (Vicuna-13B) [ 16 ] y un modelo de visión ( ViT -L/14), conectados por una capa lineal. Solo la capa lineal está ajustada. [ 17 ]

Los transformadores de visión [ 18 ] adaptan el transformador a la visión por computadora descomponiendo las imágenes de entrada como una serie de parches, convirtiéndolos en vectores y tratándolos como un vector de incrustación de tokens en un transformador estándar.

Conformer [ 19 ] y posteriormente Whisper [ 20 ] siguen el mismo patrón para el reconocimiento de voz , primero convirtiendo la señal de voz en un espectrograma , que luego se trata como una imagen, es decir, se descompone en una serie de parches, se convierte en vectores y se trata como un vector de incrustación de tokens en un transformador estándar.

Los perceptores [ 21 ] [ 22 ] son ​​una variante de los transformadores diseñados para la multimodalidad.

Para la generación de imágenes, las arquitecturas notables son DALL-E 1 (2021), Parti (2022), [ 23 ] Phenaki (2023), [ 24 ] y Muse (2023). [ 25 ] A diferencia de los modelos posteriores, DALL-E no es un modelo de difusión . En cambio, utiliza un transformador solo decodificador que genera autorregresivamente un texto, seguido de la representación de token de una imagen, que luego es convertida por un autoencoder variacional en una imagen. [ 26 ] Parti es un transformador codificador-decodificador, donde el codificador procesa una indicación de texto y el decodificador genera una representación de token de una imagen. [ 27 ] Muse es un transformador solo codificador que está entrenado para predecir tokens de imagen enmascarados a partir de tokens de imagen sin enmascarar. Durante la generación, todos los tokens de entrada están enmascarados y las predicciones de mayor confianza se incluyen para la siguiente iteración, hasta que se predicen todos los tokens. [ 25 ] Phenaki es un modelo de texto a vídeo. Es un transformador enmascarado bidireccional condicionado a tokens de texto precalculados. Los tokens generados se decodifican posteriormente a un vídeo. [ 24 ]

Modelos como CLIP (Contrastive Language–Image Pretraining) aprenden representaciones conjuntas de imágenes y texto optimizando objetivos contrastivos, lo que permite al modelo relacionar imágenes con sus descripciones textuales correspondientes. [ 28 ]

Máquinas de Boltzmann profundas multimodales

Una máquina de Boltzmann es un tipo de red neuronal estocástica inventada por Geoffrey Hinton y Terry Sejnowski en 1985. Las máquinas de Boltzmann pueden considerarse la contraparte estocástica y generativa de las redes de Hopfield . Reciben su nombre de la distribución de Boltzmann en mecánica estadística. Las unidades en las máquinas de Boltzmann se dividen en dos grupos: unidades visibles y unidades ocultas. Cada unidad es como una neurona con una salida binaria que representa si está activada o no. [ 29 ] Las máquinas de Boltzmann generales permiten la conexión entre cualquier unidad. Sin embargo, el aprendizaje es poco práctico utilizando máquinas de Boltzmann generales porque el tiempo de cálculo es exponencial al tamaño de la máquina. [ 30 ] Una arquitectura más eficiente es la máquina de Boltzmann restringida, donde la conexión solo se permite entre la unidad oculta y la unidad visible, que se describe en la siguiente sección.

Las máquinas de Boltzmann profundas multimodales pueden procesar y aprender de diferentes tipos de información, como imágenes y texto, simultáneamente. Esto se puede lograr, en particular, mediante una máquina de Boltzmann profunda independiente para cada modalidad, por ejemplo, una para imágenes y otra para texto, unidas en una capa oculta superior adicional. [ 31 ]

Aplicaciones

El aprendizaje automático multimodal tiene numerosas aplicaciones en diversos ámbitos:

  • Recuperación multimodal : la recuperación multimodal permite a los usuarios buscar datos en diferentes modalidades (por ejemplo, recuperar imágenes a partir de descripciones de texto), lo que mejora los motores de búsqueda multimedia y los sistemas de recomendación de contenido. [ 32 ]
  • Clasificación y recuperación de datos faltantes : las máquinas de Boltzmann profundas multimodales superan a los modelos tradicionales como las máquinas de vectores de soporte y la asignación latente de Dirichlet en tareas de clasificación y pueden predecir datos faltantes en conjuntos de datos multimodales, como imágenes y texto.
  • Diagnóstico sanitario : los modelos multimodales integran imágenes médicas, datos genómicos y registros de pacientes para mejorar la precisión diagnóstica y la detección precoz de enfermedades, especialmente en la detección precoz del cáncer. [ 33 ] [ 34 ] [ 35 ]
  • Generación de contenido : modelos como DALL·E generan imágenes a partir de descripciones textuales, lo que beneficia a las industrias creativas, mientras que la recuperación multimodal permite búsquedas multimedia dinámicas. [ 36 ]
  • Robótica e interacción humano-computadora : el aprendizaje multimodal mejora la interacción en robótica e IA al integrar entradas sensoriales como el habla, la visión y el tacto, lo que ayuda a los sistemas autónomos y a la interacción humano-computadora .
  • Reconocimiento de emociones : al combinar datos visuales, de audio y de texto, los sistemas multimodales mejoran el análisis de sentimientos y el reconocimiento de emociones , y se aplican en el servicio al cliente, las redes sociales y el marketing.

Véase también

Referencias

  1. ^ Hendriksen, Mariya; Bleeker, Maurits; Vakulenko, Svitlana; van Noord, Nanne; Kuiper, Ernst; de Rijke, Maarten (2021). "Ampliación de CLIP para la recuperación de categoría a imagen en el comercio electrónico". arXiv : 2112.11294 [ cs.CV ].
  2. "Repositorio de difusión estable en GitHub" . CompVis - Grupo de Investigación en Visión Artificial y Aprendizaje, LMU Múnich. 17 de septiembre de 2022. Archivado del original el 18 de enero de 2023. Consultado el 17 de septiembre de 2022 .
  3. LAION-AI/predictor estético , LAION AI, 6 de septiembre de 2024 , consultado el 8 de septiembre de 2024
  4. Mokady, Ron; Hertz, Amir; Bermano, Amit H. (2021). "ClipCap: Prefijo CLIP para subtítulos de imágenes". arXiv : 2111.09734 [ cs.CV ].
  5. Ngiam, Jiquan; Khosla, Aditya; Kim, Mingyu; Nam, Juhan; Lee, Honglak; Ng, Andrew Y. (28 de junio de 2011). "Aprendizaje profundo multimodal" . Actas de la 28.ª Conferencia Internacional sobre Aprendizaje Automático (ICML'11). Madison, WI, EE. UU.: Omnipress: 689–696 . ISBN 978-1-4503-0619-5.
  6. Zia, Tehseen (8 de enero de 2024). "Presentación de grandes modelos multimodales: dando forma al panorama de los modelos de lenguaje en 2024" . Unite.ai . Consultado el 1 de junio de 2024 .
  7. Kiros, Ryan; Salakhutdinov, Ruslan; Zemel, Rich (18 de junio de 2014). "Modelos de lenguaje neuronal multimodales" . Actas de la 31.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 595–603 . Archivado del original el 2 de julio de 2023. Recuperado el 2 de julio de 2023 .
  8. ^ Seca, Danny; Xia, Fei; Sajjadi, Mehdi SM; Lynch, Corey; Chowdhery, Aakanksha; Ichter, Brian; Wahid, Ayzaan; Thompson, Jonathan; Vuong, Quan; Yu, Tianhe; Huang, Wenlong; Chebotar, Yevgen; Sermanet, Pierre; Duckworth, Daniel; Levine, Sergey (1 de marzo de 2023). "PaLM-E: un modelo de lenguaje multimodal incorporado" . ICML . 202 : 8469–8488 .
  9. ^ Liu, Haotian; Li, Chunyuan; Wu, Qingyang; Lee, Yong Jae (1 de abril de 2023). "Ajuste de instrucciones visuales". NeurIPS .
  10. Zhang, Hang; Li, Xin; Bing, Lidong (1 de junio de 2023). "Video-LLaMA: un modelo de lenguaje audiovisual ajustado a instrucciones para la comprensión de vídeo". EMNLP . arXiv : 2306.02858 .
  11. "OpenAI afirma que GPT-4o, un modelo multimodal nativo, procesa texto, imágenes y sonido, y emite lo mismo" . The Register . 13 de mayo de 2024.
  12. Li, Junnan; Li, Dongxu; Savarese, Silvio; Hoi, Steven (1 de enero de 2023). "BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models" . ICML . 202 : 19730–19742 .
  13. Kumar, Puneet; Khokher, Vedanti; Gupta, Yukti; Raman, Balasubramanian (2021). Enfoque híbrido basado en fusión para el reconocimiento multimodal de emociones con datos etiquetados insuficientes . pp. 314–318 . doi : 10.1109/ICIP42928.2021.9506714 . ISBN  978-1-6654-4115-5.
  14. Alayrac, Jean-Baptiste; Donahue, Jeff; Luc, Pauline; Miech, Antoine; Barr, Iain; Hasson, Yana; Lenc, Karel; Mensch, Arthur; Millican, Katherine; Reynolds, Malcolm; Ring, Roman; Rutherford, Eliza; Cabi, Serkan; Han, Tengda; Gong, Zhitao (6 de diciembre de 2022). "Flamingo: un modelo de lenguaje visual para el aprendizaje con pocos ejemplos" . Advances in Neural Information Processing Systems . 35 (12): 23716– 23736. arXiv : 2204.14198 . doi : 10.1093/nsr/ nwae403 . PMC 11645129. PMID 39679213 . Archivado del original el 2 de julio de 2023. Consultado el 2 de julio de 2023 .  
  15. Lu, Kevin; Grover, Aditya; Abbeel, Pieter; Mordatch, Igor (2022-06-28). "Transformadores preentrenados congelados como motores de computación universales" . Actas de la Conferencia AAAI sobre Inteligencia Artificial . 36 (7): 7628– 7636. doi : 10.1609/aaai.v36i7.20729 . ISSN 2374-3468 . Archivado del original el 2 de diciembre de 2024. Recuperado el 11 de agosto de 2024 . 
  16. "Vicuna: Un chatbot de código abierto que impresiona a GPT-4 con una calidad ChatGPT del 90%* | LMSYS Org" . lmsys.org . 30 de marzo de 2023. Archivado del original el 12 de agosto de 2024. Consultado el 11 de agosto de 2024 .
  17. ^ Liu, Haotian; Li, Chunyuan; Wu, Qingyang; Lee, Yong Jae (15 de diciembre de 2023). "Ajuste de instrucciones visuales" . Avances en los sistemas de procesamiento de información neuronal . vol. 36. págs. 34892– 34916. doi : 10.52202/075280-1516 . ISBN   978-1-7138-9911-2Archivado del original el 26/09/2024 . Consultado el 11/08/2024 .
  18. Dosovitskiy, Alexey; Beyer, Lucas; Kolesnikov, Alejandro; Weissenborn, Dirk; Zhai, Xiaohua; Unterthiner, Thomas; Dehghani, Mostafa; Minderer, Matías; Heigold, Georg; Gelly, Sylvain; Uszkoreit, Jakob (3 de junio de 2021). "Una imagen vale 16 x 16 palabras: transformadores para el reconocimiento de imágenes a escala". arXiv : 2010.11929 [ cs.CV ].
  19. ^ Gulati, Anmol; Qin, James; Chiu, Chung-Cheng; Parmar, Niki; Zhang, Yu; Yu, Jiahui; Han, Wei; Wang, Shibo; Zhang, Zhengdong; Wu, Yonghui; Pang, Ruoming (2020). "Conformador: transformador de convolución aumentada para reconocimiento de voz". arXiv : 2005.08100 [ eess.AS ].
  20. Radford, Alec; Kim, Jong Wook; Xu, Tao; Brockman, Greg; McLeavey, Christine; Sutskever, Ilya (2022). "Reconocimiento de voz robusto mediante supervisión débil a gran escala". arXiv : 2212.04356 [ eess.AS ].
  21. Jaegle, Andrew; Gimeno, Felix; Brock, Andrew; Zisserman, Andrew; Vinyals, Oriol; Carreira, Joao (22 de junio de 2021). "Perceiver: Percepción general con atención iterativa". arXiv : 2103.03206 [ cs.CV ].
  22. ^ Jaegle, Andrés; Borgeaud, Sebastián; Alayrac, Jean-Baptiste; Doersch, Carl; Ionescu, Catalín; Ding, David; Koppula, Skanda; Zoran, Daniel; Brock, Andrés; Shelhamer, Evan; Hénaff, Olivier (2 de agosto de 2021). "Perceiver IO: una arquitectura general para entradas y salidas estructuradas". arXiv : 2107.14795 [ cs.LG ].
  23. "Parti: Pathways Autoregressive Text-to-Image Model" . sites.research.google . Archivado del original el 10 de agosto de 2024. Consultado el 9 de agosto de 2024 .
  24. 1 2 Villegas, Rubén; Babaeizadeh, Mohammad; Kindermans, Pieter-Jan; Moraldo, Hernán; Zhang, Han; Saffar, Mohammad Taghi; Castro, Santiago; Kunze, Julio; Erhan, Dumitru (29 de septiembre de 2022). "Phenaki: generación de vídeos de duración variable a partir de descripciones textuales de dominio abierto". arXiv : 2210.02399 [ cs.CV ].
  25. 1 2 Chang, Huiwen; Zhang, Han; Barber, Jarred; Maschinot, AJ; Lezama, Jose; Jiang, Lu; Yang, Ming-Hsuan ; Murphy, Kevin; Freeman, William T. (2023-01-02). "Muse: Generación de texto a imagen mediante transformadores generativos enmascarados". arXiv : 2301.00704 [ cs.CV ].
  26. Ramesh, Aditya; Pavlov, Mikhail; Goh, Gabriel; Gray, Scott; Voss, Chelsea; Radford, Alec; Chen, Mark; Sutskever, Ilya (2021-02-26). "Generación de texto a imagen sin datos previos". arXiv : 2102.12092 [ cs.CV ].
  27. ^ Yu, Jiahui; Xu, Yuanzhong; Koh, Jing Yu; Luong, Thang; Baid, Gunjan; Wang, Zirui; Vasudevan, Vijay; Ku, Alejandro; Yang, Yinfei (21 de junio de 2022). "Escalado de modelos autorregresivos para la generación de texto a imagen rico en contenido". arXiv : 2206.10789 [ cs.CV ].
  28. Radford, Alec; Kim, Jong Wook; Hallacy, Chris; Ramesh, Aditya; Goh, Gabriel; Agarwal, Sandhini; Sastry, Girish; Askell, Amanda; Mishkin, Pamela; Clark, Jack; Krueger, Gretchen; Sutskever, Ilya (2021). "Learning Transferable Visual Models From Natural Language Supervision". arXiv : 2103.00020 [ cs.CV ].
  29. Dey, Victor (2021-09-03). "Guía para principiantes de la máquina de Boltzmann" . Analytics India Magazine . Recuperado el 2024-03-02 .
  30. Patel, Shuvam; Chen, Liang; Canoza, Peter; Salahuddin, Sayeef (2020). "Problemas de optimización de modelos de Ising en una máquina de Boltzmann restringida acelerada por FPGA". arXiv : 2008.04436 [ cs.ET ].
  31. "Aprendizaje multimodal con máquina de Boltzmann profunda" (PDF) . 2014. Archivado (PDF) del original el 21/06/2015 . Recuperado el 14/06/2015 .
  32. ^ Hendriksen, Mariya; Vakulenko, Svitlana; Kuiper, Ernst; de Rijke, Maarten (2023). "Recuperación intermodal de imagen y texto centrada en la escena versus centrada en el objeto: un estudio de reproducibilidad". arXiv : 2301.05174 [ cs.CV ].
  33. Quach, Katyanna. "Investigadores de Harvard crean un sistema de IA multimodal para predecir el cáncer" . The Register . Archivado del original el 20 de septiembre de 2022. Consultado el 16 de septiembre de 2022 .
  34. Chen, Richard J.; Lu, Ming Y.; Williamson, Drew FK; Chen, Tiffany Y.; Lipkova, Jana; Noor, Zahra; Shaban, Muhammad; Shady, Maha; Williams, Mane; Joo, Bumjin; Mahmood, Faisal (8 de agosto de 2022). " Análisis histológico-genómico integrador pancáncer mediante aprendizaje profundo multimodal" . Cancer Cell . 40 (8): 865–878.e6. doi : 10.1016/j.ccell.2022.07.004 . ISSN 1535-6108 . PMC 10397370. PMID 35944502. S2CID 251456162 .    
    • Comunicado de prensa del hospital universitario: "Nueva tecnología de IA integra múltiples tipos de datos para predecir los resultados del cáncer" . Brigham and Women's Hospital a través de medicalxpress.com . Archivado del original el 20 de septiembre de 2022. Consultado el 18 de septiembre de 2022 .
  35. Shi, Yuge; Siddharth, N.; Paige, Brooks; Torr, Philip HS (2019). "Autoencoders variacionales de mezcla de expertos para modelos generativos profundos multimodales". arXiv : 1911.03393 [ cs.LG ].
  36. Shi, Yuge; Siddharth, N.; Paige, Brooks; Torr, Philip HS (2019). "Autoencoders variacionales de mezcla de expertos para modelos generativos profundos multimodales". arXiv : 1911.03393 [ cs.LG ].