Articulo de referencia

LAION

LAION (acrónimo de Large-scale Artificial Intelligence Open Network ) es una organización alemana sin ánimo de lucro que crea modelos y conjuntos de datos de inteligencia artifi...

LAION (acrónimo de Large-scale Artificial Intelligence Open Network ) es una organización alemana sin ánimo de lucro que crea modelos y conjuntos de datos de inteligencia artificial de código abierto. [ 1 ] Es más conocida por publicar varios conjuntos de datos extensos de imágenes y subtítulos extraídos de la web que se han utilizado para entrenar varios modelos de conversión de texto a imagen de gran relevancia , como Stable Diffusion e Imagen . [ 2 ] [ 3 ]

En febrero de 2023, LAION fue nombrada en la demanda de Getty Images contra Stable Diffusion como parte no involucrada. [ 4 ] En abril de 2023, LAION fue demandada directamente por un fotógrafo alemán que quería que sus imágenes fueran eliminadas del conjunto de entrenamiento. [ 5 ] En septiembre de 2024, el Tribunal Regional de Hamburgo desestimó la demanda, en lo que se describió como un "fallo histórico sobre TDM [Excepciones para datos de entrenamiento de IA en Alemania y la UE en general. [ 6 ]

El 15 de abril de 2023, LAION y sus colaboradores lanzaron públicamente un chatbot asistente de IA de código abierto llamado OpenAssistant .

conjuntos de datos de imágenes

LAION ha publicado públicamente varios conjuntos de datos extensos de pares imagen-leyenda que han sido ampliamente utilizados por investigadores de IA. Los datos provienen de Common Crawl , un conjunto de datos de páginas web extraídas. Los desarrolladores buscaron etiquetas en el HTML extraído y trataron sus atributos alt como leyendas. Utilizaron CLIP para identificar y descartar imágenes cuyo contenido no parecía coincidir con sus leyendas. [ 7 ] LAION no aloja el contenido de las imágenes extraídas; en cambio, el conjunto de datos contiene URL que apuntan a las imágenes, las cuales los investigadores deben descargar por sí mismos. [ 8 ]<img>

El primer conjunto de datos de este tipo, LAION-400M, se publicó en agosto de 2021 y constaba de 400 millones de pares imagen-leyenda. Los pares se extrajeron de un subconjunto aleatorio de páginas web rastreadas por Common Crawl entre 2014 y 2021. [ 9 ] Fue un intento de recrear el proceso utilizado por OpenAI para recopilar los 400 millones de pares imagen-leyenda que utilizaron para entrenar el modelo CLIP; la empresa había optado por publicar el código y los pesos del modelo como código abierto, pero no su conjunto de datos de entrenamiento. [ 7 ] Imagen , un modelo de texto a imagen anunciado por Google Brain en 2022, se entrenó con LAION-400M en combinación con conjuntos de datos internos privados. [ 10 ]

Un sucesor de más de 5 mil millones de pares, LAION-5B, fue lanzado en marzo de 2022. [ 11 ] En el momento de su lanzamiento, era el conjunto de datos de pares imagen-leyenda más grande disponible gratuitamente que existía. [ 7 ] Su creación fue financiada por Doodlebot, Hugging Face y Stability AI , la empresa de IA detrás de la financiación del modelo de texto a imagen Stable Diffusion , que fue entrenado con él. [ 12 ]

Crítica

Varios estudios muestran que las imágenes de LAION-5B contienen pares de imágenes y textos problemáticos relacionados con violaciones, pornografía, estereotipos dañinos, insultos racistas y étnicos, y otros contenidos extremadamente problemáticos. [ 13 ] [ 14 ]

Una investigación de Bayerischer Rundfunk mostró que los conjuntos de datos de LAION, alojados en Hugging Face, contienen grandes cantidades de datos privados y sensibles recopilados de sitios web públicos. [ 15 ]

En diciembre de 2023, el Observatorio de Internet de Stanford publicó un informe sobre LAION-5B que encontró 3226 casos sospechosos de enlaces a material de abuso sexual infantil, de los cuales 1008 fueron validados externamente. En respuesta, LAION eliminó temporalmente LAION-5B y LAION-400M citando su "política de tolerancia cero para el contenido ilegal" y "una gran precaución". [ 16 ] En agosto de 2024, LAION publicó un conjunto de datos depurado llamado Re-LAION-5B. [ 17 ]

Asistente abierto

OpenAssistant era un asistente de chat de código abierto basado en inteligencia artificial (IA) que podía comprender tareas, interactuar con sistemas de terceros y recuperar información dinámicamente para hacerlo. El proyecto fue desarrollado por un grupo de voluntarios en colaboración con LAION. Uno de los objetivos del desarrollo incluía el acceso gratuito a grandes modelos de lenguaje que se pueden ejecutar localmente en hardware de consumo. [ 18 ] [ 19 ] El proyecto fue respaldado por un esfuerzo mundial de crowdsourcing que involucró a más de 13 500 voluntarios que han creado 600 000 puntos de datos generados por humanos. [ 19 ] [ 20 ] El proyecto ha sido cerrado desde entonces; sin embargo, los conjuntos de datos y los modelos siguen disponibles en Hugging Face .

Véase también

Referencias

  1. "Acerca de" . LAION.ai . Consultado el 26 de septiembre de 2022 .
  2. Edwards, Benj (15 de septiembre de 2022). "¿Han asimilado los generadores de imágenes de IA tu arte? Una nueva herramienta te permite comprobarlo" . Ars Technica .
  3. Newman, Marissa; Cantrill, Aggi (24 de abril de 2023). "El futuro de la IA depende de la base de datos gratuita de un profesor de secundaria" . Bloomberg News . Consultado el 24 de abril de 2023 .
  4. "Getty Images (US), Inc. v. Stability AI, Inc., 1:23-cv-00135" . CourtListener . Consultado el 8 de febrero de 2023 .
  5. "Un fotógrafo intentó que eliminaran sus fotos de un conjunto de datos de IA. En su lugar, recibió una factura" . Vice . 28 de abril de 2023. Consultado el 4 de mayo de 2023 .
  6. Goldstein, Paul ; Stuetzle, Christiane; Bischoff, Susan (13 de noviembre de 2024). "Kneschke vs. LAION: Sentencia histórica sobre las excepciones de TDM para datos de entrenamiento de IA – Parte 1" . Blog de derechos de autor de Kluwer . Consultado el 25 de noviembre de 2024 .
  7. 1 2 3 Alford, Anthony (17 de mayo de 2022). "LAION lanza el conjunto de datos de cinco mil millones de pares de imágenes y texto LAION-5B" . InfoQ .
  8. Edwards, Benj (21 de septiembre de 2022). "Artista encuentra fotos de historiales médicos privados en un popular conjunto de datos de entrenamiento de IA" . Ars Technica .
  9. Schuhmann, Christoph (8 de agosto de 2021). "Conjunto de datos abiertos LAION-400 millones" . Blog de LAION . Consultado el 26 de septiembre de 2022 .
  10. ^ Sahara, Chitwan; Chan, William; Saxena, Saurabh; Li, Lala; Vaya, Jay; Denton, Emily; Kamyar Seyed Ghasemipour, Seyed; Karagol Ayan, Burcu; Sara Mahdavi, S.; Gontijo Lopes, Rapha; Salimans, Tim; Hola, Jonatán; Flota J, David; Norouzi, Mohammad (23 de mayo de 2022). "Modelos fotorrealistas de difusión de texto a imagen con comprensión profunda del lenguaje". arXiv : 2205.11487 [ cs.CV ].
  11. Beaumont, Romain (3 de marzo de 2022). "LAION-5B: Una nueva era de conjuntos de datos multimodales abiertos a gran escala" . Blog de LAION .
  12. Wiggers, Kyle (12 de agosto de 2022). "Esta startup está liberando una IA similar a DALL-E 2, sin importar las consecuencias" . TechCrunch .
  13. Birhane, Abeba; Prabhu, Vinay Uday; Kahembwe, Emmanuel (2021). "Conjuntos de datos multimodales: misoginia, pornografía y estereotipos malignos". arXiv : 2110.01963 .{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  14. ^ Birhane, Abeba; Prabhu, Vinay; Han, Sang; Boddeti, Vishnu Naresh; Luccioni, Alexandra Sasha (6 de noviembre de 2023), Into the LAIONs Den: investigando el odio en conjuntos de datos multimodales , arXiv : 2311.03449
  15. Brunner, Katharina; Harlan, Elisa (7 de junio de 2023). "Todos somos materia prima para la IA" . Bayerischer Rundfunk .
  16. Cole, Samantha (20 de diciembre de 2023). "El mayor conjunto de datos que impulsa las imágenes de IA fue retirado tras el descubrimiento de material de abuso sexual infantil" . 404 Media . Recuperado el 22 de diciembre de 2023 .
  17. Belanger, Ashley (30 de agosto de 2024). "Una organización sin fines de lucro elimina contenido ilegal de un conjunto de datos de entrenamiento de IA controvertido" . Ars Technica . Recuperado el 31 de agosto de 2024 .
  18. Open-Assistant , LAION AI, 9 de marzo de 2023 , consultado el 9 de marzo de 2023
  19. 1 2 Köpf, Andreas; Kilcher, Yannic; von Rütte, Dimitri; Anagnostidis, Sotiris; Tam, Zhi-Rui; Stevens, Keith; Barhoum, Abdullah; Duc, Nguyen Minh; Stanley, Oliver; Nagyfi, Richard; ES, Shahul; Suri, Sameer; Glushkov, David; Dantuluri, Arnav; Maguire, Andrés (14 de abril de 2023). "Conversaciones de OpenAssistant: democratización de la alineación del modelo de lenguaje grande". arXiv : 2304.07327 [ cs.CL ].
  20. "Asistente abierto: explore las posibilidades del desarrollo de chatbots abiertos y colaborativos" . KDnuggets . Consultado el 5 de mayo de 2023 .