Articulo de referencia

ImagenNet

El proyecto ImageNet es una gran base de datos visual diseñada para su uso en la investigación de software de reconocimiento de objetos visuales . Más de 14 millones [ 1 ] [ 2 ]...

El proyecto ImageNet es una gran base de datos visual diseñada para su uso en la investigación de software de reconocimiento de objetos visuales . Más de 14 millones [ 1 ] [ 2 ] de imágenes han sido anotadas manualmente por el proyecto para indicar qué objetos se muestran y en al menos un millón de imágenes, también se proporcionan cuadros delimitadores. [ 3 ] ImageNet contiene más de 20 000 categorías, [ 2 ] con una categoría típica, como "globo" o "fresa", que consta de varios cientos de imágenes. [ 4 ] La base de datos de anotaciones de URL de imágenes de terceros está disponible gratuitamente directamente desde ImageNet, aunque las imágenes reales no son propiedad de ImageNet. [ 5 ] Desde 2010, el proyecto ImageNet organiza un concurso anual de software, el ImageNet Large Scale Visual Recognition Challenge ( ILSVRC ), donde los programas de software compiten para clasificar y detectar correctamente objetos y escenas. El desafío utiliza una lista "recortada" de mil clases no superpuestas. [ 6 ]

Historia

La investigadora de IA Fei-Fei Li comenzó a trabajar en la idea de ImageNet en 2006. En un momento en que la mayor parte de la investigación en IA se centraba en modelos y algoritmos, Li quería ampliar y mejorar los datos disponibles para entrenar algoritmos de IA. [ 7 ] En 2007, Li se reunió con la profesora de Princeton Christiane Fellbaum , una de las creadoras de WordNet , para discutir el proyecto. Como resultado de esta reunión, Li construyó ImageNet a partir de los aproximadamente 22 000 sustantivos de WordNet y utilizando muchas de sus características. [ 8 ] También se inspiró en una estimación de 1987 [ 9 ] que indicaba que la persona promedio reconoce aproximadamente 30 000 tipos diferentes de objetos. [ 10 ]

Como profesor asistente en Princeton , Li reunió un equipo de investigadores para trabajar en el proyecto ImageNet. Utilizaron Amazon Mechanical Turk para ayudar con la clasificación de imágenes. El etiquetado comenzó en julio de 2008 y finalizó en abril de 2010. Se necesitaron 49 000 trabajadores de 167 países para filtrar y etiquetar más de 160 millones de imágenes candidatas. [ 11 ] [ 8 ] [ 12 ] Tenían presupuesto suficiente para etiquetar cada una de las 14 millones de imágenes tres veces. [ 10 ]

El plan original contemplaba 10 000 imágenes por categoría, para un total de 40 000 categorías y 400 millones de imágenes, cada una verificada 3 veces. Descubrieron que los humanos pueden clasificar como máximo 2 imágenes por segundo. A este ritmo, se estimó que se necesitarían 19 años humanos de trabajo (sin descanso). [ 13 ]

Presentaron su base de datos por primera vez como póster en la Conferencia de Visión por Computadora y Reconocimiento de Patrones (CVPR) de 2009 en Florida, titulada "ImageNet: Una vista previa de un conjunto de datos jerárquico a gran escala". [ 14 ] [ 8 ] [ 15 ] [ 16 ] El póster se reutilizó en la Vision Sciences Society 2009. [ 17 ]

En 2009, Alex Berg sugirió añadir la localización de objetos como tarea. Li se puso en contacto con el concurso PASCAL Visual Object Classes en 2009 para colaborar. Esto dio lugar al posterior ImageNet Large Scale Visual Recognition Challenge , que comenzó en 2010 y que cuenta con 1000 clases y localización de objetos, en comparación con PASCAL VOC , que solo tenía 20 clases y 19 737 imágenes (en 2010). [ 6 ] [ 8 ]

Importancia para el aprendizaje profundo

El 30 de septiembre de 2012, una red neuronal convolucional (CNN) llamada AlexNet [ 18 ] logró un error top-5 del 15,3 % en el ImageNet 2012 Challenge, más de 10,8 puntos porcentuales inferior al del segundo clasificado. El uso de redes neuronales convolucionales fue factible gracias al uso de unidades de procesamiento gráfico (GPU) durante el entrenamiento, [ 18 ] un ingrediente esencial de la revolución del aprendizaje profundo . Según The Economist , «De repente, la gente empezó a prestar atención, no solo dentro de la comunidad de IA sino en toda la industria tecnológica». [ 4 ] [ 19 ] [ 20 ]

En 2015, AlexNet fue superada por la CNN muy profunda de Microsoft con más de 100 capas, que ganó el concurso ImageNet 2015, con un error del 3,57% en el conjunto de prueba. [ 21 ]

Andrej Karpathy estimó en 2014 que con un esfuerzo concentrado, podría alcanzar una tasa de error del 5,1%, y ~10 personas de su laboratorio alcanzaron ~12-13% con menos esfuerzo. [ 22 ] [ 23 ] Se estimó que con el máximo esfuerzo, un ser humano podría alcanzar el 2,4%. [ 6 ]

Conjunto de datos

ImageNet utiliza la colaboración colectiva para su proceso de anotación. Las anotaciones a nivel de imagen indican la presencia o ausencia de una clase de objeto en una imagen, como por ejemplo "hay tigres en esta imagen" o "no hay tigres en esta imagen". Las anotaciones a nivel de objeto proporcionan un cuadro delimitador alrededor de la parte visible del objeto indicado. ImageNet utiliza una variante del esquema WordNet para categorizar objetos, complementado con 120 categorías de razas de perros para mostrar una clasificación más detallada. [ 6 ]

En 2012, ImageNet fue el mayor usuario académico de Mechanical Turk del mundo . El trabajador promedio identificó 50 imágenes por minuto. [ 2 ]

El plan original de ImageNet completo tendría aproximadamente 50 millones de imágenes limpias, diversas y de resolución completa distribuidas en aproximadamente 50 000 synsets. [ 15 ] Esto no se logró.

Las estadísticas resumidas presentadas el 30 de abril de 2010: [ 24 ]

  • Número total de synsets no vacíos: 21841
  • Número total de imágenes: 14.197.122
  • Número de imágenes con anotaciones de cuadros delimitadores: 1.034.908
  • Número de conjuntos de sinónimos con características SIFT: 1000
  • Número de imágenes con características SIFT: 1,2 millones

Categorías

Las categorías de ImageNet se filtraron a partir de los conceptos de WordNet. Dado que cada concepto puede contener múltiples sinónimos (por ejemplo, "gatito" y "gatito joven"), se denomina "conjunto de sinónimos" o " synset ". WordNet 3.0 contenía más de 100 000 synsets, la mayoría sustantivos (más de 80 000). El conjunto de datos de ImageNet los filtró a 21 841 synsets, que son sustantivos contables que pueden ilustrarse visualmente.

Cada synset en WordNet 3.0 tiene un "ID de WordNet" (wnid), que es una concatenación de la categoría gramatical y un "offset" (un número de identificación único ). Cada wnid comienza con "n" porque ImageNet solo incluye sustantivos . Por ejemplo, el wnid del synset " perro, perro doméstico, Canis familiaris " es "n02084071". [ 25 ]

Las categorías en ImageNet se dividen en 9 niveles, desde el nivel 1 (como "mamífero") hasta el nivel 9 (como "pastor alemán"). [ 13 ]

Formato de imagen

Las imágenes se extrajeron de búsquedas de imágenes en línea ( Google , Picsearch , MSN , Yahoo , Flickr , etc.) utilizando sinónimos en varios idiomas. Por ejemplo: pastor alemán, perro policía alemán, perro pastor alemán, alsaciano, ovejero alemán, pastore tedesco, 德国牧羊犬. [ 26 ]

ImageNet consta de imágenes en formato RGB con resoluciones variables. Por ejemplo, en ImageNet 2012, en la categoría "peces", la resolución varía de 4288 x 2848 a 75 x 56. En el aprendizaje automático, estas imágenes suelen preprocesarse para obtener una resolución constante estándar y se blanquean antes de su posterior procesamiento mediante redes neuronales.

Por ejemplo, en PyTorch, las imágenes de ImageNet se normalizan por defecto dividiendo los valores de los píxeles para que se encuentren entre 0 y 1, luego restando [0,485, 0,456, 0,406] y, finalmente, dividiendo entre [0,229, 0,224, 0,225]. Estos son la media y la desviación estándar de ImageNet, por lo que esto blanquea los datos de entrada. [ 27 ]

Etiquetas y anotaciones

Cada imagen está etiquetada con un único wnid.

Las características SIFT densas (descriptores SIFT sin procesar, palabras clave cuantificadas y coordenadas de cada descriptor/palabra clave) para ImageNet-1K estaban disponibles para su descarga, diseñadas para bolsa de palabras visuales . [ 28 ]

Los cuadros delimitadores de los objetos estaban disponibles para unos 3000 conjuntos de sinónimos populares [ 29 ] con un promedio de 150 imágenes en cada conjunto de sinónimos. [ 30 ]

Además, algunas imágenes tienen atributos. Publicaron 25 atributos para ~400 synsets populares: [ 31 ] [ 32 ]

  • Color : negro, azul, marrón, gris, verde, naranja, rosa, rojo, violeta, blanco, amarillo
  • Patrón : moteado, rayado
  • Forma : larga, redonda, rectangular, cuadrada
  • Textura : peluda, lisa, áspera, brillante, metálica, vegetal, amaderada, húmeda

ImageNet-21K

El conjunto de datos original completo se denomina ImageNet-21K. ImageNet-21K contiene 14.197.122 imágenes divididas en 21.841 clases. Algunos artículos lo resumen y lo denominan ImageNet-22K. [ 33 ]

La versión completa de ImageNet-21k se publicó en otoño de 2011. fall11_whole.tarNo existe una división oficial de entrenamiento, validación y prueba para ImageNet-21k. Algunas clases contienen solo entre 1 y 10 muestras, mientras que otras contienen miles. [ 33 ]

ImageNet-1K

Existen varios subconjuntos del conjunto de datos ImageNet que se utilizan en diversos contextos, a veces denominados "versiones". [ 18 ]

Uno de los subconjuntos más utilizados de ImageNet es el conjunto de datos de clasificación y localización de imágenes del "Desafío de Reconocimiento Visual a Gran Escala de ImageNet (ILSVRC) 2012-2017". En la literatura científica también se le conoce como ImageNet-1K o ILSVRC2017, en referencia al desafío ILSVRC original que incluía 1000 clases. ImageNet-1K contiene 1 281 167 imágenes de entrenamiento, 50 000 imágenes de validación y 100 000 imágenes de prueba. [ 34 ]

Cada categoría en ImageNet-1K es una categoría hoja, lo que significa que no hay nodos hijos debajo de ella, a diferencia de ImageNet-21K. Por ejemplo, en ImageNet-21K, hay algunas imágenes categorizadas simplemente como "mamífero", mientras que en ImageNet-1K, solo hay imágenes categorizadas como cosas como "pastor alemán", ya que no hay palabras hijas debajo de "pastor alemán". [ 26 ]

Desarrollos posteriores

En WordNet, sobre la cual se construyó ImageNet, había 2832 conjuntos de sinónimos en el subárbol "persona". Durante el período 2018-2020, eliminaron la descarga de ImageNet-21k mientras realizaban un filtrado exhaustivo en estos conjuntos de sinónimos de personas. De estos 2832 conjuntos de sinónimos, 1593 se consideraron "potencialmente ofensivos". De los 1239 restantes, 1081 se consideraron no realmente "visuales". El resultado fue que solo quedaron 158 conjuntos de sinónimos. De estos, solo 139 contenían más de 100 imágenes para "exploración adicional". [ 12 ] [ 35 ] [ 36 ]

En el invierno de 2021, se actualizó ImageNet-21k. Se eliminaron 2702 categorías en el subárbol "persona" para evitar "comportamientos problemáticos" en un modelo entrenado. El resultado fue que solo quedaron 130 synsets en el subárbol "persona". Además, en 2021, se actualizó ImageNet-1k difuminando los rostros que aparecían en las 997 categorías que no eran personas. Encontraron que, de las 1.431.093 imágenes en ImageNet-1k, 243.198 imágenes (17%) contienen al menos un rostro. Y el número total de rostros asciende a 562.626. Encontraron que entrenar modelos en el conjunto de datos con estos rostros difuminados causó una pérdida mínima en el rendimiento. [ 37 ] [ 38 ]

ImageNet-C es una versión de ImageNet perturbada adversariamente construida en 2019. [ 39 ]

ImageNetV2 era un nuevo conjunto de datos que contenía tres conjuntos de prueba con 10.000 cada uno, construido con la misma metodología que el ImageNet original. [ 40 ]

ImageNet-21K-P fue un subconjunto filtrado y depurado de ImageNet-21K, con 12.358.688 imágenes de 11.221 categorías. Todas las imágenes se redimensionaron a 224 x 224 píxeles. [ 33 ]

Historia del desafío ImageNet

Historial de tasa de error en ImageNet (mostrando el mejor resultado por equipo y hasta 10 participaciones por año). La participación de AlexNet de 2012 es claramente visible.

El ILSVRC pretende "seguir los pasos" del desafío PASCAL VOC , de menor escala , establecido en 2005, que contenía solo unas 20 000 imágenes y veinte clases de objetos. [ 6 ] Para "democratizar" ImageNet, Fei-Fei Li propuso al equipo de PASCAL VOC una colaboración, que comenzó en 2010, en la que los equipos de investigación evaluarían sus algoritmos en el conjunto de datos proporcionado y competirían para lograr una mayor precisión en varias tareas de reconocimiento visual. [ 8 ]

La competición anual resultante se conoce ahora como ImageNet Large Scale Visual Recognition Challenge (ILSVRC). El ILSVRC utiliza una lista "reducida" de solo 1000 categorías o "clases" de imágenes, incluidas 90 de las 120 razas de perros clasificadas por el esquema completo de ImageNet. [ 6 ]

En la década de 2010 se produjo un progreso espectacular en el procesamiento de imágenes.

La primera competición en 2010 contó con 11 equipos participantes. El equipo ganador fue una máquina de vectores de soporte lineal (SVM). Las características son una cuadrícula densa de HoG y LBP , dispersada mediante codificación de coordenadas locales y agrupación. [ 41 ] Logró una precisión de clasificación del 52,9 % y una precisión top-5 del 71,8 %. Fue entrenada durante 4 días en tres máquinas de 8 núcleos (doble CPU Intel Xeon  de cuatro núcleos a 2 GHz ). [ 42 ]

La segunda competición en 2011 tuvo menos equipos, con otro SVM ganando con una tasa de error top-5 del 25%. [ 10 ] El equipo ganador fue XRCE de Florent Perronnin, Jorge Sánchez. El sistema era otro SVM lineal, que se ejecutaba en vectores de Fisher cuantizados [ 43 ] . [ 44 ] [ 45 ] Logró una precisión top-5 del 74,2%.

En 2012, una red neuronal convolucional profunda llamada AlexNet logró una precisión del 84,7 % en los 5 primeros puestos, un gran avance. [ 46 ] El segundo lugar fue para Oxford VGG, que utiliza la arquitectura genérica anterior de SVM, SIFT, estadísticas de color, vectores de Fisher, etc. [ 47 ] En los siguientes dos años, la precisión en los 5 primeros puestos aumentó a más del 90 %. Si bien el avance de 2012 "combinó piezas que ya estaban presentes", la drástica mejora cuantitativa marcó el inicio de un auge de la inteligencia artificial en toda la industria. [ 4 ]

En 2013, la mayoría de las propuestas mejor clasificadas utilizaron redes neuronales convolucionales. La propuesta ganadora para la localización de objetos fue OverFeat , una arquitectura para la clasificación y localización simultánea de objetos. [ 48 ] La propuesta ganadora para la clasificación fue un conjunto de múltiples CNN de Clarifai. [ 6 ]

Para 2014, más de 50 instituciones participaron en el ILSVRC. [ 6 ] La entrada ganadora para clasificación fue GoogLeNet . [ 49 ] La entrada ganadora para localización fue VGGNet . En 2017, 29 de 38 equipos competidores tuvieron una precisión superior al 95 %. [ 50 ] En 2017 ImageNet declaró que lanzaría un nuevo desafío, mucho más difícil, en 2018 que implica clasificar objetos 3D usando lenguaje natural. Debido a que crear datos 3D es más costoso que anotar una imagen 2D preexistente, se espera que el conjunto de datos sea más pequeño. Las aplicaciones del progreso en esta área abarcarían desde la navegación robótica hasta la realidad aumentada . [ 1 ]

En 2015, la propuesta ganadora fue ResNet , que superó el rendimiento humano. [ 21 ] [ 51 ] Sin embargo, como señaló en 2015 una de las organizadoras del desafío, Olga Russakovsky , el ILSVRC solo tiene más de 1000 categorías; los humanos pueden reconocer un mayor número de categorías y también (a diferencia de los programas) pueden juzgar el contexto de una imagen. [ 52 ]

En 2016, la propuesta ganadora fue CUImage , un modelo de conjunto de 6 redes: Inception v3, Inception v4, Inception ResNet v2, ResNet 200, Wide ResNet 68 y Wide ResNet 3. [ 53 ] El segundo clasificado fue ResNeXt, que combina el módulo Inception con ResNet. [ 54 ]

En 2017, la propuesta ganadora fue la Red de Compresión y Excitación (SENet), que redujo el error top-5 al 2,251%. [ 55 ]

En 2017, los organizadores del concurso anunciaron que la edición de ese año sería la última, dado que el desafío ya se había superado y no representaba ningún reto. Asimismo, anunciaron que organizarían un nuevo concurso de imágenes 3D. [ 1 ] Sin embargo, dicho concurso nunca se concretó.

Sesgo en ImageNet

Se estima que más del 6 % de las etiquetas en el conjunto de validación ImageNet-1k son incorrectas. [ 56 ] También se ha descubierto que alrededor del 10 % de ImageNet-1k contiene etiquetas ambiguas o erróneas, y que, cuando se les presenta la predicción de un modelo y la etiqueta original de ImageNet, los anotadores humanos prefieren la predicción de un modelo de última generación de 2020 entrenado en la ImageNet original, lo que sugiere que ImageNet-1k se ha saturado. [ 57 ]

Un estudio de la historia de las múltiples capas ( taxonomía , clases de objetos y etiquetado) de ImageNet y WordNet en 2019 describió cómo el sesgo está profundamente arraigado en la mayoría de los enfoques de clasificación para todo tipo de imágenes. [ 58 ] [ 59 ] [ 60 ] [ 61 ] ImageNet está trabajando para abordar varias fuentes de sesgo. [ 62 ]

Una desventaja del uso de WordNet es que las categorías pueden ser más "sofisticadas" de lo que sería óptimo para ImageNet: "La mayoría de la gente está más interesada en Lady Gaga o en el iPod Mini que en este tipo raro de diplodocus ".

Véase también

Referencias

  1. 1 2 3 "Un nuevo desafío de visión artificial busca enseñar a los robots a ver en 3D" . New Scientist . 7 de abril de 2017. Consultado el 3 de febrero de 2018 .
  2. 1 2 3 Markoff, John (19 de noviembre de 2012). "Para imágenes web, crear nueva tecnología para buscar y encontrar" . The New York Times . Recuperado el 3 de febrero de 2018 .
  3. "ImageNet" . 7 de septiembre de 2020. Archivado del original el 7 de septiembre de 2020. Consultado el 11 de octubre de 2022 .
  4. 1 2 3 "Del no trabajo a las redes neuronales" . The Economist . 25 de junio de 2016. Consultado el 3 de febrero de 2018 .
  5. "Descripción general de ImageNet" . ImageNet . Consultado el 15 de octubre de 2022 .
  6. 1 2 3 4 5 6 7 8 Russakovsky, Olga; Deng, Jia; Su, Hao; Krause, Jonathan; Satheesh, Sanjeev; Mamá, Sean; Huang, Zhiheng; Karpathy, Andrej; Khosla, Aditya; Bernstein, Michael; Berg, Alejandro C.; Fei-Fei, Li (1 de diciembre de 2015). "Desafío de reconocimiento visual a gran escala de ImageNet" . Revista Internacional de Visión por Computadora . 115 (3): 211– 252. arXiv : 1409.0575 . doi : 10.1007/s11263-015-0816-y . ISSN 1573-1405 . 
  7. Hempel, Jesse (13 de noviembre de 2018). "La búsqueda de Fei-Fei Li para mejorar la IA para la humanidad" . Wired . Recuperado el 5 de mayo de 2019. Cuando Li, que había regresado a Princeton para aceptar un puesto como profesora asistente en 2007, habló sobre su idea para ImageNet, tuvo dificultades para conseguir que los miembros del profesorado la ayudaran. Finalmente, un profesor especializado en arquitectura de computadoras accedió a unirse a ella como colaborador.
  8. 1 2 3 4 5 Gershgorn, Dave (26 de julio de 2017). "Los datos que transformaron la investigación en IA, y posiblemente el mundo" . Quartz . Atlantic Media Co. Recuperado el 26 de julio de 2017. Tras leer sobre el enfoque de WordNet, Li se reunió con la profesora Christiane Fellbaum, una investigadora influyente en el trabajo continuo de WordNet, durante una visita a Princeton en 2006.
  9. Biederman, Irving (1987). "Reconocimiento por componentes: una teoría de la comprensión de imágenes humanas" . Psychological Review . 94 (2): 115– 117. doi : 10.1037/0033-295x.94.2.115 . ISSN 0033-295X . PMID 3575582 .  
  10. 1 2 3 Lee, Timothy B. (11 de noviembre de 2024). "Cómo un científico informático testarudo lanzó accidentalmente el auge del aprendizaje profundo" . Ars Technica . Recuperado el 12 de noviembre de 2024 .
  11. Li, Fei-Fei; Deng, Jia (2017). ¿ Dónde hemos estado? ¿Adónde vamos? (PDF) . Más allá del desafío de reconocimiento visual a gran escala de ImageNet, taller en CVPR 2017 (Presentación).
  12. 1 2 Yang, Kaiyu; Qinami, Klint; Fei-Fei, Li; Deng, Jia; Russakovsky, Olga (17 de septiembre de 2019). "Hacia conjuntos de datos más justos: filtrado y equilibrio de la distribución del subárbol de personas en la jerarquía de ImageNet" . image-net.org .
  13. 1 2 Li, FF. ImageNet. " Crowdsourcing, benchmarking y otras cosas interesantes ." CMU VASC Semin 16 (2010): 18-25.
  14. "CVPR 2009: Conferencia de la IEEE Computer Society sobre visión por computadora y reconocimiento de patrones" . tab.computer.org . Consultado el 13 de noviembre de 2024 .
  15. 1 2 Deng, Jia; Dong, Wei; Socher, Richard; Li, Li-Jia; Li, Kai; Fei-Fei, Li (2009), "ImageNet: Una base de datos jerárquica de imágenes a gran escala" (PDF) , Conferencia de 2009 sobre Visión por Computadora y Reconocimiento de Patrones , archivado del original (PDF) el 15 de enero de 2021 , recuperado el 26 de julio de 2017
  16. Li, Fei-Fei (23 de marzo de 2015), Cómo estamos enseñando a las computadoras a comprender imágenes , consultado el 16 de diciembre de 2018.
  17. Deng, Jia, et al. " Construcción y análisis de una ontología de imágenes a gran escala ." Vision Sciences Society 186.2 (2009).
  18. 1 2 3 Krizhevsky, Alex; Sutskever, Ilya; Hinton, Geoffrey E. (junio de 2017). "Clasificación de ImageNet con redes neuronales convolucionales profundas" (PDF) . Communications of the ACM . 60 (6): 84– 90. doi : 10.1145/3065386 . ISSN 0001-0782 . S2CID 195908774. Recuperado el 24 de mayo de 2017 .  
  19. "Las máquinas superan a los humanos en un número creciente de tareas" . Financial Times . 30 de noviembre de 2017. Consultado el 3 de febrero de 2018 .
  20. Gershgorn, Dave (18 de junio de 2018). "La historia interna de cómo la IA llegó a ser lo suficientemente buena como para dominar Silicon Valley" . Quartz . Consultado el 10 de diciembre de 2018 .
  21. 1 2 He, Kaiming; Zhang, Xiangyu; Ren, Shaoqing; Sun, Jian (2016). "Aprendizaje residual profundo para el reconocimiento de imágenes". Conferencia IEEE de 2016 sobre visión por computadora y reconocimiento de patrones (CVPR) . págs. 770–778 . arXiv : 1512.03385 . doi : 10.1109/CVPR.2016.90 . ISBN  978-1-4673-8851-1. S2CID 206594692 . 
  22. "Nuevas funciones comunitarias para Google Chat y una actualización de Currents" . Archivado del original el 22 de mayo de 2015.
  23. Karpathy, Andrej (2 de septiembre de 2014). "Lo que aprendí al competir contra una ConvNet en ImageNet" . Blog de Andrej Karpathy .
  24. "Resumen y estadísticas de ImageNet (actualizado el 30 de abril de 2010)" . 15 de enero de 2013. Archivado del original el 15 de enero de 2013. Consultado el 13 de noviembre de 2024 .
  25. "Documentación de la API de ImageNet" . 22 de enero de 2013. Archivado del original el 22 de enero de 2013. Consultado el 13 de noviembre de 2024 .
  26. 1 2 Berg, Alex, Jia Deng y L. Fei-Fei. " Desafío de reconocimiento visual a gran escala 2010 ". Noviembre de 2010.
  27. "Desviación estándar y media para la normalización de imágenes diferente de ImageNet · Problema n.° 20 · openai/CLIP" . GitHub . Consultado el 19 de septiembre de 2024 .
  28. "ImageNet" . 5 de abril de 2013. Archivado del original el 5 de abril de 2013. Consultado el 13 de noviembre de 2024 .
  29. https://web.archive.org/web/20181030191122/http://www.image-net.org/api/text/imagenet.sbow.obtain_synset_list
  30. "ImageNet" . Archivado del original el 5 de abril de 2013.
  31. "ImageNet" . Archivado del original el 22 de diciembre de 2019.
  32. Russakovsky, Olga; Fei-Fei, Li (2012). "Aprendizaje de atributos en conjuntos de datos a gran escala" . En Kutulakos, Kiriakos N. (ed.). Tendencias y temas en visión por computadora . Lecture Notes in Computer Science. Vol. 6553. Berlín, Heidelberg: Springer. pp. 1–14 . doi : 10.1007/978-3-642-35749-7_1 . ISBN   978-3-642-35749-7.
  33. 1 2 3 4 Ridnik, Tal; Ben-Baruch, Emanuel; Noy, Asaf; Zelnik-Manor, Lihi (5 de agosto de 2021). "Preentrenamiento de ImageNet-21K para las masas". arXiv : 2104.10972 [ cs.CV ].
  34. "ImageNet" . www.image-net.org . Consultado el 19 de octubre de 2022 .
  35. Yang, Kaiyu; Qinami, Klint; Fei-Fei, Li; Deng, Jia; Russakovsky, Olga (27 de enero de 2020). «Hacia conjuntos de datos más equitativos: Filtrado y equilibrio de la distribución del subárbol de personas en la jerarquía de ImageNet» . Actas de la Conferencia de 2020 sobre Equidad, Responsabilidad y Transparencia . ACM. págs. 547–558 . doi : 10.1145/3351095.3375709 . ISBN  978-1-4503-6936-7.
  36. "Búsqueda de premios de la NSF: Premio n.° 1763642" . www.nsf.gov . Consultado el 7 de junio de 2025 .
  37. "Actualización del sitio web y el conjunto de datos de ImageNet" . www.image-net.org . Consultado el 13 de noviembre de 2024 .
  38. Yang, Kaiyu; Yau, Jacqueline H.; Fei-Fei, Li; Deng, Jia; Russakovsky, Olga (28 de junio de 2022). "Un estudio de la ofuscación facial en ImageNet" . Actas de la 39.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 25313–25330 .
  39. Hendrycks, Dan; Dietterich, Thomas (2019). "Benchmarking Neural Network Robustness to Common Corruptions and Perturbations". arXiv : 1903.12261 [ cs.LG ].
  40. Recht, Benjamin; Roelofs, Rebecca; Schmidt, Ludwig; Shankar, Vaishaal (24 de mayo de 2019). "¿Los clasificadores de ImageNet se generalizan a ImageNet?" . Actas de la 36.ª Conferencia Internacional sobre Aprendizaje Automático . PMLR: 5389–5400 .
  41. Clasificación de ImageNet: codificación rápida de descriptores y entrenamiento de SVM a gran escala
  42. ^ Lin, Yuanqing; Lv, Fengjun; Zhu, Shenghuo; Yang, Ming; Cour, Timoteo; Yu, Kai; Cao, Liangliang; Huang, Thomas (junio de 2011). "Clasificación de imágenes a gran escala: extracción rápida de funciones y entrenamiento SVM" . CVPR 2011 . IEEE. págs. 1689-1696 . doi : 10.1109/cvpr.2011.5995477 . ISBN  978-1-4577-0394-2.
  43. Sánchez, Jorge; Perronnin, Florent (junio de 2011). «Compresión de firmas de alta dimensión para la clasificación de imágenes a gran escala» . CVPR 2011. IEEE. págs. 1665–1672 . doi : 10.1109/cvpr.2011.5995504 . ISBN  978-1-4577-0394-2.
  44. Perronnin, Florent; Sánchez, Jorge; Mensink, Thomas (2010). "Mejora del Fisher Kernel para la clasificación de imágenes a gran escala" . En Daniilidis, Kostas; Maragós, Petros; Paragios, Nikos (eds.). Visión por Computador – ECCV 2010 . Apuntes de conferencias sobre informática. vol. 6314. Berlín, Heidelberg: Springer. págs. 143-156 . doi : 10.1007/978-3-642-15561-1_11 . ISBN   978-3-642-15561-1.
  45. "XRCE@ILSVRC2011: Vectores de Fisher comprimidos para LSVR" , Florent Perronnin y Jorge Sánchez, Xerox Research Centre Europe (XRCE)
  46. "Concurso de reconocimiento visual a gran escala ImageNet 2012 (ILSVRC2012)" .
  47. Russakovsky, Olga; Deng, Jia; Huang, Zhiheng; Berg, Alexander C.; Fei-Fei, Li (2013). "Detectando aguacates y calabacines: ¿Qué hemos hecho y hacia dónde vamos?" : 2064– 2071.{{cite journal}}: Para citar una revista se requiere |journal=( ayuda )
  48. Sermanet, Pierre; Eigen, David; Zhang, Xiang; Mathieu, Michael; Fergus, Rob; LeCun, Yann (2013). "OverFeat: Reconocimiento, localización y detección integrados mediante redes neuronales convolucionales". arXiv : 1312.6229 [ cs.CV ].
  49. Szegedy, Christian; Wei Liu; Yangqing Jia; Sermanet, Pierre; Reed, Scott; Anguelov, Dragomir; Erhan, Dumitru; Vanhoucke, Vincent; Rabinovich, Andrew (junio de 2015). "Profundizando con convoluciones". Conferencia IEEE de 2015 sobre Visión por Computadora y Reconocimiento de Patrones (CVPR) . IEEE. págs. 1–9 . arXiv : 1409.4842 . doi : 10.1109/CVPR.2015.7298594 . ISBN  978-1-4673-6964-0.
  50. Gershgorn, Dave (10 de septiembre de 2017). "La guía de Quartz sobre inteligencia artificial: ¿Qué es, por qué es importante y deberíamos tenerle miedo?" . Quartz . Consultado el 3 de febrero de 2018 .
  51. Markoff, John (10 de diciembre de 2015). "Un avance en el aprendizaje de la inteligencia artificial rivaliza con las capacidades humanas" . The New York Times . Consultado el 22 de junio de 2016 .
  52. Aron, Jacob (21 de septiembre de 2015). "Olvídese de la prueba de Turing: hay mejores maneras de evaluar la IA" . New Scientist . Consultado el 22 de junio de 2016 .
  53. "Ilsvrc2016" .
  54. Xie, Saining; Girshick, Ross; Dollar, Piotr; Tu, Zhuowen; He, Kaiming (2017). Transformaciones residuales agregadas para redes neuronales profundas (PDF) . Conferencia sobre visión por computadora y reconocimiento de patrones . págs. 1492–1500 . arXiv : 1611.05431 . doi : 10.1109/CVPR.2017.634 . 
  55. ^ Hu, Jie; Shen, Li; Albanie, Samuel; Sol, pandilla; Wu, Enhua (2017). "Redes de compresión y excitación". arXiv : 1709.01507 [ cs.CV ].
  56. Northcutt, Curtis G.; Athalye, Anish; Mueller, Jonas (7 de noviembre de 2021), Los errores generalizados en las etiquetas de los conjuntos de prueba desestabilizan los benchmarks de aprendizaje automático , arXiv : 2103.14749
  57. ^ Beyer, Lucas; Hénaff, Olivier J.; Kolesnikov, Alejandro; Zhai, Xiaohua; Oord, Aäron van den (12 de junio de 2020), ¿Hemos terminado con ImageNet? , arXiv : 2006.07159
  58. "La aplicación viral que te etiqueta no es lo que piensas" . Wired . ISSN 1059-1028 . Consultado el 22 de septiembre de 2019 . 
  59. Wong, Julia Carrie (18 de septiembre de 2019). "La aplicación viral de selfies ImageNet Roulette parecía divertida, hasta que me insultó con un término racista" . The Guardian . ISSN 0261-3077 . Consultado el 22 de septiembre de 2019 . 
  60. Crawford, Kate; Paglen, Trevor (19 de septiembre de 2019). "Excavando la IA: La política de los conjuntos de entrenamiento para el aprendizaje automático" . - . Recuperado el 22 de septiembre de 2019 .
  61. Lyons, Michael J. (2020). "Excavando "Excavando IA": El elefante en la galería". arXiv : 2009.01215v3 [ cs.CY ].
  62. "Hacia conjuntos de datos más equitativos: filtrado y equilibrio de la distribución del subárbol de personas en la jerarquía de ImageNet" . image-net.org . 17 de septiembre de 2019. Consultado el 22 de septiembre de 2019 .

Fuentes primarias

  • Deng, Jia; Dong, Wei; Socher, Richard; Li, Li-Jia; Kai Li; Li Fei-Fei (junio de 2009). ImageNet: una base de datos de imágenes jerárquica a gran escala . CVPR 2009. IEEE. págs. 248–255 . doi : 10.1109/CVPR.2009.5206848 . ISBN  978-1-4244-3992-8.
  • Fei-Fei, L.; Deng, J.; Li, K. (22 de marzo de 2010). "ImageNet: Construcción de una base de datos de imágenes a gran escala" . Journal of Vision . 9 (8): 1037. doi : 10.1167/9.8.1037 . ISSN 1534-7362 . 
  • Deng, Jia; Berg, Alexander C.; Li, Kai; Fei-Fei, Li (2010). Daniilidis, Kostas; Maragos, Petros; Paragios, Nikos (eds.). ¿Qué nos dice la clasificación de más de 10 000 categorías de imágenes? . Visión por Computadora – ECCV 2010. Berlín, Heidelberg: Springer. pp. 71–84 . doi : 10.1007/978-3-642-15555-0_6 . ISBN  978-3-642-15555-0.
  • Russakovsky, Olga; Deng, Jia; Huang, Zhiheng; Berg, Alexander C.; Fei-Fei, Li (2013). De la detección de aguacates a calabacines: ¿Qué hemos hecho y hacia dónde vamos? ICCV 2013. págs. 2064–2071 . 
  • Russakovsky, Olga; Deng, Jia; Su, Hao; Krause, Jonathan; Satheesh, Sanjeev; Mamá, Sean; Huang, Zhiheng; Karpathy, Andrej; Khosla, Aditya; Bernstein, Michael; Berg, Alejandro C.; Fei-Fei, Li (1 de diciembre de 2015). "Desafío de reconocimiento visual a gran escala de ImageNet" . Revista Internacional de Visión por Computadora . 115 (3): 211– 252. arXiv : 1409.0575 . doi : 10.1007/s11263-015-0816-y . ISSN 1573-1405 . 
  • Sitio web oficial
Obtenido de " https://en.wikipedia.org/w/index.php?title=ImageNet&oldid=1349178867 "