Caltech 101 es un conjunto de datos de imágenes digitales creado en septiembre de 2003 y compilado por Fei-Fei Li , Marco Andreetto, Marc 'Aurelio Ranzato y Pietro Perona en el Instituto Tecnológico de California . Su objetivo es facilitar la investigación y las técnicas de visión artificial , y resulta especialmente útil para técnicas de clasificación y categorización de imágenes . Caltech 101 contiene un total de 9146 imágenes, divididas en 101 categorías de objetos distintas ( rostros , relojes , hormigas , pianos , etc.) y una categoría de fondo. Las imágenes incluyen un conjunto de anotaciones que describen sus contornos, junto con un script de Matlab para su visualización.
Objetivo
La mayoría de los algoritmos de visión artificial y aprendizaje automático funcionan entrenándose con ejemplos de entrada. Requieren un conjunto de datos de entrenamiento amplio y variado para funcionar eficazmente. Por ejemplo, el método de detección de rostros en tiempo real utilizado por Paul Viola y Michael J. Jones se entrenó con 4916 rostros etiquetados manualmente. [ 1 ]
Recortar, redimensionar y marcar manualmente los puntos de interés es una tarea tediosa y que consume mucho tiempo.
Históricamente, la mayoría de los conjuntos de datos utilizados en la investigación de visión por computadora se han adaptado a las necesidades específicas del proyecto en cuestión. Un problema importante al comparar técnicas de visión por computadora es que la mayoría de los grupos utilizan sus propios conjuntos de datos. Cada conjunto puede tener propiedades diferentes que dificultan la comparación directa de los resultados reportados por distintos métodos. Por ejemplo, las diferencias en el tamaño y la calidad de la imagen, la ubicación relativa de los objetos dentro de las imágenes y el nivel de oclusión y desorden presentes pueden generar resultados variables. [ 2 ]
El conjunto de datos Caltech 101 tiene como objetivo mitigar muchos de estos problemas comunes.
- Las imágenes se recortan y se redimensionan.
- Se representan numerosas categorías, lo que resulta adecuado tanto para algoritmos de reconocimiento de una sola clase como para algoritmos de reconocimiento de múltiples clases.
- Se muestran los contornos detallados de los objetos.
- Caltech 101, disponible para uso general, actúa como un estándar común para comparar diferentes algoritmos sin sesgos debidos a diferentes conjuntos de datos.
Sin embargo, un estudio de seguimiento demostró que las pruebas basadas en imágenes naturales no controladas (como el conjunto de datos Caltech 101) pueden ser muy engañosas, lo que podría orientar el progreso en la dirección equivocada. [ 3 ]
Conjunto de datos
Imágenes
El conjunto de datos Caltech 101 consta de un total de 9.146 imágenes, divididas en 101 categorías de objetos diferentes, además de una categoría adicional de fondo/elementos distractores.
Cada categoría de objetos contiene entre 40 y 800 imágenes. Las categorías comunes y populares, como las de rostros, suelen tener un mayor número de imágenes que otras.
Cada imagen tiene aproximadamente 300x200 píxeles. Las imágenes de objetos orientados, como aviones y motocicletas, se reflejaron para alinearlas de izquierda a derecha, y las estructuras orientadas verticalmente, como edificios, se rotaron para que quedaran fuera del eje.
Anotaciones
Se proporciona un conjunto de anotaciones para cada imagen. Cada conjunto de anotaciones contiene dos datos: el recuadro general que delimita el objeto y un contorno detallado, especificado por un usuario, que lo encierra.
Se proporciona un script de Matlab con las anotaciones. Este script carga una imagen y su archivo de anotación correspondiente y los muestra como una figura de Matlab.
Usos
El conjunto de datos Caltech 101 se utilizó para entrenar y probar varios algoritmos de reconocimiento y clasificación de visión artificial. El primer artículo que utilizó Caltech 101 fue un enfoque bayesiano incremental para el aprendizaje de una sola muestra, [ 4 ] un intento de clasificar un objeto utilizando solo unos pocos ejemplos, basándose en el conocimiento previo de otras clases.
Las imágenes de Caltech 101, junto con las anotaciones, se utilizaron para otro artículo sobre aprendizaje de una sola vez en Caltech. [ 5 ]
Otros artículos sobre visión por computadora que informan del uso del conjunto de datos Caltech 101 incluyen:
- Coincidencia de formas y reconocimiento de objetos mediante correspondencia de baja distorsión. Alexander C. Berg, Tamara L. Berg, Jitendra Malik . CVPR 2005
- El núcleo de coincidencia piramidal: clasificación discriminativa con conjuntos de características de imagen. K. Grauman y T. Darrell. Conferencia Internacional sobre Visión por Computadora (ICCV), 2005 [ 6 ]
- Combinación de modelos generativos y núcleos de Fisher para el reconocimiento de clases de objetos. Holub, AD. Welling, M. Perona, P. Conferencia Internacional sobre Visión por Computadora (ICCV), 2005 [ 7 ]
- Reconocimiento de objetos con características inspiradas en la corteza visual . T. Serre, L. Wolf y T. Poggio. Actas de la Conferencia de la Sociedad de Computación del IEEE de 2005 sobre Visión por Computadora y Reconocimiento de Patrones (CVPR 2005), IEEE Computer Society Press, San Diego, junio de 2005 [ 8 ]
- SVM-KNN: Clasificación discriminativa del vecino más cercano para el reconocimiento de categorías visuales. Hao Zhang, Alex Berg, Michael Maire, Jitendra Malik . CVPR, 2006 [ 9 ]
- Más allá de las bolsas de características: coincidencia de pirámide espacial para el reconocimiento de categorías de escenas naturales. Svetlana Lazebnik , Cordelia Schmid y Jean Ponce. CVPR, 2006 [ 10 ]
- Estudio empírico de bancos de filtros multiescala para la categorización de objetos. MJ Mar韓-Jim閚ez y N. P閞ez de la Blanca. Diciembre de 2005 [ 11 ]
- Reconocimiento de objetos multiclase con características dispersas y localizadas. Jim Mutch y David G. Lowe, págs. 11–18, CVPR 2006, IEEE Computer Society Press, Nueva York, junio de 2006 [ 12 ]
- Uso de regiones dependientes o categorización de objetos en un marco generativo. G. Wang, Y. Zhang y L. Fei-Fei. IEEE Comp. Vis. Patt. Recog. 2006 [ 13 ]
Análisis y comparación
Ventajas
Caltech 101 presenta varias ventajas sobre otros conjuntos de datos similares:
- Tamaño y presentación uniformes:
- Casi todas las imágenes de cada categoría tienen un tamaño uniforme y una posición relativa de los objetos de interés similar. Por lo general, los usuarios de Caltech 101 no necesitan recortar ni escalar las imágenes antes de utilizarlas.
- Bajo nivel de desorden/oclusión:
- Los algoritmos de reconocimiento suelen funcionar almacenando características únicas del objeto. Sin embargo, la mayoría de las imágenes presentan distintos grados de ruido de fondo, lo que puede provocar que los algoritmos se construyan incorrectamente.
- Anotaciones detalladas
Debilidades
Las debilidades del conjunto de datos Caltech 101 [ 3 ] [ 14 ] pueden deberse a concesiones deliberadas, pero también a limitaciones del propio conjunto de datos. Los trabajos que se basan exclusivamente en Caltech 101 suelen ser rechazados.
Entre sus debilidades se incluyen:
- El conjunto de datos es demasiado limpio:
- Las imágenes presentan una presentación muy uniforme, alineadas de izquierda a derecha y, por lo general, sin oclusiones. En consecuencia, no siempre representan fielmente los datos de entrada prácticos que el algoritmo podría esperar. En condiciones reales, las imágenes suelen estar más recargadas, con oclusiones y una mayor variabilidad en la posición y orientación relativas de los objetos de interés. Esta uniformidad permite derivar conceptos utilizando el promedio de una categoría, lo cual resulta poco realista.
- Número limitado de categorías:
- El conjunto de datos Caltech 101 representa solo una pequeña fracción de las posibles categorías de objetos.
- Algunas categorías contienen pocas imágenes:
- Algunas categorías no están tan bien representadas como otras, llegando a contener tan solo 31 imágenes.
- Esto significa que. El número de imágenes utilizadas para el entrenamiento debe ser menor o igual a 30, lo cual no es suficiente para todos los propósitos.
- Alias y artefactos debidos a la manipulación:
- Algunas imágenes han sido rotadas y escaladas con respecto a su orientación original, y presentan cierta cantidad de artefactos o aliasing .
Otros conjuntos de datos
- Caltech 256 es otro conjunto de datos de imágenes, creado en 2007. Es el sucesor de Caltech 101. Su objetivo es abordar algunas de las debilidades de Caltech 101. En general, es un conjunto de datos más difícil que Caltech 101, pero sufre problemas comparables. Incluye [ 3 ]
- 30.607 imágenes, que abarcan un mayor número de categorías.
- El número mínimo de imágenes por categoría se elevó a 80.
- Las imágenes no están alineadas horizontalmente.
- Mayor variación en la presentación de imágenes
- LabelMe es un conjunto de datos abierto y dinámico creado en el Laboratorio de Ciencias de la Computación e Inteligencia Artificial (CSAIL) del MIT. LabelMe aborda el problema de crear un gran conjunto de datos de imágenes de una manera diferente, con ventajas e inconvenientes distintos.
- 106.739 imágenes, 41.724 imágenes anotadas y 203.363 objetos etiquetados.
- Los usuarios pueden añadir imágenes al conjunto de datos mediante la carga de archivos, así como añadir etiquetas o anotaciones a las imágenes existentes.
- Debido a su naturaleza abierta, LabelMe cuenta con muchas más imágenes que abarcan un ámbito mucho más amplio que Caltech 101. Sin embargo, dado que cada persona decide qué imágenes subir y cómo etiquetarlas y anotarlas, las imágenes presentan menos uniformidad.
- VOC 2008 es una iniciativa europea para recopilar imágenes con el fin de evaluar métodos de categorización visual. En comparación con Caltech 101/256, se recopila un número menor de categorías (alrededor de 20). Sin embargo, la cantidad de imágenes en cada categoría es mayor.
- El conjunto de datos de investigación de imágenes aéreas (OIRDS) es una biblioteca anotada de imágenes y herramientas. [ 15 ] OIRDS v1.0 se compone de objetos de vehículos de pasajeros anotados en imágenes aéreas. Los vehículos de pasajeros en OIRDS incluyen automóviles, camiones, furgonetas, etc. Además de los contornos de los objetos, OIRDS incluye estadísticas subjetivas y objetivas que cuantifican el vehículo dentro del contexto de la imagen. Por ejemplo, se incluyen medidas subjetivas de desorden de la imagen, claridad, ruido y color del vehículo junto con estadísticas más objetivas como la distancia de muestreo del suelo (GSD), la hora del día y el día del año.
- Aproximadamente 900 imágenes, que contienen aproximadamente 1800 imágenes anotadas.
- ~30 anotaciones por objeto
- ~60 medidas estadísticas por objeto
- Amplia variación en el contexto del objeto
- Limitado a vehículos de pasajeros en imágenes aéreas.
- MICC-Flickr 101 es un conjunto de datos de imágenes creado en el Centro de Integración y Comunicación de Medios (MICC) de la Universidad de Florencia en 2012. Se basa en Caltech 101 y se recopila de Flickr . MICC-Flickr 101 [ 16 ] corrige el principal inconveniente de Caltech 101, es decir, su baja variabilidad entre clases, y proporciona anotaciones sociales a través de etiquetas de usuario. Se basa en un conjunto de datos estándar y ampliamente utilizado, compuesto por un número manejable de categorías (101), y por lo tanto puede utilizarse para comparar el rendimiento de la categorización de objetos en un escenario restringido (Caltech 101) y la categorización de objetos "en la naturaleza" (MICC-Flickr 101) en las mismas 101 categorías.
Véase también
Referencias
- ↑ Viola, Paul; Jones, Michael J. (2004). "Detección robusta de rostros en tiempo real". International Journal of Computer Vision . 57 (2): 137– 154. doi : 10.1023/B:VISI.0000013087.49260.fb . S2CID 2796017 .
- ↑ Oertel, Carsten; Colder, Brian; Colombe, Jeffrey; High, Julia; Ingram, Michael; Sallee, Phil (2008). "Desafíos actuales en la automatización de la percepción visual". 37.º Taller IEEE de Reconocimiento de Patrones de Imágenes Aplicadas de 2008. págs. 1–8 . doi : 10.1109/AIPR.2008.4906457 . ISBN 978-1-4244-3125-0. S2CID 36669995 .
- 1 2 3 Pinto, Nicolas; Cox, David D.; Dicarlo, James J. (2008). "¿Por qué es difícil el reconocimiento de objetos visuales en el mundo real?" . PLOS Computational Biology . 4 (1): e27. Bibcode : 2008PLSCB...4...27P . doi : 10.1371/journal.pcbi.0040027 . PMC 2211529 . PMID 18225950 .
- ↑ L. Fei-Fei, R. Fergus y P. Perona. Aprendizaje de modelos visuales generativos a partir de pocos ejemplos de entrenamiento: un enfoque bayesiano incremental probado en 101 categorías de objetos. IEEE. CVPR 2004, Taller sobre Visión Basada en Modelos Generativos. 2004
- ↑ L. Fei-Fei; R. Fergus; P. Perona (abril de 2006). "Aprendizaje de categorías de objetos con una sola muestra" ( PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . 28 (4): 594– 611. doi : 10.1109/TPAMI.2006.79 . PMID 16566508. S2CID 6953475. Archivado del original (PDF) el 9 de junio de 2007. Recuperado el 16 de enero de 2008 .
- ↑ El núcleo de coincidencia piramidal: clasificación discriminativa con conjuntos de características de imagen. K. Grauman y T. Darrell. Conferencia Internacional sobre Visión por Computadora (ICCV), 2005.
- ↑ Holub, AD; Welling, M; Perona, P. Combinación de modelos generativos y núcleos de Fisher para el reconocimiento de clases de objetos . Conferencia Internacional sobre Visión por Computadora (ICCV), 2005. Archivado del original el 14 de agosto de 2007. Recuperado el 16 de enero de 2008 .
- ↑ Reconocimiento de objetos con características inspiradas en la corteza visual. T. Serre, L. Wolf y T. Poggio. Actas de la Conferencia de la Sociedad de Computación del IEEE de 2005 sobre Visión por Computadora y Reconocimiento de Patrones (CVPR 2005), IEEE Computer Society Press, San Diego, junio de 2005.
- ↑ SVM-KNN: Clasificación discriminativa del vecino más cercano para el reconocimiento de categorías visuales. Hao Zhang, Alex Berg, Michael Maire, Jitendra Malik. CVPR, 2006
- ↑ Más allá de las bolsas de características: Coincidencia de pirámide espacial para el reconocimiento de categorías de escenas naturales . Svetlana Lazebnik , Cordelia Schmid y Jean Ponce. CVPR, 2006.
- ↑ Estudio empírico de bancos de filtros multiescala para la categorización de objetos, MJ Mar韓-Jim閚ez y N. P閞ez de la Blanca. Diciembre de 2005.
- ↑ Reconocimiento de objetos multiclase con características dispersas y localizadas, Jim Mutch y David G. Lowe, págs. 11-18, CVPR 2006, IEEE Computer Society Press, Nueva York, junio de 2006.
- ↑ G. Wang; Y. Zhang; L. Fei-Fei (2006). "Uso de regiones dependientes o categorización de objetos en un marco generativo" (PDF) . IEEE Comp. Vis. Patt. Recog . Archivado del original (PDF) el 9 de junio de 2007. Consultado el 16 de enero de 2008 .
- ↑ J. Ponce; TL Berg; M. Everingham; DA Forsyth; M. Hebert; S. Lazebnik ; M. Marszalek; C. Schmid; BC Russell; A. Torralba; CKI Williams; J. Zhang; A. Zisserman (2006). J. Ponce; M. Hebert; C. Schmid; A. Zisserman (eds.). "Problemas con los conjuntos de datos en el reconocimiento de objetos" (PDF) . Hacia el reconocimiento de objetos a nivel de categoría, Springer-Verlag Lecture Notes in Computer Science. Archivado del original (PDF) el 24-12-2016 . Recuperado el 08-02-2008 .
- ↑ F. Tanner, B. Colder, C. Pullen, D. Heagy, C. Oertel y P. Sallee, Conjunto de datos de investigación de imágenes aéreas (OIRDS): una biblioteca de datos anotados y herramientas para ayudar en el desarrollo de algoritmos de visión por computadora , junio de 2009, < https://sourceforge.net/apps/mediawiki/oirds/index.php?title=Documentation Archived 2012-11-09 at the Wayback Machine > (28 de diciembre de 2009)
- ↑ "L. Ballan, M. Bertini, A. Del Bimbo, AM Serain, G. Serra, BF Zaccone. Combinación de modelos generativos y discriminativos para clasificar imágenes sociales de 101 categorías de objetos. Conferencia Internacional sobre Reconocimiento de Patrones (ICPR), 2012" (PDF) . Archivado del original (PDF) el 26 de agosto de 2014. Consultado el 11 de julio de 2012 .
Enlaces externos
- http://www.vision.caltech.edu/Image_Datasets/Caltech101/ Archivado el 6 de diciembre de 2013 en Wayback Machine – Página principal de Caltech 101 (Incluye descarga)
- http://www.vision.caltech.edu/Image_Datasets/Caltech256/ – Página principal de Caltech 256 (Incluye descarga)
- http://labelme.csail.mit.edu/ – Página de inicio de LabelMe
- http://www2.it.lut.fi/project/visiq/ – Página de descarga aleatoria de Caltech 101 (Incluye descarga)
- http://www.micc.unifi.it/vim/datasets/micc-flickr-101/ – Página principal de MICC-Flickr101 (Incluye descarga)
- Instituto Tecnológico de California
- Conjuntos de datos en visión artificial