Esta es una lista de conjuntos de datos para la investigación de aprendizaje automático. Forma parte de la lista de conjuntos de datos para la investigación de aprendizaje automático . Estos conjuntos de datos consisten principalmente en imágenes o videos para tareas como detección de objetos , reconocimiento facial y clasificación de múltiples etiquetas .
Detección y reconocimiento de objetos
Detección y reconocimiento de objetos para vehículos autónomos
Reconocimiento facial
En visión por computadora , las imágenes faciales se han utilizado ampliamente para desarrollar sistemas de reconocimiento facial , detección de rostros y muchos otros proyectos que utilizan imágenes de rostros.
Reconocimiento de acciones
Escritura a mano y reconocimiento de caracteres
Imágenes aéreas
Imágenes submarinas
Otras imágenes
Referencias
- ^ Bottou, L.; Cortes, C.; Denker, JS; Drucker, H.; Guyon, I.; Jackel, LD; LeCun, Y.; Muller, UA; Sackinger, E.; Simard, P.; Vapnik, V. (1994). "Comparación de métodos de clasificación: un estudio de caso en el reconocimiento de dígitos escritos a mano". 2 . IEEE Comput. Soc. Press: 77–82. doi :10.1109/ICPR.1994.576879. ISBN 978-0-8186-6270-6.
{{cite journal}}: Requiere citar revista|journal=( ayuda ) - ^ "Base de datos especial 19 del NIST". NIST . 27 de agosto de 2010.
- ^ Torralba, A.; Fergus, R.; Freeman, WT (noviembre de 2008). "80 millones de imágenes diminutas: un gran conjunto de datos para el reconocimiento no paramétrico de objetos y escenas". IEEE Transactions on Pattern Analysis and Machine Intelligence . 30 (11): 1958–1970. doi :10.1109/TPAMI.2008.128. ISSN 0162-8828. PMID 18787244.
- ^ Sun, Chen; Shrivastava, Abhinav; Singh, Saurabh; Gupta, Abhinav (2017). "Revisitando la efectividad irrazonable de los datos en la era del aprendizaje profundo": 843–852. arXiv : 1707.02968 .
{{cite journal}}: Requiere citar revista|journal=( ayuda ) - ^ Zhou, Bolei; Lapedriza, Agata; Khosla, Aditya; Oliva, Aude; Torralba, Antonio (1 de junio de 2018). "Lugares: una base de datos de 10 millones de imágenes para el reconocimiento de escenas". IEEE Transactions on Pattern Analysis and Machine Intelligence . 40 (6): 1452–1464. doi :10.1109/TPAMI.2017.2723009. ISSN 0162-8828. PMID 28692961.
- ^ Grauman, Kristen; Westbury, Andrés; Byrne, Eugenio; Chavis, Zachary; Furnari, Antonino; Girdhar, Rohit; Hamburguesa, Jackson; Jiang, Hao; Liu, Miao; Liu, Xingyu; Martín, Miguel; Nagarajan, Tushar; Radosavovic, Ilija; Ramakrishnan, Santhosh Kumar; Ryan, Fiona; Sharma, Jayant; Wray, Michael; Xu, Mengmeng; Xu, Eric Zhongcong; Zhao, Chen; Bansal, Siddhant; Batra, Dhruv; Cartillier, Vicente; Grúa, Sean; Hazlo, Tien; Doulaty, Morrie; Erapalli, Akshay; Feichtenhofer, Christoph; Fragomeni, Adriano; Fu, Qichen; Gebreselasie, Abraham; González, Cristina; Hillis, James; Huang, Xuhua; Huang, Yifei; Jia, Wenqi; Khoo, Weslie; Kolar, Jachym; Kottur, sátvico; Kumar, Anurag; Landini, Federico; Li, Chao; Li, Yanghao; Li, Zhenqiang; Mangalam, Karttikeya; Modhugu, Raghava; Munro, Jonathan; Murrell, Tullie; Nishiyasu, Takumi; Precio, voluntad; Puentes, Paola Ruiz; Ramazanova, Merey; Sári, Leda; Somasundaram, Kiran; Tierra del Sur, Audrey; Sugano, Yusuke; Tao, Ruijie; Vo, Minh; Wang, Yuchen; Wu, Xindi; Yagi, Takuma; Zhao, Ziwei; Zhu, Yunyi; Arbeláez, Pablo; Crandall, David; Damen, Dima; Farinella, Giovanni María; Fuegen, Christian; Ghanem, Bernard; Ithapu, Vamsi Krishna; Jawahar, CV; Joo, Hanbyul; Kitani, Kris; Li, Haizhou; Newcombe, Richard; Oliva, Aude; Parque, Hyun Soo; Rehg, James M.; Sato, Yoichi; Shi, Jianbo; Shou, Mike Zheng; Torralba, Antonio; Torresani, Lorenzo; Yan, Mingfei; Malik, Jitendra (2022). "Ego4D: La vuelta al mundo en 3.000 horas de vídeo egocéntrico" ". arXiv : 2110.07058 [cs.CV].
- ^ Srinivasan, Krishna; Raman, Karthik; Chen, Jiecao; Bendersky, Michael; Najork, Marc (11 de julio de 2021). "WIT: conjunto de datos de texto de imágenes basado en Wikipedia para aprendizaje automático multilingüe multimodal". Actas de la 44.ª Conferencia internacional ACM SIGIR sobre investigación y desarrollo en recuperación de información . ACM. págs. 2443–2449. arXiv : 2103.01913 . doi :10.1145/3404835.3463257. ISBN 978-1-4503-8037-9.
- ^ Krishna, Ranjay; Zhu, Yuke; Groth, Oliver; Johnson, Justin; Hata, Kenji; Kravitz, Joshua; Chen, Stephanie; Kalantidis, Yannis; Li, Li-Jia; Shamma, David A; Bernstein, Michael S; Fei-Fei, Li (2017). "Genoma visual: conexión del lenguaje y la visión mediante anotaciones de imágenes densas de colaboración colectiva". Revista internacional de visión por computadora . 123 : 32–73. arXiv : 1602.07332 . doi :10.1007/s11263-016-0981-7. S2CID 4492210.
- ^ Karayev, S., et al. "Un conjunto de datos de objetos 3D a nivel de categoría: poner a Kinect a trabajar". Actas de los talleres de la Conferencia Internacional IEEE sobre Visión por Computador . 2011.
- ^ Tighe, Joseph y Svetlana Lazebnik . «Superparsing: análisis de imágenes no paramétrico escalable con superpíxeles». Archivado el 6 de agosto de 2019 en Wayback Machine . Computer Vision–ECCV 2010. Springer Berlin Heidelberg, 2010. 352–365.
- ^ Arbelaez, P.; Maire, M; Fowlkes, C; Malik, J (mayo de 2011). "Detección de contornos y segmentación jerárquica de imágenes" (PDF) . IEEE Transactions on Pattern Analysis and Machine Intelligence . 33 (5): 898–916. doi :10.1109/tpami.2010.161. PMID 20733228. S2CID 206764694 . Consultado el 27 de febrero de 2016 .
- ^ Lin, Tsung-Yi; Maire, Michael; Belongie, Serge; Bourdev, Lubomir; Girshick, Ross; Hays, James; Perona, Pietro; Ramanan, Deva; Lawrence Zitnick, C.; Dollár, Piotr (2014). "Microsoft COCO: objetos comunes en contexto". arXiv : 1405.0312 [cs.CV].
- ^ Russakovsky, Olga; et al. (2015). "Desafío de reconocimiento visual a gran escala de Imagenet". Revista Internacional de Visión por Computador . 115 (3): 211–252. arXiv : 1409.0575 . doi :10.1007/s11263-015-0816-y. hdl :1721.1/104944. S2CID 2930547.
- ^ "COCO – Objetos comunes en contexto". cocodataset.org .
- ^ Xiao, Jianxiong, et al. "Base de datos Sun: reconocimiento de escenas a gran escala desde la abadía hasta el zoológico". Visión artificial y reconocimiento de patrones (CVPR), conferencia IEEE de 2010. IEEE, 2010.
- ^ Donahue, Jeff; Jia, Yangqing; Vinyals, Oriol; Hoffman, Judy; Zhang, Ning; Tzeng, Eric; Darrell, Trevor (2013). "DeCAF: una característica de activación convolucional profunda para el reconocimiento visual genérico". arXiv : 1310.1531 [cs.CV].
- ^ Deng, Jia, et al. "Imagenet: una base de datos de imágenes jerárquica a gran escala". Visión artificial y reconocimiento de patrones, 2009. CVPR 2009. Conferencia IEEE sobre . IEEE, 2009.
- ^ abc Krizhevsky, Alex, Ilya Sutskever y Geoffrey E. Hinton. "Clasificación de imagenet con redes neuronales convolucionales profundas". Avances en sistemas de procesamiento de información neuronal . 2012.
- ^ Rusakovsky, Olga; Deng, Jia; Su, Hao; Krause, Jonathan; Satheesh, Sanjeev; et al. (11 de abril de 2015). "Desafío de reconocimiento visual a gran escala de ImageNet". Revista Internacional de Visión por Computadora . 115 (3): 211–252. arXiv : 1409.0575 . doi :10.1007/s11263-015-0816-y. hdl :1721.1/104944. S2CID 2930547.
- ^ Yu, Fisher; Seff, Ari; Zhang, Yinda; Song, Shuran; Funkhouser, Thomas; Xiao, Jianxiong (4 de junio de 2016). "LSUN: Construcción de un conjunto de datos de imágenes a gran escala mediante aprendizaje profundo con participación humana". arXiv : 1506.03365 [cs.CV].
- ^ "Índice de /lsun/". dl.yf.io . Consultado el 19 de septiembre de 2024 .
- ^ "LSUN". Laboratorio de sistemas adaptativos complejos . Consultado el 19 de septiembre de 2024 .
- ^ Ivan Krasin, Tom Duerig, Neil Alldrin, Andreas Veit, Sami Abu-El-Haija, Serge Belongie, David Cai, Zheyun Feng, Vittorio Ferrari, Victor Gomes, Abhinav Gupta, Dhyanesh Narayanan, Chen Sun, Gal Chechik, Kevin Murphy. "OpenImages: un conjunto de datos públicos para la clasificación de imágenes de múltiples etiquetas y clases a gran escala, 2017. Disponible en https://github.com/openimages".
- ^ Vyas, Apoorv, et al. "Detección de bloques comerciales en videos de noticias transmitidas". Actas de la Conferencia india de 2014 sobre gráficos de visión por computadora y procesamiento de imágenes . ACM, 2014.
- ^ Hauptmann, Alexander G. y Michael J. Witbrock. "Segmentación de historias y detección de anuncios publicitarios en videos de noticias transmitidas". Research and Technology Advances in Digital Libraries, 1998. ADL 98. Actas. Foro Internacional IEEE sobre . IEEE, 1998.
- ^ Tung, Anthony KH, Xin Xu y Beng Chin Ooi. "Curler: búsqueda y visualización de clústeres de correlación no lineal". Actas de la conferencia internacional ACM SIGMOD de 2005 sobre gestión de datos . ACM, 2005.
- ^ Jarrett, Kevin, et al. "¿Cuál es la mejor arquitectura multietapa para el reconocimiento de objetos?". Computer Vision, 2009, 12.ª Conferencia Internacional IEEE sobre . IEEE, 2009.
- ^ Lazebnik, Svetlana , Cordelia Schmid y Jean Ponce. "Más allá de las bolsas de características: correspondencia de pirámides espaciales para reconocer categorías de escenas naturales". Visión artificial y reconocimiento de patrones, Conferencia de la IEEE Computer Society de 2006 sobre . Vol. 2. IEEE, 2006.
- ^ Griffin, G., A. Holub y P. Perona. Conjunto de datos de categorías de objetos Caltech-256 California Inst . Technol., Tech. Rep. 7694, 2007. Disponible en: http://authors.library.caltech.edu/7694, 2007.
- ^ Baeza-Yates, Ricardo y Berthier Ribeiro-Neto. Recuperación de información moderna . Vol. 463. Nueva York: ACM Press, 1999.
- ^ "🐺 COYO-700M: conjunto de datos de pares de imagen y texto". Kakao Brain. 2022-11-03 . Consultado el 2022-11-03 .
- ^ Fu, Xiping, et al. "NOKMeans: Hashing de K-medias no ortogonales". Visión artificial—ACCV 2014. Springer International Publishing, 2014. 162–177.
- ^ Heitz, Geremy; et al. (2009). "Localización de objetos basada en formas para clasificación descriptiva". Revista Internacional de Visión por Computador . 84 (1): 40–62. CiteSeerX 10.1.1.142.280 . doi :10.1007/s11263-009-0228-y. S2CID 646320.
- ^ Everingham, Mark; et al. (2010). "El desafío de las clases de objetos visuales (voc) de Pascal". Revista Internacional de Visión por Computador . 88 (2): 303–338. doi :10.1007/s11263-009-0275-4. hdl : 20.500.11820/88a29de3-6220-442b-ab2d-284210cf72d6 . S2CID 4246903.
- ^ Felzenszwalb, Pedro F.; et al. (2010). "Detección de objetos con modelos basados en partes entrenados de forma discriminante". IEEE Transactions on Pattern Analysis and Machine Intelligence . 32 (9): 1627–1645. CiteSeerX 10.1.1.153.2745 . doi :10.1109/tpami.2009.167. PMID 20634557. S2CID 3198903.
- ^ ab Gong, Yunchao y Svetlana Lazebnik . "Cuantización iterativa: un enfoque procustiano para el aprendizaje de códigos binarios". Visión artificial y reconocimiento de patrones (CVPR), Conferencia IEEE de 2011. IEEE, 2011.
- ^ "Conjunto de datos CINIC-10". Luke N. Darlow, Elliot J. Crowley, Antreas Antoniou, Amos J. Storkey (2018) CINIC-10 no es ImageNet ni CIFAR-10 . 2018-10-09 . Consultado el 13 de noviembre de 2018 .
- ^ "fashion-mnist: una base de datos de productos de moda similar a MNIST. Benchmark :point_right". Zalando Research. 2017-10-07 . Consultado el 2017-10-07 .
- ^ "Conjunto de datos notMNIST". Aprendizaje automático, etc. 2011-09-08 . Consultado el 2017-10-13 .
- ^ Chaladze, G., Kalatozishvili, L. (2017). Conjunto de datos de Linneo 5 . Chaladze.com . Obtenido el 13 de noviembre de 2017, de http://chaladze.com/l5/
- ^ Afifi, Mahmoud (12 de noviembre de 2017). "Reconocimiento de género e identificación biométrica utilizando un gran conjunto de datos de imágenes de manos". arXiv : 1711.04322 [cs.CV].
- ^ Lomonaco, Vincenzo; Maltoni, Davide (18 de octubre de 2017). "CORe50: un nuevo conjunto de datos y punto de referencia para el reconocimiento continuo de objetos". arXiv : 1705.03550 [cs.CV].
- ^ Ella, Qi; Feng, ventilador; Hao, Xinyue; Yang, Qihan; Lan, Chuanlin; Lomonaco, Vincenzo; Shi, Xuesong; Wang, Zhengwei; Guo, Yao; Zhang, Yimin; Qiao, Fei; Chan, Rosa HM (15 de noviembre de 2019). "OpenLORIS-Object: un conjunto de datos de visión robótica y un punto de referencia para el aprendizaje profundo permanente". arXiv : 1911.06487v2 [cs.CV].
- ^ Morozov, Alexei; Sushkova, Olga (13 de junio de 2019). "Conjunto de datos de vídeo térmico y en THz". Desarrollo de un enfoque de programación lógica multiagente para el análisis del comportamiento humano en una videovigilancia multicanal . Moscú: IRE RAS . Consultado el 19 de julio de 2019 .
- ^ Morozov, Alexei; Sushkova, Olga; Kershner, Ivan; Polupanov, Alexander (9 de julio de 2019). "Desarrollo de un método de videovigilancia inteligente de terahercios basado en la fusión semántica de imágenes de terahercios y de video 3D" (PDF) . CEUR . 2391 : paper19 . Consultado el 19 de julio de 2019 .
- ^ M. Cordts, M. Omran, S. Ramos, T. Scharwächter, M. Enzweiler, R. Benenson, U. Franke, S. Roth y B. Schiele, "El conjunto de datos de paisajes urbanos". En el taller de CVPR sobre el futuro de los conjuntos de datos en Vision, 2015.
- ^ Houben, Sebastian, et al. "Detección de señales de tráfico en imágenes del mundo real: el punto de referencia alemán para la detección de señales de tráfico". Neural Networks (IJCNN), Conferencia conjunta internacional de 2013 sobre redes neuronales . IEEE, 2013.
- ^ Mathias, Mayeul, et al. "Reconocimiento de señales de tráfico: ¿cuán lejos estamos de la solución?". Neural Networks (IJCNN), Conferencia conjunta internacional de 2013 sobre redes neuronales . IEEE, 2013.
- ^ Geiger, Andreas, Philip Lenz y Raquel Urtasun. "¿Estamos preparados para la conducción autónoma? La suite de referencia de Kitti Vision". Visión artificial y reconocimiento de patrones (CVPR), Conferencia IEEE de 2012. IEEE, 2012.
- ^ Sturm, Jürgen, et al. "Un punto de referencia para la evaluación de sistemas SLAM RGB-D". Robots y sistemas inteligentes (IROS), Conferencia internacional IEEE/RSJ de 2012 sobre . IEEE, 2012.
- ^ La suite de referencia de KITTI Vision en YouTube
- ^ Kragh, Mikkel F.; et al. (2017). "FieldSAFE: conjunto de datos para la detección de obstáculos en la agricultura". Sensores . 17 (11): 2579. arXiv : 1709.03526 . Bibcode :2017Senso..17.2579K. doi : 10.3390/s17112579 . PMC 5713196 . PMID 29120383.
- ^ "Documentos con código: conjunto de datos de detección monocular de peatones de Daimler". paperswithcode.com . Consultado el 5 de mayo de 2023 .
- ^ Enzweiler, Markus; Gavrila, Dariu M. (diciembre de 2009). "Detección monocular de peatones: estudio y experimentos". IEEE Transactions on Pattern Analysis and Machine Intelligence . 31 (12): 2179–2195. doi :10.1109/TPAMI.2008.260. ISSN 1939-3539. PMID 19834140. S2CID 1192198.
- ^ Yin, Guojun; Liu, Bin; Zhu, Huihui; Gong, Tao; Yu, Nenghai (28 de julio de 2020). "Un conjunto de datos de video de vigilancia urbana a gran escala para el seguimiento de múltiples objetos y el análisis del comportamiento". arXiv : 1904.11784 [cs.CV].
- ^ "Reconocimiento de objetos en un conjunto de datos de vídeo". mi.eng.cam.ac.uk . Consultado el 5 de mayo de 2023 .
- ^ Brostow, Gabriel J.; Shotton, Jamie; Fauqueur, Julien; Cipolla, Roberto (2008). "Segmentación y reconocimiento utilizando la estructura de nubes de puntos de movimiento". Visión artificial – ECCV 2008. Apuntes de clase en informática. Vol. 5302. Springer. págs. 44–57. doi :10.1007/978-3-540-88682-2_5. ISBN . 978-3-540-88681-5.
- ^ Brostow, Gabriel J.; Fauqueur, Julien; Cipolla, Roberto (15 de enero de 2009). "Clases de objetos semánticos en vídeo: una base de datos de verdad fundamental de alta definición". Pattern Recognition Letters . 30 (2): 88–97. Bibcode :2009PaReL..30...88B. doi :10.1016/j.patrec.2008.04.005. ISSN 0167-8655.
- ^ "Punto de referencia de WildDash 2". wilddash.cc . Consultado el 5 de mayo de 2023 .
- ^ Zendel, Oliver; Murschitz, Markus; Zeilinger, Marcel; Steininger, Daniel; Abbasi, Sara; Beleznai, Csaba (junio de 2019). "RailSem19: un conjunto de datos para la comprensión semántica de la escena ferroviaria". Talleres de la Conferencia IEEE/CVF sobre visión artificial y reconocimiento de patrones (CVPRW) de 2019. págs. 1221–1229. doi :10.1109/CVPRW.2019.00161. ISBN 978-1-7281-2506-0.S2CID 198166233 .
- ^ "El conjunto de datos de Boreas". www.boreas.utias.utoronto.ca . Consultado el 5 de mayo de 2023 .
- ^ Burnett, Keenan; Yoon, David J.; Wu, Yuchen; Li, Andrew Zou; Zhang, Haowei; Lu, Shichen; Qian, Jingxing; Tseng, Wei-Kang; Lambert, Andrew; Leung, Keith YK; Schoellig, Angela P .; Barfoot, Timothy D. (26 de enero de 2023). "Boreas: un conjunto de datos de conducción autónoma multiestacional". arXiv : 2203.10168 [cs.RO].
- ^ "Conjunto de datos de semáforos pequeños de Bosch". hci.iwr.uni-heidelberg.de . 1 de marzo de 2017 . Consultado el 5 de mayo de 2023 .
- ^ Behrendt, Karsten; Novak, Libor; Botros, Rami (mayo de 2017). "Un enfoque de aprendizaje profundo para los semáforos: detección, seguimiento y clasificación". Conferencia internacional IEEE sobre robótica y automatización (ICRA) de 2017. págs. 1370–1377. doi :10.1109/ICRA.2017.7989163. ISBN 978-1-5090-4633-1.S2CID6257133 .
- ^ "Conjunto de datos de FRSign". frsign.irt-systemx.fr . Consultado el 5 de mayo de 2023 .
- ^ Harb, Jeanine; Rébéna, Nicolás; Chosidow, Raphaël; Roblin, Gregoire; Potarusov, romano; Hajri, Hatem (5 de febrero de 2020). "FRSign: un conjunto de datos de semáforos a gran escala para trenes autónomos". arXiv : 2002.05665 [cs.CY].
- ^ "ifs-rwth-aachen/GERALD". Cátedra e Instituto de Vehículos Ferroviarios y Sistemas de Transporte. 30 de abril de 2023. Consultado el 5 de mayo de 2023 .
- ^ Leibner, Philipp; Hampel, Fabian; Schindler, Christian (3 de abril de 2023). "GERALD: Un nuevo conjunto de datos para la detección de señales de las principales líneas ferroviarias alemanas". Actas de la Institución de Ingenieros Mecánicos, Parte F: Revista de Ferrocarril y Tránsito Rápido . 237 (10): 1332–1342. doi :10.1177/09544097231166472. ISSN 0954-4097. S2CID 257939937.
- ^ Wojek, Christian; Walk, Stefan; Schiele, Bernt (junio de 2009). "Detección de peatones a bordo con múltiples señales". Conferencia IEEE de 2009 sobre visión artificial y reconocimiento de patrones . págs. 794–801. doi :10.1109/CVPR.2009.5206638. ISBN . 978-1-4244-3992-8.S2CID18000078 .
- ^ Toprak, Tuğçe; Aydin, Burak; Belenlioğlu, Burak; Güzeliş, Cüneyt; Selver, M. Alper (5 de abril de 2020). "Conjunto ponderado condicional de modelos transferidos para detección de peatones a bordo basada en cámaras en sistemas de asistencia a conductores ferroviarios". Transacciones IEEE sobre tecnología vehicular : 1. doi : 10.1109/TVT.2020.2983825. S2CID 216510283 . Consultado el 5 de mayo de 2023 .
- ^ Toprak, Tugce; Belenlioglu, Burak; Aydın, Burak; Guzelis, Cuneyt; Selver, M. Alper (mayo de 2020). "Conjunto ponderado condicional de modelos transferidos para la detección de peatones a bordo basada en cámaras en sistemas de asistencia al conductor de ferrocarriles". IEEE Transactions on Vehicular Technology . 69 (5): 5041–5054. doi :10.1109/TVT.2020.2983825. ISSN 1939-9359. S2CID 216510283.
- ^ Tilly, romano; Neumaier, Philipp; Schwalbe, Karsten; Klasek, Pavel; Tagiew, Rustam; Denzler, Patricio; Klockau, Tobías; Boekhoff, Martín; Köppel, Martín (2023). "Datos de sensores abiertos para Rail 2023" (en alemán). doi :10.57806/9mv146r0.
{{cite journal}}: Requiere citar revista|journal=( ayuda ) - ^ Tagiew, Rustam; Köppel, Martín; Schwalbe, Karsten; Denzler, Patricio; Neumaier, Philipp; Klockau, Tobías; Boekhoff, Martín; Klasek, Pavel; Tilly, Roman (4 de mayo de 2023). "OSDaR23: Datos de sensores abiertos para Rail 2023". 2023 8º Congreso Internacional de Robótica e Ingeniería de Automatización (ICRAE) . págs. 270–276. arXiv : 2305.03001 . doi :10.1109/ICRAE59816.2023.10458449. ISBN 979-8-3503-2765-6.
- ^ "Inicio". Argoverse . Consultado el 5 de mayo de 2023 .
- ^ Chang, Ming-Fang; Lambert, John; Sangkloy, Patsorn; Singh, Jagjeet; Bak, Slawomir; Hartnett, Andrew; Wang, De; Carr, Peter; Lucey, Simon; Ramanan, Deva; Hays, James (6 de noviembre de 2019). "Argoverse: seguimiento y pronóstico en 3D con mapas enriquecidos". arXiv : 1911.02620 [cs.CV].
- ^ Zafeiriou, S.; Kollias, D.; Nicolaou, MA; Papaioannou, A.; Zhao, G.; Kotsia, I. (2017). "Aff-Wild: desafío de valencia y excitación 'en la naturaleza'" (PDF) . Talleres de la Conferencia IEEE sobre visión artificial y reconocimiento de patrones (CVPRW) de 2017. págs. 1980–1987. doi :10.1109/CVPRW.2017.248. ISBN 978-1-5386-0733-6. Número de identificación del sujeto 3107614.
- ^ Kollias, D.; Tzirakis, P.; Nicolaou, MA; Papaioannou, A.; Zhao, G.; Schuller, B.; Kotsia, I.; Zafeiriou, S. (2019). "Predicción de afecto profundo en la naturaleza: Base de datos de afecto profundo y desafío, arquitecturas profundas y más allá". Revista internacional de visión por computadora . 127 (6–7): 907–929. arXiv : 1804.10938 . doi : 10.1007/s11263-019-01158-4 . S2CID 13679040.
- ^ Kollias, D.; Zafeiriou, S. (2019). "Expresión, afecto, reconocimiento de unidad de acción: Aff-wild2, aprendizaje multitarea y arcface" (PDF) . British Machine Vision Conference (BMVC), 2019 . arXiv : 1910.04855 .
- ^ Kollias, D.; Schulc, A.; Hajiyev, E.; Zafeiriou, S. (2020). "Análisis del comportamiento afectivo en la primera competición ABAW 2020". 2020 15.ª Conferencia internacional IEEE sobre reconocimiento automático de rostros y gestos (FG 2020) . págs. 637–643. arXiv : 2001.11409 . doi :10.1109/FG47880.2020.00126. ISBN 978-1-7281-3079-8.S2CID210966051 .
- ^ Phillips, P. Jonathon; et al. (1998). "La base de datos FERET y el procedimiento de evaluación para algoritmos de reconocimiento facial". Image and Vision Computing . 16 (5): 295–306. doi :10.1016/s0262-8856(97)00070-x.
- ^ Wiskott, Laurenz; et al. (1997). "Reconocimiento facial mediante correspondencia de grafos de grupos elásticos". IEEE Transactions on Pattern Analysis and Machine Intelligence . 19 (7): 775–779. CiteSeerX 10.1.1.44.2321 . doi :10.1109/34.598235. S2CID 30523165.
- ^ Livingstone, Steven R.; Russo, Frank A. (2018). "La base de datos audiovisual de Ryerson sobre el habla y el canto emocional (RAVDESS): un conjunto dinámico y multimodal de expresiones faciales y vocales en inglés norteamericano". PLOS ONE . 13 (5): e0196391. Bibcode :2018PLoSO..1396391L. doi : 10.1371/journal.pone.0196391 . PMC 5955500 . PMID 29768426.
- ^ Livingstone, Steven R.; Russo, Frank A. (2018). "Emoción". Base de datos audiovisual de habla y canción emocional de Ryerson (RAVDESS) . doi :10.5281/zenodo.1188976.
- ^ Grgic, Mislav; Delac, Kresimir; Grgic, Sonja (2011). "SCface: base de datos de rostros de cámaras de vigilancia". Herramientas y aplicaciones multimedia . 51 (3): 863–879. doi :10.1007/s11042-009-0417-2. S2CID 207218990.
- ^ Wallace, Roy, et al. "Modelado de variabilidad entre sesiones y análisis factorial conjunto para autenticación facial". Biometrics (IJCB), Conferencia conjunta internacional de 2011 sobre . IEEE, 2011.
- ^ Georghiades, A. "Base de datos de rostros de Yale". Centro de Visión y Control Computacional de la Universidad de Yale . 2 : 1997.
- ^ Nguyen, Duy; et al. (2006). "Detección de rostros en tiempo real y extracción de características de los labios mediante matrices de puertas programables en campo". IEEE Transactions on Systems, Man, and Cybernetics - Part B: Cybernetics . 36 (4): 902–912. CiteSeerX 10.1.1.156.9848 . doi :10.1109/tsmcb.2005.862728. PMID 16903373. S2CID 7334355.
- ^ Kanade, Takeo , Jeffrey F. Cohn y Yingli Tian . "Base de datos completa para el análisis de expresiones faciales". Reconocimiento automático de rostros y gestos, 2000. Actas. Cuarta Conferencia Internacional IEEE sobre . IEEE, 2000.
- ^ Zeng, Zhihong; et al. (2009). "Un estudio de los métodos de reconocimiento de afectos: expresiones auditivas, visuales y espontáneas". IEEE Transactions on Pattern Analysis and Machine Intelligence . 31 (1): 39–58. CiteSeerX 10.1.1.144.217 . doi :10.1109/tpami.2008.52. PMID 19029545.
- ^ Lyon, Michael; Kamachi, Miyuki; Gyoba, Jiro (1998). "Imágenes de expresiones faciales". La base de datos de expresiones faciales femeninas japonesas (JAFFE) . doi :10.5281/zenodo.3451524.
- ^ Lyons, Michael; Akamatsu, Shigeru; Kamachi, Miyuki; Gyoba, Jiro "Codificación de expresiones faciales con wavelets de Gabor". Reconocimiento automático de rostros y gestos, 1998. Actas. Tercera Conferencia Internacional IEEE sobre . IEEE, 1998.
- ^ Ng, Hong-Wei y Stefan Winkler. "Un enfoque basado en datos para limpiar grandes conjuntos de datos de rostros Archivado el 6 de diciembre de 2019 en Wayback Machine ." Procesamiento de imágenes (ICIP), Conferencia internacional IEEE de 2014. IEEE, 2014.
- ^ Roy Chowdhury, Aruni; Lin, Tsung-Yu; Maji, Subhransu; Aprendido-Miller, Erik (2015). "Reconocimiento facial uno a muchos con CNN bilineales". arXiv : 1506.01342 [cs.CV].
- ^ Jesorsky, Oliver, Klaus J. Kirchberg y Robert W. Frischholz. "Detección robusta de rostros mediante la distancia de Hausdorff". Autenticación biométrica de personas basada en audio y video . Springer Berlin Heidelberg, 2001.
- ^ Huang, Gary B., et al. Rostros etiquetados en la naturaleza: una base de datos para estudiar el reconocimiento facial en entornos sin restricciones . Vol. 1. N.º 2. Informe técnico 07-49, Universidad de Massachusetts, Amherst, 2007.
- ^ Bhatt, Rajen B., et al. "Segmentación eficiente de la región de la piel mediante un modelo de árbol de decisión difuso de baja complejidad". Conferencia de la India (INDICON), IEEE anual de 2009. IEEE, 2009.
- ^ Lingala, Mounika; et al. (2014). "Detección de color mediante lógica difusa: áreas azules en imágenes de dermatoscopia de melanoma". Imágenes médicas computarizadas y gráficos . 38 (5): 403–410. doi :10.1016/j.compmedimag.2014.03.007. PMC 4287461. PMID 24786720 .
- ^ Maes, Chris, et al. "Detección de características en superficies faciales 3D para normalización y reconocimiento de poses". Biometría: teoría, aplicaciones y sistemas (BTAS), 2010 Cuarta Conferencia Internacional IEEE sobre . IEEE, 2010.
- ^ Savran, Arman, et al. "Base de datos Bosphorus para análisis facial en 3D". Biometría y gestión de identidades . Springer Berlin Heidelberg, 2008. 47–56.
- ^ Heseltine, Thomas, Nick Pears y Jim Austin. "Reconocimiento facial tridimensional: un enfoque de superficie propia". Procesamiento de imágenes, 2004. ICIP'04. Conferencia internacional de 2004 sobre . Vol. 2. IEEE, 2004.
- ^ Ge, Yun; et al. (2011). "Modelado de muestras de rostros novedoso en 3D para reconocimiento facial". Revista de multimedia . 6 (5): 467–475. CiteSeerX 10.1.1.461.9710 . doi :10.4304/jmm.6.5.467-475.
- ^ Wang, Yueming; Liu, Jianzhuang; Tang, Xiaoou (2010). "Reconocimiento facial 3D robusto mediante el refuerzo de la diferencia de forma local". IEEE Transactions on Pattern Analysis and Machine Intelligence . 32 (10): 1858–1870. CiteSeerX 10.1.1.471.2424 . doi :10.1109/tpami.2009.200. PMID 20724762. S2CID 15263913.
- ^ Zhong, Cheng, Zhenan Sun y Tieniu Tan. "Reconocimiento facial 3D robusto mediante un libro de códigos visuales aprendido". Visión artificial y reconocimiento de patrones, 2007. CVPR'07. Conferencia IEEE sobre . IEEE, 2007.
- ^ Zhao, G.; Huang, X.; Taini, M.; Li, SZ; Pietikäinen, M. (2011). "Reconocimiento de expresiones faciales a partir de vídeos de infrarrojo cercano" (PDF) . Computación de Imagen y Visión . 29 (9): 607–619. doi :10.1016/j.imavis.2011.07.002.[ enlace muerto ]
- ^ Soyel, Hamit y Hasan Demirel. "Reconocimiento de expresiones faciales mediante distancias de rasgos faciales en 3D". Análisis y reconocimiento de imágenes . Springer Berlin Heidelberg, 2007. 831–838.
- ^ Bowyer, Kevin W.; Chang, Kyong; Flynn, Patrick (2006). "Un estudio de los enfoques y desafíos en el reconocimiento facial 3D y multimodal 3D+ 2D". Visión artificial y comprensión de imágenes . 101 (1): 1–15. CiteSeerX 10.1.1.134.8784 . doi :10.1016/j.cviu.2005.05.005.
- ^ Tan, Xiaoyang; Triggs, Bill (2010). "Conjuntos de características de textura local mejoradas para el reconocimiento facial en condiciones de iluminación difíciles". IEEE Transactions on Image Processing . 19 (6): 1635–1650. Bibcode :2010ITIP...19.1635T. CiteSeerX 10.1.1.105.3355 . doi :10.1109/tip.2010.2042645. PMID 20172829. S2CID 4943234.
- ^ Mousavi, Mir Hashem; Faez, Karim; Asghari, Amin (2008). "Reconocimiento facial tridimensional mediante el uso del clasificador SVM". Séptima conferencia internacional IEEE/ACIS sobre informática y ciencias de la información (Icis 2008) . págs. 208–213. doi :10.1109/ICIS.2008.77. ISBN 978-0-7695-3131-1. Número de identificación del sujeto 2710422.
- ^ Amberg, Brian; Knothe, Reinhard; Vetter, Thomas (2008). "Reconocimiento de rostros en 3D invariante a la expresión con un modelo transformable" (PDF) . 2008 8.ª Conferencia Internacional IEEE sobre Reconocimiento Automático de Rostros y Gestos . págs. 1–6. doi :10.1109/AFGR.2008.4813376. ISBN . 978-1-4244-2154-1. S2CID 5651453. Archivado desde el original (PDF) el 28 de julio de 2018 . Consultado el 6 de agosto de 2019 .
- ^ Irfanoglu, MO; Gokberk, B.; Akarun, L. (2004). "Reconocimiento facial basado en formas 3D utilizando superficies faciales registradas automáticamente". Actas de la 17.ª Conferencia Internacional sobre Reconocimiento de Patrones, 2004. ICPR 2004. págs. 183–186. Vol. 4. doi :10.1109/ICPR.2004.1333734. ISBN 0-7695-2128-2.S2CID10987293 .
- ^ Beumier, Charles; Acheroy, Marc (2001). "Verificación de rostros a partir de pistas en 3D y niveles de gris". Pattern Recognition Letters . 22 (12): 1321–1329. Código Bibliográfico :2001PaReL..22.1321B. doi :10.1016/s0167-8655(01)00077-0.
- ^ Afifi, Mahmoud; Abdelhamed, Abdelrahman (13 de junio de 2017). "AFIF4: Clasificación de género profunda basada en la fusión de rasgos faciales aislados y rostros borrosos basada en AdaBoost". arXiv : 1706.04277 [cs.CV].
- ^ "Conjunto de datos de SoF". sites.google.com . Consultado el 18 de noviembre de 2017 .
- ^ "IMDb-WIKI". data.vision.ee.ethz.ch . Consultado el 13 de marzo de 2018 .
- ^ "AVA: un conjunto de datos de vídeo de acción visual atómica". research.google.com . Consultado el 18 de octubre de 2024 .
- ^ Li, Ang; Thotakuri, Meghana; Ross, David A.; Carreira, João; Vostrikov, Alejandro; Zisserman, Andrés (20 de mayo de 2020). "El conjunto de datos de vídeos de acciones humanas localizados de AVA-Kinetics". arXiv : 2005.00214 [cs.CV].
- ^ Patron-Perez, A.; Marszalek, M.; Reid, I.; Zisserman, A. (2012). "Aprendizaje estructurado de interacciones humanas en programas de televisión". IEEE Transactions on Pattern Analysis and Machine Intelligence . 34 (12): 2441–2453. doi :10.1109/tpami.2012.24. PMID 23079467. S2CID 6060568.
- ^ Ofli, F., Chaudhry, R., Kurillo, G., Vidal, R. y Bajcsy, R. (enero de 2013). Berkeley MHAD: una base de datos integral de acción humana multimodal. En Aplicaciones de visión por computadora (WACV), Taller IEEE de 2013 sobre (págs. 53–60). IEEE.
- ^ Jiang, YG, et al. "Desafío THUMOS: reconocimiento de acciones con una gran cantidad de clases". Taller ICCV sobre reconocimiento de acciones con una gran cantidad de clases , http://crcv.ucf.edu/ICCV13-Action-Workshop. 2013.
- ^ Simonyan, Karen y Andrew Zisserman. "Redes convolucionales de dos flujos para el reconocimiento de acciones en videos". Avances en sistemas de procesamiento de información neuronal . 2014.
- ^ Stoian, Andrei; Ferecatu, Marin; Benois-Pineau, Jenny; Crucianu, Michel (2016). "Localización de acción rápida en archivos de vídeo a gran escala". Transacciones IEEE sobre circuitos y sistemas para tecnología de vídeo . 26 (10): 1917–1930. doi :10.1109/TCSVT.2015.2475835. S2CID 31537462.
- ^ Botta, M., A. Giordana y L. Saitta . "Aprendizaje de definiciones de conceptos difusos". Fuzzy Systems, 1993., Segunda Conferencia Internacional IEEE sobre . IEEE, 1993.
- ^ Frey, Peter W.; Slate, David J. (1991). "Reconocimiento de letras utilizando clasificadores adaptativos de estilo Holland". Aprendizaje automático . 6 (2): 161–182. doi : 10.1007/bf00114162 .
- ^ Peltonen, Jaakko; Klami, Arto; Kaski, Samuel (2004). "Mejor aprendizaje de métricas de Riemann para análisis exploratorio". Redes Neuronales . 17 (8): 1087-1100. CiteSeerX 10.1.1.59.4865 . doi :10.1016/j.neunet.2004.06.008. PMID 15555853.
- ^ ab Liu, Cheng-Lin; Yin, Fei; Wang, Da-Han; Wang, Qiu-Feng (enero de 2013). "Reconocimiento de caracteres chinos manuscritos en línea y fuera de línea: evaluación comparativa en nuevas bases de datos". Reconocimiento de patrones . 46 (1): 155–162. Código Bibliográfico :2013PatRe..46..155L. doi :10.1016/j.patcog.2012.06.021.
- ^ Wang, D.; Liu, C.; Yu, J.; Zhou, X. (2009). "CASIA-OLHWDB1: una base de datos de caracteres chinos manuscritos en línea". 2009 10th International Conference on Document Analysis and Recognition . págs. 1206–1210. doi :10.1109/ICDAR.2009.163. ISBN 978-1-4244-4500-4.S2CID 5705532 .
- ^ Williams, Ben H., Marc Toussaint y Amos J. Storkey. Extracción de primitivas de movimiento a partir de datos de escritura natural . Springer Berlin Heidelberg, 2006.
- ^ Meier, Franziska, et al. "Segmentación de movimiento utilizando una biblioteca primitiva". Robots y sistemas inteligentes (IROS), Conferencia internacional IEEE/RSJ de 2011 sobre . IEEE, 2011.
- ^ TE de Campos, BR Babu y M. Varma. Reconocimiento de caracteres en imágenes naturales. En Actas de la Conferencia Internacional sobre Teoría y Aplicaciones de la Visión por Computador (VISAPP), Lisboa, Portugal , febrero de 2009
- ^ Cohen, Gregory; Afshar, Saeed; Tapson, Jonathan; André van Schaik (2017). "EMNIST: una extensión de MNIST a las cartas manuscritas". arXiv : 1702.05373v1 [cs.CV].
- ^ "El conjunto de datos EMNIST". NIST . 4 de abril de 2017.
- ^ Cohen, Gregory; Afshar, Saeed; Tapson, Jonathan; André van Schaik (2017). "EMNIST: Una extensión de MNIST a las cartas manuscritas". arXiv : 1702.05373 [cs.CV].
- ^ Llorens, David, et al. "La base de datos UJIpenchars: una base de datos basada en lápiz de caracteres manuscritos aislados". LREC . 2008.
- ^ Calderara, Simone; Prati, Andrea; Cucchiara, Rita (2011). "Mezclas de distribuciones de von Mises para el análisis de la forma de la trayectoria de las personas". IEEE Transactions on Circuits and Systems for Video Technology . 21 (4): 457–471. doi :10.1109/tcsvt.2011.2125550. S2CID 1427766.
- ^ Guyon, Isabelle, et al. "Análisis de resultados del desafío de selección de características de nips 2003". Avances en sistemas de procesamiento de información neuronal . 2004.
- ^ Lake, BM; Salakhutdinov, R.; Tenenbaum, JB (11 de diciembre de 2015). "Aprendizaje de conceptos a nivel humano mediante la inducción probabilística de programas". Science . 350 (6266): 1332–1338. Bibcode :2015Sci...350.1332L. doi : 10.1126/science.aab3050 . ISSN 0036-8075. PMID 26659050.
- ^ Lake, Brenden (9 de noviembre de 2019). "Conjunto de datos Omniglot para aprendizaje de una sola muestra". GitHub . Consultado el 10 de noviembre de 2019 .
- ^ LeCun, Yann; et al. (1998). "Aprendizaje basado en gradientes aplicado al reconocimiento de documentos". Actas del IEEE . 86 (11): 2278–2324. CiteSeerX 10.1.1.32.9552 . doi :10.1109/5.726791. S2CID 14542261.
- ^ Kussul, Ernst; Baidyk, Tatiana (2004). "Método mejorado de reconocimiento de dígitos escritos a mano probado en la base de datos MNIST". Image and Vision Computing . 22 (12): 971–981. doi :10.1016/j.imavis.2004.03.008.
- ^ Xu, Lei; Krzyżak, Adam; Suen, Ching Y. (1992). "Métodos de combinación de múltiples clasificadores y sus aplicaciones al reconocimiento de escritura a mano". IEEE Transactions on Systems, Man, and Cybernetics . 22 (3): 418–435. doi :10.1109/21.155943. hdl :10338.dmlcz/135217.
- ^ Alimoglu, Fevzi, et al. "Combinación de múltiples clasificadores para el reconocimiento de dígitos escritos a mano con lápiz" (1996).
- ^ Tang, E. Ke; et al. (2005). "Reducción de la dimensionalidad lineal mediante LDA ponderada por relevancia". Reconocimiento de patrones . 38 (4): 485–493. Bibcode :2005PatRe..38..485T. doi :10.1016/j.patcog.2004.09.005. S2CID 10580110.
- ^ Hong, Yi, et al. "Aprendizaje de una combinación de métricas de distancia dispersas para clasificación y reducción de dimensionalidad". Computer Vision (ICCV), Conferencia internacional IEEE de 2011. IEEE, 2011.
- ^ Thoma, Martin (2017). "El conjunto de datos HASYv2". arXiv : 1701.08380 [cs.CV].
- ^ Karki, Manohar; Liu, Qun; DiBiano, Robert; Basu, Saikat; Mukhopadhyay, Supratik (20 de junio de 2018). "Reconstrucción y clasificación a nivel de píxeles para caracteres bengalíes escritos a mano ruidosos". arXiv : 1806.08037 [cs.CV].
- ^ Liu, Qun; Collier, Edward; Mukhopadhyay, Supratik (2019). "PCGAN-CHAR: redes generativas adversarias de clasificadores entrenados progresivamente para la clasificación de caracteres bengalíes manuscritos ruidosos". Bibliotecas digitales en la encrucijada de la información digital para el futuro . Apuntes de clase en informática. Vol. 11853. Springer International Publishing. págs. 3–15. arXiv : 1908.08987 . doi :10.1007/978-3-030-34058-2_1. ISBN 978-3-030-34057-5.S2CID201665955 .
- ^ "iSAID". captain-whu.github.io . Consultado el 30 de noviembre de 2021 .
- ^ Zamir, Syed y Arora, Aditya y Gupta, Akshita y Khan, Salman y Sun, Guolei y Khan, Fahad y Zhu, Fan y Shao, Ling y Xia, Gui-Song y Bai, Xiang. (2019). iSAID: un conjunto de datos a gran escala para la segmentación de instancias en imágenes aéreas. sitio web
- ^ Yuan, Jiangye; Gleason, Shaun S.; Cheriyadat, Anil M. (2013). "Evaluación comparativa sistemática de la segmentación de imágenes aéreas". IEEE Geoscience and Remote Sensing Letters . 10 (6): 1527–1531. Bibcode :2013IGRSL..10.1527Y. doi :10.1109/lgrs.2013.2261453. S2CID 629629.
- ^ Vatsavai, Ranga Raju. "Clasificación de imágenes basada en objetos: estado del arte y desafíos computacionales". Actas del 2.º Taller internacional ACM SIGSPATIAL sobre análisis de grandes datos geoespaciales . ACM, 2013.
- ^ Butenuth, Matthias, et al. "Integración de simulación de peatones, seguimiento y detección de eventos para el análisis de multitudes". Talleres sobre visión artificial (talleres ICCV), Conferencia internacional IEEE 2011 sobre . IEEE, 2011.
- ^ Fradi, Hajer y Jean-Luc Dugelay. "Análisis de multitudes de bajo nivel utilizando una función normalizada por cuadro para el conteo de personas". Information Forensics and Security (WIFS), Taller internacional IEEE 2012 sobre . IEEE, 2012.
- ^ Johnson, Brian Alan, Ryutaro Tateishi y Nguyen Thanh Hoan. "Un enfoque híbrido de pansharpening y análisis de imágenes basado en objetos multiescala para mapear pinos y robles enfermos". Revista internacional de teledetección 34.20 (2013): 6969–6982.
- ^ Mohd Pozi, Muhammad Syafiq; Sulaiman, Md Nasir; Mustapha, Norwati; Perumal, Thinagaran (2015). "Un nuevo modelo de clasificación para un conjunto de datos desequilibrado en cuanto a clases utilizando programación genética y máquinas de vectores de soporte: estudio de caso para la clasificación de la enfermedad del marchitamiento". Remote Sensing Letters . 6 (7): 568–577. Bibcode :2015RSL.....6..568M. doi :10.1080/2150704X.2015.1062159. S2CID 58788630.
- ^ Gallego, A.-J.; Pertusa, A.; Gil, P. "Clasificación automática de barcos a partir de imágenes aéreas ópticas con redes neuronales convolucionales". Teledetección . 2018; 10(4):511.
- ^ Gallego, A.-J.; Pertusa, A.; Gil, P. "Conjunto de datos de imágenes satelitales marítimas". Disponible en: https://www.iuii.ua.es/datasets/masati/, 2018.
- ^ Johnson, Brian; Tateishi, Ryutaro; Xie, Zhixiao (2012). "Uso de variables ponderadas geográficamente para la clasificación de imágenes". Remote Sensing Letters . 3 (6): 491–499. Bibcode :2012RSL.....3..491J. doi :10.1080/01431161.2011.629637. S2CID 122543681.
- ^ Chatterjee, Sankhadeep, et al. "Clasificación de tipos de bosque: un enfoque basado en modelos híbridos NN-GA". Diseño de sistemas de información y aplicaciones inteligentes . Springer India, 2016. 227–236.
- ^ Diegert, Carl. "Un método combinatorio para rastrear objetos utilizando la semántica de su forma". Taller de reconocimiento de patrones de imágenes aplicadas (AIPR), 2010 IEEE 39th . IEEE, 2010.
- ^ Razakarivony, Sebastien y Frédéric Jurie. "Detección de objetivos pequeños combinando colectores de primer plano y de fondo". Conferencia internacional de la IAPR sobre aplicaciones de visión artificial . 2013.
- ^ "SpaceNet". explore.digitalglobe.com . Archivado desde el original el 13 de marzo de 2018 . Consultado el 13 de marzo de 2018 .
- ^ Etten, Adam Van (5 de enero de 2017). "Introducción a los datos de SpaceNet". The DownLinQ . Consultado el 13 de marzo de 2018 .
- ^ Vakalopoulou, M.; Bus, N.; Karantzalosa, K.; Paragios, N. (julio de 2017). "Integración de valores a priori de bordes y límites con puntuaciones de clasificación para la detección de edificios en datos de muy alta resolución". Simposio internacional sobre geociencia y teledetección (IGARSS) del IEEE de 2017. págs. 3309–3312. doi :10.1109/IGARSS.2017.8127705. ISBN . 978-1-5090-4951-6.S2CID8297433 .
- ^ Yang, Yi; Newsam, Shawn (2010). "Bolsa de palabras visuales y extensiones espaciales para la clasificación del uso de la tierra". Actas de la 18.ª Conferencia internacional SIGSPATIAL sobre avances en sistemas de información geográfica . Nueva York, Nueva York, EE. UU.: ACM Press. págs. 270–279. doi :10.1145/1869790.1869829. ISBN . 9781450304283.S2CID 993769 .
- ^ ab Basu, Saikat; Ganguly, Sangram; Mukhopadhyay, Supratik; DiBiano, Robert; Karki, Manohar; Nemani, Ramakrishna (3 de noviembre de 2015). "DeepSat: un marco de aprendizaje para imágenes satelitales". Actas de la 23ª Conferencia Internacional SIGSPATIAL sobre Avances en Sistemas de Información Geográfica . ACM. págs. 1–10. doi :10.1145/2820783.2820816. ISBN 9781450339674. Número de identificación del sujeto 4387134.
- ^ ab Liu, Qun; Basu, Saikat; Ganguly, Sangram; Mukhopadhyay, Supratik; DiBiano, Robert; Karki, Manohar; Nemani, Ramakrishna (21 de noviembre de 2019). "DeepSat V2: función de redes neuronales convolucionales aumentadas para clasificación de imágenes satelitales". Cartas de teledetección . 11 (2): 156–165. arXiv : 1911.07747 . doi :10.1080/2150704x.2019.1693071. ISSN 2150-704X. S2CID 208138097.
- ^ Md Jahidul Islam, et al. "Segmentación semántica de imágenes submarinas: conjunto de datos y punto de referencia". Conferencia internacional IEEE/RSJ de 2020 sobre robots y sistemas inteligentes (IROS) . IEEE, 2020.
- ^ Waszak et al. "Segmentación semántica en inspecciones submarinas de buques: punto de referencia y conjunto de datos". Revista IEEE de ingeniería oceánica . IEEE, 2022.
- ^ Ebadi, Ashkan; Pablo, Patricio; Auer, Sofía; Tremblay, Stéphane (12 de noviembre de 2021). "NRC-GAMMA: Presentación de un nuevo conjunto de datos de imágenes de medidores de gas de gran tamaño". arXiv : 2111.06827 [cs.CV].
- ^ Canadá, Consejo Nacional de Investigación del Gobierno de Canadá (2021). «Conjunto de datos de imágenes de medidores de gas (NRC-GAMMA) - Repositorio digital del NRC». nrc-digital-repository.canada.ca . doi :10.4224/3c8s-z290 . Consultado el 2 de diciembre de 2021 .
- ^ Rabah, Chaima Ben; Coatrieux, Gouenou; Abdelfattah, Riadh (octubre de 2020). "Base de datos de documentos escaneados de Supatlantique para fines forenses de imágenes digitales". Conferencia internacional IEEE sobre procesamiento de imágenes (ICIP) de 2020. IEEE. págs. 2096–2100. doi :10.1109/icip40778.2020.9190665. ISBN . 978-1-7281-6395-6.S2CID224881147 .
- ^ Mills, Kyle; Tamblyn, Isaac (16 de mayo de 2018). "Gran conjunto de datos de grafeno". Consejo Nacional de Investigación de Canadá. doi :10.4224/c8sc04578j.data.
{{cite web}}: Falta o está vacío|url=( ayuda ) - ^ Mills, Kyle; Spanner, Michael; Tamblyn, Isaac (16 de mayo de 2018). "Simulación cuántica". Simulaciones cuánticas de un electrón en un pozo de potencial bidimensional . Consejo Nacional de Investigación de Canadá. doi :10.4224/PhysRevA.96.042113.data.
- ^ Rohrbach, M.; Amin, S.; Andriluka, M.; Schiele, B. (2012). "Una base de datos para la detección de actividad de grano fino de actividades de cocina". Conferencia IEEE 2012 sobre visión artificial y reconocimiento de patrones . IEEE. págs. 1194–1201. doi :10.1109/cvpr.2012.6247801. ISBN . 978-1-4673-1228-8.
- ^ Kuehne, Hilde, Ali Arslan y Thomas Serre. "El lenguaje de las acciones: Recuperando la sintaxis y la semántica de las actividades humanas dirigidas a objetivos". Actas de la Conferencia IEEE sobre Visión artificial y reconocimiento de patrones . 2014.
- ^ Sviatoslav, Voloshynovskiy, et al. "Hacia resultados reproducibles en la autenticación basada en funciones físicas no clonables: el conjunto óptico de microestructura de autenticación forense (FAMOS)". Proc. Actas del Taller internacional IEEE sobre seguridad y análisis forense de la información . 2012.
- ^ Olga, Taran y Shideh, Rezaeifar, et al. "PharmaPack: reconocimiento móvil de grano fino de paquetes farmacéuticos". Proc. Conferencia Europea de Procesamiento de Señales (EUSIPCO) . 2017.
- ^ Khosla, Aditya, et al. "Nuevo conjunto de datos para la categorización de imágenes de grano fino: perros de Stanford". Proc. Taller CVPR sobre categorización visual de grano fino (FGVC) . 2011.
- ^ ab Parkhi, Omkar M., et al. "Gatos y perros". Visión artificial y reconocimiento de patrones (CVPR), Conferencia IEEE de 2012. IEEE, 2012.
- ^ Biggs, Benjamin; Boyne, Oliver; Charles, James; Fitzgibbon, Andrew; Cipolla, Roberto (2020). Visión artificial – ECCV 2020 . Apuntes de clase en informática. Vol. 12356. arXiv : 2007.11110 . doi :10.1007/978-3-030-58621-8. ISBN 978-3-030-58620-1. Número de identificación del sujeto 227173931.
- ^ Razavian, Ali, et al. "Funciones de CNN listas para usar: una base asombrosa para el reconocimiento". Actas de la Conferencia IEEE sobre talleres de visión artificial y reconocimiento de patrones . 2014.
- ^ Ortega, Michael; et al. (1998). "Soporte de consultas de similitud booleanas clasificadas en MARS". IEEE Transactions on Knowledge and Data Engineering . 10 (6): 905–925. CiteSeerX 10.1.1.36.6079 . doi :10.1109/69.738357.
- ^ He, Xuming, Richard S. Zemel y Miguel Á. Carreira-Perpiñán. "Campos aleatorios condicionales multiescala para etiquetado de imágenes [ enlace muerto permanente ] ". Visión por computadora y reconocimiento de patrones, 2004. CVPR 2004. Actas de la conferencia de la sociedad informática IEEE de 2004 sobre . Vol. 2. IEEE, 2004.
- ^ Deneke, Tewodros, et al. "Predicción del tiempo de transcodificación de video para el equilibrio de carga proactivo". Multimedia and Expo (ICME), Conferencia internacional IEEE 2014. IEEE, 2014.
- ^ Ting-Hao (Kenneth) Huang, Francis Ferraro, Nasrin Mostafazadeh, Ishan Misra, Aishwarya Agrawal, Jacob Devlin, Ross Girshick, Xiaodong He, Pushmeet Kohli, Dhruv Batra, C. Lawrence Zitnick, Devi Parikh, Lucy Vanderwende, Michel Galley, Margaret Mitchell (13 de abril de 2016). "Narración visual". arXiv : 1604.03968 [cs.CL].
{{cite arXiv}}: CS1 maint: multiple names: authors list (link) - ^ Wah, Catherine, et al. "El conjunto de datos Caltech-UCSD birds-200-2011" (2011).
- ^ Duan, Kun, et al. "Descubrimiento de atributos localizados para el reconocimiento de grano fino". Visión artificial y reconocimiento de patrones (CVPR), Conferencia IEEE de 2012. IEEE, 2012.
- ^ "Conjunto de datos de YouTube-8M". research.google.com . Consultado el 1 de octubre de 2016 .
- ^ Abu-El-Haija, Sami; Kothari, Nisarg; Lee, Joonseok; Natsev, Paul; Toderici, George; Varadarajan, Balakrishnan; Vijayanarasimhan, Sudheendra (27 de septiembre de 2016). "YouTube-8M: un punto de referencia de clasificación de vídeos a gran escala". arXiv : 1609.08675 [cs.CV].
- ^ "Conjunto de datos YFCC100M". mmcommons.org . Yahoo-ICSI-LLNL . Consultado el 1 de junio de 2017 .
- ^ Bart Thomee; David A. Shamma; Gerald Friedland; Benjamín Elizalde; Karl Ni; Douglas Polonia; Damián Borth; Li-Jia Li (25 de abril de 2016). "Yfcc100m: Los nuevos datos en la investigación multimedia". Comunicaciones de la ACM . 59 (2): 64–73. arXiv : 1503.01817 . doi :10.1145/2812802. S2CID 207230134.
- ^ Y. Baveye, E. Dellandrea, C. Chamaret y L. Chen, "LIRIS-ACCEDE: una base de datos de video para el análisis de contenido afectivo", en IEEE Transactions on Affective Computing, 2015.
- ^ Y. Baveye, E. Dellandrea, C. Chamaret y L. Chen, "Aprendizaje profundo frente a métodos kernel: rendimiento para la predicción de emociones en videos", en Conferencia de la Asociación Humana de 2015 sobre Computación Afectiva e Interacción Inteligente (ACII), 2015.
- ^ M. Sjöberg, Y. Baveye, H. Wang, VL Quang, B. Ionescu, E. Dellandréa, M. Schedl, C.-H. Demarty y L. Chen, "La tarea del impacto afectivo de las películas medievales de 2015", en el taller MediaEval 2015, 2015.
- ^ S. Johnson y M. Everingham, "Modelos de apariencia no lineal y de pose agrupada para la estimación de la pose humana Archivado el 4 de noviembre de 2021 en Wayback Machine ", en Actas de la 21.ª Conferencia británica sobre visión artificial (BMVC2010)
- ^ S. Johnson y M. Everingham, "Aprendizaje de una estimación eficaz de la postura humana a partir de una anotación inexacta Archivado el 4 de noviembre de 2021 en Wayback Machine ", en Actas de la Conferencia IEEE sobre visión artificial y reconocimiento de patrones (CVPR2011)
- ^ Afifi, Mahmoud; Hussain, Khaled F. (2 de noviembre de 2017). "El logro de una mayor flexibilidad en pruebas de opción múltiple utilizando técnicas de clasificación de imágenes". arXiv : 1711.00972 [cs.CV].
- ^ "Conjunto de datos de preguntas de opción múltiple". sites.google.com . Consultado el 18 de noviembre de 2017 .
- ^ Taj-Eddin, IATF; Afifi, M.; Korashy, M.; Hamdy, D.; Nasser, M.; Derbaz, S. (julio de 2016). "Una nueva técnica de compresión para vídeos de vigilancia: evaluación utilizando un nuevo conjunto de datos". Sexta Conferencia Internacional sobre Tecnologías de la Información y la Comunicación Digital y sus Aplicaciones (DICTAP) de 2016. págs. 159–164. doi :10.1109/DICTAP.2016.7544020. ISBN 978-1-4673-9609-7.S2CID8698850 .
- ^ Tabak, Michael A.; Norouzzadeh, Mohammad S.; Wolfson, David W.; Sweeney, Steven J.; Vercauteren, Kurt C.; Snow, Nathan P.; Halseth, Joseph M.; Di Salvo, Paul A.; Lewis, Jesse S.; White, Michael D.; Teton, Ben; Beasley, James C.; Schlichting, Peter E.; Boughton, Raoul K.; Wight, Bethany; Newkirk, Eric S.; Ivan, Jacob S.; Odell, Eric A.; Brook, Ryan K.; Lukacs, Paul M.; Moeller, Anna K.; Mandeville, Elizabeth G.; Clune, Jeff; Miller, Ryan S.; Photopoulou, Theoni (2018). "Aprendizaje automático para clasificar especies animales en imágenes de cámaras trampa: aplicaciones en ecología". Métodos en ecología y evolución . 10 (4): 585–590. Revista de Biología Molecular y Atmosférica .
- ^ Taj-Eddin, Islam ATF; Afifi, Mahmoud; Korashy, Mostafa; Ahmed, Ali H.; Ng, Yoke Cheng; Hernandez, Evelyng; Abdel-Latif, Salma M. (noviembre de 2017). "¿Podemos ver la fotosíntesis? Ampliación de los pequeños cambios de color de las hojas verdes de las plantas mediante la ampliación de vídeo euleriana". Journal of Electronic Imaging . 26 (6): 060501. arXiv : 1706.03867 . Bibcode :2017JEI....26f0501T. doi :10.1117/1.jei.26.6.060501. ISSN 1017-9909. S2CID 12367169.
- ^ "Memes matemáticos matemáticos".
- ^ Karras, Tero; Laine, Samuli; Aila, Timo (junio de 2019). "Una arquitectura de generador basada en estilos para redes generativas adversarias". Conferencia IEEE/CVF de 2019 sobre visión artificial y reconocimiento de patrones (CVPR) . IEEE. págs. 4396–4405. arXiv : 1812.04948 . doi :10.1109/cvpr.2019.00453. ISBN . 978-1-7281-3293-8.S2CID54482423 .
- ^ Oltean, Mihai (2017). "Conjunto de datos de Fruits-360". GitHub .