Articulo de referencia

Visión activa

Un área de la visión por computadora es la visión activa , también conocida como visión artificial activa . Un sistema de visión activa es aquel que puede manipular el punto de ...

Un área de la visión por computadora es la visión activa , también conocida como visión artificial activa . Un sistema de visión activa es aquel que puede manipular el punto de vista de la(s) cámara(s) para investigar el entorno y obtener mejor información del mismo. [ 1 ] [ 2 ] [ 3 ] [ 4 ]

Fondo

El interés en los sistemas de cámaras activas comenzó hace ya dos décadas. A finales de la década de 1980, Aloimonos et al. introdujeron el primer marco general para la visión activa con el fin de mejorar la calidad perceptiva de los resultados de seguimiento. [ 3 ] La visión activa es particularmente importante para lidiar con problemas como oclusiones, campo de visión limitado y resolución limitada de la cámara. [ 5 ] Otras ventajas pueden ser la reducción del desenfoque de movimiento de un objeto en movimiento [ 6 ] y la mejora de la percepción de profundidad de un objeto al enfocar dos cámaras en el mismo objeto o mover las cámaras. [ 3 ] El control activo del punto de vista de la cámara también ayuda a enfocar los recursos computacionales en el elemento relevante de la escena. [ 7 ] En este aspecto selectivo, la visión activa puede verse como estrechamente relacionada con la atención visual (manifiesta y encubierta) en organismos biológicos, que ha demostrado mejorar la percepción de una parte seleccionada del campo visual. Este aspecto selectivo de la visión humana (activa) se puede relacionar fácilmente con la estructura foveal del ojo humano, [ 8 ] [ 9 ] donde en aproximadamente el 5% de la retina se ubica más del 50% de los receptores de color.

También se ha sugerido que la atención visual y el aspecto selectivo del control activo de la cámara pueden ayudar en otras tareas como aprender modelos más robustos de objetos y entornos con menos muestras etiquetadas o de forma autónoma. [ 4 ] [ 10 ]

[ 11 ]

Aproches

El enfoque de cámara autónoma

Las cámaras autónomas son cámaras que pueden dirigirse a sí mismas en su entorno. Recientemente se han realizado algunos trabajos que utilizan este enfoque. En el trabajo de Denzler et al., el movimiento de un objeto rastreado se modela utilizando un filtro de Kalman, mientras que la distancia focal que minimiza la incertidumbre en las estimaciones de estado es la que se utiliza. Se utilizó una configuración estéreo con dos cámaras con zoom. Se han escrito algunos artículos sobre el control del zoom, pero no abordan la estimación de la posición total objeto-cámara. Un intento de combinar estimación y control en el mismo marco se puede encontrar en el trabajo de Bagdanov et al., donde se utiliza una cámara Pan-Tilt-Zoom para rastrear rostros. [ 12 ] Tanto los modelos de estimación como de control utilizados son ad hoc, y el enfoque de estimación se basa en características de la imagen en lugar de propiedades 3D del objetivo que se está rastreando. [ 13 ]

El enfoque maestro/esclavo

En una configuración maestro/esclavo, se utiliza una cámara estática supervisora ​​para monitorizar un amplio campo de visión y rastrear cada objetivo móvil de interés. La posición de cada uno de estos objetivos a lo largo del tiempo se proporciona a una cámara foveal, que intenta observarlos con mayor resolución. Tanto la cámara estática como la activa están calibradas a una referencia común, de modo que los datos procedentes de una de ellas se pueden proyectar fácilmente sobre la otra para coordinar el control de los sensores activos. Otro posible uso del enfoque maestro/esclavo consiste en que una cámara estática (maestra) extraiga características visuales de un objeto de interés, mientras que el sensor activo (esclavo) utiliza estas características para detectar el objeto deseado sin necesidad de datos de entrenamiento. [ 13 ] [ 14 ]

En los últimos años ha crecido el interés por construir redes de cámaras activas y cámaras estáticas opcionales para cubrir una gran área manteniendo una alta resolución de múltiples objetivos. En definitiva, se trata de una versión ampliada del enfoque maestro/esclavo o del enfoque de cámara autónoma. Este enfoque puede ser muy eficaz, pero también increíblemente costoso. No solo implica el uso de múltiples cámaras, sino que además deben comunicarse entre sí, lo que puede resultar computacionalmente costoso. [ 13 ] [ 14 ] 6.º Jeff Foster

Marco de visión activa controlada

La visión activa controlada se define como un movimiento controlado de un sensor de visión que maximiza el rendimiento de cualquier algoritmo robótico que involucre dicho sensor. Se trata de un sistema híbrido que combina la teoría de control con la visión convencional. Una aplicación de este marco es el servocontrol robótico en tiempo real alrededor de objetos 3D estáticos o en movimiento. Véase Servocontrol visual. Los algoritmos que incorporan el uso de múltiples ventanas y medidas de confianza numéricamente estables se combinan con controladores estocásticos para proporcionar una solución satisfactoria al problema de seguimiento que surge al combinar la visión artificial y el control. En caso de que exista un modelo impreciso del entorno, se pueden introducir técnicas de control adaptativo. La información anterior y otras representaciones matemáticas de la visión activa controlada se pueden consultar en la tesis de Nikolaos Papanikolopoulos. [ 15 ]

Ejemplos

Ejemplos de sistemas de visión activa suelen implicar una cámara montada en un robot, [ 16 ] pero otros sistemas han empleado cámaras montadas en operadores humanos (también conocidas como "dispositivos portátiles"). [ 17 ] Las aplicaciones incluyen vigilancia automática, interacción humano-robot (video) , [ 18 ] [ 19 ] SLAM , planificación de rutas, [ 20 ] etc. En el DARPA Grand Challenge la mayoría de los equipos utilizaron LIDAR combinado con sistemas de visión activa para guiar vehículos sin conductor a través de un circuito todoterreno.

Un buen ejemplo de visión activa se puede ver en este vídeo de YouTube. Muestra el seguimiento facial mediante visión activa con un sistema de cámara de giro e inclinación. https://www.youtube.com/watch?v=N0FjDOTnmm0

La visión activa también es importante para comprender cómo los humanos [ 8 ] [ 21 ] y los organismos dotados de sensores visuales ven el mundo, considerando los límites de sus sensores, la riqueza y la variabilidad continua de la señal visual y los efectos de sus acciones y objetivos en su percepción. [ 7 ] [ 22 ] [ 23 ]

El marco de visión activa controlable puede utilizarse de diversas maneras. Algunos ejemplos podrían ser el seguimiento de vehículos , aplicaciones robóticas [ 24 ] y la segmentación interactiva de resonancia magnética [ 25 ] .

La segmentación interactiva de RM utiliza visión activa controlable mediante un diseño de control de Lyapanov para establecer un equilibrio entre la influencia de un flujo de gradiente basado en datos y la entrada humana a lo largo del tiempo. Esto acopla fluidamente la segmentación automática con la interactividad. Puede encontrar más información sobre este método en [ 25 ] . La segmentación en RM es un tema complejo, y se requiere un experto para trazar los segmentos deseados debido a que la RM capta todo el líquido y el tejido. Esto puede resultar poco práctico, ya que sería un proceso muy largo. Los métodos de visión activa controlable descritos en el artículo citado podrían ayudar a mejorar el proceso, reduciendo la dependencia humana.

  • Grupo de Visión Activa de la Universidad de Oxford.
  • Laboratorio de Visión Activa de la Universidad de Edimburgo.
  • Sistema de seguimiento visual activo para vehículos aéreos no tripulados desarrollado por la Universidad de Nueva Gales del Sur.

Referencias

  1. http://axiom.anu.edu.au/~rsl/rsl_active.html
  2. Ballard, Dana H. (1991). "Visión animada". Inteligencia Artificial . 48 : 57–86 . doi : 10.1016/0004-3702(91)90080-4 .
  3. 1 2 3 Aloimonos, John; Weiss, Isaac; Bandyopadhyay, Amit (1988). "Visión activa". Revista Internacional de Visión por Computadora . 1 (4): 333– 356. doi : 10.1007/BF00133571 . S2CID 25458585 . 
  4. 1 2 Ognibene, Dimitri; Baldassare, Gianluca (2015). "Visión activa ecológica: cuatro principios bioinspirados para integrar la atención ascendente y descendente adaptativa probada con un robot simple con brazo de cámara" . IEEE Transactions on Autonomous Mental Development . 7 : 3–25 . doi : 10.1109/TAMD.2014.2341351 . hdl : 10281/301362 .
  5. Denzler; Zobel; Niemann (2003). "Selección de distancia focal basada en la teoría de la información para el seguimiento activo de objetos 3D en tiempo real". Actas de la Novena Conferencia Internacional IEEE sobre Visión por Computadora . págs. 400–407 vol.1. CiteSeerX 10.1.1.122.1594 . doi : 10.1109/ICCV.2003.1238372 . ISBN   978-0-7695-1950-0. S2CID 17622133 . 
  6. Rivlin, Ehud; Rotstein, Héctor (2000). "Control de una cámara para visión activa: visión foveal, seguimiento suave y sacada" . International Journal of Computer Vision . 39 (2): 81– 96. doi : 10.1023/A:1008166825510 . S2CID 8737891 . 
  7. 1 2 Tatler, BW; Hayhoe, MM; Land, MF; Ballard, DH (2011). "Guía ocular en la visión natural: reinterpretando la prominencia" . Journal of Vision . 11 (5): 5. doi : 10.1167/11.5.5 . PMC 3134223. PMID 21622729 .  
  8. 1 2 Findlay, JM y Gilchrist, ID Visión activa, La psicología de mirar y ver Oxford University Press, 2003
  9. Tistarelli, M.; Sandini, G. (1993). "Sobre las ventajas del mapeo polar y log-polar para la estimación directa del tiempo hasta el impacto a partir del flujo óptico" . IEEE Transactions on Pattern Analysis and Machine Intelligence . 15 (4): 401– 410. CiteSeerX 10.1.1.49.9595 . doi : 10.1109/34.206959 . 
  10. Walther, Dirk; Rutishauser, Ueli; Koch, Christof; Perona, Pietro (2005). "La atención visual selectiva permite el aprendizaje y el reconocimiento de múltiples objetos en escenas desordenadas" (PDF) . Computer Vision and Image Understanding . 100 ( 1–2 ): 41–63 . CiteSeerX 10.1.1.110.976 . doi : 10.1016/j.cviu.2004.09.004 . 
  11. Larochelle, H.; Hinton, G. (6 de diciembre de 2010). "Aprendizaje para combinar vislumbres foveales con una máquina de Boltzmann de tercer orden" (PDF) . Actas de la 23.ª Conferencia Internacional sobre Sistemas de Procesamiento de Información Neuronal . Vol. 1. págs. 1243–1251 .  
  12. Bagdanov, AD; Del Bimbo, A.; Nunziati, W. (2006). «Mejora de la calidad probatoria de las imágenes de vigilancia mediante el seguimiento facial activo» . 18.ª Conferencia Internacional sobre Reconocimiento de Patrones (ICPR'06) . págs. 1200–1203 . doi : 10.1109/ICPR.2006.700 . ISBN  978-0-7695-2521-1. S2CID 2273696 . 
  13. 1 2 3 Al Haj, Murad; Fernández, Carles; Xiong, Zhanwu; Huerta, Iván; González, Jordi; Roca, Xavier (2011). "Más allá de la cámara estática: problemas y tendencias en visión activa". Análisis visual de humanos . págs. 11 a 30. doi : 10.1007/978-0-85729-997-0_2 . ISBN  978-0-85729-996-3.
  14. 1 2 Bellotto, Nicola; Benfold, Ben; Harland, Hanno; Nagel, Hans-Hellmut; Pirlo, Nicola; Reid, Ian; Sommerlade, Eric; Zhao, Chuan (2012). "Seguimiento visual cognitivo y control de cámara" (PDF) . Computer Vision and Image Understanding . 116 (3): 457– 471. doi : 10.1016/j.cviu.2011.09.011 . S2CID 4937663 . 
  15. Papanikolopoulos, Nikolaos Panagiotis (1992). Visión activa controlada (tesis doctoral). Universidad Carnegie Mellon.
  16. Mak, Lin Chi; Furukawa, Tomonari; Whitty, Mark (2008). "Un sistema de localización para un MAV de ala rotatoria en interiores mediante LED montados en las palas" . Sensor Review . 28 (2): 125– 131. doi : 10.1108/02602280810856688 . hdl : 1959.4/38231 .
  17. Mapeo de grandes bucles con una sola cámara de mano . LA Clemente, AJ Davison, ID Reid, J Neira, JD Tardós - Robótica: Ciencia y Sistemas, 2007
  18. ^ Demiris, Yiannis; Khadhouri, Bassam (2006). "Múltiples modelos jerárquicos atentos para la ejecución y reconocimiento de acciones". Robótica y Sistemas Autónomos . 54 (5): 361– 369. CiteSeerX 10.1.1.226.5282 . doi : 10.1016/j.robot.2006.02.003 . 
  19. Hacia el reconocimiento activo de eventos D Ognibene, Y Demiris La XXIII Conferencia Internacional Conjunta de Inteligencia Artificial (IJCAI13)
  20. http://www.surrey.ac.uk/eng/research/mechatronics/robots/Activities/ActiveVision/activevis.html Archivado el 17 de agosto de 2007 en Wayback Machine
  21. Land, Michael F. (2006). "Movimientos oculares y el control de las acciones en la vida cotidiana" (PDF) . Progress in Retinal and Eye Research . 25 (3): 296– 324. doi : 10.1016/j.preteyeres.2006.01.002 . PMID 16516530. S2CID 18946141 .  
  22. Lungarella, Max; Sporns, Olaf (2006). "Mapeo del flujo de información en redes sensoriomotoras" . PLOS Computational Biology . 2 (10): e144. Bibcode : 2006PLSCB...2..144L . doi : 10.1371/journal.pcbi.0020144 . PMC 1626158. PMID 17069456 .  
  23. Verschure, Paul FMJ; Voegtlin, Thomas; Douglas, Rodney J. (2003). "Sinergia mediada por el entorno entre percepción y comportamiento en robots móviles". Nature . 425 (6958): 620– 624. Bibcode : 2003Natur.425..620V . doi : 10.1038/nature02024 . PMID 14534588 . S2CID 4418697 .  
  24. Smith, CE; Papanikolopoulos, NP; Brandt, SA (1994). "Aplicación del marco de visión activa controlada a problemas de robótica y transporte". Actas del Taller IEEE de 1994 sobre Aplicaciones de la Visión por Computadora . págs. 213–220 . CiteSeerX 10.1.1.40.3470 . doi : 10.1109/ACV.1994.341311 . ISBN   978-0-8186-6410-6. S2CID 9735967 . 
  25. 1 2 Karasev, Peter; Kolesov, Ivan; Chudy, Karol; Tannenbaum, Allen; Muller, Grant; Xerogeanes, John (2011). "Segmentación interactiva de resonancia magnética con visión activa controlada". 50.ª Conferencia IEEE sobre Decisión y Control y Conferencia Europea de Control de 2011. págs. 2293–2298 . doi : 10.1109/CDC.2011.6161453 . ISBN  978-1-61284-801-3. PMC 3935399 . PMID 24584213 .