Articulo de referencia

visión por computadora

Las tareas de visión artificial incluyen métodos para adquirir , procesar , analizar y comprender imágenes digitales , así como la extracción de datos de alta dimensión del mund...

Las tareas de visión artificial incluyen métodos para adquirir , procesar , analizar y comprender imágenes digitales , así como la extracción de datos de alta dimensión del mundo real para producir información numérica o simbólica, por ejemplo, en forma de decisiones. [ 1 ] [ 2 ] [ 3 ] [ 4 ] En este contexto, "comprender" significa la transformación de imágenes visuales en descripciones del mundo que tienen sentido para los procesos de pensamiento y pueden generar acciones apropiadas. Esta comprensión de imágenes puede verse como la separación de la información simbólica de los datos de imagen mediante modelos construidos con la ayuda de la geometría , la física , la estadística y la teoría del aprendizaje.

La disciplina científica de la visión artificial se ocupa de la teoría que subyace a los sistemas artificiales que extraen información de las imágenes. Los datos de imagen pueden adoptar diversas formas, como secuencias de vídeo, vistas de múltiples cámaras, datos multidimensionales de un escáner 3D , nubes de puntos 3D de sensores LiDAR o dispositivos de escaneo médico. La disciplina tecnológica de la visión artificial busca aplicar sus teorías y modelos a la construcción de sistemas de visión artificial.

Las subdisciplinas de la visión por computadora incluyen reconstrucción de escenas , detección de objetos , detección de eventos , reconocimiento de actividad , seguimiento de video , reconocimiento de objetos , estimación de pose 3D , aprendizaje, indexación, estimación de movimiento , servocontrol visual , modelado de escenas 3D y restauración de imágenes .

Definición

La visión por computadora es un campo interdisciplinario que se ocupa de cómo se puede lograr que las computadoras obtengan una comprensión de alto nivel a partir de imágenes o videos digitales . Desde la perspectiva de la ingeniería , busca automatizar tareas que el sistema visual humano puede realizar. [ 5 ] [ 6 ] [ 7 ] "La visión por computadora se ocupa de la extracción, el análisis y la comprensión automáticos de información útil de una sola imagen o una secuencia de imágenes. Implica el desarrollo de una base teórica y algorítmica para lograr la comprensión visual automática." [ 8 ] Como disciplina científica , la visión por computadora se ocupa de la teoría detrás de los sistemas artificiales que extraen información de las imágenes. Los datos de imagen pueden adoptar muchas formas, como secuencias de video, vistas de múltiples cámaras o datos multidimensionales de un escáner médico . [ 9 ] Como disciplina tecnológica, la visión por computadora busca aplicar sus teorías y modelos para la construcción de sistemas de visión por computadora. La visión artificial se refiere a una disciplina de ingeniería de sistemas, especialmente en el contexto de la automatización de fábricas. En tiempos más recientes, los términos visión por computadora y visión artificial han convergido en mayor medida. [ 10 ] : 13

Historia

A finales de la década de 1960, la visión por computadora comenzó en universidades pioneras en inteligencia artificial . Su objetivo era imitar el sistema visual humano como un paso previo para dotar a los robots de un comportamiento inteligente. [ 11 ] En 1966, se creía que esto podría lograrse mediante un proyecto de verano para estudiantes de pregrado, [ 12 ] conectando una cámara a una computadora y haciendo que "describiera lo que veía". [ 13 ] [ 14 ]

Lo que distinguía la visión por computadora del campo predominante del procesamiento de imágenes digitales en ese momento era el deseo de extraer la estructura tridimensional de las imágenes con el objetivo de lograr una comprensión completa de la escena. Los estudios de la década de 1970 sentaron las bases iniciales de muchos de los algoritmos de visión por computadora que existen hoy en día, incluyendo la extracción de bordes de imágenes, el etiquetado de líneas, el modelado poliédrico y no poliédrico , la representación de objetos como interconexiones de estructuras más pequeñas, el flujo óptico y la estimación de movimiento . [ 11 ]

La década siguiente vio estudios basados ​​en análisis matemáticos más rigurosos y aspectos cuantitativos de la visión por computadora. Estos incluyen el concepto de espacio de escala , la inferencia de forma a partir de varias señales como sombreado , textura y enfoque, y modelos de contorno conocidos como serpientes . Los investigadores también se dieron cuenta de que muchos de estos conceptos matemáticos podían tratarse dentro del mismo marco de optimización que la regularización y los campos aleatorios de Markov . [ 15 ] Para la década de 1990, algunos de los temas de investigación anteriores se volvieron más activos que otros. La investigación en reconstrucciones proyectivas 3-D condujo a una mejor comprensión de la calibración de la cámara . Con la llegada de los métodos de optimización para la calibración de la cámara, se comprendió que muchas de las ideas ya se habían explorado en la teoría de ajuste de haces del campo de la fotogrametría . Esto condujo a métodos para reconstrucciones 3-D dispersas de escenas a partir de múltiples imágenes . Se hizo progreso en el problema de correspondencia estéreo densa y más técnicas estéreo multivista. Al mismo tiempo, se utilizaron variaciones de corte de grafos para resolver la segmentación de imágenes . Esta década también marcó la primera vez que se utilizaron técnicas de aprendizaje estadístico en la práctica para reconocer rostros en imágenes (véase Eigenface ). Hacia finales de la década de 1990, se produjo un cambio significativo con la creciente interacción entre los campos de los gráficos por computadora y la visión por computadora. Esto incluyó la renderización basada en imágenes , la transformación de imágenes , la interpolación de vistas, la composición de imágenes panorámicas y la renderización temprana de campos de luz . [ 11 ]

Trabajos recientes han visto el resurgimiento de métodos basados ​​en características utilizados junto con técnicas de aprendizaje automático y marcos de optimización complejos. [ 16 ] [ 17 ] El avance de las técnicas de aprendizaje profundo ha revitalizado el campo de la visión por computadora. La precisión de los algoritmos de aprendizaje profundo en varios conjuntos de datos de referencia de visión por computadora para tareas que van desde la clasificación, [ 18 ] la segmentación y el flujo óptico ha superado a los métodos anteriores. [ 19 ] [ 20 ]

Detección de objetos en una fotografía

Física del estado sólido

La física del estado sólido es otro campo estrechamente relacionado con la visión artificial. La mayoría de los sistemas de visión artificial se basan en sensores de imagen que detectan radiación electromagnética , generalmente en forma de luz visible , infrarroja o ultravioleta . Estos sensores se diseñan utilizando la física cuántica . El proceso por el cual la luz interactúa con las superficies se explica mediante la física. La física explica el comportamiento de la óptica, que es una parte fundamental de la mayoría de los sistemas de imagen. Los sensores de imagen más sofisticados incluso requieren la mecánica cuántica para comprender completamente el proceso de formación de la imagen. [ 11 ] Además, diversos problemas de medición en física pueden abordarse mediante la visión artificial, por ejemplo, el movimiento en fluidos.

Neurobiología

Ejemplo simplificado de entrenamiento de una red neuronal para la detección de objetos: La red se entrena con múltiples imágenes que muestran estrellas de mar y erizos de mar , las cuales se correlacionan con "nodos" que representan características visuales . Las estrellas de mar se identifican por una textura anillada y un contorno estrellado, mientras que la mayoría de los erizos de mar se identifican por una textura rayada y una forma ovalada. Sin embargo, la presencia de un erizo de mar con textura anillada crea una asociación débil entre ellos.
Ejecución posterior de la red en una imagen de entrada (izquierda): [ 21 ] La red detecta correctamente la estrella de mar. Sin embargo, la asociación débilmente ponderada entre la textura anillada y el erizo de mar también confiere una señal débil a este último desde uno de los dos nodos intermedios. Además, una concha que no se incluyó en el entrenamiento da una señal débil para la forma ovalada, lo que también resulta en una señal débil para la salida del erizo de mar. Estas señales débiles pueden dar lugar a un resultado falso positivo para el erizo de mar. En realidad, las texturas y los contornos no estarían representados por nodos individuales, sino por patrones de peso asociados de múltiples nodos.

La neurobiología ha influido enormemente en el desarrollo de algoritmos de visión artificial. Durante el último siglo, se ha llevado a cabo un extenso estudio de los ojos, las neuronas y las estructuras cerebrales dedicadas al procesamiento de estímulos visuales tanto en humanos como en diversos animales. Esto ha dado lugar a una descripción, aunque aproximada, de cómo operan los sistemas de visión natural para resolver ciertas tareas relacionadas con la visión. Estos resultados han propiciado la creación de un subcampo dentro de la visión artificial donde se diseñan sistemas artificiales para imitar el procesamiento y el comportamiento de los sistemas biológicos en diferentes niveles de complejidad. Asimismo, algunos de los métodos basados ​​en el aprendizaje desarrollados en visión artificial ( por ejemplo , redes neuronales y análisis y clasificación de imágenes y características basados ​​en aprendizaje profundo ) tienen su origen en la neurobiología. El Neocognitron , una red neuronal desarrollada en la década de 1970 por Kunihiko Fukushima , es un ejemplo temprano de visión artificial que se inspira directamente en la neurobiología, específicamente en la corteza visual primaria .

Algunas líneas de investigación en visión artificial están estrechamente relacionadas con el estudio de la visión biológica ; de hecho, muchas líneas de investigación en IA están estrechamente vinculadas con la investigación sobre la inteligencia humana y el uso del conocimiento almacenado para interpretar, integrar y utilizar la información visual. El campo de la visión biológica estudia y modela los procesos fisiológicos que subyacen a la percepción visual en humanos y otros animales. La visión artificial, por otro lado, desarrolla y describe los algoritmos implementados en software y hardware en los sistemas de visión artificial. El intercambio interdisciplinario entre la visión biológica y la visión artificial ha resultado fructífero para ambos campos. [ 22 ]

Procesamiento de señales

Otro campo relacionado con la visión por computadora es el procesamiento de señales . Muchos métodos para procesar señales de una variable, generalmente temporales, pueden extenderse de forma natural al procesamiento de señales de dos variables o multivariables en visión por computadora. Sin embargo, debido a la naturaleza específica de las imágenes, existen muchos métodos desarrollados en visión por computadora que no tienen equivalente en el procesamiento de señales de una variable. Junto con la multidimensionalidad de la señal, esto define un subcampo del procesamiento de señales como parte de la visión por computadora.

Navegación robótica

La navegación robótica a veces implica la planificación de rutas autónomas o la deliberación para que los sistemas robóticos naveguen a través de un entorno . [ 23 ] Se requiere una comprensión detallada de estos entornos para navegar a través de ellos. La información sobre el entorno podría ser proporcionada por un sistema de visión artificial, que actúa como un sensor de visión y proporciona información de alto nivel sobre el entorno y el robot.

computación visual

La computación visual es un término genérico que engloba todas las disciplinas de la informática relacionadas con imágenes y modelos 3D , como los gráficos por computadora , el procesamiento de imágenes , la visualización , la visión artificial, la realidad virtual y aumentada , el procesamiento de video y la visualística computacional . La computación visual también incluye aspectos del reconocimiento de patrones , la interacción persona-computadora, el aprendizaje automático y las bibliotecas digitales. Los principales desafíos radican en la adquisición, el procesamiento, el análisis y la representación de información visual (principalmente imágenes y video). Entre las áreas de aplicación se encuentran el control de calidad industrial, el procesamiento y la visualización de imágenes médicas , la topografía, la robótica , los sistemas multimedia, el patrimonio virtual, los efectos especiales en cine y televisión, y la ludología . La computación visual también abarca el arte digital y los estudios de medios digitales .

Otros campos

Además de las perspectivas mencionadas sobre la visión por computadora, muchos temas de investigación relacionados también pueden estudiarse desde un punto de vista puramente matemático. Por ejemplo, muchos métodos en visión por computadora se basan en estadística , optimización o geometría . Finalmente, una parte significativa del campo se dedica al aspecto de implementación de la visión por computadora: cómo se pueden implementar los métodos existentes en diversas combinaciones de software y hardware, o cómo se pueden modificar estos métodos para aumentar la velocidad de procesamiento sin perder demasiado rendimiento. La visión por computadora también se utiliza en el comercio electrónico de moda, la gestión de inventarios, la búsqueda de patentes, el mobiliario y la industria de la belleza. [ 24 ]

Distinciones

Los campos más estrechamente relacionados con la visión por computadora son el procesamiento de imágenes , el análisis de imágenes y la visión artificial . Existe una superposición significativa en la gama de técnicas y aplicaciones que abarcan. Esto implica que las técnicas básicas que se utilizan y desarrollan en estos campos son similares, lo que puede interpretarse como que se trata de un solo campo con diferentes nombres. Por otro lado, parece necesario que los grupos de investigación, las revistas científicas, las conferencias y las empresas se presenten o promocionen como pertenecientes específicamente a uno de estos campos y, por lo tanto, se han presentado diversas caracterizaciones que distinguen cada campo de los demás. En el procesamiento de imágenes, tanto la entrada como la salida son imágenes, mientras que en la visión por computadora, la entrada es una imagen o un video, y la salida puede ser una imagen mejorada, un análisis del contenido de la imagen o incluso el comportamiento de un sistema basado en ese análisis.

Los gráficos por computadora producen datos de imagen a partir de modelos 3D, y la visión por computadora a menudo produce modelos 3D a partir de datos de imagen. [ 25 ] También hay una tendencia hacia una combinación de las dos disciplinas, por ejemplo , como se explora en la realidad aumentada .

Las siguientes caracterizaciones parecen relevantes, pero no deben tomarse como universalmente aceptadas:

  • El procesamiento y el análisis de imágenes suelen centrarse en imágenes bidimensionales, en cómo transformar una imagen en otra, por ejemplo , mediante operaciones a nivel de píxel como la mejora del contraste, operaciones locales como la extracción de bordes o la eliminación de ruido, o transformaciones geométricas como la rotación de la imagen. Esta caracterización implica que el procesamiento/análisis de imágenes no requiere suposiciones ni produce interpretaciones sobre el contenido de la imagen.
  • La visión por computadora incluye el análisis 3D a partir de imágenes 2D. Esto implica analizar la escena 3D proyectada sobre una o varias imágenes, por ejemplo , cómo reconstruir la estructura u otra información sobre la escena 3D a partir de una o varias imágenes. La visión por computadora suele basarse en suposiciones más o menos complejas sobre la escena representada en una imagen.
  • La visión artificial es el proceso de aplicar una variedad de tecnologías y métodos para proporcionar inspección automática basada en imágenes, control de procesos y guiado de robots [ 26 ] en aplicaciones industriales. [ 22 ] La visión artificial tiende a centrarse en aplicaciones, principalmente en la fabricación, por ejemplo , robots basados ​​en visión y sistemas para inspección, medición o selección basados ​​en visión (como la selección de contenedores [ 27 ] ). Esto implica que las tecnologías de sensores de imagen y la teoría de control a menudo se integran con el procesamiento de datos de imagen para controlar un robot y que se enfatiza el procesamiento en tiempo real a través de implementaciones eficientes en hardware y software. También implica que las condiciones externas, como la iluminación, pueden controlarse y a menudo se controlan más en la visión artificial que en la visión por computadora general, lo que puede permitir el uso de diferentes algoritmos.
  • También existe un campo llamado imagenología que se centra principalmente en el proceso de producción de imágenes, pero que a veces también se ocupa del procesamiento y análisis de las mismas. Por ejemplo, la imagenología médica incluye un trabajo sustancial en el análisis de datos de imagen en aplicaciones médicas. Los avances en las redes neuronales convolucionales (CNN) han mejorado la detección precisa de enfermedades en imágenes médicas, particularmente en cardiología, patología, dermatología y radiología. [ 28 ]
  • Finalmente, el reconocimiento de patrones es un campo que utiliza varios métodos para extraer información de señales en general, principalmente basados ​​en enfoques estadísticos y redes neuronales artificiales . [ 29 ] Una parte significativa de este campo se dedica a aplicar estos métodos a datos de imágenes.

La fotogrametría también se solapa con la visión por computadora, por ejemplo, la estereofotogrametría frente a la visión estéreo por computadora .

Aplicaciones

Las aplicaciones abarcan desde tareas como los sistemas de visión artificial industrial que, por ejemplo, inspeccionan botellas que pasan a gran velocidad en una línea de producción, hasta la investigación en inteligencia artificial y en ordenadores o robots capaces de comprender el mundo que les rodea. Los campos de la visión artificial y la visión por ordenador se superponen significativamente. La visión artificial abarca la tecnología central del análisis automatizado de imágenes, que se utiliza en numerosos campos. La visión artificial se refiere generalmente al proceso de combinar el análisis automatizado de imágenes con otros métodos y tecnologías para proporcionar inspección automatizada y guiado de robots en aplicaciones industriales. En muchas aplicaciones de visión artificial, los ordenadores están preprogramados para resolver una tarea específica, pero los métodos basados ​​en el aprendizaje automático son cada vez más comunes. Algunos ejemplos de aplicaciones de visión artificial incluyen sistemas para:

El aprendizaje de formas 3D ha sido una tarea desafiante en la visión por computadora. Los recientes avances en aprendizaje profundo han permitido a los investigadores construir modelos capaces de generar y reconstruir formas 3D a partir de mapas de profundidad o siluetas de una o varias vistas de forma fluida y eficiente. [ 25 ]

Para 2024, las principales áreas de visión artificial fueron la industria (tamaño del mercado US$5.22 mil millones), [ 34 ] la medicina (tamaño del mercado US$2.6 mil millones), [ 35 ] el sector militar (tamaño del mercado US$996.2 millones). [ 36 ]

Medicamento

Vídeo conceptual de DARPA sobre el razonamiento en medios visuales.

Uno de los campos de aplicación más destacados es la visión artificial médica , o procesamiento de imágenes médicas, que se caracteriza por la extracción de información de datos de imagen para diagnosticar a un paciente. [ 37 ] Un ejemplo de esto es la detección de tumores , arteriosclerosis u otros cambios malignos, y una variedad de patologías dentales; las mediciones de las dimensiones de los órganos, el flujo sanguíneo, etc., son otro ejemplo. También apoya la investigación médica al proporcionar nueva información: por ejemplo , sobre la estructura del cerebro o la calidad de los tratamientos médicos. Las aplicaciones de la visión artificial en el área médica también incluyen la mejora de imágenes interpretadas por humanos —imágenes de ultrasonido o imágenes de rayos X , por ejemplo— para reducir la influencia del ruido.

visión artificial

Una segunda área de aplicación de la visión artificial se encuentra en la industria, donde se extrae información para apoyar un proceso de producción. Un ejemplo es el control de calidad, donde se inspeccionan automáticamente detalles o productos finales para detectar defectos. Uno de los campos más comunes para este tipo de inspección es la industria de las obleas, donde cada oblea se mide e inspecciona para detectar imprecisiones o defectos y evitar que un chip informático llegue al mercado en condiciones inutilizables. Otro ejemplo es la medición de la posición y orientación de detalles que debe recoger un brazo robótico. La visión artificial también se utiliza ampliamente en los procesos agrícolas para eliminar alimentos no deseados de la materia prima, un proceso llamado clasificación óptica . [ 38 ]

Militar

Los ejemplos más evidentes son la detección de soldados o vehículos enemigos y la guía de misiles . Los sistemas más avanzados de guía de misiles los dirigen a una zona en lugar de a un objetivo específico, y la selección del objetivo se realiza cuando el misil alcanza dicha zona, basándose en datos de imagen adquiridos localmente. Los conceptos militares modernos, como el de "conocimiento del campo de batalla", implican que diversos sensores, incluidos los de imagen, proporcionan un amplio conjunto de información sobre la escena del combate que puede utilizarse para respaldar las decisiones estratégicas. En este caso, el procesamiento automático de los datos se utiliza para reducir la complejidad y fusionar la información de múltiples sensores, aumentando así la fiabilidad.

Vehículos autónomos

Concepto artístico de Curiosity , un ejemplo de vehículo terrestre no tripulado. La cámara estéreo está montada en la parte superior del rover.

Una de las áreas de aplicación más recientes son los vehículos autónomos, que incluyen sumergibles , vehículos terrestres (pequeños robots con ruedas, automóviles o camiones), vehículos aéreos y vehículos aéreos no tripulados ( UAV ). El nivel de autonomía varía desde vehículos totalmente autónomos (no tripulados) hasta vehículos donde los sistemas basados ​​en visión artificial asisten a un conductor o piloto en diversas situaciones. Los vehículos totalmente autónomos suelen utilizar visión artificial para la navegación, por ejemplo, para saber dónde se encuentran o mapear su entorno ( SLAM ), y para detectar obstáculos. También se puede utilizar para detectar ciertos eventos específicos de la tarea, por ejemplo , un UAV que busca incendios forestales. Ejemplos de sistemas de apoyo son los sistemas de advertencia de obstáculos en automóviles, las cámaras y los sensores LiDAR en vehículos, y los sistemas para el aterrizaje autónomo de aeronaves. Varios fabricantes de automóviles han demostrado sistemas para la conducción autónoma de automóviles . Existen numerosos ejemplos de vehículos militares autónomos, desde misiles avanzados hasta UAV para misiones de reconocimiento o guiado de misiles. La exploración espacial ya se está realizando con vehículos autónomos que utilizan visión artificial, por ejemplo , el rover Curiosity de la NASA y el rover Yutu-2 de la CNSA .

Retroalimentación táctil

Capa de piel artificial de caucho con estructura flexible para la estimación de la forma de superficies microonduladas.
Arriba se muestra un molde de silicona con una cámara en su interior que contiene varios marcadores de puntos. Al presionar este sensor contra la superficie, la silicona se deforma y la posición de los marcadores cambia. Un ordenador puede procesar estos datos y determinar con precisión cómo se presiona el molde contra la superficie. Esto se puede utilizar para calibrar manos robóticas y asegurar que puedan agarrar objetos con eficacia.

Materiales como el caucho y la silicona se utilizan para crear sensores que permiten aplicaciones como la detección de microondulaciones y la calibración de manos robóticas. El caucho se puede usar para crear un molde que se coloca sobre un dedo; dentro de este molde se encuentran múltiples galgas extensométricas. El molde y los sensores se colocan sobre una pequeña lámina de caucho con una matriz de pines. El usuario se pone el molde y traza una superficie. Una computadora lee los datos de las galgas extensométricas y mide si uno o más pines se desplazan hacia arriba. Si un pin se desplaza, la computadora lo reconoce como una imperfección en la superficie. Esta tecnología es útil para obtener datos precisos sobre imperfecciones en superficies muy grandes. [ 39 ] Otra variante de este sensor de molde son los sensores que contienen una cámara suspendida en silicona. La silicona forma una cúpula alrededor de la cámara y en ella se encuentran marcadores puntuales espaciados uniformemente. Estas cámaras se pueden colocar en dispositivos como manos robóticas para permitir que la computadora reciba datos táctiles de alta precisión. [ 40 ]

Otras aplicaciones

Otras áreas de aplicación incluyen:

Tareas típicas

Cada una de las áreas de aplicación descritas anteriormente emplea diversas tareas de visión artificial: problemas de medición o procesamiento, más o menos definidos, que pueden resolverse mediante distintos métodos. A continuación, se presentan algunos ejemplos de tareas típicas de visión artificial.

Las tareas de visión por computadora incluyen métodos para adquirir , procesar , analizar y comprender imágenes digitales, y la extracción de datos de alta dimensión del mundo real para producir información numérica o simbólica, por ejemplo , en forma de decisiones. [ 1 ] [ 2 ] [ 3 ] [ 4 ] La comprensión en este contexto significa la transformación de imágenes visuales en descripciones del mundo que pueden interactuar con otros procesos de pensamiento y generar acciones apropiadas. Esta comprensión de imágenes puede verse como la separación de la información simbólica de los datos de la imagen utilizando modelos construidos con la ayuda de la geometría, la física, la estadística y la teoría del aprendizaje. [ 46 ]

Reconocimiento

El problema clásico en visión por computadora, procesamiento de imágenes y visión artificial es determinar si los datos de la imagen contienen o no algún objeto, característica o actividad específicos. En la literatura se describen diferentes variedades de problemas de reconocimiento. [ 47 ]

  • Reconocimiento de objetos (también llamado clasificación de objetos ) : se pueden reconocer uno o varios objetos o clases de objetos predefinidos o aprendidos, generalmente junto con sus posiciones 2D en la imagen o poses 3D en la escena. Blippar, Google Goggles y LikeThat ofrecen programas independientes que ilustran esta funcionalidad. 
  • Identificación : se reconoce una instancia individual de un objeto. Algunos ejemplos son la identificación del rostro o la huella dactilar de una persona específica, la identificación de dígitos escritos a mano o la identificación de un vehículo específico. 
  • Detección : los datos de la imagen se analizan en busca de objetos específicos y su ubicación. Algunos ejemplos incluyen la detección de obstáculos en el campo de visión del automóvil y posibles células o tejidos anormales en imágenes médicas, o la detección de un vehículo en un sistema automático de peaje. La detección basada en cálculos relativamente sencillos y rápidos se utiliza a veces para encontrar regiones más pequeñas de datos de imagen de interés, que luego se analizan mediante técnicas computacionalmente más exigentes para obtener una interpretación correcta. 

Actualmente, los mejores algoritmos para estas tareas se basan en redes neuronales convolucionales . Un ejemplo de sus capacidades lo proporciona el ImageNet Large Scale Visual Recognition Challenge ; este es un referente en clasificación y detección de objetos, con millones de imágenes y 1000 clases de objetos utilizadas en la competición. [ 48 ] El rendimiento de las redes neuronales convolucionales en las pruebas de ImageNet ahora se acerca al de los humanos. [ 48 ] Los mejores algoritmos aún tienen dificultades con objetos pequeños o delgados, como una pequeña hormiga en el tallo de una flor o una persona sosteniendo una pluma en la mano. También tienen problemas con imágenes que han sido distorsionadas con filtros (un fenómeno cada vez más común con las cámaras digitales modernas). Por el contrario, este tipo de imágenes rara vez suponen un problema para los humanos. Sin embargo, los humanos tienden a tener problemas con otros asuntos. Por ejemplo, no son buenos clasificando objetos en clases de grano fino, como la raza particular de perro o la especie de ave, mientras que las redes neuronales convolucionales lo manejan con facilidad.

Existen varias tareas especializadas basadas en el reconocimiento, tales como:

  • Recuperación de imágenes basada en contenido : encontrar todas las imágenes de un conjunto más amplio que tengan un contenido específico. El contenido se puede especificar de diferentes maneras, por ejemplo, en términos de similitud con una imagen objetivo (dame todas las imágenes similares a la imagen X) mediante técnicas de búsqueda inversa de imágenes , o en términos de criterios de búsqueda de alto nivel proporcionados como texto (dame todas las imágenes que contengan muchas casas, que hayan sido tomadas durante el invierno y que no tengan coches). 
Visión por computadora para el conteo de personas en lugares públicos, centros comerciales y tiendas.

Análisis de movimiento

Varias tareas están relacionadas con la estimación de movimiento, donde se procesa una secuencia de imágenes para producir una estimación de la velocidad en cada punto de la imagen, en la escena 3D o incluso de la cámara que produce las imágenes. Ejemplos de dichas tareas son:

  • Egomotion : determinación del movimiento rígido tridimensional (rotación y traslación) de la cámara a partir de una secuencia de imágenes producida por la misma. 
  • Seguimiento : seguimiento de los movimientos de un conjunto (generalmente) más pequeño de puntos u objetos de interés ( por ejemplo , vehículos, objetos, personas u otros organismos [ 44 ] ) en la secuencia de imágenes. Esto tiene amplias aplicaciones industriales, ya que la mayoría de la maquinaria de alta velocidad puede ser monitoreada de esta manera. 
  • Flujo óptico : para determinar, para cada punto de la imagen, cómo se mueve ese punto con respecto al plano de la imagen, es decir , su movimiento aparente. Este movimiento es el resultado tanto del movimiento del punto 3D correspondiente en la escena como del movimiento de la cámara con respecto a la escena. 

Reconstrucción de la escena

A partir de una o (normalmente) más imágenes de una escena, o un vídeo, la reconstrucción de escenas tiene como objetivo calcular un modelo 3D de la misma. En el caso más sencillo, el modelo puede ser un conjunto de puntos 3D. Métodos más sofisticados generan un modelo de superficie 3D completo. La llegada de la imagen 3D sin necesidad de movimiento ni escaneo, junto con los algoritmos de procesamiento relacionados, está permitiendo rápidos avances en este campo. La detección 3D basada en cuadrículas permite adquirir imágenes 3D desde múltiples ángulos. Actualmente existen algoritmos para unir varias imágenes 3D y formar nubes de puntos y modelos 3D. [ 25 ]

Restauración de imágenes

La restauración de imágenes entra en juego cuando la imagen original se degrada o daña debido a factores externos como una mala posición de la lente, interferencias en la transmisión, poca iluminación o desenfoque por movimiento, etc., lo que se conoce como ruido. Cuando las imágenes se degradan o dañan, la información que se puede extraer de ellas también se ve afectada. Por lo tanto, es necesario recuperar o restaurar la imagen a su estado original. El objetivo de la restauración de imágenes es eliminar el ruido (ruido del sensor, desenfoque por movimiento, etc.) de las imágenes. El método más sencillo para eliminar el ruido consiste en utilizar diversos tipos de filtros, como filtros de paso bajo o filtros de mediana. Los métodos más sofisticados parten de un modelo de cómo se ven las estructuras locales de la imagen para distinguirlas del ruido. Al analizar primero los datos de la imagen en términos de las estructuras locales, como líneas o bordes, y luego controlar el filtrado en función de la información local obtenida en el análisis, se suele conseguir un mejor nivel de eliminación de ruido en comparación con los métodos más sencillos.

Un ejemplo en este campo es el relleno de imágenes .

Métodos de sistema

La organización de un sistema de visión artificial depende en gran medida de la aplicación. Algunos sistemas son aplicaciones independientes que resuelven un problema específico de medición o detección, mientras que otros constituyen un subsistema de un diseño más amplio que, por ejemplo, también incluye subsistemas para el control de actuadores mecánicos, planificación, bases de datos, interfaces hombre-máquina, etc. La implementación específica de un sistema de visión artificial también depende de si su funcionalidad está predefinida o si alguna parte de ella puede aprenderse o modificarse durante su funcionamiento. Muchas funciones son exclusivas de la aplicación. Sin embargo, existen funciones típicas que se encuentran en muchos sistemas de visión artificial.

  • Adquisición de imágenes : Una imagen digital se produce mediante uno o varios sensores de imagen , que, además de diversos tipos de cámaras fotosensibles, incluyen sensores de distancia , dispositivos de tomografía, radar, cámaras ultrasónicas, etc. Según el tipo de sensor, los datos de imagen resultantes son una imagen 2D ordinaria, un volumen 3D o una secuencia de imágenes. Los valores de los píxeles suelen corresponder a la intensidad de la luz en una o varias bandas espectrales (imágenes en escala de grises o en color), pero también pueden estar relacionados con diversas medidas físicas, como la profundidad, la absorción o la reflectancia de ondas sónicas o electromagnéticas, o la resonancia magnética . [ 38 ]
  • Preprocesamiento : Antes de aplicar un método de visión artificial a los datos de imagen para extraer información específica, suele ser necesario procesar los datos para asegurar que cumplen con ciertos supuestos implícitos en el método. Algunos ejemplos son:
    • Remuestreo para asegurar que el sistema de coordenadas de la imagen sea correcto.
    • Reducción de ruido para garantizar que el ruido del sensor no introduzca información errónea.
    • Mejora del contraste para garantizar que se pueda detectar la información relevante.
    • Representación del espacio de escalas para realzar las estructuras de la imagen a escalas localmente apropiadas.
  • Extracción de características : Se extraen características de la imagen con distintos niveles de complejidad a partir de los datos de la imagen. [ 38 ] Ejemplos típicos de dichas características son:
Las características más complejas pueden estar relacionadas con la textura, la forma o el movimiento.
  • Detección / segmentación : En algún punto del procesamiento, se toma una decisión sobre qué puntos o regiones de la imagen son relevantes para su posterior procesamiento. [ 38 ] Ejemplos:
    • Selección de un conjunto específico de puntos de interés.
    • Segmentación de una o varias regiones de una imagen que contienen un objeto de interés específico.
    • Segmentación de la imagen en una arquitectura de escena anidada que comprende primer plano, grupos de objetos, objetos individuales o partes de objetos prominentes [ 51 ] (también denominada jerarquía de escena de taxón espacial), [ 52 ] mientras que la prominencia visual a menudo se implementa como atención espacial y temporal .
    • Segmentación o cosegmentación de uno o varios vídeos en una serie de máscaras de primer plano por fotograma, manteniendo su continuidad semántica temporal. [ 53 ] [ 54 ]
  • Procesamiento de alto nivel : en este paso, la entrada suele ser un pequeño conjunto de datos, por ejemplo, un conjunto de puntos o una región de imagen, que se supone que contiene un objeto específico. [ 38 ] El procesamiento restante se ocupa, por ejemplo:
    • Verificación de que los datos cumplen con los supuestos basados ​​en el modelo y específicos de la aplicación.
    • Estimación de parámetros específicos de la aplicación, como la postura o el tamaño del objeto.
    • Reconocimiento de imágenes : clasificación de un objeto detectado en diferentes categorías.
    • Registro de imágenes : comparación y combinación de dos vistas diferentes del mismo objeto.
  • Toma de decisiones Tomar la decisión final requerida para la solicitud, [ 38 ] por ejemplo:
    • Aprobado/suspenso en aplicaciones de inspección automática.
    • Coincidencia/no coincidencia en aplicaciones de reconocimiento.
    • Marcar para su posterior revisión humana en aplicaciones médicas, militares, de seguridad y de reconocimiento.

Sistemas de comprensión de imágenes

Los sistemas de comprensión de imágenes (SII) incluyen tres niveles de abstracción: el nivel bajo comprende elementos básicos de la imagen, como bordes, texturas o regiones; el nivel intermedio incluye límites, superficies y volúmenes; y el nivel alto comprende objetos, escenas o eventos. Muchos de estos requisitos son objeto de futuras investigaciones.

Los requisitos de representación en el diseño de los IUS para estos niveles son: representación de conceptos prototípicos, organización de conceptos, conocimiento espacial, conocimiento temporal, escalamiento y descripción por comparación y diferenciación.

Mientras que la inferencia se refiere al proceso de derivar hechos nuevos, no representados explícitamente, a partir de hechos ya conocidos, el control se refiere al proceso que selecciona cuál de las muchas técnicas de inferencia, búsqueda y comparación debe aplicarse en una etapa particular del procesamiento. Los requisitos de inferencia y control para la inferencia son: búsqueda y activación de hipótesis, comparación y comprobación de hipótesis, generación y uso de expectativas, cambio y enfoque de la atención, certeza y fuerza de la creencia, inferencia y satisfacción de objetivos. [ 55 ]

Hardware

Un iPad Pro modelo 2020 con sensor LiDAR

Existen diversos tipos de sistemas de visión artificial; sin embargo, todos ellos incluyen los siguientes elementos básicos: una fuente de alimentación, al menos un dispositivo de adquisición de imágenes (cámara, CCD, etc.), un procesador y cables de control y comunicación o algún tipo de mecanismo de interconexión inalámbrica. Además, un sistema de visión práctico incluye software y una pantalla para su monitorización. Los sistemas de visión para interiores, al igual que la mayoría de los industriales, incorporan un sistema de iluminación y pueden ubicarse en un entorno controlado. Asimismo, un sistema completo incluye numerosos accesorios, como soportes para la cámara, cables y conectores.

La mayoría de los sistemas de visión artificial utilizan cámaras de luz visible que observan pasivamente una escena a una velocidad de fotogramas de como máximo 60 fotogramas por segundo (normalmente mucho menor).

Algunos sistemas de visión artificial utilizan hardware de adquisición de imágenes con iluminación activa o con alguna fuente de luz distinta a la visible, o ambas, como escáneres 3D de luz estructurada , cámaras termográficas , generadores de imágenes hiperespectrales , imágenes de radar , escáneres lidar , imágenes de resonancia magnética , sonar de barrido lateral , sonar de apertura sintética , etc. Este hardware captura "imágenes" que luego se procesan, a menudo utilizando los mismos algoritmos de visión artificial que se emplean para procesar imágenes de luz visible.

Si bien los sistemas de video tradicionales para transmisión y consumo operan a una velocidad de 30 fotogramas por segundo, los avances en el procesamiento de señales digitales y el hardware gráfico para el consumidor han hecho posible la adquisición, el procesamiento y la visualización de imágenes a alta velocidad para sistemas en tiempo real del orden de cientos a miles de fotogramas por segundo. Para aplicaciones en robótica, los sistemas de video rápidos en tiempo real son de vital importancia y, a menudo, pueden simplificar el procesamiento necesario para ciertos algoritmos. Combinada con un proyector de alta velocidad, la rápida adquisición de imágenes permite realizar mediciones 3D y seguimiento de características. [ 56 ]

Los sistemas de visión egocéntrica se componen de una cámara portátil que toma fotografías automáticamente desde una perspectiva en primera persona.

A partir de 2016, las unidades de procesamiento de visión están emergiendo como una nueva clase de procesadores para complementar las CPU y las unidades de procesamiento gráfico (GPU) en esta función. [ 57 ]

Véase también

Liza

Referencias

  1. ^ Reinhard Klette (2014). Visión por computadora concisa . Saltador. ISBN 978-1-4471-6320-6.
  2. 1 2 Linda G. Shapiro ; George C. Stockman (2001). Visión por computadora . Prentice Hall. ISBN 978-0-13-030796-5.
  3. 1 2 Tim Morris (2004). Visión por computadora y procesamiento de imágenes . Palgrave Macmillan. ISBN 978-0-333-99451-1.
  4. 1 2 Bernd Jähne; Horst Haußecker (2000). Visión por computadora y aplicaciones: una guía para estudiantes y profesionales . Academic Press. ISBN 978-0-13-085198-7.
  5. Dana H. Ballard; Christopher M. Brown (1982). Visión por computadora . Prentice Hall. ISBN 978-0-13-165316-0.
  6. Huang, T. (1996-11-19). Vandoni, Carlo E (ed.). Visión por computadora: evolución y promesas (PDF) . 19.ª Escuela de Computación del CERN . Ginebra: CERN. pp. 21–25 . doi : 10.5170/CERN-1996-008.21 . ISBN  978-92-9083-095-5Archivado (PDF) del original el 7 de febrero de 2018 .
  7. Milan Sonka; Vaclav Hlavac; Roger Boyle (2008). Procesamiento, análisis y visión artificial de imágenes . Thomson. ISBN 978-0-495-08252-1.
  8. http://www.bmva.org/visionoverview Archivado el 16 de febrero de 2017 en Wayback Machine. La Asociación Británica de Visión Artificial y la Sociedad para el Reconocimiento de Patrones. Consultado el 20 de febrero de 2017.
  9. Murphy, Mike (13 de abril de 2017). "El escáner médico 'tricorder' de Star Trek está cada vez más cerca de convertirse en realidad" . Archivado del original el 2 de julio de 2017. Recuperado el 18 de julio de 2017 .
  10. Principios, algoritmos, aplicaciones y aprendizaje de la visión por computadora, 5.ª edición, de ER Davies, Academic Press, Elsevier, 2018, ISBN 978-0-12-809284-2
  11. 1 2 3 4 Richard Szeliski (30 de septiembre de 2010). Visión por computadora: algoritmos y aplicaciones . Springer Science & Business Media. págs. 10–16 . ISBN  978-1-84882-935-0.
  12. Sejnowski, Terrence J. (2018). La revolución del aprendizaje profundo . Cambridge, Massachusetts. Londres, Inglaterra: The MIT Press. pág. 28. ISBN  978-0-262-03803-4.
  13. Papert, Seymour (1966-07-01). "The Summer Vision Project". MIT AI Memos (1959 - 2004) . hdl : 1721.1/6125 .
  14. Margaret Ann Boden (2006). La mente como máquina: una historia de la ciencia cognitiva . Clarendon Press. pág. 781. ISBN  978-0-19-954316-8.
  15. Takeo Kanade (6 de diciembre de 2012). Visión artificial tridimensional . Springer Science & Business Media. ISBN 978-1-4613-1981-8.
  16. Nicu Sebe; Ira Cohen; Ashutosh Garg; Thomas S. Huang (3 de junio de 2005). Aprendizaje automático en visión por computadora . Springer Science & Business Media. ISBN 978-1-4020-3274-5.
  17. William Freeman; Pietro Perona; Bernhard Scholkopf (2008). "Editorial invitado: Aprendizaje automático para la visión por computadora" . Revista Internacional de Visión por Computadora . 77 (1): 1. doi : 10.1007/s11263-008-0127-7 . hdl : 21.11116/0000-0003-30FB-C . ISSN 1573-1405 . 
  18. LeCun, Yann; Bengio, Yoshua; Hinton, Geoffrey (2015). " Aprendizaje profundo" (PDF) . Nature . 521 (7553): 436– 444. Bibcode : 2015Natur.521..436L . doi : 10.1038/nature14539 . PMID 26017442. S2CID 3074096 .  
  19. Ilg, Eddy; Mayer, Nikolaus; Saikia, Tonmoy; Keuper, Margret; Dosovitskiy, Alexey; Brox, Thomas (2016). "FlowNet 2.0: Evolución de la estimación del flujo óptico con redes profundas". arXiv : 1612.01925 [ cs.CV ].
  20. ^ Jiao, Licheng; Zhang, ventilador; Liu, colmillo; Yang, Shuyuan; Li, Lingling; Feng, Zhixi; Qu, Rong (2019). "Una encuesta sobre detección de objetos basada en aprendizaje profundo" . Acceso IEEE . 7 : 128837– 128868. arXiv : 1907.09408 . Código Bib : 2019IEEEA...7l8837J . doi : 10.1109/ACCESS.2019.2939201 . S2CID 198147317 . 
  21. Ferrie, C.; Kaiser, S. (2019). Redes neuronales para bebés . Sourcebooks. ISBN 978-1-4926-7120-6.
  22. ^ Steger , Carsten; Markus Ulrich; Christian Wiedemann (2018). Algoritmos y aplicaciones de visión artificial (2ª ed.). Weinheim: Wiley-VCH . pag. 1.ISBN   978-3-527-41365-2Archivado del original el 15 de marzo de 2023. Consultado el 30 de enero de 2018 .
  23. Murray, Don y Cullen Jennings. « Mapeo y navegación basados ​​en visión estéreo para robots móviles. Archivado el 31/10/2020 en Wayback Machine ». Actas de la Conferencia Internacional sobre Robótica y Automatización. Vol. 2. IEEE, 1997.
  24. Andrade, Norberto Almeida. "Visión computacional e inteligencia empresarial en el segmento de belleza: un análisis a través de Instagram" (PDF) . Journal of Marketing Management . American Research Institute for Policy Development. Archivado del original el 11 de marzo de 2024. Recuperado el 11 de marzo de 2024 .
  25. 1 2 3 Soltani, AA; Huang, H.; Wu, J.; Kulkarni, TD; Tenenbaum, JB (2017). "Síntesis de formas 3D mediante el modelado de mapas de profundidad multivista y siluetas con redes generativas profundas". 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR) . pp. 1511–1519 . doi : 10.1109/CVPR.2017.269 . hdl : 1721.1/126644 . ISBN  978-1-5386-0457-1. S2CID 31373273 . 
  26. Turek, Fred (junio de 2011). "Fundamentos de la visión artificial: cómo hacer que los robots vean". NASA Tech Briefs Magazine . 35 (6).páginas 60–62
  27. "El futuro de la selección aleatoria automatizada de contenedores" . Archivado del original el 11 de enero de 2018. Consultado el 10 de enero de 2018 .
  28. Esteva, Andre; Chou, Katherine; Yeung, Serena; Naik, Nikhil; Madani, Ali; Mottaghi, Ali; Liu, Yun; Topol, Eric; Dean, Jeff; Socher, Richard (2021-01-08). "Visión artificial médica habilitada por aprendizaje profundo" . npj Digital Medicine . 4 (1): 5. doi : 10.1038/s41746-020-00376-2 . ISSN 2398-6352 . PMC 7794558. PMID 33420381 .   
  29. Chervyakov, NI; Lyakhov, PA; Deryabin, MA; Nagornov, NN; Valueva, MV; Valuev, GV (2020). "Solución basada en el sistema de numeración de residuos para reducir el costo de hardware de una red neuronal convolucional". Neurocomputing . 407 : 439– 453. doi : 10.1016/j.neucom.2020.04.018 . S2CID 219470398 . Las redes neuronales convolucionales (CNN) representan arquitecturas de aprendizaje profundo que actualmente se utilizan en una amplia gama de aplicaciones, incluyendo visión artificial, reconocimiento de voz, identificación de secuencias albuminosas en bioinformática, control de producción, análisis de series temporales en finanzas y muchas otras. 
  30. Wäldchen, Jana; Mäder, Patrick (2017-01-07). "Identificación de especies vegetales mediante técnicas de visión artificial: una revisión sistemática de la literatura" . Archives of Computational Methods in Engineering . 25 (2): 507– 543. doi : 10.1007/s11831-016-9206-z . ISSN 1134-3060 . PMC 6003396. PMID 29962832 .   
  31. Aghamohammadesmaeilketabforoosh, Kimia; Nikan, Soodeh; Antonini, Giorgio; Pearce, Joshua M. (enero de 2024). "Optimización de la detección de enfermedades y calidad de la fresa con Vision Transformers y redes neuronales convolucionales basadas en atención" . Foods . 13 ( 12): 1869. doi : 10.3390/foods13121869 . ISSN 2304-8158 . PMC 11202458. PMID 38928810 .   
  32. "Nuevo modelo de IA desarrollado en Western detecta enfermedades de la fresa y busca reducir el desperdicio" . Londres . 13 de septiembre de 2024. Consultado el 19 de septiembre de 2024 .
  33. "Aplicaciones de la visión por computadora" . GeeksforGeeks . 30 de junio de 2020. Consultado el 27 de abril de 2025 .
  34. "Análisis del crecimiento del mercado global de visión artificial industrial: tamaño y pronóstico 2024-2028" . www.technavio.com . Consultado el 14 de mayo de 2025 .
  35. Laviola, Erin. "¿Qué es la visión artificial y cómo se utiliza en la atención médica?" . HealthTech . Consultado el 14 de mayo de 2025 .
  36. "Visión por computadora: perspectivas del mercado militar de la inteligencia artificial" . www.grandviewresearch.com . Consultado el 14 de mayo de 2025 .
  37. Li, Mengfang; Jiang, Yuanyuan; Zhang, Yanzhou; Zhu, Haisheng (2023). "Análisis de imágenes médicas mediante algoritmos de aprendizaje profundo" . Frontiers in Public Health . 11 1273253. Bibcode : 2023FrPH...1173253L . doi : 10.3389/fpubh.2023.1273253 . ISSN 2296-2565 . PMC 10662291. PMID 38026291 .   
  38. 1 2 3 4 5 6 E. Roy Davies (2005). Visión artificial: teoría, algoritmos y aspectos prácticos . Morgan Kaufmann. ISBN 978-0-12-206093-9.
  39. Ando, ​​Mitsuhito; Takei, Toshinobu; Mochiyama, Hiromi (2020-03-03). "Capa de piel artificial de caucho con estructura flexible para la estimación de la forma de superficies microonduladas" . ROBOMECH Journal . 7 (1): 11. doi : 10.1186/s40648-020-00159-0 . ISSN 2197-4225 . 
  40. Choi, Seung-hyun; Tahara, Kenji (2020-03-12). "Manipulación diestra de objetos mediante una mano robótica multifinger con sensores visuales y táctiles en las puntas de los dedos" . ROBOMECH Journal . 7 (1): 14. doi : 10.1186/s40648-020-00162-5 . ISSN 2197-4225 . 
  41. Garg, Hitendra (29 de febrero de 2020). "Detección de somnolencia en un conductor mediante una aplicación convencional de visión artificial". Conferencia Internacional de 2020 sobre Electrónica de Potencia y Aplicaciones de IoT en Energía Renovable y su Control (PARC) . págs. 50–53 . doi : 10.1109/PARC49193.2020.236556 . ISBN  978-1-7281-6575-2. S2CID 218564267 . 
  42. Hasan, Fudail; Kashevnik, Alexey (14 de mayo de 2021). «Análisis del estado del arte de los algoritmos modernos de detección de somnolencia basados ​​en visión artificial» . 29.ª Conferencia de la Asociación de Innovaciones Abiertas (FRUCT) de 2021. págs. 141-149 . doi : 10.23919/FRUCT52173.2021.9435480 . ISBN  978-952-69244-5-8. S2CID 235207036 . Archivado del original el 27-06-2022 . Recuperado el 06-11-2022 . 
  43. ^ Balasundaram, A; Ashokkumar, S; Kothandaraman, D; kora, SeenaNaik; Sudarshan, E; Harshaverdhan, A (1 de diciembre de 2020). "Detección de fatiga basada en visión por computadora mediante parámetros faciales" . Serie de conferencias IOP: Ciencia e ingeniería de materiales . 981 (2) 022005. Código bibliográfico : 2020MS y E..981b2005B . doi : 10.1088/1757-899x/981/2/022005 . ISSN 1757-899X . S2CID 230639179 .  
  44. 1 2 Bruijning, Marjolein; Visser, Marco D.; Hallmann, Caspar A.; Jongejans, Eelke; Golding, Nick (2018). "trackdem: Seguimiento automatizado de partículas para obtener recuentos de población y distribuciones de tamaño a partir de vídeos en r" . Methods in Ecology and Evolution . 9 (4): 965– 973. Bibcode : 2018MEcEv...9..965B . doi : 10.1111/2041-210X.12975 . hdl : 2066/184075 . ISSN 2041-210X . 
  45. Quamer, Amanullah; Asgari, Nima; Pearce, Joshua M (2026-06-01). "Modelo de aprendizaje profundo de dos etapas para el conteo no destructivo de hojas en cultivos de tomate" . Computers and Electronics in Agriculture . 247 111717. doi : 10.1016/j.compag.2026.111717 . ISSN 0168-1699 . 
  46. David A. Forsyth; Jean Ponce (2003). Visión por computadora: un enfoque moderno . Prentice Hall. ISBN 978-0-13-085198-7.
  47. Forsyth, David; Ponce, Jean (2012). Visión por computadora: un enfoque moderno . Pearson.
  48. ^ Russakovsky , Olga; Deng, Jia; Su, Hao; Krause, Jonathan; Satheesh, Sanjeev; Mamá, Sean; Huang, Zhiheng; Karpathy, Andrej; Khosla, Aditya; Bernstein, Michael; Berg, Alexander C. (diciembre de 2015). "Desafío de reconocimiento visual a gran escala de ImageNet" . Revista Internacional de Visión por Computadora . 115 (3): 211– 252. arXiv : 1409.0575 . doi : 10.1007/s11263-015-0816-y . hdl : 1721.1/104944 . ISSN 0920-5691 . S2CID 2930547 . Archivado desde el original el 15 de marzo de 2023 . Consultado el 20 de noviembre de 2020 .  
  49. Quinn, Arthur (09/10/2022). "Reconocimiento de imágenes mediante IA: una tendencia inevitable en el estilo de vida moderno" . TopTen.ai . Archivado del original el 02/12/2022 . Consultado el 23/12/2022 .
  50. Barrett, Lisa Feldman; Adolphs, Ralph; Marsella, Stacy; Martinez, Aleix M.; Pollak, Seth D. (julio de 2019). " Expresiones emocionales reconsideradas: desafíos para inferir emociones a partir de movimientos faciales humanos" . Psychological Science in the Public Interest . 20 (1): 1– 68. doi : 10.1177/1529100619832930 . ISSN 1529-1006 . PMC 6640856. PMID 31313636 .   
  51. A. Maity (2015). "Detección y manipulación improvisada de objetos salientes". arXiv : 1511.02999 [ cs.CV ].
  52. Barghout, Lauren. « Enfoque taxométrico visual para la segmentación de imágenes mediante corte taxonómico espacial difuso que genera regiones contextualmente relevantes. Archivado el 14/11/2018 en Wayback Machine ». Procesamiento de la información y gestión de la incertidumbre en sistemas basados ​​en el conocimiento. Springer International Publishing, 2014.
  53. Liu, Ziyi; Wang, Le; Hua, Gang; Zhang, Qilin; Niu, Zhenxing; Wu, Ying; Zheng, Nanning (2018). "Joint Video Object Discovery and Segmentation by Coupled Dynamic Markov Networks" (PDF) . IEEE Transactions on Image Processing . 27 (12): 5840– 5853. Bibcode : 2018ITIP...27.5840L . doi : 10.1109/tip.2018.2859622 . ISSN 1057-7149 . PMID 30059300. S2CID 51867241. Archivado del original (PDF) el 7 de septiembre de 2018. Recuperado el 14 de septiembre de 2018 .   
  54. Wang, Le; Duan, Xuhuan; Zhang, Qilin; Niu, Zhenxing; Hua, Gang; Zheng, Nanning (22 de mayo de 2018). "Segment-Tube: Localización de acciones espaciotemporales en vídeos sin recortar con segmentación por fotograma" (PDF) . Sensors . 18 (5): 1657. Bibcode : 2018Senso..18.1657W . doi : 10.3390/s18051657 . ISSN 1424-8220 . PMC 5982167. PMID 29789447. Archivado (PDF) del original el 7 de septiembre de 2018 .   
  55. Shapiro, Stuart C. (1992). Enciclopedia de la Inteligencia Artificial, Volumen 1. Nueva York: John Wiley & Sons, Inc. pp. 643–646 . ISBN  978-0-471-50306-4.
  56. Kagami, Shingo (2010). «Sistemas de visión de alta velocidad y proyectores para la percepción del mundo en tiempo real». 2010 IEEE Computer Society Conference on Computer Vision and Pattern Recognition - Workshops . Vol. 2010. pp. 100–107 . doi : 10.1109/CVPRW.2010.5543776 . ISBN   978-1-4244-7029-7. S2CID 14111100 . 
  57. Seth Colaner (3 de enero de 2016). "Un tercer tipo de procesador para RV/RA: la VPU Myriad 2 de Movidius" . www.tomshardware.com . Archivado del original el 15 de marzo de 2023. Consultado el 3 de mayo de 2016 .

Lecturas adicionales

  • James E. Dobson (2023). El nacimiento de la visión por computadora . University of Minnesota Press. ISBN 978-1-5179-1421-9.
  • David Marr (1982). Visión . WH Freeman and Company. ISBN 978-0-7167-1284-8.
  • Azriel Rosenfeld; Avinash Kak (1982). Procesamiento digital de imágenes . Academic Press. ISBN 978-0-12-597301-4.
  • Barghout, Lauren; Lawrence W. Lee (2003). Sistema de procesamiento de información perceptiva . Solicitud de patente estadounidense 10/618,543. ISBN 978-0-262-08159-7.
  • Berthold KP Horn (1986). Visión robótica . Prensa del MIT. ISBN 978-0-262-08159-7.
  • Michael C. Fairhurst (1988). Visión por computadora para sistemas robóticos . Prentice Hall. ISBN 978-0-13-166919-2.
  • Olivier Faugeras (1993). Visión por computadora tridimensional: una perspectiva geométrica . MIT Press. ISBN 978-0-262-06158-2.
  • Tony Lindeberg (1994). Teoría del espacio de escalas en visión por computadora . Springer. ISBN 978-0-7923-9418-1.
  • James L. Crowley; Henrik I. Christensen, eds. (1995). La visión como proceso . Springer-Verlag. ISBN 978-3-540-58143-7.
  • Gösta H. Granlund; Hans Knutsson (1995). Procesamiento de señales para visión por computadora . Editorial académica Kluwer. ISBN 978-0-7923-9530-0.
  • Reinhard Klette; Karsten Schluens; Andreas Koschan (1998). Visión por computadora: datos tridimensionales a partir de imágenes . Springer, Singapur. ISBN 978-981-3083-71-4.
  • Emanuele Trucco; Alejandro Verri (1998). Técnicas introductorias a la visión por computadora 3-D . Prentice Hall. ISBN 978-0-13-261108-4.
  • Bernd Jähne (2002). Procesamiento de imágenes digitales . Springer. ISBN 978-3-540-67754-3.
  • Richard Hartley y Andrew Zisserman (2003). Geometría de múltiples vistas en visión por computadora . Cambridge University Press. ISBN 978-0-521-54051-3.
  • Gérard Medioni; Sing Bing Kang (2004). Temas emergentes en visión por computadora . Prentice Hall. ISBN 978-0-13-101366-7.
  • R. Fisher; K. Dawson-Howe; A. Fitzgibbon; C. Robertson; E. Trucco (2005). Diccionario de visión por computadora y procesamiento de imágenes . John Wiley. ISBN 978-0-470-01526-1.
  • Nikos Paragios , Yunmei Chen y Olivier Faugeras (2005). Manual de modelos matemáticos en visión por computadora . Springer. ISBN 978-0-387-26371-7.
  • Wilhelm Burger; Mark J. Burge (2007). Procesamiento de imágenes digitales: un enfoque algorítmico con Java . Springer . ISBN 978-1-84628-379-6Archivado del original el 17 de mayo de 2014. Consultado el 13 de junio de 2007 .
  • Pedram Azad; Tilo Gockel; Rüdiger Dillmann (2008). Visión por computadora: principios y práctica . Elektor International Media BV. ISBN 978-0-905705-71-2.
  • Richard Szeliski (2010). Visión por computadora: algoritmos y aplicaciones . Springer-Verlag. ISBN 978-1-84882-934-3.
  • JR Parker (2011). Algoritmos para el procesamiento de imágenes y la visión por computadora (2.ª  ed.). Wiley. ISBN 978-0-470-64385-3.
  • Richard J. Radke (2013). Visión por computadora para efectos visuales . Cambridge University Press. ISBN 978-0-521-76687-6.
  • Nixon, Mark; Aguado, Alberto (2019). Extracción de características y procesamiento de imágenes para visión por computadora (4.ª  ed.). Academic Press. ISBN 978-0-12-814976-8.
  • Lista de conferencias sobre visión artificial de USC Iris
  • Artículos sobre visión artificial en la web : una lista completa de los artículos de las conferencias más relevantes sobre visión artificial.
  • Computer Vision Online (archivado el 30/11/2011 en Wayback Machine) : noticias, código fuente, conjuntos de datos y ofertas de trabajo relacionados con la visión artificial.
  • CVonline – Compendio de Visión por Computadora de Bob Fisher.
  • Asociación Británica de Visión Artificial (BMVA ): apoya la investigación en visión artificial en el Reino Unido a través de las conferencias BMVC y MIUA, la revista Annals of the BMVA (de código abierto), la Escuela de Verano de la BMVA y reuniones de un día.
  • Contenedor de visión artificial, Joe Hoeller GitHub: Contenedor de código abierto ampliamente adoptado para aplicaciones de visión artificial aceleradas por GPU. Utilizado por investigadores, universidades, empresas privadas y el gobierno de EE. UU.
Obtenido de " https://en.wikipedia.org/w/index.php?title=Computer_vision&oldid=1359975054 "