En visión artificial y procesamiento de imágenes , una característica es información sobre el contenido de una imagen; generalmente, se refiere a si una región específica de la imagen posee ciertas propiedades. Las características pueden ser estructuras específicas de la imagen, como puntos, bordes u objetos. También pueden ser el resultado de una operación general de vecindad o detección de características aplicada a la imagen. Otros ejemplos de características están relacionados con el movimiento en secuencias de imágenes o con formas definidas mediante curvas o límites entre diferentes regiones de la imagen.
En términos más generales, una característica es cualquier información relevante para resolver la tarea computacional relacionada con una aplicación específica. Este concepto es similar al de característica en el aprendizaje automático y el reconocimiento de patrones en general, si bien el procesamiento de imágenes cuenta con un conjunto de características mucho más sofisticado. El concepto de característica es muy general, y la selección de características en un sistema de visión artificial concreto puede depender en gran medida del problema específico en cuestión.
Definición
No existe una definición universal ni exacta de lo que constituye una característica, y dicha definición suele depender del problema o del tipo de aplicación. Sin embargo, una característica se define generalmente como una parte "interesante" de una imagen , y se utiliza como punto de partida para muchos algoritmos de visión artificial.
Dado que las características se utilizan como punto de partida y primitivas principales para los algoritmos subsiguientes, el algoritmo en su conjunto a menudo será tan bueno como su detector de características. Por consiguiente, la propiedad deseable para un detector de características es la repetibilidad : si la misma característica se detectará o no en dos o más imágenes diferentes de la misma escena.
La detección de características es una operación de procesamiento de imágenes de bajo nivel . Generalmente, se realiza como la primera operación en una imagen y examina cada píxel para determinar si contiene alguna característica. Si forma parte de un algoritmo más amplio, este solo examinará la región donde se encuentran dichas características. Como requisito previo para la detección de características, la imagen de entrada suele suavizarse mediante un núcleo gaussiano en una representación de espacio de escalas , y se calculan una o varias imágenes de características, a menudo expresadas en términos de operaciones de derivadas locales de la imagen .
En ocasiones, cuando la detección de características resulta computacionalmente costosa y existen limitaciones de tiempo, se puede utilizar un algoritmo de nivel superior para guiar la etapa de detección de características, de modo que solo se busquen características en ciertas partes de la imagen.
Existen numerosos algoritmos de visión artificial que utilizan la detección de características como paso inicial, lo que ha dado lugar al desarrollo de una gran cantidad de detectores de características. Estos varían considerablemente en cuanto al tipo de características que detectan, su complejidad computacional y su repetibilidad.
Cuando las características se definen en términos de operaciones de vecindad local aplicadas a una imagen, un procedimiento comúnmente conocido como extracción de características , se puede distinguir entre los enfoques de detección de características que toman decisiones locales sobre si existe o no una característica de un tipo determinado en un punto específico de la imagen, y aquellos que producen datos no binarios como resultado. Esta distinción cobra relevancia cuando las características detectadas resultantes son relativamente escasas. Si bien se toman decisiones locales, el resultado de un paso de detección de características no tiene por qué ser una imagen binaria. El resultado se suele representar en términos de conjuntos de coordenadas (conectadas o no) de los puntos de la imagen donde se han detectado características, a veces con precisión subpíxel.
Cuando la extracción de características se realiza sin toma de decisiones local, el resultado suele denominarse imagen de características . Por consiguiente, una imagen de características puede considerarse una imagen en el sentido de que es una función de las mismas variables espaciales (o temporales) que la imagen original, pero donde los valores de los píxeles contienen información sobre las características de la imagen en lugar de intensidad o color. Esto significa que una imagen de características puede procesarse de forma similar a una imagen ordinaria generada por un sensor de imagen. Las imágenes de características también se suelen calcular como un paso integrado en los algoritmos de detección de características.
Vectores de características y espacios de características
En algunas aplicaciones, no basta con extraer un solo tipo de característica para obtener la información relevante de los datos de la imagen. En su lugar, se extraen dos o más características diferentes, lo que da como resultado dos o más descriptores de características en cada punto de la imagen. Una práctica común es organizar la información proporcionada por todos estos descriptores como los elementos de un único vector, comúnmente denominado vector de características . El conjunto de todos los vectores de características posibles constituye un espacio de características . [ 1 ]
Un ejemplo común de vectores de características se presenta cuando se desea clasificar cada punto de una imagen dentro de una clase específica. Suponiendo que cada punto de la imagen posee un vector de características correspondiente, basado en un conjunto adecuado de características, lo que implica que cada clase está bien diferenciada en el espacio de características correspondiente, la clasificación de cada punto de la imagen puede realizarse mediante un método de clasificación estándar .
Otro ejemplo relacionado se da cuando se aplica el procesamiento basado en redes neuronales a imágenes. Los datos de entrada que se alimentan a la red neuronal suelen proporcionarse en forma de un vector de características de cada punto de la imagen, donde el vector se construye a partir de varias características diferentes extraídas de los datos de la imagen. Durante la fase de aprendizaje, la red puede determinar por sí misma qué combinaciones de diferentes características son útiles para resolver el problema en cuestión.
Tipos
Bordes
Los bordes son puntos donde existe un límite (o borde) entre dos regiones de una imagen. En general, un borde puede tener una forma casi arbitraria y puede incluir uniones. En la práctica, los bordes se definen como conjuntos de puntos en la imagen con una magnitud de gradiente elevada . Además, algunos algoritmos comunes encadenan puntos de alto gradiente para formar una descripción más completa de un borde. Estos algoritmos suelen imponer ciertas restricciones a las propiedades del borde, como la forma, la suavidad y el valor del gradiente.
Localmente, los bordes tienen una estructura unidimensional.
Esquinas/puntos de interés
Los términos esquinas y puntos de interés se usan indistintamente y se refieren a características puntuales en una imagen, que poseen una estructura bidimensional local. El nombre "esquina" surgió cuando los primeros algoritmos realizaban la detección de bordes y luego los analizaban para encontrar cambios rápidos de dirección (esquinas). Estos algoritmos se desarrollaron posteriormente, eliminando la necesidad de una detección explícita de bordes, por ejemplo, buscando altos niveles de curvatura en el gradiente de la imagen . Entonces se observó que las llamadas esquinas también se detectaban en partes de la imagen que no eran esquinas en el sentido tradicional (por ejemplo, se puede detectar un pequeño punto brillante sobre un fondo oscuro). Estos puntos se conocen frecuentemente como puntos de interés, pero el término "esquina" se usa tradicionalmente .
Puntos de interés / regiones
Los blobs proporcionan una descripción complementaria de las estructuras de la imagen en términos de regiones, a diferencia de las esquinas, que son más puntuales. Sin embargo, los descriptores de blobs suelen contener un punto preferido (un máximo local de la respuesta de un operador o un centro de gravedad), lo que significa que muchos detectores de blobs también pueden considerarse operadores de puntos de interés. Los detectores de blobs pueden detectar áreas en una imagen que son demasiado suaves para ser detectadas por un detector de esquinas.
Consideremos reducir el tamaño de una imagen y luego realizar la detección de esquinas. El detector responderá a los puntos que son nítidos en la imagen reducida, pero que pueden ser suaves en la imagen original. Es en este punto donde la diferencia entre un detector de esquinas y un detector de manchas se vuelve algo difusa. En gran medida, esta distinción se puede solucionar incluyendo una noción de escala adecuada. Sin embargo, debido a sus propiedades de respuesta a diferentes tipos de estructuras de imagen a diferentes escalas, los detectores de manchas LoG y DoH también se mencionan en el artículo sobre detección de esquinas .
Crestas
Para objetos alargados, la noción de crestas es una herramienta natural. Un descriptor de cresta calculado a partir de una imagen en escala de grises puede considerarse una generalización de un eje medial . Desde un punto de vista práctico, una cresta puede pensarse como una curva unidimensional que representa un eje de simetría y, además, tiene un atributo de ancho de cresta local asociado a cada punto de la cresta. Sin embargo, lamentablemente, es algorítmicamente más difícil extraer características de crestas de clases generales de imágenes en escala de grises que características de bordes, esquinas o regiones. No obstante, los descriptores de crestas se utilizan con frecuencia para la extracción de carreteras en imágenes aéreas y para la extracción de vasos sanguíneos en imágenes médicas (véase detección de crestas ).
Detección

La detección de características incluye métodos para calcular abstracciones de la información de la imagen y tomar decisiones locales en cada punto de la imagen sobre si existe o no una característica de un tipo determinado en ese punto. Las características resultantes serán subconjuntos del dominio de la imagen, a menudo en forma de puntos aislados, curvas continuas o regiones conectadas.
La extracción de características a veces se realiza mediante varias escalas. Uno de estos métodos es la transformación de características invariantes a la escala (SIFT).
Extracción
Una vez detectadas las características, se puede extraer un parche de imagen local alrededor de la característica. Esta extracción puede requerir un procesamiento de imagen considerable. El resultado se conoce como descriptor de características o vector de características. Entre los métodos utilizados para la descripción de características, cabe mencionar los N -jets y los histogramas locales (véase la transformación de características invariante a la escala como ejemplo de descriptor de histograma local). Además de esta información de atributos, el paso de detección de características por sí mismo también puede proporcionar atributos complementarios, como la orientación del borde y la magnitud del gradiente en la detección de bordes, y la polaridad y la intensidad del blob en la detección de blobs.
Nivel bajo
- Detección de bordes
- Detección de esquinas
- detección de blobs
- detección de crestas
- Transformación de características invariantes a la escala
Curvatura
- Dirección del borde, cambio de intensidad, autocorrelación .
Movimiento de la imagen
- Detección de movimiento . Enfoque diferencial basado en áreas. Flujo óptico .
Basado en la forma
- Umbralización
- Extracción de blob
- Coincidencia de plantillas
- Hough transforma
- Pauta
- Círculos/elipses
- Formas arbitrarias (transformada de Hough generalizada)
- Funciona con cualquier característica parametrizable (variables de clase, detección de clústeres, etc.).
- Transformación de Hough generalizada
Métodos flexibles
- Formas deformables y parametrizadas
- Contornos activos (serpientes)
Representación
Una característica específica de una imagen, definida en términos de una estructura específica en los datos de la imagen, a menudo puede representarse de diferentes maneras. Por ejemplo, un borde puede representarse como una variable booleana en cada punto de la imagen que indica si hay un borde presente en ese punto. Alternativamente, podemos usar una representación que proporcione una medida de certeza en lugar de una declaración booleana sobre la existencia del borde y combinarla con información sobre su orientación . De manera similar, el color de una región específica puede representarse mediante el color promedio (tres escalares) o un histograma de color (tres funciones).
Cuando se diseña un sistema o algoritmo de visión artificial, la elección de la representación de características puede ser un aspecto crítico. En algunos casos, un mayor nivel de detalle en la descripción de una característica puede ser necesario para resolver el problema, pero esto conlleva el coste de tener que manejar más datos y un procesamiento más exigente. A continuación, se analizan algunos de los factores que son relevantes para elegir una representación adecuada. En esta discusión, una instancia de una representación de características se denominadescriptor de características , o simplementedescriptor.
Certeza o confianza
Dos ejemplos de características de imagen son la orientación de los bordes locales y la velocidad local en una secuencia de imágenes. En el caso de la orientación, el valor de esta característica puede ser más o menos indefinido si hay más de un borde en la vecindad correspondiente. La velocidad local es indefinida si la región de la imagen correspondiente no contiene ninguna variación espacial. Como consecuencia de esta observación, puede ser relevante utilizar una representación de características que incluya una medida de certeza o confianza relacionada con la afirmación sobre el valor de la característica. De lo contrario, es típico que el mismo descriptor se utilice para representar valores de características de baja certeza y valores de características cercanos a cero, lo que genera ambigüedad en la interpretación de este descriptor. Dependiendo de la aplicación, dicha ambigüedad puede ser aceptable o no.
En particular, si una imagen destacada se va a utilizar en un procesamiento posterior, puede ser conveniente emplear una representación de características que incluya información sobre la certeza o la confianza . Esto permite calcular un nuevo descriptor de características a partir de varios descriptores, por ejemplo, calculados en el mismo punto de la imagen pero a diferentes escalas, o a partir de puntos distintos pero adyacentes, en términos de un promedio ponderado donde los pesos se derivan de las certezas correspondientes. En el caso más simple, el cálculo correspondiente puede implementarse como un filtrado de paso bajo de la imagen destacada. La imagen de características resultante será, en general, más estable frente al ruido.
Promediabilidad
Además de incluir medidas de certeza en la representación, la representación de los valores de las características correspondientes puede ser apta o no para una operación de promediado . En la práctica, la mayoría de las representaciones de características se pueden promediar, pero solo en ciertos casos el descriptor resultante puede interpretarse correctamente en términos de un valor de característica. Dichas representaciones se denominan promediables .
Por ejemplo, si la orientación de una arista se representa mediante un ángulo, esta representación debe presentar una discontinuidad donde el ángulo pasa de su valor máximo a su valor mínimo. En consecuencia, puede ocurrir que dos orientaciones similares se representen mediante ángulos cuya media no se encuentre cerca de ninguno de los ángulos originales y, por lo tanto, esta representación no sea promediable. Existen otras representaciones de la orientación de las aristas, como el tensor de estructura , que sí son promediables.
Otro ejemplo se relaciona con el movimiento, donde en algunos casos solo se puede extraer la velocidad normal relativa a un borde. Si se han extraído dos de estas características y se puede asumir que se refieren a la misma velocidad real, esta velocidad no se expresa como el promedio de los vectores de velocidad normal. Por lo tanto, los vectores de velocidad normal no son promediables. En cambio, existen otras representaciones del movimiento, mediante matrices o tensores, que proporcionan la velocidad real en términos de una operación de promedio de los descriptores de velocidad normal.
Pareo
Las características detectadas en cada imagen se pueden comparar entre varias imágenes para establecer características correspondientes , como puntos correspondientes .
El algoritmo se basa en comparar y analizar las correspondencias de puntos entre la imagen de referencia y la imagen objetivo. Si alguna parte de la escena desordenada comparte correspondencias mayores que el umbral, esa parte de la imagen de la escena desordenada se considera objetivo y se cree que contiene el objeto de referencia. [ 18 ]
Véase también
Referencias
- ↑ Scott E Umbaugh (27 de enero de 2005). Computer Imaging: Digital Image Analysis and Processing . CRC Press. ISBN 978-0-8493-2919-7.
- ↑ Ferrie, C., & Kaiser, S. (2019). Redes neuronales para bebés . Sourcebooks. ISBN 1492671207.
{{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Canny, J. (1986). "Un enfoque computacional para la detección de bordes". IEEE Transactions on Pattern Analysis and Machine Intelligence . 8 (6): 679– 714. doi : 10.1109/TPAMI.1986.4767851 . PMID 21869365. S2CID 13284142 .
- ↑ C. Harris; M. Stephens (1988). "Un detector combinado de esquinas y bordes" (PDF) . Actas de la 4.ª Conferencia Alvey Vision . págs. 147–151 . Archivado del original (PDF) el 1 de abril de 2022. Consultado el 11 de febrero de 2021 .
- ↑ SM Smith; JM Brady (mayo de 1997). "SUSAN: un nuevo enfoque para el procesamiento de imágenes de bajo nivel" . International Journal of Computer Vision . 23 (1): 45–78 . doi : 10.1023/A:1007963824710 . S2CID 15033310 .
- ↑ J. Shi; C. Tomasi (junio de 1994). "Buenas características para rastrear" . 9.ª Conferencia IEEE sobre Visión por Computadora y Reconocimiento de Patrones . Springer.
- 1 2 3 T. Lindeberg (1998). "Detección de características con selección automática de escala" (resumen) . International Journal of Computer Vision . 30 (2): 77– 116. doi : 10.1023/A:1008045108935 . S2CID 723210 .
- ↑ E. Rosten; T. Drummond (2006). "Aprendizaje automático para la detección de esquinas a alta velocidad". Conferencia Europea sobre Visión por Computadora . Springer. pp. 430–443 . CiteSeerX 10.1.1.60.3991 . doi : 10.1007/11744023_34 .
- ↑ JL Crowley y AC Parker, " Una representación de la forma basada en picos y crestas en la diferencia de la transformada de paso bajo"", Transacciones IEEE en PAMI, PAMI 6 (2), págs. 156-170, marzo de 1984.
- ↑ D. Lowe (2004). "Características distintivas de imágenes a partir de puntos clave invariantes a la escala" . International Journal of Computer Vision . 60 (2): 91. CiteSeerX 10.1.1.73.2924 . doi : 10.1023/B:VISI.0000029664.99615.94 . S2CID 221242327 .
- ↑ T. Lindeberg "Propiedades de selección de escala de detectores de puntos de interés en el espacio de escalas generalizados", Journal of Mathematical Imaging and Vision, Volumen 46, Número 2, páginas 177-210, 2013.
- ↑ T. Lindeberg "Coincidencia de imágenes mediante puntos de interés generalizados en el espacio de escalas", Journal of Mathematical Imaging and Vision , volumen 52, número 1, páginas 3-36, 2015.
- ↑ J. Matas; O. Chum; M. Urban; T. Pajdla (2002). "Estéreo robusto de línea base amplia a partir de regiones extremas máximamente estables" (PDF) . Conferencia Británica de Visión por Máquina . págs. 384–393 .
- ↑ R. Haralick, " Crestas y valles en imágenes digitales ", Computer Vision, Graphics, and Image Processing vol. 22, no. 10, pp. 28–38, abril de 1983.
- ↑ D. Eberly, R. Gardner, B. Morse, S. Pizer, C. Scharlach, Ridges for image analysis , Journal of Mathematical Imaging and Vision, v. 4 n. 4, pp. 353–373, dic. 1994.
- ↑ T. Lindeberg (1998). "Detección de bordes y detección de crestas con selección automática de escala" (resumen) . International Journal of Computer Vision . 30 (2): 117– 154. doi : 10.1023/A:1008097225773 . S2CID 207658261 .
- ↑ T. Lindeberg (1993). "Detección de estructuras de imagen prominentes tipo mancha y sus escalas con un boceto primario en el espacio de escalas: un método para el foco de atención" (resumen) . International Journal of Computer Vision . 11 (3): 283– 318. doi : 10.1007/BF01469346 . S2CID 11998035 .
- ↑ "Detección de objetos en una escena desordenada mediante coincidencia de características puntuales - MATLAB y Simulink" . www.mathworks.com . Consultado el 6 de julio de 2019 .
Lecturas adicionales
- T. Lindeberg (2009). "Espacio de escalas" . En Benjamin Wah (ed.). Enciclopedia de Ciencias de la Computación e Ingeniería . Vol. IV. John Wiley and Sons. pp. 2495–2504 . doi : 10.1002/9780470050118.ecse609 . ISBN 978-0470050118.(Resumen y revisión de varios detectores de características formulados a partir de operaciones en el espacio de escalas)
- Detección de características (visión por computadora)