La clasificación contextual de imágenes , un tema del reconocimiento de patrones en la visión artificial , es un enfoque de clasificación basado en la información contextual de las imágenes. "Contextual" significa que este enfoque se centra en la relación de los píxeles cercanos, lo que también se denomina vecindad. El objetivo de este enfoque es clasificar las imágenes utilizando la información contextual.
Introducción
De manera similar al procesamiento del lenguaje , una sola palabra puede tener múltiples significados a menos que se proporcione el contexto, y los patrones dentro de las oraciones son los únicos segmentos informativos que nos interesan. En el caso de las imágenes, el principio es el mismo: hay que encontrar los patrones y asociarles los significados adecuados.
Como se ilustra en la imagen a continuación, si solo se muestra una pequeña parte de la imagen, es muy difícil saber de qué se trata la imagen.

Incluso si probamos otra parte de la imagen, sigue siendo difícil clasificarla.

Sin embargo, si aumentamos el contexto de la imagen, entonces tiene más sentido reconocerla.

Como muestran las imágenes completas a continuación, casi todo el mundo puede clasificarlo fácilmente.

Durante el procedimiento de segmentación , los métodos que no utilizan la información contextual son sensibles al ruido y las variaciones, por lo que el resultado de la segmentación contendrá una gran cantidad de regiones mal clasificadas, y a menudo estas regiones son pequeñas (por ejemplo, un píxel).
En comparación con otras técnicas, este enfoque es resistente al ruido y a las variaciones sustanciales, ya que tiene en cuenta la continuidad de los segmentos.
A continuación se describirán varios métodos de este enfoque.
Aplicaciones
Funciona como un filtro de posprocesamiento para una imagen etiquetada
Este método es muy eficaz contra regiones pequeñas causadas por ruido. Y estas regiones pequeñas suelen estar formadas por unos pocos píxeles o por un píxel. A estas regiones se les asigna la etiqueta más probable. Sin embargo, este método tiene un inconveniente. Las regiones pequeñas también pueden estar formadas por regiones correctas en lugar de por ruido, y en este caso el método en realidad empeora la clasificación. Este método se utiliza ampliamente en aplicaciones de teledetección .
Mejorando la clasificación del posprocesamiento
Este es un proceso de clasificación de dos etapas:
- Para cada píxel, etiquete el píxel y forme un nuevo vector de características para él.
- Utilice el nuevo vector de características y combine la información contextual para asignar la etiqueta final a la
Fusionando los píxeles en etapas anteriores
En lugar de utilizar píxeles individuales, los píxeles vecinos se pueden fusionar en regiones homogéneas que aprovechan la información contextual y proporcionan estas regiones al clasificador.
Adquisición de características de píxeles del vecindario
Los datos espectrales originales se pueden enriquecer añadiendo la información contextual que contienen los píxeles vecinos, o incluso reemplazarlos en algunas ocasiones. Este tipo de métodos de preprocesamiento se utilizan ampliamente en el reconocimiento de imágenes con textura . Los enfoques típicos incluyen valores medios, varianzas, descripción de la textura, etc.
Combinando información espectral y espacial
El clasificador utiliza el nivel de gris y la vecindad de los píxeles (información contextual) para asignar etiquetas a los píxeles. En este caso, la información es una combinación de información espectral y espacial.
Desarrollado por el clasificador de error mínimo de Bayes
La clasificación contextual de datos de imágenes se basa en el clasificador de error mínimo de Bayes (también conocido como clasificador Bayes ingenuo ).
Presentar el píxel :
- Un píxel se denota como .
- La vecindad de cada píxel es un vector y se denota como .
- Los valores en el vector de vecindad se denotan como .
- Cada píxel se representa mediante el vector
- Las etiquetas (clasificación) de los píxeles en el vecindario se presentan como un vector
- Aquí denota la clase asignada.
- Un vector presenta las etiquetas en el vecindario sin el píxel
El vecindario : Tamaño del vecindario. No hay límite de tamaño, pero se considera que es relativamente pequeño para cada píxel . Un tamaño razonable de vecindario sería de conectividad 4 u conectividad 8 ( está marcado en rojo y ubicado en el centro).
-
Barrio de 8 conectividades
El cálculo :
Aplicar la clasificación de error mínimo a un píxel , si la probabilidad de que una clase presente el píxel es la más alta entre todas, entonces asignar como su clase.
La regla de clasificación contextual se describe a continuación y utiliza el vector de características en lugar de .
Utilice la fórmula de Bayes para calcular la probabilidad a posteriori
El número de vectores es el mismo que el número de píxeles de la imagen. El clasificador utiliza un vector correspondiente a cada píxel y el vector se genera a partir de la vecindad del píxel.
Los pasos básicos de la clasificación de imágenes contextuales :
- Calcula el vector de características para cada píxel.
- Calcular los parámetros de la distribución de probabilidad y
- Calcular las probabilidades posteriores y todas las etiquetas . Obtener el resultado de la clasificación de la imagen.
Algoritmos
Coincidencia de plantillas
La comparación de plantillas es una implementación de "fuerza bruta" de este enfoque. [1] El concepto consiste en crear primero un conjunto de plantillas y luego buscar pequeñas partes en la imagen que coincidan con una plantilla.
Este método requiere mucho tiempo de cálculo y es ineficiente. Mantiene una lista completa de plantillas durante todo el proceso y la cantidad de combinaciones es extremadamente alta. Para una imagen de píxeles, podría haber un máximo de combinaciones, lo que genera un alto nivel de cálculo. Este método es un método de arriba hacia abajo y a menudo se lo denomina búsqueda en tabla o búsqueda en diccionario .
Cadena de Markov de orden inferior
La cadena de Markov [2] también se puede aplicar en el reconocimiento de patrones. Los píxeles de una imagen se pueden reconocer como un conjunto de variables aleatorias y, a continuación, se puede utilizar la cadena de Markov de orden inferior para encontrar la relación entre los píxeles. La imagen se trata como una línea virtual y el método utiliza probabilidad condicional.
Curvas de Hilbert que llenan el espacio
La curva de Hilbert recorre un patrón único a lo largo de toda la imagen, recorre cada píxel sin pasar por ninguno dos veces y mantiene una curva continua. Es rápida y eficiente.
Mallas de Markov
La cadena de Markov de orden inferior y las curvas de relleno del espacio de Hilbert mencionadas anteriormente tratan la imagen como una estructura lineal. Sin embargo, las mallas de Markov tendrán en cuenta la información bidimensional.
Árbol de dependencia
El árbol de dependencia [3] es un método que utiliza la dependencia del árbol para aproximar distribuciones de probabilidad.
Referencias
- ^ GT Toussaint, "El uso del contexto en el reconocimiento de patrones", Pattern Recognition, vol. 10, 1977, págs. 189-204.
- ^ K. Abend, TJ Harley y LN Kanal, "Clasificación de patrones aleatorios binarios", IEEE Transactions on Information Theory, vol. 11, núm. 4, octubre de 1965, págs. 538–544.
- ^ CK Chow y CN Liu, "Aproximación de distribuciones de probabilidad discretas con árboles de dependencia", IEEE Transactions on Information Theory, vol. 14, núm. 3, mayo de 1965, págs. 462–467.
Enlaces externos
- Página de inicio de Advanced Vision
- El uso del contexto en el reconocimiento de patrones
- Análisis y comprensión de imágenes: clasificación contextual de imágenes Archivado el 10 de diciembre de 2004 en Wayback Machine