En visión artificial , la segmentación de movimiento rígido es el proceso de separar regiones , características o trayectorias de una secuencia de video en subconjuntos coherentes de espacio y tiempo. Estos subconjuntos corresponden a objetos independientes que se mueven rígidamente en la escena. El objetivo de esta segmentación es diferenciar y extraer el movimiento rígido significativo del fondo y analizarlo. Las técnicas de segmentación de imágenes etiquetan los píxeles para que sean parte de píxeles con ciertas características en un momento particular. Aquí, los píxeles se segmentan dependiendo de su movimiento relativo durante un período de tiempo, es decir, el tiempo de la secuencia de video.
Se han propuesto varios métodos para hacerlo. [1] No existe una forma consistente de clasificar la segmentación de movimiento debido a su gran variación en la literatura. Dependiendo del criterio de segmentación utilizado en el algoritmo, se puede clasificar ampliamente en las siguientes categorías: diferencia de imagen, métodos estadísticos, wavelets, capas, flujo óptico y factorización. Además, dependiendo del número de vistas requeridas, los algoritmos pueden basarse en dos o múltiples vistas. La segmentación de movimiento rígida ha encontrado un aumento en su aplicación en el pasado reciente con el aumento de la vigilancia y la edición de video . Estos algoritmos se discuten más a fondo.
Introducción al movimiento rígido
En general, el movimiento puede considerarse como una transformación de un objeto en el espacio y el tiempo. Si esta transformación conserva el tamaño y la forma del objeto, se denomina transformación rígida. La transformación rígida puede ser rotacional, traslacional o reflexiva. Definimos matemáticamente la transformación rígida como:

donde F es una transformada rígida si y sólo si conserva la isometría y la orientación espacial .
En el sentido de movimiento, la transformación rígida es el movimiento de un objeto rígido en el espacio. Como se muestra en la Figura 1: este movimiento tridimensional es la transformación de las coordenadas originales (X, Y, Z) a las coordenadas transformadas (X', Y', Z') que es el resultado de la rotación y la traslación capturadas por la matriz rotacional R y el vector traslacional T respectivamente. Por lo tanto, la transformación será:
dónde,
tiene 9 incógnitas que corresponden al ángulo de rotación con cada eje y tiene 3 incógnitas ( ) que representan la traslación en las direcciones X, Y y Z respectivamente. Este movimiento (3-D) en el tiempo cuando es capturado por una cámara (2-D) corresponde al cambio de píxeles en los fotogramas posteriores de la secuencia de video. Esta transformación también se conoce como movimiento de cuerpo rígido 2-D o transformación euclidiana 2-D . Puede escribirse como:
dónde,
X→ coordenada del píxel original.
X'→ coordenada del píxel transformada.
R→ matriz de rotación ortonormal con R ⋅ R T = I y |R| = 1.
t→ vector traslacional pero en el espacio de la imagen 2D.
Para visualizar esto, considere un ejemplo de una secuencia de video de una cámara de vigilancia de tráfico. Tendrá autos en movimiento y este movimiento no cambia su forma ni su tamaño. Además, el movimiento es una combinación de rotación y transformación del auto en 3D que se refleja en los fotogramas de video posteriores. Por lo tanto, se dice que el auto tiene un movimiento rígido.
Segmentación de movimiento

Las técnicas de segmentación de imágenes se centran en segmentar diferentes partes de la imagen según la región de interés. Como los vídeos son secuencias de imágenes, la segmentación de movimiento tiene como objetivo descomponer un vídeo en objetos en movimiento y fondo segmentando los objetos que experimentan diferentes patrones de movimiento. El análisis de estos cambios espaciales y temporales que se producen en la secuencia de imágenes separando las características visuales de las escenas en diferentes grupos nos permite extraer información visual. Cada grupo corresponde al movimiento de un objeto en la secuencia dinámica. En el caso más simple, la segmentación de movimiento puede significar extraer objetos en movimiento de una cámara estacionaria, pero la cámara también puede moverse, lo que introduce el movimiento relativo del fondo estático. Según el tipo de características visuales que se extraen, los algoritmos de segmentación de movimiento se pueden dividir en dos categorías. La primera se conoce como segmentación de movimiento directo, que utiliza intensidades de píxeles de la imagen. Estos algoritmos suponen una iluminación constante. La segunda categoría de algoritmos calcula un conjunto de características correspondientes a puntos físicos reales de los objetos. Estas características dispersas se utilizan para caracterizar el movimiento 2D de la escena o el movimiento 3D de los objetos en la escena. Hay una serie de requisitos para diseñar un buen algoritmo de segmentación de movimiento. El algoritmo debe extraer características distintivas (esquinas o puntos salientes) que representen el objeto mediante un número limitado de puntos y debe tener la capacidad de lidiar con oclusiones. Las imágenes también se verán afectadas por el ruido y tendrán datos faltantes, por lo que deben ser robustas. Algunos algoritmos detectan solo un objeto, pero la secuencia de video puede tener diferentes movimientos. Por lo tanto, el algoritmo debe ser detector de objetos múltiples. Además, el tipo de modelo de cámara, si se usa, también caracteriza el algoritmo. Dependiendo de la caracterización del objeto de un algoritmo, puede detectar movimiento rígido, no rígido o ambos. Además, los algoritmos utilizados para estimar movimientos de cuerpos rígidos individuales pueden proporcionar resultados precisos con robustez al ruido y los valores atípicos, pero cuando se extienden a múltiples movimientos de cuerpos rígidos, fallan. En el caso de las técnicas de segmentación basadas en vistas que se describen a continuación, esto sucede porque se viola el supuesto de la matriz fundamental única, ya que cada movimiento ahora se representará por medio de una nueva matriz fundamental correspondiente a ese movimiento.
Algoritmos de segmentación
Como se mencionó anteriormente, no existe una forma particular de distinguir las técnicas de segmentación de movimiento, pero dependiendo de la base del criterio de segmentación utilizado en el algoritmo, se puede clasificar en términos generales de la siguiente manera: [2]
Diferencia de imagen
Es una técnica muy útil para detectar cambios en imágenes debido a su simplicidad y capacidad para lidiar con oclusiones y movimientos múltiples. Estas técnicas suponen una intensidad de fuente de luz constante. El algoritmo primero considera dos fotogramas a la vez y luego calcula la diferencia de intensidad píxel por píxel. En este cálculo, establece un umbral para la diferencia de intensidad y mapea los cambios en un contorno . Usando este contorno, extrae la información espacial y temporal requerida para definir el movimiento en la escena. Aunque es una técnica simple de implementar, no es robusta al ruido. Otra dificultad con estas técnicas es el movimiento de la cámara. Cuando la cámara se mueve, hay un cambio en toda la imagen que debe tenerse en cuenta. Se han introducido muchos algoritmos nuevos para superar estas dificultades. [3] [4] [5] [6]
Teoría estadística
La segmentación de movimiento puede verse como un problema de clasificación donde cada píxel tiene que ser clasificado como fondo o primer plano. Estas clasificaciones se modelan bajo la teoría estadística y se pueden utilizar en algoritmos de segmentación. Estos enfoques se pueden dividir aún más dependiendo del marco estadístico utilizado. Los marcos más utilizados son la probabilidad máxima a posteriori (MAP), [7] el filtro de partículas (PF) [8] y la maximización de expectativas (EM). [9] MAP utiliza la regla de Bayes para la implementación donde un píxel particular tiene que ser clasificado bajo clases predefinidas. PF se basa en el concepto de evolución de una variable con pesos variables a lo largo del tiempo. La estimación final es la suma ponderada de todas las variables. Ambos métodos son iterativos. El algoritmo EM también es un método de estimación iterativo. Calcula la estimación de máxima verosimilitud (ML) de los parámetros del modelo en presencia de datos faltantes u ocultos y decide el ajuste más probable de los datos observados.
Flujo óptico
El flujo óptico (FO) ayuda a determinar la velocidad relativa de los píxeles de los puntos dentro de una secuencia de imágenes. Al igual que la diferencia de imágenes, también es un concepto antiguo utilizado para la segmentación. Inicialmente, el principal inconveniente del FO era la falta de robustez al ruido y los altos costos computacionales, pero debido a las recientes técnicas de coincidencia de puntos clave e implementaciones de hardware, estas limitaciones han disminuido. Para aumentar su robustez a la oclusión y la detención temporal, el FO generalmente se utiliza con otras técnicas estadísticas o de diferencia de imágenes. Para escenarios complicados, particularmente cuando la cámara se está moviendo, el FO proporciona una base para estimar la matriz fundamental donde los valores atípicos representan otros objetos que se mueven independientemente en la escena. [3] Alternativamente, el flujo óptico basado en segmentos de línea en lugar de características puntuales también se puede utilizar para segmentar múltiples movimientos de cuerpo rígido. [10]
Ondícula
Una imagen se compone de diferentes componentes de frecuencia. [11] Los bordes, las esquinas y las regiones planas se pueden representar mediante diferentes frecuencias. Los métodos basados en wavelets realizan un análisis de los diferentes componentes de frecuencia de las imágenes y luego estudian cada componente con una resolución diferente de modo que coincidan con su escala. La descomposición multiescala se utiliza generalmente para reducir el ruido. Aunque este método proporciona buenos resultados, [12] está limitado por el supuesto de que el movimiento de los objetos solo se produce frente a la cámara. Las implementaciones de técnicas basadas en wavelets están presentes con otros enfoques, como el flujo óptico, y se aplican a varias escalas para reducir el efecto del ruido.
Capas
Las técnicas basadas en capas dividen las imágenes en capas que tienen un movimiento uniforme. Este enfoque determina las diferentes capas de profundidad en la imagen y encuentra en qué capa se encuentra el objeto o parte de la imagen. Estas técnicas se utilizan en la visión estereoscópica , donde es necesario calcular la distancia de profundidad. La primera técnica basada en capas se propuso en 1993. [13] Como los humanos también utilizan la segmentación basada en capas, este método es una solución natural a los problemas de oclusión, pero es muy complejo y requiere un ajuste manual.
Factorización
Tomasi y Kanade introdujeron el primer método de factorización. Este método rastreaba características en una secuencia de imágenes y recuperaba la forma y el movimiento. Esta técnica factorizaba la matriz de trayectoria W, determinada después del seguimiento de diferentes características sobre la secuencia en dos matrices: movimiento y estructura utilizando la descomposición en valores singulares . [14] La simplicidad del algoritmo es la razón de su amplio uso, pero son sensibles al ruido y a los valores atípicos . La mayoría de estos métodos se implementan bajo el supuesto de movimiento rígido e independiente.
Algoritmos basados en vistas
Otros algoritmos de detección de movimiento también se pueden clasificar según el número de vistas: enfoques basados en dos y múltiples vistas, es decir. Los enfoques basados en dos vistas generalmente se basan en geometría epipolar . Considere dos vistas de cámara en perspectiva de un cuerpo rígido y encuentre sus correspondencias de características. Se ve que estas correspondencias satisfacen una restricción epipolar para un cuerpo rígido general o una restricción de homografía para un objeto plano. El movimiento plano en una secuencia es el movimiento del fondo, la fachada o el suelo. [15] Por lo tanto, es un caso degenerado de movimiento de cuerpo rígido junto con objetos de cuerpo rígido generales, por ejemplo, automóviles. Por lo tanto, en una secuencia esperamos ver más de un tipo de movimiento, descrito por múltiples restricciones epipolares y homografías. Los algoritmos basados en vistas son sensibles a los valores atípicos, pero los enfoques recientes tratan los valores atípicos mediante el consenso de muestra aleatoria ( RANSAC ) [16] y modelos mejorados de mezcla de procesos de Dirichlet . [3] [17] Otros enfoques utilizan la minimización de la dimensión global para revelar los grupos correspondientes al subespacio subyacente. Estos enfoques utilizan solo dos cuadros para la segmentación del movimiento, incluso si hay varios cuadros disponibles, ya que no pueden usar información de múltiples cuadros. Los enfoques basados en múltiples vistas utilizan la trayectoria de los puntos característicos a diferencia de los enfoques basados en dos vistas. [18] Se han proporcionado varios enfoques que incluyen los métodos de configuración de ángulos principales (PAC) [19] y agrupamiento de subespacio disperso (SSC) [20] . Estos funcionan bien en dos o tres casos de movimiento. Estos algoritmos también son robustos al ruido con una compensación con la velocidad, es decir, son menos sensibles al ruido pero lentos en el cálculo. Otros algoritmos con un enfoque de múltiples vistas son el agrupamiento de curvatura espectral (SCC), el método basado en representación de bajo rango latente (LatLRR) [21] y los enfoques basados en ICLM. [22] Estos algoritmos son más rápidos y más precisos que los basados en dos vistas, pero requieren una mayor cantidad de cuadros para mantener la precisión.
Problemas

La segmentación de movimiento es un campo en investigación ya que hay muchos problemas que brindan un alcance de mejora. Uno de los principales problemas es la detección de características y el hallazgo de correspondencias . Hay algoritmos de detección de características fuertes, pero aún dan falsos positivos que pueden conducir a correspondencias inesperadas. Encontrar estas correspondencias de píxeles o características es una tarea difícil. Estos puntos de características no coincidentes de los objetos y el fondo a menudo introducen valores atípicos. La presencia de ruido de imagen y valores atípicos afecta aún más la precisión de la estimación de la estructura a partir del movimiento (SFM). Otro problema es el de los modelos de movimiento o las representaciones de movimiento. Requiere que el movimiento se modele o estime en el modelo dado utilizado en el algoritmo. La mayoría de los algoritmos realizan una segmentación de movimiento 2-D asumiendo que los movimientos en la escena pueden modelarse mediante modelos de movimiento afines 2-D. Teóricamente, esto es válido porque el modelo de movimiento traslacional 2-D puede representarse mediante un modelo de movimiento afín general. Sin embargo, tales aproximaciones en el modelado pueden tener consecuencias negativas. El modelo traslacional tiene dos parámetros y el modelo afín tiene 6 parámetros, por lo que estimamos cuatro parámetros adicionales. Además, puede que no haya suficientes datos para estimar el modelo de movimiento afín, por lo que la estimación de parámetros podría ser errónea. Algunos de los otros problemas que se enfrentan son:
- El conocimiento previo sobre los objetos o sobre el número de objetos en la escena es esencial y no siempre está disponible.
- El desenfoque es un problema común cuando hay movimiento involucrado.
- Los objetos en movimiento pueden crear oclusiones y es posible que todo el objeto desaparezca y reaparezca en la escena.
- La medición de las correspondencias de características 3D en las imágenes puede ser ruidosa en términos de coordenadas de píxeles. [ aclaración necesaria ]
Se han propuesto algoritmos robustos para tener en cuenta los valores atípicos e implementarlos con mayor precisión. El método de factorización de Tomasi y Kanade es uno de los métodos mencionados anteriormente en el apartado de factorización.
Aplicaciones
La segmentación de movimiento tiene muchas aplicaciones importantes. [1] Se utiliza para la compresión de vídeo. Con la segmentación, es posible eliminar la redundancia relacionada con la repetición de los mismos patrones visuales en imágenes sucesivas. También se puede utilizar para tareas de descripción de vídeo, como registro, anotación e indexación. Mediante el uso de técnicas de extracción automática de objetos, se puede segregar el contenido de vídeo con información específica del objeto. Este concepto puede ser utilizado por los motores de búsqueda y las videotecas. Algunas aplicaciones específicas incluyen:
- Videovigilancia en aplicaciones de seguridad
- Análisis de la escena deportiva
- Aplicaciones de seguridad vial en vehículos inteligentes
- Indexación de vídeo
- Monitoreo de tráfico
- Reconocimiento de objetos
Enlaces externos
- El laboratorio de visión cubre GPCA, RANSAC (consenso de muestras de RANdom) y afinidad de subespacio local (LSA), JCAS (categorización y segmentación conjuntas), agrupamiento de subespacios de bajo rango (LRSC) y teoría de representación dispersa. Un enlace a algunas implementaciones que utilizan Matlab del laboratorio de visión de la Universidad Johns Hopkins
Referencias
- ^ ab Perera, Samunda. "Segmentación del movimiento de un cuerpo rígido con una cámara RGB-D" (PDF) .
- ^ Zappella, Luca; Lladó, Xavier; Salvi, Joaquim (2008). "Motion Segmentation: a Review". Actas de la Conferencia de 2008 sobre Investigación y Desarrollo de Inteligencia Artificial: Actas de la 11.ª Conferencia Internacional de la Asociación Catalana de Inteligencia Artificial Páginas 398-407 . IOS Press. págs. 398–407. ISBN 9781586039257.
- ^ abc Bewley, Alex; Guizilini, Vitor; Ramos, Fabio; Upcroft, Ben (2014). "Segmentación multiinstancia autosupervisada en línea de objetos dinámicos" (PDF) . 2014 IEEE International Conference on Robotics and Automation (ICRA) (PDF) . pp. 1296–1303. doi :10.1109/ICRA.2014.6907020. ISBN . 978-1-4799-3685-4.S2CID 5907733 .
- ^ Chen, Chen-Yuan; Lin, Jeng-Wen; Lee, Wan-I; Chen, Cheng-Wu (2010). "Control difuso para una estructura oceánica: un estudio de caso en un sistema TLP con retardo de tiempo". Journal of Vibration and Control .
- ^ Cavallaro, Andrea; Steiger, Olivier; Ebrahimi, Touradj (4 de abril de 2005). "Seguimiento de objetos de vídeo en un fondo desordenado" (PDF) . IEEE Transactions on Circuits and Systems for Video Technology . 15 (4): 575–584. CiteSeerX 10.1.1.464.7218 . doi :10.1109/tcsvt.2005.844447. S2CID 15604489.
- ^ Li, Renjie; Yu, Songyu; Yang, Xiaokang (agosto de 2007). "Segmentación espacio-temporal eficiente para extraer objetos en movimiento en secuencias de vídeo". IEEE Transactions on Consumer Electronics . 53 (3): 1161–1167. CiteSeerX 10.1.1.227.6442 . doi :10.1109/tce.2007.4341600. S2CID 2216371.
- ^ Shen, Huanfeng; Zhang, Liangpei; Huang, Bo; Li, Pingxiang (febrero de 2007). "Un enfoque de mapa para la estimación del movimiento conjunto, la segmentación y la súper resolución" (PDF) . IEEE Transactions on Image Processing . 16 (2): 479–490. Bibcode :2007ITIP...16..479S. CiteSeerX 10.1.1.692.4884 . doi :10.1109/tip.2006.888334. PMID 17269640. S2CID 14221962.
- ^ Rathi, Y.; Vaswani, N.; Tannenbaum, A.; Yezzi, A. (2005). "Filtrado de partículas para contornos geométricos activos con aplicación al seguimiento de objetos en movimiento y deformables" (PDF) . Conferencia de la IEEE Computer Society de 2005 sobre visión artificial y reconocimiento de patrones (CVPR'05) . Vol. 2. págs. 2–9. CiteSeerX 10.1.1.550.156 . doi :10.1109/CVPR.2005.271. ISBN. 978-0-7695-2372-9.S2CID2169573 .
- ^ Liu, Guangcan; Lin, Zhouchen; Yu, Yong (2010). "Segmentación robusta del subespacio mediante representación de bajo rango" (PDF) . Actas de la 27.ª Conferencia internacional sobre aprendizaje automático (ICML-10) . Archivado desde el original (PDF) el 14 de julio de 2010.
- ^ Zhang, Jing; Shi, Fanhuai; Wang, Jianhua; Liu, Yuncai (2007). "Segmentación de movimiento 3D a partir de flujo óptico en línea recta". Análisis y minería de contenido multimedia . Apuntes de clase en informática. Vol. 4577. Springer Berlin Heidelberg. págs. 85–94. doi :10.1007/978-3-540-73417-8_15. ISBN . 978-3-540-73417-8.
- ^ González (1993). Procesamiento de imágenes digitales . Wesley Publishing Company. ISBN 9780201600780.
- ^ Krüger, Volker; Feris, Rogerio S. (2001). "Método de subespacio wavelet para seguimiento de rostros en tiempo real". Reconocimiento de patrones . Apuntes de clase en informática. Vol. 2191. págs. 186–193. CiteSeerX 10.1.1.18.2433 . doi :10.1007/3-540-45404-7_25. ISBN. 978-3-540-42596-0.
- ^ Wang, JYA; Adelson, EH (1993). "Representación en capas para análisis de movimiento". Actas de la Conferencia IEEE sobre Visión artificial y reconocimiento de patrones . págs. 361–366. doi :10.1109/CVPR.1993.341105. ISBN 978-0-8186-3880-0.S2CID5556692 .
- ^ TOMASI, CARLO; KANADE, TAKEO (1992). "Forma y movimiento a partir de secuencias de imágenes bajo ortografía: un método de factorización" (PDF) . Revista internacional de visión por computadora . 9 (2): 137–154. CiteSeerX 10.1.1.131.9807 . doi :10.1007/bf00129684. S2CID 2931825.
- ^ Rao, Shankar R; Yang, Allen Y; Sastry, S. Shanka (enero de 2010). "Segmentación algebraica robusta de movimientos mixtos de cuerpos rígidos y planos desde dos vistas" (PDF) . Int J Comput Vis . 88 (3): 425–446. doi : 10.1007/s11263-009-0314-1 . S2CID 8343951.
- ^ Fischler, Martin A.; Bolles, Robert C. (junio de 1981). "Consenso de muestras aleatorias: un paradigma para el ajuste de modelos con aplicaciones al análisis de imágenes y la cartografía automatizada". Comunicaciones de la ACM . 24 (6): 381–395. doi : 10.1145/358669.358692 . S2CID 972888.
- ^ Chen, Chu-Song; Jian, Yong-Dian (16 de enero de 2010). "Segmentación de movimiento de dos vistas con selección de modelos y eliminación de valores atípicos mediante modelos de mezcla de procesos Dirichlet mejorados con RANSAC" (PDF) .
{{cite journal}}: Requiere citar revista|journal=( ayuda ) - ^ Jung, Heechul; Ju, Jeongwoo; Kim, Junmo. "Segmentación de movimiento rígido mediante votación aleatoria" (PDF) .
{{cite journal}}: Requiere citar revista|journal=( ayuda ) - ^ Zappella, L.; Provenzi, E.; Lladó, X.; Salvi, J. (2011). Algoritmo de segmentación de movimiento adaptativo basado en la configuración de ángulos principales, Visión artificial – ACCV 2010 . Springer Berlin Heidelberg. págs. 15–26. ISBN 978-3-642-19318-7.
- ^ Elhamifar, Ehsan; Vidal, Rene (2009). "Agrupamiento de subespacios dispersos". Conferencia IEEE de 2009 sobre visión artificial y reconocimiento de patrones . pp. 2790–2797. CiteSeerX 10.1.1.217.953 . doi :10.1109/CVPR.2009.5206547. ISBN. 978-1-4244-3992-8.S2CID847078 .
- ^ Liu, Guangcan; Yan, Shuicheng (noviembre de 2011). "Representación latente de bajo rango para la segmentación del subespacio y la extracción de características". Conferencia internacional sobre visión artificial de 2011 (PDF) . pp. 1615–1622. doi :10.1109/ICCV.2011.6126422. ISBN. 978-1-4577-1102-2. Número de identificación del sujeto 6240314.
- ^ Flores-Mangas; Jepson (junio de 2013). "Segmentación de movimiento rígido rápido mediante modelos locales complejos incrementales". Conferencia IEEE de 2013 sobre visión artificial y reconocimiento de patrones (PDF) . pp. 2259–2266. CiteSeerX 10.1.1.692.7518 . doi :10.1109/CVPR.2013.293. ISBN . 978-0-7695-4989-7.S2CID6116643 .