Articulo de referencia

Unión de imágenes

Dos imágenes unidas. La foto de la derecha está ligeramente distorsionada para que coincida con la de la izquierda. El ensamblaje de imágenes o fotomontaje es el proceso de comb...

Dos imágenes unidas. La foto de la derecha está ligeramente distorsionada para que coincida con la de la izquierda.

El ensamblaje de imágenes o fotomontaje es el proceso de combinar múltiples imágenes fotográficas con campos de visión superpuestos para producir un panorama segmentado o una imagen de alta resolución. Generalmente realizado mediante software informático , la mayoría de los métodos de ensamblaje de imágenes requieren superposiciones casi exactas entre las imágenes y exposiciones idénticas para producir resultados sin fisuras, [ 1 ] [ 2 ] aunque algunos algoritmos de ensamblaje se benefician de imágenes con diferentes exposiciones al realizar imágenes de alto rango dinámico en las regiones de superposición. [ 3 ] [ 4 ] Algunas cámaras digitales pueden ensamblar sus fotos internamente.

Aplicaciones

La composición de imágenes se utiliza ampliamente en aplicaciones modernas, como las siguientes:

La isla de Alcatraz , mostrada en una panorámica creada mediante la unión de imágenes.

Proceso

El proceso de unión de imágenes se puede dividir en tres componentes principales: registro de imágenes , calibración y fusión .

algoritmos de unión de imágenes

Esta imagen de muestra ilustra el registro geométrico y las líneas de unión utilizadas en la creación de panoramas.

Para estimar la alineación de imágenes, se necesitan algoritmos que determinen el modelo matemático adecuado que relacione las coordenadas de píxeles de una imagen con las de otra. Para estimar estos parámetros, se pueden utilizar algoritmos que combinen comparaciones directas píxel a píxel con el descenso de gradiente (y otras técnicas de optimización).

En cada imagen se pueden encontrar características distintivas que luego se comparan de manera eficiente para establecer rápidamente correspondencias entre pares de imágenes. Cuando existen varias imágenes en un panorama, se han desarrollado técnicas para calcular un conjunto de alineaciones globalmente consistentes y para descubrir de manera eficiente qué imágenes se superponen entre sí.

Se necesita una superficie de composición final sobre la cual deformar o transformar proyectivamente y colocar todas las imágenes alineadas, así como algoritmos para fusionar sin problemas las imágenes superpuestas, incluso en presencia de paralaje, distorsión de la lente, movimiento de la escena y diferencias de exposición.

Problemas de unión de imágenes

Dado que no se puede garantizar que la iluminación en dos vistas sea idéntica, unir dos imágenes podría crear una costura visible. Otras razones para la aparición de costuras podrían ser el cambio de fondo entre dos imágenes para el mismo primer plano continuo. Otros problemas importantes a considerar son la presencia de paralaje , distorsión de la lente , movimiento de la escena y diferencias de exposición . En un caso real no ideal, la intensidad varía en toda la escena, al igual que el contraste y la intensidad entre fotogramas. Además, es necesario tener en cuenta la relación de aspecto de una imagen panorámica para crear una composición visualmente agradable .

Para la creación de panorámicas , el conjunto ideal de imágenes tendrá una superposición razonable (al menos del 15 al 30 %) para compensar la distorsión de la lente y presentar suficientes detalles detectables. Además, las imágenes tendrán una exposición uniforme entre fotogramas para minimizar la probabilidad de que aparezcan uniones.

Detección de puntos clave

La detección de características es necesaria para encontrar automáticamente correspondencias entre imágenes. Se requieren correspondencias robustas para estimar la transformación necesaria para alinear una imagen con la imagen sobre la que se está componiendo. Las esquinas, los blobs, las esquinas de Harris y las diferencias de gaussianas de las esquinas de Harris son buenas características, ya que son repetibles y distintivas.

Uno de los primeros operadores para la detección de puntos de interés fue desarrollado por Hans Moravec en 1977 para su investigación sobre la navegación automática de un robot en un entorno complejo. Moravec también definió el concepto de "puntos de interés" en una imagen y concluyó que estos puntos podían utilizarse para encontrar regiones coincidentes en diferentes imágenes. El operador de Moravec se considera un detector de esquinas porque define los puntos de interés como aquellos donde existen grandes variaciones de intensidad en todas las direcciones. Esto suele ocurrir en las esquinas. Sin embargo, Moravec no estaba específicamente interesado en encontrar esquinas, sino simplemente regiones distintas en una imagen que pudieran utilizarse para alinear fotogramas consecutivos.

Harris y Stephens mejoraron el detector de esquinas de Moravec al considerar directamente la diferencia de la puntuación de la esquina con respecto a la dirección. Necesitaban este método como paso de procesamiento para generar interpretaciones del entorno de un robot a partir de secuencias de imágenes. Al igual que Moravec, necesitaban un método para emparejar puntos correspondientes en fotogramas consecutivos, pero estaban interesados ​​en rastrear tanto esquinas como bordes entre fotogramas.

SIFT y SURF son algoritmos recientes para la detección de puntos clave o de interés, pero cabe destacar que SURF está patentado y su uso comercial está restringido. Una vez detectada una característica, se puede aplicar un método de descripción, como el descriptor SIFT, para su posterior comparación.

Registro

El registro de imágenes implica la coincidencia de características [ 8 ] en un conjunto de imágenes o el uso de métodos de alineación directa para buscar alineaciones de imágenes que minimicen la suma de las diferencias absolutas entre píxeles superpuestos. [ 9 ] Al usar métodos de alineación directa, se puede calibrar primero las imágenes para obtener mejores resultados. Además, los usuarios pueden introducir un modelo aproximado del panorama para facilitar la etapa de coincidencia de características, de modo que, por ejemplo, solo se busquen características coincidentes en imágenes vecinas. Dado que hay un grupo más pequeño de características para la coincidencia, el resultado de la búsqueda es más preciso y la ejecución de la comparación es más rápida.

Para estimar un modelo robusto a partir de los datos, se utiliza comúnmente el método RANSAC . El nombre RANSAC es una abreviatura de " RAN dom SAmple Consensus " ( Consenso de Muestra Aleatoria). Es un método iterativo para la estimación robusta de parámetros que permite ajustar modelos matemáticos a partir de conjuntos de datos observados, los cuales pueden contener valores atípicos. El algoritmo es no determinista, ya que produce un resultado razonable solo con cierta probabilidad, la cual aumenta con cada iteración. Al ser un método probabilístico, se obtienen resultados diferentes cada vez que se ejecuta el algoritmo.

El algoritmo RANSAC ha encontrado numerosas aplicaciones en visión artificial, incluyendo la resolución simultánea del problema de correspondencia y la estimación de la matriz fundamental asociada a un par de cámaras estéreo. El método se basa en la premisa de que los datos se componen de "valores válidos" (cuya distribución puede explicarse mediante un modelo matemático) y "valores atípicos" (datos que no se ajustan a dicho modelo). Los valores atípicos se consideran puntos provenientes de ruido, mediciones erróneas o simplemente datos incorrectos.

Para el problema de estimación de homografía , RANSAC funciona ajustando varios modelos con algunos pares de puntos y luego verificando si los modelos lograron relacionar la mayoría de los puntos. El mejor modelo —la homografía que produce el mayor número de coincidencias correctas— se elige como la solución al problema. Por lo tanto, si la proporción de valores atípicos con respecto a los puntos de datos es muy baja, RANSAC genera un modelo adecuado que se ajusta a los datos.

Calibración

La calibración de imágenes tiene como objetivo minimizar las diferencias entre los modelos de lentes ideales y la combinación de cámara y lente utilizada, defectos ópticos como distorsiones , diferencias de exposición entre imágenes, viñeteo , [ 10 ] respuesta de la cámara y aberraciones cromáticas . Si se utilizaron métodos de detección de características para registrar las imágenes y se registraron y guardaron las posiciones absolutas de las características, el software de unión puede utilizar los datos para la optimización geométrica de las imágenes, además de colocarlas en la panosfera. Panotools y sus diversos programas derivados utilizan este método.

Alineación

Puede ser necesario alinear una imagen para que coincida con el punto de vista de la imagen con la que se está combinando. En términos sencillos, la alineación consiste en un cambio en el sistema de coordenadas para que adopte un nuevo sistema que genere una imagen que coincida con el punto de vista requerido. Los tipos de transformaciones que puede sufrir una imagen son: traslación pura, rotación pura, una transformación de similitud que incluye traslación, rotación y escalado de la imagen que se va a transformar, y una transformación afín o proyectiva.

La transformación proyectiva es la transformación más radical que puede realizarse en una imagen (dentro del conjunto de transformaciones planas bidimensionales), donde las únicas características visibles que se conservan en la imagen transformada son las líneas rectas, mientras que en una transformación afín se mantiene el paralelismo.

La transformación proyectiva se puede describir matemáticamente como incógnita=Hincógnita,{\displaystyle x'=H\cdot x,} dóndeincógnita{\displaystyle x}son puntos en el antiguo sistema de coordenadas,incógnita{\displaystyle x'}son los puntos correspondientes en la imagen transformada yH{\displaystyle H}es la matriz de homografía .

Expresar los puntosincógnita{\displaystyle x}yincógnita{\displaystyle x'}utilizando los parámetros intrínsecos de la cámara (K{\displaystyle K}yK{\displaystyle K'}) y su rotación y traslación[Rt]{\displaystyle [R\,t]}a las coordenadas del mundo realincógnita{\displaystyle X}y<metroath>incógnita{\displaystyle <math>x}yincógnita{\displaystyle x'}'</matemáticas>, obtenemos

incógnita=K[Rt]incógnita{\displaystyle X=K\cdot [R\,t]\cdot X}yincógnita=K[Rt]incógnita{\displaystyle X'=K'\cdot [R'\,t']\cdot X'}.

Utilizando las dos ecuaciones anteriores y la relación de homografía entreincógnita{\displaystyle x}yincógnita{\displaystyle x'}, podemos derivar H=KRR1K1.{\displaystyle H=K'\cdot R'\cdot R^{-1}\cdot K^{-1}.}

La matriz de homografíaH{\displaystyle H}tiene 8 parámetros o grados de libertad. La homografía se puede calcular utilizando la Transformación Lineal Directa y la descomposición en valores singulares con Ah=0,{\displaystyle A\cdot h=0,} dóndeA{\displaystyle A}es la matriz construida utilizando las coordenadas de las correspondencias yh{\displaystyle h}es el vector unidimensional de los 9 elementos de la matriz de homografía remodelada. Para llegar ah{\displaystyle h}Podemos aplicar simplemente SVD:A=USVT{\displaystyle A=U\cdot S\cdot V^{\mathrm {T} }}. Yh=V{\displaystyle h=V}(columna correspondiente al vector singular más pequeño). Esto es cierto ya queh{\displaystyle h}se encuentra en el espacio nulo deA{\displaystyle A}Dado que contamos con 8 grados de libertad, el algoritmo requiere al menos cuatro correspondencias de puntos. En el caso de que se utilice RANSAC para estimar la homografía y se disponga de múltiples correspondencias, la matriz de homografía correcta es aquella con el mayor número de puntos coincidentes.

Composición

La composición es el proceso mediante el cual las imágenes rectificadas se alinean de tal manera que parezcan una sola toma de una escena. La composición se puede realizar automáticamente, ya que el algoritmo ahora sabe qué correspondencias se superponen.

Mezcla

La fusión de imágenes implica la aplicación de los ajustes realizados en la etapa de calibración, junto con la reasignación de las imágenes a una proyección de salida. Se ajustan los colores entre las imágenes para compensar las diferencias de exposición. Si procede, se realiza una fusión de alto rango dinámico ( HDR ), junto con la compensación de movimiento y la eliminación de imágenes fantasma. Las imágenes se combinan y se ajusta la línea de unión para minimizar la visibilidad de las uniones entre ellas.

La costura se puede reducir con un simple ajuste de ganancia. Esta compensación consiste básicamente en minimizar la diferencia de intensidad de los píxeles superpuestos. El algoritmo de fusión de imágenes asigna mayor peso a los píxeles cercanos al centro de la imagen. Las imágenes con ganancia compensada y las imágenes fusionadas en múltiples bandas ofrecen la mejor comparación. IJCV 2007.

El enderezamiento es otro método para rectificar la imagen. Matthew Brown y David G. Lowe, en su artículo «Unión automática de imágenes panorámicas mediante características invariantes», describen métodos de enderezamiento que aplican una rotación global tal que el vector u sea vertical (en el marco de renderizado), lo que elimina eficazmente el efecto ondulado de las panorámicas resultantes. Este proceso es similar a la rectificación de imágenes y, en general, a la corrección por software de las distorsiones ópticas en fotografías individuales.

Incluso después de la compensación de ganancia, algunos bordes de la imagen siguen siendo visibles debido a una serie de efectos no modelados, como el viñeteado (la intensidad disminuye hacia el borde de la imagen), los efectos de paralaje debidos al movimiento no deseado del centro óptico, los errores de registro debidos a un modelado incorrecto de la cámara, la distorsión radial, etc. Por estas razones, proponen una estrategia de fusión denominada fusión multibanda.

Diseños proyectivos

Comparación de las proyecciones de Mercator y rectilíneas
Comparación de las distorsiones cerca de los polos de la panosfera mediante diversos formatos cilíndricos.

Para segmentos de imagen que se han tomado del mismo punto en el espacio, las imágenes unidas se pueden organizar utilizando una de varias proyecciones cartográficas .

Rectilíneo

Proyección rectilínea , donde la imagen compuesta se visualiza en un plano bidimensional que interseca la panosfera en un único punto. Las líneas que son rectas en la realidad se muestran como rectas, independientemente de su dirección en la imagen. Las vistas amplias, de unos 120°, comienzan a presentar una distorsión severa cerca de los bordes de la imagen. Un ejemplo de proyección rectilínea es el uso de caras de cubo con mapeo cúbico para la visualización de panoramas. El panorama se mapea a seis cuadrados, cada cara del cubo mostrando un área de 90 por 90 grados del panorama.

Cilíndrico

Proyección cilíndrica , donde la imagen compuesta muestra un campo de visión horizontal de 360° y un campo de visión vertical limitado. Los panoramas en esta proyección están diseñados para ser vistos como si la imagen estuviera envuelta en un cilindro y vista desde su interior. Cuando se observa en un plano 2D, las líneas horizontales aparecen curvas mientras que las verticales permanecen rectas. [ 11 ] La distorsión vertical aumenta rápidamente al acercarse a la parte superior de la panosfera. Existen otros formatos cilíndricos, como Mercator y Miller, que presentan menor distorsión cerca de los polos de la panosfera.

Esférico

Plano 2D de una panorámica esférica de 360° ( ver como una panorámica interactiva de 360° )

Proyección esférica o equirrectangular —que, estrictamente hablando, es otra proyección cilíndrica— donde la imagen compuesta muestra un campo de visión de 360° horizontal por 180° vertical, es decir, la esfera completa. Los panoramas en esta proyección están pensados ​​para ser vistos como si la imagen estuviera envuelta en una esfera y observada desde dentro. Cuando se observa en un plano 2D, las líneas horizontales aparecen curvas como en una proyección cilíndrica, mientras que las verticales permanecen verticales. [ 11 ]

Panini

Dado que un panorama es básicamente un mapa de una esfera, también se pueden utilizar diversas proyecciones cartográficas de otros cartógrafos si se desea. Además, existen proyecciones especializadas que pueden ofrecer ventajas estéticas sobre las proyecciones cartográficas convencionales, como la proyección Panini de Hugin [ 12 ] —que recibe su nombre del pintor vedutista italiano Giovanni Paolo Panini [ 13 ] — o la proyección Vedutismo de PTGui [ 14 ] . Se pueden combinar diferentes proyecciones en una misma imagen para ajustar con precisión el aspecto final de la imagen de salida [ 15 ] .

Estereografía

La proyección estereográfica o de ojo de pez permite crear una pequeña panorámica del planeta apuntando la cámara virtual directamente hacia abajo y ajustando el campo de visión para que muestre todo el terreno y algunas zonas por encima de él; apuntar la cámara virtual hacia arriba crea un efecto de túnel. La conformidad de la proyección estereográfica puede producir un resultado visualmente más atractivo que la proyección de ojo de pez de igual área, como se explica en el artículo sobre proyección estereográfica.

Artefactos

Artefactos debidos al error de paralaje
Artefactos debido al movimiento del sujeto

El uso de imágenes tomadas desde distintos puntos (con un punto de pivote alrededor de la pupila de entrada de la cámara) [ 16 ] puede provocar errores de paralaje en el producto final. Cuando la escena capturada presenta movimiento rápido o dinámico, pueden aparecer artefactos debido a las diferencias de tiempo entre los segmentos de la imagen. El «unión ciega» mediante métodos de alineación basados ​​en características (véase autostitch ), a diferencia de la selección y unión manual, puede causar imperfecciones en el ensamblaje del panorama.

Software

Entre los programas especializados se incluyen Autostitch , Hugin , Ptgui , Panorama Tools , Microsoft Research Image Composite Editor y CleVR Stitcher . Muchos otros programas también permiten unir varias imágenes; un ejemplo popular es Photoshop de Adobe Systems , que incluye una herramienta llamada Photomerge y, en las versiones más recientes, la nueva función Auto-Blend . Otros programas, como VideoStitch, permiten unir vídeos, y Vahana VR posibilita la unión de vídeos en tiempo real. El módulo Image Stitching del software de microscopía QuickPHOTO permite unir de forma interactiva múltiples campos de visión del microscopio utilizando la vista en directo de la cámara. También se puede utilizar para la unión manual de muestras microscópicas completas.

Véase también

Referencias

  1. Mann, Steve; Picard, RW (13-16 de noviembre de 1994). "Fuelles virtuales: construcción de imágenes fijas de alta calidad a partir de vídeo". Actas de la Primera Conferencia Internacional del IEEE sobre Procesamiento de Imágenes . Conferencia Internacional del IEEE. Austin, Texas : IEEE . doi : 10.1109/ICIP.1994.413336 . S2CID 16153752 . 
  2. Ward, Greg (2006). «Ocultando costuras en panoramas de alto rango dinámico». Actas del 3er Simposio sobre Percepción Aplicada en Gráficos y Visualización . Conferencia Internacional ACM. Vol. 153. ACM . doi : 10.1145/1140491.1140527 . ISBN  1-59593-429-4.
  3. Mann, Steve (9-14 de mayo de 1993). Composición de múltiples imágenes de la misma escena . Actas de la 46.ª Conferencia Anual de Ciencia y Tecnología de la Imagen.
  4. S. Mann, C. Manders y J. Fung, " La ecuación de restricción de cambio de espacio de luz (LCCE) con aplicación práctica a la estimación de la transformación de proyectividad+ganancia entre múltiples imágenes del mismo tema. Archivado el 14 de marzo de 2023 en Wayback Machine ". Conferencia Internacional IEEE sobre Acústica, Habla y Procesamiento de Señales, 6-10 de abril de 2003, pp. III - 481-4 vol. 3
  5. Hannuksela, Jari; Sangi, Pekka; Heikkila, Janne; Liu, Xu; Doermann, David (2007). "Mosaico de imágenes de documentos con teléfonos móviles". 14.ª Conferencia Internacional sobre Análisis y Procesamiento de Imágenes (ICIAP 2007) . págs. 575–582 . doi : 10.1109/ICIAP.2007.4362839 . ISBN  978-0-7695-2877-9.
  6. Breszcz, M.; Breckon, TP (agosto de 2015). «Construcción y visualización en tiempo real de mosaicos de vídeo sin deriva a partir de movimiento de cámara sin restricciones». The Journal of Engineering. 2015 (16): 229–240. [enlace roto reemplazado con un ejemplo de VisualGPT]
  7. VisualGPT. "Editor de imágenes con IA: técnicas de composición y fusión de imágenes". https://visualgpt.io/ai-image-editor . Consultado en febrero de 2026.
  8. Szeliski, Richard (2005). "Alineación y unión de imágenes" (PDF) . Recuperado el 1 de junio de 2008 .
  9. S. Suen; E. Lam; K. Wong (2007). "Unión fotográfica con coincidencia de objetos y colores optimizada basada en derivados de imágenes" . Optics Express . 15 (12): 7689–7696 . Bibcode : 2007OExpr..15.7689S . doi : 10.1364/OE.15.007689 . PMID 19547097 . 
  10. d'Angelo, Pablo (2007). "Alineación radiométrica y calibración de viñeteo" (PDF) .
  11. 1 2 Wells, Sarah; Gross, Barry; Gross, Michael; Frischer, Bernard; Donavan, Brian; Johnson, Eugene; Martin, Worthy; Reilly, Lisa; Rourke, Will; Stuart, Ken; Tuite, Michael; Watson, Tom; Wassel, Madelyn (2007). "Creación de panoramas (Parte 1): Métodos y técnicas para capturar imágenes" . Guía de mejores prácticas de IATH para fotografía panorámica digital . Archivado del original el 6 de octubre de 2008. Recuperado el 1 de junio de 2008 .
  12. "La proyección general de Panini" . Wiki de PanoTools.org . 21 de agosto de 2019.
  13. German, Daniel M. (2008-12-29). "Nueva proyección de Panini" . Google Groups .
  14. New House Internet Services BV. "Proyecciones" . PTGui .
  15. Lyons, Max. "Proyecciones de PTAssembler" . TawbaWare . Sección "Proyección híbrida".
  16. Littlefield, Rik (2006-02-06). "Teoría del punto "sin paralaje" en la fotografía panorámica" (PDF) . ver. 1.0 . Consultado el 2008-06-01 .
  • Logotipo de Wikimedia CommonsContenido multimedia relacionado con la costura en Wikimedia Commons