En visión por computadora , la matriz esencial es unamatriz ,que relaciona puntos correspondientes en imágenes estéreo suponiendo que las cámaras satisfacen el modelo de cámara estenopeica .
Función
Más específicamente, siyson coordenadas de imagen normalizadas homogéneas en la imagen 1 y 2, respectivamente, entonces
siycorresponder al mismo punto 3D en la escena (no es un " si y solo si " debido a que los puntos que se encuentran en la misma línea epipolar en la primera imagen se mapearán a la misma línea epipolar en la segunda imagen).
La relación anterior que define la matriz esencial fue publicada en 1981 por H. Christopher Longuet-Higgins , introduciendo el concepto a la comunidad de visión por computadora. El libro de Richard Hartley y Andrew Zisserman informa que una matriz análoga apareció en fotogrametría mucho antes. El artículo de Longuet-Higgins incluye un algoritmo para estimara partir de un conjunto de coordenadas de imagen normalizadas correspondientes, así como un algoritmo para determinar la posición y orientación relativas de las dos cámaras dado quees conocido. Finalmente, muestra cómo se pueden determinar las coordenadas 3D de los puntos de la imagen con la ayuda de la matriz esencial.
Usar
La matriz esencial puede considerarse como un precursor de la matriz fundamental ,. Ambas matrices pueden utilizarse para establecer restricciones entre puntos de imagen coincidentes, pero la matriz esencial solo puede utilizarse en relación con cámaras calibradas, ya que los parámetros internos de la cámara (matricesy) debe conocerse para lograr la normalización. Sin embargo, si las cámaras están calibradas, la matriz esencial puede ser útil para determinar tanto la posición relativa como la orientación entre las cámaras y la posición 3D de los puntos de imagen correspondientes. La matriz esencial está relacionada con la matriz fundamental con
Derivación y definición
Esta derivación sigue el trabajo de Longuet-Higgins.
Dos cámaras normalizadas proyectan el mundo 3D sobre sus respectivos planos de imagen. Sean las coordenadas 3D de un punto P.yen relación con el sistema de coordenadas de cada cámara. Dado que las cámaras están normalizadas, las coordenadas de imagen correspondientes son
- y
Una representación homogénea de las dos coordenadas de la imagen viene dada entonces por
- y
que también se puede escribir de forma más compacta como
- y
dóndeyson representaciones homogéneas de las coordenadas de la imagen 2D yySon coordenadas 3D correctas, pero en dos sistemas de coordenadas diferentes.
Otra consecuencia de las cámaras normalizadas es que sus respectivos sistemas de coordenadas están relacionados mediante una traslación y una rotación. Esto implica que los dos conjuntos de coordenadas 3D están relacionados como
dóndees unmatriz de rotación yes un vector de traslación tridimensional.
La matriz esencial se define entonces como:
dóndees la representación matricial del producto cruzado con. Nota: Aquí, la transformacióntransformará los puntos de la segunda vista a la primera vista.
Para la definición deSolo nos interesan las orientaciones de las coordenadas de imagen normalizadas [ 1 ] (Véase también: Producto triple ). Como tal, no necesitamos el componente de traslación al sustituir las coordenadas de imagen en la ecuación esencial. Para ver que esta definición dedescribe una restricción en las coordenadas de imagen correspondientes multiplicardesde la izquierda y la derecha con las coordenadas 3D del punto P en los dos sistemas de coordenadas diferentes:
- Inserte las relaciones anteriores entreyy la definición deen términos dey.
- desdees una matriz de rotación.
- Propiedades de la representación matricial del producto vectorial .
Finalmente, se puede asumir que ambosyson > 0, de lo contrario no son visibles en ambas cámaras. Esto da
que es la restricción que la matriz esencial define entre los puntos de imagen correspondientes.
Propiedades
No todo arbitrarioLa matriz puede ser una matriz esencial para algunas cámaras estéreo. Para ver esto, observe que se define como el producto matricial de una matriz de rotación y una matriz antisimétrica , ambasLa matriz antisimétrica debe tener dos valores singulares iguales y uno cero. La multiplicación de la matriz de rotación no modifica los valores singulares, lo que significa que la matriz esencial también tiene dos valores singulares iguales y uno cero. Las propiedades descritas aquí se conocen a veces como restricciones internas de la matriz esencial.
Si la matriz esencialse multiplica por un escalar distinto de cero, el resultado es de nuevo una matriz esencial que define exactamente la misma restricción queSí. Esto significa quepuede verse como un elemento de un espacio proyectivo , es decir, dos matrices de este tipo se consideran equivalentes si una es una multiplicación escalar no nula de la otra. Esta es una posición relevante, por ejemplo, sise estima a partir de datos de imagen. Sin embargo, también es posible adoptar la postura de quese define como
dónde, y luegoTiene una "escalabilidad" bien definida. Depende de la aplicación qué posición es la más relevante.
Las restricciones también pueden expresarse como
y
En este caso, la última ecuación es una restricción matricial, que puede interpretarse como nueve restricciones, una por cada elemento de la matriz. Estas restricciones se utilizan a menudo para determinar la matriz esencial a partir de cinco pares de puntos correspondientes.
La matriz esencial tiene cinco o seis grados de libertad, dependiendo de si se considera o no un elemento proyectivo. La matriz de rotacióny el vector de traslaciónCada una tiene tres grados de libertad, lo que da un total de seis. Sin embargo, si se considera la matriz esencial como un elemento proyectivo, se debe restar un grado de libertad relacionado con la multiplicación escalar, lo que deja un total de cinco grados de libertad.
Estimación
Dado un conjunto de puntos de imagen correspondientes, es posible estimar una matriz esencial que satisfaga la restricción epipolar definitoria para todos los puntos del conjunto. Sin embargo, si los puntos de imagen presentan ruido, lo cual es común en cualquier situación práctica, no es posible encontrar una matriz esencial que satisfaga todas las restricciones de forma exacta.
Dependiendo de cómo se mida el error relacionado con cada restricción, es posible determinar o estimar una matriz esencial que satisfaga de forma óptima las restricciones para un conjunto dado de puntos de imagen correspondientes. El enfoque más directo consiste en plantear un problema de mínimos cuadrados totales , comúnmente conocido como el algoritmo de ocho puntos .
Extracción de rotación y traslación
Dado que se ha determinado la matriz esencial para un par de cámaras estéreo —por ejemplo, utilizando el método de estimación anterior—, esta información puede utilizarse también para determinar la rotación.y traducción(hasta un factor de escala) entre los dos sistemas de coordenadas de la cámara. En estas derivacionesse considera un elemento proyectivo en lugar de tener una escala bien determinada.
Encontrar una solución
El siguiente método para determinaryse basa en realizar una SVD de, véase el libro de Hartley y Zisserman. [ 2 ] También es posible determinarysin una descomposición en valores singulares (SVD), por ejemplo, siguiendo el artículo de Longuet-Higgins.
Una SVD deda
dóndeyson ortogonalesmatrices yes unmatriz diagonal con
Las entradas diagonales deson los valores singulares deque, según las restricciones internas de la matriz esencial, debe constar de dos valores idénticos y uno cero. Definir
- con
y haga el siguiente ansatz
Desdepuede que no cumpla completamente con las restricciones cuando se trata de datos del mundo real (por ejemplo, imágenes de cámara), la alternativa
- con
puede ayudar.
Prueba
Primero, estas expresiones paraysatisfacen la ecuación definitoria para la matriz esencial
Segundo, debe demostrarse que estoes una representación matricial del producto vectorial para algún. Desde
es el caso quees antisimétrica, es decir,Este también es el caso de nuestro, desde
De acuerdo con las propiedades generales de la representación matricial del producto vectorial, se deduce que:debe ser el operador de producto cruzado de exactamente un vector.
En tercer lugar, también debe demostrarse que la expresión anterior paraes una matriz de rotación. Es el producto de tres matrices que son todas ortogonales, lo que significa que, también, es ortogonal oPara ser una matriz de rotación adecuada, también debe satisfacer. Puesto que, en este caso,se considera un elemento proyectivo esto se puede lograr invirtiendo el signo desi es necesario.
Encontrar todas las soluciones
Hasta ahora una posible solución parayse ha establecido dadoSin embargo, no es la única solución posible y puede que ni siquiera sea una solución válida desde un punto de vista práctico. Para empezar, dado que la escala deno está definido, la escala detambién es indefinido. Debe estar en el espacio nulo dedesde
Sin embargo, para el análisis posterior de las soluciones, la escala exacta deNo es tan importante como su "signo", es decir, en qué dirección apunta.ser vector normalizado en el espacio nulo deEntonces, sucede que ambosyson vectores de traslación válidos relativosTambién es posible cambiarenen las derivaciones deyarriba. Para el vector de traslación, esto solo provoca un cambio de signo, lo cual ya se ha descrito como una posibilidad. Para la rotación, en cambio, esto producirá una transformación diferente, al menos en el caso general.
En resumen, dadoHay dos direcciones opuestas que son posibles paray dos rotaciones diferentes que son compatibles con esta matriz esencial. En total, esto da cuatro clases de soluciones para la rotación y la traslación entre los dos sistemas de coordenadas de la cámara. Además de eso, también hay una escala desconocida.para la dirección de traducción elegida.
Resulta que, en la práctica, solo una de las cuatro clases de soluciones puede implementarse. Dado un par de coordenadas de imagen correspondientes, tres de las soluciones siempre generarán un punto 3D que se encuentra detrás de al menos una de las dos cámaras y, por lo tanto, no es visible. Solo una de las cuatro clases generará consistentemente puntos 3D que se encuentran delante de ambas cámaras. Esta debe ser, por lo tanto, la solución correcta. Sin embargo, presenta una escala positiva indeterminada relacionada con el componente de traslación.
La determinación anterior deyasume quesatisfacer las restricciones internas de la matriz esencial . Si este no es el caso, lo cual, por ejemplo, suele ser el caso siSe ha estimado a partir de datos de imágenes reales (y ruidosas), por lo que debe asumirse que satisface aproximadamente las restricciones internas. El vectorse elige entonces como vector singular derecho decorrespondiente al valor singular más pequeño.
Puntos 3D a partir de puntos de imagen correspondientes
Existen muchos métodos para calculardadas las coordenadas de imagen normalizadas correspondientesy, si se conoce la matriz esencial y se han determinado las transformaciones de rotación y traslación correspondientes.
Véase también
Cajas de herramientas
- Estimación matricial esencial en MATLAB (Manolis Lourakis).
Enlaces externos
- Una investigación de la matriz esencial por RI Hartley
Referencias
- ↑ Visión por computadora fotogramétrica: estadística, geometría, orientación y reconstrucción (1.ª ed.).
- ↑ Hartley, Richard; Andrew Zisserman (2004). Geometría de múltiples vistas en visión por computadora (2.ª ed.). Cambridge, Reino Unido. ISBN 978-0-511-18711-7OCLC 171123855
{{cite book}}: CS1 mantenimiento: falta el editor de ubicación ( enlace )
- David Nistér (junio de 2004). "Una solución eficiente al problema de la pose relativa de cinco puntos". IEEE Transactions on Pattern Analysis and Machine Intelligence . 26 (6): 756– 777. doi : 10.1109/TPAMI.2004.17 . PMID 18579936. S2CID 886598 .
- H. Stewénius, C. Engels y D. Nistér (junio de 2006). «Desarrollos recientes en orientación relativa directa». ISPRS Journal of Photogrammetry and Remote Sensing . 60 (4): 284– 294. Bibcode : 2006JPRS...60..284S . CiteSeerX 10.1.1.61.9329 . doi : 10.1016/j.isprsjprs.2006.03.005 .
- H. Christopher Longuet-Higgins (septiembre de 1981). "Un algoritmo informático para reconstruir una escena a partir de dos proyecciones". Nature . 293 (5828): 133– 135. Bibcode : 1981Natur.293..133L . doi : 10.1038/293133a0 . S2CID 4327732 .
- Richard Hartley y Andrew Zisserman (2003). Geometría de múltiples vistas en visión por computadora . Cambridge University Press. ISBN 978-0-521-54051-3.
- Yi Ma; Stefano Soatto ; Jana Košecká ; S. Shankar Sastry (2004). Una invitación a la visión 3D . Springer. ISBN 978-0-387-00893-6.
- Gang Xu y Zhengyou Zhang (1996). Geometría epipolar en estéreo, movimiento y reconocimiento de objetos . Kluwer Academic Publishers. ISBN 978-0-7923-4199-4.
- Förstner, Wolfgang y Wrobel, Bernhard P. (2016). Visión por computadora fotogramétrica: estadística, geometría, orientación y reconstrucción (1.ª ed.). Springer Publishing Company, Incorporated. ISBN 978-3319115498.
{{cite book}}: CS1 maint: varios nombres: lista de autores ( enlace )
- Geometría en visión por computadora