Articulo de referencia

Modelo de constelación

El modelo de constelación es un modelo probabilístico y generativo para el reconocimiento de objetos a nivel de categoría en visión artificial . Al igual que otros modelos basad...

El modelo de constelación es un modelo probabilístico y generativo para el reconocimiento de objetos a nivel de categoría en visión artificial . Al igual que otros modelos basados ​​en partes , el modelo de constelación intenta representar una clase de objeto mediante un conjunto de N partes sujetas a restricciones geométricas mutuas. Debido a que considera la relación geométrica entre las diferentes partes, el modelo de constelación difiere significativamente de los modelos de representación basados ​​únicamente en la apariencia, o de " bolsa de palabras ", que ignoran explícitamente la ubicación de las características de la imagen.

Definir un modelo generativo para el reconocimiento de objetos es un problema complejo. La tarea se complica considerablemente por factores como el ruido de fondo, la oclusión y las variaciones en el punto de vista, la iluminación y la escala. Idealmente, nos gustaría que la representación elegida fuera robusta ante la mayor cantidad posible de estos factores.

En el reconocimiento a nivel de categoría, el problema es aún más complejo debido a la variación intraclase. Incluso si dos objetos pertenecen a la misma categoría visual, su apariencia puede ser significativamente diferente. Sin embargo, para objetos estructurados como automóviles, bicicletas y personas, las distintas instancias de objetos de la misma categoría están sujetas a restricciones geométricas similares. Por esta razón, ciertas partes de un objeto, como los faros o los neumáticos de un automóvil, mantienen una apariencia y posición relativa consistentes. El Modelo de Constelación aprovecha este hecho modelando explícitamente la ubicación relativa, la escala relativa y la apariencia de estas partes para una categoría de objeto específica. Los parámetros del modelo se estiman mediante un algoritmo de aprendizaje no supervisado , lo que significa que el concepto visual de una clase de objeto puede extraerse de un conjunto de imágenes de entrenamiento sin etiquetar, incluso si dicho conjunto contiene imágenes irrelevantes o instancias de objetos de múltiples categorías. También puede tener en cuenta la ausencia de partes del modelo debido a la variabilidad de la apariencia, la oclusión, el desorden o los errores del detector.

Historia

La idea de un modelo de "partes y estructura" fue introducida originalmente por Fischler y Elschlager en 1973. [ 1 ] Este modelo se ha desarrollado y ampliado desde entonces en diversas direcciones. El Modelo de Constelación, introducido por el Dr. Perona y sus colegas, fue una adaptación probabilística de este enfoque.

A finales de los 90, Burl et al. [ 2 ] [ 3 ] [ 4 ] [ 5 ] retomaron el modelo de Fischler y Elschlager para el reconocimiento facial. En su trabajo, Burl et al. utilizaron la selección manual de partes de constelaciones en imágenes de entrenamiento para construir un modelo estadístico para un conjunto de detectores y las ubicaciones relativas en las que debían aplicarse. En 2000, Weber et al. [ 6 ] [ 7 ] [ 8 ] [ 9 ] dieron el importante paso de entrenar el modelo utilizando un proceso de aprendizaje más no supervisado, lo que eliminó la necesidad de un tedioso etiquetado manual de las partes. Su algoritmo fue particularmente notable porque funcionó bien incluso en datos de imágenes desordenadas y ocluidas. Fergus et al. [ 10 ] [ 11 ] luego mejoraron este modelo haciendo que el paso de aprendizaje fuera completamente no supervisado, aprendiendo simultáneamente tanto la forma como la apariencia, y teniendo en cuenta explícitamente la escala relativa de las partes.

El método de Weber y Welling et al.

En el primer paso, se utiliza un método estándar de detección de puntos de interés , como la detección de esquinas de Harris , para generar dichos puntos. Las características de la imagen generadas en la proximidad de estos puntos se agrupan mediante k-means u otro algoritmo apropiado. En este proceso de cuantificación vectorial , los centroides de estos grupos pueden considerarse representativos de la apariencia de las partes distintivas de los objetos. Posteriormente, se entrenan detectores de características apropiados utilizando estos grupos, los cuales pueden emplearse para obtener un conjunto de partes candidatas a partir de las imágenes. [ 9 ]

Como resultado de este proceso, cada imagen ahora puede representarse como un conjunto de partes. Cada parte tiene un tipo, que corresponde a uno de los grupos de apariencia mencionados anteriormente, así como una ubicación en el espacio de la imagen.

Modelo generativo básico

Weber y Welling introducen aquí el concepto de primer plano y fondo . Las partes del primer plano corresponden a una instancia de una clase de objeto objetivo, mientras que las partes del fondo corresponden a elementos distractores o detecciones falsas.

Sea T el número de diferentes tipos de partes. Las posiciones de todas las partes extraídas de una imagen se pueden representar entonces en la siguiente "matriz",

incógnitao=(incógnita11,incógnita12,,incógnita1norte1incógnita21,incógnita22,,incógnita2norte2incógnitaT1,incógnitaT2,,incógnitaTnorteT){\displaystyle X^{o}={\begin{pmatrix}x_{11},x_{12},{\cdots },x_{1N_{1}}\\x_{21},x_{22},{\cdots },x_{2N_{2}}\\\vdots \\x_{T1},x_{T2},{\cdots },x_{TN_{T}}\end{pmatrix}}}

dóndenortei{\displaystyle N_{i}\,}representa el número de partes de tipoi{1,,T}{\displaystyle i\in \{1,\dots ,T\}}observado en la imagen. El superíndice o indica que estas posiciones son observables , en contraposición a las que faltan . Las posiciones de las partes del objeto no observadas se pueden representar mediante el vectorincógnitametro{\displaystyle x^{m}\,}. Supongamos que el objeto estará compuesto deF{\displaystyle F\,}partes distintas en primer plano. Para simplificar la notación, asumimos aquí queF=T{\displaystyle F=T\,}, aunque el modelo puede generalizarse aF>T{\displaystyle F>T\,}Una hipótesish{\displaystyle h\,}entonces se define como un conjunto de índices, conhi=j{\displaystyle h_{i}=j\,}, indicando ese puntoincógnitaij{\displaystyle x_{ij}\,}es un punto de primer plano enincógnitao{\displaystyle X^{o}\,}El modelo probabilístico generativo se define a través de la densidad de probabilidad conjunta.pag(incógnitao,incógnitametro,h){\displaystyle p(X^{o},x^{m},h)\,}.

Detalles del modelo

El resto de esta sección resume los detalles del modelo de Weber y Welling para un modelo de un solo componente. Las fórmulas para modelos de múltiples componentes [ 8 ] son ​​extensiones de las descritas aquí.

Para parametrizar la densidad de probabilidad conjunta, Weber y Welling introducen las variables auxiliares.b{\displaystyle b\,}ynorte{\displaystyle n\,}, dóndeb{\displaystyle b\,}es un vector binario que codifica la presencia/ausencia de partes en la detección (bi=1{\displaystyle b_{i}=1\,}sihi>0{\displaystyle h_{i}>0\,}, de lo contrariobi=0{\displaystyle b_{i}=0\,}), ynorte{\displaystyle n\,}es un vector dondenortei{\displaystyle n_{i}\,}denota el número de candidatos de fondo incluidos en elith{\displaystyle i^{th}}fila deincógnitao{\displaystyle X^{o}\,}. Desdeb{\displaystyle b\,}ynorte{\displaystyle n\,}están completamente determinados porh{\displaystyle h\,}y el tamaño deincógnitao{\displaystyle X^{o}\,}, tenemospag(incógnitao,incógnitametro,h)=pag(incógnitao,incógnitametro,h,norte,b){\displaystyle p(X^{o},x^{m},h)=p(X^{o},x^{m},h,n,b)\,}. Por descomposición,

pag(incógnitao,incógnitametro,h,norte,b)=pag(incógnitao,incógnitametro|h,norte,b)pag(h|norte,b)pag(norte)pag(b){\displaystyle p(X^{o},x^{m},h,n,b)=p(X^{o},x^{m}|h,n,b)p(h|n,b)p(n)p(b)\,}

La densidad de probabilidad sobre el número de detecciones de fondo se puede modelar mediante una distribución de Poisson ,

pag(norte)=i=1T1nortei¡(METROi)norteimiMETROi{\displaystyle p(n)=\prod _{i=1}^{T}{\frac {1}{n_{i}!}}(M_{i})^{n_{i}}e^{-M_{i}}}

dóndeMETROi{\displaystyle M_{i}\,}es el número promedio de detecciones de fondo de tipoi{\displaystyle i\,}por imagen.

Dependiendo del número de piezasF{\displaystyle F\,}, la probabilidadpag(b){\displaystyle p(b)\,}puede modelarse como una tabla explícita de longitud2F{\displaystyle 2^{F}\,}, o, siF{\displaystyle F\,}es grande, comoF{\displaystyle F\,}probabilidades independientes, cada una de las cuales rige la presencia de una parte individual.

La densidadpag(h|norte,b){\displaystyle p(h|n,b)\,}es modelado por

pag(h|norte,b)={1F=1FnorteFbF,si hH(b,norte)0,para otros h{\displaystyle p(h|n,b)={\begin{cases}{\frac {1}{\textstyle \prod _{f=1}^{F}N_{f}^{b_{f}}}},&{\mbox{if }}h\in H(b,n)\\0,&{\mbox{for other }}h\end{cases}}}

dóndeH(b,norte){\displaystyle H(b,n)\,}denota el conjunto de todas las hipótesis consistentes conb{\displaystyle b\,}ynorte{\displaystyle n\,}, ynorteF{\displaystyle N_{f}\,}denota el número total de detecciones de piezas de tipoF{\displaystyle f\,}. Esto expresa el hecho de que todas las hipótesis consistentes, de las cuales hayF=1FnorteFbF{\displaystyle \textstyle \prod _{f=1}^{F}N_{f}^{b_{f}}}, son igualmente probables en ausencia de información sobre la ubicación de las piezas.

Y finalmente,

pag(incógnitao,incógnitametro|h,norte)=pagFgramo(z)pagbgramo(incógnitabgramo){\displaystyle p(X^{o},x^{m}|h,n)=p_{fg}(z)p_{bg}(x_{bg})\,}

dóndez=(incógnitaoincógnitametro){\displaystyle z=(x^{o}x^{m})\,}son las coordenadas de todas las detecciones de primer plano, observadas y faltantes, yincógnitabgramo{\displaystyle x_{bg}\,}representa las coordenadas de las detecciones de fondo. Cabe señalar que se supone que las detecciones de primer plano son independientes del fondo.pagFgramo(z){\displaystyle p_{fg}(z)\,}se modela como una gaussiana conjunta con mediaμ{\displaystyle \mu \,}y covarianzaΣ{\displaystyle \Sigma \,}.

Clasificación

El objetivo final de este modelo es clasificar las imágenes en clases "objeto presente" (clasedo1{\displaystyle C_{1}\,}) y "objeto ausente" (clasedo0{\displaystyle C_{0}\,}) dada la observaciónincógnitao{\displaystyle X^{o}\,}Para lograr esto, Weber y Welling ejecutan detectores de partes del paso de aprendizaje de forma exhaustiva sobre la imagen, examinando diferentes combinaciones de detecciones. Si se considera la oclusión, también se permiten combinaciones con detecciones faltantes. El objetivo es seleccionar la clase con la máxima probabilidad a posteriori, considerando la proporción.

pag(do1|incógnitao)pag(do0|incógnitao)hpag(incógnitao,h|do1)pag(incógnitao,h0|do0){\displaystyle {\frac {p(C_{1}|X^{o})}{p(C_{0}|X^{o})}}\propto {\frac {\sum _{h}p(X^{o},h|C_{1})}{p(X^{o},h_{0}|C_{0})}}}

dóndeh0{\displaystyle h_{0}\,}denota la hipótesis nula , que explica todas las partes como ruido de fondo. En el numerador, la suma incluye todas las hipótesis, incluida la hipótesis nula, mientras que en el denominador, la única hipótesis consistente con la ausencia de un objeto es la hipótesis nula. En la práctica, se puede definir un umbral tal que, si la razón supera dicho umbral, se considera que se ha detectado una instancia de un objeto.

Aprendizaje de modelos

Tras la fase preliminar de detección de puntos de interés, generación de características y agrupamiento, disponemos de un amplio conjunto de partes candidatas en las imágenes de entrenamiento. Para entrenar el modelo, Weber y Welling realizan primero una búsqueda voraz sobre posibles configuraciones del modelo, o, equivalentemente, sobre subconjuntos potenciales de las partes candidatas. Esto se lleva a cabo de forma iterativa, comenzando con una selección aleatoria. En iteraciones posteriores, se sustituyen aleatoriamente partes del modelo, se estiman sus parámetros y se evalúa su rendimiento. El proceso finaliza cuando ya no es posible obtener mejoras adicionales en el rendimiento del modelo.

En cada iteración, los parámetros del modelo

Θ={μ,Σ,pag(b),METRO}{\displaystyle \Theta =\{\mu ,\Sigma ,p(b),M\}\,}

se estiman utilizando el método de maximización de la esperanza .μ{\displaystyle \mu \,}yΣ{\displaystyle \Sigma \,}Recordemos que son la media y la covarianza de la distribución gaussiana conjunta.pagFgramo(z){\displaystyle p_{fg}(z)\,},pag(b){\displaystyle p(b)\,}es la distribución de probabilidad que rige la presencia/ausencia binaria de partes, yMETRO{\displaystyle M\,}es el número medio de detecciones de fondo en todos los tipos de piezas.

Paso M

EM procede maximizando la probabilidad de los datos observados,

L(incógnitao|Θ)=i=1Iregistrohipag(incógnitaio,incógnitaimetro,hi|Θ)dincógnitaimetro{\displaystyle L(X^{o}|\Theta )=\sum _{i=1}^{I}\log \sum _{h_{i}}\int p(X_{i}^{o},x_{i}^{m},h_{i}|\Theta )dx_{i}^{m}}

con respecto a los parámetros del modeloΘ{\displaystyle \Theta \,}. Dado que esto es difícil de lograr analíticamente, EM maximiza iterativamente una secuencia de funciones de costo,

Q(Θ~|Θ)=i=1Imi[registropag(incógnitaio,incógnitaimetro,hi|Θ~)]{\displaystyle Q({\tilde {\Theta }}|\Theta )=\sum _{i=1}^{I}E[\log p(X_{i}^{o},x_{i}^{m},h_{i}|{\tilde {\Theta }})]}

Al derivar esto con respecto a los parámetros e igualarlo a cero, se obtienen las reglas de actualización:

μ~=1Ii=1Imi[zi]{\displaystyle {\tilde {\mu }}={\frac {1}{I}}\sum _{i=1}^{I}E[z_{i}]}
Σ~=1Ii=1Imi[ziziT]μ~μ~T{\displaystyle {\tilde {\Sigma }}={\frac {1}{I}}\sum _{i=1}^{I}E[z_{i}z_{i}^{T}]-{\tilde {\mu }}{\tilde {\mu }}^{T}}
pag~(b¯)=1Ii=1Imi[δb,b¯]{\displaystyle {\tilde {p}}({\bar {b}})={\frac {1}{I}}\sum _{i=1}^{I}E[\delta _{b,{\bar {b}}}]}
METRO~=1Ii=1Imi[nortei]{\displaystyle {\tilde {M}}={\frac {1}{I}}\sum _{i=1}^{I}E[n_{i}]}

Paso E

Las reglas de actualización en el paso M se expresan en términos de estadísticas suficientes ,mi[z]{\displaystyle E[z]\,},mi[zzT]{\displaystyle E[zz^{T}]\,},mi[δb,b¯]{\displaystyle E[\delta _{b,{\bar {b}}}]\,}ymi[norte]{\displaystyle E[n]\,}, que se calculan en el paso E considerando la densidad posterior:

pag(hi,incógnitaimetro|incógnitaio,Θ)=pag(hi,incógnitaimetro,incógnitaio|Θ)hiHbpag(hi,incógnitaimetro,incógnitaio|Θ)dincógnitaimetro{\displaystyle p(h_{i},x_{i}^{m}|X_{i}^{o},\Theta )={\frac {p(h_{i},x_{i}^{m},X_{i}^{o}|\Theta )}{\textstyle \sum _{h_{i}\in H_{b}}\int p(h_{i},x_{i}^{m},X_{i}^{o}|\Theta )dx_{i}^{m}}}}

El método de Fergus et al.

En Weber et al., los modelos de forma y apariencia se construyen por separado. Una vez seleccionado el conjunto de partes candidatas, la forma se aprende independientemente de la apariencia. La innovación de Fergus et al. consiste en aprender simultáneamente no solo dos, sino tres parámetros del modelo: forma, apariencia y escala relativa. Cada uno de estos parámetros se representa mediante densidades gaussianas. [ 10 ]

Representación de características

Mientras que el paso preliminar en el método de Weber et al. consiste en buscar las ubicaciones de los puntos de interés, Fergus et al. utilizan el detector de Kadir y Brady [ 12 ] para encontrar regiones prominentes en la imagen tanto en la ubicación (centro) como en la escala (radio). Por lo tanto, además de la información de ubicaciónincógnita{\displaystyle X\,}Este método también extrae información de escala asociada.S{\displaystyle S\,}Fergus et al. luego normalizan los cuadrados que delimitan estas regiones circulares a parches de 11 x 11 píxeles, o equivalentemente, vectores de 121 dimensiones en el espacio de apariencia. Estos se reducen luego a 10-15 dimensiones mediante análisis de componentes principales , lo que proporciona la información de apariencia.A{\displaystyle A\,}.

Estructura del modelo

Dado un modelo de clase de objeto particular con parámetrosΘ{\displaystyle \Theta \,}, debemos decidir si una nueva imagen contiene o no una instancia de esa clase. Esto se logra tomando una decisión bayesiana,

R=pag(Objeto|incógnita,S,A)pag(Ningún objeto|incógnita,S,A){\displaystyle R={\frac {p({\mbox{Object}}|X,S,A)}{p({\mbox{No object}}|X,S,A)}}}
=pag(incógnita,S,A|Objeto)pag(Objeto)pag(incógnita,S,A|Ningún objeto)pag(Ningún objeto){\displaystyle ={\frac {p(X,S,A|{\mbox{Object}})p({\mbox{Object}})}{p(X,S,A|{\mbox{No object}})p({\mbox{No object}})}}}
pag(incógnita,S,A|Θ)pag(Objeto)pag(incógnita,S,A|Θbgramo)pag(Ningún objeto){\displaystyle \approx {\frac {p(X,S,A|\Theta )p({\mbox{Object}})}{p(X,S,A|\Theta _{bg})p({\mbox{No object}})}}}

dóndeΘbgramo{\displaystyle \Theta _{bg}}es el modelo de fondo. Esta relación se compara con un umbral.T{\displaystyle T\,}para determinar la presencia/ausencia de un objeto.

Las probabilidades se calculan de la siguiente manera:

pag(incógnita,S,A|Θ)=hHpag(incógnita,S,A,h|Θ)={\displaystyle p(X,S,A|\Theta )=\sum _{h\in H}p(X,S,A,h|\Theta )=}
hHpag(A|incógnita,S,h,Θ)Aparienciapag(incógnita|S,h,Θ)Formapag(S|h,Θ)Escala Rel.pag(h|Θ)Otro{\displaystyle \sum _{h\in H}\underbrace {p(A|X,S,h,\Theta )} _{\mbox{Appearance}}\underbrace {p(X|S,h,\Theta )} _{\mbox{Shape}}\underbrace {p(S|h,\Theta )} _{\mbox{Rel. Scale}}\underbrace {p(h|\Theta )} _{\mbox{Other}}}

Apariencia

Cada partepag{\displaystyle p\,}tiene una apariencia modelada por una densidad gaussiana en el espacio de apariencia, con parámetros de media y covarianza.Θpagapagpag={dopag,Vpag}{\displaystyle \Theta _{p}^{app}=\{c_{p},V_{p}\}}, independientemente de las densidades de otras partes. El modelo de fondo tiene parámetrosΘbgramoapagpag={dobgramo,Vbgramo}{\displaystyle \Theta _{bg}^{app}=\{c_{bg},V_{bg}\}}Fergus et al. asumen que, dadas las características detectadas, la posición y la apariencia de esas características son independientes. Por lo tanto,pag(A|incógnita,S,h,Θ)=pag(A|h,Θ){\displaystyle p(A|X,S,h,\Theta )=p(A|h,\Theta )\,}. La relación de los términos de aparición se reduce a

pag(A|incógnita,S,h,Θ)pag(A|incógnita,S,h,Θbgramo)=pag(A|h,Θ)pag(A|h,Θbgramo){\displaystyle {\frac {p(A|X,S,h,\Theta )}{p(A|X,S,h,\Theta _{bg})}}={\frac {p(A|h,\Theta )}{p(A|h,\Theta _{bg})}}}
=pag=1PAG(GRAMO(A(hpag)|dopag,Vpag)GRAMO(A(hpag)|dobgramo,Vbgramo))bpag{\displaystyle =\prod _{p=1}^{P}\left({\frac {G(A(h_{p})|c_{p},V_{p})}{G(A(h_{p})|c_{bg},V_{bg})}}\right)^{b_{p}}}

Recordemos de Weber et al. queh{\displaystyle h\,}es la hipótesis para los índices de las partes en primer plano, yb{\displaystyle b\,}es el vector binario que da el estado de oclusión de cada parte en la hipótesis.

Forma

La forma se representa mediante una densidad gaussiana conjunta de las ubicaciones de las partes dentro de una hipótesis particular, después de que dichas partes se hayan transformado en un espacio invariante a la escala. Esta transformación elimina la necesidad de realizar una búsqueda exhaustiva sobre la escala. La densidad gaussiana tiene parámetrosΘforma={μ,Σ}{\displaystyle \Theta ^{\mbox{shape}}=\{\mu ,\Sigma \}\,}El modelo de fondoΘbgramo{\displaystyle \Theta _{bg}\,}Se supone que es una distribución uniforme sobre la imagen, que tiene áreaα{\displaystyle \alpha \,}AlquilerF{\displaystyle f\,}sea ​​el número de partes en primer plano,

pag(incógnita|S,h,Θ)pag(incógnita|S,h,Θbgramo)=GRAMO(incógnita(h)|μ,Σ)αF{\displaystyle {\frac {p(X|S,h,\Theta )}{p(X|S,h,\Theta _{bg})}}=G(X(h)|\mu ,\Sigma )\alpha ^{f}}

Escala relativa

La escala de cada partepag{\displaystyle p\,}En relación con un marco de referencia, se modela mediante una densidad gaussiana con parámetrosΘescala={tpag,Upag}{\displaystyle \Theta ^{\mbox{scale}}=\{t_{p},U_{p}\}\,}Se supone que cada parte es independiente de las demás. El modelo de fondoΘbgramo{\displaystyle \Theta _{bg}\,}asume una distribución uniforme en la escala, dentro de un rangor{\displaystyle r\,}.

pag(S|h,Θ)pag(S|h,Θbgramo)=pag=1PAGGRAMO(S(hpag)|tpag,Upag)dpagrF{\displaystyle {\frac {p(S|h,\Theta )}{p(S|h,\Theta _{bg})}}=\prod _{p=1}^{P}G(S(h_{p})|t_{p},U_{p})^{d_{p}}r^{f}}

Oclusión y estadísticas de detección de características

pag(h|Θ)pag(h|Θbgramo)=pagPoiss(norte|METRO)pagPoiss(norte|METRO)1nortedor(norte,F)pag(b|Θ){\displaystyle {\frac {p(h|\Theta )}{p(h|\Theta _{bg})}}={\frac {p_{\mbox{Poiss}}(n|M)}{p_{\mbox{Poiss}}(N|M)}}{\frac {1}{^{n}C_{r}(N,f)}}p(b|\Theta )}

El primer factor modela el número de características detectadas mediante una distribución de Poisson con media M. El segundo factor sirve como variable de control para la variable de hipótesis. El último factor es una tabla de probabilidad para todos los posibles patrones de oclusión.

Aprendiendo

La tarea de aprender los parámetros del modeloΘ={μ,Σ,do,V,METRO,pag(b|Θ),t,U}{\displaystyle \Theta =\{\mu ,\Sigma ,c,V,M,p(b|\Theta ),t,U\}\,}Esto se logra mediante la maximización de la expectativa . Se lleva a cabo con un espíritu similar al de Weber et al. Los detalles y las fórmulas para el paso E y el paso M se pueden encontrar en la literatura. [ 11 ]

Actuación

El modelo Constellation, tal como lo concibieron Fergus et al., logra tasas de categorización exitosas consistentemente superiores al 90 % en grandes conjuntos de datos de motocicletas, rostros, aviones y gatos manchados. [ 13 ] Para cada uno de estos conjuntos de datos, el modelo Constellation es capaz de capturar la "esencia" de la clase de objeto en términos de apariencia y/o forma. Por ejemplo, los conjuntos de datos de rostros y motocicletas generan modelos de forma muy precisos porque los objetos en esas categorías tienen una estructura muy bien definida, mientras que los gatos manchados varían significativamente en pose, pero tienen una apariencia manchada muy distintiva. Por lo tanto, el modelo tiene éxito en ambos casos. Es importante señalar que el modelo Constellation generalmente no considera cambios significativos en la orientación. Por lo tanto, si el modelo se entrena con imágenes de aviones horizontales, no tendrá un buen desempeño en, por ejemplo, imágenes de aviones orientados verticalmente a menos que el modelo se extienda para considerar explícitamente este tipo de rotación.

En términos de complejidad computacional, el modelo de constelación es muy costoso. Sinorte{\displaystyle N\,}es el número de detecciones de características en la imagen, yPAG{\displaystyle P\,}el número de partes en el modelo de objeto, luego el espacio de hipótesisH{\displaystyle H\,}esO(nortePAG){\displaystyle O(N^{P})\,}Debido a que el cálculo de estadísticas suficientes en el paso E de la maximización de la expectativa requiere evaluar la probabilidad de cada hipótesis, el aprendizaje se convierte en una operación de cuello de botella importante. Por esta razón, solo los valores dePAG6{\displaystyle P\leq 6}se han utilizado en aplicaciones prácticas y el número de detecciones de característicasnorte{\displaystyle N\,}Por lo general, se mantiene dentro del rango de aproximadamente 20 a 30 por imagen.

Variaciones

Una variación que intenta reducir la complejidad es el modelo estrella propuesto por Fergus et al. [ 14 ] Las dependencias reducidas de este modelo permiten el aprendizaje enO(norte2PAG){\displaystyle O(N^{2}P)\,}tiempo en lugar deO(nortePAG){\displaystyle O(N^{P})\,}Esto permite utilizar un mayor número de componentes del modelo y características de la imagen durante el entrenamiento. Dado que el modelo estrella tiene menos parámetros, también evita mejor el problema del sobreajuste cuando se entrena con menos imágenes.

Referencias

  1. Fischler, MA; Elschlager, RA (1973). "La representación y correspondencia de estructuras pictóricas". IEEE Transactions on Computers (1): 67– 92. doi : 10.1109/TC.1973.223602 . S2CID 14554383 . 
  2. M. Burl, T. Leung y P. Perona. Localización de rostros mediante estadísticas de forma. (1995)
  3. T. Leung, M. Burl y P. Perona. Detección de rostros en escenas desordenadas mediante la coincidencia aleatoria de grafos etiquetados. (1995)
  4. M. Burl y P. Perona. Reconocimiento de clases de objetos planares (1996)
  5. M. Burl, M. Weber y P. Perona. Un enfoque probabilístico para el reconocimiento de objetos mediante fotometría local y geometría global (1998)
  6. M. Weber. Aprendizaje no supervisado de modelos para el reconocimiento de objetos. Tesis doctoral. (2000)
  7. M. Weber, W. Einhaeuser, M. Welling y P. Perona. Aprendizaje y detección de cabezas humanas invariantes al punto de vista. (2000)
  8. 1 2 M. Weber, M. Welling y P. Perona. Hacia el descubrimiento automático de categorías de objetos. (2000)
  9. 1 2 M. Weber, M. Welling y P. Perona. Aprendizaje no supervisado de modelos para el reconocimiento. (2000)
  10. 1 2 R. Fergus, P. Perona y A. Zisserman. Reconocimiento de clases de objetos mediante aprendizaje no supervisado invariante a la escala. (2003)
  11. 1 2 R. Fergus. Reconocimiento de categorías de objetos visuales. Tesis doctoral. (2005)
  12. Kadir, Timor; Brady, Michael (2001). "Saliencia, escala y descripción de imágenes" . Revista Internacional de Visión por Computadora . 45 (2): 83– 105. doi : 10.1023/A:1012460413855 . S2CID 825395 . 
  13. R. Fergus y P. Perona. Conjuntos de datos de categorías de objetos de Caltech. http://www.vision.caltech.edu/html-files/archive.html (2003)
  14. R. Fergus, P. Perona y A. Zisserman. Un modelo de categorías de objetos disperso para un aprendizaje eficiente y un reconocimiento exhaustivo. (2005)
  • L. Fei-fei. Categorización de objetos: los modelos de constelación . Diapositivas de la clase. (2005) (enlace no funciona)

Véase también