Articulo de referencia

fidelidad de la información visual

La fidelidad de la información visual ( VIF ) es un índice de evaluación de la calidad de imagen de referencia completa basado en estadísticas de escenas naturales y la noción d...

La fidelidad de la información visual ( VIF ) es un índice de evaluación de la calidad de imagen de referencia completa basado en estadísticas de escenas naturales y la noción de información de imagen extraída por el sistema visual humano . [ 1 ] Fue desarrollado por Hamid R Sheikh y Alan Bovik en el Laboratorio de Ingeniería de Imagen y Video (LIVE) de la Universidad de Texas en Austin en 2006. Está implementado en el núcleo del sistema de monitoreo de calidad de video VMAF de Netflix , que controla la calidad de imagen de todos los videos codificados transmitidos por Netflix.

Modelo del sistema

Modelo fuente

Se utiliza una mezcla de escala gaussiana (GSM) para modelar estadísticamente los coeficientes wavelet de una descomposición piramidal orientable de una imagen. [ 2 ] El modelo se describe a continuación para una subbanda dada de la descomposición multiescala y multiorientación, y puede extenderse a otras subbandas de manera similar. Sean los coeficientes wavelet en una subbanda dada los siguientes:do={do¯i:iI}{\displaystyle {\mathcal {C}}=\{{\bar {C}}_{i}:i\in {\mathcal {I}}\}}dóndeI{\displaystyle {\mathcal {I}}}denota el conjunto de índices espaciales a través de la subbanda y cadado¯i{\displaystyle {\bar {C}}_{i}}es unMETRO{\displaystyle M}vector dimensional . La subbanda se divide en bloques no superpuestos deMETRO{\displaystyle M}coeficientes cada uno, donde cada bloque corresponde ado¯i{\displaystyle {\bar {C}}_{i}}Según el modelo GSM,do=SU={SiU¯i:iI},{\displaystyle {\mathcal {C}}={\mathcal {S}}\cdot {\mathcal {U}}=\{S_{i}{\bar {U}}_{i}:i\in {\mathcal {I}}\},} dóndeSi{\displaystyle S_{i}}es un escalar positivo yU¯i{\displaystyle {\bar {U}}_{i}}es un vector gaussiano con media cero y covarianzadoU{\displaystyle \mathbf {C} _{U}}Además, se supone que los bloques no superpuestos son independientes entre sí y que el campo aleatorioS{\displaystyle {\mathcal {S}}}es independiente deU{\displaystyle {\mathcal {U}}}.

Modelo de distorsión

El proceso de distorsión se modela utilizando una combinación de atenuación de señal y ruido aditivo en el dominio de la ondícula . Matemáticamente, siD={D¯i:iI}{\displaystyle {\mathcal {D}}=\{{\bar {D}}_{i}:i\in {\mathcal {I}}\}}denota el campo aleatorio de una subbanda dada de la imagen distorsionada,GRAMO={gramoi:iI}{\displaystyle {\mathcal {G}}=\{g_{i}:i\in {\mathcal {I}}\}}es un campo escalar determinista yV={V¯i:iI}{\displaystyle {\mathcal {V}}=\{{\bar {V}}_{i}:i\in {\mathcal {I}}\}}, dóndeV¯i{\displaystyle {\bar {V}}_{i}}es un vector gaussiano de media cero con covarianzadoV=σv2I{\displaystyle \mathbf {C} _{V}=\sigma _{v}^{2}\mathbf {I} }, entonces

D=GRAMOdo+V.{\displaystyle {\mathcal {D}}={\mathcal {G}}{\mathcal {C}}+{\mathcal {V}}.}

Más,V{\displaystyle {\mathcal {V}}}está modelado para ser independiente deS{\displaystyle {\mathcal {S}}}yU{\displaystyle {\mathcal {U}}}.

Modelo HVS

La dualidad de los modelos HVS y NSS implica que varios aspectos del HVS ya se han tenido en cuenta en el modelo fuente. Aquí, el HVS se modela adicionalmente basándose en la hipótesis de que la incertidumbre en la percepción de las señales visuales limita la cantidad de información que se puede extraer de la imagen fuente y distorsionada. Esta fuente de incertidumbre se puede modelar como ruido visual en el modelo HVS. En particular, el ruido HVS en una subbanda dada de la descomposición wavelet se modela como ruido gaussiano blanco aditivo. Seanorte={norte¯i:iI}{\displaystyle {\mathcal {N}}=\{{\bar {N}}_{i}:i\in {\mathcal {I}}\}}ynorte={norte¯i:iI}{\displaystyle {\mathcal {N}}'=\{{\bar {N}}_{i}':i\in {\mathcal {I}}\}}sean campos aleatorios, dondenorte¯i{\displaystyle {\bar {N}}_{i}}ynorte¯i{\displaystyle {\bar {N}}_{i}'}son vectores gaussianos de media cero con covarianzadonorte{\displaystyle \mathbf {C} _ {N}}ydonorte{\displaystyle \mathbf {C} _ {N}'}. Además, dejemosmi{\displaystyle {\mathcal {E}}}yF{\displaystyle {\mathcal {F}}}denotamos la señal visual en la salida del HVS. Matemáticamente, tenemosmi=do+norte{\displaystyle {\mathcal {E}}={\mathcal {C}}+{\mathcal {N}}}yF=D+norte{\displaystyle {\mathcal {F}}={\mathcal {D}}+{\mathcal {N}}'}. Tenga en cuenta quenorte{\displaystyle {\mathcal {N}}}ynorte{\displaystyle {\mathcal {N}}'}son campos aleatorios que son independientes deS{\displaystyle {\mathcal {S}}},U{\displaystyle {\mathcal {U}}}yV{\displaystyle {\mathcal {V}}}.

Índice VIF

Dejardo¯norte=(do¯1,do¯2,,do¯norte){\displaystyle {\bar {C}}^{N}=({\bar {C}}_{1},{\bar {C}}_{2},\ldots ,{\bar {C}}^{N})}denotemos el vector de todos los bloques de una subbanda dada.Snorte,D¯norte,mi¯norte{\displaystyle S^{N},{\bar {D}}^{N},{\bar {E}}^{N}}y F¯norte{\displaystyle {\bar {F}}^{N}}ser definidos de manera similar. Seasnorte{\displaystyle s^{N}}denota la estimación de máxima verosimilitud deSnorte{\displaystyle S^{N}}dadodonorte{\displaystyle C^{N}}ydoU{\displaystyle \mathbf {C} _{U}}. La cantidad de información extraída de la referencia se obtiene como

I(do¯norte;mi¯norte|S¯norte=snorte)=12i=1norteregistro2(|si2doU+σnorte2I||σnorte2I|),{\displaystyle I({\bar {C}}^{N};{\bar {E}}^{N}|{\bar {S}}^{N}=s^{N})={\frac {1}{2}}\sum _{i=1}^{N}\log _{2}\left({\frac {|s_{i}^{2}\mathbf {C} _{U}+\sigma _{n}^{2}\mathbf {I} |}{|\sigma _{n}^{2}\mathbf {I} |}}\right),}

mientras que la cantidad de información extraída de la imagen de prueba se da como

I(do¯norte;F¯norte|S¯norte=snorte)=12i=1norteregistro2(|gramoi2si2doU+(σv2+σnorte2)I||(σv2+σnorte2)I|).{\displaystyle I({\bar {C}}^{N};{\bar {F}}^{N}|{\bar {S}}^{N}=s^{N})={\frac {1}{2}}\sum _{i=1}^{N}\log _{2}\left({\frac {|g_{i}^{2}s_{i}^{2}\mathbf {C} _{U}+(\sigma _{v}^{2}+\sigma _{n}^{2})\mathbf {I} |}{|(\sigma _{v}^{2}+\sigma _{n}^{2})\mathbf {I} |}}\right).}

Denotando elnorte{\displaystyle N}bloques en la subbandaj{\displaystyle j}de la descomposición wavelet pordo¯norte,j{\displaystyle {\bar {C}}^{N,j}}y de manera similar para las demás variables, el índice VIF se define como

VIF=jsubbandasI(do¯norte,j;F¯norte,jSnorte,j=snorte,j)jsubbandasI(do¯norte,j;mi¯norte,jSnorte,j=snorte,j).{\displaystyle {\textrm {VIF}}={\frac {\sum _{j\in {\textrm {subbands}}}I({\bar {C}}^{N,j};{\bar {F}}^{N,j}\mid S^{N,j}=s^{N,j})}{\sum _{j\in {\textrm {subbands}}}I({\bar {C}}^{N,j};{\bar {E}}^{N,j}\mid S^{N,j}=s^{N,j})}}.}

Actuación

El coeficiente de correlación de rangos de Spearman (SROCC) entre las puntuaciones del índice VIF de las imágenes distorsionadas en la base de datos de evaluación de la calidad de imagen LIVE y las puntuaciones de opinión humana correspondientes se evalúa en 0,96.

Referencias

  1. Sheikh, Hamid; Bovik, Alan (2006). "Información de imagen y calidad visual". IEEE Transactions on Image Processing . 15 (2): 430– 444. Bibcode : 2006ITIP...15..430S . doi : 10.1109/tip.2005.859378 . PMID 16479813 . 
  2. Simoncelli, Eero; Freeman, William (1995). «La pirámide orientable: una arquitectura flexible para el cálculo de derivadas multiescala». Actas de la Conferencia Internacional sobre Procesamiento de Imágenes . Vol. 3. págs. 444–447 . doi : 10.1109/ICIP.1995.537667 . ISBN   0-7803-3122-2. S2CID 1099364 . 
  • Laboratorio de Ingeniería de Imagen y Video de la Universidad de Texas
  • Una implementación del índice VIF
  • Base de datos de evaluación de la calidad de imagen en tiempo real
Obtenido de " https://en.wikipedia.org/w/index.php?title=Visual_information_fidelity&oldid=1297472835 "