Video Multimethod Assessment Fusion ( VMAF ) es una métrica objetiva de calidad de vídeo con referencia completa desarrollada por Netflix en colaboración con la Universidad del Sur de California , el laboratorio IPI/LS2N de la Universidad de Nantes y el Laboratorio de Ingeniería de Imagen y Vídeo (LIVE) de la Universidad de Texas en Austin . Predice la calidad subjetiva del vídeo basándose en una secuencia de vídeo de referencia y otra distorsionada. Esta métrica puede utilizarse para evaluar la calidad de diferentes códecs de vídeo , codificadores, configuraciones de codificación o variantes de transmisión.
Historia
La métrica se basa en el trabajo inicial del grupo del profesor C.-C. Jay Kuo en la Universidad del Sur de California. [ 1 ] [ 2 ] [ 3 ] Aquí, se ha investigado la aplicabilidad de la fusión de diferentes métricas de calidad de video utilizando máquinas de vectores de soporte (SVM), lo que ha llevado a un "Índice FVQA (Evaluación de la calidad de video basada en fusión)" que ha demostrado superar a las métricas de calidad de imagen existentes en una base de datos subjetiva de calidad de video.
El método se ha desarrollado aún más en colaboración con Netflix, utilizando diferentes conjuntos de datos de vídeo subjetivos, incluido un conjunto de datos propiedad de Netflix ("NFLX"). Posteriormente renombrado como "Video Multimethod Assessment Fusion", se anunció en el Netflix TechBlog en junio de 2016 [ 4 ] y la versión 0.3.1 de la implementación de referencia se puso a disposición bajo una licencia de código abierto permisiva. [ 5 ]
En 2017, la métrica se actualizó para admitir un modelo personalizado que incluye una adaptación para la visualización en pantallas de teléfonos móviles, lo que genera puntuaciones de mayor calidad para el mismo material de entrada. En 2018, se lanzó un modelo que predice la calidad de contenido con resolución de hasta 4K . Los conjuntos de datos con los que se entrenaron estos modelos no se han hecho públicos.
En 2021, Beamr, Netflix, la Universidad del Sur de California, la Universidad de Nantes , la Universidad de Texas en Austin , SSIMWAVE, Disney, Google, Brightcove y ATEME recibieron un premio Emmy de Tecnología e Ingeniería por el desarrollo de métricas perceptuales abiertas para la optimización de la codificación de vídeo. Fue la segunda vez en 20 años que universidades recibían un premio Emmy. También fue la primera vez que una universidad francesa lo obtenía. [ 6 ] [ 7 ]
En junio de 2026, Netflix anunció VMAF v1, una importante actualización de la métrica. [ 8 ] La actualización solucionó problemas de la versión original, como la tendencia a priorizar los artefactos de compresión sobre el escalado descendente, así como la incapacidad de detectar artefactos de bandas . VMAF v1 cuenta con modelos que abarcan escenarios de visualización en 1080p, teléfonos móviles y 4K , con modelos separados para distancias de visualización cercanas y típicas de 4K. Netflix también anunció una futura versión HDR en la que está trabajando.
Componentes
VMAF utiliza métricas de calidad de imagen ya existentes, que un modelo de aprendizaje automático combina para obtener una única puntuación de calidad.
Desde la versión 1, la métrica utiliza las siguientes características: [ 8 ] [ 9 ]
- Métrica de pérdida de detalles (DLM): [ 10 ] mide la pérdida de detalles y las deficiencias que distraen la atención del espectador.
- Índice de bandas multiescala sensible al contraste (CAMBI): detecta artefactos de bandas en regiones suaves.
- Una característica de croma basada en una versión modificada de SpEED-QA.
- Diferencia media de píxeles colocalizados (MCPD): mide la diferencia temporal entre fotogramas en el componente de luminancia.
Las características mencionadas se combinan mediante una regresión basada en SVM para obtener una puntuación de salida única en el rango de 0 a 100 por fotograma de vídeo , donde 100 representa una calidad idéntica a la del vídeo de referencia. Estas puntuaciones se agrupan temporalmente a lo largo de toda la secuencia de vídeo mediante la media aritmética para obtener una puntuación de opinión media diferencial (DMOS) global. Para gestionar las distancias de visualización 4K, la versión 1 ajusta los valores de las características según la distancia de visualización normalizada, de modo que se pueda reentrenar y volver a aplicar un único modelo.
Además, a partir de la versión 1, la variante Sin Mejora de Ganancia (NEG) está habilitada por defecto. Esto evita que la puntuación se infle artificialmente con algunas técnicas de mejora visual.
v1 eliminó la función de Fidelidad de Información Visual (VIF) para reducir el costo computacional. [ 9 ]
Gracias a la disponibilidad pública del código fuente de entrenamiento ("VMAF Development Kit", VDK), el método de fusión puede volver a entrenarse y evaluarse en función de diferentes conjuntos de datos y características de vídeo.
Versión original
La versión original de VMAF, lanzada en 2016, fusionaba un conjunto diferente de características utilizando una regresión basada en máquinas de vectores de soporte (SVM):
- Fidelidad de la información visual (VIF): considera la pérdida de fidelidad de la información en cuatro escalas espaciales diferentes.
- Métrica de pérdida de detalles (DLM): mide la pérdida de detalles y las deficiencias que distraen la atención del espectador.
- Diferencia media de píxeles colocalizados (MCPD): mide la diferencia temporal entre fotogramas en el componente de luminancia.
La relación señal-ruido antirruido (AN-SNR) se utilizó en versiones anteriores de VMAF como métrica de calidad, pero posteriormente se abandonó. [ 11 ]
Actuación
Se ha demostrado que una versión temprana de VMAF supera a otras métricas de calidad de imagen y video como SSIM , PSNR -HVS y VQM-VFD en tres de cuatro conjuntos de datos en términos de precisión de predicción, cuando se compara con calificaciones subjetivas . [ 4 ] Su rendimiento también se ha analizado en otro artículo, que encontró que VMAF no tuvo un mejor rendimiento que SSIM y MS-SSIM en un conjunto de datos de video. [ 12 ] En 2017, ingenieros de RealNetworks informaron una buena reproducibilidad de los hallazgos de rendimiento de Netflix. [ 13 ] En el benchmark de métricas de calidad de video de MSU , donde se probaron sus varias versiones (incluido VMAF NEG), VMAF superó a todas las demás métricas en todos los estándares de compresión (H.265, VP9, AV1, VVC).
Las puntuaciones VMAF pueden incrementarse artificialmente sin mejorar la calidad percibida mediante la aplicación de diversas operaciones antes o después de distorsionar el vídeo, a veces sin afectar a la popular métrica PSNR . [ 14 ] [ 15 ]
Software
Una implementación de referencia escrita en C y Python ("VMAF Development Kit, VDK") se publica como software libre bajo los términos de la licencia BSD+Patent. [ 16 ] Su código fuente y material adicional están disponibles en GitHub . [ 5 ]
Véase también
Referencias
- ↑ Liu, Tsung-Jung; Lin, Joe Yuchieh; Lin , Weisi; Kuo, C.-C. Jay (2013). "Evaluación de la calidad visual: desarrollos recientes, aplicaciones de codificación y tendencias futuras" . APSIPA Transactions on Signal and Information Processing . 2. doi : 10.1017/atsip.2013.5 . hdl : 10356/106287 . ISSN 2048-7703 .
- ↑ Lin, Joe Yuchieh; Liu, TJ; Wu, ECH; Kuo, CCJ (diciembre de 2014). «Un índice de evaluación de la calidad de vídeo (Fvqa) basado en fusión». Cumbre y Conferencia Anual de la Asociación de Procesamiento de Señales e Información (APSIPA), Asia-Pacífico 2014. págs. 1–5 . doi : 10.1109/apsipa.2014.7041705 . ISBN 978-6-1636-1823-8. S2CID 7742774 .
- ↑ Lin, Joe Yuchieh; Wu, Chi-Hao; Ioannis, Katsavounidis; Li, Zhi; Aaron, Anne; Kuo, C.-C. Jay (junio de 2015). "EVQA: Un índice de evaluación de la calidad de vídeo basado en el aprendizaje conjunto". 2015 IEEE International Conference on Multimedia & Expo Workshops (ICMEW) . pp. 1–5 . doi : 10.1109/ICMEW.2015.7169760 . ISBN 978-1-4799-7079-7. S2CID 6996075 .
- 1 2 Blog, Netflix Technology (06/06/2016). "Hacia una métrica práctica de calidad de vídeo perceptual" . Netflix TechBlog . Recuperado el 15/07/2017 .
- 1 2 vmaf: Evaluación de la calidad perceptual del vídeo basada en la fusión de múltiples métodos , Netflix, Inc., 14 de julio de 2017 , consultado el 15 de julio de 2017.
- ↑ "Ganadores de los 72º Premios Emmy® de Tecnología e Ingeniería – Los Emmy" . theemmys.tv . 25 de enero de 2021. Archivado del original el 19 de mayo de 2022. Consultado el 8 de febrero de 2021 .
- ↑ PATRÓN, Julien. "Tecnología : ¡la Universidad de Nantes recibió un premio Emmy !" . NOTICIAS (en francés) . Consultado el 8 de febrero de 2021 .
- ^ Bampis , Christos G.; Li, Zhi; Swanson, Kyle; Fons Miret, Nil; Madhusudanarao, Pavan (junio de 2026). "VMAF v1: Lo bueno no es suficientemente bueno" . Blog tecnológico de Netflix . Consultado el 20 de junio de 2026 .
- 1 2 "Modelos VMAF v1" . GitHub . Netflix, Inc. Recuperado el 20 de junio de 2026 .
- ↑ Li, S.; Zhang, F.; Ma, L.; Ngan, KN (octubre de 2011). "Evaluación de la calidad de la imagen mediante la evaluación separada de las pérdidas de detalle y los deterioros aditivos". IEEE Transactions on Multimedia . 13 (5): 935– 949. Bibcode : 2011ITMm...13..935L . doi : 10.1109/tmm.2011.2152382 . ISSN 1520-9210 . S2CID 8618041 .
- ↑ Zhili, Henry. "Eliminación de AN-SNR" . Github.
- ^ Bampis, Christos G.; Bovik, Alan C. (2 de marzo de 2017). "Aprender a predecir la calidad de la experiencia de la transmisión de vídeo: distorsiones, almacenamiento en búfer y memoria". arXiv : 1703.00633 [ cs.MM ].
- ↑ Rassool, Reza (2017). "Reproducibilidad de VMAF: Validación de una métrica práctica de calidad de vídeo perceptual" (PDF) . Simposio Internacional IEEE de 2017 sobre Sistemas Multimedia de Banda Ancha y Radiodifusión (BMSB) . págs. 1–2 . doi : 10.1109/BMSB.2017.7986143 . ISBN 978-1-5090-4937-0. S2CID 5449498 . Consultado el 30-11-2017 .
- ↑ Zvezdakova, Anastasia; Zvezdakov, Sergey; Kulikov, Dmitriy; Vatolin, Dmitriy (29 de abril de 2019). "Hackear VMAF con color de vídeo y distorsión de contraste". arXiv : 2107.04510 [ cs.MM ].
- ↑ Siniukov, Maksim; Antsiferova, Anastasia; Kulikov, Dmitriy; Vatolin, Dmitriy (2021). "Hackear VMAF y VMAF NEG: vulnerabilidad a diferentes métodos de preprocesamiento". arXiv : 2107.04510 [ cs.MM ].
- ↑ "BSD+Patente | Iniciativa de Código Abierto" . 18 de mayo de 2017.
Enlaces externos
- Implementación de referencia
- Tecnología cinematográfica y de vídeo
- Televisión digital
- Procesamiento de imágenes