SMPTE ST 2117-1 , [ 1 ] conocido informalmente como VC-6 , es un formato de codificación de vídeo . [ 2 ]
Descripción general
El códec VC-6 está optimizado para aplicaciones de codificación intermedia, mezzanine o de contribución. [ 2 ] Normalmente, estas aplicaciones implican la compresión de composiciones terminadas para edición, contribución, distribución primaria, archivado y otras aplicaciones donde es necesario preservar la calidad de la imagen lo más cerca posible de la original, al tiempo que se reducen las tasas de bits y se optimizan los requisitos de procesamiento, energía y almacenamiento. VC-6, como otros códecs de esta categoría [ 3 ] [ 4 ] utiliza solo compresiones intra-fotograma , donde cada fotograma se almacena de forma independiente y se puede decodificar sin dependencias de ningún otro fotograma. [ 5 ] El códec implementa compresión sin pérdidas y con pérdidas , dependiendo de los parámetros de codificación que se hayan seleccionado. Fue estandarizado en 2020. V-Nova ha implementado variantes anteriores del códec desde 2015 bajo el nombre comercial Perseus. El códec se basa en estructuras de datos jerárquicas llamadas s-trees y no implica compresión DCT ni transformada wavelet . El mecanismo de compresión es independiente de los datos que se comprimen y puede aplicarse tanto a píxeles como a otros datos que no sean imágenes. [ 6 ]
A diferencia de los códecs basados en DCT , VC-6 se basa en estructuras jerárquicas y repetibles de tipo s-tree, similares a quadtrees modificados . Estas estructuras simples proporcionan capacidades intrínsecas, como paralelismo masivo [ 7 ] y la capacidad de elegir el tipo de filtrado utilizado para reconstruir imágenes de mayor resolución a partir de imágenes de menor resolución [ 8 ] . En el estándar VC-6 [ 2 ] se proporciona un sobremuestreador desarrollado con una red neuronal convolucional en bucle para optimizar el detalle en la imagen reconstruida, sin requerir una gran sobrecarga computacional. La capacidad de navegar espacialmente dentro del flujo de bits VC-6 en múltiples niveles [ 2 ] también permite que los dispositivos de decodificación apliquen más recursos a diferentes regiones de la imagen, lo que permite que las aplicaciones de región de interés operen en flujos de bits comprimidos sin necesidad de decodificar la imagen de resolución completa [ 9 ] .
Historia
En la feria NAB Show de 2015, V-Nova afirmó "ganancias de compresión promedio de 2x a 3x, en todos los niveles de calidad, bajo escenarios operativos prácticos en tiempo real en comparación con H.264 , HEVC y JPEG2000 ". [ 10 ] Hacer este anuncio el 1 de abril antes de una importante feria comercial atrajo la atención de muchos expertos en compresión. [ 11 ] Desde entonces, V-Nova ha implementado y licenciado la tecnología, conocida en ese momento como Perseus, [ 10 ] tanto en aplicaciones de contribución como de distribución en todo el mundo, incluyendo Sky Italia , [ 12 ] Fast Filmz, [ 13 ] [ 14 ] Harmonic Inc y otros. Una variante de la tecnología optimizada para mejorar el códec de distribución pronto se estandarizará como MPEG-5 Parte 2 LCEVC . [ 15 ] [ 16 ] [ 17 ]
En septiembre de 2025, un blog para desarrolladores de NVIDIA informó sobre cómo su implementación acelerada por CUDA de SMPTE VC-6 se integra en las canalizaciones de IA de visión para optimizar el flujo de datos. Al mantener los conjuntos de datos comprimidos y obtener solo lo que requiere cada paso, VC-6 acelerado por CUDA reduce las transferencias del host a la GPU, alivia los cuellos de botella de memoria y admite lotes de mayor tamaño sin infraestructura adicional. El blog para desarrolladores de NVIDIA documentó mejoras de rendimiento de hasta 5 veces en flujos de trabajo de IA de visión de extremo a extremo, lo que posiciona a VC-6 como una solución práctica para escalar tanto el entrenamiento como la inferencia en entornos de datos de alto volumen. [ 18 ]
Conceptos básicos
Aviones
El estándar [ 2 ] describe un algoritmo de compresión que se aplica a planos de datos independientes. Estos planos pueden ser píxeles RGB o RGBA provenientes de una cámara, píxeles YCbCr de una fuente de video convencional centrada en TV u otros planos de datos. Puede haber hasta 255 planos de datos independientes, y cada plano puede tener una cuadrícula de valores de datos con dimensiones de hasta 65535 x 65535. [ 19 ] El estándar SMPTE ST 2117-1 se centra en la compresión de planos de valores de datos, típicamente píxeles. Para comprimir y descomprimir los datos en cada plano, VC-6 utiliza representaciones jerárquicas de una pequeña estructura en forma de árbol que contiene metadatos utilizados para predecir otros árboles. Hay 3 estructuras fundamentales que se repiten en cada plano. [ 2 ]
Árbol S
La estructura de compresión principal en VC-6 es el árbol s. Es similar a la estructura de quadtree común en otros esquemas. Un árbol s se compone de nodos dispuestos en una estructura de árbol, donde cada nodo se enlaza con 4 nodos en la siguiente capa. El número total de capas por encima del nodo raíz se conoce como la altura del árbol s . La compresión se logra en un árbol s mediante el uso de metadatos para indicar si se pueden predecir los niveles con transporte selectivo de datos de mejora en el flujo de bits. Cuantos más datos se puedan predecir, menos información se envía y mejor es la relación de compresión . [ 6 ] [ 2 ]
Cuadro
El estándar [ 2 ] define un tableau como el nodo raíz, o la capa más alta de un s-tree , que contiene nodos para otro s-tree. Al igual que los s-trees genéricos a partir de los cuales se construyen, los tableaux se organizan en capas con metadatos en los nodos que indican si se predicen o transmiten capas superiores en el flujo de bits. [ 6 ]
Escalón
Las estructuras jerárquicas de árbol s y tableau en el estándar [ 2 ] se utilizan para transportar mejoras (llamadas resid-vals) y otros metadatos para reducir la cantidad de datos sin procesar que se deben transportar en la carga útil del flujo de bits. La herramienta jerárquica final es la capacidad de organizar los tableaux, de modo que los datos de cada plano (es decir, píxeles) se puedan descuantizar a diferentes resoluciones y utilizar como predictores para resoluciones más altas. Cada una de estas resoluciones está definida por el estándar [ 2 ] como un echelon. Cada echelon dentro de un plano se identifica mediante un índice , donde un índice más negativo indica una resolución baja y un índice mayor y más positivo indica una resolución más alta.
Descripción general del flujo de bits
VC-6 es un ejemplo de codificación intra-fotograma , donde cada imagen se codifica sin referencia a otras imágenes. También es intra-plano, donde no se utiliza información de un plano para predecir otro plano. Como resultado, el flujo de bits VC-6 contiene toda la información para todos los planos de una sola imagen. [ 2 ] Una secuencia de imágenes se crea concatenando los flujos de bits de varias imágenes, o empaquetándolas en un contenedor como MXF , QuickTime o Matroska .
El flujo de bits VC-6 se define en el estándar [ 2 ] mediante pseudocódigo, y se ha demostrado un decodificador de referencia basado en dicha definición. La cabecera primaria es la única estructura fija definida por el estándar [ 2 ] . La cabecera secundaria contiene información de marcadores y tamaño que depende de los valores de la cabecera primaria. La cabecera terciaria se calcula completamente, y luego la estructura de la carga útil se deriva de los parámetros calculados durante la decodificación de la cabecera [ 2 ].
Descripción general de la decodificación
El estándar [ 2 ] define un proceso llamado reconstrucción de plano para decodificar imágenes a partir de un flujo de bits. El proceso comienza con el escalón con el índice más bajo. No se utilizan predicciones para este escalón. En primer lugar, se utilizan las reglas del flujo de bits para reconstruir los residuos. A continuación, se realizan procesos de desparsificación y decodificación de entropía para llenar la cuadrícula con valores de datos en cada coordenada. Estos valores se descuantizan para crear valores de rango completo que pueden utilizarse como predicciones para el escalón con el siguiente índice más alto. Cada escalón utiliza el sobremuestreador especificado en el encabezado para crear un plano predicho del escalón inferior, que se añade a la cuadrícula residual del escalón actual, la cual puede sobremuestrearse como predicción para el siguiente escalón. [ 20 ]
El escalón final de resolución completa, definido por el estándar, se encuentra en el índice 0, y sus resultados se muestran en lugar de utilizarse para otro escalón. [ 2 ]
Opciones de sobremuestreo
Opciones básicas
El estándar [ 2 ] define una serie de sobremuestreadores básicos [ 21 ] para crear predicciones de mayor resolución a partir de niveles de menor resolución. Hay dos sobremuestreadores lineales, bicúbico y nítido, y un sobremuestreador del vecino más cercano.
Sobremuestreador de red neuronal convolucional
Seis muestreadores ascendentes no lineales diferentes se definen [ 2 ] mediante un conjunto de procesos y coeficientes que se proporcionan en formato JSON . [ 21 ] Estos coeficientes se generaron utilizando técnicas de redes neuronales convolucionales [ 22 ] .
Referencias
- ↑ "Resultados de búsqueda de IEEE Xplore" . IEEE . Consultado el 17 de septiembre de 2020 .
- 1 2 3 4 5 6 7 8 9 10 11 12 13 14 15 16 17 18 "ST 2117-1:2020 - Estándar SMPTE - Formato de imagen multiplanar VC-6 — Parte 1. Flujo de bits elemental" . St 2117-1:2020 : 1–156 . Julio de 2020. doi : 10.5594/SMPTE.ST2117-1.2020 . ISBN 978-1-68303-219-9Archivado del original el 28 de octubre de 2020.
- ↑ "ST 2042-1:2012 - Estándar SMPTE - Compresión de vídeo VC-2" . St 2042-1:2012 : 1–137 . Agosto de 2012. doi : 10.5594/SMPTE.ST2042-1.2012 . ISBN 978-1-61482-890-7Archivado del original el 13 de junio de 2018.
- ↑ "ST 2019-1:2016 - Estándar SMPTE - Formato de flujo de datos y compresión de imágenes VC-3" . St 2019-1:2016 : 1–108 . Junio de 2016. doi : 10.5594/SMPTE.ST2019-1.2016 . ISBN 978-1-68303-020-1Archivado del original el 6 de marzo de 2017.
- ↑ "ST 2073-1:2014 - Estándar SMPTE - VC-5 Video Essence - Parte 1: Elementary Bitstream" . St 2073-1:2014 : 1–50 . Marzo de 2014. doi : 10.5594/SMPTE.ST2073-1.2014 . ISBN 978-1-61482-797-9.
- 1 2 3 "SMPTE ratifica el códec de vídeo VC-6 con IA de V-Nova" . Digital Media World . 7 de octubre de 2020.
- ↑ Hung, Yubin; Rosenfeld, Azriel (1 de agosto de 1989). "Procesamiento paralelo de quadtrees lineales en una computadora conectada en malla" . Journal of Parallel and Distributed Computing . 7 (1): 1– 27. doi : 10.1016/0743-7315(89)90049-X . ISSN 0743-7315 .
- ↑ Samet, Hanan (1988), "An Overview of Quadtrees, Octrees, and Related Hierarchical Data Structures" , Theoretical Foundations of Computer Graphics and CAD , Berlín, Heidelberg: Springer Berlin Heidelberg, pp. 51–68 , doi : 10.1007/978-3-642-83539-1_2 , ISBN 978-3-642-83541-4Consultado el 9 de septiembre de 2020.
- ↑ S., VG (5 de octubre de 2020). "SMPTE publica el nuevo estándar de códec de producción de vídeo VC-6" . Sports Video Group .
- 1 2 "Análisis: V-Nova Perseus: ¿Su compresión está a la altura de las expectativas?" . Streaming Media Magazine . 17 de junio de 2016 . Consultado el 4 de septiembre de 2020 .
- ↑ "Cronología histórica de los estándares y formatos de codificación de vídeo" . Vcodex . Consultado el 30 de julio de 2021 .
- ↑ "Sky Italia elige a V-Nova para ampliar su cobertura de IPTV" . Televisión digital Europa .
- ↑ "FastFilmz de India se asocia con V-Nova para ofrecer OTT a teléfonos 2G" . Televisión digital Europa . 7 de abril de 2016. Consultado el 9 de septiembre de 2020 .
- ↑ "SHAREit adquiere Fastfilmz para aumentar el contenido de vídeo y los usuarios regionales" . Inc42 Media . 8 de mayo de 2018. Consultado el 17 de septiembre de 2020 .
- ↑ "Códec de vídeo de mejora de baja complejidad" . LCEVC: un nuevo enfoque para la compresión de vídeo .
- ↑ "V-Nova anuncia MPEG-5 Parte 2 LCEVC" . TVB Europe .
- ↑ "Se filtran detalles políticos de Perseus en la NAB tras la revelación sobre MPEG-5" . Rethnk Research . 11 de abril de 2019.
- ↑ "Crea canalizaciones de IA de visión de alto rendimiento con VC-6 acelerado por NVIDIA CUDA" . Blog técnico de NVIDIA . Nvidia . 11 de septiembre de 2025.
- ↑ "Descripción general del VC-6" . mrmxf.com . Archivado del original el 15 de junio de 2021. Consultado el 15 de junio de 2021 .
- ↑ ST 2117-1:2020 - Estándar SMPTE - Formato de imagen multiplanar VC-6 — Parte 1. Flujo de bits elemental . Julio de 2020. págs. 1–156 . doi : 10.5594/SMPTE.ST2117-1.2020 . ISBN 978-1-68303-219-9Archivado del original el 28 de octubre de 2020.
{{cite book}}:|journal=ignorado ( ayuda ) - 1 2 ST 2117-1 elemento multimedia de sobremuestreo . 21 de julio de 2020. págs. 1–156 . doi : 10.5594/SMPTE.ST2117-1.2020 . ISBN 978-1-68303-219-9Archivado del original el 15 de junio de 2021.
{{cite book}}:|journal=ignorado ( ayuda ) - ↑ Arabshahi, P. (mayo de 1996). "Fundamentos de redes neuronales artificiales [ Reseñas de libros ] " . IEEE Transactions on Neural Networks . 7 (3): 793. doi : 10.1109/tnn.1996.501738 . ISSN 1045-9227 . S2CID 6576607 .
- Televisión de alta definición
- Estándares SMPTE
- Códecs de vídeo
- HD DVD
- Estándares abiertos protegidos por patentes
- Compresión de vídeo
- Algoritmos de compresión sin pérdidas