Articulo de referencia

Tipos de imágenes de compresión de vídeo

En el campo de la compresión de video , un fotograma de video se comprime utilizando diferentes algoritmos con distintas ventajas y desventajas, centradas principalmente en la c...

En el campo de la compresión de video , un fotograma de video se comprime utilizando diferentes algoritmos con distintas ventajas y desventajas, centradas principalmente en la cantidad de datos comprimidos . Estos diferentes algoritmos para fotogramas de video se denominan tipos de imagen o tipos de fotograma . Los tres tipos de imagen principales utilizados en los diferentes algoritmos de video son I , P y B. [ 1 ] Se diferencian en las siguientes características:

  • Los fotogramas I son los menos compresibles, pero no requieren otros fotogramas de vídeo para su decodificación.
  • Los fotogramas P pueden utilizar datos de fotogramas anteriores para descomprimirse y son más compresibles que los fotogramas I.
  • Los fotogramas B pueden utilizar tanto los fotogramas anteriores como los posteriores como referencia de datos para obtener la mayor compresión de datos posible.

Resumen

Una secuencia de fotogramas de vídeo, que consta de dos fotogramas clave (I), un fotograma predicho hacia adelante (P) y un fotograma predicho bidireccionalmente (B).

En la compresión de vídeo se utilizan tres tipos de imágenes (o fotogramas) : fotogramas I, P y B.

Un fotograma I ( imagen codificada intra ) es una imagen autónoma, como un archivo de imagen JPG o BMP .

Un fotograma P (imagen predicha) permite predecir cada macrobloque a partir de una región de cualquier fotograma decodificado previamente que se encuentre en el búfer de fotogramas decodificados. El codificador no necesita reenviar regiones que no hayan cambiado en absoluto con respecto a un fotograma decodificado previamente, lo que ahorra espacio.

Un fotograma B (imagen predicha bidireccional) ahorra aún más espacio al generar predicciones de macrobloques más precisas. Esto se logra permitiendo que cada macrobloque se prediga combinando regiones de dos fotogramas previamente decodificados que se encuentran en el búfer de fotogramas decodificados, generalmente un fotograma que lo precede en el orden de visualización y otro que lo sigue.

Los fotogramas P y B también se denominan fotogramas intermedios . El orden en que se disponen los fotogramas I, P y B se denomina grupo de imágenes .

Cuadros/marcos

Aunque los términos fotograma e imagen se suelen usar indistintamente, imagen es un concepto más general, ya que una imagen puede ser un fotograma o un campo . Un fotograma es una imagen completa, y un campo es el conjunto de líneas de exploración impares o pares que componen una imagen parcial. Por ejemplo, una imagen HD 1080 tiene 1080 líneas (filas) de píxeles. Un campo impar consta de información de píxeles para las líneas 1, 3, 5,  ..., 1079. Un campo par tiene información de píxeles para las líneas 2, 4, 6,  ..., 1080. Cuando el vídeo se transmite en formato de exploración entrelazada , los campos se envían en secuencia, alternando entre campos de líneas impares y campos de líneas pares, cada uno con la mitad de información que un fotograma, pero separados en el tiempo como fotogramas secuenciales (es decir, un campo de líneas impares dado representa un tiempo entre el del campo de líneas pares precedente y el del campo de líneas pares siguiente).

Un sistema de referencia utilizado para predecir otros sistemas de referencia se denomina sistema de referencia.

Un fotograma codificado como una imagen fija completa sin información de otros fotogramas se denomina fotograma I. Un fotograma que utiliza la predicción de un único fotograma de referencia precedente (o un único fotograma para la predicción de cada región) es un fotograma P. Un fotograma B utiliza la predicción de un promedio (posiblemente ponderado) de dos fotogramas de referencia, uno precedente y otro posterior.

rebanadas

En el estándar H.264/MPEG-4 AVC , la granularidad de los tipos de predicción se reduce al nivel de "segmento". Un segmento es una región espacialmente distinta de un fotograma que se codifica por separado de cualquier otra región del mismo fotograma. Los segmentos I, P y B reemplazan a los fotogramas I, P y B, respectivamente.

Macrobloques

Normalmente, las imágenes (fotogramas) se segmentan en macrobloques , y los tipos de predicción individuales se pueden seleccionar en función de cada macrobloque, en lugar de que sean los mismos para toda la imagen, como se muestra a continuación:

  • Los marcos I solo pueden contener macrobloques intra.
  • Los marcos P pueden contener tanto macrobloques intra como macrobloques predichos.
  • Los fotogramas B pueden contener macrobloques intra, predichos y bi-predichos.

Además, en el estándar de codificación de vídeo H.264 , el fotograma se puede segmentar en secuencias de macrobloques llamadas cortes , y en lugar de utilizar selecciones de tipo de fotograma I, B y P, el codificador puede elegir el estilo de predicción de forma distinta en cada corte individual. En H.264 también se encuentran varios tipos adicionales de fotogramas/cortes:

  • SI-frames/slices (Switching I): Facilita el cambio entre flujos codificados; contiene SI-macroblocks (un tipo especial de macrobloque codificado intra).
  • Marcos/segmentos SP (Switching P): Facilita el cambio entre flujos codificados; contiene macrobloques P y/o I.
  • Multi‑frame motion estimation (up to 16 reference frames or 32 reference fields)

Multi‑frame motion estimation increases the quality of the video, while allowing the same compression ratio. SI and SP frames (defined for the Extended Profile) improve error correction. When such frames are used along with a smart decoder, it is possible to recover the broadcast streams of damaged DVDs.

Intra-coded (I) frames/slices (key frames)

  • I-frames contain an entire image. They are coded without reference to any other frame except (parts of) themselves.
  • May be generated by an encoder to create a random access point (to allow a decoder to start decoding properly from scratch at that picture location).
  • May also be generated when differentiating image details prohibit generation of effective P or B-frames.
  • Typically require more bits to encode than other frame types.

Often, I‑frames are used for random access and are used as references for the decoding of other pictures. Intra refresh periods of a half-second are common on such applications as digital television broadcast and DVD storage. Longer refresh periods may be used in some environments. For example, in videoconferencing systems it is common to send I-frames very infrequently.

Predicted (P) frames/slices

  • Require the prior decoding of some other picture(s) in order to be decoded.
  • May contain both image data and motion vector displacements and combinations of the two.
  • Can reference previous pictures in decoding order.
  • Older standard designs (such as MPEG-2) use only one previously decoded picture as a reference during decoding, and require that picture to also precede the P picture in display order.
  • H.264 can use multiple previously decoded pictures as references during decoding, and can have any arbitrary display-order relationship relative to the picture(s) used for its prediction.
  • Typically require fewer bits for encoding compared to I-frames.

Bi-directional predicted (B) frames/slices (macroblocks)

  • Require the prior decoding of subsequent frame(s) to be displayed.
  • May contain image data and/or motion vector displacements. Older standards allow only a single global motion compensation vector for the entire frame or a single motion compensation vector per macroblock.
  • Include some prediction modes that form a prediction of a motion region (e.g., a macroblock or a smaller area) by averaging the predictions obtained using two different previously decoded reference regions. Some standards allow two motion compensation vectors per macroblock (biprediction).
  • In older standards (such as MPEG-2), B-frames are never used as references for the prediction of other pictures. As a result, a lower quality encoding (requiring less space) can be used for such B-frames because the loss of detail will not harm the prediction quality for subsequent pictures.
  • H.264 relaxes this restriction, and allows B-frames to be used as references for the decoding of other frames at the encoder's discretion.
  • Older standards (such as MPEG-2), use exactly two previously decoded pictures as references during decoding, and require one of those pictures to precede the B-frame in display order and the other one to follow it.
  • H.264 allows for one, two, or more than two previously decoded pictures as references during decoding, and can have any arbitrary display-order relationship relative to the picture(s) used for its prediction.
  • The heightened flexibility of information retrieval means that B-frames typically require fewer bits for encoding than either I or P-frames.

See also

References

  1. Beach, Andy; Owen, Aaron (2019). Video compression handbook (2nd ed.). Place of publication not identified: Peachpit Press. ISBN 978-0-13-486621-5. OCLC 1006298938.
  • Video streaming with SP and SI frames