En teoría de la información , la compresión de datos , codificación de fuente [ 1 ] o reducción de la tasa de bits es el proceso de codificar información utilizando menos bits que la representación original. [ 2 ] Cualquier compresión particular puede ser con pérdida o sin pérdida . La compresión sin pérdida reduce los bits al identificar y eliminar la redundancia estadística . No se pierde información en la compresión sin pérdida. La compresión con pérdida reduce los bits al eliminar información innecesaria o menos importante. [ 3 ] Normalmente, un dispositivo que realiza la compresión de datos se denomina codificador, y uno que realiza el proceso inverso (descompresión) se denomina decodificador.
El proceso de reducir el tamaño de un archivo de datos se conoce comúnmente como compresión de datos. En el contexto de la transmisión de datos , se denomina codificación de origen: la codificación se realiza en el origen de los datos antes de su almacenamiento o transmisión. [ 4 ] La codificación de origen no debe confundirse con la codificación de canal , para la detección y corrección de errores, ni con la codificación de línea , que consiste en asignar datos a una señal.
Los algoritmos de compresión de datos presentan una relación de compromiso entre la complejidad espacio-temporal, es decir, entre los bytes necesarios para almacenar o transmitir información y los recursos computacionales necesarios para realizar la codificación y decodificación. El diseño de esquemas de compresión de datos implica equilibrar el grado de compresión, la cantidad de distorsión introducida (al usar compresión de datos con pérdida ) y los recursos computacionales o el tiempo necesarios para comprimir y descomprimir los datos. [ 5 ]
Sin pérdidas
Los algoritmos de compresión de datos sin pérdida suelen aprovechar la redundancia estadística para representar los datos sin perder información , de modo que el proceso sea reversible. La compresión sin pérdida es posible porque la mayoría de los datos del mundo real presentan redundancia estadística. Por ejemplo, una imagen puede tener áreas de color que no cambian a lo largo de varios píxeles; en lugar de codificar "píxel rojo, píxel rojo...", los datos se pueden codificar como "279 píxeles rojos". Este es un ejemplo básico de codificación de longitud variable ; existen muchos métodos para reducir el tamaño de los archivos eliminando la redundancia.
Los métodos de compresión Lempel-Ziv (LZ) se encuentran entre los algoritmos más populares para el almacenamiento sin pérdidas. [ 6 ] DEFLATE es una variación de LZ optimizada para la velocidad de descompresión y la relación de compresión, [ 7 ] pero la compresión puede ser lenta. A mediados de la década de 1980, tras el trabajo de Terry Welch , el algoritmo Lempel-Ziv-Welch (LZW) se convirtió rápidamente en el método de elección para la mayoría de los sistemas de compresión de propósito general. LZW se utiliza en imágenes GIF , programas como PKZIP y dispositivos de hardware como módems. [ 8 ] Los métodos LZ utilizan un modelo de compresión basado en tablas donde las entradas de la tabla se sustituyen por cadenas de datos repetidas. Para la mayoría de los métodos LZ, esta tabla se genera dinámicamente a partir de datos anteriores en la entrada. La tabla en sí a menudo está codificada en Huffman . Los códigos basados en gramática como este pueden comprimir entradas altamente repetitivas de manera extremadamente eficaz, por ejemplo, una colección de datos biológicos de la misma especie o especies muy relacionadas, una enorme colección de documentos con versiones, un archivo de internet, etc. La tarea básica de los códigos basados en gramática es construir una gramática libre de contexto a partir de una sola cadena. Otros algoritmos prácticos de compresión de gramática incluyen Sequitur y Re-Pair .
Los compresores modernos sin pérdidas más potentes utilizan modelos probabilísticos , como la predicción por coincidencia parcial . La transformada de Burrows-Wheeler también puede considerarse una forma indirecta de modelado estadístico. En un perfeccionamiento del uso directo del modelado probabilístico , las estimaciones estadísticas pueden acoplarse a un algoritmo llamado codificación aritmética . La codificación aritmética es una técnica de codificación más moderna que utiliza los cálculos matemáticos de una máquina de estados finitos para producir una cadena de bits codificados a partir de una serie de símbolos de datos de entrada. Puede lograr una compresión superior en comparación con otras técnicas, como el algoritmo de Huffman, más conocido. Utiliza un estado de memoria interna para evitar la necesidad de realizar una asignación uno a uno de símbolos de entrada individuales a representaciones distintas que utilizan un número entero de bits, y borra la memoria interna solo después de codificar toda la cadena de símbolos de datos. La codificación aritmética se aplica especialmente bien a tareas de compresión de datos adaptativa donde las estadísticas varían y dependen del contexto, ya que puede acoplarse fácilmente con un modelo adaptativo de la distribución de probabilidad de los datos de entrada. Un ejemplo temprano del uso de la codificación aritmética se encontraba en una característica opcional (pero no muy utilizada) del estándar de codificación de imágenes JPEG . [ 9 ] Desde entonces, se ha aplicado en varios otros diseños, incluidos H.263 , H.264/MPEG-4 AVC y HEVC para la codificación de vídeo. [ 10 ]
El software de archivado normalmente tiene la capacidad de ajustar el "tamaño del diccionario", donde un tamaño mayor requiere más memoria de acceso aleatorio durante la compresión y descompresión, pero comprime más fuertemente, especialmente en patrones repetitivos en el contenido de los archivos. [ 11 ] [ 12 ]
Con pérdidas

A finales de la década de 1980, las imágenes digitales se hicieron más comunes y surgieron estándares para la compresión de imágenes sin pérdida. A principios de la década de 1990, los métodos de compresión con pérdida comenzaron a usarse ampliamente. [ 13 ] En estos esquemas, se acepta cierta pérdida de información, ya que eliminar detalles no esenciales puede ahorrar espacio de almacenamiento. Existe una compensación correspondiente entre preservar la información y reducir el tamaño. Los esquemas de compresión de datos con pérdida se diseñan en base a investigaciones sobre cómo las personas perciben los datos en cuestión. Por ejemplo, el ojo humano es más sensible a las variaciones sutiles de luminancia que a las variaciones de color. La compresión de imágenes JPEG funciona en parte redondeando bits de información no esenciales. [ 14 ] Varios formatos de compresión populares explotan estas diferencias perceptivas, incluyendo la psicoacústica para el sonido y la psicovisual para imágenes y video.
La mayoría de las formas de compresión con pérdida se basan en la codificación de transformación , especialmente la transformada discreta del coseno (DCT). Fue propuesta por primera vez en 1972 por Nasir Ahmed , quien luego desarrolló un algoritmo funcional con T. Natarajan y KR Rao en 1973, antes de presentarlo en enero de 1974. [ 15 ] [ 16 ] La DCT es el método de compresión con pérdida más utilizado y se utiliza en formatos multimedia para imágenes (como JPEG y HEIF ), [ 17 ] video (como MPEG , AVC y HEVC) y audio (como MP3 , AAC y Vorbis ).
La compresión de imágenes con pérdida se utiliza en cámaras digitales para aumentar la capacidad de almacenamiento. De manera similar, los DVD , Blu-ray y el vídeo en streaming utilizan formatos de codificación de vídeo con pérdida . La compresión con pérdida se utiliza ampliamente en vídeo.
En la compresión de audio con pérdida, se utilizan métodos psicoacústicos para eliminar los componentes no audibles (o menos audibles) de la señal de audio . La compresión del habla humana se realiza a menudo con técnicas aún más especializadas; la codificación del habla se distingue como una disciplina independiente de la compresión de audio de propósito general. La codificación del habla se utiliza en la telefonía por internet , por ejemplo, y la compresión de audio se utiliza para la extracción de CD y es decodificada por los reproductores de audio.
La compresión con pérdidas puede provocar pérdida de generación .
Teoría
La base teórica de la compresión la proporciona la teoría de la información y, más específicamente, el teorema de codificación de fuentes de Shannon ; las teorías específicas del dominio incluyen la teoría de la información algorítmica para la compresión sin pérdidas y la teoría de tasa-distorsión para la compresión con pérdidas. Estas áreas de estudio fueron creadas esencialmente por Claude Shannon , quien publicó artículos fundamentales sobre el tema a finales de la década de 1940 y principios de la de 1950. Otros temas asociados con la compresión incluyen la teoría de la codificación y la inferencia estadística . [ 18 ]
Aprendizaje automático
Existe una estrecha relación entre el aprendizaje automático y la compresión. Un sistema que predice las probabilidades posteriores de una secuencia, dada su historia completa, puede utilizarse para la compresión óptima de datos (mediante la codificación aritmética de la distribución de salida). A la inversa, un compresor óptimo puede utilizarse para la predicción (encontrando el símbolo que mejor se comprime, dado el historial previo). Esta equivalencia se ha utilizado como justificación para emplear la compresión de datos como referencia para la "inteligencia general". [ 19 ] [ 20 ] [ 21 ]
Una perspectiva alternativa muestra que los algoritmos de compresión asignan implícitamente cadenas a vectores de espacio de características implícitos , y las medidas de similitud basadas en la compresión calculan la similitud dentro de estos espacios de características. Para cada compresor C(.) definimos un espacio vectorial asociado ℵ, de modo que C(.) asigna una cadena de entrada x, correspondiente a la norma vectorial ||~x||. Un examen exhaustivo de los espacios de características subyacentes a todos los algoritmos de compresión está limitado por el espacio; en su lugar, los vectores de características optan por examinar tres métodos representativos de compresión sin pérdidas: LZW, LZ77 y PPM. [ 22 ]
Según la teoría AIXI , una conexión que se explica con mayor detalle en el Premio Hutter , la mejor compresión posible de x es el software más pequeño posible que genera x. Por ejemplo, en ese modelo, el tamaño comprimido de un archivo zip incluye tanto el archivo zip como el software de descompresión, ya que no se puede descomprimir sin ambos, pero puede existir una forma combinada aún más pequeña.
Ejemplos de software de compresión de audio/video impulsado por IA incluyen NVIDIA Maxine y AIVC. [ 23 ] Ejemplos de software que pueden realizar compresión de imágenes impulsada por IA incluyen OpenCV , TensorFlow , Image Processing Toolbox (IPT) de MATLAB y High-Fidelity Generative Image Compression. [ 24 ]
En el aprendizaje automático no supervisado , el agrupamiento k-means se puede utilizar para comprimir datos agrupando puntos de datos similares en clústeres. Esta técnica simplifica el manejo de conjuntos de datos extensos que carecen de etiquetas predefinidas y se utiliza ampliamente en campos como la compresión de imágenes . [ 25 ]
La compresión de datos tiene como objetivo reducir el tamaño de los archivos de datos, mejorando la eficiencia del almacenamiento y acelerando la transmisión de datos. El algoritmo de agrupamiento K-means, un algoritmo de aprendizaje automático no supervisado, se emplea para particionar un conjunto de datos en un número específico de clústeres, k, cada uno representado por el centroide de sus puntos. Este proceso condensa conjuntos de datos extensos en un conjunto más compacto de puntos representativos. Particularmente beneficioso en el procesamiento de imágenes y señales , el agrupamiento K-means ayuda a la reducción de datos al reemplazar grupos de puntos de datos con sus centroides, preservando así la información central de los datos originales y disminuyendo significativamente el espacio de almacenamiento requerido. [ 26 ]
Los modelos de lenguaje grandes (LLM) también son compresores de datos sin pérdida eficientes en algunos conjuntos de datos, como lo demuestra la investigación de DeepMind con el modelo Chinchilla 70B. Desarrollado por DeepMind, Chinchilla 70B comprimió datos de manera efectiva, superando a métodos convencionales como Portable Network Graphics (PNG) para imágenes y Free Lossless Audio Codec (FLAC) para audio. Logró comprimir datos de imagen y audio al 43,4 % y al 16,4 % de sus tamaños originales, respectivamente. Sin embargo, existe cierta preocupación de que el conjunto de datos utilizado para las pruebas se superponga con el conjunto de datos de entrenamiento del LLM, lo que hace posible que el modelo Chinchilla 70B solo sea una herramienta de compresión eficiente en los datos con los que ya ha sido entrenado. [ 27 ] [ 28 ]
Diferenciación de datos

La compresión de datos puede considerarse un caso especial de diferenciación de datos . [ 29 ] [ 30 ] La diferenciación de datos consiste en producir una diferencia a partir de una fuente y un destino, y el parcheo reproduce el destino a partir de una fuente y una diferencia. Dado que en la compresión de datos no existe una fuente y un destino separados, se puede considerar la compresión de datos como una diferenciación de datos con datos de origen vacíos, donde el archivo comprimido corresponde a una diferencia con respecto a la nada. Esto es equivalente a considerar la entropía absoluta (correspondiente a la compresión de datos) como un caso especial de entropía relativa (correspondiente a la diferenciación de datos) sin datos iniciales.
El término compresión diferencial se utiliza para enfatizar la conexión con la diferenciación de datos.
Usos
Imagen
La codificación de entropía se originó en la década de 1940 con la introducción de la codificación de Shannon-Fano , [ 31 ] la base de la codificación de Huffman que se desarrolló en 1950. [ 32 ] La codificación de transformada se remonta a finales de la década de 1960, con la introducción de la codificación de transformada rápida de Fourier (FFT) en 1968 y la transformada de Hadamard en 1969. [ 33 ]
Una técnica importante de compresión de imágenes es la transformada discreta del coseno (DCT), una técnica desarrollada a principios de la década de 1970. [ 15 ] La DCT es la base de JPEG, un formato de compresión con pérdida que fue introducido por el Joint Photographic Experts Group (JPEG) en 1992. [ 34 ] JPEG reduce considerablemente la cantidad de datos necesarios para representar una imagen a costa de una reducción relativamente pequeña en la calidad de la imagen y se ha convertido en el formato de archivo de imagen más utilizado . [ 35 ] [ 36 ] Su algoritmo de compresión basado en DCT, altamente eficiente, fue en gran parte responsable de la amplia proliferación de imágenes y fotografías digitales . [ 37 ]
Lempel–Ziv–Welch (LZW) es un algoritmo de compresión sin pérdidas desarrollado en 1984. Se utiliza en el formato GIF , introducido en 1987. [ 38 ] DEFLATE , un algoritmo de compresión sin pérdidas especificado en 1996, se utiliza en el formato Portable Network Graphics (PNG). [ 39 ]
La compresión wavelet , el uso de wavelets en la compresión de imágenes, comenzó después del desarrollo de la codificación DCT. [ 40 ] El estándar JPEG 2000 se introdujo en 2000. [ 41 ] A diferencia del algoritmo DCT utilizado por el formato JPEG original, JPEG 2000 utiliza algoritmos de transformada wavelet discreta (DWT). [ 42 ] [ 43 ] [ 44 ] La tecnología JPEG 2000, que incluye la extensión Motion JPEG 2000 , fue seleccionada como el estándar de codificación de video para cine digital en 2004. [ 45 ]
Audio
La compresión de datos de audio, que no debe confundirse con la compresión de rango dinámico , tiene el potencial de reducir el ancho de banda de transmisión y los requisitos de almacenamiento de los datos de audio. Los algoritmos de compresión de los formatos de audio se implementan en software como códecs de audio . Tanto en la compresión con pérdida como en la compresión sin pérdida, se reduce la redundancia de información mediante métodos como la codificación , la cuantización , la DCT y la predicción lineal para reducir la cantidad de información utilizada para representar los datos sin comprimir.
Los algoritmos de compresión de audio con pérdida proporcionan una mayor compresión y se utilizan en numerosas aplicaciones de audio, incluyendo Vorbis y MP3 . Casi todos estos algoritmos se basan en la psicoacústica para eliminar o reducir la fidelidad de los sonidos menos audibles, reduciendo así el espacio necesario para almacenarlos o transmitirlos. [ 2 ] [ 46 ]
El equilibrio aceptable entre la pérdida de calidad de audio y el tamaño de transmisión o almacenamiento depende de la aplicación. Por ejemplo, un disco compacto (CD) de 640 MB contiene aproximadamente una hora de música de alta fidelidad sin comprimir, menos de dos horas de música comprimida sin pérdida o siete horas de música comprimida en formato MP3 a una tasa de bits media . Una grabadora de sonido digital suele almacenar alrededor de 200 horas de voz claramente inteligible en 640 MB. [ 47 ]
La compresión de audio sin pérdidas produce una representación de datos digitales que puede decodificarse para obtener una copia digital exacta del original. Las tasas de compresión rondan el 50-60% del tamaño original, [ 48 ] similar a las de la compresión de datos sin pérdidas genérica. Los códecs sin pérdidas utilizan el ajuste de curvas o la predicción lineal como base para estimar la señal. Los parámetros que describen la estimación y la diferencia entre la estimación y la señal real se codifican por separado. [ 49 ]
Existen varios formatos de compresión de audio sin pérdida. Consulte la lista de códecs sin pérdida para obtener más información. Algunos formatos están asociados a un sistema específico, como Direct Stream Transfer , utilizado en Super Audio CD , y Meridian Lossless Packing , utilizado en DVD-Audio , Dolby TrueHD , Blu-ray y HD DVD .
Algunos formatos de archivo de audio presentan una combinación de un formato con pérdida y una corrección sin pérdida; esto permite eliminar la corrección para obtener fácilmente un archivo con pérdida. Dichos formatos incluyen MPEG-4 SLS (Scalable to Lossless), WavPack y OptimFROG DualStream .
Cuando se procesan archivos de audio, ya sea mediante compresión adicional o para su edición , es conveniente trabajar con un original sin modificar (sin comprimir o con compresión sin pérdida). El procesamiento de un archivo con compresión con pérdida suele producir un resultado final inferior al de la creación del mismo archivo comprimido a partir de un original sin comprimir. Además de la edición o mezcla de sonido, la compresión de audio sin pérdida se utiliza a menudo para el almacenamiento de archivos o como copias maestras.
Compresión de audio con pérdida

La compresión de audio con pérdida se utiliza en una amplia gama de aplicaciones. Además de las aplicaciones independientes de solo audio, como la reproducción de archivos en reproductores MP3 o computadoras, las secuencias de audio comprimidas digitalmente se utilizan en la mayoría de los DVD de video, la televisión digital, la transmisión de contenido multimedia por Internet , la radio satelital y por cable, y cada vez más en las transmisiones de radio terrestres. La compresión con pérdida generalmente logra una compresión mucho mayor que la compresión sin pérdida, al descartar los datos menos críticos basándose en optimizaciones psicoacústicas . [ 50 ]
La psicoacústica reconoce que no todos los datos de una transmisión de audio pueden ser percibidos por el sistema auditivo humano . La mayoría de las técnicas de compresión con pérdida reducen la redundancia identificando primero los sonidos perceptualmente irrelevantes, es decir, aquellos que son muy difíciles de oír. Ejemplos típicos incluyen frecuencias altas o sonidos que ocurren simultáneamente con sonidos más fuertes. Estos sonidos irrelevantes se codifican con menor precisión o no se codifican en absoluto.
Debido a la naturaleza de los algoritmos de compresión con pérdida, la calidad del audio se ve afectada por una pérdida de generación digital al descomprimir y volver a comprimir un archivo. Esto hace que la compresión con pérdida no sea adecuada para almacenar los resultados intermedios en aplicaciones profesionales de ingeniería de audio, como la edición de sonido y la grabación multipista. Sin embargo, los formatos con pérdida, como el MP3, son muy populares entre los usuarios finales, ya que el tamaño del archivo se reduce a entre un 5 % y un 20 % del tamaño original, y un megabyte puede almacenar aproximadamente un minuto de música con una calidad adecuada.
Se han desarrollado varios algoritmos de compresión con pérdida patentados que ofrecen un rendimiento de audio de mayor calidad mediante la combinación de algoritmos con y sin pérdida, con tasas de bits adaptativas y menores índices de compresión. Algunos ejemplos son aptX , LDAC , LHDC , MQA y SCL6 .
Métodos de codificación
Para determinar qué información en una señal de audio es perceptualmente irrelevante, la mayoría de los algoritmos de compresión con pérdida utilizan transformaciones como la transformada discreta del coseno modificada (MDCT) para convertir las formas de onda muestreadas en el dominio del tiempo a un dominio de transformación, típicamente el dominio de la frecuencia . Una vez transformadas, las frecuencias componentes se pueden priorizar según su audibilidad. La audibilidad de los componentes espectrales se evalúa utilizando el umbral absoluto de audición y los principios de enmascaramiento simultáneo —el fenómeno en el que una señal es enmascarada por otra señal separada por la frecuencia— y, en algunos casos, enmascaramiento temporal —donde una señal es enmascarada por otra señal separada por el tiempo—. También se pueden utilizar contornos de igual sonoridad para ponderar la importancia perceptual de los componentes. Los modelos de la combinación oído-cerebro humanos que incorporan tales efectos se denominan a menudo modelos psicoacústicos . [ 51 ]
Otros tipos de compresores con pérdida, como la codificación predictiva lineal (LPC) utilizada con el habla, son codificadores basados en la fuente. La LPC utiliza un modelo del tracto vocal humano para analizar los sonidos del habla e inferir los parámetros que el modelo utiliza para producirlos momento a momento. Estos parámetros cambiantes se transmiten o almacenan y se utilizan para controlar otro modelo en el decodificador, que reproduce el sonido.
Los formatos con pérdida se utilizan a menudo para la distribución de audio en streaming o comunicación interactiva (como en las redes de telefonía móvil). En estas aplicaciones, los datos deben descomprimirse a medida que fluyen, en lugar de después de que se haya transmitido todo el flujo de datos. No todos los códecs de audio pueden utilizarse para aplicaciones de streaming. [ 50 ]
La latencia se introduce por los métodos utilizados para codificar y decodificar los datos. Algunos códecs analizan un segmento más largo, llamado trama , de los datos para optimizar la eficiencia, y luego lo codifican de manera que se requiere un segmento mayor de datos para decodificarlo. La latencia inherente del algoritmo de codificación puede ser crítica; por ejemplo, en una transmisión bidireccional de datos, como en una conversación telefónica, los retrasos significativos pueden degradar seriamente la calidad percibida.
A diferencia de la velocidad de compresión, que es proporcional al número de operaciones que requiere el algoritmo, aquí la latencia se refiere al número de muestras que deben analizarse antes de procesar un bloque de audio. En el caso mínimo, la latencia es de cero muestras (por ejemplo, si el codificador/decodificador simplemente reduce el número de bits utilizados para cuantificar la señal). Los algoritmos en el dominio del tiempo, como LPC, también suelen tener latencias bajas, de ahí su popularidad en la codificación de voz para telefonía. Sin embargo, en algoritmos como MP3, se debe analizar un gran número de muestras para implementar un modelo psicoacústico en el dominio de la frecuencia, y la latencia es del orden de 23 ms.
Codificación de voz
La codificación de voz es una categoría importante de compresión de datos de audio. Los modelos perceptivos que se utilizan para estimar qué aspectos del habla puede oír el oído humano suelen ser algo diferentes de los que se utilizan para la música. El rango de frecuencias necesario para transmitir los sonidos de la voz humana es normalmente mucho más estrecho que el necesario para la música, y el sonido suele ser menos complejo. Como resultado, la voz se puede codificar con alta calidad utilizando una tasa de bits relativamente baja.
Esto se logra, en general, mediante una combinación de dos enfoques:
- Solo se codifican los sonidos que podrían ser producidos por una sola voz humana.
- Descartar una mayor cantidad de datos en la señal, conservando solo lo suficiente para reconstruir una voz "inteligible" en lugar de todo el rango de frecuencias del oído humano .
Los primeros algoritmos utilizados en la codificación de voz (y en la compresión de datos de audio en general) fueron el algoritmo de la ley A y el algoritmo de la ley μ .
Historia

Las primeras investigaciones de audio se llevaron a cabo en los Laboratorios Bell . Allí, en 1950, C. Chapin Cutler presentó la patente de la modulación diferencial por codificación de pulsos (DPCM). [ 52 ] En 1973, P. Cummiskey, Nikil S. Jayant y James L. Flanagan introdujeron la DPCM adaptativa (ADPCM) . [ 53 ] [ 54 ]
La codificación perceptual se utilizó por primera vez para la compresión de codificación de voz , con codificación predictiva lineal (LPC). [ 55 ] Los conceptos iniciales para LPC se remontan al trabajo de Fumitada Itakura ( Universidad de Nagoya ) y Shuzo Saito ( Nippon Telegraph and Telephone ) en 1966. [ 56 ] Durante la década de 1970, Bishnu S. Atal y Manfred R. Schroeder en Bell Labs desarrollaron una forma de LPC llamada codificación predictiva adaptativa (APC), un algoritmo de codificación perceptual que explotaba las propiedades de enmascaramiento del oído humano, seguido a principios de la década de 1980 por el algoritmo de predicción lineal excitada por código (CELP) que logró una relación de compresión significativa para su tiempo. [ 55 ] La codificación perceptual es utilizada por formatos modernos de compresión de audio como MP3 [ 55 ] y AAC .
La transformada discreta del coseno (DCT), desarrollada por Nasir Ahmed , T. Natarajan y KR Rao en 1974, [ 16 ] proporcionó la base para la transformada discreta del coseno modificada (MDCT) utilizada por formatos de compresión de audio modernos como MP3, [ 57 ] Dolby Digital , [ 58 ] [ 59 ] y AAC. [ 60 ] La MDCT fue propuesta por JP Princen, AW Johnson y AB Bradley en 1987, [ 61 ] siguiendo el trabajo anterior de Princen y Bradley en 1986. [ 62 ]
El primer sistema comercial de compresión de audio para automatización de transmisiones del mundo fue desarrollado por Oscar Bonello, profesor de ingeniería en la Universidad de Buenos Aires . [ 63 ] Este sistema de automatización de transmisiones se lanzó en 1987 con el nombre de Audicom . [ 64 ] [ 65 ]
En febrero de 1988, se publicó en la revista Journal on Selected Areas in Communications ( JSAC ) del IEEE un compendio bibliográfico sobre una gran variedad de sistemas de codificación de audio . Si bien existían algunos artículos anteriores, esta colección documentaba una amplia gama de codificadores de audio terminados y funcionales, casi todos ellos utilizando técnicas perceptivas y algún tipo de análisis de frecuencia y codificación sin ruido en la etapa final. [ 66 ]
Video
El vídeo sin comprimir requiere una tasa de datos muy alta . Aunque los códecs de compresión de vídeo sin pérdidas funcionan con un factor de compresión de 5 a 12, un vídeo típico con compresión con pérdidas H.264 tiene un factor de compresión de entre 20 y 200. [ 67 ]
Las dos técnicas clave de compresión de vídeo utilizadas en los estándares de codificación de vídeo son la DCT y la compensación de movimiento (MC). La mayoría de los estándares de codificación de vídeo, como los formatos H.26x y MPEG , suelen utilizar la codificación de vídeo DCT con compensación de movimiento (compensación de movimiento por bloques). [ 68 ] [ 69 ]
La mayoría de los códecs de vídeo se utilizan junto con técnicas de compresión de audio para almacenar los flujos de datos separados pero complementarios como un paquete combinado utilizando los llamados formatos contenedores . [ 70 ]
Teoría de la codificación
Los datos de vídeo pueden representarse como una serie de fotogramas fijos. Estos datos suelen contener una gran cantidad de redundancia espacial y temporal . Los algoritmos de compresión de vídeo intentan reducir la redundancia y almacenar la información de forma más compacta.
La mayoría de los formatos y códecs de compresión de vídeo aprovechan la redundancia espacial y temporal (por ejemplo, mediante codificación de diferencias con compensación de movimiento ). Las similitudes se pueden codificar almacenando únicamente las diferencias entre, por ejemplo, fotogramas temporalmente adyacentes (codificación entre fotogramas) o píxeles espacialmente adyacentes (codificación dentro del fotograma). La compresión entre fotogramas (una codificación delta temporal ) (re)utiliza datos de uno o más fotogramas anteriores o posteriores en una secuencia para describir el fotograma actual. La codificación dentro del fotograma , por otro lado, utiliza únicamente datos dentro del fotograma actual, siendo en la práctica una compresión de imagen fija. [ 51 ]
Los formatos de codificación de vídeo intra-fotograma utilizados en videocámaras y edición de vídeo emplean una compresión más sencilla que solo utiliza predicción intra-fotograma. Esto simplifica el software de edición de vídeo, ya que evita que un fotograma comprimido haga referencia a datos que el editor haya eliminado.
Por lo general, la compresión de video emplea además técnicas de compresión con pérdida, como la cuantización , que reducen aspectos de los datos de origen que son (más o menos) irrelevantes para la percepción visual humana, explotando características perceptivas de la visión humana. Por ejemplo, las pequeñas diferencias de color son más difíciles de percibir que los cambios de brillo. Los algoritmos de compresión pueden promediar un color en estas áreas similares de manera similar a los utilizados en la compresión de imágenes JPEG. [ 9 ] Como en toda compresión con pérdida, existe una compensación entre la calidad del video y la tasa de bits , el costo del procesamiento de la compresión y descompresión, y los requisitos del sistema. El video altamente comprimido puede presentar artefactos visibles o que distraigan .
Otros métodos, además de los formatos de transformación basados en DCT, como la compresión fractal , la búsqueda de coincidencias y el uso de la transformada discreta de ondículas (DWT), han sido objeto de investigación, pero generalmente no se utilizan en productos prácticos. La compresión de ondículas se utiliza en codificadores de imágenes fijas y de vídeo sin compensación de movimiento. El interés en la compresión fractal parece estar disminuyendo, debido a análisis teóricos recientes que muestran una relativa falta de eficacia de dichos métodos. [ 51 ]
Codificación entre fotogramas
En la codificación entre fotogramas, los fotogramas individuales de una secuencia de vídeo se comparan entre sí, y el códec de compresión de vídeo registra las diferencias con respecto al fotograma de referencia. Si el fotograma contiene áreas donde no se ha producido ningún movimiento, el sistema puede simplemente emitir un comando corto que copia esa parte del fotograma anterior en el siguiente. Si las secciones del fotograma se mueven de forma sencilla, el compresor puede emitir un comando (ligeramente más largo) que indica al descompresor que desplace, rote, aclare u oscurezca la copia. Este comando más largo sigue siendo mucho más corto que los datos generados por la compresión intra-fotograma. Normalmente, el codificador también transmite una señal residual que describe las diferencias restantes, más sutiles, con respecto a la imagen de referencia. Mediante la codificación entrópica, estas señales residuales tienen una representación más compacta que la señal completa. En áreas de vídeo con mayor movimiento, la compresión debe codificar más datos para seguir el ritmo del mayor número de píxeles que cambian. Por lo general, los detalles de alta frecuencia de explosiones, llamas, bandadas de animales y algunos planos panorámicos provocarán disminuciones en la calidad o aumentos en la tasa de bits variable .
Formatos de transformación híbridos basados en bloques

Muchos métodos de compresión de vídeo de uso común (por ejemplo, los incluidos en los estándares aprobados por la UIT-T o la ISO ) comparten la misma arquitectura básica que se remonta al estándar H.261 , estandarizado en 1988 por la UIT-T. Estos métodos se basan principalmente en la DCT, aplicada a bloques rectangulares de píxeles vecinos, y en la predicción temporal mediante vectores de movimiento , así como, en la actualidad, también en un paso de filtrado dentro del bucle.
En la etapa de predicción, se aplican diversas técnicas de deduplicación y codificación diferencial que ayudan a descorrelacionar los datos y a describir nuevos datos basándose en los datos ya transmitidos.
A continuación, los bloques rectangulares de datos de píxeles restantes se transforman al dominio de la frecuencia. En la etapa principal de procesamiento con pérdida, los datos del dominio de la frecuencia se cuantifican para reducir la información irrelevante para la percepción visual humana.
En la última etapa, la redundancia estadística se elimina en gran medida mediante un codificador de entropía , que a menudo aplica algún tipo de codificación aritmética.
En una etapa adicional de filtrado dentro del bucle, se pueden aplicar diversos filtros a la señal de imagen reconstruida. Al calcular estos filtros también dentro del bucle de codificación, se facilita la compresión, ya que se pueden aplicar al material de referencia antes de que se utilice en el proceso de predicción y se pueden guiar mediante la señal original. El ejemplo más común son los filtros de eliminación de artefactos de bloqueo , que difuminan los artefactos de bloqueo producidos por discontinuidades de cuantificación en los límites de los bloques de transformación.
Historia
En 1967, AH Robinson y C. Cherry propusieron un esquema de compresión de ancho de banda de codificación de longitud de ejecución para la transmisión de señales de televisión analógicas. [ 71 ] La DCT, que es fundamental para la compresión de vídeo moderna, [ 72 ] fue introducida por Nasir Ahmed , T. Natarajan y KR Rao en 1974. [ 16 ] [ 73 ]
H.261 , que debutó en 1988, introdujo comercialmente la arquitectura básica predominante de la tecnología de compresión de video. [ 74 ] Fue el primer formato de codificación de video basado en la compresión DCT. [ 72 ] H.261 fue desarrollado por varias compañías, incluidas Hitachi , PictureTel , NTT , BT y Toshiba . [ 75 ]
Los estándares de codificación de vídeo más populares utilizados para códecs han sido los estándares MPEG . MPEG-1 fue desarrollado por el Motion Picture Experts Group (MPEG) en 1991 y fue diseñado para comprimir vídeo con calidad VHS . Fue sucedido en 1994 por MPEG-2 / H.262 , [ 74 ] que fue desarrollado por varias compañías, principalmente Sony , Thomson y Mitsubishi Electric . [ 76 ] MPEG-2 se convirtió en el formato de vídeo estándar para DVD y televisión digital SD . [ 74 ] En 1999, fue seguido por MPEG-4 / H.263 . [ 74 ] También fue desarrollado por varias compañías, principalmente Mitsubishi Electric, Hitachi y Panasonic . [ 77 ]
H.264/MPEG-4 AVC fue desarrollado en 2003 por varias organizaciones, principalmente Panasonic, Godo Kaisha IP Bridge y LG Electronics . [ 78 ] AVC introdujo comercialmente los modernos algoritmos de codificación aritmética binaria adaptativa al contexto (CABAC) y codificación de longitud variable adaptativa al contexto (CAVLC). AVC es el principal estándar de codificación de vídeo para discos Blu-ray y es ampliamente utilizado por sitios web de intercambio de vídeos y servicios de transmisión por internet como YouTube , Netflix , Vimeo e iTunes Store , software web como Adobe Flash Player y Microsoft Silverlight , y diversas transmisiones de HDTV por televisión terrestre y por satélite. [ 79 ]
Genética
Los algoritmos de compresión genética son la última generación de algoritmos sin pérdida que comprimen datos (típicamente secuencias de nucleótidos) utilizando tanto algoritmos de compresión convencionales como algoritmos genéticos adaptados al tipo de datos específico. En 2012, un equipo de científicos de la Universidad Johns Hopkins publicó un algoritmo de compresión genética que no utiliza un genoma de referencia para la compresión. HAPZIPPER fue diseñado para los datos de HapMap y logra una compresión de más de 20 veces (reducción del 95 % en el tamaño del archivo), proporcionando una compresión de 2 a 4 veces mejor y siendo menos intensivo computacionalmente que las principales utilidades de compresión de propósito general. Para ello, Chanda, Elhaik y Bader introdujeron la codificación basada en MAF (MAFE), que reduce la heterogeneidad del conjunto de datos ordenando los SNP por su frecuencia alélica menor, homogeneizando así el conjunto de datos. [ 80 ] Otros algoritmos desarrollados en 2009 y 2013 (DNAZip y GenomeZip) tienen índices de compresión de hasta 1200 veces, lo que permite almacenar 6 mil millones de genomas humanos diploides de pares de bases en 2,5 megabytes (en relación con un genoma de referencia o promediado sobre muchos genomas). [ 81 ] [ 82 ] Para una evaluación comparativa de compresores de datos genéticos/genómicos, véase [ 83 ]
Perspectivas y potencial actualmente sin utilizar
Se estima que la cantidad total de datos almacenados en los dispositivos de almacenamiento del mundo podría comprimirse aún más con los algoritmos de compresión existentes en un factor promedio restante de 4,5:1. [ 84 ] Se estima que la capacidad tecnológica combinada del mundo para almacenar información proporciona 1300 exabytes de dígitos de hardware en 2007, pero cuando el contenido correspondiente se comprime de forma óptima, esto solo representa 295 exabytes de información de Shannon . [ 85 ]
algoritmos de compresión de datos
Sin pérdidas
- 842
- Codificación adaptativa
- Codificación adaptativa de Huffman
- Algoritmo BSTW
- Codificación aritmética
- Sistemas numéricos asimétricos
- Brotli
- Transformación Burrows-Wheeler
- Codificación de pares de bytes
- bzip2
- Código canónico de Huffman
- Código de cadena
- Mezcla de contexto
- Ponderación del árbol de contexto
- Desinflar
- Codificación delta
- Codificador de diccionario
- Compresión dinámica de Markov
- Codificación gamma de Elias
- Codificación exponencial-Golomb
- FELICS
- Codificación de Fibonacci
- Codificación en Golomb
- Código basado en gramática
- Codificación de Huffman
- Codificación incremental
- Lempel–Ziv–Oberhumer
- LZS
- LZSS
- LZW
- Codificación de Levenshtein
- LZ4
- LZ77 y LZ78
- LZFSE
- LZMA
- LZRW
- LZWL
- LZX
- Codificación de Huffman modificada
- Transformación de movimiento al frente
- Codificación de Negafibonacci
- PackBits
- PAQ
- Predicción mediante coincidencia parcial
- Codificación de rango
- Reparar
- Indexación recursiva
- Codificación de arroz
- Codificación de longitud de ejecución
- Algoritmo de secuencia
- Codificación de Shannon
- Codificación de Shannon-Fano
- Codificación de Shannon-Fano-Elias
- Rápido
- Codificación binaria truncada
- Codificación de Tunstall
- Codificación unaria
- Código universal
- Zopfli
- Estándar Z
Con pérdidas
- 3Dc
- Algoritmo de ley A
- Modulación por impulsos codificados diferencial adaptativa
- Compresión de texturas escalable y adaptativa
- Predicción lineal excitada por código algebraico
- Codificación por truncamiento de bloques
- Predicción lineal excitada por código
- Compresión de celdas de color
- Modulación delta
- Modulación diferencial por codificación de impulsos
- Transformada discreta del coseno
- Transformada discreta del seno
- Transformada discreta de ondículas
- Árboles cero incrustados de transformadas wavelet
- Compresión fractal
- Transformación superpuesta
- pares espectrales de líneas
- Codificación predictiva lineal
- relación de área logarítmica
- Transformada discreta del coseno modificada
- Algoritmo de ley Mu
- Estéreo paramétrico
- Pirámide laplaciana
- Cuantización vectorial piramidal
- S2TC
- Compresión de texturas S3
- Particionamiento de conjuntos en árboles jerárquicos
- Codificación de subbandas
- Codificación de transformación
- TurboQuant
- Cuantización vectorial
- compresión wavelet
- Cuantización escalar de ondículas
- Codificación predictiva lineal distorsionada
Véase también
Referencias
- ^ Wade, Graham (1994). Codificación y procesamiento de señales (2.ª ed.). Cambridge University Press. pág. 34. ISBN 978-0-521-42336-6. Consultado el 22/12/2011 .
El objetivo general de la codificación de fuente es explotar o eliminar la redundancia "ineficiente" en la fuente PCM y, por lo tanto, lograr una reducción en la tasa de fuente general R.
- ^ a b Mahdi, OA; Mohammed, MA; Mohamed, AJ (noviembre de 2012). "Implementación de un enfoque novedoso para convertir la compresión de audio en codificación de texto mediante una técnica híbrida" (PDF) . International Journal of Computer Science Issues . 9 (6, n.º 3): 53–59 . Archivado (PDF) del original el 20 de marzo de 2013. Recuperado el 6 de marzo de 2013 .
- ^ Pujar, JH; Kadlaskar, LM (mayo de 2010). "Un nuevo método sin pérdidas de compresión y descompresión de imágenes mediante técnicas de codificación Huffman" (PDF) . Journal of Theoretical and Applied Information Technology . 15 (1): 18–23 . Archivado (PDF) del original el 24 de mayo de 2010.
- ^ Salomon, David (2008). Una introducción concisa a la compresión de datos . Berlín: Springer. ISBN 9781848000728.
- ^ Tank, MK (2011). "Implementación del algoritmo Lempel-ZIV para compresión sin pérdidas usando VHDL". Thinkquest 2010: Actas de la Primera Conferencia Internacional sobre Contornos de la Tecnología Informática . Berlín: Springer. pp. 275–283 . doi : 10.1007/978-81-8489-989-4_51 . ISBN 978-81-8489-988-7.
- ^ Navqi, Saud; Naqvi, R.; Riaz, RA; Siddiqui, F. (abril de 2011). "Diseño e implementación RTL optimizados del algoritmo LZW para aplicaciones de alto ancho de banda" (PDF) . Electrical Review . 2011 (4): 279–285 . Archivado (PDF) del original el 20 de mayo de 2013.
- ^ Gestión de documentos - Formato de documento portátil - Parte 1: PDF 1.7 (1.ª ed.). Adobe Systems Incorporated. 1 de julio de 2008.
- ^ Stephen, Wolfram (2002). Un nuevo tipo de ciencia . Champaign, IL: Wolfram Media. pág. 1069. ISBN 1-57955-008-8Archivado del original el 31/07/2021 . Consultado el 01/03/2021 .
- ^ a b Lane, Tom. "Preguntas frecuentes sobre compresión de imágenes JPEG, parte 1" . Archivos de preguntas frecuentes de Internet . Grupo JPEG independiente. Archivado del original el 10 de noviembre de 2010. Recuperado el 6 de marzo de 2013 .
- ^ Sullivan, GJ ; J.-R. Ohm; W.-J. Han; T. Wiegand (diciembre de 2012). "Descripción general del estándar de codificación de vídeo de alta eficiencia (HEVC)". IEEE Transactions on Circuits and Systems for Video Technology . 22 (12). IEEE : 1649–1668 . Bibcode : 2012ITCSV..22.1649S . doi : 10.1109/TCSVT.2012.2221191 . S2CID 64404 .
- ^ "Cómo elegir la configuración de archivado óptima – WinRAR" . Archivado del original el 15/08/2021 . Consultado el 07/11/2021 .
- ^ "(Establecer método de compresión) interruptor – 7zip" . Archivado del original el 09-04-2022 . Recuperado el 07-11-2021 .
- ^ Wolfram , Stephen (2002). Un nuevo tipo de ciencia . Wolfram Media, Inc. pág. 1069. ISBN 978-1-57955-008-0.
- ^ Arcangel, Cory. "Sobre la compresión" (PDF) . Archivado (PDF) del original el 28 de julio de 2013. Recuperado el 6 de marzo de 2013 .
- ^ a b Ahmed, Nasir (enero de 1991). "Cómo desarrollé la transformada discreta del coseno" . Procesamiento de señales digitales . 1 (1): 4– 5. Bibcode : 1991DSP.....1....4A . doi : 10.1016/1051-2004(91)90086-Z . Archivado del original el 10 de junio de 2016. Consultado el 20 de septiembre de 2019 .
- ^ a b c Nasir Ahmed ; T. Natarajan; Kamisetty Ramamohan Rao (enero de 1974). "Transformada discreta del coseno" (PDF) . IEEE Transactions on Computers . C-23 (1): 90–93 . Bibcode : 1974ITCmp.100...90A . doi : 10.1109/TC.1974.223784 . S2CID 149806273. Archivado (PDF) del original el 8 de diciembre de 2016 .
- ^ CCITT Study Group VIII und die Joint Photographic Experts Group (JPEG) von ISO/IEC Joint Technical Committee 1/Subcommittee 29/Working Group 10 (1993), "Anexo D – Codificación aritmética", Recomendación T.81: Compresión digital y codificación de imágenes fijas de tono continuo – Requisitos y directrices (PDF) , págs. 54 y siguientes, archivado (PDF) del original el 30-12-2019 , recuperado el 07-11-2009
- ^ Marak, Laszlo. "Sobre la compresión de imágenes" (PDF) . Universidad de Marne la Vallée. Archivado del original (PDF) el 28 de mayo de 2015. Recuperado el 6 de marzo de 2013 .
- ^ Mahoney, Matt. "Fundamentos de una prueba de rendimiento para la compresión de textos grandes" . Instituto Tecnológico de Florida. Archivado del original el 18 de agosto de 2006. Consultado el 5 de marzo de 2013 .
- ^ Shmilovici A.; Kahiri Y.; Ben-Gal I.; Hauser S. (2009). "Medición de la eficiencia del mercado Forex intradía con un algoritmo universal de compresión de datos" ( PDF) . Economía Computacional . 33 (2): 131– 154. CiteSeerX 10.1.1.627.3751 . doi : 10.1007/s10614-008-9153-3 . S2CID 17234503. Archivado (PDF) del original el 9 de julio de 2009.
- ^ Ben-Gal, I. (2008). "Sobre el uso de medidas de compresión de datos para analizar diseños robustos" (PDF) . IEEE Transactions on Reliability . 54 (3): 381– 388. doi : 10.1109/TR.2005.853280 . S2CID 9376086. Archivado del original (PDF) el 26 de septiembre de 2020. Recuperado el 6 de abril de 2016 .
- ^ D. Scully; Carla E. Brodley (2006). "Compresión y aprendizaje automático: una nueva perspectiva sobre los vectores del espacio de características". Conferencia de compresión de datos (DCC'06) . pág. 332. doi : 10.1109/DCC.2006.13 . ISBN 0-7695-2545-8. S2CID 12311412 .
- ^ Gary Adcock (5 de enero de 2023). "¿Qué es la compresión de vídeo por IA?" . massive.io . Archivado del original el 6 de abril de 2023 . Consultado el 6 de abril de 2023 .
- ^ Mentzer, Fabián; Toderici, George; Tschannen, Michael; Agustsson, Eirikur (2020). "Compresión de imágenes generativas de alta fidelidad". arXiv : 2006.09965 [ eess.IV ].
- ^ "¿Qué es el aprendizaje no supervisado? | IBM" . www.ibm.com . 23 de septiembre de 2021. Archivado del original el 5 de febrero de 2024. Consultado el 5 de febrero de 2024 .
- ^ "Agrupamiento con privacidad diferencial para conjuntos de datos a gran escala" . blog.research.google . 25 de mayo de 2023. Archivado del original el 16 de marzo de 2024. Consultado el 16 de marzo de 2024 .
- ^ Edwards, Benj (28-09-2023). "Los modelos de lenguaje de IA pueden superar a PNG y FLAC en compresión sin pérdidas, dice un estudio" . Ars Technica . Archivado del original el 07-03-2024 . Recuperado el 07-03-2024 .
- ^ Delétang, Grégoire; Ruoss, Anian; Duquenne, Paul-Ambroise; Catt, Elliot; Genewein, Tim; Materna, Christopher; Grau-Moya, Jordi; Li Kevin Wenliang; Aitchison, Mateo; Orseau, Laurent; Hutter, Marco; Veness, Joel (2023). "El modelado del lenguaje es compresión". arXiv : 2309.10668 [ cs.LG ].
- ^ Korn, D.; et al. (julio de 2002). "RFC 3284: El formato genérico de datos de diferenciación y compresión VCDIFF" . Grupo de trabajo de ingeniería de Internet. Archivado del original el 2 de mayo de 2019. Recuperado el 5 de marzo de 2013 .
- ^ Korn, DG; Vo, KP (1995). B. Krishnamurthy (ed.). Vdelta: Diferenciación y compresión . Software práctico y reutilizable para Unix. Nueva York: John Wiley & Sons, Inc.
- ^ Claude Elwood Shannon (1948). Alcatel-Lucent (ed.). "Una teoría matemática de la comunicación" (PDF) . Bell System Technical Journal . 27 ( 3–4 ): 379–423 , 623–656 . Bibcode : 1948BSTJ...27..379S . doi : 10.1002/j.1538-7305.1948.tb01338.x . hdl : 11858/00-001M-0000-002C-4314-2 . Archivado (PDF) del original el 24-05-2011 . Recuperado el 21-04-2019 .
- ^ David Albert Huffman (septiembre de 1952), "Un método para la construcción de códigos de redundancia mínima" (PDF) , Actas del IRE , vol. 40, n.º 9, págs. 1098–1101 , Bibcode : 1952PIRE...40.1098H , doi : 10.1109/JRPROC.1952.273898 , archivado (PDF) del original el 8 de octubre de 2005
- ^ Pratt, WK; Kane, J.; Andrews, HC (1969). "Codificación de imágenes mediante la transformada de Hadamard". Actas del IEEE . 57 (1): 58– 68. Bibcode : 1969IEEEP..57...58P . doi : 10.1109/PROC.1969.6869 .
- ^ "T.81 – COMPRESIÓN Y CODIFICACIÓN DIGITAL DE IMÁGENES FIJAS DE TONO CONTINUO – REQUISITOS Y DIRECTRICES" (PDF) . CCITT . Septiembre de 1992. Archivado (PDF) del original el 30 de diciembre de 2019. Recuperado el 12 de julio de 2019 .
- ^ "Explicación del formato de imagen JPEG" . BT.com . Grupo BT . 31 de mayo de 2018. Archivado del original el 5 de agosto de 2019. Consultado el 5 de agosto de 2019 .
- ^ Baraniuk, Chris (15 de octubre de 2015). "Las protecciones contra copia podrían llegar a los JPEG" . BBC News . BBC . Archivado del original el 9 de octubre de 2019. Recuperado el 13 de septiembre de 2019 .
- ^ Caplan, Paul (24 de septiembre de 2013). "¿Qué es un JPEG? El objeto invisible que ves todos los días" . The Atlantic . Archivado del original el 9 de octubre de 2019. Recuperado el 13 de septiembre de 2019 .
- ^ "La controversia de los GIF: la perspectiva de un desarrollador de software" . 27 de enero de 1995. Archivado del original el 23 de agosto de 2016. Consultado el 26 de mayo de 2015 .
- ^ Deutsch, L. Peter (mayo de 1996). Especificación del formato de datos comprimidos DEFLATE versión 1.3 . IETF . pág. 1. sec. Resumen. doi : 10.17487/RFC1951 . RFC 1951. Recuperado el 23 de abril de 2014 .
- ^ Hoffman, Roy (2012). Compresión de datos en sistemas digitales . Springer Science & Business Media . pág. 124. ISBN 9781461560319Básicamente ,
la codificación wavelet es una variante de la codificación de transformación basada en DCT que reduce o elimina algunas de sus limitaciones. (...) Otra ventaja es que, en lugar de trabajar con bloques de píxeles de 8 × 8, como hacen JPEG y otras técnicas DCT basadas en bloques, la codificación wavelet puede comprimir simultáneamente toda la imagen.
- ^ Taubman, David; Marcellin, Michael (2012). Fundamentos, estándares y práctica de la compresión de imágenes JPEG2000: Fundamentos, estándares y práctica de la compresión de imágenes . Springer Science & Business Media . ISBN 9781461507994.
- ^ Unser, M.; Blu, T. (2003). "Propiedades matemáticas de los filtros wavelet JPEG2000" . IEEE Transactions on Image Processing . 12 (9): 1080– 1090. Bibcode : 2003ITIP...12.1080U . doi : 10.1109/TIP.2003.812329 . PMID 18237979. S2CID 2765169. Archivado del original el 27 de junio de 2020. Recuperado el 6 de junio de 2020 .
- ^ Sullivan, Gary (8–12 de diciembre de 2003). "Características generales y consideraciones de diseño para la codificación de vídeo de subbanda temporal" . ITU-T . Grupo de Expertos en Codificación de Vídeo . Archivado del original el 6 de marzo de 2023. Recuperado el 13 de septiembre de 2019 .
- ^ Bovik, Alan C. (2009). La guía esencial para el procesamiento de vídeo . Academic Press . pág. 355. ISBN 9780080922508.
- ^ Swartz, Charles S. (2005). Comprensión del cine digital: Manual profesional . Taylor & Francis . pág. 147. ISBN 9780240806174.
- ^ Cunningham, Stuart; McGregor, Iain (2019). "Evaluación subjetiva de música comprimida con el códec ACER en comparación con AAC, MP3 y PCM sin comprimir" . International Journal of Digital Multimedia Broadcasting . 2019 : 1–16 . doi : 10.1155/2019/8265301 .
- ^ Según su manual, la grabadora de voz digital Olympus WS-120 puede almacenar aproximadamente 178 horas de audio con calidad de voz en formato .WMA en 500 MB de memoria flash.
- ^ Coalson, Josh. "Comparación de FLAC" . Archivado del original el 15 de agosto de 2020. Recuperado el 23 de agosto de 2020 .
- ^ "Descripción general del formato" . Archivado del original el 21 de febrero de 2020. Consultado el 23 de agosto de 2020 .
- ^ Jaiswal , RC (2009). Ingeniería Audio-Video . Pune, Maharashtra: Nirali Prakashan. pag. 3.41. ISBN 9788190639675.
- ^ a b c Faxin Yu; Hao Luo; Zheming Lu (2010). Análisis y procesamiento de modelos tridimensionales . Berlín: Springer. pág . 47. ISBN 9783642126512.
- ^ Patente estadounidense 2605361 , C. Chapin Cutler, "Cuantización diferencial de señales de comunicación", emitida el 29 de julio de 1952.
- ^ Cummiskey, P.; Jayant, NS; Flanagan, JL (1973). "Cuantización adaptativa en la codificación PCM diferencial del habla". Bell System Technical Journal . 52 (7): 1105– 1118. Bibcode : 1973BSTJ...52.1105C . doi : 10.1002/j.1538-7305.1973.tb02007.x .
- ^ Cummiskey, P.; Jayant, Nikil S.; Flanagan, JL (1973). "Cuantización adaptativa en la codificación diferencial PCM del habla". The Bell System Technical Journal . 52 (7): 1105– 1118. Bibcode : 1973BSTJ...52.1105C . doi : 10.1002/j.1538-7305.1973.tb02007.x . ISSN 0005-8580 .
- ^ a b c Schroeder, Manfred R. (2014). "Bell Laboratories" . Acústica, información y comunicación: volumen conmemorativo en honor a Manfred R. Schroeder . Springer. pág. 388. ISBN 9783319056609.
- ^ Gray, Robert M. (2010). "Una historia del habla digital en tiempo real en redes de paquetes: Parte II de la codificación predictiva lineal y el protocolo de Internet" (PDF) . Found. Trends Signal Process . 3 (4): 203– 303. doi : 10.1561/2000000036 . ISSN 1932-8346 . Archivado (PDF) del original el 4 de julio de 2010.
- ^ Guckert, John (Primavera de 2012). "El uso de FFT y MDCT en la compresión de audio MP3" (PDF) . Universidad de Utah . Archivado (PDF) del original el 24 de enero de 2014. Recuperado el 14 de julio de 2019 .
- ^ Luo, Fa-Long (2008). Estándares de radiodifusión multimedia móvil: tecnología y práctica . Springer Science & Business Media . pág. 590. ISBN 9780387782638.
- ^ Britanak, V. (2011). "Sobre las propiedades, relaciones e implementación simplificada de bancos de filtros en los estándares de codificación de audio Dolby Digital (Plus) AC-3". IEEE Transactions on Audio, Speech, and Language Processing . 19 (5): 1231– 1241. Bibcode : 2011ITASL..19.1231B . doi : 10.1109/TASL.2010.2087755 . S2CID 897622 .
- ^ Brandenburg, Karlheinz (1999). "MP3 y CAA explicados" (PDF) . Archivado (PDF) del original el 13 de febrero de 2017.
- ^ Princen, J.; Johnson, A.; Bradley, A. (1987). "Codificación de subbanda/transformación utilizando diseños de bancos de filtros basados en la cancelación de aliasing en el dominio del tiempo". ICASSP '87. Conferencia Internacional IEEE sobre Acústica, Habla y Procesamiento de Señales . Vol. 12. pp. 2161– 2164. doi : 10.1109/ICASSP.1987.1169405 . S2CID 58446992 .
- ^ Princen, J.; Bradley, A. (1986). "Diseño de banco de filtros de análisis/síntesis basado en la cancelación de aliasing en el dominio del tiempo". IEEE Transactions on Acoustics, Speech, and Signal Processing . 34 (5): 1153– 1161. Bibcode : 1986ITASS..34.1153P . doi : 10.1109/TASSP.1986.1164954 .
- ^ "Ricardo Sametband, Diario La Nación "Historia de un pionero en audio digital"" (en español). Archivado del original el 4 de junio de 2023. Recuperado el 3 de junio de 2023 .
- ^ "Resumen de algunas de las contribuciones de Solidyne a la ingeniería de radiodifusión" . Breve historia de Solidyne . Buenos Aires: Solidyne. Archivado del original el 8 de marzo de 2013. Recuperado el 6 de marzo de 2013 .
- ^ "Anuncio del Audicom, AES Journal, julio-agosto de 1992, vol. 40, n.° 7/8, pág. 647" . Archivado del original el 3 de junio de 2023. Consultado el 3 de junio de 2023 .
- ^ "Posibilidades de compresión de archivos" . Una breve guía para comprimir un archivo de 4 maneras diferentes . 17 de febrero de 2017. Archivado del original el 13 de marzo de 2018. Consultado el 13 de marzo de 2018 .
- ^ Vatolin, Dmitriy; et al. (Graphics & Media Lab Video Group) (marzo de 2007). Comparación de códecs de vídeo sin pérdidas '2007 (PDF) (Informe). Universidad Estatal de Moscú. Archivado (PDF) del original el 15 de mayo de 2008.
- ^ Chen, Jie; Koc, Ut-Va; Liu, KJ Ray (2001). Diseño de sistemas de codificación de vídeo digital: un enfoque completo del dominio comprimido . CRC Press . pág. 71. ISBN 9780203904183.
- ^ Li, Jian Ping (2006). Actas de la Conferencia Internacional de Computación 2006 sobre Tecnología de Medios Activos Wavelet y Procesamiento de la Información: Chongqing, China, 29-31 de agosto de 2006. World Scientific . pág. 847. ISBN 9789812709998.
- ^ "Codificación de vídeo" . Sitio web de CSIP . Centro de Procesamiento de Señales e Información, Instituto Tecnológico de Georgia. Archivado del original el 23 de mayo de 2013. Consultado el 6 de marzo de 2013 .
- ^ Robinson, AH; Cherry, C. (1967). "Resultados de un prototipo de esquema de compresión de ancho de banda de televisión". Actas del IEEE . 55 (3). IEEE : 356–364 . Bibcode : 1967IEEEP..55..356R . doi : 10.1109/PROC.1967.5493 .
- ^ a b Ghanbari, Mohammed (2003). Códecs estándar: compresión de imágenes a codificación de vídeo avanzada . Institution of Engineering and Technology . págs. 1–2 . ISBN 9780852967102.
- ^ Reader, Cliff (31 de agosto de 2016). "Panorama de patentes para codificación de vídeo libre de regalías" . En Tescher, Andrew G (ed.). Aplicaciones del procesamiento digital de imágenes XXXIX . Aplicaciones del procesamiento digital de imágenes XXXIX. Vol. 9971. San Diego, California: Society of Photo-Optical Instrumentation Engineers. págs. 99711B. Bibcode : 2016SPIE.9971E..1BR . doi : 10.1117/12.2239493 . Archivado del original el 8 de diciembre de 2016.Grabación de la conferencia, desde las 3:05:10.
- ^ a b c d "Infografía sobre la historia de los formatos de archivo de vídeo — RealPlayer" . 22 de abril de 2012. Archivado del original el 29 de junio de 2018. Recuperado el 12 de julio de 2019 .
- ^ "Declaración de patente registrada como H261-07" . UIT . Archivado del original el 14 de octubre de 2023. Recuperado el 11 de julio de 2019 .
- ^ "Lista de patentes MPEG-2" (PDF) . MPEG LA . Archivado (PDF) del original el 29 de mayo de 2019. Consultado el 7 de julio de 2019 .
- ^ "MPEG-4 Visual - Lista de patentes" (PDF) . MPEG LA . Archivado (PDF) del original el 6 de julio de 2019. Recuperado el 6 de julio de 2019 .
- ^ "AVC/H.264 – Lista de patentes" (PDF) . MPEG LA . Archivado del original (PDF) el 25 de enero de 2023. Recuperado el 6 de julio de 2019 .
- ^ Artamonova, Maria (01/10/2025). "AV1 vs. H.264: ¿Qué códec debería elegir para una aplicación de vídeo en 2026?" . Consultado el 20/05/2026 .
- ^ Chanda P, Bader JS, Elhaik E (27 de julio de 2012). "HapZipper: compartir poblaciones de HapMap ahora es más fácil" . Nucleic Acids Research . 40 (20): e159. doi : 10.1093/nar/gks709 . PMC 3488212. PMID 22844100 .
- ^ Christley S, Lu Y, Li C, Xie X (15 de enero de 2009). "Genomas humanos como archivos adjuntos de correo electrónico" . Bioinformática . 25 (2): 274– 5. doi : 10.1093/bioinformatics/btn582 . PMID 18996942 .
- ^ Pavlichin DS, Weissman T, Yona G (septiembre de 2013). "El genoma humano se contrae de nuevo" . Bioinformatics . 29 (17): 2199–202 . doi : 10.1093/bioinformatics/btt362 . PMID 23793748 .
- ^ Hosseini, Morteza; Pratas, Diogo; Pinho, Armando (2016). "Una encuesta sobre métodos de compresión de datos para secuencias biológicas" . Información . 7 (4): 56. doi : 10.3390/info7040056 .
- ^ "Compresión de datos mediante síntesis lógica" (PDF) . Archivado (PDF) del original el 18 de agosto de 2017. Consultado el 9 de abril de 2019 .
- ^ Hilbert, Martin; López, Priscila (1 de abril de 2011). "La capacidad tecnológica del mundo para almacenar, comunicar y procesar información" . Science . 332 ( 6025): 60– 65. Bibcode : 2011Sci...332...60H . doi : 10.1126/science.1200970 . PMID 21310967. S2CID 206531385 .
Enlaces externos
- "Parte 3: Compresión de vídeo" , Fundamentos de la compresión de datos
- Larbier, Pierre, Uso de la codificación AVC/H.264 de 10 bits con 4:2:2 para la contribución a la radiodifusión , Ateme, archivado del original el 5 de septiembre de 2009.
- ¿Por qué el formato de 10 bits ahorra ancho de banda (incluso cuando el contenido es de 8 bits)? ( en Wayback Machine , archivado el 30 de agosto de 2017)
- ¿Qué tecnología de compresión debería utilizarse? en Wayback Machine (archivado el 30/08/2017)
- Introducción a la teoría de la compresión (PDF) , Wiley, archivado (PDF) del original el 28/09/2007.
- Pruebas de escucha subjetivas de la EBU sobre códecs de audio de baja tasa de bits.
- Guía de archivo de audio: Formatos de música (Guía para ayudar al usuario a elegir el códec adecuado)
- Introducción a la compresión de vídeo MPEG 1 y 2 (formato PDF) en Wayback Machine (archivado el 28 de septiembre de 2007).
- Comparación de la wiki de hydrogenaudio
- Introducción a la compresión de datos por Guy E. Blelloch de la Universidad Carnegie Mellon.
- Explicación del método de compresión de señal sin pérdidas utilizado por la mayoría de los códecs.
- Videsignline – Introducción a la compresión de vídeo en Wayback Machine (archivado el 15/03/2010)
- Tecnología de reducción de la huella de datos en Wayback Machine (archivado el 27/05/2013)
- ¿Qué es la codificación de longitud de ejecución en la compresión de vídeo?
- Compresión de datos
- Audio digital
- Televisión digital
- Tecnología cinematográfica y de vídeo
- Tipos de software de utilidad
- Compresión de vídeo
- Videotelefonía
