La compresión de imágenes es un tipo de compresión de datos que se aplica a las imágenes digitales para reducir su coste de almacenamiento o transmisión . Los algoritmos pueden aprovechar la percepción visual y las propiedades estadísticas de los datos de imagen para proporcionar resultados superiores en comparación con los métodos genéricos de compresión de datos que se utilizan para otros datos digitales. [ 1 ]

Compresión de imágenes con y sin pérdida
La compresión de imágenes puede ser con pérdida o sin pérdida . La compresión sin pérdida se prefiere para fines de archivo y, a menudo, para imágenes médicas, dibujos técnicos, imágenes prediseñadas o cómics. Los métodos de compresión con pérdida, especialmente cuando se utilizan a bajas tasas de bits , introducen artefactos de compresión . Los métodos con pérdida son particularmente adecuados para imágenes naturales, como fotografías, en aplicaciones donde una pérdida menor (a veces imperceptible) de fidelidad es aceptable para lograr una reducción sustancial en la tasa de bits. La compresión con pérdida que produce diferencias insignificantes puede denominarse visualmente sin pérdida.
Métodos para la compresión con pérdida :
- Codificación por transformación : este es el método más utilizado.
- Transformada discreta del coseno (DCT): la forma más utilizada de compresión con pérdida. Es un tipo de transformada relacionada con Fourier y fue desarrollada originalmente por Nasir Ahmed , T. Natarajan y KR Rao en 1974. [ 2 ] La DCT a veces se denomina "DCT-II" en el contexto de una familia de transformadas discretas del coseno (véase transformada discreta del coseno ). Generalmente es la forma más eficiente de compresión de imágenes.
- La DCT se utiliza en JPEG , el formato con pérdida más popular, y en el formato HEIF, más reciente .
- La transformada wavelet, desarrollada más recientemente, también se utiliza ampliamente, seguida de la cuantización y la codificación entrópica .
- Transformada discreta del coseno (DCT): la forma más utilizada de compresión con pérdida. Es un tipo de transformada relacionada con Fourier y fue desarrollada originalmente por Nasir Ahmed , T. Natarajan y KR Rao en 1974. [ 2 ] La DCT a veces se denomina "DCT-II" en el contexto de una familia de transformadas discretas del coseno (véase transformada discreta del coseno ). Generalmente es la forma más eficiente de compresión de imágenes.
- Cuantización de color : reduce el espacio de color a unos pocos colores "representativos" en la imagen. Los colores seleccionados se especifican en la paleta de colores del encabezado de la imagen comprimida. Cada píxel simplemente hace referencia al índice de un color en la paleta. Este método se puede combinar con el tramado para evitar la posterización .
- Submuestreo de croma . Esto aprovecha el hecho de que el ojo humano percibe los cambios espaciales de brillo con mayor nitidez que los de color, promediando o descartando parte de la información de crominancia en la imagen.
- Compresión fractal .
- Más recientemente, se aplicaron métodos basados en aprendizaje automático , utilizando perceptrones multicapa , redes neuronales convolucionales , redes generativas antagónicas [ 3 ] y modelos de difusión [ 4 ] . Existen implementaciones disponibles en OpenCV , TensorFlow , Image Processing Toolbox (IPT) de MATLAB y el proyecto de código abierto High-Fidelity Generative Image Compression (HiFiC) [ 5 ] .
Métodos para la compresión sin pérdidas :
- Codificación de longitud de ejecución : se utiliza como método predeterminado en PCX y como uno de los posibles en BMP , TGA y TIFF.
- Codificación predictiva: utilizada en el DPCM.
- Codificación de entropía : las dos técnicas de codificación de entropía más comunes son la codificación aritmética y la codificación de Huffman.
- Algoritmos de diccionario adaptativos como LZW , utilizados en GIF y TIFF.
- DEFLATE – utilizado en PNG , MNG y TIFF
- Códigos de cadena
Otras propiedades
El objetivo principal de la compresión de imágenes es obtener la mejor calidad de imagen posible con una determinada tasa de compresión (o tasa de bits ); sin embargo, existen otras propiedades importantes de los esquemas de compresión de imágenes:
La escalabilidad generalmente se refiere a una reducción de calidad lograda mediante la manipulación del flujo de bits o archivo (sin descompresión ni recompresión). Otros nombres para la escalabilidad son codificación progresiva o flujos de bits incrustados . A pesar de su naturaleza contraria, la escalabilidad también puede encontrarse en códecs sin pérdida, generalmente en forma de escaneos de píxeles de grueso a fino. La escalabilidad es especialmente útil para previsualizar imágenes mientras se descargan (por ejemplo, en un navegador web) o para proporcionar acceso de calidad variable a, por ejemplo, bases de datos. Existen varios tipos de escalabilidad:
- Progresivo por calidad o progresivo por capas: el flujo de bits refina sucesivamente la imagen reconstruida.
- Resolución progresiva : Primero se codifica una resolución de imagen más baja; luego se codifica la diferencia a resoluciones más altas. [ 6 ] [ 7 ]
- Componente progresivo : primero se codifica la versión en escala de grises; luego se añade el color completo.
Codificación de regiones de interés . Ciertas partes de la imagen se codifican con mayor calidad que otras. Esto puede combinarse con la escalabilidad (codificar estas partes primero y las demás después).
Metainformación . Los datos comprimidos pueden contener información sobre la imagen que puede utilizarse para categorizar, buscar o explorar imágenes. Dicha información puede incluir estadísticas de color y textura, pequeñas imágenes de vista previa e información sobre el autor o los derechos de autor.
Potencia de procesamiento . Los algoritmos de compresión requieren diferentes cantidades de potencia de procesamiento para codificar y decodificar. Algunos algoritmos de alta compresión requieren una alta potencia de procesamiento.
La calidad de un método de compresión se suele medir mediante la relación señal-ruido máxima . Esta mide la cantidad de ruido introducido por la compresión con pérdida de la imagen; sin embargo, el juicio subjetivo del espectador también se considera una medida importante, quizás incluso la más importante.
Historia
La codificación de entropía comenzó a finales de la década de 1940 con la introducción de la codificación de Shannon-Fano , [ 8 ] la base de la codificación de Huffman que se publicó en 1952. [ 9 ] La codificación de transformada se remonta a finales de la década de 1960, con la introducción de la codificación de transformada rápida de Fourier (FFT) en 1968 y la transformada de Hadamard en 1969. [ 10 ]
Un avance importante en la compresión de datos de imagen fue la transformada discreta del coseno (DCT), una técnica de compresión con pérdida propuesta por primera vez por Nasir Ahmed , T. Natarajan y KR Rao en 1973. [ 11 ] JPEG fue introducido por el Joint Photographic Experts Group (JPEG) en 1992. [ 12 ] JPEG comprime las imágenes a tamaños de archivo mucho más pequeños y se ha convertido en el formato de archivo de imagen más utilizado . [ 13 ] JPEG fue en gran parte responsable de la amplia proliferación de imágenes y fotos digitales , [ 14 ] con varios miles de millones de imágenes JPEG producidas cada día a partir de 2015. [ 15 ]
Lempel–Ziv–Welch (LZW) es un algoritmo de compresión sin pérdidas desarrollado por Abraham Lempel , Jacob Ziv y Terry Welch en 1984. Se utiliza en el formato GIF , introducido en 1987. [ 16 ] DEFLATE , un algoritmo de compresión sin pérdidas desarrollado por Phil Katz y especificado en 1996, se utiliza en el formato Portable Network Graphics (PNG). [ 17 ]
El estándar JPEG 2000 fue desarrollado entre 1997 y 2000 por un comité JPEG presidido por Touradj Ebrahimi (posteriormente presidente de JPEG). [ 18 ] A diferencia del algoritmo DCT utilizado por el formato JPEG original, JPEG 2000 utiliza algoritmos de transformada discreta de ondículas (DWT). Utiliza la transformada de ondículas CDF 9/7 (desarrollada por Ingrid Daubechies en 1992) para su algoritmo de compresión con pérdidas, [ 19 ] y la transformada de ondículas Le Gall-Tabatabai (LGT) 5/3 [ 20 ] [ 21 ] (desarrollada por Didier Le Gall y Ali J. Tabatabai en 1988) [ 22 ] para su algoritmo de compresión sin pérdidas. [ 19 ] La tecnología JPEG 2000 , que incluye la extensión Motion JPEG 2000 , fue seleccionada como el estándar de codificación de vídeo para el cine digital en 2004. [ 23 ]
Notas y referencias
- ↑ "Compresión de datos de imagen" .
- ↑ Ahmed, N.; Natarajan, T.; Rao, KR (1974). "Transformada discreta del coseno" (PDF) . IEEE Transactions on Computers . 100 (1): 90– 93. Bibcode : 1974ITCmp.100...90A . doi : 10.1109/TC.1974.223784 . S2CID 149806273. Archivado del original (PDF) el 25 de noviembre de 2011.
- ↑ Gilad David Maayan (24 de noviembre de 2021). "Compresión de imágenes basada en IA: estado del arte" . Towards Data Science . Archivado del original el 25 de noviembre de 2021. Recuperado el 6 de abril de 2023 .
- ↑ Bühlmann, Matthias (28-09-2022). "Compresión de imágenes estable basada en difusión" . Medium . Consultado el 02-11-2022 .
- ↑ "Compresión generativa de imágenes de alta fidelidad" . Consultado el 6 de abril de 2023 .
- ↑ Burt, P.; Adelson, E. (1 de abril de 1983). "La pirámide laplaciana como código de imagen compacto". IEEE Transactions on Communications . 31 (4): 532– 540. Bibcode : 1983ITCom..31..532B . CiteSeerX 10.1.1.54.299 . doi : 10.1109/TCOM.1983.1095851 . S2CID 8018433 .
- ^ Shao, Dan; Kropatsch, Walter G. (3 al 5 de febrero de 2010). Spaček, Libor; Franco, Vojtěch (eds.). "Pirámide gráfica laplaciana irregular" (PDF) . Taller de invierno de visión por computadora 2010 . Nové Hrady, República Checa: Sociedad Checa de Reconocimiento de Patrones. Archivado (PDF) desde el original el 27 de mayo de 2013.
- ↑ Claude Elwood Shannon (1948). Alcatel-Lucent (ed.). "Una teoría matemática de la comunicación" (PDF) . Bell System Technical Journal . 27 ( 3–4 ): 379–423 , 623–656 . Bibcode : 1948BSTJ...27..379S . doi : 10.1002/j.1538-7305.1948.tb01338.x . hdl : 11858/00-001M-0000-002C-4314-2 . Archivado (PDF) del original el 24-05-2011 . Recuperado el 21-04-2019 .
- ↑ David Albert Huffman (septiembre de 1952), "Un método para la construcción de códigos de redundancia mínima" (PDF) , Actas del IRE , vol. 40, n.º 9, págs. 1098–1101 , Bibcode : 1952PIRE...40.1098H , doi : 10.1109/JRPROC.1952.273898 , archivado (PDF) del original el 8 de octubre de 2005
- ↑ Pratt, WK; Kane, J.; Andrews, HC (1969). "Codificación de imágenes mediante la transformada de Hadamard". Actas del IEEE . 57 (1): 58– 68. Bibcode : 1969IEEEP..57...58P . doi : 10.1109/PROC.1969.6869 .
- ↑ Ahmed, Nasir (enero de 1991). "Cómo desarrollé la transformada discreta del coseno" . Procesamiento de señales digitales . 1 (1): 4– 5. Bibcode : 1991DSP.....1....4A . doi : 10.1016/1051-2004(91)90086-Z .
- ↑ "T.81 – COMPRESIÓN DIGITAL Y CODIFICACIÓN DE IMÁGENES FIJAS DE TONO CONTINUO – REQUISITOS Y DIRECTRICES" (PDF) . CCITT . Septiembre de 1992. Archivado (PDF) del original el 18 de agosto de 2000. Consultado el 12 de julio de 2019 .
- ↑ "Explicación del formato de imagen JPEG" . BT.com . Grupo BT . 31 de mayo de 2018. Consultado el 5 de agosto de 2019 .
- ↑ "¿Qué es un JPEG? El objeto invisible que ves todos los días" . The Atlantic . 24 de septiembre de 2013. Consultado el 13 de septiembre de 2019 .
- ↑ Baraniuk, Chris (15 de octubre de 2015). "Las protecciones contra copia podrían llegar a los JPEG" . BBC News . BBC . Consultado el 13 de septiembre de 2019 .
- ↑ "La controversia de los GIF: la perspectiva de un desarrollador de software" . 27 de enero de 1995. Consultado el 26 de mayo de 2015 .
- ↑ L. Peter Deutsch (mayo de 1996). Especificación del formato de datos comprimidos DEFLATE versión 1.3 . IETF . pág. 1. sec. Resumen. doi : 10.17487/RFC1951 . RFC 1951. Consultado el 23 de abril de 2014 .
- ↑ Taubman, David; Marcellin, Michael (2012). Fundamentos, estándares y práctica de la compresión de imágenes JPEG2000: Fundamentos, estándares y práctica de la compresión de imágenes . Springer Science & Business Media . ISBN 9781461507994.
- 1 2 Unser, M.; Blu, T. (2003). "Propiedades matemáticas de los filtros wavelet JPEG2000" (PDF) . IEEE Transactions on Image Processing . 12 ( 9): 1080– 1090. Bibcode : 2003ITIP...12.1080U . doi : 10.1109/TIP.2003.812329 . PMID 18237979. S2CID 2765169. Archivado del original (PDF) el 13 de octubre de 2019.
- ↑ Sullivan, Gary (8–12 de diciembre de 2003). "Características generales y consideraciones de diseño para la codificación de vídeo de subbanda temporal" . ITU-T . Grupo de Expertos en Codificación de Vídeo . Recuperado el 13 de septiembre de 2019 .
- ↑ Bovik, Alan C. (2009). La guía esencial para el procesamiento de vídeo . Academic Press . pág. 355. ISBN 9780080922508.
- ↑ Le Gall, Didier; Tabatabai, Ali J. (1988). "Codificación de subbandas de imágenes digitales mediante filtros de núcleo corto simétricos y técnicas de codificación aritmética". ICASSP-88., Conferencia Internacional sobre Acústica, Habla y Procesamiento de Señales . pp. 761–764 vol.2. doi : 10.1109/ICASSP.1988.196696 . S2CID 109186495 .
- ↑ Swartz, Charles S. (2005). Comprensión del cine digital: Manual profesional . Taylor & Francis . pág. 147. ISBN 9780240806174.
- Compresión de imágenes
- Compresión de datos