El corpus de Calgary es una colección de archivos de texto y datos binarios , comúnmente utilizada para comparar algoritmos de compresión de datos . Fue creado por Ian Witten , Tim Bell y John Cleary de la Universidad de Calgary en 1987 y se utilizó ampliamente en la década de 1990. En 1997 fue reemplazado por el corpus de Canterbury , [ 1 ] debido a dudas sobre la representatividad del corpus de Calgary, [ 2 ] pero este último aún existe para comparaciones y sigue siendo útil para su propósito original.
Contenido
En su forma más utilizada, el corpus consta de 14 archivos que suman un total de 3.141.622 bytes, como se detalla a continuación.
También existe una versión menos común de 18 archivos que incluye 4 archivos de texto adicionales en formato "troff" de UNIX, PAPER3 a PAPER6. Los responsables del sitio web del corpus de Canterbury señalan que "no contribuyen a la evaluación". [ 3 ]
Puntos de referencia
El corpus de Calgary fue un referente común para la compresión de datos en la década de 1990. Los resultados se solían expresar en bits por byte (bpb) para cada archivo y luego se resumían mediante el cálculo del promedio. Más recientemente, se ha vuelto común simplemente sumar los tamaños comprimidos de todos los archivos. Esto se denomina promedio ponderado , ya que equivale a ponderar las tasas de compresión según los tamaños originales de los archivos. El referente UCLC [ 4 ] de Johan de Bock utiliza este método.
Para algunos compresores de datos, es posible comprimir el corpus a un tamaño menor combinando las entradas en un archivo sin comprimir (como un archivo tar ) antes de la compresión, debido a la información mutua entre los archivos de texto. En otros casos, la compresión es peor porque el compresor maneja mal las estadísticas no uniformes. Este método se utilizó en una prueba de rendimiento en el libro en línea Data Compression Explained de Matt Mahoney. [ 5 ]
La tabla a continuación muestra los tamaños comprimidos del corpus de Calgary de 14 archivos utilizando ambos métodos para algunos programas de compresión populares. Cuando se utilizan opciones, se selecciona la mejor compresión. Para obtener una lista más completa, consulte las comparativas anteriores.
desafío de compresión
El concurso "Calgary Corpus Compression and SHA-1 Crack Challenge" [ 6 ] fue iniciado por Leonid A. Broukhis el 21 de mayo de 1996 para comprimir la versión de 14 archivos del corpus de Calgary. El concurso ofrece un pequeño premio en efectivo que ha variado con el tiempo. Actualmente, el premio es de US$1 por cada 111 bytes de mejora con respecto al resultado anterior.
Según las reglas del concurso, una participación debe constar tanto de los datos comprimidos como del programa de descompresión, empaquetados en uno de varios formatos de archivo estándar. Con el tiempo, se han flexibilizado los límites de tiempo y memoria, los formatos de archivo y los lenguajes de descompresión. Actualmente, el programa debe ejecutarse en 24 horas en una máquina de 2000 MIPS con Windows o Linux y consumir menos de 800 MB de memoria. Posteriormente se añadió un desafío SHA-1 , que permite al programa de descompresión generar archivos diferentes al corpus de Calgary, siempre que su hash coincida con el de los archivos originales. Hasta el momento, este desafío no se ha superado.
La primera entrada recibida fue de 759.881 bytes en septiembre de 1997 por Malcolm Taylor, autor de RK y WinRK. La entrada más reciente fue de 580.170 bytes por Alexander Ratushnyak el 2 de julio de 2010. La entrada consiste en un archivo comprimido de tamaño 572.465 bytes y un programa de descompresión escrito en C++ y comprimido a 7700 bytes como un archivo PPMd var. I, más 5 bytes para el nombre y tamaño del archivo comprimido. El historial es el siguiente.
Véase también
Referencias
- ↑ Ian H. Witten; Alistair Moffat; Timothy C. Bell (1999). Managing Gigabytes: Compressing and Indexing Documents and Images . Morgan Kaufmann. p. 92. ISBN 9781558605701.
- ↑ Salomon, David (2007). Compresión de datos: La referencia completa (Cuarta ed.). Springer. pág. 12. ISBN 9781846286032.
- ↑ "El Corpus de Canterbury" . corpus.canterbury.ac.nz .
- ↑ "Centro de Aprendizaje de la UC" . 6 de enero de 2023.
- ↑ "Explicación de la compresión de datos" . mattmahoney.net .
- ↑ "El desafío de la compresión/SHA-1" . mailcom.com .
Enlaces externos
- Sede original del Corpus Christi de Calgary
- Casa nueva
- Bell, Witten y Cleary, 1988
- Información sobre el Corpus de Calgary
- El desafío de compresión del cuerpo cavernoso y fisura SHA-1 de Calgary
- Compresión de datos
- Elementos de prueba