La compresión de silencio es una técnica de procesamiento de audio que se utiliza para codificar eficazmente los intervalos de silencio, reduciendo la cantidad de almacenamiento o ancho de banda necesarios para transmitir las grabaciones de audio.
Descripción general
El silencio se define como segmentos de audio con sonido prácticamente imperceptible. Ejemplos de silencio son las pausas entre palabras o frases al hablar y las pausas entre notas musicales. Al comprimir los intervalos de silencio, los archivos de audio se vuelven más pequeños y fáciles de manejar, almacenar y enviar, conservando la calidad de sonido original. Si bien las técnicas varían, la compresión de silencio generalmente se logra mediante dos pasos cruciales: la detección de los intervalos de silencio y su posterior compresión. Las aplicaciones de la compresión de silencio incluyen telecomunicaciones , transmisión de audio, reconocimiento de voz, archivo de audio y producción multimedia. [ 1 ]
Técnicas
1. Recorte
El recorte es un método de compresión de silencio en el que se eliminan por completo los intervalos silenciosos. Esto se logra identificando intervalos de audio por debajo de un cierto umbral de amplitud, que indican silencio, y eliminando dicho intervalo del audio. Una desventaja del recorte es que modifica permanentemente el audio original y puede causar artefactos perceptibles al reproducirlo. [ 1 ]
a. Recorte del umbral de amplitud
El recorte por umbral de amplitud elimina el silencio mediante el establecimiento de un umbral de amplitud en el que cualquier segmento de audio que caiga por debajo de este umbral se considera silencioso y se trunca o elimina por completo. Algunos algoritmos comunes de recorte por umbral de amplitud son:
- Umbral fijo: En este método, se selecciona un nivel de amplitud estático y se eliminan los segmentos de audio que se encuentran por debajo de dicho umbral. Una desventaja es que puede resultar difícil elegir un umbral fijo adecuado, debido a las diferencias en las condiciones de grabación y las fuentes de audio.
- Umbral dinámico: En un enfoque de umbral dinámico, se aplica un algoritmo para ajustar el umbral de forma dinámica según las características del audio. Un ejemplo de algoritmo consiste en establecer el umbral como una fracción de la amplitud promedio en una ventana determinada. Este enfoque permite una mayor adaptabilidad al trabajar con diversas fuentes de audio, pero requiere una mayor complejidad de procesamiento.
b. Recorte basado en energía
El recorte basado en energía funciona mediante el análisis de los niveles de energía de una señal de audio. El nivel de energía de una señal de audio es la magnitud de la señal durante un intervalo de tiempo corto. Una fórmula común para calcular la energía del audio es:, dóndees la energía de la señal,son las muestras dentro de la señal de audio, yes ella amplitud de la señal de la muestra. Una vez calculados los niveles de energía, se establece un umbral en el que todos los niveles de energía que caen por debajo del umbral se consideran silencio y se eliminan. El recorte basado en energía puede detectar el silencio con mayor precisión que el recorte basado en amplitud, ya que considera la potencia de salida total del audio en lugar de solo la amplitud de la onda sonora. El recorte basado en energía se usa a menudo para archivos de voz/habla debido a la necesidad de almacenar y transmitir solo las partes relevantes que contienen sonido. Algunos algoritmos populares de recorte basado en energía incluyen los métodos de Energía de Tiempo Corto (STE) y Tasa de Cruce por Cero (ZCR). [ 2 ] De manera similar, esos algoritmos también se usan en la detección de actividad de voz (VAD) para detectar actividad de habla. [ 1 ] [ 3 ]
2. Supresión del silencio
La supresión de silencio es una técnica utilizada en el contexto de la Voz sobre IP (VoIP) y la transmisión de audio para optimizar la velocidad de transferencia de datos. Mediante la reducción temporal de datos en intervalos de silencio, el audio se puede transmitir por internet en tiempo real de forma más eficiente. [ 1 ] [ 3 ]
a. Transmisión discontinua (DTX)
DTX optimiza el uso del ancho de banda durante las telecomunicaciones en tiempo real detectando intervalos de silencio y suspendiendo la transmisión de dichos intervalos. Mediante la monitorización continua de la señal de audio, los algoritmos DTX detectan el silencio según criterios predefinidos. Al detectarse silencio, se envía una señal al receptor que detiene la transmisión de datos de audio. Cuando se reanuda la voz o el sonido, se reactiva la transmisión de audio. Esta técnica permite una comunicación ininterrumpida con una alta eficiencia en el uso de los recursos de la red. [ 1 ] [ 3 ]
3. Codificación del silencio
La codificación de silencio es esencial para la representación eficiente de intervalos silenciosos sin eliminarlos por completo. Esto permite minimizar los datos necesarios para codificar y transmitir el silencio, manteniendo la integridad de la señal de audio. [ 4 ] [ 5 ] [ 6 ] Existen varios métodos de codificación utilizados para este propósito:
RLE detecta muestras idénticas repetidas en el audio y las codifica de forma más eficiente en cuanto al espacio. En lugar de almacenar cada muestra idéntica individualmente, RLE almacena una sola muestra y cuenta cuántas veces se repite. RLE funciona bien para codificar el silencio, ya que los intervalos silenciosos suelen consistir en secuencias repetidas de muestras idénticas. La reducción de muestras idénticas almacenadas reduce posteriormente el tamaño de la señal de audio. [ 4 ] [ 5 ]
La codificación Huffman es un método de codificación entrópica y un algoritmo de código de longitud variable que asigna a los valores más comunes códigos binarios más cortos que requieren menos bits para su almacenamiento. La codificación Huffman funciona en el contexto de la compresión de silencios asignando a los patrones de silencio que ocurren con frecuencia códigos binarios más cortos, reduciendo así el tamaño de los datos. [ 5 ] [ 6 ]
4. Codificación diferencial
La codificación diferencial aprovecha la similitud entre muestras de audio consecutivas durante intervalos de silencio, almacenando únicamente la diferencia entre ellas. Se utiliza para codificar de forma eficiente las transiciones entre sonido y silencio, y resulta útil para muestras de audio donde el silencio se intercala con sonido activo. [ 7 ] [ 8 ] [ 9 ] Algunos algoritmos de codificación diferencial incluyen:
La modulación delta cuantifica y codifica las diferencias entre muestras de audio consecutivas codificando la derivada de la amplitud de la muestra. Al almacenar cómo cambia la señal de audio a lo largo del tiempo, en lugar de las muestras en sí, se puede capturar de manera eficiente la transición del silencio al sonido. La modulación delta suele utilizar un mecanismo de cuantificación de un bit , donde 1 indica un aumento en el tamaño de la muestra y 0 indica una disminución. Si bien esto permite un uso eficiente del ancho de banda o del almacenamiento, no puede proporcionar una codificación de alta fidelidad de señales de baja amplitud. [ 8 ]
La modulación Delta-Sigma es una variante más avanzada de la modulación Delta que permite codificaciones de alta fidelidad para señales de baja amplitud. Esto se logra mediante la cuantización a una alta tasa de sobremuestreo , lo que permite una codificación precisa de cambios leves en la señal de audio. La modulación Delta-Sigma se utiliza en situaciones donde se prioriza mantener una alta fidelidad de audio. [ 9 ]
Aplicaciones
La reducción del tamaño del audio mediante la compresión del silencio tiene usos en numerosas aplicaciones:
- Telecomunicaciones: La reducción de las transmisiones silenciosas en sistemas de telecomunicaciones como VoIP permite un uso más eficiente del ancho de banda y una reducción de los costes de datos.
- Transmisión de audio: la compresión de silencio minimiza el uso de datos durante la transmisión de audio, lo que permite transmitir audio de alta calidad de manera eficiente a través de Internet.
- Archivo de audio: la compresión de silencio ayuda a ahorrar el espacio necesario para almacenar audio manteniendo la fidelidad del mismo.
Referencias
- 1 2 3 4 5 Benyassine, A.; Shlomot, E.; Su, H.-Y.; Massaloux, D.; Lamblin, C.; Petit, J.-P. (1997). "Recomendación G.729 Anexo B de la UIT-T: un esquema de compresión de silencio para su uso con G.729 optimizado para aplicaciones digitales simultáneas de voz y datos V.70". IEEE Communications Magazine . 35 (9): 64– 73. doi : 10.1109/35.620527 .
- ↑ Sahin, Arda; Unlu, Mehmet Zubeyir (2021-01-20). "Compresión de archivos de voz mediante la eliminación de componentes sordos/silencio" . Ingeniería e innovación sostenibles . 3 (1): 11– 14. doi : 10.37868/sei.v3i1.119 . ISSN 2712-0562 . S2CID 234125634 .
- 1 2 3 "Sobre el esquema de compresión de silencio ITU-T G.729.1" . IEEE : 1–5 . Agosto de 2008. Recuperado el 9 de noviembre de 2023 .
- 1 2 Elsayed, Hend A. (2014). "Transformación de Burrows-Wheeler y combinación de codificación Move-to-Front y codificación Run Length para codificación de audio sin pérdidas". 9.ª Conferencia Internacional de Ingeniería Informática y Sistemas (ICCES) de 2014. pp. 354–359 . doi : 10.1109/ICCES.2014.7030985 . ISBN 978-1-4799-6594-6. S2CID 15743605 .
- 1 2 3 Patil, Rupali B.; Kulat, KD (2017). "Compresión de audio mediante codificación dinámica Huffman y RLE". 2017 2.ª Conferencia Internacional sobre Sistemas de Comunicación y Electrónica (ICCES) . págs. 160–162 . doi : 10.1109/CESYS.2017.8321256 . ISBN 978-1-5090-5013-0. S2CID 4122679 .
- 1 2 Firmansah, Luthfi; Setiawan, Erwin Budi (2016). "Compresión de audio de datos del formato FLAC sin pérdidas al formato MP3 con pérdidas mediante el algoritmo de codificación por desplazamiento de Huffman". 4.ª Conferencia Internacional sobre Tecnologías de la Información y la Comunicación (ICoICT) de 2016. pp. 1–5 . doi : 10.1109/ICoICT.2016.7571951 . ISBN 978-1-4673-9879-4. S2CID 18754681 .
- ↑ Jensen, J.; Heusdens, R. (2003). "Una comparación de esquemas diferenciales para la codificación de audio sinusoidal de baja velocidad". 2003 IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (IEEE Cat. No.03TH8684) . pp. 205–208 . doi : 10.1109/ASPAA.2003.1285867 . ISBN 0-7803-7850-4. S2CID 58213603 .
- 1 2 Zhu, YS; Leung, SW; Wong, CM (1996). "Un sistema de procesamiento de audio digital basado en modulación delta de muestreo no uniforme". IEEE Transactions on Consumer Electronics . 42 : 80–86 . doi : 10.1109/30.485464 .
- 1 2 "Modulación sigma-delta para DSP de audio" . IEEE : 1/1–1/6. Noviembre de 1993. Recuperado el 09-11-2023 .
- Compresión de datos