Articulo de referencia

Codificación de excitación vectorial armónica

La codificación de excitación vectorial armónica , abreviada como HVXC, es un algoritmo de codificación de voz especificado en el estándar MPEG-4 Parte 3 (MPEG-4 Audio) para la ...

La codificación de excitación vectorial armónica , abreviada como HVXC, es un algoritmo de codificación de voz especificado en el estándar MPEG-4 Parte 3 (MPEG-4 Audio) para la codificación de voz a muy baja tasa de bits . HVXC admite tasas de bits de 2 y 4 kbit/s en el modo de tasa de bits fija y variable , y una frecuencia de muestreo de 8 kHz. También opera a tasas de bits más bajas, como 1,2-1,7 kbit/s, utilizando una técnica de tasa de bits variable. [ 1 ] El retardo algorítmico total para el codificador y el decodificador es de 36 ms. [ 2 ]   

Se publicó como subparte 2 de ISO / IEC 14496-3:1999 (MPEG-4 Audio) en 1999. [ 3 ] Una versión extendida de HVXC se publicó en MPEG-4 Audio Versión 2 (ISO/IEC 14496-3:1999/Amd 1:2000). [ 4 ] [ 5 ]

El conjunto de herramientas de codificación de voz natural MPEG-4 utiliza dos algoritmos: HVXC y CELP ( Code Excited Linear Prediction ). HVXC se utiliza a una baja tasa de bits de 2 o 4 kbit/s. CELP cubre  tasas de bits superiores a 4  kbit/s, además de 3,85 kbit/s. [ 6 ] 

Tecnología

Codificación predictiva lineal

HVXC utiliza codificación predictiva lineal (LPC) con adaptación por bloques cada 20 ms. [ 2 ] Los parámetros LPC se transforman en coeficientes de pares espectrales lineales (LSP), que se cuantifican conjuntamente. [ 2 ] La señal residual LPC se clasifica como sonora o sorda . En el caso del habla sonora, el residuo se codifica en una representación paramétrica (funcionando como un vocoder ), mientras que en el caso del habla sorda, la forma de onda residual se cuantifica (funcionando así como un códec de voz híbrido).

Codificación residual con voz (armónica)

En los segmentos sonoros, la señal residual se representa mediante dos parámetros: el período de tono y la envolvente espectral. [ 2 ] El período de tono se estima a partir de los valores pico de la autocorrelación de la señal residual. [ 2 ] En este proceso, la señal residual se compara con copias desplazadas de sí misma, y ​​el desplazamiento que produce la mayor similitud según la medida de dependencia lineal se identifica como el período de tono. La envolvente espectral se representa mediante un conjunto de valores de amplitud, uno por armónico . [ 2 ] Para extraer estos valores, la señal residual LPC se transforma al dominio DFT . [ 2 ] El espectro DFT se segmenta en bandas, una banda por armónico. La banda de frecuencia para el m-ésimo armónico consta de los coeficientes DFT desde (m-1/2)ω 0 hasta (m+1/2)ω 0 , siendo ω 0 la frecuencia de tono. [ 2 ] El valor de amplitud para el m-ésimo armónico se elige para representar de forma óptima estos coeficientes DFT. [ 2 ] La información de fase se descarta en este proceso. La envolvente espectral se codifica luego utilizando cuantización vectorial ponderada de dimensión variable . Este proceso también se conoce como VQ armónica .

Para que un discurso con una mezcla de excitación sonora y sorda suene más natural y fluido, se diferencian tres modos distintos de habla sonora (Sonido Mixto-1, Sonido Mixto-2, Sonorizado Completo). [ 2 ] El grado de sonorización se determina mediante el valor de la función de autocorrelación normalizada con un desplazamiento de un período de tono. Dependiendo del modo elegido, el decodificador añade diferentes cantidades de ruido gaussiano de paso de banda a la señal armónica sintetizada.

Codificación residual sin voz (VXC)

Los segmentos sordos se codifican según el esquema CELP , también conocido como codificación de excitación vectorial (VXC). [ 2 ] La codificación CELP en HVXQ se realiza utilizando únicamente un diccionario de códigos estocástico. En otros códecs CELP, se utiliza adicionalmente un diccionario de códigos dinámico para realizar la predicción a largo plazo de los segmentos sonoros. Sin embargo, dado que HVXC no utiliza CELP para los segmentos sonoros, el diccionario de códigos dinámico se omite en el diseño.

Véase también

Referencias

  1. ISO / IEC (1 de septiembre de 2009), ISO/IEC 14496-3:2009 - Tecnología de la información - Codificación de objetos audiovisuales - Parte 3: Audio (PDF) , IEC , consultado el 7 de octubre de 2009.
  2. 1 2 3 4 5 6 7 8 9 10 11 Masayuki Nishiguchi (17 de abril de 2006), Codificación de excitación vectorial armónica del habla (PDF) , Acoustical Science and Technology , consultado el 9 de octubre de 2009
  3. ISO (1999). "ISO/IEC 14496-3:1999 - Tecnología de la información - Codificación de objetos audiovisuales - Parte 3: Audio" . ISO . Consultado el 9 de octubre de 2009 .
  4. ISO (2000). "ISO/IEC 14496-3:1999/Amd 1:2000 - Extensiones de audio" . ISO . Consultado el 7 de octubre de 2009 .
  5. ISO / IEC JTC 1/SC 29/WG 11 (julio de 1999). "ISO/IEC 14496-3:/Amd.1 - Borrador final del comité - MPEG-4 Audio Versión 2" (PDF) . Servidor FTP ( FTP ) . Recuperado el 7 de octubre de 2009 .{{cite web}}: CS1 maint: nombres numéricos: lista de autores ( enlace ) (Para ver los documentos, consulte Ayuda:FTP )
  6. Karlheinz Brandenburg; Oliver Kunz; Akihiko Sugiyama. "MPEG-4 Natural Audio Coding - Natural Speech Coding Tools" (PDF) . Consultado el 25 de marzo de 2013 .