Articulo de referencia

Medida de la calidad perceptiva del habla

La Medida de Calidad de Habla Perceptual ( PSQM ) es un algoritmo computacional y de modelado definido en la Recomendación ITU-T P.861 que evalúa y cuantifica objetivamente la c...

La Medida de Calidad de Habla Perceptual ( PSQM ) es un algoritmo computacional y de modelado definido en la Recomendación ITU-T P.861 que evalúa y cuantifica objetivamente la calidad de voz de los códecs de habla de banda de voz (300 – 3400  Hz) .

Puede utilizarse para clasificar el rendimiento de estos códecs de voz con diferentes niveles de entrada de voz, hablantes, tasas de bits y transcodificaciones. La norma P.861 fue retirada y sustituida por la Recomendación ITU-T P.862 ( PESQ ), que incluye un algoritmo de evaluación de voz mejorado.

Por qué se utiliza

El uso del estándar PSQM permite que las metodologías de prueba automatizadas, basadas en simulación, evalúen objetivamente tanto la claridad del habla como la calidad de la voz transmitida. Se han desarrollado diversos productos de software y/o hardware para facilitar estas pruebas. Esto se traduce en un ahorro considerable de tiempo y dinero en comparación con la práctica tradicional de utilizar grandes grupos de personas para evaluar subjetivamente las señales de voz y la calidad de la misma. Además, proporciona resultados objetivos, fiables y reproducibles. Esto es fundamental para los proveedores de telefonía, quienes están obligados a mantener altos estándares de calidad de servicio .

Algoritmo

El PSQM utiliza un algoritmo de modelado matemático psicoacústico (tanto perceptivo como cognitivo) para analizar las señales de voz antes y después de la transmisión, generando un valor PSQM que mide la degradación de la calidad de la señal y varía de 0 (sin degradación) a 6,5 ​​(máxima degradación). Este resultado se traduce en una puntuación media de opinión (MOS), una medida aceptada de la calidad percibida del contenido multimedia recibido, en una escala numérica del 1 al 5. Un valor de 1 indica una calidad de voz inaceptable, mientras que un valor de 5 indica una alta calidad de voz sin problemas perceptibles.

El algoritmo PSQM convierte la(s) señal(es) del dominio físico en el dominio psicoacústico, que tiene significado perceptual, mediante una serie de procesos no lineales como el mapeo tiempo-frecuencia, la deformación de frecuencia y la deformación de intensidad.

La calidad del habla codificada se evalúa en función de las diferencias en su representación interna. Esta diferencia se utiliza para calcular la perturbación sonora en función del tiempo y la frecuencia. Además del modelado perceptual, el algoritmo PSQM emplea modelos cognitivos, como el escalado de sonoridad y el enmascaramiento asimétrico, para obtener altas correlaciones entre las mediciones subjetivas y objetivas.

Limitaciones

El PSQM, tal como fue concebido originalmente, no se desarrolló para tener en cuenta las perturbaciones de la calidad de servicio de la red, comunes en las aplicaciones de Voz sobre IP , como la pérdida de paquetes , la variación del retardo y la entrega fuera de orden . Estas condiciones suelen generar resultados inapropiados en simulaciones de alta carga de red, ya que no reflejan una pérdida real de la calidad de la voz. Los intentos de reproducir las condiciones de fallo de la red mediante la introducción de una pérdida significativa de paquetes dan como resultado valores de PSQM que corresponden a valores de MOS inflados artificialmente .

Para superar esta limitación, se desarrolló PSQM+ modificando el algoritmo original. PSQM+ genera resultados que parecen reflejar con mayor precisión el rendimiento deficiente de los códecs de voz en condiciones de carga de red realistas.

Otras consideraciones

Otros problemas incluyen la falta de estandarización en las señales de prueba utilizadas para evaluar diversos códecs de voz. PSQM proporciona valores MOS más fiables y consistentes si se utiliza de acuerdo con los métodos recomendados por la UIT para la evaluación objetiva y subjetiva de la calidad (ITU-T P.800/P.830/P.861). Estas recomendaciones de la UIT-T incluyen el uso de señales de referencia de voz de género masculino y femenino a un nivel promedio de −20 dB . El tipo, el género, la duración y la ganancia de la voz o la señal pueden tener un impacto menor en el valor PSQM o la puntuación MOS  , al igual que los niveles de umbral, el número de llamadas realizadas y otras configuraciones del entorno. Al comparar las mediciones de calidad de voz, se deben tener en cuenta la señal, el entorno y las configuraciones.

Existen numerosos códecs de voz que se utilizan en una amplia variedad de aplicaciones. Es necesario seleccionar cuidadosamente el o los códecs de voz adecuados para cumplir con los requisitos del sistema. Se encuentra disponible una lista de códecs de voz comunes y sus valores MOS derivados de PSQM/PSQM+ asociados, obtenidos bajo diversas condiciones de carga de red.

Referencias

  • Recomendación P.861 de la UIT-T (retirada) : Medición objetiva de la calidad de los códecs de voz en la banda telefónica (300–3400  Hz). Se reconoció que la P.861 presentaba ciertas limitaciones en áreas de aplicación específicas. Fue reemplazada por la P.862, que incluye un algoritmo mejorado para la evaluación objetiva de la calidad de la voz.
  • Recomendación P.862 de la UIT-T (2001-02) : Evaluación perceptiva de la calidad del habla (PESQ): Un método objetivo para la evaluación de la calidad del habla de extremo a extremo en redes telefónicas de banda estrecha y códecs de voz.
  • «AES Journal Forum  » Una medida de la calidad del habla basada en la percepción a partir de una representación psicoacústica del sonido» . secure.aes.org . Consultado el 18 de abril de 2024.

Véase también