MUSHRA significa Estímulos Múltiples con Referencia y Anclaje Ocultos y es una metodología para realizar una prueba de escucha de códec para evaluar la calidad percibida de la salida de algoritmos de compresión de audio con pérdidas . Está definida por la recomendación ITU-R BS.1534-3. [ 1 ] La metodología MUSHRA se recomienda para evaluar la "calidad de audio intermedia". Para deficiencias de audio muy pequeñas o sensibles, se recomienda la recomendación ITU-R BS.1116-3 (ABC/HR).
MUSHRA se puede utilizar para probar códecs de audio en un amplio espectro de casos de uso: consumo de música y películas, voz (por ejemplo, en podcasts y radio) , transmisión en línea (donde el equilibrio entre calidad y eficiencia en cuanto a tamaño y procesamiento es fundamental), telefonía digital moderna y aplicaciones VoIP (que requieren codificación casi en tiempo real y de baja tasa de bits que siga siendo inteligible). Los usos profesionales, audiófilos y de usuarios avanzados suelen ser más adecuados para pruebas alternativas, como la mencionada ABC/HR, que parten de la premisa de un audio de alta calidad y alta resolución , donde habrá mínimas diferencias detectables entre el material de referencia y la salida del códec.
La principal ventaja de MUSHRA sobre la metodología de puntuación media de opinión (MOS), que cumple una función similar, radica en que requiere menos participantes para obtener resultados estadísticamente significativos. Esto se debe a que todos los códecs se presentan simultáneamente a los mismos participantes, lo que permite utilizar una prueba t pareada o un análisis de varianza de medidas repetidas para el análisis estadístico. Además, la escala de 0 a 100 empleada por MUSHRA permite expresar diferencias perceptibles con un alto grado de detalle, especialmente en comparación con la escala Likert modificada de 0 a 5, frecuentemente utilizada en los experimentos MOS.
En MUSHRA, al oyente se le presenta la referencia (etiquetada como tal), una cierta cantidad de muestras de prueba, una versión oculta de la referencia y uno o más anclajes (es decir, codificaciones gravemente deterioradas que tanto los experimentadores como los participantes deben reconocer inmediatamente como tales; se utilizan de forma similar a la referencia para proporcionar una línea base que demuestre —«anclaje»— a los participantes la realidad del extremo inferior de la escala de calidad). La recomendación especifica que se deben incluir un anclaje de rango bajo y uno de rango medio en las señales de prueba. Estos suelen ser una versión de paso bajo de 7 kHz y otra de 3,5 kHz de la referencia. El propósito de los anclajes es calibrar la escala para que los artefactos menores no se penalicen indebidamente. Esto es particularmente importante al comparar o agrupar resultados de diferentes laboratorios.
Comportamiento del oyente
Tanto las pruebas MUSHRA como ITU BS.1116 [ 2 ] requieren oyentes expertos capacitados que conozcan el sonido típico de los artefactos y dónde es probable que ocurran. Los oyentes expertos también comprenden mejor la escala de calificación, lo que genera resultados más repetibles que con oyentes no capacitados. Por lo tanto, con oyentes capacitados, se necesita un menor número de participantes para obtener resultados estadísticamente significativos .
Se asume que las preferencias son similares para oyentes expertos y oyentes inexpertos, por lo que los resultados de los oyentes expertos también son predictivos para los consumidores. De acuerdo con esta suposición, Schinkel-Bielefeld et al. no encontraron diferencias en el orden de clasificación entre oyentes expertos y oyentes no entrenados al usar señales de prueba que contenían solo timbre y ningún artefacto espacial. [ 3 ] Sin embargo, Rumsey et al. demostraron que, para señales que contienen artefactos espaciales, los oyentes expertos les dan un peso ligeramente mayor que los oyentes no entrenados, quienes se centran principalmente en los artefactos de timbre. [ 4 ]
Además, se ha demostrado que los oyentes expertos utilizan más la opción de escuchar repetidamente secciones más pequeñas de las señales bajo prueba y realizan más comparaciones entre las señales bajo prueba y la referencia. [ 3 ] A diferencia del oyente inexperto que emite una calificación de preferencia, los oyentes expertos, por lo tanto, emiten una calificación de calidad de audio, calificando las diferencias entre la señal bajo prueba y el original sin comprimir, que es el objetivo real de una prueba MUSHRA.
Antes o después de la evaluación
Las directrices de MUSHRA describen dos posibilidades principales para evaluar la fiabilidad de un oyente (que se describen a continuación).
La opción más sencilla y común es descalificar, a posteriori , a todos los oyentes que califiquen la referencia oculta repetidamente por debajo de 90 puntos MUSHRA para más del 15 % de todos los elementos de la prueba. En el caso ideal, la referencia oculta debería calificarse con 100 puntos para indicar la equivalencia perceptual con el audio de referencia original. Si bien puede ocurrir que la referencia oculta y una señal de alta calidad se confundan, la especificación establece que una calificación inferior a 90 solo debe otorgarse cuando el oyente esté seguro de que la señal calificada es diferente de la referencia original, por lo que una calificación inferior a 90 para la referencia oculta se considera un error claro y evidente del oyente.
La otra posibilidad para evaluar el desempeño de un oyente es eGauge , [ 5 ] un marco basado en el análisis de varianza (ANOVA). Calcula la concordancia , la repetibilidad y la discriminabilidad , aunque solo se recomiendan las dos últimas para la preselección o postselección. La concordancia es el ANOVA de la concurrencia de un oyente con el resto de los oyentes. La repetibilidad examina la fiabilidad interna del individuo al calificar la misma señal de prueba nuevamente en comparación con la varianza de las otras señales de prueba. La discriminabilidad analiza una especie de fiabilidad entre pruebas al verificar que los oyentes pueden distinguir entre señales de prueba de diferentes condiciones. Como eGauge requiere escuchar cada señal de prueba dos veces, su uso es temporalmente ineficiente a corto plazo en relación con el método anterior de postselección de oyentes basado en una referencia oculta. eGauge tiene ventajas cuando se usa con una perspectiva a largo plazo. Elimina la pequeña probabilidad de una repetición completa en el raro caso en el que los resultados de una muestra carecen de suficiente potencia estadística debido a una tasa de falla excesiva descubierta a posteriori. Además, la ineficiencia inicial puede amortizarse a lo largo de una serie de experimentos eliminando la necesidad de fases de reclutamiento: si un oyente ha demostrado ser fiable utilizando eGauge, también puede considerarse un oyente fiable para futuras pruebas de escucha, siempre que la naturaleza de la prueba no se altere sustancialmente (por ejemplo, un oyente fiable para pruebas estéreo no es necesariamente igual de bueno para percibir artefactos en configuraciones 5.1 o 22.2 o incluso en formatos mono ).
Elementos de prueba
Es importante seleccionar elementos de prueba críticos. En concreto, elementos difíciles de codificar y propensos a generar artefactos. Asimismo, estos elementos deben tener validez ecológica : deben ser representativos del material emitido y no meras señales sintéticas diseñadas para ser difíciles de codificar a costa del realismo. Ekeroot et al. presentan un método para seleccionar material crítico mediante un procedimiento de clasificación por eliminación. [ 6 ] Si bien este método es eficaz para seleccionar los elementos de prueba más críticos, no garantiza la inclusión de una variedad de elementos propensos a generar diferentes artefactos.
Idealmente, un elemento de prueba MUSHRA debería mantener características similares durante toda su duración (por ejemplo, el uso de instrumentación consistente en la música o la misma voz de la persona con cadencia y tono similares en el audio hablado). Puede ser difícil para el oyente decidir una calificación MUSHRA unidimensional si algunas partes de los elementos muestran artefactos diferentes o artefactos más fuertes en comparación con otras partes, lo cual se hace más probable por grandes variaciones en las características del audio. [ 7 ] A menudo, los elementos más cortos conducen a menos variabilidad, ya que muestran mayor estacionariedad (consistencia y constancia perceptual). [ 8 ] Sin embargo, incluso al intentar elegir elementos estacionarios, los estímulos ecológicamente válidos (es decir, audio que es probable que aparezca o similar al que es probable que aparezca en situaciones del mundo real, como en la radio) muy a menudo tendrán secciones que son ligeramente más críticas que el resto de la señal (ejemplos incluyen palabras clave en un discurso o frases principales de música y dependen del tipo de estímulo). La estacionariedad es importante ya que los oyentes que se centran en diferentes secciones de la señal tienden a evaluarla de manera diferente. Los oyentes que son más analíticos parecen ser mejores para identificar las regiones más críticas de un estímulo que aquellos que son menos analíticos. [ 9 ]
Idioma de los ítems de la prueba
Las pruebas ITU-T P.800 , [ 10 ] basadas en la metodología de puntuación media de opinión, se utilizan comúnmente para evaluar códecs de voz para su uso en, por ejemplo, VoIP . Esta norma especifica que los elementos de voz evaluados siempre deben estar en el idioma nativo de los oyentes. Cuando se utiliza MUSHRA para estos fines, la coincidencia de idioma se vuelve innecesaria. Los experimentos MUSHRA no pretenden evaluar la inteligibilidad de las palabras habladas, sino únicamente la calidad del audio que contiene esas palabras y la presencia o ausencia de artefactos audibles (por ejemplo, distorsión). Un estudio MUSHRA con oyentes de chino mandarín y alemán no encontró diferencias significativas entre la calificación de elementos de prueba en idioma extranjero y en idioma nativo. A pesar de la falta de distinción en los resultados finales, los oyentes sí necesitaron más tiempo y oportunidades de comparación (repeticiones) para evaluar con precisión los elementos en idioma extranjero. [ 11 ] Esta compensación es imposible en las pruebas ITU-T P.800 ACR, donde los elementos se escuchan solo una vez y no es posible compararlos con el audio de referencia. En este tipo de pruebas, a diferencia de las pruebas MUSHRA, los elementos en lengua extranjera se perciben y luego se califican como de menor calidad, independientemente de la calidad real del códec, cuando la competencia de los oyentes en la lengua meta es baja. [ 12 ]
Referencias
- ↑ Recomendación BS.1534 de la UIT-R
- ↑ ITU-R BS.1116 (febrero de 2015). "Métodos para la evaluación subjetiva de pequeñas deficiencias en sistemas de audio" .
{{cite journal}}: La cita de la revista requiere|journal=( ayuda ) CS1 maint: nombres numéricos: lista de autores ( enlace ) - 1 2 Schinkel-Bielefeld, N., Lotze, N. y Nagel, F. (mayo de 2013). "Evaluación de la calidad de audio por oyentes experimentados e inexpertos". The Journal of the Acoustical Society of America . 133 (5): 3246. Bibcode : 2013ASAJ..133.3246S . doi : 10.1121/1.4805210 .
{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace ) - ↑ Rumsey, Francis; Zielinski, Slawomir; Kassier, Rafael; Bech, Søren (31 de mayo de 2005). "Relaciones entre las calificaciones de calidad de audio multicanal de oyentes experimentados y las preferencias de oyentes ingenuos" . The Journal of the Acoustical Society of America . 117 (6): 3832– 3840. Bibcode : 2005ASAJ..117.3832R . doi : 10.1121/1.1904305 . ISSN 0001-4966 . PMID 16018485 .
- ↑ Lorho, Gaëtan; Le Ray, Guillaume; Zacharov, Nick (2010-06-13). "eGauge: una medida de la experiencia del evaluador en evaluaciones de calidad de audio" . Actas de la Audio Engineering Society. 38.ª Conferencia Internacional sobre Evaluación de la Calidad del Sonido .
- ↑ Ekeroot, Jonas; Berg, Jan; Nykänen, Arne (2014-04-25). "Criticidad de los estímulos de audio para pruebas de escucha: duraciones de escucha durante una tarea de clasificación" . 136.ª Convención de la Audio Engineering Society .
- ↑ Max, Neuendorf; Frederik, Nagel (2011-10-19). "Estudios exploratorios sobre la estacionariedad perceptiva en pruebas de escucha - Parte I: señales del mundo real de pruebas de escucha personalizadas" .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - ↑ Frederik, Nagel; Max, Neuendorf (2011-10-19). "Estudios exploratorios sobre la estacionariedad perceptiva en pruebas de escucha - Parte II: señales sintéticas con artefactos variables en el tiempo" .
{{cite journal}}: Para citar una revista se requiere|journal=( ayuda ) - ↑ Nadja, Schinkel-Bielefeld (11 de mayo de 2017). "Evaluación de la calidad de audio en las pruebas MUSHRA: influencias entre la configuración del bucle y las calificaciones de los oyentes" . 142.ª Convención de la Audio Engineering Society .
- ↑ ITU-T P.800 (agosto de 1996). "P.800 : Métodos para la determinación subjetiva de la calidad de la transmisión" .
{{cite journal}}: La cita de la revista requiere|journal=( ayuda ) CS1 maint: nombres numéricos: lista de autores ( enlace ) - ↑ Nadja, Schinkel-Bielefeld; Zhang, Jiandong; Qin, Yili; Katharina, Leschanowsky, Anna; Fu, Shanshan (2017-05-11). "¿Es más difícil percibir artefactos de codificación en elementos en lenguas extranjeras? – Un estudio con oyentes de habla china mandarín y alemana" .
{{cite journal}}: La cita de la revista requiere|journal=( ayuda ) CS1 maint: nombres múltiples: lista de autores ( enlace ) - ↑ Blašková, Lubica; Holub, Jan (2008). "¿Cómo perciben los oyentes no nativos la calidad de la voz transmitida?" (PDF) . Communications: Scientific Letters of the University of Zilina . 10 (4): 11– 15. doi : 10.26552/com.C.2008.4.11-14 . S2CID 196699038 .
Enlaces externos
- webMUSHRA: un software experimental basado en una API de audio web compatible con MUSHRA, configurable mediante YAML.
- RateIt: Una interfaz gráfica de usuario para realizar experimentos MUSHRA
- MUSHRAM - Una interfaz de Matlab para pruebas de escucha de MUSHRAM en la Wayback Machine (archivado el 19/10/2008)
- Una interfaz Max/MSP para pruebas de escucha MUSHRA
- Una herramienta de evaluación de audio basada en navegador para ejecutar diversas pruebas, incluyendo MUSHRA. No se requiere programación.
- BeaqleJS: Marco de trabajo basado en HTML5 y JavaScript para pruebas de escucha.
- mushraJS+Server: basado en mushraJS con el servidor mochiweb, que es un servidor web Erlang.
- Procesamiento de señales
- Recomendaciones de la UIT-R
- Psicofísica