La latencia se refiere a un breve período de retardo (generalmente medido en milisegundos ) entre el momento en que una señal de audio ingresa a un sistema y el momento en que sale. Entre los factores que pueden contribuir a la latencia en un sistema de audio se incluyen la conversión analógica-digital , el almacenamiento en búfer , el procesamiento digital de señales , el tiempo de transmisión , la conversión digital-analógica y la velocidad del sonido en el medio de transmisión .
La latencia puede ser una métrica de rendimiento crítica en el audio profesional , incluyendo sistemas de refuerzo de sonido , sistemas de monitorización (especialmente aquellos que utilizan monitores intrauditivos ) , radio y televisión en directo . Una latencia de audio excesiva puede degradar la calidad de las llamadas en aplicaciones de telecomunicaciones . El audio de baja latencia en ordenadores es importante para la interactividad .
llamadas telefónicas
En todos los sistemas, se puede decir que la latencia consta de tres elementos: retardo del códec , retardo de reproducción y retardo de red.
La latencia en las llamadas telefónicas a veces se denominaretardo boca a oído ; la industria de las telecomunicaciones también utiliza el términocalidad de la experiencia(QoE). La calidad de la voz se mide según elde la UIT; la calidad medible de una llamada se degrada rápidamente cuando la latencia del retardo boca a oído supera los 200 milisegundos. Lapuntuación media de opinión(MOS) también es comparable de forma casi lineal con la escala de calidad de la UIT, definida en las normas G.107, [ 1 ] : 800 G.108 [ 2 ] y G.109 [ 3 ] , con un factor de calidadRque va de 0 a 100. Un MOS de 4 ('Bueno') tendría unaRde 80 o superior; para alcanzar 100R se requiere un MOS superior a 4,5.
La UIT y el 3GPP agrupan los servicios de usuario final en clases basadas en la sensibilidad a la latencia: [ 4 ]
De manera similar, la recomendación G.114 sobre el retardo de boca a oído indica que la mayoría de los usuarios están "muy satisfechos" siempre que la latencia no supere los 200 ms, con un R correspondiente de 90+. La elección del códec también juega un papel importante; los códecs de mayor calidad (y mayor ancho de banda) como G.711 generalmente se configuran para incurrir en la menor latencia de codificación-descodificación, por lo que en una red con suficiente rendimiento se pueden lograr latencias inferiores a 100 ms . G.711 a una tasa de bits de 64 kbit/s es el método de codificación que se utiliza predominantemente en la red telefónica pública conmutada .
llamadas móviles
El códec de banda estrecha AMR , utilizado en las redes GSM y UMTS , introduce latencia en los procesos de codificación y decodificación.
A medida que los operadores móviles actualizan las redes existentes de mejor esfuerzo para admitir múltiples tipos de servicio simultáneos sobre redes totalmente IP, servicios como la Calidad de Servicio Jerárquica ( H-QoS ) permiten políticas de QoS por usuario y por servicio para priorizar protocolos sensibles al tiempo, como las llamadas de voz y otro tráfico de retorno inalámbrico. [ 5 ] [ 6 ] [ 7 ]
Otro aspecto de la latencia móvil es la transferencia entre redes; cuando un cliente de la Red A llama a un cliente de la Red B, la llamada debe atravesar dos redes de acceso de radio separadas , dos redes centrales y un centro de conmutación móvil de puerta de enlace (GMSC) que realiza la interconexión física entre los dos proveedores. [ 8 ]
llamadas IP
Con conexiones de velocidad garantizada y gestionadas por QoS de extremo a extremo , la latencia se puede reducir a niveles de PSTN/POTS analógicos. En una conexión estable con ancho de banda suficiente y latencia mínima, los sistemas VoIP suelen tener una latencia inherente mínima de 20 ms. En condiciones de red menos ideales, se busca una latencia máxima de 150 ms para el uso general del consumidor. [ 9 ] [ 10 ] Muchos sistemas populares de videoconferencia dependen del almacenamiento en búfer de datos y la redundancia de datos para hacer frente a la fluctuación de la red y la pérdida de paquetes. Las mediciones han demostrado que el retardo de boca a oído está entre 160 y 300 ms en una distancia de 500 millas, en condiciones promedio de red en EE. UU. La latencia es una consideración más importante cuando hay eco y los sistemas deben realizar supresión y cancelación de eco . [ 11 ]
Audio de computadora
La latencia puede ser un problema particular en las plataformas de audio en computadoras. Las optimizaciones de interfaz compatibles reducen el retardo a tiempos demasiado cortos para que el oído humano los detecte. Al reducir el tamaño de los búferes, se puede reducir la latencia. [ 12 ] Una solución de optimización popular es ASIO de Steinberg , que omite la plataforma de audio y conecta las señales de audio directamente al hardware de la tarjeta de sonido. Muchas aplicaciones de audio profesionales y semiprofesionales utilizan el controlador ASIO, lo que permite a los usuarios trabajar con audio en tiempo real. [ 13 ] Pro Tools HD ofrece un sistema de baja latencia similar a ASIO. Pro Tools 10 y 11 también son compatibles con los controladores de interfaz ASIO.
El kernel de tiempo real de Linux [ 14 ] es un kernel modificado que altera la frecuencia del temporizador estándar que utiliza el kernel de Linux y otorga a todos los procesos o hilos la capacidad de tener prioridad en tiempo real. Esto significa que un proceso crítico en el tiempo, como una transmisión de audio, puede tener prioridad sobre otro proceso menos crítico, como la actividad de red. Esto también es configurable por usuario (por ejemplo, los procesos del usuario "tux" podrían tener prioridad sobre los procesos del usuario "nobody" o sobre los procesos de varios demonios del sistema ).
Audio de televisión digital
Muchos receptores de televisión digital, decodificadores y receptores AV modernos utilizan un procesamiento de audio sofisticado , lo que puede generar un retardo entre la recepción de la señal de audio y su reproducción en los altavoces. Dado que los televisores también introducen retardos en el procesamiento de la señal de vídeo, esto puede provocar que ambas señales se sincronicen lo suficiente como para que el espectador no lo note. Sin embargo, si la diferencia entre el retardo del audio y el del vídeo es significativa, el efecto puede resultar desconcertante. Algunos sistemas cuentan con una función de sincronización labial que permite ajustar el retardo del audio para sincronizarlo con el vídeo, y otros ofrecen ajustes avanzados donde se pueden desactivar algunos pasos del procesamiento de audio.
El retardo de audio también supone un inconveniente importante en los juegos de ritmo , donde se requiere una sincronización precisa para tener éxito. La mayoría de estos juegos cuentan con una configuración de calibración de retardo que ajusta las ventanas de tiempo en una cierta cantidad de milisegundos para compensar. En estos casos, las notas de una canción se envían a los altavoces incluso antes de que el juego reciba la entrada necesaria del jugador, con el fin de mantener la ilusión de ritmo. Los juegos que dependen de la improvisación musical , como Rock Band Drums o DJ Hero , también pueden verse muy afectados, ya que el juego no puede predecir qué pulsará el jugador, y un retardo excesivo seguirá creando un retraso perceptible entre pulsar las notas y escucharlas.
Audio de transmisión
La latencia de audio puede experimentarse en sistemas de radiodifusión donde alguien participa en una transmisión en vivo a través de un enlace satelital o similar con alta latencia. La persona en el estudio principal debe esperar a que el participante en el otro extremo del enlace responda a las preguntas. La latencia en este contexto puede oscilar entre varios cientos de milisegundos y unos pocos segundos. Gestionar latencias de audio tan elevadas requiere capacitación especializada para que la salida de audio combinada resultante sea razonablemente aceptable para los oyentes. Siempre que sea posible, es importante intentar mantener baja la latencia de audio en la producción en vivo para que las reacciones y el intercambio entre los participantes sean lo más naturales posible. Una latencia de 10 milisegundos o menos es el objetivo para los circuitos de audio en estructuras de producción profesionales. [ 15 ]
Audio de la actuación en directo
La latencia en las actuaciones en directo se produce de forma natural debido a la velocidad del sonido . El sonido tarda aproximadamente 3 milisegundos en recorrer 1 metro. Se produce una pequeña latencia entre los intérpretes, dependiendo de la distancia que los separe y de la que mantienen los monitores de escenario , si se utilizan. Esto crea un límite práctico a la distancia que pueden mantener los artistas de un grupo entre sí. La monitorización de escenario amplía ese límite, ya que el sonido, en forma de señal eléctrica, viaja a una velocidad cercana a la de la luz a través de los cables que conectan los monitores.
Los intérpretes, sobre todo en espacios amplios, también perciben la reverberación , o eco, de su música, ya que el sonido que se proyecta desde el escenario rebota en las paredes y estructuras, y regresa con retardo y distorsión. Uno de los objetivos principales de la monitorización en el escenario es proporcionar a los artistas un sonido más nítido para que no se vean afectados por la latencia de estas reverberaciones.
Procesamiento de señales en tiempo real
Si bien los equipos de audio analógicos no presentan una latencia apreciable, los equipos de audio digitales tienen una latencia asociada a dos procesos generales: la conversión de un formato a otro y las tareas de procesamiento digital de señales (DSP), como la ecualización, la compresión y el enrutamiento.
Los procesos de conversión digital incluyen convertidores analógico-digitales (ADC), convertidores digital-analógicos (DAC) y diversas transformaciones de un formato digital a otro, como AES3 , que transmite señales eléctricas de bajo voltaje a ADAT , un protocolo de transporte óptico. Cualquiera de estos procesos requiere poco tiempo; las latencias típicas oscilan entre 0,2 y 1,5 milisegundos, dependiendo de la frecuencia de muestreo, el diseño del software y la arquitectura del hardware. [ 16 ]
Las distintas operaciones de procesamiento de señales de audio , como los filtros de respuesta de impulso finito (FIR) y de respuesta de impulso infinito (IIR), emplean diferentes enfoques matemáticos para lograr el mismo resultado y pueden presentar diferentes latencias. Además, el almacenamiento en búfer de muestras de entrada y salida añade retardo. Las latencias típicas oscilan entre 0,5 y 10 milisegundos, aunque algunos diseños pueden llegar a tener hasta 30 milisegundos de retardo. [ 17 ]
La latencia en los equipos de audio digital se nota especialmente cuando la voz de un cantante se transmite a través de su micrófono, mediante la mezcla, el procesamiento y el enrutamiento de audio digital, y luego llega a sus oídos mediante auriculares o monitores intrauditivos . En este caso, el sonido vocal del cantante se conduce a su oído a través de los huesos de la cabeza y, unos milisegundos después, a través de la vía digital. En un estudio, los oyentes consideraron perceptible una latencia superior a 15 ms. La latencia en otras actividades musicales, como tocar la guitarra, no representa un problema tan grave. Diez milisegundos de latencia no son tan perceptibles para un oyente que no escucha su propia voz. [ 18 ]
Altavoces con retardo
En el refuerzo de sonido para presentaciones musicales o de discursos en grandes recintos, lo óptimo es proporcionar un volumen de sonido suficiente en la parte posterior del recinto sin recurrir a volúmenes excesivos cerca del frente. Una forma en que los ingenieros de audio pueden lograr esto es utilizando altavoces adicionales ubicados a cierta distancia del escenario, pero más cerca de la parte posterior del público. El sonido viaja por el aire a la velocidad del sonido (aproximadamente 343 metros por segundo , dependiendo de la temperatura y la humedad del aire). Al medir o estimar la diferencia de latencia entre los altavoces cercanos al escenario y los altavoces más cercanos al público, el ingeniero de audio puede introducir un retardo adecuado en la señal de audio que llega a estos últimos altavoces, de modo que los frentes de onda de los altavoces cercanos y lejanos lleguen al mismo tiempo. Debido al efecto Haas, se pueden agregar 15 milisegundos adicionales al tiempo de retardo de los altavoces más cercanos al público, de modo que el frente de onda del escenario los alcance primero, para centrar la atención del público en el escenario en lugar del altavoz local. El ligero retraso en la respuesta sonora de los altavoces simplemente aumenta el nivel de sonido percibido sin afectar negativamente a la localización del sonido.
Véase también
Referencias
- ↑ "G.107 : El modelo E: un modelo computacional para su uso en la planificación de la transmisión" (PDF) . Unión Internacional de Telecomunicaciones . 7 de junio de 2000. Consultado el 14 de enero de 2013 .
- ↑ "G.108 : Aplicación del modelo E: Guía de planificación" (PDF) . Unión Internacional de Telecomunicaciones . 28 de julio de 2000. Consultado el 14 de enero de 2013 .
- ↑ "G.109 : Definición de categorías de calidad de transmisión de voz - UIT" (PDF) . Unión Internacional de Telecomunicaciones . 11 de mayo de 2000. Consultado el 14 de enero de 2013 .
- ↑ O3b Networks y Sofrecom. "Por qué la latencia importa para el backhaul móvil - O3b Networks" (PDF) . O3b Networks . Consultado el 11 de enero de 2013 .
{{cite web}}: CS1 maint: nombres numéricos: lista de autores ( enlace ) - ↑ Nir, Halachmi; O3b Networks y Sofrecom (17 de junio de 2011). "Solución HQoS" . Telco.com . Consultado el 11 de enero de 2013 .
{{cite web}}: CS1 maint: nombres numéricos: lista de autores ( enlace ) - ↑ Cisco. "Consideraciones arquitectónicas para el backhaul de redes 2G/3G y Long Term Evolution" . Documento técnico de Cisco . Cisco . Consultado el 11 de enero de 2013 .
- ↑ "Libro blanco: El impacto de la latencia en el rendimiento de las aplicaciones" (PDF) . Nokia Siemens Networks . 2009. Archivado del original (PDF) el 1 de agosto de 2013.
- ↑ "Arquitectura de red GSM" . GSM para principiantes . Consultado el 11 de enero de 2013 .
- ↑ "G.114 : Tiempo de transmisión unidireccional" . www.itu.int . Consultado el 16 de noviembre de 2019 .
- ↑ "Requisitos de QoS para voz, vídeo y datos > Implementación de la calidad de servicio en VPN MPLS de Cisco" . www.ciscopress.com . Consultado el 16 de noviembre de 2019 .
- ↑ Michael Dosch y Steve Church. "VoIP en el estudio de radiodifusión" . Axia Audio. Archivado del original el 7 de octubre de 2011. Consultado el 21 de junio de 2011 .
- ↑ Huber, David M., y Robert E. Runstein. "Latencia". Técnicas modernas de grabación. 7.ª ed. Nueva York y Londres: Focal, 2013. 252. Impreso.
- ↑ "JD Mars. Mejor latente que nunca: una discusión largamente esperada sobre los problemas de latencia de audio " . Archivado del original el 17 de agosto de 2016. Recuperado el 30 de marzo de 2008 .
- ↑ Wiki de Linux en tiempo real
- ↑ Introducción a Livewire (PDF) , Axia Audio, abril de 2007, archivado del original (PDF) el 7 de octubre de 2011 , consultado el 21 de junio de 2011.
- ↑ Fonseca, Nuno; Monteiro, Edmundo (mayo de 2005), Problemas de latencia en redes de audio , Audio Engineering Society
- ↑ ProSoundWeb. David McNell. Transporte de audio en red: Análisis de los métodos y factores. Archivado el 21 de marzo de 2008 en Wayback Machine .
- ↑ Torbellino. ¿Abriendo la caja de Pandora? La palabra clave: latencia y sistemas de audio digital.
Enlaces externos
- La colaboración musical nunca se producirá en línea en tiempo real.
- Ingeniería de audio