MPEG Surround ( ISO / IEC 23003-1 [ 1 ] o MPEG-D Parte 1 [ 2 ] [ 3 ] ), también conocido como Codificación de Audio Espacial (SAC), [ 4 ] [ 5 ] [ 6 ] [ 7 ] es un formato de compresión con pérdida para sonido envolvente que proporciona un método para extender los servicios de audio mono o estéreo a audio multicanal de forma retrocompatible. Las tasas de bits totales utilizadas para el núcleo (mono o estéreo) y los datos MPEG Surround suelen ser solo ligeramente superiores a las tasas de bits utilizadas para la codificación del núcleo (mono o estéreo). MPEG Surround añade un flujo de información lateral al flujo de bits del núcleo (mono o estéreo) , que contiene datos de imagen espacial. Los sistemas de reproducción estéreo antiguos ignorarán esta información lateral, mientras que los reproductores que admiten la decodificación MPEG Surround emitirán el audio multicanal reconstruido.
El Moving Picture Experts Group (MPEG) emitió una convocatoria de propuestas sobre codificación de audio espacial MPEG en marzo de 2004. El grupo decidió que la tecnología que sería el punto de partida en el proceso de estandarización sería una combinación de las presentaciones de dos proponentes: Fraunhofer IIS / Agere Systems y Coding Technologies / Philips. [ 5 ] El estándar MPEG Surround fue desarrollado por el Moving Picture Experts Group ( ISO/IEC JTC 1 /SC29/WG11) y publicado como ISO/IEC 23003 en 2007. [ 1 ] Fue el primer estándar del grupo de estándares MPEG-D, formalmente conocido como ISO/IEC 23003 - Tecnologías de audio MPEG .
MPEG Surround también se definió como uno de los tipos de objetos de audio MPEG-4 en 2007. [ 8 ] También existe el tipo de objeto MPEG-4 No Delay MPEG Surround (LD MPEG Surround), que se publicó en 2010. [ 9 ] [ 10 ] La codificación de objetos de audio espacial (SAOC) se publicó como MPEG-D Parte 2 - ISO/IEC 23003–2 en 2010 y extiende el estándar MPEG Surround al reutilizar sus capacidades de renderizado espacial mientras mantiene la compatibilidad total con los receptores existentes. El sistema MPEG SAOC permite a los usuarios en el lado de decodificación controlar interactivamente el renderizado de cada objeto de audio individual (por ejemplo, instrumentos individuales, voces, voces humanas). [ 2 ] [ 3 ] [ 11 ] [ 12 ] [ 13 ] [ 14 ] [ 15 ] También existe la codificación unificada de voz y audio (USAC), que se definirá en MPEG-D Parte 3 - ISO/IEC 23003-3 e ISO/IEC 14496-3:2009/Amd 3. [ 16 ] [ 17 ] Las herramientas de codificación paramétrica MPEG Surround de MPEG-D están integradas en el códec USAC. [ 18 ]
El núcleo (mono o estéreo) puede codificarse con cualquier códec de audio ( con o sin pérdida ) . Se pueden alcanzar tasas de bits particularmente bajas (64-96 kbit/s para 5.1 canales) al usar HE-AAC v2 como códec principal.
Percepción de los sonidos en el espacio
La codificación MPEG Surround utiliza nuestra capacidad de percibir el sonido en 3D y captura esa percepción en un conjunto compacto de parámetros. La percepción espacial se atribuye principalmente a tres parámetros, o señales, que describen cómo los humanos localizan el sonido en el plano horizontal: la diferencia de nivel interaural (ILD), la diferencia de tiempo interaural (ITD) y la coherencia interaural (IC). Estos tres conceptos se ilustran en la siguiente imagen. Las ondas directas, o de primera llegada, de la fuente llegan al oído izquierdo en un tiempo determinado, mientras que el sonido directo recibido por el oído derecho se difracta alrededor de la cabeza, con retardo de tiempo y atenuación de nivel asociados. Estos dos efectos dan como resultado ITD e ILD, que están asociados con la fuente principal. Finalmente, en un entorno reverberante, el sonido reflejado de la fuente, o el sonido de una fuente difusa, o el sonido no correlacionado pueden llegar a ambos oídos; todos ellos están relacionados con IC. 
Descripción
MPEG Surround utiliza diferencias entre canales de nivel, fase y coherencia equivalentes a los parámetros ILD, ITD e IC. La imagen espacial se captura mediante una señal de audio multicanal relativa a una señal de mezcla descendente transmitida. Estos parámetros se codifican de forma muy compacta para decodificar tanto los parámetros como la señal transmitida y sintetizar una representación multicanal de alta calidad.

El codificador MPEG Surround recibe una señal de audio multicanal de x1 a xN, donde N es el número de canales de entrada . El aspecto más importante del proceso de codificación es que se deriva una señal de mezcla descendente, xt1 y xt2, que suele ser estéreo, a partir de la señal de entrada multicanal. Es esta señal de mezcla descendente la que se comprime para su transmisión a través del canal, en lugar de la señal multicanal. El codificador puede aprovechar el proceso de mezcla descendente para obtener un mejor rendimiento. No solo crea un equivalente fiel de la señal multicanal en la mezcla descendente mono o estéreo, sino que también genera la mejor decodificación multicanal posible basada en la mezcla descendente y las señales espaciales codificadas. Alternativamente, la mezcla descendente podría proporcionarse externamente (Mezcla descendente artística en el bloque de diagrama anterior). El algoritmo de compresión utilizado para los canales transmitidos (Codificador de audio y Decodificador de audio en el bloque de diagrama anterior) podría ignorar el proceso de codificación MPEG Surround. Podría tratarse de cualquier tipo de algoritmo de compresión de alto rendimiento, como MPEG-1 Layer III, MPEG-4 AAC o MPEG-4 High Efficiency AAC, o incluso podría ser PCM.
Las señales espaciales se generan y recuperan en dos tipos de módulos de filtro. El filtro OTT inverso (de uno a dos) genera una secuencia mezclada, una diferencia de nivel, un valor de coherencia y una señal residual opcional a partir de un par de señales. El filtro TTT inverso (de dos a tres) genera dos secuencias mezcladas, dos diferencias de nivel, un valor de coherencia y una señal residual opcional. Tanto en la dirección directa (decodificación) como en la inversa (codificación), la disposición de estos filtros en una configuración de árbol permite la mezcla y recuperación arbitrarias. [ 19 ]
Compatibilidad heredada
La técnica MPEG Surround permite la compatibilidad con decodificadores MPEG estéreo actuales y futuros, ya que la mezcla descendente transmitida (por ejemplo, estéreo) aparece ante estos decodificadores como una versión estéreo convencional de la señal multicanal. La compatibilidad con decodificadores estéreo es deseable, dado que la presentación estéreo seguirá siendo omnipresente debido a la cantidad de aplicaciones en las que la escucha se realiza principalmente a través de auriculares, como los reproductores de música portátiles.
MPEG Surround también admite un modo en el que la mezcla descendente es compatible con decodificadores de sonido envolvente de matriz populares, como Dolby Pro-Logic . [ 19 ]
Aplicaciones
Radiodifusión de audio digital
Debido al ancho de banda relativamente pequeño del canal, al coste relativamente elevado de los equipos y licencias de transmisión, y al deseo de maximizar las opciones de los usuarios ofreciendo muchos programas, la mayoría de los sistemas de radiodifusión digital existentes o planificados no pueden proporcionar sonido multicanal a los usuarios.
DRM+ fue diseñado [ 20 ] para ser totalmente capaz de transmitir MPEG Surround y dicha transmisión también se demostró con éxito. [ 21 ]
La retrocompatibilidad y la sobrecarga relativamente baja de MPEG Surround ofrecen una forma de añadir sonido multicanal a la radio digital DAB sin reducir drásticamente la calidad del audio ni afectar a otros servicios.
Radiodifusión de televisión digital
Actualmente, la mayoría de las emisiones de televisión digital utilizan codificación de audio estéreo. MPEG Surround podría utilizarse para extender estos servicios ya establecidos al sonido envolvente, al igual que ocurre con la radio digital DAB.
Servicio de descarga de música
Actualmente, existen varios servicios comerciales de descarga de música que gozan de un considerable éxito comercial. Estos servicios podrían ampliarse fácilmente para ofrecer presentaciones multicanal, manteniendo la compatibilidad con reproductores estéreo: en ordenadores con sistemas de reproducción de 5.1 canales, los archivos de sonido comprimidos se presentan en sonido envolvente, mientras que en reproductores portátiles se reproducen en estéreo.
Servicio de música en streaming / Radio por Internet
Muchas emisoras de radio por Internet operan con un ancho de banda de transmisión muy limitado, por lo que solo pueden ofrecer contenido mono o estéreo. La tecnología de codificación MPEG Surround podría ampliar esta funcionalidad a un servicio multicanal, manteniéndose dentro del rango de velocidades de bits permitido. Dado que la eficiencia es fundamental en esta aplicación, la compresión de la señal de audio transmitida es vital. Utilizando la tecnología de compresión MPEG más reciente (codificación MPEG-4 High Efficiency Profile), se han demostrado sistemas MPEG Surround completos con velocidades de bits tan bajas como 48 kbit/s.
Véase también
Referencias
- 1 2 ISO (2007-01-29). "ISO/IEC 23003-1:2007 - Tecnología de la información - Tecnologías de audio MPEG - Parte 1: MPEG Surround" . ISO. Archivado del original el 6 de junio de 2011. Recuperado el 24 de octubre de 2009 .
- 1 2 MPEG. "Estándares MPEG - Lista completa de estándares desarrollados o en desarrollo" . chiariglione.org. Archivado del original el 20 de abril de 2010. Recuperado el 9 de febrero de 2010 .
- 1 2 MPEG. "Términos de referencia" . chiariglione.org. Archivado del original el 21-02-2010 . Recuperado el 09-02-2010 .
- ↑ "Vista previa de ISO/IEC 23003-1, primera edición, 15/02/2007, Parte 1: MPEG Surround" (PDF) . 15/02/2007. Archivado (PDF) del original el 14/06/2011 . Consultado el 24/10/2009 .
- 1 2 ISO/IEC JTC 1/SC29/WG11 (julio de 2005). "Tutorial sobre codificación de audio envolvente MPEG" . Archivado del original el 30 de abril de 2010. Recuperado el 9 de febrero de 2010 .
{{cite web}}: CS1 maint: nombres numéricos: lista de autores ( enlace ) - ↑ "Documentos de trabajo, MPEG-D (Tecnologías de audio MPEG)" . MPEG. Archivado del original el 21 de febrero de 2010. Consultado el 9 de febrero de 2010 .
- ↑ Codificación de audio espacial MPEG / Sonido envolvente MPEG: Descripción general y estado actual (PDF) , Audio Engineering Society, 2005, archivado (PDF) del original el 18 de julio de 2011 , consultado el 29 de octubre de 2009.
- ↑ ISO (2007). "Extensiones BSAC y transporte de MPEG Surround, ISO/IEC 14496-3:2005/Amd 5:2007" . ISO. Archivado del original el 6 de junio de 2011. Recuperado el 13 de octubre de 2009 .
- ↑ Documento de la Convención AES 8099: Una nueva extensión estéreo paramétrica y multicanal para MPEG-4 Enhanced Low Delay AAC (AAC-ELD) (PDF) , archivado del original (PDF) el 28/09/2011 , recuperado el 18/07/2011.
- ↑ ISO/IEC JTC 1/SC29/WG11 (octubre de 2009), ISO/IEC 14496-3:2009/FPDAM 2 – Perfil simple ALS y transporte de SAOC, N11032 , archivado del original (DOC) el 29-07-2014 , recuperado el 30-12-2009
{{citation}}: CS1 maint: nombres numéricos: lista de autores ( enlace ) - ↑ ISO (06/10/2010). "ISO/IEC 23003-2 - Tecnología de la información - Tecnologías de audio MPEG - Parte 2: Codificación de objetos de audio espacial (SAOC)" . Archivado del original el 01/02/2012 . Consultado el 18/07/2011 .
- ↑ Codificación de objetos de audio espacial (SAOC) – El próximo estándar MPEG sobre codificación de audio paramétrica basada en objetos (PDF) , 2008, archivado (PDF) del original el 12/03/2012 , recuperado el 19/07/2011
- ↑ Manfred Lutzky, Fraunhofer IIS (2007), Códecs de audio MPEG de baja latencia (PDF) , archivado (PDF) del original el 27/09/2011 , recuperado el 19/07/2011
- ↑ MPEG (octubre de 2009). "Aviso de la 91.ª reunión del WG11" . chiariglione.org. Archivado del original el 17 de febrero de 2010. Consultado el 9 de febrero de 2010 .
- ↑ ISO/IEC JTC 1/SC 29 (30-12-2009). "Programa de trabajo (asignado a SC 29/WG 11) - MPEG-D" . Archivado del original el 31-12-2013 . Recuperado el 30-12-2009 .
{{cite web}}: CS1 maint: nombres numéricos: lista de autores ( enlace ) - ↑ "ISO/IEC DIS 23003-3 - Tecnología de la información - Tecnologías de audio MPEG - Parte 3: Codificación unificada de voz y audio" . 15 de febrero de 2011. Archivado del original el 28 de enero de 2012. Consultado el 18 de julio de 2011 .
- ↑ "ISO/IEC 14496-3:2009/PDAM 3 - Transporte de codificación unificada de voz y audio (USAC)" . 30 de junio de 2011. Archivado del original el 29 de enero de 2012. Consultado el 18 de julio de 2011 .
- ↑ "Software de referencia del codificador común de Unified Speech and Audio Coder" . Marzo de 2011. Archivado del original el 6 de agosto de 2011. Consultado el 18 de julio de 2011 .
- 1 2 Herre, Jürgen; Kjörling, Kristofer; Breebaart, Jeroen; Faller, Christof; Disch, Sascha; Purnhagen, Heiko; Koppens, Jeroen; Hilpert, Johannes; Rodén, Jonas; Oomen, Werner; Linzmeier, Karsten; Chong, Kok Seng (8 de diciembre de 2008). "MPEG Surround: el estándar ISO/MPEG para codificación de audio multicanal compatible y eficiente" . Revista de la Sociedad de Ingeniería de Audio . 56 (11): 932–955 .Abstracto
- ↑ "ETSI aprueba la mejora del sistema DRM" (Comunicado de prensa). Consorcio DRM. 2 de septiembre de 2009. Archivado del original el 15 de octubre de 2009. Consultado el 20 de octubre de 2009 .
- ↑ "DRM+ en la Banda I se promueve como la tecnología más adecuada para complementar otros estándares de radio digital en países como Francia" (Comunicado de prensa). Consorcio DRM. 16 de julio de 2009. Archivado del original el 15 de octubre de 2009. Consultado el 20 de octubre de 2009 .
Enlaces externos
- MPEG Surround
- Sitio web oficial de MPEG
- RFC 5691 - Formato de carga útil RTP para flujos elementales con audio multicanal MPEG Surround
- Códecs de audio
- MPEG
- Estándares abiertos protegidos por patentes