El audio semántico consiste en la extracción de significado de las señales de audio . Este campo se basa principalmente en el análisis del audio para crear metadatos significativos, que luego pueden utilizarse de diversas maneras.
Análisis semántico
El análisis semántico del audio se realiza para revelar una comprensión más profunda de una señal de audio. Esto generalmente da como resultado descriptores de metadatos de alto nivel , como acordes musicales y tempo, o la identificación de la persona que habla, para facilitar la gestión basada en el contenido de las grabaciones de audio. En los últimos años, el crecimiento de las técnicas de análisis automático de datos ha crecido considerablemente,
- Recuperación de información musical
- Reconocimiento de sonido
- Segmentación del habla
- Transcripción musical automática
- separación ciega de fuentes
- similitud musical
- Indexación, hash y búsqueda de audio
- Monitoreo de transmisiones
- Análisis de la interpretación musical
Aplicaciones
Con el desarrollo de aplicaciones que utilizan esta información semántica para ayudar al usuario a identificar, organizar y explorar señales de audio, e interactuar con ellas. Estas aplicaciones incluyen la recuperación de información musical, tecnologías de la web semántica, producción de audio, reproducción de sonido, educación y videojuegos. La tecnología semántica implica algún tipo de comprensión del significado de la información que maneja y, para ello, puede incorporar aprendizaje automático, procesamiento digital de señales, procesamiento del habla, separación de fuentes, modelos perceptuales de la audición, conocimiento musicológico, metadatos y ontologías.
Además de las tecnologías de recuperación y recomendación de audio, la semántica de las señales de audio cobra cada vez más importancia, por ejemplo, en la codificación de audio basada en objetos, así como en la edición y el procesamiento de audio inteligente. Los lanzamientos recientes de productos ya lo demuestran en gran medida; sin embargo, se vislumbran funcionalidades más innovadoras basadas en el análisis y la gestión semántica del audio. Estas funcionalidades pueden utilizar, por ejemplo, la separación (informada) de fuentes de audio, la segmentación e identificación de locutores, la segmentación estructural de la música o tecnologías de la Web Semántica y social , incluidas las ontologías y los datos abiertos enlazados.
El reconocimiento de voz es una importante aplicación de audio semántico. Sin embargo, para el habla, otras operaciones semánticas incluyen la identificación del idioma , la identificación del hablante o la identificación del género. Para audio o música en general, incluye la identificación de una pieza musical (por ejemplo, Shazam, una aplicación de música ) o la banda sonora de una película.
Las áreas de investigación en audio semántico incluyen la capacidad de etiquetar una forma de onda de audio indicando dónde cambian las armonías, cuáles son, dónde se repite el material y qué instrumentos están sonando.
Audio semántico y la Web Semántica
La Web Semántica proporciona un marco potente para la expresión y reutilización de datos estructurados. El uso y almacenamiento de descriptores de audio semánticos en el marco de la web semántica permite un mayor alcance y un estándar unificado para almacenar y gestionar los metadatos de audio semánticos asociados. Se han desarrollado varias ontologías para almacenar y gestionar audio en la web semántica, incluida la Ontología Musical., la (Ontología de estudio)y la (ontología de características de audio)
Audición semántica
Se ha propuesto la audición semántica para auriculares, permitiendo a los usuarios seleccionar los sonidos que desean escuchar en su entorno, basándose en su descripción semántica. [ 1 ] Esta tecnología de auriculares con cancelación de ruido utiliza redes neuronales en tiempo real para que los usuarios puedan volver a escuchar ciertos sonidos que deseen oír, como el llanto de bebés, el canto de los pájaros o el sonido de las alarmas. [ 2 ] Este tipo de capacidad en auriculares y audífonos podría proporcionar a los usuarios cierto control sobre los sonidos que los rodean. Esto podría beneficiar a personas que requieren una escucha concentrada para su trabajo, como profesionales de la salud, militares e ingenieros, o trabajadores de fábricas o de la construcción, así como para el diseño de audífonos inteligentes. [ 2 ]
Véase también
Referencias
- ↑ Veluri, Bandhav; Itani, Malek; Chan, Justin; Yoshioka, Takuya; Gollakota, Shyamnath (29 de octubre de 2023). «Audición semántica: programación de escenas acústicas con dispositivos auditivos binaurales» . Actas del 36.º Simposio Anual de la ACM sobre Software y Tecnología de Interfaz de Usuario . UIST '23. Nueva York, NY, EE. UU.: Association for Computing Machinery. págs. 1-15 . arXiv : 2311.00320 . doi : 10.1145/3586183.3606779 . ISBN 979-8-4007-0132-0.
- 1 2 "Los auriculares con cancelación de ruido podrían permitirte elegir los sonidos que quieres escuchar" . MIT Technology Review . Consultado el 11 de noviembre de 2023 .
Enlaces externos
- Tutorial sobre separación de fuentes
- El Comité Técnico de Análisis Semántico de Audio de la Audio Engineering Society
- 42.ª Conferencia Internacional de la AES sobre Audio Semántico
- 53.ª Conferencia Internacional de la AES sobre Audio Semántico
- Conferencia Internacional AES 2017 sobre Audio Semántico
- Acústica
- Ingeniería de audio
- Web semántica