La audición computarizada ( AC ) o escucha automática es el campo general de estudio de algoritmos y sistemas para la interpretación de audio por máquinas. [ 1 ] [ 2 ] Dado que la noción de lo que significa que una máquina "escuche" es muy amplia y algo vaga, la audición computarizada intenta reunir varias disciplinas que originalmente se ocupaban de problemas específicos o tenían en mente una aplicación concreta. El ingeniero Paris Smaragdis , entrevistado en Technology Review , habla de estos sistemas : "software que utiliza el sonido para localizar personas que se mueven por habitaciones, monitorear maquinaria para detectar averías inminentes o activar cámaras de tráfico para registrar accidentes". [ 3 ]
Inspirada en modelos de audición humana , la CA aborda cuestiones de representación, transducción , agrupación, uso del conocimiento musical y semántica sonora general con el fin de realizar operaciones inteligentes sobre señales de audio y música mediante la computadora. Técnicamente, esto requiere una combinación de métodos de los campos del procesamiento de señales , el modelado auditivo , la percepción y cognición musical , el reconocimiento de patrones y el aprendizaje automático , así como métodos más tradicionales de inteligencia artificial para la representación del conocimiento musical. [ 4 ] [ 5 ]
Aplicaciones
Al igual que la visión artificial frente al procesamiento de imágenes, la audición computarizada frente a la ingeniería de audio se centra en la comprensión del audio en lugar de su procesamiento. También se diferencia de los problemas de comprensión del habla por parte de las máquinas, ya que trabaja con señales de audio generales, como sonidos naturales y grabaciones musicales.
Las aplicaciones de la audición computarizada son muy variadas e incluyen la búsqueda de sonidos , el reconocimiento de géneros , la monitorización acústica, la transcripción musical , el seguimiento de partituras, la textura de audio , la improvisación musical , la expresión de emociones en el audio , etc.
Disciplinas relacionadas
La audición por ordenador se solapa con las siguientes disciplinas:
- Recuperación de información musical : métodos para la búsqueda y el análisis de similitudes entre señales musicales.
- Análisis de la escena auditiva : comprensión y descripción de las fuentes y los eventos de audio.
- Musicología computacional y teoría matemática de la música: uso de algoritmos que emplean el conocimiento musical para el análisis de datos musicales.
- Música por ordenador : uso de ordenadores en aplicaciones musicales creativas.
- La maestría musical de las máquinas: sistemas musicales interactivos basados en audiciones.
Áreas de estudio
Dado que las señales de audio son interpretadas por el sistema oído-cerebro humano, este complejo mecanismo perceptivo debe simularse de alguna manera en el software para la "escucha artificial". En otras palabras, para funcionar a la par con los humanos, la computadora debe oír y comprender el contenido de audio de forma similar a como lo hacen los humanos. El análisis preciso del audio involucra varios campos: ingeniería eléctrica (análisis de espectro, filtrado y transformaciones de audio); inteligencia artificial (aprendizaje automático y clasificación de sonido); [ 6 ] psicoacústica (percepción del sonido); ciencias cognitivas (neurociencia e inteligencia artificial); [ 7 ] acústica (física de la producción de sonido); y música (armonía, ritmo y timbre). Además, las transformaciones de audio, como el cambio de tono, la extensión temporal y el filtrado de objetos de sonido, deben tener significado perceptivo y musical. Para obtener los mejores resultados, estas transformaciones requieren una comprensión perceptiva de los modelos espectrales, la extracción de características de alto nivel y el análisis/síntesis de sonido. Finalmente, la estructuración y codificación del contenido de un archivo de audio (sonido y metadatos) podría beneficiarse de esquemas de compresión eficientes, que descartan la información inaudible del sonido. [ 8 ] Los modelos computacionales de percepción y cognición de la música y el sonido pueden conducir a una representación más significativa, una manipulación digital más intuitiva y la generación de sonido y música en interfaces hombre-máquina musicales.
El estudio del análisis de componentes principales (AC) podría dividirse aproximadamente en los siguientes subproblemas:
- Representación: señal y simbólica. Este aspecto se ocupa de las representaciones tiempo-frecuencia, tanto en términos de notas como de modelos espectrales, incluyendo la reproducción de patrones y la textura de audio.
- Extracción de características : descriptores de sonido, segmentación, inicio, detección de tono y envolvente , croma y representaciones auditivas.
- Estructuras del conocimiento musical: análisis de la tonalidad , el ritmo y las armonías .
- Similitud sonora: métodos para la comparación entre sonidos, identificación de sonidos, detección de novedades, segmentación y agrupamiento.
- Modelado de secuencias: correspondencia y alineación entre señales y secuencias de notas.
- Separación de fuentes: métodos de agrupación de sonidos simultáneos, como la detección de múltiples tonos y los métodos de agrupamiento tiempo-frecuencia.
- Cognición auditiva: modelado de emociones, anticipación y familiaridad, sorpresa auditiva y análisis de la estructura musical.
- Análisis multimodal : búsqueda de correspondencias entre señales textuales, visuales y auditivas.
Cuestiones de representación
La audición computarizada se ocupa de señales de audio que pueden representarse de diversas maneras, desde la codificación directa de audio digital en dos o más canales hasta instrucciones de síntesis representadas simbólicamente. Las señales de audio suelen representarse mediante grabaciones analógicas o digitales . Las grabaciones digitales son muestras de la forma de onda acústica o parámetros de algoritmos de compresión de audio . Una de las propiedades únicas de las señales musicales es que a menudo combinan diferentes tipos de representaciones, como partituras gráficas y secuencias de acciones de interpretación codificadas como archivos MIDI .
Dado que las señales de audio suelen estar compuestas por múltiples fuentes de sonido, a diferencia de las señales de voz, que pueden describirse eficazmente mediante modelos específicos (como el modelo fuente-filtro), resulta difícil diseñar una representación paramétrica para el audio en general. Las representaciones de audio paramétricas suelen utilizar bancos de filtros o modelos sinusoidales para capturar múltiples parámetros de sonido, aumentando a veces el tamaño de la representación para capturar la estructura interna de la señal. Otros tipos de datos relevantes para la audición computarizada son las descripciones textuales del contenido de audio, como anotaciones, reseñas e información visual en el caso de grabaciones audiovisuales.
Características
La descripción del contenido de las señales de audio generales suele requerir la extracción de características que capturen aspectos específicos de la señal. En términos generales, estas características se pueden dividir en descriptores de señal o matemáticos, como la energía, la descripción de la forma espectral, etc.; caracterización estadística, como la detección de cambios o novedades; y representaciones especiales que se adaptan mejor a la naturaleza de las señales musicales o del sistema auditivo, como el crecimiento logarítmico de la sensibilidad ( ancho de banda ) en frecuencia o la invariancia de octava (croma).
Dado que los modelos paramétricos en audio suelen requerir muchos parámetros, las características se utilizan para resumir las propiedades de múltiples parámetros en una representación más compacta o destacada.
Conocimientos musicales
Es posible encontrar estructuras musicales específicas utilizando conocimientos musicales, así como métodos de aprendizaje automático supervisado y no supervisado. Algunos ejemplos incluyen la detección de la tonalidad según la distribución de frecuencias que corresponden a patrones de aparición de notas en escalas musicales, la distribución de los tiempos de inicio de las notas para la detección de la estructura rítmica, la distribución de energías en diferentes frecuencias para detectar acordes musicales, entre otros.
Similitud de sonido y modelado de secuencias
La comparación de sonidos puede realizarse comparando sus características con o sin referencia temporal. En algunos casos, se puede evaluar la similitud general mediante valores cercanos de las características entre dos sonidos. En otros casos, cuando la estructura temporal es importante, es necesario aplicar métodos de deformación temporal dinámica para "corregir" las diferentes escalas temporales de los eventos acústicos. Encontrar repeticiones y subsecuencias similares de eventos sonoros es importante para tareas como la síntesis de texturas y la improvisación automática .
Separación de fuentes
Dado que una de las características básicas del audio general es que comprende múltiples fuentes sonoras simultáneas, como varios instrumentos musicales, personas hablando, ruidos de máquinas o vocalizaciones de animales, la capacidad de identificar y separar fuentes individuales es muy deseable. Desafortunadamente, no existen métodos que puedan resolver este problema de manera robusta . Los métodos existentes de separación de fuentes se basan a veces en la correlación entre diferentes canales de audio en grabaciones multicanal . La capacidad de separar fuentes de señales estéreo requiere técnicas diferentes a las que se aplican habitualmente en comunicaciones donde se dispone de múltiples sensores. Otros métodos de separación de fuentes se basan en el entrenamiento o la agrupación de características en grabaciones mono, como el seguimiento de parciales armónicamente relacionados para la detección de múltiples tonos. Algunos métodos, antes del reconocimiento explícito, se basan en revelar estructuras en los datos sin conocer dichas estructuras (como reconocer objetos en imágenes abstractas sin atribuirles etiquetas significativas) al encontrar las representaciones de datos menos complejas, por ejemplo, describiendo escenas de audio como generadas por unos pocos patrones de tonos y sus trayectorias (voces polifónicas) y contornos acústicos dibujados por un tono (acordes). [ 9 ]
Cognición auditiva
Escuchar música y audio en general no suele ser una actividad orientada a una tarea específica. Las personas disfrutan de la música por diversas razones aún no del todo claras, que comúnmente se relacionan con el efecto emocional que genera, debido a la creación de expectativas y su posterior cumplimiento o incumplimiento. Los animales prestan atención a las señales de peligro en los sonidos, que pueden ser nociones específicas o generales de cambios sorprendentes e inesperados. En general, esto crea una situación en la que la audición computarizada no puede depender únicamente de la detección de características o propiedades sonoras específicas, sino que debe desarrollar métodos generales para adaptarse a un entorno auditivo cambiante y monitorear su estructura. Esto implica el análisis de estructuras de repetición y autosimilitud más amplias en el audio para detectar innovaciones, así como la capacidad de predecir la dinámica de las características locales.
Análisis multimodal
Entre los datos disponibles para describir la música, se encuentran representaciones textuales, como notas de álbumes, reseñas y críticas que describen el contenido de audio con palabras. En otros casos, las reacciones humanas, como juicios emocionales o mediciones psicofisiológicas, pueden aportar información sobre el contenido y la estructura del audio. La Audición Computarizada busca relaciones entre estas diferentes representaciones para brindar una comprensión más profunda del contenido de audio.
Véase también
Enlaces externos
- Laboratorio de Audición por Computadora de la UCSD
- Recursos de audición por computadora de George Tzanetakis
- Tutorial de Shlomo Dubnov sobre audición por computadora
- Departamento de Ingeniería Eléctrica, IIT (Bangalore)
- Computación de Sonido y Música, Universidad de Aalborg, Copenhague, Dinamarca
Referencias
- ↑ Audición automática: principios, algoritmos y sistemas . IGI Global. 2011. ISBN 9781615209194.
- ↑ "Audición por máquina: principios, algoritmos y sistemas" (PDF) .
- ↑ Paris Smaragdis enseñó a las computadoras a reproducir música más realista.
- ↑ Tanguiane (Tangian), Andranick (1993). Percepción artificial y reconocimiento musical . Lecture Notes in Artificial Intelligence. Vol. 746. Berlín-Heidelberg: Springer. ISBN 978-3-540-57394-4.
- ↑ Tanguiane (Tanguiane), Andranick (1994). "Un principio de correlatividad de la percepción y su aplicación al reconocimiento musical". Music Perception . 11 (4): 465– 502. doi : 10.2307/40285634 . JSTOR 40285634 .
- ↑ Kelly, Daniel; Caulfield, Brian (febrero de 2015). "Detección sonora generalizada: un enfoque de entrenamiento débilmente supervisado" . IEEE Transactions on Cybernetics . 46 (1): 123–135 . doi : 10.1109/TCYB.2015.2396291 . hdl : 10197/6853 . PMID 25675471. S2CID 16042016 .
- ↑ Hendrik Purwins, Perfecto Herrera, Maarten Grachten, Amaury Hazan, Ricard Marxer y Xavier Serra. Modelos computacionales de percepción y cognición musical I: La cadena de procesamiento perceptivo y cognitivo. Physics of Life Reviews, vol. 5, n.º 3, págs. 151-168, 2008.
- ↑ Página web del curso de escucha automática del MIT
- ↑ Tanguiane (Tangian), Andranick (1995). "Hacia la axiomatización de la percepción musical". Journal of New Music Research . 24 (3): 247– 281. doi : 10.1080/09298219508570685 .
- Inteligencia artificial
- Procesamiento digital de señales