La psicoacústica es la rama de la psicofísica que estudia científicamente la percepción del sonido por el sistema auditivo humano . Es la rama de la ciencia que estudia las respuestas psicológicas asociadas al sonido, incluyendo el ruido , el habla y la música . La psicoacústica es un campo interdisciplinario que abarca la psicología, la acústica , la ingeniería electrónica, la física, la biología, la fisiología y la informática. [ 1 ]
Fondo
La audición no es un fenómeno puramente mecánico de propagación de ondas , sino también un evento sensorial y perceptivo. Cuando una persona oye algo, ese algo llega al oído como una onda sonora mecánica que viaja por el aire, pero dentro del oído se transforma en potenciales de acción neuronales . Estos impulsos nerviosos viajan luego al cerebro, donde se perciben. Por lo tanto, en muchos problemas de acústica, como en el procesamiento de audio , es ventajoso tener en cuenta no solo la mecánica del entorno, sino también el hecho de que tanto el oído como el cerebro participan en la experiencia auditiva de una persona.
El oído interno , por ejemplo, realiza un procesamiento de señales significativo al convertir las formas de onda del sonido en estímulos neuronales; este procesamiento hace que ciertas diferencias entre las formas de onda sean imperceptibles. [ 2 ] Las técnicas de compresión de datos , como MP3 , aprovechan este hecho. [ 3 ] Además, el oído tiene una respuesta no lineal a sonidos de diferentes niveles de intensidad; esta respuesta no lineal se denomina sonoridad . Las redes telefónicas y los sistemas de reducción de ruido de audio aprovechan este hecho comprimiendo de forma no lineal las muestras de datos antes de la transmisión y luego expandiéndolas para su reproducción. [ 4 ] Otro efecto de la respuesta no lineal del oído es que los sonidos con frecuencias cercanas producen notas fantasma o productos de distorsión de intermodulación . [ 5 ]
Existen al menos cinco características para identificar prácticas psicoacústicas eficaces: sonoridad (medidas del volumen percibido), aspereza (disonancia sensorial), nitidez (distribución espectral), tonalidad (relación de los picos espectrales tonales) y amplitud (para predecir la amplitud percibida).
Otro procedimiento para reconocer géneros musicales o recomendar música consiste en eliminar una amplia gama de características objetivas que no están totalmente relacionadas con la percepción humana. Sin embargo, existen algunas características de bajo nivel que no están relacionadas con la percepción humana/física, pero que pueden mejorar el descubrimiento de la psicoacústica.
La primera, la raíz cuadrática media (RMS), es otra forma de medir el sonido, específicamente la sonoridad. La RMS es un proceso de medición importante porque ayuda a controlar el volumen. La atenuación espectral ayuda a equilibrar la frecuencia. La planitud espectral se considera para definir el nivel de ruido. Por último, la correlación cruzada entre canales estima la relación entre cómo un oído percibe el sonido y el otro. [ 6 ]
Límites de la percepción

El oído humano puede oír nominalmente sonidos en el rangoDe 20 a 20 000 Hz . El límite superior tiende a disminuir con la edad; la mayoría de los adultos no pueden oír por encima de este valor.16 000 Hz . En condiciones de laboratorio ideales, la frecuencia más baja que se ha identificado como un tono musical es de 12 Hz. [ 7 ] Los tonos entre 4 y 16 Hz se pueden percibir a través del sentido del tacto del cuerpo .
Se ha medido que la percepción humana de la separación temporal de la señal de audio es menor que10 μs . Esto no significa que las frecuencias superiores100 kHz (1/10 μs ) son audibles, pero esa discriminación temporal no está directamente relacionada con el rango de frecuencia. [ 8 ] [ 9 ]
La resolución de frecuencia del oído es de aproximadamente 3,6 Hz dentro de la octava de1000–2000 Hz Es decir, en un entorno clínico se pueden percibir cambios en el tono mayores de 3,6 Hz. [ 7 ] Sin embargo, incluso diferencias de tono más pequeñas pueden percibirse por otros medios. Por ejemplo, la interferencia de dos tonos a menudo se puede oír como una variación repetitiva en el volumen del tono. Esta modulación de amplitud ocurre con una frecuencia igual a la diferencia de frecuencias de los dos tonos y se conoce como batido .
La escala de semitonos utilizada en la notación musical occidental no es una escala de frecuencia lineal, sino logarítmica . Otras escalas se han derivado directamente de experimentos sobre la percepción auditiva humana, como la escala Mel y la escala Bark (que se utilizan para estudiar la percepción, pero no suelen emplearse en la composición musical). Estas escalas presentan una frecuencia aproximadamente logarítmica en el extremo de alta frecuencia, pero son casi lineales en el extremo de baja frecuencia.
El rango de intensidad de los sonidos audibles es enorme. Los tímpanos humanos son sensibles a las variaciones en la presión sonora y pueden detectar cambios de presión desde unos pocos micropascales (μPa) hasta mayores que100 kPa . Por esta razón, el nivel de presión sonora también se mide logarítmicamente, con todas las presiones referenciadas a20 μPa (o1,973 85 × 10 −10 atm ). Por lo tanto, el límite inferior de audibilidad se define como0 dB , pero el límite superior no está tan claramente definido. El límite superior es más bien una cuestión del potencial de causar pérdida auditiva inducida por ruido .
Una exploración más rigurosa de los límites inferiores de la audibilidad determina que el umbral mínimo en el que se puede oír un sonido depende de la frecuencia. Al medir esta intensidad mínima para tonos de prueba de varias frecuencias, se puede derivar una curva de umbral absoluto de audición (UAA) dependiente de la frecuencia. Típicamente, el oído muestra un pico de sensibilidad (es decir, su UAA más bajo) entre1–5 kHz , aunque el umbral cambia con la edad, y los oídos de las personas mayores muestran una sensibilidad reducida por encima de 2 kHz. [ 10 ]
El ATH es el más bajo de los contornos de igual sonoridad . Los contornos de igual sonoridad indican el nivel de presión sonora (dB SPL) en el rango de frecuencias audibles que se perciben como de igual sonoridad. Los contornos de igual sonoridad fueron medidos por primera vez por Fletcher y Munson en Bell Labs en 1933 utilizando tonos puros reproducidos a través de auriculares, y los datos que recopilaron se denominan curvas de Fletcher-Munson . Debido a que la sonoridad subjetiva era difícil de medir, las curvas de Fletcher-Munson se promediaron entre muchos sujetos. Robinson y Dadson refinaron el proceso en 1956 para obtener un nuevo conjunto de curvas de igual sonoridad para una fuente de sonido frontal medida en una cámara anecoica . Las curvas de Robinson-Dadson se estandarizaron como ISO 226 en 1986. En 2003, la ISO 226 se revisó utilizando datos recopilados de 12 estudios internacionales.
localización del sonido
La localización del sonido es el proceso de determinar la ubicación de una fuente sonora. El cerebro utiliza sutiles diferencias de volumen, tono y ritmo entre ambos oídos para permitirnos localizar las fuentes sonoras. [ 11 ] La localización se puede describir en términos de posición tridimensional: el acimut o ángulo horizontal, el cenit o ángulo vertical y la distancia (para sonidos estáticos) o la velocidad (para sonidos en movimiento). [ 12 ] Los humanos, como la mayoría de los animales de cuatro patas , son hábiles para detectar la dirección en el plano horizontal, pero menos en el plano vertical debido a la simetría de sus oídos. Algunas especies de búhos tienen los oídos colocados asimétricamente y pueden detectar el sonido en los tres planos, una adaptación para cazar pequeños mamíferos en la oscuridad. [ 13 ]
Efectos de enmascaramiento

Supongamos que un oyente puede oír una señal acústica determinada en condiciones de silencio. Cuando una señal se reproduce simultáneamente con otro sonido, la señal interferente debe ser más fuerte para que el oyente la oiga. Esta señal se conoce como enmascarador y la dificultad para oírla, como enmascaramiento . El enmascarador no necesita tener los componentes de frecuencia de la señal original para que se produzca el enmascaramiento. Una señal enmascarada puede oírse aunque sea más débil que el enmascarador. El enmascaramiento se produce cuando una señal y un enmascarador se reproducen simultáneamente —por ejemplo, cuando una persona susurra mientras otra grita— y el oyente no oye la señal más débil porque ha sido enmascarada por el enmascarador más fuerte. El enmascaramiento también puede ocurrir en una señal antes de que comience un enmascarador o después de que este termine. Por ejemplo, un aplauso fuerte y repentino puede hacer inaudibles los sonidos inmediatamente anteriores o posteriores. El efecto del enmascaramiento hacia atrás es más débil que el del enmascaramiento hacia adelante. [ 10 ] El efecto de enmascaramiento ha sido ampliamente estudiado en la investigación psicoacústica y se explota en la codificación de audio con pérdidas, como MP3 .
Falta fundamental
Cuando se les presenta una serie armónica de frecuencias en la relación 2 f , 3 f , 4 f , 5 f , etc. (donde f es una frecuencia específica), los humanos tienden a percibir que el tono es f . Un ejemplo audible se puede encontrar en YouTube. [ 14 ]
Música
La psicoacústica abarca temas y estudios relevantes para la psicología de la música y la musicoterapia . Teóricos como Benjamin Boretz consideran que algunos de los resultados de la psicoacústica solo tienen sentido en un contexto musical. [ 15 ]
Los LP de la serie Environments de Irv Teibel (1969-79) son un ejemplo temprano de sonidos disponibles comercialmente lanzados expresamente para mejorar las capacidades psicológicas. [ 16 ]
Psicoacústica aplicada

La psicoacústica ha mantenido durante mucho tiempo una relación simbiótica con la informática . Los pioneros de Internet JCR Licklider y Bob Taylor realizaron estudios de posgrado en psicoacústica, mientras que BBN Technologies se especializó originalmente en consultoría sobre cuestiones acústicas antes de comenzar a construir la primera red de conmutación de paquetes .
Licklider escribió un artículo titulado "Una teoría dúplex de la percepción del tono". [ 17 ]
La psicoacústica se aplica en muchos campos del desarrollo de software, donde los desarrolladores mapean patrones matemáticos probados y experimentales en el procesamiento de señales digitales. Muchos códecs de compresión de audio, como MP3 y Opus, utilizan un modelo psicoacústico para aumentar las tasas de compresión. El éxito de los sistemas de audio convencionales para la reproducción de música en teatros y hogares puede atribuirse a la psicoacústica [ 18 ] y las consideraciones psicoacústicas dieron lugar a nuevos sistemas de audio, como la síntesis de campo sonoro psicoacústico . [ 19 ] Además, los científicos han experimentado con éxito limitado en la creación de nuevas armas acústicas, que emiten frecuencias que pueden dañar, perjudicar o matar. [ 20 ] La psicoacústica también se aprovecha en la sonificación para hacer audibles y fácilmente interpretables múltiples dimensiones de datos independientes. [ 21 ] Esto permite la guía auditiva sin necesidad de audio espacial y en los videojuegos de sonificación [ 22 ] y otras aplicaciones, como el vuelo de drones y la cirugía guiada por imágenes . [ 23 ] También se aplica hoy en día en la música, donde músicos y artistas siguen creando nuevas experiencias auditivas al enmascarar frecuencias no deseadas de los instrumentos, lo que provoca que otras frecuencias se realcen. Otra aplicación se encuentra en el diseño de altavoces pequeños o de menor calidad, que pueden utilizar el fenómeno de la ausencia de frecuencias fundamentales para producir el efecto de notas graves a frecuencias más bajas de las que los altavoces son físicamente capaces de generar (véanse las referencias).
Los fabricantes de automóviles diseñan sus motores e incluso sus puertas para que tengan un sonido determinado. [ 24 ]
Codificación de audio perceptiva

El modelo psicoacústico permite una compresión de señal con pérdida de alta calidad al describir qué partes de una señal de audio digital determinada pueden eliminarse o reproducirse con calidad reducida sin una pérdida significativa en la calidad percibida del sonido. Esto proporciona una gran ventaja a la relación de compresión general, y el análisis psicoacústico suele generar archivos de música comprimidos que ocupan entre una décima y una doceava parte del tamaño de los másteres de alta calidad, pero con una pérdida de calidad proporcionalmente menor. Esta compresión es una característica de casi todos los formatos modernos de compresión de audio con pérdida. Algunos de estos formatos incluyen Dolby Digital (AC-3), MP3 , Opus , Ogg Vorbis , AAC , WMA , MPEG-1 Layer II (utilizado para la radiodifusión de audio digital en varios países) y ATRAC , la compresión utilizada en MiniDisc y algunos modelos de Walkman .
La psicoacústica se basa en gran medida en la anatomía humana , especialmente en las limitaciones del oído para percibir el sonido, como se describió anteriormente. En resumen, las principales limitaciones son:
- Límite de alta frecuencia
- Umbral absoluto de audición
- Enmascaramiento temporal (enmascaramiento hacia adelante, enmascaramiento hacia atrás)
- Enmascaramiento simultáneo (también conocido como enmascaramiento espectral)
Un algoritmo de compresión puede asignar menor prioridad a los sonidos que se encuentran fuera del rango de audición humana y reducir la precisión de las diferentes frecuencias según el nivel de enmascaramiento previsto. Al desplazar cuidadosamente los bits de los componentes menos importantes hacia los más relevantes, el algoritmo garantiza que los sonidos que el oyente tiene más probabilidades de percibir se representen con la mayor precisión posible.
Los codificadores de audio analizan el audio mediante un modelo perceptivo (modelo psicoacústico) para calcular la precisión requerida por banda de frecuencia o sección temporal. Los resultados de este cálculo se utilizan para ajustar la precisión de la codificación en función de la frecuencia y el tiempo mediante un conjunto de herramientas de codificación que dependen del formato de codificación de audio, ya que los diferentes formatos admiten distintas herramientas.
Algunos ejemplos de este tipo de herramientas de codificación son:
- Filtrado de frecuencia ( paso bajo , paso alto )
- Transformar la selección de ventana (tamaño y modelo)
- Codificación estéreo conjunta
- Estéreo paramétrico
- Recuantificación de muestras
- Cuantización no lineal
- Cuantización vectorial
- Conformación de ruido temporal (TNS)
- Sustitución de ruido perceptivo (PNS)
- Replicación de banda espectral (SBR)
En muchos codificadores, un algoritmo de control de velocidad garantiza que la tasa de bits resultante del audio codificado se mantenga dentro de los límites definidos. Si no se puede lograr una codificación transparente a la tasa de bits objetivo, los algoritmos de control de velocidad ajustarán la precisión de la codificación (e introducirán distorsión) en diversas partes del espectro sonoro, basándose en los datos calculados por el modelo psicoacústico, hasta que se pueda alcanzar la tasa de bits objetivo.
Véase también
- Ponderación A , una función de transferencia de sonoridad perceptual de uso común
- Prueba ABX
- Audiología
- Análisis de escenas auditivas , incluyendo percepción de sonido 3D y localización.
- Latidos binaurales
- Sonido de raspado de la pizarra , sonido de uñas raspando la pizarra
- Ancho de banda rectangular equivalente (ERB)
- Efectos del ruido en la salud
- Efecto hipersónico
- Procesamiento del lenguaje en el cerebro
- misofonía
- afinación musical
- Efecto de precedencia
- Psicolingüística
- teoría de la distorsión de la tasa
- separación de señales
- enmascaramiento de sonido
- Percepción del habla
- Reconocimiento de voz
- Timbre
Referencias
Notas
- ↑ Ballou, Glen (12 de noviembre de 2012). Manual para ingenieros de sonido (Cuarta edición). Taylor & Francis . pág. 43. ISBN 9781136122538.
- ↑ Christopher J. Plack (2005). El sentido del oído . Routledge. ISBN 978-0-8058-4884-7.
- ↑ Lars Ahlzen; Clarence Song (2003). The Sound Blaster Live! Book . No Starch Press. ISBN 978-1-886411-73-9.
- ↑ Rudolf F. Graf (1999). Diccionario moderno de electrónica . Newnes. ISBN 978-0-7506-9866-5.
- ↑ Jack Katz; Robert F. Burkard y Larry Medwetsky (2002). Manual de audiología clínica . Lippincott Williams & Wilkins. ISBN 978-0-683-30765-8.
- ↑ Ziemer, Tim; Yu, Yi; Tang, Suhua (8 de diciembre de 2016). «Uso de modelos psicoacústicos para el análisis del sonido en la música» . Actas de la 8.ª Reunión Anual del Foro para la Evaluación de la Recuperación de Información . FIRE '16. Nueva York, NY, EE. UU.: Association for Computing Machinery. págs. 1-7 . doi : 10.1145/3015157.3015158 . ISBN 978-1-4503-4838-6.
- 1 2 Olson, Harry F. (1967). Música, física e ingeniería . Dover Publications. págs. 248–251 . ISBN 978-0-486-21769-7.
- ↑ Kuncher, Milind (agosto de 2007). "Audibilidad de la distorsión temporal y la desalineación temporal de las señales acústicas" (PDF) . boson.physics.sc.edu . Archivado (PDF) del original el 14 de julio de 2014.
- ↑ Robjohns, Hugh (agosto de 2016). "Precisión en el dominio del tiempo de MQA y calidad de audio digital" . soundonsound.com . Sound On Sound. Archivado del original el 10 de marzo de 2023.
- 1 2 Fastl, Hugo; Zwicker, Eberhard (2006). Psicoacústica: hechos y modelos . Springer. págs. 21–22 . ISBN 978-3-540-23159-2.
- ↑ Thompson, Daniel M. Comprender el audio: cómo sacar el máximo provecho de su proyecto o estudio de grabación profesional. Boston, MA: Berklee, 2005. Impreso.
- ↑ Roads, Curtis. Tutorial de música por ordenador. Cambridge, MA: MIT, 2007. Impreso.
- ↑ Lewis, DP (2007): Orejas de búho y audición. Owl Pages [En línea]. Disponible en: http://www.owlpages.com/articles.php?section=Owl+Physiology&title=Hearing [5 de abril de 2011]
- ↑ Acústico, Musical (9 de marzo de 2015). "Missing Fundamental" . YouTube . Archivado del original el 20 de diciembre de 2021. Recuperado el 19 de agosto de 2019 .
- ↑ Sterne, Jonathan (2003). El pasado audible: Orígenes culturales de la reproducción del sonido . Durham: Duke University Press. ISBN 9780822330134.
- ↑ Cummings, Jim. "Irv Teibel murió esta semana: creador de los LP "Environments" de la década de 1970" . Earth Ear . Consultado el 18 de noviembre de 2015 .
- ↑ Licklider, JCR (enero de 1951). "Una teoría dúplex de la percepción del tono" (PDF) . The Journal of the Acoustical Society of America . 23 (1): 147. Bibcode : 1951ASAJ...23..147L . doi : 10.1121/1.1917296 . Archivado (PDF) del original el 2 de septiembre de 2016.
- ↑ Ziemer, Tim (2020). «Sonido estereofónico convencional». Síntesis del campo sonoro de la música psicoacústica . Investigación actual en musicología sistemática. Vol. 7. Cham: Springer. pp. 171–202 . doi : 10.1007/978-3-030-23033-3_7 . ISBN 978-3-030-23033-3. S2CID 201142606 .
- ↑ Ziemer, Tim (2020). Síntesis de campos sonoros de música psicoacústica . Investigación actual en musicología sistemática. Vol. 7. Cham: Springer. doi : 10.1007/978-3-030-23033-3 . ISBN 978-3-030-23032-6ISSN 2196-6974 . S2CID 201136171 .
- ↑ "La investigación sobre energía acústica recibe una nota discordante" . Archivado del original el 19 de julio de 2010. Consultado el 6 de febrero de 2010 .
- ↑ Ziemer, Tim; Schultheis, Holger; Black, David; Kikinis, Ron (2018). "Sonificación interactiva psicoacústica para navegación de corto alcance". Acta Acustica United with Acustica . 104 (6): 1075– 1093. doi : 10.3813/AAA.919273 . S2CID 125466508 .
- ↑ CURAT. "Juegos y entrenamiento para cirugía mínimamente invasiva" . CURAT . Universidad de Bremen . Consultado el 15 de julio de 2020 .
- ↑ Ziemer, Tim; Nuchprayoon, Nuttawut; Schultheis, Holger (2019). "Sonificación psicoacústica como interfaz de usuario para la interacción humano-máquina". Revista Internacional de la Sociedad de Informática . 12 (1). arXiv : 1912.08609 . doi : 10.13140/RG.2.2.14342.11848 .
- ↑ Tarmy, James (5 de agosto de 2014). "Las puertas de Mercedes tienen un sonido característico: aquí te contamos cómo" . Bloomberg Business . Consultado el 10 de agosto de 2020 .
Fuentes
- E. Larsen y RM Aarts (2004), Extensión del ancho de banda de audio. Aplicación de la psicoacústica, el procesamiento de señales y el diseño de altavoces. , J. Wiley.
- Larsen E.; Aarts RM (marzo de 2002). "Reproducción de señales de baja frecuencia a través de altavoces pequeños" (PDF) . Journal of the Audio Engineering Society . 50 (3): 147– 64.
- Oohashi T.; Kawai N.; Nishina E.; Honda M.; Yagi R.; Nakamura S.; Morimoto M.; Maekawa T.; Yonekura Y.; Shibasaki H. (febrero de 2006). "El papel de sistemas biológicos distintos de la conducción aérea auditiva en la aparición del efecto hipersónico" . Brain Research . 1073–1074 : 339–347 . doi : 10.1016/j.brainres.2005.12.096 . PMID 16458271 .
Enlaces externos
- El oído musical: la percepción del sonido en Wayback Machine (archivado el 25/12/2005)
- Müller C, Schnider P, Persterer A, Opitz M, Nefjodova MV, Berger M (1993). "Psicoacústica aplicada en los vuelos espaciales". Wien Med Wochenschr (en alemán). 143 ( 23– 24): 633– 5. PMID 8178525 . —Simulación de la audición en campo libre mediante auriculares
- Enmascaramiento temporal
- Conceptos de HyperPhysics: Sonido y audición
- Psicoacústica
- Musicología cognitiva
- psicología de la música
- Acústica