El análisis de voz es el estudio de los sonidos del habla con fines distintos al contenido lingüístico, como el reconocimiento de voz . Dichos estudios incluyen principalmente el análisis médico de la voz ( foníatría ), pero también la identificación del hablante . [1] De manera más controvertida, algunos creen que la veracidad o el estado emocional de los hablantes se puede determinar mediante el análisis del estrés de la voz o el análisis de voz en capas.
Métodos de análisis
Los problemas de voz que requieren análisis de voz se originan más comúnmente en las cuerdas vocales o en la musculatura laríngea que las controla, ya que las cuerdas están sujetas a fuerzas de colisión con cada ciclo vibratorio y al secado por el aire que se fuerza a través del pequeño espacio entre ellas, y la musculatura laríngea es intensamente activa durante el habla o el canto y está sujeta a cansancio. Sin embargo, el análisis dinámico de las cuerdas vocales y su movimiento es físicamente difícil. La ubicación de las cuerdas vocales prohíbe efectivamente la medición directa e invasiva del movimiento. Los métodos de imagen menos invasivos, como los rayos X o las ecografías, no funcionan porque las cuerdas vocales están rodeadas de cartílago, lo que distorsiona la calidad de la imagen. Los movimientos en las cuerdas vocales son rápidos, las frecuencias fundamentales suelen estar entre 80 y 300 Hz , lo que impide el uso de videos ordinarios. Los videos estroboscópicos y de alta velocidad brindan una opción, pero para ver las cuerdas vocales se debe colocar una sonda de fibra óptica que conduce a la cámara en la garganta, lo que dificulta el habla. Además, la colocación de objetos en la faringe suele desencadenar un reflejo nauseoso que detiene la vocalización y cierra la laringe. Además, la obtención de imágenes estroboscópicas solo es útil cuando el patrón vibratorio de las cuerdas vocales es muy periódico.
Los métodos indirectos más importantes [ ¿según quién? ] son actualmente el filtrado inverso de grabaciones de micrófono o de flujo de aire oral y la electroglotografía (EGG). [ cita requerida ] En el filtrado inverso, el sonido del habla (la forma de onda de presión acústica radiada, tal como se obtiene de un micrófono) o la forma de onda del flujo de aire oral de una máscara con ventilación circunferencial (CV) se graba fuera de la boca y luego se filtra mediante un método matemático para eliminar los efectos del tracto vocal. Este método estima la entrada glótica de la producción de voz registrando la salida y utilizando un modelo computacional para invertir los efectos del tracto vocal. El otro tipo de indicación indirecta no invasiva del movimiento de las cuerdas vocales es la electroglotografía, en la que electrodos colocados a ambos lados de la garganta del sujeto a nivel de las cuerdas vocales registran los cambios en la conductividad de la garganta según el tamaño de la porción de las cuerdas vocales que se tocan entre sí. Por lo tanto, produce información unidimensional del área de contacto. Ni el filtrado inverso ni el EGG son suficientes para describir completamente el complejo patrón tridimensional del movimiento de las cuerdas vocales, pero pueden proporcionar evidencia indirecta útil de ese movimiento.
Otra forma de realizar un análisis de voz es observar las características de la voz. Algunas características de la voz son la fonación , el tono , la intensidad y la velocidad. Estas características se pueden utilizar para evaluar la voz de una persona y pueden ayudar en el proceso de análisis de voz. La fonación generalmente se prueba observando diferentes tipos de datos recopilados de una persona, como palabras con vocales largas, palabras con muchos fonemas o simplemente el habla típica. El tono de una persona se puede evaluar haciendo que la persona produzca los sonidos más altos y más bajos que pueda, así como los sonidos intermedios. Se puede utilizar un teclado para ayudar en este proceso. La intensidad es valiosa para observar porque para ciertas personas, la intensidad afecta la forma en que producen ciertos sonidos. Algunas personas necesitan hablar más alto para ciertos fonemas en comparación con otros solo para poder producirlos. [ cita requerida ] Esto se puede probar pidiéndole a la persona que use la misma cantidad de volumen mientras canta una escala. La velocidad también es importante porque observa qué tan rápido o lento habla una persona.
[2]
Uso en medicina
Un estudio médico de la voz puede consistir, por ejemplo, en el análisis de la voz de pacientes a los que se les ha extirpado un pólipo de las cuerdas vocales mediante una operación. Se pueden utilizar métodos informáticos para evaluar estos aspectos de forma objetiva. [3] Un terapeuta de voz experimentado puede evaluar la voz de forma bastante fiable, pero esto requiere una formación exhaustiva y sigue siendo subjetivo.
Otro tema de investigación activo en el análisis de la voz médica es la evaluación de la carga vocal . Las cuerdas vocales de una persona que habla durante un tiempo prolongado sufren cansancio, es decir, el proceso de hablar ejerce una carga sobre las cuerdas vocales y cansa el tejido. Entre los usuarios profesionales de la voz (por ejemplo, profesores, vendedores), este cansancio puede provocar fallos en la voz y bajas por enfermedad. El análisis de la voz se ha estudiado como un medio objetivo para evaluar tales problemas. [4]
El análisis de voz fue un factor importante en el estudio de la parálisis de las cuerdas vocales. Afecta diferentes funciones de las cuerdas vocales, desde el habla hasta la respiración, y el análisis de voz se utiliza para estudiar la eficacia de las mejoras de la tiroplastia (tiroplastia de medialización) en las cuerdas vocales después de la cirugía. La grabación de voz tradicional se utiliza en la preoperación para grabar las voces de los pacientes elegidos para compararlas con el uso posterior a la operación, junto con grabaciones más complejas utilizando una electroglotografía, fotoglotografía [ 5] y videoquimografía . Los profesionales médicos tienen la capacidad de leer y comprender los resultados de las grabaciones complejas, pero se necesita el conocimiento de un profesional de la voz dentro de estos experimentos para obtener resultados precisos. Los expertos en voz fueron importantes para vincular el examen físico de las cuerdas vocales con el examen neurológico para garantizar el éxito de la cirugía debido a su oído entrenado. La evaluación perceptiva de la voz depende en gran medida de la calidad de la voz , un factor evaluado preferiblemente por especialistas en voz ( terapeutas del habla ). Un analizador de voz profesional tiene un oído entrenado y puede bloquear las variantes excesivas que pueden ser engañosas en los resultados. [6]
Uso en la ciencia forense
El análisis de voz se utiliza en una rama de la ciencia forense llamada análisis forense de audio . Estos análisis se realizan generalmente sobre evidencia con el fin de evaluar la autenticidad del audio en cuestión, mejorar las características del audio que pueden estar ocultas bajo un ruido de fondo que distraiga, interpretar el audio desde la perspectiva de un experto forense [7] o, en algunos casos, con el fin de identificar al hablante [8] .
Un experto empleará una variedad de técnicas en su análisis. Los procedimientos mínimos son "escucha crítica, análisis de forma de onda y análisis espectral ". [9] La escucha crítica implica un análisis minucioso de los sonidos de fondo y de primer plano mediante una escucha repetitiva. [9] El análisis de forma de onda visualiza el audio para que el examinador pueda ver cualquier irregularidad que pueda ocurrir. El análisis espectral visualiza la frecuencia del audio para que un examinador pueda identificar características de interés. [9]
Un caso en el que el audio jugó un papel más importante es el caso de Trayvon Martin , donde se analizó la grabación de una llamada hecha a la policía para determinar si los gritos de fondo provenían de George Zimmerman o de Martin .
Voz forense
Los expertos en análisis forense de voz analizan grabaciones examinando el habla transmitida y almacenada, mejorándola y descodificándola para investigaciones criminales, juicios judiciales y agencias federales.
Para utilizar grabaciones de audio en un tribunal, un fonetista forense debe autenticar la grabación para detectar alteraciones, mejorar el audio e interpretar el habla. Su primer trabajo es asegurarse de que el habla en la grabación que se está utilizando sea comprensible. A menudo, las muestras tienen una mala calidad de sonido debido a factores ambientales como el viento o el movimiento. Otras veces, la degradación del sonido se debe a problemas tecnológicos dentro del dispositivo de grabación. Cualquier trabajo de investigación sobre la identificación del hablante no se puede realizar hasta que la grabación sea de la calidad adecuada. Se realizan diferentes soluciones para la mala comprensión mediante programas informáticos que permiten al usuario filtrar y eliminar el ruido. El software informático también puede convertir el habla en espectros y formas de onda, lo que resulta útil para el fonetista forense. Sin embargo, cualquier trabajo que se realice en la grabación debe realizarse después de que se haya hecho una copia de la grabación original.
Una parte importante del trabajo del fonetista forense es la identificación del hablante. El proceso de interpretación puede incluir la construcción de una línea de tiempo, la transcripción del diálogo y la identificación de sonidos desconocidos o ininteligibles en la grabación de audio. En el tribunal, el experto, en última instancia, sirve para explicar los hechos relacionados con la evidencia de audio, proporcionando una explicación de los principios acústicos y físicos relevantes para explicar lo que se evidencia en la grabación. Los informes se realizan para incluir información detallada, si hay una sección de la grabación que no es comprensible o es inaudible, una explicación de lo que estaba sucediendo (en la grabación) y una descripción de lo que falta en la grabación.
Identificación del hablante
El análisis de la voz tiene un papel en la identificación del hablante . Esto es cuando la identidad de un hablante es desconocida y tiene que ser identificada entre una serie de otras voces o sospechosos cuando se trata de una investigación criminal o un juicio judicial. La identificación adecuada del hablante y las voces, particularmente para los casos penales, depende de una lista de factores, como la familiaridad, la exposición, el retraso, el tono de voz, el disfraz de la voz y los acentos. La familiaridad con un hablante aumenta las posibilidades de identificar correctamente una voz y distinguirla. La cantidad de exposición a una voz también ayuda a identificar correctamente una voz, incluso si es una desconocida. Un oyente que escucha un enunciado más largo o estuvo expuesto a una voz con más frecuencia es mejor para reconocer una voz, que alguien que tal vez solo pudo escuchar una palabra. Un retraso entre el momento de escuchar una voz y el momento de identificar al hablante también disminuye la posibilidad de identificar al hablante correcto. El tono de voz afecta la capacidad de identificar al hablante correcto. Si el tono no coincide con el del hablante en el momento de la comparación, resultará más difícil de analizar. El disfraz de la voz, por ejemplo cuando un hablante susurra, también dificultará la capacidad de identificar con precisión al hablante. En algunos casos, las personas que hablan el mismo idioma que el hablante cuya voz se está analizando tendrán más facilidad para identificarlo debido al acento y la tensión de la voz. La identificación del hablante se complica además por las distorsiones del método técnico de grabación y por cuestiones relacionadas con el hablante, como estados emocionales o motivos alternativos que causan una discrepancia entre su voz y la de una grabación. Los métodos de identificación del hablante en la ciencia forense incluyen el uso de testigos auditivos que se utilizan para identificar las voces que han escuchado, el enfoque auditivo-perceptivo realizado por un especialista con respecto a los suprasegmentos del habla de un individuo y los enfoques basados en computadora.
Véase también
Referencias
- ^ Sarangi, Susanta; Sahidullah, Md; Saha, Goutam (septiembre de 2020). "Optimización del banco de filtros basado en datos para la verificación automática de hablantes". Procesamiento de señales digitales . 104 : 102795. arXiv : 2007.10729 . doi :10.1016/j.dsp.2020.102795. S2CID 220665533.
- ^ Hapner, Edie; Stemple, Joseph (2014). Terapia de la voz: estudios de casos clínicos . Plural Publishing.
- ^ Toran, SiKC; Lal, BK (2010). "Análisis objetivo de la voz para pólipos vocales después de una fonocirugía microlaríngea". Revista Médica de la Universidad de Katmandú . 8 (2): 185–189. doi : 10.3126/kumj.v8i2.3555 . ISSN 1812-2078. PMID 21209532.
- ^ Stemple, Joseph C.; Stanley, Jennifer; Lee, Linda (1995). "Medidas objetivas de la producción de voz en sujetos normales tras el uso prolongado de la voz". Journal of Voice . 9 (2): 127–133. doi :10.1016/s0892-1997(05)80245-0. ISSN 0892-1997. PMID 7620534.
- ^ Gerratt, Bruce R.; Hanson, David G.; Berke, Gerald S.; Precoda, Kristin (1991-01-01). "Fotoglotografía: una sinopsis clínica". Journal of Voice . 5 (2): 98–105. doi :10.1016/S0892-1997(05)80173-0 . Consultado el 2020-12-16 .
- ^ Chowdhury, Kanishka; Saha, Somnath; Saha, Vedula Padmini; Pal, Sudipta; Chatterjee, Indranil (23 de marzo de 2013). "Análisis de voz pre y postoperatorio después de tiroplastia de medialización en casos de parálisis unilateral de las cuerdas vocales". Revista india de otorrinolaringología y cirugía de cabeza y cuello . 65 (4): 354–357. doi :10.1007/s12070-013-0649-3. ISSN 2231-3796. PMC 3851511 . PMID 24427598.
- ^ Maher, Robert C. (2018). Principios del análisis de audio forense . Acústica moderna y procesamiento de señales. Cham: Springer International Publishing. págs. 1–2. doi :10.1007/978-3-319-99453-6. ISBN 978-3-319-99452-9 .
- ^ Solan, Lawrence M.; Tiersma, Peter M. (2004). Hablando de crimen . University of Chicago Press. doi :10.7208/chicago/9780226767871.001.0001. ISBN 978-0-226-76793-2.
- ^ abc Maher, Robert C. (2018). Principios del análisis de audio forense . Acústica moderna y procesamiento de señales. Cham: Springer International Publishing. págs. 48-49. doi :10.1007/978-3-319-99453-6. ISBN 978-3-319-99452-9 .
Enlaces externos
- Comunidad en línea sobre problemas de voz y trastornos vocales (VoiceMatters.net)