Articulo de referencia

Procesamiento del habla

El procesamiento del habla es el estudio de las señales de voz y los métodos de procesamiento de señales. Las señales se procesan generalmente en una representación digital , po...

El procesamiento del habla es el estudio de las señales de voz y los métodos de procesamiento de señales. Las señales se procesan generalmente en una representación digital , por lo que el procesamiento del habla puede considerarse un caso especial del procesamiento digital de señales , aplicado a las señales de voz . Los aspectos del procesamiento del habla incluyen la adquisición, manipulación, almacenamiento, transferencia y salida de señales de voz. Diferentes tareas de procesamiento del habla incluyen el reconocimiento de voz , la síntesis de voz , la diarización de hablantes , la mejora del habla , el reconocimiento de hablantes , etc. [ 1 ]

Historia

Los primeros intentos de procesamiento y reconocimiento del habla se centraron principalmente en comprender algunos elementos fonéticos simples , como las vocales. En 1952, tres investigadores de los Laboratorios Bell, Stephen Balashek, R. Biddulph y K.H. Davis, desarrollaron un sistema capaz de reconocer dígitos pronunciados por un solo hablante. [ 2 ] En la década de 1940 se publicaron trabajos pioneros en el campo del reconocimiento del habla mediante el análisis de su espectro. [ 3 ]

La codificación predictiva lineal (LPC), un algoritmo de procesamiento del habla, fue propuesta por primera vez por Fumitada Itakura de la Universidad de Nagoya y Shuzo Saito de Nippon Telegraph and Telephone (NTT) en 1966. [ 4 ] Bishnu S. Atal y Manfred R. Schroeder realizaron nuevos desarrollos en la tecnología LPC en los Laboratorios Bell durante la década de 1970. [ 4 ] La LPC fue la base de la tecnología de voz sobre IP (VoIP), [ 4 ] así como de los chips sintetizadores de voz , como los chips de voz LPC de Texas Instruments utilizados en los juguetes Speak & Spell desde 1978. [ 5 ]

Uno de los primeros productos de reconocimiento de voz disponibles comercialmente fue Dragon Dictate, lanzado en 1990. En 1992, la tecnología desarrollada por Lawrence Rabiner y otros en Bell Labs fue utilizada por AT&T en su servicio de procesamiento de llamadas con reconocimiento de voz para enrutar llamadas sin un operador humano. Para entonces, el vocabulario de estos sistemas era mayor que el vocabulario humano promedio. [ 6 ]

A principios de la década de 2000, la estrategia dominante de procesamiento del habla comenzó a alejarse de los modelos ocultos de Markov hacia redes neuronales más modernas y aprendizaje profundo . [ 7 ]

En 2012, Geoffrey Hinton y su equipo de la Universidad de Toronto demostraron que las redes neuronales profundas podían superar significativamente a los sistemas tradicionales basados ​​en HMM en tareas de reconocimiento continuo del habla con vocabulario extenso. Este avance propició la adopción generalizada de técnicas de aprendizaje profundo en la industria. [ 8 ] [ 9 ]

A mediados de la década de 2010, empresas como Google , Microsoft , Amazon y Apple habían integrado sistemas avanzados de reconocimiento de voz en sus asistentes virtuales, como Google Assistant , Cortana , Alexa y Siri . [ 10 ] Estos sistemas utilizaban modelos de aprendizaje profundo para proporcionar interacciones de voz más naturales y precisas.

El desarrollo de modelos basados ​​en Transformers, como BERT (Bidirectional Encoder Representations from Transformers) de Google y GPT (Generative Pre-trained Transformer) de OpenAI, impulsó aún más los límites del procesamiento del lenguaje natural y el reconocimiento de voz. Estos modelos permitieron una comprensión del habla más contextual y semánticamente rica. [ 8 ] En los últimos años, los modelos de reconocimiento de voz de extremo a extremo han ganado popularidad. Estos modelos simplifican el proceso de reconocimiento de voz al convertir directamente la entrada de audio en salida de texto, omitiendo pasos intermedios como la extracción de características y el modelado acústico. Este enfoque ha optimizado el proceso de desarrollo y mejorado el rendimiento. [ 11 ]

Técnicas

Deformación temporal dinámica

La alineación temporal dinámica (DTW) es un algoritmo para medir la similitud entre dos secuencias temporales , cuya velocidad puede variar. En general, DTW calcula la coincidencia óptima entre dos secuencias dadas (por ejemplo, series temporales) con ciertas restricciones y reglas. La coincidencia óptima se define como aquella que satisface todas las restricciones y reglas y que tiene el costo mínimo, calculado como la suma de las diferencias absolutas entre los valores de cada par de índices coincidentes.

modelos ocultos de Markov

Un modelo oculto de Markov puede representarse como la red bayesiana dinámica más simple . El objetivo del algoritmo es estimar una variable oculta x(t) a partir de una lista de observaciones y(t). Aplicando la propiedad de Markov , la distribución de probabilidad condicional de la variable oculta x ( t ) en el instante t , dados los valores de la variable oculta x en todos los instantes, depende únicamente del valor de la variable oculta x ( t -1). De manera similar, el valor de la variable observada y ( t ) solo depende del valor de la variable oculta x ( t ) (ambos en el instante t ).

Redes neuronales artificiales

Una red neuronal artificial (RNA) se basa en un conjunto de unidades o nodos conectados, denominados neuronas artificiales , que modelan de forma aproximada las neuronas de un cerebro biológico . Cada conexión, al igual que las sinapsis en un cerebro biológico , puede transmitir una señal de una neurona artificial a otra. Una neurona artificial que recibe una señal puede procesarla y, a su vez, enviar señales a otras neuronas artificiales conectadas a ella. En las implementaciones comunes de RNA, la señal en una conexión entre neuronas artificiales es un número real , y la salida de cada neurona artificial se calcula mediante una función no lineal de la suma de sus entradas.

Procesamiento sensible a la fase

A menudo se supone que la fase es aleatoria, pero contiene información útil. El envolvimiento de la fase: [ 12 ] puede introducirse debido a saltos periódicos en2π{\displaystyle 2\pi }. Desenrollado de fase (véase, [ 13 ] Capítulo 2.3; Fase y frecuencia instantáneas ), se puede expresar como: [ 12 ] [ 14 ]ϕ(h,l)=ϕlinorte(h,l)+Ψ(h,l){\displaystyle \phi (h,l)=\phi _{lin}(h,l)+\Psi (h,l)}, dóndeϕlinorte(h,l)=ω0(l)Δt{\displaystyle \phi _{lin}(h,l)=\omega _{0}(l'){}_{\Delta }t}es fase lineal (Δt{\displaystyle {}_{\Delta }t}es el desplazamiento temporal en cada fotograma de análisis),Ψ(h,l){\displaystyle \Psi (h,l)}es la contribución de fase del tracto vocal y la fuente de fase. [ 14 ] Las estimaciones de fase obtenidas pueden usarse para la reducción de ruido: suavizado temporal de la fase instantánea [ 15 ] y sus derivadas por el tiempo ( frecuencia instantánea ) y la frecuencia ( retardo de grupo ), [ 16 ] suavizado de la fase a través de la frecuencia. [ 16 ] Los estimadores de amplitud y fase combinados pueden recuperar el habla con mayor precisión basándose en la suposición de una distribución de fase de von Mises. [ 14 ]

Aplicaciones

Véase también

Referencias

  1. ^ Sahidullah, Maryland; Patiño, José; Cornell, Samuele; Yin, Ruiking; Sivasankaran, Sunit; Bredin, Hervé; Korshunov, Pavel; Brutti, Alessio; Serizel, Romain; Vicente, Emmanuel; Evans, Nicolás; Marcel, Sebastián; Squartini, Stefano; Barras, Claude (6 de noviembre de 2019). "La presentación rápida a DIHARD II: contribuciones y lecciones aprendidas". arXiv : 1911.02388 [ eess.AS ].
  2. Juang, B.-H.; Rabiner, LR (2006), "Reconocimiento automático del habla: historia", Enciclopedia del lenguaje y la lingüística , Elsevier, pp. 806–819 , doi : 10.1016/b0-08-044854-2/00906-8 , ISBN  9780080448541
  3. Myasnikov, LL; Myasnikova, Ye. N. (1970). Reconocimiento automático de patrones sonoros (en ruso). Leningrado: Energiya.
  4. 1 2 3 Gray, Robert M. (2010). "Una historia del habla digital en tiempo real en redes de paquetes: Parte II de la codificación predictiva lineal y el protocolo de Internet" (PDF) . Found. Trends Signal Process . 3 (4): 203– 303. doi : 10.1561/2000000036 . ISSN 1932-8346 . 
  5. "VC&G - Entrevista a VC&G: 30 años después, Richard Wiggins habla sobre el desarrollo de Speak & Spell" .
  6. Huang, Xuedong; Baker, James; Reddy, Raj (2014-01-01). "Una perspectiva histórica del reconocimiento de voz". Communications of the ACM . 57 (1): 94– 103. doi : 10.1145/2500887 . ISSN 0001-0782 . S2CID 6175701 .  
  7. Furui, Sadaoki (2005). "50 años de progreso en la investigación del reconocimiento de voz y del hablante" . ECTI Transactions on Computer and Information Technology . 1 (2): 64– 74. doi : 10.37936/ecti-cit.200512.51834 . ISSN 2286-9131 . 
  8. 1 2 "Redes neuronales profundas para el modelado acústico en el reconocimiento de voz" (PDF) . 23-07-2019 . Consultado el 05-11-2024 .
  9. "RECONOCIMIENTO DE VOZ CON REDES NEURONALES RECURRENTES PROFUNDAS" (PDF) . 23-07-2019 . Consultado el 05-11-2024 .
  10. Hoy, Matthew B. (2018). "Alexa, Siri, Cortana y más: una introducción a los asistentes de voz". Medical Reference Services Quarterly . 37 (1): 81– 88. doi : 10.1080/02763869.2018.1404391 . ISSN 1540-9597 . PMID 29327988 .  
  11. Hagiwara, Masato (21/12/2021). Procesamiento del lenguaje natural en el mundo real: aplicaciones prácticas con aprendizaje profundo . Simon and Schuster. ISBN 978-1-63835-039-2.
  12. 1 2 Mowlaee, Pejman; Kulmer, Josef (agosto de 2015). "Estimación de fase en la mejora del habla de un solo canal: límites-potencial". IEEE/ACM Transactions on Audio, Speech, and Language Processing . 23 (8): 1283– 1294. Bibcode : 2015ITASL..23.1283M . doi : 10.1109/TASLP.2015.2430820 . ISSN 2329-9290 . S2CID 13058142 .  
  13. Mowlaee, Pejman; Kulmer, Josef; Stahl, Johannes; Mayer, Florian (2017). Procesamiento de señales de un solo canal con detección de fase en la comunicación del habla: teoría y práctica . Chichester: Wiley. ISBN 978-1-119-23882-9.
  14. 1 2 3 Kulmer, Josef; Mowlaee, Pejman (abril de 2015). "Estimación de fase armónica en mejora de voz monocanal utilizando distribución de von Mises y SNR previa". Acústica, habla y procesamiento de señales (ICASSP), Conferencia Internacional IEEE de 2015 sobre . IEEE. págs. 5063–5067 . 
  15. Kulmer, Josef; Mowlaee, Pejman (mayo de 2015). "Estimación de fase en la mejora del habla de un solo canal mediante descomposición de fase". IEEE Signal Processing Letters . 22 (5): 598– 602. Bibcode : 2015ISPL...22..598K . doi : 10.1109/LSP.2014.2365040 . ISSN 1070-9908 . S2CID 15503015 .  
  16. 1 2 Mowlaee, Pejman; Saeidi, Rahim; Stylianou, Yannis (julio de 2016). "Avances en el procesamiento de señales con conciencia de fase en la comunicación del habla" . Speech Communication . 81 : 1–29 . doi : 10.1016/j.specom.2016.04.002 . ISSN 0167-6393 . S2CID 17409161. Recuperado el 3 de diciembre de 2017 .