
La red neuronal con retardo de tiempo ( TDNN ) [ 1 ] es una arquitectura de red neuronal artificial multicapa cuyo propósito es 1) clasificar patrones con invariancia a los cambios y 2) modelar el contexto en cada capa de la red. Esencialmente, es una red neuronal convolucional (CNN) unidimensional .
La clasificación invariante a desplazamientos significa que el clasificador no requiere una segmentación explícita previa a la clasificación. Para la clasificación de un patrón temporal (como el habla), la TDNN evita tener que determinar los puntos de inicio y fin de los sonidos antes de clasificarlos.
En el modelado contextual de una TDNN, cada unidad neuronal en cada capa recibe información no solo de las activaciones/características de la capa inferior, sino también de un patrón de salida de la unidad y su contexto. Para las señales temporales, cada unidad recibe como entrada los patrones de activación a lo largo del tiempo de las unidades inferiores. Aplicada a la clasificación bidimensional (imágenes, patrones tiempo-frecuencia), la TDNN puede entrenarse con invariancia de desplazamiento en el espacio de coordenadas y evita la segmentación precisa en dicho espacio.
Historia
La TDNN se introdujo a finales de la década de 1980 y se aplicó a una tarea de clasificación de fonemas para el reconocimiento automático del habla en señales de voz donde la determinación automática de segmentos precisos o límites de características era difícil o imposible. Debido a que la TDNN reconoce fonemas y sus características acústicas/fonéticas subyacentes, independientemente de la posición en el tiempo, mejoró el rendimiento con respecto a la clasificación estática. [ 1 ] [ 2 ] También se aplicó a señales bidimensionales (patrones tiempo-frecuencia en el habla, [ 3 ] y patrón de espacio de coordenadas en OCR [ 4 ] ).
Kunihiko Fukushima publicó el neocognitrón en 1980. [ 5 ] El max pooling aparece en una publicación de 1982 sobre el neocognitrón [ 6 ] y estuvo en la publicación de 1989 en LeNet-5 . [ 7 ]
En 1990, Yamaguchi et al. utilizaron max pooling en TDNN para lograr un sistema de reconocimiento de palabras aisladas independiente del hablante. [ 8 ]
Descripción general
Arquitectura
En lenguaje moderno, el diseño de TDNN es una red neuronal convolucional 1D , donde la dirección de la convolución es a través de la dimensión del tiempo. En el diseño original, hay exactamente 3 capas.
La entrada a la red es una señal de voz continua, preprocesada en una matriz 2D (un espectrograma en escala Mel ). Una dimensión es el tiempo, con 10 ms por trama, y la otra es la frecuencia. La dimensión temporal puede ser arbitrariamente larga, pero la de frecuencia solo tenía 16 tramas. En el experimento original, solo se consideraron señales de voz muy cortas que pronunciaban palabras sueltas como "baa", "daa", "gaa". Por ello, las señales de voz podían ser muy cortas, de hecho, de tan solo 15 tramas (150 ms de duración).
En detalle, procesaron una señal de voz de la siguiente manera:
- El habla de entrada se muestrea a 12 kHz, con ventana de Hamming .
- Su transformada rápida de Fourier (FFT) se calcula cada 5 ms.
- Los coeficientes de la escala Mel se calculan a partir del espectro de potencia tomando los logaritmos de las energías en cada banda de energía de la escala Mel.
- Los coeficientes adyacentes en el tiempo se suavizan, lo que da como resultado un fotograma cada 10 ms.
- Para cada señal, un humano detecta manualmente el inicio de la vocal, y se recorta toda la señal de voz excepto 7 fotogramas antes y 7 fotogramas después, dejando solo 15 fotogramas en total, centrados en el inicio de la vocal.
- Los coeficientes se normalizan restando la media y luego escalándolos, de modo que las señales se encuentren entre -1 y +1.
La primera capa de la TDNN es una capa convolucional 1D. La capa contiene 8 núcleos de forma. Genera un tensor de forma.
La segunda capa de la TDNN es una capa convolucional 1D. La capa contiene 3 núcleos de forma. Genera un tensor de forma.
La tercera capa de la TDNN no es una capa convolucional. En cambio, es simplemente una capa fija con 3 neuronas. Sea la salida de la segunda capa.dónde y. El-la neurona -ésima en la tercera capa calcula, dóndees la función sigmoide . Esencialmente, se puede pensar como una capa de convolución con 3 núcleos de forma.
Se entrenó con aproximadamente 800 muestras durante 20 000 a 50 000 pasos de retropropagación . Cada paso se calculó en lotes sobre todo el conjunto de datos de entrenamiento, es decir, no fue estocástico . Requirió el uso de una supercomputadora Alliant con 4 procesadores.
Ejemplo
En el caso de una señal de voz, las entradas son coeficientes espectrales a lo largo del tiempo.
Para aprender características acústico-fonéticas críticas (por ejemplo, transiciones de formantes, explosiones, fricción, etc.) sin necesidad de una localización precisa, la TDNN se entrena de forma invariante al desplazamiento temporal. Esta invariancia se logra mediante el uso compartido de pesos a lo largo del tiempo durante el entrenamiento: se crean copias desplazadas en el tiempo de la TDNN sobre el rango de entrada (de izquierda a derecha en la Fig. 1). A continuación, se realiza la retropropagación a partir de un vector objetivo de clasificación general (véase el diagrama de la TDNN; en la capa de salida se muestran tres objetivos de clase de fonema (/b/, /d/, /g/)), lo que da como resultado gradientes que generalmente varían para cada una de las copias de la red desplazadas en el tiempo. Sin embargo, dado que estas redes desplazadas en el tiempo son solo copias, la dependencia de la posición se elimina mediante el uso compartido de pesos. En este ejemplo, esto se logra promediando los gradientes de cada copia desplazada en el tiempo antes de realizar la actualización de pesos. En el habla, se ha demostrado que el entrenamiento invariante al desplazamiento temporal aprende matrices de pesos que son independientes del posicionamiento preciso de la entrada. También se podría demostrar que las matrices de pesos detectan características acústico-fonéticas importantes que se sabe que son importantes para la percepción del habla humana, como transiciones de formantes, ráfagas, etc. [ 1 ] Las TDNN también podrían combinarse o ampliarse mediante preentrenamiento. [ 9 ]
Implementación
La arquitectura precisa de las TDNN (retardos de tiempo, número de capas) la determina principalmente el diseñador en función del problema de clasificación y los tamaños de contexto más útiles. Los retardos o ventanas de contexto se eligen específicamente para cada aplicación. También se ha trabajado en la creación de TDNN con retardo de tiempo adaptables [ 10 ], donde se elimina este ajuste manual.
Lo último
Los reconocedores de fonemas basados en TDNN se compararon favorablemente en comparaciones iniciales con modelos de fonemas basados en HMM. [ 1 ] [ 9 ] Las arquitecturas TDNN profundas modernas incluyen muchas más capas ocultas y submuestrean o agrupan conexiones sobre contextos más amplios en capas superiores. Logran hasta un 50 % de reducción de errores de palabras sobre los modelos acústicos basados en GMM . [ 11 ] [ 12 ] Si bien las diferentes capas de las TDNN están diseñadas para aprender características de un ancho de contexto creciente, también modelan contextos locales. Cuando se deben procesar relaciones de mayor distancia y secuencias de patrones, el aprendizaje de estados y secuencias de estados es importante y las TDNN se pueden combinar con otras técnicas de modelado. [ 13 ] [ 3 ] [ 4 ] Las arquitecturas TDNN también se han adaptado a las redes neuronales de picos , lo que ha dado lugar a resultados de vanguardia y se presta a implementaciones de hardware energéticamente eficientes . [ 14 ]
Aplicaciones
Reconocimiento de voz
Las TDNN se utilizaban para resolver problemas de reconocimiento de voz y se introdujeron en 1989 [ 2 ] , centrándose inicialmente en el reconocimiento de fonemas invariante al desplazamiento temporal. El habla se presta bien a las TDNN, ya que los sonidos hablados rara vez tienen una longitud uniforme y la segmentación precisa es difícil o imposible. Al escanear un sonido en el pasado y el futuro, la TDNN puede construir un modelo para los elementos clave de ese sonido de manera invariante al desplazamiento temporal. Esto es particularmente útil ya que los sonidos se difuminan por la reverberación. [ 11 ] [ 12 ] Las grandes TDNN fonéticas se pueden construir modularmente mediante el preentrenamiento y la combinación de redes más pequeñas. [ 9 ]
Reconocimiento de voz con vocabulario amplio
El reconocimiento de voz con vocabulario extenso requiere reconocer secuencias de fonemas que componen palabras, sujetas a las restricciones de un amplio vocabulario de pronunciación. La integración de redes neuronales con retardo de tiempo (TDNN) en reconocedores de voz con vocabulario extenso es posible mediante la introducción de transiciones de estado y búsqueda entre los fonemas que componen una palabra. La red neuronal con retardo de tiempo multiestado (MS-TDNN) resultante puede entrenarse de forma discriminativa a nivel de palabra, optimizando así toda la configuración hacia el reconocimiento de palabras en lugar de la clasificación de fonemas. [ 13 ] [ 15 ] [ 4 ]
Independencia del orador
Se propusieron variantes bidimensionales de las TDNN para la independencia del hablante. [ 3 ] Aquí, la invariancia de desplazamiento se aplica al eje del tiempo y al eje de la frecuencia para aprender características ocultas que son independientes de la ubicación precisa en el tiempo y en la frecuencia (esta última debido a la variabilidad del hablante).
Reverberación
Uno de los problemas persistentes en el reconocimiento de voz es reconocer el habla cuando está corrompida por eco y reverberación (como ocurre en salas grandes y con micrófonos distantes). La reverberación puede considerarse como una corrupción del habla con versiones retardadas de sí misma. Sin embargo, en general, es difícil eliminar la reverberación de una señal, ya que la función de respuesta impulsional (y, por lo tanto, el ruido convolucional que experimenta la señal) no se conoce para ningún espacio arbitrario. Se ha demostrado que la TDNN es eficaz para reconocer el habla de forma robusta a pesar de los diferentes niveles de reverberación. [ 11 ] [ 12 ]
Lectura de labios – habla audiovisual
Las TDNN también se utilizaron con éxito en las primeras demostraciones de habla audiovisual, donde los sonidos del habla se complementan con la lectura visual del movimiento de los labios. [ 15 ] En este caso, los reconocedores basados en TDNN utilizaron características visuales y acústicas conjuntamente para lograr una mayor precisión de reconocimiento, particularmente en presencia de ruido, donde la información complementaria de una modalidad alternativa podía fusionarse de manera óptima en una red neuronal.
Reconocimiento de escritura a mano
Las TDNN se han utilizado eficazmente en sistemas de reconocimiento de escritura a mano compactos y de alto rendimiento . [ 16 ] La invariancia de desplazamiento también se adaptó a patrones espaciales (ejes x/y) en el reconocimiento de escritura a mano fuera de línea de imágenes. [ 4 ]
Análisis de vídeo
El vídeo posee una dimensión temporal que convierte a la TDNN en una solución ideal para analizar patrones de movimiento. Un ejemplo de este análisis es la combinación de detección de vehículos y reconocimiento de peatones. [ 17 ] Al examinar vídeos, las imágenes subsiguientes se introducen en la TDNN como entrada, donde cada imagen es el siguiente fotograma del vídeo. La fortaleza de la TDNN reside en su capacidad para examinar objetos desplazados en el tiempo hacia adelante y hacia atrás, definiendo así un objeto detectable a medida que se modifica el tiempo. Si un objeto puede reconocerse de esta manera, una aplicación puede planificar su detección futura y realizar una acción óptima.
Reconocimiento de imágenes
Posteriormente, las redes neuronales TDNN bidimensionales se aplicaron a otras tareas de reconocimiento de imágenes bajo el nombre de " Redes Neuronales Convolucionales ", donde se aplica un entrenamiento invariante a la traslación a los ejes x/y de una imagen.
Bibliotecas comunes
- Las redes neuronales convolucionales trípticas (TDNN) se pueden implementar en prácticamente todos los marcos de aprendizaje automático que utilizan redes neuronales convolucionales unidimensionales , debido a la equivalencia de los métodos.
- Matlab : La caja de herramientas de redes neuronales tiene una funcionalidad explícita diseñada para producir una red neuronal con retardo de tiempo, especificando el tamaño del paso de los retardos y una función de entrenamiento opcional. El algoritmo de entrenamiento predeterminado es un algoritmo de retropropagación de aprendizaje supervisado que actualiza los pesos del filtro basándose en las optimizaciones de Levenberg-Marquardt. La función es timedelaynet(delays, hidden_layers, train_fnc) y devuelve una arquitectura de red neuronal con retardo de tiempo que el usuario puede entrenar y a la que puede proporcionar entradas. [ 18 ]
- El kit de herramientas Kaldi ASR tiene una implementación de TDNN con varias optimizaciones para el reconocimiento de voz. [ 19 ]
Véase también
- Red neuronal convolucional : una red neuronal convolucional en la que la convolución se realiza a lo largo del eje temporal de los datos es muy similar a una TDNN.
- Redes neuronales recurrentes : una red neuronal recurrente también maneja datos temporales, aunque de una manera diferente. En lugar de una entrada que varía con el tiempo, las RNN mantienen capas ocultas internas para realizar un seguimiento de las entradas pasadas (y, en el caso de las RNN bidireccionales, futuras).
Referencias
- 1 2 3 4 Waibel, A.; Hanazawa, T.; Hinton, G.; Shikano, K.; Lang, KJ (1989). "Reconocimiento de fonemas mediante redes neuronales con retardo temporal" (PDF) . IEEE Transactions on Acoustics, Speech, and Signal Processing . 37 (3): 328– 339. doi : 10.1109/29.21701 .
- 1 2 Alexander Waibel, Reconocimiento de fonemas mediante redes neuronales con retardo temporal , Procedimientos del Instituto de Ingenieros Eléctricos, de Información y de Comunicación (IEICE), diciembre de 1987, Tokio, Japón.
- 1 2 3 John B. Hampshire; Alex Waibel. "Arquitecturas conexionistas para el reconocimiento de fonemas de múltiples hablantes" . Avances en sistemas de procesamiento de información neuronal . 2 : 203–210 .
- 1 2 3 4 Jaeger, S.; Manke, S.; Reichert, J.; Waibel, A. (2001). "Reconocimiento de escritura a mano en línea: El reconocedor NPen++" . Revista Internacional de Análisis y Reconocimiento de Documentos . 3 (3): 169– 180. doi : 10.1007/PL00013559 .
- ↑ Fukushima, Kunihiko (1980). "Neocognitron: un modelo de red neuronal autoorganizada para un mecanismo de reconocimiento de patrones no afectado por el cambio de posición" ( PDF) . Cibernética biológica . 36 (4): 193–202 . doi : 10.1007/BF00344251 . PMID 7370364. S2CID 206775608. Archivado (PDF) del original el 3 de junio de 2014. Recuperado el 16 de noviembre de 2013 .
- ↑ Fukushima, Kunihiko; Miyake, Sei (1982-01-01). "Neocognitron: Un nuevo algoritmo para el reconocimiento de patrones tolerante a deformaciones y cambios de posición" . Pattern Recognition . 15 (6): 455– 469. Bibcode : 1982PatRe..15..455F . doi : 10.1016/0031-3203(82)90024-3 . ISSN 0031-3203 .
- ↑ LeCun, Yann; Boser, Bernhard; Denker, John; Henderson, Donnie; Howard, R.; Hubbard, Wayne; Jackel, Lawrence (1989). "Reconocimiento de dígitos manuscritos con una red de retropropagación" . Avances en sistemas de procesamiento de información neuronal . 2. Morgan-Kaufmann.
- ↑ Yamaguchi, Kouichi; Sakamoto, Kenji; Akabane, Toshio; Fujimoto, Yoshiji (noviembre de 1990). Una red neuronal para el reconocimiento de palabras aisladas independiente del hablante . Primera Conferencia Internacional sobre Procesamiento del Lenguaje Hablado (ICSLP 90). Kobe, Japón. Archivado del original el 7 de marzo de 2021. Consultado el 4 de septiembre de 2019 .
- 1 2 3 Alexander Waibel, Hidefumi Sawai, Kiyohiro Shikano, Modularidad y escalamiento en grandes redes neuronales fonémicas , IEEE Transactions on Acoustics, Speech, and Signal Processing, diciembre de 1989.
- ↑ Wöhler, C.; Anlauf, JK (1999). "Un algoritmo de red neuronal con retardo de tiempo adaptable para el análisis de secuencias de imágenes". IEEE Transactions on Neural Networks . 10 (6): 1531– 1536. doi : 10.1109/72.809100 . PMID 18252656. S2CID 16813677 .
- 1 2 3 Peddinti, Vijayaditya; Povey, Daniel; Khudanpur, Sanjeev (2015). "Una arquitectura de red neuronal con retardo de tiempo para el modelado eficiente de contextos temporales largos". Interspeech 2015. pp. 3214–3218 . doi : 10.21437/Interspeech.2015-647 . S2CID 8536162 .
- 1 2 3 David Snyder, Daniel Garcia-Romero, Daniel Povey, Modelos de fondo universales basados en redes neuronales profundas con retardo temporal para el reconocimiento de locutores , Actas de ASRU 2015.
- 1 2 Haffner, Patrick; Waibel, Alex (1991). "Redes de retardo de tiempo multiestado para el reconocimiento continuo del habla" . proceedings.neurips.cc . 4. NIPS: 135–142 .
- ↑ D'Agostino, Simone; Moro, Filippo; Torchet, Tristan; Demirağ, Yiğit; Grenouillet, Laurent; Castellani, Niccolò; Indiveri, Giacomo; Vianello, Elisa; Payvand, Melika (2024-04-24). "DenRAM: arquitectura dendrítica neuromórfica con RRAM para un procesamiento temporal eficiente con retrasos" . Nature Communications . 15 (1): 3446. doi : 10.1038/s41467-024-47764-w . ISSN 2041-1723 . PMC 11043378 .
- 1 2 Bregler, C.; Hild, H.; Manke, S.; Waibel, A. (1993). "Mejora del reconocimiento de letras conectadas mediante lectura labial". Conferencia Internacional IEEE sobre Acústica, Habla y Procesamiento de Señales . Vol. 1. págs. 557–560 . doi : 10.1109/ICASSP.1993.319179 . ISBN 0-7803-0946-4.
- ↑ Guyon, I.; Albrecht, P.; Le Cun, Y.; Denker, J.; Hubbard, W. (1991-01-01). "Diseño de un reconocedor de caracteres de red neuronal para un terminal táctil" . Pattern Recognition . 24 (2): 105– 119. doi : 10.1016/0031-3203(91)90081-F . ISSN 0031-3203 .
- ↑ Wöhler, C.; Anlauf, JK (2001). "Reconocimiento de objetos en tiempo real en secuencias de imágenes con el algoritmo de red neuronal de retardo de tiempo adaptable: aplicaciones para vehículos autónomos". Image and Vision Computing . 19 ( 9–10 ): 593–618 . doi : 10.1016/S0262-8856(01)00040-3 .
- ↑ " Series temporales y sistemas dinámicos - MATLAB y Simulink ". mathworks.com. Consultado el 21 de junio de 2016.
- ↑ Peddinti, Vijayaditya; Chen, Guoguo; Manohar, Vimal; Ko, Tom; Povey, Daniel; Khudanpur, Sanjeev (2015). "Sistema JHU ASpIRE: LVCSR robusto con TDNNS, adaptación iVector y RNN-LMS" (PDF) . Taller IEEE de 2015 sobre reconocimiento y comprensión automática del habla (ASRU) . págs. 539–546 . doi : 10.1109/ASRU.2015.7404842 . ISBN 978-1-4799-7291-3.
- Haffner, Patrick; Waibel (1991) [enero de 1991]. Lippman, Richard; Moody, John (eds.). "Redes de retardo de tiempo multiestado para el reconocimiento continuo del habla" . Avances en sistemas de procesamiento de información neuronal . 4. Morgan Kaufman: 135–142 .
- Hampshire, John; Waibel, Alex (1990) [30 de noviembre de 1989]. Touretzky, David (ed.). "Arquitecturas conexionistas para el reconocimiento de fonemas en múltiples hablantes" . Advances in Neural Information Processing Systems 2 : 203–210 .
- Waibel, Alex; Hanazawa, Toshiyuki; Hinton, Geoffrey; Shikano, Kiyohiro; Lang, Kevin (abril de 1989). "Reconocimiento de fonemas mediante redes neuronales con retardo temporal" . IEEE Transactions on Acoustics, Speech, and Signal Processing . 37 (3): 328– 339. doi : 10.1109/29.21701 .
- Waibel, Alex (1987) [diciembre]. "Reconocimiento de fonemas mediante redes neuronales con retardo temporal" . Conferencia: Reunión del Instituto de Ingenieros Eléctricos, de Información y de Comunicación (IEICE) . Japón.
- Arquitecturas de redes neuronales
- 1987 en inteligencia artificial