Articulo de referencia

NETtalk (red neuronal artificial)

Estructura de NETtalk. NETtalk es una red neuronal artificial que aprende a pronunciar texto escrito en inglés mediante aprendizaje supervisado. Recibe texto en inglés como entr...

Estructura de NETtalk.

NETtalk es una red neuronal artificial que aprende a pronunciar texto escrito en inglés mediante aprendizaje supervisado. Recibe texto en inglés como entrada y produce transcripciones fonéticas coincidentes como salida. [ 1 ]

Es el resultado de una investigación llevada a cabo a mediados de la década de 1980 por Terrence Sejnowski y Charles Rosenberg. El objetivo de NETtalk era construir modelos simplificados que pudieran esclarecer la complejidad del aprendizaje de tareas cognitivas a nivel humano , y su implementación como un modelo conexionista que también pudiera aprender a realizar una tarea comparable. Los autores lo entrenaron mediante retropropagación . [ 1 ]

La red se entrenó con una gran cantidad de palabras en inglés y sus pronunciaciones correspondientes, y es capaz de generar pronunciaciones para palabras desconocidas con un alto nivel de precisión. La salida de la red era una secuencia de fonemas, que se introducía en DECtalk para producir habla audible. Alcanzó un gran éxito popular, apareciendo en el programa Today . [ 2 ] : 115

Desde el punto de vista de la modelización de la cognición humana, NETtalk no modela específicamente las etapas de procesamiento de imágenes ni el reconocimiento de letras en la corteza visual . Más bien, asume que las letras han sido preclasificadas y reconocidas. La tarea de NETtalk consiste en aprender las asociaciones adecuadas entre la pronunciación correcta y una secuencia de letras determinada, basándose en el contexto en el que aparecen dichas letras.

Posteriormente se utilizó una arquitectura similar para la tarea opuesta, la de convertir una señal de habla continua en una secuencia de fonemas. [ 3 ]

Capacitación

El conjunto de datos de entrenamiento fue un subconjunto de 20 008 palabras del Corpus Brown , con fonemas y acentuación anotados manualmente para cada letra. El proceso de desarrollo se describió en una entrevista de 1993. Se necesitaron tres meses (250 horas-persona) para crear el conjunto de datos de entrenamiento, pero solo unos pocos días para entrenar la red. [ 4 ] [ 5 ]

Tras su exitosa aplicación en este caso, los autores lo probaron con la transcripción fonológica de una entrevista con un joven latino de un barrio de Los Ángeles . El resultado fue una red que reproducía su acento español. [ 2 ] : 115

El NETtalk original se implementó en un Ridge 32 , que tardaba 0,275 segundos por paso de aprendizaje (una pasada hacia adelante y una hacia atrás). El entrenamiento de NETtalk se convirtió en un referente para probar la eficiencia de los programas de retropropagación. Por ejemplo, una implementación en Connection Machine-1 (con 16384 procesadores) se ejecutó con una aceleración de 52x. Una implementación en un Warp de 10 celdas se ejecutó con una aceleración de 340x. [ 6 ] [ 7 ]

La siguiente tabla recopila las puntuaciones de referencia a partir de 1988. [ 6 ] [ 7 ] [ 8 ] La velocidad se mide en "millones de conexiones por segundo" (MCPS). Por ejemplo, el NETtalk original en Ridge 32 tardaba 0,275 segundos por cada pase de ida y vuelta, lo que daba18629/1060,275=0,068{\displaystyle {\frac {18629/10^{6}}{0,275}}=0,068}MCPS. Los tiempos relativos se normalizan con respecto al MicroVax.

Arquitectura

La red tenía tres capas y 18.629 pesos ajustables, una cantidad considerable para los estándares de 1986. Existía la preocupación de que se sobreajustara al conjunto de datos, pero se entrenó con éxito. [ 2 ]

La red neuronal tiene una entrada de 203 unidades, divididas en 7 grupos de 29 unidades cada uno. Cada grupo representa una codificación one-hot de un carácter. Existen 29 caracteres posibles: 26 letras, coma, punto y espacio en blanco (límite de palabra). Para producir la pronunciación de un solo carácter, la red utiliza el carácter en sí, así como los 3 caracteres anteriores y los 3 posteriores.

La capa oculta tiene 80 unidades.

La salida consta de 26 unidades. 21 unidades codifican las características articulatorias (punto de articulación, sonoridad, altura vocálica, etc.) de los fonemas, y 5 unidades codifican el acento y los límites silábicos.

Sejnowski estudió la representación aprendida en la red y descubrió que los fonemas que suenan similares se agrupan en el espacio de representación. La salida de la red se degrada, pero sigue siendo comprensible, cuando se eliminan algunas neuronas ocultas. [ 9 ]

Referencias

  1. 1 2 Sejnowski, Terrence J., y Charles R. Rosenberg. " Redes paralelas que aprenden a pronunciar texto en inglés ". Sistemas complejos 1.1 (1987): 145-168.
  2. 1 2 3 Sejnowski, Terrence J. (2018). La revolución del aprendizaje profundo . Cambridge, Massachusetts Londres, Inglaterra: The MIT Press. ISBN 978-0-262-03803-4.
  3. Bourlard, H.; Wellekens, CJ (diciembre de 1990). "Vínculos entre modelos de Markov y perceptrones multicapa". IEEE Transactions on Pattern Analysis and Machine Intelligence . 12 (12): 1167– 1178. Bibcode : 1990ITPAM..12.1167B . doi : 10.1109/34.62605 .
  4. Anderson, James A.; Rosenfeld, Edward, eds. (28 de febrero de 2000). Talking Nets: An Oral History of Neural Networks . The MIT Press. doi : 10.7551/mitpress/6626.001.0001 . ISBN 978-0-262-26715-1.
  5. Consulte el archivo nettalk.names en el archivo del conjunto de datos original. https://archive.ics.uci.edu/dataset/150/connectionist+bench+nettalk+corpus
  6. 1 2 Pomerleau; Gusciora; Touretzky; Kung (1988). "Simulación de redes neuronales a velocidad Warp: Cómo conseguimos 17 millones de conexiones por segundo" . Conferencia Internacional IEEE sobre Redes Neuronales . IEEE. págs. 143–150 vol.2. doi : 10.1109/icnn.1988.23922 . ISBN  0-7803-0999-5.
  7. 1 2 Borkar, S.; Cohn, R.; Cox, G.; Gleason, S.; Gross, T. (1988-11-01). "iWarp: una solución integrada de computación paralela de alta velocidad" . Actas de la Conferencia ACM/IEEE de 1988 sobre Supercomputación . Supercomputing '88. Washington, DC, EE. UU.: IEEE Computer Society Press: 330–339 . ISBN 978-0-8186-0882-7.
  8. Blelloch, Guy; Rosenberg, Charles R. (1987-08-23). ​​"Aprendizaje de redes en la máquina de conexión" . Actas de la 10.ª Conferencia Internacional Conjunta sobre Inteligencia Artificial - Volumen 1. IJCAI'87. San Francisco, CA, EE. UU.: Morgan Kaufmann Publishers Inc.: 323–326 .
  9. "Aprender, luego hablar" . The New York Times . 16 de agosto de 1988. Consultado el 4 de noviembre de 2024 .
  • Conjunto de entrenamiento NETtalk original
  • Artículo del New York Times sobre NETtalk