Articulo de referencia

TIMIT

TIMIT es un corpus de transcripciones fonéticas y léxicas del habla de hablantes de inglés americano de diferentes sexos y dialectos. Cada elemento transcrito ha sido delimitado...

TIMIT es un corpus de transcripciones fonéticas y léxicas del habla de hablantes de inglés americano de diferentes sexos y dialectos. Cada elemento transcrito ha sido delimitado en el tiempo.

TIMIT fue diseñado para impulsar el conocimiento acústico-fonético y los sistemas de reconocimiento automático del habla. Fue encargado por DARPA y el diseño del corpus fue un esfuerzo conjunto entre el Instituto Tecnológico de Massachusetts (MIT) , SRI International y Texas Instruments (TI). El habla se grabó en TI, se transcribió en el MIT y fue verificada y preparada para su publicación por el Instituto Nacional de Estándares y Tecnología (NIST). [ 1 ] También existe una versión de ancho de banda telefónico llamada NTIMIT (Network TIMIT).

TIMIT y NTIMIT no están disponibles gratuitamente; para acceder al conjunto de datos se requiere ser miembro del Consorcio de Datos Lingüísticos o realizar un pago monetario.

Datos

TIMIT contiene aproximadamente 5 horas de habla, de 10 oraciones pronunciadas por cada uno de los 630 hablantes. Las oraciones se seleccionaron aleatoriamente de un corpus de 2342 oraciones. Los hablantes eran nativos de inglés americano y se clasificaron en 8 regiones dialectales principales: Nueva Inglaterra, Norte, Centro Norte, Centro Sur, Sur, Ciudad de Nueva York, Oeste y Army Brat (que se mudaron con frecuencia). El 70 % de los hablantes eran hombres y el 30 % mujeres. [ 2 ]

Las grabaciones se realizaron en una cabina de grabación insonorizada en Texas Instruments, utilizando un sistema informático semiautomático (STEROIDS) para controlar la presentación de las indicaciones al hablante y la grabación. Se realizaron grabaciones de dos canales utilizando un micrófono de diadema Sennheiser HMD 414 y un micrófono de presión de campo lejano Brüel & Kjær de 1/2" (n.° 4165). El habla se digitalizó a una frecuencia de muestreo de 20  kHz y luego se submuestreó a 16  kHz. [ 2 ]

Historia

El corpus telefónico TIMIT fue un intento inicial de crear una base de datos con muestras de voz. [ 3 ] Se publicó en 1988 en CD-ROM y consta de solo 10 oraciones por hablante. Cada hablante leyó dos oraciones en dialecto, así como otras 8 oraciones seleccionadas de un conjunto más amplio. [ 4 ] Cada oración tiene una duración promedio de 3 segundos y es pronunciada por 630 hablantes diferentes. [ 5 ] Fue el primer intento notable de crear y distribuir un corpus de voz y el proyecto en su conjunto generó costos de 1,5 millones de dólares estadounidenses. [ 6 ]

En octubre de 1990 se publicó una actualización. Incluía [ 2 ]

  • corpus completo de 630 hablantes;
  • Transcripciones revisadas y corregidas;
  • transcripciones de alineación de palabras;
  • Archivos de forma de onda con encabezado NIST SPHERE y software para la manipulación de encabezados;
  • diccionario fonémico;
  • nuevos subconjuntos de prueba y entrenamiento equilibrados para la cobertura dialectal y fonética;
  • documentación más extensa.

El nombre completo del proyecto es DARPA-TIMIT Acoustic-Phonetic Continuous Speech Corpus [ 7 ] y el acrónimo TIMIT corresponde a Texas Instruments/Massachusetts Institute of Technology. La principal razón para crear un corpus de habla telefónica fue entrenar software de reconocimiento de voz . En el desafío Blizzard, diferentes programas tienen la obligación de convertir grabaciones de audio en datos textuales y el corpus TIMIT se utilizó como referencia estandarizada. [ 8 ]

Véase también

Referencias

  1. Fisher, William M.; Doddington, George R.; Goudie-Marshall, Kathleen M. (1986). "La base de datos de investigación de reconocimiento de voz de DARPA: especificaciones y estado". Actas del taller de DARPA sobre reconocimiento de voz . págs. 93–99 . 
  2. 1 2 3 Garofolo, John S.; Lamel, LF; Fisher, WM; Fiscus, Jonathan G.; Pallett, DS; Dahlgren, Nancy L. (1993-02-01). "CD-ROM del corpus acústico-fonético continuo del habla DARPA TIMIT. Disco de habla NIST 1-1.1" (PDF) . Informe Interinstitucional/Interno del NIST . 93 (4930): 27403. Bibcode : 1993STIN...9327403G .Dominio públicoEste artículo incorpora texto de esta fuente, que es de dominio público .
  3. Morales, Nicolas y Tejedor, Javier y Garrido, Javier y Colas, Jose y Toledano, Doroteo T (2008). "Generación de un corpus telefónico de un solo canal STC-TIMIT". Actas del Sexto Congreso Internacional de Recursos y Evaluación del Lenguaje (LREC'08) : 391–395 .{{cite journal}}: CS1 maint: varios nombres: lista de autores ( enlace )
  4. Lori F Lamel , Robert H. Kassel y Stephanie Seneff (1986). Desarrollo de bases de datos de voz: diseño y análisis del corpus acústico-fonético (Informe técnico). DARPA (SAIC-86/1546).
  5. John S Garofolo y Lori F Lamel y William M Fisher y Jonathan G Fiscus y David S Pallett y Nancy L Dahlgren (1993). DARPA TIMIT (Informe técnico). Instituto Nacional de Estándares y Tecnología. doi : 10.6028/nist.ir.4930 .
  6. Nattanun Chanchaochai y Christopher Cieri y Japhet Debrah y Hongwei Ding y Yue Jiang y Sishi Liao y Mark Liberman y Jonathan Wright y Jiahong Yuan y Juhong Zhan y Yuqing Zhan (2018). GlobalTIMIT: Conjuntos de datos acústico-fonéticos para las lenguas del mundo . Interspeech 2018. ISCA. doi : 10.21437/interspeech.2018-1185 .
  7. Bauer, Patrick y Scheler, David y Fingscheidt, Tim (2010). WTIMIT: El corpus de voz TIMIT transmitido a través de la red móvil de banda ancha 3G AMR . LREC.{{cite conference}}: CS1 maint: varios nombres: lista de autores ( enlace )
  8. Sawada, Kei y Asai, Chiaki y Hashimoto, Kei y Oura, Keiichiro y Tokuda, Keiichi (2016). El sistema de conversión de texto a voz de NITech para el Blizzard Challenge 2016. Taller del Blizzard Challenge 2016.{{cite conference}}: CS1 maint: varios nombres: lista de autores ( enlace )
  • Corpus de habla continua acústico-fonética TIMIT

Obtenido de " https://en.wikipedia.org/w/index.php?title=TIMIT&oldid=1359571673 "