Articulo de referencia

Modelo acústico

En el reconocimiento automático del habla, se utiliza un modelo acústico para representar la relación entre una señal de audio y los fonemas u otras unidades lingüísticas que co...

En el reconocimiento automático del habla, se utiliza un modelo acústico para representar la relación entre una señal de audio y los fonemas u otras unidades lingüísticas que componen el habla. El modelo se aprende a partir de un conjunto de grabaciones de audio y sus transcripciones correspondientes. Se crea tomando grabaciones de audio del habla y sus transcripciones de texto, y utilizando software para generar representaciones estadísticas de los sonidos que componen cada palabra.

Fondo

Los sistemas modernos de reconocimiento de voz utilizan tanto un modelo acústico como un modelo lingüístico para representar las propiedades estadísticas del habla. El modelo acústico modela la relación entre la señal de audio y las unidades fonéticas del idioma. El modelo lingüístico se encarga de modelar las secuencias de palabras. Estos dos modelos se combinan para obtener las secuencias de palabras mejor clasificadas correspondientes a un segmento de audio determinado.

La mayoría de los sistemas modernos de reconocimiento de voz procesan el audio en pequeños fragmentos, conocidos como tramas, con una duración aproximada de 10 ms por trama. La señal de audio original de cada trama se transforma aplicando el cepstrum de frecuencia Mel . Los coeficientes resultantes de esta transformación se conocen comúnmente como coeficientes cepstrales de frecuencia Mel (MFCC) y se utilizan como entrada para el modelo acústico junto con otras características.

Recientemente, el uso de redes neuronales convolucionales ha dado lugar a importantes mejoras en el modelado acústico. [ 1 ]

Características del audio del habla

El audio se puede codificar a diferentes frecuencias de muestreo (es decir, muestras por segundo; las más comunes son: 8, 16, 32, 44,1, 48 y 96  kHz) y con diferentes bits por muestra (las más comunes son: 8, 16, 24 o 32 bits). Los motores de reconocimiento de voz funcionan mejor si el modelo acústico que utilizan se entrenó con audio de voz grabado a la misma frecuencia de muestreo y con la misma cantidad de bits por muestra que la voz que se está reconociendo.

Reconocimiento de voz basado en telefonía

El factor limitante para el reconocimiento de voz en telefonía es el ancho de banda de transmisión. Por ejemplo, un teléfono fijo estándar solo tiene un ancho de banda de 64  kbit/s a una frecuencia de muestreo de 8  kHz y 8 bits por muestra (8000 muestras por segundo * 8 bits por muestra = 64000 bit/s). Por lo tanto, para el reconocimiento de voz en telefonía, los modelos acústicos deben entrenarse con  archivos de audio de voz de 8 kHz y 8 bits.

En el caso de la voz sobre IP , el códec determina la frecuencia de muestreo/bits por muestra de la transmisión de voz. Los códecs con una mayor frecuencia de muestreo/bits por muestra para la transmisión de voz (que mejoran la calidad del sonido) requieren modelos acústicos entrenados con datos de audio que coincidan con dicha frecuencia de muestreo/bits por muestra.

Reconocimiento de voz basado en ordenador de sobremesa

Para el reconocimiento de voz en un PC de escritorio estándar, el factor limitante es la tarjeta de sonido . La mayoría de las tarjetas de sonido actuales pueden grabar  audio a frecuencias de muestreo de entre 16 y 48 kHz, con tasas de bits de 8 a 16 bits por muestra, y reproducirlo hasta a 96  kHz.

Por regla general, un motor de reconocimiento de voz funciona mejor con modelos acústicos entrenados con datos de audio grabados a frecuencias de muestreo/bits por muestra más altas. Sin embargo, usar audio con una frecuencia de muestreo/bits por muestra demasiado alta puede ralentizar el motor de reconocimiento. Es necesario encontrar un punto intermedio. Por lo tanto, para el reconocimiento de voz en ordenadores de escritorio, el estándar actual son los modelos acústicos entrenados con datos de audio grabados a frecuencias de muestreo de 16  kHz/16  bits por muestra.

Referencias

  1. T. Sainath et al. , "Redes neuronales convolucionales para LVCSR", ICASSP , 2013.
  • Modelos acústicos japoneses para usar con Julius
  • Modelos acústicos de código abierto en VoxForge
  • Modelos acústicos HTK WSJ para HTK