Articulo de referencia

Esfinge de la CMU

[https://cmusphinx.github.io Open source speech recognition toolkit] "},"website":{"wt":"{{URL|https://cmusphinx.github.io/wiki/}}"}},"i":0}}]}"> CMU Sphinx , también conocido c...

CMU Sphinx , también conocido como Sphinx, es el término general para describir un grupo de sistemas de reconocimiento de voz desarrollados en la Universidad Carnegie Mellon . Estos incluyen una serie de reconocedores de voz (Sphinx 2-4) y un entrenador de modelos acústicos (SphinxTrain).

En el año 2000, el grupo Sphinx de la Universidad Carnegie Mellon se comprometió a liberar como código abierto varios componentes de reconocimiento de voz, incluyendo Sphinx 2 y, posteriormente, Sphinx 3 (en 2001). Los decodificadores de voz incluyen modelos acústicos y aplicaciones de ejemplo. Además, los recursos disponibles incluyen software para el entrenamiento de modelos acústicos, la compilación de modelos de lenguaje y un diccionario de pronunciación de dominio público , cmudict .

Sphinx engloba varios sistemas de software, que se describen a continuación.

Esfinge

Sphinx es un sistema de reconocimiento de voz continua e independiente del hablante que utiliza modelos acústicos ocultos de Markov ( HMM ) y un modelo estadístico de lenguaje n-grama . Fue desarrollado por Kai-Fu Lee . Sphinx demostró la viabilidad del reconocimiento de voz continua e independiente del hablante con un vocabulario amplio, una posibilidad que en aquel entonces (1986) estaba en entredicho. [ 2 ]

Sphinx tiene únicamente interés histórico; ha sido superada en su interpretación por versiones posteriores.

Esfinge 2

Sphinx 2 es un reconocedor rápido y orientado al rendimiento, desarrollado originalmente por Xuedong Huang en Carnegie Mellon y publicado como código abierto con una licencia de estilo BSD en SourceForge por Kevin Lenzo en LinuxWorld en 2000. Se centra en el reconocimiento en tiempo real adecuado para aplicaciones de lenguaje hablado. Por ello, incorpora funcionalidades como la identificación de extremos, la generación de hipótesis parciales, el cambio dinámico de modelos de lenguaje, etc. Se utiliza en sistemas de diálogo y sistemas de aprendizaje de idiomas. Puede utilizarse en sistemas PBX basados ​​en computadora, como Asterisk . El código de Sphinx 2 también se ha incorporado a varios productos comerciales. Ya no se encuentra en desarrollo activo (salvo para mantenimiento rutinario). El desarrollo actual del decodificador en tiempo real se lleva a cabo en el proyecto Pocket Sphinx . [ 3 ]

Esfinge 3

Sphinx 2 utilizaba una representación semicontinua para el modelado acústico (es decir, se empleaba un único conjunto de gaussianas para todos los modelos, y cada modelo individual se representaba como un vector de pesos sobre estas gaussianas). Sphinx 3 adoptó la representación HMM continua predominante y se ha utilizado principalmente para el reconocimiento de alta precisión, aunque no en tiempo real. Los avances recientes (tanto en algoritmos como en hardware) han hecho que Sphinx 3 sea casi en tiempo real, si bien aún no es adecuado para aplicaciones interactivas críticas. Sphinx 3 se encuentra en desarrollo activo y, junto con SphinxTrain, proporciona acceso a diversas técnicas de modelado modernas, como LDA/MLLT, MLLR y VTLN, que mejoran la precisión del reconocimiento (véase el artículo sobre reconocimiento de voz para obtener descripciones de estas técnicas).

Esfinge 4

Sphinx 4 es una reescritura completa del motor Sphinx, cuyo objetivo es proporcionar un marco más flexible para la investigación en reconocimiento de voz, escrito íntegramente en el lenguaje de programación Java. Sun Microsystems apoyó el desarrollo de Sphinx 4 y aportó su experiencia en ingeniería de software al proyecto. Entre los participantes se encontraban investigadores de MERL, MIT y CMU . (Actualmente, los lenguajes compatibles son C, C++, C#, Python, Ruby, Java y JavaScript).

Los objetivos de desarrollo actuales incluyen:

  • desarrollo de un nuevo entrenador (modelo acústico)
  • Implementación de la adaptación del hablante (por ejemplo, MLLR)
  • mejorar la gestión de la configuración
  • Creación de una interfaz de usuario basada en gráficos para el diseño de sistemas gráficos.

Esfinge de bolsillo

PocketSphinx es una versión de Sphinx que puede utilizarse en sistemas embebidos (por ejemplo, basados ​​en un procesador ARM ). Se encuentra en desarrollo activo e incorpora características como aritmética de punto fijo y algoritmos eficientes para el cálculo de GMM .

Véase también

Referencias

  1. Kit de herramientas de reconocimiento de voz de código abierto
  2. Lee, K.-F.; Hon, H.-W.; Reddy, R. (enero de 1990). "Una visión general del sistema de reconocimiento de voz SPHINX". IEEE Transactions on Acoustics, Speech, and Signal Processing . 38 (1): 35– 45. doi : 10.1109/29.45616 .
  3. Huang, Xuedong; Alleva, Fileno; Hwang, Mei-Yuh; Rosenfeld, Ronald (1993). "Una visión general del sistema de reconocimiento de voz SPHINX-II" . Actas del Taller sobre Tecnología del Lenguaje Humano - HLT '93 . Morristown, NJ, EE. UU.: Asociación de Lingüística Computacional: 81. doi : 10.3115/1075671.1075690 . ISBN 1-55860-324-7.
  • Los desarrolladores de Sphinx recomiendan Vosk ahora.
  • Página principal de CMU Sphinx
  • El repositorio de Sphinx en GitHub debe considerarse la fuente definitiva del código.
  • SourceForge aloja versiones y archivos antiguos.
  • NeXT en el Campus Otoño 1990 (Este documento está en formato PostScript comprimido con gzip). Universidad Carnegie Mellon - Avances en reconocimiento de voz y gestión de documentos , págs. 12-13
Obtenido de " https://en.wikipedia.org/w/index.php?title=CMU_Sphinx&oldid=1357617334 "