Gnuspeech es un paquete de software de conversión de texto a voz extensible que produce voz artificial basada en la síntesis articulatoria del habla en tiempo real mediante reglas. Es decir, convierte cadenas de texto en descripciones fonéticas, con la ayuda de un diccionario de pronunciación, reglas de conversión de letras a sonidos y modelos de ritmo e entonación; transforma las descripciones fonéticas en parámetros para un sintetizador de voz articulatorio de bajo nivel ; utiliza estos parámetros para controlar un modelo articulatorio del tracto vocal humano que produce una salida adecuada para los dispositivos de salida de sonido habituales de diversos sistemas operativos ; y lo hace a la misma velocidad o más rápida que la del habla humana.
Diseño
El sintetizador es un modelo de resonancia de tubo, o guía de ondas, que modela el comportamiento del tracto vocal real de forma directa y razonablemente precisa, a diferencia de los sintetizadores de formantes que modelan indirectamente el espectro del habla. [ 2 ] El problema de control se resuelve utilizando el Modelo de Región Distintiva de René Carré [ 3 ] que relaciona los cambios en los radios de ocho divisiones longitudinales del tracto vocal con los cambios correspondientes en los tres formantes de frecuencia en el espectro del habla que transmiten gran parte de la información del habla. Las regiones, a su vez, se basan en el trabajo del Laboratorio de Tecnología del Habla de Estocolmo [ 4 ] del Real Instituto de Tecnología ( KTH ) sobre el "análisis de sensibilidad de formantes", es decir, cómo las frecuencias de los formantes se ven afectadas por pequeños cambios en el radio del tracto vocal en varios puntos a lo largo de su longitud. [ 5 ]
Historia
Gnuspeech fue originalmente un software comercial producido por la ahora extinta Trillium Sound Research para la computadora NeXT como varios grados de kit "TextToSpeech". Trillium Sound Research era una empresa derivada de transferencia de tecnología formada en la Universidad de Calgary, Alberta, Canadá, basada en una larga investigación en el departamento de ciencias de la computación sobre la interacción humano-computadora mediante el habla, donde se mantienen artículos y manuales relevantes para el sistema. [ 6 ] La versión inicial de 1992 usaba un sintetizador de voz basado en formantes. Cuando NeXT dejó de fabricar hardware, el software del sintetizador fue completamente reescrito [ 7 ] y también portado a NSFIP (NextStep For Intel Processors) usando el enfoque de guía de ondas para modelar tubos acústicos basado en la investigación del Centro de Investigación Informática en Música y Acústica ( CCRMA ) en la Universidad de Stanford, especialmente el Music Kit. El enfoque de síntesis se explica con más detalle en un artículo presentado a la American Voice I/O Society en 1995. [ 8 ] El sistema utilizaba el procesador de señal digital (DSP) 56001 integrado en la computadora NeXT y una tarjeta adicional Turtle Beach con el mismo DSP en la versión NSFIP para ejecutar la guía de ondas (también conocida como modelo de tubo). Las limitaciones de velocidad significaban que la longitud más corta del tracto vocal que se podía utilizar para el habla en tiempo real (es decir, generada a la misma velocidad o más rápida que la "hablada") era de unos 15 centímetros, porque la frecuencia de muestreo para los cálculos de la guía de ondas aumenta al disminuir la longitud del tracto vocal. Las velocidades de procesamiento más rápidas están eliminando progresivamente esta restricción, un avance importante para producir el habla de los niños en tiempo real.
Dado que NeXTSTEP está descontinuado y las computadoras NeXT son escasas, una opción para ejecutar el código original es el uso de máquinas virtuales . El emulador Previous , por ejemplo, puede emular el DSP de las computadoras NeXT , que puede ser utilizado por el software Trillium.

Trillium cesó su actividad comercial a finales de la década de 1990 y el proyecto Gnuspeech se incorporó por primera vez al repositorio GNU Savannah bajo los términos de la Licencia Pública General de GNU en 2002, como software oficial de GNU .
Debido a su licencia gratuita y de código abierto , que permite la personalización del código, Gnuspeech se ha utilizado en la investigación académica. [ 9 ] [ 10 ]
Referencias
- ↑ "Gnuspeech - Directorio de software libre" . Consultado el 23 de octubre de 2025 .
- ↑ COOK, PR (1989) Síntesis de la voz cantada mediante un modelo parametrizado físicamente del tracto vocal humano. Conferencia Internacional de Música por Computadora, Columbus, Ohio.
- ↑ CARRE, R. (1992) Regiones distintivas en tubos acústicos. Modelado de la producción del habla. Journal d'Acoustique, 5 141 a 159
- ↑ Ahora Departamento de Habla, Música y Audición
- ↑ FANT, G. y PAULI, S. (1974) Características espaciales de los modelos de resonancia del tracto vocal. Actas del Seminario de Comunicación del Habla de Estocolmo, KTH , Estocolmo, Suecia.
- ↑ Sitio web relevante de la Universidad de Calgary
- ↑ El sintetizador de voz basado en el modelo de resonancia de tubo
- ↑ HILL, DR, MANZARA, L. y TAUBE-SCHOCK, CR. (1995) Síntesis de voz articulatoria en tiempo real mediante reglas. Actas de AVIOS '95, 14.ª Conferencia Internacional Anual sobre Tecnologías de la Voz, San José, 12-14 de septiembre de 1995, 27-44.
- ↑ D'Este, F. - Síntesis de voz articulatoria con algoritmo genético multiobjetivo paralelo. Tesis de maestría, Instituto de Ciencias de la Computación Avanzadas de Leiden, 2010.
- ↑ Xiong, F.; Barker, J. - Aprendizaje profundo de representaciones basadas en la articulación y aplicaciones para mejorar el reconocimiento del habla disártrica. Conferencia ITG sobre comunicación del habla, Alemania, 2018.
Enlaces externos
- Gnuspeech en GNU Savannah
- Descripción general del sistema Gnuspeech
- Software libre multiplataforma
- Software gratuito de síntesis de voz