MBROLA es un software de síntesis de voz como un proyecto colaborativo mundial. La página web del proyecto MBROLA proporciona bases de datos de difonos para muchos [ 1 ] idiomas hablados .
El software MBROLA no es un sistema completo de síntesis de voz para todos esos idiomas; primero hay que transformar el texto en información fonética y prosódica en el formato de MBROLA, y es necesario un software aparte (por ejemplo, eSpeakNG ).
Historia
El proyecto MBROLA se inició en 1995 en el Laboratorio TCTS de la Facultad Politécnica de Mons (Bélgica) como un proyecto científico para obtener un conjunto de sintetizadores de voz para la mayor cantidad de idiomas posible. La primera versión del software MBROLA se lanzó en 1996 y se ofreció como software gratuito para uso no comercial ni militar. Las licencias para las bases de datos de voz creadas varían, pero en su mayoría también son para uso no comercial y no militar.
Debido a su uso gratuito solo para aplicaciones no comerciales, MBROLA era una opción alternativa para usuarios privados/domésticos para el motor de síntesis de voz de facto eSpeakNG en estaciones de trabajo Linux , pero en su mayoría no se usaba para soluciones comerciales (por ejemplo, para relojes de tiempo hablados, notificaciones de embarque para puertos y terminales, etc.) Después del desarrollo inicial de bases de datos de voz, las actualizaciones y el soporte del software MBROLA cesaron y gradualmente los binarios de código cerrado quedaron rezagados con respecto al desarrollo de hardware y sistemas operativos recientes. [ 2 ] Para abordar esto, el equipo de desarrollo de MBROLA decidió lanzar MBROLA como software de código abierto , y el 24 de octubre de 2018, el código fuente se publicó en GitHub con la Licencia Pública General Affero de GNU . El 23 de enero de 2019, se lanzó la herramienta llamada MBROLATOR para proporcionar la creación de la base de datos MBROLA a partir de archivos WAV con la misma licencia.
Tecnología usada
El software MBROLA utiliza el algoritmo MBROLA (Multi-Band Resynthesis OverLap Add) [ 3 ] para la generación de voz. Aunque se basa en difonos , la calidad de la síntesis de MBROLA se considera superior a la de la mayoría de los sintetizadores de difonos, ya que preprocesa los difonos imponiendo un tono constante y fases armónicas que mejoran su concatenación, degradando solo ligeramente su calidad segmental.
MBROLA es un algoritmo en el dominio del tiempo similar a PSOLA , lo que implica una carga computacional muy baja durante la síntesis. Sin embargo, a diferencia de PSOLA, MBROLA no requiere una marcación previa de los periodos de tono. Esta característica ha permitido desarrollar el proyecto MBROLA en torno a su algoritmo, a través del cual numerosos laboratorios de investigación del habla , empresas e individuos de todo el mundo han proporcionado bases de datos de difonos para diversos idiomas y voces.
Referencias
- Repositorio de código fuente de MBROLA
- Utilizando Festival con MBROLA
Enlaces externos
- Voces MBROLA (base de datos para el sintetizador de voz MBROLA)
- MBROLATOR (herramienta de creación de bases de datos para el sintetizador de voz MBROLA)
- Síntesis de voz
- Lingüística computacional