La adaptación del hablante es una tecnología importante para ajustar las características o los modelos de habla para evitar la falta de coincidencia debido a la variación entre hablantes . En la última década, se ha desarrollado la adaptación del hablante de voz propia (EV). Hace uso del conocimiento previo de los hablantes en entrenamiento para proporcionar un algoritmo de adaptación rápido (en otras palabras, solo se necesita una pequeña cantidad de datos de adaptación ). Inspirado por la idea de cara propia del núcleo en el reconocimiento facial , se propone la voz propia del núcleo (KEV). [1] KEV es una generalización no lineal a EV. Esto incorpora el análisis de componentes principales del núcleo , una versión no lineal del análisis de componentes principales , para capturar correlaciones de orden superior con el fin de explorar más a fondo el espacio del hablante y mejorar el rendimiento del reconocimiento.
Véase también
Referencias
- ^ "Tesis de la voz propia del núcleo" (PDF) . Archivado desde el original (PDF) el 2011-06-10 . Consultado el 2009-07-17 .
Enlaces externos
- Adaptación de voz propia del núcleo del hablante, ScientificCommons
- Mak, B.; Ho, S. (2005). "Varios métodos de determinación de hablantes de referencia para la adaptación de hablantes de voz propia del núcleo integrado". IEEE International Conference on Acoustics, Speech, and Signal Processing, 2005. Actas . ICASSP '05. Vol. 1. págs. 981– 984. doi :10.1109/ICASSP.2005.1415280.
- Mak, B.; Kwok, JT; Ho, S. (septiembre de 2005). "Adaptación de locutor de voz propia del núcleo". IEEE Transactions on Speech and Audio Processing . 13 (5): 984– 992. doi :10.1109/TSA.2005.851971. ISSN 1063-6676. S2CID 7361772 . Consultado el 15 de noviembre de 2017 .
- Aceleración de la adaptación del hablante de voz propia del núcleo mediante PCA de núcleo integrado, ICSLP 2004.
- Adaptación de altavoces mediante PCA de núcleo compuesto, NIPS 2003.
- Mak, Brian Kan-Wing; Hsiao, Roger Wend-Huu; Ho, Simon Ka-Lung; Kwok, JT (julio de 2006). "Adaptación de voz propia del hablante en el núcleo integrado y su implicación en la ponderación del hablante de referencia". IEEE Transactions on Audio, Speech, and Language Processing . 14 (4): 1267– 1280. CiteSeerX 10.1.1.206.4596 . doi :10.1109/TSA.2005.860836. S2CID 7527119.