WaveNet es una red neuronal profunda para generar audio sin procesar. Fue creada por investigadores de la firma de inteligencia artificial DeepMind, con sede en Londres . La técnica, descrita en un artículo en septiembre de 2016, [1] es capaz de generar voces humanas con un sonido relativamente realista mediante el modelado directo de formas de onda utilizando un método de red neuronal entrenado con grabaciones de habla real. Las pruebas con inglés estadounidense y mandarín mostraron que el sistema supera a los mejores sistemas de texto a voz (TTS) existentes de Google, aunque a partir de 2016 su síntesis de texto a voz todavía era menos convincente que el habla humana real. [2] La capacidad de WaveNet para generar formas de onda sin procesar significa que puede modelar cualquier tipo de audio, incluida la música. [3]
Historia
Generar voz a partir de texto es una tarea cada vez más común gracias a la popularidad de software como Siri de Apple , Cortana de Microsoft , Amazon Alexa y Google Assistant . [4]
La mayoría de estos sistemas utilizan una variación de una técnica que implica la concatenación de fragmentos de sonido para formar sonidos y palabras reconocibles. [5] El más común de estos se llama TTS concatenativo. [6] Consiste en una gran biblioteca de fragmentos de voz, grabados de un solo hablante, que luego se concatenan para producir palabras y sonidos completos. El resultado suena poco natural, con una cadencia y un tono extraños. [7] La dependencia de una biblioteca grabada también dificulta la modificación o el cambio de la voz. [8]
Otra técnica, conocida como TTS paramétrica, [9] utiliza modelos matemáticos para recrear sonidos que luego se ensamblan en palabras y oraciones. La información necesaria para generar los sonidos se almacena en los parámetros del modelo. Las características del habla de salida se controlan a través de las entradas del modelo, mientras que el habla se crea típicamente utilizando un sintetizador de voz conocido como vocoder . Esto también puede dar como resultado un audio que suene poco natural.
Diseño e investigación en curso
Fondo

WaveNet es un tipo de red neuronal de propagación hacia adelante conocida como red neuronal convolucional profunda (CNN). En WaveNet, la CNN toma una señal sin procesar como entrada y sintetiza una salida de a una muestra por vez. Lo hace mediante el muestreo de una distribución softmax (es decir, categórica ) de un valor de señal que se codifica mediante una transformación de compresión -expansión de ley μ y se cuantifica a 256 valores posibles. [11]
Concepto inicial y resultados
Según el artículo de investigación original de DeepMind de septiembre de 2016 WaveNet: A Generative Model for Raw Audio [12], la red recibió formas de onda reales de habla en inglés y mandarín. A medida que pasan por la red, aprende un conjunto de reglas para describir cómo evoluciona la forma de onda de audio con el tiempo. La red entrenada puede luego usarse para crear nuevas formas de onda similares al habla a 16.000 muestras por segundo. Estas formas de onda incluyen respiraciones y chasquidos de labios realistas, pero no se ajustan a ningún idioma. [13]
WaveNet es capaz de modelar con precisión diferentes voces, con el acento y el tono de la entrada correlacionándose con la salida. Por ejemplo, si se entrena con alemán, produce habla en alemán. [14] La capacidad también significa que si WaveNet recibe otras entradas, como música, su salida será musical. En el momento de su lanzamiento, DeepMind demostró que WaveNet podía producir formas de onda que suenan como música clásica . [15]
Intercambio de contenido (voz)
Según el artículo de junio de 2018 Disentangled Sequential Autoencoder , [16] DeepMind ha utilizado WaveNet con éxito para el "intercambio de contenido" de audio y voz: la red puede intercambiar la voz de una grabación de audio por otra voz preexistente mientras mantiene el texto y otras características de la grabación original. "También experimentamos con datos de secuencias de audio. Nuestra representación desenredada nos permite convertir las identidades de los hablantes entre sí mientras se condiciona el contenido del discurso". (p. 5) "Para el audio, esto nos permite convertir a un hablante masculino en una hablante femenina y viceversa [...] ". (p. 1) Según el artículo, se requiere una cantidad mínima de dos dígitos de horas (c. 50 horas) de grabaciones de voz preexistentes de la voz de origen y de destino para que se introduzcan en WaveNet para que el programa aprenda sus características individuales antes de poder realizar la conversión de una voz a otra con una calidad satisfactoria. Los autores destacan que " [u] na ventaja del modelo es que separa las características dinámicas de las estáticas [...] " (p. 8), es decir, WaveNet es capaz de distinguir entre el texto hablado y los modos de entrega (modulación, velocidad, tono, estado de ánimo, etc.) a mantener durante la conversión de una voz a otra por un lado, y las características básicas de las voces de origen y destino que se requiere intercambiar por el otro.
El artículo de seguimiento de enero de 2019 Unsupervised speech representation learning using WaveNet autoencoders [17] detalla un método para mejorar con éxito el reconocimiento automático adecuado y la discriminación entre características dinámicas y estáticas para el "intercambio de contenido", en particular incluyendo el intercambio de voces en grabaciones de audio existentes, con el fin de hacerlo más confiable. Otro artículo de seguimiento, Sample Efficient Adaptive Text-to-Speech [18] , de septiembre de 2018 (última revisión de enero de 2019), afirma que DeepMind ha reducido con éxito la cantidad mínima de grabaciones de la vida real necesarias para muestrear una voz existente a través de WaveNet a "simplemente unos pocos minutos de datos de audio" manteniendo resultados de alta calidad.
Su capacidad para clonar voces ha suscitado preocupaciones éticas sobre la capacidad de WaveNet para imitar las voces de personas vivas y muertas. Según un artículo de la BBC de 2016 , las empresas que trabajan en tecnologías de clonación de voz similares (como Adobe Voco ) pretenden insertar marcas de agua inaudibles para los humanos para evitar la falsificación, al tiempo que sostienen que la clonación de voz que satisface, por ejemplo, las necesidades de la industria del entretenimiento sería de una complejidad mucho menor y utilizaría métodos diferentes a los necesarios para engañar a los métodos de evidencia forense y a los dispositivos de identificación electrónica, de modo que las voces naturales y las voces clonadas para fines de la industria del entretenimiento aún podrían distinguirse fácilmente mediante análisis tecnológico. [19]
Aplicaciones
En el momento de su lanzamiento, DeepMind dijo que WaveNet requería demasiado poder de procesamiento computacional para ser utilizado en aplicaciones del mundo real. [20] A partir de octubre de 2017, Google anunció una mejora de rendimiento de 1000 veces junto con una mejor calidad de voz. Luego, WaveNet se utilizó para generar voces de Google Assistant para inglés de EE. UU. y japonés en todas las plataformas de Google. [21] En noviembre de 2017, los investigadores de DeepMind publicaron un artículo de investigación que detalla un método propuesto para "generar muestras de voz de alta fidelidad a más de 20 veces más rápido que en tiempo real", llamado "Destilación de densidad de probabilidad". [22] En la conferencia anual de desarrolladores de E/S en mayo de 2018, se anunció que las nuevas voces de Google Assistant estaban disponibles y eran posibles gracias a WaveNet; WaveNet redujo en gran medida la cantidad de grabaciones de audio que se necesitaban para crear un modelo de voz al modelar el audio sin procesar de las muestras del actor de voz. [23]
Véase también
Referencias
- ^ van den Oord, Aarón; Dieleman, Sander; Zen, Heiga; Simonyan, Karen; Vinyals, Oriol; Tumbas, Alex; Kalchbrenner, Nal; Mayor, Andrés; Kavukcuoglu, Koray (12 de septiembre de 2016). "WaveNet: un modelo generativo para audio sin formato". arXiv : 1609.03499 [cs.SD].
- ^ Kahn, Jeremy (9 de septiembre de 2016). "DeepMind de Google logra un gran avance en la generación de voz". Bloomberg.com . Consultado el 6 de julio de 2017 .
- ^ Meyer, David (9 de septiembre de 2016). «DeepMind de Google afirma haber logrado un progreso masivo en el habla sintetizada». Fortune . Consultado el 6 de julio de 2017 .
- ^ Kahn, Jeremy (9 de septiembre de 2016). "DeepMind de Google logra un gran avance en la generación de voz". Bloomberg.com . Consultado el 6 de julio de 2017 .
- ^ Condliffe, Jamie (9 de septiembre de 2016). "Cuando esta computadora habla, es posible que en realidad quieras escucharla". MIT Technology Review . Consultado el 6 de julio de 2017 .
- ^ Hunt, AJ; Black, AW (mayo de 1996). "Selección de unidades en un sistema de síntesis de voz concatenativa utilizando una gran base de datos de voz". Actas de la conferencia internacional IEEE de 1996 sobre acústica, voz y procesamiento de señales (PDF) . Vol. 1. págs. 373–376. CiteSeerX 10.1.1.218.1335 . doi :10.1109/ICASSP.1996.541110. ISBN. 978-0-7803-3192-1. Número de identificación del sujeto 14621185.
- ^ Coldewey, Devin (9 de septiembre de 2016). "WaveNet de Google utiliza redes neuronales para generar un discurso y una música inquietantemente convincentes". TechCrunch . Consultado el 6 de julio de 2017 .
- ^ van den Oord, Aäron; Dieleman, Sander; Zen, Heiga (8 de septiembre de 2016). "WaveNet: un modelo generativo para audio sin formato". Mente profunda . Consultado el 6 de julio de 2017 .
- ^ Zen, Heiga; Tokuda, Keiichi; Black, Alan W. (2009). "Síntesis de voz paramétrica estadística". Speech Communication . 51 (11): 1039–1064. CiteSeerX 10.1.1.154.9874 . doi :10.1016/j.specom.2009.04.004. S2CID 3232238.
- ^ van den Oord, Aäron (12 de noviembre de 2017). "Síntesis de voz de alta fidelidad con WaveNet". DeepMind . Consultado el 5 de junio de 2022 .
- ^ Oord, Aaron van den; Dieleman, Sander; Zen, Heiga; Simonyan, Karen; Vinyals, Oriol; Tumbas, Alex; Kalchbrenner, Nal; Mayor, Andrés; Kavukcuoglu, Koray (12 de septiembre de 2016). "WaveNet: un modelo generativo para audio sin formato". arXiv : 1609.03499 [cs.SD].
- ^ Aaron van den Oord; Dieleman, Sander; Zen, Heiga; Simonyan, Karen; Vinyals, Oriol; Tumbas, Alex; Kalchbrenner, Nal; Mayor, Andrés; Kavukcuoglu, Koray (2016). "WaveNet: un modelo generativo para audio sin formato". arXiv : 1609.03499 [cs.SD].
- ^ Gershgorn, Dave (9 de septiembre de 2016). "¿Estás seguro de que estás hablando con un humano? Los robots están empezando a sonar extrañamente parecidos a la vida real". Quartz . Consultado el 6 de julio de 2017 .
- ^ Coldewey, Devin (9 de septiembre de 2016). "WaveNet de Google utiliza redes neuronales para generar un discurso y una música inquietantemente convincentes". TechCrunch . Consultado el 6 de julio de 2017 .
- ^ van den Oord, Aäron; Dieleman, Sander; Zen, Heiga (8 de septiembre de 2016). "WaveNet: un modelo generativo para audio sin formato". Mente profunda . Consultado el 6 de julio de 2017 .
- ^ Li, Yingzhen; Mandt, Stephan (2018). "Autocodificador secuencial desenredado". arXiv : 1803.02991 [cs.LG].
- ^ Chorowski, Jan; Weiss, Ron J.; Bengio, Samy; Van Den Oord, Aaron (2019). "Aprendizaje de representación de voz no supervisado mediante codificadores automáticos WaveNet". Transacciones IEEE/ACM sobre procesamiento de audio, voz y lenguaje . 27 (12): 2041–2053. arXiv : 1901.08810 . doi :10.1109/TASLP.2019.2938863.
- ^ Chen, Yutian; Assael, Yannis; Shillingford, Brendan; Budden, David; Caña, Scott; Zen, Heiga; Wang, Quan; Cobo, Luis C.; Trask, Andrés; Laurie, Ben; Gulcehre, Caglar; Aäron van den Oord; Vinyals, Oriol; Nando de Freitas (2018). "Muestra de conversión de texto a voz adaptativa eficiente". arXiv : 1809.10460 [cs.LG].
- ^ El "Photoshop para voz" de Adobe Voco genera preocupación, 7 de noviembre de 2016, BBC
- ^ "El 'Photoshop para voz' de Adobe Voco genera preocupación". BBC News . 2016-11-07 . Consultado el 2017-07-06 .
- ^ WaveNet se lanza en el Asistente de Google
- ^ Aaron van den Oord; Li, Yazhe; Babuschkin, Igor; Simonyan, Karen; Vinyals, Oriol; Kavukcuoglu, Koray; George van den Driessche; Lockhart, Eduardo; Cobo, Luis C.; Stimberg, Florián; Casagrande, normando; Grewe, Dominik; Noury, Seb; Dieleman, Sander; Elsen, Erich; Kalchbrenner, Nal; Zen, Heiga; Tumbas, Alex; Rey, Helena; Walters, Tom; Belov, Dan; Hassabis, Demis (2017). "Parallel WaveNet: síntesis de voz rápida y de alta fidelidad". arXiv : 1711.10433 [cs.LG].
- ^ Martin, Taylor (9 de mayo de 2018). "Prueba las nuevas voces del Asistente de Google ahora mismo". CNET . Consultado el 10 de mayo de 2018 .
Enlaces externos
- WaveNet: un modelo generativo para audio sin procesar