La separación de fuentes musicales (MSS), [ 1 ] también conocida como separación de pistas , desmezcla , separación de fuentes de audio o desmezcla , [ 2 ] es una técnica para separar una pista de audio en múltiples pistas de audio mediante la extracción de información musical (MIR) del material mezclado. [ 3 ] La MSS es una rama de la separación de señales que se estableció a mediados de la década de 1990 como una tecnología para reconstruir una o más señales de origen a partir de mezclas de las mismas. El proceso es utilizado generalmente por profesionales de la música para separar grabaciones existentes con el fin de mejorar el balance de la mezcla, remezclar o remasterizar. Existen casos de uso adicionales donde no se dispone de archivos multipista o de sesión para la grabación de sonido, lo que hace necesario recurrir a herramientas que proporcionan separación de pistas a partir de un solo archivo de audio.

La separación inicial de la fuente de audio con fines comerciales dio como resultado un archivo separado de forma no destructiva, de modo que los archivos resultantes pudieran reconstruirse y sonar exactamente como el original sin introducir problemas cuando todas las pistas se reproducían simultáneamente. [ 4 ]
Existen diversas aplicaciones de esta tecnología fuera del ámbito musical, como la enseñanza, la medicina forense, la separación de voz, la cancelación de sonido en directo, la restauración de audio y la realidad virtual/aumentada . [ 5 ] [ 6 ]
Separación de tallos mediante IA y separación de fuentes de audio
A partir de finales de 2018, se pusieron a disposición herramientas comerciales para la separación de cuatro pistas de audio de un solo archivo de audio utilizando modelos de IA. [ 7 ] Estas aplicaciones separaron las pistas en voz, batería, bajo y otras categorías de un solo archivo de audio. Los avances en aprendizaje profundo y los nuevos modelos de procesamiento, como Wav-U-Net para redes neuronales, contribuyeron a una mayor calidad y menos artefactos de fase en las separaciones de material mezclado. [ 8 ] iZotope RX , AudiosourceRe Demix y RipX DeepMix fueron algunos de los primeros proveedores de herramientas especializadas para la separación de pistas. Con el tiempo, este proceso se generalizó entre los usuarios y los desarrolladores de aplicaciones comerciales; simultáneamente, las tecnologías continuaron mejorando en términos de calidad y velocidad de separación. [ 9 ] La empresa Deezer también puso a disposición su herramienta Spleeter de forma abierta alrededor de 2019 para una mayor investigación y desarrollo del proceso de separación de fuentes de audio. [ 10 ] Empresas como Apple lanzaron herramientas de separación de cuatro pistas directamente en el DAW (que en este caso requerían Apple Silicon ), bajo la marca Stem Splitter. [ 11 ] Actualmente, docenas de empresas utilizan las tecnologías de separación de fuentes de audio para una gran variedad de aplicaciones. A partir de 2025, diversos desarrolladores ofrecen nuevas opciones de separación para instrumentos como piano, cuerdas, viento, guitarra, guitarra acústica y sintetizador . La tendencia a principios de 2025 era integrar estas capacidades de separación de pistas con tecnologías adicionales basadas en IA para aplicaciones musicales, como masterización, detección y manipulación de tono, reconocimiento de acordes, transcripción de letras, intercambio de voces y similares.
Cómo funciona generalmente la separación de tallos mediante IA
Este proceso, que implica la ingeniería inversa de secuencias a partir de pistas masterizadas, se basa en el entrenamiento de modelos para identificar objetivos en mezclas. Millones de secuencias aisladas reales de archivos de proyecto se utilizan para actualizar los márgenes de los parámetros de los modelos y generar estimaciones para la salida final de las mezclas. Se desarrollan grandes conjuntos de datos multipista a partir de las secuencias aisladas proporcionadas, con ajustes adicionales a las mezclas para proporcionar un mayor número de datos que entrenan los modelos para obtener mayores grados de precisión. [ 12 ] Inicialmente, los proveedores utilizaban la separación de secuencias en línea porque permitía el uso de potentes sistemas computacionales (a menudo con GPU avanzadas); ahora, existen muchas opciones para el procesamiento local de la IA basado en sistemas debido a las optimizaciones en el enfoque de procesamiento. También hay desarrollos de CPU que incluyen flujos de trabajo neuronales que facilitan la arquitectura de procesamiento más rápida necesaria para la separación de secuencias de máxima fidelidad con menores requisitos de tiempo. [ 13 ]
Separación de tallos mediante IA en música sincronizada
Un número creciente de empresas ofrece a editores musicales y clientes la posibilidad de utilizar tecnologías de separación de pistas para sus proyectos, lo cual resulta especialmente útil para eliminar voces de las mezclas. El uso de estas herramientas permite a los editores y agentes de la industria musical de cine y televisión ajustar y contornear canciones rápidamente, sin necesidad de contactar con proveedores, lo que evitaría retrasos. Esto mejora el potencial de colocación, ya que un problema común en la sincronización es que ciertos sonidos (por ejemplo, las voces) pueden interferir demasiado con la música de fondo. Además, permite a los profesionales de la sincronización explorar nuevas direcciones en la pista y mejorar la mezcla para su correcta aplicación. [ 14 ]
Separación de tallos mediante IA para DJ
La rápida separación de pistas individuales es ideal para el DJ profesional que busca crear mashups únicos . Generalmente, la pista se divide en pistas individuales colocando las canciones deseadas en la carpeta correspondiente; al seleccionar la canción, dispone de los cuatro grupos básicos de pistas y, en algunos casos, se pueden activar partes individuales (muestras) en pads para presentaciones en vivo. [ 15 ]
Estudios de caso notables de separación de tallos mediante IA
Disney Music Group utilizó tecnologías de separación de pistas para mejorar su catálogo de grabaciones. [ 16 ] Las grabaciones de los Beatles se dividieron y mejoraron con tecnologías de separación de pistas, y los ingenieros durante este proceso también ayudaron a avanzar en el desarrollo de la tecnología. [ 17 ] Numerosas canciones clásicas de éxito han sido objeto de restauración mediante los logros de la separación de pistas. [ 18 ] [ 19 ]
Tallos vs. separación de tallos mediante IA
En la industria discográfica, el término "stems" se utiliza para referirse a los archivos generados durante el proceso de mezcla, generalmente una colección de sonidos similares agrupados como una " stem ". Dentro del contexto de los archivos originales del proyecto, los stems pueden proporcionar una gran cantidad de archivos de audio exportados para diversos fines. Este tipo de archivos suele ofrecer una mejor calidad general y permite aislar aún más el material del proyecto sin introducir artefactos.
Las separaciones de pistas mediante IA generalmente han producido material ideal para ajustes de volumen o procesamiento de efectos o producción adicionales. Este tipo de pistas generalmente se presentan en los cuatro grupos básicos: voz, bajo, batería y otros. Nuevos enfoques y un entrenamiento más profundo de los modelos dieron como resultado la capacidad de aislar material adicional más allá de los cuatro grupos básicos; sin embargo, este tipo de separaciones generalmente presentan anomalías espectrales, mezclan sonidos adicionales o alteran alguna cualidad del sonido original. [ 20 ]
Diseño de sonido con herramientas de separación de pistas mediante IA
El proceso de utilizar IA y otras metodologías para seleccionar tipos específicos de sonidos permitió un nuevo método de diseño de sonido basado en la separación espectral mediante nuevas herramientas de edición, como las de SpectraLayers y RipX. La capacidad instantánea de separar componentes, como información transitoria y temporal, en pistas completas de creaciones sonoras no convencionales, facilita la creación de efectos de groove y otras técnicas de doblaje de sonido, revelando nuevos timbres y estructuras basados en selecciones espectrales gracias a los avances en herramientas para la manipulación de stems. [ 21 ] [ 22 ]
Reducción de ruido y separación de tallos mediante IA
Además de los métodos avanzados de reducción de ruido basados en el aprendizaje de perfiles de ruido, adoptar un enfoque inverso y eliminar objetivos de fuente conocidos, como los cuatro modelos básicos y especializados, puede resultar en dejar solo el ruido como una pista separada, dependiendo del conjunto. A partir de ahí, se puede eliminar la pista de ruido. El ruido puede aparecer en una sola pista, y esa pista puede ser tratada exclusivamente con perfiles de reducción de ruido; de esta manera, no es necesario procesar toda la mezcla. [ 23 ]
Karaoke (eliminador de voz) y separación de pistas mediante IA
Uno de los usos más populares de la separación de pistas es la creación de una versión instrumental de una canción cuando no se conoce su existencia o disponibilidad. Existen decenas de sitios web que utilizan esta tecnología para atraer a usuarios que desean crear versiones instrumentales de sus canciones favoritas. [ 24 ] [ 25 ]
RipX y el enfoque de Melodyne para la separación de tallos
El DAW RipX ofrece una perspectiva única del concepto de separación de stems gracias a su estructura audiovisual armónica basada en notas, denominada "Formato Rip Audio". El sistema proporciona una herramienta de separación de stems que divide un único archivo en varias pistas, donde las notas se representan como pistas de audio. Estas notas son altamente ajustables y el sistema incluye herramientas especializadas para trabajar con ellas y con los aspectos espectrales de las capturas. A cada nota o parte de nota se le pueden aplicar efectos especializados. Las pistas se pueden intercambiar fácilmente gracias a la utilización de esta notación con otros sonidos. De este modo, no solo se separa el stem, sino que también se transcribe el MIDI, lo que permite interpretarlo como una secuencia MIDI y, por lo tanto, dirigir instrumentos. La notación utilizada por el formato Rip Audio se asemeja a la arquitectura Melodyne de extracción de notas de audio; sin embargo, estas notas también funcionan como MIDI y audio simultáneamente. RipX es un DAW completamente único basado en la separación de stems y en este nuevo formato Rip Audio, donde los mundos del audio y el MIDI se fusionan con nuevas herramientas para dar soporte al nuevo paradigma. [ 26 ]
Herramienta de masterización de tallos
Native Instruments creó una herramienta especializada llamada "Stem Creator Tool" para trabajar con pistas stem de cuatro partes, ideal para el mundo de los DJ, ya que las consolas de DJ digitales y el hardware de Native Instruments, como Traktor y Maschine, utilizan la estructura stem de cuatro pistas. Esta herramienta permite masterizar y guardar archivos rápidamente en formato de archivo "stem". [ 27 ] La herramienta es gratuita y ofrece efectos de masterización esenciales aplicables al audio basado en stems.
Ejemplos de enfoques y metodologías empleadas
Aprendizaje profundo
- Redes neuronales
- Redes neuronales convolucionales (CNN)
- Redes neuronales recurrentes (RNN) y transformadores
- algoritmos de separación de fuentes
Técnicas de procesamiento de señales con integración de IA
- Análisis computacional de escenas auditivas (CASA)
- Análisis de componentes independientes (ICA)
- Factorización de matrices no negativas (NMF)
- Transformada de Fourier de corto tiempo (STFT)
- Enfoques integrales
- Enfoques híbridos
- Enfoques basados en el enmascaramiento
- Métodos basados en la repetición
Apoyando los desarrollos
- Aprendizaje en conjunto
- Conv-TasNet
- Aprovechamiento de grandes conjuntos de datos
- Métodos basados en mapeo
- SynthSOD
- Separación de fuentes basada en texto
- Red Wave-U
Problemas conocidos
El tiempo que lleva analizar y separar el sonido implica que las mezclas generalmente requieren pre-renderizado o que existe un retraso en el procesamiento. El proceso de separación de pistas basado en IA produce artefactos y no siempre resulta en la designación correcta de los instrumentos objetivo. También puede haber sangrado espectral entre partes. Es fácil comprometer la estructura de la mezcla de la obra completa ajustando ciertos elementos en partes aisladas. Un sonido de volumen modulado rápido similar a un trémolo también puede ser un factor en ciertos tipos de separaciones. El orden en que se procesa el audio de origen y el tipo de aplicaciones y su secuencia pueden afectar el resultado de las separaciones, además del tipo de mezclas y masterizaciones. El proceso puede detectar anomalías espectrales que pueden necesitar ser fusionadas en diferentes pistas. Puede ser necesario reprocesar una separación de pistas de instrumentos especializados hasta que se logre el equilibrio deseado del sonido objetivo capturado. Existen herramientas de edición de audio especializadas para limpiar aún más el procesamiento de la separación de pistas. [ 28 ] [ 29 ]
Referencias
- ↑ "Papers with Code - Music Source Separation" . paperswithcode.com . Consultado el 27 de marzo de 2025 .
- ↑ Petermann, Darius; Wichern, Gordon; Wang, Zhong-Qiu; Roux, Jonathan Le (mayo de 2022). "El problema del tenedor de cóctel: separación de audio de tres ramas para bandas sonoras del mundo real". ICASSP 2022 - Conferencia Internacional IEEE de Acústica, Habla y Procesamiento de Señales (ICASSP) de 2022. págs . 526–530 . arXiv : 2110.09958 . doi : 10.1109/ICASSP43922.2022.9746005 . ISBN 978-1-6654-0540-9.
- ↑ Qian, Jiale; Liu, Xinlu; Yu, Yi; Li, Wei (2023-01-12). "Stripe-Transformer: aprendizaje profundo de características de franjas para la separación de fuentes musicales" . EURASIP Journal on Audio, Speech, and Music Processing . 2023 (1): 2. doi : 10.1186/s13636-022-00268-1 . ISSN 1687-4722 .
- ↑ "Desmezclando capas" . download.steinberg.net . Consultado el 27 de marzo de 2025 .
- ↑ Lab, Gaudio. "Presentamos GSEP: La columna vertebral de la tecnología de separación de audio de Gaudio Studio" . Eliminar voces y extraer instrumentos | Gaudio Studio . Consultado el 29 de marzo de 2025 .
- ↑ "Método y aparato para la separación de fuentes de audio | Laboratorio Lincoln del MIT" . ll.mit.edu . Consultado el 29 de marzo de 2025 .
- ↑ Desarrollador, Paddy Hallihan-. "Acerca de AudioSourceRE | AudioSourceRe" . audiosourcere.com . Consultado el 27 de marzo de 2025 .
- ↑ Stoller, Daniel; Ewert, Sebastian; Dixon, Simon (2018-06-08), Wave-U-Net: una red neuronal multiescala para la separación de fuentes de audio de extremo a extremo , arXiv : 1806.03185
- ↑ Adams, Stuart (7 de enero de 2026). "Probé 11 de las mejores herramientas de separación de pistas, y puede que ya tengas la ganadora en tu DAW" . MusicRadar . Consultado el 28 de abril de 2026 .
- ↑ Moussallam, Manuel (2020-02-03). "Lanzamiento de Spleeter: motor de separación de fuentes de I+D de Deezer" . Medium . Recuperado el 27 de marzo de 2025 .
- ↑ "Extraer pistas vocales e instrumentales con Stem Splitter en Logic Pro para Mac" . Soporte técnico de Apple . Consultado el 27 de marzo de 2025 .
- ↑ "Introducción: herramientas y datos de código abierto para la separación de fuentes musicales" . source-separation.github.io . Consultado el 29 de marzo de 2025 .
- ↑ "Implementación de Transformers en el Apple Neural Engine" . Investigación sobre aprendizaje automático de Apple . Consultado el 29 de marzo de 2025 .
- ↑ Cartmell, Matt (2024-10-07). "El creciente papel de la separación de pistas en la concesión de licencias de sincronización" . Music Technology UK . Recuperado el 29 de marzo de 2025 .
- ↑ Morse, Phil (25 de mayo de 2023). "¿Cuál es el mejor software para DJ para stems en 2023?" . Consejos para DJ digitales . Recuperado el 29 de marzo de 2025 .
- ↑ "Disney Music Group y AudioShake colaborarán en una tecnología de separación de pistas de instrumentos para añadir valor a grabaciones y letras icónicas" . audioshake.ai . Consultado el 27 de marzo de 2025 .
- ↑ "Cómo Peter Jackson usó la IA para eliminar las guitarras y descubrir conversaciones ocultas de The Beatles en el estudio para Get Back" . Guitar.com | Todo sobre guitarras . Consultado el 27 de marzo de 2025 .
- ↑ Mishra, James. "Dentro de Audioshake, usando IA para recrear pistas perdidas de canciones exitosas" . clicktrack.fm . Consultado el 28 de marzo de 2025 .
- ↑ "La inteligencia artificial puede descomponer canciones antiguas en 'pistas' individuales. Así es como se utiliza" . CNET . Consultado el 29 de marzo de 2025 .
- ↑ Musicpreneur, Christopher Wieduwilt-The AI (16 de diciembre de 2024). "Creé la guía definitiva de herramientas de IA para dividir pistas, para que encuentres la mejor para ti" . Consultado el 29 de marzo de 2025 .
- ↑ "El arte de la separación de pistas de audio" . maztr.com . Consultado el 29 de marzo de 2025 .
- ↑ Raphael, Christopher (2008). "Un enfoque basado en clasificadores para la separación de fuentes guiada por partituras de audio musical" . Computer Music Journal . 32 (1): 51– 59. doi : 10.1162/comj.2008.32.1.51 . ISSN 0148-9267 . JSTOR 40072664 .
- ↑ Schum, Don. "Abordando el problema del ruido: Enfoques actuales - Artículo 17637" . AudiologyOnline . Consultado el 28 de marzo de 2025 .
- ↑ Klimas, Aidas. "Mejores alternativas a VocalRemover (2025)" . Product Hunt . Consultado el 28 de marzo de 2025 .
- ↑ "Los 10 mejores eliminadores de voz para 2025 [ Lista más reciente ] " . notta.ai . Consultado el 28 de marzo de 2025 .
- ↑ Sandzer-Bell, Ezra (13 de febrero de 2024). "RipX DAW: Separación de pistas y manipulación de audio con IA" . AudioCipher . Consultado el 28 de marzo de 2025 .
- ↑ "Stem Creator - descarga gratuita" . Stems . Consultado el 28 de marzo de 2025 .
- ↑ "¿Qué es SpectraLayers?: Descubre todas sus características" . steinberg.net . Consultado el 28 de marzo de 2025 .
- ↑ "RipX DAW PRO" . RipX DAW - El DAW con IA . Consultado el 28 de marzo de 2025 .
- Ingeniería de audio