Qué son los stems — ¿y de verdad se puede desmezclar una canción?
En un estudio, los stems existen antes que la mezcla. Sacarlos de un archivo que ya está mezclado es una operación completamente distinta, y conviene saber qué te están entregando en realidad.
Actualizado
Stems, en sentido propio
Un stem es una submezcla agrupada que se guarda aparte del resto: toda la batería en uno, toda la voz en otro, y así. Existen para que un ingeniero de masterización, un remezclador o un técnico de directo pueda trabajar sobre una parte sin tocar las demás.
Los stems de verdad son sencillamente archivos que alguien conservó. Si los tienes, no hay nada que estimar: nunca llegaron a combinarse.
La separación no es lo mismo
Cuando un tema está mezclado, todas las partes se han sumado en dos canales de audio. Esa suma no es reversible: las partes individuales ya no existen en ninguna parte del archivo.
Así que un modelo de separación no las recupera. Estima: dada esta mezcla, ¿cómo sonaba probablemente cada parte por su cuenta? Ha escuchado suficiente música como para acertar mucho, pero sigue siendo una conjetura.
De ahí el carácter tan concreto de los resultados. Cada parte suele convencer por sí sola, con un rastro tenue de las demás todavía audible, y los pasajes densos adquieren una cualidad algo acuosa y emborronada. No son fallos que haya que arreglar: es a lo que suena una estimación.
Qué te devuelve
Cuatro pistas: voz, batería, bajo y todo lo demás. Esa última no es un descuido del modelo: es la categoría de guitarras, teclados, cuerdas, sintetizadores y cualquier cosa que no sea una de las otras tres. Si tu canción se sostiene sobre un piano, el piano está en «otros».
Todos los stems tienen la duración del original y encajan exactamente con él, así que puedes cargarlos en cualquier editor y quedarán sincronizados.
¿Cómo de bien funciona? Lo medimos
«Se ejecutó y salieron cuatro archivos» no demuestra absolutamente nada: cuatro archivos de papilla verosímil se verían igual. Así que construimos una mezcla cuyos ingredientes conocíamos con exactitud: una grabación de voz, una onda sinusoidal de 60 Hz haciendo de bajo y ráfagas cortas de ruido haciendo de batería. Después correlacionamos cada stem de salida con cada ingrediente conocido.
Cada stem coincidió con su propio ingrediente casi exactamente en 1,0 y con los demás casi exactamente en 0. El stem de batería contenía las ráfagas de ruido y prácticamente nada más; el de bajo contenía la sinusoide y prácticamente nada más.
Esa prueba demuestra que la separación es real y está bien conectada. No demuestra que cualquier canción vaya a separarse limpiamente: la música real es mucho más difícil que una mezcla sintética, y una producción muy densa o muy comprimida lo es todavía más.
Es lento, y eso es un hecho sobre el método
La separación pasa la forma de onda entera por una red neuronal. Medimos 7,8 segundos de audio tardando 15,1 segundos en procesarse, aproximadamente el doble del tiempo real. Una canción completa, por tanto, pasa de seis minutos.
Por eso la herramienta trabaja sobre una vista previa de 30 segundos y te dice la cifra antes de que pulses nada, en lugar de arrancar un trabajo de seis minutos en una pestaña y confiar en que te quedes.
Separar algo no te da derecho a usarlo
Sacar la voz de un disco comercial no cambia de quién es esa grabación. Practicar sobre un instrumental, estudiar un arreglo o hacer algo para ti es una situación; publicar o distribuir el resultado es otra distinta, y la separación no influye en eso.
Nada de lo que cargues aquí sale de tu equipo, pero eso es una afirmación sobre privacidad, no sobre licencias.
Hazlo ahora, sin subir nada
¿Puedo hacer un karaoke de una canción?
Sí: coge todos los stems menos la voz y vuelve a mezclarlos. Espera un rastro tenue de voz en las partes densas; el modelo estima, y donde la voz se solapa con instrumentos fuertes no puede separarlas del todo.
¿Sonarán los stems tan bien como el original?
Sumados de nuevo, quedan muy cerca. Escuchados por separado con auriculares se oyen artefactos, sobre todo una cualidad algo acuosa y restos de las otras partes. Cada stem es una reconstrucción, no una extracción.
¿Por qué solo 30 segundos?
Porque el proceso corre a aproximadamente el doble del tiempo real en un navegador, así que una canción entera pasaría de seis minutos con la pestaña abierta. La vista previa te deja oír si la separación es lo bastante buena para tu tema antes de comprometerte.
Vale la pena leer
- Qué es un archivo HEIC y por qué no abre
- PNG, JPG, WebP o AVIF: ¿cuál deberías usar?
- Por qué tu PDF pesa tanto y qué lo reduce de verdad
- MOV frente a MP4: qué cambia de verdad
- Cómo funciona quitar el fondo de verdad — y cuándo falla
- ¿La IA añade detalle real al ampliar una imagen?
- SRT o VTT — ¿qué archivo de subtítulos necesitas?
- ¿Por qué no se abre mi PDF?
- CSV frente a Excel — qué cambia de verdad
- ¿Se puede fiar uno de un resumen hecho por IA?
- WAV o MP3: ¿cuál necesitas realmente?
- ¿Qué es un códec y en qué se diferencia de MP4?
- ¿Por qué mi vídeo sale de lado?