Stem Splitter + Remix Separar la voz y los instrumentos de una canción gratis

Python FastAPI HTDemucs v4 WaveSurfer.js Web Audio API Async Processing Audio AI
Stem Splitter + Remix

Stem Splitter + Remix Inteligente

Una aplicación web donde el usuario sube cualquier canción y la IA la separa en 4 stems (voces, batería, bajo, melodía) en segundos. Desde esa misma pantalla puede hacer remix en tiempo real: ajustar BPM, transponer la tonalidad, silenciar o potenciar cada stem y exportar el resultado.

Por qué HTDemucs v4

HTDemucs v4 (MIT license) es el modelo de separación de fuentes de Meta AI con mejor SDR en benchmarks 2024. Supera a Spleeter (2019, TensorFlow 1.x) en 3-5 dB SDR en todas las pistas. El modelo htdemucs_ft (fine-tuned) ofrece la mejor calidad para voces complejas sin artefactos.

Arquitectura

  • Backend: FastAPI + Uvicorn con procesamiento asíncrono. El usuario sube el audio, recibe un job_id y hace polling hasta que los stems están listos.
  • Motor IA: HTDemucs v4 (htdemucs_ft) — 4 stems: vocals, drums, bass, other
  • Frontend: WaveSurfer.js 7 para visualización de formas de onda. Web Audio API para playback y mezcla en tiempo real.

Stack técnico

  • HTDemucs v4 (MIT): mejor modelo open-source de separación de fuentes de Meta AI
  • FastAPI + Uvicorn: API asíncrona con procesamiento en background tasks
  • WaveSurfer.js 7: visualización declarativa de formas de onda por stem
  • Web Audio API nativa: mezcla en tiempo real con GainNodes independientes por stem

Integración, datos y licencia

  • Integración: API REST propia (FastAPI) con 4 endpoints documentados en el repositorio; se puede consumir desde cualquier lenguaje o plataforma, con especificación OpenAPI autogenerada.
  • Tratamiento de datos: el procesamiento se realiza íntegramente en el servidor del proyecto, sin enviar datos a servicios de IA de terceros. No se almacenan las consultas de la demo.
  • Nota: El procesamiento de audio (Demucs) se ejecuta en el propio servidor; los archivos subidos se eliminan tras completar el trabajo.
  • Licencia: MIT — uso libre, incluido comercial, manteniendo el aviso de copyright. El repositorio contiene la aplicación completa y puede desplegarse en infraestructura propia. El código es gratuito; los costes de motor de IA, infraestructura, implantación y mantenimiento corren por cuenta de quien lo despliega (no se ofrece soporte ni consultoría).

¿Cómo lo integro?

Disponible ahora: Trabajo asíncrono: se sube el audio, se consulta el estado por job_id y se descargan las pistas separadas — el patrón correcto para procesos largos, sin bloquear al cliente.

Integraciones habituales en este sector (valoradas como vía recomendada; salvo que se indique lo contrario, no vienen implementadas — el código está preparado para añadirlas):

  • Webhook al completar — YA IMPLEMENTADO: se pasa callback_url en la subida y el servicio hace POST al terminar, con firma HMAC-SHA256 en X-StemSplitter-Signature (el esquema de GitHub o Stripe) para que el receptor verifique el origen. El destino se valida contra SSRF: se rechazan IPs privadas, loopback y link-local.
  • DAWs (Ableton, Logic, Reaper): las pistas salen en WAV estándar, listas para arrastrar a la sesión; no hace falta plugin.
  • Almacenamiento S3 / MinIO: en volumen alto conviene que el resultado se escriba en el bucket del cliente en vez de servirse por HTTP.
Mapa del bucleDisparador: Necesito esta canción sin la voz y no tengo las pistas originales.. Acción: Separa el audio en voz, batería, bajo y melodía con HTDemucs v4, por segmentos para caber en CPU.. Medición: Las cuatro pistas por separado, ya sonando en el navegador para mezclarlas.. Decisión: Decido si la mezcla me sirve o subo y bajo pistas hasta que suene..EL BUCLE QUE CIERRAPara quien quiere una base o unkaraoke de una canción1DISPARADORNecesito esta canción sin lavoz y no tengo las pistasoriginales.2ACCIÓNSepara el audio en voz,batería, bajo y melodía conHTDemucs v4, por segmentospara caber en CPU.3MEDICIÓNLas cuatro pistas porseparado, ya sonando en elnavegador para mezclarlas.4DECISIÓNDecido si la mezcla me sirveo subo y bajo pistas hastaque suene.Cada canciónlo hace una personalo hace el software

Descargar el diagrama (SVG)

Resultados

4
stems separados
v4
HTDemucs versión
MIT
licencia
50MB
tamaño máximo

Funcionalidades implementadas

  • HTDemucs v4 — SOTA 2024. Modelo fine-tuned de Meta AI con el mejor SDR del mercado. 3-5 dB superior a Spleeter con menos artefactos en voces complejas
  • Remix en tiempo real. Web Audio API nativa con GainNodes independientes por stem. Sin latencia, sin recodificación
  • Visualización con WaveSurfer 7. Formas de onda en color por stem, interactivas y sincronizadas con el playback
  • API abierta. FastAPI backend con endpoints documentados para integración en producción o B2B

Límites

Lo que no hace

  • No transcribe ni saca partituras: devuelve audio separado, no notas.
  • Cuatro pistas fijas: voz, batería, bajo y todo lo demás junto.
  • No es instantáneo: sin GPU, separar una canción lleva su rato.

Decisiones

Por qué está construido así

  • Separar por segmentos en vez de cargar la canción entera en memoria

    Sin GPU y con la RAM que hay, la canción completa no cabe. Por segmentos corre en el mismo servidor que el resto.

  • Mezclar en el navegador en vez de renderizar cada mezcla en el servidor

    Subir o bajar una pista es instantáneo con Web Audio, y el servidor no vuelve a tocar el audio ni una vez más.

Try Live Demo View Code

Cómo está construido

Separar canciones en stems con HTDemucs v4 en un servidor con poca RAM Separar voz, batería, bajo y melodía de una mezcla es uno de los problemas más bonitos del audio con IA. Así desplegué HTDemucs v4 con procesado asíncrono y segmenta...